Inference Brew

OpenBMBがオンデバイスモデル「MiniCPM5-2B」をリリース

00:00 / --:--

← ホームへ戻る

OpenBMBがオンデバイスモデル「MiniCPM5-2B」をリリース

1. OpenBMBがオンデバイスモデル「MiniCPM5-2B」をリリース

OpenBMBのMiniCPM5-2Bは、オンデバイスで効率的に動作するように設計された、高度に最適化されたデンス因果言語モデルです。4000億トークンの教師ありファインチューニング(SFT)と、16の強化学習エキスパートによるオンポリシー蒸留を経て構築されており、ツール使用、コーディングエージェント、長文コンテキストの検索において強力なパフォーマンスを発揮します。34のベンチマーク平均でQwen3.5-4Bベースラインを上回り、Artificial Analysis Intelligence Indexではタスクあたりわずか19kの出力トークンを使用するという高いトークン効率を実証しています。

  • • MiniCPM5-2Bは、Apache 2.0ライセンスでリリースされた25.2億パラメータのデンスモデルです。
  • • 131,072トークンのネイティブコンテキストウィンドウと、グループクエリアテンションを採用した42層のアーキテクチャを特徴としています。
  • • Artificial Analysis Intelligence Index v4.2で15点を獲得し、40億パラメータ未満のオープンウェイトモデルとして最高スコアを記録しました。
  • • vLLM、SGLang、Transformers、llama.cpp、Ollama、LM Studio、MLXなどの標準的なランタイムと互換性があります。
  • • OpenBMBはモデルの重みに加え、中間チェックポイントやUltra-FineWeb、UltraXといったデータセットも公開しています。

このモデルは、開発者に対し、ローカルでのエージェントワークフローやコンシューマーハードウェア上での長文コンテキスト検索に向けた、高性能かつトークン効率に優れた、完全にオープンな重みを持つ選択肢を提供します。

2. Tencentが視覚的文書検索モデル「EVIE」をリリース

Tencentの新しいEVIE-8BおよびEVIE-4.5Bモデルは、RAGパイプラインにおける視覚的文書検索の課題に対処します。文書ページを視覚的に表現することで、テキストのみのパーサーでは失われがちな重要なレイアウト、表、タイポグラフィ情報を保持します。特にEVIE-4.5Bモデルは本番環境向けに最適化されており、動的な次元削減を可能にするPrefix-MRL弾力性や、ページを32個のベクトルに圧縮する高度なクラスタリング機能を備えており、ベクトルデータベースのストレージコストを大幅に削減します。

  • • EVIE-8Bは、ViDoRe V3ベンチマークにおいて66.75 nDCG@10という最先端の検索パフォーマンスを達成しました。
  • • 4096次元の表現を利用し、タイポグラフィ、グラフ、表などの微細な詳細を保持します。
  • • EVIE-4.5BはPrefix-MRL弾力性を備えており、実行時に64から2048の間で次元を切り詰めることが可能です。
  • • EVIE-4.5Bは階層的凝集クラスタリングを使用して、ページあたりのトークン数を32個のベクトルに圧縮します。
  • • この圧縮により、インデックスのストレージ要件を100万ページあたり3.81 GiBまで削減できます。

これらのモデルにより、開発者は複雑な文書レイアウト、グラフ、表を保持したまま、ストレージのオーバーヘッドを抑えた高精度な視覚的RAGパイプラインを構築できます。

SOURCES

3. EngrimがAI CLI向けローカルファーストSQLiteメモリエンジンをローンチ

Tim Gordon氏によって作成されたEngrimは、同一のコードベースで複数のAIコーディングアシスタントを使用する際のコンテキスト断片化という課題に対処します。ユニバーサルなローカルファーストのメモリ層として機能することで、CursorやClaude Codeといったツール間でアーキテクチャの決定事項やプロジェクトの状態が確実に保持されます。このエンジンは、キーワード検索と軽量なベクトル埋め込みを組み合わせて高速なコンテキスト読み込みを実現しており、オフラインファーストのアーキテクチャにより、機密性の高いコードベースのメタデータが開発者のローカルマシン上で安全に保たれます。

  • • Engrimは、MITライセンスで提供されるプロジェクトスコープのローカルファーストメモリエンジンです。
  • • Claude Code、Cursor、Windsurf、Google Antigravityなど、複数の環境をサポートしています。
  • • SQLite FTS5キーワード検索とmodel2vec静的ベクトル埋め込みを組み合わせたハイブリッド検索を使用しています。
  • • 完全にオフラインで動作し、~/.engrim/memory.dbにあるアクセス権が制限されたSQLiteファイルにデータを保存します。
  • • Engrimは各メモリエントリーの出所を追跡し、どのエージェントやユーザーが作成したかを識別します。

開発者はEngrimを使用することで、データを外部に漏らすことなく、Claude Code、Cursor、Windsurfなどの異なるコーディングツール間で一貫したコンテキストと状態を維持できます。

SOURCES

4. エージェントのフィードバック向けフレームワーク「LLM-as-a-Verifier」が公開

オープンソースのLLM-as-a-Verifierフレームワークは、AIエージェントの信頼性を高めるためのトレーニング不要な手法を提供します。詳細なステップバイステップのフィードバックを生成することで、開発者はエージェントのパイプライン内で直接、テスト時のスケーリングや進捗追跡を実装できます。このシステムは、ソフトウェアエンジニアリングやロボティクスを含む多様なドメインで最先端の結果を示しており、複雑なマルチステップエージェントを構築する開発者にとって汎用性の高いツールとなっています。

  • • LLM-as-a-Verifierは、GitHubで公開されている汎用的なトレーニング不要のフレームワークです。
  • • エージェントのワークフローをガイドし修正するための、きめ細かなフィードバックを提供します。
  • • コーディング、ロボティクス、医療エージェントのベンチマーク全体で最先端のパフォーマンスを達成しています。
  • • 検証者からのフィードバックは、テスト時のスケーリングや強化学習に直接適用可能です。

開発者はこのフレームワークを統合することで、ファインチューニングのオーバーヘッドなしに、エージェントのテスト時スケーリング、進捗追跡、強化学習を実装できます。

SOURCES

5. FreeCAD MCPサーバーがAIアシスタントとCADワークフローを統合

freecad-mcpプロジェクトは、Model Context Protocolをコンピュータ支援設計(CAD)にもたらし、開発者がローカルのAIエージェントを介してFreeCADを制御できるようにします。MCPサーバーをセットアップし、FreeCAD内でコンパニオンRPCサーバーを起動することで、開発者は自然言語のプロンプトをローカルモデルに渡し、複雑な幾何学的設計タスクを実行できます。さらに、視覚認識可能なGGUFモデルを利用することで、アシスタントはFreeCADのスクリーンショットを視覚的に検査し、幾何学的操作が正しく実行されたかどうかを検証できます。

  • • freecad-mcpプロジェクトは、FreeCADとAIモデリングアシスタントを統合するアドオンです。
  • • MCPサーバー設定を介して、llama.cppやpiなどのローカルランタイムをモデリングアシスタントとして使用することをサポートしています。
  • • システムには、AIアシスタントとの通信を処理するためにFreeCAD内にRPCサーバーが含まれています。
  • • --mmprojオプションを使用してマルチメディア対応モデルを読み込むことで、AIがスクリーンショットを分析し、幾何学的操作を検証できます。
  • • 前提条件として、FreeCAD、llama.cpp、GGUFモデル、およびuvパッケージマネージャーが必要です。

この統合により、開発者は自然言語コマンドを使用して物理的な3Dモデルを生成、修正、検証できるエージェントワークフローを構築できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。