Inference Brew

Mistralがマルチモーダルモデレーションモデル「Shieldstral 3B」をリリース

00:00 / --:--

← ホームへ戻る

Mistralがマルチモーダルモデレーションモデル「Shieldstral 3B」をリリース

1. Mistralがマルチモーダルモデレーションモデル「Shieldstral 3B」をリリース

Shieldstralは、異種混合の安全データセットを単一のポリシー適応型モデルに統合することで、安全ガードレールの導入を簡素化します。ルールをハードコーディングしたり、個別の分類器をファインチューニングしたりする代わりに、開発者はプロンプトで直接カスタムの自然言語ガイドラインを渡すことができます。これにより、導入環境やコミュニティガイドラインの変更に合わせて、モデレーション基準を即座に更新することが可能です。

  • Shieldstralは、Apache 2.0ライセンスで公開された3Bパラメータのオープンウェイト・マルチモーダル安全分類器です。
  • このモデルはモデレーションを質問応答タスクとして構成し、推論時に自然言語のポリシーを受け入れます。
  • 単一の16GB NVIDIA GPUで動作するように設計されており、最大7倍のサイズのガードモデルと同等以上の性能を発揮します。
  • 単一のフォワードパスから得られるYes/Noロジットをソフトマックス正規化することで、継続的な安全スコアを生成します。
  • Shieldstralは、Open Secure AI Allianceの設立メンバーです。

開発者は、単一の16GB GPU上で、ポリシー適応型の柔軟なコンテンツモデレーションをローカル環境に実装できます。

SOURCES

2. Liquid AIが128Kコンテキスト対応の「LFM2.5-2.6B」をリリース

Liquid AIの最新リリースは、ローカルハードウェアで動作可能な軽量かつエージェント機能を持つモデルへの需要の高まりに応えるものです。ツール呼び出しや構造化されたエージェントタスクには優れていますが、開発元は知識集約型や複雑なコーディングタスクへの使用は推奨していません。GGUF版のフットプリントが小さいため、モバイルやデスクトップへの統合に非常に適しています。

  • LFM2.5-2.6Bは26.9億パラメータと128Kのコンテキストウィンドウを備えています。
  • マルチステップのエージェントワークフロー用にポストトレーニングされており、ツール呼び出しをサポートしていますが、エージェントによるコーディングには推奨されません。
  • 公式のQ4_K_M GGUF版は約1.67GBで、動作には2.5GB未満のメモリが必要です。
  • 報告されているCPU性能は、スマートフォンで30トークン/秒、Ryzen AI Max+ 395で113トークン/秒、M5 Maxで220トークン/秒です。
  • ToolSandboxで77.83、IFBenchで59.17、BFCLv4で56.88、LiveCodeBenchで59.41のスコアを記録しています。

開発者は、エッジデバイスやコンシューマー向けハードウェア上で、高性能なエージェントワークフローやツール呼び出しタスクをローカル実行できます。

SOURCES

3. MiniMax H3がArtificial Analysisの動画編集ベンチマークで1位を獲得

7月31日のリリース後、マルチモーダルモデル「MiniMax H3」はArtificial Analysisによる評価を受け、動画編集ランキングで首位を獲得した初のオープンモデルとなりました。この首位に加え、テキストから動画への生成で2位、画像から動画への生成で3位を獲得し、プロプライエタリな代替モデルに対する競争力を証明しました。

  • MiniMax H3は、Artificial Analysisの動画編集部門で1位を獲得した初のオープンモデルです。
  • 同モデルは、Artificial Analysisによりテキストから動画への生成で2位、画像から動画への生成で3位にランク付けされています。
  • これらのランキングは、7月31日のモデル初公開に続くものです。

開発者は、最近リリースされたMiniMax H3が動画編集および生成タスクにおいてトップクラスの性能を持つオープンモデルであることを、独立したベンチマークデータで確認できるようになりました。

SOURCES

4. inclusionAIがオープンウェイトモデル「Ling-3.0-flash」をリリース

Ling-3.0-flashモデルファミリーは、前モデルのLing-2.6-flashを拡張したもので、高度にスパースな活性化を行う大規模なMixture-of-Experts(MoE)アーキテクチャを提供します。思考機能をチャットテンプレートにリクエストごとのスイッチとして直接統合しているため、開発者は推論を活用するために個別のモデルSKUを管理する必要がありません。公式のFP8量子化によりハードウェアの障壁が大幅に下がり、メモリ要件が128GBまで削減されました。

  • Ling-3.0-flashは合計127.5Bパラメータで、トークンあたり5.1Bの有効パラメータを使用します。
  • このモデルはBailingMoeV3アーキテクチャに基づいており、512の専門家(エキスパート)のうち8つがアクティブになります。
  • BF16版は約255GBのメモリを必要とし、公式のFP8版は128GBを必要とします。
  • 「思考」機能はチャットテンプレート内のリクエストごとのスイッチとして実装されており、デフォルトでオンになっています。
  • モデルはMITライセンスの下、Hugging Faceで公開されています。

開発者は、ローカルで実行可能な、思考機能内蔵の非常に効率的なオープンウェイトMoEモデルを利用できるようになります。

SOURCES

5. Keyvおよびキャッシュユーティリティが大規模なサプライチェーン攻撃の標的に

「Shai-Hulud」と名付けられたこの非常に巧妙なサプライチェーン攻撃は、JavaScriptおよびNode.jsエコシステムに差し迫った脅威をもたらしています。悪意のあるパッケージは、乗っ取られたメンテナーのアカウントから直接、有効な来歴(provenance)を伴って公開されたため、標準的な自動セキュリティチェックでは初期段階でブロックできなかった可能性があります。開発者は直ちにKeyvおよび関連キャッシュユーティリティのロックファイルをチェックし、漏洩した可能性のあるシークレットをローテーションする必要があります。

  • 2026年8月4日、攻撃者がKeyvメンテナーのGitHubアカウントを乗っ取り、認証情報を窃取するワームを注入しました。
  • この攻撃により、1381バージョンにわたる少なくとも434のパッケージが侵害され、月間20億以上のインストールに影響が及びました。
  • ドロッパー(setup.mjs)やペイロード(Math_Symbol.js)を含む悪意のあるファイルが、有効な来歴を伴ってnpmに公開されました。
  • マルウェアはnpmトークン、GitHubトークン、AWS認証情報、Kubernetesシークレット、HashiCorp Vaultトークン、Stripe/Slackトークンを収集します。
  • ワームは、盗んだnpmトークンを使用して感染したパッケージを再公開し、盗んだGitHubトークンを使用して悪意のあるフックを注入することで自己複製します。
  • データは公開GitHubリポジトリ、またはイーサリアムのスマートコントラクトで管理されるフォールバックドメインに流出します。

開発者は直ちに依存関係ツリーを監査し、すべてのAPIキー、npmトークン、クラウド認証情報をローテーションする必要があります。

SOURCES

6. Databricksの調査でミニマリストなコーディングハーネス「Pi」の性能が明らかに

Piの設計思想は、ますます複雑化するエージェントフレームワークのトレンドに挑戦するものです。ツール定義とシステムプロンプトを1,000トークン未満に抑えることで、モデルの混乱を減らし、トークン消費量を劇的に削減します。Shopifyによる自律的な「pi-autoresearch」ループの導入成功は、高度に制約されたツールセットであっても、実際のコードベースで大幅な性能最適化を実現できることを示しています。

  • Piは、わずか4つのツールと1,000トークン未満のシステムプロンプトを備えたミニマリストなコーディングハーネスです。
  • Databricksの調査では、PiとOpus 4.8を組み合わせた場合、Claude CodeやCodexよりも低コストで最高の全体的なパス率を達成しました。
  • Piはターンあたりのコンテキスト送信量が約3分の1であり、実行回数とAPIコストの削減につながりました。
  • ShopifyはPiを使用して「pi-autoresearch」拡張機能を開発し、ユニットテストを300倍高速化、Reactコンポーネントのマウントを20%高速化しました。
  • ハーネスのコンテキストフットプリントが小さいため、コンテキストウィンドウが小さいローカルモデルに非常に適しています。

開発者は、ミニマリストなハーネス設計を採用することで、より信頼性が高くコスト効率の良いコーディングエージェントを構築できます。

SOURCES

7. Warpがスタンドアロンの「Warp Agent CLI」をリリース

Warp Agent CLIは、好みのターミナルエミュレータに関係なく、ターミナルネイティブなAIエージェントの力を開発者に提供します。Warpの既存インフラを活用することで、このツールはセッション多重化をネイティブに処理し、リモートサーバー上でエージェントを実行する際の一般的な摩擦を解消します。PythonやSQLiteのようなフルスクリーンターミナルアプリケーションと対話できる能力は、強力なローカル自動化ワークフローを実現します。

  • Warp Agent CLIは、Ghostty、iTerm 2、VS Code、およびネイティブのWindows/Macターミナルと互換性のあるスタンドアロンツールです。
  • このCLIはWarpのターミナルインフラ上に構築されており、ネイティブなセッション多重化とリモートエージェント実行を可能にします。
  • マルチエージェントオーケストレーション、クラウドエージェントの引き継ぎ、sqliteやpythonなどの対話型ターミナルアプリの制御をサポートしています。
  • このツールは、フロンティアモデルとオープンウェイトモデル間での自動モデルルーティング機能を備えています。
  • 価格は20ドル分の推論込みで月額18ドルからで、アドホッククレジットや独自のAPIキーを使用するオプションもあります。

開発者は、リモートバイナリをインストールすることなく、リモートマシン上でターミナルベースのAIエージェントを実行できます。

SOURCES

8. CursorがGoogle Workspaceプラグインをリリース

これらの新しいプラグインは、Cursorの機能をローカルコード編集を超えて拡張し、開発者がコードベースとチームドキュメントの間のギャップを埋めることを可能にします。Google Workspaceとの直接的な対話を可能にすることで、共有ドキュメント、スプレッドシート、その他のコラボレーションツールの参照や更新を含むワークフローを効率化します。

  • Cursorは、Cursorマーケットプレイスで新しいGoogle Workspaceプラグインをリリースしました。
  • このプラグインにより、CursorエディタがGoogle Workspaceアプリケーションと直接対話できるようになります。
  • サポートされているアクションには、Workspaceスイート全体での読み取り、書き込み、タスクの実行が含まれます。

Cursorを使用する開発者は、コーディング環境をGoogle Workspaceと直接統合し、ドキュメント作成や管理タスクを自動化できるようになりました。

SOURCES

9. Orchard:Kubernetesネイティブなオープンソース・エージェントフレームワーク

Orchardは、エージェントのコアロジックとトレーニングレシピを基盤となるインフラから分離することで、エージェント開発の断片化に対処します。標準化されたKubernetesネイティブ環境サービスを提供することで、開発者は異なる実行ハーネスのためにコードを書き直すことなく、強化学習や軌道蒸留(trajectory distillation)ワークフローをスケールアップできます。

  • Orchardは、Kubernetesネイティブ環境サービス上に構築されたオープンソースのエージェントモデリングフレームワークです。
  • このフレームワークは、特定のハーネス、トレーナー、推論バックエンド、タスクドメインを前提とせず、汎用的なプリミティブを公開します。
  • 軌道蒸留、オンポリシー強化学習のロールアウト、評価のための単一の基盤を提供します。
  • データセット、トレーニングレシピ、評価プロトコルは、異なるプロジェクトやドメイン間で完全にポータブルなままです。

開発者は、データセットとレシピを異なるバックエンド間でポータブルに保つ単一の基盤を使用して、エージェントの構築、トレーニング、評価を行うことができます。

SOURCES

10. Kiroが軽量なサーバーサイド・エージェントハーネスをリリース

エージェントの実行環境をユーザーインターフェースから分離することで、Kiroのアーキテクチャは、クライアント側のアプリケーションを再デプロイすることなく、エージェントの動作を更新・反復することを可能にします。定義されたプロトコルインターフェースにより、CLI、Web、IDEクライアントが同じ基盤となるエージェントコードベースとシームレスに対話できるようになります。

  • Kiroエージェントハーネスは、コードベースと並行して実行される軽量なサーバーサイドプロセスとして動作します。
  • ユーザーの対話とプレゼンテーションは、IDE、CLI、Webクライアントによって管理されます。
  • サーバーとクライアントは、定義されたプロトコルインターフェースを通じてのみ通信します。
  • このハーネスは、仕様、ステアリング、フックを含むエージェント的なIDE機能をサポートしています。

開発者は、エージェントのロジックがクライアントアプリケーションから独立して進化するエージェント的なコーディングツールを構築できます。

SOURCES

11. LM Studioがウェブサイト刷新で「Bionic」エージェントを優先

7月のBionic AIエージェントの立ち上げに続き、LM Studioはウェブサイトを更新し、Bionicを主要なダウンロード対象としました。元のアプリケーションはフッターのリンクに格下げされています。この動きはエージェントワークフローへの戦略的な転換を示しており、元のアプリケーションは小規模なメンテナンスアップデートのみを受けることになります。

  • LM Studioは、ウェブサイトの主要なダウンロードリンクをBionicエージェントを指すように置き換えました。
  • 元のLM Studioアプリケーションは、ウェブサイトのフッターにあるリンクからのみアクセス可能です。
  • 元のアプリケーションは小規模なアップデートしか受けておらず、長期的なサポートに懸念が生じています。
  • この動きは、2026年7月16日のBionicの初期リリースに続くものです。

元のLM Studioアプリケーションに依存している開発者は、同社が配布の焦点を移す中で、Bionicエージェントハーネスを中心とした新しいインターフェースに適応する必要があります。

SOURCES

12. llama.cppがヒートマップベースのMoEエキスパートキャッシュを統合

動的なVRAMエキスパート管理によるMoE推論の最適化に向けたコミュニティの取り組みに基づき、公式llama.cppリポジトリへの新しいプルリクエスト(#26563)がヒートマップ機能を導入しました。このメカニズムは、頻繁に使用されるエキスパートをGPUメモリ内で追跡・キャッシュするもので、以前報告された実験的なフォークよりも統合されたアプローチを提供します。これにより最適化がメインコードベースに近づきましたが、特定のハードウェア制限を持つ実験的なPRのままです。

  • GitHubのプルリクエスト#26563は、頻繁に使用されるMoEエキスパートをVRAMで追跡・キャッシュするヒートマップ機能を導入します。
  • この開発は、動的なエキスパートキャッシュが実験的なフォークから公式のllama.cppプロジェクトへ移行したことを示しています。
  • 8GB VRAMを搭載したQwen3.6-35B-A3Bでのテストでは、Q2_Mで1.68倍、Q5_K_P量子化で2.07倍の性能向上が見られました。
  • この機能は現在CUDAのみのサポートであり、シングルトークンデコードに限定されています。
  • Qwen3.5-122B-A10BやLaguna-S-2.1のような大規模モデルでは速度が低下するため、普遍的な改善ではありません。
  • このPRは現在マージされていないブランチであり、出力にわずかな差異が生じる可能性があります。

このPRは動的なエキスパートキャッシュをメインのllama.cppコードベースにもたらし、メモリ制約のあるハードウェアで最大2倍の高速化を実現するための標準化された道筋を提供する可能性があります。

SOURCES

13. llama.cppがマルチトークン予測用のGPU加速サンプリングを追加

以前のMTP性能向上に基づき、新しいllama.cppプルリクエスト(#25532)はサンプリングフェーズをGPUバックエンドに直接移行します。これによりCPU-GPU間のデータ転送オーバーヘッドが削減され、RTX 5090のような最新ハードウェアで最大8%の性能向上が実現し、MTP対応のローカル推論の効率がさらに向上しました。

  • GitHubのプルリクエスト#25532は、MTPサンプリングをGPUに移行します。
  • Nvidia RTX 5090でのテストでは、Qwen3.6:35bで1秒あたりのトークン数が8%増加しました。
  • 性能向上はハードウェアに依存し、Tesla P40のような古いカードでは4%の増加が見られました。
  • MTPの受け入れ比率は、このバックエンドの変更によって影響を受けません。

この最適化は、すでにMTPを利用している開発者に追加の性能向上をもたらし、特にサンプリングタスクをGPUにオフロードすることでレイテンシを削減します。

SOURCES

14. Soup CLIが4GBのノートPC用GPUでの8Bモデルファインチューニングを実現

Soupは、設定を単一のYAMLファイルに統合することで、ローカルでのポストトレーニングワークフローを簡素化します。ベースモデルのレイヤーをシステムRAMから順次ストリーミングすることで、通常はコンシューマーグレードのハードウェアで8Bモデルのトレーニングを妨げるVRAMの制限を回避します。DPOやSimPOのような最新の選好アライメントアルゴリズムが含まれているため、ローカルモデルのカスタマイズに非常に汎用性の高いツールとなっています。

  • Soupは、LLMのファインチューニングとポストトレーニングのためのApache-2.0ライセンスのオープンソースCLIツールです。
  • このツールは「Exact Layer Streaming」を使用して、フリーズされたベースモデルをホストRAMからGPUへデコーダーレイヤーごとにストリーミングします。
  • RTX 3050ノートPC用GPU(4GB VRAM)上で、NF4量子化されたLlama-3.1-8B-Instructが3.32GBのピークメモリで119.6トークン/秒を達成しました。
  • バージョン0.72.4は、教師ありファインチューニングと、DPO、ORPO、SimPO、KTOを含む選好損失をサポートしています。
  • このプロジェクトはAlpamys Makazhanによって管理されており、Zenodoで公開された2026年のプレプリントに基づいています。

開発者は、高価なクラウドGPUを借りることなく、標準的なノートPCハードウェア上でタスク固有の8Bモデルをローカルでファインチューニングできます。

SOURCES

15. DeepSeek-V4-Flashの2ビット量子化がSQLベンチマークで100%を達成

このベンチマーク結果は、カスタム推論エンジンと組み合わせた場合の、高度に量子化されたオープンウェイトモデルの可能性を強調しています。複雑なSQL推論タスクで満点を達成したことで、DeepSeek-V4-Flashの2ビット量子化は、極端な量子化が必ずしも推論能力を破壊するわけではなく、ローカルのデータベースエージェント統合にとって実行可能な選択肢であることを証明しました。

  • DeepSeek-V4-Flashは、著者の25テストSQL推論ベンチマークで100%のスコアを達成した初のローカルモデルです。
  • セットアップには、デュアルRTX 3080 GPU、96GB RAM、Ryzen 9800X3D上でカスタムIQ2_M GGUFを使用しました。
  • 修正されたds4エンジンは、メインラインのllama.cppを上回る300トークン/秒のプリフィルと11-12トークン/秒の生成を達成しました。
  • 以前は、Opus 4.7とGPT-5.5というプロプライエタリなモデルのみが、このベンチマークで満点を達成していました。

開発者は、高度に量子化されたモデルと最適化された推論エンジンを使用して、高精度なSQL推論タスクをローカルで実行できます。

SOURCES

16. VIDRAFTが高速Gemma推論の最適化レシピを公開

この最適化レシピのリリースは、Gemma 4のセルフホストを検討している開発者に実用的な青写真を提供します。高価なハードウェアアップグレードではなくソフトウェアレベルのチューニングに焦点を当てることで、このガイドはNVIDIA A10Gなどを搭載した標準的なクラウドインスタンスから最大限のパフォーマンスを引き出す方法を示しています。

  • VIDRAFTは、検証済みのFast Gemma提出で使用された正確な構成と最適化レシピを公開しました。
  • セットアップは、単一のコスト効率の高いNVIDIA A10G GPU上でGemma 4 E4Bモデルを実行しました。
  • ドキュメントには、スループットを最大化するために使用された特定のソフトウェアレベルの最適化が詳述されています。

開発者は、検証済みのソフトウェア最適化を適用することで、予算に優しいクラウドGPU上でGemma 4の1秒あたりのトークン性能を最大化できます。

SOURCES

17. AMD MI300XでのDeepSeek-V4-Flashのスループットが向上

AMD MI300XでのFP8互換性のための初期のソフトウェア回避策に基づき、新しい本番構成では304BパラメータのDeepSeek-V4-Flash-0731モデルを完全にHBMで実行できるようになりました。vLLM ROCm nightlyとAITER 0.1.19を利用することで、このセットアップは6,988〜7,019トークン/秒のキャッシュなしプリフィル速度を達成し、以前報告された2,699トークン/秒から大幅に増加しました。この構成では、追い出されたプレフィックスキャッシュエントリをCPUメモリにオフロードするハイブリッドKV戦略も導入されています。

  • 以前報告された2,699トークン/秒から、6,988〜7,019トークン/秒を達成しました。
  • FP8およびMoEルーティング用のカスタムパッチを適用したvLLM ROCm nightlyとAITER 0.1.19を利用しています。
  • 20GBのGPUキャッシュと96GiBのCPUオフロードを備えたハイブリッドKV戦略を実装しています。
  • 単一のAMD MI300X上で304BパラメータのDeepSeek-V4-Flash-0731モデルを実行します。

この開発により、単一のエンタープライズGPU上で大規模モデルの推論スループットが大幅に向上し、高性能なローカルホスティングがより実用的になります。

SOURCES

18. GPT-5.6 Solがトークン消費量を増加させ、キャッシュ書き込み料金を追加

GPT-5.6 Solのリリースは、フロンティアAIモデルのコスト上昇という業界の傾向を継続しています。GPT-5.5で見られたコスト増加に基づき、この新しいバージョンはセッションあたりのトークン消費量が2倍以上になり、キャッシュ書き込み料金が追加されたため、大量のコーディングワークフローにおける開発者の予算にさらなる影響を与えています。

  • GPT-5.6 Solは、GPT-5.5と比較してセッションあたりのトークン消費量が2倍以上です。
  • トークン使用量の2.25倍の増加は、APIコストの比例的な上昇につながります。
  • GPT-5.5には存在しなかった新しいキャッシュ書き込み料金が導入されました。
  • 既存のトークンベースのクォータの実質的な価値は、50パーセント以上減少しています。

GPT-5.6 Solに移行する開発者は、トークンベースのコストが2.25倍になることを考慮し、新しいキャッシュ書き込み料金を管理する必要があり、エージェント開発ワークフローへの経済的圧力が強まっています。

SOURCES

19. 独立調査がDeepSeek V4-Flashを最もコスト効率の高いモデルとして検証

7月31日のDeepSeek V4-Flash APIのパブリックベータ立ち上げに基づき、独立した調査会社からの新しいデータが、大量のタスクにおいて最もコスト効率の高い選択肢としてのモデルの地位を確認しました。分析では、AnthropicのClaude Fable 5に対して105倍のコスト差があることが強調されており、API支出を最適化するためにV4-Flashアーキテクチャへワークフローをルーティングすることの妥当性を開発者に示しています。

  • 独立した調査会社が、DeepSeek V4-Flashを最もコスト効率の高いモデルとして特定しました。
  • このモデルは、AnthropicのClaude Fable 5よりも105倍安く実行できます。
  • この検証は、7月31日のV4-FlashマネージドAPIのパブリックベータ立ち上げに続くものです。

この独立した検証により、開発者はClaude Fable 5のようなフロンティアモデルからDeepSeek V4-Flashへ大量のタスクを移行し、大幅なコスト削減を実現するための明確なベンチマークを得ることができます。

SOURCES

20. Replit、Kilo Code、SymboticがAIエージェントの予算を管理する方法

AIエージェントが開発作業の大部分を担うようになるにつれ、企業は急増するAPI請求額に直面しています。これに対抗するため、チームは単一モデルのアプローチから脱却し、複雑さに基づいてタスクを動的にルーティングするマルチモデルゲートウェイを導入しています。さらに、エージェントが生成したプルリクエストに自動リスクスコアリングを実装することで、速度と人間の監視のバランスを取り、高価なリソースが必要な場所にのみ使用されるようにしています。

  • Kilo Codeは、初期のアーキテクチャには高価なフロンティアモデルを使用し、その後のタスクには安価なオープンウェイトモデルに切り替えることを推奨しています。
  • Replitはエージェントベースのシステムを使用してプルリクエストにリスクスコアを割り当て、人間の介入が必要な時期を判断しています。
  • Kilo Codeは、ソフトウェアを特定のモデルプロバイダーから分離するために、ゲートウェイで500以上のモデルをサポートしています。
  • Symboticは従業員向けの月間コスト階層と、プルリクエストや使用傾向を監視するための管理ツールを実装しました。
  • Replitはエージェントをエンジニアリング以外にも拡大し、単純なタスクにフロンティアモデルを使用しないよう厳格なモデルルーティングを促しています。

開発者は、自律的なコーディングエージェントによるAPI請求額の暴走を防ぐために、実証済みのアーキテクチャパターンを実装できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。