Inference Brew

Google DeepMindがGemini Robotics 2をリリース

00:00 / --:--

← ホームへ戻る

Google DeepMindがGemini Robotics 2をリリース

1. Google DeepMindがGemini Robotics 2をリリース

Google DeepMindのGemini Robotics 2スイートには、Gemini Robotics 2 (VLA)、Gemini Robotics ER 2 (embodied reasoning)、Gemini Robotics On-Device 2の3つのモデルが含まれます。ER 2モデルは高度なプランナーとして機能し、ロボットカメラからのライブ映像を処理して進捗を追跡し、マルチロボットタスクを調整します。オンデバイスモデルは、ローカル実行と迅速な適応に最適化されています。このシステムは、Apptronik Apollo 2ヒューマノイドにおいて、全身制御と5本指の器用な操作を実証しました。

  • Gemini Robotics ER 2は、128kのコンテキストウィンドウを持つGemini 3.5 Flashをベースにしたアップグレード版の身体化推論モデルです。
  • ER 2モデルはGemini Live APIと統合されており、本日より開発者が利用可能です。
  • Gemini Robotics On-Device 2はGemmaテクノロジーをベースにしており、200未満の例示で数時間以内に新しいロボットの形態に適応可能です。
  • 今回のリリースには、Hugging FaceでCC-BY-4.0ライセンスの下で公開されたASIMOV-Agentic安全ベンチマークが含まれています。

開発者は、Gemini Live APIを通じて、ライブ映像と多段階推論を活用した物理エージェントのワークフローを構築できるようになりました。

2. 研究者がDeepSeek V4 Flashを蒸留したGPT-OSS-120Bを開発

HINT-SDに基づく進化した蒸留手法を用いて、研究者は複雑な金融推論能力をオープンソースモデルへ転送することに成功しました。生成された120Bモデルは、単一のH100 GPU上で8kトークンの予算内に収まる問題の98.7%を完了し、クエリあたりのコストは約0.00026ドルです。チームはまた、開発者が蒸留モデルにおける検閲の転送を研究できるように、LineageEvalフレームワークをGitHubで公開しました。

  • 研究者はDeepSeek V4 Flashの金融推論能力をGPT-OSS-120Bモデルに蒸留しました。
  • 120BモデルはFinanceReasoningベンチマークで83.61%を記録し、Kimi K3を上回りました。
  • 単一の80GB GPUで動作する20B金融モデルのオープンウェイトが公開されました。
  • 152組のペアプロンプトを用いた研究により、教師モデルの検閲が蒸留された生徒モデルには転送されないことが示されました。

開発者は、高度に専門化された低コストの金融モデルにアクセスし、新しいLineageEvalフレームワークを使用して検閲の転送を監査できるようになります。

SOURCES

3. 100万トークンコンテキスト対応のInkling-Small 276B MoEモデルがリリース

Inkling-Smallは、100万トークンという膨大なコンテキストウィンドウを備えた高容量のMixture-of-Expertsアーキテクチャを提供します。トークンごとに120億のパラメータのみをアクティブ化することで、推論の深さと計算効率のバランスをとっています。開発者は、GGUF量子化のためのCPUオフロードをサポートする特殊なllama.cppビルドを使用して、このモデルのローカルデプロイを試すことができます。

  • Inkling-Smallは合計2760億パラメータ、アクティブパラメータ120億を備えています。
  • このモデルは100万トークンのコンテキストウィンドウをサポートしています。
  • Hugging FaceにてNVFP4およびGGUF形式で利用可能です。
  • llama.cppの開発ブランチが、UnslothのGGUF量子化をCUDAおよびCPUオフロードで実行することをサポートしています。

開発者は、CUDAとCPUオフロードをサポートするllama.cppの開発ブランチを使用して、長文コンテキスト対応のMoEモデルをローカルで実行できます。

SOURCES

4. LG AI ResearchがK-EXAONE 2.0 750Bモデルをリリース

韓国のソブリンAI基盤モデルプロジェクトのフェーズ2で開発されたK-EXAONE 2.0は、前モデルの3倍の規模です。このモデルは堅牢な安全アライメントを備え、安全ベンチマークで94.6を記録し、コーディングやエージェントによるツール使用において競争力のあるパフォーマンスを発揮します。Apache 2.0ライセンスにより非常にアクセスしやすいですが、その巨大なサイズのためホスティングには大きな要件が必要です。

  • K-EXAONE 2.0は、Apache 2.0ライセンスでリリースされた7500億パラメータのモデルです。
  • 10言語をサポートし、OpenAI-MRCR長文コンテキストベンチマークで94.4を記録しました。
  • エージェントツール使用のためのTau3-Bench Bankingベンチマークで14.2のスコアを達成し、Qwen 3.5を上回りました。
  • コーディングパフォーマンスは、バージョン1と比較して主要指標全体で平均30%向上しています。

このリリースにより、強力なエージェントツール使用能力と長文コンテキスト能力を備えた、巨大なオープンウェイト基盤モデルが提供されます。

SOURCES

5. Basetenが新しいマージモデルによりGLM 5.2に視覚機能を追加

GLM 5.2 APIの最近のパフォーマンス最適化に続き、BasetenはGLM-5.2-Vision-NVFP4をリリースすることでモデルの有用性を拡大しました。このマージモデルは、Kimi k2.6の視覚エンコーダーをGLM 5.2アーキテクチャに統合し、マルチモーダル処理を可能にします。このリリースはOpenRouterで利用可能であり、元のGLM 5.2リリースにおけるネイティブな視覚サポートの欠如に関する開発者からのフィードバックに対応しています。

  • GLM-5.2-Vision-NVFP4がOpenRouterで推論可能になりました。
  • このモデルはGLM 5.2アーキテクチャとKimi k2.6視覚エンコーダーのマージ版です。
  • 今回のリリースにより、GLM 5.2ファミリーにマルチモーダル機能が追加され、以前の制限が解消されました。

開発者は、既存のGLM 5.2インフラストラクチャを基盤として、マルチモーダルアプリケーション向けに視覚対応版のGLM 5.2を利用できるようになりました。

SOURCES

6. SpaceXAIがGrok Voice Think Fast 2.0をローンチ

SpaceXAIは、本番環境の顧客ワークフローにおける信頼性を高めるために設計された更新版音声モデル「Grok Voice Think Fast 2.0」をローンチしました。このモデルはAgent Builderを通じて音声1分あたり0.09ドルで利用可能です。現在`grok-voice-latest`モデルを統合している開発者は、8月5日にこの新バージョンへ自動的に移行する準備をする必要があります。

  • Grok Voice Think Fast 2.0がSpaceXAIのAgent Builderで利用可能になりました。
  • サービス価格は音声1分あたり0.09ドルです。
  • grok-voice-latest APIエンドポイントは、8月5日に自動的に新バージョンへ移行します。
  • 今回のリリースは、実際の顧客ワークフローにおける信頼性の向上に焦点を当てています。

Grok Voiceを使用している開発者は、本番ワークフローにおける信頼性の向上を期待でき、来週には予定されているAPI移行が行われます。

SOURCES

7. ClaudeのPDFトークンコストを90〜99%削減するToken Saver MCP拡張機能

Token Saverは、Claude 3.5 SonnetおよびClaude 3 Opusを使用してローカルのPDFドキュメントをクエリするための、設定不要で安全な方法を提供します。8段階の処理パイプラインを通じて動作するこの拡張機能は、標準I/Oを介して完全にローカルで実行され、外部サーバーへのファイルアップロードをゼロにします。ユーザーが設定可能なフォルダーの許可リストとネットワーク分離機能を備えており、エンタープライズ環境に最適です。

  • Token Saverは、Claude Desktop (v1.0)向けのオープンソースModel Context Protocol (MCP)拡張機能です。
  • このツールは、BM25キーワードマッチング(0.4)とall-MiniLM-L6-v2セマンティック検索(0.6)を使用したローカルハイブリッドRAGシステムを実装しています。
  • 関連するドキュメントの箇所のみを抽出して送信することで、LLMのトークン消費量を92%から99%削減します。
  • この拡張機能は.mcpbバンドルとして配布されており、Python環境やターミナル設定は不要です。

開発者は、大規模なローカルPDFを扱う際に、関連性の高い箇所のみをモデルに送信することで、Claude APIのコストを劇的に削減できます。

SOURCES

8. Tmuxでのマルチエージェント実行を簡素化するAgent-Manager TUI

Agent-managerは、複数のAIコーディングエージェントを実行する開発者のための強力なターミナルベースのコントロールプレーンを提供します。各エージェントを独自のtmuxセッションに分離することで、開発者はリアルタイムのシステムメトリクスを監視し、エージェントをプロジェクトツリーにグループ化し、レビューコメントを単一のプロンプトとしてエージェントに送り返すことができます。また、ペインポーリングやClaude Codeのフックイベントによる自動ステータス検出機能も備えています。

  • Agent-managerは、Claude Code、Codex、OpenCodeなどのコーディングエージェントを個別のtmuxセッションで実行します。
  • このツールは、ライブステータスの表示、エージェントのグループ化、セッションにアタッチせずにプロンプトを送信するための統合TUIを提供します。
  • 構文ハイライト付きのフルファイル差分レビューをサポートし、エージェント主導のセッション管理のためのMCPサーバーが含まれています。
  • インストールはHomebrew、シェルスクリプト、AUR、mise、またはGoを介してサポートされています。

開発者は、単一の統合ターミナルインターフェースから、複数の同時実行コーディングエージェント全体でオーケストレーション、プロンプト送信、差分レビューを行うことができます。

SOURCES

9. Deep Agents v0.7がベース入力トークンを65%削減

Deep Agents v0.7のリリースは、エージェントワークフローのランタイム効率の最適化に焦点を当てています。ベース入力の処理方法を再構築することで、フレームワークは入力トークンの使用量を65%削減しました。この最適化により、開発者は以前のAPIコストの数分の一で複雑なエージェントループを実行しながら、同一の出力品質を維持できます。

  • Deep Agents v0.7は、以前のバージョンと比較してベース入力トークンを65%削減します。
  • トークンの削減は、エージェントのパフォーマンスを低下させることなく達成されています。
  • このアップデートは、開発者のコストとトークン効率を直接向上させるように設計されています。

Deep Agentsを使用している開発者は、エージェントのパフォーマンスを犠牲にすることなく、APIコストを即座に下げ、トークン効率を向上させることができます。

SOURCES

10. PerplexityがNumbatエージェントセキュリティスイートをオープンソース化

PerplexityのNumbatは、クライアントデバイス上で自律型AIエージェントを実行する際の特有のセキュリティ課題に対処します。エージェント実行ハーネスと直接統合することで、このオープンソーススイートは、エージェントの動作を監視し、偶発的なメルトダウンを防ぎ、エンドポイントレベルでセキュリティリスクを軽減するためのツールを開発者に提供します。

  • Numbatは、PerplexityがAIエージェント専用に開発したオープンソースのセキュリティスイートです。
  • このスイートは、クライアントエンドポイントへの自律型エージェントのデプロイに関連するセキュリティリスクを標的としています。
  • Numbatはエージェントハーネスと直接統合し、ランタイムのセキュリティインシデントを検知・軽減します。

開発者はNumbatをエージェントハーネスに統合することで、クライアントレベルでの偶発的なエージェントのメルトダウンを防止、検知、軽減できます。

SOURCES

11. Hush Securityが自律型AIエージェント向けのIdentity Gatewayをローンチ

イスラエルのスタートアップHush Securityは、急速に成長するAIエージェントエコシステムのセキュリティ課題に取り組んでいます。自律型エージェントは多くの場合、広範な人間の資格情報を継承したり、長期間有効なAPIキーを使用したりするため、重大なセキュリティリスクをもたらします。Hush SecurityのIdentity Gatewayプラットフォームを使用すると、組織はエージェントに一意のIDを割り当て、タスク固有のきめ細かな権限を強制できます。開発者がランタイムの可視性を獲得し、アクセス制御を実装できるようにするための無料ティアが用意されています。

  • Hush Securityは、自律型AIエージェントを管理するプラットフォームを拡大するために、シリーズAラウンドで3000万ドルを調達しました。
  • Identity GatewayプラットフォームはAIエージェントを発見し、タスク固有の権限を仲介することで「最小権限」を強制します。
  • ランタイムの可視性、リスク分析、IDベースのアクセス制御を提供する無料プランが利用可能です。
  • このプラットフォームは、継承された人間の資格情報や長期間有効なAPIキーで動作するエージェントからのセキュリティリスクに対処します。

開発者は、人間以外の固有のIDを割り当て、タスク固有の仲介された権限を強制することで、エージェントのデプロイを保護できます。

SOURCES

12. 技術英語を簡素化するオープンソースのエージェントスキル

このオープンソースのエージェントスキルは、エラーメッセージ、ランブック、インシデントレポート、リリースノート向けに特定の適応を提供します。簡略化技術英語を強制することで、このスキルはドキュメントの明瞭さを向上させるだけでなく、テストされたすべてのモデルで出力トークン数を一貫して減少させます。開発者は、既存のエージェント構成やシステムプロンプトにこのスキルを簡単に追加できます。

  • このオープンソーススキルは、LLMにASD-STE100簡略化技術英語(STE)での記述を強制します。
  • Claude Code、Cursor、VS Code Copilot、およびその他の主要なエージェントハーネスと互換性があります。
  • テストでは、STE違反が72.9%減少し、平均文長が11.2語から9.7語に短縮されました。
  • このスキルはMITライセンスの下で提供されており、`npx skills add AminBlg/SimpleEnglish`でインストール可能です。

開発者はこのスキルをClaude Code、Cursor、Copilotに統合することで、より明確で簡潔なドキュメントを自動生成し、トークンを節約できます。

SOURCES

13. Tencentが推論加速フレームワーク「AngelSpec」をオープンソース化

TencentのAngelSpecは、推論加速用ドラフトモデルを学習するための統合フレームワークを提供します。会話データ用のMTPモデルと、コードや数学に最適化されたブロック拡散モデル(DFly)という2つの補完的なアーキテクチャを提供します。AngelSpecには、長文コンテキスト学習のためのUlyssesシーケンス並列処理やドキュメント認識シーケンスパッキングなどの高度な機能が含まれており、開発者は高度に最適化されたローカル推論パイプラインをデプロイできます。

  • AngelSpecは、推論加速用ドラフトモデルを学習するための、TorchSpec上に構築されたオープンソースのTorchネイティブフレームワークです。
  • このフレームワークは、自己回帰型マルチトークン予測(MTP)とブロック並列DFlashファミリーをサポートしています。
  • HY3-295B-A21Bモデルにおいて、DFly-8ドラフトモデルは標準的な自己回帰推論と比較して1.98倍から2.40倍の高速化を実現します。
  • AngelSpecはvLLM、SGLang、Hugging Face Transformersと統合されており、7つの事前学習済みチェックポイントが含まれています。

開発者はカスタムドラフトモデルを学習することで、ターゲットモデルを変更することなく、ローカルLLM推論を最大2.4倍高速化できます。

SOURCES

14. Ciscoが無料のAIサプライチェーン出所調査ツールをローンチ

CiscoのAI Supply Chain Provenance Explorerは、オープンソースAIにおける検証の欠如(オープンモデルの最大69%が系譜未検証)に対処します。Embedding Anchor Similarityのような重みレベルの信号を分析することで、このツールは自己申告のメタデータをバイパスし、真のモデルの起源を特定します。欧州委員会が2026年8月2日にEU AI法を施行し始め、オープンモデルの未検証の改変に対して厳しい罰金を科すようになるため、この検証はますます重要になっています。

  • AI Supply Chain Provenance Explorerは、約900のオープンソースモデルをカバーする無料の公開データベースです。
  • このツールは静的フィンガープリントと行動類似性分析を使用して、96.4%の精度でモデルの系譜を検証します。
  • プロバイダーの本社、ライセンス制限、スキャンされたファイルに関する検索可能なデータを提供します。
  • データベースはCiscoアカウントを必要とせず、provenance.aidefense.cisco.comで公開されています。

開発者はオープンソースモデルの真の系譜とライセンスを検証し、EU AI法などの今後の規制への準拠を確実にすることができます。

SOURCES

15. ローカルGPU向けに量子化されたEscha-W2 Qwen MoEモデルがリリース

Escha-W2により、巨大な256エキスパートのMixture-of-Expertsモデルをコンシューマーグレードのハードウェアでホストできるようになりました。Qwen3.6-35B-A3Bモデルを2ビット量子化まで圧縮することで、ビルドは12.3GBのディスク容量に収まります。OpenAI互換のHTTP APIをすぐに公開するために必要なサービングインフラストラクチャがプリパッケージされています。

  • Escha-W2は、256エキスパートを備えたQwen3.6-35B-A3B MoEモデルの2ビット量子化ビルドです。
  • このモデルは、OpenAI互換のHTTP APIを介してローカルで提供するためのツールと共にパッケージ化されています。
  • 12.3GBのディスク容量を占有し、16GBまたは24GBのVRAMを搭載した単一のコンシューマーGPUで動作します。

開発者は、OpenAI互換APIを使用して、16GBまたは24GBのVRAMを搭載したハードウェア上で、256エキスパートのMixture-of-Expertsモデルをローカルでホストできます。

SOURCES

16. MindControlベンチマークでコーディングタスクのトークンが50%削減

MindControl llama.cppフォークの最初のリリースに続き、開発者のLaurence Hardmanがそのパフォーマンスを定量化するベンチマーク結果を公開しました。ハードカットオフをサンプラーレベルのガイド付き推論予算に置き換えることで、このツールはQwen3.6-27Bのようなモデルがコーディングベンチマークで高い精度を維持しながら、LiveCodeBenchでのトークン使用量を50%以上削減することを可能にします。

  • Qwen3.6-27BでのMindControlベンチマークは、LiveCodeBenchでのトークン消費量が50%削減されたことを示しています。
  • 最も制約の厳しい構成で、HumanEval+で95.7%のスコアを達成しました。
  • この手法は高い精度を維持しながらトークン予算を最適化しますが、最も難しい問題サブセットではパフォーマンスコストが指摘されました。

これらの結果は、以前にリリースされたMindControlフォークが、集計精度を低下させることなく、コーディングタスクのローカルモデル推論の効率を大幅に向上できることを裏付けています。

SOURCES

17. OpenAIがGPT-5.6の価格を調整し、高スループットの「Fast mode」を追加

今月初めにリリースされたGPT-5.6モデルファミリーの一般提供開始に基づき、OpenAIは競争力を維持するために大幅な価格調整を実施しました。同社は、コスト最適化されたLunaモデルのAPI価格を80%、バランスの取れたTerraモデルの価格を20%引き下げました。さらに、フラッグシップモデルSol向けに新しい「Fast mode」を導入し、レイテンシに敏感な本番ワークフロー向けに2.5倍高いスループットをプレミアム価格で提供します。

  • GPT-5.6 Lunaの価格を80%引き下げ、合計で100万トークンあたり1.40ドルに設定。
  • GPT-5.6 Terraの価格を20%引き下げ、合計で100万トークンあたり14.00ドルに設定。
  • GPT-5.6 Sol向けの新しい「Fast mode」は、100万トークンあたり70ドルで2.5倍のスループットを提供。
  • GPT-5.6 Solの標準価格は変更なし。

これらのアップデートにより、開発者はGPT-5.6シリーズに対してより柔軟なコストとパフォーマンスの選択肢を得ることができ、より安価な軽量推論や高スループットの本番環境機能が可能になります。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。