Inference Brew

NvidiaがNeMo SwitchyardとNemotron 3.5 Lightningを発表

00:00 / --:--

← ホームへ戻る

NvidiaがNeMo SwitchyardとNemotron 3.5 Lightningを発表

1. NvidiaがNeMo SwitchyardとNemotron 3.5 Lightningを発表

Nvidiaは、エージェントワークフローの各ステップを、状態やトークンコストの予測に基づいて、最も費用対効果が高く高性能なモデルに動的にルーティングするオープンソースライブラリ「NeMo Switchyard」を発表しました。これと併せて、ハイブリッドなMamba-Transformerアーキテクチャと100万トークンのコンテキストウィンドウを備えた300億パラメータのオープンな混合エキスパートモデル「Nemotron 3.5 Lightning」もリリースされました。LangChainなどのフレームワークやCognitionのDevin DesktopといったプラットフォームへのSwitchyardの早期統合により、マルチターンエージェントタスクにおいて最大74%のコスト削減が実証されています。

  • • Nvidiaがエージェントワークフローにおける動的モデルルーティングのためのオープンソースライブラリ「NeMo Switchyard」をリリース。
  • • 30Bのオープンな混合エキスパートモデル「Nemotron 3.5 Lightning」を発表。アクティブパラメータは3B、コンテキストウィンドウは1Mトークン。
  • • NeMo SwitchyardはLangChain、Kong、LiteLLM、OpenRouter、CognitionのDevin Desktopと統合済み。
  • • LangChainは、Switchyardを通じて呼び出しの7%をフロンティアモデルにルーティングすることで、145のマルチターンタスク全体で74%のコスト削減を報告。
  • • Nemotron 3.5 Lightningは商用利用可能なOpenMDW-1.1ライセンスでリリースされ、Hugging Faceで利用可能。

開発者はオープンソースのルーティングライブラリを使用して、タスクの途中で自動的にモデルを切り替えることが可能になり、精度を犠牲にすることなく複雑なエージェントワークフローのAPIコストを大幅に削減できます。

2. オープンウェイトのビデオ・世界モデル「LTX-2.5」がリリース

LightricksからスピンアウトしたLTXは、Nvidia RTX GPUでの低遅延なローカル実行向けに設計されたオープンウェイトのビデオ・世界モデル「LTX-2.5」をリリースしました。このモデルは、拡散ビデオデコーダー、ネイティブなマルチショット生成、カスタムのGemma 4言語バックボーンを特徴としています。ノードベースのワークフローツールであるComfyUIにネイティブ統合されており、Hugging FaceおよびLTX APIを通じて利用可能です。年間経常収益が1,000万ドル未満の組織は無料で利用できるコミュニティライセンスが提供されています。

  • • LTXが2026年8月11日にオープンウェイトのビデオ・世界モデル「LTX-2.5」をリリース。
  • • モデルはComfyUIにネイティブ統合されており、Hugging FaceおよびLTX APIで利用可能。
  • • LTX-2.5コミュニティライセンスに基づき、年間経常収益1,000万ドル未満の組織は無料。
  • • 新機能として、拡散ビデオデコーダー、ネイティブなマルチショット生成、カスタムのGemma 4バックボーンを搭載。
  • • NVIDIA RTX GPUでのローカル実行をサポートし、低遅延推論向けに最適化されている。

開発者は、オープンウェイトとComfyUIのネイティブ統合を活用して、ローカルで低遅延なビデオ生成機能をアプリに組み込むことができます。

SOURCES

3. SpaceXAIとCursorが常駐型AIエージェント「Grok Bot」を発表

現在合併手続き中のSpaceXAI(旧xAI)とCursorは、macOS、Windows、Linux、iOS向けの「Grok Bot」ベータ版を立ち上げました。Grok Botは、専用のクラウドコンピュータ上で実行される常駐型AIエージェントを展開し、アプリケーションへのログイン、ユーザーワークフローの学習、24時間365日のタスク調整を可能にします。システムはタスクをバックエンドモデルに自動的に動的ルーティングします。価格は、組織向け「Cursor Premium Teams」で1シートあたり月額120ドル、個人向け「Cursor Ultra」で月額200ドルです。

  • • SpaceXAIとCursorがmacOS、Windows、Linux、iOS向けにGrok Botのベータ版をリリース。
  • • Grok Botには専用のクラウドコンピュータが割り当てられ、アプリにログインして24時間365日稼働。
  • • サービス料金は組織向け(Cursor Premium Teams)で月額120ドル/シート、個人向け(Cursor Ultra)で月額200ドル。
  • • システムは手動のモデル選択なしで、タスクをバックエンドモデルに自動ルーティング。
  • • SpaceXAIとCursorは現在、単一企業への合併手続き中。

Cursorに直接結びついた高度に統合された常駐型エージェント環境が導入され、開発者はマルチステップかつアプリケーションを横断するワークフローを、クラウドホスト型の自律的なチームメイトに委任できるようになります。

4. ローカルモデルの学習と推論を行う「Unsloth Desktop」アプリがリリース

Unslothは、ローカルでモデルを実行・学習するために設計されたmacOS、Windows、Linux向けのオープンソースアプリケーション「Unsloth Desktop」をリリースしました。このアプリケーションはMLX、GGUF、拡散モデル、オーディオ形式をサポートし、MiniMax-H3やMuse Glimmerといったモデルをネイティブでサポートしています。Unsloth Desktopを使用すると、開発者はClaude CodeやCodexをローカルLLMに接続でき、自己修復ツール呼び出しとサンドボックス化されたコード実行により精度が50%向上すると主張しています。また、VRAM使用量を70%削減しつつ、2倍高速なモデル学習を実現します。

  • • Unsloth DesktopがmacOS、Windows、Linux向けのオープンソースアプリとしてリリース。
  • • 開発者はClaude CodeやCodexをローカルLLMに接続可能。
  • • MLX、GGUF、拡散モデル、オーディオ形式(MiniMax-H3やMuse Glimmerを含む)をサポート。
  • • VRAM使用量を70%削減し、2倍高速なモデル学習を実現すると主張。
  • • プライベートウェブ検索、ディープリサーチ、RAG、MCP、NVFP4およびGGUFへのエクスポート機能を搭載。
  • • アプリケーションはテレメトリやユーザーデータを一切収集しない。

テレメトリを含まない強力なローカル環境を提供し、Claude Codeのようなクラウドベースのコーディングアシスタントと、ローカルで自己ホストされたモデルを橋渡しします。

SOURCES

5. Qwen-MM-PluginsがAgent Plugins 1.0.0標準を実装

Agent Plugins 1.0.0標準のリリースに続き、Qwenモデル向けのネイティブなマルチモーダルプラグインを提供する新しいオープンソースリポジトリ「Qwen-MM-Plugins」が立ち上がりました。1.0.0仕様を活用することで、これらのプラグインは特定のスキルとオプションのModel Context Protocol (MCP) サーバーをバンドルし、開発者が視覚、音声、画像機能をエージェントハーネスに統合できるようにします。

  • • Qwen-MM-PluginsはAgent Plugins 1.0.0標準を採用し、マルチモーダル機能をパッケージ化。
  • • リポジトリには、Qwen搭載エージェント向けのネイティブプラグインとオプションのMCPサーバーが含まれる。
  • • 開発者のツールリスト作成やセットアップ手順を支援するクックブックを提供。
  • • このリリースにより、エージェントハーネスがマルチモーダルネイティブなシステムとして機能可能に。

この実装はAgent Plugins 1.0.0標準の実用的な応用例であり、開発者がQwenモデル向けのマルチモーダルネイティブなエージェントワークフローを構築するためのすぐに使えるツールを提供します。

SOURCES

6. 研究者がフロンティアAPIから隠された推論トレースを抽出

テュービンゲン大学、マックス・プランク研究所、MATS Research、Snykの研究者らは、OpenAI、Anthropic、GoogleのAPIアクセス可能なフロンティアモデルにおいて、隠された推論トレースを抽出できる脆弱性を特定しました。この攻撃手法は、暗号化された推論トレースを同じモデルのより小さく調整されていないバージョンに入力し、その内部思考を明らかにするというものです。各社は、パスワードやAPIキーなどの機密データの復元を可能にしていたこの脆弱性に対処するため、短期的なAPI緩和策を実装しました。また研究者らは、Moonshot AIのオープンウェイトモデル「Kimi K3」の出力がClaude Opus 4.8やGPT 5.6 Solのトレースと非常に類似していることを指摘し、モデル蒸留に関する疑問を提起しました。

  • • 研究者がAPI経由でOpenAI、Anthropic、Googleのモデルから隠された推論トレースを抽出する方法を発見。
  • • 攻撃手法は、暗号化された推論トレースをモデルのより小さく調整されていないバージョンに入力して内部思考を明らかにするもの。
  • • この脆弱性により以前はパスワードやAPIキーの復元が可能だったが、プロバイダーはAPI緩和策を実装済み。
  • • 中国のオープンウェイトモデルKimi K3が、Claude Opus 4.8やGPT 5.6 Solの隠された推論トレースと非常に類似した出力を生成した。
  • • Anthropicは、レポートで説明されたリプレイ動作に対する短期的な緩和策の構築を開始したことを確認。

フロンティア推論APIにおける重大なセキュリティ脆弱性を浮き彫りにし、機密性の高い内部状態やデータが露出する可能性があるため、主要なAPIプロバイダーによる即時の緩和策が求められました。

7. リバースエンジニアリングによりGitHub Copilotのプライバシーリスクが露呈

エンジニアのRafael氏は、Man-in-the-Middle (MitM) プロキシを使用してGitHub Copilotをリバースエンジニアリングし、VS Code拡張機能からのネットワークトラフィックを調査しました。その結果、Copilotは最近編集されたファイルのコンテキストをAPIリクエストに自動的に含めており、編集履歴に`.env`のようなファイルが含まれていると、機密データが意図せず露出する可能性があることが判明しました。さらに、Copilotはユーザーのプロンプトとアシスタントの応答を、編集、サニタイズ、秘密フィルタリングを行うことなく、プレーンテキストでローカルのSQLiteデータベース(`session-store.db`)に書き込んでおり、内部のChronicleツールがSQLを使用して過去の履歴をクエリできるようになっています。

  • • エンジニアがmitmproxyを使用してGitHub Copilotをリバースエンジニアリングし、VS Codeのネットワークトラフィックを調査。
  • • Copilotは最近編集されたファイルのコンテキストを自動的に含めるため、`.env`などのファイルから機密データが漏洩する可能性がある。
  • • ユーザーのプロンプトとアシスタントの応答は、ローカルのSQLiteデータベース(`session-store.db`)にプレーンテキストで保存される。
  • • ローカルデータベースのコードは、保存されたデータに対して編集、サニタイズ、秘密フィルタリングを一切行わない。
  • • CopilotのChronicleツールは、SQLを使用してこのローカルデータベースをクエリし、過去のセッション履歴を取得する。

Copilotを使用する開発者は、`.env`のような機密ファイルがAPIペイロードで密かに漏洩する可能性があり、プロンプト履歴全体がローカルマシン上に暗号化されずに保存されていることを認識する必要があります。

SOURCES

8. AnthropicがClaudeモデル全体に不可視の電子透かしを実装へ

Anthropicは、EU AI法の透明性義務を遵守するため、旧モデルを含む全モデルラインナップに不可視の機械可読な電子透かしシステムを実装することを約束しました。この電子透かしは、Claude Platform、Claude、Claude Code、Claude Cowork、Claude Tag全体にグローバルに適用され、モデルに直接アクセスする場合でも、AWS、Google Cloud、Microsoft Foundryなどのクラウドプロバイダー経由でアクセスする場合でも同様です。Claudeが生成した画像にはC2PAメタデータ標準が採用され、テキストにはコピー&ペースト操作を経ても持続する知覚不可能なステガノグラフィ電子透かしが施されます。

  • • Anthropicは、Claudeが生成したテキストと画像に不可視の機械可読な電子透かしをグローバルに適用する。
  • • 電子透かしは、直接API、AWS、Google Cloud、Microsoft Foundryを含むすべてのアクセス方法に適用される。
  • • Claudeが生成した画像にはC2PA来歴メタデータ標準を使用し、テキストにはステガノグラフィ電子透かしを使用する。
  • • この実装は、2024年8月2日に発効したEU AI法を遵守するためのもの。
  • • Anthropicは、第三者がこれらの電子透かしを検出するための技術ドキュメントを公開する予定。

Claude APIを使用する開発者は、生成されるすべてのテキストと画像に持続的な機械可読の電子透かしが含まれることに備える必要があり、これが後続の処理やコンプライアンスワークフローに影響を与える可能性があります。

9. H3-metalプロジェクトがApple SiliconでのローカルMiniMax-H3推論を実現

マルチモーダルモデル「MiniMax-H3」の最近のリリースに基づき、H3-metalプロジェクトはApple Silicon向けのネイティブ推論サポートを導入しました。M3 MaxおよびM5 Maxチップ向けに最適化されており、プロンプトからビデオ/オーディオへの生成、最初/最後のフレームの条件付け、Ref2VA参照をサポートしています。M5 Max上でDiTストレージのメモリ要件を2.0~2.1 GiBに削減する「--ssd-streaming」モードが含まれており、int8量子化もサポートしています。

  • • H3-metalは、Apple Silicon上でMiniMax-H3モデルのネイティブ推論を提供。
  • • プロンプトからビデオ/オーディオへの生成、最初/最後のフレームの条件付け、Ref2VA参照をサポート。
  • • M5 Max上で2.0~2.1 GiBのDiTストレージのみを必要とする「--ssd-streaming」モードを搭載。
  • • M3 MaxおよびM5 Maxチップ向けに最適化されており、int8量子化をサポート。

この開発により、開発者は最近リリースされたMiniMax-H3モデルを、高度に最適化されたメモリフットプリントでApple Siliconハードウェア上でローカルに実行できるようになります。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。