1. GoogleがGemini Distillation Serviceを発表
Googleは、最先端モデルの推論パターンを効率的な学生モデルに転送するために設計されたマネージドサービス「Gemini Distillation Service」を開始しました。このサービスは現在、gemini-3.1-proからgemini-2.5-flashへの知識蒸留をサポートしています。これにより、開発者は高度な推論能力を維持しつつ、本番アプリケーションの推論コストを大幅に削減できる、専門化された低遅延モデルを構築できるようになります。
- • Gemini Distillation Serviceは、より大きな教師モデルを使用して、より小さな学生モデルのトレーニングを自動化します。
- • 現在、教師モデルとしてgemini-3.1-pro、学生モデルとしてgemini-2.5-flashをサポートしています。
- • 複雑な推論能力を必要とする、高トラフィックかつ低遅延が求められるアプリケーション向けに最適化されています。
開発者は、複雑な推論能力をより小さく、高速で安価なモデルに簡単に蒸留できるようになり、高トラフィックかつ低遅延が求められるアプリケーションに最適化できます。
2. Microsoftがストリーミングマルチモーダルモデル「Mage-VL」をリリース
Microsoftは、画像および動画理解に最適化されたオープンウェイトのコーデックネイティブなストリーミングマルチモーダル基盤モデル「Mage-VL」をリリースしました。Mage-VLは、カスタムの4BスケールのビジュアルエンコーダーとQwen3-4B言語バックボーンを組み合わせています。動画ストリームをアンカーフレームと予測フレームに分離することで、モデルのスパース性メカニズムが冗長なビジュアルトークンを75%以上フィルタリングし、推論時間を3.5倍高速化します。さらに、組み込みの「認知ゲート(cognition gate)」により、重要なイベントが検出された場合にのみ完全な視覚言語モデルが呼び出されるため、不要な計算を大幅に削減します。
- • Mage-VLは、画像および動画理解のためのコーデックネイティブなプロアクティブストリーミングマルチモーダル基盤モデルです。
- • ゼロからトレーニングされた4Bスケールのビジュアルエンコーダーと、Qwen3-4B-Instruct-2507言語バックボーンを搭載しています。
- • コーデックに準拠したスパース性メカニズムが動画ストリームをアンカー(I)フレームと予測(P)フレームに分離し、ビジュアルトークンを75%以上削減します。
- • 均一なフレームサンプリングと比較して、最大3.5倍の推論速度を実現します。
- • 「認知ゲート」を備えたデュアルプロセス設計により、応答に値するイベントが検出された場合にのみ完全なVLMを呼び出します。
開発者は、推論の遅延とトークン消費を大幅に削減する、非常に効率的な動画処理パイプラインを構築できます。
3. Runwayがリアルタイム動画モデル「Characters」と蒸留ワークフローの詳細を公開
VB Transform 2026において、Runwayはゼロ遅延のアバター対話を実現するリアルタイム動画モデル「Runway Characters」のプロダクションインサイトを共有しました。リアルタイム速度を達成するために、Runwayは大規模な基盤モデルをより小さな学生モデルに蒸留し、視覚的な鮮明さを維持するために敵対的ポストトレーニング(APT)を使用することで、生成遅延を80%から90%削減しています。また、キャラクターのドリフトバグを解決するためのフロントエンドの再センタリング機能や、クラウドデータセンターでのハードウェアレベルのパフォーマンス低下を特定するためのAI監視エージェントの導入など、実用的なエンジニアリングの回避策についても詳細を説明しました。
- • Runway Charactersは、AI生成アバターとのゼロ遅延対話を可能にするリアルタイム動画モデルです。
- • Runwayは蒸留を利用してより小さな学生モデルをトレーニングし、動画生成時間を80%から90%短縮しています。
- • 蒸留モデルの視覚的な鮮明さを維持するために、敵対的ポストトレーニング(APT)を採用しています。
- • 入力画像を再センタリングする「画質最適化」フロントエンド機能を実装し、キャラクタードリフトのバグを解決しました。
- • AIエージェントと監視ツールを使用して、APIの速度低下(呼び出しの8%が16fpsに低下)の原因がus-east-1のハードウェア故障であることを特定しました。
インタラクティブな動画アプリケーションを構築する開発者は、Runwayのプロダクション戦略から、遅延の最適化やキャラクタードリフトへの対処方法を学ぶことができます。
4. MicrosoftがMAIモデルファミリーを拡充、サイバーセキュリティ特化の「MAI-Cyber-1-Flash」を発表
Microsoftは、Build 2026で初めて導入された独自のMAIモデルファミリーを、「MAI-Cyber-1-Flash」のリリースにより拡充しました。この新しい50億アクティブパラメータモデルは、以前リリースされた「MAI-Code-1-Flash」をベースに、コードベースのパッチ適用などの防御的なサイバーセキュリティタスクに特化して微調整されたものです。このモデルはMicrosoftのMDASHスキャンハーネスを強化し、運用コストを削減しながら自動化されたセキュリティワークフローを実現します。
- • MAI-Cyber-1-Flashは、MAI-Code-1-Flashモデルをサイバーセキュリティ向けに微調整したものです。
- • 総パラメータ数137B、アクティブパラメータ数5B、コンテキスト長256kを特徴としています。
- • CyberGymベンチマークで95.95%のスコアを記録したMDASHスキャンハーネスを強化します。
- • 防御タスクに制限されており、エクスプロイトを生成することはできず、ExploitGymではゼロスコアを記録しています。
- • MDASHへの統合により、ルーチンタスクをローカルで処理してから大規模モデルにエスカレーションすることで、運用コストを50%削減します。
このリリースは、MAIモデルファミリー初のサイバーセキュリティ特化型拡張であり、自動セキュリティパッチ適用のための費用対効果の高い防御ツールを開発者に提供します。
5. Model Context Protocolがステートレスアーキテクチャを正式リリース
Agentic AI Foundation (AAIF) は、Model Context Protocol (MCP) 仕様の最終版を正式にリリースしました。5月に発表されたリリース候補版から移行し、完全にステートレスなリクエスト/レスポンスアーキテクチャとなりました。このGAリリースにより、開発者は標準的なロードバランサーやKubernetesの背後にMCPサーバーをデプロイできるようになり、必須のセキュリティ強化と、レガシー機能に対する12ヶ月の非推奨ポリシーが導入されました。
- • MCP仕様の最終版がGAとなり、ステートレスなリリース候補版から本番環境対応のアーキテクチャへ移行しました。
- • ステートレス設計により、標準的なロードバランサーやKubernetesの背後でのデプロイをサポートします。
- • セキュリティのために必須のRFC 9207発行者検証が含まれています。
- • HTTP+SSEなどのレガシー機能に対して、正式な12ヶ月の非推奨ポリシーを確立しました。
- • 2つの新しい公式拡張機能「MCP Apps」と「MCP Tasks」が追加されました。
この正式リリースにより、ステートレスアーキテクチャへの移行が確定し、クラウドネイティブ環境での本番グレードのMCPサーバーデプロイが可能になります。
6. SnowflakeがAIエージェントを統制する「Cortex AI Gateway」を発表
Snowflakeは、自律型AIエージェントを管理するために設計された一元的なガバナンスおよびセキュリティレイヤー「Cortex AI Gateway」を発表しました。Natomaの買収技術に基づいて構築されたこのゲートウェイは、100以上のModel Context Protocol (MCP) サーバーをサポートしており、開発者はアクセス権限や許可を一元管理できます。説明責任を果たすため、プラットフォームはエージェントのIDと承認した人間の両方を記録する「デュアルアトリビューション」を実装し、財務チームにはリアルタイムのコスト配分と、API料金の暴走を防ぐための厳格な支出制限を提供します。
- • SnowflakeのCortex AI Gatewayは、AIエージェントによるエンタープライズデータ、ツール、モデルへのアクセスを統制する一元的な制御レイヤーとして機能します。
- • 100以上のModel Context Protocol (MCP) サーバーをサポートし、認証、権限、監査ログを一元化します。
- • エージェントの非人間IDとタスクを承認した特定の人間を記録するデュアルアトリビューション機能を備えています。
- • 1Password、Aembit、Linx Security、SailPoint、Saviyntとのセキュリティ統合が含まれています。
- • 統一されたコスト配分と支出制限を提供し、エンタープライズAPI料金の暴走を防ぎます。
エンタープライズエージェントを構築する開発者は、このゲートウェイを使用してセキュリティポリシーの強制、権限管理、APIコストの暴走防止を行うことができます。
7. Fireworks AIがルーティングレイヤー「Fireworks Nexus」を発表
Fireworks AIは、LLMの支出を最適化するために設計されたインテリジェントなルーティングおよびコスト管理プラットフォーム「Fireworks Nexus」を発表しました。プラットフォームのコアとなるオープンソースコンポーネント「FireConnect」により、開発者はClaude Codeなどの既存の開発ツールに1行のインストールでFireworksモデルを統合できます。インテリジェントルーターは、カスタムトレーニングされたモデルを使用してリクエストの難易度を評価し、ルーチン的なコーディングタスクを費用対効果の高いオープンウェイトモデルに自動的にオフロードし、複雑なクエリをフロンティアAPI用に予約することで、プルリクエストあたりのコストを33%削減します。
- • Fireworks Nexusは、エンタープライズコスト管理とトラフィック管理を備えたAI管理およびルーティングプラットフォームです。
- • FireConnectコンポーネントはApache 2.0ライセンスでオープンソース化されており、Claude Code、Codex、OpenCodeとの1行統合が可能です。
- • インテリジェントルーターがカスタムモデルを使用してリクエストの難易度をスコアリングし、単純なタスクをオープンウェイトモデルへ、複雑なタスクをフロンティアAPIへルーティングします。
- • 初期の顧客テストでは、マージされたプルリクエストあたりのコストが33%削減されました。
- • ルーターはリサーチプレビュー版であり、Claude Opus 5とGLM-5.2間のルーティングなどの構成をサポートしています。
開発者はこのルーティングレイヤーを1行のコードで統合し、ルーチン的なコーディングタスクのAPIコストを自動的に削減できます。
8. OpenAIがCodexセキュリティツールをCLIおよびSDK経由で一般公開
OpenAIは、Codexを活用したセキュリティイニシアチブを、以前発表された「Daybreak」クローズドプレビューから汎用的な開発者ツールへと移行しました。新しい「@openai/codex-security」パッケージは、開発者が自身のビルドワークフロー内で脆弱性の検出と修正を自動化できるCLIとTypeScript SDKを提供します。以前の販売制限付きエージェントプレビューとは異なり、このリリースではAPIキーを使用した非対話型のCI/CD統合と、ChatGPT認証による対話型スキャンがサポートされています。
- • Codexベースのセキュリティを「Daybreak」クローズドプレビューから公開CLIおよびSDKへ移行しました。
- • APIキーを介したCI/CDパイプラインでの自動脆弱性スキャンと修正をサポートします。
- • カスタム統合のためのプログラム可能なCodexSecurityクラスが含まれています。
- • Node.js 22+およびPython 3.10+が必要です。
このリリースにより、OpenAIのセキュリティ機能が制限されたエンタープライズプレビューからセルフサービス型の開発者ツールへと移行し、標準的なCI/CDパイプラインでの自動セキュリティ統合が可能になります。
9. Visaがエージェント型脆弱性スキャンハーネスをオープンソース化
Visaは、同社のグローバル決済インフラストラクチャのバグを調査するために開発したマルチモデルセキュリティパイプライン「Visa Vulnerability Agentic Harness」をオープンソース化しました。このハーネスは、コードの取り込み、脅威モデリング、エクスプロイトチェーンの合成など、複雑なセキュリティワークフローを自動化します。リリースに合わせて、Visaは重要インフラストラクチャ向けの12のアーキテクチャプラクティスをまとめたホワイトペーパーを公開し、自律型エージェントはセキュリティ境界を維持するために、明確でスコープが限定されたIDの下で動作しなければならないと強調しています。
- • Visa Vulnerability Agentic HarnessはGitHubでオープンソース化されており、コードの取り込み、脅威モデリング、エクスプロイト合成を管理します。
- • マルチモデルパイプラインを利用しており、Visaは当初、AnthropicのClaude Mythosモデルと組み合わせてグローバル決済ネットワークをスキャンしていました。
- • Visaは、攻撃経路の確認、修正、および修正完了の検証にかかる時間を測定する指標として「Mean Time to Adapt (MTTA)」を導入しました。
- • プロジェクトのアーキテクチャガイドラインでは、AIエージェントを厳格にスコープされた権限を持つ個別のIDとして扱うことを義務付けています。
開発者は、この実績のあるマルチモデルパイプラインを採用し、自身のコードベース内での脅威モデリングとエクスプロイトチェーンの合成を自動化できます。
10. エージェント型強化学習フレームワーク「Molt」がリリース
オープンソースコミュニティは、AIエージェントを構造化されたプログラムとして扱うように設計されたPyTorchネイティブのフレームワーク「Molt」を導入しました。Moltは、カスタムPython報酬、ツール統合、マルチモーダル環境、LLMベースの評価をネイティブサポートし、強化学習を使用してエージェントをトレーニングするための堅牢な環境を開発者に提供します。Ray、vLLM、NVIDIA AutoModel、FSDP2の高性能スタック上に構築されており、兆パラメータ規模のMixture-of-Expertsモデルまでトレーニングをスケーリングできるように設計されています。
- • Moltは、AIエージェント自体をプログラムとして扱うPyTorchネイティブのフレームワークです。
- • カスタムPython報酬、ツール使用、マルチモーダル環境、LLMジャッジをサポートしています。
- • Moltの技術スタックはRay、vLLM、NVIDIA AutoModel、FSDP2を統合しています。
- • 兆パラメータ規模のMixture-of-Expertsモデルまでトレーニングをスケーリングする能力を備えています。
開発者はこのフレームワークを使用して、カスタム報酬、ツール使用、LLMイン・ザ・ループのジャッジを備えた複雑なエージェントワークフローを構築およびトレーニングできます。
11. AgentaがオープンソースのClaude Cowork代替ツールをリリース
Agentaは、Claude Coworkのオープンソースかつセルフホスト可能な代替ツールをリリースし、開発者がAI Coworkerを構築・デプロイするための柔軟なプラットフォームを提供します。GitHubで利用可能なAgentaを使用すると、ユーザーはClaude Code、OpenAI Codex、またはローカルのセルフホストモデルなど、好みのモデルハーネスを使用して、スケジュールまたはイベントトリガーによる自動化を実行できます。AIエージェントは自然なチャット対話を通じて構成され、分離されたワークスペース、カスタムツール、ユーザーフィードバックに基づく自己改善型の構成を維持します。
- • AgentaはClaude Coworkのオープンソースかつセルフホスト可能な代替ツールであり、GitHubで利用可能です。
- • 開発者は、スケジュールまたは外部アプリのイベントに基づいてトリガーされるAI Coworkerを構築できます。
- • Claude Code、OpenAI Codex、セルフホストモデルなど、複数の実行ハーネスをサポートしています。
- • エージェントはチャットを通じて作成され、個別の指示、ツール、スキル、専用の作業フォルダを維持します。
開発者は独自のAI Coworkerをローカルで構築・ホストできるため、ベンダーロックインを回避しつつ、既存のAPIサブスクリプションやセルフホストモデルを活用できます。