1. OpenAI、GPT-5.6モデルファミリーの限定プレビューを開始
GPT-5.6ファミリーの初期発表に基づき、OpenAIは政府承認を受けたパートナー向けにモデルの限定プレビューを開始しました。このシリーズには、フラッグシップモデルのSol、バランス型のTerra、手頃な価格のLunaが含まれます。プレビューでは、サブエージェント駆動の推論モード、明示的なプロンプトキャッシングのブレークポイント、特定の価格設定などの新機能が導入されており、今後数週間以内に一般公開される予定です。
- • OpenAIは、Sol、Terra、Lunaモデルを特徴とするGPT-5.6ファミリーの限定プレビューを開始しました。
- • プレビューは現在政府承認を受けたパートナーに限定されており、今後数週間以内に一般公開される予定です。
- • GPT-5.6 Solは、「max」推論と「ultra」サブエージェントオーケストレーションを導入しています。
- • 価格は100万トークンあたり、Solが5.00ドル/30.00ドル、Terraが2.50ドル/15.00ドル、Lunaが1.00ドル/6.00ドルに設定されています。
- • 新しい開発者向け機能には、30分の最小キャッシュ寿命を持つ明示的なプロンプトキャッシングのブレークポイントが含まれます。
開発者は、GPT-5.6モデルの階層、具体的な価格設定、推論能力、新しいプロンプトキャッシング機能などの詳細を、一般公開に先駆けて把握できるようになりました。
2. 米国政府、Claude Mythos 5の輸出制限を解除
米国政府は、緊急指令により世界的にオフラインを余儀なくされていたAnthropicのAIモデル「Claude Mythos 5」に対する輸出制限を解除しました。新たな取り決めの下、100以上の承認された米国企業および政府機関は、外国人従業員のために輸出ライセンスを取得することなく、同システムにアクセスできるようになります。Claude Mythos 5はこれらの特定の組織に対して許可されましたが、Anthropicの「Fable 5」モデルについては、安全ガードレールに関する交渉が続いているため、引き続き制限が適用されます。
- • 米国政府はAnthropicのClaude Mythos 5に対する制限を解除し、100以上の米国機関へのリリースを承認しました。
- • この進展は、6月13日に報告された、潜在的な脱獄(ジェイルブレイク)への懸念に起因する世界的な停止措置を覆すものです。
- • 新しい取り決めにより、特定の組織や外国人従業員に転送する際のClaude Mythos 5の輸出ライセンス要件が撤廃されました。
- • AnthropicのFable 5モデルは、リリースに関する議論が続いている間、引き続きブロックされたままとなります。
米国政府が以前の輸出ライセンス要件を撤廃したことで、承認された米国の機関の開発者はClaude Mythos 5の利用を再開できるようになりました。
3. Nemotron-3-Super-120B、504Kトークンで完全なリコールを達成
400Kコンテキストでパフォーマンスの低下が指摘されていた以前のベンチマークに基づき、Nemotron-3-Super-120B-A12Bモデルは、504,482トークンまで「干し草の中の針」リコールで完全な精度を実証しました。ハイブリッドMamba2、周期アテンション、および定数サイズのリカレント状態を持つMoEアーキテクチャを活用することで、このモデルは、長いコンテキスト長で以前の純粋なアテンションモデルに見られたVRAMの肥大化やパフォーマンスの低下を回避しています。
- • Nemotron-3-Super-120B-A12Bは、504,482トークンまで正確な「干し草の中の針」リコールを達成しました。
- • このモデルは、ハイブリッドMamba2/MoEアーキテクチャを使用して定数サイズのリカレント状態を維持し、以前の400Kコンテキストテストで見られたパフォーマンス低下を防ぎます。
- • 4枚のRTX 3090 GPUでのテストでは、504Kコンテキストで毎秒23トークンの安定したデコード速度を示しています。
- • このアップデートにより、以前報告された400Kコンテキスト制限を超えて、モデルの実用性が大幅に拡張されました。
この開発は、初期のテストで特定された主要なボトルネックに対処するものであり、開発者はコンシューマーハードウェア上で、より長いコンテキストウィンドウにおいて高い精度と実用的なデコード速度を維持できるようになります。
4. NVIDIA、Blackwell GPU向けにNVFP4量子化されたGLM-5.2をリリース
NVIDIAは、Blackwell GPUアーキテクチャをターゲットにしたGLM-5.2モデルの最適化バージョンをHugging Faceで公開しました。これは、Zhipu AIによる7530億パラメータのMixture-of-Expertsモデルの発表に続くものです。モデルをNVFP4形式に量子化することで、NVIDIAは元のFP8精度とほぼ同等の精度を維持しながら、Blackwellハードウェア上での高性能なローカル実行を可能にしました。
- • NVIDIAは、GLM-5.2モデルのNVFP4量子化バージョンをHugging Faceでリリースしました。
- • このモデルは、100万トークンのコンテキストウィンドウを持つ7530億パラメータのMixture-of-Expertsアーキテクチャです。
- • NVFP4形式はBlackwell GPU向けに特別に最適化されており、高性能なローカル実行を提供します。
- • 量子化されたモデルは、元のFP8精度とほぼ同等の精度レベルを維持しています。
開発者は、最適化されたメモリ使用量とFP8に近い精度で、753BパラメータのGLM-5.2モデルをBlackwellハードウェア上にデプロイできるようになりました。
5. DeepReinforce、Ornith-2.0でOrnithコーディングモデルファミリーを拡大
昨日のOrnith-1.0コーディングモデルのリリースに基づき、DeepReinforceはOrnith-2.0ファミリーでラインナップを拡大しました。Ornith-1.0がエージェント的なコーディングタスクに焦点を当てていたのに対し、新しいOrnith-2.0モデルは強化学習(RL)の足場(スキャフォールド)を記述するために特別にトレーニングされています。両モデルファミリーはGemma 4およびQwen 3.5を基盤として構築されており、Hugging Faceで利用可能です。
- • DeepReinforceは、Ornith-2.0のリリースにより、オープンソースのコーディングモデルスイートを拡大しました。
- • Ornith-2.0は、強化学習(RL)の足場を記述するために特別に最適化されています。
- • 昨日リリースされたOrnith-1.0モデルと同様に、新しいモデルはGemma 4およびQwen 3.5の基盤アーキテクチャ上に構築されています。
- • 新しいリリースのモデルウェイトと技術ドキュメントは、Hugging Faceで入手可能です。
開発者は、より幅広い専門的なコーディングモデルにアクセスできるようになり、新しいOrnith-2.0は特に強化学習の足場作成をターゲットにしています。
6. Vercel、ゼロオーバーヘッド実行ループを備えたAI SDK 7をリリース
Vercelは、マルチステップツールのオーケストレーションとエージェント的なUIストリーミングの合理化に焦点を当てたAI SDK 7を立ち上げました。このアップデートでは、複雑なツール呼び出しを簡素化し、エージェント的なUI状態をフロントエンドフレームワークに直接ストリーミングしやすくするゼロオーバーヘッド実行ループが導入されています。さらに、新しい統合テレメトリレイヤーがサーバーレスコンピューティングランタイムと直接統合され、開発者はトークン使用量、モデル選択、ツール実行のレイテンシに関する詳細なトレーシングの可視性を得ることができます。
- • Vercelは、ストリームとツールのオーケストレーションを強化するためにAI SDK 7をリリースしました。
- • このアップデートでは、マルチステップツール呼び出しを簡素化するためのゼロオーバーヘッド実行ループが導入されています。
- • エージェント的なUI状態をフロントエンドフレームワークに直接ストリーミングするためのサポートが追加されました。
- • 統合テレメトリレイヤーがサーバーレスコンピューティングランタイムと統合され、トークン使用量、モデルの選択、ツール実行のレイテンシを追跡します。
開発者は、より応答性の高いエージェント的なUIを構築し、サーバーレス環境におけるトークン使用量、モデルの選択、ツールのレイテンシを簡単に追跡できるようになります。
7. Hugging Face、単一コマンドでのvLLMデプロイを開始
Hugging Faceは、開発者が単一のコマンドでプライベートなOpenAI互換vLLMエンドポイントを立ち上げることができる簡素化されたデプロイワークフローを導入しました。Hugging Faceの秒単位課金サーバーレスJobsインフラストラクチャ上で動作するこのサービスは、永続的なGPUインスタンスを管理することなく、オープンウェイトモデルをホストするための非常に費用対効果が高く、摩擦の少ない方法を提供します。
- • Hugging Faceは、開発者向けの単一コマンドデプロイワークフローを開始しました。
- • このワークフローにより、プライベートなOpenAI互換vLLMエンドポイントの作成が可能になります。
- • このサービスは、Hugging Faceの秒単位課金サーバーレスJobsインフラストラクチャ上で実行されます。
開発者は、秒単位の課金で、プライベートな自動スケーリングvLLM推論エンドポイントを即座に立ち上げることができます。
8. Weave、コーディングエージェント向けのソース利用可能なモデルルーターをリリース
Weaveは、Claude Code、Codex、Cursorなどのコーディングエージェントの直前に配置するように設計されたインテリジェントなモデルルーターをリリースしました。標準的なAnthropicまたはOpenAIエンドポイントとして動作するこのルーターは、エージェントのトレースでトレーニングされたRLモデルを使用してタスクの複雑さを分析します。日常的なタスクはDeepSeek v4、GLM 5.2、Kimi K2.6などのより高速で安価なモデルに自動的にルーティングし、複雑なリクエストにはOpus 4.8やGPT 5.5などの高価なフロンティアモデルを割り当てます。Weaveは、出力品質を損なうことなくトークンコストを40%削減したと報告しています。このツールはElastic License 2.0の下でソースが利用可能です。
- • Weaveは、Claude Code、Codex、Cursorと統合するように設計されたモデルルーターを開発しました。
- • ルーターはAnthropic/OpenAIエンドポイントとして機能し、タスクの複雑さに基づいてリクエストを振り分けます。
- • 日常的なタスクを安価なモデル(DeepSeek v4、GLM 5.2、Kimi K2.6)に、複雑なタスクをフロンティアモデル(Opus 4.8、GPT 5.5)にルーティングします。
- • ルーティングロジックは、数万件のエージェントトレースでトレーニングされたRLモデルによって駆動されます。
- • Weaveは、品質や速度を損なうことなく、内部的にトークンコストを40%削減したと報告しました。
- • ルーターは、セルフホスト用またはホスト型サービスとして、Elastic License 2.0の下でソースが利用可能です。
開発者は、日常的なコーディングタスクを安価なモデルにルーティングし、複雑なクエリにはフロンティアモデルを予約することで、LLM APIコストを最大40%削減できます。
9. MRAgentメモリフレームワーク、トークン消費量を劇的に削減
シンガポール国立大学の研究者は、AIエージェントにおける長期的な推論を最適化するために設計されたオープンソースフレームワーク「MRAgent」を導入しました。静的な検索に頼るのではなく、MRAgentはCue-Tag-Contentメカニズムを使用してメモリを多層連想グラフとして整理し、LLMが動的にメモリを再構築して無関係な枝を剪定できるようにします。LongMemEvalベンチマークテストでは、MRAgentはサンプルあたりのプロンプトトークン消費量を118kトークンにまで削減しました(LangMemが消費した326万トークンと比較)。また、実行ランタイムも半分に短縮されました。コードは現在GitHubで入手可能です。
- • シンガポール国立大学の研究者は、AIエージェントにおける長期的な推論のためのフレームワーク「MRAgent」を開発しました。
- • MRAgentは、Cue-Tag-Content連想グラフを使用した動的メモリ再構築に静的検索を置き換えます。
- • このフレームワークは、LongMemEvalにおいてサンプルあたりのプロンプトトークン消費量を118kに削減しました(LangMemの326万と比較)。
- • 実行ランタイムを586秒に短縮し、A-MEMベースラインの1,122秒の約半分となりました。
- • 研究者はMRAgentのコードをGitHubで公開しました。
開発者は、深いコンテキストを維持しながら、APIトークンコストと実行レイテンシを劇的に削減する長期的なエージェントを構築できます。
10. Liquid AI、Opus 4.8フレームワークでWebGPUサポートを正式化
Liquid AIは、エージェント的なWebGPUカーネル最適化フレームワークであるOpus 4.8を正式にリリースしました。このリリースにより、以前コミュニティのデモンストレーションで紹介されたLFM2.5-230Mモデルのブラウザ内推論機能が正式なものとなりました。このフレームワークにより、モデルはWebブラウザ内で最大毎秒1,400トークンの速度でローカル実行可能となり、開発者が高速でゼロレイテンシのローカルモデルをクライアント側のWebアプリケーションに直接デプロイするためのサポートされたパスを提供します。
- • Liquid AIは、公式のWebGPUカーネル最適化フレームワークであるOpus 4.8をリリースしました。
- • このフレームワークは、LFM2.5-230Mモデルのブラウザ内推論機能を正式なものにします。
- • 以前報告された毎秒1,400トークンの推論速度を維持しています。
開発者は、LFM2.5-230Mモデルに対して、高速でローカルなブラウザベースの推論をデプロイするためのLiquid AIからの公式でサポートされたフレームワークを利用できるようになりました。
11. Apple、Appleシリコン向け「container」CLIツールをオープンソース化
Appleは、Swiftで記述されたApache 2.0ライセンスのコマンドラインツール「container」をオープンソース化しました。これは、LinuxコンテナをAppleシリコン上で軽量な仮想マシンとして実行するものです。セキュリティ、プライバシー、パフォーマンスを最大化するため、このツールは単一の共有VMに依存するのではなく、各コンテナに対して個別の分離されたVMを起動します。ランタイムはVirtualizationやKeychainサービスなどのmacOSフレームワークと直接統合されており、バージョン1.0.0では、永続的なコンテナマシン、TOML構成、自動化を容易にする構造化されたJSON/YAML/TOML出力が追加されています。
- • Appleは、LinuxコンテナをAppleシリコン上で軽量VMとして実行するためのオープンソースSwiftコマンドラインツール「container」をリリースしました。
- • このツールはApache 2.0ライセンスであり、OCI互換のコンテナイメージをサポートしています。
- • 共有VMツールとは異なり、セキュリティ、プライバシー、パフォーマンスを向上させるために、各コンテナに対して個別の軽量仮想マシンを起動します。
- • このツールはAppleシリコンを必要とし、完全な仮想化とネットワークサポートのためにmacOS 26を推奨しています。
- • バージョン1.0.0では、永続的なコンテナマシン、TOML構成、自動化のための構造化されたJSON、YAML、TOML出力が導入されています。
開発者は、エージェント実行やローカルサービスのために、macOS上で直接、安全で分離されたローカルサンドボックスを実行できます。
12. Alibaba、Qwen-Image-Agentフレームワークを導入
Alibabaは、現実世界の画像生成ワークフローを強化するために設計されたエージェントフレームワーク「Qwen-Image-Agent」を導入しました。計画、推論、検索、メモリ機能を組み込むことで、このフレームワークはコンテキストを自動的に収集および構造化してテキストから画像へのモデルをガイドし、より正確でコンテキストを認識した画像出力を実現します。
- • Alibabaは、現実世界の画像生成のためのエージェントフレームワーク「Qwen-Image-Agent」を導入しました。
- • このフレームワークは、テキストから画像へのモデルにコンテキストを提供するために、情報を計画、推論、検索、記憶します。
開発者は、エージェント的な計画とメモリを活用して出力品質を向上させる、より洗練された画像生成パイプラインを構築できます。
13. AWS、Nvidiaコンピューティングワークロードの価格を20%引き上げ
Amazon Web Servicesは、AIワークロードレンタルサービスの20%の価格引き上げを発表し、Nvidiaコンピューティングインスタンスのレンタルコストを直接引き上げました。金曜日に発表されたこの価格改定は、モデルのトレーニング、ファインチューニング、または大量の推論ワークロードのためにAWS GPUインスタンスに依存している開発者に直ちに影響を与えます。
- • Amazon Web Servicesは、AIワークロードレンタルサービスの20%の価格引き上げを発表しました。
- • この価格改定は、特にNvidiaコンピューティングインスタンスに影響を与えます。
- • この発表は金曜日に行われました。
AWS Nvidiaインスタンス上でモデルをホストまたはファインチューニングしている開発者は、コンピューティング料金が直接20%増加することになります。