1. SpaceXAIがフロンティアモデル「Grok 4.7」をリリース
SpaceXAIは、Grok 4.6の後継モデルとなるGrok 4.7をリリースしました。この新バージョンでは、500kのコンテキストウィンドウを維持しつつ、エージェントによるナレッジワークやコーディングタスクにおいて大幅なベンチマーク向上を実現しています。入力および出力の価格は100万トークンあたり2ドル/6ドルで据え置かれていますが、モデルの「xhigh」モードでは前モデルと比較して出力トークン消費量が最大125%増加するため、複雑なタスクにおけるAPIコストは上昇します。
- • Grok 4.7はGrok 4.6の後継であり、Artificial Analysis Intelligence Indexで46のスコアを達成。
- • AA-Briefcaseベンチマークにおいて、Grok 4.6と比較してエージェント性能が111ポイント向上。
- • 500kトークンのコンテキストウィンドウを維持し、基本価格は100万トークンあたり2ドル/6ドル。
- • xhighモードはGrok 4.6より125%多くの出力トークンを消費し、複雑なタスクのコストを押し上げる。
開発者はより高性能な推論・コーディングモデルを利用できるようになりますが、前モデルのGrok 4.6と比較して「xhigh」モードでのコスト増加に注意が必要です。
2. XiaomiがMiMo-V2.6-Proをリリース、V2.5-Proの後継として登場
2026年6月にリリースされたMiMo-V2.5-Proシリーズを基盤として、XiaomiはMiMo-V2.6-Proを立ち上げました。この新しい1.02兆パラメータのMixture-of-Expertsモデルは、420億のアクティブパラメータを備え、Artificial Analysis Intelligence Indexで46のスコアを達成しました。これはV2.5-Proのスコア26から大幅な性能向上を示しています。価格は入力100万トークンあたり0.435ドル、出力100万トークンあたり0.87ドルに設定されており、開発者にとって競争力のある経済性を維持しています。
- • MiMo-V2.6-Proは、420億のアクティブパラメータを持つ1.02兆パラメータのMoEモデル。
- • Artificial Analysis Intelligence Indexで46のスコアを記録し、V2.5-Proの26を上回る。
- • 価格は入力100万トークンあたり0.435ドル、出力100万トークンあたり0.87ドル。
- • 99%のキャッシュヒット割引が含まれており、開発者のコスト効率を向上させる。
開発者はMiMo-V2.5-Proのより高性能な後継モデルにアクセスできるようになり、競争力のある価格で向上したインテリジェンスを利用可能です。
3. MetaがModel APIでSegment Anything Model (SAM) 3.1をリリース
Metaは、Meta Model API上でSegment Anything Model (SAM) 3.1を正式にリリースしました。このアップデートにより、開発者は静止画および動画シーケンスの両方で、テキストプロンプトによる物体検出、セグメンテーション、追跡を実行できるようになります。低遅延と高い信頼性を確保するため、Metaはカスタム構築された推論インフラ上でSAM 3.1を提供します。APIの価格は画像1,000枚あたり2.50ドル、動画フレーム1,000枚あたり0.20ドルです。
- • MetaはMeta Model APIでSAM 3.1をリリースし、テキストプロンプトによる物体検出、セグメンテーション、追跡をサポート。
- • モデルは、特定のアーキテクチャに最適化された専用の推論インフラ上で提供される。
- • 価格は画像1,000枚あたり2.50ドル、または動画フレーム1,000枚あたり0.20ドル。
開発者は複雑なビジョンモデルをホストすることなく、管理されたAPIを通じて高度なコンピュータビジョン機能をアプリに簡単に統合できます。
4. CloudflareがPython Workersの一般提供を開始
CloudflareはPython Workersの一般提供開始を発表し、サーバーレス開発者プラットフォームにファーストクラスのPythonサポートをもたらしました。このリリースにより、開発者はJavaScriptラッパーを必要とせず、Workers AI、R2、Durable ObjectsなどのCloudflareサービスと直接やり取りするネイティブなPythonコードを作成・デプロイできます。Python WorkersはFastAPIやFlaskなどの主要なWebフレームワークに加え、OpenAI、LangChain、MCPなどの主要なAIライブラリをサポートしています。さらに、新しいソケットブリッジにより、Hyperdriveを介したリレーショナルデータベースへのシームレスな接続が可能になりました。
- • PythonがCloudflare開発者プラットフォームでファーストクラスの完全サポート言語となった。
- • Python WorkersはWorkers AI、R2、D1、Durable ObjectsなどのCloudflareサービスとネイティブに統合。
- • 組み込みコネクタを使用してFastAPI、Django、FlaskなどのASGI/WSGIフレームワークを実行可能。
- • openai、langchain、mcpなどの主要なAIライブラリが標準でサポートされている。
- • 新しいソケットブリッジにより、Hyperdriveを介してPostgreSQLおよびMySQLデータベースへの直接接続が可能。
開発者はJavaScriptのグルーコードを書くことなく、PythonベースのAIアプリケーション、FastAPIバックエンド、MCPサーバーをCloudflareに直接デプロイできるようになります。
5. Foremerge: 並列コーディングエージェントのためのローカル調整レイヤー
Foremergeは、同じコードベースで作業する並列コーディングエージェントを管理するために設計された、オープンソースのローカル調整レイヤーとしてリリースされました。Rustバイナリとして構築されたForemergeは、CLIと18のツールを備えたMCPサーバーを提供し、Claude Code、Codex、Cursorとシームレスに統合します。git共通ディレクトリ内の共有SQLiteデータベースを利用することで、このツールはエージェントの操作とスコープを追跡し、git履歴を変更したり高価なLLMベースの判定に頼ったりすることなく、意図の競合を発生前に決定論的に検出します。
- • Foremergeは、並列コーディングエージェント間での意図した操作とスコープを追跡するローカル調整レイヤー。
- • Rustバイナリとして実装され、CLIと18のツールを含むMCPサーバーを備えている。
- • gitおよびワークツリーの上位で動作し、git共通ディレクトリ内の共有SQLiteファイルを使用してgit履歴の変更を回避する。
- • 競合検出は完全に決定論的であり、LLM判定ではなく宣言された操作に基づいている。
- • Claude Code、Codex、Cursorと互換性があり、最大98個の並列エージェントでのテスト実績がある。
複数の並列コーディングエージェントを実行する開発者は、高価なLLM判定に頼ることなく、競合するコード変更を防止できます。
6. AX: 自律エージェントのための高スループットな宣言型オーケストレーター
AXは、クラスター内で数十億の自律エージェントワークロードを管理・スケーリングするために設計された、オープンソースの高スループットオーケストレーターとして導入されました。Agent Substrate上で動作するAXは、エージェントデプロイメントにKubernetesのような宣言型の体験をもたらします。開発者はワークスペースとゲートウェイの仕様を使用してタスクを定義し、AXはそれらのエージェントを大規模かつ安全に実行するために必要なサンドボックス化、配線、ネットワークフェンスを自動的に処理します。
- • AXは、大規模な自律エージェントワークロードを実行するために構築された高スループットな宣言型オーケストレーター。
- • Agent Substrate上で動作し、Kubernetesのようなユーザー体験を提供する。
- • ユーザー定義のワークスペースおよびゲートウェイ仕様に基づいて、エージェントタスクのサンドボックス化、配線、ネットワークフェンスを行う。
開発者は、使い慣れた宣言型のワークスペースおよびゲートウェイ仕様を使用して、大規模なエージェントワークロードをデプロイ、サンドボックス化、スケーリングできます。
7. AlibabaのQwenチームがエージェントサンドボックス「RecreationWorld」をリリース
AlibabaのQwenチームは、Hugging Faceでホストされる専門的なサンドボックス環境「RecreationWorld」をリリースしました。ハイブリッドなコンピュータ使用エージェント向けに設計されたRecreationWorldは、自律エージェントが実際のアプリケーションと対話し、複雑なワークフローを実行し、自身のビルドを視覚的に検証できる5つのプラットフォーム環境を提供します。このリリースにより、開発者はGUIベースのエージェントの挙動をベンチマークし、洗練させるための標準化された安全な環境を利用できます。
- • RecreationWorldは、ハイブリッドなコンピュータ使用エージェント専用に設計された5つのプラットフォームを備えたサンドボックス。
- • エージェントが実際のアプリケーションを探索し、タスクを実行し、ビルドを視覚的に検証できる。
- • AlibabaのQwenチームによってリリースされ、Hugging Faceでホストされている。
開発者は、標準化されたサンドボックス内で、複数のプラットフォームにわたるコンピュータ使用エージェントを安全にテストし、視覚的に検証できます。
8. Haloフレームワークがオープンソースモデルのポストトレーニングを加速
オープンソースモデルのファインチューニングとアライメントを最適化することを目的とした、Haloと呼ばれる新しいポストトレーニングフレームワークが導入されました。Haloは、Hugging Faceの標準TRLライブラリの最大2.8倍のスループットを実現し、同時にピークメモリ消費量を削減します。開発者にとって重要な点として、Haloフレームワークを使用してトレーニングされたモデルは、ネイティブなHugging Face形式との完全な互換性を維持しており、既存のパイプラインへのシームレスなデプロイが可能です。
- • Haloは、オープンソースモデルのポストトレーニング用に設計された新しいフレームワーク。
- • 標準のTRL(Transformer Reinforcement Learning)の最大2.8倍のスループットを実現。
- • トレーニング実行中のピークメモリ使用量が標準のTRLより少ない。
- • Haloで処理されたモデルは、ネイティブなHugging Face形式を維持する。
ローカルモデルをファインチューニングする開発者は、ポストトレーニングパイプラインを大幅に高速化し、ハードウェアコストを削減できます。
9. ZCodeがスタックをオープンソース化し、データアップロード事案を受けてセキュリティ脆弱性を修正
不正なワークスペースアップロードに関する最近のセキュリティ調査結果を受けて、ZCodeはオープンソースモデルへ移行し、デスクトップアプリケーション、Webワークスペース、バックエンド、Agent CLI、ランタイムをGitHubで公開しました。これに伴うv3.14.0アップデートでは、Repo Wiki機能を削除し、ローカルリポジトリのスナップショットの自動アップロードを無効にすることで、報告された脆弱性に対処しています。さらに、CAICTおよびNSFOCUSによる第三者監査により、ZCodeのクラウドストレージバケットが削除され、データゼロ状態にあることが確認され、モデルトレーニングのためにユーザーコードが保持されていないことが証明されました。
- • ZCodeはデスクトップアプリ、Webワークスペース、バックエンド、Agent CLI、ランタイムをGitHubでオープンソース化。
- • v3.14.0リリースでは、Repo Wikiの削除とローカルリポジトリのスナップショットアップロードの無効化によりセキュリティ問題に対処。
- • CAICTおよびNSFOCUSによる独立監査により、zcode-prod Alibaba Cloud OSSバケットが削除され、検証済みのデータゼロ状態にあることを確認。
- • ユーザーコードデータが保持されたり、モデルトレーニングに使用されたりしていないことを会社が確認。
- • ZCodeは、開発者向けの報酬を伴う継続的な脆弱性報告プログラムを確立している。
このアップデートは、以前特定されたデータプライバシーリスクに対する検証済みの修正を施したオープンソースのセルフホスト環境へ移行することで、開発者がZCodeを安全に使い続けるための道筋を提供します。
10. MetaがMuse AIプラットフォームをサードパーティコネクタに開放
Metaは、今月初めに立ち上げたMuseコンシューマーAIエージェントプラットフォームを拡張し、カスタムAPIコネクタを構築するための開発者アクセスを開放しました。開発者は独自のサービスをMuseエコシステムに直接統合できるようになり、Metaが基盤となるエージェントオーケストレーションとコンテキスト管理を処理します。すべての提出物は、セキュリティ、機能性、および法的コンプライアンスをカバーする審査プロセスの対象となります。
- • MetaはMuseプラットフォーム向けのカスタムAPIコネクタの提出を受け付けている。
- • 開発者がAPIを提供し、Museがエージェントオーケストレーションとコンテキストを管理する。
- • コネクタは、ユーザーに提供される前に機能、セキュリティ、および法的審査に合格する必要がある。
- • 承認された統合は、Museエコシステム内で特集される可能性がある。
この開発により、サードパーティサービスがMuseアシスタントに直接統合できるようになり、プラットフォームの機能をMetaの初期機能セットを超えて拡張できます。
11. Kev: ローカル推論のためのQwen3.5ベースの小型意思決定モデル
Kevは、ランク16のLoRAアダプターとポインターヘッドを使用してQwen3.5アーキテクチャ上に構築された、Apache-2.0ライセンスの小型意思決定モデルファミリーを導入しました。0.8B、4B、9Bのサイズで提供されるこれらのモデルは、イエス/ノー、多肢選択、評価質問などの構造化されたタスクに最適化されています。モデルはCUDA、ROCM、Apple Silicon上でローカルに実行され、大型のバリエーションも32GBのMacに容易に収まります。KevはTypeSafeのSystem Oneとの箱から出した状態での互換性を備えており、開発者はTypeSafe Python SDKをローカルのKevサーバーに直接向けることができます。
- • KevはQwen3.5ベースの小型意思決定モデルファミリーで、0.8B、4B、9Bのパラメータサイズで利用可能。
- • Apache-2.0ライセンスの下で、構造化されたイエス/ノー、多肢選択、評価質問タイプをサポート。
- • 4Bおよび9BバージョンはCUDA、ROCM、Apple Siliconで動作し、bf16精度を使用して32GBのMacに収まる。
- • ローカルKevサーバーはTypeSafeのSystem Oneと完全な互換性があり、TypeSafe Python SDKとの直接統合が可能。
- • モデルは、単純なJSONL形式と--init_fromフラグを使用して、ドメイン固有のデータでファインチューニング可能。
開発者は、Apple SiliconやCUDA上で高速かつ構造化された意思決定モデルをローカルで実行でき、TypeSafe SDKとの完全な互換性を利用できます。
12. 低RAM環境でのエージェントコーディング向け「Sharp-Spark-X2.5-4B-GGUF」リリース
ローカルエージェントコーディングを低スペックハードウェアにもたらすため、新しい量子化モデル「Sharp-Spark-X2.5-4B-GGUF」がHugging Faceでリリースされました。非営利のボランティア活動として開発されたこのモデルは、小型GPUや16GB以下のRAMを搭載したデバイス向けに特別に調整されています。量子化プロセスでは、コーディングおよびサイバーセキュリティタスク用に重み付けされたカスタム重要度行列を利用し、標準的な数学的忠実度メトリクスよりも実世界のSWE-bench-Liveパフォーマンスを優先しています。
- • Sharp-Spark-X2.5-4B-GGUFは、低スペックハードウェアでのエージェントコーディング用に設計された量子化モデル。
- • 量子化プロセスでは、エージェントコーディングとサイバーセキュリティ用に調整されたカスタム重要度行列を使用。
- • 従来のKLダイバージェンスメトリクスよりもSWE-bench-Liveパフォーマンスを優先。
- • 16GB以下のRAMを搭載したスマートフォンや古いノートパソコンで動作するように設計されている。
- • 非営利のボランティア活動としてHugging Faceで公開されている。
ハードウェアが制限されている開発者でも、16GB以下のRAMを搭載したデバイスで高性能なローカルコーディングエージェントを実行できます。
13. phantom-kv: ホットスワップ可能なKVキャッシュ注入によるLLMの検閲解除
phantom-kvと呼ばれる新しいオープンソースプロジェクトは、大規模言語モデルの基礎となる重みを変更せずにその挙動を修正する新しい手法を導入しました。オフラインでトレーニングされた18MBのキー/値テンソルの小さなバンクをモデルのKVキャッシュに直接注入することで、phantom-kvは有害なプロンプトに対する拒否行動を抑制しつつ、無害なプロンプトに対する標準的な挙動を維持できます。このアプローチにより、開発者は異なるキャッシュスロットを使用して、能力モードをその場でホットスワップできます。非常に柔軟ですが、8Bモデルの監査では、キャッシュ移植は長時間のセッションで2〜4kトークンの半減期を持つことが明らかになり、効果を維持するには定期的な再注入が必要となります。
- • phantom-kvは、学習済みのキー/値テンソルバンク(約18MB)をLLMのKVキャッシュにロードする拒否削除システム。
- • ベースモデルの重みを変更したりエンジンフックを必要としたりせず、アンロード時にはモデルがバイト単位で同一になる。
- • 異なるキャッシュスロットを利用することで、ホットスワップ可能な能力モード(防御的または攻撃的など)をサポート。
- • 8Bモデルの監査では、長時間のセッションで2〜4kトークンの半減期が示され、定期的な再注入で緩和可能。
- • 監査では、意味的な拒否が言い換えとして残る可能性があるため、語彙的な拒否抑制メトリクスがコンプライアンスを過大評価する可能性があると指摘。
開発者は、複数のファインチューニングされた重みをホストするオーバーヘッドなしで、ローカルモデルの安全性と能力モードを動的に切り替えることができます。
14. Apple M5 Ultra Mac StudioがローカルAIパフォーマンスを大幅に向上
M5 Ultra Mac Studioの新しいレビューでは、ローカルAIエージェントや複雑なワークフローを実行するための最高のワークステーションとしての地位が強調されています。2つのM5 Maxチップを接続するクアッドダイアーキテクチャ上に構築されたこのマシンは、ニューラルアクセラレーターを備えた80コアGPUと、1.2 TB/sという巨大なメモリ帯域幅を特徴としています。oMLXバックエンドを使用した実用的なテストでは、M5 UltraはM3 Ultraと比較してトークン生成で70%の高速化、プロンプト処理で150%の改善を示し、従来のグラフィックスカードのVRAM制約なしでQwen3.8-Flash-Nextのようなローカルモデルを実行するのに非常に効果的です。
- • M5 Ultra Mac Studioはニューラルアクセラレーターを備えた80コアGPUを搭載し、M3 Ultraの最大4.5倍のAI計算能力を発揮。
- • メモリ帯域幅はM3 Ultraの819 GB/sから50%増加し、1.2 TB/sに達した。
- • 実世界のテストでは、M5 UltraはM3 Ultraよりもトークン生成で70%、プロンプト処理で150%高速。
- • Qwen3.8-Flash-Nextを搭載したOpen MinisやHermes Agentのようなローカルエージェントを正常に実行。
- • NVIDIA RTX 5090の方が生の計算能力は高いが、Mac StudioのユニファイドメモリはコンシューマーGPUの32GB VRAM制限を回避できる。
ローカルAIエージェントや大規模なドキュメント分析を実行する開発者は、VRAM制限のあるGPUに代わる非常に高性能なハードウェアを手に入れることができます。
15. Hugging FaceがRustでTokenizers v1をリリース
Hugging Faceは、人気のトークナイザーライブラリのバージョン1を正式にリリースしました。Rustで書き直されたv1リリースは、パフォーマンスと効率に焦点を当てており、マルチスレッドスケーリングと大幅に削減されたパッケージサイズを実現しています。このライブラリは、複数の言語にわたって堅牢で高速なトークナイゼーションを提供し、ローカル推論エンジンやカスタムモデルパイプラインにとって高度に最適化された依存関係となっています。
- • Hugging Faceは、Rustベースのトークナイザーライブラリのバージョン1を正式にリリース。
- • アップデートにより、マルチスレッドスケーリングと最小限のパッケージフットプリントが導入された。
- • ライブラリには、複数の言語に対する堅牢なサポートが含まれている。
ローカル推論パイプラインやカスタムトレーニングワークフローを構築する開発者は、複数の言語にわたるより高速で高度に最適化されたトークナイゼーションの恩恵を受けられます。