1. Kimi K3オープンモデル、Claudeと同等のコーディング性能を低コストで実現
Kimi K3オープンモデルがArtificial Analysisのリーダーボードに登場し、Claudeに匹敵するコーディング能力とトークン効率を実証しました。KimiのAPI料金は入力100万トークンあたり3ドル、出力100万トークンあたり15ドルと非常に競争力が高く、Claudeのそれぞれ10ドル、50ドルという料金設定を大幅に下回っています。さらに、MITライセンスでリリースされたGLM 5.2などのオープンウェイトモデルもサイバーセキュリティのベンチマークで強力な性能を示しており、制限付きモデルが回答を拒否したタスクにおいてClaudeを上回りました。一方、OpenAIは主力モデルであるGPT-5.6を月額20ドルの標準サブスクリプションプランに統合しました。
- • Kimi K3のAPI料金は入力100万トークンあたり3ドル、出力100万トークンあたり15ドルで、Claudeの10ドルおよび50ドルという料金設定と比較して安価です。
- • このオープンモデルはClaudeに匹敵するコーディング性能とトークン効率を実現しており、Artificial Analysisのリーダーボードにも掲載されています。
- • MITライセンスでリリースされたオープンウェイトモデルのGLM 5.2は、制限付きモデルが回答を拒否したタスクを完了させることで、サイバーセキュリティのベンチマークでClaudeを上回りました。
- • Kimiは月額19ドルからの有料プランを提供しており、39ドルのコーディング向けティアも用意されています。
開発者は、Claudeよりも大幅に低いAPI料金で、最先端クラスのコーディング能力を持つオープンモデルを利用できるようになります。
2. OpenPangu-2.0-Flashがローカルデプロイ向けGGUF形式で利用可能に
92B-A6B OpenPangu-2.0-Flashモデルの初期オープンソースリリースに基づき、llama.cppのik_llamaフォークのユーザー向けにGGUFバージョンが提供されました。このアップデートにより、開発者は最適化されたGGUF形式を使用して、512Kコンテキストモデルをローカルで実行できるようになります。
- • OpenPangu-2.0-FlashがGGUF形式で利用可能になりました。
- • GGUFリリースはllama.cppのik_llamaフォークと互換性があります。
- • これにより、512Kコンテキストモデルのローカルデプロイが可能になります。
このリリースは、初期のモデルウェイトと実用的なローカル実行の間のギャップを埋めるものであり、開発者が高コンテキストモデルをローカルの推論パイプラインに統合することを可能にします。
3. AISIアップデート:オープンウェイトモデルがサイバー能力の差を4〜7ヶ月に短縮
AIのサイバー能力の急速な加速に関する2026年5月の報告書に基づき、英国AI安全研究所(AISI)はオープンウェイトモデルに焦点を当てた新しい評価データを公開しました。AISIは以前、最先端モデルにおける能力の急速な倍増を特定していましたが、今回の評価では、GLM-5.2のようなオープンウェイトモデルが最先端モデルとの差をわずか4〜7ヶ月にまで縮めていることが示されました。これは2025年に観測された6〜10ヶ月の差から大幅な改善です。AISIは、これらのモデルがクローズドなAPIに代わる費用対効果の高い選択肢を提供する一方で、現時点では最先端システムに見られるようなデプロイ時の安全対策が欠けていると指摘しました。同研究所は、2026年7月末に予定されているKimi K3のリリース後、評価対象を拡大する計画です。
- • GLM-5.2は現在最もサイバー能力の高いオープンウェイトモデルであり、最先端モデルとの差は4〜7ヶ月です。
- • 性能差は2025年に測定された6〜10ヶ月の遅れから縮小しています。
- • GLM-5.2やDeepSeek V4-Proのようなオープンウェイトモデルは、クローズドウェイトの代替品と比較して大幅なコスト上の利点を提供します。
- • AISIは今後、近日リリース予定のKimi K3モデルを含め、評価シリーズを継続する予定です。
オープンウェイトモデルとクローズドウェイトモデルの差が縮まっていることは、開発者が複雑な技術的タスクにおいて、アクセスしやすく費用対効果の高いモデルにますます依存できることを示唆していますが、組み込みの安全監視機能の欠如は依然として重要な検討事項です。
4. Google Cloudが「Always-On Memory Agent」のリファレンス実装を公開
Google Cloudは、Google Agent Development Kit (ADK) とGemini 3.1 Flash-Liteで構築されたリファレンス実装「Always-On Memory Agent」を公開しました。このリリースは、2026年7月8日にGemini Managed Agentsフレームワークに導入されたバックグラウンド実行機能を活用しています。従来のベクトルデータベースに依存するのではなく、構造化されたメモリ保存のためにSQLiteを使用します。エージェントは24時間365日のバックグラウンドプロセスとして動作し、オーケストレーターを使用してIngestAgent、ConsolidateAgent、QueryAgentという3つの専門サブエージェントを管理します。ConsolidateAgentは30分タイマーで実行され、メモリ間の接続を統合します。また、システムは統合のためにポート8888でHTTP APIを公開します。
- • Always-On Memory Agentは、Google Agent Development Kit (ADK) とGemini 3.1 Flash-Liteを使用して構築されています。
- • Gemini Managed Agentsフレームワークのバックグラウンド実行機能を活用しています。
- • 従来のベクトルデータベースや埋め込みを回避し、構造化されたメモリをSQLiteに保存します。
- • オーケストレーターがIngestAgent、ConsolidateAgent、QueryAgentの3つの専門サブエージェントを管理します。
- • ConsolidateAgentは30分タイマーで実行され、保存されたメモリ間の接続や洞察を継続的に統合します。
- • エージェントは統合と管理を容易にするため、ポート8888でHTTP APIを公開しています。
開発者は、以前発表されたバックグラウンド実行フレームワークを使用して、進化する構造化された長期記憶を持つエージェントを構築するための具体的なリファレンス実装を利用できるようになりました。
5. NVIDIA DeepStream 9.1、Vision AIパイプライン向けの「エージェントスキル」を導入
NVIDIAは、AIベースの動画および画像理解のためのストリーミング分析ツールキットのアップデートであるDeepStream 9.1をリリースしました。このリリースでは、コーディングエージェントが自然言語プロンプトを使用してマルチカメラビジョンパイプラインを構築できる13のエージェントスキルが導入されました。主な機能には、複数のカメラからの検出結果を共有3D座標系に投影して一貫したオブジェクトIDを維持する「Multi-View 3D Tracking (MV3DT)」や、既存のビデオストリームからカメラキャリブレーションを自動化する「AutoMagicCalib (AMC)」が含まれます。プラットフォームは現在、CC-BY-4.0およびApache-2.0ライセンスの下で統一されたオープンソースGitHubリポジトリでホストされており、Jetson OrinおよびThorエッジデバイス上のNVIDIA JetPack 7.2のサポートが追加されました。
- • DeepStream 9.1では、自然言語プロンプトを使用してマルチカメラビジョンパイプラインを構築するための13のエージェントスキルが導入されました。
- • 新しいMulti-View 3D Tracking (MV3DT) は、複数のカメラからの検出結果を共有3D座標系に投影し、一貫したオブジェクトIDを維持します。
- • AutoMagicCalib (AMC) は、ビデオストリームから直接パラメータを推定することでカメラキャリブレーションを自動化し、手動のチェッカーボードを不要にします。
- • プラットフォームは現在、CC-BY-4.0およびApache-2.0ライセンスの下で統一されたオープンソースGitHubリポジトリでホストされています。
- • このリリースでは、Jetson OrinおよびThorエッジデバイス上のNVIDIA JetPack 7.2のサポートが追加されました。
開発者は、手動でパイプラインコードを書く代わりに、自然言語を使用して複雑なマルチカメラコンピュータビジョンアプリケーションを構築し、カメラキャリブレーションを自動化できます。
6. Claude Code向け「常時稼働Mac」セットアップの詳細ガイドが公開
予備のMacを、コンピュータ使用機能が有効なClaude Codeのための常時稼働環境として設定するためのステップバイステップガイドが提供されました。このセットアップにより、開発者はモバイルデバイスやメインコンピュータからSSH経由でエージェントをリモート制御できます。設定には、SSHの有効化、パスワードなしsudoの設定、スリープを防ぐためのmacOS電源設定の調整が含まれます。SSHベースのプロセスに対する画面録画やアクセシビリティに関するmacOSのセキュリティ制限を回避するため、このセットアップではLaunchAgentと永続的なtmuxサーバーを利用します。ガイドでは、安全なリモートアクセスのためにTailscaleを、エージェントを分離するために個別のGitHubアカウントを使用することを推奨しています。
- • このセットアップでは、予備のMacをClaude Codeの常時稼働環境として設定し、モバイルデバイスやメインコンピュータからSSH経由でリモート制御できるようにします。
- • LaunchAgentと永続的なtmuxサーバーを利用して、SSHプロセスに対する画面録画やアクセシビリティのmacOSセキュリティ制限を回避します。
- • ターゲットマシンへの安全なピアツーピアリモートアクセスを確立するためにTailscaleが推奨されています。
- • ガイドでは、エージェントを分離するために、個別のGitHubアカウントとClaude for Chrome拡張機能経由の専用Chromeプロファイルを使用することを推奨しています。
開発者は、メインのワークステーションをさらすことなく、Claude Codeのデスクトップ自動化機能をあらゆるデバイスから安全にリモートで実行および制御できます。
7. LLMハーネスのキャッシュ無効化問題を特定するツール「cache-hunter」
ある開発者が、ローカルLLMを実行する際にLLMハーネス構築者がキャッシュ無効化問題を特定できるように設計されたツール「cache-hunter」をリリースしました。キャッシュの無効化は、メッセージの順序、システムプロンプト、ツール、またはreasoning_effortのわずかな変更によって密かに引き起こされる可能性があります。このツールはローカルポートを通じてLLMセッションをキャプチャし、不安定な要素を赤色で強調表示します。OpenCode、Claude Code、Cline、Pi、Hermes、Vibeなどの一般的なハーネスでテストしたところ、ほとんどが不安定なシステムプロンプト、ツール、順序、またはコンテンツに関する問題を抱えていることが明らかになりました。このツールはGitHubから利用可能です。
- • cache-hunterツールはローカルポートを通じてLLMセッションをキャプチャし、キャッシュを無効化する不安定な要素を赤色で強調表示します。
- • ローカルLLMにおけるキャッシュの無効化は、メッセージの順序、システムプロンプト、ツール、またはreasoning_effortの変更によって引き起こされる可能性があります。
- • テストの結果、Claude Code、Cline、OpenCodeを含む一般的なハーネスは、不安定なシステムプロンプトやツール構成を頻繁に示すことが明らかになりました。
- • このツールはオープンソースであり、GitHubリポジトリ「co-l/cache-hunter」で公開されています。
開発者は、LLMアプリケーションハーネス内の隠れたキャッシュ無効化バグによって引き起こされる予期しないレイテンシやAPIコストを排除できます。
8. Fable 5、複雑なNP困難ベンチマークでGPT-5.6 Solを上回る
Fable 5とGPT-5.6 Solを、10^1223という推定探索空間を持つ「KIRO」と呼ばれる未発表のNP困難な光ファイバーネットワーク設計問題で比較評価しました。Fable 5は、Fableの並列ポートフォリオに適した8 CPUのテスト環境に助けられ、GPT-5.6 Solを上回る平均スコアと高い一貫性を達成しました。この実験では、Claude Codeでは別の評価モデルを介して、Codexでは永続化されたスレッド状態を介して機能する「/goal」コマンドも分析しました。/goalコマンドは個別の試行の過半数で勝利しましたが、一部の実行で大きな性能低下が見られたため、両モデルの平均性能は低下しました。
- • Fable 5は、KIRO光ファイバーネットワーク設計問題において、GPT-5.6 Solよりも優れた平均スコアと高い一貫性を達成しました。
- • /goalコマンドは試行の過半数で勝利しましたが、一部の実行で大きな性能低下が見られたため、全体的な平均性能は低下しました。
- • Claude Codeは別の評価モデルを使用して/goalを実装していますが、Codexは永続化されたスレッド状態とライフサイクルツールを使用しています。
- • ベンチマーク環境は8つのCPUを提供しており、これがFableの並列ポートフォリオに有利に働きました。
Claude CodeやCodexを使用する開発者は、目標駆動型のコマンドが重大な性能低下を引き起こす可能性があるため、使用には注意が必要です。
9. エージェントスキルの再現可能な管理を可能にするCLIツール「Trivium」
エージェントのスキルを管理するための新しいオープンソースCLIツール「Trivium」がリリースされました。このツールにより、開発者は手動でファイルを管理することなく、異なるスキルセットを切り替えることができます。Triviumは、スキルを特定のGitコミットに固定し、「skills.lock」ファイルを使用して追跡することで再現性を保証します。また、異なるスキル構成を保存およびアクティブ化するための名前付き環境もサポートしています。リポジトリはGitHubで公開されています。
- • Triviumを使用すると、開発者は手動でファイルを操作することなく、異なるエージェントスキルセットを切り替えることができます。
- • このツールはスキルを特定のGitコミットに固定し、再現性のためにskills.lockファイルを使用して追跡します。
- • 異なるスキル構成を保存およびアクティブ化するための名前付き環境をサポートしています。
- • オープンソースリポジトリはGitHubの「AlapinEnjoyer/trivium」でホストされています。
開発者は、手動でファイルを管理することなく、環境間で異なるエージェントスキル構成を確実にバージョン管理し、切り替えることができます。