1. DeepReinforceがOrnithモデルファミリーをアップデート、1.5をリリース
DeepReinforceは、従来のOrnith-1.0および2.0リリースを基盤として、Ornith-1.5モデルファミリーを立ち上げました。このアップデートでは、エンドツーエンドの自己改善ループを通じてトレーニングされた9Bの密なモデル、35BのMoE、および397BのMoEが導入されています。1.5リリースでは初期バージョンのパフォーマンスが向上しており、397BモデルはClaude Opus 4.8のベンチマークに匹敵し、9BモデルはiOSおよびAndroidでのモバイル展開をサポートするようになりました。
- • Ornith-1.5ファミリーには、9Bの密なモデル、35BのMoE、および397BのMoEモデルが含まれます。
- • 397BのMoEモデルは、主要なベンチマークにおいてClaude Opus 4.8のパフォーマンスに匹敵します。
- • 9Bの密なモデルには、iOSおよびAndroid向けのモバイル最適化バージョンが含まれています。
- • モデルは、タスク生成とソリューション展開のためのエンドツーエンドの自己改善ループを使用してトレーニングされています。
- • ファミリーはHugging Faceにて標準形式およびGGUF形式で利用可能です。
このリリースにより、開発者は複雑な推論やエージェントワークフローのための、より高性能で更新されたオープンウェイトモデルを利用できるようになり、モバイル最適化された新しい選択肢も提供されます。
2. InclusionAIがLing-3.0エコシステムを拡大、ベースモデルのチェックポイントを公開
Ling-3.0モデルウェイトの初期リリースに続き、InclusionAIはLing-3.0-tinyおよびLing-3.0-flashの6つのベースモデルチェックポイントをオープンソース化しました。事前トレーニング済み、中間トレーニング済み、WSMマージ済みの各段階にわたるこれらのチェックポイントは、カスタムファインチューニングや継続的な事前トレーニングのための詳細な開始点を提供します。モデルは従来の学習率減衰に代わってWeighted Checkpoint Merging (WSM)を利用しており、124BパラメータのFlashバリアントはコーディングおよび推論タスクで強力なパフォーマンスを発揮します。
- • Ling-3.0-tinyおよびLing-3.0-flashの事前トレーニング済み、中間トレーニング済み、WSMマージ済みの各段階をカバーする6つのチェックポイントが含まれます。
- • Ling-3.0-tiny-baseは合計7.9Bパラメータ(アクティブ1.3B)を持ち、旧来のLing-2.5-mini-baseを上回ります。
- • Ling-3.0-flash-baseは合計124Bパラメータ(アクティブ5.1B)を持ち、コーディング、推論、長文コンテキストタスクをターゲットとしています。
- • トレーニングプロセスでは、従来の学習率減衰の代わりにWeighted Checkpoint Merging (WSM)が使用されています。
- • 完全にポストトレーニングされたバージョンは、引き続きLing-3.0-tinyおよびLing-3.0-flashとして利用可能です。
これらの中間チェックポイントは、以前にリリースされた最終ウェイトと比較して、ファインチューニングや継続的な事前トレーニングにおいて開発者により高い柔軟性を提供します。
3. TrueFoundryがAIエージェントハーネス「TrueForge」をオープンソース化
TrueFoundryは、エンタープライズ開発者がコスト効率が高くベンダー中立なエージェントを構築・管理できるように設計された、MITライセンスのAIエージェントハーネス「TrueForge」をオープンソース化しました。TrueForgeは、大規模なツール結果をファイルにオフロードしたり、会話履歴を圧縮したりするコンテキストエンジニアリング技術を採用し、APIコストを最小限に抑えます。さらに、その「sandbox-as-a-tool」アーキテクチャは、安全なコード実行のためにオンデマンドで分離された環境をプロビジョニングし、管理型エージェントプラットフォームに代わる非常に効率的な選択肢を提供します。
- • TrueForgeはTrueFoundryによってMITライセンスの下でリリースされています。
- • コンテキストエンジニアリング(大規模なツール結果のファイルへのオフロード、履歴の圧縮)を活用してモデルの支出を削減します。
- • 必要な時にのみ分離された環境をプロビジョニングする「sandbox-as-a-tool」アーキテクチャを特徴としています。
- • TrueFoundryは、Enterprise-BenchにおいてGLM-5.2を使用したTrueForgeが、Claude Opus 4.8を使用したClaude Managed Agentsよりも75%安価であると主張しています。
- • アクセス制御とガバナンスのために、TrueFoundryの商用AI Gatewayと組み合わせることができます。
開発者に対し、サンドボックス機能とコンテキスト最適化を内蔵した、ベンダー中立でコスト効率の高いAIエージェントのデプロイおよび管理フレームワークを提供します。
4. プロダクションレベルのエージェントポストトレーニング向け「Miles v0.1」リリース
Miles v0.1は、AIエージェントのプロダクションレベルのポストトレーニングのためのオープンシステムとしてリリースされました。このフレームワークにより、開発者は分離されたサンドボックス環境で複数のエージェントインスタンスを実行し、そのパフォーマンスを自動的にスコアリングして、結果を強化学習ループにフィードバックできます。Milesは非同期トレーニングとアクティブワーカーへのモデル更新のホットスワップをサポートしており、パイプラインを停止することなく継続的なエージェントの改善が可能です。
- • Miles v0.1は、強化学習を使用してAIエージェントをポストトレーニングするためのオープンシステムです。
- • 分離された環境で複数のエージェントコピーを実行してタスクパフォーマンスをスコアリングし、結果をトレーニングにフィードバックします。
- • トレーニングパイプラインを停止することなく、更新されたモデルをワーカーに配布できます。
- • ロールアウト、サンドボクシング、非同期トレーニング、リプレイ、モデル更新、マルチハードウェアスケーリングのためのコンポーネントが含まれています。
開発者に対し、プロダクションワークフローを停止することなく、更新されたエージェントモデルを継続的にトレーニング、評価、デプロイするための自動化されたパイプラインを提供します。
5. 監査可能な人間とエージェントのコラボレーションのための「CHAP 0.2」リリース
Brightbeam AIは、人間とAIエージェント間の構造化された監査可能なコラボレーションのために設計されたオープンプロトコル「CHAP 0.2 (Collaborative Human-Agent Protocol)」をリリースしました。CHAPは、エージェントのドラフトに対する人間の編集内容をクエリ可能なコンテンツハッシュ化されたエンベロープに保存し、単一の信頼できる情報源を維持します。このリリースには、PythonとTypeScriptでのリファレンス実装、MCPのサポート、およびLangGraph、Pydantic AI、LlamaIndexなどの人気ライブラリ向けのフレームワークブリッジが含まれています。
- • CHAP (Collaborative Human-Agent Protocol) 0.2はパブリックドラフトとして利用可能です。
- • プロトコルは、エージェントのドラフトに対する人間の編集内容を、コンテンツハッシュでリンクされたクエリ可能で検証可能なエンベロープに保存します。
- • TypeScriptとPythonでのリファレンス実装、適合性ハーネス、MCPおよびA2Aトランスポートのサポートが含まれています。
- • LangGraph、Pydantic AI、AG2、LlamaIndex、Google ADK向けのフレームワークブリッジを提供します。
- • オプションのセキュリティ機能には、OIDCバインド署名と外部の透明性ログへのアンカリングが含まれます。
開発者に対し、監査証跡を内蔵したヒューマン・イン・ザ・ループのエージェントワークフローを構築するための、標準化された安全なフレームワークを提供します。
6. コーディングツールがコードベース理解のために「AGENTS.md」を採用
Cursor、Codex、Ampを含むAIコーディングツールは、AIエージェントのコードベース理解を向上させるために「AGENTS.md」と呼ばれる新しい標準化されたMarkdown形式を採用しています。Claude Code固有のCLAUDE.md形式に代わるツール非依存の代替手段として設計されたAGENTS.mdは、開発者が自律型コーディングエージェントのためにコードベースの構造、ガイドライン、コンテキストを文書化するための統一された方法を提供します。
- • Codex、Amp、Cursorが、標準化されたMarkdownファイル形式としてAGENTS.mdを採用しています。
- • この形式は、コーディングエージェントがコードベースを理解するための統一された方法を提供するように設計されています。
- • Claude Code固有のCLAUDE.mdに代わる、ツール非依存の代替手段として機能します。
開発者に対し、独自の形式に代わる、AIコーディングエージェント専用のコードベースを文書化するためのツール非依存の方法を提供します。
7. ModularがMojo 1.0をオープンソース化し、プラットフォームサポートを拡大
Modularは、Mojo 1.0プログラミング言語がApache 2.0ライセンスの下で完全にオープンソースになったと発表しました。オープンソースリリースと並行して、Modularは共有および専用デプロイメントのための「Modular Cloud」を立ち上げ、プラットフォームのハードウェアサポートをAWS Trainium、Google TPU、Qualcommアクセラレータにまで拡大しました。さらに、MAXライセンスが更新され、デバイス使用制限が撤廃され、新しいオープンアライアンスプログラムの下でソース利用可能なモデルに移行しました。
- • Mojo 1.0はApache 2.0ライセンスの下で完全にオープンソース化されました。
- • Modular Cloudがconsole.modular.comで一般公開され、共有エンドポイントと専用デプロイメントを提供します。
- • Modular Platformは、AWS Trainium、Google TPU、Qualcomm Cloud AI 100およびDragonflyアクセラレータへのハードウェアサポートを拡大しました。
- • ModularはMicrosoftと協力し、MojoのネイティブWindowsサポートを開発しています。
- • MAXライセンスはデバイス使用制限を撤廃するように更新され、ソース利用可能となります。
開発者に対し、より広範なハードウェア互換性を備えた、AIシステムエンジニアリングのための完全にオープンソースで高性能な言語を提供します。
8. ベクトル検索とAIワークフローのためのPostgreSQLの活用
PostgreSQLは、特殊な拡張機能を通じてAIエンジニアリングにおける有用性を拡大し続けています。ベクトル埋め込みのためのpgvector拡張機能と、直接的なLLMインデックス作成およびモデル呼び出しのためのpgai拡張機能を活用することで、開発者はデータベース、ベクトル検索、LLM統合レイヤーを統合できます。このエコシステムは、JSONストレージ、全文検索、およびunloggedテーブルによる高性能キャッシングのネイティブサポートと組み合わさることで、チームは単一のデータベース内で堅牢なAIバックエンドを構築できます。
- • pgvector拡張機能により、PostgreSQLはAIワークフローのためのベクトルデータベースとして機能できます。
- • pgai拡張機能は、データのインデックス作成とLLMモデルの直接呼び出しをPostgreSQL内で容易にします。
- • PostgreSQLは、全文検索、JSONドキュメントストレージ、パーティショニング、共通テーブル式をサポートしています。
- • SELECT .. FOR UPDATEおよびSKIP LOCKEDを使用して、高性能なキューイングシステムとして機能できます。
- • Unloggedテーブルは、非永続的な高性能キャッシングに使用できます。
リレーショナルデータ、ベクトル埋め込み、LLM統合のために単一の信頼できるデータベースを使用することで、開発者がスタックを簡素化するのに役立ちます。
9. Claudeの新しい透かしを回避するためのツールが開発者によりリリース
ClaudeモデルにおけるGoogleのSynthID-Text透かしの最近の実装を受けて、開発者はすでにこの技術を回避する方法を作成しています。ロールアウトから4時間以内に、開発者のGuillaume Meyerが透かしを除去するように設計されたオープンソースのオーバーライドツールをリリースしました。コミュニティによって特定されたその他の回避方法には、テキストの言い換え、翻訳、並べ替えなどがあり、AIの出所証明の取り組みとユーザー側の修正との間の継続的な緊張関係が浮き彫りになっています。
- • Anthropicは、EU AI法を遵守するために、ClaudeモデルにSynthID-Text透かしを最近実装しました。
- • 開発者のGuillaume Meyerは、発表から4時間以内にこれらの透かしを除去するオープンソースツールをリリースしました。
- • コミュニティメンバーは、テキストの並べ替えや翻訳など、追加の回避技術を特定しました。
- • Anthropicは、透かしが応答品質に影響を与えないと主張しており、検出APIをリリースする予定です。
Anthropicの新しい透かし実装に対するコミュニティの即時的な反応を示しており、モデル出力から合成識別子を削除するためのツールを開発者に提供しています。
10. Inco AIがDFlash 2をローンチ、推論デコーディング研究を基盤に
元のDFlash推論デコーディング研究を基盤として、Inco AIはDFlash 2をリリースしました。このアップデートでは、軽量なパスセレクターとローカル畳み込みモジュールが導入され、サフィックスの減衰を緩和し、元のDFlashと比較して16.5百万パラメータを追加しながらスループットを16%から25%向上させました。この技術は現在統合可能となっており、llama.cppとvLLMへのサポートがすでに追加されており、Qwen3.8-27Bが標準的な自己回帰デコーディングの最大3.4倍のスループットを達成できるようになりました。
- • DFlash 2は、元のDFlashと比較してスループットを16%から25%向上させます。
- • 新機能には、軽量なパスセレクターと、サフィックスの減衰に対処するための16.5Mパラメータのローカル畳み込みモジュールが含まれます。
- • Inco AIは、Qwen3.8-27BおよびMetaのMuse Glimmer用のDFlash 2ドラフターをHugging Faceでリリースしました。
- • llama.cppのプルリクエスト#27342がDFlash 2のサポートを追加し、RTX 6000上でQwen3.8-27Bに対して最大3倍の高速化を示しています。
- • vLLMベースの実装では、RTX 3090上でシングルユーザーリクエストに対して毎秒138トークンを達成しました。
ローカルLLM推論のためにDFlash推論デコーディングフレームワークをすでに利用している開発者にとって、大幅なパフォーマンスアップグレードを提供します。
11. Unslothが動的v3.0 GGUF量子化をリリース
Unslothは動的v3.0量子化形式を導入し、Qwen3.8-27Bの更新されたGGUFモデルをリリースしました。新しい量子化手法は、洗練されたimatrixキャリブレーションデータセットを活用して、エージェントコーディング、チャット、多言語パフォーマンスを最適化します。QATやQADを回避することで、Unslothは以前のバージョンよりも10%の精度向上を実現しており、わずか8GBのRAMを搭載したハードウェアでも70%以上の精度を維持する超低ビットの1ビット量子化が含まれています。
- • 動的v3.0 GGUFは、llama.cppおよびUnsloth Desktopと互換性があります。
- • 量子化手法は、エージェントコーディング、チャット、多言語タスク用に洗練された高品質のimatrixキャリブレーションデータセットを使用します。
- • プロセスは、量子化認識トレーニング(QAT)や量子化認識蒸留(QAD)を行わず、完全にポストトレーニング量子化に依存しています。
- • 新しい1ビットのUD-IQ1_S量子化はサイズが6.2GBで、72%から77%の精度を維持し、8GBのRAMで実行可能です。
- • Unslothは、ディスク容量を約500MB節約するために、UD-Q2_K_XL未満の小さな量子化からMTPモジュールを削除しました。
開発者が、最小限のメモリフットプリントで、高精度な量子化モデルをコンシューマーハードウェア上でローカルに実行できるようにします。
12. FreeTokenが効率的なローカルMoEサービングを実現
研究者は、Mixture-of-Experts (MoE) モデルの効率的なエッジネイティブサービングのために設計された技術「FreeToken」を導入しました。エキスパート、モデルの状態、CPU/GPUワークロード、およびエージェントの状態の再利用を、ホストマシンの利用可能なメモリと帯域幅に合わせて動的に再マッピングすることで、FreeTokenはコンシューマーハードウェアで大規模なモデルを実行できるようにします。このシステムは、8GBのラップトップGPU上の35Bモデルから、単一のワークステーションGPU上の753B GLMモデルまで、20以上のMoEモデルをサポートしています。
- • FreeTokenは、利用可能なメモリに基づいて、エキスパート、モデルの状態、CPU/GPU作業、およびエージェントの状態の再利用を動的に再マッピングします。
- • この技術は20以上のMoEモデルをサポートしています。
- • サポートされているセットアップは、8GBのラップトップGPUで35Bモデルを実行するものから、単一のワークステーションGPUで753B GLMモデルを実行するものまで多岐にわたります。
メモリと帯域幅を最適化することで、開発者が標準的なワークステーションやラップトップ上で大規模なMoEモデルをローカルに実行できるようにします。
13. ソフトウェアエンジンがTesla V100 GPUでのネイティブFP4/FP8を可能に
ある開発者が、Volta世代のTesla V100 GPUでNVFP4およびFP8モデルウェイトをネイティブに実行するように設計されたソフトウェアエンジン「v100-skinny」をリリースしました。カスタムQuantized Processing Network (QPN) カーネルを利用することで、エンジンは低精度のウェイトをVolta Tensor Coreと互換性のあるFP16形式に変換し、ハードウェアのネイティブFP4/FP8サポートの欠如を回避します。Qwen 3.8を使用したテストでは、4つのV100のクラスターが毎秒219.1トークンを達成し、最新のRTX 5090のシングルリクエストデコードパフォーマンスに匹敵しました。
- • 「v100-skinny」エンジンにより、4つのTesla V100 GPUがQwen 3.8で毎秒219.1トークンのデコードスループットを達成できます。
- • パフォーマンスは、NInferエンジンを実行しているRTX 5090のシングルリクエストデコード速度に匹敵します。
- • システムはQuantized Processing Network (QPN) カーネルを使用して、FP4およびFP8ウェイトをVolta Tensor Coreと互換性のあるFP16形式に変換します。
- • バージョン1.1は、モデルの混合FP4/FP8割り当てを維持するための特定のSM70実行パスを提供します。
- • このセットアップは、約600豪ドルのハードウェアコストで取得した4つのV100 GPUを使用して構築されました。
開発者が安価で古いエンタープライズGPUを再利用して、最新のフラッグシップカードのシングルリクエストデコードパフォーマンスに匹敵させることができます。
14. OpenAIがデータ保持ゼロのためのプライベート安全性処理をテスト
OpenAIは、一部のエンタープライズ顧客を対象に「Private Safety Processing」のテストを開始しました。この新しい技術は、データ保持ゼロ(ZDR)保護を完全に維持しながら不正利用パターンや安全性の違反を検出するように設計されており、厳格なコンプライアンス要件を持つ組織がOpenAIのフロンティアモデルを安全に活用できるようにします。
- • この技術は「Private Safety Processing」と呼ばれます。
- • データ保持ゼロ保護を維持しながら、不正利用パターンを特定するように設計されています。
- • この機能は現在、初期のエンタープライズ顧客を対象にテストされています。
- • 企業がOpenAIにデータを保持させることなく、OpenAIの最も高度なモデルを使用できるようにします。
厳格なデータプライバシーおよび保持要件を損なうことなく、規制の厳しい業界の開発者が高度なOpenAIモデルを使用できるようにします。