1. Ant Groupが因果ビデオ世界モデル「LingBot-World-Infinity」を公開
Ant Groupの具現化知能部門であるRobbyantは、LingBot-World-Infinity(LingBot-World 2.0)をリリースしました。この因果ビデオ生成モデルは、インタラクティブな世界シミュレーターとして機能し、双方向および自己回帰(MoBA)アテンションマスクを組み合わせることで、長期的なドリフトとレイテンシを軽減します。Director-Pilot Co-Simulation Frameworkを採用しており、14Bパラメータ版に加え、非商用ライセンス(CC BY-NC-SA 4.0)の下でシングルGPU環境向けに設計された1.3Bパラメータの軽量版も提供されています。
- • LingBot-World-Infinity(LingBot-World 2.0)は、インタラクティブな世界シミュレーターとして機能する因果ビデオ生成モデルです。
- • 主要な14Bパラメータ版と、シングルGPU環境向けの1.3Bパラメータ軽量版が用意されています。
- • 双方向および自己回帰(MoBA)アテンションマスクを使用し、長期的なドリフトとインタラクティブなレイテンシに対処しています。
- • アーキテクチャには、Vision-Language ModelとDiffusion Transformerを組み合わせたDirector-Pilot Co-Simulation Frameworkを採用しています。
- • プロジェクトは非商用ライセンス(CC BY-NC-SA 4.0)で公開されており、480x832解像度での実行用スクリプトが含まれています。
物理的および意味的なシミュレーションを実行可能な、シングルGPU対応の軽量な1.3B版を含むオープンウェイトのインタラクティブ世界シミュレーターを提供します。
2. GoogleがTabFMをBigQueryに統合し、Scikit-Learn APIを公開
TabFM基盤モデルの初期リリースに基づき、Googleはそのアクセシビリティを拡大し、JAXおよびPyTorchをサポートするscikit-learn互換APIを提供しました。さらに、このモデルはBigQueryに統合され、ユーザーは10万行未満のデータセットに対して「AI.PREDICT」コマンドを使用して直接ゼロショットの表形式予測を実行できるようになりました。
- • TabFMは、JAXおよびPyTorch向けのscikit-learn互換APIを通じてアクセス可能になりました。
- • GoogleはTabFMのBigQueryへの統合を開始し、「AI.PREDICT」コマンドによるゼロショット予測を実現しました。
- • 10万行未満の表形式データセットでの迅速なプロトタイピングをサポートしています。
- • モデルは引き続き10個の出力クラスと最大500個の特徴量を持つテーブルに制限されています。
これらのアップデートにより、TabFMは研究用リリースから実用的な開発者ツールへと進化し、既存のデータワークフローへの直接統合が可能になりました。
3. Kyutaiがオープンウェイトの音楽MIDI変換Transformer「MuScriptor」をリリース
KyutaiとMireloは、マルチ楽器の音楽録音をMIDIに変換するために最適化されたオープンウェイトのデコーダー専用Transformerモデル「MuScriptor」をリリースしました。103M、307M、1.4Bパラメータの各バージョンが提供されており、推論コードはMITライセンス、ウェイトは非商用利用限定のCC BY-NC 4.0ライセンスで公開されています。1.3Bモデルは転写ベンチマークでベースラインモデルを大幅に上回りますが、現在は5秒のセグメント制限があり、音の強弱(ベロシティ)や重なり合う同一音程の表現には対応していません。
- • MuScriptorは、マルチ楽器の音楽をMIDIに変換するためのオープンウェイトのデコーダー専用Transformerモデルです。
- • 103M、307M、1.4Bパラメータの3つのウェイトバリエーションで提供されています。
- • 1.3BパラメータモデルはD_TestデータセットでMulti F1スコア48.2を達成し、YourMT3+ベースラインの21.9を上回りました。
- • 推論コードはMITライセンス、ウェイトは非商用利用限定のCC BY-NC 4.0ライセンスで公開されています。
- • 現在の制限として、5秒のセグメント制限や、音の強弱および重なり合う同一音程の表現ができない点が挙げられます。
複雑なマルチ楽器の録音を直接MIDIファイルに変換できる、専門的なオープンウェイトのオーディオモデルを開発者に提供します。
4. Databricksが数百万行規模のコードベースでコーディングエージェントをベンチマーク
Databricksは、数百万行のコードベースに対してコーディングエージェントを評価するベンチマークを公開しました。その結果、bashと最小限のツールセットに依存するpi-coding-agentは、より複雑なエージェントよりも最大2倍安価で、高いパス率を達成することが明らかになりました。さらに、GLM 5.2モデルはコーディングタスクにおいてClaude Opus 4.8 highと同等の性能を発揮しますが、視覚的なワークフローのためのネイティブな画像入力サポートが欠けていることが示されました。
- • Databricksは、数百万行のコードベースに対してコーディングエージェントを評価しました。
- • bashと最小限のツールを使用するpi-coding-agentは、他のエージェントよりも最大2倍安価で、高いパス率を達成しました。
- • GLM 5.2の性能は、コーディングタスクにおいてClaude Opus 4.8 highと同等であることが判明しました。
- • GLM 5.2はネイティブな画像入力サポートを欠いており、Playwrightなどのツールを使用するエージェントと比較して視覚的なタスクには不向きです。
コーディングエージェントを設計する開発者に対し、最小限のツールセットが複雑な構成を上回る可能性があることを示す、実証的なコストとパフォーマンスのデータを提供します。
5. チュートリアル:DeepAnalyze-8BでT4対応のデータサイエンスエージェントを構築
DeepAnalyze-8Bモデルを使用して自律型データサイエンスエージェントを構築するステップバイステップのチュートリアルが公開されました。モデルを4ビットモードでロードすることで、開発者は低コストのT4 GPUハードウェア上でパイプライン全体を実行できます。このアーキテクチャはサンドボックス化されたPython実行環境を活用しており、エージェントがコードを生成・実行し、反復ループ内で結果を観察することで、Eコマースデータセットのクリーニング、分析、可視化を行い、構造化されたレポートを出力します。
- • このチュートリアルでは、DeepAnalyze-8Bモデルを4ビットモードで標準的なT4 GPUハードウェア上で実行する方法を示しています。
- • エージェントループ内でモデルが生成したコードを実行するために、サンドボックス化されたPython実行環境を利用しています。
- • エージェントはEコマースデータセットのクリーニング、結合、分析、可視化を自律的に行います。
- • ワークフローの最後には、エージェントがアナリストレベルの構造化レポートと視覚的出力を生成します。
非常にアクセスしやすく低コストなクラウドハードウェア上で、コードを実行する完全にサンドボックス化されたデータサイエンスエージェントをデプロイするためのガイドを提供します。
6. OpenFoxがローカルAIコーディング向けに推論キャッシュウォーミングを導入
ローカルAIコーディング用のMITライセンスハーネスであるOpenFoxは、「推論キャッシュウォーミング(speculative cache warming)」と呼ばれる機能を導入しました。この技術は、プロンプトが送信されるのを待つのではなく、ユーザーが入力している間にバックグラウンドでシステムプロンプトとツール配列を処理します。このプロアクティブなキャッシュにより、毎秒500トークンの速度で約10秒の処理時間を節約でき、キャッシュの安定性を維持し、オプトインによるキャッシュ無効化を処理するメカニズムも組み込まれています。
- • OpenFoxは、ローカルAIコーディングタスク用に設計されたMITライセンスのハーネスです。
- • 開発者は、ユーザーが入力している間にシステムプロンプトとツール配列を処理する「推論キャッシュウォーミング」を実装しました。
- • この機能により、毎秒500トークンの速度で推定10秒の処理時間を節約できます。
- • OpenFoxにはキャッシュの安定性を維持するメカニズムが含まれており、キャッシュ無効化のためのオプトインシステムも提供されています。
ユーザーが送信ボタンを押す前にプロンプトキャッシュを事前に温めることで、ローカルコーディングワークフローにおける10〜20秒のレイテンシを解消します。
7. Wispr FlowがClaude、ChatGPT、Cursor向けの音声入力レイヤーを追加
Wispr Flowは、Claude、ChatGPT、Cursorを使用する開発者向けに特別に設計された音声入力レイヤーを導入しました。このツールは、タイピングと比較してプロンプト入力速度を最大4倍向上させることを目指しており、音声テキストの自動クリーンアップやコード構文の管理も行います。現在、無料トライアル版がダウンロード可能です。
- • Wispr Flowを使用すると、開発者はClaude、ChatGPT、Cursorに音声でプロンプトを入力できます。
- • このツールは、標準的なタイピング方法と比較して入力速度を4倍向上させると主張しています。
- • 音声テキストをクリーンアップし、コード構文を管理する組み込み機能を備えています。
- • ソフトウェアは現在、無料トライアル付きでダウンロード可能です。
CursorやLLMインターフェース内で直接コード構文を処理し、音声テキストをクリーンアップする統合音声レイヤーを提供することで、開発者のプロンプトワークフローを加速させます。
8. オープンソースの「llm-serve-dashboard」がローカルのllama.cppおよびvLLM環境を監視
「llm-serve-dashboard」という新しいオープンソースツールは、ローカルのLLMサービング環境を監視するための、単一ファイルで依存関係のないライブダッシュボードを提供します。llama.cppとvLLMの両方をサポートしており、単一ファイルのHTMLフロントエンドと、nvidia-smiおよびPrometheusメトリクスを読み取るPythonバックエンドを備えています。GPUの主要メトリクスに加え、デコードおよびプリフィル時のトークン毎秒、アクティブなリクエスト数、KVキャッシュの充填率などのリアルタイムのワーカーパフォーマンスを追跡します。
- • llm-serve-dashboardは、ローカルのLLMサービング環境を監視するための単一ファイルで依存関係のないライブダッシュボードです。
- • llama.cppとvLLMの両方のフレームワークをサポートし、リスニングソケットからワーカーポートを自動的に検出します。
- • フロントエンドは単一のindex.htmlファイルで、バックエンドはnvidia-smiとPrometheusメトリクスを読み取る標準的なPythonファイルです。
- • GPUメトリクス(使用率、VRAM、電力、温度)とワーカーパフォーマンス(デコード/プリフィル時のトークン毎秒、リクエスト数、KV充填率)を追跡します。
- • プロジェクトはオープンソースであり、GitHubのNHClimber87/llm-serve-dashboardで公開されています。
開発者は、ローカルのサービング環境におけるGPUメトリクス、トークン生成速度、KVキャッシュ充填率を監視するための、軽量で依存関係のないツールを利用できます。
9. 12種類のAIモデルをコーディングタスクで評価する比較研究
比較研究では、レイトレーサー、3Dルービックキューブ、計算機、ライフゲームという4つのコーディングタスクにおいて12種類のAIモデルを評価しました。パフォーマンスのばらつきを考慮し、各タスクで5回の試行が許可されました。GPT-5.6 SolやClaude Fable 5のようなフロンティアモデルが複雑なタスクを支配する一方で、Qwen 3.7 PlusやGLM-5.2のようなオープンウェイトモデルは単純なタスクには十分であることが証明されました。MetaのMuse Spark 1.1は中間的な位置づけで、オープンウェイトモデルを上回りましたが、Grok 4.5には及びませんでした。
- • この研究では、レイトレーサー、3Dルービックキューブ、計算機、ライフゲームの4つのコーディングタスクで12モデルを評価しました。
- • GPT-5.6 SolとClaude Fable 5が複雑なタスクでトップパフォーマンスを示し、Solはレイトレーサー、Fableはルービックキューブでリードしました。
- • Qwen 3.7 PlusやGLM-5.2のようなオープンウェイトモデルは、ライフゲームのような単純なタスクには成功しましたが、複雑で新しい課題には苦戦しました。
- • Grok 4.5は、いくつかのタスクでClaude Opus 4.8と同等のパフォーマンスを示しました。
- • MetaのMuse Spark 1.1はオープンウェイトモデルよりも優れたパフォーマンスを示しましたが、Grok 4.5よりはわずかに劣りました。
開発者が特定のコーディングの複雑さに最適なモデルを選択するのに役立ち、オープンウェイトモデルが成功する領域と、依然としてフロンティアモデルが必要な領域を明らかにします。
10. UnslothがQwen3.6モデル向けに高速なNVFP4量子化をリリース
Unslothは、Qwen3.6 27Bおよび35B-A3Bモデル向けに最適化されたNVFP4量子化をリリースしました。NVIDIAのW4A16実装の代わりに4ビットテンソルコア用のW4A4を利用することで、Unslothは最大2.5倍の高速化を達成しています。このリリースには、コンテキスト長を倍増させるFP8 KVキャッシュキャリブレーション、事前埋め込みのマルチトークン予測(MTP)、およびより高い精度を必要とする開発者向けの35B-A3Bモデルの混合精度NVFP4バリアントが含まれています。
- • Unslothは、NVIDIAのバージョンと比較してQwen3.6 27B(2.5倍高速)および35B-A3B(1.56倍〜1.79倍高速)向けのNVFP4量子化をリリースしました。
- • 実装には4ビットテンソルコア用のW4A4が使用されており、NVIDIAのバージョンではW4A16が使用されています。
- • FP8 KVキャッシュキャリブレーションが含まれており、最大2倍のコンテキスト長を実現します。
- • 35B-A3Bモデルは、NVFP4-Fast(フルW4A4)およびNVFP4(高精度向け混合精度)バージョンで利用可能です。
- • モデルには、生成をさらに加速するための事前埋め込みマルチトークン予測(MTP)が搭載されています。
ローカルモデルを実行する開発者は、キャリブレーションされたFP8 KVキャッシュを使用して、4ビットテンソルコア上で大幅な高速化とコンテキスト長の倍増を実現できます。
11. ONNXを使用して音声アシスタントのASRとTTSをCPUにオフロード
オープンソースプロジェクト「fulloch」は、ASR(自動音声認識)およびTTS(テキスト読み上げ)タスクをCPUにオフロードすることで、ローカル音声アシスタントのリソース効率の高いアーキテクチャを模索しています。Daumee/Qwen3-ASR-0.6B-ONNX-CPUとKokoro-82M-v1.0-ONNXをCPU上で実行することで、システムはGPUリソースをLLM推論のために完全に確保します。このセットアップは、音声活動検出(VAD)と5秒のフォローアップウィンドウを利用して、ウェイクワードなしの自然な対話を可能にしており、ソースコードはGitHubで公開されています。
- • プロジェクト「fulloch」は、LLMのためにGPUリソースを節約するため、ONNXモデルを使用してASRおよびTTSタスクをCPUにオフロードします。
- • Daumee/Qwen3-ASR-0.6B-ONNX-CPUおよびonnx-community/Kokoro-82M-v1.0-ONNXを利用しています。
- • AMD Ryzen 9 7900でのテストでは高速なパフォーマンスを達成し、2022年のMacbook M2でも実用的な動作を確認しました。
- • システムは音声活動検出(VAD)と5秒のフォローアップウィンドウを使用して、繰り返しのウェイクワードなしでコマンドをトリガーします。
- • ソースコードはオープンソースであり、GitHubのliampetti/fullochで公開されています。
音声認識やテキスト読み上げのために貴重なGPU VRAMを消費することなく、低レイテンシのローカル音声アシスタントを構築するための具体的なパターンを提供します。
12. 開発者がGoogleに対し、レイテンシへの懸念からGemini 2.5 Flashの維持を請願
GoogleのGemini 3.5 Flashはトークン処理能力が向上しましたが、開発者からは完了時間が300-400msから600-800msに増加するという大幅なレイテンシの低下と、コストが3倍に増加したという報告が寄せられています。これに応えて、多くの開発者がGemini 2.5 Flashへのアクセスを維持するようGoogleに請願しており、旧モデルが廃止された場合にはオープンウェイトの代替モデルへ移行する可能性があると警告しています。
- • 開発者は、300-400msのレイテンシを理由に、Gemini 2.5 Flashをアクティブに保つようGoogleに請願しています。
- • Gemini 3.5 Flashはレイテンシが高く(600-800ms)、前モデルよりも約3倍高価です。
- • レイテンシの低下は、オーストラリアなどローカルデプロイメントがない地域で特に顕著です。
- • 開発者は、Gemini 2.5 Flashが廃止された場合、オープンウェイトモデルへの切り替えを検討しています。
この反発は、Googleの最新モデルにおける重大なパフォーマンスのギャップを浮き彫りにしており、開発者は独自のアップグレードか、より費用対効果が高く低レイテンシなオープンソースの代替案かを選択せざるを得なくなっています。