1. TensorSharpがQwen-Image 2.1およびLoRAアダプターのローカルサポートを追加
TensorSharpは、9月20日にAlibabaからリリースされたQwen-Image 2.1モデルをサポートするようにプラットフォームを更新しました。このアップデートにより、Pruna 8-stepやViggle TurboなどのQwen-Image 2.1用LoRAアダプターのサポートを含め、ローカルでのテキストから画像への生成および編集が可能になります。開発者は、ベース設定ファイルとオプションのLoRA設定を指定することで、TensorSharp CLI経由でモデルを実行できます。
- • TensorSharpが9月20日にリリースされたQwen-Image 2.1モデルのローカル実行をサポートしました。
- • Pruna 8-stepやViggle Turboを含むQwen-Image 2.1用LoRAアダプターのサポートが追加されました。
- • Qwen-Image 2.1 GGUFやQwen-Image 2.1 VAEなど、複数のモデルファイルにアクセス可能です。
- • ベース設定ファイルとオプションのLoRA設定を使用して、TensorSharp CLIからエンジンにアクセスできます。
この統合により、開発者は最近リリースされたQwen-Image 2.1モデルを、特殊な画像生成や編集タスク向けのカスタムLoRAアダプターと共にローカルで実行できるようになります。
2. KoboldCppが組み込みエージェントハーネスを導入、フィッシングサイトに警告
KoboldCppは、Claude Codeのようなツールの軽量な代替として設計された組み込みエージェントハーネスを導入しました。このハーネスには9つの組み込みツールが含まれ、2kトークンのシステムプロンプトをサポートしており、mcp.jsonファイルを読み込むことでMCPツールを統合し、機能を拡張できます。このリリースと併せて、開発者はブラックハットSEOを使用してマルウェアを配布するフィッシングサイト「kobolcpp.com」に対して緊急の警告を発しました。
- • KoboldCppに、9つの組み込みツールと2kトークンのシステムプロンプトを備えた統合エージェントハーネスが追加されました。
- • エージェントランタイムは、mcp.json設定ファイルを読み込むことでModel Context Protocol (MCP) ツールをサポートします。
- • エージェントはGUIランチャーのAdminタブまたは--agentコマンドラインフラグから有効化でき、OpenAI互換エンドポイントをサポートしています。
- • エージェントの推奨システム要件は、少なくとも28kのコンテキスト、8kの生成制限、12GBのVRAMです。
- • 開発者は、ブラックハットSEOを使用してマルウェアを配布するフィッシングサイト「kobolcpp.com」に対して緊急の警告を発しました。
KoboldCpp内で直接、組み込みツールとMCPサポートを備えた軽量なローカルエージェントランタイムを提供すると同時に、マルウェアを配布するフィッシングサイトを回避するようユーザーに注意を促しています。
3. DeepSeekがエージェント向けプロダクションサンドボックスプラットフォーム「DSec」を導入
DeepSeek Elastic Compute (DSec) は、大規模なエージェント学習および評価のために設計されたプロダクションスケールのサンドボックスプラットフォームです。このプラットフォームは、関数呼び出し、コンテナ、マイクロVM、フルVMのサンドボックスバックエンドをサポートする統合SDKを提供します。DSecはFire-Flyer File System (3FS) を活用してクラスタ全体でオンデマンドで画像データを読み込み、ステートフルなロールアウト実行をプリエンプティブルなGPU学習から分離するために強化学習フレームワークと共同設計されています。
- • DeepSeek Elastic Compute (DSec) は、大規模なエージェント学習および評価用に設計されたプロダクショングレードのサンドボックスプラットフォームです。
- • このプラットフォームは、関数呼び出し、コンテナ、マイクロVM、フル仮想マシンなど、複数のバックエンドをサポートする統合SDKを提供します。
- • DSecはFire-Flyer File System (3FS) を利用して、クラスタ全体でコンテナ画像データをオンデマンドで読み込みます。
- • DSecの単一のプロダクションスケールユニットは約160ノードに及び、38万以上の同時サンドボックスと1日300万回の実行をサポートします。
- • このシステムは、ステートフルなエージェント実行をGPU学習リソースから分離するために、強化学習フレームワークと共同設計されています。
エージェントワークフローをプロダクションスケールで安全に実行、学習、評価するための、拡張性の高い統合サンドボックスインフラストラクチャを提供します。
4. DrawgentがコーディングエージェントとExcalidrawホワイトボードを統合
Drawgentは、Claude Code、Codex、またはopencodeをExcalidrawホワイトボードと統合し、ライブでの図面編集を行うコーディングエージェントツールです。このツールはAgent Communication Protocol (ACP) を使用してコーディングエージェントとインターフェースし、get_scene、add_elements、update_elementsなどのMCPツールスイートを提供します。DrawgentはレンダリングにヘッドレスChromeまたはChromiumをサポートしており、エージェントが共同作業用のExcalidrawルームにアクティブな協力者として参加することを可能にします。
- • Drawgentは、Claude CodeやCodexなどのコーディングエージェントをExcalidrawキャンバスに接続し、ライブでインタラクティブな図面編集を実現します。
- • このツールは、エージェントによるキャンバス操作のために、get_scene、add_elements、update_elementsなどの専用MCPツールスイートを提供します。
- • エージェントは共同作業用のExcalidrawルームにアクティブな参加者として加わり、キャンバスのテキストトリガーやチャットパネルのコマンドに応答できます。
- • システムはNode.js (バージョン18以上) で動作し、ExcalidrawキャンバスのレンダリングにヘッドレスChromeまたはChromiumを使用します。
- • シーンはローカルのgit-ignored JSONファイルに保存され、ツールは外部統合用にRESTおよびWebSocket APIを公開しています。
コーディングエージェントを共同作業用ホワイトボードに直接統合し、エージェントがリアルタイムで図面を読み取り、編集し、検証できるようにします。
5. AIフレンドリーなレイアウト制御を実現する図面言語「Reladraw」
Reladrawは、Mermaidのようなツールの自動配置機能と、Draw.ioのようなソフトウェアの手動制御のバランスを取るために設計された新しい図面言語です。このツールは、人間とAIエージェントの両方が簡単に操作できるように最適化されています。npm経由でインストール可能で、Claudeやその他のAIエージェントと直接統合するための事前構築済みスキルを提供しており、開発者は構造化された視覚的レイアウトを簡単に生成できます。
- • Reladrawは、自動レイアウト配置と正確な手動制御のバランスを取るように設計された図面言語です。
- • 人間である開発者とAIエージェントの両方が簡単に操作できるように最適化されています。
- • npm経由でインストール可能で、Claudeやその他のエージェントと直接統合するための事前構築済みスキルが含まれています。
- • ローカルインストールなしでテストできるWebベースのプレイグラウンドがGitHubで利用可能です。
Claudeやその他のエージェントに簡単に統合して、構造化された制御可能な視覚的レイアウトを生成できる、AIフレンドリーな図面言語を提供します。
6. Splash 1.1.0リリース、Apple Silicon向けGGUFおよびMLXサポートを追加
Splashバージョン1.1.0がリリースされ、Apple Silicon向けの最適化されたローカル推論ランタイムを提供します。このソフトウェアは、最適化されたカーネル、推論デコーディング、プレフィックスキャッシュ、混合ウェイトサポートを単一のプログラムに統合しています。コミュニティのテストでは、あるユーザーがM5 Pro(64GB RAM)上でUnslothのUD-Q4_K_XL形式のQwen3.8 27Bモデルを実行し、毎秒50トークンの速度を達成したと報告しています。
- • Splashバージョン1.1.0がリリースされ、Apple SiliconにGGUF量子化サポートとMLXインポートが追加されました。
- • このソフトウェアは、最適化されたカーネル、推論デコーディング、プレフィックスキャッシュ、混合ウェイトサポートを単一のランタイムに統合しています。
- • あるユーザーは、M5 Pro(64GB RAM)上でUnslothのUD-Q4_K_XL形式のQwen3.8 27Bモデルを実行し、毎秒50トークンを達成したと報告しています。
Apple Silicon開発者に、GGUF、MLXインポート、推論デコーディングをサポートし、高速なモデル実行を実現する高度に最適化されたローカル推論エンジンを提供します。
7. GPT-OSS Jinjaテンプレートの修正により、チャット履歴での回答欠落を解消
GPT-OSS Jinjaテンプレート(元はUnslothのバージョンに基づく)において、推論を含むチャット履歴をリプレイする際にモデルの回答内容が欠落するというバグが特定されました。このバグによりGPT-OSS 20Bが誤動作していましたが、より大規模な120Bバリアントは機能していました。Hugging Faceで修正版テンプレートがリリースされ、プレフィックスキャッシュを通じて複数ターンの推論速度を向上させる「preserve_thinking」機能も導入されました。
- • GPT-OSS Jinjaテンプレート(Unsloth由来)のバグにより、推論を含むチャット履歴をリプレイする際にモデルの回答が欠落することが判明しました。
- • このバグによりGPT-OSS 20Bモデルが誤動作していましたが、より大規模な120Bバリアントは機能していました。
- • Hugging Faceで修正版テンプレートがリリースされ、参照テンプレートからのコピー&ペーストエラーが解決されました。
- • 更新されたテンプレートには「preserve_thinking」機能が導入されており、プレフィックスキャッシュを使用してトークン使用量と引き換えに複数ターンの推論を高速化します。
推論を多用するチャット履歴で回答が欠落するGPT-OSSテンプレートの重大なバグを修正し、複数ターンの推論を高速化するプレフィックスキャッシュ機能を導入します。
8. GLM-5.3-Flashで単一トークン決定を可能にするプロンプト手法
開発者は、最初の出力トークンが質問に答えるようなプロンプトを作成することで、標準的なLLMをJevのような決定特性を持つように構成できるようになりました。この手法により、単一のフォワードパス内での意思決定が可能になり、GLM-5.3-FlashおよびvLLM推論エンジンでの使用が文書化されています。この設定は視覚入力をサポートしており、高速な視覚分類タスクに非常に適しています。
- • 新しいプロンプト手法により、最初の出力トークンで質問に回答させることで、標準的なLLMが単一のフォワードパス内で決定を下せるようになります。
- • このアプローチは、GLM-5.3-FlashとvLLM推論エンジンを使用して文書化およびテストされています。
- • この設定は視覚入力をサポートしており、高速な視覚分類タスクが可能です。
- • ベンチマークによると、この設定は精度と速度でJevに匹敵し、Layaを上回りますが、コスト効率ではJevが依然として優れています。
GLM-5.3-Flashのような標準的なLLMにおいて、単一のフォワードパスを使用して超低遅延の意思決定を実現できます。
9. LLMのログプロブを利用した高速な視覚分類を可能にする単一関数ラッパー
軽量な手法により、開発者は完全なテキストを生成する代わりに、LLMのトークン確率を読み取ることでコンピュータビジョンタスクを実行できます。この手法では、標準のChat Completionsリクエストでmax_completion_tokensを1、logprobsをtrue、top_logprobsを20に設定する必要があります。著者はJevプロジェクトのリクエスト形式を拡張して、attachmentsフィールドでのBase64エンコードされた画像データのサポートを追加し、OpenCVを使用してWebカメラのフレームをキャプチャするPythonスクリプトを提供しています。
- • このラッパーは、特定の質問に対するLLMのトークン確率を読み取ることで、コンピュータビジョン分類を実行します。
- • この手法では、Chat Completionsリクエストでmax_completion_tokensを1、logprobsをtrue、top_logprobsを20に設定する必要があります。
- • 実装はJevプロジェクトの形式を拡張し、attachmentsフィールドでBase64エンコードされた画像データをサポートします。
- • 提供されたPythonスクリプトはOpenCVを使用してWebカメラをキャプチャし、ローカルのllama.cppおよびOpenAI APIエンドポイントの両方と互換性があります。
- • RTX 3090上のGemma 4 12Bで約1fps、OpenAIのgpt-6-lunaで0.2fpsのパフォーマンスを達成しました。
完全なテキストを生成する代わりにLLMのトークン確率を読み取ることで、高速なコンピュータビジョン分類を実行するための軽量な単一関数ラッパーを提供します。
10. FreeTokenフレームワークが大規模MoEモデル向けに「Overspill」ディスク層を追加
ローカルMoEサービングのためのFreeTokenフレームワークの既存機能を基盤として、新しい実験的なOverspillディスク層により、モデルが利用可能なシステムRAMを超えることが可能になりました。テストでは、85GBのDeepSeek-V4-Flash REAP-150Bモデルが64GBのDDR5 RAMを搭載したRTX 3060上で正常に実行され、毎秒2.8〜3.4トークンを達成しました。この実装では、エキスパートのメモリマッピングと並列読み取りを使用してパフォーマンスを最適化しています。
- • Overspillは、FreeTokenフレームワークのための新しい実験的なディスク層です。
- • 利用可能なシステムRAMを超えるMoEモデルの実行を可能にします。
- • テストでは、RTX 3060上で85GBのモデルを使用して毎秒2.8〜3.4トークンを達成しました。
- • フレームワークはメモリマッピングと並列読み取りを使用してエキスパートの読み込みを管理します。
- • このプロジェクトはApache-2.0ライセンスの下でオープンソース化されています。
この開発は、RAMが限られたハードウェア上で大規模なMoEモデルの実行を可能にすることでFreeTokenフレームワークの有用性を拡大し、ローカルモデルサービングの新しい選択肢を提供します。