Inference Brew

AnthropicがClaude Fable 5とMythos 5の利用枠を導入し、アクセスを拡大

00:00 / --:--

← ホームへ戻る

AnthropicがClaude Fable 5とMythos 5の利用枠を導入し、アクセスを拡大

1. AnthropicがClaude Fable 5とMythos 5の利用枠を導入し、アクセスを拡大

米国の輸出管理規制の解除を受け、AnthropicはClaude Fable 5およびMythos 5モデルを正式に再展開しました。Fable 5は現在、週間の利用制限が50%に設定されており、7月7日以降はクレジットベースのモデルに移行します。さらに、Mythos 5へのアクセスは米国の特定の組織向けに拡大されており、Anthropicは政府と連携し、Glasswingプログラムの下で国内外のパートナーへの提供範囲を広げる調整を行っています。

  • Claude Fable 5とMythos 5が正式に再展開されました。
  • Fable 5の利用は7月7日まで週間の利用制限の50%に制限され、その後クレジットベースのシステムに移行します。
  • Mythos 5へのアクセスが米国の特定の組織向けに拡大されています。
  • Anthropicは米国政府と協力し、Glasswingプログラムを通じて国際的なパートナーにもMythos 5へのアクセスを拡大する予定です。

開発者は両モデルの商用利用を再開できますが、新たな利用枠とMythos 5の更新されたアクセス経路を考慮する必要があります。

SOURCES

2. GoogleがGemini 3.5 Flashの後継モデルをLM Arenaでテスト開始

Googleは、LM Arenaプラットフォーム上でGemini Flashモデルのアップグレード版をテストしており、これは最近リリースされたGemini 3.5 Flashの後継となる可能性があります。LM Arenaでのテストは歴史的に公式リリースに先行するため、今回の動きは、Googleが高速かつコスト効率の高いモデル層に向けて、Gemini 3.6または4 Flashと噂される新バージョンの準備を進めていることを示唆しています。

  • アップグレードされたGemini Flashモデルが現在LM Arenaプラットフォームでテストされています。
  • このテストは、最近のGemini 3.5 Flashのリリースに続くものです。
  • LM Arenaでの活動は、歴史的にGoogleの公式モデルリリースの前兆となっています。
  • 新モデルは、現在の3.5 Flashバージョンと比較して段階的な性能向上が期待されています。

Gemini 3.5 Flashを大量のAPIトラフィックで使用している開発者は、Googleの低遅延モデルロードマップにおける次なる性能向上を示す指標として、これらのテストを注視すべきです。

SOURCES

3. Kimi K2.7 CodeがGitHub Copilotで一般利用可能に

2026年6月12日にオープンウェイトモデルとしてリリースされたKimi K2.7 Codeが、GitHub Copilot内で一般利用可能になりました。この統合により、開発者はIDE内で直接モデルを選択でき、利用料金はMicrosoft Azureを通じて請求されます。この展開はCopilot Pro、Pro+、およびMaxプランで有効であり、BusinessおよびEnterpriseユーザーは管理ポリシーでの有効化が必要です。

  • 以前オープンウェイトモデルとしてリリースされたKimi K2.7 Codeが、GitHub Copilotのモデル選択機能で利用可能になりました。
  • 統合はMicrosoft Azure上でホストされ、従量課金制となっています。
  • VS Code、Visual Studio、JetBrains、Xcode、Eclipseなどの主要IDEを含むCopilot Pro、Pro+、Maxプランが対象です。
  • BusinessおよびEnterpriseユーザーは、モデルにアクセスするために手動でポリシーを有効にする必要があります。

この統合により、開発者はオープンソースのウェイトを手動でデプロイすることなく、既存のIDEワークフロー内で直接Kimi K2.7 Codeモデルにアクセスできるようになります。

SOURCES

4. 開発者がGemma-4-31Bをクリエイティブライティングおよびコピーライティング向けにファインチューニング

開発者のakwin123氏は、ダイレクトレスポンス・コピーライティングおよびクリエイティブライティングに特化して最適化されたGemma-4-31B-itモデルのファインチューニング版をリリースしました。マーケティングブリーフや実際の広告のコーパスを用いてQLoRA SFTで学習されたこのモデルは、カスタムのEQ-Bench 3ベンチマークで1657 Eloを記録し、ベースモデルから290ポイントの向上を果たしました。最終的なウェイトはbf16にマージされ、256Kのコンテキストウィンドウをサポートしており、Hugging Faceで公開されています。開発者は、最適なクリエイティブ出力を得るために「思考モード(thinking mode)」を無効にすることを推奨しています。

  • Gemma-4-31B-itモデルは、マーケティングブリーフや実際の広告例のコーパスを用いてQLoRA SFTでファインチューニングされました。
  • ファインチューニングされたモデルは、カスタムのEQ-Bench 3ベンチマークでベースモデルの1367に対し、1657のEloスコアを達成しました。
  • DeepSeek V4 Flashによるブラインドテストにおいて、30件中24件(80%)の対戦で勝利しました。
  • 最終的なモデルウェイトはbf16にマージされ、256Kのコンテキストウィンドウをサポートし、Hugging Faceで公開されています。
  • 開発者は、最適な出力品質を得るために思考モードを無効(enable_thinking = false)にすることを推奨しています。

マーケティングやクリエイティブライティングのアプリケーションを構築する開発者は、一般的なAI特有の専門用語を減らし、感情的知性を向上させるために最適化されたオープンウェイトモデルを利用できます。

SOURCES

5. Fijik 2.0 350mがApache-2.0ライセンスでリリース

開発者の'Fijik'氏は、Granite 4 350Mアーキテクチャをベースにした小型オープンウェイトモデル「Fijik 2.0 350m」をリリースしました。Apache-2.0ライセンスの下で公開されたこのモデルは、60億トークンで継続事前学習され、混合推論の取り組みを特徴とするカスタムSFTコーパスで事後学習されています。SafetensorsおよびGGUF形式でHugging Faceにて公開されており、制約の厳しい環境向けに高度に最適化されていますが、パラメータサイズが小さいため、Web検索ツールと組み合わせて使用することが推奨されています。

  • Fijik 2.0 350mはGranite 4 350Mアーキテクチャをベースにしており、Apache-2.0ライセンスでリリースされています。
  • このモデルは60億トークンで継続事前学習され、2025年8月までの知識カットオフを持っています。
  • 混合推論の取り組みを特徴とするカスタムSFTコーパスで事後学習が行われました。
  • モデルはHugging FaceにてSafetensorsおよびGGUF形式で入手可能です。
  • パラメータサイズが小さいため、Web検索ツールと併用することが推奨されています。

非常に制約の厳しいローカル環境や、Web検索支援が必要なタスクに適した、オープンライセンスの小型モデルを提供します。

SOURCES

6. ManufactがModel Context Protocolアプリ向けのクラウドプラットフォームを立ち上げ

YC支援を受けるスタートアップManufactは、Model Context Protocol(MCP)エコシステムに特化したクラウドプラットフォームを立ち上げました。MCPのためのバーティカルクラウド(Next.jsに対するVercelのような関係)として位置付けられるManufactは、開発チームがMCPアプリやサーバーを構築、テスト、監視、デプロイすることを可能にします。このプラットフォームはGitHub統合、実験的ブランチのプレビューデプロイ、ChatGPTおよびClaude間での自動テスト、AIクライアントインターフェース内で直接カスタムブランディングを表示できるインタラクティブUIのサポートを特徴としています。

  • Manufactは、Model Context Protocol(MCP)アプリやサーバーを構築、テスト、監視、デプロイするためのクラウドプラットフォームです。
  • このプラットフォームはMCPバーティカルクラウドとして機能し、GitHub統合、プレビューデプロイ、MCP固有の分析を提供します。
  • ManufactはChatGPTやClaudeなどの主要クライアント間での自動テストをサポートしています。
  • MCPサーバーはインタラクティブなUIを返すことができ、企業はAI製品内で直接データやブランディングを表示できます。
  • 創業者は以前mcp-useという名称で活動しており、MCP向けのオープンソースSDKを保守しています。

MCPサーバー専用のVercelのようなデプロイおよびテストワークフローを提供し、ChatGPTやClaude向けのインタラクティブなツールの構築と配布を容易にします。

SOURCES

7. Alibabaがブラウザ内GUI自動化のためのPage Agentをオープンソース化

Alibabaは、ページ内ブラウザ自動化のために設計されたTypeScriptファーストのJavaScriptライブラリ「Page Agent」をオープンソース化しました。SeleniumやPlaywrightのような外部ツールとは異なり、Page Agentはブラウザセッション内で直接動作し、ユーザーのアクティブなCookie、認証、セッション状態を継承します。ライブDOMをコンパクトなテキストマップに圧縮する「DOMデハイドレーション」技術を利用することで、このライブラリはOpenAI互換のエンドポイントを介して、標準的なテキストベースのLLMを使用してインターフェースを自動化できます。

  • Page Agentは、MITライセンスでリリースされたオープンソースのTypeScriptファーストJavaScriptライブラリです。
  • ライブラリはブラウザセッション内で動作し、ユーザーのCookie、認証、セッション状態を継承します。
  • 「DOMデハイドレーション」を使用してライブDOMをコンパクトなテキストマップに変換し、テキストのみのLLMとの互換性を実現します。
  • ライブラリはモデルに依存せず、あらゆるOpenAI互換エンドポイントをサポートします。
  • 単一ページのインタラクションに限定されており、プロンプトベースの安全性に依存しているため、機密性の高いアクションにはサーバー側の検証が必要です。

外部の自動化ツールを介さずに、ユーザーのアクティブなセッション、Cookie、認証状態を直接継承するAIコパイロットを開発者が構築できるようになります。

SOURCES

8. AlibabaのSkillWeaverがエージェントのトークン消費量を99%削減

Alibabaの研究者は、複雑なエンタープライズAIワークフローにおいてサブタスクを適切なツールにルーティングするために設計されたオープンソースフレームワーク「SkillWeaver」を開発しました。LLMにツールライブラリ全体を公開する代わりに、取得・ルーティング(retrieve-and-route)アプローチを採用することで、SkillWeaverはコンテキストウィンドウの消費量を99%以上削減します。このフレームワークは、並列実行のための有向非巡回グラフ(DAG)を生成する3段階のプロセスを利用し、7Bモデルのタスク分解精度を51.0%から67.7%に向上させるフィードバックループを導入しています。

  • SkillWeaverは、3段階のプロセス(分解、取得、構成)を使用して、マルチステップタスクの実行グラフを作成します。
  • このフレームワークは、取得したツールに基づいてタスク分解を洗練させるフィードバックループであるSkill-Aware Decomposition(SAD)を導入しています。
  • SADフィードバックループを有効にすると、7Bモデルの分解精度が51.0%から67.7%に向上しました。
  • 取得・ルーティングアプローチにより、ツールライブラリ全体を公開する場合と比較して、コンテキストウィンドウの消費量が99%以上削減されました。
  • このフレームワークは、依存関係をマッピングし、並列実行を可能にする有向非巡回グラフ(DAG)を作成します。

コンテキストウィンドウを使い果たしたり、膨大なトークンコストを支払ったりすることなく、数千のツールを備えた複雑なエージェントワークフローを構築できるようになります。

SOURCES

9. Z.aiがGLM-5.2向けのエージェント開発環境「ZCode」を立ち上げ

Z.ai(旧Zhipu AI)は、CursorやClaude Codeに対抗するために設計された無料のデスクトップアプリケーション「ZCode」を立ち上げました。新たにオープンソース化されたGLM-5.2モデルのためのエージェント開発環境として構築されたZCodeは、macOS、Windows、Linuxで動作します。基盤となるGLM-5.2モデルは、Huaweiのシリコンで完全にトレーニングされ、MITライセンスでリリースされた7440億パラメータの混合エキスパートモデルです。ZCodeは、APIキー設定によるサードパーティモデルもサポートしており、WeChatやTelegramなどのメッセージングプラットフォームとのユニークなリモート制御統合を提供します。

  • ZCodeは、macOS、Windows、Linuxで利用可能な無料のデスクトップ型エージェント開発環境です。
  • この環境は、100万トークンのコンテキストウィンドウを持つ7440億パラメータの混合エキスパートモデル「GLM-5.2」向けに設計されています。
  • Z.aiは6月16日にGLM-5.2のオープンソースウェイトをHugging FaceでMITライセンスの下でリリースしました。
  • ZCodeはサードパーティモデル向けのAPIキー設定をサポートしています。
  • この環境は、WeChat、Feishu、またはTelegramを介したリモート制御機能を備えており、モバイルからコーディングタスクを管理できます。

開発者にGLM-5.2で構築するための無料のクロスプラットフォームデスクトップ環境を提供し、メッセージングアプリ経由のリモート制御機能やサードパーティモデルのサポートを備えています。

SOURCES

10. オープンソースのclaude-real-videoがLLM分析用に動画コンテンツを準備

オープンソースツール「claude-real-video」がMITライセンスでリリースされ、開発者がLLM分析用に動画コンテンツを準備するのを支援します。固定の時間間隔を使用するのではなく、このPythonベースのツールはシーンの変化と密度フロアに基づいてフレームを抽出し、ほぼ重複するフレームを削除してコンテキストウィンドウの使用を最適化します。また、Whisperまたは既存の字幕を使用して音声を文字起こしし、マルチモーダルLLMと互換性のあるフレーム、文字起こし、マニフェストファイルを含む構造化されたフォルダを出力します。

  • claude-real-videoは、MITライセンスでリリースされたオープンソースのPythonツールです。
  • このツールは固定の時間間隔ではなく、シーンの変化と密度フロアに基づいてフレームを抽出し、重複を削除してコンテキストを節約します。
  • 既存の字幕またはWhisper CLIを使用して音声を文字起こしし、構造化されたマニフェストを生成します。
  • ローカルファイルだけでなく、YouTube、Instagram、TikTokのURLもサポートしています。
  • Python 3.10+、ffmpeg、ffprobeが必要です。

重複するフレームを削除し、文字起こしを調整することで、ローカルファイルやURL(YouTube、TikTok)からの動画コンテンツをLLMに簡単に供給できるようになります。

SOURCES

11. RustベースのCLIツール「ctx」がコーディングエージェントにローカルメモリを提供

コーディングエージェントに長期記憶を提供するために、「ctx」という新しいRustベースのCLIツールがリリースされました。トランスクリプトとログをローカルのSQLiteデータベースに取り込むことで、ctxはランク付けされたテキストマッチングを使用し、複雑なグラフデータベースや外部ホストのメモリAPIを必要とせずに、エージェントが過去のセッションを検索できるようにします。このローカル設定により、開発者は新しいタスクを開始する前に、過去の失敗や成功した回避策についてコーディングツールにブリーフィングを行う、履歴調査サブエージェントを実装できます。

  • ctxは、ローカルのSQLiteデータベースを使用してコーディングエージェントに長期記憶を提供するRust CLIツールです。
  • このツールは検索にランク付けされたテキストマッチングを使用し、グラフデータベースやホストされたメモリサービスを不要にします。
  • 開発者はエージェント履歴調査サブエージェントを実装し、新しいタスクを開始する前に過去のセッションに関するブリーフィングを準備できます。
  • このツールは、過去の失敗や成功した回避策を参照することで、エージェントが繰り返される問題を特定して解決するのを支援します。
  • 共有したりプルリクエストに添付したりできる、クリーンなセッショントランスクリプトの生成をサポートしています。

複雑なグラフデータベースやホストされたメモリサービスを必要とせずに、コーディングエージェントに過去のセッション履歴や回避策へのアクセスを提供できます。

SOURCES

12. オープンソースのghealth CLIがAIエージェント向けにGoogle Health APIをラップ

Fitbit Web APIの公式後継として、「ghealth」という新しいオープンソースCLIツールがリリースされました。Google Health API v4のラッパーとして機能するこのツールは、Apache 2.0ライセンスの下で単一のGoバイナリとして配布されます。Fitbit、Pixel Watch、およびサードパーティソースからの40の検証済みデータ型を構造化されたJSONとして公開します。ターミナルおよびAIエージェント統合用に特別に設計されたghealthは、決定論的な終了コードを特徴とし、セットアップと認証を合理化するための2つのエージェントスキルファイルが含まれています。

  • ghealthは、Apache 2.0ライセンスの下でGoogle Health API v4のラッパーとして機能するオープンソースCLIツールです。
  • このツールはFitbit Web APIの公式後継であり、認証にはGoogle OAuth 2.0を使用します。
  • 単一のGoバイナリとして配布され、40の検証済みデータ型を構造化されたJSONとして公開します。
  • CLIは決定論的な終了コードと、ターミナルおよびAIエージェント統合用に設計された簡略化されたJSON出力を特徴としています。
  • 認証、セットアップ、データ型のドキュメント化を支援する2つのエージェントスキルファイルが含まれています。

決定論的な終了コードと事前に構築されたエージェントスキルファイルを使用して、構造化された健康およびフィットネスデータをAIエージェントに簡単に供給できます。

SOURCES

13. FriendliAIがコーディングエージェント向けに高速推論レイヤーを提供

FriendliAIは、AIエージェントの実行に特化して最適化された推論レイヤーを導入しました。このプラットフォームは、GLM-5.2、MiniMax-M3、Kimi-K2.7を含むいくつかのフロンティアモデルをサポートしており、OpenRouter上でGLM-5.1の最速の出力速度を誇ります。99.99%の稼働率SLAに裏打ちされたFriendliAIのインフラストラクチャは、現在、Claude Code、Cursor、Kilo Code、Hermes Agents、Ollamaなどの開発者向けサービスを支えています。

  • FriendliAIは、AIエージェントの実行に特化して設計された専用の推論レイヤーを提供します。
  • このプラットフォームは、OpenRouter上でGLM-5.1モデルの最速の出力速度を主張しています。
  • サポートされているフロンティアモデルには、GLM-5.2、MiniMax-M3、Kimi-K2.7が含まれます。
  • FriendliAIは99.99%の稼働率サービスレベルアグリーメント(SLA)を提供します。
  • このプラットフォームは、Claude Code、Cursor、Kilo Code、Hermes Agents、Ollamaのバックエンドサービスを強化しています。

コーディングエージェントを構築する開発者は、Claude CodeやCursorなどのツールを強化するために、99.99%の稼働率SLAを備えた高速で信頼性の高い推論プロバイダーを活用できます。

SOURCES

14. OpenLumaraがローカルモデル統合のためのOpenAI互換APIブリッジを追加

モジュール式エージェントフレームワークとしての初期リリースを基盤として、OpenLumaraはOpenAI互換のAPIブリッジを含むようになりました。ポート8000で動作するこのブリッジは、KoboldLiteやOpenWebUIなどのフロントエンドUIを、llama.cppやKoboldCPPなどのローカルバックエンドエンジンに接続し、クラウド中心のAPI規約を、最適化されたローカルパフォーマンスと思考ヘッダーの折りたたみなどのトークン節約機能に置き換えます。

  • OpenLumaraは、ポート8000で動作するOpenAI互換のAPIブリッジを備えるようになりました。
  • このブリッジは、KoboldLiteやOpenWebUIなどのフロントエンドUIを、llama.cppやKoboldCPPなどのローカルバックエンドに接続します。
  • クラウド中心のAPI規約を置き換え、ローカルモデルのパフォーマンスを向上させます。
  • トークン使用量をさらに削減するために、思考ヘッダーを折りたたむ特定の設定が含まれています。

このアップデートにより、OpenLumaraエコシステムの互換性が広がり、開発者はフレームワークのトークン効率への注力を維持しながら、標準的なUIツールをローカルモデルで使用できるようになります。

SOURCES

15. Thinking Machines LabとBridgewaterがオープンウェイトモデルをファインチューニングし、フロンティアLLMを凌駕

Mira Murati氏のThinking Machines LabとヘッジファンドのBridgewater Associatesは、投資ニュースをフィルタリングするためのAIを評価する共同結果を発表しました。GPT、Claude、Geminiなどのフロンティアモデルは、専門家によるプロンプトを使用しても中程度の70%台で頭打ちになりましたが、BridgewaterはTinker APIを使用してオープンウェイトモデルをファインチューニングしました。その結果、モデルは84.7%の精度を達成し、80%の運用信頼しきい値を超え、最高のフロンティアモデルと比較してコストを13.8倍削減しました。

  • フロンティアモデル(GPT、Claude、Gemini)は、6つの投資ニュースフィルタリングテスト全体で平均約50%の精度しか達成できませんでした。
  • 専門家が作成したプロンプトによりフロンティアモデルの精度は70%台半ばまで向上しましたが、Bridgewaterの80%の運用信頼しきい値には届きませんでした。
  • Bridgewaterは、実際の専門家の判断に基づき、Thinking Machines LabのTinker APIを使用してオープンウェイトモデルをファインチューニングしました。
  • ファインチューニングされたモデルは84.7%の精度を達成し、テストされた最高のフロンティアモデルと比較してミスを29.8%削減しました。
  • ファインチューニングされたモデルは、テストされた最高のフロンティアモデルと比較して、タスクあたりのコストを13.8倍削減しました。

専門家データで小型のオープンウェイトモデルをファインチューニングすることが、フロンティアAPIに依存するよりも高い精度と大幅に低いコストをもたらす具体的な事例を示しています。

SOURCES

16. Hugging Faceの開発者がClaude Agents SDKとModalを使用して役割を自動化

aiDotEngineerイベントにおいて、Hugging Faceの開発者が自身の役割の側面を自動化するために設計されたワークフローを実演しました。この実装は、Claude Agents SDKと、推論プロバイダーを介してアクセスされるGLM-5.2を組み合わせています。本番環境の監視とデプロイのために、このセットアップはトレーシング用にLangfuseを統合し、Modalのサーバーレスプラットフォーム上で実行されており、自律型エージェントを構築する開発者にとって具体的なスタックの参考となります。

  • 自動化ワークフローは、aiDotEngineerイベントでHugging Faceの開発者によって発表されました。
  • システムは、推論プロバイダーを介してClaude Agents SDKとGLM-5.2を利用しています。
  • LangfuseはLLMのトレーシングと監視に使用されます。
  • エージェントワークフロー全体がModalのサーバーレスインフラストラクチャ上にデプロイされています。

SDK、トレーシング、サーバーレスデプロイを組み合わせた、本番グレードのエージェントワークフローの現実的な青写真を提供します。

SOURCES

17. RAG-AnythingチュートリアルがGoogle Colabでのマルチモーダル検索を詳述

新しいチュートリアルでは、テキスト、表、数式、画像を含むマルチモーダル検索のためのRAG-Anythingワークフローの構築方法が概説されています。チャット、ビジョン、埋め込みにOpenAI APIを使用してGoogle Colabで実装されたこのガイドでは、複雑なドキュメントを構造化されたJSONコンテンツリストに変換する方法を詳述しています。RAG-Anythingシステムは、ナイーブ、ローカル、グローバル、ハイブリッドの検索モードをサポートしており、開発者が混合メディアデータセット全体でクロスモーダル推論を実装できるようにします。

  • このチュートリアルでは、チャット、ビジョン、埋め込みにOpenAI APIを使用して、Google ColabでRAG-Anythingワークフローを構築する方法を実演しています。
  • ワークフローは、合成マルチモーダルレポート(表、チャート、PDFを含む)を構造化されたJSONコンテンツリストに変換します。
  • RAG-Anythingは、ナイーブ、ローカル、グローバル、ハイブリッドを含む複数の検索モードをサポートしています。
  • システムは、構造化された値とマルチモーダルな証拠に基づいて、クロスモーダル推論を実行し、クエリに回答する能力についてテストされています。

開発者が標準的なOpenAI APIを使用して、クロスモーダル推論および検索パイプラインを実装するためのステップバイステップガイドを提供します。

SOURCES

18. vLLMのアップデートがOOM問題を解決し、コンテキストウィンドウを倍増

オープンソースのvLLMエンジンの開発者は、メモリ不足(OOM)問題の解決を目的とした3つの主要なアップデートをリリースしました。これらのアップデートは、事前割り当てとチューニングパラメータによって引き起こされるメモリのボトルネックに対処します。実際のテストでは、これらの最適化により、RTX 5090 GPUでQwen2-7Bを実行する際に、使用可能なコンテキストウィンドウを120kから240kトークンに倍増させることができ、ローカル推論能力が大幅に向上しました。

  • vLLM開発者は、事前割り当てとチューニングによって引き起こされるメモリ不足(OOM)問題に対処する3つの主要なアップデートをリリースしました。
  • ユーザーは、RTX 5090でQwen2-7Bを使用して、使用可能なコンテキストウィンドウサイズを120kから240kトークンに倍増させたと報告しました。
  • アップデートは、ローカル推論のためのメモリ事前割り当てとチューニングパラメータを最適化します。

ローカルモデルを実行する開発者は、RTX 5090のようなコンシューマーGPUで、使用可能なコンテキストウィンドウを(最大240kトークンまで)倍増させることができるようになりました。

SOURCES

19. GLM 5.2がDSparkを介して投機的デコードサポートを獲得

GLM 5.2 DSparkプレビューがリリースされ、オープンソース化されたDSparkフレームワークのDeepSeek以外のモデルへの初の適用となりました。フレームワークの投機的デコード機能を利用することで、このプレビューはvLLM nightlyを介して4x B300ハードウェア上でGLM-5.2のFP8デコードを約1.5倍高速化します。このリリースは、多様なオープンウェイトアーキテクチャ全体で推論レイテンシを最適化するためのフレームワークの有用性を示しています。

  • GLM 5.2 DSparkプレビューは、オープンソースのDSparkフレームワークを使用してDeepSeek以外のモデル用に開発された最初のスペキュレーターです。
  • 4x B300ハードウェア上でGLM-5.2-FP8のデコードを1.5倍高速化します。
  • 実装はvLLM nightly上で動作します。
  • 将来のアップデートでは、より強力なチェックポイントが期待されています。

開発者はDSpark投機的デコードフレームワークをGLM-5.2に適用して推論レイテンシを大幅に削減できるようになり、元のDeepSeek-V4モデルを超えたフレームワークのより広範な互換性が検証されました。

SOURCES

20. llama.cppのプルリクエストがIntel ARCでのプロンプト処理速度を倍増

llama.cppリポジトリへの新しいプルリクエストは、Intel ARC GPU向けの重要なプロンプト処理の高速化を導入しています。Claudeの支援を受けて開発されたこの最適化は、262kのコンテキストサイズを持つQwen3.6 35Bモデルを実行するIntel B580 GPUでテストされました。このアップデートにより、116kのコンテキスト会話の処理時間が510秒から262秒に短縮され、スループットが245 t/sから462 t/sに実質的に倍増しました。現在の最適化はF16 KVキャッシュに限定されています。

  • 新しいllama.cppプルリクエストは、Intel ARC GPU向けのパフォーマンス最適化を提供します。
  • 262,144のコンテキストサイズを持つQwen3.6 35B A3B Q5_K_XLモデルを使用してベンチマークが行われました。
  • 116kのコンテキスト会話の処理時間が510秒から262秒に短縮されました。
  • プロンプト処理速度が245 t/sから462 t/sに向上しました。
  • 現在の最適化はF16 KVキャッシュに限定されています。

Intel ARCハードウェアでローカルモデルを実行する開発者は、長いコンテキストの会話のレイテンシを大幅に削減できます。

SOURCES

21. 開発者がMiniMax-M2.7向けに6x NVIDIA P40ホームラボをベンチマーク

ある開発者が、合計144GBのVRAMを提供する6枚のNVIDIA P40 GPUを使用してローカルで大規模モデルを実行するために設計されたホームラボ構成を文書化しました。改造されたBIOSとIntel Xeonプロセッサを搭載したAsus X99-E-WSマザーボード上に構築されたこのシステムは、MiniMax-M2.7-GGUFを実行するための最適な構成を見つけるためにllama.cppを使用してベンチマークされました。開発者の検証済みセットアップは、F16 KVキャッシュ、Flash Attention、2048のバッチサイズ、およびレイヤーベースのテンソル分割を利用しています。

  • ホームラボシステムは、合計144GBのVRAMを提供する6枚のNVIDIA P40 GPUを搭載しています。
  • ハードウェアには、改造されたBIOSを搭載したAsus X99-E-WSマザーボード、Intel Xeon E5-2680 v4 CPU、128GBのDDR4 RAMが含まれます。
  • 最適なllama.cpp構成は、F16 KVキャッシュ、Flash Attention、2048のバッチサイズ、256のubatchサイズ、レイヤーベースのテンソル分割を使用します。
  • セットアップは、llama-serverを介してMiniMax-M2.7-GGUFモデルを実行してベンチマークされました。

古いコスト効率の高いエンタープライズGPU上で大規模モデルをローカルで実行しようとしている開発者向けに、具体的なハードウェアおよびソフトウェア構成の青写真を提供します。

SOURCES

22. ローカルベンチマークがRTX 3090でQwen3.6、Gemma4、Ornith1.0を比較

独立した開発者が、inspect-aiフレームワークを使用してRTX 3090 GPU上でQwen3.6 27b、Gemma4 26B、Ornith1.0 35Bを比較したローカルベンチマーク結果を公開しました。テストの結果、Qwen3.6 27bが一般知識と推論でリードし、Ornith1.0 35Bが最大100kトークンまでのグラウンディングとリコールタスクで優れていることが明らかになりました。ベンチマークでは、LM Studioを介してGemma4 26Bを実行する際の無限ループ問題など、実用的な統合の課題も浮き彫りになりました。

  • ベンチマークは、RTX 3090上でinspect-aiフレームワークを使用してQwen3.6 27b、Gemma4 26B、Ornith1.0 35Bを評価しました。
  • Qwen3.6 27bは、6つの一般知識および推論ベンチマークのうち4つで最高または同等のスコアを達成しました。
  • Ornith1.0 35Bは、100kトークンの「干し草の中の針(Needle in a Haystack)」テストを含む、グラウンディングおよびリコールタスクで他のモデルを上回りました。
  • 評価者は、Gemma4 26Bでの無限ループやコーディングベンチマークの長い処理時間などの技術的な問題を報告しました。

推論やリコールタスクのために人気のあるオープンウェイトモデルを選択するのに役立つ、客観的なローカルハードウェアパフォーマンスデータを提供します。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。