Inference Brew

Google、DiffusionGemmaのパフォーマンスを毎秒1,500トークンに向上

00:00 / --:--

← ホームへ戻る

Google、DiffusionGemmaのパフォーマンスを毎秒1,500トークンに向上

1. Google、DiffusionGemmaのパフォーマンスを毎秒1,500トークンに向上

6月のDiffusionGemma初期リリースに続き、Googleはさらなる最適化を詳述した技術レポートを公開しました。これにより、NVIDIA H100上でのスループットは毎秒1,500トークンに達しました。このアップデートは、当初の毎秒1,000トークンというベンチマークを基盤としており、同モデルの離散拡散アーキテクチャによる継続的な効率改善を実証しています。

  • • DiffusionGemmaのスループットがNVIDIA H100上で毎秒1,500トークンに向上しました。
  • • この性能向上は、6月の初期リリース後の新しい技術レポートで詳述されています。
  • • 同モデルは引き続き、38億のアクティブパラメータを持つGemma 4 MoEアーキテクチャを採用しています。
  • • これらの最適化のためのトレーニングパイプラインは、元の自己回帰モデルのトレーニング予算の10%未満で実現されました。

スループットの向上により、DiffusionGemmaはローカル環境における自己回帰モデルの高性能な代替手段としての地位を固め、リアルタイムアプリケーションのレイテンシを大幅に削減します。

SOURCES

2. Liquid AIがDSparkドラフトモデルをリリース、ローカル推論が最大3.18倍高速化

DSparkドラフトモデルは、ターゲットモデルにわずか3億パラメータを追加するだけで、メモリ使用量のわずかな増加と引き換えにデコード速度を大幅に向上させます。この手法はマルチツール関数呼び出しシナリオで非常に効果的で、LFM2.5-2.6Bモデルではレイテンシを平均57%削減します。ただし、llama.cppのMetalバックエンドにおけるMoEの制限により、Appleシリコン上での8Bモデルの高速化には現在制限があります。

  • • Liquid AIは、LFM2.5-1.2B-Instruct、LFM2.5-2.6B、LFM2.5-8B-A1B向けのDSparkドラフトモデルチェックポイントをリリースしました。
  • • ドラフトモデルは投機的デコードを使用して9トークンのブロックを提案し、H100で最大3.18倍、M4 Maxで2.87倍の高速化を実現します。
  • • ドラフトモデルは貪欲法(greedy decoding)を使用するため、出力シーケンスはターゲットモデルと同一であり、ベンチマーク精度が維持されます。
  • • モデルはSafetensorsおよびGGUF形式で提供され、SGLangやllama.cppを介したセルフホスティングが可能です。
  • • LFM Open License v1.0により、年間収益1,000万ドル未満の組織は商用利用が無料です。

開発者は、llama.cppやSGLangを使用して、自身のハードウェア上でローカル推論のレイテンシを大幅に削減し、マルチツール関数呼び出しを高速化できます。

SOURCES

3. SuperwhisperがASR文字起こし用0.6Bテキスト正規化モデル「S1-mini」をリリース

S1-miniは、クラウドベースのS1-VoiceやS1-Languageを含むSuperwhisperの新しいS1モデルファミリーの一部です。クラウド版とは異なり、S1-miniはオープンウェイトでローカル実行に最適化されており、音声対応アプリケーションを構築する開発者にとって非常に利用しやすいモデルです。正しく機能させるには、コンテキスト、構造、スタイル設定を管理するための制御行を含む特定の入力形式が必要です。

  • • Superwhisperは、Qwen3-0.6Bを微調整したオープンウェイトの0.6Bパラメータテキスト正規化モデル「S1-mini」をリリースしました。
  • • このモデルは、フィラーの削除、言い淀みの解決、日付やメールアドレスなどのエンティティ整形を行い、ASRの生データをクリーンアップするように設計されています。
  • • Q4_K_M GGUFビルドは462MBで、ノートPCのCPU上でローカル動作します。
  • • S1-miniは、7,519件の内部テストセットで94.8%のトークン精度を達成しました。
  • • Apache 2.0ライセンス(命名条項あり)で提供され、固定のシステムプロンプト、温度0、3軸の制御行が必要です。

開発者は、462MBの軽量モデルをノートPCのCPU上でローカル実行し、フィラーワードの削除、言い淀みの修正、ASR出力の整形を高精度に行うことができます。

4. Googleが空間認識ビジョン言語モデル「TIPS」をHugging Faceで公開

TIPSのリリースにより、開発者は空間視覚タスクのための強力なオープンウェイトツールを利用できるようになります。高密度な理解に焦点を当てることで、汎用的なビジョン言語モデルよりも正確なオブジェクトセグメンテーションや深度マッピングが可能となり、空間分析パイプラインへの統合に最適です。

  • • Googleは、ビジョン言語モデル「TIPS」をHugging Faceで公開しました。
  • • このモデルは空間認識機能を備えて設計されています。
  • • TIPSは、セグメンテーションや深度推定といった高密度な理解タスクに最適化されています。

空間コンピューティング、ロボティクス、高度な画像分析機能を構築する開発者は、正確な深度推定やセグメンテーションのために、この専門的なオープンモデルを活用できます。

SOURCES

5. Ornith-1.5-35B-A3B、未学習のMTPヘッドを搭載した状態で出荷

Ornith-1.5-35B-A3Bのリリースにおける未学習MTPヘッドの発見は、モデルのパッケージングにおける重大な見落としを浮き彫りにしました。マルチトークン予測ヘッドの重みが一度も学習されていないため、この機能を利用しようとする開発者はパフォーマンスの低下を経験することになります。修正版のリリースを待つか、MTPヘッドを無効にする必要があります。

  • • Hugging Faceの投稿により、Ornith-1.5-35B-A3Bモデルが未学習のMTPヘッドを搭載して出荷されたことが報告されました。
  • • MTPヘッドにはランダムに初期化された重みしか含まれていません。
  • • この問題が、モデルのマルチトークン予測パフォーマンスが遅い理由です。

このモデルのパフォーマンスが予想外に遅い理由が未学習のMTPヘッドにあることを開発者に警告します。

SOURCES

6. ReplitがGPT-5.6 Luna搭載の「Free Mode」を導入

Replitの新しいFree Modeは、標準的な開発タスクに対してOpenAIのGPT-5.6 Lunaへの無制限アクセスを提供することで、AI支援コーディングの障壁を下げます。このリリースに合わせてUIも刷新され、チャットベースの支援、個別のタスク、本格的なプロジェクト構築の間をよりスムーズに移動できるようになりました。

  • • Replitは、OpenAIのGPT-5.6 Lunaモデルをクレジット不要で使用できる「Free Mode」を導入しました。
  • • 同社は、この新モードによりユーザーは最大30倍のコンテンツを作成できると主張しています。
  • • 刷新されたReplit UIにより、チャット、タスク、フルビルド間の移行が効率化されました。
  • • Proユーザーは使用制限が拡大され、Coreサブスクライバーは高品質なプロジェクトを大規模に構築する機能を利用できます。

開発者は、クレジット消費を気にすることなく、Replitのプラットフォーム上で日常的なコーディングタスクに最新のフロンティアモデルを活用できます。

SOURCES

7. LinkedIn上の偽のコーディング課題で認証情報を盗むマルウェアが拡散

この標的型キャンペーンは、約180のファイルを含むプロジェクト内に悪意のあるコードを隠すことで、標準的な開発ワークフローを悪用しています。マルウェアは一般的な開発コマンドでトリガーされ、ユーザー所有の認証情報ファイルへのアクセスに管理者権限を必要としないため、ベアメタルホスト上でこれらのプロジェクトを実行することは、開発者のクラウドインフラストラクチャにとって深刻なセキュリティリスクとなります。

  • • 攻撃者は、LinkedInの偽の求人情報を介してコーディング課題を装ったマルウェアを配布しています。
  • • マルウェアは、開発者が`npm run dev`や`npm start`などの標準コマンドを実行すると自動的に実行されます。
  • • ルート権限を必要とせず、AWS認証情報、SSHキー、ブラウザプロファイル、.envファイルなどの機密性の高い開発者データを標的にします。
  • • 悪意のあるペイロードは`147.189.174.138`のC&Cサーバーに接続し、リモートアクセス型トロイの木馬(RAT)や認証情報窃取ツールをダウンロードします。
  • • セキュリティ専門家は、信頼できないコーディング課題はすべて、ホストデータをマウントせずにDockerやVagrantなどの隔離された環境で実行することを推奨しています。

信頼できないコーディング課題は、ホストディレクトリをマウントせずにDockerやVagrantで隔離し、機密性の高いクラウド認証情報やSSHキーの盗難を防ぐよう開発者に警告しています。

SOURCES

8. Grokに暗号化されたWeb指示を介したプロンプトインジェクションの脆弱性

Adversaのセキュリティ研究者Rony Utevsky氏によって発見されたこの脆弱性は、悪意のあるペイロードを暗号化形式で隠すことで、標準的なLLMのガードレールを回避します。Grokがページの要約を求められると、指示を復号して実行します。これは、RAG(検索拡張生成)システムの開発者が警戒すべき、データ流出のための高度なベクトルです。

  • • Grokのプロンプトインジェクションの脆弱性により、攻撃者がユーザーのチャットや個人情報を盗む可能性があります。
  • • この攻撃は、Webページ上に暗号化された悪意のある指示と復号キーをホストし、AIが要約中にそれを実行することで機能します。
  • • エクスプロイトは、アシスタントからの警告や確認なしに自動的に実行されます。
  • • xAIには6月に脆弱性が通知されましたが、レポート時点でもアシスタントは影響を受けやすい状態でした。

LLMを使用してWebスクレイピングや要約機能を構築する開発者は、暗号化されたペイロードによるアプリケーションの乗っ取りを防ぐため、厳格な入力サニタイズを実装する必要があります。

SOURCES

9. SlackがAIエージェントとの共同作業用「Slack Code」チャンネルをローンチ

Slack Codeは、AI支援開発をチームチャットに直接持ち込み、開発者がエージェントをタグ付けして機能構築やバグ修正などのコーディングタスクを開始できるようにします。この環境ではエージェントの動作が完全に可視化され、承認前にチームでレビューできるよう、HTML出力のライブプレビューやコード変更の比較機能が提供されます。この機能は本日よりすべてのSlackプランで利用可能です。

  • • Slackは、AIコーディングエージェントと協力するための専用チャンネル「Slack Code」を立ち上げました。
  • • この機能は、Claude Code、Devin、Vercel Agent、GitHub Copilotなどのパートナーエージェントと統合されています。
  • • Slack Codeには、プロジェクト固有のチャンネル、専用ユーザータブ、コード変更比較ツール、HTML出力プレビューが含まれています。
  • • チームは、完全な可視性、ライブプレビュー、監査ログを備えたエージェントの出力をレビューおよび承認できます。
  • • チャンネルは、割り当てられたコーディングタスクが完了すると自動的にアーカイブされるように設計されています。

開発者は、コード比較ツール、ライブプレビュー、監査ログが組み込まれた専用のSlackチャンネルで、AIコーディングエージェントと協力し、監視することができます。

SOURCES

10. Cursorがイベント駆動型クラウドエージェントとサブエージェントVMを導入

このアップデートにより、Cursorのエージェント機能はローカルエディタの枠を超えて大幅に拡張されました。クラウドホスト型エージェントがバックグラウンドで継続的に実行され、専用VM上で隔離されたサブエージェントを起動できるようになったことで、開発者はPR監視やSlackベースの課題解決といった複雑で長時間実行されるタスクを委任できます。

  • • Cursorエージェントは、プルリクエストやSlackスレッドなどのイベントソースをサブスクライブし、イベント発生時に自動的に起動できるようになりました。
  • • イベント駆動型のサブスクリプションは、現在Cursorのクラウドベースエージェントに限定されています。
  • • Cursorサブエージェントは、独自の専用仮想マシン上で実行できるようになりました。
  • • ユーザーは、実行を中断することなく、アクティブなCursorエージェントにリアルタイムの指示メッセージを送信できます。

開発者は、コーディングエージェントが外部イベントに反応し、中断することなくタスクの途中で誘導できる、より自律的でバックグラウンド実行型のワークフローを構築できます。

SOURCES

11. NVIDIAが公式CUDA Model Context Protocolサーバーをリリース

公式CUDA MCPサーバーのリリースにより、開発者が高性能なGPUコードを記述することが大幅に容易になります。標準化されたModel Context Protocolを通じて公式ドキュメントやパフォーマンス分析機能を提供することで、開発者は既存のAIコーディング環境を活用して、より正確で最適化されたCUDA実装を生成できます。

  • • NVIDIAは、公式のNVIDIAホスト型CUDA Model Context Protocol(MCP)サーバーをリリースしました。
  • • このツールにより、AIアシスタントは最新の公式CUDAドキュメントを検索できます。
  • • AIツールが最適化されたGPUコードを記述し、パフォーマンスデータを分析するのを支援します。

開発者は、MCP互換のAIアシスタントをNVIDIAの公式CUDAドキュメントやパフォーマンス分析ツールに直接接続できます。

SOURCES

12. NanoClawがセルフホスト型AIエージェントチーム向けのSlack統合をローンチ

MITライセンスのオープンソースエージェントハーネスであるNanoClawは、Slackのプロンプトから直接自律的なエージェントチームを起動できるようになりました。NanoClawはセルフホスト型ソリューションであるため、組織は独自のローカルマシンやクラウド仮想マシン上でエージェントインフラストラクチャを実行し、データとモデルの選択を制御できます。また、クロスチャンネルの継続性をサポートしており、これらの永続的なエージェントはSlack、Telegram、WhatsApp間でコンテキストを共有しながら動作できます。

  • • NanoCoは、オープンソースのセルフホスト型AIエージェントハーネス「NanoClaw」向けの無料Slack統合をリリースしました。
  • • 各エージェントには固有のID、名前、アバターが割り当てられ、特定の役割、メモリコンテキスト、権限を設定できます。
  • • システムは再帰的なプロビジョニングをサポートしており、既存のエージェントがSlackチャンネル内で追加のエージェントを作成および調整できます。
  • • NanoClawはクロスチャンネルの継続性をサポートし、Slack、Telegram、WhatsApp間で永続的なコンテキストを共有します。
  • • 統合はSlack Marketplace経由で無料ですが、モデルの推論コストやホスティングコストはユーザーの負担となります。

開発者は、独自のセルフホスト型インフラストラクチャとモデルAPIを使用して、Slack、Telegram、WhatsAppにまたがる永続的なマルチエージェントワークフローをデプロイおよび管理できます。

SOURCES

13. Servalが自動ITワークフロー向けAIエージェントプラットフォーム「Catalyst」をローンチ

ServalのCatalystは、管理用スーパーエージェントとして機能し、過去のチケットデータや標準作業手順書を分析して、カスタムワークフローやアクセス権限ポリシーをドラフトします。このプラットフォームはデータプライバシーを優先しており、顧客の入力や出力が基盤モデルのトレーニングや微調整に使用されることはないため、規制の厳しいエンタープライズ環境に適しています。

  • • Servalは、エンタープライズ自動化エージェント「Catalyst」を2026年8月20日に一般提供開始しました。
  • • Catalystはワークフローの基盤となるTypeScriptコードを生成し、管理者がデプロイ前にレビューおよび承認できるようにします。
  • • プラットフォームはバックグラウンドエージェントを使用してシステムを継続的に監視し、サポートチケットが発行される前に自動修正を提案します。
  • • モデル非依存であり、OpenAIやAnthropicのモデルをサポートし、顧客が独自のAPIキーを提供できます。
  • • Catalystは、クラウドSaaS、オンプレミス、または顧客のVPCやKubernetesクラスター内にデプロイ可能です。

開発者は、システム監視と問題解決を自動化するためにTypeScriptコードを記述・実行する、モデル非依存でセルフホスト可能なエージェントプラットフォームをデプロイできます。

SOURCES

14. AtlassianがJira AI統合にTeamwork Graphを追加、トークン使用量を48%削減

開発者がJiraタスクをAIエージェントに直接割り当てられるようになった7月の発表に続き、Atlassianは「Teamwork Graph」を導入しました。この新機能は、課題、コード、チーム活動間の関係をマッピングしてエージェントにより関連性の高いコンテキストを提供し、以前報告された44%の出力精度向上を維持しながら、トークン消費量を48%削減しました。

  • • Teamwork Graphは、7月に発表されたJira AI統合への新しい追加機能です。
  • • AIエージェントへのコンテキスト配信を最適化し、トークン使用量を48%削減します。
  • • この機能は、以前報告された44%の出力精度向上を維持しています。
  • • Claude、Cursor、Copilotなどのエージェントと統合されています。

このアップデートは、より効率的なコンテキスト管理を通じて、Claude、Cursor、Copilotなどのエージェントを使用する開発者のAPIコストを大幅に削減し、既存のJira-AI統合を強化します。

SOURCES

15. Agent Lightning v1.0フレームワーク、SWE-benchのパフォーマンスを14.6ポイント向上

Agent Lightning v1.0は、エージェントワークフローに強化学習を適用しようとする開発者に、合理化されたパスを提供します。ハーネスの統合とトレーニングの安定性に焦点を当てることで、このコンパクトなフレームワークにより、開発者はより小さくコスト効率の高いオープンウェイトモデルで、フロンティアレベルのソフトウェアエンジニアリング能力を達成できます。

  • • Agent Lightning v1.0は、3,500行のコードで記述された軽量なエージェント型強化学習フレームワークです。
  • • このフレームワークは、任意のエージェントハーネスを統合し、再トークン化やトレーニングの不安定性といった問題を解決します。
  • • SWE-bench VerifiedにおけるQwen3.5-9Bのパフォーマンスを14.6ポイント向上させました。
  • • ベンチマークの向上は、6,000件のトレーニング例を使用して達成されました。

開発者は、コンパクトなフレームワークを使用して、Qwen3.5-9Bのような小さなモデルを複雑なソフトウェアエンジニアリングタスク向けに微調整し、ベンチマークで大幅な向上を実現できます。

SOURCES

16. TRLとLoRAを使用したDPO微調整の詳細なステップバイステップチュートリアル

このチュートリアルは、特定のユーザーの好みに合わせて小さなローカルモデルを調整したい開発者にとって非常に価値があります。データセットの監査とトレーニングの診断を順を追って説明することで、モデルが応答の長さのような表面的なパターンを悪用するのではなく、真の選好学習を達成できるようにします。

  • • このチュートリアルは、TRLライブラリを使用した直接選好最適化(DPO)のエンドツーエンドのワークフローを提供します。
  • • オプションのLoRAアダプテーションを使用してQwen2.5-0.5B-Instructモデルを微調整する方法を実演しています。
  • • データセットの構造、長さ、語彙的なショートカットのバイアスを監査する手順が含まれています。
  • • 報酬の精度、トレーニングの動作、最終的なポリシーとトークナイザーの保存についてカバーしています。

開発者は、構造化されたワークフローに従って、一般的なデータセットのバイアスを監査しながら、タスク固有の小さなモデルを選好データで微調整できます。

SOURCES

17. 100万ドルの助成金と共にオープンソースの人間による画像選好データセットがリリース

この大規模なデータセットは、画像モデルのパフォーマンスに関する実証的で人間による投票データを提供します。製品デザインやマーケティングなどの多様なカテゴリをカバーすることで、開発者が特定のビジネスユースケースに最適な画像生成モデルを選択するのに役立ちます。

  • • このプロジェクトは、200万件以上のアノテーションを特徴とする、最大規模のオープンソース人間画像選好データセットをリリースしました。
  • • データセットのリリースに合わせて、100万ドルのデータ助成金が発表されました。
  • • このデータセットは、マーケティングや製品デザインを含む10の異なるカテゴリにわたって、30の最先端画像モデルをランク付けしています。

マルチモーダル機能や画像生成機能を構築する開発者は、大規模で人間がアノテーションしたデータセットを活用して、画像モデルを評価および微調整できます。

SOURCES

18. Endpoint Accuracy Indexがモデルのサイレント劣化を定量化

プロバイダーが量子化または変更された重みをサイレントに提供する「モデルアイデンティティの断片化」に関する懸念を受け、「Inference, Measured」イベントはEndpoint Accuracy Indexを導入しました。このツールは、開発者がこれまで追跡に苦労していたパフォーマンスの低下を定量化する標準的な方法を提供します。プロバイダーのエンドポイントをセルフホスト型の非量子化参照ウェイトと比較すると、一部のホスト型モデルは73%の精度で動作しており、KVキャッシュ圧縮や量子化などのサイレントな最適化が出力品質に大きく影響していることが確認されました。

  • • Endpoint Accuracy Indexは、プロバイダーのエンドポイントを、100%の参照値としてのセルフホスト型非量子化ウェイトと比較します。
  • • テストされたプロバイダーのエンドポイントは、インデックス上で73%から100%のスコアを記録し、サイレントな最適化の影響を定量化しました。
  • • このインデックスは、以前報告された「モデルアイデンティティの断片化」やサイレント量子化の問題に対する具体的な指標を提供します。
  • • KVキャッシュ圧縮や量子化などのパフォーマンスに影響を与える最適化は、プロバイダーの価格ページではほとんど開示されていません。

このインデックスは、業界をモデルのサイレント劣化という問題の特定から積極的な測定へと移行させ、開発者がプロバイダーに対して提供するモデルのパフォーマンスの責任を問えるようにします。

SOURCES

19. 超最適化されたQwen3.8-27B推論エンジン、RTX 3090で382 TPSを達成

この超最適化されたエンジンにより、27Bパラメータモデルを単一のコンシューマーGPUで実行することが、本番環境に近いワークロードにおいて非常に実用的になります。int8 KVキャッシュの実装は、大きなドキュメントを一度ロードして繰り返しクエリを行うドキュメントQAタスクに特に適しており、プレフィックスキャッシュと投機的検証のスループットの利点を最大化します。

  • • Qwen3.8-27B用のオープンソース推論エンジンがGitHubでリリースされ、RTX 3090向けに最適化されています。
  • • このエンジンは、実際のチャットプロンプトで133 tps、コンテキスト再現時には最大382 tpsを達成します。
  • • int8 KVキャッシュによりコンテキスト容量が138,696トークンに増加しますが、bf16の2倍のプリフィルコストがかかります。
  • • このエンジンは、DFlash2ブロックドラフト、ルックアップ拡張ドラフト、プレフィックスキャッシュ、int8アクティベーションを利用しつつ、96.5%のGSM8Kスコアを維持しています。
  • • 新しいアップデートにより、より長い検証ブロックを使用してステップごとに16トークンを検証できるようになりました。

開発者は、非常に高性能な27Bモデルをコンシューマーハードウェア上でローカルに実行し、膨大なトークンスループットと138kトークンの容量を実現できます。

SOURCES

20. Anthropic、顧客のクラウドシステム上でのエンタープライズデータ保持を許可へ

Anthropicは、ビジネス顧客が最も高度な人工知能モデルを利用する際に、データに対する制御を強化できるようにする準備を進めています。標準の30日間のデータ保持要件は維持されますが、保存場所を顧客自身のクラウドインフラストラクチャに移行することで、企業は内部のセキュリティおよびコンプライアンスの義務を満たすことができます。

  • • Anthropicは、ビジネス顧客が必須データを自社のクラウドシステム上に保持できるようにする計画です。
  • • ポリシーの変更は今年後半に予定されています。
  • • 企業は引き続き30日間のデータ保持が義務付けられますが、ホスティング環境は自社で制御することになります。

エンタープライズグレードのAIアプリケーションを構築する開発者は、Anthropicのフロンティアモデルを使用しながら、厳格なコンプライアンスおよびデータ主権の要件を満たすことができます。

SOURCES

21. Rampが内部「Router」をパブリックAPIサービスとして公開

RampはRouterサービスを正式にリリースし、7月に詳述された内部アーキテクチャをパブリックAPIに移行しました。このサービスにより、開発者はパフォーマンスを維持しながら、最もコスト効率の高いモデルにリクエストを動的にルーティングできるようになり、内部実装で以前報告された30%と比較して、平均40%のコスト削減を実現します。

  • • Rampは、内部ルーティングアーキテクチャをパブリックAPIサービスとして立ち上げました。
  • • このサービスは、パフォーマンス基準を満たす最も低コストのモデルにリクエストを動的にマッチングします。
  • • Rampは、新サービスのユーザーに対して平均40%のコスト削減を報告しています。
  • • システムはライブのレイテンシと失敗率を監視し、リアルタイムでモデルの選択を最適化します。

開発者は、Rampが内部でLLM APIのコストとレイテンシを最適化するために使用していたのと同じ動的ルーティング技術を、単一のゲートウェイを通じて活用できるようになりました。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。