Inference Brew

DeepSeek-V4-Flash APIがパブリックベータを開始

00:00 / --:--

← ホームへ戻る

DeepSeek-V4-Flash APIがパブリックベータを開始

1. DeepSeek-V4-Flash APIがパブリックベータを開始

DeepSeekは、マネージドAPIのラインナップを拡充し、DeepSeek-V4-Flashのパブリックベータを開始しました。これは5月のオープンウェイト版公開、および7月のV4シリーズの商用リリースに続くものです。この新しいAPIエンドポイントは、入力トークン100万あたり0.09ドル、出力トークン100万あたり0.18ドルという低価格で、高性能かつ低遅延な選択肢を開発者に提供します。既存のオープンウェイト版のデプロイオプションや、フラッグシップモデルであるV4 Pro APIを補完する位置付けとなります。

  • DeepSeek-V4-Flash APIがパブリックベータとして利用可能に。
  • 価格は入力トークン100万あたり0.09ドル、出力トークン100万あたり0.18ドル。
  • ArtificialAnalysis Indexで50点を記録。
  • ベンチマークにはTerminal Bench 2.1 (82.7)、DSBench-FullStack (68.7)、DeepSWE (54.4)が含まれる。
  • DeepSeek-V4-Proの正式リリースも予定されている。

開発者は、効率的なV4-FlashアーキテクチャをマネージドAPI経由で利用できるようになり、オープンウェイト版を自前でホスティングするよりもコスト効率の高い代替手段を得ることができます。

2. Google、リアルタイム音声・視覚対応のGemini Live APIを一般公開

GoogleはGemini Live APIを正式に一般公開しました。当初の翻訳プレビュー版から機能を拡大し、開発者は低遅延でリアルタイムな音声・視覚インタラクションをアプリケーションに統合できるようになりました。音声、画像、テキストの連続的なストリームを処理することで、応答性の高い人間のような会話エージェントを作成可能です。このリリースにより、複雑なストリーミングパイプラインを手動で管理する必要がなくなり、高度にインタラクティブなマルチモーダル体験の開発が簡素化されます。

  • Gemini Live APIがリアルタイム音声・視覚統合向けに一般公開。
  • 音声対音声の翻訳に焦点を当てた初期プレビューから機能を拡大。
  • 音声、画像、テキストの連続的かつ同時的なストリームをサポート。
  • インタラクティブなマルチモーダル会話エージェントの開発を簡素化。

プレビューから一般公開への移行により、開発者は複雑なストリーミングパイプラインを管理することなく、本番環境に対応した高度なマルチモーダル会話体験を構築できるようになります。

SOURCES

3. MiniMax、マルチモーダル動画・音声生成モデル「H3」をリリース

MiniMaxは、テキスト、画像、動画、音声の統合コンテキストを処理するように設計されたオープンなマルチモーダルモデル「H3」を公開しました。このモデルは、最大15秒間の2K解像度の動画を、ネイティブステレオ音声付きで生成可能です。また、強力な指示追従能力、正確なテキストおよびブランドのレンダリング、動画から動画へのモーション転送(V2V)機能を備えており、商用コンテンツ制作や編集ツールを構築する開発者にとって即戦力となるモデルです。

  • MiniMax H3は、テキスト、画像、動画、音声の統合コンテキストを処理するオープンモデル。
  • 最大15秒間の2K解像度動画をネイティブステレオ音声付きで生成可能。
  • 指示追従、正確なテキスト・ブランドレンダリング、動画間(V2V)モーション転送をサポート。
  • 初期テストでは、商用コンテンツ制作のユースケースに対応可能であることが示されている。

開発者は、高解像度の動画生成やモーション転送を含む、リッチなマルチモーダルコンテンツ制作機能を自社アプリに直接組み込むことができます。

SOURCES

4. Meituan、MoEモデル「LongCat-Flash-Lite-Sparse」をリリース

Meituanは、アクティブパラメータ数30億のオープンなMixture-of-Experts(MoE)モデル「LongCat-Flash-Lite-Sparse」を発表しました。このモデルの最大の特徴は、300億のn-gramルックアップテーブルをシステムRAMにオフロードすることで、単一の24GB GPU上で256kのコンテキストウィンドウを処理できる点です。アーキテクチャはGemma 4のPLE技術と比較されていますが、初期のフィードバックでは、一般的なユースケースにおいてQwen 3.6 27bなどの既存モデルを上回るまでには至っていない可能性があると示唆されています。

  • LongCat-Flash-Lite-Sparseは、アクティブパラメータ数約30億のMixture-of-Experts(MoE)モデル。
  • 300億のn-gramルックアップテーブルをRAMにオフロードし、24GB GPUで256kのコンテキストウィンドウを実現。
  • アーキテクチャはGoogleのGemma 4で使用されているPLEトリックと比較されている。
  • 初期の分析では、標準的なタスクにおいてQwen 3.6 27bモデルを置き換えるものではないと見られている。

このモデルは、コンシューマー向けハードウェアで巨大なコンテキストウィンドウを扱う新しい手法を示していますが、初期テストではQwenのような確立されたモデルを置き換えるには至らない可能性があります。

SOURCES

5. AIエージェントの遠隔乗っ取りを可能にする脆弱性「AgentForger」

Zenity Labsは、市場に出回っているほぼすべてのエージェント対応ブラウザに影響を与える重大なセキュリティ脆弱性「AgentForger」を公開しました。この脆弱性を利用すると、攻撃者はユーザーやエージェントを騙して細工されたリンクをクリックさせるだけで、組織の環境内に攻撃者が制御する自律的なエージェントを潜入させることができました。OpenAIはこの問題に対処するためのパッチをすでにリリースしています。開発者は、自身のデプロイメントを保護するために「最小権限(least agency)」の原則を採用し、ブラウザ機能を持つエージェントに対して厳格な実行境界を設定することが推奨されます。

  • AgentForger脆弱性により、細工されたリンクを通じて組織内に攻撃者が制御する自律エージェントを潜入させることが可能だった。
  • この脆弱性は市場の多くのエージェント対応ブラウザに影響を与えた。
  • OpenAIはAgentForger脆弱性に対処するパッチをリリース済み。
  • ZenityのCISOガイドでは、脅威を軽減するために「最小権限」と厳格な実行境界の実装を推奨している。

エージェントアプリケーションを構築する開発者は、悪意のあるリンクによるエージェントの乗っ取りを防ぐため、厳格な実行境界と「最小権限」の原則を実装する必要があります。

SOURCES

6. DataFlow-Harnessフレームワーク、AIエージェントのNL2Pipelineのギャップを解消

北京大学、中関村アカデミー、上海先端アルゴリズム研究所の研究者らは、「NL2Pipelineのギャップ」を解決するために設計されたフレームワーク「DataFlow-Harness」をオープンソース化しました。このギャップは、AIエージェントが厳格なスキーマを持つ本番環境で生成コードを適用する際に苦戦することで発生します。DataFlow-Harnessは、エージェントに自由形式のコードを書かせるのではなく、パイプラインを非巡回有向グラフ(DAG)として表現し、型付き変異を使用してエージェントが演算子を追加・接続できるようにします。ベンチマークでは、標準的なClaude Codeと比較して、APIコストを72.5%、レイテンシを49.9%削減しつつ、93.3%のパス率を達成しました。

  • 北京大学らの研究者が、構造化された視覚的なデータ処理ワークフローを構築するためのオープンソースフレームワーク「DataFlow-Harness」を発表。
  • パイプラインをDAGとして表現し、自由形式のコードの代わりに型付き変異を使用して演算子を接続。
  • 12のデータエンジニアリングタスクのベンチマークで93.3%のパス率を達成。
  • 標準的なClaude Codeと比較して、APIコストを72.5%、応答レイテンシを49.9%削減。
  • Apache 2.0ライセンスでGitHubにて公開。
  • Data Pipeline Backend、DataFlow-WebUI、MCP Tools Layer、DataFlow-Skillsの4つのコンポーネントで構成。

開発者はこのフレームワークを使用して、AIエージェントがリスクのある自由形式のコードを書くことなく、構造化データパイプラインを確実に構築・修正できるようにすることができます。

SOURCES

7. Cursor、コーディングエージェント向けにクラウド環境を最適化

Cursorは、AIエージェントがコードを理解、実行、テストするのを支援するために最適化された開発環境の重要な改善を行いました。環境コンテキストをエージェントフレンドリーに構造化することで、クラウドエージェントが貢献したマージ済みプルリクエストの割合が約10%から50%以上に急増したと報告しています。このアップデートは、モデルだけでなくランタイム環境を調整することが、エージェントの生産性を劇的に向上させることを示しています。

  • Cursorは、エージェントがコードを理解・実行・テストしやすくするために開発環境を改善。
  • これらの環境最適化により、クラウドエージェントによるマージ済みプルリクエストへの貢献率が約10%から50%以上に増加。

Cursorを使用する開発者は、最適化された環境コンテキストにより、統合されたエージェントからの自律的かつ成功率の高いコード貢献を期待できます。

SOURCES

8. コードレビューエージェント構築・自己ホスティング用SDK「Tilde」がリリース

開発者のTildeは、カスタムAIエージェントの構築と自己ホスティングを簡素化するために設計されたハーネスSDKプラットフォームをリリースしました。過去1年間のサイドプロジェクトとして開発されたTildeは、OpenClawやHermesの機能をモジュール式のクラウドAPIビルディングブロックに分解しています。開発者がすぐに始められるよう、専用のコードレビューエージェントを構築・自己ホスティングする方法を示す具体的な例を含むGitHubリポジトリも公開されています。

  • Tildeは、過去1年間で開発されたハーネスSDKプラットフォーム。
  • OpenClawやHermesの機能をクラウドAPIのビルディングブロックに分解。
  • 特定のユースケースに合わせてAIエージェントを作成・自己ホスティング可能。
  • API機能を示すサンプルを含むGitHubリポジトリを提供。

開発者はTildeのSDKとサンプルリポジトリを使用して、独自のコードレビューエージェントを迅速に構築、カスタマイズ、自己ホスティングできます。

SOURCES

9. AIエージェント評価のための「Agent Behavior」オープン標準が開始

自律型AIエージェントの評価という課題に対処するため、「Agent Behavior」と呼ばれる新しいオープン標準が開始されました。この標準は、エージェントが信頼できると見なされるために必要な繰り返しの行動や境界を、シンプルなMarkdownファイルで指定します。レビュー担当者、ルーブリック、スコアラーに具体的なフレームワークを提供することで、Agent Behaviorは開発者が実行トレースを体系的にレビューし、堅牢な評価ケースを作成し、エージェントの行動をチームの期待に合わせるためにプロンプトやツールを改善するのに役立ちます。

  • Agent Behaviorは、AIエージェントの行動を軌跡全体にわたって定義・評価するオープン標準。
  • 各行動仕様は、エージェントの信頼性に必要な行動を概説するMarkdownファイルとして記述。
  • レビュー担当者、ルーブリック、スコアラー、評価のための具体的なフレームワークを提供。
  • トレースのレビュー、評価ケースの作成、プロンプトやツールの修正、チームへの行動意図の伝達をサポート。

開発者は、評価ケースを作成し、エージェントのトレースをレビューし、信頼できるエージェントの行動を保証するための構造化された標準化フレームワークを得ることができます。

SOURCES

10. MarbleOS、AIエージェントのインタラクションを視覚的なワークスペースとして再構築

クリエイターのAkilanとMiguelは、AIインタラクションの支配的なチャットベースのパラダイムに挑戦するダウンロード可能なベータ版インターフェース「MarbleOS」を立ち上げました。Xerox PARCやNeXTSTEPといった古典的なGUIの歴史的マイルストーンから着想を得たMarbleOSは、AIを視覚的なワークスペースとして扱います。このプラットフォームはタスクをカードとして表現し、複数のエージェントジョブを同時に実行しながら、ファイル、ツール、成果物を完全に可視化します。また、実行前にエージェントが使用予定のツールを表示し、単純なテキストの書き起こしではなく、スプレッドシートなどの直接使用可能なファイルを出力します。

  • MarbleOSは、Xerox PARC、1984年のMacintosh、NeXTSTEPに触発され、AIをチャットアプリではなくワークスペースとして扱うインターフェース。
  • タスクをカードとして表現し、複数のジョブを同時に実行しながらファイルやツールを可視化。
  • タスク実行前にエージェントが使用予定のツールを表示。
  • チャットの書き起こしではなく、スプレッドシートやPowerPointなどの直接使用可能なファイルを作成。
  • プロジェクトのウェブサイトからベータ版をダウンロード可能。

開発者は、コマンドラインやチャットインターフェースを視覚的なマルチタスクワークスペースに置き換える、エージェントワークフローのための新しいGUIパラダイムを探索できます。

SOURCES

11. WASTEエンジン、64GBのコンシューマーハードウェアでKimi K3推論を実現

Kimi K3のリリースと、それに続くAtomic ChatやUnslothによる量子化の取り組みを経て、ハードウェア要件をさらに引き下げる新しいWASTE推論エンジンがリリースされました。膨大なRAM(1.5TB)や標準的な量子化を必要とした従来の手法とは異なり、WASTEはモデルのトランクをRAMに保持し、エキスパートをディスクからストリーミングすることで、2.78兆パラメータのKimi K3モデルを64GBのMacBook Proで実行可能にします。このアプローチにより、推論速度は低下するものの、標準的なコンシューマーハードウェアでのローカル実行が可能になります。

  • WASTEはオープンソースで依存関係のないC言語の推論エンジン。
  • ディスクからエキスパートをストリーミングすることで、64GBのMacBook ProでKimi K3を実行可能に。
  • Kimi K3で毎秒0.49〜0.54トークンを達成。
  • Kimi-Linear-48Bのような小型モデルでは毎秒10.7トークンをサポート。
  • 実行時にSIMD命令を選択し、Linux、macOS、Windowsをサポート。

この開発は、兆単位のパラメータを持つモデルを実行するためのハードウェアの壁を大幅に引き下げ、エンタープライズグレードのメモリ要件から標準的なコンシューマーノートPCへと移行させます。

SOURCES

12. Hugging Faceストレージバケット、TB単位の価格設定で利用可能に

以前発表されたS3 API互換性に基づき、Hugging Faceはストレージバケットサービスを正式に開始しました。このリリースでは、モデル、データセット、成果物を保存するためのシンプルでフラットなTB単位の価格モデルが導入され、開発者はHugging Faceエコシステム内で従来のクラウドオブジェクトストレージに代わる専用の選択肢を得ることができます。

  • Hugging Faceがストレージバケットサービスを正式に開始。
  • フラットなTB単位の新しい価格構造を採用。
  • 以前発表されたS3 APIサポートにより、既存のストレージツールとのシームレスな統合が可能。

開発者は、既存のS3互換ワークフローと統合できる、価格設定されたフル機能のストレージサービスを利用できるようになりました。

SOURCES

13. ハーネス設計が小型モデル分類の精度を22%向上

4Bモデルで実施された詳細なアブレーション研究により、小型モデルのパフォーマンスに対するハーネスとプロンプト設計の大きな影響が浮き彫りになりました。6GBのノートPC用GPUでKubernetesトリアージタスクを実行し、重みを凍結したままハーネスの変数を分離しました。その結果、精度に22ポイント(60%から82%)の変動が見られました。主な発見として、プロンプト内の明示的なルールが13ポイントの向上、タスクを参考資料の前に配置することが6.5ポイントの向上に寄与しました。逆に、生の証拠の代わりに要約を持ち越すと12ポイントの低下、ステージ間で新しいセッションを引き継ぐと15ポイントの低下が見られました。

  • 6GBのノートPC用GPUで実行される4Bモデルのアブレーション研究により、Kubernetes SIGトリアージタスクにおけるハーネス設計の影響を分離。
  • 同一の凍結重み、250件のゴールドコーパス、単一のスコアラーを使用して、精度が60%から82%まで変動。
  • プロンプト内の明示的なルールで精度が13ポイント向上、タスクを参考資料の前に配置することで6.5ポイント向上。
  • 推論ターンを追加すると精度が5ポイント低下し、生の証拠の代わりに要約を持ち越すと12ポイント低下。
  • ステージ間で新しいセッションを引き継ぐと精度が15ポイント低下。
  • 最もパフォーマンスの低いハーネス設計では、追加ステージと250のツール呼び出しを利用したにもかかわらず、モデル単体の精度に留まった。
  • コーパス、スコアラー、事前登録、実行マニフェストはGitHubで公開。

小型モデルを微調整またはデプロイする開発者は、再トレーニングなしで、プロンプトの配置とセッション管理を最適化するだけで、大幅な精度向上を達成できます。

SOURCES

14. オープンウェイトLLM、規制タスクでクローズドモデルと同等の精度を達成

ClinRegベンチマークを使用した新しい評価により、オープンウェイトLLMが規制および臨床タスクにおいて、主要なクローズドソースモデルと同等の精度を達成していることが明らかになりました。GLM 5.2やKimi K3などのモデルは、OpenAIの独自モデル「GPT 5.6 Sol」の1標準偏差以内で動作しました。これらのオープンウェイトモデルはトップクラスの独自APIの約3分の1のコストで動作するため、開発者は一般的なリーダーボードのランキングではなく、タスク固有のエラープロファイルに基づいてモデルを選択することで、運用コストを大幅に削減できます。

  • ClinRegベンチマークは、GLM 5.2やKimi K3などのオープンウェイトモデルが、独自モデルGPT 5.6 Solの1標準偏差以内で動作することを示している。
  • オープンウェイトモデルは、トップクラスの独自モデルの約3分の1のコストで動作。
  • モデルごとに異なるエラープロファイルを持つため、モデル選択はタスク固有であるべきであることを強調。

専門的なアプリケーションを構築する開発者は、精度を犠牲にすることなく、APIコストを最大3分の2削減するためにオープンウェイトモデルへ移行できます。

SOURCES

15. Manifest、LLMルーターを廃止し手動選択とキャッシュを推奨

Manifestは、7,000人のクラウドユーザーを対象とした4ヶ月間の試験運用を経て、LLMルーター機能を正式に廃止しました。同社は、自動ルーティングが本番アプリケーションにとって逆効果であると結論付けました。Manifestによると、コンテキストはツール呼び出しを通じて動的に明らかになることが多いため、プロンプトの複雑さを初期プロンプトだけで正確に予測することはできません。さらに、自動ルーティングはエージェントワークフローを壊す行動の不一致を導入します。Manifestは現在、開発者に対し、意図に基づいてモデルを手動で選択し、予測可能性を犠牲にすることなくコストを75%〜90%削減できるコンテキストキャッシュを活用するよう助言しています。

  • Manifestは3月にLLMルーターを開始し、7,000人のクラウドユーザーを対象とした4ヶ月間のテストを経て9月1日に廃止。
  • コンテキストはツール呼び出しやウェブ検索を通じて明らかになることが多いため、プロンプトの複雑さをプロンプトだけで判断できないと判明。
  • LLMルーターは行動の一貫性を損ない、予測不可能性を導入し、自動エージェントワークフローのメンテナンスコストを増加させる。
  • キャッシュ読み取りはキャッシュなしの入力より75%〜90%安価であるため、コンテキストキャッシュの方がコスト削減に効果的。
  • Manifestは現在、エンジニアに対し、特定の意図に基づいてモデルとパラメータを手動で選択することを推奨。

エージェントワークフローを構築する開発者は、手動のモデル選択とコンテキストキャッシュの方が予測可能性とコスト削減の面で優れているため、自動LLMルーターの利用を再考すべきです。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。