Inference Brew

OpenAI、GPT-5.6 Solの価格を再調整

00:00 / --:--

← ホームへ戻る

OpenAI、GPT-5.6 Solの価格を再調整

1. OpenAI、GPT-5.6 Solの価格を再調整

OpenAIはGPT-5.6 Solモデルの価格を改定し、今後3ヶ月間、100万入力トークンあたり4ドル、100万出力トークンあたり20ドルに設定しました。これは8月17日に発表された50%の値下げ(それぞれ2.50ドルと15.00ドル)に続くもので、同社のフラッグシップモデルにおける新たな価格帯となります。

  • • OpenAIはGPT-5.6 Solモデルの価格を100万入力トークンあたり4ドル、100万出力トークンあたり20ドルに設定しました。
  • • これは8月17日に発表された50%の値下げに続くものです。
  • • 新しい価格体系は3ヶ月間適用されます。

この調整により、開発者はプラットフォーム上での大規模なエージェントワークロードやコーディングワークロードにおけるコスト見通しを更新できます。

SOURCES

2. Anthropic、エージェント機能を統合し一般提供を開始

アプリ内ブラウザアクセスやマネージドオーケストレーションといったエージェント機能の段階的なリリースを経て、Anthropicは統合されたプロダクション環境を立ち上げました。このプラットフォームはコンピュータ使用、ブラウザアクセス、バージョン管理されたスキル、再利用可能なファイルを統合しており、開発チームは個別の機能テストを超えて、自律型エージェントのための効率的で本番環境に対応した環境へ移行できます。

  • • Anthropicはコンピュータ使用、ブラウザアクセス、バージョン管理されたスキル、再利用可能なファイルを単一のプロダクション環境に統合しました。
  • • プラットフォームが一般提供され、個別の機能リリースから統合されたエージェント展開環境へと移行しました。
  • • スキルのバージョン固定やファイルIDの再利用が可能になり、運用効率が向上します。
  • • 統合された環境は、エージェント実行時のブラウザのラウンドトリップを最小限に抑えるよう設計されています。

個別の機能リリースから統合された環境への移行により、スキルのバージョン固定やブラウザの冗長なラウンドトリップの削減が可能となり、本番グレードのエージェント展開が簡素化されます。

SOURCES

3. Mistral、Search Toolkitに反復的なドキュメント検索を行う「Agentic Search」を追加

Mistralは、以前に統合RAGフレームワークとしてリリースしたSearch Toolkitを拡張し、「Agentic Search」を追加しました。この新機能は、従来のワンショット検索をアクティブな検索ループに置き換えるもので、モデルに「検索」「開く」「ナビゲート」「読み取り」「grep」という5つの操作を装備させ、長いドキュメントを調査して回答を動的に検証できるようにします。この更新により複雑なドキュメントに対する検索精度が大幅に向上し、内部ベンチマークではFinanceBenchの正解率が26.7%から86%に向上しました。

  • • Agentic SearchはMistral Search Toolkitの新しいコンポーネントです。
  • • 「検索」「開く」「ナビゲート」「読み取り」「grep」という5つの操作が導入されました。
  • • 静的なチャンクに頼るのではなく、モデルが参照をたどり、回答を動的に検証できるようになります。
  • • 内部テストではFinanceBenchの正解率が26.7%から86%に向上しました。
  • • 反復的なループにより、複雑なドキュメント検索タスクにおけるテールレイテンシが削減されます。

この更新により、Search Toolkitは静的な検索インターフェースからアクティブなエージェントシステムへと進化し、複雑な複数ページのドキュメントに対してより信頼性の高いRAGパフォーマンスを実現します。

SOURCES

4. DeepSeek、V4-Flashシリーズに実験的なビジョンモデルを追加

既存のV4-Flash APIおよび推論バリアントを基盤として、DeepSeekは「deepseek-v4-flash-vision-exp」モデルを導入しました。この実験的リリースは、V4-Flashエコシステムにマルチモーダル画像分析機能を追加するもので、JPEG、PNG、GIF、WebP形式をサポートし、OpenAIおよびAnthropic APIとのドロップイン互換性を備えています。

  • • 新しいdeepseek-v4-flash-vision-expモデルはマルチモーダル画像分析をサポートします。
  • • OpenAI Chat CompletionsおよびAnthropic /messages APIと互換性があります。
  • • インラインbase64データ、外部URL、Files APIをサポートします。
  • • 画像は自動的に1画像あたり最大384トークンにリサイズされます。

この拡張により、開発者は使い慣れたAPI標準を使用して、既存のV4-Flashワークフローにマルチモーダルなビジョン機能を統合できます。

SOURCES

5. FireRedTeam、オープンソースモデル「FireRedAudio」および「FireRedTTS3」をリリース

FireRedTeamは、高度な音声処理と音声生成のために設計されたモデルスイート「FireRedAudio」および「FireRedTTS3」をオープンソース化しました。FireRedAudioは、ASR(自動音声認識)、音声理解、および最大1時間の録音に対する音声編集をサポートする9Bパラメータのモデルです。FireRedTTS3には2つのバリアントがあり、24言語と21の中国語方言でゼロショット音声クローンを提供する「Base」モデルと、自然言語による説明からの音声デザインやセマンティックな音声編集を可能にする「Instruct」モデルがあります。

  • • FireRedAudioは、ASR、音声理解、音声編集をサポートする9Bパラメータの汎用音声言語モデルです。
  • • FireRedAudioは、時間的グラウンディングを伴う最大1時間の録音を処理できます。
  • • FireRedTTS3には、ゼロショット音声クローン用の「FireRedTTS3-Base」と、音声デザイン用の「FireRedTTS3-Instruct」の2つのバリアントがあります。
  • • FireRedTTS3-Baseは24言語と21の中国語方言でのゼロショット音声クローンをサポートします。
  • • FireRedTTS3-Instructでは、自然言語の説明から音声を生成し、セマンティックな音声編集を行うことができます。

これにより、開発者は高度な音声理解、生成、音声デザインのための強力な自己ホスト型モデルを利用できるようになります。

SOURCES

6. Qwen3-TTSのカスタム実装が50ms未満のレイテンシを達成

Nari Labsは、単一のNVIDIA H100 GPU上で50ms未満のp95初回音声生成時間(TTFA)を達成する、Qwen3-TTS 1.7B CustomVoiceの最適化された実装をリリースしました。このシステムは、毎秒最大10リクエストのトラフィックでこの低レイテンシを維持し、毎秒約630文字を生成し、推定コストは100万文字あたり2ドルです。主なパフォーマンス最適化には、先頭の無音部分の動的トリミング、生成ループの単一CUDAグラフとしてのキャプチャ、およびフレーム履歴全体の再処理を回避するための状態キャッシュベースのコーデックの利用が含まれます。

  • • Qwen3-TTS 1.7B CustomVoiceの実装は、毎秒10リクエストで50ms未満のp95 TTFAを達成します。
  • • トラフィックが毎秒20リクエストに拡大しても、TTFAは100ms未満を維持します。
  • • 最適化には、先頭の無音部分の動的トリミング、フレーム蓄積の調整、共有スケジューラーが含まれます。
  • • システムはCodec Predictorの生成ループを単一のCUDAグラフとしてキャプチャし、状態キャッシュベースのコーデックを使用します。
  • • 入力ストリーミングをサポートしており、完全なテキスト応答を受信する前に音声合成を開始できます。

これにより、超低レイテンシで自然な音声エージェントやリアルタイムの音声対音声アプリケーションが可能になります。

SOURCES

7. Anthropic、Claude Securityを拡張し企業向けにMythos 5を統合

7月に開始されたClaude Securityターミナルプラグインを基盤として、AnthropicはClaude Enterpriseの顧客向けにClaude Securityパブリックベータ版へClaude Mythos 5モデルを統合しました。この拡張により、ユーザーはGitHubリポジトリに直接接続し、自動データフロー追跡と脆弱性特定を行うことができます。安全性を確保するため、インターフェースは直接的なプロンプト入力を制限しており、人間の承認を必要とする構造化されたスキャン結果と推奨パッチを提供します。さらに、Anthropicはオープンソースセキュリティを支援するために3,500万ドルのDefender Advantage Fundを発表しました。

  • • Claude Securityパブリックベータ版は、Claude Enterpriseの顧客向けにClaude Mythos 5モデルを統合しました。
  • • サービスはGitHubリポジトリに接続し、データフローを追跡してパッチを提案します。
  • • インターフェースはエクスプロイト生成を防ぐために直接的なプロンプト入力を制限し、すべてのパッチに人間のレビューを義務付けています。
  • • AnthropicはオープンソースセキュリティのためにClaudeクレジットを提供する3,500万ドルのDefender Advantage Fundを立ち上げました。

この更新により、Mythos 5モデルの高度な機能が企業ワークフローにもたらされ、管理された環境内での自動的かつ安全なコードベースのスキャンと修復が可能になります。

SOURCES

8. Google、Gemini EnterpriseおよびIDEにAntigravityエージェントを導入

5月に開始されたAntigravity 2.0プラットフォームと最近のファイルベースのカスタムエージェントの導入を基盤として、GoogleはAntigravityエージェントをGemini Enterpriseに統合することでエコシステムを拡大しました。この更新により、エンタープライズ開発者はVS Code、Visual Studio、JetBrains、Zed全体で統一されたエージェントワークスペースを利用できます。組織的な展開をサポートするため、この統合にはサンドボックス、ツール権限、予算、監査を管理するための新しい管理コントロールが含まれています。

  • • Antigravityエージェントは、対象となるGemini Enterpriseサブスクリプション内で利用可能になりました。
  • • 新しいIDE拡張機能により、VS Code、Visual Studio、JetBrains、Zed向けの統一されたエージェントワークスペースが提供されます。
  • • エンタープライズ管理者は、サンドボックス、予算、監査のための一元化されたコントロールを利用できます。
  • • この更新は、既存のAntigravity 2.0フレームワークとカスタムエージェント構成を基盤としています。

この開発により、Antigravityはスタンドアロンの開発者ツールから、エンタープライズ対応のIDE統合ワークフローへと移行し、開発チーム全体での一元管理と一貫したエージェントアクセスが可能になります。

SOURCES

9. Anthropic、会議からエージェントワークフローへの移行を支援する「Project Parka」をプレビュー

Anthropicは、ライブ会議と自律的な開発をつなぐために設計されたMac向けのアプリケーション「Project Parka」をプレビューしています。このツールはシステムおよびマイクの音声をキャプチャし、話者属性付きのトランスクリプトをClaudeのエージェントに直接ストリーミングして、実行可能な実装プロンプトを生成します。システムはタスク作成を自動化しますが、エージェントがこれらのタスクを自動的に実行するのか、それとも人間の承認を必要とするのかについては、Anthropicはまだ明らかにしていません。

  • • Project Parkaは、システムおよびマイクの音声をキャプチャできるMac向けの機能です。
  • • システムは話者属性付きのトランスクリプトをストリーミングし、Claudeのエージェント用の実行可能な作業を作成します。
  • • ライブ会議を直接、完全な実装プロンプトに変換するように設計されています。
  • • Claudeがアクションを自動的に実行するのか、ユーザーの手動承認が必要なのかは不明です。

これにより、話者属性付きのトランスクリプトをエージェントのプロンプトに直接ストリーミングすることで、ライブ会議から実行可能なコードへの移行が自動化されます。

SOURCES

10. NVIDIA、自律エージェント向けのモデル非依存型AVOアーキテクチャを導入

NVIDIAは、持続的で長期的な自律エージェント運用向けに設計されたモデル非依存型フレームワーク「Agentic Variation Operators (AVO)」アーキテクチャを開発しました。AVOは永続メモリを使用して以前の推論を保存し、進捗が停滞した際に戦略をリダイレクトするスーパーバイザーメカニズムを利用します。このアーキテクチャは、テキストのみの64x64グリッドを使用してARC-AGI-3ベンチマークで100%の成功率を達成し、GPUカーネルを自律的に最適化してFlashAttention-4を最大10.5%上回るという実用的な有用性を示しました。

  • • AVOアーキテクチャは、永続メモリとスーパーバイザーメカニズムを使用して進捗を監視し、戦略をリダイレクトします。
  • • AVOはARC-AGI-3ベンチマークで100%の成功率を達成し、25環境にわたる183レベルすべてを完了しました。
  • • システムはARC-AGI-3上でテキストのみのモダリティで動作し、画像トークンなしの64x64テキストグリッドとして観測を受け取りました。
  • • 7日間のGPUカーネル最適化研究において、AVOはFlashAttention-4を最大10.5%上回るアテンションカーネルを生成しました。
  • • AVOはモデル非依存であり、Claude Opus 5とGPT-5.6 Solの両方を使用して検証されています。

これは、コードを最適化し複雑なタスクを解決する、長期的な自律エージェントを構築するための非常に効率的でモデル非依存型のフレームワークを提供します。

SOURCES

11. DeepSeek Harness v0.1.1、ネイティブ画像サポートとMCP統合を追加

DeepSeek-Harness (dsh-v0.1.1-rc.1)のリリースでは、マルチモーダルモデル「DeepSeek-V4-Flash-Vision-Exp」のネイティブ統合が導入されました。この更新により、/goalや/planといったコマンドがテキストと画像の両方の入力を受け入れられるようになり、@メニューがファイルやセッションを参照できるようになりました。エージェント開発者にとって重要な点として、Model Context Protocol (MCP/ACP)の統合が永続的な画像添付をサポートし、PTCモードがネストされた画像を転送するように更新されました。

  • • DeepSeek-Harness v0.1.1-rc.1は、DeepSeek-V4-Flash-Vision-Expモデルのサポートを導入しました。
  • • この更新によりネイティブな画像リクエストが可能になり、/goalや/planコマンドがテキストと画像の両方の入力を受け入れられるようになりました。
  • • MCP/ACP統合が永続的な画像添付をサポートするようになりました。
  • • PTCモードが更新され、ネストされた画像の転送をサポートするようになりました。

これにより、開発者がMCPサーバーやネストされたワークフローを通じて永続的な画像を渡せるようになり、マルチモーダルエージェントの開発が効率化されます。

SOURCES

12. AutoFigureツールキット、科学図の生成を自動化

AutoFigureは、テキストの説明、論文の内容、および方法論の解説から、科学図やダイアグラムをプログラムで生成するために設計された新しいツールキットです。このパイプラインは、オフラインでのSVG検証、PNGレンダリング、およびdraw.io互換の出力生成をサポートしています。開発者はAPIベースの生成を構成し、参照画像を使用してスタイルガイドラインを適用し、完成したアセットをzipアーカイブとしてエクスポートしたり、HTMLギャラリーで表示したりできます。

  • • AutoFigureは、テキストの説明、論文の内容、方法論の解説から科学図を生成します。
  • • ツールキットは、オフラインでのSVG検証、PNGレンダリング、draw.io互換の出力をサポートしています。
  • • ワークフローには、APIベースの生成の構成や、スタイル調整のための参照画像の使用が含まれます。
  • • Colabでの出力表示、HTMLレビューギャラリーの構築、アセットのエクスポートのためのツールを提供します。

これにより、SVG、PNG、draw.io互換のダイアグラムをプログラムでレンダリングすることで、ドキュメントインテリジェンスパイプラインが簡素化されます。

SOURCES

13. Claudetteツール、冗長なClaude Code出力を平易な英語に翻訳

よりクリーンなターミナル出力を求める開発者は、Claude Codeの応答から冗長なクリックベイト風の言語を取り除くために設計された新しいオープンソースツール「Claudette」を使用できます。MITライセンスの下でリリースされたこのツールは、Claudeの出力をインターセプトし、認証済みのGemini CLIインストールを使用して平易な英語に翻訳します。Geminiの翻訳をそのまま出力することで、ClaudetteはClaudeがテキストを再編集するのを防ぎ、直接的で簡潔なターミナル対話を保証します。

  • • Claudetteは、GitHubリポジトリadnanakil/nobuzzで入手可能なMITライセンスのツールです。
  • • このツールはGemini CLIを使用して、Claude Codeの応答を平易な英語に翻訳します。
  • • Geminiの翻訳をそのまま出力することで、Claudeが再編集して冗長な言語を再導入するのを防ぎます。
  • • 要件には、Claude Codeと認証済みのGemini CLIインストールが含まれます。

これにより、冗長で会話的なAIの応答を直接的で実行可能なターミナル出力に整理することで、開発者の生産性が向上します。

SOURCES

14. Speech Agent Arena、音声対音声モデルのベンチマークを開始

新しく立ち上げられたSpeech Agent Arenaは、エージェント型および非エージェント型のシナリオ全体で、有料の人間参加者を使用して音声対音声モデルを評価するための標準化されたベンチマークを提供します。初期のランキングでは、会話の好みとタスク実行の間に乖離があることが明らかになりました。Gemini 3.1 Flash Live Preview - Minimalは、1時間あたり1.50ドルで1,046のEloスコアを獲得し、会話の好みでリードしていますが、タスク成功率は74.6%にとどまっています。対照的に、Grok Voice Think Fast 2.0 Highは1時間あたり4.80ドルで94.7%のタスク成功率をリードし、OpenAIのGPT-Realtime-2.1 Highは1時間あたり10.75ドルで91.5%の成功率に達しています。

  • • Speech Agent Arenaは、15のエージェント型シナリオと20の非エージェント型シナリオで、有料の人間参加者を使用してモデルを評価します。
  • • Gemini 3.1 Flash Live Preview - Minimalは、1時間あたり1.50ドルのコストで1,046のEloスコアを獲得し、会話の好みでリードしています。
  • • SpaceXAI Grok Voice Think Fast 2.0 Highは、94.7%のタスク成功率でリードしていますが、コストは1時間あたり4.80ドルです。
  • • Gemini 3.1 Flash Live Preview - Minimalは、会話の好みでリードしているにもかかわらず、タスク成功率は74.6%にとどまりました。
  • • OpenAIのGPT-Realtime-2.1 Highは、1時間あたり10.75ドルのコストで91.5%のタスク成功率を達成しました。

これにより、開発者は実際の音声エージェント展開のための、客観的で人間が評価したコストとパフォーマンスのベンチマークを得ることができます。

SOURCES

15. AWS Bedrock上のCodex CLIのバグによりGPT-5.6 Solで10倍の料金が発生

Amazon BedrockでネイティブCodex CLI(バージョン0.147.0)を使用している開発者は、GPT-5.6 Solモデルのプロンプトキャッシュを妨げる重大なバグを報告しています。CLIがリクエストボディでprompt_cache_optionsまたはprompt_cache_breakpointをシリアル化できないため、エージェント型のコーディングワークロードはキャッシュされた入力を使用せずに大量のキャッシュ書き込みトークン量を発生させています。影響を受けたセッションの分析では、キャッシュ書き込みトークンがモデル総支出の約85%を占めており、最大10倍高い料金が発生していることが示されています。

  • • ネイティブCodex CLIバージョン0.147.0は、Amazon Bedrock上のGPT-5.6 Solに対する明示的なプロンプトキャッシュのサポートを欠いています。
  • • このバグにより、エージェント型ワークロードにおける推定支出の約85%をキャッシュ書き込みトークンが占めるようになります。
  • • あるローカルセッションでは、76のリクエストで670万のキャッシュ書き込みトークンが記録され、キャッシュされたトークンはゼロでした。
  • • この問題は、プロバイダーがリクエストボディでprompt_cache_optionsまたはprompt_cache_breakpointをシリアル化できないことが原因です。

これにより、AWS BedrockでCodex CLIを使用している開発者は、予期せぬ高額なAPI請求を回避できます。

SOURCES

16. Llama.cppフォーク、ローカル推論を高速化するDSpark PC Treeを実装

ある開発者が、Parent Conditioned Drafting Tree (DSpark PC Tree)推論デコーディング手法を実装したllama.cppの独立したフォークをリリースしました。RTX 5090上でQwen 3.0を使用したベンチマークテストでは、k3/n16構成で毎秒159トークンを達成し、ベースラインと比較して1.69倍の高速化を実現しました。この実装はオープンソースであり、さまざまなタスクカテゴリ全体でローカル推論速度を最適化することを目的としています。

  • • この実装はDSpark PC Tree研究論文に基づいており、GitHubで入手可能です。
  • • RTX 5090 GPUとQwen 3.0を使用したテストでは、毎秒159.00トークンを達成し、ベースラインから1.69倍の高速化を実現しました。
  • • k3/n16構成は、SPEED-Benchの11カテゴリ中9カテゴリで線形DSparkを上回り、要約で6.56%の向上を示しました。
  • • より大きなk4/n22構成はより多くのドラフトを受け入れましたが、検証バッチコストの増加を相殺するには至りませんでした。

これにより、精度を犠牲にすることなく、コンシューマーGPUでのローカルモデル推論が最大1.69倍高速化されます。

SOURCES

17. Qwen 3.8 27BのBlackwellネイティブNVFP4量子化がリリース

Qwen 3.8 27B向けに、Blackwellネイティブでプリフィル最適化された4ビット量子化(NVFP4)がリリースされました。RTX 5090でベンチマークされたNVFP4量子化は、2,048トークンのプリフィルで毎秒6,250トークンを達成し、標準のQ4_0およびQ6_K量子化を上回りました。このリリースには、量子化されたMulti-Token Prediction (MTP)ドラフトヘッドもパッケージ化されており、推奨設定で構成するとさらに15%のパフォーマンス向上が得られます。

  • • 新しいNVFP4量子化は、同じメモリフットプリントを持つ標準のQ4量子化よりも50%高速に動作します。
  • • RTX 5090でのベンチマークテストでは、2,048プリフィル(pp2048)で毎秒6,250トークンを達成しました。
  • • このリリースは、Unslothの実装など、他のNVFP4量子化よりも4%から7%高速に動作します。
  • • GGUFリリースには、さらに15%の高速化を提供する量子化されたMulti-Token Prediction (MTP)ドラフトヘッドが含まれています。

これにより、RTX 5090またはBlackwellハードウェアでローカル推論を実行している開発者は、プリフィル時間を大幅に短縮できます。

SOURCES

18. AMD Instinct Coder、推論をローカルハードウェアにルーティング

AMDは、Spectro Cloudとのパートナーシップで開発されたサービス「Instinct Coder」を導入しました。これは、開発者のコーディング推論をローカルハードウェアでホストされているオープンウェイトモデルにルーティングするものです。このサービスは商用フロンティアモデルの自己ホスト型代替手段を提供するように設計されており、AMDはエンタープライズ開発チームにとって最大70%のコスト削減が可能であると主張しています。

  • • AMD Instinct Coderは、Spectro Cloudを搭載したサービスです。
  • • このサービスは、推論ワークロードをローカルハードウェアで実行されているオープンモデルにルーティングします。
  • • フロンティアクラウドモデルを使用する場合と比較して、最大70%のコスト削減が可能であると主張しています。

これはクラウドベースのコーディングアシスタントの自己ホスト型代替手段を提供し、最大70%のコスト削減を謳っています。

SOURCES

19. NVIDIA、モデル間KVキャッシュ転送のための線形数学手法を導入

NVIDIAの研究者は、開発者がプリフィルされたKVキャッシュをソースモデルからターゲットモデルに直接マッピングできる、モデル間KVキャッシュ転送手法を導入しました。単純な線形数学(具体的には閉形式のヘッドごとのリッジマッパー)を利用することで、このフレームワークは高価なディープラーニングモデルのトレーニングを回避します。マッピングプロセスは、会話をゼロから再計算するよりも最大25倍高速に実行され、ファミリー内転送においてターゲットモデルのスタンドアロン精度の最大98%を保持します。

  • • この手法は、閉形式のヘッドごとのリッジマッパーを使用して、プリフィルされたKVキャッシュをソースモデルからターゲットモデルにマッピングします。
  • • マッピングプロセスは、会話を再計算するよりも2.7倍から25倍高速に実行されます。
  • • ファミリー内転送(例:Qwen3、Llama 3.1)において、ターゲットモデルのスタンドアロン精度の最大98%を保持します。
  • • より複雑なモデルペアの場合、90%を超える精度を回復するために、小さな非線形多層パーセプトロンが使用されました。

これにより、開発者は高価な再計算やモデルトレーニングなしで、異なるモデル間でアクティブな会話を引き継ぐことができます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。