Inference Brew

OpenAIがGPT-Live-1をAPI開発者向けに公開

00:00 / --:--

← ホームへ戻る

OpenAIがGPT-Live-1をAPI開発者向けに公開

1. OpenAIがGPT-Live-1をAPI開発者向けに公開

OpenAIは、GPT-Live-1モデルへのアクセスを拡大し、ChatGPT専用機能から開発者向けAPI製品へと移行しました。1分あたり0.05ドルで提供されるこのモデルにより、開発者は全二重音声機能(聞き取りと発話を同時に行う機能)を自社アプリケーションに統合できます。今回のリリースは7月の一般向け公開に続くもので、開発者は音声エージェント向けにネイティブな割り込み処理やリアルタイム推論機能を利用できるようになります。

  • • GPT-Live-1がOpenAI APIで1分あたり0.05ドルで利用可能になりました。
  • • 全二重音声に対応しており、聞き取りと発話を同時に行えます。
  • • 12種類の音声オプションとネイティブな割り込み処理が含まれています。
  • • ライブ音声対話中にバックグラウンドでの推論やアクションの実行が可能です。
  • • 初期テストでは、従来のターン制システムと比較して割り込みが80%削減されることが示されています。

開発者は、ChatGPTに限定されていた技術を活用し、割り込みを自然に処理し、会話の途中で複雑な推論を行う、極めて自然なリアルタイム音声インターフェースを構築できるようになりました。

SOURCES

2. OpenAIが画像生成モデル「GPT Image 2.5 Flare」および「Sunburst」を発表

OpenAIは画像生成スイートを更新し、「GPT Image 2.5 Flare」と「Sunburst」をリリースしました。Flareは低遅延の日常的な画像生成向けに構築されており、Sunburstは詳細なクリエイティブ作業や精密な編集制御に最適化されています。両モデルとも価格は100万画像出力トークンあたり30ドルで、GPT Image 2と同価格であり、OpenAI APIを通じて即座に利用可能です。SunburstはArtificial Analysisの画像編集リーダーボードで首位を獲得しており、複雑なレイアウト、テキストレンダリング、構造的な編集の処理において大幅な改善を示しています。

  • • OpenAIはGPT Image 2のリリースから5ヶ月を経て、GPT Image 2.5 FlareとSunburstをリリースしました。
  • • Flareは低遅延の日常的な生成に最適化され、Sunburstは高品質なクリエイティブ作業と厳密な編集制御向けに設計されています。
  • • 両モデルともテキストから画像への生成および画像編集をサポートし、価格は100万画像出力トークンあたり30ドルです。
  • • FlareとSunburstはArtificial Analysisの画像リーダーボードで上位2位を占めています。
  • • Sunburstは画像編集の10のユースケースのうち8つで首位に立ち、複雑な構成、図表、クリエイター向けコンテンツで大きな進歩を見せています。
  • • これらのモデルはOpenAI APIを通じて利用可能であり、ChatGPTおよびCodexにも統合されています。

開発者は、従来モデルよりも高価なコストを支払うことなく、より高速で高品質な画像生成と精密な構成編集をアプリケーションに統合できます。

SOURCES

3. Cohereが218BパラメータのMoE翻訳モデル「North Small Translate」をリリース

Cohereは、50言語にわたる高品質な機械翻訳に最適化された2180億パラメータのスパースMixture-of-Experts(MoE)モデル「North Small Translate」をリリースしました。トークンあたり250億パラメータをアクティブ化するこのモデルは、128の専門家(エキスパート)を備えたデコーダーのみのアーキテクチャを採用し、16Kの入出力コンテキストウィンドウをサポートしています。開発者はCohereのAPI経由でアクセスするか、4ビット量子化バージョンを単一のB200またはデュアルH100構成でセルフホストすることができ、ローカルでの高スループットな翻訳パイプラインとして活用可能です。

  • • North Small Translateは、合計218B、アクティブ25Bパラメータを持つスパースMixture-of-Experts(MoE)モデルです。
  • • 50言語の翻訳をサポートし、16Kの入力および16Kの出力コンテキストウィンドウを備えています。
  • • CohereのAPI経由、非商用目的のセルフホスト、または商用ライセンスの下で利用可能です。
  • • 4ビット量子化バージョンは、単一のB200または2基のH100 GPUでローカル実行可能です。
  • • エージェント型のバリアントはマルチパスワークフローを使用してエラーを修正し、CohereのWMT26評価で84.36を記録しました。

開発者は、高精度なオープンウェイト翻訳モデルを標準的なエンタープライズハードウェア上でローカルにデプロイするか、API経由でアクセスして多言語アプリケーションに組み込むことができます。

SOURCES

4. 25言語対応の音声認識モデル「Orukeet」がリリース

Orukeetは、NVIDIA Parakeet TDT 0.6B v3アーキテクチャをベースに構築された高性能な25言語対応自動音声認識(ASR)モデルとしてリリースされました。エンコーダーのテンポラル深層フィルタの半分を12,288個の適合・固定されたガボールカーネルに置き換えることで、Orukeetは25のFLEURS言語全体で、元のParakeetモデルと比較して単語誤り率(WER)を相対的に10.6%削減しました。このオープンウェイトモデルは、ローカルデプロイメント向けの非常に正確な多言語アクセント対応の音声テキスト変換ソリューションを開発者に提供します。

  • • Orukeetは、NVIDIA Parakeet TDT 0.6B v3モデルから構築された25言語対応の音声認識モデルです。
  • • エンコーダーのテンポラル深層フィルタの半分を12,288個の適合・固定されたガボールカーネルに置き換えています。
  • • OrukeetはLibriSpeech test-cleanで1.46%の単語誤り率(WER)を達成し、Parakeetの1.53%を上回りました。
  • • 25のFLEURS言語全体で、Orukeetは9.85%のプールされたWERを達成し、Parakeetに対して相対的に10.6%の削減を実現しました。
  • • このモデルは多言語および多アクセントのデータで学習されており、最終的な適応にはLibriSpeech test-otherが使用されています。

音声機能やスピーチ機能を構築する開発者は、複数の言語で単語誤り率を低減できる、高精度なオープンウェイトの音声テキスト変換モデルを採用できます。

SOURCES

5. 「Qwen3.8-27B-Humanlike-Chat」モデルがリリース

標準的なAIアシスタントに特徴的な、過度に冗長で洗練されたトーンに対抗するため、開発者が「Qwen3.8-27B-Humanlike-Chat」をリリースしました。これは、アブレーション(abliterated)されたQwen3.8-27Bベースモデルに対して、125,000件以上の人間同士のメッセージデータセットを用いてランク256のLoRAで微調整されたものです。結果として得られるモデルは、複雑なシステムプロンプトを必要とせず、より短く、非公式で、現実的な会話応答を自然に生成します。現在、Hugging Faceでオープンウェイトとして公開されており、レート制限付きのOpenAI互換APIエンドポイント経由でも利用可能です。

  • • このモデルは、標準的なAIアシスタントに典型的な、過度に親切で洗練され、冗長なトーンに対処するために学習されました。
  • • 1,396の会話にわたる125,217件の人間同士のメッセージデータセットを使用して学習されました。
  • • huihui-ai/Huihui-Qwen3.8-27B-abliteratedベースモデルにランク256のLoRAを適用して学習が行われました。
  • • 特定のシステムプロンプトを必要とせず、より短く、洗練されすぎない応答を生成します。
  • • Hugging Face、デモスペース、およびレート制限付きのOpenAI互換APIエンドポイントを通じて利用可能です。

会話型エージェントを構築する開発者は、過度に冗長でロボットのようなアシスタントテンプレートを回避し、人間同士の現実的な対話を自然に模倣するモデルをデプロイできます。

SOURCES

6. Sakana AIがFuguオーケストレーションプラットフォームを拡張、「Fugu Max」と「Fugu Ultra v2」を追加

Fugu-Cyberエンドポイントで拡張されたFuguオーケストレーションプラットフォームを基盤として、Sakana AIは「Fugu Max」と「Fugu Ultra v2」という2つの新しいモデルを立ち上げました。これらのモデルは単一のOpenAI互換API経由で利用可能であり、開発者はコスト効率や複雑な推論のためにモデルプール全体でタスクをルーティングできます。Fugu Maxは低コスト向けに最適化されており、Fugu Ultra v2は高度な多段階推論に焦点を当てています。なお、これらのモデルはセルフホスト不可であり、EU/EEA地域からは利用できません。

  • • Fugu MaxとFugu Ultra v2は、Fuguオーケストレーションプラットフォームへの新しい追加機能です。
  • • Fugu Maxはコスト効率を重視し、入力100万トークンあたり2ドル、出力100万トークンあたり6ドルで提供されます。
  • • Fugu Ultra v2は複雑な推論向けに設計されており、DeepSWEベンチマークで74.3を記録しました。
  • • これらのモデルはホスト型のOpenAI互換API経由で利用可能です。
  • • これまでのFuguエンドポイントと同様に、セルフホストはできず、EU/EEA地域は対象外です。

このアップデートにより、開発者はFuguエコシステム内で追加の専門的なルーティングオプションを利用できるようになり、コストと推論パフォーマンスをより細かく制御できます。

SOURCES

7. 超低遅延・低コストの「Octen Search」が登場

Octen Searchは、AIエージェント向けの速度とコスト効率に重点を置いた検索API市場に参入しました。Artificial Analysisの検索インデックスで3位に初登場したこのサービスは、平均クエリ遅延がわずか0.2秒(Perplexity Searchのバリアントより5倍高速)で、複雑な検索タスクを16.9秒で完了します。1,000クエリあたり1ドルという非常に競争力のある価格設定により、Octen SearchはLLMやエージェントをリアルタイムのWebデータにグラウンディングするための、高性能かつ低コストな選択肢を開発者に提供します。

  • • Octen SearchはArtificial Analysisの検索インデックスでスコア77を獲得し、3位に初登場しました。
  • • タスクあたりの最速処理時間16.9秒を達成し、モデルのみのベースラインである22.6秒を上回りました。
  • • クエリあたり平均0.2秒で、Perplexity Searchのバリアントより5倍高速です。
  • • Octen Searchは1,000検索クエリあたり1ドル(検索インデックスタスクあたり0.058ドル)で提供されます。
  • • ベンチマークは、固定されたベースモデルを使用したオープンソースエージェントハーネス「Stirrup」を使用して実施されました。

検索機能を持つエージェントを構築する開発者は、速度に最適化された検索プロバイダーに切り替えることで、遅延とAPIコストを劇的に削減できます。

SOURCES

8. マルチモデルコーディングエージェント「Devin Fusion」がベンチマークされローンチ

SWE-2モデルの最近の統合を基盤として、Cognitionは「Devin Fusion」を正式にローンチしました。このマルチモデルエージェントアーキテクチャは、Claude Fable 5.1やGPT-6 Astraなどのフロンティアモデルと、SWE-2サイドキックモデルを組み合わせることで、能力と実行コストのバランスを取ります。このシステムはArtificial Analysisのコーディングエージェントインデックスに初登場し、エージェントワークフローの速度とコスト効率に関するベンチマークデータを提供しています。

  • • Devin Fusionは、Artificial Analysisのコーディングエージェントインデックスに掲載された初のマルチモデルコーディングエージェントです。
  • • Claude Fable 5.1 (xhigh) と SWE-2 (medium) を組み合わせた構成は、コーディングエージェントインデックスv1.5でスコア62を達成しました。
  • • GPT-6 Astra (xhigh) と SWE-2 (medium) の構成はスコア59を記録し、Claude Fableのセットアップよりも43%安価で31%高速でした。
  • • Cognitionは、Fusionモデルの技術的な詳細を説明するローンチブログ記事を公開しました。

開発者は、Artificial Analysisのコーディングエージェントインデックスの標準化されたベンチマークを使用して、Devin Fusionのマルチモデル構成のパフォーマンスとコストのトレードオフを評価できるようになりました。

SOURCES

9. AnthropicがClaude Code向けプラグイン評価機能を導入

Anthropicは、バージョン2.1.269からClaude Codeにネイティブなプラグイン評価ワークフローを追加しました。この新機能により、開発者はプラグインを無効にしたベースラインと比較することでカスタムプラグインのパフォーマンスを測定し、明確なデルタスコアを生成できます。このフレームワークは6種類のグレーダー(評価器)タイプをサポートしており、そのうち4つは無料で実行でき、2つは有料のLLM呼び出しをジャッジとして利用します。新しい「claude-code eval」コマンドを使用することで、開発者はテストスイートを自動生成し、エージェントスキルのリグレッション(退行)を防ぐためにCIパイプラインに直接統合できます。

  • • AnthropicはClaude Code(v2.1.269以降)向けの新しいプラグイン評価ワークフローを導入しました。
  • • このワークフローは、プラグインのパフォーマンスをプラグインなしのベースラインと比較してデルタスコアを算出します。
  • • システムは6種類のグレーダータイプをサポートしており、4つの無料グレーダーと2つの有料LLMジャッジグレーダーが含まれます。
  • • 「claude-code eval」コマンドは、プラグインの初期テストスイートとグレーダーを自動生成できます。
  • • 評価はCIパイプラインに直接統合でき、新しいスキルの品質ゲートとして機能します。

Claude Code用のカスタムプラグインやスキルを構築する開発者は、自動化されたマルチグレーダー評価を使用して、コードを体系的にテスト、ベンチマーク、およびゲート(品質管理)できるようになりました。

SOURCES

10. LiteLLMの軽量・低依存代替ライブラリ「litelm」

アプリケーションの依存関係を削減したい開発者は、人気のLiteLLMライブラリの軽量な代替品である「litelm」を使用できるようになりました。わずか2,900行のコードで記述され、依存関係は2つ(openaiとhttpx)のみのlitelmは、プロキシサーバーやキャッシュなどの重い機能を省略し、コアとなるルーティング、メッセージ変換、ストリーミング、ツール使用、埋め込みに厳密に焦点を当てています。APIはLiteLLMを直接模倣するように設計されており、ドロップインでの置き換えが可能で、DSPyとの検証済み統合に加え、完全な非同期サポートが含まれています。

  • • litelmは、約2,900行のコードと2つの依存関係(openaiおよびhttpx)のみで構成される最小限のLLMルーティングライブラリです。
  • • APIはLiteLLMを模倣しており、開発者はインポート文を更新するだけで切り替え可能です。
  • • 標準的なプロバイダー/モデル名の構文を使用して19のプロバイダーへのルーティングをサポートし、acompletionのような非同期バリアントも含まれています。
  • • ライブラリはプロバイダーのエラーをカスタム例外階層(例:ContextWindowExceededError)にマッピングします。
  • • 現在アルファ版であり、7つの実行パスにわたるDSPy統合のサポートが検証されています。

開発者は、肥大化したルーティングライブラリを、API互換性とネイティブな非同期サポートを維持した、最適化された最小限の依存関係ラッパーに置き換えることができます。

SOURCES

11. ローカルオートコンプリートモデルの微調整を簡素化する「CodeFinetuner」

CodeFinetunerは、開発者が独自のプライベートコードベースで小さなローカルコードオートコンプリートモデル(Qwen2.5-Coder-3Bなど)を微調整できるように設計されたエンドツーエンドパイプラインとして立ち上げられました。「uv tool install codefinetuner」でインストール可能なこのツールは、Unslothを活用してVRAM使用量を最小限に抑え、Mac(MPS)とNVIDIA(CUDA)の両方のハードウェアでのトレーニングをサポートしています。このパイプラインは、tree-sitter解析からLoRA微調整、評価、GGUF変換まで、プロセス全体を自動化し、llama.vimやllama.vscodeなどのローカルエディタ拡張機能に直接組み込めるモデルを生成します。

  • • CodeFinetunerは、特定のコードベースで小さなコードオートコンプリートモデルをLoRA微調整するためのエンドツーエンドパイプラインです。
  • • このツールは、オプションのUnsloth統合により、Mac(MPS)とNVIDIA(CUDA)の両方のハードウェアでのトレーニングをサポートしています。
  • • ワークフローは、tree-sitter解析、LoRA微調整、評価(CodeBLEU/perplexity)、GGUF変換を処理します。
  • • 生成されたGGUFモデルは、llama.vimやllama.vscodeなどのローカルエディタツールと互換性があります。
  • • このツールは「uv tool install codefinetuner」で即座にインストール可能です。

開発者は、ローカルのオートコンプリートモデルをプライベートなコードベースに合わせて簡単にカスタマイズし、MacやNVIDIAハードウェア上で効率的に実行できます。

SOURCES

12. GoogleがAgent Plugins 1.0.0標準に基づくCloud Developer Pluginをローンチ

8月のAgent Plugins 1.0.0オープン標準のリリースに続き、Googleは「Google Cloud Developer Plugin」をローンチしました。この新しいツールセットは、AIコーディングエージェントがGoogle Cloudインフラストラクチャと対話し、構成し、管理するための専門的なスキルを備えたインストール可能なバンドルを提供し、最近確立されたプラグイン仕様の実用的な応用を示しています。

  • • GoogleはAgent Plugins 1.0.0標準を実装したGoogle Cloud Developer Pluginをリリースしました。
  • • このプラグインは、Google Cloudリソースを管理するためのインストール可能なツールバンドルを提供します。
  • • AIエージェントがGoogle Cloud環境内でデプロイメント、管理、トラブルシューティングのタスクを実行できるようにします。

このリリースはAgent Plugins 1.0.0標準の採用を示すものであり、開発者は標準化されたポータブルなクラウド管理機能をAIエージェントのワークフローに直接統合できるようになります。

SOURCES

13. Google Researchがツール使用データ生成フレームワーク「ToolGrad」をリリース

Google、東京大学、理化学研究所、東北大学の研究者は、ツール使用および関数呼び出しモデル向けの高品質なトレーニングデータを生成するために設計されたオープンソースフレームワーク「ToolGrad」をリリースしました。従来のパイプラインを反転させ、まず検証済みのツール使用チェーンを構築してから対応するユーザークエリを生成することで、ToolGradはToolBenchで99.8%のデータ生成成功率を達成しました。この手法を使用して、研究者はBerkeley Function Calling Leaderboardで83.1を記録したGemma-3 12Bモデルを微調整し、教師モデルであるGemini 2.5 Flash-Liteを実際に上回りました。このフレームワークは、Apache-2.0ライセンスの下でPyPIパッケージとして利用可能です。

  • • ToolGradは、まず検証済みのツール使用チェーンを構築し、次に一致するユーザークエリを生成することで、標準的なデータ生成を反転させます。
  • • このフレームワークは、深さ優先探索と比較して、ToolBenchでのデータ生成成功率を63.8%から99.8%に向上させました。
  • • 研究者はToolGradを使用して、Gemini 2.5 Flash-Liteを用いたGemma-3モデル(1B、4B、12B)の微調整を行いました。
  • • 結果として得られたToolGrad-12Bモデルは、Berkeley Function Calling Leaderboardで83.1を記録し、教師モデルを上回りました。
  • • ToolGradのコードはApache-2.0ライセンスでリリースされており、モデル、データセット、PyPIパッケージが利用可能です。

開発者は、高品質な関数呼び出しデータセットを生成し、ツール使用においてフロンティアAPIを上回る、小さく非常に効率的なローカルモデルを微調整できます。

SOURCES

14. Llama-Managerが生成中の動的なモデル再構成を実現

「llama-manager」と呼ばれる新しいツールは、アクティブなトークン生成を中断することなく、llama.cppで実行されているローカルモデルを動的に再構成する方法を開発者に提供します。再構成中にKVキャッシュを保持することで、llama-managerは推論の高速化(speculative decoding)を切り替えたり、コンポーネントをCPUに移動したり、KVキャッシュの量子化を調整したりする際に、プロンプトを再処理する必要をなくします。単一の32GB GPUでのベータテストにおいて、このツールは動的なメモリ戦略を使用して、Qwen3.8-27Bモデルのコンテキストウィンドウを167,680トークンから262,144トークンに拡張することに成功しました。

  • • llama-managerは、ロード後の動的なモデル構成を可能にするllama.cppフォーク用のラッパーです。
  • • このツールはトークン生成の途中でのモデルのホットリロードをサポートし、KVキャッシュを保持してプロンプトの再処理を回避します。
  • • ユーザーは推論の高速化の切り替え、コンポーネントのCPUへの移動、KVキャッシュの量子化の更新を動的に行うことができます。
  • • 32GB GPUでQwen3.8-27B-UD-Q4_K_XLを実行した際、コンテキストウィンドウを167,680から262,144トークンに拡張しました。
  • • このプロジェクトは現在ベータ版であり、単一GPUでの推論に制限されています。

ローカルモデルを実行している開発者は、量子化、推論の高速化、オフロード戦略をその場で動的に調整し、限られたGPUメモリ上でコンテキスト長を最大化できます。

SOURCES

15. Qwen 3 4Bを100個の論理パズルで微調整し、数学ベンチマークを31%向上

ターゲットを絞った微調整の驚くべき実証として、Qwen 3 4Bベースモデルをわずか100個のゼブラパズルという小さなデータセットでトレーニングすることで、MATH-500ベンチマークで31%のパフォーマンス向上が得られることが示されました。トレーニング全体は、単一のH100またはH200 GPU上で6.5分で完了しました。共有された再現用ノートブックを含むこのレシピは、開発者が膨大な計算予算ではなく、高度にキュレーションされたドメイン固有のデータセットを使用して、小さくローカルなモデルでいかに大きな推論能力の向上を達成できるかを強調しています。

  • • Qwen 3 4Bベースモデルを100個のゼブラパズルで微調整した結果、MATH-500ベンチマークで31%の向上が見られました。
  • • トレーニングプロセスは、単一のH100またはH200 GPUでわずか6.5分で完了しました。
  • • 微調整プロセスの完全な再現用ノートブックが公開されています。

開発者は、高度にターゲットを絞った超小規模なデータセットを適用することで、最小限の計算コストで、小さくローカルなモデルの推論能力を劇的に向上させることができます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。