Inference Brew

OpenAIがAgents APIのパブリックベータ版を公開、マネージドCodexハーネスを搭載

00:00 / --:--

← ホームへ戻る

OpenAIがAgents APIのパブリックベータ版を公開、マネージドCodexハーネスを搭載

1. OpenAIがAgents APIのパブリックベータ版を公開、マネージドCodexハーネスを搭載

OpenAIの新しいAgents APIは、長時間のセッションにおける自動コンテキスト圧縮、効率的なツール利用、サブエージェントへの委任など、エージェントオーケストレーションの複雑な処理を代行します。コードの実行、ファイルの編集、MCPサーバーへの接続を行うための統合インターフェースを提供することで、信頼性の高いエージェントを構築するために必要な定型コードを削減します。価格は、基盤となるモデルのAPI料金に直接連動しており、ホスト型サンドボックスやツールの利用には追加コストがかかります。

  • • Agents APIは、OpenAIが内部で使用しているものと同じCodexハーネスとインフラストラクチャを開発者に提供します。
  • • 開発者は、OpenAIが管理するサンドボックス、自社のインフラストラクチャ、または9つのパートナーサンドボックスでエージェントの計算を実行できます。
  • • パートナーサンドボックスには、Vercel、E2B、Modal、Cloudflare、Daytona、DigitalOcean、Blaxel、Runloop、Oracleが含まれます。
  • • APIは、Agent、Environment、Session、Events and itemsという4つの主要な概念で構成されています。
  • • データレジデンシーは現在米国に限定されており、Zero Data Retention (ZDR) はサポートされていません。

開発者は、OpenAIのマネージドインフラストラクチャやパートナーのサンドボックスを利用して、永続的なクラウドエージェントを構築・デプロイできるようになります。

SOURCES

2. DeepSeekがアップデート版モデル「DeepSeek-V4.1-Flash」をリリース

2026年5月にリリースされたオリジナルのDeepSeek-V4 Flashモデルをベースに、新しいV4.1-Flashイテレーションでは、Causal Encoder-Decoder設計と高度なCompressed Sparse Attention 2 (CSA2) を導入し、メモリ効率をさらに最適化しました。このアップデートでは、FP4量子化を利用してKVキャッシュのフットプリントをトークンあたり890バイトに削減し、以前のV4 Proシリーズと比較してエージェントタスクやコーディングタスクでのパフォーマンスを向上させています。

  • • DeepSeek-V4.1-Flashは、552BパラメータのマルチモーダルMixture-of-Expertsモデルです。
  • • 1Mトークンのコンテキストウィンドウを備え、プリフィル時に8B、デコード時に16Bのアクティブパラメータを使用します。
  • • Compressed Sparse Attention 2 (CSA2) とFP4量子化を実装し、KVキャッシュ効率を向上させています。
  • • エージェント、コーディング、サイバーセキュリティのベンチマークにおいて、以前のDeepSeek V4 Pro 0813を上回ります。
  • • MITライセンスの下、vLLM、SGLang、Transformers、およびパブリックAPIを通じて利用可能です。

このリリースにより、初期のV4 Flashリリースと比較して、長文コンテキストアプリケーションのメモリオーバーヘッドを大幅に削減する、より効率的なアップグレード版マルチモーダルモデルが提供されます。

3. Cognitionがコーディングモデル「SWE-2」をリリース、FrontierCodeで50%のスコアを達成

CognitionのSWE-2はKimi K3ベースを基盤としており、エージェントによるコーディングのために広範な強化学習が行われています。すべての推論努力レベルを単一の実行でトレーニングすることで、モデルはコストとパフォーマンスの境界を最適化し、SWE-2 mediumはSWE-1.7を上回る性能を、平均して58%少ないターン数と81%低いコストで実現しました。公開ウェイトやスタンドアロンのAPIエンドポイントはありませんが、開発者はDevinスイートを通じてすぐにモデルにアクセスできます。

  • • SWE-2は、Kimi K3からポストトレーニングされた、トークンあたり104Bのアクティブパラメータを持つ2.8TパラメータのMixture-of-Expertsモデルです。
  • • FrontierCode 1.1ベンチマークで50.0のスコアを達成し、Claude Fable 5.1と同等の性能を64%低いコストで実現しています。
  • • 本日よりDevin Desktop、CLI、Devin Web、Fusionで利用可能であり、公開ウェイトやトークン単位のAPI料金はありません。
  • • SWE-2は推論にNVFP4およびFP8カーネルを使用し、スループットを10%から20%向上させるプリフィル遅延器を備えています。
  • • このモデルは、すべての推論努力レベルを単一の実行で最適化する強化学習アルゴリズムを使用してトレーニングされました。

Devinを使用する開発者は、コストとパフォーマンスの境界を最適化する、より安価で効率的なエージェントコーディングモデルを利用できるようになります。

4. AI SageがGated DeltaNetを搭載した「GigaChat-3.5-Reasoning」をリリース

GigaChat-3.5-Reasoningは、Gated DeltaNetを活用して長文コンテキストシナリオで高い効率を実現します。CISPOを使用してドメイン固有の専門家をトレーニングし、それらを単一のモデルに蒸留することで開発されており、数学、コーディング、推論タスクのための強力なオープンウェイトの代替手段を提供します。MITライセンスのウェイトはHugging Faceで公開されています。

  • • GigaChat-3.5-Reasoningは、Gated DeltaNetを搭載した432B-A28B Mixture-of-Expertsモデルです。
  • • コード、数学、一般知識のドメイン専門家をオンポリシー蒸留によって蒸留することでトレーニングされました。
  • • 推論トレースで使用するトークン数を37%削減しながら、DeepSeek V4 Flash Previewと同等のパフォーマンスを発揮します。
  • • モデルのウェイトは、MITライセンスの下でHugging Faceで公開されています。
  • • このモデルは、giga.chatのウェブインターフェースからもアクセス可能です。

開発者は、推論トレースで使用するトークン数を大幅に削減しながら、最先端のパフォーマンスに匹敵する非常に効率的な推論モデルをセルフホストできます。

SOURCES

5. 攻撃的セキュリティおよびエージェントコーディング向け「CyberTiel 35B-A3B」がリリース

CyberTielは現実世界のソフトウェアエンジニアリングの問題をターゲットにしており、作成者はQwen3.8-27bが必要とする時間の数分の一でコードベースの問題においてOpus 4.6 mediumを上回ると主張しています。一般的な世界知識を犠牲にすることで、専門的なコーディングやセキュリティタスクに対する有用性を最大化しています。開発者は、新しくリリースされたGGUFおよびMLXフォーマットを使用して、ローカルでモデルを実行できます。

  • • CyberTielは、TielCoderベースに基づく検閲なしの35B-A3Bコーダーモデルです。
  • • 攻撃的セキュリティ研究およびエージェントソフトウェアエンジニアリング専用に設計されています。
  • • 厳選されたサイバーセキュリティおよびソフトウェアエンジニアリングのコーパスでトレーニングされた改良型imatrixを使用した量子化によって作成されました。
  • • ローカルデプロイ用に、GGUFおよびMLXバージョンのモデルがHugging Faceで入手可能です。
  • • 一般的な世界知識よりもコーディング能力を優先しており、匿名の研究者によって開発されました。

セキュリティに重点を置く開発者に対し、現実世界のコードベースの問題においてより大きなモデルを凌駕する、非常に専門的で検閲のないローカルモデルを提供します。

SOURCES

6. 特注UI要素生成モデル「OUI-1」がリリース

OUI-1は、冗長な標準ウェブフォーマットではなくOpenUI-Langでトレーニングすることにより、ユーザーインターフェース要素を生成するための効率的な手法を導入しています。このDSL中心のアプローチにより、UIフォーマットに通常必要とされるシステムプロンプトのオーバーヘッドが大幅に削減されます。ただし、基盤となるDiffusionGemmaアーキテクチャがllama.cppをサポートしていないため、ローカルでモデルを実行しようとする開発者はハードルに直面することになります。

  • • OUI-1は、DiffusionGemmaを微調整してHugging Faceにアップロードされたモデルです。
  • • HTML、Markdown、Reactの代わりに、カスタムドメイン固有言語であるOpenUI-Langを使用します。
  • • DSLでの微調整は、システムプロンプトと比較してコンテキストウィンドウのオーバーヘッドを削減するように設計されています。
  • • DiffusionGemmaは現在llama.cppでサポートされていないため、Ollamaなどのツールによるローカル実行が制限されています。

トークン使用量を削減するUI生成への専門的なアプローチを提供しますが、ローカルデプロイは現在llama.cppの互換性によって制限されています。

SOURCES

7. LandingAIがDPT-3モデルを搭載した「Agentic Document Extraction Gen2」をリリース

LandingAIのADE Gen2は、フラットなチャンク化から階層的なツリー構造へと移行することで、ドキュメント処理における大きな転換点となります。これにより、検証可能なグラウンディングを伴う正確なデータ抽出が可能になります。このリリースは一般提供されており、AWS、Azure、Google Cloud、Snowflake、オンプレミスを含む柔軟なデプロイオプションをサポートしており、混合ワークロードで25%から80%のコスト削減が見込まれています。

  • • ADE Gen2は、DPT-3 ProとDPT-3 Verityを特徴とする新しいDPT-3モデルファミリーに基づいて構築されています。
  • • システムはドキュメントをツリー構造として扱い、データを特定の単語や行にトレースするためのアトミックグラウンディングを提供します。
  • • DPT-3 Verityは単語レベルの信頼性を備えた決定論的な文字起こしを提供し、DPT-3 Proは複雑なレイアウトや手書き文字を処理します。
  • • 価格設定は、ページあたり3クレジットの固定モデルから、ページあたりの料金と出力文字数あたりの料金に変更されました。
  • • Gen1のクライアントコードはGen2のエンドポイントと互換性がないため、既存ユーザーは移行が必要です。

開発者は行レベルのグラウンディングを備えた非常に正確なドキュメント解析を利用できますが、既存のクライアントコードを新しい非互換のエンドポイントに移行する必要があります。

SOURCES

8. Redisがマネージドセマンティックキャッシングサービス「LangCache」をリリース

Redis LangCacheは、LLMを呼び出す前にセマンティックキャッシュを検索し、その後レスポンスを保存する2コールループとして動作します。プロンプトの正確なテキストではなく意図を照合することで、動的なユーザー入力に対するキャッシュヒット率を最大化します。Redisは、顧客データが顧客自身のサーバーに留まり、モデルのトレーニングに使用されないことを保証します。

  • • Redis LangCacheは、Redis Cloudでパブリックプレビューとして利用可能なマネージドセマンティックキャッシングサービスです。
  • • このサービスには、専用のPythonおよびJavaScript SDKを備えたREST APIを通じてアクセスできます。
  • • セマンティックな意味に基づいてプロンプトを照合し、標準的なLLMクエリよりも最大15倍高速にキャッシュヒットを返します。
  • • 構成可能な類似性しきい値、TTL、エビクションポリシー、適応型精度制御などの機能を備えています。
  • • 初期の顧客であるMangoes.aiは、70%のキャッシュヒット率とLLM支出の70%削減を報告しました。

Redis Cloud上のマネージドセマンティックキャッシングを通じて、LLM APIコストとレスポンスレイテンシを削減します。

SOURCES

9. SentryがLLMワークフローのデバッグ用エージェントトレーシングツールを導入

Sentryの新しいエージェントトレーシング機能は、非決定的なAIワークフローの可観測性の課題に対処します。エージェントの実行ステップをマッピングすることで、開発者は不正な出力を特定のツール呼び出しやプロンプトの失敗まで簡単に追跡できます。このツールは、SlackやGitHub Actionsなどの多様な環境でのデバッグを実演するライブワークショップで紹介されました。

  • • Sentryのエージェントトレーシングツールは、不適切なツール呼び出し、不正な出力、未計上のトークン支出などの問題を診断します。
  • • このツールにより、開発者はエージェントがどこで壊れたのか、およびそれに関連する運用コストを正確に特定できます。
  • • Sentryは、Slackエージェント、eコマースチャットボット、GitHub Actionを含むライブエージェントでこのツールを実演しました。
  • • 開発者は、監視と分析のために独自のカスタムエージェントをSentryプラットフォームに統合できます。

開発者はエージェントの実行パスを深く可視化し、障害を特定してトークン支出を最適化できるようになります。

SOURCES

10. NVIDIAがPiコーディングエージェントを最適化する「SoL-Pi」拡張機能をリリース

NVIDIAのSoL-Pi拡張機能は、Piコーディングエージェントのパフォーマンスを最適化するための非侵襲的な方法を提供します。診断ログを圧縮するEvidence-Preserving Reducerや、ウィンドウの圧力を管理するOnline Context Compactなどの機能を実装することで、拡張機能は不要なトークン交換を最小限に抑えます。すべてのメカニズムはオプトインであり、デフォルトでは無効になっているため、開発者は特定のワークフローに合わせて最適化を選択的に適用できます。

  • • SoL-Piは、Piコーディングエージェントの効率を向上させるために設計されたスタンドアロン拡張機能です。
  • • この拡張機能は、ソースコードにパッチを当てることなく、パブリックAPIを使用して未修正のPiリリースの最上位にインストールされます。
  • • Action Fusion、ObservationPack、Evidence-Preserving Reducer、Online Context Compactという4つのオプトインメカニズムが含まれています。
  • • Action Fusionは、編集または書き込み操作と同じツール呼び出しで検証コマンドを実行します。
  • • ObservationPackは、大きなテキスト結果をページングリコール付きの安定したハンドルに変換し、トークン通信量を削減します。

Piエージェントを使用する開発者は、オプトインの最適化メカニズムを通じて、推論コストとレイテンシを大幅に削減できます。

SOURCES

11. マネージドエージェント資格情報管理のための「LangSmith Connections」が開始

エージェントワークフローにおける資格情報の管理は、歴史的にセキュリティのボトルネックとなってきました。LangSmith Connectionsは、OAuthや共有APIキーを処理するための構造化された方法を提供することで、これに対処します。これにより、エージェントは厳格なセキュリティ境界と監査証跡を維持しながら、チケットの起票や外部データベースへのクエリなど、認証が必要なタスクを実行できるようになります。

  • • LangSmith Connectionsは、AIエージェント向けに設計されたマネージド資格情報管理システムです。
  • • ウェブ検索のような共有タスクのために、エージェントが所有する資格情報をサポートしています。
  • • ユーザーが所有するOAuth設定をサポートしており、エージェントが個々のユーザーに代わって安全に行動できるようにします。
  • • このシステムは、デプロイされたエージェントのセキュリティと機能の両方を強化することを目的としています。

ウェブ検索を実行したりチケットを起票したりする自律型エージェントのための、APIキーやOAuthトークンを管理するというセキュリティ上の課題を解決します。

SOURCES

12. ZeroModelsがマルチバックエンド推論用のKeras 3事前学習済みモデルをリリース

ZeroModelsは、マルチモーダル機能をアプリケーションに統合する開発者向けに、合理化された代替手段を提供します。Keras 3を活用することで、このコレクションはデプロイ環境に応じてJAX、PyTorch、またはTensorFlow上でモデルをシームレスに実行できます。transformersのような重いランタイム依存関係がないため、リソースが制限された、または高度に最適化された本番パイプラインに非常に適しています。

  • • ZeroModelsは、完全にKeras 3で構築された事前学習済みモデルのコレクションです。
  • • サポートされているタスクには、画像分類、物体検出、セグメンテーション、深度推定、音声認識が含まれます。
  • • コードベースは、JAX、PyTorch、TensorFlowバックエンドと完全に互換性があります。
  • • このコレクションは、ランタイム時にtransformersやtorchライブラリを必要としません。

開発者は、重いランタイムライブラリのオーバーヘッドなしで、軽量な視覚および音声モデルをさまざまなバックエンドにデプロイできます。

SOURCES

13. Cherenkov推論エンジンがApple Silicon上でローカルMoEモデルを最適化

Cherenkovは、ローカルハードウェア上で大規模なMixture-of-Expertsモデルを実行する際のメモリ制限に対処します。どのエキスパートが必要になるかを予測し、SSDからオンザフライでストリーミングすることで、エンジンはモデル全体をRAMにロードすることを回避します。この予測的なストリーミングアプローチにより、32GBのMacBook Airのようなメモリ制限のあるデバイスでも、物理メモリ制限を超えてしまうようなモデルを実行できるようになります。

  • • Cherenkovは、Apple Silicon専用に設計された推論エンジンです。
  • • エンジンは予測的なエキスパートストリーミングを使用して、ユニファイドメモリ内のエキスパートの作業セットを制限します。
  • • 1層の先読みを使用して必要なエキスパートを予測し、事前にSSD読み取りを開始します。
  • • SSDの読み取り時間が不十分な場合、システムはより小さなQ3またはQ2量子化にフォールバックできます。
  • • 32GBのM4 MacBook AirでQwen3.8-Flash-Nextを実行し、毎秒8〜22トークンを達成しました。

開発者は、オンデマンドでSSDからエキスパートをストリーミングすることにより、コンシューマーグレードのMac上で大規模なMixture-of-Expertsモデルをローカルで実行できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。