Inference Brew

AnthropicがClaude 5.5ファミリーに新しいSonnetモデルを追加

00:00 / --:--

← ホームへ戻る

AnthropicがClaude 5.5ファミリーに新しいSonnetモデルを追加

1. AnthropicがClaude 5.5ファミリーに新しいSonnetモデルを追加

Anthropicは、先週リリースされたフラッグシップモデルOpus 5.5を基盤とするClaude Sonnet 5.5をリリースし、Claude 5.5モデルファミリーを拡充しました。Sonnet 5.5はエージェント的なコーディング能力において飛躍的な進歩を遂げており、Terminal-Bench 4.0で70.6%のスコアを達成しました(前モデルSonnet 5は10.3%)。価格は従来のSonnet 5と同等ですが、標準的なタスクにおいて30%高速化し、トークン効率も向上しています。ただし、最大限の推論能力を発揮する際にはトークン消費量が増加する可能性があるため、開発者は注意が必要です。

  • • Claude Sonnet 5.5はArtificial Analysis Intelligence Indexで56点を獲得し、総合2位にランクインしました。
  • • 価格はSonnet 5と同等で、入力トークン100万あたり2ドル、出力トークン100万あたり10ドルです。
  • • Terminal-Bench 4.0におけるエージェント的コーディング性能は、Sonnet 5の10.3%から70.6%に向上しました。
  • • モデルはSonnet 5より30%高速に動作し、100万トークンのコンテキストウィンドウを維持しています。
  • • AWS、Google Cloud、Azureで利用可能で、データ保持なしのオプションも提供されています。

前世代と新しいフラッグシップモデルOpus 5.5の間の性能差を埋める、高速かつ高性能なミドルティアモデルとして、エージェントワークフローに貢献します。

2. ElevenLabsがEleven v4およびv4 Turbo TTSモデルをリリース

ElevenLabsは、最新のテキスト読み上げ(TTS)モデルであるEleven v4およびEleven v4 Turboをリリースしました。Eleven v4は対応言語を90以上に拡大し、生成スループットはv3と比較して毎秒73.4文字とほぼ2倍になりました。開発者は10秒の音声サンプルを使用して音声をクローンできるほか、[sighs](ため息)や[whispers](ささやき)といったインラインテキストキューを使用して、きめ細かな感情制御が可能になりました。Eleven v4は現在、Artificial AnalysisのProvider Voice TTS Arenaリーダーボードで1位を獲得しており、価格は100万文字あたり80ドルです。

  • • Eleven v4は90以上の言語をサポートし(v3の70以上から増加)、Artificial AnalysisのProvider Voice TTS Arenaリーダーボードで1位にランクインしました。
  • • モデルは毎秒73.4文字を処理し、Eleven v3の生成速度をほぼ2倍に向上させました。
  • • Eleven v4 Turboは、リアルタイムの会話アプリケーション向けにほぼ即時の応答をサポートします。
  • • 10秒の音声サンプルから高品質な音声クローンを作成可能です。
  • • スクリプトに[sighs]や[whispers]などのテキストキューを直接挿入することで、音声出力のスタイルや感情を制御できます。
  • • Eleven v4の価格は100万文字あたり80ドルに設定されています。

開発者は、高度なスクリプトベースの感情制御を備えた、90以上の言語に対応する非常にリアルでほぼ即時の音声アプリケーションを構築できます。

3. OpenAIがCerebras搭載の「Ultrafast」APIモードへのアクセスを拡大

GPT-5.6 Solのウェイティングリスト限定ティアとして8月にプレビュー公開された後、OpenAIは「Ultrafast」APIモードのより広範なロールアウトを準備しています。開発者プラットフォームとAPIドキュメントの最近の更新によると、Cerebrasハードウェアを活用して毎秒最大750出力トークンの速度を実現するこのサービスは、制限付き評価フェーズからより広範な利用可能性へと移行しつつあります。

  • • OpenAIは「Ultrafast」APIモードへのアクセスを、初期のウェイティングリスト限定プレビューから拡大しています。
  • • このモードは引き続きCerebrasハードウェアで動作し、毎秒750出力トークンの性能を維持しています。
  • • この展開は、2026年8月に発表された限定的なエンタープライズ評価フェーズからの転換を意味します。
  • • 標準的な推論と比較して14倍の速度向上は、リアルタイムアプリケーションにとって主要な価値提案であり続けています。

この高速ティアの拡大により、リアルタイムの会話インターフェースや高頻度エージェントループを構築する開発者にとって、LLMのほぼ即時応答がより利用しやすくなります。

SOURCES

4. Fireworks AIが推論モデル「Ember-1」をリリース

Fireworks AIは、Moonshot AIのオープンウェイトモデルKimi K3をポストトレーニングして構築された専門推論モデル「Ember-1」をリリースしました。Ember-1は推論トレースを大幅に短縮するように最適化されており、本番環境のA/Bテストにおいて合計トークン数を39%、推論トークン数を71.3%削減しました。トレースが短いにもかかわらず、モデルは高いタスク精度を維持しており、Terminal Bench 2.1およびDeepSWE 1.1でKimi K3 Maxを上回っています。現在、FireworksサーバーレスAPIでリサーチプレビューとして利用可能で、価格はKimi K3と同等です。

  • • Ember-1は、Moonshot AIのオープンウェイトモデルKimi K3をポストトレーニングして構築された専門モデルです。
  • • 推論トレースを短縮するように設計されており、合計トークン数が約40%、推論トークン数が71.3%削減されました。
  • • FireworksサーバーレスAPI限定のリサーチプレビューとして提供されており、ウェイトやトレーニングコードは公開されていません。
  • • Ember-1はTerminal Bench 2.1およびDeepSWE 1.1ベンチマークでKimi K3 Maxを上回りました。
  • • 価格はKimi K3と同等で、入力トークン100万あたり3.00ドル、キャッシュ済み入力トークン100万あたり0.30ドル、出力トークン100万あたり15.00ドルです。

開発者に対し、同等のタスク精度を持ちながら、より安価で高速な推論モデルをサーバーレスAPIで提供します。

SOURCES

5. Jeffが超高速ローカル意思決定モデルをリリース

オープンソースプロジェクト「Jeff」は、ゼロショット分類およびルーティング用に設計された超高速な0.8Bおよび2Bの意思決定モデルコレクションをリリースしました。AutoJevレシピからフォークされたこれらのモデルは、テキスト生成を完全にバイパスし、単一のフォワードパスで構造化されたオプション(選択肢、はい/いいえ、またはスケール)に対する調整済みの確率を返します。ローカルで実行される0.8Bモデルは、MLXを使用したApple M4 Maxで約28ミリ秒、RTX PRO 6000で22ミリ秒の意思決定レイテンシを実現しており、エージェントループにおける高速ルーティングや安全ゲートに最適です。

  • • Jeffは、テキスト生成を行わないゼロショット分類タスク用に設計された、ファインチューニング済みのQwen3.5およびGemma 4モデルを提供します。
  • • モデルは、MLXを使用したApple M4 Maxで約28ms、RTX PRO 6000で約22msの意思決定レイテンシを達成しています。
  • • Jeffは、選択(最大255オプション)、noul(はい/いいえの確率)、スコア(スケールベース)の3つの構造化された質問タイプをサポートしています。
  • • Jeff 2Bモデルは、BBH、JudgeBench、RAGTruthを含む5つのベンチマークパネルで83.1%のスコアを達成しました。
  • • モデルのウェイトはApache 2.0ライセンスで、トレーニングコードはMITライセンスで公開されています。

開発者は、Macや単一GPUなどのコンシューマーハードウェア上で、高度に調整された30ミリ秒未満の意思決定およびルーティングモデルをローカルで実行できます。

SOURCES

6. マルチモーダル意思決定モデル「ImaJev-4B」がJevBenchでトップを獲得

ImaJev-4Bは、テキスト、JSON、および最大2枚の写真を処理し、単一のフォワードパスで調整済みの確率を出力するように設計された、新しくリリースされたオープンウェイトのマルチモーダル意思決定モデルです。Qwen3.5-4Bの上にLoRAとカスタム意思決定ヘッドを使用して構築されたこのモデルは、JevBenchでトップ(スコア67.37)を獲得し、DecisionBenchでGPT-5.6 Lunaを上回りました。ImaJevは高度に調整されており、ハルシネーションを起こすよりも「不明」と出力することを優先します。Apache-2.0ライセンスの下で、MLXを介してMac上でローカルに、または単一のGPU上で実行可能です。

  • • ImaJevはQwen3.5-4Bの上にLoRAと小さな意思決定ヘッドを使用して構築されており、トレーニングにかかったGPUリソース費用はわずか1,200ドルです。
  • • JevBenchでスコア67.37を獲得して1位にランクインし、Jev 1.13.0を上回ったほか、DecisionBenchではGPT-5.6 Lunaを上回りました。
  • • テキストまたはJSONレコードと最大2枚の写真を受け入れ、単一のフォワードパスで調整済みのオプション確率を返します。
  • • モデルは高度に調整されており、不確実な場合には推測せずに「不明」をデフォルトとしています。
  • • ウェイトはApache-2.0ライセンスで公開されており、MLXを使用したMacまたは単一のGPU上でローカルに実行できます。

構造化された意思決定や視覚的検証タスクに優れた、軽量でローカルなマルチモーダルモデルを開発者に提供します。

SOURCES

7. NvidiaがOpenShellサンドボックスを備えたOpen Agent Safety Platformを立ち上げ

Nvidiaは、Linux Foundation傘下のOpen Secure AI Allianceによって管理されるオープンソースのセキュリティフレームワーク「Open Agent Safety Platform」をリリースしました。このプラットフォームは、OpenShell(セキュアランタイムサンドボックス)とSentry(帯域外ウォッチドッグ)という2つの主要コンポーネントを提供することで、自律型AIエージェントのセキュリティリスクに対処します。OpenShellはエージェントのライフサイクルを管理し、ネットワーク、ファイルシステム、プロセスに関する厳格なルールを強制します。Sentryは別のネットワークチップ上で動作し、ホストのCPUやGPUに依存することなく、エージェントの動作を継続的に監視し、不正なエージェントをミリ秒単位で隔離します。

  • • Nvidiaは、AIエージェントのセキュリティのためのオープンソースフレームワークおよびリファレンスデザインであるOpen Agent Safety Platformを立ち上げました。
  • • OpenShellはApache 2.0ライセンスのセキュアランタイムで、Linux、macOS、Windows WSL 2上のDocker、Podman、MicroVM、Kubernetes全体でエージェントをサンドボックス化します。
  • • Nvidia SentryはBlueField-4 DPU上で動作する帯域外ウォッチドッグで、エージェントを継続的に監視し、ミリ秒単位で隔離するように設計されています。
  • • このプラットフォームはNvidia Vera CPU向けに最適化されており、従来のCPUインフラストラクチャと比較して最大80%高速なサンドボックスパフォーマンスを実現します。
  • • Anthropic、Salesforce、SAP、Red Hat、SpaceXAIなど、100以上の組織がこのプラットフォームで協力しています。

AIエージェントをサンドボックス化し、許可されていないシステムやネットワークアクションの実行を防止するための、セキュアなカーネルレベルのランタイム環境を開発者に提供します。

8. Cloudflareがcf Agentic CLIをオープンベータで開始

Cloudflareは、エージェント的なソフトウェア開発専用に設計された新しいCLI「cf」をオープンベータで開始しました。このリリースは、Wranglerアクティビティの48%をエージェントが占めるという、エージェント利用の急増に対応するものです。cf CLIは3,000以上のCloudflare API操作を公開し(Wranglerの280から増加)、AIエージェントのコンテキストウィンドウ使用を最適化するためにJSONインターフェースをデフォルトとしています。また、型チェックのためのTypeScriptベースのcloudflare.config.ts設定形式や、API記述に基づいてエージェントが正しいコマンドを発見するのを支援する自然言語の「cf cli search」コマンドも導入されています。

  • • Cloudflareはcf CLIをオープンベータで開始し、npm i -g cfでグローバルにインストール可能です。
  • • このCLIは3,000以上のCloudflare API操作をサポートしており、Wranglerがサポートする280と比較して大幅に増加しています。
  • • AIエージェントのコンテキスト使用を最適化するために、デフォルトのインターフェースとしてJSONを使用します。
  • • 新しいcloudflare.config.ts設定形式はTypeScriptを利用して、型チェックとエージェントとの対話の改善を提供します。
  • • CLIには、エージェントが自然言語を使用して適切なコマンドを発見できる「cf cli search」コマンドが搭載されています。
  • • Wranglerは、cfベータ終了後18ヶ月間、メンテナンスサポートが提供されます。

開発者は、型安全でエージェントフレンドリーなインターフェースを使用して、Cloudflareインフラストラクチャをプログラムで管理および設定するエージェントを構築できます。

SOURCES

9. ShopifyがブラウザベースのAIエージェントにチェックアウトプロセスを開放

ShopifyはWebMCPサポートを拡大し、チェックアウトプロセスを含めることで、ブラウザベースのAIエージェントがプログラムで注文詳細を更新し、購入を完了できるようにしました。購入者の明示的な承認があれば、エージェントはトランザクションフロー全体を自律的にナビゲートできるようになりました。このアップデートにより、単なる製品検索を超えてトランザクションの完全な実行までを行う、ショッピングアシスタントやeコマースエージェントを構築する開発者の摩擦が大幅に軽減されます。

  • • ShopifyはWebMCPサポートを拡大し、チェックアウトプロセスを含めました。
  • • このアップデートにより、ブラウザベースのAIエージェントが注文詳細を更新し、購入を完了できるようになります。
  • • エージェントがこれらのアクションを実行するには、購入者の明示的な承認が必要です。

開発者は、購入者の承認を得てチェックアウトフロー全体をプログラムで完了できる、自律的なショッピングエージェントを構築できます。

SOURCES

10. Vespperが最先端のDocx MCPサーバーを立ち上げ

Vespper (YC F24) は、AIエージェントがWord (.docx) 文書を編集できるように設計された新しいModel Context Protocol (MCP) サーバーを立ち上げました。python-docxのような従来のライブラリに頼るのではなく、VespperはWordファイルを編集用にHTMLに変換し、変更を元の形式に反映させます。LoRAアダプターを備えたファインチューニング済みの3-8Bモデルを搭載しており、エージェントに対して「読み取り」「検索」「編集」という3つのコアツールを公開します。Vespperは月間500編集までの無料ティアを提供しており、データ保持なしのオプションやセルフホストも可能です。

  • • Vespperは、Word文書 (.docx) を編集用にHTMLに変換し、変更を元のファイルに反映させるMCPサーバーです。
  • • システムは、LoRAアダプターを備えたファインチューニング済みの3-8Bベースモデルで動作します。
  • • python-docxなどの代替手段と比較して、3倍高速で2倍安価、かつ高精度であると主張しています。
  • • MCPはエージェント向けに「読み取り」「検索」「編集」の3つのツールを公開しています(現在、画像やコメントはサポートしていません)。
  • • Vespperは月間500編集までの無料ティアを提供しており、データ保持なし (ZDR) やセルフホストなどのプライバシーオプションも用意されています。

AIエージェントがWord文書をプログラムで編集するための、高速で安価かつ高精度な方法を提供します。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。