Inference Brew

Meta、コンシューマー向けAIエージェントプラットフォームでMuseエコシステムを拡大

00:00 / --:--

← ホームへ戻る

Meta、コンシューマー向けAIエージェントプラットフォームでMuseエコシステムを拡大

1. Meta、コンシューマー向けAIエージェントプラットフォームでMuseエコシステムを拡大

Metaは「Muse Spark 1.3」モデルと「Muse Code」ターミナルエージェントのリリースに続き、個人用AIエージェントプラットフォーム「Muse」を立ち上げました。iOS、Android、Webで利用可能なこのプラットフォームは、Muse Spark 1.3を活用して、メール管理や旅行予約などの個人的なタスクを自動化します。セキュリティを確保するため、各ユーザーには専用の「Muse Secure VM」が割り当てられ、Sentinelエージェントがネットワークの出口とコネクタの動作を監視します。

  • • MetaはiOS、Android、Web向けの個人用AIエージェントプラットフォーム「Muse」を立ち上げました。
  • • このプラットフォームは、以前開発者向けにリリースされた「Muse Spark 1.3」モデルを搭載しています。
  • • 各ユーザーには、ブラウザや認証情報を隔離するための専用の「Muse Secure VM」が提供されます。
  • • セキュリティエージェント「Sentinel」が、サロゲートトークンを使用してネットワークの出口とコネクタの動作を管理します。
  • • メール、旅行予約、請求交渉などの個人的なタスクを自動化します。

このローンチにより、Metaのエージェント機能が開発者向けのMuse CodeターミナルエージェントやモデルAPIの枠を超え、一般消費者のデバイスでも利用可能になります。

SOURCES

2. Mercury 2.5の価格詳細:80%割引が適用開始

9月8日に発表されたMercury 2.5のリリースを受け、Inception Labsはその価格体系を詳細に公開しました。このモデルは、入力トークン100万あたり0.04ドル、出力トークン100万あたり0.15ドルで利用可能となり、これは以前示されていた標準料金から80%の割引となります。Mercury 2.5は引き続き26万トークンのコンテキストウィンドウと、毎秒1,107トークンの生成速度を提供します。

  • • Mercury 2.5は、入力トークン100万あたり0.04ドル、出力トークン100万あたり0.15ドルで利用可能です。
  • • この価格は、モデルの標準料金から80%の割引に相当します。
  • • モデルは26万トークンのコンテキストウィンドウと、毎秒1,107トークンの生成速度を維持しています。

開発者は、新しい26万コンテキストモデルを本番ワークフローに統合する際の具体的なコスト削減額を計算できるようになりました。

SOURCES

3. Suno、ライセンスデータで学習したAI音楽モデル「v6」をリリース

Sunoは、法的な紛争の和解を経て、Warner Music Group、BMG、Believeなどの主要な業界パートナーと共同開発したAI音楽モデルスイート「v6」をリリースしました。今回のリリースには、フラッグシップモデルの「v6」、実験的な「v6-wild」、無料の「v6-mini」の3つのモデルが含まれます。新しいモデルでは、特定の曲のパートを自然言語で編集する機能、トラック要素の分離、画像・動画・音声をリファレンスプロンプトとして使用する機能などの高度な機能が導入されています。

  • • Sunoは、フラッグシップの「v6」、実験的な「v6-wild」、無料の「v6-mini」からなるAI音楽モデルスイート「v6」をリリースしました。
  • • これらのモデルは、Warner Music Group、BMG、Believeからのライセンスコンテンツを含む新しいデータセットでゼロから学習されました。
  • • 新機能には、特定の曲パートの自然言語編集、ユーザーライブラリの要素の結合、テキスト・音声・画像・動画によるプロンプトが含まれます。
  • • フラッグシップのv6およびv6-wildモデルへのアクセスには、Pro(月額8ドル)またはPremier(月額24ドル)のサブスクリプションが必要です。
  • • モデルはジャンルの理解が向上していますが、常に調和とリズムが完璧に出力され、自然な不完全さを生成することはできません。

オーディオやクリエイティブなアプリケーションを構築する開発者は、Sunoの新しいv6モデルを活用して、自然言語による編集、トラックの結合、マルチモーダルなリファレンスプロンプトを実現できます。

4. Desert Ant Labs、18種類のオンデバイスインテリジェンスモデルをリリース

欧州のスタートアップであるDesert Ant Labsは、5年前の古いスマートフォンでもローカルで動作するように設計された、18種類の専門的なオンデバイスインテリジェンスモデルをリリースしました。Swift、Kotlin、JavaScript用の統合SDKを通じてアクセス可能なこのスイートには、Voz(Whisperより4.7倍高速な文字起こしモデル)、Clear(9MBのオーディオエンハンサー)、Redact(リアルタイムのPIIマスキングツール)、Clips(284MBのビデオクリップジェネレーター)が含まれています。これらのモデルは、月間アクティブデバイス10万台まで無料でデプロイでき、クラウドAPIに代わるトークンコストゼロの選択肢を提供します。

  • • Desert Ant Labsは、古いスマートフォンを含むデバイスでローカル動作するように設計された18種類の専門モデル(安定版12、ベータ版6)をリリースしました。
  • • モデルはSwift、Kotlin、JavaScriptをサポートするSDKを通じてアクセス可能です。
  • • 主要モデルには、Voz(Whisperより4.7倍高速な文字起こし)、Clear(9MBのスタジオ品質オーディオエンハンサー)、Redact(27言語対応のリアルタイムPIIマスキング)が含まれます。
  • • Clipsは284MBのモデルで、Claude Sonnetと比較して10倍高速かつ470倍少ないエネルギーでビデオクリップを生成します。
  • • モデルは月間アクティブデバイス10万台まで無料で利用可能です。

開発者は、クラウドAPIのコストやレイテンシを発生させることなく、高速なローカルオーディオ、ビデオ、テキスト処理機能をモバイルアプリやWebアプリに統合できます。

SOURCES

5. Tencent、音声生成・編集モデル「AuK」をリリース

Tencentは、自然言語インターフェースを介して動作する統合音声生成・編集モデル「AuK」をリリースしました。AuKは、ゼロショットのテキスト読み上げ(TTS)、オーディオ強化、分離、およびコンテンツ・音響・パラ言語の指示駆動型編集をサポートしています。レイテンシに敏感なアプリケーション向けに、Tencentは標準モデルより4.5倍高速に動作する蒸留版「AuK-Flash」もリリースしました。

  • • Tencentは、音声生成と編集のための統合モデル「AuK」をリリースしました。
  • • このモデルは、ゼロショットのテキスト読み上げ(TTS)、コンテンツ・音響・パラ言語の指示駆動型編集、およびオーディオ強化をサポートしています。
  • • AuKはすべての操作に自然言語インターフェースを利用します。
  • • 「AuK-Flash」と呼ばれる蒸留版は、標準版より4.5倍高速に動作します。

開発者は、自然言語インターフェースを使用して、既存の音声を編集し、オーディオを強化し、ゼロショットTTSを実行する高度な音声アプリケーションを構築できます。

SOURCES

6. Gradium、合成音声生成のための「Voice Design API」をリリース

Gradiumは、リファレンス音声を必要とせず、テキストの説明から全く新しい合成音声を生成するツール「Voice Design」をAPIおよびStudio経由でリリースしました。英語、フランス語、スペイン語、ポルトガル語、ドイツ語をサポートし、1〜500文字のプロンプトを処理して、3〜5秒で最大5つの非決定論的な音声候補を返します。このツールはGradiumの無料枠で利用可能で、変換されなかった候補は30日後に自動的に削除されます。

  • • GradiumのVoice Designは、リファレンス音声を必要とせず、1〜500文字のテキスト説明から新しい合成音声を生成します。
  • • このツールはGradium APIおよびStudioで利用可能(無料枠あり)で、英語、フランス語、スペイン語、ポルトガル語、ドイツ語をサポートしています。
  • • システムは3〜5秒で1〜5つの非決定論的な音声候補を返します。
  • • 変換されなかった音声候補は30日後に削除され、機能が制限されます。
  • • Gradiumは、他の5つの音声デザインシステムとのブラインドペア比較テストで72.6%の勝率を達成しました。

開発者は、リファレンス音声の代わりにシンプルなテキストプロンプトを使用して、カスタムの非決定論的な合成音声をプログラムで数秒のうちに生成できます。

SOURCES

7. Google、セキュリティツールキット「Mantis」をオープンソース化

Googleは、7月に導入された「Mantis Skills」フレームワークを基盤として、MantisセキュリティツールキットをApache 2.0ライセンスの下で正式にオープンソース化しました。このツールキットは、Gemini CLIやGoogle ADKなどのフレームワークと互換性のあるモジュール式のスラッシュコマンドとルールを提供し、エージェントが脆弱性の検出からサンドボックス内での再現、パッチ適用、再攻撃検証に至るまでの脆弱性ライフサイクル全体を管理できるようにします。

  • • GoogleはMantisセキュリティツールキットをApache 2.0ライセンスでオープンソース化しました。
  • • このリリースは、2026年7月にMantis Skillsフレームワークが最初に導入されたことに続くものです。
  • • ツールキットは、サンドボックスでの再現やパッチ再攻撃を含むエンドツーエンドの脆弱性管理をサポートしています。
  • • Gemini CLI、Antigravity CLI、Google ADKと互換性があります。
  • • トークンオーバーヘッドを85%以上削減する階層型サマリーツリー機能を備えています。

開発者は、以前発表されたMantisフレームワークを本番パイプラインに統合し、サンドボックスでの再現とパッチ検証を伴うセキュリティレビューを自動化できるようになりました。

SOURCES

8. OtoDock 1.6.0、サンドボックスカーネルを備えたセルフホスト型エージェントOSをリリース

OtoDock 1.6.0は、永続的なAIエージェントを安全な環境で実行するように設計されたセルフホスト型の企業向けOSとしてリリースされました。このプラットフォームはClaude Codeと同様の機能を統合し、Anthropic、OpenAI、またはローカルモデルをサポートしています。セキュリティを確保するため、エージェントはbubblewrapを使用したカーネルサンドボックス内で実行され、pastaを介したネットワーク隔離が行われます。また、インバウンドポートやVPNを必要とせずに、アウトバウンドのWebSocketを介してリモートマシンに接続できます。OtoDockはGitHubでFair Sourceライセンスの下で利用可能で、5ユーザーまで無料です。

  • • OtoDockは、ビジネス管理とマルチテナントコラボレーションのためのセルフホスト型企業向けOSです。
  • • Claude Code、Cowork、クラウドセッションと同様の機能を単一のアプリケーションに統合しています。
  • • エージェントは、bubblewrapを使用したカーネルサンドボックスとpastaによるネットワーク隔離内で永続的なプロセスとして実行されます。
  • • エージェントはアウトバウンドWebSocketを使用してリモートコンピュータ上で実行できるため、インバウンドポートやVPNは不要です。
  • • OtoDockはFair Sourceライセンスで提供され、5ユーザーまで無料で、Docker Compose経由でインストールされます。

開発者は、インバウンドポートを公開することなく、永続的なマルチテナントのコーディングおよびビジネスエージェントをローカルまたはリモートでデプロイおよび管理できます。

SOURCES

9. Apple、写真認証のための「Reference Image API」を導入

Appleは、iPhone 18 Proシリーズで利用可能なハードウェアベースの写真認証ツール「Apple Reference Image」を発表しました。Referenceモードに設定すると、新しいカメラセンサーがキャプチャされたすべてのピクセルに署名し、AppleのPrivate Cloud Computeがそれを処理して変更不可能なリファレンス画像を作成します。開発者がこの検証を統合できるように、AppleはiOS、iPadOS、macOS全体でReference Image APIをリリースし、サードパーティアプリケーションが署名された写真を検査し、編集されたバージョンと比較してAIによる改ざんを検出できるようにします。

  • • AppleのReference Image機能は、新しいカメラセンサーを使用してReferenceモードでキャプチャされたすべてのピクセルに署名します。
  • • AppleのPrivate Cloud Computeは、署名されたセンサーデータを処理し、写真アプリで表示可能な変更不可能なリファレンス画像を作成します。
  • • Reference Image APIにより、開発者はiOS、iPadOS、macOS全体のサードパーティアプリで署名された写真を検査できるようになります。
  • • この機能はハードウェアに直接組み込まれており、SynthID、C2PA、MetaのContent Sealなどの標準とは一線を画しています。
  • • この機能は今月後半にiPhone 18 Proシリーズで開始されますが、EUのユーザーはiOS 27で開発および表示のサポートを受けることになります。

開発者は、新しいReference Image APIを使用して、iOS、iPadOS、macOSアプリ内の署名された変更不可能な写真をプログラムで検査し、AIによる編集を検出できます。

SOURCES

10. 新しいMegakernelサービングエンジンがNorth Mini Codeを加速

6月のNorth Mini Codeモデルのリリースに続き、そのデプロイを最適化するための新しいサービングエンジンが開発されました。デコードメガカーネルを活用することで、このエンジンはすべてのバッチサイズでvLLMよりも1.58倍高速なパフォーマンスを実現します。連続バッチ処理、ページド・アテンション、最大256Kのコンテキスト長をサポートし、ツール呼び出しをサポートするOpenAI互換エンドポイントを提供します。

  • • 新しいエンジンは、6月にリリースされた30B MoEモデルであるNorth Mini Codeに特化して最適化されています。
  • • パフォーマンスは、さまざまなバッチサイズでvLLMより1.58倍高速です。
  • • バッチサイズ1で毎秒292トークンを達成します。
  • • 連続バッチ処理、ページド・アテンション、256Kのコンテキスト長をサポートしています。
  • • ツール呼び出しをサポートするOpenAI互換エンドポイントが含まれています。

開発者は、標準のvLLM実装と比較して、レイテンシを大幅に削減し、スループットを向上させた状態でNorth Mini Codeモデルをデプロイできるようになりました。

SOURCES

11. Artificial Analysis、努力レベル別のモデルリリースページを公開

Artificial Analysisは、開発者がフロンティアモデルの複雑なパフォーマンスとコストプロファイルを把握できるように設計された「モデルリリース」ページを立ち上げました。GPT-6 AstraやClaude Fable 5.1のようなモデルが最大6つの異なる努力レベルを提供するようになったため、これらのページでは、タスクあたりのコスト、出力速度、レイテンシ、ドメイン固有のCapability Indexスコアのサイドバイサイド比較を提供します。このツールにより、開発者は特定のアプリケーションワークロードに合わせて努力レベルを設定する際に、データに基づいた意思決定を行うことができます。

  • • Artificial Analysisは、異なるモデルの努力レベル間で知能、コスト、速度を比較するためのモデルリリースページを立ち上げました。
  • • フロンティアモデルは現在最大6つの異なる努力レベルを備えており、パフォーマンスとコストプロファイルが大幅に変化します。
  • • ページでは、タスクあたりのコスト、出力速度、レイテンシを含む努力レベルのサイドバイサイド比較を提供します。
  • • エンジニアリング、金融、法務、ヘルスケアなどのドメインに対するCapability Indexスコアが提供されます。
  • • GPT-6 AstraはIntelligence Indexで46〜53、Claude Fable 5.1は47〜53の範囲です。

開発者は、GPT-6 AstraやClaude Fable 5.1のようなモデルについて、コスト、レイテンシ、精度のトレードオフを評価および最適化できます。

SOURCES

12. DeepSeek-V4-Flash-Vision-ExpをコンシューマーGPUでローカル実行

新しいオープンソースプロジェクトにより、10〜12枚のRTX 3090 GPUを使用して、285BのDeepSeek-V4-Flash-Vision-Exp MoEモデルをコンシューマーハードウェア上でローカルに実行できるようになりました。FP4エキスパートとFP8アテンションを活用することで、このセットアップは推論デコーディングを使用して12枚のGPUで毎秒120トークンを超えるデコード速度を実現します。このプロジェクトは、メモリとスケジューリングの問題を解決するランタイムパッチとともに、ビルド済みのDockerイメージを提供し、GPUメモリ内に完全に収まる最大100万トークンのコンテキストウィンドウをサポートします。

  • • DeepSeek-V4-Flash-Vision-Expは、157GBの重みを持つFP4エキスパートとFP8アテンションを利用した285B MoEモデルです。
  • • このモデルは、SM86互換のvLLMビルドを使用して、10〜12枚のRTX 3090 GPUを搭載したコンシューマーハードウェアで実行できます。
  • • パフォーマンスは、推論デコーディングを使用して10枚のGPUで毎秒60トークン以上、12枚のGPUで毎秒120トークン以上に達します。
  • • システムはオフロードなしで100万トークンのコンテキストウィンドウをサポートし、RAMオフロードを使用すると最大400万トークンまでサポートします。
  • • プロジェクトは、GitHub上でビルド済みのDockerイメージ、ビルドガイド、開始スクリプト、ランタイムパッチを提供しています。

開発者は、10〜12枚のコンシューマーGPU上で巨大な285Bの視覚対応MoEモデルをセルフホストし、毎秒最大120トークンのデコード速度を実現できます。

SOURCES

13. Qwen3.8-Flash-NextがMLX-serveでリリース、100万コンテキストに対応

MLX-serveにおけるQwen3.8-Flash-Nextエンジンサポートの共同開発者がそのリリースを発表し、Apple Siliconに100万トークンのコンテキスト機能をもたらしました。M5 Max 128GBシステムでテストされたこのエンジンは、8ビットKVキャッシュ、8ビット密層量子化、4ビットエキスパート層量子化を利用して高い出力品質を維持します。100万コンテキスト全体を実行するには、GPUの有線制限を120,000MBに設定する必要があり、コーディングにおいて毎秒最大75トークンの生成速度を実現します。

  • • MLX-serveのQwen3.8-Flash-Nextエンジンサポートは、最大100万トークンのコンテキスト長をサポートします。
  • • エンジンは8ビットKVキャッシュを利用し、M5 Max 128GBシステムで約117GBのピークメモリを必要とします。
  • • モデルは品質を維持するために、密層に8ビット量子化、エキスパート層に4ビット量子化を使用します。
  • • 生成速度は、100万コンテキストにおいて、散文で毎秒40トークン、コーディングで毎秒75トークンに達します。
  • • ソースコードとモデルの重みはGitHubとHugging Faceで入手可能で、MLX Serve Monitorプラグインも含まれています。

開発者は、Apple Silicon Mac上で100万トークンのコンテキストウィンドウを使用してローカル推論を実行し、コーディングタスクで毎秒最大75トークンを実現できます。

SOURCES

14. Mentria.ai、ブラウザでの1ビット27Bモデル推論を実現

Mentria.aiは、WebGPUとWGSL上に構築されたブラウザベースの推論エンジンを導入し、大規模モデルを完全にクライアントサイドで実行できるようにしました。1ビット行列ベクトルカーネルを最適化してスクラッチメモリバンクの競合を排除することで、このエンジンはPrism MLの1ビットBonsai-27BモデルをRTX 3060ラップトップGPU上で毎秒25〜30トークンで実行できます。このプラットフォームはインストールやサーバー側の処理を必要とせず、ホットスワップ可能なLoRAアダプター、ビジョンタワー、および小型のQwen3.5モデルをサポートしています。

  • • Mentria.aiは、WebGPUとWGSLを使用して構築されたブラウザベースの推論エンジンです。
  • • エンジンは、RTX 3060ラップトップ上で1ビットBonsai-27Bモデル(3.8GBのGPUメモリが必要)を毎秒25〜30トークンで実行します。
  • • パフォーマンスの向上は、1ビット行列ベクトルカーネルを最適化してスクラッチメモリ内のバンク競合を解決することで達成されました。
  • • エンジンは、インストールやサーバー側の処理を必要とせず、ブラウザ内で完全に動作します。
  • • プラットフォームは、ホットスワップ可能なLoRAアダプター、画像入力用のビジョンタワー、および小型のQwen3.5モデルをサポートしています。

開発者は、サーバー側のコストやインストールを一切発生させることなく、高度に量子化された大規模モデルをクライアントブラウザに直接デプロイできます。

SOURCES

15. Cosmos3 (64B) INT4量子化がCUDAおよびMLX向けに実装

640億パラメータのCosmos3モデルのオープンソース実装により、ローカルハードウェアでINT4のテキスト・画像・動画生成機能が実現しました。CUDAとApple Silicon MLXランタイムの両方と互換性があり、プロジェクトは量子化された重みをHugging Faceで、コードをGitHubでホストしています。M4 Max 128GB Macでは、単一のビデオクリップの生成に約5分かかります。

  • • 64BのCosmos3モデルが、INT4のテキスト・画像・動画生成タスク向けに実装されました。
  • • コードはGitHubで入手可能で、モデルの重みはHugging Faceでホストされています。
  • • M4 Max 128GB Macでは、単一のビデオクリップの生成に約5分かかります。
  • • 実装はCUDAとApple Silicon MLXランタイムの両方をサポートしています。

開発者は、最適化されたINT4の重みを使用して、Apple SiliconおよびNvidiaハードウェア上で高忠実度のローカル画像および動画生成タスクを実行できます。

SOURCES

16. Foundation-1オーディオモデル、音色固定のキーベッドを実現

独立研究者が、無限のワンショットを生成し、テキストプロンプトを演奏可能なシンセに変換するように設計されたカスタムオーディオモデル「Foundation-1」をリリースしました。楽器から音色制御を分離することで、モデルは複数の拡散呼び出しを通じて一貫性を保つ「音色固定キーベッド」を実現します。モデルの重みはHugging Faceでホストされており、完全な推論パイプラインとツールはRC-stable-audio-toolsリポジトリの下でGitHubでオープンソース化されています。

  • • Foundation-1は、楽器とは別の要素として音色を制御するカスタムAIモデルです。
  • • モデルは、複数の拡散呼び出しを通じて一貫性を保つ音色固定キーベッドを実現します。
  • • モデルはHugging Faceで入手可能で、推論パイプラインはRC-stable-audio-toolsの下でGitHubでオープンソース化されています。
  • • システムは音楽制作のための無限のワンショットを生成し、テキストプロンプトを完全に演奏可能なシンセに変換できます。

音楽制作ツールを構築する開発者は、オープンウェイトモデルを活用して、テキストプロンプトから一貫性のある演奏可能なシンセを生成できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。