Inference Brew

GoogleがGemini Flashシリーズをバージョン3.8にアップグレード

00:00 / --:--

← ホームへ戻る

GoogleがGemini Flashシリーズをバージョン3.8にアップグレード

1. GoogleがGemini Flashシリーズをバージョン3.8にアップグレード

2026年8月のGemini 3.7 Flashリリースに続き、GoogleはGemini 3.8 Flashを導入しました。このアップデートにより推論能力とコーディング能力が向上しましたが、モデルによる反復的なツール呼び出しの増加により、タスク全体のコストが約40%増加する可能性があります。さらに、政府機関や信頼できるパートナー向けに、脆弱性検出に特化したGemini 3.8 Flash Cyberもリリースされました。

  • • Gemini 3.8 Flashは3.7 Flashの後継モデルで、推論とコーディングのパフォーマンスが向上しています。
  • • 100万トークンのコンテキストウィンドウを備え、2026年末までの価格は入力100万トークンあたり0.75ドル、出力100万トークンあたり3.75ドルです。
  • • 推論ステップの増加と反復的なツール呼び出しにより、以前のバージョンと比較してタスクあたりの総コストが40%高くなる可能性があります。
  • • 自動化された脆弱性修正用に調整された制限付きモデルバリアント「Gemini 3.8 Flash Cyber」が導入されました。
  • • Artificial Analysis Intelligence Indexで59点を獲得し、Gemini 3.7 Flashから3ポイント向上しました。

開発者はFlashシリーズでより高度な推論モデルを利用できるようになりましたが、モデルの推論プロセスが強化されたことによるコスト増加の可能性を考慮する必要があります。

2. MetaがMuse Sparkをバージョン1.3にアップデートし、パフォーマンスを向上

Metaは8月のバージョン1.2リリースに続き、Muse Sparkモデルラインをバージョン1.3にアップデートしました。新バージョンでは、前モデルと同じ価格体系を維持しながら、コーディング、エージェントワークフロー、科学的推論におけるパフォーマンスが向上しています。Muse Spark 1.3 (xhigh) バリアントは現在MetaのAPIおよびMuse Codeを通じて利用可能で、より強力な「max」バリアントは現在限定プレビュー中です。

  • • MetaはMuse Spark 1.3をリリースし、コーディング、エージェントタスク、科学的推論において大幅なパフォーマンス向上を実現しました。
  • • Muse Spark 1.3 (xhigh) バリアントが現在利用可能で、Artificial Analysis Intelligence Indexで61点を獲得しました。
  • • xhighバリアントの価格は、入力100万トークンあたり1.25ドル、出力100万トークンあたり4.25ドルで変更ありません。
  • • より強力なMuse Spark 1.3 (max) バリアントが、現在パートナー向けに限定プレビュー中です。

開発者は、トークンコストを上げることなく、Metaの既存のAPIおよびMuse Codeエコシステムを通じて、より高性能な推論・コーディングモデルを利用できるようになりました。

3. GoogleがGeminiモデル向けにエージェント型動画理解機能をリリース

Googleは、Geminiファミリーの複数のモデルにエージェント型動画理解機能を展開しました。ネイティブの動画処理ツールとモデルのコアとなる推論能力を組み合わせることで、このアップデートは複雑な動画分析タスクのパフォーマンスを向上させます。開発者はこれらの機能を活用して、動画ストリーム内の自動的なシーン検索、異常検知、正確なオブジェクトカウントを行うためのより堅牢なアプリケーションを構築できます。

  • • Googleは複数のGeminiモデル向けにエージェント型動画理解機能をリリースしました。
  • • この機能は、ネイティブの動画ツールとモデルの推論能力を組み合わせています。
  • • シーン検索、異常検知、カウントなどのタスクにおけるパフォーマンスが向上します。

開発者は、シーン検索、異常検知、オブジェクトカウントといった複雑な動画タスクを、より高い精度で実行するアプリケーションを構築できます。

SOURCES

4. Multiverse Computingがフラッグシップ推論モデル「Quasar 438B」をリリース

Multiverse Computingは、英語とスペイン語の両方をサポートするフラッグシップ推論モデル「Quasar 438B」で大規模モデル市場に参入しました。エンタープライズ規模のエージェント、技術的なコパイロット、ワークフロー自動化向けに設計されたこのモデルは、Artificial Analysis Intelligence Index v4.1.1で43点を獲得し、欧州モデルとして最高記録を達成しました。ターミナル環境(Terminal-Bench v2.1で69.3点)や長文推論(AA-LCRで75.0点)において強力な能力を発揮し、CompactifAI APIを通じて利用可能です。

  • • Multiverse Computingは、英語とスペイン語をサポートする初の大型推論モデル「Quasar 438B」をリリースしました。
  • • Artificial Analysis Intelligence Index v4.1.1で43点を獲得し、欧州モデルとして最高の結果となりました。
  • • 長文推論ベンチマークAA-LCRで75.0点、ターミナル環境ベンチマークTerminal-Bench v2.1で69.3点を獲得しました。
  • • Quasar 438BはCompactifAI APIを通じてテストおよびデプロイが可能です。
  • • 500トークンの応答を15.3秒で完了します。

開発者は、CompactifAI APIを通じて、複雑なターミナル環境や長文推論に対応した、高性能な新しいバイリンガルモデルを選択肢として得られます。

SOURCES

5. Vercelが動的ワークロードスケーリングのための「Fluid」コンピューティングレイヤーを導入

Vercelは、リアルタイムのワークロード需要に基づいてインフラストラクチャを動的に構成するように設計された統合コンピューティングレイヤー「Fluid」を導入しました。突然のバースト容量を吸収するように設計されたFluidは、ビルド、サンドボックス、サーバーレス関数をシームレスに処理します。このシステムはすでに大規模に運用されており、月間1兆件以上のリクエストを処理し、最新のWebおよびAIアプリケーションの高い可用性とパフォーマンスを保証しています。

  • • Vercelは、さまざまなワークロードに合わせてインフラストラクチャを動的に構成する統合コンピューティングレイヤー「Fluid」を導入しました。
  • • このシステムは、ビルド、サンドボックス、関数のバースト容量を吸収するように設計されています。
  • • Fluidは現在、月間1兆件以上のリクエストをサポートするようにスケーリングされています。

Vercel上でAIアプリをデプロイする開発者は、手動構成なしで大規模なトラフィックの急増に対応できる、より回復力のある動的スケーリングインフラストラクチャを利用できます。

SOURCES

6. WebLLMがWebGPUによるブラウザ内での高性能LLM推論を実現

MLC LLMのコンパニオンプロジェクトであるWebLLMは、WebGPUを活用した高性能なブラウザ内推論エンジンを提供します。完全にクライアントサイドで実行されるため、サーバーコストやレイテンシを排除しつつ、ストリーミング、JSONモード、関数呼び出しを含むOpenAI API標準との互換性を維持しています。開発者はNPMやCDNを使用してエンジンをWebアプリケーションに簡単に統合し、重い計算をWeb WorkerにオフロードしてUIの応答性を維持し、MLC形式でコンパイルされたカスタムモデルをデプロイできます。

  • • WebLLMは、ハードウェアアクセラレーションにWebGPUを使用して、ブラウザ内で完全に言語モデルを実行します。
  • • このエンジンはOpenAI APIと互換性があり、ストリーミング、JSONモード、関数呼び出しをサポートしています。
  • • Llama 3、Phi 3、Gemma、Mistral、Qwenなどの人気のあるオープンモデルをネイティブでサポートしています。
  • • 開発者はNPM、Yarn、またはCDN経由でWebLLMを統合し、計算をWeb WorkerやService Workerにオフロードできます。
  • • エンジンは、Subresource Integrity (SRI) ハッシュを使用してモデルアーティファクトの整合性検証をオプションで提供します。

開発者は、OpenAI互換APIを使用して、ユーザーのブラウザで直接モデルを実行する、完全にローカルでプライベートなWebアプリケーションを構築できます。

SOURCES

7. PerplexityがAppleシリコンでのオンデバイス推論を最適化する「Lily」をオープンソース化

Perplexity AIは、Appleシリコン上でのオンデバイスLLMパフォーマンスを最大化するために設計された軽量なMac推論サーバー「Lily」をオープンソース化しました。スパースMoEルーティングとGated DeltaNetレイヤーを備えたQwen3.6-35B-A3Bモデル向けに特別に調整されたLilyは、ユニファイドメモリとAppleの専用ハードウェアを活用し、MLX-LMを上回るプリフィルおよびデコードスループットを実現します。リポジトリはGitHubで公開されており、開発者は単一のMac上で非常に効率的なローカル推論をホストできます。

  • • Perplexity AIは、Mac推論サーバーとして設計された「lily」リポジトリをGitHubでオープンソース化しました。
  • • このエンジンは、Appleシリコンで最高のパフォーマンスを達成するためにQwen3.6-35B-A3Bモデル向けに特別に最適化されています。
  • • Lilyはユニファイドメモリと専用ハードウェアを活用し、MLX-LMよりも高いプリフィルおよびデコードスループットを実現します。
  • • Qwen3.6-35B-A3Bモデルは、スパースMoEルーティングとGated DeltaNetレイヤーを利用しています。

開発者は、MLX-LMを上回るプリフィルおよびデコードスループットで、単一のMac上で大規模なスパースMoEモデルをローカルに実行できます。

SOURCES

8. 「Worlds via code」がClaude Fable 5.1を使用して探索可能な3Dシーンを生成

「Worlds via code」プロジェクトは、自律的なClaude Fable 5.1エージェントスウォームを使用して、実在する場所のブラウザネイティブで探索可能な3D再構築を生成する新しいパイプラインを実証しました。独自のゲームエンジンを使用せず、完全にThree.jsアプリケーションとして構築された現在のデモでは、129の店舗、動作する信号機、インタラクティブなインテリアを備えた詳細なサンフランシスコの広場を再構築しています。偵察、Blenderアセット生成、ランタイムアセンブリ、Playwrightベースの品質保証にわたるパイプライン全体が、MITライセンスの下でオープンソース化されています。

  • • 「Worlds via code」プロジェクトは、Claude Fable 5.1エージェントスウォームを使用して、実在する場所のブラウザネイティブで探索可能な再構築を作成します。
  • • 再構築は、ゲームエンジンや独自の3Dタイルを使用せず、Three.jsアプリケーションとして構築されます。
  • • 現在のデモでは、129の店舗、動作する信号機、探索可能なインテリアを備えたサンフランシスコの広場を再構築しています。
  • • パイプラインは、偵察、Blenderでのオフラインアセット生成、ランタイムアセンブリ、PlaywrightによるカメラマッチQAの4段階のプロセスを使用します。
  • • プロジェクトのコードとアセットはMITライセンスの下で公開されており、OpenStreetMapおよびUSGS 3DEPデータを使用しています。

開発者は、独自のゲームエンジンに依存することなく、実世界の空間データをインタラクティブなThree.jsアプリケーションに変換するMITライセンスのパイプラインを学習または採用できます。

SOURCES

9. SwitchがSlack、Teams、Discord全体でAIエージェントをローカル実行

Switchは、AIモデルとエージェントをSlack、Microsoft Teams、Discordに直接接続するために設計されたローカルソフトウェアツールとしてリリースされました。完全にローカルで動作し、アカウント作成を必要としないSwitchにより、開発者はプラットフォームのロックインや基盤となるインフラストラクチャの移行を必要とせずに、既存のチャットチャンネル内でエージェントワークフローをテストおよび実行できます。

  • • Switchを使用すると、ユーザーはAIモデル、インフラストラクチャ、エージェントをローカルで実行できます。
  • • このツールは、数分でエージェントをSlack、Microsoft Teams、Discordと統合します。
  • • 使用するアカウントは不要で、プラットフォームのロックインや移行を回避します。

開発者は、複雑なクラウドインフラストラクチャをセットアップしたり外部アカウントを作成したりすることなく、Slack、Teams、またはDiscordで会話型エージェントを迅速にデプロイおよびテストできます。

SOURCES

10. Hugging Faceがブラウザ推論用に最適化されたWebGPUカーネルをリリース

Hugging Faceは、高度に最適化された207個のWebGPUカーネルを含む専用ライブラリ「@huggingface/kernels」を立ち上げました。このライブラリはクライアントサイドのAIモデル推論を高速化するために構築されており、Web開発者は最小限のレイテンシと最大限のハードウェア利用率で、複雑なニューラルネットワーク操作をブラウザ内で直接実行できます。

  • • Hugging Faceは「@huggingface/kernels」ライブラリを導入しました。
  • • このライブラリには207個の最適化されたWebGPUカーネルが含まれています。
  • • Webブラウザ内で直接AIモデル推論を高速化するように設計されています。

Web開発者は、これらの事前最適化されたカーネルを活用して、クライアントサイドのモデル実行を大幅に高速化し、より応答性の高いローカルAI機能を構築できます。

SOURCES

11. AnthropicがC2PAファイルチェックツールと検出APIプレビューをリリース

不可視の透かしを実装するという8月のコミットメントに基づき、Anthropicは、ファイルがClaudeによって処理されたかどうかを検証するために、暗号署名されたC2PAメタデータを読み取るツールをリリースしました。このツールはユーザーのデバイス上でローカルに動作します。さらに、同社はテキスト透かし用の検出APIのプライベートプレビューを開始し、組織がEUのAI規制に準拠してコンテンツの来歴を検証できるようにしました。

  • • Anthropicは、.png、.jpg、.svgファイル内のC2PAメタデータを検証するためのローカルツールをリリースしました。
  • • テキスト透かし用の検出APIのプライベートプレビューが、対象となる組織向けに利用可能になりました。
  • • これらのリリースは、Claudeによって生成されたコンテンツを検出するための技術的手段を提供するという同社の以前のコミットメントを果たすものです。
  • • ファイルチェックツールは、ファイルをAnthropicに送信することなくメタデータをローカルで処理することでプライバシーを確保します。

これらのツールは、Anthropicが以前に発表した来歴基準の実用的な実装を提供し、開発者や組織がClaudeによって生成されたコンテンツを検証できるようにします。

SOURCES

12. UnslothがDeepSeek-V4-Flash-Vision-ExpのGGUF量子化をサポート

8月31日のHugging FaceでのDeepSeek-V4-Flash-Vision-Expの重みリリースに基づき、UnslothはモデルのGGUF形式サポートを統合しました。このアップデートにより、開発者は実験的な視覚対応モデルの量子化バージョンをローカルで実行できるようになり、リソースが制限された環境への統合が容易になります。

  • • UnslothはDeepSeek-V4-Flash-Vision-ExpモデルのGGUFサポートを追加しました。
  • • これは、8月31日のHugging Faceでのモデルの重みリリースに続くものです。
  • • このアップデートにより、実験的な視覚モデルのローカルでの量子化推論が可能になります。

この開発により、開発者は生の重みをホストするだけでなく、DeepSeek-V4-Flash-Vision-Expモデルの最適化された量子化バージョンをローカルで実行できるようになります。

SOURCES

13. llama.cppがApple M5ニューラルアクセラレータのMetalサポートを正式に追加

llama.cppプロジェクトは、M5行列乗算とニューラルアクセラレータをネイティブでサポートするようにMetalバックエンドを更新しました。この公式統合により、以前はカスタムw8a8カーネルを必要としていたパフォーマンスのギャップが解消され、M5ハードウェア上でUnslothのQ_8 GGUFモデルのプリフィルパフォーマンスが毎秒300〜350トークンに向上しました。M5 Pro上でQwen3.8 27Bモデル(Q8範囲)の生成速度が毎秒19トークンに達し、llama.cppはネイティブのMLXモデルと同等のパフォーマンスを達成しました。

  • • llama.cppは、M5行列乗算およびニューラルアクセラレータのネイティブMetalサポートを含むようになりました。
  • • このアップデートにより、M5のパフォーマンスを解放するために以前報告されていたカスタムw8a8カーネルの必要性がなくなりました。
  • • M5ハードウェア上のUnslothのQ_8 GGUFモデルのプリフィルパフォーマンスは、現在毎秒300〜350トークンに達します。
  • • M5 Pro上のQ8範囲のQwen3.8 27bモデルで、毎秒約19トークンの生成速度が観測されました。

開発者は、デフォルトの16ビットアクティベーション制限を回避するためにサードパーティのカスタムカーネルに頼ることなく、メインのllama.cppプロジェクト内で直接M5ハードウェアアクセラレーションを活用できるようになりました。

SOURCES

14. VoxGenが軽量でAMDに最適化されたTTS推論エンジンをリリース

VoxGenは、VoxCPM2モデル専用に設計された軽量なネイティブテキスト読み上げ推論エンジンとしてリリースされました。Rustで記述され、Vulkanコンピューティングで動作するVoxGenは、Python、PyTorch、CUDAを完全にバイパスし、AMDグラフィックスカード(XTX 7900専用モードを含む)で最適化されたパフォーマンスを提供します。エンジンはシェルから直接実行されるため、開発者はローカルで低レイテンシの音声合成をアプリケーションやスクリプトに簡単に統合できます。

  • • VoxGenは、Rustで記述されたVoxCPM2モデル用の軽量なネイティブ推論エンジンです。
  • • このエンジンはPython、PyTorch、CUDAの代わりにVulkanコンピューティングを利用し、AMD GPU向けにパフォーマンスを最適化します。
  • • AMD Radeon XTX 7900向けの特定の最適化モードを備えています。
  • • アプリケーションはシェルから実行されるため、外部スクリプトやプログラムとの統合が容易です。
  • • インストールには、VoxGen実行ファイルとHugging Faceからの2つのモデルファイルが必要です。

開発者は、重いPythonやPyTorchの依存関係に頼ることなく、AMDハードウェア上でローカルかつ高性能な音声合成を実行できます。

SOURCES

15. MistralがVibeおよびAPIユーザー向けのデータトレーニングオプトアウト設定を詳細化

Mistralは、ユーザーや開発者が入力および出力データがモデルトレーニングに使用されることをオプトアウトするために必要な具体的な手順を概説しました。Vibe Enterpriseアカウントはデフォルトでオプトアウトされていますが、標準のVibe、モバイル、APIユーザーは手動で設定を調整する必要があります。Mistral StudioまたはAPIを使用する開発者は、管理パネルの「匿名改善データ」トグルを無効にすることでデータを保護できますが、VibeとAPIのオプトアウト構成は個別に管理されることに注意してください。

  • • Mistralは、ユーザーがオプトアウトしない限り、ユーザーの会話やアップロードされたドキュメントをモデルトレーニングに使用する場合があります。
  • • Vibe Enterpriseの顧客はデフォルトでトレーニングからオプトアウトされていますが、標準のVibeユーザーは設定から手動でオプトアウトする必要があります。
  • • APIおよびMistral Studioのユーザーは、管理パネルの「匿名改善データ」トグルを無効にすることでオプトアウトできます。
  • • iOSおよびAndroidのモバイルアプリユーザーは、設定で「データ共有を有効にする」の選択を解除することでオプトアウトできます。
  • • VibeとAPIのオプトアウト設定は別々であり、個別に構成する必要があります。

開発者やチームは、独自の入力や出力がモデルトレーニングに使用されるのを防ぐために、Mistral管理パネルでプライバシー設定を手動で構成する必要があります。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。