Inference Brew

GoogleがGemini 3.5 Transcribeを正式リリースし、Gemini 3.8 Liveを発表

00:00 / --:--

← ホームへ戻る

GoogleがGemini 3.5 Transcribeを正式リリースし、Gemini 3.8 Liveを発表

1. GoogleがGemini 3.5 Transcribeを正式リリースし、Gemini 3.8 Liveを発表

Googleは音声およびオーディオ機能を拡充し、Gemini 3.5 Transcribeをパブリックプレビューから一般提供へと移行させるとともに、新しいGemini 3.8 Liveモデルを発表しました。これらのアップデートにより、8月に発表されたTranscribeモデルのプレビューや7月のGemini Live APIの広範なリリースに続き、開発者はリアルタイム音声アプリケーション向けに、より安定した本番環境対応のツールを利用できるようになります。

  • • Gemini 3.5 Transcribeは、2026年8月26日のパブリックプレビュー開始を経て、一般提供が開始されました。
  • • Googleは、リアルタイム音声対話に最適化された新しいモデル「Gemini 3.8 Live」を導入しました。
  • • このリリースにより、開発者は低遅延の音声認識やライブ会話エージェントのための本番環境対応ツールを利用できます。

開発者は、完成版のGemini 3.5 Transcribeと新しく利用可能になったGemini 3.8 Liveモデルを使用して、本番グレードのリアルタイム音声アプリケーションを構築できるようになりました。

SOURCES

2. Prior Labsが表形式データ用基盤モデル「TabPFN-3.5」をリリース

Prior Labsは、パラメータ数を2億2000万にスケールアップした表形式データ用基盤モデルのメジャーアップデート版「TabPFN-3.5」を立ち上げました。デフォルト設定で生のデータに対して動作するように設計されており、データセットごとのトレーニングを必要とせず、分類や回帰タスクを即座に実行します。今回のリリースには、より高速な8400万パラメータ版、ネイティブなテキスト処理に対応した企業向けのPlus版、および推論計算を強化したThinking版が含まれています。

  • • Prior Labsは、単一のフォワードパスで予測を行う2億2000万パラメータの表形式データ用基盤モデル「TabPFN-3.5」をリリースしました。
  • • 本モデルは「Otto Group Product Classification Challenge」で0.375のスコアを達成し、Kaggleの優勝ソリューションを上回りました。
  • • TabPFN-3.5は、TabArenaやScoringBenchを含む7つの表形式ベンチマークで1位を獲得しています。
  • • 最大100万行、最大2万特徴量(推奨は6000)までサポートしています。
  • • オープンウェイトは研究、評価、Kaggle利用向けに提供されており、本番環境へのデプロイには商用ライセンスまたはPrior Labs APIが必要です。

開発者は、データセットごとのトレーニングやチューニングを行うことなく、単一のフォワードパスで高精度な表形式データの分類や回帰を実行できます。

SOURCES

3. Nums AIが表形式データ用基盤モデル「Causilo」をリリース

Nums AIは、完全に合成データで事前学習された表形式データ用基盤モデル「Causilo」を発表しました。Causiloは標準的なscikit-learnインターフェースを介して既存のPythonワークフローに直接統合でき、コードはApache-2.0ライセンスで提供されます。クロスアテンションを採用することで、特徴量数に対して線形的な計算量を維持しており、大規模な表形式データセットに対して非常に効率的です。

  • • Nums AIは、分類および回帰タスク向けの事前学習済み表形式データ用基盤モデル「Causilo」をリリースしました。
  • • 本モデルはscikit-learnインターフェースを備えており、Apache-2.0ライセンスのコードと事前学習済みウェイトがHugging Faceで公開されています。
  • • Causiloは、TabArenaベンチマークの分類および回帰の両部門において、単一モデルとして最高のEloスコアを保持しています。
  • • アーキテクチャは3段階のプロセス(リファインメント、圧縮、インコンテキスト学習)とクロスアテンションを採用し、計算コストを特徴量数に対して線形に保っています。
  • • Python 3.10〜3.12およびPyTorch 2.13以降が必要で、研究および評価目的であれば無料で利用可能です。

開発者は、使い慣れたscikit-learnインターフェースを使用して、高性能なオープンソースの表形式モデルをPythonパイプラインに統合できます。

SOURCES

4. Knowledgatorがスキーマ条件付きエンコーダー「GLiFormer」をリリース

Knowledgator Engineeringは、テキストトークンを生成することなく複数の抽出タスクを処理するように設計されたオープンソース・エンコーダーフレームワーク「GLiFormer」をリリースしました。提供されたスキーマやアンカーとの適合性を直接スコアリングすることで、従来の生成型LLMに伴う遅延を回避します。Apache 2.0ライセンスのチェックポイントはBase(2億6400万)およびLarge(5億7500万)サイズで提供されており、構造化データ抽出のための高速かつコスト効率の高い代替手段となります。

  • • Knowledgator Engineeringは、情報抽出のためのスキーマ条件付きエンコーダーフレームワーク「GLiFormer」をリリースしました。
  • • 単一のエンコーダーを使用して、固有表現抽出、テキスト分類、関係抽出、ネストされたJSON構造化、テキスト埋め込みを実行します。
  • • GLiFormer Large(5億7560万パラメータ)は、ネストされたJSON抽出ベンチマークでF1スコア91.10を達成しました。
  • • モデルのチェックポイントはApache 2.0ライセンスで公開されており、CPUおよびGPUハードウェアの両方と互換性があります。
  • • GLiFormer-base(2億6420万パラメータ)は、NVIDIA RTX PRO 6000 Blackwell GPU上で69msの中央値レイテンシを記録しました。

開発者は、生成型LLMのトークン生成に伴う遅延やコストを発生させることなく、高精度なスキーマ条件付き情報抽出やネストされたJSON構造化を実行できます。

SOURCES

5. Ant Groupが金融特化型オープンウェイトモデル「Ling-3.0-flash-Fin」をリリース

Ant Groupは、Ling-3.0-flashアーキテクチャをベースに構築された専門的な金融モデル「Ling-3.0-flash-Fin」をリリースしました。このモデルは、ソースチェック、レポート作成、スプレッドシート作成などのドメイン固有のタスクを支援するように設計されています。ビジネス知識の正確性は高いものの、評価によると、同アーキテクチャのマルチモーダル版と比較してハルシネーション(幻覚)の発生率が高いことが示されています。

  • • Ant Groupは、MITライセンスの下で金融特化型のオープンウェイトモデル「Ling-3.0-flash-Fin」をリリースしました。
  • • 本モデルは、総パラメータ数124B、トークンあたりのアクティブパラメータ数5.1BのMixture-of-Expertsアーキテクチャを採用しています。
  • • 256Kトークンのコンテキストウィンドウをサポートし、入力・出力はテキストのみに限定されています。
  • • OpenRouterで利用可能であり、レート制限付きの無料エンドポイントも提供されています。
  • • Ling-3.0-flash-FinはArtificial Analysis Intelligence Indexで23のスコアを獲得し、アクティブパラメータ数が半分でありながらMiniMax-M2.7と同等の性能を示しています。

金融アプリケーションを構築する開発者は、レポート作成や評価タスク向けに、256Kのコンテキストウィンドウを備えた専門的なMITライセンスのオープンウェイトモデルを活用できます。

SOURCES

6. TypeSafe AIが高速意思決定モデル「Jev System One」を発表

TypeSafe AIは、ソフトウェアワークフローへの直接統合を目的として構築された専門的な「System One」モデル「Jev」の早期アクセスを開始しました。自由形式のテキストを生成する従来のLLMとは異なり、Jevは構造化された出力と選択肢の選定専用に設計されています。そのアーキテクチャは、従来のモデルよりも最大2桁高速に動作しながら、ハルシネーションを完全に排除するように最適化されています。

  • • TypeSafe AIは、ソフトウェアにおける高速で構造化された意思決定のために設計された新しいクラスの「System One Model」である「Jev」を発表しました。
  • • 本モデルは構造化出力に最適化されており、ハルシネーションが発生しないとされています。
  • • Jevは、既存の大規模言語モデルと同等の知能を維持しながら、2桁高速かつ効率的であると主張されています。
  • • 本モデルは現在、早期アクセスで利用可能です。

開発者は、ソフトウェアにおける高速かつ構造化された意思決定に特化して最適化された、非常に効率的でハルシネーションのない新しいクラスのモデルを利用できます。

SOURCES

7. GoogleがGoogle HomeのModel Context Protocolサーバーを立ち上げ

Googleは、開発者が構築したAIエージェントに対してスマートホームエコシステムを開放するため、Model Context Protocol(MCP)サーバーの早期アクセス版を立ち上げました。この統合により、ClaudeやChatGPTを含む外部エージェントは、自然言語を使用してデバイスの状態照会、カメラフィードの確認、スマートホームハードウェアの制御が可能になります。利用を開始するには、開発者はGoogle Cloudプロジェクトを構成し、Home MCPサーバーとインターフェース接続する必要があります。

  • • Googleは、Google Home向けのModel Context Protocol(MCP)サーバーの早期アクセスを開始しました。
  • • この統合により、ClaudeやChatGPTなどのサードパーティAIエージェントが、接続されたスマートホームデバイスの制御やカメラの要約へのアクセスが可能になります。
  • • セットアップには、開発者がHome MCP用にGoogle Cloudプロジェクトを作成および構成する必要があります。
  • • この機能は、当初は米国のGoogle Home Premium Advancedユーザー向けに月額20ドルまたは年額200ドルで提供されます。
  • • Googleは、レート制限やドアの解錠をエージェントに許可しない制限など、安全対策を実装しています。

開発者は、Model Context Protocolを使用して、Google Homeのスマートデバイスを直接操作、監視、制御するAIエージェントを構築できるようになりました。

8. スタンフォード大学の研究者が「Paper2Agent」パイプラインをリリース

スタンフォード大学の研究者は、科学論文とそのコードリポジトリをModel Context Protocol(MCP)サーバーに変換するプロセスを自動化するオープンソースパイプライン「Paper2Agent」を発表しました。このシステムは環境を管理し、ツールを抽出し、厳格な検証ゲートを実行して、生成されたエージェントの出力が元の論文の図や数値結果と一致することを保証します。MITライセンスのこのツールにより、開発者は高度に専門化された科学エージェントを迅速に構築できます。

  • • スタンフォード大学の研究者は、研究論文とコードベースを実行可能なMCPサーバーに変換するシステム「Paper2Agent」をリリースしました。
  • • このパイプラインは、数値結果が3%以内で一致し、図がパーセプチュアルハッシュで一致することを要求する厳格な検証ゲートを備えています。
  • • 100本のbioRxiv論文を用いたスケールテストでは、74本の論文が変換に成功し、599個のツールのうち593個が検証を通過しました。
  • • ソフトウェアはMITライセンスで提供され、構築済みのサーバーはHugging Face Spacesでホストされています。
  • • AlphaGenomeエージェントの作成には45分と14ドルのコストがかかり、22個のツールすべてが検証を通過しました。

開発者は、科学論文とそれに関連するコードベースを、AIエージェントが実行するための完全に検証されたModel Context Protocolサーバーに自動変換できます。

SOURCES

9. Ory Agent SecurityがAIエージェント向けのHarness-Layerガバナンスを立ち上げ

Ory Agent Securityは、AIコーディングエージェントを管理するために特別に設計されたベンダー非依存のセキュリティソリューションを発表しました。ハーネス層で動作することで、このツールはアクションが外部ゲートウェイに到達する前にインターセプトして評価します。このシステムは11の主要なAIコーディングエージェントハーネスと互換性があり、開発者が自律型エージェントのIDおよびアクセス管理を実装するための具体的な手段を提供します。

  • • Ory Agent Securityは、ハーネス層でAIエージェントの実行を管理するためにリリースされました。
  • • このツールはベンダー非依存であり、ゲートウェイ呼び出しが行われる前に動作します。
  • • Ory Agent Securityは、11の主要なAIコーディングエージェントハーネスと互換性があります。
  • • このソリューションは、AIエージェントが人間のユーザー数を上回るようになるにつれて生じるセキュリティ課題に対処するために設計されています。

開発者は、外部ゲートウェイへの呼び出しを行う前にハーネス層でセキュリティポリシーを実行することで、AIコーディングエージェントを保護および管理できます。

SOURCES

10. Cloudflareが9月の期限を経て「AI学習の拒否」設定を導入

Cloudflareは「AI学習の拒否」設定を実装し、7月に設定されたクローラー分離の9月15日の期限を達成しました。この新機能により、サイト所有者は検索エンジンによるコンテンツのインデックス作成を許可しつつ、混合型クローラーによるAIモデルの学習をブロックできます。このロールアウトにより、従来のボット管理ツールが統合された「Bot Preference Sync」システムに置き換わり、Google、Apple、Microsoftなどの主要な運営者が新しいオプトアウト設定を尊重するというコミットメントが含まれています。

  • • Cloudflareは「AI学習の拒否」設定を正式に開始し、クローラー分離の9月15日の期限を達成しました。
  • • この機能により、サイト所有者は検索の発見可能性を維持しながら、混合型クローラーによるAI学習をブロックできます。
  • • Google、Apple、Microsoftを含む主要な運営者が、新しいオプトアウト設定を尊重することを約束しました。
  • • このアップデートにより、従来のボット管理ツールが新しい「Bot Preference Sync」システムに置き換わりました。
  • • Cloudflareは、来年初めまでにAI生成要約に対するさらなる詳細な制御を導入する予定です。

このリリースは、サイト所有者がクローラー分離ポリシーを強制するための最終的なメカニズムを提供し、検索エンジンのランキングを犠牲にすることなく、コンテンツを不正なAI学習から保護します。

SOURCES

11. Openjevプロジェクトがオープンソースのシングルパス選択モデルを提供

Openjevプロジェクトは、TypeSafeのJevのような商用選択モデルに対するオープンソースでMITライセンスの代替手段を提供します。オプションアテンションヘッドを使用して入力をシングルパスでスコアリングすることで、モデルは標準的なトークン生成の遅延を回避します。このリポジトリは、デフォルトのバイトエンコーダー、またはQwen2.5-0.5BのようなHugging Faceの事前学習済みエンコーダーを使用したトレーニングをサポートしており、8つのオプションを評価する際に400トークンの書き出しを強制される小さなデコーダーよりも約100倍高速であると報告されています。

  • • Openjevプロジェクトは、変化するテキストオプションのリストからシングルパスで選択を行うように設計された、独立したMITライセンスのスターターモデルを提供します。
  • • 本モデルは、8つのオプションを評価する際に400トークンの書き出しを強制される小さなデコーダーよりも約100倍高速であると報告されています。
  • • オプションアテンションヘッドを使用して入力をスコアリングし、オプションをクエリベクトルに変換してコンテキストトークンにアテンションの重みを割り当てます。
  • • ローカル実験では、このシングルパススコアラーは合成メニューで約98%、Wikispeediaの次クリックデータで29%の精度に達しました。

開発者は、低速なトークン生成デコーダーに依存することなく、アプリケーション内で超高速なシングルパス分類およびオプション選択を実装できます。

12. GSQ-RCO量子化がローカルGPU向けにQwen3.8-Flash-Nextをさらに最適化

125BのQwen3.8-Flash-Nextモデルに対するこれまでの最適化リリース(NVIDIAのNVFP4やAtomicChatのSSDオフロードなど)に基づき、新しいGSQ-RCO量子化手法はローカルデプロイのための追加のパスを提供します。Q2_0およびIQ3_XXSバリアントを最適化することで、この手法はベースラインに近い性能を維持しながら12GB VRAMのハードウェアでモデルを実行可能にし、既存の量子化およびオフロード戦略の代替手段を提供します。

  • • GSQ-RCO量子化により、Qwen3.8-Flash-Nextモデルのサイズが68〜76GBに削減されます。
  • • Q2_0バリアントは、IQ2_XSと比較して6.2倍のプロンプトスループットと1.9倍の低レイテンシを実現します。
  • • IQ3_XXSバリアントは、12GBのRTX 5070上で毎秒15トークンの出力を達成します。
  • • 性能はAIME25でベースモデルと一致し、GPQA-Diamondでは0.51ポイント以内の差を維持しています。

開発者は、以前にリリースされたNVFP4やSSDオフロード技術を補完し、コンシューマーハードウェアで巨大なQwen3.8-Flash-Nextモデルを実行するための、非常に効率的な追加の量子化オプションを手に入れました。

SOURCES

13. vLLM実装がQwen3.8-Flash-NextのKVキャッシュをRAMにオフロード

開発者は、KVキャッシュをシステムRAMにオフロードすることで、vLLM上で100万トークンのコンテキスト長を持つQwen3.8-Flash-Nextを実行できるようになりました。このアプローチは、12層のKVキャッシュと36層のゲート付きデルタネット層を組み合わせたモデル独自のアーキテクチャを活用しています。QSAメカニズムを使用してデコードステップごとに最大2,048の位置をインデックス化および読み取ることで、モデルの量子化がVRAMに収まりにくい場合でも、システムは高いスループットを維持します。

  • • 新しい実装により、開発者はQwen3.8-Flash-NextのKVキャッシュの大部分を、デコードの減速を最小限に抑えつつシステムRAMにオフロードできます。
  • • このセットアップは、3枚のNVIDIA 3090 GPUを使用してvLLM上で100万トークンのコンテキスト長を達成しました。
  • • モデルアーキテクチャは、メモリを管理するためにKVキャッシュを持つ12層と、固定サイズのリカレント状態を持つ36層のゲート付きデルタネット層を使用しています。
  • • QSAメカニズムは、各デコードステップで読み取られるKVキャッシュデータの量を、最大2,048の位置を選択することで制限します。

開発者は、限られたGPU VRAMによってボトルネックになることなく、最大100万トークンの非常に長いコンテキストを持つローカルモデルを実行できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。