Inference Brew

Googleがエンコーダーフリーのマルチモーダルアーキテクチャを採用した「Gemma 4 12B」をリリース

00:00 / --:--

← ホームへ戻る

Googleがエンコーダーフリーのマルチモーダルアーキテクチャを採用した「Gemma 4 12B」をリリース

1. Googleがエンコーダーフリーのマルチモーダルアーキテクチャを採用した「Gemma 4 12B」をリリース

Google DeepMindのGemma 4 12Bは、個別の視覚・音声エンコーダーを排除するという主要なアーキテクチャの転換を示しています。代わりに、35Mパラメーターのエンベダーが視覚パッチを処理し、生の音声フレームがLLMのコア埋め込み空間に直接投影されます。この統合設計により、16GBのVRAMまたはユニファイドメモリを搭載したコンシューマー向けハードウェアでローカル実行が可能となり、Googleは26BのMixture of Expertsモデルに近い性能を実現したと主張しています。

  • Gemma 4 12Bは、Apache 2.0ライセンスでリリースされた119.5億パラメーターのモデルです。
  • 生の音声(16kHz)と視覚パッチ(48x48ピクセル)がLLMバックボーンに直接流し込まれるエンコーダーフリーのアーキテクチャを採用しています。
  • 256Kトークンのコンテキストウィンドウ、ネイティブなエージェントツール使用、ステップバイステップの推論モードをサポートしています。
  • llama.cpp、MLX、vLLM、Ollama、SGLang、Unsloth、LM Studioと互換性があります。
  • ローカル推論のレイテンシを低減するための専用のMulti-Token Prediction (MTP) ドラフターモデルが含まれています。

開発者は、個別の視覚・音声エンコーダーを排除して複雑さとレイテンシを低減し、高性能なマルチモーダルモデルを標準的な16GBのノートPCでローカル実行できるようになります。

2. Nous Researchがローカルエージェントワークフロー向け「Hermes Desktop GUI」をリリース

Hermes Desktopは、自律型Hermes Agentに洗練されたグラフィカルインターフェースをもたらします。このアプリケーションは、ライブのツールアクティビティ、ストリーミング応答、ファイルブラウジングを可視化しつつ、自己改善可能な再利用スキルやセッション間リコールといったエージェントのコア機能を維持します。開発者は、DockerやModalなどのサンドボックス化されたバックエンドを使用して、エージェントタスクを安全に実行できます。

  • Hermes Desktopは、macOS、Windows、Linuxで利用可能なネイティブアプリケーションです。
  • Hermes Agent v0.15.2と統合されており、CLIと同じコア、設定、APIキー、メモリを共有します。
  • local、Docker、SSH、Singularity、Modalの5つのバックエンド全体でサンドボックス実行をサポートしています。
  • Model Context Protocol (MCP) を介したツール統合と、エージェントが管理する永続的なメモリ機能を備えています。
  • MITライセンスでリリースされており、モデルに依存しません。

ストリーミングツール出力、サンドボックス実行、Model Context Protocol (MCP) サポートを備えた視覚的インターフェースを提供することで、ローカルエージェント開発を簡素化します。

SOURCES

3. 「sandboxed」がプレビューURL付きのオープンソース開発サンドボックスを提供

AIコーディングプレイグラウンドやエージェントプラットフォームのようなマルチテナントユースケース向けに設計されたsandboxedは、Kubernetesを回避することでインフラを簡素化します。単一のLinuxホスト上で軽量なDockerとTraefikのセットアップを使用し、アイドル停止メカニズムを活用することで、複数のサンドボックスがサーバーリソースを効率的に共有できるようにします。

  • Docker、Traefik、SQLiteを使用して単一サーバー上で動作します。
  • メモリとホスティングコストを最適化するためのアイドル停止およびリクエスト時起動メカニズムを備えています。
  • AI駆動のコーディングタスク用に、OpenCodeおよびClaude Code CLIがプリインストールされています。
  • ライブプレビューURLのための自動ルーティングとTLSをサポートしています。

AIアプリビルダーやエージェントプラットフォームの開発者は、Kubernetesの複雑さを伴わずに、安全なマルチテナント実行環境を簡単に立ち上げることができます。

SOURCES

4. MnemoがLLM向けローカルファーストのAIメモリレイヤーをローンチ

Mnemoは、ローカルのサイドカーサービスとして動作することで、長期的なエージェントメモリの課題に対処します。LLM入力を解析してSQLite内に構造化されたナレッジグラフを構築することで、外部のクラウドデータベースや複雑なベクトル検索設定に依存することなく、履歴コンテキストの迅速かつ低レイテンシな取得を可能にします。

  • Rustで記述された単一の静的バイナリとして配布され、SQLiteとpetgraphを利用しています。
  • テキストから名前付きエンティティと関係性を抽出し、50ミリ秒未満でアトミックな更新を実行します。
  • Ollama、OpenAI、Anthropic、およびその他のOpenAI互換APIと統合可能です。
  • CLIツール、Python SDK、REST APIを提供しています。

開発者は、クラウド依存ゼロで、LLMセッション全体にわたって長期的なコンテキストを維持するための高速なメモリレイヤーを利用できます。

SOURCES

5. Alibabaの「Fun-Realtime-TTS」がSpeech Arenaリーダーボードで首位を獲得

AlibabaのFun-Realtime-TTSは、Artificial Analysis Speech Arenaリーダーボードにおいて、GoogleのGemini 3.1 Flash TTSやInworldのRealtime TTS-2を追い抜きました。このモデルは、音声クローン作成や地域アクセント付きの多言語出力など、堅牢な機能セットを提供しており、音声対応エージェントを構築する開発者にとって魅力的な選択肢となっています。

  • 962回のArena登場に基づき、Eloスコア1,219を達成して1位を獲得しました。
  • 価格は100万文字あたり27.59ドルで、Sonic 3.5などのフロンティアTTSモデルよりも安価です。
  • リアルタイム音声生成、音声クローン作成、音声デザイン、地域アクセントをサポートしています。
  • Alibaba Cloud APIアクセスを通じて開発者が利用可能です。

開発者は、低レイテンシで手頃な価格の、競争力の高いトップクラスのテキスト読み上げ(TTS)オプションを利用できるようになります。

SOURCES

6. llama.cppがQwenモデル向けにMulti-Token Predictionを最適化

llama.cppの最新アップデートは、Multi-Token Predictionによるローカル推論の高速化に焦点を当てています。ポストノルムの隠れ状態の処理方法を最適化することで、フレームワークはより高いドラフト受け入れ率を達成し、互換性のあるQwenモデルをローカルで実行する際のトークン毎秒(TPS)出力の向上を実現しました。

  • Llama.cppバージョンb9495では、特にQwen3.5およびQwen3.6向けのMTP関連の改善が導入されました。
  • プルリクエスト(PR #24025)により、Qwen3.5のポストノルム隠れ状態を使用してMTPを高速化しています。
  • 初期のベンチマークでは、Qwen3.6-35B-A3B-MTPのドラフト受け入れ率が0.526であることが示されています。

マルチトークン生成中のドラフト受け入れ率を向上させることで、Qwenモデルを実行する開発者のローカル推論速度が向上します。

SOURCES

7. QLoRAとDPOを用いたLFM2-1.2Bのファインチューニング手順ガイド

このステップバイステップのコーディングチュートリアルは、Liquid AIのLFM2-1.2Bモデルを適応させるための完全なパイプラインを提供します。パラメーター効率の高いトレーニングのためのQLoRAと、その後のDPOアライメントステップを組み合わせることで、開発者は無料または低コストのGoogle Colab環境内で、最新のアライメントワークフローを完全に再現できます。

  • Transformers、TRL、PEFT、datasets、bitsandbytesなどのオープンソースライブラリを使用しています。
  • 「smoltalk」データセットから500サンプルを使用し、60ステップで教師ありファインチューニング(SFT)を実演しています。
  • モデルの応答を調整するために、40ステップにわたる直接選好最適化(DPO)を組み込んでいます。
  • トレーニング中のGPUメモリ使用量を最小限に抑えるために、4ビット量子化を採用しています。

独自のデータで小型かつ効率的なモデルをカスタマイズしようとしている開発者向けに、具体的で低リソースなレシピを提供します。

SOURCES

8. VercelがAI推論の盗用を防ぐためのBotID分析を推奨

AIアプリケーションの成長に伴い、攻撃者は公開されたAPIエンドポイントを標的にして、モデルの推論を盗んで再販するケースが増えています。Vercelの分析では、標準的なレート制限戦略ではこれらの攻撃を阻止できないことが強調されており、LLMプロバイダーにリクエストをルーティングする前に、BotID分析を採用してクライアントの真正性を検証するよう開発者に促しています。

  • 攻撃者は公開されたフロントエンドエンドポイントを悪用して、AI推論を乗っ取り再販しています。
  • 従来のレート制限は、巧妙な不正再販を阻止するには不十分な場合が多いです。
  • Vercelは、すべての着信AIリクエストの正当性を検証するために、BotID分析を実装することを推奨しています。

開発者がAPIキーを保護し、許可されていない第三者がモデルアクセスを再販することによって発生する予期せぬクラウド料金を防ぐのに役立ちます。

SOURCES

9. Ideogramがオープンウェイトの画像生成モデル「Ideogram 4」をリリース

Ideogramは、最新の画像生成モデルv4をオープンウェイトで公開しました。このモデルは急速にDesignArenaリーダーボードのトップに躍り出ており、開発者にプロプライエタリな画像生成APIに代わる、非常に競争力の高いオープンな選択肢を提供しています。

  • Ideogram v4がオープンウェイトでリリースされました。
  • 現在、DesignArenaプラットフォームでトップモデルとしてランク付けされています。
  • 即座にダウンロードして統合することが可能です。

開発者は、ローカルでホストしたりアプリに統合したりできる、最先端のオープンウェイト画像生成モデルを利用できるようになります。

SOURCES

10. Angular v22がネイティブMCPとエージェントツールを導入

Angular v22は、コアフレームワークとAI開発者ツールの両方に重要なアップデートをもたらします。ネイティブなMCPサポートと実験的なWebMCP機能を導入することで、AIエージェントやコーディングアシスタントがブラウザ内で直接Angularアプリケーションを理解、リファクタリング、操作することが容易になりました。

  • 更新されたMCPの提供とAngularエージェントスキルを導入し、AIアシスタントに最新のAngularコンテキストを提供します。
  • WebMCPの実験的サポートを追加し、エージェントがブラウザツールと直接対話できるようにしました。
  • Signal Forms、Angular Aria、非同期リアクティビティAPIを本番環境対応ステータスに移行しました。
  • TypeScript 6との互換性を備え、Webpackを非推奨とし、TSGoを優先しています。

フロントエンド開発者は、Angular固有のコンテキストやブラウザツールをAIコーディングアシスタントに簡単に公開できるようになります。

SOURCES

11. 「iiiエンジン」でドキュメントインテリジェンスバックエンドを構築

iiiエンジンとそのPython SDKは、ドキュメントインテリジェンスパイプラインの作成を簡素化します。個別の処理関数を登録することで、開発者はスケジュール実行やHTTP経由のトリガーで動作する複雑なワークフローを編成でき、Prometheusサポートが組み込まれているため、スループットやシステムの状態を簡単に監視できます。

  • テキスト正規化、トークン化、感情分析、キーワード抽出のためのモジュール式関数をサポートしています。
  • 直接呼び出し、HTTPエンドポイント、スケジュールされたcronトリガーなど、複数の実行方法を提供します。
  • ランタイムメトリクスとハートビートを追跡するために、共有のインメモリ状態を維持します。
  • ローカルコンソールまたはポート9464でのPrometheusメトリクススクレイピングを通じて監視可能です。

ローカルまたはHTTP経由で、ステップ数の多いドキュメント処理パイプラインを構造化し、監視可能な方法で編成できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。