Inference Brew

H CompanyがNeoMMEシングルタワー型マルチモーダルエンコーダーを発表

00:00 / --:--

← ホームへ戻る

H CompanyがNeoMMEシングルタワー型マルチモーダルエンコーダーを発表

1. H CompanyがNeoMMEシングルタワー型マルチモーダルエンコーダーを発表

H Companyは、シングルタワー型マルチモーダルモデルとして機能する260Mおよび800Mパラメーターの双方向エンコーダーファミリー「NeoMME」を発表しました。多言語テキストと生の32x32 RGB画像パッチを単一のTransformerで処理することで、NeoMMEは独立したビジョンタワーや因果デコーダーを不要にしました。小型ながら、NeoMME-Retriever-260MはViDoRe v3ベンチマークにおいて3.75BのColQwen2.5モデルと同等の性能を発揮します。本モデルはApache 2.0ライセンスで公開されており、16,384トークンのコンテキストをサポートし、インデックスストレージを1ページあたり1.5MBからわずか6kBに圧縮可能です。

  • • NeoMMEモデルは260Mおよび800Mパラメーターサイズで提供され、Apache 2.0ライセンスの下、Hugging Faceで即日利用可能です。
  • • シングルタワーアーキテクチャにより、多言語テキストと生の32x32 RGB画像パッチを単一のTransformerで処理し、独立したビジョンタワーを排除しました。
  • • NeoMME-Retriever-260Mは、ViDoRe v3ベンチマークで0.523 nDCG@10を記録し、3.75BパラメーターのColQwen2.5モデルと同等の性能を示しました。
  • • NVIDIA L40S上で、260Mモデルは毎秒51.3ページのインデックス作成が可能であり、CPUのみのホストでのクエリエンコードは78.3msで完了します。
  • • 階層型トークンプーリングと非対称量子化を使用することで、インデックスストレージ要件を1ページあたり1.5MBから6kBに削減できます。

開発者は、CPU上で高速に動作し、最小限のインデックスストレージで済むコンパクトなモデルを使用して、効率的なマルチモーダル検索およびRAGパイプラインを構築できます。

SOURCES

2. XHTokenが100万トークンのコンテキストウィンドウを持つSpark-X2.5モデルをリリース

XHTokenは、長文コンテキストタスク向けに設計されたコンパクトな言語モデル「Spark-X2.5-4B」および「Spark-X2.5-1.7B」をリリースしました。パラメーターサイズは小さいものの、両モデルとも200以上の言語をサポートし、1つのフルアテンション層と3つのスライディングウィンドウアテンション層を組み合わせたハイブリッドアテンションアーキテクチャにより、最大100万トークンのネイティブコンテキストウィンドウを実現しています。これらのモデルはエージェントワークフロー向けに構築されており、Claude CodeやCodexなどのフレームワーク、およびvLLM、SGLang、llama.cpp、Ollamaといった推論エンジンと初日から統合可能です。

  • • Spark-X2.5-4BおよびSpark-X2.5-1.7Bモデルは200以上の言語をサポートし、最大100万トークンのネイティブコンテキストウィンドウを備えています。
  • • アーキテクチャには、1つのフルアテンション層と3つのスライディングウィンドウアテンション層からなるハイブリッドアテンション設計が採用されています。
  • • 本モデルはCodex、Claude Code、OpenClaw、Hermesなどのエージェントハーネスと統合されています。
  • • サポートされている推論フレームワークには、vLLM、SGLang、llama.cpp、MLX、Ollama、LM Studioが含まれます。
  • • 本モデルはNVIDIA、Huawei、Hygon、HOUMO.AIのハードウェアプラットフォームと互換性があります。

開発者は、一般的なエージェントフレームワークや推論エンジンをネイティブサポートする、非常にコンパクトで長文コンテキスト対応のモデルをローカルで実行できます。

SOURCES

3. カリフォルニア大学バークレー校がコンピュータ操作エージェント向けプラットフォーム「CUA-Lite」を公開

カリフォルニア大学バークレー校の研究チームは、コンピュータ操作エージェント(CUA)の開発と評価を簡素化するために設計されたオープンプラットフォーム「CUA-Lite」をリリースしました。このプラットフォームは、エージェント、環境、トレース、評価フレームワークを単一のアクションスペースとデータスキーマの下に統合します。主要コンポーネントである「Lite.OSWorld」は、重い仮想マシンをDockerコンテナに置き換えることで、環境のフットプリントを4.1GBから0.9GBに削減しつつ、テストされた13モデルすべてで同一のパフォーマンススコアを維持しています。CUA-LiteはPython 3.12をサポートし、ネストされた仮想化なしで任意のDockerホストにデプロイ可能です。

  • • CUA-Liteは、デスクトップ、ブラウザ、モバイル環境全体で単一のアクションスペースとデータスキーマを提供します。
  • • プラットフォームに含まれるLite.OSWorldは、OSWorldタスクを仮想マシンではなくDockerコンテナで実行し、フットプリントを4.1GBから0.9GBに削減します。
  • • Lite.OSWorldコンテナでのパフォーマンススコアは、テストされた13モデルすべてにおいて元のOSWorld VMと一致しています。
  • • 本プラットフォームは、30,000以上の検証可能なタスク、15以上のベンチマーク、10以上のエージェント、20以上のHugging Face上のデータセットを備えています。
  • • CUA-LiteはPython 3.12と互換性があり、ネストされた仮想化を必要とせず、任意のDockerホストにデプロイできます。

開発者は、評価精度を犠牲にすることなく、ディスクフットプリントを75%以上削減した軽量なDockerベースの環境で、コンピュータ操作エージェントを構築・テストできます。

SOURCES

4. モデルの回答を視覚的に比較するオープンソースツール「lm-eval-ledger」が登場

ある開発者が、異なるモデルが特定のベンチマークの質問にどのように回答するかを検査・比較するために設計されたオープンソースのベンチマークハーネス「lm-eval-ledger」をリリースしました。このツールはYAML駆動型であり、ユーザーは単一のコマンドで複数のモデルとタスクを実行するように構成できます。システムプロンプト、生の生成結果、抽出された回答、停止理由など、質問ごとの詳細なデータをSQLiteデータベースに保存し、付属のFlask Webインターフェースを使用して並べて比較・探索できます。このツールはvLLM、SGLang、Hugging Face、llama.cppのバックエンドをサポートしています。

  • • このツールはYAML駆動型であり、設定ファイルで複数のモデルとタスクを定義し、単一のコマンドでベンチマークを実行できます。
  • • ベンチマークデータをSQLiteデータベースに保存し、Flaskアプリケーションを使用してモデルの回答を視覚化・比較します。
  • • ハーネスは、システムプロンプト、モデルの生成結果、抽出された回答、正解、停止理由など、質問ごとのデータを記録します。
  • • LinuxおよびWindowsの両方で、vLLM、SGLang、Hugging Face、llama.cppなどのバックエンドをサポートしています。
  • • 単一の5090 GPUで実行された初期ベンチマークでは、Qwen3.5-9B、NVIDIA-Nemotron-3.5-Lightning、Gemma-4-12B-itが比較されました。

開発者は、ベンチマーク全体でモデルの正確な出力を視覚的に検査・比較することで、単なるスコアを超えてモデルがなぜ成功または失敗したのかを理解できます。

SOURCES

5. ローカルLLMのKVキャッシュ削除を検証するオープンソースツール「cache-pressure」

ローカルLLMデプロイメントにおけるKVキャッシュ管理のパフォーマンスを検証・測定するために、新しいオープンソースツール「cache-pressure」がリリースされました。このツールは、キャッシュの期待値を調整し、安定したコンテキストでキャッシュを埋め、逆順でキャッシュヒットを検証することで、古いコンテキストがどのように削除されるかを正確に確認します。このツールを使用した作成者は、vLLMのキャッシュ管理バグを特定・解決し、負荷がかかった状態での保持トークン数を約100万から300万以上に向上させました。本ツールはvLLM、ninfer、llama.cpp、SGLangと互換性があります。

  • • このツールは、キャッシュの期待値を調整し、安定したコンテキストでキャッシュを埋め、逆順でキャッシュヒットを検証することで機能します。
  • • このツールを使用して、作成者はvLLMのキャッシュ管理の問題を特定・修正し、負荷がかかった状態での保持トークン数を1,052,025から3,000,048に増加させました。
  • • 本ツールは、vLLM、ninfer、llama.cpp、SGLangを含む複数の推論エンジンと互換性があります。
  • • このツールを実行すると、ターゲットデプロイメント上の既存のキャッシュされたコンテキストはすべて削除されます。

開発者は、ローカル推論エンジンにおける潜在的なコンテキスト削除バグを特定・解決し、高負荷下でも信頼性の高い長文コンテキストパフォーマンスを確保できます。

SOURCES

6. 8種類のAbliterated Qwen 3.8 27Bバリアントの評価比較

Qwen 3.8 27Bモデルの8種類のAbliterated(検閲解除済み)バリアントを評価した詳細な調査により、さまざまな検閲解除手法のトレードオフが浮き彫りになりました。167 GPU時間を費やした11日間の調査の結果、外科的な編集の方が、思考ループの終了に失敗する原因となりやすい過激な編集(「obliteratus」バリアントでは回答の44.8%が完了に失敗)よりも一般的に優れていることがわかりました。「orcarouter」バリアントはHarmBenchの攻撃成功率で82.2%という最高値を達成し、「apostate」バリアントは低いKLダイバージェンスと元のモデルに近い能力の優れたバランスを提供しました。

  • • Qwen 3.8 27Bの8種類のAbliteratedバリアントを11日間、約167 GPU時間かけて評価・比較しました。
  • • 手法には、重みの比較、KLダイバージェンスの測定、13のベンチマーク、HarmBench 400 classicが含まれます。
  • • 「orcarouter」バリアントはHarmBenchの攻撃成功率(ASR)で82.2%を達成し、重みが完全に検証された唯一のモデルでした。
  • • 「apostate」バリアントはASR 78.7%を達成し、低いKLダイバージェンスと元のモデルに近い能力で注目されています。
  • • 「obliteratus」バリアントは、過激な編集により回答の44.8%が思考プロセスを完了できなかったため、避けるべきです。
  • • 「blackfrost」バリアントには、チャットテンプレート内に未公開の1457文字の脱獄用システムプロンプトが含まれていることが判明しました。

検閲解除済みのローカルモデルをデプロイする開発者は、推論能力を維持し、過度な編集による思考ループの破損を回避できるバリアントを選択できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。