Inference Brew

MirroSが動画から物理シミュレーションへ変換するオープンウェイトモデル「Code-as-World」を公開

00:00 / --:--

← ホームへ戻る

MirroSが動画から物理シミュレーションへ変換するオープンウェイトモデル「Code-as-World」を公開

1. MirroSが動画から物理シミュレーションへ変換するオープンウェイトモデル「Code-as-World」を公開

MirroSは、物理シーンをピクセルやキャプションではなく実行可能なコードとして表現するフレームワーク「Code-as-World」を発表しました。これに合わせて、Apache 2.0ライセンスで「Code-as-World-VL-4B」および「Code-as-World-VL-9B」をオープンウェイトモデルとして公開しています。Qwen3.5をファインチューニングし、vLLM経由で提供される9Bモデルは、QuantiPhyベンチマークにおいてGemini-3.1 Flashを上回る性能を示しました。このシステムは、MuJoCoを実行エンジンとして使用し、5回の反復プロセスを通じて物理的な整合性を検証します。

  • • MirroSがCode-as-World-VL-4BおよびCode-as-World-VL-9BをApache 2.0ライセンスで公開。
  • • モデルはQwen3.5をベースにファインチューニングされ、vLLM経由でBF16 safetensorsとして提供。
  • • Code-as-World-VL-9BはQuantiPhyベンチマークで55.4を記録し、Gemini-3.1 Flashの54.8を上回った。
  • • MuJoCoを使用して物理的整合性を提案、インスタンス化、実行、レンダリング、検証するエージェントループを採用。
  • • 現在の実装は剛体物理に限定されており、発見ループ自体はモデル内部に組み込まれていない。

開発者は、Apache 2.0ライセンスのモデルを使用して、動画ファイルから構造化された実行可能な物理世界の表現を抽出できるようになります。

SOURCES

2. Claude CodeがデフォルトでGitコミットにセッションURLを付与する仕様に

Claude Codeがデフォルト設定で、すべてのGitコミットメッセージおよびプルリクエストの説明にセッションURLを自動的に付与していることが判明しました。この動作は、オンボーディング時に明示的なオプトインや警告なしに行われます。これらのURLがGit履歴を汚染したり、セッション詳細を公開したりすることを防ぐには、.claude/settings.jsonファイル内の「attribution.commit」設定を変更して手動で無効化する必要があります。

  • • Claude Codeは、オプトインの確認なしに、すべてのコミットメッセージとPR説明にセッションURLを自動付与する。
  • • 自動的なURL付与がGit履歴を汚染し、外部コントリビューターに対して不適切に見えるとの報告がある。
  • • 「.claude/settings.json」ファイルで「attribution.commit」をfalseに設定することで、この動作を抑制可能。
  • • この設定は、オンボーディングや初回利用時に見つけにくい状態となっている。

開発者は、内部セッションURLが公開Git履歴に流出するのを防ぐため、この設定を手動で無効にする必要があります。

SOURCES

3. Anthropicが情報窃取マルウェア攻撃を受け、Claudeセッションをリセット

Anthropicは、一部のユーザーのPC上で情報窃取マルウェアがアクティブなClaudeログインセッションを乗っ取ったことを発見し、保護措置を講じました。不正利用や課金被害の影響を軽減するため、Anthropicは影響を受けたユーザーをサインアウトさせ、保存されていた決済情報を削除し、返金を行いました。開発者は、セッションを盗むマルウェアに対してローカル開発環境が安全であることを確認するよう推奨されています。

  • • AnthropicがClaudeユーザーに対し、ローカルの情報窃取マルウェアに関する警告を発令。
  • • マルウェアがユーザーのPCからアクティブなClaudeログインセッションを乗っ取り、利用枠を消費していた。
  • • Anthropicは影響を受けたユーザーのサインアウト、保存済み決済情報の削除、返金対応を実施。

Claudeを利用する開発者は、不正なAPI利用や課金被害につながるセッション乗っ取りを防ぐため、ローカル環境を保護する必要があります。

SOURCES

4. Googleが静的エージェントベンチマークを学習用に適応させる「EnvHarness」を公開

Google Cloud AI Researchは、学術パートナーと共同で「EnvHarness」をApache 2.0ライセンスで公開しました。EnvHarnessは、基盤となるシミュレーターを変更することなく、静的なエージェントベンチマークをポリシー学習に適応させるために設計されたプログラム可能なレイヤーです。LLMベースの設計ツール「EnvRigger」を使用してポリシーの欠陥を診断し、ターゲットを絞ったラッパーを生成します。SWE-bench Verifiedを含む5つのベンチマークにおいて、このツールはエージェントのパフォーマンスを最大9.0ポイント向上させ、実行ステップを約10%削減しました。

  • • EnvHarnessは、標準的なstep/resetインターフェースを介してプラグインコンポーネントを使用し、既存環境をラップする。
  • • LLMベースの設計ツール「EnvRigger」を使用して、ポリシーの欠陥を診断し、ターゲットを絞ったラッパーを作成。
  • • 「Stage(アクションのリプレイ)」「Contract(ステップごとのフックインストール)」「Chain(環境の合成)」という3つの修正コンポーネントを提供。
  • • Apache 2.0ライセンスで公開されているが、ライブユーザーアカウントや物理ロボットは対象外。
  • • SWE-bench VerifiedおよびALFWorldでのテストで、最大9.0ポイントの改善と実行ステップの9.8%削減を達成。

開発者は、ポリシーの欠陥を自動的に診断し、既存のエージェント環境をラップすることでパフォーマンスを向上させることができます。

SOURCES

5. ベンチマークにより、Gemma 4とQwenのオープンVLMがエゴセントリックデータでGemini Flashに匹敵することが判明

Hebbian-Roboticsは、HFlowツールを使用してエゴセントリック(一人称視点)データを処理するオープンウェイト視覚言語モデル(VLM)の評価結果を公開しました。Egocentric-10kデータセットでのテストでは、Gemma 4 26B-A4BおよびQwen 3.8 27Bが、Gemini 2.5 Flashのベースラインとほぼ同等の性能を示しました。特にGemma 4は、Gemini 2.5 Flashより19倍安価でありながら同等の結果を達成しており、プライベートかつ高スループットなデータ処理において、セルフホスト型のオープンVLMが非常に実用的であることを示しています。

  • • Hebbian-RoboticsがHFlowツールを用いてEgocentric-10kデータセットでオープンウェイトVLMを評価。
  • • Gemma 4 26B-A4Bは、Gemini 2.5 Flashのベースライン(91.65%)に対して90.87%の一致率を達成し、コストは19分の1。
  • • 同評価において、Qwen 3.8 27Bは90.79%、GLM 5.3 Flashは91.00%を記録。
  • • 本研究は、現代のオープンVLMにおける主要な差別化要因として、コスト、スループット、出力の信頼性、セルフホストの容易さを強調している。

開発者は、商用APIと比較して19倍低いコストで、プライベートかつ高スループットな動画・画像処理のためにGemma 4やQwen 3.8をセルフホストできます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。