Inference Brew

NVIDIAがNemotron 3 Embedオープンモデルコレクションをリリース

00:00 / --:--

← ホームへ戻る

NVIDIAがNemotron 3 Embedオープンモデルコレクションをリリース

1. NVIDIAがNemotron 3 Embedオープンモデルコレクションをリリース

NVIDIAは、3つのオープンなTransformerエンコーダーチェックポイントを特徴とする「Nemotron 3 Embed」コレクションをリリースしました。これには、8B BF16モデル、1B BF16モデル、およびBlackwellハードウェア向けに最適化された1B NVFP4モデルが含まれます。3つのモデルすべてが双方向アテンションマスキングと最大32,768トークンのシーケンス長をサポートしています。1Bモデルは、NVIDIA ModelOpt Neural Architecture Searchを使用して、8Bの教師モデルからプルーニングおよび蒸留を行うことで開発されました。さらに、NVIDIAは1Bモデル向けに最適化されたRustベースのNIMマイクロサービスもリリースしており、GB200およびRTX PRO 6000ハードウェア上でvLLMチェックポイントと同等以上のパフォーマンスを発揮します。

  • Nemotron-3-Embed-8B-BF16モデルは、Retrieval Embedding Benchmark (RTEB) で平均NDCG@10スコア78.46を記録し、第1位を獲得しました。
  • コレクションには、8B BF16モデル、1B BF16モデル、およびBlackwellハードウェア向けに最適化された1B NVFP4モデルが含まれます。
  • 1B NVFP4モデルは、検索精度を99%以上維持しながら、Blackwellハードウェア上でBF16バージョンと比較して最大2倍のスループットを提供します。
  • すべてのモデルはOpenMDWライセンス契約バージョン1.1の下でリリースされ、最大32,768トークンのシーケンス長をサポートしています。

開発者は、本番環境のRAG、エージェントのメモリ、コード検索のために、最大32kのコンテキストを持つ高精度なオープンウェイト埋め込みモデルをデプロイできます。

SOURCES

2. trellis.cppがGGML移植版TRELLIS.2 3D生成のバグを修正

trellis.cppの開発者は、GGMLに移植されたTRELLIS.2画像から3Dへの生成パイプラインにおける重大なバグが修正されたと発表しました。移植されたモデルのアセット品質は現在、参照モデルと同等になっており、GPUまたはCPUを介したローカルハードウェア上で高品質なオープンソース3D生成が可能になりました。RAWエンジンはGitHubで公開されており、Lemonadeと統合することで、より優れた体験やオプションのテキストから3Dへのカスケード機能を利用できます。

  • GGMLに移植されたTRELLIS.2画像から3Dへの生成パイプラインのバグが修正され、アセット品質が参照モデルと同等になりました。
  • このツールにより、十分なGPUパワーを持つハードウェア、またはCPU上で、ローカルでのオープンソース3D生成が可能になります。
  • RAWエンジンはGitHubでホストされており、Lemonadeと併用することで統合された体験やオプションのテキストから3Dへのカスケード機能を利用できます。

開発者は、最適化されたGGML移植版を使用して、コンシューマー向けハードウェア上で高品質なオープンソースの画像から3Dへの生成をローカルで実行できるようになりました。

SOURCES

3. Capital OneがAIセキュリティツール「VulnHunter」をオープンソース化

Capital Oneは、Apache 2.0ライセンスの下でGitHubにて利用可能なオープンソースのエージェント型AIセキュリティツール「VulnHunter」をリリースしました。VulnHunterはソースコードの脆弱性をスキャンし、潜在的な攻撃経路をマッピングし、本番環境にデプロイする前にターゲットを絞ったコード修正を提案します。このツールは、APIやファイルアップロードなどのシステムエントリーポイントから始まる潜在的な攻撃経路を追跡する「攻撃者ファースト」のフォワード分析手法を採用しています。また、開発者に提示する前に潜在的な脆弱性を反証するように設計された組み込みの反証エンジンを備えており、誤検知を低減します。

  • Capital Oneは、オープンソースのエージェント型AIセキュリティツール「VulnHunter」をApache 2.0ライセンスでリリースしました。
  • このツールはソースコードをスキャンし、攻撃者ファーストのフォワード分析手法を用いて攻撃経路をマッピングし、コード修正を提案します。
  • 組み込みの反証エンジンが潜在的な脆弱性を反証しようと試みることで、誤検知を最小限に抑えます。
  • VulnHunterは現在、Claude Code環境内でAnthropicのClaude Opus 4.8モデルを使用して動作します。

開発者は、オープンソースのエージェント型セキュリティスキャナーをCI/CDパイプラインに統合し、攻撃経路の自動追跡とターゲットを絞ったコード修正の生成を行うことができます。

SOURCES

4. BrexがAIエージェント向けネットワークプロキシ「CrabTrap」をオープンソース化

Brexは、AIエージェント向けのオープンソースネットワークガバナンスツール「CrabTrap」をリリースしました。HTTP/HTTPSプロキシとして動作するCrabTrapは、ネットワークトラフィックを傍受し、決定論的な静的ルールと、未知のリクエスト(通常トラフィックの3%未満)に対する「LLM-as-a-judge」を組み合わせてセキュリティポリシーを強制します。このツールはフレームワーク、言語、APIに依存せず、標準的なプロキシ環境変数のみを必要とします。プロンプトインジェクションを緩和するため、CrabTrapはリクエストをJSONオブジェクトとして構造化し、評価前にユーザー制御のコンテンツをエスケープします。

  • CrabTrapは、AIエージェントのセキュリティポリシーを強制するためにネットワークトラフィックを傍受するオープンソースのHTTP/HTTPSプロキシです。
  • このツールは決定論的な静的ルールを使用し、全トラフィックの3%未満に対してのみ「LLM-as-a-judge」をトリガーします。
  • フレームワーク、言語、APIに依存せず、HTTP_PROXYおよびHTTPS_PROXY環境変数の設定のみで利用可能です。
  • CrabTrapはリクエストをJSONとして構造化し、ユーザー制御のコンテンツをエスケープすることでプロンプトインジェクションのリスクを軽減します。

開発者は、フレームワークに依存しないプロキシを通じてアウトバウンドのネットワークリクエストを傍受・フィルタリングすることで、エージェントのデプロイメントを保護できます。

SOURCES

5. GitHubがカスタムアプリ統合用のCopilot SDKをリリース

GitHubはCopilot SDKを利用可能にし、開発者がGitHub Copilotエージェントを独自のカスタムアプリケーションや開発者ツールに統合できるようにしました。このSDKは、外部ワークフロー内でCopilotのエージェント機能を利用するために必要なインターフェースを提供し、開発者がCopilotによる支援をデプロイできる場所と方法を拡大します。

  • Copilot SDKは公開GitHubリポジトリで利用可能です。
  • このSDKにより、GitHub Copilotエージェントをカスタムアプリケーションや開発者ツールに統合できます。

開発者は、GitHub Copilotのエージェント機能を独自の開発者ツールやカスタム社内アプリケーションに直接組み込むことができます。

SOURCES

6. AnthropicがClaude Codeの自動継続機能を撤回

Anthropicは2026年7月1日にClaude Codeバージョン2.1.198をリリースし、60秒間操作がない場合にAskUserQuestionツールが進行する、文書化されていない自動継続機能を導入しました。この機能には、内部的な「キーボードから離れている(AFK)」指定、カウントダウンタイマー、および分析トラッキングが含まれていました。ユーザーからのフィードバックを受け、Anthropicは2026年7月3日のバージョン2.1.200でこの動作を撤回しました。Claude Codeのソースコードは公開されていないため、ユーザーはコンパイル済みバイナリを比較(diff)してこれらの変更を特定する必要がありました。

  • AnthropicはClaude Codeバージョン2.1.198で、60秒間操作がない場合に進行する文書化されていない自動継続機能を導入しました。
  • この機能は、ユーザーからのフィードバックを受けて2026年7月3日のバージョン2.1.200で撤回されました。
  • ユーザーは、CLAUDE_AFK_TIMEOUT_MSやDISABLE_AUTOUPDATERなどの環境変数を使用して、自動継続動作を管理したり、自動アップデーターを無効にしたりできます。

Claude Codeを使用する開発者は、バージョン2.1.200にアップデートするか、予期しない自動ツール実行を防ぐために環境変数を設定する必要があります。

SOURCES

7. AnthropicがClaude Codeによる大規模コード移行の詳細を公開

Anthropicは、Claude Codeを使用して大規模なコード移行を実行するための社内手法を詳細に説明しました。このプロセスは、ルールブックの作成、依存関係の分析、変換ルールのストレステストを含む6ステップの戦略に基づいています。移行の効率とコード品質を確保するため、Anthropicは複数のエージェントをデプロイしてコードの変換、レビュー、修正を反復的に行い、敵対的レビュー担当者や機械的検証の使用を重視しています。

  • Anthropicは、Claude Codeを使用した大規模なコード移行に6ステップのプロセスを採用しています。
  • この戦略には、複数のエージェントをデプロイしてコードの変換、レビュー、修正を反復的に行うことが含まれます。
  • プロセスには、ルールブックの作成、依存関係の分析、変換ルールのストレステストが含まれます。
  • Anthropicは、移行効率を向上させるために敵対的レビュー担当者と機械的検証を利用しています。

開発者は、Anthropicの実証済みのマルチエージェントワークフローパターンを採用することで、複雑で大規模なコードベースの移行をより高い信頼性で自動化できます。

SOURCES

8. Intuitが4ヶ月でエージェントアーキテクチャを2回再構築

VB Transform 2026において、IntuitのAI担当VPであるNhung Ho氏は、同社が4ヶ月以内にエージェントアーキテクチャを2回再構築したことを明らかにしました。Intuitは当初、専門エージェントから中央オーケストレーション層へ移行しましたが、エージェント間の自然言語による引き継ぎから生じる複合的なエラーにより失敗しました。その後、同社は60日間でスキルとツールベースのアーキテクチャへの移行に成功しました。このモジュール式のアプローチにより、個々のコンポーネントを製品間で再利用できるようになり、エンジニアリングの焦点がシステム評価へとシフトしました。Intuitはまた、人間のサポートスタッフが完全なコンテキストを持ってアクティブなAIエージェントの会話に参加できる機能をテストしています。

  • Intuitは、エージェント間の自然言語による引き継ぎが原因で発生する複合的なエラーのため、3ヶ月後に中央オーケストレーション層を放棄しました。
  • 同社はシステムをスキルとツールベースのアーキテクチャに再構築し、2回目の再構築を60日間で完了しました。
  • 新しいアーキテクチャにより、個々のコンポーネントを製品間で再利用できるようになり、エンジニアリングの焦点がシステム評価へとシフトしました。
  • Intuitは、人間のサポートスタッフが完全なコンテキストを持ってアクティブなAIエージェントの会話に参加できる機能をテストしています。

開発者は、エージェント間の自然言語による引き継ぎを避け、再利用可能なスキルとツールベースの設計を採用することで、コストのかかるアーキテクチャの行き詰まりを回避できます。

SOURCES

9. 技術リーダーがレガシーインフラをAIエージェントのスケーリングのボトルネックと特定

VB Transform 2026において、LinkedIn、Walmart、Zendeskのインフラリーダーは、AIエージェントのスケーリングにおける課題について議論しました。LinkedInは、Kubernetesのプロビジョニングの遅延に対して、事前プロビジョニングされたコンテナプールに移行することで対処し、LLMを推論のみに限定し、80%を決定論的なコードに移行することでハルシネーションを削減しました。Zendeskは、大規模な会話履歴を直接コンテキストウィンドウに供給するよりも、データパイプラインへの投資を優先し、Walmartはエージェントの重複を管理するためのガバナンスを実装しました。LinkedInとWalmartは両社とも、モデルとベンダーの独立性を維持するために社内AIゲートウェイを開発しました。

  • インフラリーダーは、エージェントのスケーリングにおける主要なボトルネックはAIモデルではなくレガシーインフラであると特定しました。
  • LinkedInは、80%を決定論的なコードに移行し、LLMを推論のみに使用することでエージェントのハルシネーションを削減しました。
  • LinkedInは、オンデマンドのコンテナ作成から事前プロビジョニングされたプールに移行することで、Kubernetesのプロビジョニングの遅延に対処しました。
  • LinkedInとWalmartは、モデルとベンダーの独立性を維持するために社内AIゲートウェイを構築しました。

開発者は、事前プロビジョニングされたコンテナプール、決定論的なコードパス、社内AIゲートウェイを採用することで、より信頼性の高いエージェントアーキテクチャを設計できます。

SOURCES

10. Harness Handbookがエージェントの動作とコード実装をマッピング

Harness Handbookは、コーディングエージェントのハーネス向けに特別に設計された動作レベルのマップとしてリリースされました。これは、実行、権限、安全性に関する平易な言語による質問と、それらを実装するために必要な具体的なプロンプト、ツール、状態ロジック、構成、テレメトリとの間のギャップを埋めるものです。このマッピングは、開発者がAIエージェントの運用境界を体系的に設計および監査するのに役立ちます。

  • Harness Handbookは、コーディングエージェントのハーネス向けに設計された動作レベルのマップです。
  • 実行、権限、安全性に関する平易な言語による質問を、特定のプロンプト、ツール、状態ロジック、構成、テレメトリに接続します。

開発者はこのハンドブックを使用して、抽象的なエージェントの安全性と実行要件を、本番環境ですぐに使用できる具体的なコードとプロンプトに変換できます。

SOURCES

11. MongoDBがエージェント型イベント会場オペレーターのチュートリアルをリリース

MongoDBは、エージェント型イベント会場オペレーターのデモを構築するためのリファレンスチュートリアルをリリースしました。このアーキテクチャは、運用記録、セマンティックメモリ、視覚ドキュメント、エージェント状態の統合レイヤーとしてMongoDB Atlasを利用しています。アプリケーションスタックには、FastAPI、Vision RAG用のClaude Vision、Voyage AI埋め込み、エージェントオーケストレーション用のLangGraphが統合されており、オブザーバビリティのためにオプションでLangfuseを統合できます。デモは4つのタブを持つUIと、ベクトル類似性と語彙スコアリングを組み合わせたハイブリッド検索を特徴としています。

  • MongoDBは、MongoDB Atlas、Voyage AI埋め込み、LangGraphを使用してエージェント型イベント会場オペレーターを構築するためのチュートリアルをリリースしました。
  • このアーキテクチャは、運用記録、セマンティックメモリ、視覚ドキュメント、エージェント状態の統合レイヤーとしてMongoDB Atlasを使用します。
  • アプリケーションスタックには、FastAPI、Vision RAG用のClaude Vision、オブザーバビリティ用のオプションのLangfuseが含まれます。
  • 前提条件として、Python 3.12以降、ベクトル検索を備えたMongoDB Atlasクラスター、AnthropicおよびVoyage AIのAPIキーが必要です。

開発者はこのリファレンスアーキテクチャに従うことで、MongoDB Atlasを統合データベースおよびメモリレイヤーとして活用する、マルチモーダルでステートフルなエージェントを構築できます。

SOURCES

12. 画面監視アプリ「Observer」がローカルLLMを統合

LLMを使用して画面アクティビティを監視し通知を送信するオープンソースアプリケーション「Observer」は、AGPLv3ライセンスの下でSignPath Foundation FOSSプロジェクトに移行しました。このアプリケーションは、ブラウザベースのtransformers.js、Ollama、バンドルされたllama.cpp、vLLM、またはOpenAI互換エンドポイントを介したローカル推論をサポートするようになり、画面データがユーザーのローカルマシン上に留まることを保証します。さらに、セットアップは単一の自然言語コマンドに簡素化されました。

  • Observerは、ローカルLLM推論をサポートするオープンソースのAGPLv3ライセンス画面監視アプリケーションです。
  • このアプリケーションは、transformers.js、Ollama、バンドルされたllama.cpp、vLLM、またはOpenAI互換エンドポイントを介したローカル推論をサポートしています。
  • セットアップは、手動の複数ステッププロセスから単一の自然言語コマンドに簡素化されました。
  • プライバシーを保護するため、画面データは完全にユーザーのローカルマシン上に留まります。

開発者は、完全にローカルなモデルと簡素化されたセットアッププロセスを使用して、プライバシーを重視した画面監視および自動化ワークフローを構築できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。