Inference Brew

OpenAIが無料ユーザー向けに無制限のテキストチャットとGPT-5.6 Lunaを提供開始

00:00 / --:--

← ホームへ戻る

OpenAIが無料ユーザー向けに無制限のテキストチャットとGPT-5.6 Lunaを提供開始

1. OpenAIが無料ユーザー向けに無制限のテキストチャットとGPT-5.6 Lunaを提供開始

OpenAIは、これらの機能が来週提供されるとの発表に続き、GPT-5.6 Lunaを無料およびGoユーザーのデフォルトモデルとして正式に実装しました。また、昨日の報道で約束されていた通り、テキストのみのチャットに関するすべての利用制限を撤廃しました。ファイル、画像、音声に関するマルチモーダル制限は引き続き適用されますが、より高度な推論が可能な新しい「Think」ボタンがオプションとして利用可能になりました。

  • • GPT-5.6 Lunaが無料およびGoユーザーのデフォルトモデルになりました。
  • • テキストベースのチャット利用制限が即時撤廃されました。
  • • 当初の「来週」という予定を前倒しして展開されました。
  • • ファイル、画像、音声に関する制限は変更されていません。
  • • より高度な推論を行うための新しい「Think」ボタンが利用可能です。

展開が当初の予定より早まったことで、ユーザーや開発者はGPT-5.6 Lunaによるテキスト対話を即座に無制限で利用できるようになりました。

SOURCES

2. DeepSeekがV4-Flashモデルに推論バリアントを追加

DeepSeek-V4-Flash APIの最近のパブリックベータ公開に基づき、DeepSeekはV4-Flash 0731モデルを導入しました。このアップデートでは、アーキテクチャに3つの異なる推論バリアントが追加され、ARC-AGI-1 Semi-Privateベンチマークで89.0%、ARC-AGI-2 Semi-Privateベンチマークで61.4%のスコアを達成しました。これらのバリアントはタスクあたりそれぞれ0.02ドルおよび0.04ドルで提供され、複雑な推論ワークロードに対してコスト効率の高い専門的な選択肢を提供します。

  • • DeepSeekは3つの推論バリアントを備えたV4-Flash 0731モデルをリリースしました。
  • • このモデルはARC-AGI-1 Semi-Privateベンチマークで89.0%を達成し、タスクあたり0.02ドルで利用可能です。
  • • このモデルはARC-AGI-2 Semi-Privateベンチマークで61.4%を達成し、タスクあたり0.04ドルで利用可能です。

このリリースにより、開発者はコスト効率の高いV4-Flashエコシステム内で専門的な推論機能を利用できるようになり、低価格で高精度な抽象的推論が可能になります。

SOURCES

3. キャラクターアニメーションフレームワーク「Wan-Animate-2」がリリース

Wan-Animate-2の開発者は、エンドツーエンドのキャラクターアニメーションフレームワークの推論スクリプト、ベースモデルの重み、および蒸留モデルの重みを公開しました。Hugging FaceのWan-AI組織でホストされているこのフレームワークは、再設計されたDiffusion Transformerを利用して、駆動用動画から直接動きを生成します。中間的なモーション抽出器をバイパスすることで、アイデンティティの保持と動きの忠実度を向上させています。今回のリリースには、リアルタイムストリーミングの遅延を考慮して最適化された「Wan-Animate-2-Lite」も含まれており、出力カメラの視点をソース動画から切り離すテキスト駆動型の視点制御もサポートしています。

  • • Wan-Animate-2は、再設計されたDiffusion Transformerを使用するエンドツーエンドのキャラクターアニメーションフレームワークです。
  • • 駆動用動画から直接動きを生成し、中間的なモーション抽出器を排除することでアイデンティティを保持します。
  • • テキスト駆動型の視点制御機能を備えており、出力カメラの視点を駆動用動画から切り離すことが可能です。
  • • Wan-Animate-2-Liteは、リアルタイムストリーミングの遅延を考慮した効率的なバリアントです。
  • • 推論スクリプト、ベースモデルの重み、蒸留モデルの重みが2026年8月7日にHugging Faceで公開されました。

開発者は、駆動用動画から直接動きを生成するオープンウェイトモデルを使用して、高忠実度かつリアルタイムなキャラクターアニメーション機能を構築できるようになります。

SOURCES

4. Cloudflareがエージェント優先のヘッドレスブラウザ「Kitesurf」を公開

Cloudflareは、人間ではなくAIエージェントのためにゼロから構築されたヘッドレスブラウザ「Kitesurf」を導入しました。CloudflareのサーバーレスWorkersプラットフォーム上で動作するように12週間かけて開発されたKitesurfは、視覚要素よりもコンテキストウィンドウの管理、トークンコスト、リソース効率を優先しています。RustとWebAssemblyを使用して構築されており、Blitzのレンダリングエンジン、FirefoxのStylo CSSパーサー、Boa JSエンジンを活用しています。現時点では動画再生、WebGL、永続的な状態保持には対応していませんが、215,000以上のWebプラットフォームテストに合格しており、Chrome DevTools Protocolを介してPuppeteerおよびPlaywrightと完全に互換性があります。

  • • CloudflareはAIエージェント向けに最適化されたクラウドホスト型ブラウザ「Kitesurf」を立ち上げ、現在Browser Run経由でベータ版を無料で提供しています。
  • • このブラウザは完全にCloudflare Workers上で動作し、Blitzのモジュール式レンダリングエンジン、FirefoxのStylo CSSパーサー、Boa JS Rustエンジンを活用しています。
  • • Kitesurfは、HTML抽出やスクリーンショットなどのエージェントタスクにおいて、Chromiumよりも3〜7倍優れたメモリおよびCPU効率を実現します。
  • • Chrome DevTools Protocol (CDP) をサポートしており、PuppeteerやPlaywrightなどの既存ツールと互換性があります。
  • • アーキテクチャはステートレスかつ分離されており、信頼できない入力を処理するためにセッションごとにクリーンな状態で開始されます。

開発者は、Chromiumよりも3〜7倍優れたCPUおよびメモリ効率で、サーバーレスインフラ上で直接AIエージェント向けのヘッドレスブラウザタスクを実行できるようになります。

5. NVIDIAがオブジェクト指向エージェントフレームワーク「NOOA」をリリース

NVIDIA Labsは、Apache 2.0ライセンスのPythonフレームワーク「NOOA (NVIDIA Object-Oriented Agents)」をリリースしました。これは、エージェントのコンポーネントをオブジェクト指向プログラミングの概念に直接マッピングすることで、エージェント開発を簡素化します。NOOAでは、エージェント全体が単一のPythonクラスとして定義され、メソッドがアクションを、フィールドが状態を、ドキュメント文字列がプロンプトを、型アノテーションが実行時に強制される契約を表します。このフレームワークはLLM駆動のループと決定論的なメソッドの両方をサポートし、モデルのプラグイン性にはLiteLLMを利用し、大きなデータは「参照渡し」と境界付きプレビューで処理します。フレームワークがLLM生成コードを実行するため、NVIDIAはコンテナや仮想マシンなどの分離された環境内でNOOAエージェントを実行することを強く推奨しています。

  • • NVIDIA Labsは、Apache 2.0ライセンスの下でモデル非依存のPythonフレームワーク「NOOA (NVIDIA Object-Oriented Agents)」をリリースしました。
  • • NOOAは、プロンプトテンプレート、ツールスキーマ、コールバックコード、ワークフローグラフを単一のPythonクラスに統合します。
  • • メソッドはアクション、フィールドは状態、ドキュメント文字列はプロンプト、型アノテーションは実行時に強制される契約として機能します。
  • • このフレームワークは、LLM駆動のループ (AgenticMethod) と決定論的なPythonメソッドの両方をサポートします。
  • • Python 3.12〜3.13が必要であり、LiteLLMを介してホスト型API、Ollama、vLLMと統合されます。
  • • NVIDIAは、LLM生成コードを実行するため、OSレベルの分離(コンテナまたはVM)内でNOOAエージェントを実行することを推奨しています。

開発者は、馴染みのあるオブジェクト指向プログラミングパターンを使用してAIエージェントを構築し、標準的なPythonの型アノテーションを通じて実行時の契約を強制できるようになります。

SOURCES

6. Microsoftが多言語対応のユニットテスト生成エージェントをオープンソース化

Microsoftは、MITライセンスの下で、ローカルで動作する多言語対応のユニットテスト生成エージェント「code-testing-generator」をオープンソース化しました。ホスト型サービスを必要とせず、既存のローカルコーディング環境内で完全に動作するこのエージェントは、Research-Plan-Implement (RPI) パイプラインを使用して、コードを記述する前にリポジトリの規約、ファイルの場所、テストフレームワークを分析します。組み込みの検証ゲートを備えており、ミューテーションテストの実行、欠落しているアサーションのチェック、リポジトリのテストコマンドが新しいテストを正常に検出できることの確認を行います。内部ベンチマークでは、このエージェントは92.1%のタスク完了率を達成し、GitHub Copilotの78.9%を大幅に上回りました。

  • • Microsoftは、多言語対応のユニットテストエージェント「code-testing-generator」をMITライセンスでオープンソース化しました。
  • • このエージェントは既存のコーディング環境内でローカルに動作し、ホスト型サービスを必要としません。
  • • Research-Plan-Implement (RPI) パイプラインを利用して、リポジトリの規約とテストフレームワークを分析します。
  • • Microsoftの内部152タスクベンチマークにおいて、このエージェントは92.1%のタスクを完了し、GitHub Copilotの78.9%を上回りました。
  • • ミューテーションテストを実行し、欠落しているアサーションをチェックする検証ゲートが含まれています。

開発者は、標準のCopilotを上回る性能を持ち、生成されたテストを自動的に検証する、非常に有能なローカルユニットテストエージェントを実行できるようになります。

SOURCES

7. AgentRadioがエンタープライズコーディングタスクでClaude Codeを上回る

Coral AI Labsと複数の大学の研究者らは、長期的なコードベースタスクに取り組むAIエージェントチームを調整するために設計された非同期メッセージパッシング層「AgentRadio」をオープンソース化しました。Apache 2.0ライセンスでリリースされたAgentRadioは、create_thread、send_message、wait_for_mentionという3つの通信プリミティブを導入し、エージェントがメインの実行ループを中断することなくコンテキストを共有し、知識を更新できるようにします。SWE-Atlas QnAデータセットでのベンチマークでは、AgentRadioを搭載したチームはタスクの62.1%を解決し、Opus 4.6を使用した単一のClaude Codeエージェントの32.3%を上回りました。調整層によってタスクあたりの平均APIコストは2.96ドルから19.45ドルに増加しましたが、計算リソースを合わせた独立したエージェント構成よりも大幅に優れた結果となりました。

  • • 研究者らは、AIエージェント調整のための非同期メッセージパッシング層「AgentRadio」をApache 2.0ライセンスでオープンソース化しました。
  • • AgentRadioは、create_thread、send_message、wait_for_mentionという3つのプリミティブを通じて受動的な認識を可能にします。
  • • SWE-Atlas QnAベンチマークにおいて、AgentRadioを搭載したチームはタスクの62.1%を解決し、単一のClaude Codeエージェントの32.3%を上回りました。
  • • アーキテクチャはGitHubで公開されており、Claude CodeやCodex CLIなどの既存のエージェントハーネスと互換性があります。
  • • タスクあたりの平均APIコストは2.96ドルから19.45ドルに増加しましたが、計算リソースを合わせた独立した構成よりも優れた性能を発揮しました。

開発者はこのオープンソースの調整層を使用して、非同期に通信するマルチエージェントチームを構築し、複雑なコードベースでのタスク解決率を大幅に向上させることができます。

SOURCES

8. Tencent CloudがTencentDB Agent Memoryをv2.0にアップグレード

2026年5月のTencentDB Agent Memoryの初期リリースに基づき、Tencent Cloudはバージョン2.0を立ち上げました。このアップデートでは、個々のエージェントのメモリからチームレベルのハブへと焦点を移し、複数のエージェントがコンテキストとスキルを共有できるようにしました。新バージョンでは、Chat Memory、Skill、LLM-Wiki、Code-Graphの4つのアセットタイプが導入され、Claude CodeおよびOpenClawとの統合サポートが追加されました。

  • • TencentDB Agent Memory v2.0は、元のフレームワークをチームレベルのメモリハブへと拡張します。
  • • Chat Memory、Skill、LLM-Wiki、Code-Graphという4つの再利用可能なアセットタイプを導入しました。
  • • Claude Code、OpenClaw、Hermesとの統合サポートを追加しました。
  • • 元のリリースの自己ホスト型、MITライセンス、Dockerデプロイ可能な性質を維持しています。
  • • 階層型検索アプローチ(BM25、ベクトル検索、RRF)を引き続き使用しています。

このアップデートにより、チームは複数のAIエージェント間で永続的な共有メモリを維持できるようになり、元のリリースの単一エージェントの範囲を超えた運用が可能になります。

SOURCES

9. DatabricksがAIコーディングコストを削減するツールをオープンソース化

Databricksは、指数関数的に増加するAIコーディングコストを管理するための戦略を共有し、ハーネスとキャッシュの最適化を通じて全体的な支出を70%、生成トークンを50%削減したことを明らかにしました。他の組織がAIインフラストラクチャコストを管理できるように、DatabricksはUnity AI GatewayとOmnigentツールをオープンソース化しました。Omnigentはモデルの独立性を維持するメタハーネスとして機能し、開発者が基盤となるモデルを簡単に切り替え、「効率のフロンティア」をターゲットにできるようにします。これは、ピーク時の知能だけでなく、価格対知能比が最も優れたモデルを優先するアプローチです。

  • • Databricksは、ハーネスとキャッシュ設定を調整することで、生成トークンとコストを約50%削減しました。
  • • 同社はUnity AI GatewayとOmnigentツールをオープンソースまたはフリーソフトウェアとしてリリースしました。
  • • Omnigentは、モデルの独立性を維持し、開発者の切り替えコストを削減するために設計されたメタハーネスです。
  • • Databricksは、価格対知能比が最も優れたモデルを優先する「効率のフロンティア」アプローチを推奨しています。
  • • 同社は、厳格なトークン予算を可視化ツールと段階的な摩擦に置き換えることを推奨しています。

開発者はオープンソースツールと最適化戦略を使用して、コード品質を犠牲にすることなくAPIトークンの使用量とコストを大幅に削減できます。

SOURCES

10. Agent Plugins 1.0.0オープン標準がリリース

Agent Plugins 1.0.0のリリースにより、開発者が再利用可能なAIエージェントスキルとModel Context Protocol (MCP) サーバーをパッケージ化および配布する方法を簡素化することを目的とした新しいオープン標準が導入されました。統一された仕様を確立することで、この標準により開発者はエージェント機能をポータブルなプラグインにバンドルし、多様なエージェントランタイムやフレームワーク間での統合を合理化できます。

  • • Agent Plugins 1.0.0は、再利用可能なAIエージェントスキルとMCPサーバーのパッケージングを簡素化するために設計されたオープン標準です。
  • • この標準は、エージェント機能をプラグインとして簡単に配布できるようにすることを目的としています。

開発者は統一された標準を使用して、エージェント機能やMCPサーバーをパッケージ化、配布し、異なるエージェントフレームワーク間で再利用できるようになります。

SOURCES

11. NVIDIA NeMo RetrieverとLanceDBによるマルチモーダルRAGパイプラインの構築

NVIDIAは、PDFドキュメントからテキスト、表、グラフ、インフォグラフィックを処理できるマルチモーダル検索拡張生成(RAG)パイプラインを構築するための包括的なパターンを概説しました。Python 3.12で構成されたこのパイプラインは、GPUを必要とせずにオフラインでテキスト抽出を行うためにPDFiumを使用し、レイアウト検出、OCR、表抽出、埋め込み生成、リランキングのためにホスト型のNVIDIA NIMエンドポイントを活用します。処理されたデータはLanceDBベクトルデータベースに保存され、メタデータフィルタリング検索、視覚言語リランキング、Nemotron言語モデルを使用したインライン引用付きの根拠ある回答生成を可能にします。

  • • このパイプラインは、レイアウト検出、OCR、表/グラフ抽出、埋め込み生成、リランキングのためにホスト型のNVIDIA NIMエンドポイントを使用します。
  • • 処理されたコンテンツはLanceDBベクトルデータベースに保存されます。
  • • オフラインのPDFテキスト抽出は、GPUや外部APIキーを必要とせずにPDFiumを使用して実行されます。
  • • このシステムは、メタデータフィルタリング検索、視覚言語リランキング、インライン引用付きの根拠ある回答生成を実装します。
  • • パイプラインはPython 3.12で構成され、根拠ある回答のためにNemotron言語モデルを使用します。

開発者は、構造化された検証済みのパイプラインパターンを使用して、高度なマルチモーダル検索(テキスト、表、グラフ、インフォグラフィックの処理)を実装できるようになります。

SOURCES

12. NVIDIAがNeMo Gym会話型ツール使用アセットをリリース

NVIDIAは、Hugging FaceでNeMo Gym会話型ツール使用アセットをリリースしました。このリリースは、開発者にゴールデンポリシー/ツール参照ペアとプロンプト履歴のキュレーションコレクションを提供します。これらのアセットは、開発者が会話型ツール使用パイプライン内でLLMをトレーニング、微調整、評価し、エージェントツール呼び出しワークフローの信頼性を向上させるのに役立つように設計されています。

  • • NVIDIAはHugging FaceプラットフォームでNeMo Gym会話型ツール使用アセットをリリースしました。
  • • このリリースには、ゴールデンポリシー/ツール参照ペアとプロンプト履歴のコレクションが含まれています。
  • • これらのアセットは、特に会話型ツール使用パイプライン向けに設計されています。

開発者は、高品質な参照データセットを使用して、会話型ツール呼び出しタスクにおいて独自のモデルをトレーニング、微調整、または評価できるようになります。

SOURCES

13. Parakeet.wgslがWebGPUによる高速で依存関係のないブラウザASRを実現

「parakeet.wgsl」という新しいオープンソースプロジェクトは、高性能で依存関係のない自動音声認識(ASR)をブラウザに直接もたらします。この実装は、生のWebGPUコンピュートシェーダーとSIMD WebAssemblyオーディオフロントエンドを使用して、NVIDIAのParakeet TDT 0.6B V2英語文字起こしモデルをパッケージ化しています。ベンチマークによると、Google Chromeを実行しているApple M5プロセッサ上で、1時間の音声をわずか20秒で文字起こしできます。WebGPUに依存しているため、モデルは完全にオフラインで実行でき、WebGPU対応ブラウザをホストするあらゆるデバイスと互換性があり、Dawnやwgpuを介したスタンドアロンのデスクトップ実行の可能性もあります。

  • • このプロジェクトは、ブラウザベースの推論のためにNVIDIAのParakeet TDT 0.6B V2英語文字起こしモデルを実装しています。
  • • 生のWebGPUコンピュートシェーダーとSIMD WebAssemblyオーディオフロントエンドを利用しており、依存関係はありません。
  • • Google Chromeを実行しているApple M5プロセッサ上で、1時間の音声を20秒で文字起こしできます。
  • • GPUとWebGPU対応ブラウザを搭載したあらゆるデバイスと互換性があります。
  • • Dawnやwgpuなどのフレームワークを使用して、ブラウザ外でのオフライン実行も可能です。

開発者は、外部APIや重いバックエンドサーバーに頼ることなく、ブラウザ上で直接、高速でプライベートなオフラインの音声テキスト変換を実装できるようになります。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。