Inference Brew

GoogleがGemini 3.5 Flashにネイティブなコンピュータ操作機能を統合

00:00 / --:--

← ホームへ戻る

GoogleがGemini 3.5 Flashにネイティブなコンピュータ操作機能を統合

1. GoogleがGemini 3.5 Flashにネイティブなコンピュータ操作機能を統合

GoogleのGemini 3.5 Flash向けネイティブコンピュータ操作統合は、継続的なソフトウェアテストや専門的なナレッジワークなど、長期的なタスクやエンタープライズレベルの自動化を想定して設計されています。セキュリティ上の懸念に対処するため、Googleはユーザー確認ゲートやタスクの自動終了といった組み込みの保護機能と、安全なサンドボックス化、人間による検証、厳格なアクセス制御を組み合わせることを推奨しています。

  • GoogleはGemini 3.5 Flashモデルにネイティブなコンピュータ操作機能を統合し、Gemini APIおよびGemini Enterprise Agent Platform経由で利用可能にしました。
  • このツールにより、開発者はブラウザ、モバイル、デスクトップ環境を認識、推論し、操作を実行できるエージェントを構築できます。
  • Googleは、ライブ環境で動作するエージェントのプロンプトインジェクションリスクを軽減するために、標的型敵対的学習を使用しています。
  • 企業は2つのオプションの保護システムを利用して、機密性の高いアクションに対するユーザー確認を要求したり、間接的なプロンプトインジェクションが特定された場合にタスクを自動停止したりできます。
  • コンピュータ操作機能をテストするためのデモ環境が、現在Browserbaseによってホストされています。

開発者は、Gemini APIを通じてブラウザ、モバイル、デスクトップ環境をネイティブに認識し、操作できる、コスト効率が高く低遅延なエージェントを構築できるようになりました。

SOURCES

2. Gradiumがリアルタイム音声翻訳モデルを発表

Hibiki-ZeroフレームワークをベースにしたGradiumの新しいモデルは、強化学習を活用して精度と遅延のトレードオフを最適化しており、BLEUおよびMetricXの精度指標においてgpt-realtime-translateを上回っています。このシステムは、PCM 24 kHz 16-bit signed mono、WAV、Opus、mu-law、A-lawなど、複数の入力音声フォーマットをサポートしており、リアルタイム通信アプリケーションにおいて非常に汎用性が高くなっています。

  • Gradiumは、stt-translate(音声対テキスト)およびs2s-translate(音声対音声)のリアルタイム翻訳モデルをリリースしました。
  • これらのモデルは5言語(英語、フランス語、ドイツ語、スペイン語、ポルトガル語)の20の言語ペアをサポートしています。
  • アーキテクチャは文字起こしと翻訳を組み合わせたシングルパス設計を採用しており、従来の3モデル構成のカスケードを2つに削減しました。
  • Gradiumは平均エンドツーエンド遅延が3.0秒であると報告しており、gpt-realtime-translate(3.6秒)を上回っています。
  • s2s-translateモデルは出力音声の選択と音声クローンをサポートし、二重通信WebSocketを使用して音声をストリーミングします。

開発者は、音声クローンをサポートする二重通信WebSocket APIを使用して、低遅延のシングルパス音声対音声および音声対テキスト翻訳をアプリに統合できます。

SOURCES

3. Alibabaが環境シミュレーションモデル「Qwen-AgentWorld」をリリース

AlibabaのQwenチームは、デカップリングされた環境シミュレーターとして機能する言語ワールドモデルに焦点を当てたプロジェクト「Qwen-AgentWorld」を導入しました。これらのモデルはエージェントの行動を予測するのではなく、GUIベースのタスク向けにテキストアクセシビリティツリーやUI階層を処理し、7つのドメインにわたる環境応答を予測します。トレーニングは、実際のエージェント実行からの1,000万以上の軌跡を使用して、3つのステージ(CPT、SFT、RL)で完了しました。実証結果によると、ワールドモデルの事前学習により、エージェント固有のファインチューニングを必要とせずに、BFCL v4やClaw-Evalなどのベンチマークでエージェントのパフォーマンスが向上することが示されています。

  • Alibabaは、Apache 2.0ライセンスの下で、30億のアクティブパラメータを持つオープンウェイトのMixture-of-Expertsモデル「Qwen-AgentWorld-35B-A3B」をリリースしました。
  • これらのモデルは、標準的なチャットや自律型エージェントとしてではなく、エージェントの行動に続く環境状態を予測するように設計されています。
  • MCP/ツール呼び出し、検索、ターミナル、ソフトウェアエンジニアリング、Android、Web、オペレーティングシステムGUIの7つの対話ドメインをカバーしています。
  • より大きな3970億パラメータバージョン(170億アクティブ)も導入されましたが、そのウェイトは非公開のままです。
  • リリースには、実際の対話に基づいた言語ワールドモデルを評価するためのベンチマーク「AgentWorldBench」が含まれています。

開発者は、ライブAPIに依存することなく、MCP、ターミナル、OSなどのシミュレートされた環境でAIエージェントをオフラインでテストおよびトレーニングできます。

4. NVIDIAがNVFP4量子化版MiniMax-M3モデルをリリース

NVIDIAは、MiniMax-M3モデルのNVFP4量子化バージョンをHugging Faceで利用可能にしました。この4280億パラメータのマルチモーダルMixture-of-Expertsモデルは、100万トークンの広大なコンテキストウィンドウをサポートしています。NVFP4フォーマットを使用してモデルを4ビット精度に圧縮することで、開発者はNVIDIA Blackwell GPUにデプロイする際に2倍のメモリ節約を実現できます。

  • NVIDIAは、MiniMax-M3モデルのNVFP4量子化バージョンをHugging Faceでリリースしました。
  • MiniMax-M3は、4280億パラメータのマルチモーダルMixture-of-Experts(MoE)モデルです。
  • このモデルは100万トークンのコンテキストウィンドウを備えています。
  • 4ビット精度への圧縮により、特にBlackwell GPU上で2倍のメモリ節約が提供されます。

Blackwell GPUを実行している開発者は、4280億パラメータのマルチモーダルMoEモデルを100万トークンのコンテキストウィンドウで4ビット精度でデプロイし、2倍のメモリ節約を実現できるようになりました。

SOURCES

5. Kogが超高速2BモデルをHugging Faceでオープンソース化

Kogは、Hugging Faceで20億パラメータのオープンソースモデルをリリースしました。このモデルの主な特徴は、その極めて高い推論速度であり、毎秒3,000トークンを超える速度で実行できる能力を示しており、低遅延のローカルアプリケーションに非常に適しています。

  • Kogは、Hugging Faceプラットフォームで20億パラメータのモデルをオープンソース化しました。
  • このモデルは、毎秒3,000トークンを超える速度で実行可能です。

毎秒3,000トークンを超える超高速ローカル推論が可能なオープンソースの20億パラメータモデルを提供します。

SOURCES

6. 開発者がClaude Codeを使用してPostHogのSQLパーサーを70倍高速に書き換え

このケーススタディは、複雑なシステムに対するAI支援エンジニアリングの力を強調しています。並列Claude Codeセッションを調整することで、開発者はANTLRベースのパーサーを高性能なRust実装に置き換えることに成功しました。この移行は、厳格なプロパティベースのテストと、トラフィックを切り替える前にレガシーパーサーに対して数百万の本番クエリを検証するシャドウモードデプロイメントによって安全に行われました。

  • 著者は、2026年5月に並列Claude CodeセッションとClaude Opus 4.7を使用して、PostHogのSQLパーサーをRustに書き換えました。
  • 新しい手書きの再帰下降パーサーは、本番環境で454倍、ローカルラップトップで70倍の速度向上を達成しました。
  • 開発プロセスでは、HypothesisライブラリとカスタムSQLジェネレーターを使用したプロパティベースのテストが活用されました。
  • 既存のC++ ANTLRベースのパーサーをオラクルとして使用し、ASTとソース位置の出力が同一であることを保証しました。
  • 最終的な実装は、16,000行のパーサーコード、5,000行のツール、数千行のテストで構成されています。
  • パーサーは、完全なロールアウトの前に、数百万の本番クエリに対してシャドウモードで検証され、乖離はゼロでした。

開発者が並列Claude Codeセッションとプロパティベースのテストを活用して、複雑なレガシーシステムを本番環境での回帰ゼロで高性能なRustコードに書き換える方法を示しています。

SOURCES

7. ShopifyがLLMプロキシと蒸留による回復力のあるAIスタックの詳細を公開

Farhan Thawar氏率いるShopifyのエンジニアリングチームは、プロバイダーのダウンタイムや高いAPIコストから会社を保護するAIインフラストラクチャを設計しました。すべてのトラフィックを一元化されたLLMプロキシ経由でルーティングすることで、サーキットブレーカーを使用してトークン消費を管理し、継続的な稼働時間を確保しています。さらに、同社のTangleプラットフォームは、大規模な教師モデルから高度に専門化されたSLM(小規模言語モデル)への蒸留を自動化し、大幅なコストと遅延の削減を実現しています。

  • Shopifyは、ユーザー接続をルーティングし、トークンを一括購入し、複数のAIプロバイダー間で自動フェイルオーバーを提供するLLMプロキシを開発しました。
  • このプロキシにより、Shopifyはダウンタイム中に開発者のワークフローを中断することなく、Claude OpusやGPT 5.5などのモデルを切り替えることができます。
  • Shopifyはモデル蒸留を使用して、AIアシスタント「Sidekick」のために、より大きな教師モデルから専門的な小規模言語モデル(SLM)を作成しています。
  • Shopifyで蒸留されたモデルは、汎用モデルよりも2倍から30倍安価で高速であることが証明されています。
  • Shopifyの内部プラットフォーム「Tangle」により、エンジニアは通常約1日間実行される蒸留パイプラインを視覚化できます。

自動フェイルオーバーと高度に最適化されたタスク固有の小規模言語モデルを備えた、回復力のあるマルチプロバイダーAIスタックを構築するための青写真を提供します。

SOURCES

8. DFlash推論デコーディングがBlackwellで最大15倍のスループットを達成

カリフォルニア大学サンディエゴ校の研究チームによって開発されたDFlashは、ターゲットの隠れ特徴量をすべてのドラフトレイヤーのKeyおよびValueプロジェクションに注入することで推論デコーディングを最適化し、受け入れ長がドラフトの深さに応じてスケーリングできるようにします。これは、以前の拡散ベースの推論デコーディング手法で使用されていた7Bドラフトよりも大幅に小さい5層のコンパクトなドラフトを利用しており、本番環境へのデプロイに非常に効率的です。

  • DFlashは、軽量なブロック拡散モデルを使用してトークンブロック全体を単一のフォワードパスでドラフトする推論デコーディング手法です。
  • この手法は、ターゲットの自己回帰モデルを使用してドラフトされたブロックを並列に検証することで、ロスレスな出力を維持します。
  • NVIDIAエンジニアリングは、固定された対話性ターゲットにおいて、Blackwell GPU上のgpt-oss-120bモデルで最大15倍高いスループットを報告しています。
  • 研究チームは、Qwen3-8Bモデルで最大6.08倍のロスレス加速を報告しています。
  • DFlashは、vLLM、SGLang、Transformersを含む一般的なサービングフレームワークと互換性があります。

開発者は、一般的なサービングフレームワーク全体で、LLM推論スループットをロスレスで最大15倍向上させることができます。

SOURCES

9. llama.cppの新しいJavaScript実行機能に対するセキュリティ上の懸念

llama.cppのWeb UIに最近マージされた機能により、言語モデルはWeb Workerを介してブラウザ内で生成されたJavaScriptを直接実行できるようになりました。実行はiframe内でサンドボックス化されていますが、開発者はネットワークリクエストが分離を回避して機密データを流出させる可能性について警鐘を鳴らしています。ユーザーは注意を促し、より良いドキュメントと実行前の明示的なレビューゲートを求めています。

  • run_javascriptツールがllama.cppのメインラインリポジトリにマージされ、モデルがブラウザ内でコードを実行できるようになりました。
  • このツールは、sandbox='allow-scripts'属性を使用して、サンドボックス化されたiframe内でコードを実行します。
  • ユーザーは、ネットワークリクエストが可能であり、データ流出に悪用される可能性があると指摘し、セキュリティ上の懸念を報告しています。
  • この機能は広く宣伝されておらず、現在はデスクトップ版Firefoxでのみ表示されるなど、可視性が限定されている可能性があります。
  • コミュニティメンバーは、サンドボックス制限の明確なドキュメントや、実行前のコードレビューインターフェースなどの改善を提案しています。

llama.cppのWeb UIを使用する開発者は、iframe内でコードを実行するものの、ネットワークベースのデータ流出を許可する可能性がある、新しい未公表のJavaScript実行ツールに関連するセキュリティリスクを認識しておく必要があります。

SOURCES

10. Nous ResearchがHermes Agentに自動スキル生成機能を追加

Hermes Agentの新しい「/learn」機能は、SKILL.mdファイルを書き込むという面倒なプロセスを排除するように設計されています。プログレッシブ・ディスクロージャー(段階的開示)を活用することで、エージェントはコンテキストウィンドウを肥大化させることを避け、厳密に必要な場合にのみ完全なスキルコンテンツを読み込みます。この機能は、CLI、TUI、メッセージングゲートウェイ、ダッシュボード環境全体で完全に一貫しており、レビューゲート用のskill_manageツールと統合されています。

  • Nous Researchは、オープンソースのHermes Agentを更新し、再利用可能なスキルを自動作成するための新しい「/learn」コマンドを追加しました。
  • 「/learn」コマンドは、ローカルディレクトリ、URL、過去の会話、または貼り付けられたメモを処理してSKILL.mdファイルを生成します。
  • エージェントは、read_file、search_files、web_extractなどのツールを使用して、オフラインで情報を収集します。
  • Hermes Agentはプログレッシブ・ディスクロージャーパターンを使用し、コンテキストウィンドウの使用を最小限に抑えるために、最初に約3kトークンのインデックスを読み込みます。
  • 作成されたすべてのスキルは、agentskills.ioオープン標準と互換性があり、オプションの書き込み承認ゲートをサポートしています。

開発者は、手動でマークダウン設定ファイルを作成することなく、コードベース、URL、または会話から再利用可能なエージェントスキルを自動生成できます。

SOURCES

11. BrowserbaseがAIエージェントによるCAPTCHAやログインウォールの回避を支援

Browserbaseは、セキュリティ対策によって頻繁にブロックされるWebブラウジングAIエージェントを構築する開発者向けに、堅牢なソリューションを提供します。このプラットフォームは、CAPTCHAやログインウォールなどの複雑なWeb上の課題を処理し、エージェントが変化するWebページを確実にナビゲートできるようにします。このサービスはすでに広く採用されており、毎月数千万のセッションを処理しています。

  • Browserbaseは、ログインウォール、CAPTCHA、変化するWebページを処理することで、AIエージェントを本番環境対応にするために設計されたサービスです。
  • このプラットフォームは、毎月3,500万以上のセッションを処理しています。
  • 現在、10,000以上のチームから信頼されています。
  • プロモーションコード「TLDR1MO」を使用して、1ヶ月の無料トライアルを利用できます。

CAPTCHA、ログインウォール、動的なページレイアウトを自動的に処理する、AIエージェント向けの本番環境対応ブラウザ環境を提供します。

SOURCES

12. IBMがオープンソースのエージェントハーネス「CUGA」をリリース

IBMのCUGAは、ガバナンスと柔軟性を維持しながら、エージェントアプリケーションの開発から本番環境への移行を合理化するように設計されています。状態維持、エラー修正、計画という重労働を処理することで、CUGAは開発者がプロンプトの設計とツールの選択に集中できるようにします。このフレームワークには、構成可能な推論モードと統合されたポリシーシステムも含まれています。

  • IBMは、エージェントアプリケーションの開発を簡素化するために設計されたオープンソースのエージェントハーネス「CUGA」をリリースしました。
  • このフレームワークは計画、実行、状態管理を管理し、開発者がツールの選択とプロンプトに集中できるようにします。
  • CUGAには、状態維持、エラー修正、統合ポリシーシステムのための組み込み機能が含まれています。
  • このフレームワークは、AppWorldなどのベンチマークにおいて他のフレームワークを上回ると報告されています。
  • 構成可能な推論モードを備えており、開発から本番環境への移行をサポートします。

計画、状態管理、エラー修正をすぐに利用できる、軽量なオープンソースのエージェントハーネスを提供します。

SOURCES

13. NVIDIAが専門的なAIエージェント向けのAgent Toolkitを立ち上げ

NVIDIAのAgent Toolkitは、安全なランタイムとツール、スキル、オープンモデルのスイートを提供することで、複雑なドメイン固有のワークフローを加速させることを目的としています。このツールキットは、企業が本番環境で信頼できる高度に専門化されたAIエージェントを構築できるように設計されており、サイバーセキュリティやヘルスケアなどの業界ですでに早期導入が進んでいます。

  • NVIDIAは、企業が専門的でカスタマイズ可能なAIエージェントを構築できるようにAgent Toolkitをリリースしました。
  • このツールキットは、オープンモデル、ツール、スキル、および安全なランタイム環境を活用します。
  • ライフサイエンス、ヘルスケア、サイバーセキュリティ、産業運営などの業界全体で複雑なワークフローを加速するように設計されています。
  • Cadence、Synopsys、CrowdStrikeなどの企業が現在このツールキットを活用しています。

オープンモデルを使用して、専門的でドメイン固有のAIエージェントを構築およびデプロイするための安全なランタイムとツールキットを提供します。

SOURCES

14. Mindstoneがローカルファーストのエージェント型AI OS「Rebel」を立ち上げ

MindstoneのRebelは、企業がAIエージェントを安全にデプロイできるように設計されています。状態とメモリにマークダウンファイルを利用することで、プラットフォームはデータがローカルファーストであることを保証します。ローカルモデルとクラウドモデル間でタスクを調整し、開発者がコストと機密性に合わせて最適化できるようにします。顧客であるEpignosisでの早期導入では、12週間で8人のフルタイムの役割に相当する能力を回復したと報告されています。

  • Mindstoneは、macOSおよびWindows向けのローカルファーストなエージェント型AIオペレーティングシステム「Rebel」を立ち上げました。
  • RebelはFair Sourceライセンスの下で配布されており、100ユーザー未満のチームは無料ですが、大規模なチームには商用ライセンスが必要です。
  • このプラットフォームは、状態、プロンプト、タスク指示、メモリ階層を保存するためにマークダウンファイルを使用します。
  • マルチモデルオーケストレーションをサポートし、データの機密性とコストに基づいてローカルモデルとクラウドベースのモデル間でタスクをルーティングします。
  • Fair Sourceライセンスには2年間のサンセット条項が含まれており、その後ソフトウェアバージョンは自動的にMITライセンスに変換されます。

データを安全に保ちながら、ローカルモデルとクラウドモデル間でタスクを調整する、マークダウン駆動のローカルファーストなエージェント型オペレーティングシステムを提供します。

SOURCES

15. OpenHarnessエージェントランタイムをゼロから構築する方法の詳細チュートリアル

MarkTechPostによって公開されたこのチュートリアルでは、OpenHarnessのコアアーキテクチャ、ツールレイヤー、モデル脳レイヤー、およびメインエージェントループを構築する手順を説明しています。このガイドは、開発者がエージェントランタイムの基礎となるメカニズムを理解できるように設計されており、外部APIキーを必要とせずに、ライフサイクルフック、コスト追跡、コンテキスト圧縮の実践的なデモンストレーションを提供します。

  • このチュートリアルは、エージェントシステムフレームワークであるOpenHarnessをゼロから構築するためのガイドを提供します。
  • OpenHarnessには、ツール使用、型付きツールスキーマ、権限、ライフサイクルフック、メモリ、スキル、コンテキスト圧縮、再試行ロジック、コスト追跡、マルチエージェント調整などの機能が含まれています。
  • 実装は、APIキーや複雑なインフラストラクチャを必要とせずに実行できるように設計されています。
  • このフレームワークは、決定論的なモック脳と、AnthropicまたはOpenAI APIと互換性のある実際のLLMプロバイダーとの切り替えをサポートしています。
  • チュートリアルでは、権限ガバナンス、オンデマンドスキル、メモリ永続化、マルチエージェント委任を実演しています。

ツールスキーマ、権限ガバナンス、マルチエージェント調整を備えた、本番グレードのエージェントランタイムを構築するためのステップバイステップのアーキテクチャ青写真を提供します。

SOURCES

16. GraphifyがPythonおよびSQLコードベースをオフラインでナレッジグラフにマッピング

Graphifyは、LLMベースのコードベース分析に対する軽量なオフラインの代替手段を提供します。tree-sitterでコードベースを解析することにより、開発者がNetworkXを使用して分析できる構造化されたgraph.jsonファイルを生成します。これにより、チームはコードを外部APIに送信することなく、マルチモジュールアプリケーションをマッピングし、アーキテクチャのボトルネックを特定し、依存関係フローを視覚化できます。

  • Graphifyは、tree-sitterベースの分析を使用して、PythonおよびSQLコードベースをナレッジグラフに変換します。
  • ワークフローは完全にオフラインで動作し、APIキーやLLMバックエンドを必要としません。
  • 生成されたgraph.jsonファイルはNetworkXに読み込んで、中心性の計算、コミュニティの検出、最短経路の追跡を行うことができます。
  • このプロセスは、アーキテクチャのホットスポット、ゴッドノード、依存関係フローを特定するのに役立ちます。
  • Matplotlibによる静的視覚化と、Pyvisを使用したインタラクティブな視覚化をサポートしています。

LLMやAPIキーを必要とせずに、PythonおよびSQLコードベースの構造をナレッジグラフとしてオフラインでマッピングおよび分析できます。

SOURCES

17. NVIDIAとAWSが提携し、Blackwell GPUをEC2 G7インスタンスに導入

NVIDIAとAWSは、クラウド開発者にBlackwell世代のハードウェアを提供するために協力関係を拡大しました。新しいNVIDIA RTX PRO 4500 Blackwell GPUをAWS EC2 G7インスタンスに統合することで、このパートナーシップは本番スケールのAI推論ワークロードに対して大幅なパフォーマンス向上を実現することを目指しています。

  • NVIDIAとAWSは、新しいNVIDIA RTX PRO 4500 Blackwell GPUを使用して、AIデプロイメントを大規模に最適化するために提携しました。
  • 新しいGPUはAWS EC2 G7インスタンスに統合されています。
  • このコラボレーションにより、以前の構成と比較して最大4.6倍のAI推論パフォーマンスが提供されます。

開発者は、Blackwell GPUを搭載したAWS EC2 G7インスタンス上でAIモデルをデプロイし、推論パフォーマンスを最大4.6倍高速化できるようになりました。

SOURCES

18. AMDがローカルLLM向けのハイブリッドNPUおよびGPU処理を有効化

AMDは、ROCmソフトウェアスタックの更新を通じて、ローカルLLMワークロード向けにRyzen AI NPUを解放しました。新しいハイブリッドモードを利用することで、開発者はNPUと統合GPUの両方に処理を分散させることができ、NPUがプロンプト処理を並列で処理できるようになります。公式ドキュメントとモデル準備ガイドは、ryzenai.docs.amd.comで入手できます。

  • AMD Ryzen AI NPUは、ROCmソフトウェアスタックの改善により、LLMワークロードに使用できるようになりました。
  • ハイブリッドモードでは、LLMがNPUとiGPUの両方を使用して同時に実行され、NPUがプロンプト処理を並列で処理できるようになります。
  • FastFlowLM NPUモデルは、NPUハードウェア上で実行するように特別に設計されています。
  • Ryzen AIハードウェアの機能をテストするには、Lemonadeソフトウェア(lemonade-server.ai)が推奨されます。
  • Qwen 3.6 GGUFモデルをハイブリッド実行用にONNX形式に変換することは、依然として技術的な課題です。

開発者は、AMD Ryzen AIハードウェア上のNPUとiGPUの両方を同時に活用して、ローカルLLMのプロンプト処理と推論を加速できるようになりました。

SOURCES

19. WebGPU拡張機能を使用してブラウザでSDXLをローカル実行

generate-ai-images拡張機能は、ローカル画像生成をブラウザに直接もたらします。14インチMacBook M4では、拡張機能が1枚の画像を処理するのに約50〜60秒かかります。モデルの読み込み中や生成終了時に、同期的なWebGPUシェーダーコンパイルのためにブラウザが約10秒間一時的にフリーズしますが、SDXL-Lightningをオフラインで実行するための非常にアクセスしやすい方法を提供します。

  • generate-ai-imagesブラウザ拡張機能により、仮想環境や複雑なインストールなしで、WebGPUを使用したローカル画像生成が可能になります。
  • この拡張機能は、テキストエンコーダー、UNet、VAEコンポーネントにONNXグラフを利用して、ユーザーのGPU上でモデルをオフラインで実行します。
  • サポートされているモデルには、SDXL-Lighting fp16(約7GBのストレージと8GBのVRAMが必要)および4ビットバージョン(約3.6GBのストレージと4-5GBのVRAMが必要)が含まれます。
  • このツールには、WebGPUをサポートするブラウザ(具体的にはChromeまたはEdgeバージョン122以降、または最新バージョンのFirefox)が必要です。
  • プロジェクトはオープンソースであり、GitHub、Firefoxアドオンストア、Chromeウェブストアから入手できます。

開発者は、複雑なローカルPython環境を必要とせずに、ONNXグラフを使用してWebGPU経由でブラウザ内でSDXL-Lightningをローカルに実行できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。