Inference Brew

Tencentが770Bパラメータのオープンウェイトモデル「Hy4 Preview」を公開

00:00 / --:--

← ホームへ戻る

Tencentが770Bパラメータのオープンウェイトモデル「Hy4 Preview」を公開

1. Tencentが770Bパラメータのオープンウェイトモデル「Hy4 Preview」を公開

Tencentは、総パラメータ数7700億、アクティブパラメータ数490億の大規模言語モデル「Hy4 Preview」をオープンウェイトで公開しました。このモデルは100万トークンのコンテキストウィンドウをサポートしており、Hugging Faceで利用可能ですが、1.56TBという巨大なファイルサイズのため、ホスティングにはかなりのリソースが必要です。Hy4には「デュアルレベル推論」機能が導入されており、デフォルトの「high」推論レベルと、推論を完全に無効にする「no_think」レベルを開発者が切り替えることができます。

  • • Hy4は、総パラメータ数770B、アクティブパラメータ数49Bのテキスト入力型大規模言語モデルです。
  • • 100万トークンのコンテキストウィンドウをサポートしています。
  • • Hugging Faceでのモデルファイルサイズは1.56TBです。
  • • デフォルトの「high」レベルと、推論を無効にする「no_think」レベルの2つの推論レベルを備えています。

開発者は、100万トークンのコンテキストウィンドウをサポートし、「no_think」レベルで推論を無効化できる巨大なオープンウェイトモデルを試すことができます。

SOURCES

2. OpenAIがChatGPT Workのサブスクリプション階層とローカル自動化機能を詳細化

7月のChatGPT Workの初期リリースに基づき、OpenAIはそのサブスクリプション構造を詳細化しました。サービスは、コード実行環境とWeb自動化用のヘッドレスChromeを提供する「Work Cloud」と、デスクトップアプリを通じてローカルファイルへの直接アクセスを可能にする「Work Local」に分割されました。さらに、ユーザーはCloudflare Workersを活用した「ChatGPT Sites」を使用してステートフルなWebサイトをデプロイできるようになったほか、サブエージェントセッションやスケジュールされたプロンプト自動化のサポートも新たに追加されました。

  • • ChatGPT Workは「Work Cloud」と「Work Local」の階層に分割されました。
  • • Work Localでは、デスクトップアプリケーションを通じてローカルファイルに直接アクセスできます。
  • • Work Cloudには、永続的なファイルシステム、コード実行環境、Web自動化用のヘッドレスChromeが含まれます。
  • • ユーザーはCloudflare Workersを使用してChatGPT Sites経由でステートフルなWebサイトをデプロイできます。
  • • サブエージェントセッションとスケジュールされたプロンプト自動化がサポートされました。

これらの機能により、ChatGPT Workは汎用エージェントから、ローカルファイルの操作や自動化されたWebデプロイが可能な専門的な開発環境へと進化しました。

SOURCES

3. Google AIが多変量時系列予測モデル「TimesFM-3」をリリース

Google Researchは、多変量時系列予測用に設計された3億3000万パラメータのゼロショット基盤モデル「TimesFM-3」をリリースしました。1兆以上のタイムポイントで事前学習されており、タスク固有のファインチューニングなしで、複数のターゲット、過去の共変量、過去・未来の共変量をサポートします。デコーダーのみのTransformerアーキテクチャを採用し、因果的時系列アテンションと全変数アテンションを交互に使用して、系列間の依存関係をモデル化します。リポジトリのコードはApache-2.0ライセンスですが、モデルの重みは非商用および非本番環境での利用に制限されている点に注意が必要です。

  • • Google Researchは、多変量時系列予測のための3億3000万パラメータの基盤モデル「TimesFM-3」をリリースしました。
  • • 実データと合成データを含む1兆以上のタイムポイントで事前学習されています。
  • • タスク固有のファインチューニングなしで、複数のターゲットや共変量をサポートします。
  • • デコーダーのみのTransformerアーキテクチャを採用しています。
  • • モデルの重みは非商用・非本番利用に制限されていますが、コードはApache-2.0ライセンスです。
  • • GIFT-Eval、fev-bench、TIMEベンチマークにおいて、事前学習済み基盤モデルの中で1位を獲得しています。

開発者は最先端のゼロショットモデルを複雑な多変量予測に使用できますが、非商用ライセンスを遵守する必要があります。

SOURCES

4. Apodex 1.1のベンチマーク結果とAPI価格が詳細化

8月27日のApodex 1.1モデルファミリーの発表に続き、詳細なパフォーマンス指標と商用価格が公開されました。このモデルは「Artificial Analysis Intelligence Index」で44点を獲得し、エージェントベンチマーク「GDPval-AA v2」でElo 1348を記録しました。TerminalBench v2.1では70%のスコアで高い性能を示しましたが、AA-Omniscienceベンチマークでは78.4%のハルシネーション率も確認されました。ApodexのファーストパーティAPI経由で利用可能で、価格は入力100万トークンあたり0.30ドル、出力100万トークンあたり3.00ドルです。

  • • Apodex 1.1はArtificial Analysis Intelligence Indexで44点を獲得しました。
  • • エージェントベンチマークGDPval-AA v2でElo 1348を達成しました。
  • • TerminalBench v2.1のパフォーマンスは70%でした。
  • • API価格は入力100万トークンあたり0.30ドル、出力100万トークンあたり3.00ドルです。
  • • 256Kトークンのコンテキストウィンドウを備えています。
  • • AA-Omniscienceベンチマークでのハルシネーション率は78.4%でした。

開発者は標準化されたベンチマークデータと公式価格を使用してApodex 1.1のコスト対パフォーマンスを評価し、エージェントワークフローへの統合を検討できます。

SOURCES

5. 量子化モデル「DeepSeek-V4-Pro-0813-NVFP4」がリリース

DeepSeekの自己回帰型Mixture-of-Experts言語モデルの量子化バージョンである「DeepSeek-V4-Pro-0813-NVFP4」がリリースされました。Model Optimizerを使用して量子化されており、高度な推論、ツール使用、エージェントAIアプリケーション向けに調整されています。商用・非商用を問わず利用可能であり、本番環境へのデプロイが可能です。

  • • DeepSeek-V4-Pro-0813-NVFP4は、DeepSeek-V4-Pro-0813の量子化バージョンです。
  • • Model Optimizerを使用して量子化されています。
  • • 高度な推論、エージェントAI、ツール使用、複雑な問題解決向けに設計されています。
  • • 商用・非商用を問わず利用可能です。

開発者は、エージェントワークフローや複雑な問題解決のために、高度に最適化されたDeepSeekの推論モデルをデプロイできます。

SOURCES

6. 「DeepSeek-V4-Flash-Vision-Exp」の重みがHugging Faceで公開

8月21日の実験的モデル「DeepSeek-V4-Flash-Vision-Exp」の発表に続き、モデルの重みがHugging Faceからダウンロード可能になりました。これにより、開発者はAPI経由のアクセスに加え、視覚機能を持つこのモデルをローカルでホストできるようになります。

  • • DeepSeek-V4-Flash-Vision-Expの重みがHugging Faceで公開されました。
  • • 8月21日のAPIベースの視覚機能発表に続くものです。
  • • 実験的な視覚モデルのローカルデプロイとセルフホストが可能になりました。

開発者はAPIアクセスだけでなく、独自のマルチモーダルアプリケーションのために実験的な視覚モデルをセルフホストできるようになりました。

SOURCES

7. エージェントの計画とメモリを強化する「ContextPilot-14B」がリリース

エージェント機能を強化するために設計されたQwen3-14Bの特殊チェックポイント「ContextPilot-14B」がHugging Faceでリリースされました。このモデルは、エージェントがどのように計画を立て、長期記憶を維持し、不要なコンテキストをオフロードしながら推論やツール実行を継続するかを学習させることに重点を置いています。これにより、開発者はより堅牢な自律ワークフローを構築するためのターゲットを絞ったオープンウェイトの選択肢を得ることができます。

  • • ContextPilot-14Bは、Hugging FaceでホストされているQwen3-14Bチェックポイントです。
  • • エージェントの機能を強化するために設計されています。
  • • エージェントが計画を立て、長期記憶を維持し、推論やツール使用を継続しながらコンテキストをオフロードできるようにします。

自律エージェントを構築する開発者は、この特殊なチェックポイントを使用して長期的な推論とコンテキスト管理を改善できます。

SOURCES

8. 推論を高速化した「Nanbeige4.2-3B-DSpark」がリリース

7月に導入されたNanbeige4.2-3Bモデルに基づき、新しい「Nanbeige4.2-3B-DSpark」バリアントがHugging Faceでリリースされました。このバージョンはリソースが制限された環境向けに特別に最適化されており、毎秒約35トークンの自己回帰生成速度を実現します。GPUリソースが限られている開発者にとって、Qwen 3.5 9Bモデルのより高速な代替手段として位置付けられています。

  • • Nanbeige4.2-3B-DSparkは、7月にリリースされたNanbeige4.2-3Bの最適化バージョンです。
  • • Hugging Faceでホストされており、リソースが制限された環境向けに設計されています。
  • • 毎秒約35トークンの自己回帰生成速度を実現します。
  • • GPUリソースが限られた環境において、Qwen 3.5 9Bの高速な代替手段となります。

このリリースは、既存のNanbeige4.2-3Bアーキテクチャに対して最適化された高速な推論パスを提供し、限られたハードウェアでのパフォーマンスを向上させます。

SOURCES

9. Anthropicがコード実行エクスプロイトを受け「Auto Mode」のセキュリティについて説明

セキュリティ研究者が、Pythonモジュールのシャドウイングを悪用して任意のコード実行を可能にする、Auto ModeのClaude Code Opus 5に対する攻撃チェーンを実証しました。これは、Anthropicが8月14日にAuto ModeをClaude Codeのデフォルト設定にしたことに続くものです。このエクスプロイトに対し、AnthropicはAuto Modeが安全性に関する以前の主張にもかかわらず、セキュリティ境界ではなく、ベストエフォート型の分類器を備えた利便性機能であることを明確にしました。開発者は、コーディングエージェントをコンテナや仮想マシンなどの隔離された環境で実行し、ネットワークの出口を制限することが推奨されます。

  • • 研究者がAuto ModeのClaude Code Opus 5に対する攻撃チェーンを実証し、最大80%の成功率でコード実行を達成しました。
  • • このエクスプロイトはPythonモジュールのシャドウイングを使用して、悪意のあるZIPアーカイブからコードを実行させます。
  • • AnthropicはAuto Modeがセキュリティ境界ではなく利便性機能であることを明確にし、安全なデフォルトであるという以前の立場を修正しました。
  • • 開発者はコーディングエージェント使用時に隔離された環境(コンテナ/VM)を使用し、ネットワーク出口を制限することが推奨されます。

この開示は、デフォルトのエージェントモードの認識されたセキュリティと実際の耐性との間のギャップを浮き彫りにしており、より厳格なローカル環境制御の必要性を示しています。

SOURCES

10. 「OpenClaw 2.0」リリース:ガイド付きセットアップと再構築されたコントロールUI

OpenClawチームは、オープンソースプロジェクト史上最大のアップデートとなるOpenClaw 2.0をリリースしました。16,000件以上のプルリクエストが統合されています。シングルオペレーターおよびチームデプロイ向けに設計されており、OpenAI、Anthropic、Ollama、LM Studioなどのプロバイダーの認証情報を自動的に検出・検証するインストールプロセスが書き直されました。再構築されたコントロールUIは起動時間を575ミリ秒に短縮し、新しいドッキングパネルにはワークスペースファイルエディタ、Gitベースの変更パネル、フルスクリーンWebターミナルが追加されました。セッションとトランスクリプトはSQLiteストレージに移行されました。

  • • OpenClaw 2.0は、既存のサブスクリプション、APIキー、ローカルモデルを自動検出するインストールプロセスを備えています。
  • • 再構築されたコントロールUIは起動時間を1.6秒から575ミリ秒に短縮し、JavaScriptリクエストを140から45に削減しました。
  • • セッションとトランスクリプトはSQLiteに移行され、新しいドッキングパネルでファイル編集やGit操作が可能です。
  • • 共有クラウドセッションにより複数ユーザーのコラボレーションが可能ですが、セキュリティ境界やテナント分離としては機能しません。
  • • 933人の貢献者による16,000件以上のプルリクエストが統合されており、これはプロジェクト全体の約50%に相当します。

シングルオペレーターやチーム向けのAIゲートウェイをデプロイする開発者は、モデル検証機能と共同セッションを備えた、より高速で統合されたワークスペースを活用できます。

SOURCES

11. 「uv 0.12.8」がBLAKE3を使用したファイルレベルのキャッシュ重複排除を導入

Astralはuvバージョン0.12.8をリリースし、ホイールキャッシュにおけるファイルレベルの重複排除を導入しました。ファイルをBLAKE3ハッシュに基づいてfiles-v0バケットに保存し、ハードリンクを使用して元の場所に配置することで、既存のインストールワークフローを変更することなくディスク使用量を大幅に削減します。また、macOSでのキャッシュクリーンアップを最適化し、依存関係グラフの構築を高速化、ホイール抽出時の割り当てを削減し、冗長な同時ダウンロードを防止します。

  • • uv 0.12.8は、BLAKE3ハッシュを使用してホイールキャッシュのファイルレベル重複排除を行います。
  • • ハードリンクを使用してオブジェクトを元の場所に保存し、既存のワークフローを維持します。
  • • macOS向けにgetattrlistbulkを使用してハードリンク数をバッチで読み取り、キャッシュクリーンアップを最適化しました。
  • • 依存関係グラフ構築の高速化、ホイール抽出時の割り当て削減、冗長な同時ダウンロードの防止を実現しました。
  • • Azure Storage APIの互換性、Azure SASのURL秘匿化、ワークスペース検出に関するバグを修正しました。

uvを使用する開発者は、依存関係グラフ構築の高速化、ディスク使用量の削減、macOSでのキャッシュクリーンアップの最適化を享受できます。

SOURCES

12. OpenAI Codexのメモリ機能がローカルチャットコンテンツを流出させているとの疑い

OpenAI Codexのメモリ機能が、ローカルプロバイダーのチャットコンテンツをOpenAIのサーバーに流出させているというセキュリティ上の懸念が浮上しました。報告によると、このデータ転送はユーザーへの通知なしに行われており、OpenAIの開発者ツールと並行してローカルLLM環境を利用する開発者にとって、プライバシーとセキュリティ上の懸念が生じています。

  • • OpenAI Codexのメモリ機能が、ローカルプロバイダーのチャットコンテンツをOpenAIに流出させている疑いがあります。
  • • データ転送はユーザーへの通知なしに行われます。
  • • ローカル開発ツールとクラウドベースの開発ツールを併用する開発者に影響します。

OpenAIツールとローカルLLMプロバイダーを併用する開発者は、プライベートなコードベースに影響を与えるデータ漏洩のリスクに注意する必要があります。

SOURCES

13. ポータブルなエージェントメモリファイル形式「Memoryfields」が登場

Memoryfieldsは、ポータブルで低メカニズムなエージェントメモリファイル形式として導入されました。Markdownページ、オプションのYAMLフロントマター、セマンティック検索用のオプションのSQLiteベクトルインデックスで構成され、メモリを厳密にデータとして扱います。この設計により、チャンキングやリランキングのような複雑なRAGパイプラインを回避し、bashやSQLiteのような単純なアクセスパターンでエージェントがメモリと対話できるようにします。Memoryfieldsはzipファイルとしてパッケージ化され、トランスポートに依存せず、ローカルストレージ、Amazon S3、GitHub、HTTPをサポートします。CLIツールと管理スキルが利用可能で、埋め込みにはnomic-embed-text-v1.5が推奨されています。

  • • Memoryfieldsは、Markdownページ、YAMLフロントマター、SQLiteベクトルインデックスで構成されるポータブルなメモリ形式です。
  • • メモリをデータとして扱い、チャンキングやリランキングなどの複雑なRAGプロセスを回避します。
  • • 各メモリページには約8kbまたは2000トークンのソフト制限があります。
  • • zipファイルとして保存され、ローカル、S3、GitHub、HTTPなどトランスポートに依存しません。
  • • CLIツールと管理スキルが提供されており、埋め込みにはnomic-embed-text-v1.5が推奨されます。

開発者はMemoryfieldsを使用して、複雑なRAGパイプラインなしで、トランスポートに依存しない低メカニズムなエージェントメモリを実装できます。

SOURCES

14. Hebbian Roboticsがマルチモーダルロボティクスデータ用SDK「HFlow」をリリース

Hebbian Roboticsは、スケーラブルなロボティクスデータパイプラインを構築するためのSDK「HFlow」をオープンソース化しました。Apache-2.0ライセンスの下でリリースされたHFlowは、ビデオ、関節状態、アクションなどの生のマルチモーダル記録を、標準化されたエピソードとクエリ可能なデータセットマニフェストに変換します。このSDKはMCAPコンテナ形式を使用してセンサーのストリームを同期させます。パイプラインはPython関数として記述され、Airflow 3 DAGとして実行可能で、測定値とメタデータを追記専用のParquetカタログに保存します。開発者はDuckDB SQLを使用してこのカタログをクエリし、生の記録を再オープンすることなくバージョン固定されたトレーニングマニフェストを生成できます。

  • • HFlowは、マルチモーダルロボティクスデータを処理するためのオープンソースSDKで、Apache-2.0ライセンスです。
  • • 生の記録(ビデオ、関節状態、アクション)を標準化されたエピソードとクエリ可能なマニフェストに変換します。
  • • MCAPコンテナ形式を使用してセンサーのストリームを同期させます。
  • • パイプラインはPython関数で構築され、Airflow 3 DAGとして実行可能です。
  • • 測定値、メタデータ、品質証拠を追記専用のParquetカタログに保存し、DuckDB SQLでクエリ可能です。

ロボティクスやマルチモーダルAIアプリケーションを構築する開発者は、HFlowを使用してDuckDB SQLでクエリ可能な構造化されたバージョン固定のトレーニングデータセットを構築できます。

SOURCES

15. Keenable AIがライブ検索ベンチマーク「NEEDLE」をオープンソース化

Keenable AIは、クエリセットを時間単位または日単位で再生成することで過学習を防ぐ、Web検索API向けのライブベンチマーク「NEEDLE」をオープンソース化しました。MITライセンスの下でリリースされたNEEDLEは、ニュース、日常、専門、ディープテール、法律の5つの分野で検索APIを評価するPython CLIツールです。プールされたオラクルエンジンに基づく「究極」の指標を使用して、経験的な上限を確立します。2026年8月28日までの週のレイテンシベンチマークでは、Keenable-realtimeのp50レイテンシは193msを記録し、Exaの1,876ms、Bingの2,767msと比較されました。

  • • Keenable AIは、クエリセットを時間単位または日単位で再生成するWeb検索API向けのライブベンチマーク「NEEDLE」をオープンソース化しました。
  • • ニュース、日常、専門、ディープテール、法律の5つの分野で検索APIを評価します。
  • • NEEDLEはMITライセンスのPython CLIツールで、判定にはOpenRouterキーが必要です。
  • • 2026年8月28日までの7日間のレイテンシベンチマークでは、Keenable-realtimeが193ms(p50)、Exaが1,876ms(p50)、Bingが2,767ms(p50)でした。
  • • 実際のエージェントトラフィックを代表するディープテールクエリが最も困難であり、Exaは究極の天井の0.557を達成しました。

検索対応エージェントを構築する開発者は、NEEDLEを使用してExa、Bing、Keenableなどの検索APIのレイテンシと検索品質を評価・比較できます。

SOURCES

16. llama.cppがQwen 3.8 Flash Nextのデフォルトのlazy-mode動作を変更

llama.cpp(b10726)の最近のアップデートにより、Qwen 3.8 Flash Nextモデルのランタイム処理が変更され、lazy-mode設定のデフォルトがautoになりました。この構成では、モデルの51BパラメータのPLE n-gram埋め込みテーブルがmmapを介してディスク上に保持され、推論中にオンデマンドで読み取られます。これによりメモリ使用量は削減されますが、ベンチマークでは50%のパープレキシティ速度低下と15%のトークン生成速度低下が示されています。開発者は、lazy-mode offフラグを明示的に渡すことで、この動作を回避し、埋め込みテーブルをRAMに強制的に読み込ませることができます。

  • • アップデートb10726により、Qwen 3.8 Flash Nextモデルのデフォルトのlazy-mode動作がautoに変更されました。
  • • この変更により、load-mode none設定であっても、モデルの51BパラメータのPLE n-gram埋め込みテーブルがmmap経由でディスク上に保持されます。
  • • 新しいデフォルトのlazy-modeにより、50%のパープレキシティ速度低下と15%のトークン生成速度低下が報告されています。
  • • ユーザーはlazy-mode offフラグを使用して、埋め込みテーブルをRAMに強制的に読み込ませることができます。

llama.cpp経由でQwen 3.8 Flash Nextをローカルで実行する開発者は、50%のパープレキシティ速度低下と15%のトークン生成速度低下を避けるために、手動でlazy-modeを無効にする必要があります。

SOURCES

17. Qwen 3.8 Flash Nextのllama.cppベンチマークがVRAMとメモリレイアウトのトレードオフを明らかに

llama.cpp b10666上でのunsloth/Qwen3.8-Flash-Next-GGUFモデルのパフォーマンステストは、ハイエンドハードウェアにおける重要なメモリおよびレイアウト構成を浮き彫りにしました。96GB VRAMを搭載したNVIDIA RTX PRO 6000で実行した場合、2Kプロンプトで毎秒109.07トークンのデコード速度を達成しましたが、CPUのみでは毎秒8.34トークンでした。重要な点として、レイヤーごとの27.2 GiBのトークン埋め込みテーブルをCUDA VRAMに強制的に配置すると、デコード速度は毎秒1.95トークンまで急落しました。さらに、非統合KVレイアウトを使用すると、同時実行数16で毎秒92.0トークンを達成し、統合レイアウトを上回りました。

  • • llama.cpp b10666上のunsloth/Qwen3.8-Flash-Next-GGUFのベンチマークでは、96GB VRAMで109.07 tok/sのデコードを達成し、CPUのみの8.34 tok/sを大きく上回りました。
  • • 27.2 GiBのトークン埋め込みテーブルをCUDA VRAMに強制配置すると、デコード速度が108.5 tok/sから1.95 tok/sに大幅に低下しました。
  • • RAM常駐ロードは、48GBのテンソル配置でのmmapと比較して1.87倍高いプリフィル速度を提供しました。
  • • 同時実行数16において、非統合KVレイアウトは92.0 tok/sに達し、統合KVレイアウトを上回りました。
  • • 96GB VRAMと24GB VRAMのパフォーマンス上の利点は、2Kコンテキストでの2.80倍から245Kコンテキストでは1.45倍に減少しました。

ローカル推論を最適化する開発者は、最適なメモリとレイアウト構成により、ハイエンドハードウェアで毎秒最大109トークンを達成できます。

SOURCES

18. BeeLlamaの最適化フォークが、高コンテキスト深度でのKVarNパフォーマンスを改善

BeeLlama.cppにおけるKVarNの初期実装に基づき、新しいGitHubフォーク(valujin/beellama-kvarn)が、高コンテキスト深度でのパフォーマンス低下に対処するための最適化を導入しました。5070Ti GPUを搭載したWindows 11システムでQwen3.8 IQ4 XSモデルを使用したテストでは、このフォークは元の実装と比較して最大76%高速なトークン生成を実現しました。開発者は、kvarnを使用する際に-nglフラグを外すと、両方の実装でパフォーマンスの問題が発生することに注意する必要があります。

  • • valujin/beellama-kvarnフォークは、高コンテキスト深度向けに既存のKVarN実装を最適化しています。
  • • パフォーマンステストでは、元のBeeLlama実装と比較して最大76%高速なトークン生成が示されました。
  • • このフォークは、Qwen3.8 IQ4 XSモデルを使用し、5070Ti GPU、16GB VRAM、48GB RAMを搭載したWindows 11システムでテストされました。
  • • kvarn使用時に-nglフラグを外すと、オリジナルとフォークの両方の実装でパフォーマンスの問題が発生します。

KVキャッシュ量子化にKVarNを使用する開発者は、この最適化されたフォークに切り替えることで、長コンテキスト推論中のパフォーマンス低下を軽減できます。

SOURCES

19. llama.cppのプルリクエストがIQモデルのAVX2プロンプト処理を高速化

llama.cppリポジトリの新しいプルリクエスト(#27402)は、IQ量子化モデルの大きなバッチサイズのプロンプト処理を高速化するために設計されたAVX2最適化を導入しました。このアップデートは、IQモデルを利用する開発者のCPUベースのローカル推論パフォーマンスを直接向上させます。

  • • bartowski1182によるllama.cppのプルリクエスト(#27402)がAVX2最適化を導入しました。
  • • CPU上でのIQモデルの大きなバッチサイズのプロンプト処理を高速化します。

CPUでローカル推論を実行する開発者は、IQ量子化モデルを使用する際にプロンプト処理速度の向上を享受できます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。