1. AnthropicがClaude Opus 5.5をリリース、価格引き下げと安全性を強化
Claude Opus 5およびFable 5.1シリーズのリリースに続き、AnthropicはClaude Opus 5.5を発表しました。この新しいフラッグシップモデルは、基本トークン価格を20%引き下げて入力100万トークンあたり4ドル、出力100万トークンあたり20ドルとし、キャッシュ読み取りコストも60%削減しました。Opus 5.5は前モデルより30%高速化されており、境界回避の試みを85%削減する厳格な安全対策や、サイバーセキュリティおよび生物学に関する機密性の高いクエリに対する自動ルーティング機能が導入されています。
- • Claude Opus 5.5はClaude 5ファミリーの最新版で、100万トークンのコンテキストウィンドウを備えています。
- • 基本価格は20%引き下げられ、入力100万トークンあたり4ドル、出力100万トークンあたり20ドルとなり、キャッシュ読み取りコストは60%削減され100万トークンあたり0.20ドルとなりました。
- • このモデルはOpus 5より30%以上高速で、現在Artificial Analysis Intelligence Indexでスコア58を獲得し首位に立っています。
- • 強化された安全プロトコルにより、境界回避の試みが以前のバージョンと比較して85%削減されました。
- • サイバーセキュリティや生物学に関する機密性の高いリクエストは、自動的に古いモデルバージョン(それぞれOpus 4.8およびOpus 5)に再ルーティングされます。
開発者は、初期のClaude 5リリースで確立された機能を基盤としつつ、現在Artificial Analysis Intelligence Indexでトップを走る、より費用対効果が高く安全なフラッグシップモデルを利用できるようになりました。
2. OpenAIがGPT-6ラインナップを拡充、SolおよびLunaモデルを追加
OpenAIは、今月初めにエージェント型モデルGPT-6 Astraをリリースしたのに続き、GPT-6 SolおよびGPT-6 Lunaを一般公開し、GPT-6モデルファミリーを拡充しました。これらの新しいモデルは、ハイエンドのAstraモデルに代わるメインストリーム向けかつ予算に優しい選択肢を開発者に提供し、GPT-5.6シリーズと比較して大幅な価格引き下げとハルシネーション率の改善を実現しています。
- • OpenAIはSolおよびLunaモデルのリリースによりGPT-6シリーズを拡充しました。
- • GPT-6 Solの価格は入力100万トークンあたり2ドル、出力100万トークンあたり10ドルです。
- • GPT-6 Lunaの価格は入力100万トークンあたり0.10ドル、出力100万トークンあたり0.50ドルです。
- • 両モデルともハルシネーション率が改善されており、GPT-6アーキテクチャで導入された90%のプロンプトキャッシュ割引を維持しています。
- • GPT-6 Solは、AutomationBenchベンチマークにおいて、より低コストでClaude Opus 5を上回るパフォーマンスを発揮します。
開発者はより幅広いGPT-6モデルを選択できるようになり、新しいアーキテクチャ全体でパフォーマンス、コスト、推論能力のバランスを取ることが可能になります。
3. XiaomiがMiMo-V2.6シリーズにFlashオムニモーダルモデルを追加
MiMo-V2.6-Proの最近の立ち上げを拡大し、Xiaomiは3Dシーン構築におけるエージェントの調整用に設計されたFlashオムニモーダルモデルをリリースしました。同社はまた、V2.6シリーズの技術レポート、トレーニング環境、および強化学習コードをオープンソース化しました。両モデルとも100万トークンのコンテキストウィンドウを備え、テキスト、画像、音声、動画の入力をサポートしています。
- • Xiaomiは、以前発表されたMiMo-V2.6-Proと並んでFlashオムニモーダルモデルをリリースしました。
- • これらのモデルは、インタラクティブな3Dシーンを構築およびテストするためのエージェントを調整するように設計されています。
- • XiaomiはV2.6シリーズの技術レポート、トレーニング環境、および強化学習コードをオープンソース化しました。
- • 両モデルともテキスト、画像、音声、動画の入力をサポートし、100万トークンのコンテキストウィンドウを備えています。
開発者は、新しいFlashモデルや、インタラクティブな3Dエージェントワークフローを構築するための包括的なオープンソースのトレーニングリソースを含む、MiMo-V2.6スイート全体にアクセスできるようになりました。
4. StepFunが100万コンテキストウィンドウを備えたStep 5 Previewをリリース
StepFunは、合計6000億パラメータ(アクティブ270億)と100万トークンのコンテキストウィンドウを備えた新しいフラッグシップモデル「Step 5 Preview」を立ち上げました。このモデルはテキスト、画像、動画の入力を受け付け、Artificial Analysis Intelligence IndexにおいてKimi K3 (max)のパフォーマンスに匹敵しながら、タスクあたりのコストを2.8倍削減しています。現在、StepFunのファーストパーティAPIを通じて、入力100万トークンあたり1ドル、出力100万トークンあたり2.70ドルで利用可能であり、10月15日にはオープンウェイト版のリリースが予定されています。
- • StepFunは、合計600Bパラメータ、アクティブ27Bパラメータを持つフラッグシップモデル「Step 5 Preview」をリリースしました。
- • このモデルは100万トークンのコンテキストウィンドウをサポートし、テキスト、画像、動画の入力を受け付けます。
- • Step 5 PreviewはArtificial Analysis Intelligence IndexでKimi K3 (max)のパフォーマンスに匹敵し、タスクあたりのコストは2.8倍低くなっています。
- • 価格は入力100万トークンあたり1ドル、出力100万トークンあたり2.70ドルで、キャッシュされた入力は100万トークンあたり0.05ドルです。
- • このモデルはStepFunのAPI経由で利用可能で、10月15日にオープンウェイト版がリリースされる予定です。
開発者は、長文コンテキストのマルチモーダルタスク向けに非常に費用対効果の高いフラッグシップモデルを利用でき、来月にはオープンウェイト版のリリースも予定されています。
5. AntLingがUI/UXデザイン向け6Bモデルファミリー「Ming-Image-0.1-Design」をオープンソース化
AntLingは、6BのMing-Image-0.1-Designおよび6BのMing-Image-0.1-Design-LayerモデルからなるMing-Image-0.1-Designモデルファミリーをオープンソース化しました。UI/UXタスク専用に設計されたこのベースモデルは、現在Artificial AnalysisのUI/UXデザインリーダーボードのオープンウェイトモデル部門で1位にランクされています。今回のリリースには、「Ling UI Design Skill」と「Image-to-Editable-PPT Skill」という2つのオープンソースエージェントスキルも含まれています。
- • AntLingは6BパラメータのMing-Image-0.1-DesignおよびMing-Image-0.1-Design-Layerモデルをオープンソース化しました。
- • このリリースには、「Ling UI Design Skill」と「Image-to-Editable-PPT Skill」という2つのオープンソースエージェントスキルが含まれています。
- • Ming-Image-0.1-Designは、Artificial AnalysisのUI/UXデザインリーダーボードのオープンウェイトモデル部門で1位にランクされています。
開発者は、UIデザインや編集可能なプレゼンテーションの生成に特化して調整された、トップランクのオープンウェイトモデルをセルフホストできるようになります。
6. StepFunが単語誤り率1.7%のStepAudio 3 ASRをリリース
StepFunは、APIを通じて利用可能な新しい非ストリーミング音声認識(Speech to Text)モデル「StepAudio 3 ASR」をリリースしました。このモデルはAA-WER Indexで1.7%の単語誤り率(WER)を達成し、AlibabaのFun-Realtime-ASR-previewと並んで1位となり、StepAudio 2.5の4.7%のWERから大幅な改善を示しました。しかし、リアルタイム速度の88倍という速度は、MAI-Transcribe-2(374倍)のようなより高速な代替手段に遅れをとっており、価格は1時間あたり0.40ドルとプレミアムな設定になっています。
- • StepFunは、API経由で利用可能な非ストリーミング音声認識モデル「StepAudio 3 ASR」をリリースしました。
- • このモデルはAA-WER Indexで1.7%の単語誤り率(WER)を達成し、AlibabaのFun-Realtime-ASR-previewと並びました。
- • StepAudio 3 ASRの文字起こし速度はリアルタイムの88倍で、MAI-Transcribe-2(374倍)やGrok Voice Transcribe 2.0(154倍)などの競合に遅れをとっています。
- • 価格は1時間あたり0.40ドル(1,000分あたり6.67ドル)で、最も正確な5つのモデルの中で最も高価です。
音声機能を構築する開発者は、非常に正確な音声認識オプションを手に入れることができますが、その高コストと高速な代替トランスコーダーを比較検討する必要があります。
7. Qwen-Image 2.1、画像生成に9Bプロンプト書き換えモデルを採用
Qwen-Image 2.1は、画像を生成する前にユーザーのリクエストを拡張するために9Bパラメータのプロンプト書き換えモデルを利用します。この書き換えモデルはbf16形式で20GBのメモリを必要とし、1,700語のシステムプロンプトを使用し、回答を出力する前に約1,600トークンの「思考」を行います。リソースが制限された環境向けに、ノートPCでの実行を可能にする圧縮された0.8Bパラメータバージョンもリリースされています。
- • Qwen-Image 2.1は、画像を生成する前にユーザーのリクエストを拡張するために9Bパラメータのプロンプト書き換えモデルを利用します。
- • 9Bのプロンプト書き換えモデルはbf16形式で20GBのメモリを必要とし、1,700語のシステムプロンプトを使用します。
- • 書き換えモデルは回答を生成する前に約1,600トークン分思考します。
- • ノートPCで実行可能な圧縮された0.8Bパラメータバージョンのモデルが利用可能です。
Qwen-Image 2.1のプロンプト拡張アーキテクチャを理解することで、開発者は画像生成パイプラインとハードウェア要件を最適化できます。
8. AWSがStrandsフレームワークを新しいAgent Harnessに統合
6月のStrands Agentsフレームワークのオープンソースリリースに続き、AWSはStrands Agent Harnessを立ち上げました。この新しいサービスは、フレームワークを管理されたすぐに使える環境へと移行させるもので、ウェブ検索、コマンド実行、ファイル編集、タスク委任機能が組み込まれており、開発者はLLMを提供するだけでエージェントをデプロイできます。
- • AWSは、オープンソースのStrands Agentsフレームワークの進化版であるStrands Agent Harnessを立ち上げました。
- • このハーネスは、ウェブ検索、コマンド実行、ファイル編集のためのすぐに使える環境を提供します。
- • メモリ機能とヘルパーエージェントへのタスク委任機能が組み込まれています。
- • 開発者は、実行を開始するために基盤となるLLMを提供するだけで済みます。
開発者は、確立されたStrandsフレームワークを完全に管理されたAWS環境内で活用できるようになり、ツール実行と委任機能が組み込まれたエージェントワークフローのデプロイが簡素化されます。
9. DigitalOceanがManaged Agentsをパブリックプレビューで開始
DigitalOceanはManaged Agentsをパブリックプレビューで開始しました。これは、Claude Code、Codex、またはカスタムLangGraphワークフローのような自律型エージェントを実行するために特別に設計されたサーバーレスランタイム環境を提供します。このサービスは75以上のオープンおよびプロプライエタリモデルをサポートし、請求を統合し、エージェントツールに対して単一の管理されたエンドポイントを提供します。インフラストラクチャコストを最適化するため、管理されたランタイムはエージェントがアイドル状態になると自動的に一時停止します。
- • DigitalOcean Managed Agentsがパブリックプレビューに入りました。
- • このサービスは、Claude Code、Codex、またはカスタムLangGraphエージェントを、アイドル時に一時停止するランタイム環境で実行します。
- • 75以上のオープンおよびプロプライエタリモデルをサポートしています。
- • このプラットフォームは、エージェントツールに対して単一の管理されたエンドポイントを提供し、請求を統合します。
開発者は、アイドル時に自動的に一時停止してコストを節約する、安全で管理された環境で自律型エージェントをデプロイおよび実行できます。
10. RabbitがBYOKモデルを採用したエージェント型OS「OS3」をリリース
Rabbitは、同社のR1ハードウェア(製造終了)を必要とせず、Windows、Mac、Linuxデバイスで動作するように設計されたエージェント型オペレーティングシステム「OS3」を発表しました。OS3は「Bring Your Own Key」(BYOK)モデルで動作し、ユーザーはOpenAIやAnthropicなどのプロバイダーから独自のAPIキーを統合できます。このシステムはユーザーのPC上でローカルエージェントノードを実行してソフトウェアタスクの実行、コード作成、デバッグを行い、必要なファイル、アプリ、モデルを自動的に調整します。
- • Rabbitは、Windows、Mac、Linux、およびR1ガジェットで動作するエージェント型オペレーティングシステム「OS3」を発表しました。
- • OS3は「Bring Your Own Key」(BYOK)モデルを使用しており、ユーザーはOpenAIやAnthropicの独自のAPIキーを提供できます。
- • このプラットフォームは、ホストマシン上のローカルエージェントノードを使用してソフトウェアタスクの実行、コード作成、デバッグを行います。
- • RabbitはR1ハードウェアの製造を終了しており、今後数ヶ月以内に「バイブコーディング」用の「Cyberdeck」デバイスをリリースする予定です。
開発者やパワーユーザーは、独自のAPIキーを使用してソフトウェアタスクの実行やコード作成を行うローカルエージェントノードを実行できます。
11. Firecrawlが7500万ドルを調達し、Alexandriaクラウドサービスを開始
ウェブスクレイピングスタートアップのFirecrawlは、Smash Venturesが主導するシリーズB資金調達ラウンドで7500万ドルを調達しました。資金調達と併せて、Firecrawlはウェブスクレイピングデータと、科学論文の要約やコードファイルを含むサードパーティおよびキュレーションされたデータセットを統合する新しいクラウドサービス「Alexandria」を開始しました。Alexandriaはこのデータを単一のAPIを通じて公開するため、開発者はカスタムコネクタを構築する必要がなく、スマートウェイトや自動フォーム送信といったFirecrawlのエージェント最適化されたスクレイピング機能を活用できます。
- • FirecrawlはSmash Venturesが主導するシリーズB資金調達ラウンドで7500万ドルを調達しました。
- • このプラットフォームは、スマートウェイトや自動ユーザーアクション(スクロール、クリック)を備えた、AIエージェント向けに最適化されたウェブスクレイピングツールを提供します。
- • Firecrawlは、ウェブデータとサードパーティおよびキュレーションされたデータセット(科学論文の要約、コードファイル)を統合する新しいクラウドサービス「Alexandria」を開始しました。
- • Alexandriaは単一のAPIを通じてデータを提供し、カスタムコネクタの構築を不要にします。
AIエージェントを構築する開発者は、より堅牢で資金力のあるスクレイピングプラットフォームと、ウェブデータに加えてキュレーションされたコードや科学データセットにアクセスするための統合APIを利用できるようになります。
12. Jev Catalogが意思決定モデル向けのツールと統合をキュレーション
Jevは、自由形式のテキストを生成するのではなく、オプションの選択、イエス/ノーの確率の提供、またはスケール上でのアイテムのスコアリングによってデータクエリに回答するように設計された専門ツールです。Jevを統合するために、開発者はtypesafe-sdk APIキーで構成された公式のJavaScript、TypeScript、またはPython SDKを使用します。ブラウザ自動化やコーディングエージェントサポートのためのツールを含む、レビュー済みの36プロジェクトのキュレーションカタログが4時間ごとに更新され、コミュニティの統合事例を紹介しています。
- • Jevは、テキストを生成する代わりに、オプションの選択、イエス/ノーの確率の提供、またはアイテムのスコアリングによって質問に回答するツールです。
- • このプロジェクトにはtypesafe-sdkとTYPESAFE_API_KEYが必要です。
- • 公式サポートはJavaScript、TypeScript、Python SDKを通じて提供されます。
- • キュレーションカタログには、ブラウザ自動化、コーディングエージェントサポート、ゲームなどの36のピックアップが含まれています。
開発者は、構造化された意思決定モデルを中心に構築された36のプロジェクトと統合のキュレーションカタログを探索できます。
13. エージェント型LLMを使用したRustコードパフォーマンスの最適化
ある開発者が、エージェント型LLMを使用してRustコードを反復的に最適化し、2倍から20倍のパフォーマンス向上を達成するための非常に効果的な方法を文書化しました。このワークフローは、構造化された「Ur-Prompt」と、AGENTS.mdファイルで定義された一連のルールに依存しており、LLMがcriterionクレートを使用したベンチマークを行う際に不正行為を防ぐようガイドします。このプロセスではGPT-5.6 Lunaサブエージェントを使用して最適化の仮説を探索し、パフォーマンスを低下させることなくソースコード行数を少なくとも20%削減するリファクタリングステップが含まれています。
- • 著者は、LLMがRustコードのベンチマークと最適化を行うための「Ur-Prompt」とAGENTS.md内のルールを開発しました。
- • このプロセスにより、さまざまなドメインで2倍から20倍のパフォーマンス向上が達成されました。
- • ベンチマークはcriterionクレートを使用して実行され、安全でないコードや並列実行を禁止する制約があります。
- • ワークフローはGPT-5.6 Lunaサブエージェントを使用して最適化の仮説を探索し、ソースコード行数を20%削減するリファクタリングステップを含みます。
- • GPT-6 Astraのような最近のフロンティアモデルは、アルゴリズムの再実装を見つけることで、さらに2倍から3倍の速度向上を実現できることを示しました。
開発者は、構造化されたプロンプトルールとサブエージェントワークフローを採用することで、ローカルコードベースのベンチマークと最適化を自動化できます。
14. Artificial AnalysisがSpeech Arenaを拡充、多言語サポートと発音ベンチマークを追加
Artificial Analysisは、Controlled Voice Arenaを拡充し、9つの新しい言語(日本語、北京語、ヒンディー語、スペイン語、ドイツ語、フランス語、ポルトガル語、ベトナム語、アラビア語)を追加し、発音堅牢性ベンチマークを導入しました。この更新は、以前は英語やその他の主要言語でのモデルパフォーマンスを追跡していた同社の既存のSpeech Arenaを基盤としています。新しいベンチマークは、454の難解な文章でTTSモデルを評価し、現在Google Gemini 3.1 Flash TTSが88.1%の精度でリードしています。同プラットフォームでトップパフォーマーとして注目されていたCartesiaのSonic 3.6は、新たに追加された9言語のうち7言語でリードしています。
- • Artificial Analysisは、日本語、北京語、アラビア語を含む9つの言語をControlled Voice Arenaに追加しました。
- • 新しい発音堅牢性ベンチマークは、454の文章全体でTTSの精度を評価します。
- • Google Gemini 3.1 Flash TTSが88.1%の精度で新しい発音ベンチマークをリードしています。
- • CartesiaのSonic 3.6が、新たに追加された9言語のうち7言語で1位にランクされています。
- • Kokoro 82M v1.0は、1秒あたり242文字というテストされた中で最速のモデルですが、発音堅牢性では55.5%のスコアでした。
開発者は、拡張された言語サポートと特定の発音精度指標を使用してグローバルアプリケーション向けのTTSモデルを評価できるようになり、既存のArtificial Analysisベンチマークスイートの有用性が広がりました。
15. Jevクラスモデルの評価を標準化する「JevBench」がリリース
構造化された意思決定のために設計された専門システムであるJevクラスモデルのエコシステムが成長し続ける中、開発者はJevBenchをリリースしました。このオープンソースベンチマークツールは、534の英語の意思決定からなる再現可能なハーネスを提供し、さまざまなJevスタイル実装全体で知能、キャリブレーション、速度、コストの標準化された評価を可能にします。
- • JevBenchは、Jevクラスモデルを評価するための標準化されたオープンソースハーネスを提供します。
- • このツールは、534の英語の意思決定タスク全体で精度、キャリブレーション、レイテンシ、コストを測定します。
- • このリリースは、商用、オープンソース、DIY実装を含む、Jevスタイルモデルの成長するエコシステムをサポートします。
- • ハーネス、アーティファクト、スコアリングコードはGitHubで入手可能です。
標準化されたベンチマークにより、開発者はさまざまなJevクラスモデルやDIY実装のパフォーマンスを比較でき、構造化された意思決定タスクのためのより良い選択と最適化が促進されます。
16. TypeSafe AIがif文最適化のためのJev2およびSemIfモデルをリリース
9月16日のJevフレームワークの立ち上げに続き、TypeSafe AIはif-then意思決定を合理化するために特別に設計された2つの新しいモデル「Jev2」および「SemIf」を導入しました。これらのモデルは元のJevアーキテクチャを基盤としており、テストにおいて99%のコスト削減と47%から80%以上への精度向上を示し、AI駆動の条件付きロジックの経済性をさらに洗練させています。
- • Jev2とSemIfは、if-then意思決定を最適化するために設計された新しいモデルです。
- • これらのモデルは、9月16日の初期Jevフレームワークの立ち上げに続くものです。
- • テストでは99%のコスト削減と、精度が47%から80%以上に向上したことが示されています。
- • これらのモデルは、AI生産システムの経済性をさらに変革することを目指しています。
これらの更新により、開発者は複雑な条件付きロジックを置き換えるためのより専門的で効率的なツールを利用できるようになり、元のJevリリースと比較してAPIコストが大幅に削減されます。
17. オープンソースのルートレスLinuxサンドボックス「Drop」がgVisorサポートを追加
Dropは、サードパーティのプログラムを分離された環境で実行するために設計されたオープンソースのルートレスLinuxサンドボックスであり、信頼できないLLM生成コードを実行する開発者にとって非常に有用です。このツールはLinux名前空間を活用して分離を強制し、書き込み可能で使い捨てのホームディレクトリを提供しつつ、設定ファイルを読み取り専用としてマウントします。最新のアップデートでは、オプションのgVisorユーザー空間カーネルサポートが導入され、ルート権限を必要とせずにホストカーネルの脆弱性に対する保護が強化されました。
- • Dropは、サードパーティのプログラムを分離された環境で実行するために設計されたルートレスLinuxサンドボックスです。
- • このツールはLinux名前空間(ユーザー、マウント、ネットワーク、PID、IPC、cgroup)を使用して分離を強制します。
- • 書き込み可能で使い捨てのホームディレクトリを提供し、設定ファイルを読み取り専用でマウントします。
- • 最新のアップデートでは、ホストカーネルの脆弱性から保護するためにオプションのgVisorユーザー空間カーネルサポートが追加されました。
エージェントランタイムを構築したり、信頼できないLLM生成コードを実行したりする開発者は、ルート権限を必要とせずにDropを使用してホストシステムを保護できます。
18. Cisco TalosがAI統合型マルウェアを分析するCAIRNフレームワークをリリース
Cisco Talosは、AI統合型マルウェアを分類および分析するための「Cognitive Artifact Intelligence Research Network(CAIRN)」と呼ばれるオープンソースフレームワークをリリースしました。CAIRNを使用して、研究者は4つのLLM(DeepSeek、Qwen、Mistral、Google Gemini)をポーリングすることで自律的に行動を決定する、Windowsの認証情報および暗号資産を盗むマルウェア「CLOSEDQUORUM」を特定しました。このリリースは、以前文書化されたHugging Face経由でQwen2.5-Coderと通信するLAMEHUGマルウェアのように、攻撃者がLLM APIを運用化する傾向が高まっていることを強調しています。
- • Cisco Talosは、AI統合型マルウェアを分類および分析するためのオープンソースのCognitive Artifact Intelligence Research Network(CAIRN)フレームワークをリリースしました。
- • 研究者はCAIRNを使用して、DeepSeek、Qwen、Mistral、Geminiを自律的にポーリングして行動を決定するWindowsマルウェア「CLOSEDQUORUM」を特定しました。
- • CLOSEDQUORUMは、ログイン認証情報と暗号資産を盗むように設計されています。
- • 2025年7月、Hugging Face API経由でQwen2.5-Coder-32B-Instructと通信するLAMEHUGマルウェアを使用したフィッシングキャンペーンが発見されました。
開発者やセキュリティチームは、CAIRNを使用して、攻撃を調整するためにLLM APIを使用するマルウェアなど、新たなAI駆動の脅威を分析できます。
19. オンプレミスでのペネトレーションテスト用オープンウェイトモデル「Aikido Altar」がリリース
Aikido Altarは、Aikido Machineのペネトレーションテスト機能を強化するために設計されたオープンウェイトAIモデルとしてリリースされました。主権セキュリティのために特別に構築されたこのモデルは、顧客自身のローカルインフラストラクチャ内で完全に実行されるため、開発者は機密コードやネットワークデータを外部のクラウドAPIにさらすことなく、自動化されたセキュリティテストを実行できます。
- • Aikido Altarは、Aikido Machineのペネトレーションテスト機能を向上させるために設計されたオープンウェイトAIモデルです。
- • このモデルは、顧客自身のインフラストラクチャ内で完全に動作するように構築されています。
セキュリティ意識の高い開発者は、機密データを外部APIに送信することなく、専門的なペネトレーションテストモデルをローカルにデプロイしてインフラストラクチャをスキャンできます。
20. Unsloth StudioでQwen Image 2.1 Fast FP8がサポート
ユーザーは、Unsloth Studioを使用して10GB未満のVRAMでQwen Image 2.1 (Fast FP8)モデルをローカルで実行することに成功したと報告しています。この高性能で低メモリの画像生成オプションにアクセスするには、Unsloth Studioを最新バージョンに更新することをお勧めします。
- • Qwen Image 2.1 (Fast FP8)は、Unsloth Studio上で10GB未満のVRAMで実行可能です。
- • このモデルは、高性能でプレミアム品質の画像を生成します。
- • ユーザーは最新のモデルオプションにアクセスするためにUnsloth Studioを更新する必要があります。
開発者は、低いメモリ要件でコンシューマーGPU上で高品質な画像生成をローカルで実行できます。
21. K2-HorizonモデルのGGUF量子化版が利用可能に
9月3日のK2-Horizonオープンウェイトモデルファミリーの立ち上げを基盤として、量子化されたGGUFバージョンがHugging Faceで利用可能になりました。0.9Bから36BのMoVAモデルまで及ぶこれらのバージョンはローカル実行を可能にしますが、公式サポートが保留中のため、現在はllama.cppの特定のフォークが必要です。
- • K2-Horizonモデルシリーズの量子化されたGGUFバージョンがHugging Faceで利用可能になりました。
- • サポートされているモデルには、K2-Horizon-MoVA-36B、32B、7B、3.7B、0.9Bが含まれます。
- • ローカル実行にはllama.cppの特定のフォークが必要であり、公式サポートは現在進行中です。
この更新により、開発者はコンシューマーハードウェア上でK2-Horizonモデルをローカルで実行できるようになり、モデルウェイトの初期リリースが拡張されました。
22. GGUFファイルを最適化する「Dynamic Quantiser」ツール
Dynamic Quantiserは、ローカルモデルのカスタムで高品質なGGUF量子化を作成するために設計された新しいオープンソースツールです。Dinkelbachのアルゴリズムと分離可能なラグランジュ内部ループを使用してモデル全体のコサイン偏差を最小化することで、各テンソルの最適な量子化レベルを決定します。純粋なテキストタスクではUnsloth dynamic 3.0よりもパフォーマンスが劣りますが、標準のK-quantsよりも正確であると報告されています。
- • Dynamic Quantiserは、カスタムGGUF量子化を作成するためのオープンソースのGitHubリポジトリです。
- • このツールは、Dinkelbachのアルゴリズムを使用してモデル全体のコサイン偏差を最小化し、モデルの精度を向上させます。
- • 動的量子化、コサイン偏差最小化、ディスクサイズ最小化の3つのアルゴリズムを提供します。
- • このツールは標準のK-quantsよりも正確ですが、純粋なテキストタスクではUnsloth dynamic 3.0よりもパフォーマンスが劣ります。
- • 初期のテーブル構築には、Ryzen 5 3600プロセッサで27Bモデルの場合、約25分かかります。
ローカルモデルを実行する開発者は、標準のK-quantsを上回る非常に正確なカスタム量子化を生成できます。