Inference Brew

Alibabaがオープンウェイトモデル「Qwen3.8-27B」をリリース

00:00 / --:--

← ホームへ戻る

Alibabaがオープンウェイトモデル「Qwen3.8-27B」をリリース

1. Alibabaがオープンウェイトモデル「Qwen3.8-27B」をリリース

Alibabaは、Qwen3.8-27Bモデルのオープンウェイト版をリリースするという約束を果たしました。今回のリリースは、先行して公開されたQwen3.8-Maxモデルに続くもので、コンシューマー向けハードウェアに最適化された高性能なマルチモーダルモデルを開発者に提供します。

  • • Alibabaは270億パラメータのQwen3.8-27BモデルをHugging FaceにてApache 2.0ライセンスで公開しました。
  • • 本モデルは、ネイティブな画像・動画理解機能、262,144トークンのコンテキストウィンドウ、強力なエージェント機能を備えています。
  • • SWE-bench Proで61.7、LiveCodeBench v6で90.3のスコアを記録しました。
  • • 4bit量子化での実行には約17GBのGPUメモリが必要であり、ハイエンドなコンシューマー向けハードウェアと互換性があります。
  • • RTX 3090での最適化された推論では、グリーディモードで最大124トークン/秒を達成します。

開発者は、以前リリースされたフロンティアクラスのMaxモデルに加え、ローカル環境へのデプロイが可能なQwen3.8シリーズの27Bバリアントを利用できるようになりました。

2. Z.aiがGLM 5.3の価格、ベンチマーク、および新しい脆弱性スキャンサービス「OpenVuln」を発表

8月14日の推論モデル「GLM 5.3」の発表を受け、Z.aiは商用利用に関する詳細を公開しました。価格は入力100万トークンあたり1.40ドル、出力100万トークンあたり4.40ドルで、Artificial Analysis Intelligence Indexでは60のスコアを達成しています。さらに、GLM 5.3を使用してコードリポジトリのセキュリティ脆弱性をスキャンするサービス「OpenVuln」も開始しました。

  • • GLM 5.3の価格は、入力100万トークンあたり1.40ドル、出力100万トークンあたり4.40ドルです。
  • • 同モデルはArtificial Analysis Intelligence Indexで60を記録し、Kimi K3モデルと並びました。
  • • Z.aiはGLM 5.3を搭載したコード脆弱性スキャンサービス「OpenVuln」を立ち上げました。
  • • GLM 5.3のオープンウェイト版は、1週間以内にMITライセンスでリリースされる予定です。

開発者は、GLM 5.3を本番環境で利用するための明確な価格と性能データを得るとともに、セキュリティワークフロー向けの新しい専門ツールを利用できるようになりました。

3. OpenMOSSがリアルタイム動画理解モデル「MOSS-VL 11B」をリリース

OpenMOSSのMOSS-VLは、リアルタイムの動画理解を目的とした110億パラメータのオープンな視覚言語モデルです。このモデルは、ライブ映像を認識しながら音声応答を生成でき、能動的な沈黙や動的な自己修正機能を備えています。

  • • OpenMOSSは110億パラメータのオープンな視覚言語モデル「MOSS-VL」をリリースしました。
  • • 本モデルはリアルタイム動画理解のために設計されており、ライブ映像を認識しながら応答を生成します。
  • • 能動的な沈黙や動的な自己修正のための組み込み機能を備えています。

開発者は、能動的な沈黙や動的な自己修正をサポートするモデルを使用して、リアルタイムでインタラクティブな動画アプリケーションを構築できます。

SOURCES

4. オープンソース音声モデル「Confucius4-TTS」が大幅アップデート

オープンソースのConfucius4-TTSモデルは、音声品質と実用性の向上に焦点を当てた大幅なアップデートを受けました。新たに公開されたarXiv論文で詳細が説明されており、開発者にとって多言語および言語横断的な音声生成のための非常に強力なオープンソースの選択肢となります。

  • • 多言語および言語横断的な音声生成を行うオープンソースモデル「Confucius4-TTS」が大幅にアップデートされました。
  • • 今回のアップデートは、開発者向けの音声品質と実用性の向上に重点を置いています。
  • • モデルのアーキテクチャと機能の詳細を記した研究論文がarXivで公開されました。

音声対応アプリケーションを構築する開発者は、実用性が向上したアップグレード済みのオープンソース多言語テキスト読み上げモデルを活用できます。

SOURCES

5. Apple Silicon向けにQwen3.8-27Bの検閲なし版がリリース

Qwen3.8-27BがApple Siliconで利用可能になったことを受け、OrcaRouterは「Qwen3.8-27B-Uncensored-MLX」をリリースしました。この新しいバリアントは、Macハードウェアでのローカル推論用に量子化された、27Bアーキテクチャの検閲なしバージョンです。

  • • OrcaRouterは、高密度ハイブリッドアテンションモデル「Qwen3.8-27B-Uncensored-MLX」をリリースしました。
  • • 本モデルはApple Silicon向けに量子化されており、2bitから8bitのバージョンが利用可能です。
  • • これは、MacハードウェアにおけるベースモデルQwen3.8-27Bの投機的デコード(speculative decoding)サポートの導入に続くものです。

このリリースにより、Apple Silicon向けに最適化された標準のQwen3.8-27Bモデルの検閲なしの代替品が提供され、Macユーザー向けのローカルモデルエコシステムが拡大しました。

SOURCES

6. Crusoeのサーバーレスファインチューニングに「GLM-5.2」が追加

Crusoeは、サーバーレスファインチューニングサービスを拡張し、GLM-5.2のサポートを追加しました。この統合により、開発者はCrusoeのコスト最適化されたサーバーレスインフラを活用して、100万トークンのコンテキストを扱うコーディングおよびエージェントモデルのファインチューニングとデプロイが可能になります。

  • • GLM-5.2がCrusoeでのサーバーレスファインチューニングおよびセルフサービスデプロイに対応しました。
  • • この統合により、アイドルGPU料金を排除することで、100万コンテキストモデルのコスト効率の高いカスタマイズが可能になります。
  • • CrusoeのファインチューニングサービスとGLM-5.2オープンウェイトモデルという、これまで独立していたリソースが統合されました。

このアップデートにより、開発者はGLM-5.2の長大な推論能力とCrusoeのサーバーレスファインチューニングのコスト効率を組み合わせることができ、モデルカスタマイズ中のアイドルGPU時間の料金を支払う必要がなくなります。

SOURCES

7. P2Pエージェントネットワーキングのための「SAM (Sovereign Agent Mesh)」がリリース

SAM (Sovereign Agent Mesh) は、自律型AIエージェントがModel Context Protocol (MCP) を介してツールを共有するための、分散型ゼロトラストP2Pネットワークを提供します。このプロジェクトは、オフライン認証にOIDCとBiscuit Datalogトークンを使用し、APIキーを公開することなく安全なツール共有を保証します。

  • • SAM (Sovereign Agent Mesh) は、自律型AIエージェント向けのApache 2.0ライセンスのP2Pネットワーキングプロジェクトです。
  • • Model Context Protocol (MCP) を介したエージェント間のツール共有のための、ゼロコンフィグ・ゼロトラストP2Pオーバーレイを提供します。
  • • アーキテクチャはID管理にOIDCを使用し、クレームをBiscuit Datalogトークンに変換してオフライン認証を可能にします。
  • • セキュアなアウトバウンドゲートウェイがトラフィックを傍受して認証情報を注入するため、実際のAPIキーがエージェントのサンドボックスに露出することはありません。
  • • パブリックメッシュは現在ベータテストネット段階であり、本番環境ではコントロールプレーンのセルフホストが推奨されます。

開発者は、エージェントが暗号化トークンを使用してオフラインで安全にツールを共有し、リクエストを承認できる、安全で分散化されたマルチエージェントネットワークを構築できます。

SOURCES

8. Blockがローカルエージェントワークスペース「Berd」をオープンソース化

BlockのBerdは、AIエージェントを管理するためのモデル非依存型ワークスペースを提供するオープンソースのローカルデスクトップアプリケーションです。このアプリケーションはAgent Client Protocolを使用してGooseフレームワークと通信し、会話履歴をローカルに、認証情報をOSのキーチェーンに保存します。

  • • Blockは、AIエージェントを操作するためのローカルインストール型グラフィカルデスクトップアプリケーション「Berd」をオープンソース化しました。
  • • 本アプリケーションはGitHubにてApache 2.0ライセンスで公開されており、macOS、Windows、Linuxで利用可能です。
  • • BerdはAgent Client Protocol (ACP) を使用してGooseエージェントフレームワークと通信します。
  • • モデル非依存であり、ユーザーは好みのAIプロバイダーやエージェントハーネスを設定できます。
  • • データモデルはローカルファーストで、会話履歴はデバイス上に、認証情報はOSのキーチェーンに保存されます。

開発者は、さまざまなモデルやフレームワーク間でエージェントを設定、実行、テストするための、ローカルファーストでカスタマイズ可能なグラフィカルインターフェースを利用できます。

SOURCES

9. NVIDIAが「TensorRT Model Connect」のパブリックプレビューをリリース

NVIDIAのTensorRT Model Connect (TRTMC) は、Hugging FaceチェックポイントのネイティブC++ TensorRT推論へのデプロイを簡素化します。このツールは、中間的なONNXエクスポートやPyTorchランタイムの依存関係をバイパスし、高度に最適化されたアーティファクトをわずか2つのコマンドで生成します。

  • • NVIDIAはTensorRT Model Connect (TRTMC) をApache 2.0ライセンスでパブリックプレビューとしてリリースしました。
  • • このツールは、Hugging Faceやローカルのチェックポイントを、2つのコマンドでエンドツーエンドのTensorRT推論に変換します。
  • • 中間的なONNXエクスポートステップを排除し、ネイティブC++タスクAPIを介して実行されるバージョン管理されたアーティファクトを生成します。
  • • 現在のリリースホイールはLinux aarch64に限定されており、x86_64プラットフォームではDockerソースビルドパスを使用する必要があります。
  • • 7月29日のスナップショットでは、102のプロファイル全体で5%以上のパフォーマンス向上が実証されました。

開発者は、中間的なONNXエクスポートを回避し、PyTorchのオーバーヘッドなしで、高度に最適化されたTensorRTモデルをネイティブC++ランタイムに直接デプロイできます。

SOURCES

10. Artificial AnalysisがAIエージェント向け検索インデックスを立ち上げ

Artificial AnalysisのSearch Indexは、AIエージェントワークフロー内での検索APIパフォーマンスを評価するための標準化されたベンチマークを提供します。Stirrupエージェントハーネスを使用してExaやFirecrawlなどのプロバイダーをテストすることで、開発者が検索品質、レイテンシ、モデルトークンコストのバランスを取るのを支援します。

  • • Artificial Analysisは、AIエージェント利用向けの検索APIプロバイダーをベンチマークする「Search Index」を立ち上げました。
  • • 初期の対象には、Parallel、Exa、Firecrawl、You.com、Tavily、Keenable、Braveが含まれます。
  • • 立ち上げ時点で、Parallel、Exa、Firecrawlが最高のSearch Indexスコア(それぞれ75、74、73)を獲得しました。
  • • 検索APIを統合することで、モデルのみのベースライン(スコア33)と比較して、エージェントのベンチマークパフォーマンスが65〜75に向上しました。
  • • 検索結果の品質向上により、モデルトークンの使用量が40%以上削減され、タスク全体のコストが低下しましたが、検索統合によりタスクごとのレイテンシは増加しました。

開発者は、エージェントワークフローに最適な検索APIを選択することで、検索品質を最大化し、モデルトークンコストを最大40%削減できます。

SOURCES

11. machine0が永続的なエージェントコンピューティングVM向けCLIをリリース

machine0は、長期間のAIエージェントコンピューティング専用に設計された永続的なクラウドVMを管理するためのCLIツールを提供します。このサービスは、直接GPUサポートを備えたフルKVM仮想マシンを提供し、エージェントがプログラムによって独自のコンピューティングリソースを起動、スナップショット作成、破棄できるようにします。

  • • machine0は、長期間のAIエージェントコンピューティング向けに設計された永続的なクラウドVMを管理するCLIツールをリリースしました。
  • • このサービスは99.99%の稼働率を誇るフルKVM仮想マシンを提供し、1時間あたり0.013ドルからの分単位課金となります。
  • • ハードウェア構成は1 vCPUから最大8xH200 GPUまで、永続ブロックストレージは最大16TBまで対応しています。
  • • エージェントはCLIまたはMCPを使用して、独自のコンピューティングリソースをセルフサービスで起動、スナップショット作成、破棄できます。

開発者は、AIエージェントが直接GPUサポートを備えたフルKVM仮想マシンをプログラムによって起動、スナップショット作成、破棄できるようにすることができます。

SOURCES

12. Nous ResearchがHermes Agentにマルチエージェント「Bot Mode」を追加

Nous Researchは、Hermes Agent (v0.20.3) を拡張し、新しい「Bot Mode」を追加しました。これにより、開発者は以前Profile Builderで導入された個別のエージェントプロファイルの管理から、名前付きのローカルボットのリストを編成する段階へ移行できます。このアップデートにより、ボットは永続的なAgent Inboxを使用して2〜6人のグループチャットで対話できるようになり、新しいストレージ層を必要とせずにエージェントの既存のメモリおよびスキルプリミティブを活用できます。

  • • Nous Researchは、オープンソースのHermes Agent v0.20.3で「Bot Mode」をリリースしました。
  • • Bot Modeは、ユーザーが名前付きエージェントプロファイルをリストにグループ化できるようにすることで、マルチエージェントの協調を可能にします。
  • • ボットは永続的なAgent Inboxを介してローカルで通信し、2〜6エージェントのグループチャットをサポートします。
  • • この機能は既存のHermesプロファイルプリミティブを活用し、各ボットの個別のメモリ、スキル、モデル設定を維持します。
  • • このツールは個人開発者や小規模チーム向けに設計されており、エンタープライズグレードの機能よりもローカル実行に重点を置いています。

このアップデートにより、Hermes Agentは単一エージェントツールから協調的なマルチエージェントシステムへと進化し、開発者は新しいストレージインフラを必要とせずに、ローカルでプロファイルベースのエージェントチームをデプロイできるようになります。

SOURCES

13. Warpがエージェントエコシステムに永続メモリを追加

今月初めにリリースされたWarp Agent CLIに基づき、WarpはAIエージェント向けの永続メモリ機能を導入しました。このアップデートにより、エージェントは異なるハーネス、マシン、チームメンバー間で状態とコンテキストを維持できるようになり、協調的で長期的なエージェントワークフローのニーズに対応します。リサーチプレビューには、組み込みの来歴追跡(provenance tracking)と構成可能なアクセス制御が含まれています。

  • • Warpは、AIエージェント向けの永続メモリ機能をリサーチプレビューとして導入しました。
  • • この機能はWarp Agent CLIエコシステムに基づいており、ステートフルで協調的なワークフローを可能にします。
  • • メモリはエージェントハーネス、マシン、チームメイト間で共有されます。
  • • 組み込みの来歴追跡と構成可能なアクセス制御が含まれています。

この開発により、エージェントがセッションやチームメンバー間でコンテキストを保持できるようになり、より複雑で協調的な自動化が促進され、Warp Agent CLIの機能が拡張されます。

SOURCES

14. WarpがAIソフトウェア開発のための「Warp Factories」を導入

Warp Factoriesは、AIソフトウェアファクトリーの作成を簡素化するために設計された、構築済みのインフラシステムを開発者に提供します。このシステムは、自動化されたAI開発パイプラインのデプロイとスケーリングを合理化し、カスタムエージェント環境を構築するために必要なエンジニアリングのオーバーヘッドを削減することを目的としています。

  • • Warpは、AI開発のための新しいインフラシステム「Warp Factories」を導入しました。
  • • このシステムは、AIソフトウェアファクトリーの構築プロセスを簡素化するように設計されています。
  • • AI駆動のソフトウェア作成を合理化するための、すぐに使えるインフラを提供します。

開発者は、構築済みのインフラを活用して、AI駆動のソフトウェア開発パイプラインを自動化およびスケーリングできます。

SOURCES

15. Atlas Cloudがマルチモデルテストのための「Creator Central」を立ち上げ

Atlas CloudのCreator Centralプラットフォームは、開発者が複数のモデルで同時にプロンプトをテストできるようにすることで、モデル評価を簡素化します。プラットフォームのModel Explorerツールは、単一のプロンプトを最大10個のモデルで実行し、出力と設定を比較するプロセスを合理化します。

  • • Atlas Cloudは、開発者がAIモデルをテストおよび比較するのを支援するために「Creator Central」を立ち上げました。
  • • Model Explorerツールを使用すると、ユーザーは単一のプロンプトを最大10種類のモデルで同時に実行できます。
  • • プラットフォームには、特定のプロンプトや設定にアクセスして編集するためのGeneratorテンプレートワークフローが含まれています。
  • • Atlas Cloudは、Seedance 2.5モデルの値下げと、Wan3.0の近日リリースも発表しました。

開発者は、複数のタブやスプレッドシートを管理する代わりに、リアルタイムで出力を並べて比較することで、モデル評価プロセスを合理化できます。

SOURCES

16. HumanEvalsオープンソースライブラリがマルチモーダル評価に人間の判断を統合

HumanEvalsオープンソースライブラリは、マルチモーダルモデルの評価パイプラインへの人間によるフィードバックの統合を簡素化します。このライブラリは画像、動画、音声の出力をサポートしており、開発者は人間の参加者からペアごとの好み、評価、ランキングを迅速に収集できます。

  • • HumanEvalsは、マルチモーダルモデルの評価に人間の判断を統合するために設計されたオープンソースライブラリです。
  • • このライブラリは、モデルからの画像、動画、音声出力の評価をサポートしています。
  • • 開発者は、人間の参加者からペアごとの好み、評価、ランキングを数秒で取得できます。

開発者は、画像、動画、音声モデルの評価パイプラインに実際の人間によるフィードバックを簡単に追加して、アライメントを改善できます。

SOURCES

17. 複合LLMパイプラインにおける「ロールドリフト」に対抗するRole Anchorメソッド

Role Anchorメソッドは、専門モジュールが割り当てられたタスクを密かに放棄する、複合LLMパイプラインにおける「ロールドリフト」に対処します。モジュールを所定の役割に拘束することで、このメソッドは、システムレベルの精度向上が、モジュール同士が答えを教え合っている結果ではなく、本物であることを保証します。

  • • 複合LLMパイプラインは、システムレベルのメトリクスでは向上が見られるにもかかわらず、専門モジュールが割り当てられた役割を放棄する「ロールドリフト」に悩まされています。
  • • ある評価されたパイプラインでは、見かけ上の強化学習による向上の86%が、実際にはロールドリフトによって引き起こされていました。
  • • Role Anchorは、パイプライン内のモジュールを割り当てられた役割に拘束するように設計された新しいメソッドです。
  • • 開発者がシステムレベルのパフォーマンスメトリクスのみを監視している場合、ロールドリフトはしばしば目に見えません。

開発者は、専門的なパイプラインモジュールが密かに失敗したり不正を行ったりするのを防ぎ、システムレベルの精度向上が本物であることを保証できます。

SOURCES

18. llama.cppがTernaryモデル向けのCUDAおよびVulkanサポートをマージ

llama.cppへの最近のアップデートでは、Ternary-Bonsai-27BのCUDAおよびVulkanサポートが導入され、トークン生成速度を向上させるCUDA最適化も追加されました。これらのアップデートにより、高度に量子化された1bitおよびTernaryモデルをコンシューマーハードウェア上で効率的に実行できるようになります。

  • • Ternary-Bonsai-27BのCUDAおよびVulkanサポートがllama.cppのメインラインにマージされました。
  • • マージされたCUDA最適化PRにより、トークン生成が15〜40%、プロンプト処理が8%向上します。
  • • Maple-Preview 20B-A1Bモデルは、Mac Mini M4上で200トークン/秒以上を達成します。
  • • CPUベースのTernary量子化およびVNNI互換CPUの速度向上のために、いくつかのllama.cppプルリクエストが開かれています。

開発者は、高度に量子化された1bitおよびTernaryモデルを、コンシューマーハードウェア上で大幅な速度向上とともにローカルで実行できます。

SOURCES

19. llama.cppがLing-3.0モデルの公式サポートを追加

8月4日のLing-3.0-flashモデルウェイトのリリースに基づき、llama.cppプロジェクトはBailingMoE3アーキテクチャのサポートを正式に統合しました。このアップデートにより、開発者は最適化されたGGUF量子化を使用して、Ling-3.0-tinyおよびLing-3.0-flashモデルをローカルで実行できるようになります。

  • • Ling-3.0 (BailingMoE3) のサポートが、ビルドb10472からプルリクエスト#26608を介してllama.cppマスターブランチにマージされました。
  • • Bartowskiは、Ling-3.0-tiny (8B) およびLing-3.0-flash (127B) モデルのGGUF imatrix量子化をリリースしました。
  • • Intel Arc B580 GPU上でのLing-3.0-tiny-Q8_0のユーザーベンチマークでは、プロンプト処理で120.76トークン/秒を達成しました。
  • • 特定の構成フラグを使用することで、12GBのVRAMで128Kのコンテキストウィンドウを使用してモデルを実行できます。

開発者は、最適化されたGGUF量子化を使用してLing-3.0モデルファミリーをローカルでデプロイできるようになり、今月初めにリリースされたウェイトの有用性が拡大しました。

SOURCES

20. Anthropicが8月の新プロモーションでClaude Codeの使用制限を延長

Claude Codeの容量に関する以前の調整に続き、AnthropicはPro、Max、Team、およびレガシーEnterpriseプランの週次使用制限を自動的に50%引き上げる新しいプロモーションを導入しました。すべてのプラットフォームに適用されるこの引き上げは、2026年8月31日まで有効であり、以前のアップデートで提供された容量をさらに拡大します。

  • • Claude Codeの週次使用制限が50%引き上げられ、2026年8月31日まで有効です。
  • • Pro、Max、Team、およびレガシーEnterpriseプランに適用されます。
  • • CLI、IDE拡張機能、デスクトップ、およびWebプラットフォームをカバーします。
  • • 無料プランおよび従量課金制のEnterpriseシートは除外されます。

このプロモーションは、Claude Code向けに以前実装されたインフラと制限のアップデートに基づき、8月の残りの期間、開発者にコーディング容量の追加ブーストを提供します。

SOURCES

21. OpenRouterがOpenAIのGPT-5.6 Solの値下げを反映

8月17日のOpenAIによるGPT-5.6 Solモデルの標準API価格の50%引き下げを受け、OpenRouterはプラットフォームを更新し、バッチ、フレックス、優先ティア全体で同じ50%の割引を提供することにしました。これにより、OpenRouterのルーティングインフラを使用する開発者は、フラッグシップモデルの低コスト化の恩恵を即座に受けることができます。

  • • OpenRouterは、GPT-5.6 Solに対するOpenAIの50%の値下げに追随しました。
  • • 割引はOpenRouterのバッチ、フレックス、優先ティアに適用されます。
  • • これは8月17日に発表されたOpenAIの公式な値下げに続くものです。

このアップデートは、GPT-5.6 Solの業界全体での最近の値下げがサードパーティのアグリゲーター全体に反映されていることを確認するものであり、本番規模のエージェントワークフローのコストをさらに削減します。

SOURCES

22. Snowflake Cortex AI Gatewayが動的モデルルーティングを追加

Snowflakeは、AIエージェントに一元化されたガバナンスとセキュリティを提供するために7月に立ち上げられたCortex AI Gatewayの機能を拡張し、動的モデルルーティングを追加しました。このアップデートにより、ゲートウェイはアドバイザーパターンと過去のタスクデータを使用して、タスクを最もコスト効率の高いモデルに自動的に誘導できるようになり、セキュリティ境界を維持しながらトークンコストを最大3倍削減できる可能性があります。

  • • Snowflakeは、以前エージェントガバナンス向けに立ち上げられたCortex AI Gatewayに動的モデルルーティングを追加しました。
  • • 新しいルーティング機能は、アドバイザーパターンと過去のタスク分類を使用してモデル選択を最適化します。
  • • このアップデートにより、単純なタスクをより小さなモデルにオフロードすることで、トークンコストを最大3倍削減できます。
  • • サービスは顧客の地域的なセキュリティ境界内に留まり、追加料金なしで含まれています。
  • • ゲートウェイはDeepSeek-V4-FlashやGLM-5.3などのオープンモデルをサポートしています。

このアップデートは、ゲートウェイの既存のガバナンスフレームワークに基づいて自動化されたコスト最適化を追加し、開発者が単一のプラットフォーム内でセキュリティと推論費用の両方を管理できるようにします。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。