Inference Brew

Qwen3.8-27Bのオープンウェイト版がプレビューを経て公開

00:00 / --:--

← ホームへ戻る

Qwen3.8-27Bのオープンウェイト版がプレビューを経て公開

1. Qwen3.8-27Bのオープンウェイト版がプレビューを経て公開

8月5日に発表された27Bモデルの詳細に基づき、Qwenチームは「Qwen3.8-27B」のウェイトをApache 2.0ライセンスの下で公開しました。コーディングやオフィスワークフロー向けに最適化されたこのモデルは、画像と動画のネイティブな理解をサポートし、262Kのコンテキストウィンドウを備え、最大100万トークンまで拡張可能です。現在Hugging FaceおよびModelScopeで利用可能であり、UnslothがDynamic GGUFを介したローカル実行をサポートしています。

  • • Qwen3.8-27BがApache 2.0ライセンスの下でオープンウェイトとして利用可能になりました。
  • • ネイティブなマルチモーダル対応と262Kのコンテキストウィンドウを備え、最大100万トークンまで拡張可能です。
  • • Unslothが本モデルをサポートし、ローカル実行用のDynamic GGUFも提供されています。
  • • 今回のリリースは、8月5日に行われたモデル機能のプレビューに続くものです。

開発者は、Qwenチームが予告していた27Bマルチモーダルモデルにアクセスしてセルフホストできるようになり、複雑な推論や長文コンテキストタスクのためのローカルデプロイが可能になります。

2. Z.aiがGLM-5.2の後継モデル「GLM-5.3」を発表、コーディングとセキュリティ性能を強化

GLM-5.2のリリースに続き、Z.aiは7430億パラメータのポストトレーニング済みモデル「GLM-5.3」を投入しました。これは長期的なコーディングやサイバーセキュリティタスクにおいて大幅な性能向上を実現しています。前モデルと同じベースモデルを使用していますが、GLM-5.3ではすべてのAPI呼び出しにおいて推論トークンが必須となりました。現在Z.aiのAPI経由で利用可能であり、オープンウェイト版は2週間後に公開予定です。

  • • GLM-5.3は、743BのGLM-5.2ベースモデルをポストトレーニングした反復モデルです。
  • • Terminal-Bench 3.0で28.3、CyberGymで84.5%のスコアを達成しました。
  • • APIアクセスは現在利用可能で、オープンウェイト版は2週間後に公開予定です。
  • • 開発者はすべてのAPI呼び出しにおいて、必須の推論トークンに対応する必要があります。

このアップデートにより、開発者はより高性能なコーディングおよびセキュリティ特化型モデルを利用できるようになりますが、推論トークンが必須となったため、既存の統合環境の調整が必要となります。

3. Mistral OCR 4.1が一般提供を開始

Mistralは「OCR 4.1」をパブリックプレビューから一般提供へと移行しました。このモデルは、複雑なドキュメントレイアウトから構造化されたJSONやMarkdownをネイティブに抽出可能で、プレビュー段階で導入された構造解析機能を基盤として、本番環境での利用が可能になりました。

  • • Mistral OCR 4.1がパブリックプレビューを経て一般提供を開始しました。
  • • 複雑なドキュメントレイアウトを構造化されたJSONやMarkdownにネイティブ解析します。
  • • 段落レベルのバウンディングボックス抽出と構造ブロックラベル機能を備えています。
  • • RAGパイプライン向けのプロダクションレベルのドキュメント処理が可能になります。

開発者はプレビュー版のテストから移行し、信頼性の高い構造化ドキュメント解析のためにOCR 4.1を本番環境へデプロイできるようになりました。

SOURCES

4. Cursorがバックグラウンド環境準備機能を追加、エージェントの起動遅延を削減

エージェントのコンテキスト向けクラウド環境の最適化に向けた最近の取り組みに続き、Cursorはバックグラウンド環境準備機能を導入しました。このアップデートは特にコールドスタート時の遅延を対象としており、事前構築された環境と前回の成功したビルドを活用することで、エージェントの起動を3倍高速化します。

  • • Cursorは開発環境の無料バックグラウンド準備機能を提供します。
  • • エージェントは事前準備された環境で起動するため、応答時間が最大3倍高速化されます。
  • • エージェントは前回の成功したビルドを利用して作業の中断を防ぎます。
  • • バックグラウンドでデバッグタスクを実行している間も、開発者はアクティブなコーディングを継続できます。

この開発により、Cursorのクラウドベースエージェントの効率がさらに向上し、待ち時間が短縮され、開発中のマルチタスクがよりスムーズになります。

SOURCES

5. Claude Codeのトークンコストを最適化するためのベストプラクティスが公開

Claude Codeのターミナルセッションにおけるトークンコストを管理するための最適化ガイドラインが公開されました。Claude Codeはコストを抑えるためにプロンプトキャッシュに大きく依存しているため、セッション途中の設定変更を避けること、/clearや/compactといった組み込みコマンドを使用すること、bashの出力長を制限して不要なコンテキストの肥大化を防ぐことが推奨されています。

  • • Claude Codeセッションはトークン単位で課金され、プロンプトキャッシュは通常1時間で期限切れになります。
  • • セッション途中でモデルや努力レベルなどの設定を変更すると、プロンプトキャッシュが無効になります。
  • • タスク間で/clearを使用したり、/compactを使用して長い会話を要約し、コンテキストを解放したりできます。
  • • 最初の要求で@-mentionを使用してファイルを添付することで、冗長なReadツール呼び出しを防げます。
  • • BASH_MAX_OUTPUT_LENGTHを設定するか、quietフラグを使用することで、大規模なコマンド出力によるコンテキストの肥大化を防げます。
  • • サブエージェントを使用して、ノイズの多いタスクを別のコンテキストウィンドウに分離できます。

Claude Codeを使用する開発者は、ターミナルセッションを構成してプロンプトキャッシュを維持し、コマンド出力を制限することで、日々のAPIコストを即座に削減できます。

SOURCES

6. BlueskyがJetstream v2と再構築されたTypeScript SDKをリリース

Blueskyは開発者エコシステムを刷新し、「Bluesky Protocol Services」の立ち上げと「Jetstream v2」のリリースを行いました。更新されたデータストリーミングプロトコルは、ストリーム移行中のデータ欠落を防ぐ「Network Replay」機能を備えています。また、イベント処理と重複排除を簡素化するために、完全に型定義されたTypeScriptおよびGo SDKが新たに書き直されました。

  • • Blueskyは、docs.bsky.appに代わる新しいドキュメントハブ「Bluesky Protocol Services」を立ち上げました。
  • • Jetstream v2はNetwork Replayを導入し、開発者が履歴レコードにアクセスし、欠落なくライブストリームへ移行できるようにします。
  • • Jetstream v2のアーカイブ要求にはAPIトークンが必要ですが、ライブテールは認証なしで引き続き利用可能です。
  • • TypeScriptおよびGo用の新しいJetstream SDKは、イベントの再接続、重複排除、デコードを支援します。
  • • Bluesky TypeScript SDKは@atproto/lex上に再構築され、完全な型定義を提供し、レガシーコードパスを排除しました。

ソーシャルアプリやリアルタイムデータアプリを構築する開発者は、欠落のない履歴移行と完全に型定義されたTypeScript SDKを使用して、AT Protocolのファイアホースを消費できるようになります。

SOURCES

7. Mole:厳格な予算管理機能を備えたオープンソースのターミナルリサーチエージェント

自動化された深層リサーチにおけるAPIコストの暴走やデータプライバシーといった一般的な課題に対処するため、新しいオープンソースのターミナルツール「Mole」がリリースされました。ローカルで実行され、0%の予算超過ポリシーを厳格に強制することで、Moleは開発者が予期せぬ請求のリスクを負うことなく、さまざまなローカルまたはクラウドベースのLLM全体でリサーチタスクを安全に実行できるようにします。

  • • Moleは、ターミナルで直接実行するように設計された無料かつオープンソースの深層リサーチエージェントです。
  • • このツールは、0%の測定された超過率で厳格な予算を強制します。
  • • データをローカルで処理することでプライバシーを維持し、機密情報がマシンから決して流出しないようにします。
  • • エージェントによって生成されたすべての主張には、検証済みのソースが添付されます。
  • • Moleは、ローカルモデルやサブスクリプションベースのAPIを含む、ほとんどのLLMと互換性があります。

開発者は、厳格なコスト上限を設定してローカルで深層リサーチタスクを実行でき、データプライバシーを維持しながら予算超過をゼロに抑えることができます。

SOURCES

8. Mixedbreadがフロンティアモデルのコストを削減する検索エージェント「Toast 1」をリリース

Mixedbreadは、高価なフロンティアモデル向けのコンテキストキュレーションを最適化することを目的とした専門検索エージェント「Toast 1」を導入しました。クエリを分解し、GPT-5.6 Solのようなモデルに渡す前にソースを精査することで、Toast 1は回答の正確性を維持しながら、トークンの肥大化と運用コストを劇的に削減します。

  • • Toast 1は、クエリを分解し、証拠を収集し、フロンティアモデル向けのコンテキストをキュレートするように設計された専門検索エージェントです。
  • • このエージェントは、Claude Opus 5やGPT-5.6 Solに匹敵するかそれを上回る性能を持ちながら、最大10倍安く、12倍高速であると報告されています。
  • • ベンチマークでは、Toast 1は従来の一般的なエージェントと比較して、トークン使用量を3.5倍削減し、コストを60%以上削減しました。
  • • ローンチ価格は、入力トークン100万あたり0.30ドル、キャッシュされた入力トークン100万あたり0.036ドル、出力トークン100万あたり0.72ドルに設定されています。

開発者は、高価なフロンティアモデルにクエリを投げる際、API請求額を大幅に削減し、検索精度を向上させることができます。

SOURCES

9. GoogleがAI Studioに専用のエージェント管理UIを追加

Gemini Managed Agentsフレームワークを拡張し、GoogleはAI Studio内に専用のユーザーインターフェースタブをテストしています。このアップデートにより、開発者はGoogle Cloudプロジェクトに紐付いたCloud Agentsを設定・監視するための集中ダッシュボードを利用できるようになり、これまでAPIやCLI経由で処理されていたエンタープライズグレードのエージェントワークフローの管理が簡素化されます。

  • • GoogleはAI Studio内で新しいエージェント管理タブをテストしています。
  • • このUIは、Google Cloudプロジェクト内のCloud Agentsを管理するための集中インターフェースを提供します。
  • • このアップデートは既存のGemini Managed Agentsフレームワークに基づいており、APIベースの管理に代わる視覚的な選択肢を提供します。

このUIアップデートにより、開発者はプログラムインターフェースのみに頼ることなく、Google Cloudエコシステム内の複雑で非同期なエージェントワークフローをより簡単に管理できるようになります。

SOURCES

10. Googleが暗号化AI推論のためのHEIRコンパイラをリリース

Googleは、AIアプリケーションにおける準同型暗号化への参入障壁を下げることを目的としたオープンソースのコンパイラツールチェーン「HEIR」を立ち上げました。モデルをコンパイルして暗号化データ上で実行できるようにすることで、HEIRは開発者がサーバー上の計算サイクル全体を通じて機密ユーザーデータが完全に暗号化されたままとなる、安全な推論パイプラインをデプロイできるようにします。

  • • HEIRは、AI推論のための準同型暗号化を可能にするために設計されたオープンソースのコンパイラツールチェーンおよび開発プラットフォームです。
  • • このツールチェーンはGoogleのPrivate Computing Toolkitの一部であり、専門家以外でも暗号化推論を利用できるようにすることを目指しています。
  • • 準同型暗号化により、サーバーは基礎となるデータを公開することなく、暗号化されたデータ上で計算を行い、暗号化された結果を返すことができます。
  • • Googleは、不正検知器やレコメンデーションモデルなど、HEIRでコンパイルされた4つのサンプルアプリケーションをGitHubでオープンソース化しました。

開発者は、サーバー上で復号することなく、暗号化されたユーザーデータに対してAI推論を実行するプライバシー保護アプリケーションを構築できます。

SOURCES

11. mlx-dsparkがApple Silicon上でQwen3.8-27Bを最大3倍高速化

DeepSeekのDSpark推論デコーディングドラフターとz-labのDFlashのMLXポートである「mlx-dspark」が更新され、新たにリリースされたQwen3.8-27BモデルをApple Silicon上で高速化できるようになりました。ロスレス検証ループを利用することで、このツールはターゲットモデルの出力品質を維持しながら、ローカルでのトークン生成速度を大幅に向上させます。

  • • mlx-dsparkバージョン0.10.0は、RadixArkのドラフターを使用してQwen3.8-27Bの推論デコーディングサポートを追加しました。
  • • 48GBのRAMを搭載したM4 Pro上の8ビットターゲットモデルは、平均2.45倍の高速化を達成し、毎秒8.3トークンから20.3トークンに増加しました。
  • • 同じハードウェア上の4ビットターゲットモデルは、約18GBのメモリを使用して毎秒25.3トークンで1.74倍の高速化を達成しました。
  • • このツールは、ターゲットモデルがすべてのドラフトトークンを検証するロスレス検証ループを使用します。
  • • mlx-dsparkはpip経由で利用可能で、OpenAI互換サーバーとAnthropic Messages APIサポートが含まれています。

Macを使用する開発者は、出力品質を損なうことなく、新しいQwen3.8-27Bモデルをローカルでより高速に実行できます。

SOURCES

12. AnthropicがClaude Opus 5の値下げで価格競争に参入

AnthropicはClaude Opus 5モデルのコストを50%削減し、進行中のAPI価格競争における重要なエスカレーションを示しました。この動きは、GPT-5.6 Lunaモデルに対するOpenAIの最近の80%の値下げに続くもので、7月中旬以降、業界全体のトークン価格が約25%下落する要因となっています。これらの積極的な値下げは、エンタープライズ顧客によるコスト効率の高い中国モデルの採用拡大に対抗するための、米国ラボによる戦略的な転換を反映しています。

  • • Anthropicは、前モデルの半額でClaude Opus 5をリリースしました。
  • • OpenAIは以前、GPT-5.6 Lunaの価格を80%引き下げました。
  • • 米国のラボは、エンタープライズ顧客を定額サブスクリプションから従量課金制へと移行させています。
  • • 中国のAIプロバイダーとの競争が、現在の業界全体の価格引き下げを牽引しています。

OpenAIとAnthropicの両社を含むAPIコストの急速な下落傾向により、フロンティアクラスのモデルが本番規模のエージェントワークフローでますます利用しやすくなっています。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。