Inference Brew

GLM 5.2のトークン最適化とローカルパフォーマンス指標

00:00 / --:--

← ホームへ戻る

GLM 5.2のトークン最適化とローカルパフォーマンス指標

1. GLM 5.2のトークン最適化とローカルパフォーマンス指標

GLM 5.2は推論能力を拡張し、トークン制限をGLM 5.1の16.7kから36.7kに引き上げました。z.aiの技術レポートによると、開発者は「max」の代わりに「high」エフォートレベルを利用することで、ローカルおよびAPIデプロイメントを最適化できます。これにより、コーディングタスクのパフォーマンスを98%維持しながら、トークン消費量を半分以下に削減可能です。6x RTX 3090のようなマルチGPU構成でのローカルテストでは、90Kコンテキストで毎秒7.8トークンという許容可能な生成速度が得られますが、Xeonベースのハードウェアでは現在、極端な応答遅延が発生することがユーザーから報告されています。

  • GLM 5.2の推論トークン数は、GLM 5.1の16.7kから36.7kに増加しました。
  • z.aiの技術レポートによると、「high」エフォートレベルは、トークン使用量を半分以下に抑えつつ、コーディングタスクにおいて「max」レベルの知能の98%を発揮します。
  • Q4量子化を用いたGLM 5.2のローカルテストでは、「high」エフォートレベルで「max」レベルと同等の数学的結果が得られました。
  • 6x RTX 3090 GPUを使用したコミュニティのベンチマークでは、unsloth UD-IQ2_M量子化と90Kコンテキストを使用して、毎秒7.8トークンの生成速度を達成しました。
  • ユーザーからは、現在Xeonハードウェアでは応答待ち時間が長すぎてGLM 5.2が使用できないとの報告が上がっています。

これにより、開発者は高いコーディング品質を維持しながら、日々のワークフローにおけるAPIコストと遅延を大幅に削減できます。

SOURCES

2. Cloudflare、AIエージェントデプロイメント向けの一時アカウントを導入

Cloudflareは、完全に自律的なエージェントワークフローを促進するために設計された機能「Temporary Cloudflare Accounts for Agents」を導入しました。AIエージェントは「wrangler deploy --temporary」を実行することで、既存のアカウントや手動認証を必要とせずに、ウェブサイト、API、Cloudflare Workersをデプロイできます。これらのデプロイメントは60分間有効であり、開発者やエージェントは自動削除される前にリソースを恒久的に引き継ぐことができます。

  • AIエージェントは「wrangler deploy --temporary」コマンドを実行することで、一時的なデプロイを開始できます。
  • 一時的なデプロイは60分間有効で、その間にアカウントとリソースを恒久的なものとして引き継ぐことができます。
  • 引き継がれなかった一時アカウントと関連リソースは、60分後に自動的に削除されます。
  • Wrangler CLIは、認証の壁に直面した際に、エージェントに対して「--temporary」フラグに関する情報を提示するように更新されました。
  • この機能は、人間の介入なしに迅速かつ反復的なエージェントワークフローをサポートするように設計されています。

これにより、コーディングエージェントのための摩擦のない完全自動化された「作成・デプロイ・検証」サイクルが可能になり、人間による認証のボトルネックが解消されます。

SOURCES

3. Cisco AI、プロンプト最適化システム「FAPO」を公開

Cisco AIは、Claude Codeを活用してマルチステップLLMパイプラインを最適化するために設計されたシステム「FAPO(Fully Automated Prompt Optimization)」をオープンソース化しました。Apache 2.0ライセンスの下でリリースされたFAPOは、ステップレベルの失敗帰属を使用して、パイプラインのエラーを「検索」「カスケード」「フォーマット」「推論」の失敗に分類します。その後、プロンプト編集、パラメータ調整、構造的変更という3つの段階的なレベルでパイプラインを最適化します。評価において、FAPOはGEPAオプティマイザーを平均14.1ポイント上回り、構造的変更が必要なベンチマークでは最大33.8ポイント上回りました。また、過学習を防ぐためにトレーニング分割のみの検査といったガードレールを採用しています。

  • FAPO(Fully Automated Prompt Optimization)はApache 2.0ライセンスでオープンソース化されています。
  • このシステムは、マルチステップLLMパイプラインを洗練させるための最適化エージェントとしてClaude CodeとCodexをサポートしています。
  • ステップレベルの失敗帰属を使用して、エラーを検索、カスケード、フォーマット、または推論の失敗に分類します。
  • FAPOは、プロンプト編集、パラメータ調整、構造的変更の3つのレベルでパイプラインを最適化します。
  • ベンチマークでは、FAPOはGEPAオプティマイザーを平均14.1ポイント上回り、HoVerのような構造的ベンチマークでは最大33.8ポイントの向上を達成しました。
  • 過学習に対する組み込みのガードレールには、トレーニング分割のみの検査や独立した提案レビューが含まれます。

開発者は、過学習を防ぐガードレールを備えたプロンプト編集、パラメータ調整、構造的変更を通じて、複雑なLLMパイプラインを自動的に最適化できます。

SOURCES

4. Nous Research、Hermes Agentに「Blank Slate」モードを追加

Nous Researchは、セキュリティに敏感で監査可能なデプロイメント向けに設計された新しい「Blank Slate」構成モードを、オープンソースのHermes Agentに追加しました。このモードを有効にすると、エージェントは基本的なプロバイダー設定、ファイル操作、ターミナルアクセスのみで初期化され、ウェブブラウジング、コード実行、ビジョン、MCPサーバーなどのデフォルト機能は無効化されます。ソフトウェアアップデート後も構成を維持するため、このモードは「disabled_toolsets」および「platform_toolsets.cli」ファイルをディスクに直接書き込みます。

  • Blank Slateモードは、プロバイダー/モデル設定、ファイル操作、ターミナルのみを有効にしてHermes Agentを初期化します。
  • ウェブアクセス、ブラウザ、コード実行、ビジョン、メモリ、MCPサーバーなどのデフォルト機能は無効化されます。
  • 構成は、明示的な「disabled_toolsets」および「platform_toolsets.cli」リストをディスクに書き込むことで、アップデート後も維持されます。
  • Hermes Agentには、最低64,000トークンのコンテキストウィンドウを持つLLMが必要です。
  • このモードは、セキュリティに敏感なデプロイメント、再現可能なチーム環境、および教育的な監査のために設計されています。

これにより、機密性の高い本番環境でエージェントを実行するための、非常に安全で再現性が高く、監査可能な環境が提供されます。

SOURCES

5. Cosine、アクティブなペネトレーションテスト向けにKimi K2.6をポストトレーニング

Cosine (YC W23) は、システムの脆弱性を積極的に特定するために設計されたサイバーセキュリティAIツールを立ち上げました。Kimi K2.6ベースモデルを基盤とし、10年分のキャプチャ・ザ・フラグ(CTF)コンテストデータを使用して、教師ありファインチューニング(SFT)と検証可能な報酬を用いた強化学習(RL)でポストトレーニングを行い、セキュリティテスト中の標準的な安全拒否を防ぐようにしました。CLI経由で動作するこのツールは、読み取り専用のローカルコードスキャナーと、サンドボックス化されたシステムを攻撃しようとするアクティブなペネトレーションテストモードを備えており、正確なエクスプロイトリクエストとレスポンスを表示することで、開発者に脆弱性の具体的な証拠を提供します。

  • このツールは、10年分のCTFデータを使用してSFTとRLでポストトレーニングされたKimi K2.6ベースモデルを基盤としています。
  • CLI経由で動作し、読み取り専用のローカルコードスキャンモードと、サンドボックスシステム向けのアクティブなペネトレーションテストモードを提供します。
  • アクティブなペネトレーションテストモードはライブシステムを攻撃しようとし、エクスプロイトリクエストとレスポンスを表示することで脆弱性の証拠を提供します。
  • このシステムは、オーケストレーターが並列サブエージェントにタスクを分散させるマルチエージェントスウォームハーネスを使用しています。
  • インストールは無料で、最大200万トークンまでのスキャンが可能な無料枠が含まれており、コンテキストはTLS経由で推論APIに送信されます。

開発者は、サンドボックス化されたシステムに対して自動化されたアクティブなペネトレーションテストを実行し、具体的なエクスプロイトの証拠とともに脆弱性を発見・検証できます。

SOURCES

6. SearXNGとScraplingによるローカルエージェント向けのセルフホスト型ウェブアクセス

ある開発者が、有料の検索およびスクレイピングAPIを回避する、ローカルファーストのAIエージェント向けのセルフホスト型ウェブアクセスパイプラインを設計しました。このアーキテクチャは、DockerでSearXNGをデプロイしてJSON経由で検索結果を提供し、Scraplingを使用してページコンテンツを抽出します。ブラウザを使用しない高速なパスと、困難なサイト向けのステルスヘッドレスブラウザパスを備えており、トークン消費を最小限に抑えるためにTrafilaturaを介して最終的なHTMLをMarkdownに変換します。このパイプラインには、エージェントが内部ネットワーク範囲をスキャンするのを防ぐSSRFガードも含まれています。

  • セルフホスト型のセットアップでは、DockerでデプロイされたSearXNGを使用して、JSONエンドポイント経由で検索結果を提供します。
  • ページ抽出には、ブラウザを使用しない高速パスと、ブロックされたページ用のヘッドレスブラウザを使用したステルスパスを利用します。
  • Trafilaturaは抽出されたHTMLをクリーンなMarkdownに変換し、ローカルLLMの読みやすさとトークン使用量を最適化します。
  • このシステムはPDF処理用のpypdfと、エージェントが内部ネットワーク範囲にアクセスするのを防ぐSSRFガードを統合しています。
  • このセットアップは有料のAPIキーやベンダー固有の検索サービスを回避しますが、検索品質はアップストリームのエンジンに依存します。

開発者は、高価でベンダーロックインされた検索やスクレイピングAPIに依存することなく、完全にローカルでプライバシーを保護したウェブブラウジングエージェントを構築できます。

SOURCES

7. Hugging Face経由でClaude CodeとGLM-5.2を実行

新しい統合ガイドでは、AnthropicのClaude Code CLIをGLM-5.2モデルで実行するように構成する方法を詳しく説明しています。Hugging Face Inference Providersを通じてリクエストをルーティングすることで、開発者はエージェントターミナルワークフロー内でオープンウェイトモデルを利用できます。このセットアップには、推論プロバイダー権限を持つ詳細なHugging Faceトークンの生成と、接続を確立するための特定の環境変数の構成が必要です。

  • Claude Codeは、Hugging Face Inference Providersを使用してGLM-5.2と統合できます。
  • 構成には、「Make calls to Inference Providers」権限を持つ詳細なHugging Faceトークンが必要です。
  • セットアップは、Claude CodeのAPI呼び出しをルーティングするための特定の環境変数を構成することで完了します。

これにより、開発者はClaude Codeのエージェント機能を、GLM-5.2のような代替のオープンウェイトモデルで活用できるようになります。

SOURCES

8. TimeCopilot、基盤モデルによる予測パイプラインを簡素化

新しいチュートリアルでは、予測ワークフローを合理化するために設計されたツール「TimeCopilot」を使用して、エンドツーエンドの予測パイプラインを構築する方法を概説しています。このパイプラインは、ローリングクロスバリデーションを使用して統計モデル、基盤モデル、GPUベースの予測モデルを評価し、MAE、RMSE、MAPE指標でランク付けします。さらに、TimeCopilotは、OpenAIまたはAnthropicのAPIキーを使用して、最もパフォーマンスの高いモデルを自動的に選択し、分析的な解釈を生成できるオプションのLLMエージェントを統合しています。

  • TimeCopilotは、データ準備や異常検知を含む、エンドツーエンドの予測ワークフローを構築するために設計されたツールです。
  • パイプラインは、ローリングクロスバリデーションを使用して統計モデル、基盤モデル、GPUベースの予測モデルを評価します。
  • 80%および95%の予測区間を持つ12ヶ月の確率的予測を生成します。
  • TimeCopilotは、OpenAIまたはAnthropic APIを使用してモデルを選択し、分析的な解釈を提供できるオプションのLLMエージェントを備えています。

開発者は、従来の統計モデルとLLM主導の分析を組み合わせた複雑な予測パイプラインを迅速に構築および評価できます。

SOURCES

9. Yandex、ゼロコピーシリアライゼーションライブラリ「YaFF」をオープンソース化

Yandexは、Apache 2.0ライセンスの下でリリースされた高性能C++シリアライゼーションライブラリ「YaFF(Yet another Flat Format)」をオープンソース化しました。YaFFはProtobufエコシステムにゼロコピーワイヤーフォーマットを導入し、開発者が既存の「.proto」ファイルを信頼できる唯一の情報源として維持できるようにします。AMD EPYC 7713でのベンチマークでは、YaFFのフラットレイアウトは、ホットデータをFlatBuffersより3.8倍、標準のProtobufより22倍高速に読み取り、レコメンデーションエンジンで本番規模でデプロイされた場合に10〜20%のCPU節約を実現しました。

  • YaFF(Yet another Flat Format)はApache 2.0ライセンスでオープンソース化されています。
  • このライブラリは、.protoファイルを信頼できる唯一の情報源として維持しながら、Protobufエコシステムにゼロコピーワイヤーフォーマットを提供します。
  • AMD EPYC 7713でのベンチマークでは、YaFFのフラットレイアウトはホットデータをFlatBuffersより3.8倍、Protobufより22倍高速に読み取りました。
  • Yandexの広告レコメンデーションシステムにYaFFを実装した結果、本番規模で10〜20%のCPU節約が実現しました。
  • YaFFは、システムエッジでのProtobufとYaFF間の双方向変換を通じて、段階的な導入をサポートしています。

高スループットのサーバーサイドランタイムを構築する開発者は、レコメンデーションエンジンやメモリマップドインデックスにおいて、大幅なCPU節約と高速な読み取り速度を実現できます。

SOURCES

10. Noema Atlas、P2PローカルLLMウェイト配布ネットワークを立ち上げ

Noema Atlasは、ローカルLLMのウェイトを共有するために設計された、オープンソースのRustベースのピアツーピアネットワークソフトウェアを導入しました。Apache-2.0ライセンスの下でリリースされたNoema Atlasは、ピアツーピア転送にIrohプロトコルを利用し、BLAKE3コンテンツハッシュを介してファイルの整合性を検証します。このシステムは、リリンクまたはハードリンクを使用してモデルバリアント間で同一ファイルを重複排除することでローカルストレージを最適化し、Hugging Faceのような中央プラットフォームから削除されたモデルを開発者が共有および救出できるようにします。

  • Noema AtlasはRustで構築され、Apache-2.0オープンソースライセンスの下でリリースされています。
  • このソフトウェアはピアツーピア転送にIrohを使用し、BLAKE3コンテンツハッシュを使用してファイルの整合性を検証します。
  • リリンクまたはハードリンクを使用して、モデルバリアントやミラー間で同一ファイルを重複排除します。
  • ユーザーは、タイトルとライセンスを提供することで、Hugging Faceなどのプラットフォームから削除されたモデルを救出して共有できます。
  • このプロジェクトには、macOS、Windows、Linux用のネイティブデスクトップアプリ、CLI、およびNoema Atlas Studioと呼ばれるコンパニオンアプリが含まれています。

開発者は、中央の帯域幅のボトルネックやモデルの削除を回避し、ピアから直接大規模なモデルウェイトを安全に共有、ミラーリング、ダウンロードできます。

SOURCES

11. Apple Silicon MacでEXL3量子化サポートが開始

オープンソースのPonyExl3プロジェクトにより、64GB以上のRAMを搭載したApple Silicon MacでEXL3量子化サポートが実現しました。以前はCUDA対応のRTXハードウェアに限定されていましたが、EXL3モデルをmacOS上で実行、推論、変換できるようになりました。MiniCPM5およびQwen3.6-27Bモデルでの初期テストでは、macOSで変換されたモデルは、NVIDIA RTXカードで変換されたモデルと同等の平均カルバック・ライブラー情報量(KLD)を達成し、MLX量子化と比較して品質対重量パフォーマンスで約0.5ビットの改善を実現しました。

  • 以前はCUDAおよび高価なRTXハードウェアに限定されていたEXL3モデルが、64GB以上のRAMを搭載したApple Silicon Macで実行および変換できるようになりました。
  • オープンソースのPonyExl3プロジェクトは、Apache 2.0ライセンスの下でGitHubで入手可能です。
  • macOS上でのMiniCPM5およびQwen3.6-27Bモデルのテストでは、RTXカードで行われた変換と同等の平均KLDが示されました。
  • EXL3量子化は、MLXと比較して品質対重量パフォーマンスにおいて、ウェイトあたり約0.5ビットの改善を提供します。

これにより、macOS上で高性能なEXL3量子化が解禁され、MLX量子化よりも優れた品質対重量パフォーマンスが提供されます。

SOURCES

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。

Inference Brewを受信箱へ

1日5分。無料、いつでも解除できます。