1. Qwen 3.8 27Bが30分でarm64コードのリバースエンジニアリングに成功
Artificial Analysisのインテリジェンスインデックスで4B〜40Bサイズクラスの1位にランクインしているQwen 3.8 27Bが、商用アプリケーションのライセンスチェックのリバースエンジニアリングに成功しました。Nvidia GB10 Grace Blackwellチップを搭載したLenovo ThinkStation PGX上で動作し、arm64コードの静的解析を実行。30分以内に自らのエラーを特定・修正し、難読化されたRSAキーを復元して、認証バイパスを構築しました。また、コードの監査を行う前に、初期の脱獄(ジェイルブレイク)の試みを認識し、拒否する能力も示しました。
- • Qwen 3.8 27Bは、Artificial Analysisのインテリジェンスインデックスにおいて、スコア52で4B〜40Bサイズクラスのトップモデルにランクイン。
- • arm64コードの静的解析を用いて、商用アプリケーションのライセンスチェックのリバースエンジニアリングに成功。
- • 30分間のプロセスの中で、モデルは自らのエラーを特定・修正し、難読化されたRSAキーの復元と認証バイパスを実現。
- • SGLang、NVFP4、DFlash2推論デコーディングを使用し、Nvidia GB10 Grace Blackwellチップ上で最大50トークン/秒のパフォーマンスを達成。
この成果は、モデルがローカル環境で複雑な多段階の推論と自己修正を実行できることを示しており、高度なセキュリティ監査ワークフローの可能性を切り拓くものです。
2. VercelがZigベースのコーディングエージェント「fx」をリリース
Vercelは、Zigで記述された軽量かつ高速なコーディングエージェント「fx」をリリースしました。このリリースは、LLMがRustやZigのような複雑なシステムプログラミング言語への参入障壁を下げているという業界の広範なシフトと一致しています。開発者は、パフォーマンスの最適化や、eBPF、DWARFファイル、カスタムネットワークドライバといった低レイヤー技術の操作を支援するために、AIをますます活用しています。例えば、CloudflareのArtifactsサービスでは、100KBのWebAssemblyモジュールにコンパイルされた純粋なZig製のGitプロトコルエンジンが稼働しています。
- • Vercelがリリースした「fx」は、その小型さと高速さを特徴とするZigベースのコーディングエージェント。
- • CloudflareのArtifactsサービスは、100KBのWebAssemblyモジュールにコンパイルされた純粋なZig製のGitプロトコルエンジンを活用。
- • LLMがRustやZigのような複雑な言語への参入障壁を下げており、開発者はパフォーマンス最適化をAIに頼ることができるようになっている。
- • AI支援により、開発者はeBPF、DWARFファイル、カスタム暗号化といった複雑な技術を扱うことが可能になっている。
「fx」のリリースにより、開発者はZigの速度と小さなフットプリントを活用した、最適化された低オーバーヘッドのコーディングエージェントを利用できるようになります。
3. Claude Code(Opus 5)が大規模コード移植でQwen 3.8 27Bを圧倒
2.1MBのCファイル(39,000行)を単一のプロンプトでHTML/three.jsプロジェクトに移植する実験において、ローカルのQwen 3.8 27BとOpus 5を比較しました。Opus 5を実行するClaude Codeは、21分で「まずまず(okay)」の品質でタスクを完了しました。対照的に、vLLM上でFP8を使用してローカル実行したQwen 3.8 27Bは、Hermesハーネスで4時間18分、Codehamrハーネスで1時間40分を要し、いずれのローカル実行も「悪い(bad)」品質の出力となりました。
- • Opus 5を使用したClaude Codeは、2.1MBのCファイルの移植を21分で完了し、1759行の「まずまず」な品質の出力を生成。
- • Hermesハーネス上で動作するQwen 3.8 27Bは、4時間18分をかけて949行の「悪い」品質の出力を生成。
- • Codehamrハーネス上で動作するQwen 3.8 27Bは、1時間40分で1056行の「悪い」品質の出力を生成。
- • ローカルのQwen 3.8 27B環境は、RTX 6000 Pro 96GB GPU上でvLLMのFP8を使用して実行。
このベンチマークは、複雑な単一プロンプトでのコードベース移行を実行する際、ローカルモデルと最先端APIの間に存在するパフォーマンスの境界を浮き彫りにしています。
4. エージェントハーネスとオープンソースのPiフレームワークの理解
エージェントハーネスは、AIモデルがエージェントとして動作するための構造化された環境を提供する、重要なアーキテクチャパターンとして台頭しています。通常、システムプロンプト、ツール、エージェントループ、変換レイヤーで構成されるハーネスにより、開発者はさまざまなプロバイダーのモデルを切り替えたり、オープンウェイトモデルをローカルで実行したりできます。Earendilによって開発された「Pi」は、ラップトップ上でローカルに動作する無料のオープンソースハーネスであり、ユーザーの主体性を最大化するために5,000以上のコミュニティ共有拡張機能を備えています。
- • エージェントハーネスは、システムプロンプト、ツールセット、エージェントループ、モデル互換性のための変換レイヤーで構成される。
- • 変換レイヤーにより、開発者はAnthropicやOpenAIなどの異なるプロバイダーのモデルを切り替えたり、オープンウェイトモデルを使用したりできる。
- • Piは、ラップトップ上でローカルに動作し、5,000以上のコミュニティ共有拡張機能をサポートする無料のオープンソースエージェントハーネス。
- • ハーネスは完全に所有・カスタマイズ可能であり、ユーザー自身のハードウェア上でローカルに実行できる。
ハーネスは、エージェントループを独自のAPIプロバイダーから切り離し、開発者がエージェントの実行に対して完全な所有権とローカル制御を持てるようにします。
5. DeepSeek Harnessが暗号化されたTORベースのエージェント通信を実現
DeepSeek Harness (DSH) は、プログレッシブでストレスのないセットアップと、特定の思想に縛られない(unopinionated)設計で注目を集めています。このツールは、簡単なチェックインのためのWebUIを備えており、AIエージェントとのエンドツーエンド暗号化されたTORベースのメッセージングを可能にします。最近の実装では、ある開発者がAIに直接統合を実行させるよう指示することで、DSHとSimpleXの統合に成功しました。これは、手動のプルリクエストやコミュニティプラグインを必要とせずに、ツールの柔軟性を示しています。
- • DeepSeek Harness (DSH) は、簡単なチェックインのためのWebUIと、プログレッシブでストレスのないセットアッププロセスを特徴とする。
- • DSHは、AIエージェントとのエンドツーエンド暗号化およびTORベースのメッセージングを可能にする。
- • ユーザーはAIに直接統合を実行させることで、プルリクエストやコミュニティプラグインを介さずにDSHとSimpleXの統合に成功した。
- • DSHは特定の思想に縛られない設計であり、開発者はその動作を完全にカスタマイズできる。
このツールは、プライバシーと安全な通信を標準で優先する、特定の思想に縛られない高度にカスタマイズ可能なエージェント環境を開発者に提供します。
6. Qwen 3.8 27B NVFP4がRTX 5090で451K KVキャッシュ、120 tok/sを達成
ある開発者が、vLLMを使用して電力制限(400W)されたNVIDIA RTX 5090上でQwen 3.8 27B NVFP4モデルを実行することに成功しました。メモリ使用率を0.98まで最大化するためにUIを無効化したLinux(Bazzite)上で動作し、セッションあたり196Kのコンテキストと、3つの並列セッションで有効化された451KのグローバルKVキャッシュをサポートしています。このセットアップは平均120トークン/秒の速度を達成しており、ベンチマークはllama-benchy 0.4.0で検証されています。
- • このセットアップは、セッションあたり196Kのコンテキストウィンドウと、3つの並列セッション全体で451KのグローバルKVキャッシュをサポート。
- • 電力制限された(400W)NVIDIA RTX 5090上で、平均120トークン/秒の生成速度を達成。
- • メモリ使用率0.98を達成するため、UIを無効化したLinux(Bazzite)環境で実行。
- • パフォーマンスベンチマークは、4Kから185Kまでのコンテキスト長でllama-benchy 0.4.0を使用して実施。
この構成は、開発者がコンシューマー向けハードウェア上で、いかにして巨大なコンテキストウィンドウと並列セッションをローカルで実行できるかを示しています。
7. Qwen 3.8 27B向けAtomic Dynamic GGUF量子化版がリリース
Atomic Chatチームは、Qwen 3.8 27Bモデル向けのAtomic Dynamic (AD) GGUF量子化版をリリースし、ボクセルアイランド作成タスクを使用してRTX PRO 6000上で評価しました。チームは、BF16と比較して98.7%のトップ1精度を維持し、49トークン/秒で動作するAD-Q6_Kバリアント(25.0GB)を最も安全な選択肢として推奨しています。より厳しいメモリ制約がある場合は、AD-Q4_K_Mバリアントを使用することで、サイズを17.1GBに削減しつつ、95.6%の精度を維持し、速度を67トークン/秒まで向上させることができます。
- • AD-Q6_K量子化は最も安全な選択肢として推奨され、BF16と比較して98.7%のトップ1精度と49 tok/sのデコード速度を提供。
- • AD-Q4_K_M量子化はモデルサイズを17.1GBに削減し、95.6%のトップ1精度を維持しつつ67 tok/sを達成。
- • AD-Q5_K_M量子化は20.2GBのサイズで97.3%のトップ1精度と57 tok/sのデコード速度を提供。
- • すべての量子化版は、atomic.chatアプリまたはAtomicChat Hugging Faceコレクションからダウンロード可能。
開発者は、プロフェッショナル向けワークステーションGPU上で、メモリフットプリントと精度のバランスを取りながら、高度に最適化されたQwen 3.8 27Bのローカル量子化版をデプロイできるようになりました。
8. GLM-4.5-AirがLlama.cppでマルチトークン予測(MTP)をサポート
Llama.cppへのマルチトークン予測(MTP)の初期統合に基づき、GLM-4.5-Airモデルのサポートが追加されました。この106BパラメータのMixture-of-Experts (MoE) モデルは、MTPを活用することで、Strix HaloやNVIDIA 3090 GPUのようにメモリ容量は大きいが計算能力が限られているハードウェアでの生成速度を向上させることができます。GGUFファイルに必要なMTPブロックは、jacek2024氏が管理するリポジトリから入手可能です。
- • GLM-4.5-Airは、12Bのアクティブパラメータを持つ106BパラメータのMoEモデル。
- • Llama.cppのMTPサポートは、GLM-4.5-AirおよびフルGLM-4.5モデルをカバー。
- • この実装は、メモリが大きく計算能力が限られたハードウェア向けに最適化されている。
- • ユーザーは、jacek2024氏が管理するリポジトリからGGUFファイルに必要なMTPブロックにアクセス可能。
このアップデートにより、MTPのパフォーマンス上の利点がGLM-4.5-Airモデルにも拡大され、メモリは豊富だが計算能力が限られたハードウェア上で、大規模なMoEアーキテクチャをより効率的にローカルデプロイできるようになります。
9. 新ベンチマーク:Kimi K3においてB300でのMXFP4がA100での1ビットGGUFを上回るコスト効率
Kimi K3モデルのセルフホストに関する以前の費用対効果分析に基づき、新しいベンチマークデータは、8x B300 GPU上のネイティブMXFP4が、古いハードウェア上の1ビット量子化よりも大幅に効率的であることを明らかにしました。8x A100上での1ビットGGUFは時間あたりのコストは低いものの、B300セットアップの優れたスループットにより、100万トークンあたりのコスト効率は3.3倍高くなっています。
- • 8x B300 GPU上でvLLMとネイティブMXFP4を使用してKimi K3をホストする場合、92 tok/sで100万トークンあたり190ドル。
- • 8x A100-80GB GPU上で1ビットUD-IQ1_S GGUFを実行する場合、9 tok/sで100万トークンあたり620ドル。
- • B300構成は、時間あたりのレンタル料金が高いにもかかわらず、3.3倍のコスト効率を実現。
このベンチマークは、大規模なMoEモデルのハードウェアと量子化戦略を選択するインフラエンジニアにとって重要なデータを提供します。
10. Nvidiaが顧客に対しAI製品の15%を超える値上げを通知
Nvidiaは、AI関連製品の今後の値上げについて顧客に通知しました。発表された値上げ幅は15%を超えており、この動きはハードウェア調達コストや、モデルを自社ホストする開発者向けのクラウドGPUレンタル料金に直接影響を与えることが予想されます。
- • Nvidiaは、AI関連製品の値上げについて顧客に正式に通知した。
- • これらのAI関連製品に対する発表された値上げ幅は15%を超えている。
この値上げはハードウェア取得コストを直接的に押し上げ、クラウドGPUインスタンスの価格上昇を招く可能性が高く、開発者のインフラ予算に影響を与えます。