1. OpenAIがChatGPTにGPT-5.6を統合、新しい「Think」スライダーとテキストチャット無制限化を発表
7月にリリースされたGPT-5.6モデルファミリーの一般公開を受け、OpenAIはChatGPTのコンシューマー向け体験をアップデートします。無料ユーザーおよびGoユーザーは「GPT-5.6 Luna」モデルにアップグレードされ、PlusおよびProサブスクライバーは「GPT-5.6 Sol」モデルを利用可能になります。また、有料ユーザー向けには推論深度を制御する「Think」スライダーが導入され、来週からは無料ユーザーのテキストチャットにおけるレート制限が撤廃されます。
- • OpenAIは無料ユーザーおよびGoユーザーのデフォルトモデルをGPT-5.6 Lunaにアップグレードします。
- • PlusおよびProサブスクライバーはGPT-5.6 Solモデルにアップデートされます。
- • 新しい「Think」スライダーにより、有料ユーザーは推論深度を調整可能になります。
- • 来週から、無料ユーザーおよびGoユーザーのテキストチャットのレート制限が撤廃されます。
- • 来週から、無料ユーザーおよびGoユーザーも複雑なクエリに対して「Think」ボタンを利用できるようになります。
このアップデートにより、これまで開発者向けだったGPT-5.6モデルがより幅広いユーザー層に提供され、推論能力の向上と柔軟な利用制限が実現します。
2. NVIDIA、文書理解のための「Nemotron Parse 2.0」をリリース
NVIDIAのNemotron Parse 2.0は、文書理解とデータ抽出のワークフローを効率化するために設計されています。RGB文書画像とタスクプロンプトを入力することで、モデルはタイトル、表、脚注などの要素に対する空間アノテーションとともにフォーマットされたテキストを生成し、マルチモーダルなデータキュレーションに非常に有用です。
- • NVIDIAは、文書画像を構造化テキスト、レイアウトクラス、バウンディングボックス、読み取り順序情報に変換するNemotron Parse 2.0をリリースしました。
- • バージョン1.2と比較して、CJK(中国語・日本語・韓国語)やインド系文字を含む多言語サポートのために2万トークンの語彙拡張が行われています。
- • グラフを認識する文書解析機能が導入され、手書き文字の抽出精度が向上しました。
- • このモデルは商用・非商用を問わず利用可能です。
開発者はこのモデルを使用して、RAGやデータキュレーションパイプラインのために文書画像から構造化データ、表、グラフを抽出できます。
3. ネイティブハイブリッド推論モデル「Ling-3.0-tiny」がリリース
Ling-3.0-tinyは、リソースが制限された環境向けに構築されています。ネイティブハイブリッド推論モデルとして、トークンあたり13億パラメータのみをアクティブ化するため、数学や指示追従における強力な能力を維持しながら効率的に動作します。
- • Ling-3.0-tinyは、合計79億パラメータ、トークンあたり13億の有効パラメータを持つネイティブハイブリッド推論モデルです。
- • リソースに敏感な環境でのデプロイ向けに設計されており、実世界のタスク、数学、指示追従を実行します。
- • リリース後1週間は無料で利用可能です。
開発者は、ローカルやエッジ環境へのデプロイに適した、リソース効率の高い推論モデルを利用できるようになります。
4. Gemma-4のファインチューン版「Scotoma-2」が冗長な表現を削減
ユーザーAesSedaiによって開発されたScotoma-2は、Scotoma V1の後継モデルです。複数のDPOセッションを通じて特定の散文の問題に対処し、標準的なアシスタントのペルソナを崩すことで、Gemma-4-31B-itの基礎能力を維持しつつ、より自然な文章生成を目指しています。
- • Scotoma-2は、「It's not x, it's y」のような一般的な決まり文句や形容詞の重ねすぎを減らすために作成されたGemma-4-31B-itのファインチューン版です。
- • 作成者はHeraticを使用してモデルを「abliterate(消去)」し、J-lense投影を用いてアシスタントのペルソナを崩しました。
- • 4つの異なるデータセットを使用して、4回のDPOファインチューニングセッションが行われました。
- • Scotoma-2モデルのGGUFバージョンはHugging Faceで入手可能です。
よりクリーンで定型文的ではないテキスト生成を求める開発者は、ライティングタスクにこのファインチューンされたGemma-4モデルを活用できます。
5. CLIコーディングエージェントランタイム「Herdr」がY Combinatorに参加
Herdrは25,000のスターと340,000のダウンロードを獲得し、大きな注目を集めています。Y Combinatorへの参加にあたり、開発者はコアランタイムをApache-2.0ライセンスの下でオープンソースとして維持しつつ、追加のクライアントや接続機能の開発を計画しています。
- • AIエージェント管理ツールであるHerdrは、Y CombinatorのF26バッチに参加します。
- • HerdrランタイムはApache-2.0ライセンスであり、今後も無料かつオープンソースとして提供されます。
- • Herdrは、CLIコーディングエージェントが異なる環境間で永続的に動作するためのランタイムを提供します。
- • SSH経由のリモートアクセスをサポートするターミナルユーザーインターフェース(TUI)が含まれています。
- • Raycast、Stream Deck、iOS向けの拡張機能など、500以上のコミュニティ製プラグインがエコシステムに含まれています。
永続的なCLIコーディングエージェントにHerdrを使用している開発者は、プロジェクトがオープンソースのままでありながら、支援を受けて新機能が追加されることを期待できます。
6. 1PasswordがAIエージェント向けの特権アクセス管理を開始
過度に権限が付与された永続的なエージェント認証情報によるセキュリティリスクに対処するため、1Passwordは「Privileged Access」を立ち上げました。このツールはジャストインタイムアクセスを強制し、認証情報の有効期間をタスクに必要な時間に制限し、監査用の自動セッションログを提供します。
- • 1Passwordは、人間、エージェント、マシンに対して、常時アクセスをジャストインタイム権限に置き換える「1Password Privileged Access」を導入しました。
- • このツールはアクセス期間を特定のタスクに必要な時間に制限し、すべてのセッションを自動的にログに記録します。
- • 1Passwordによる2026年6月の調査では、技術職の53%がAIエージェントに過度な権限を与えていることが判明しました。
- • 同調査では、技術職の40%がAIエージェントに永続的なアクセス権を付与していることも示されました。
開発者は、エージェントが特定のタスクに必要な期間のみ認証情報にアクセスできるようにすることで、エージェントのワークフローを保護し、認証情報の悪用リスクを低減できます。
7. 「Zero-Mem」がエージェントのメモリ操作におけるトークン消費を排除
Zero-Memは、LLMエージェントのメモリ管理に対する非常に効率的な代替手段を提供します。メモリ操作中のLLM呼び出しの必要性を排除することで、このフレームワークはトークンのオーバーヘッドとレイテンシを大幅に削減しつつ、競争力のあるタスクパフォーマンスを維持します。
- • Zero-Memは、メモリ操作中のLLM呼び出しとLLMトークン消費の必要性を排除します。
- • このフレームワークは、従来のメモリ管理手法と比較して競争力のあるパフォーマンスを実現します。
開発者は、標準的なLLMベースのメモリ検索に伴うAPIコストやレイテンシを発生させることなく、永続的なメモリを持つエージェントを構築できます。
8. PDFパーサーベンチマーク、複雑な文書における8つのツールを評価
8つのPDFパーサーの包括的な評価により、処理速度と精度のトレードオフが浮き彫りになりました。ChandraはLaTeXや手書き文字などの複雑な要素を解析することに成功しましたが、L4 GPUで1ページあたり91秒を要しました。対照的に、LightOnOCR-1Bのような高速な代替手段(1ページあたり7.9秒)は、ハルシネーションやテキストの欠落が発生し、開発者がRAGパイプラインで速度と品質のバランスを取るための明確なデータを提供しました。
- • ベンチマーク対象:MinerU 2.5、Granite-Docling、PaddleOCR-VL、XBerg 1.0、HURIDOCS PDLA v0.0.35、LiteParse 2.11、Chandra、LightOnOCR-1B。
- • Chandraは最高のパフォーマンスを達成し、HTML表、LaTeX、筆記体テキストを含む14のテストケースすべてを正しく解析しました。
- • ChandraはL4 GPUで1ページあたり91秒の処理時間を要しました。
- • XBerg、LiteParse、PDLAは手書き文字の処理に失敗し、Granite-Doclingは出力に生のDocTagが混入しました。
- • LightOnOCR-1BはL4 GPUで1ページあたり7.9秒で処理しましたが、手書き文字でハルシネーションが発生し、文中でテキストが欠落しました。
- • ベンチマークのソースコードとテストファイルはGitHubリポジトリ「alaamroue/pdf-parser-bench」で入手可能です。
RAGパイプラインを構築する開発者は、このベンチマークを使用して、表、LaTeX、手書き文字を処理するための最も正確なPDFパーサーを選択できます。
9. 「VulcanBench」が長期エージェントベンチマークの不一致を指摘
内部モデルベンチマークとVulcanBenchのような独立評価との間のパフォーマンスの不一致は、実行時間予算に起因することが増えています。内部評価では実行あたり最大12時間を許可する場合がありますが、標準的なベンチマークでは実行を45〜60分に制限しています。これにより、HubSpot、Zendesk、Finなどの企業は、トークン使用量ではなく、解決の成功に基づいた課金モデルを実装するようになっています。
- • 独立ベンチマーク「VulcanBench」によると、Qwen 3.8-Maxはベストエフォート設定で中程度、デフォルト設定で最下位となり、Alibabaの内部的な12時間実行結果とは対照的でした。
- • Long-Horizon-Terminal-Benchの7月のレポートによると、未解決のエージェント実行の79%がタイムアウトによるものでした。
- • Claude Opus 5は、高負荷の実行が頻繁にタイムアウトするため、高負荷設定よりも低負荷設定の方が優れたパフォーマンスを示しました。
- • このレポートでは、すべての試行にかかった総コストを合格基準を満たしたタスク数で割る「タスク成功あたりのコスト」を指標として採用することを推奨しています。
- • DeepSeek-V4-Flash-0731の価格は入力100万トークンあたり0.14ドル、出力100万トークンあたり0.28ドルですが、Qwen 3.8-Maxは2ドル/6ドル、Kimi K3は3ドル/15ドルです。
自律型エージェントを構築する開発者は、高負荷の実行が本番環境で頻繁にタイムアウトするため、生のベンチマークスコアではなく、タスク成功あたりのコストに基づいてモデルを評価すべきです。
10. VastがHugging Faceストレージバケットのサポートを追加
Hugging Faceストレージバケットの最近の立ち上げを受け、Vastは同サービスをプラットフォームに統合しました。開発者はこれらのバケットをGPUインスタンスに直接マウントできるようになり、手動転送なしでトレーニングや推論のためのデータに直接アクセスできます。
- • VastはHugging Faceストレージバケットをクラウド接続として統合しました。
- • これは、Hugging Faceストレージサービスの最近の公式立ち上げに続くものです。
- • ユーザーはVastインスタンスとHugging Faceバケット間で、データセットの取得や結果のプッシュを直接行えるようになりました。
この統合により、開発者は最近立ち上げられたHugging FaceストレージサービスをVast GPUワークフロー内で直接活用でき、データパイプラインの摩擦を軽減できます。
11. BasetenがHugging Faceの公式推論プロバイダーに
この新しいパートナーシップにより、Basetenの推論サービスにHugging Faceのモデルページから直接アクセスできるようになりました。開発者は既存のHugging Faceトークンを活用して高性能モデルを立ち上げ、実行できるため、評価とデプロイのプロセスが効率化されます。
- • Basetenは現在、Hugging Faceプラットフォームの公式推論プロバイダーです。
- • ユーザーは、Kimi K3、DeepSeek V4 Flash、GLM-5.2などのモデルを、Hugging Faceのモデルページから直接Baseten上で実行できます。
- • この統合により、ユーザーはHugging Faceトークンを使用してBasetenの推論サービスにアクセスできます。
開発者は、Kimi K3やDeepSeek V4 Flashなどの人気モデルを、Hugging Faceから直接Basetenのインフラ上で迅速にデプロイおよびテストできます。
12. 開発者がvLLMサービングスタックをC++20に移植
vllm.cppプロジェクトは、LLMをサービングするための高度に最適化された軽量な代替手段を提供します。コアとなるvLLMスタックをC++20に移植することで、巨大なPython依存関係のフットプリントを排除し、パフォーマンスの同等性を維持しながら、エッジデプロイやリソースが制限されたサーバーに最適化しています。
- • vllm.cppは、vLLMサービングスタックの非公式なC++20移植版であり、66 MiBのバイナリを生成し、Python依存関係を排除します。
- • このエンジンは、連続バッチング、ブロックページKV、自動プレフィックスキャッシュ、投機的デコード、OpenAI互換サーバーをサポートしています。
- • safetensors、GGUF、NVFP4、k-quants、i-quants、fp8、bf16フォーマットをサポートしています。
- • ハードウェアサポートには、CUDA、CPU(AVX-512およびArm i8mm)、Metal、および部分的なVulkanサポートが含まれます。
- • DGX Sparkハードウェアでのベンチマークでは、さまざまな同時実行レベルでvLLMと同等のパフォーマンスを示しています。
- • 現在の制限事項には、マルチGPUサポートの欠如、サーバー内でのLoRA統合の欠如、ROCmサポートの欠如が含まれます。
開発者は、9 GiBのPython仮想環境のオーバーヘッドなしで、リソースが制限された環境で高スループットのLLMサービングをデプロイできます。
13. NVIDIA、音声モデルのローカルデプロイ用「NeMo-Speech.cpp」を立ち上げ
Nemotron 3.5 ASRやNemotronLabs-VoiceChat-11Bのようなモデルのリリースに基づき、NVIDIAはローカルデプロイを簡素化するためにNeMo-Speech.cppを導入しました。この新しいランタイムにより、開発者はGGUF量子化を使用してコンシューマーハードウェア上でNVIDIAの音声スイート(ASR、TTS、コーデックモデルを含む)をローカルで実行でき、単なるモデルの利用から完全なオンデバイス実行パイプラインへと移行できます。
- • NeMo-Speech.cppは、NVIDIAの音声スタックをローカルでオンデバイス実行するための統合ランタイムを提供します。
- • このスタックは、Nemotron 3.5 ASRやMagpie-TTSを含む、以前リリースされたモデルのGGUF量子化バージョンをサポートしています。
- • このリリースにより、クラウド依存なしで低レイテンシのローカル音声アプリケーションが可能になります。
- • Nemotron Speech Streaming EN 0.6B、Parakeet CTC 1.1B、Parakeet TDT 0.6B v3、NanoCodecのサポートが含まれています。
開発者は、NVIDIAが以前リリースしたモデルを活用し、クラウドAPIに依存することなく、コンシューマーハードウェア上で完全かつ高性能な音声パイプラインをローカルにデプロイできるようになりました。
14. 開発者がNVIDIA Nemotron-Omni用の純粋なMLXランタイムを構築
オープンソースのnemotron-omni-mlxプロジェクトは、macOS上でテキスト部分しか読み込まれないというNVIDIAのNemotron-Omniの重要な制限を解決します。視覚および音声タワーをMLXで実装することで、開発者はApple Silicon上で高いトークンスループットと管理可能なメモリ使用量で、完全なマルチモーダルローカル推論を実行できるようになりました。
- • ある開発者が、macOS上でNVIDIA Nemotron-Omniの視覚および音声タワーをサポートするための純粋なMLXランタイム(nemotron-omni-mlx)を作成しました。
- • この実装は、視覚および音声タワーをbf16精度で実行し、mlx-communityの4ビット量子化言語モデルをサポートしています。
- • M5 Maxチップ上で、このモデルは画像で67.7トークン/秒、音声で147トークン/秒、テキストのみのタスクで152トークン/秒を達成します。
- • この実装は画像パスで最大22.1 GBのメモリ使用量に達し、32 GBのMacシステムと互換性があります。
- • このプロジェクトはMITライセンスでGitHubで公開されており、NVIDIAのPyTorchリファレンスに対して23個中23個のコンポーネントが検証を通過しています。
Macベースの開発者は、macOS上でテキスト部分しか読み込まれないという制限を回避し、NVIDIAのマルチモーダルモデル「Nemotron-Omni」をローカルで高性能に実行できます。
15. DeepSeek-V4 APIが今後値上げへ
DeepSeek-V4 APIが7月20日に本番リリースに移行して以来、同社は今後の値上げ計画を示唆しています。新しい価格スケジュールは未定ですが、開発者はすでに、これらの変更の影響を軽減するために、ローカルハードウェアホスティングへの移行やモデルルーティング構成の調整を検討しています。
- • DeepSeekは、V4シリーズのAPIの大幅な値上げ計画を発表しました。
- • 今回の価格変更は、7月20日のモデルの本番環境対応ステータスへの移行に続くものです。
- • この値上げは、財務上の損失ではなく、インフラの負荷管理によるものと報告されています。
- • 開発者は、このニュースを受けてローカルハードウェアホスティングとルーティング構成を再検討しています。
本番リリース後にDeepSeek-V4 APIを統合した開発者は、ローカルホスティングや代替のルーティング戦略を検討することで、潜在的なコスト増加に備える必要があります。