1. OpenAI, ChatGPT에 GPT-5.6 통합 및 'Think' 슬라이더와 무제한 무료 텍스트 기능 도입
7월에 출시된 GPT-5.6 모델 제품군의 정식 출시를 바탕으로, OpenAI는 ChatGPT 소비자 경험을 업데이트합니다. 무료 및 Go 사용자는 GPT-5.6 Luna 모델로 업그레이드되며, Plus 및 Pro 구독자는 GPT-5.6 Sol 모델을 사용하게 됩니다. 이번 업데이트는 유료 사용자를 위한 'Think' 슬라이더를 도입하여 추론 깊이를 제어할 수 있게 하며, 다음 주부터 무료 사용자의 텍스트 채팅 속도 제한을 제거합니다.
- • OpenAI는 무료 및 Go 사용자의 기본 모델을 GPT-5.6 Luna로 업그레이드합니다.
- • Plus 및 Pro 구독자는 GPT-5.6 Sol 모델로 업데이트됩니다.
- • 새로운 'Think' 슬라이더를 통해 유료 사용자는 추론 깊이를 조절할 수 있습니다.
- • 다음 주부터 무료 및 Go 사용자의 텍스트 채팅 속도 제한이 해제됩니다.
- • 다음 주부터 무료 및 Go 사용자도 복잡한 쿼리에 대해 'Think' 버튼을 사용할 수 있습니다.
이번 업데이트는 기존 개발자 중심이었던 GPT-5.6 모델을 더 넓은 소비자 기반으로 확장하여, 사용자에게 향상된 추론 능력과 더 유연한 사용 제한을 제공합니다.
2. NVIDIA, 문서 이해를 위한 Nemotron Parse 2.0 출시
NVIDIA의 Nemotron Parse 2.0은 문서 이해 및 데이터 추출 워크플로우를 간소화하도록 설계되었습니다. RGB 문서 이미지와 작업 프롬프트를 입력받아, 이 모델은 제목, 표, 각주와 같은 요소에 대한 공간 주석과 함께 서식이 지정된 텍스트를 생성하여 멀티모달 데이터 큐레이션에 매우 유용합니다.
- • NVIDIA는 문서 이미지를 구조화된 텍스트, 레이아웃 클래스, 경계 상자 및 읽기 순서 정보로 변환하는 Nemotron Parse 2.0을 출시했습니다.
- • 이 모델은 버전 1.2 대비 다국어 지원(CJK 및 인도어 스크립트 포함)을 위해 2만 토큰의 어휘 확장을 특징으로 합니다.
- • 차트를 인식하는 문서 파싱 기능과 향상된 필기 텍스트 추출 기능을 도입했습니다.
- • 이 모델은 상업적 및 비상업적 용도로 모두 사용할 수 있습니다.
개발자는 이 모델을 사용하여 RAG 및 데이터 큐레이션 파이프라인을 위해 문서 이미지에서 구조화된 데이터, 표, 차트를 추출할 수 있습니다.
3. 네이티브 하이브리드 추론 모델 Ling-3.0-tiny 출시
Ling-3.0-tiny는 자원이 제한된 환경을 위해 특별히 구축되었습니다. 네이티브 하이브리드 추론 모델로서 토큰당 13억 개의 파라미터만 활성화하므로, 수학 및 지시 이행 능력을 유지하면서 효율적으로 실행될 수 있습니다.
- • Ling-3.0-tiny는 총 79억 개의 파라미터와 토큰당 13억 개의 활성 파라미터를 가진 네이티브 하이브리드 추론 모델입니다.
- • 이 모델은 자원 민감형 배포를 위해 설계되었으며, 실제 작업, 수학 및 지시 이행을 수행합니다.
- • 출시 첫 주 동안은 무료로 제공됩니다.
개발자는 로컬 또는 엣지 배포를 위한 경량의 자원 효율적인 추론 모델을 사용할 수 있게 됩니다.
4. Gemma-4의 산문체 표현을 줄인 Scotoma-2 파인튜닝 모델
사용자 AesSedai가 개발한 Scotoma-2는 Scotoma V1의 후속 모델입니다. 여러 번의 DPO 세션을 통해 특정 산문체 문제를 해결하고 표준적인 AI 비서 페르소나를 탈피함으로써, Gemma-4-31B-it의 기본 성능을 유지하면서 더 자연스러운 글쓰기를 제공하는 것을 목표로 합니다.
- • Scotoma-2는 'It's not x, it's y'와 같은 일반적인 산문체 표현이나 과도한 형용사 사용을 줄이기 위해 만들어진 Gemma-4-31B-it의 파인튜닝 버전입니다.
- • 제작자는 Heratic을 사용하여 모델을 'abliterate'하고 J-lense 투영을 통해 AI 비서 페르소나를 해체했습니다.
- • 이 모델은 4개의 서로 다른 데이터셋을 사용하여 4번의 별도 DPO 파인튜닝 세션을 거쳤습니다.
- • Scotoma-2 모델의 GGUF 버전은 Hugging Face에서 이용 가능합니다.
더 깔끔하고 정형화되지 않은 텍스트 생성을 원하는 개발자는 글쓰기 작업을 위해 이 파인튜닝된 Gemma-4 모델을 사용할 수 있습니다.
5. CLI 코딩 에이전트 런타임 Herdr, Y Combinator 합류
Herdr은 25,000개의 스타와 340,000회의 다운로드를 기록하며 상당한 관심을 받았습니다. Y Combinator에 합류함에 따라, 제작자는 핵심 런타임을 Apache-2.0 라이선스 하에 오픈소스로 유지하고, 추가적인 클라이언트와 연결 기능을 구축할 계획입니다.
- • AI 에이전트 관리용 개발자 도구인 Herdr이 Y Combinator F26 배치에 합류합니다.
- • Herdr 런타임은 Apache-2.0 라이선스를 따르며 무료 및 오픈소스로 유지됩니다.
- • Herdr은 CLI 코딩 에이전트가 다양한 환경에서 지속적으로 실행될 수 있도록 하는 런타임을 제공합니다.
- • 이 플랫폼은 SSH를 통한 원격 액세스를 지원하는 터미널 사용자 인터페이스(TUI)를 포함합니다.
- • 생태계에는 Raycast, Stream Deck, iOS용 확장을 포함하여 500개 이상의 커뮤니티 제작 플러그인이 포함되어 있습니다.
지속적인 CLI 코딩 에이전트를 위해 Herdr을 사용하는 개발자들은 프로젝트가 오픈소스로 유지되면서 지속적인 지원과 새로운 기능을 기대할 수 있습니다.
6. 1Password, AI 에이전트를 위한 권한 관리(Privileged Access) 출시
과도하게 허용적이고 지속적인 에이전트 자격 증명으로 인한 보안 위험을 해결하기 위해 1Password는 Privileged Access를 출시했습니다. 이 도구는 적시 액세스를 강제하여 자격 증명 가용 기간을 작업에 필요한 정확한 시간으로 제한하고, 감사를 위한 자동 세션 로깅을 제공합니다.
- • 1Password는 인간, 에이전트 및 기계에 대한 상시 액세스를 적시 권한으로 대체하기 위해 1Password Privileged Access를 도입했습니다.
- • 이 도구는 액세스 기간을 특정 작업에 필요한 시간으로 제한하고 모든 세션을 자동으로 기록합니다.
- • 1Password의 2026년 6월 설문조사에 따르면 기술 직원의 53%가 AI 에이전트에게 과도하게 허용적인 액세스 권한을 제공하고 있습니다.
- • 같은 설문조사에서 기술 직원의 40%가 AI 에이전트에게 지속적인 액세스 권한을 부여한다고 응답했습니다.
개발자는 에이전트가 특정 작업 기간 동안만 자격 증명에 액세스할 수 있도록 보장하여 자격 증명 오용 위험을 줄임으로써 에이전트 워크플로우를 보호할 수 있습니다.
7. Zero-Mem, 에이전트 메모리 작업 시 토큰 소비 제거
Zero-Mem은 LLM 에이전트 메모리를 관리하기 위한 매우 효율적인 대안을 제공합니다. 메모리 작업 중 LLM 호출 요구 사항을 제거함으로써, 이 프레임워크는 경쟁력 있는 작업 성능을 유지하면서 토큰 오버헤드와 지연 시간을 크게 줄입니다.
- • Zero-Mem은 메모리 작업 중 LLM 호출 및 LLM 토큰 소비의 필요성을 제거합니다.
- • 이 프레임워크는 기존 메모리 관리 방식과 비교하여 경쟁력 있는 성능을 달성합니다.
개발자는 표준 LLM 기반 메모리 검색의 API 비용과 지연 시간 없이 지속적인 메모리를 가진 에이전트를 구축할 수 있습니다.
8. PDF 파서 벤치마크, 복잡한 문서에 대한 8개 도구 평가
8개의 PDF 파서에 대한 포괄적인 평가는 처리 속도와 정확성 사이의 균형을 강조합니다. Chandra는 LaTeX 및 필기체와 같은 복잡한 요소를 성공적으로 파싱했지만, L4 GPU에서 페이지당 91초가 소요되었습니다. 반면, LightOnOCR-1B와 같은 더 빠른 대안(페이지당 7.9초)은 환각 현상과 텍스트 누락을 겪었으며, 이는 개발자들에게 RAG 파이프라인에서 속도와 품질의 균형을 맞추기 위한 명확한 데이터를 제공합니다.
- • 벤치마크 비교 대상 PDF 파서: MinerU 2.5, Granite-Docling, PaddleOCR-VL, XBerg 1.0, HURIDOCS PDLA v0.0.35, LiteParse 2.11, Chandra, LightOnOCR-1B.
- • Chandra는 HTML 표, LaTeX, 필기체를 포함한 14가지 테스트 케이스를 모두 올바르게 파싱하며 가장 높은 성능을 달성했습니다.
- • Chandra는 L4 GPU에서 페이지당 91초의 처리 시간이 필요했습니다.
- • XBerg, LiteParse, PDLA는 필기체 처리에 실패했으며, Granite-Docling은 원시 DocTag를 출력에 노출했습니다.
- • LightOnOCR-1B는 L4 GPU에서 페이지당 7.9초 만에 처리했지만, 필기체에 대한 환각 현상과 문장 중간의 텍스트 누락을 보였습니다.
- • 벤치마크 소스 코드와 테스트 파일은 GitHub 저장소 alaamroue/pdf-parser-bench에서 확인할 수 있습니다.
RAG 파이프라인을 구축하는 개발자는 이 벤치마크를 사용하여 표, LaTeX 및 필기체를 처리하는 데 가장 정확한 PDF 파서를 선택할 수 있습니다.
9. VulcanBench, 장기 에이전트 벤치마크의 불일치 강조
내부 모델 벤치마크와 VulcanBench와 같은 독립적인 평가 사이의 성능 차이는 점점 더 실행 시간 예산 때문인 것으로 분석됩니다. 내부 평가에서는 실행당 최대 12시간까지 허용할 수 있지만, 표준 벤치마크는 실행 시간을 45~60분으로 제한합니다. 이로 인해 HubSpot, Zendesk, Fin과 같은 기업들은 원시 토큰 사용량이 아닌 성공적인 해결을 기준으로 하는 과금 모델을 구현하게 되었습니다.
- • 독립 벤치마크인 VulcanBench는 Qwen 3.8-Max가 최선의 설정에서 중간 정도, 기본 설정에서 최하위 성능을 보였으며, 이는 Alibaba의 내부 12시간 실행 결과와 대조적임을 발견했습니다.
- • Long-Horizon-Terminal-Bench의 7월 보고서에 따르면 해결되지 않은 에이전트 실행의 79%가 타임아웃으로 인해 발생했습니다.
- • Claude Opus 5는 높은 노력의 실행이 자주 타임아웃되기 때문에 높은 노력 설정보다 낮은 노력 설정에서 더 나은 성능을 보였습니다.
- • 이 보고서는 모든 시도에 대한 총 지출을 수락 검사를 통과한 작업 수로 나누는 '성공적인 작업당 비용'을 지표로 채택할 것을 권장합니다.
- • DeepSeek-V4-Flash-0731은 백만 입력 토큰당 $0.14, 출력 토큰당 $0.28인 반면, Qwen 3.8-Max는 $2/$6, Kimi K3는 $3/$15입니다.
자율 에이전트를 구축하는 개발자는 높은 노력의 실행이 프로덕션에서 자주 타임아웃되기 때문에 원시 벤치마크 점수가 아닌 성공적인 작업당 비용을 기준으로 모델을 평가해야 합니다.
10. Vast, Hugging Face 스토리지 버킷 지원 추가
Hugging Face 스토리지 버킷의 최근 출시를 바탕으로, Vast는 해당 서비스를 자사 플랫폼에 통합했습니다. 개발자는 이제 이 버킷을 GPU 인스턴스에 직접 마운트하여 수동 전송 없이 학습 및 추론을 위한 데이터에 직접 액세스할 수 있습니다.
- • Vast는 Hugging Face 스토리지 버킷을 클라우드 연결로 통합했습니다.
- • 이는 Hugging Face 스토리지 서비스의 최근 공식 출시를 따른 것입니다.
- • 사용자는 이제 Vast 인스턴스와 Hugging Face 버킷 간에 데이터셋을 가져오고 결과를 직접 보낼 수 있습니다.
이번 통합을 통해 개발자는 최근 출시된 Hugging Face 스토리지 서비스를 Vast GPU 워크플로우 내에서 직접 활용하여 데이터 파이프라인의 마찰을 줄일 수 있습니다.
11. Baseten, 공식 Hugging Face 추론 제공업체로 선정
이번 새로운 파트너십을 통해 Baseten의 추론 서비스는 Hugging Face 모델 페이지에서 직접 액세스할 수 있게 되었습니다. 개발자는 기존 Hugging Face 토큰을 활용하여 고성능 모델을 실행하고 평가 및 배포 프로세스를 간소화할 수 있습니다.
- • Baseten은 이제 Hugging Face 플랫폼의 공식 추론 제공업체입니다.
- • 사용자는 Hugging Face 모델 페이지에서 직접 Baseten을 통해 Kimi K3, DeepSeek V4 Flash, GLM-5.2를 포함한 모델을 실행할 수 있습니다.
- • 이 통합을 통해 사용자는 Hugging Face 토큰을 사용하여 Baseten의 추론 서비스에 액세스할 수 있습니다.
개발자는 Hugging Face에서 직접 Baseten의 인프라를 사용하여 Kimi K3 및 DeepSeek V4 Flash와 같은 인기 모델을 빠르게 배포하고 테스트할 수 있습니다.
12. 개발자, vLLM 서빙 스택을 C++20으로 포팅
vllm.cpp 프로젝트는 LLM 서빙을 위한 매우 최적화된 경량 대안을 제공합니다. 핵심 vLLM 스택을 C++20으로 포팅함으로써, 이 프로젝트는 거대한 Python 의존성 발자국을 제거하여 성능 동등성을 유지하면서 엣지 배포나 자원이 제한된 서버에 이상적입니다.
- • vllm.cpp는 Python 의존성을 제거하고 66 MiB 바이너리를 생성하는 vLLM 서빙 스택의 독립적인 C++20 포트입니다.
- • 이 엔진은 연속 배치, 블록 페이징 KV, 자동 접두사 캐싱, 추측 디코딩 및 OpenAI 호환 서버를 지원합니다.
- • safetensors, GGUF, NVFP4, k-quants, i-quants, fp8 및 bf16 형식을 지원합니다.
- • 하드웨어 지원에는 CUDA, CPU(AVX-512 및 Arm i8mm), Metal 및 부분적인 Vulkan 지원이 포함됩니다.
- • DGX Spark 하드웨어에서의 벤치마크는 다양한 동시성 수준에서 vLLM과 성능 동등성을 보여줍니다.
- • 현재 제한 사항으로는 다중 GPU 지원 없음, 서버 내 LoRA 통합 없음, ROCm 지원 없음이 있습니다.
개발자는 9 GiB Python 가상 환경의 오버헤드 없이 자원이 제한된 환경에서 고처리량 LLM 서빙을 배포할 수 있습니다.
13. NVIDIA, 음성 모델의 로컬 배포를 위한 NeMo-Speech.cpp 출시
Nemotron 3.5 ASR 및 NemotronLabs-VoiceChat-11B와 같은 모델의 출시를 바탕으로, NVIDIA는 로컬 배포를 간소화하기 위해 NeMo-Speech.cpp를 도입했습니다. 이 새로운 런타임을 통해 개발자는 GGUF 양자화를 사용하여 소비자 하드웨어에서 NVIDIA의 음성 제품군(ASR, TTS, 코덱 모델 포함)을 로컬로 실행할 수 있으며, 단순한 모델 가용성을 넘어 완전한 온디바이스 실행 파이프라인으로 나아갈 수 있습니다.
- • NeMo-Speech.cpp는 NVIDIA 음성 스택의 로컬 온디바이스 실행을 위한 통합 런타임을 제공합니다.
- • 이 스택은 Nemotron 3.5 ASR 및 Magpie-TTS를 포함하여 이전에 출시된 모델의 GGUF 양자화 버전을 지원합니다.
- • 이 릴리스는 클라우드 의존성 없이 저지연 로컬 음성 애플리케이션을 가능하게 합니다.
- • Nemotron Speech Streaming EN 0.6B, Parakeet CTC 1.1B, Parakeet TDT 0.6B v3 및 NanoCodec에 대한 지원이 포함됩니다.
개발자는 이제 NVIDIA가 이전에 출시한 모델을 활용하여 클라우드 API에 의존하지 않고 소비자 하드웨어에서 완전한 고성능 음성 파이프라인을 로컬로 배포할 수 있습니다.
14. 개발자, NVIDIA Nemotron-Omni를 위한 순수 MLX 런타임 구축
오픈소스 nemotron-omni-mlx 프로젝트는 macOS에서 텍스트 부분만 로드되는 NVIDIA Nemotron-Omni의 주요 제한 사항을 해결합니다. 비전 및 오디오 타워를 MLX로 구현함으로써, 개발자는 이제 Apple Silicon에서 높은 토큰 처리량과 관리 가능한 메모리 사용량으로 전체 멀티모달 로컬 추론을 실행할 수 있습니다.
- • 한 개발자가 macOS에서 NVIDIA Nemotron-Omni의 비전 및 오디오 타워를 지원하기 위해 순수 MLX 런타임(nemotron-omni-mlx)을 만들었습니다.
- • 이 구현은 비전 및 오디오 타워를 bf16 정밀도로 실행하면서 mlx-community 4비트 양자화 언어 모델을 지원합니다.
- • M5 Max 칩에서 이 모델은 이미지 사용 시 67.7 토큰/초, 오디오 사용 시 147 토큰/초, 텍스트 전용 작업 시 152 토큰/초를 달성합니다.
- • 이 구현은 이미지 경로에서 22.1 GB의 최대 메모리 사용량에 도달하여 32 GB Mac 시스템과 호환됩니다.
- • 이 프로젝트는 MIT 라이선스이며 GitHub에서 이용 가능하고, NVIDIA의 PyTorch 참조 모델에 대해 23개 구성 요소 중 23개가 검증을 통과했습니다.
Mac 기반 개발자는 NVIDIA의 멀티모달 Nemotron-Omni 모델을 로컬에서 고성능으로 실행할 수 있으며, macOS에서 텍스트 부분만 로드되는 제한을 우회할 수 있습니다.
15. DeepSeek-V4 API, 가격 인상 예정
DeepSeek-V4 API가 7월 20일에 프로덕션 릴리스로 전환된 이후, 회사는 향후 가격 인상 계획을 알렸습니다. 새로운 일정은 아직 미정이지만, 개발자들은 이러한 변화의 영향을 완화하기 위해 로컬 하드웨어 호스팅으로 전환하거나 모델 라우팅 구성을 조정하는 것을 이미 고려하고 있습니다.
- • DeepSeek는 V4 시리즈에 대한 상당한 API 가격 인상 계획을 발표했습니다.
- • 이번 가격 변경은 7월 20일 모델이 프로덕션 준비 상태로 전환된 이후에 이루어집니다.
- • 이번 인상은 재정적 손실보다는 인프라 부하 관리 때문인 것으로 알려졌습니다.
- • 개발자들은 이 소식에 대응하여 로컬 하드웨어 호스팅 및 라우팅 구성을 재고하고 있습니다.
프로덕션 릴리스 이후 DeepSeek-V4 API를 통합한 개발자들은 이제 로컬 호스팅이나 대체 라우팅 전략을 모색하여 잠재적인 비용 증가에 대비해야 합니다.