1. Z AI, GLM-5.2 오픈 웨이트 모델 공식 출시
6월 13일 발표에 이어 Z AI가 GLM-5.2 오픈 웨이트 모델을 공식 출시했습니다. 7,440억 개의 파라미터를 가진 이 Mixture of Experts 모델은 MIT 라이선스로 제공되어 개발자가 상업적 용도로 직접 호스팅할 수 있습니다. 이전에 발표된 100만 토큰 컨텍스트 윈도우 외에도, Artificial Analysis Intelligence Index v4.1에서 51점을 기록한 벤치마크 데이터와 자체 API 가격 정보가 포함되었습니다.
- • GLM-5.2는 MIT 라이선스 하에 오픈 웨이트 모델로 제공됩니다.
- • 이 모델은 총 7,440억 개의 파라미터와 4,000억 개의 활성 파라미터를 갖추고 있습니다.
- • Artificial Analysis Intelligence Index v4.1에서 51점을 기록했습니다.
- • 자체 API 가격은 입력 토큰 100만 개당 1.40달러, 출력 토큰 100만 개당 4.40달러로 책정되었습니다.
- • 로컬 실행을 위한 양자화 버전이 Hugging Face에 공개되었습니다.
개발자들은 이제 API를 통한 테스트 단계를 넘어, 현재 오픈 웨이트 벤치마크를 선도하는 최첨단 추론 모델을 직접 호스팅할 수 있게 되었습니다.
2. OpenAI, ChatGPT용 양방향 오디오 모델 GPT-Bidi-1 준비 중
OpenAI의 GPT-Bidi-1 개발은 음성 에이전트가 대화 흐름을 처리하는 방식의 큰 변화를 예고합니다. 오디오를 양방향으로 처리함으로써 기존 음성 파이프라인의 어색한 턴테이킹 지연을 제거하여 매우 자연스러운 대화형 인터페이스를 구현할 수 있게 되었습니다.
- • GPT-Bidi-1은 ChatGPT 음성 모드를 위해 설계된 양방향 오디오 모델입니다.
- • 이 모델은 동시에 듣고 말할 수 있으며 실시간으로 사용자의 중단을 수용합니다.
- • 사용자 입력에 따라 문장 중간에 말하기 방식을 조정할 수 있습니다.
개발자들은 향후 자연스럽고 중단 가능하며 실시간 음성 상호작용을 지원하는 API 기능을 기대할 수 있습니다.
3. Soniox, 저지연 스트리밍 음성 인식(STT) API 출시
Soniox의 새로운 실시간 모델은 정확도와 지연 시간 측면에서 파레토 최적(Pareto frontier)을 달성했습니다. 낮은 단어 오류율(WER)로 즉각적인 전사를 제공하는 이 API는 대화형 음성 애플리케이션 및 실시간 번역 서비스에 최적화되어 있습니다.
- • Soniox v5 Real-Time은 Soniox 콘솔을 통해 오디오 1,000분당 2달러에 제공됩니다.
- • 이 모델은 최종 전사 시 음성 종료 후 0.05초 만에 4.5%의 단어 오류율(WER)을 달성합니다.
- • 60개 이상의 언어를 지원하며 실시간 번역 및 언어 식별 기능을 제공합니다.
- • 이번 출시는 기존 비스트리밍 모델인 Soniox v5 Async를 보완합니다.
개발자들은 다른 독점 API보다 훨씬 저렴한 비용으로 고정밀 실시간 전사 및 번역 기능을 음성 에이전트에 통합할 수 있습니다.
4. LoopCoder-v2 7B 코드 모델, SWE-bench Verified에서 64.4점 기록
LoopCoder-v2는 테스트 타임 컴퓨팅 스케일링을 활용하여 파라미터 크기 대비 뛰어난 성능을 제공합니다. 연구진은 2루프 구성이 잠재적 정교화에 최적의 균형을 제공하며, 3루프를 추가할 경우 성능 향상이 미미하거나 오히려 저하된다는 점을 확인했습니다.
- • LoopCoder-v2는 Parallel Loop Transformer 아키텍처를 기반으로 구축된 7B 명령어 튜닝 코드 모델입니다.
- • 2루프 구성을 사용하여 SWE-bench Verified 벤치마크에서 64.4점을 기록했습니다.
- • 100개 이상의 프로그래밍 언어를 포함하는 18조 개의 토큰으로 처음부터 학습되었습니다.
- • 이 아키텍처는 크로스 루프 위치 오프셋과 공유 KV 게이트 슬라이딩 윈도우 어텐션을 사용하여 일정한 캐시 풋프린트를 유지합니다.
- • 모델과 관련 코드는 Hugging Face에서 공개적으로 이용 가능합니다.
개발자들은 복잡한 소프트웨어 엔지니어링 작업에서 훨씬 큰 모델들을 능가하는 고효율 오픈 웨이트 코딩 모델을 사용할 수 있게 되었습니다.
5. OpenAI Codex 브라우저 자동화, Chrome DevTools Protocol 지원 추가
OpenAI Codex의 브라우저 작업 자동화 초기 출시 이후, 이제 Chrome DevTools Protocol에 대한 옵트인 지원이 포함되었습니다. 이 업데이트를 통해 에이전트는 실시간 브라우저 상호작용을 수행하고, JavaScript 성능을 프로파일링하며, 웹사이트를 실시간으로 수정할 수 있어 웹 자동화 개발자들에게 더 큰 유용성을 제공합니다. 이 기능은 현재 초기 단계이며 EEA, 영국, 스위스에서는 사용할 수 없습니다.
- • OpenAI Codex는 이제 설정 옵트인을 통해 Chrome DevTools Protocol(CDP)을 지원합니다.
- • 이 기능을 통해 에이전트는 JavaScript 성능을 프로파일링하고 웹사이트를 실시간으로 수정할 수 있습니다.
- • 현재 EEA, 영국, 스위스 사용자는 액세스할 수 없습니다.
- • 초기 단계의 기능으로 신중한 프롬프팅이 필요하며 현재 성능 문제를 겪고 있습니다.
이 업데이트는 개발자에게 네이티브 디버깅 및 실시간 수정 도구를 제공하여 이전 릴리스에서 도입된 브라우저 기반 자동화 에이전트의 기능을 크게 향상시킵니다.
6. Vercel, 오픈 소스 AI 에이전트 프레임워크 'Eve' 출시
Vercel의 새로운 프레임워크는 디렉토리 내의 파일을 에이전트 기능에 직접 매핑하여 에이전트 개발을 단순화합니다. 보안 연결, 다중 채널 통신, 평가 추적에 대한 내장 지원을 통해 'eve'는 클라우드에 에이전트를 배포하는 개발자에게 강력한 프로덕션급 기반을 제공합니다.
- • eve는 AI 에이전트 구축 및 확장을 위한 Apache-2.0 라이선스의 오픈 소스 프레임워크입니다.
- • 이 프레임워크는 에이전트를 디스크상의 디렉토리로 정의하는 파일시스템 우선 아키텍처를 사용합니다.
- • 내장 기능에는 내구성 있는 실행, 샌드박스 컴퓨팅, 인간 개입 승인(human-in-the-loop)이 포함됩니다.
- • 개발자는 `npx create-eve@latest`를 사용하여 새 에이전트를 스캐폴딩하고 Vercel에 직접 배포할 수 있습니다.
- • Vercel은 현재 eve 프레임워크를 사용하여 100개 이상의 에이전트를 프로덕션 환경에서 운영하고 있습니다.
개발자들은 내장된 내구성 있는 실행(durable execution)과 샌드박스 컴퓨팅을 갖춘 간단한 디렉토리 기반 아키텍처를 사용하여 프로덕션 준비가 완료된 에이전트를 구축할 수 있습니다.
7. Claude Design, 양방향 Claude Code 동기화로 대폭 개편
초기 프리뷰 이후 2개월 만에 Anthropic은 Claude Design의 높은 토큰 소비와 관련된 주요 개발자 불편 사항을 해결했습니다. 시각적 편집기와 공유 사용 제한을 도입함으로써, 이 업데이트는 불필요한 모델 턴을 최소화하는 동시에 컴포넌트 잠금과 같은 엔터프라이즈급 규정 준수 기능을 제공합니다.
- • Claude Design은 이제 Claude Code와의 양방향 통합을 지원하여 터미널 기반 디자인 시스템 동기화가 가능합니다.
- • 이 업데이트를 통해 조직은 GitHub, 디자인 파일 또는 원본 업로드에서 컴포넌트를 가져올 수 있습니다.
- • Anthropic은 Claude Design, 채팅, Cowork, Claude Code 간에 사용 제한을 공유하여 토큰 소모 문제를 해결했습니다.
- • 드래그 앤 리사이즈 기능이 있는 새로운 편집기는 레이아웃 조정에 필요한 모델 턴 수를 줄여줍니다.
- • 플랫폼은 Vercel, Replit, Lovable, Canva, Adobe에 대한 내보내기 지원을 추가했습니다.
개발자들은 이제 디자인 시스템을 원활하게 동기화하고 터미널에서 직접 UI 작업을 실행하여 토큰 소비와 수동 핸드오프를 줄일 수 있습니다.
8. AWS, 네이티브 MCP 지원을 포함한 Context Intelligence Stack 출시
AWS는 수동 지식 큐레이션을 제거하도록 설계된 스택으로 에이전트 컨텍스트 경쟁에 뛰어들었습니다. S3 Annotations 및 Glue 스킬 자산의 비즈니스 정의를 쿼리 가능한 그래프로 합성함으로써, AWS Context는 에이전트가 MCP를 통해 네이티브로 액세스할 수 있는 안전하고 감사 가능한 런타임 컨텍스트 계층을 제공합니다.
- • AWS Context는 데이터 세트와 비즈니스 규칙 전반의 관계를 자동으로 추론하는 새로운 지식 그래프 서비스입니다.
- • 에이전트는 Bedrock AgentCore 또는 EKS 전반의 에이전트 검색 API 및 MCP 도구를 통해 시스템을 쿼리합니다.
- • 스택에는 S3 Annotations와 AWS Glue Data Catalog의 스킬 자산 프리뷰가 포함됩니다.
- • 쿼리는 안전한 데이터 액세스를 위해 호출 사용자의 IAM 및 Lake Formation 권한을 상속합니다.
- • 메타데이터는 Apache Iceberg 형식으로 Amazon S3 Tables에 게시됩니다.
AWS에 에이전트를 배포하는 개발자는 Bedrock과 통합되고 MCP를 통해 도구를 노출하는 관리형 컨텍스트 계층을 활용할 수 있습니다.
9. Cursor Origin, 에이전트 네이티브 Git Forge로 출시
Origin 플랫폼의 초기 발표를 바탕으로, Cursor가 공식적으로 Cursor Origin을 출시했습니다. 이 포지는 자동화된 브랜칭, 커밋, 코드 리뷰를 포함하여 AI 에이전트의 특정 요구 사항을 처리하도록 설계되었으며, 에이전트 규모의 개발을 위한 전용 환경을 제공합니다.
- • Cursor Origin은 AI 에이전트를 위한 Git 호환 포지로 정식 출시되었습니다.
- • 이 플랫폼은 클로닝, 브랜칭, 리베이스와 같은 병렬 에이전트 작업을 지원합니다.
- • 에이전트 규모의 개발 파이프라인을 최적화하도록 설계된 AI 소프트웨어 팩토리 역할을 합니다.
개발자들은 이제 자동화된 병렬 워크플로우에 최적화된 리포지토리 호스팅 환경에 코딩 에이전트를 배포할 수 있습니다.
10. Android 17, AI 에이전트를 위한 네이티브 MCP 및 AppFunctions 도입
Android 17에 네이티브 Model Context Protocol 지원이 추가된 것은 모바일 에이전트 아키텍처의 큰 진전을 의미합니다. 온디바이스 모델이 애플리케이션 기능을 검색하고 실행하는 방식을 표준화함으로써, Google은 개발자가 에이전트 친화적인 모바일 애플리케이션을 훨씬 쉽게 구축할 수 있도록 만들고 있습니다.
- • Android 17은 AppFunctions 및 Android MCP(Model Context Protocol) 지원을 도입합니다.
- • 이 기능들을 통해 애플리케이션은 온디바이스 에이전트를 위한 오케스트레이션 가능한 도구를 노출할 수 있습니다.
- • Google은 이번 릴리스를 깊게 통합된 플랫폼 전반의 지능형 시스템으로의 전환으로 포지셔닝하고 있습니다.
모바일 개발자는 자신의 앱 기능을 시스템 수준의 AI 에이전트가 네이티브로 호출할 수 있는 오케스트레이션 가능한 도구로 노출할 수 있습니다.
11. Lemonade v10.8, 동적 VRAM 관리 및 MCP 게이트웨이 추가
v10.7의 하드웨어 가속 개선을 바탕으로, Lemonade v10.8은 유휴 모델을 자동으로 언로드하고 KV 캐시 크기를 줄이는 동적 VRAM 관리를 추가했습니다. 또한 이 업데이트는 로컬 모델을 도구로 노출하기 위한 POST /mcp의 네이티브 MCP 게이트웨이를 도입했으며, Windows에서의 NVIDIA Blackwell arm64 CUDA 및 AMD ROCm에 대한 지원을 확대했습니다.
- • 유휴 모델을 자동으로 언로드하여 메모리 사용량을 최적화하는 동적 VRAM 관리를 도입했습니다.
- • 도구 노출, 채팅, 이미지 생성을 위해 POST /mcp에 MCP 게이트웨이를 추가했습니다.
- • OpenAI 호환 제공업체를 위한 제공업체 독립적 오프로드 백엔드를 포함합니다.
- • 플랫폼 지원을 확장하여 NVIDIA Blackwell arm64 CUDA 및 Windows용 AMD ROCm을 포함합니다.
개발자들은 이제 자동화된 GPU 메모리 관리의 이점을 누리면서 로컬 모델을 MCP 인식 호스트에 통합할 수 있습니다.
12. 백악관, Claude Fable 5 재출시 조건 설정
수출 통제 지침으로 인한 Claude Fable 5의 초기 중단에 이어, 미국 정부는 복구 경로를 명확히 했습니다. Anthropic은 사이버, 화학, 생물학적 쿼리와 관련된 탈옥 취약점에 대해 강력하고 사전 예방적인 가드레일을 입증해야 모델을 다시 온라인으로 전환할 수 있습니다. Anthropic은 우려가 과장되었다고 주장하지만, 회사가 이러한 새로운 연방 테스트 요구 사항을 충족하기 위해 노력하는 동안 모델은 오프라인 상태로 유지됩니다.
- • 미국 정부는 Claude Fable 5가 재출시되기 전에 Anthropic이 사전 예방적 탈옥 방지 조치를 구현하도록 명령했습니다.
- • 이 요구 사항은 수출 통제 지침 및 보안 우려로 인해 6월 13일 모델이 전 세계적으로 중단된 데 따른 것입니다.
- • Anthropic은 사용자가 사이버, 화학, 생물학적 기능에 대한 가드레일을 우회할 수 있게 하는 취약점을 해결해야 합니다.
- • Anthropic이 행정부의 사전 예방적 테스트 요구를 충족하기 위해 노력하는 동안 모델은 오프라인 상태로 유지됩니다.
Claude Fable 5의 복귀를 기다리는 개발자들은 이제 서비스가 복구되기 전에 Anthropic이 해결해야 할 규제 장벽을 명확히 알게 되었습니다.
13. Llama.cpp, 전체 수명 주기 관리를 포함하도록 모델 API 확장
이달 초 모델 핫스왑 API 도입에 이어, Llama.cpp는 API 기능을 전체 모델 수명 주기 관리까지 확장하는 새로운 풀 리퀘스트를 병합했습니다. 개발자들은 이제 서버 재시작 없이 단순한 교체를 넘어 포괄적인 모델 관리를 위해 프로그래밍 방식으로 모델을 로드, 언로드 및 다운로드할 수 있습니다.
- • 기존 핫스왑 API를 확장하여 로드, 언로드 및 다운로드 기능을 포함합니다.
- • 풀 리퀘스트 #23976은 완전한 프로그래밍 방식의 모델 수명 주기 관리를 가능하게 합니다.
- • 서버 재시작 없이 동적인 모델 관리가 가능합니다.
- • 현재 이러한 새로운 기능을 위한 사용자 인터페이스는 제공되지 않습니다.
이 업데이트는 API 호출을 통해 모델 수명 주기를 완전히 제어할 수 있게 함으로써 개발자가 더 동적이고 다중 모델을 사용하는 로컬 애플리케이션을 구축할 수 있도록 합니다.
14. Claw-SWE-Bench 출시, 코딩 에이전트 하네스 성능 격리
Artificial Analysis Coding Agent Index와 같은 초기 벤치마크가 결합된 모델-하네스 쌍의 성능에 초점을 맞춘 반면, Claw-SWE-Bench는 하네스 계층을 독립적으로 평가하는 표준화된 프레임워크를 제공합니다. 동일한 조건에서 래퍼를 테스트함으로써 개발자는 기본 모델과 관계없이 상호작용 방식과 래퍼 로직이 작업 성공 및 API 비용에 미치는 영향을 격리할 수 있습니다.
- • Claw-SWE-Bench는 기본 모델로부터 하네스 성능을 격리합니다.
- • 8개 언어와 43개 리포지토리에 걸쳐 350개의 실제 GitHub 이슈를 사용합니다.
- • 1시간의 시간 제한과 단일 시도를 포함한 고정된 조건에서 하네스를 평가합니다.
- • 채점은 에이전트 출력 형식보다는 리포지토리 파일 변경 사항에 중점을 둡니다.
- • 평가 비용을 절감하기 위해 80개의 작업이 포함된 Lite 버전을 포함합니다.
이 벤치마크를 통해 개발자는 전체 모델-하네스 조합을 평가하는 기존 벤치마크를 보완하면서 하네스 계층의 영향을 격리하여 에이전트 아키텍처를 최적화할 수 있습니다.
15. 헤드리스 스크린샷 루프, 로컬 코딩 에이전트를 위한 시각적 디버깅 활성화
Claude Code와 로컬 모델 모두 처음에는 레이트레이싱 FPS 데모를 한 번에 작성하는 데 어려움을 겪었지만, 시각적 피드백을 도입하자 결과가 바뀌었습니다. 에이전트가 스크린샷을 트리거하고 코드의 시각적 출력을 검사하도록 함으로써, 개발자는 토큰 소비가 증가한다는 단점은 있지만 로컬 모델의 문제 해결 능력을 크게 향상시킬 수 있습니다.
- • 스크린샷 트리거가 있는 헤드리스 모드를 추가하여 코딩 에이전트를 위한 재귀적 시각적 디버깅 루프를 활성화했습니다.
- • 이 패턴을 통해 로컬 Qwen3.6 27B 에이전트(codehamr)와 Claude Code가 C 레이트레이싱 FPS 데모를 작성할 수 있었습니다.
- • 에이전트는 스크린샷을 사용하여 렌더링 결과를 검사하고 버그를 식별하며 수정 사항을 반복했습니다.
- • 시각적 피드백 루프는 토큰 사용량, 런타임 및 실제 소요 시간을 증가시킵니다.
개발자들은 이 시각적 피드백 루프 패턴을 구현하여 더 작고 로컬인 모델이 그렇지 않으면 실패했을 복잡한 UI 및 렌더링 작업을 해결하도록 도울 수 있습니다.
16. 최적화된 Gemma 4 WebGPU 커널, M4 Max에서 초당 255토큰 달성
이번 릴리스는 고성능 클라이언트 측 LLM 실행의 실행 가능성을 보여줍니다. WebGPU 커널을 활용함으로써 개발자는 클라우드 API와 비슷하거나 그 이상의 속도로 브라우저에서 로컬로 Gemma 4를 실행할 수 있으며, 지연 시간이 없고 개인 정보를 보호하는 웹 애플리케이션을 위한 새로운 가능성을 열어줍니다.
- • 최적화된 Gemma 4 WebGPU 커널은 M4 Max 프로세서에서 초당 약 255토큰을 달성했습니다.
- • 데모와 커널은 Hugging Face에 공개되었습니다.
- • 이 구현은 google/gemma-4-E2B-it-qat-mobile-transformers 모델을 사용합니다.
- • 최적화 작업은 Fable 5가 종료되기 전에 완료되었습니다.
개발자는 서버 측 추론 비용을 발생시키지 않고 클라이언트 하드웨어에서 고속 로컬 브라우저 내 LLM 기능을 배포할 수 있습니다.
17. Anthropic, 계획된 Claude Agent SDK 과금 변경 일시 중단
Claude Agent SDK를 위한 새로운 크레딧 기반 과금 시스템 도입에 관한 5월 13일 발표 이후, Anthropic은 이러한 변경 사항을 일시 중단하기로 결정했습니다. 회사가 에이전트 워크플로우를 더 잘 지원하기 위해 가격 모델을 재평가함에 따라, 개발자들은 계획되었던 별도의 토큰 기반 구조가 아닌 표준 API 요금으로 계속 청구됩니다.
- • Anthropic은 6월 15일 구현 예정이었던 Claude Agent SDK에 대한 별도의 토큰 기반 과금 구조를 일시 중단했습니다.
- • Agent SDK 사용량은 계속해서 표준 API 요금으로 청구됩니다.
- • 회사는 개발자 요구 사항에 더 잘 맞추기 위해 가격 계획을 재평가하고 있습니다.
이번 중단은 계획된 비용 구조 변경을 되돌리는 것으로, Anthropic이 가격 전략을 재검토하는 동안 개발자들에게 표준 API 요금으로 Claude Agent SDK에 대한 지속적인 액세스를 제공합니다.