1. Anthropic, Claude 5.5 제품군에 새로운 Sonnet 모델 추가
Anthropic은 지난주 출시된 플래그십 모델 Opus 5.5를 기반으로 Claude 5.5 모델 제품군을 확장하여 Claude Sonnet 5.5를 발표했습니다. Sonnet 5.5는 에이전트 코딩 기능에서 비약적인 발전을 이루었으며, 이전 모델인 Sonnet 5의 10.3% 대비 Terminal-Bench 4.0에서 70.6%의 점수를 기록했습니다. 가격은 기존 Sonnet 5와 동일하게 유지되지만, 새로운 모델은 표준 작업에서 30% 더 빠르고 토큰 효율성이 높습니다. 다만, 개발자는 최대 추론 작업 시 토큰 소비량이 증가할 수 있다는 점을 고려해야 합니다.
- • Claude Sonnet 5.5는 Artificial Analysis Intelligence Index에서 56점을 기록하며 전체 2위를 차지했습니다.
- • 가격은 Sonnet 5와 동일하게 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러입니다.
- • Terminal-Bench 4.0에서의 에이전트 코딩 성능은 Sonnet 5의 10.3%에서 70.6%로 향상되었습니다.
- • 이 모델은 Sonnet 5보다 30% 더 빠르게 실행되며 100만 토큰의 컨텍스트 윈도우를 유지합니다.
- • 현재 AWS, Google Cloud, Azure에서 데이터 보존 옵션 없이 사용할 수 있습니다.
이전 세대와 새로운 Opus 5.5 플래그십 모델 사이의 성능 격차를 메우는, 에이전트 워크플로우를 위한 더 빠르고 뛰어난 성능의 미드티어 모델을 제공합니다.
2. ElevenLabs, Eleven v4 및 v4 Turbo TTS 모델 출시
ElevenLabs는 최신 텍스트 음성 변환(TTS) 모델인 Eleven v4와 Eleven v4 Turbo를 출시했습니다. Eleven v4는 언어 지원을 90개 이상으로 확대했으며, 생성 처리량은 v3 대비 거의 두 배인 초당 73.4자로 증가했습니다. 이 모델을 통해 개발자는 10초 분량의 오디오 샘플로 음성을 복제할 수 있으며, [한숨]이나 [속삭임]과 같은 인라인 텍스트 큐를 통해 세밀한 감정 제어가 가능합니다. Eleven v4는 현재 Artificial Analysis Provider Voice TTS Arena 리더보드에서 1위를 차지하고 있으며, 가격은 100만 자당 80달러입니다.
- • Eleven v4는 90개 이상의 언어를 지원하며(v3의 70개 이상에서 확대), Artificial Analysis Provider Voice TTS Arena 리더보드에서 1위를 기록했습니다.
- • 이 모델은 초당 73.4자를 처리하여 Eleven v3의 생성 속도를 거의 두 배로 높였습니다.
- • Eleven v4 Turbo는 실시간 대화형 애플리케이션을 위한 즉각적인 응답을 지원합니다.
- • 이 모델들은 10초 오디오 샘플로 고품질 음성 복제를 가능하게 합니다.
- • 개발자는 스크립트에 [한숨]이나 [속삭임]과 같은 텍스트 큐를 직접 삽입하여 음성 출력 스타일과 감정을 제어할 수 있습니다.
- • Eleven v4의 가격은 100만 자당 80달러로 책정되었습니다.
개발자는 고급 스크립트 기반 감정 제어를 통해 90개 이상의 언어로 매우 사실적이고 즉각적인 음성 애플리케이션을 구축할 수 있습니다.
3. OpenAI, Cerebras 기반 'Ultrafast' API 모드 액세스 확대
8월 GPT-5.6 Sol을 위한 대기자 명단 전용 티어로 처음 공개된 이후, OpenAI는 'Ultrafast' API 모드의 더 넓은 출시를 준비하고 있습니다. 최근 개발자 플랫폼 및 API 문서 업데이트에 따르면, Cerebras 하드웨어를 활용하여 초당 최대 750개의 출력 토큰 속도를 달성하는 이 서비스가 제한된 평가 단계를 넘어 더 폭넓은 가용성으로 전환되고 있음을 나타냅니다.
- • OpenAI는 'Ultrafast' API 모드에 대한 액세스를 초기 대기자 명단 전용 프리뷰 이상으로 확대하고 있습니다.
- • 이 모드는 Cerebras 하드웨어 기반으로 유지되며 초당 750 출력 토큰 성능을 유지합니다.
- • 이번 개발은 2026년 8월에 발표된 제한된 엔터프라이즈 평가 단계에서 전환되었음을 의미합니다.
- • 표준 추론 대비 14배 빠른 속도는 실시간 애플리케이션을 위한 주요 가치 제안으로 남아 있습니다.
이 고속 티어의 확장은 실시간 대화형 인터페이스와 고주파 에이전트 루프를 구축하는 개발자들에게 즉각적인 LLM 응답을 더욱 쉽게 제공합니다.
4. Fireworks AI, Ember-1 추론 모델 출시
Fireworks AI는 Moonshot AI의 오픈 웨이트 모델인 Kimi K3를 사후 학습하여 구축한 전문 추론 모델 Ember-1을 출시했습니다. Ember-1은 더 짧은 추론 과정을 생성하도록 최적화되어, 프로덕션 A/B 테스트에서 총 토큰 수를 39%, 추론 토큰 수를 71.3% 절감했습니다. 더 짧은 추론 과정에도 불구하고 이 모델은 높은 작업 정확도를 유지하며 Terminal Bench 2.1 및 DeepSWE 1.1에서 Kimi K3 Max를 능가했습니다. 현재 Fireworks 서버리스 API에서 Kimi K3와 동일한 가격으로 연구용 프리뷰로 제공됩니다.
- • Ember-1은 Moonshot AI의 오픈 웨이트 모델인 Kimi K3를 사후 학습하여 구축된 전문 모델입니다.
- • 이 모델은 더 짧은 추론 과정을 생성하도록 설계되어 총 토큰 수를 약 40%, 추론 토큰 수를 71.3% 절감합니다.
- • Fireworks 서버리스 API를 통해서만 연구용 프리뷰로 제공되며, 가중치와 학습 코드는 공개되지 않았습니다.
- • Ember-1은 Terminal Bench 2.1 및 DeepSWE 1.1 벤치마크에서 Kimi K3 Max를 능가했습니다.
- • 가격은 Kimi K3와 동일하게 입력 토큰 100만 개당 3달러, 캐시된 입력 토큰 100만 개당 0.3달러, 출력 토큰 100만 개당 15달러입니다.
개발자들에게 서버리스 API에서 더 저렴하고 빠른 추론 모델을 유사한 작업 정확도로 제공합니다.
5. Jeff, 초고속 로컬 의사결정 모델 출시
오픈 소스 프로젝트 Jeff는 제로샷 분류 및 라우팅을 위해 설계된 초고속 0.8B 및 2B 의사결정 모델 컬렉션을 출시했습니다. AutoJev 레시피에서 포크된 이 모델들은 텍스트 생성을 완전히 우회하여 단일 순방향 패스에서 구조화된 옵션(선택, 예/아니오, 또는 척도)에 대한 보정된 확률을 반환합니다. 로컬에서 실행되는 0.8B 모델은 MLX를 사용하는 Apple M4 Max에서 약 28밀리초, RTX PRO 6000에서 22밀리초의 의사결정 지연 시간을 제공하여 에이전트 루프 내의 고속 라우팅 및 안전 게이팅에 이상적입니다.
- • Jeff는 텍스트 생성 없이 제로샷 분류 작업을 수행하도록 설계된 미세 조정된 Qwen3.5 및 Gemma 4 모델을 제공합니다.
- • 이 모델들은 RTX PRO 6000에서 약 22ms, MLX를 사용하는 Apple M4 Max에서 약 28ms의 의사결정 지연 시간을 달성합니다.
- • Jeff는 선택(최대 255개 옵션), noul(예/아니오 확률), 점수(척도 기반)의 세 가지 구조화된 질문 유형을 지원합니다.
- • Jeff 2B 모델은 BBH, JudgeBench, RAGTruth를 포함한 5개 벤치마크 패널에서 83.1%의 점수를 기록했습니다.
- • 모델 가중치는 Apache 2.0 라이선스로, 학습 코드는 MIT 라이선스로 공개되었습니다.
개발자는 Mac이나 단일 GPU와 같은 소비자용 하드웨어에서 로컬로 고도로 보정된 30ms 미만의 의사결정 및 라우팅 모델을 실행할 수 있습니다.
6. ImaJev-4B 멀티모달 의사결정 모델, JevBench 1위 달성
ImaJev-4B는 텍스트, JSON 및 최대 두 장의 사진을 처리하여 단일 순방향 패스에서 보정된 확률을 출력하도록 설계된 새로 출시된 오픈 웨이트 멀티모달 의사결정 모델입니다. Qwen3.5-4B 위에 LoRA와 사용자 지정 의사결정 헤드를 사용하여 구축된 이 모델은 JevBench에서 1위(67.37점)를 차지했으며 DecisionBench에서 GPT-5.6 Luna를 능가했습니다. ImaJev는 매우 정밀하게 보정되어 환각을 일으키기보다 '알 수 없음'을 출력하는 것을 선호하며, Apache-2.0 라이선스 하에 MLX를 통해 Mac에서 로컬로 실행하거나 단일 GPU에서 실행할 수 있습니다.
- • ImaJev는 Qwen3.5-4B 위에 LoRA와 작은 의사결정 헤드를 사용하여 구축되었으며, 학습에 1,200달러의 GPU 자원만 소요되었습니다.
- • 이 모델은 JevBench에서 67.37점으로 1위를 차지하여 Jev 1.13.0을 능가했으며, DecisionBench에서는 GPT-5.6 Luna보다 앞섰습니다.
- • 텍스트 또는 JSON 레코드와 최대 두 장의 사진을 입력받아 단일 순방향 패스에서 보정된 옵션 확률을 반환합니다.
- • 이 모델은 매우 정밀하게 보정되어 불확실할 때 추측하기보다 '알 수 없음'을 기본값으로 설정합니다.
- • 가중치는 Apache-2.0 라이선스로 공개되었으며 MLX를 사용하는 Mac이나 단일 GPU에서 로컬로 실행할 수 있습니다.
개발자들에게 구조화된 의사결정 및 시각적 검증 작업에 탁월한 경량 로컬 멀티모달 모델을 제공합니다.
7. Nvidia, OpenShell 샌드박스를 포함한 Open Agent Safety Platform 출시
Nvidia는 Linux 재단 산하 Open Secure AI Alliance가 관리하는 오픈 소스 보안 프레임워크인 Open Agent Safety Platform을 출시했습니다. 이 플랫폼은 OpenShell(보안 런타임 샌드박스)과 Sentry(대역 외 감시 장치)라는 두 가지 핵심 구성 요소를 제공하여 자율 AI 에이전트의 보안 위험을 해결합니다. OpenShell은 에이전트 수명 주기를 관리하고 엄격한 네트워크, 파일 시스템 및 프로세스 규칙을 적용합니다. Sentry는 별도의 네트워크 칩에서 실행되어 호스트 CPU나 GPU에 의존하지 않고도 에이전트 동작을 지속적으로 모니터링하고 몇 밀리초 내에 악성 에이전트를 격리합니다.
- • Nvidia는 AI 에이전트 보안을 위한 오픈 소스 프레임워크 및 참조 설계인 Open Agent Safety Platform을 출시했습니다.
- • OpenShell은 Linux, macOS 및 Windows WSL 2에서 Docker, Podman, MicroVM 또는 Kubernetes 전반에 걸쳐 에이전트를 샌드박싱하는 Apache 2.0 라이선스 보안 런타임입니다.
- • Nvidia Sentry는 BlueField-4 DPU에서 실행되는 대역 외 감시 장치로, 에이전트를 지속적으로 모니터링하고 몇 밀리초 내에 격리하도록 설계되었습니다.
- • 이 플랫폼은 기존 CPU 인프라 대비 최대 80% 더 빠른 샌드박스 성능을 제공하는 Nvidia Vera CPU에 최적화되어 있습니다.
- • Anthropic, Salesforce, SAP, Red Hat, SpaceXAI를 포함한 100개 이상의 조직이 이 플랫폼에 협력하고 있습니다.
개발자들에게 AI 에이전트를 샌드박싱하고 승인되지 않은 시스템 또는 네트워크 작업을 실행하지 못하도록 방지하는 보안 커널 수준의 런타임 환경을 제공합니다.
8. Cloudflare, cf Agentic CLI 오픈 베타 출시
Cloudflare는 에이전트 소프트웨어 개발을 위해 특별히 설계된 새로운 CLI인 'cf'를 오픈 베타로 출시했습니다. 이번 출시는 Wrangler 활동의 48%를 에이전트가 주도하는 등 에이전트 사용량이 급증함에 따라 이루어졌습니다. cf CLI는 3,000개 이상의 Cloudflare API 작업을 노출하며(Wrangler의 280개에서 증가), AI 에이전트의 컨텍스트 윈도우 사용을 최적화하기 위해 JSON 인터페이스를 기본값으로 설정합니다. 또한 유형 검사를 위한 TypeScript 기반의 cloudflare.config.ts 구성 형식과 API 설명을 기반으로 에이전트가 올바른 명령을 찾도록 돕는 자연어 cf cli search 명령을 도입했습니다.
- • Cloudflare는 cf CLI를 오픈 베타로 출시했으며, npm i -g cf를 통해 전역적으로 설치할 수 있습니다.
- • 이 CLI는 Wrangler가 지원하는 280개 대비 3,000개 이상의 Cloudflare API 작업을 지원합니다.
- • AI 에이전트의 컨텍스트 사용을 최적화하기 위해 JSON을 기본 인터페이스로 사용합니다.
- • 새로운 cloudflare.config.ts 구성 형식은 TypeScript를 활용하여 유형 검사 및 향상된 에이전트 상호 작용을 제공합니다.
- • 이 CLI는 에이전트가 자연어를 사용하여 적절한 명령을 찾을 수 있는 cf cli search 명령을 제공합니다.
- • Wrangler는 cf 베타 종료 후 18개월 동안 유지 관리 지원을 받게 됩니다.
개발자들이 유형 안전하고 에이전트 친화적인 인터페이스를 사용하여 Cloudflare 인프라를 프로그래밍 방식으로 관리하고 구성하는 에이전트를 구축할 수 있게 합니다.
9. Shopify, 브라우저 기반 AI 에이전트에 결제 프로세스 개방
Shopify는 WebMCP 지원을 결제 프로세스까지 확대하여 브라우저 기반 AI 에이전트가 프로그래밍 방식으로 주문 세부 정보를 업데이트하고 구매를 완료할 수 있도록 했습니다. 구매자의 명시적인 승인을 통해 에이전트는 이제 전체 거래 흐름을 자율적으로 탐색할 수 있습니다. 이번 업데이트는 단순한 제품 검색을 넘어 전체 거래 실행까지 가능하게 함으로써 쇼핑 도우미 및 전자상거래 에이전트를 구축하는 개발자들의 마찰을 크게 줄여줍니다.
- • Shopify는 WebMCP 지원을 결제 프로세스까지 확대하고 있습니다.
- • 이번 업데이트를 통해 브라우저 기반 AI 에이전트가 주문 세부 정보를 업데이트하고 구매를 완료할 수 있습니다.
- • 에이전트가 이러한 작업을 실행하려면 구매자의 명시적인 승인이 필요합니다.
개발자들이 구매자의 승인을 받아 전체 결제 흐름을 프로그래밍 방식으로 완료할 수 있는 자율 쇼핑 에이전트를 구축할 수 있게 합니다.
10. Vespper, 최첨단 Docx MCP 서버 출시
Vespper(YC F24)는 AI 에이전트가 Word(.docx) 문서를 편집할 수 있도록 설계된 새로운 MCP(Model Context Protocol) 서버를 출시했습니다. python-docx와 같은 기존 라이브러리에 의존하는 대신, Vespper는 Word 파일을 편집을 위해 HTML로 변환한 다음 변경 사항을 원래 형식으로 다시 조정합니다. LoRA 어댑터가 포함된 미세 조정된 3-8B 모델로 구동되는 이 도구는 읽기, 검색, 편집이라는 세 가지 핵심 도구를 에이전트에 노출합니다. Vespper는 월 500회 편집의 무료 티어를 제공하며, 데이터 보존 제로(ZDR)를 지원하고 자체 호스팅이 가능합니다.
- • Vespper는 Word 문서(.docx)를 편집을 위해 HTML로 변환한 다음 변경 사항을 원래 파일로 다시 조정하는 MCP 서버입니다.
- • 이 시스템은 LoRA 어댑터가 포함된 미세 조정된 3-8B 베이스 모델로 구동됩니다.
- • python-docx와 같은 대안보다 3배 빠르고 2배 저렴하며 더 정확하다고 주장합니다.
- • 이 MCP는 에이전트를 위해 읽기, 검색, 편집이라는 세 가지 도구를 노출합니다(현재 이미지나 댓글은 지원하지 않음).
- • Vespper는 월 500회 편집의 무료 티어를 제공하며, 데이터 보존 제로(ZDR) 및 자체 호스팅을 포함한 개인정보 보호 옵션을 제공합니다.
AI 에이전트가 Word 문서를 프로그래밍 방식으로 편집할 수 있는 빠르고 저렴하며 매우 정확한 방법을 제공합니다.