1. Anthropic의 저렴한 Opus 5, 기업용 모델 지출에서 Fable 5 추월
출시 한 달 만에 Anthropic의 Opus 5가 50% 저렴한 가격을 앞세워 기업용 모델 지출에서 Fable 5를 추월했습니다. Fable 5는 다단계 일관성이 필요한 장기적이고 자율적인 프로젝트를 위해 설계되었지만, 기업들은 낮은 전환 비용을 활용하여 일상적인 작업을 더 경제적인 Opus 5로 라우팅하고 있습니다. 비록 Opus 5가 더 많은 시도나 사람의 검토를 필요로 할 수 있음에도 불구하고 말입니다.
- • Opus 5는 출시 한 달 만에 기업용 모델 지출에서 Fable 5를 추월했습니다.
- • Opus 5의 가격은 Fable 5의 절반 수준입니다.
- • 낮은 전환 비용 덕분에 기업들은 일상적인 작업을 더 저렴한 모델로 유연하게 라우팅할 수 있습니다.
- • Fable 5는 연결된 단계 전반에 걸쳐 일관성이 필요한 장기 자율 프로젝트에 여전히 적합합니다.
- • Opus 5는 Fable 5보다 더 많은 시도, 더 긴 프롬프트 또는 더 많은 사람의 검토가 필요할 수 있습니다.
개발자는 일상적인 작업에는 더 저렴한 Opus 5를 사용하고, 복잡한 자율 프로젝트에는 프리미엄 모델을 예약함으로써 운영 비용을 최적화할 수 있습니다.
2. Meta, 온디바이스 Mixture-of-Experts 모델 MobileMoE 출시
Meta는 모바일 하드웨어에 최적화된 온디바이스 Mixture-of-Experts 언어 모델 제품군인 MobileMoE를 선보였습니다. 세 가지 규모(0.3B, 0.5B, 0.9B 활성 파라미터)로 제공되는 이 모델들은 소비자 기기에서 메모리 부족을 방지하기 위해 INT4 양자화된 크기를 3GB 미만으로 유지하도록 설계되었습니다. 가장 큰 변형인 MobileMoE-L-Base는 토큰당 4개의 활성 전문가와 1개의 공유 전문가를 포함하여 총 60개의 라우팅된 전문가를 활용하며, 8,192 토큰의 컨텍스트 윈도우를 지원합니다.
- • MobileMoE는 0.3B, 0.5B, 0.9B 활성 파라미터를 가진 온디바이스 MoE 모델 제품군입니다.
- • 각 모델 규모는 모바일 DRAM에 맞게 INT4 정밀도에서 3GB 미만의 가중치 크기로 설계되었습니다.
- • MobileMoE-L-Base 모델은 9억 2,200만 개의 활성 파라미터와 53억 개의 총 파라미터를 특징으로 합니다.
- • 아키텍처에는 토큰당 4개의 활성 전문가와 1개의 공유 전문가를 포함한 60개의 라우팅된 전문가가 포함됩니다.
- • 이 모델들은 8,192 토큰의 컨텍스트 길이를 지원하며 FAIR NC 라이선스로 출시되었습니다.
개발자는 메모리 사용량을 최소화하면서 모바일 기기에서 직접 고효율 오픈 웨이트 MoE 모델을 배포할 수 있습니다.
3. Fastino, 경계 예측 정보 추출을 위한 GLiNER2.5 출시
Fastino는 기존의 스팬 열거 방식에서 경계 예측 아키텍처로 전환한 새로운 정보 추출 모델 GLiNER2.5를 출시했습니다. 이러한 변화로 최대 엔티티 너비 제한이 제거되었으며, 공동 엔티티-관계 디코딩 및 스팬별 속성과 같은 고급 기능이 가능해졌습니다. Apache 2.0 라이선스로 출시된 이 모델은 CPU, CUDA 또는 MPS에서 로컬로 자체 호스팅하도록 최적화된 세 가지 경량 체크포인트(74M, 194M, 287M 파라미터)로 제공됩니다.
- • Fastino는 GLiNER2.5를 출시하여 스팬 열거를 경계 예측으로 대체하고 엔티티 너비 제한을 제거했습니다.
- • 이 모델은 4,096 단어의 컨텍스트, 공동 엔티티-관계 디코딩 및 작업 간 레이블 제약을 지원합니다.
- • 세 가지 체크포인트(74M, 194M, 287M 파라미터)가 Apache 2.0 라이선스로 Hugging Face에 제공됩니다.
- • 다국어 체크포인트는 16개의 제로샷 벤치마크에서 56.17의 전체 매크로 F1 점수를 달성했습니다.
- • 이 모델은 자체 호스팅을 위해 설계되었으며 Python 3.10+를 사용하여 CPU, CUDA 또는 MPS 추론을 지원합니다.
개발자는 4,096 단어의 컨텍스트를 지원하고 엔티티 너비 제한을 제거한 고효율 정보 추출 모델을 자체 호스팅할 수 있습니다.
4. 초경량 로컬 언어 모델 SHADOW-250M 출시
SHADOW-250M은 2비트 미만의 양자화를 통해 2억 5천만 개의 파라미터를 60MB 크기에 담아 로컬 추론을 위한 초경량 옵션을 제공합니다. MIT 라이선스가 적용된 컴파일된 런타임에서 실행되는 이 모델은 표준 노트북 CPU에서 초당 400 토큰의 속도를 달성합니다. 독특한 아키텍처는 2,048 토큰의 fp16 KV 캐시를 유지하면서 이전 기록을 디스크에서 1비트로 압축하여, 개발자가 최대 1억 개의 토큰 기록 데이터에서 컨텍스트를 검색할 수 있도록 합니다.
- • SHADOW-250M은 Fineweb 데이터 300억 개 토큰으로 처음부터 학습된 2억 5천만 파라미터 모델입니다.
- • 이 모델은 2비트 미만으로 양자화되어 60MB의 배포 크기와 80MB의 RAM이 필요합니다.
- • GPU 없이 표준 노트북 CPU에서 초당 약 400 토큰의 속도로 실행됩니다.
- • 아키텍처는 최근 2,048 토큰을 fp16 KV 캐시에 저장하고 이전 토큰은 디스크에서 1비트로 압축하여 최대 1억 개의 기록 토큰에서 검색이 가능합니다.
- • 이 모델은 Windows와 Linux를 지원하는 MIT 라이선스 컴파일 런타임을 사용하며 GitHub와 Hugging Face에서 이용할 수 있습니다.
개발자는 GPU 가속 없이도 표준 노트북 CPU에서 매우 빠르고 메모리 사용량이 적은 언어 모델을 로컬로 배포할 수 있습니다.
5. 고성능 로컬 코딩 모델 TielCoder 35B MoE 출시
TielCoder는 실제 코드베이스 문제를 해결하기 위해 특별히 설계된 새로운 35B-A3B Mixture of Experts 모델입니다. Ornith-1.5 파인튜닝을 기반으로 구축된 이 모델은 동적 양자화를 위한 코드 가중 imatrix와 에이전트 실행 중 토큰 효율성을 극대화하기 위한 최적화된 채팅 템플릿을 사용합니다. GGUF 및 MLX 버전이 Hugging Face에서 제공되며, 독점 API에 대한 빠르고 일관된 로컬 대안을 제공합니다.
- • TielCoder는 Ornith-1.5 파인튜닝을 기반으로 구축된 35B-A3B Mixture of Experts 코딩 모델입니다.
- • 이 모델은 22GB 4비트 양자화 형식에서 최근 실제 코딩 문제에 대해 Opus 4.6 medium과 일치하는 성능을 보입니다.
- • 동적 양자화를 위한 코드 가중 imatrix와 토큰 효율적인 에이전트 코딩을 위해 최적화된 채팅 템플릿을 활용합니다.
- • 모델의 GGUF 및 MLX 버전은 Hugging Face의 사용자 peculiar-ragdoll 계정에서 이용할 수 있습니다.
개발자는 실제 코드베이스 문제에서 Opus 4.6 medium의 성능과 일치하는 고효율 4비트 양자화 로컬 코딩 모델을 실행할 수 있습니다.
6. Nvidia의 Groq 3 LPU 랙 시스템, 초당 3,400 토큰 달성
Artificial Analysis의 독립적인 벤치마크 결과, Groq 3 LPU를 통합한 Nvidia의 LPX 랙 시스템이 Google의 Gemma 4 31B 모델을 실행할 때 초당 3,400 토큰을 달성한 것으로 나타났습니다. 이 이기종 아키텍처는 워크로드를 분할하여 연산 집약적인 프리필(prefill) 단계는 GPU로, 메모리 대역폭 집약적인 디코드(decode) 단계는 Groq 3 LPU로 라우팅합니다. LPU는 500MB의 온보드 SRAM을 활용하여 150TB/s의 메모리 대역폭을 제공하며, 벤치마크에서 Cerebras의 가장 가까운 대안보다 4배 더 뛰어난 성능을 보였습니다.
- • Groq 3 LPU로 구동되는 Nvidia의 LPX 랙 시스템은 독립적인 벤치마크에서 Gemma 4 31B 실행 시 초당 3,400 토큰을 달성했습니다.
- • 벤치마크된 시스템은 초당 882 토큰을 기록한 Cerebras 플랫폼보다 4배 더 빠른 것으로 보고되었습니다.
- • Groq 3 LPU는 150TB/s의 메모리 대역폭을 제공하는 SRAM 집약적 아키텍처를 활용합니다.
- • Nvidia의 이기종 아키텍처는 연산 집약적인 프리필 단계를 GPU로, 디코드 단계를 Groq 3 LPU로 오프로드합니다.
- • 각 Groq 3 LPU에는 500MB의 SRAM이 포함되어 있으며 랙당 최대 256개의 LPU에 걸쳐 이더넷 분배가 필요합니다.
고처리량 추론을 실행하는 개발자는 새로운 이기종 하드웨어 구성을 활용하여 초저지연을 달성할 수 있습니다.
7. vLLM의 치명적인 취약점 CVE-2025-9141, 임의 코드 실행 허용
보안 연구원들은 악성 LLM이 vLLM 및 SGLang과 같은 최신 추론 엔진의 취약점을 악용하여 호스트 머신을 제어할 수 있다고 경고했습니다. 대표적인 예로, 안전하지 않은 eval() 호출을 통해 코드 실행을 허용했던 Qwen3 Coder용 vLLM의 XML 기반 도구 파서의 임의 코드 실행 취약점인 CVE-2025-9141이 있습니다. 복잡한 채팅 파서와 멀티모달 디코더가 공격 표면을 확장하기 때문에, 개발자는 GPU 호스트를 토큰 파서로부터 격리하고 호스트 권한을 제한할 것을 권장합니다.
- • CVE-2025-9141은 Qwen3 Coder를 위한 vLLM의 XML 기반 도구 파서에 존재하는 임의 코드 실행 버그였습니다.
- • 이 취약점은 안전하지 않은 eval() 호출을 통해 임의 코드 실행을 허용했습니다.
- • Gemini의 치명적인 보안 경고에도 불구하고 vLLM의 수석 관리자는 변경 사항을 강제로 병합했습니다.
- • 멀티모달 아키텍처와 복잡한 채팅 형식 파서는 최신 추론 엔진의 공격 표면을 증가시킵니다.
- • 제안된 완화 조치에는 GPU 호스트를 토큰 파서와 분리하고 GPU 호스트 권한을 제한하는 것이 포함됩니다.
자체 호스팅된 vLLM 또는 SGLang 인스턴스를 실행하는 개발자는 악성 토큰 시퀀스가 파서 취약점을 악용하여 호스트 제어권을 획득할 수 있으므로 환경을 보호해야 합니다.
8. Microsoft, 새로운 최적화 기술로 Agent Lightning 확장
8월 20일에 출시된 Agent Lightning v1.0 강화 학습 프레임워크를 기반으로, Microsoft는 Agent Lightning v1.0.1을 도입했습니다. 이 새로운 명령줄 기술을 통해 개발자는 Claude Code, Codex, GitHub Copilot을 포함한 코딩 에이전트의 프롬프트, 도구 및 워크플로우를 체계적으로 최적화할 수 있습니다. 이제 개발자는 Agent Lightning 생태계의 최적화 기능을 에이전트 파이프라인에 직접 통합하여 정확도, 비용 및 지연 시간의 균형을 맞출 수 있습니다.
- • Agent Lightning v1.0.1은 Agent Lightning 생태계를 확장하는 명령줄 기술입니다.
- • 코딩 에이전트를 위한 프롬프트, 도구 및 추론 설정의 최적화를 자동화합니다.
- • Claude Code, Codex 및 GitHub Copilot과 호환됩니다.
- • GitHub CLI를 통해 설치할 수 있습니다: gh skill install microsoft/agent-lightning agent-lightning --agent <agent>.
- • 정확도, 비용 및 신뢰성 향상을 추적하기 위한 자동화된 벤치마크 보고 기능이 포함되어 있습니다.
이번 릴리스는 개발자가 Agent Lightning 프레임워크의 최적화 논리를 활성 코딩 에이전트에 적용하여 프롬프트 및 추론 설정의 개선을 자동화할 수 있는 실용적인 인터페이스를 제공합니다.
9. Anthropic, 전체 대화 컨텍스트를 포함하도록 Claude Tag Slack 에이전트 강화
Claude Tag 에이전트의 초기 출시를 기반으로, Anthropic은 개별 메시지가 아닌 전체 대화 컨텍스트를 평가하도록 도구를 업데이트했습니다. 이 개선 사항은 팀 토론에 선제적으로 개입하는 에이전트의 능력을 30% 향상시킵니다. 이번 업데이트는 Model Context Protocol(MCP)을 활용하여 안전한 데이터 액세스를 유지하며, 에이전트의 가시성이 개별 사용자 권한과 일치하도록 보장합니다.
- • Claude Tag는 이제 개별 메시지가 아닌 전체 대화 기록을 평가합니다.
- • 이번 업데이트로 에이전트의 자발적 개입 정확도가 30% 향상되었습니다.
- • 에이전트는 안전하고 권한을 인식하는 데이터 액세스를 위해 Model Context Protocol(MCP)을 계속 사용합니다.
- • 현재 확장된 채널 컨텍스트 기능에 대한 추가 비용은 없습니다.
이번 업데이트는 Claude Tag를 선제적인 팀 구성원으로서의 신뢰성을 높여, 개발자가 Slack 내에서 더 컨텍스트를 잘 이해하는 에이전트를 배포할 수 있게 합니다.
10. Liquid AI와 Artificial Analysis, LFM2.5 모델을 위한 모바일 추론 벤치마킹 표준화
Liquid AI와 Artificial Analysis는 오픈 소스 Pipette 앱으로 구동되는 모바일 기기 추론 벤치마킹 도구를 도입했습니다. 이 이니셔티브는 이달 초 출시된 2.6B 모델을 포함한 LFM2.5 모델 제품군에 대해 표준화된 성능 및 메모리 지표를 제공합니다. iPhone 17 Pro와 Galaxy S26 Ultra에서 테스트한 결과, Nanbeige4.2-3B와 LFM2.5-2.6B가 63점으로 지능 순위에서 선두를 차지했으며, 표준 12GB 기기에서 더 큰 9B 모델의 메모리 제약 사항을 강조했습니다.
- • 벤치마킹 파트너십은 iOS와 Android에서 Liquid AI의 무료 오픈 소스 'Pipette' 앱을 사용합니다.
- • 평가는 16K 컨텍스트 제한 하에 iPhone 17 Pro와 Galaxy S26 Ultra에서 수행됩니다.
- • Nanbeige4.2-3B와 LFM2.5-2.6B가 63점의 최고 평균 평가 점수를 기록했습니다.
- • LFM2.5-2.6B는 iPhone 17 Pro에서 2.3GB 메모리를 사용하여 1,024 토큰 프롬프트를 8.0초 만에 처리하며 더 높은 효율성을 입증했습니다.
- • 4K 컨텍스트에서의 최대 메모리 사용량은 LFM2.5-230M의 0.4GB에서 12GB RAM 기기를 크게 제약하는 Qwen3.5 9B의 6.9GB까지 다양합니다.
개발자는 이제 표준화된 벤치마크를 사용하여 모바일 하드웨어에서 Liquid AI 모델의 효율성과 메모리 사용량을 평가하고, 온디바이스 애플리케이션을 위한 더 나은 모델 선택을 할 수 있습니다.
11. OpenAI, GPT-5.6 Sol API에 대한 20% 일시적 가격 인하 도입
8월 17일과 8월 21일의 GPT-5.6 Sol 모델 가격 업데이트에 이어, OpenAI는 최소 2026년 11월 21일까지 유효한 API에 대한 20% 이상의 일시적 가격 인하를 발표했습니다. 이번 업데이트는 또한 2026년 3월 5일 이후 출시된 모델의 지역 처리 엔드포인트에 대해 10%의 가격 프리미엄을 도입하고, 회사의 파인튜닝 플랫폼 종료를 확인했습니다.
- • OpenAI는 2026년 11월 21일까지 GPT-5.6 Sol API 사용에 대해 20%의 일시적 가격 인하를 제공합니다.
- • 2026년 3월 5일 이후 출시된 모델의 지역 처리 엔드포인트에는 이제 10%의 가격 프리미엄이 부과됩니다.
- • OpenAI는 기존 모델을 유지하면서 신규 가입을 차단하는 방식으로 파인튜닝 플랫폼을 종료하고 있습니다.
- • API는 계속해서 우선순위 및 빠른 서비스 계층을 지원합니다.
개발자는 이 3개월간의 프로모션 기간 동안 GPT-5.6 Sol 워크로드에 대한 API 비용을 추가로 절감할 수 있습니다.
12. GPU 네오클라우드 요금표, B200 및 B300 가격 공개
특수 GPU 네오클라우드에 대한 시장 분석을 통해 AI 인프라를 확장하는 개발자를 위한 주요 가격 및 하드웨어 차별화 요소가 밝혀졌습니다. Lambda는 현재 NVIDIA B200에 대해 GPU 시간당 6.69달러로 온디맨드 경제성에서 앞서고 있으며, Nebius는 최신 B300에 대한 온디맨드 요금을 게시하는 유일한 제공업체로 두각을 나타내고 있습니다. AMD 대안을 찾는 개발자를 위해 Crusoe는 표준 요금표에 MI300X와 MI355X를 나열하는 독점 제공업체입니다.
- • Lambda는 GPU 시간당 6.69달러로 가장 낮은 NVIDIA B200 온디맨드 요금을 제공합니다.
- • Nebius는 그룹 내에서 NVIDIA B300에 대한 온디맨드 가격을 게시하는 유일한 제공업체입니다.
- • Crusoe는 상위 5개 제공업체 중 요금표에 AMD MI300X와 MI355X를 나열하는 유일한 업체입니다.
- • CoreWeave는 2026년 2분기에 NVIDIA Vera Rubin NVL72 시스템의 업계 최초 가동 및 검증을 완료했습니다.
- • CoreWeave는 SemiAnalysis ClusterMAX 2.0 평가에서 Platinum 등급을 받은 유일한 제공업체입니다.
개발자는 전문 클라우드 제공업체 전반의 온디맨드 요금과 하드웨어 가용성을 비교하여 교육 및 추론 예산을 최적화할 수 있습니다.