1. Anthropic, 조정 가능한 사고 능력과 완화된 코드 안전 정책을 갖춘 Claude Opus 5 출시
Anthropic은 Claude Opus 4.8을 대체하는 새로운 플래그십 모델로 Claude Opus 5를 출시했습니다. 이 모델은 제한적이고 복잡한 작업을 위해 설계되었으며, Claude Max 소비자 등급의 새로운 기본 모델 역할을 합니다. 많은 영역에서 Claude Fable 5의 성능에 근접하면서도 복잡한 코딩 작업에서 더 나은 성능을 발휘합니다. 안전성 측면에서 Anthropic은 소스 코드 내 취약점 탐지를 허용하도록 안전 장치를 완화했으며, 바이너리 기반 스캔 및 익스플로잇 생성에 대한 제한은 유지했습니다. 또한 이 모델은 기만적인 행동 비율이 낮고 간접적인 프롬프트 주입 성공률이 감소했습니다. 추가로 Anthropic은 정부 파트너와 협력하여 모델에 대한 독립적인 테스트를 수행하고 있습니다.
- • Claude Opus 5는 이전 모델인 Opus 4.8과 동일하게 입력 토큰 100만 개당 5달러, 출력 토큰 100만 개당 25달러로 책정되었습니다.
- • 이 모델은 100만 토큰 컨텍스트 윈도우를 특징으로 하며, 동기식 Messages API에서 최대 128k 출력 토큰을 지원합니다.
- • 사고(Thinking) 기능이 기본적으로 활성화되어 있으며, 추론 깊이를 제어하는 조정 가능한 노력(effort) 매개변수가 포함되어 있습니다. effort를 4096 이상으로 설정하고 max_tokens를 지정하면 400 오류가 반환됩니다.
- • Anthropic은 소스 코드 취약점 스캔을 허용하기 위해 안전 장치를 완화했으나, 익스플로잇 생성에 대한 제한은 유지했습니다.
- • 새로운 API 기능으로는 2배 가격의 Fast 모드, 자동 폴백 라우팅, 대화 중 도구 변경 지원 등이 있습니다.
개발자들은 네이티브 추론 제어 기능과 소스 코드 보안 분석에 대한 제한이 완화된, 비용 효율적이고 성능이 뛰어난 플래그십 모델을 사용할 수 있게 되었습니다.
2. Microsoft, MAI-Image-2.5-Pro 및 MAI-Voice-2-Flash 퍼블릭 프리뷰로 확대
Microsoft는 PowerPoint 및 Bing과 같은 핵심 제품에 MAI-Image-2.5-Pro와 MAI-Voice-2-Flash를 최근 통합한 데 이어, 이제 개발자들에게 해당 모델을 퍼블릭 프리뷰로 제공합니다. 이번 릴리스를 통해 이전에는 내부 제품용으로만 제한되었던 고충실도 이미지 생성 및 저지연 음성 기능을 외부 개발자들도 사용할 수 있게 되었습니다.
- • MAI-Image-2.5-Pro와 MAI-Voice-2-Flash가 개발자를 위한 퍼블릭 프리뷰로 제공됩니다.
- • 이는 최근 Bing 및 PowerPoint와 같은 Microsoft 소비자 제품에 배포된 이후의 조치입니다.
- • 해당 모델들은 이제 외부 사용을 위한 Microsoft의 프로덕션 모델 라인업에 포함되었습니다.
개발자들은 이제 Microsoft의 핵심 소비자 애플리케이션을 구동하는 것과 동일한 고성능 모델을 자신의 소프트웨어에 통합할 수 있습니다.
3. CachyLLama 포크, 영구 KV 캐싱을 통한 로컬 에이전트 세션 최적화
CachyLLama는 저사양 하드웨어에서 반복적인 프롬프트 처리를 최적화하기 위해 설계된 llama.cpp의 포크입니다. 이 프로젝트는 이전에 처리된 컨텍스트를 복원하기 위해 SSD 기반의 영구 KV 체크포인트와 시스템 프롬프트 캐시 기능을 제공합니다. CachyLLama 체크포인트는 서버 재시작 후에도 유지될 수 있습니다. 이 소프트웨어는 생성 속도를 높이지는 않지만, 중복 작업을 방지하여 프롬프트 평가 시간을 단축합니다.
- • CachyLLama는 서버 재시작 후에도 유지되는 SSD 기반의 영구 KV 체크포인트와 시스템 프롬프트 캐시를 갖춘 llama.cpp 포크입니다.
- • 이 소프트웨어는 프롬프트 평가 시간을 단축하며, 7840U 시스템에서 15,700 토큰에 대해 0.99초의 웜 처리 시간을 달성했습니다.
- • Qwen 3.5/3.6, Gemma 4, GLM-4.7을 포함한 하이브리드 아키텍처를 지원합니다.
로컬 에이전트를 실행하는 개발자들은 중복된 프롬프트 처리 오버헤드를 제거하고 서버 재시작 시에도 컨텍스트를 유지할 수 있습니다.
4. Baidu의 3B Unlimited-OCR 모델로 고해상도 OCR 파이프라인 구축
새로운 튜토리얼에서는 Baidu의 3B 파라미터 Unlimited-OCR 비전-언어 모델을 사용하여 엔드투엔드 OCR 파이프라인을 구축하는 방법을 보여줍니다. 이 워크플로우는 하드웨어 지원에 따라 bfloat16 또는 float16 정밀도를 자동으로 선택하여 CUDA 지원 GPU가 있는 Google Colab에서 실행되도록 설계되었습니다. 파이프라인에는 텍스트, Markdown, MMD 및 JSON 아티팩트를 생성하기 위한 긴 컨텍스트 생성 설정, 반복 제어 및 구조화된 출력 처리 기능이 포함되어 있습니다.
- • 이 파이프라인은 CUDA 지원 GPU에서 실행되는 Baidu의 3B 파라미터 Unlimited-OCR 비전-언어 모델을 사용하며, bfloat16/float16을 자동으로 선택합니다.
- • 밀집된 레이아웃에서 타일링된 이미지 크롭을 위한 Gundam 모드와 단일 1024픽셀 뷰를 위한 Base 모드 등 두 가지 추론 모드를 지원합니다.
- • 다중 페이지 PDF는 PyMuPDF를 사용하여 페이지를 PNG로 래스터화하고 infer_multi() 함수로 처리하여 파싱합니다.
- • 파이프라인은 긴 컨텍스트 생성 및 반복 제어 기능을 갖춘 구조화된 텍스트, Markdown, MMD 및 JSON 아티팩트를 출력합니다.
개발자들은 3B 경량 모델을 사용하여 구조화된 Markdown 및 JSON 출력을 제공하는 고해상도 다중 페이지 OCR 파이프라인을 로컬 또는 Colab 환경에서 구현할 수 있습니다.
5. SupraLabs, 소형 모델 파인튜닝을 위한 500만 샘플 추론 코퍼스 공개
SupraLabs는 500만 개의 샘플을 포함하는 추론 코퍼스 데이터셋을 Hugging Face에 공개했습니다. 이 데이터셋은 초소형 언어 모델(SLM)의 지도 미세 조정(SFT) 및 학습을 촉진하기 위해 설계되었습니다. 모든 샘플은 저사양 학습 환경과의 호환성을 보장하기 위해 5,000 토큰 시퀀스 길이로 제한되었습니다.
- • 이 데이터셋은 500만 개의 샘플을 포함하며 Hugging Face에 SupraLabs/reasoning-corpus-4K-5M-v1으로 호스팅되어 있습니다.
- • 각 샘플은 ChatML 형식으로 사용자 프롬프트, 모델 사고 과정, 어시스턴트 답변, 저장소 ID 및 총 토큰 길이를 포함합니다.
- • 모든 샘플은 초소형 모델의 지도 미세 조정(SFT)을 용이하게 하기 위해 5,000 토큰 시퀀스 길이로 제한되었습니다.
개발자들은 이 구조화된 추론 코퍼스를 사용하여 명시적인 사고 과정과 5,000 토큰 시퀀스 제한을 갖춘 소형의 작업별 모델을 파인튜닝할 수 있습니다.
6. Noema Overfit, SSD 모델 페이징을 통해 iPhone에서 Gemma 4 26B 실행 지원
Noema는 Noema 앱 내에 'Noema Overfit'이라는 기능을 출시했습니다. Noema Overfit은 페이징 기술을 사용하여 iPhone 17 Pro와 같은 장치에서 Gemma 4 26B A4B(Q4_K_M 버전)와 같은 대형 모델을 실행할 수 있게 합니다. 이 페이징 기술은 비전문가 가중치를 RAM에 저장하고 모델 전문가 가중치를 SSD에서 읽어오는 방식을 사용합니다. 이 시스템은 속도보다 답변 정확도가 우선시되는 시나리오를 위해 설계되었으며, 저사양 RAM MacBook에도 적합합니다.
- • Noema 앱의 Noema Overfit 기능은 Gemma 4 26B A4B 모델을 iPhone 17 Pro와 같은 장치에서 실행할 수 있게 합니다.
- • 페이징 기술은 비전문가 가중치를 RAM에 저장하고 모델 전문가 가중치를 SSD에서 동적으로 읽어옵니다.
- • iPhone 17 Pro에서 테스트한 결과, 프리필 속도는 초당 34.4 토큰, 디코드 속도는 초당 3.5 토큰을 기록했습니다.
- • 이 시스템은 속도보다 정확도가 중요한 시나리오를 위해 설계되었으며, 저사양 RAM MacBook과도 호환됩니다.
개발자들은 SSD 기반 가중치 페이징을 활용하여 더 크고 성능이 뛰어난 오픈 가중치 모델을 모바일 및 저사양 소비자 하드웨어에 직접 배포할 수 있습니다.
7. Hetzner, Qwen MoE 모델을 위한 실험적 무료 LLM 추론 API 출시
Hetzner는 현재 무료로 제공되며 SLA나 프로덕션 보장이 없는 실험적 LLM 추론 서비스를 출시했습니다. 이 서비스는 350억 개의 파라미터와 30억 개의 활성 파라미터, 262K 컨텍스트 윈도우, FP8 양자화 가중치를 가진 Mixture-of-Experts 모델인 Qwen/Qwen3.6-35B-A3B-FP8 모델에 대한 OpenAI 호환 API를 제공합니다. Hetzner의 현재 공개 전용 GPU 서버 제품군은 NVIDIA RTX 4000 SFF Ada Generation 및 NVIDIA RTX PRO 6000 Blackwell Max-Q GPU로 구성되어 있습니다.
- • Hetzner의 실험적 LLM 추론 서비스는 현재 무료이며 SLA가 없는 OpenAI 호환 API를 제공합니다.
- • 이 서비스는 35B MoE 모델인 Qwen/Qwen3.6-35B-A3B-FP8(3B 활성 파라미터, 262K 컨텍스트 윈도우)을 호스팅합니다.
- • 벤치마크 테스트 결과, 첫 토큰까지의 중앙값 시간은 153ms, 출력 속도는 초당 224 토큰을 기록했습니다.
- • API에는 모델의 추론 예산을 전환할 수 있는 문서화되지 않은 enable_thinking 매개변수가 포함되어 있습니다.
- • Hetzner의 공개 전용 GPU 서버 옵션은 현재 NVIDIA RTX 4000 SFF Ada 및 RTX PRO 6000 Blackwell Max-Q GPU를 제공합니다.
개발자들은 전용 GPU 하드웨어에 배포하기 전에 OpenAI 호환 엔드포인트를 통해 반응성이 뛰어난 양자화된 35B MoE 모델을 무료로 테스트할 수 있습니다.