Inference Brew

Anthropic, Claude Sonnet 5 출시

00:00 / --:--

← 메인으로

Anthropic, Claude Sonnet 5 출시

1. Anthropic, Claude Sonnet 5 출시

Claude Sonnet 5는 에이전트 워크플로우를 위한 큰 도약을 의미하며, 중간급 가격으로 플래그십에 가까운 성능을 제공합니다. 이 모델은 브라우저와 터미널을 자율적으로 제어할 수 있어 복잡한 소프트웨어 엔지니어링 및 계획 작업에 매우 적합합니다. 토큰 수를 1.0~1.35배 증가시킬 수 있는 업데이트된 토크나이저를 사용하지만, 도입 할인과 확대된 속도 제한 덕분에 즉각적인 배포에 매우 접근성이 높습니다.

  • Anthropic이 이전 Sonnet 4.6 모델을 대체하는 Claude Sonnet 5를 출시했습니다.
  • 이 모델은 긴 세션 동안 계획, 도구 사용 및 자율 운영을 위해 설계되었습니다.
  • 도입 가격은 2026년 8월 31일까지 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 10달러입니다.
  • 프로모션 기간 이후 표준 가격은 입력 토큰 100만 개당 3달러, 출력 토큰 100만 개당 15달러로 인상됩니다.
  • Sonnet 5는 SWE-bench Pro에서 63.2%, OSWorld-Verified에서 81.2%를 기록했습니다.
  • 이 모델은 100만 토큰 컨텍스트 윈도우를 특징으로 하며 업데이트된 토크나이저를 사용합니다.
  • Anthropic은 Chat, Cowork, Claude Code 및 Claude Platform 전반의 속도 제한을 상향 조정했습니다.

개발자들은 이전의 최첨단 모델보다 낮은 비용으로 계획을 세우고 도구를 제어할 수 있는 더 자율적인 에이전트를 구축할 수 있습니다.

2. Google, Gemini 3.1 Flash-Lite Image와 Gemini Omni Flash 출시

Google은 같은 발표 흐름에서 두 개의 멀티모달 모델을 내놨다. Gemini 3.1 Flash-Lite Image는 Nano Banana 2 Lite라는 이름으로 빠르고 저렴한 이미지 생성을 겨냥하며, Gemini Omni Flash는 대화형 비디오 생성과 편집을 개발자 워크플로에 연결한다.

  • Gemini 3.1 Flash-Lite Image는 Nano Banana 2 Lite의 공식 모델명이다.
  • 이미지 모델은 낮은 비용과 빠른 생성을 목표로 한다.
  • Gemini Omni Flash는 대화형 비디오 생성과 편집을 지원한다.
  • Gemini Omni Flash 가격은 생성 비디오 초당 $0.10로 보고됐다.
  • 두 모델 모두 로컬 오픈웨이트가 아니라 Google의 관리형 멀티모달 스택에 속한다.

개발자는 이번 업데이트를 별도 이미지/비디오 뉴스가 아니라 Google 멀티모달 스택의 통합 출시로 이해하고 평가할 수 있다.

3. GLM-5.2, 인텔리전스 인덱스에서 오픈 웨이트 모델 1위 차지

최근 오픈 웨이트 출시를 바탕으로, GLM-5.2는 이제 Artificial Analysis Intelligence Index의 평가를 받아 오픈 웨이트 모델 중 1위를 차지했습니다. 이 모델은 폐쇄형 소스 대안과 경쟁하는 추론 능력을 보여주지만, 평가 결과 출력 토큰의 95%가 추론에 할당되는 등 상당한 장황함이 강조되었으며, 개발자는 이를 추론 비용 계획 시 고려해야 합니다.

  • GLM-5.2는 이제 Artificial Analysis Intelligence Index에서 최고의 성능을 발휘하는 오픈 웨이트 모델입니다.
  • 이 모델은 51점을 획득하여 Claude Opus 4.8 및 GPT-5.5와 같은 폐쇄형 소스 모델에 이어 2위를 기록했습니다.
  • 평가 결과 높은 장황함이 확인되었으며, 평균 출력 토큰의 1.8배를 사용합니다.
  • 추론 과정이 모델 전체 출력 토큰 사용량의 95%를 차지합니다.
  • 이 모델은 GDPval-AA v2 벤치마크에서 GPT-5.5를 능가했습니다.

이 독립적인 순위는 최근 출시된 GLM-5.2를 로컬 에이전트 워크플로우에 통합할지 결정하는 개발자들에게 표준화된 성능 벤치마크를 제공합니다.

SOURCES

4. Microsoft, 작업 성공률이 향상된 4B GUI 에이전트 모델 업데이트

5월 Phi-Ground-Any 4B 모델의 초기 출시 이후, Microsoft는 GUI 에이전트의 업데이트 버전을 출시했습니다. 이번 반복 버전은 Sico-Evolution 작업 성공률이 39.8%에서 82.9%로 증가하며 상당한 성능 향상을 보여주었으며, 특정 작업 벤치마크에서 GPT-5.4 및 Claude Opus 4.7과 같은 더 큰 규모의 프론티어 모델을 능가했습니다.

  • Microsoft가 Hugging Face에 업데이트된 4B 파라미터 GUI 에이전트를 출시했습니다.
  • 이 모델은 Sico-Evolution 작업 성공률을 기존 39.8%에서 82.9%로 향상시켰습니다.
  • 업데이트된 에이전트는 작업 성공률 면에서 GPT-5.4 및 Claude Opus 4.7을 능가하는 것으로 보고되었습니다.

개발자들은 이제 더 안정적인 화면 자동화를 위해 Microsoft의 경량 오픈 웨이트 GUI 에이전트의 더 뛰어난 버전을 활용할 수 있습니다.

SOURCES

5. Google Research, TabFM 파운데이션 모델 도입

TabFM은 개발자가 표 형식 데이터를 처리하는 방식의 변화를 나타내며, 전통적인 분류 및 회귀 작업에 파운데이션 모델 기술을 적용합니다. 제로샷 인컨텍스트 학습을 활용함으로써 TabFM은 지루한 피처 엔지니어링과 모델 학습의 필요성을 제거하며, 향후 BigQuery 통합을 통해 개발자는 SQL을 사용하여 직접 예측을 실행할 수 있게 됩니다.

  • Google Research가 표 형식 데이터 분류 및 회귀를 위한 TabFM을 도입했습니다.
  • 이 모델은 제로샷 인컨텍스트 학습을 활용하여 예측을 수행합니다.
  • TabFM은 구조적 인과 모델을 사용하여 생성된 합성 데이터셋으로 학습되었습니다.
  • 이 모델은 2026년 6월 30일 기준으로 Hugging Face와 GitHub에서 사용할 수 있습니다.
  • Google은 AI.PREDICT SQL 명령을 통해 TabFM을 BigQuery에 통합할 계획입니다.

개발자들은 수동 모델 학습, 하이퍼파라미터 튜닝 또는 피처 엔지니어링 없이 표 형식 예측을 수행할 수 있습니다.

SOURCES

6. Huawei, OpenPangu-2.0-Flash 오픈 소스 공개

Huawei의 OpenPangu-2.0-Flash 출시는 개발자들에게 매우 효율적인 MoE(Mixture-of-Experts) 모델을 제공합니다. 총 920억 개의 파라미터 중 60억 개의 활성 파라미터만 사용하는 이 모델은 빠른 추론을 위해 설계되었으며, 오픈 소스 가중치와 추론 코드를 포함하여 512K라는 방대한 컨텍스트 윈도우를 지원합니다.

  • Huawei가 OpenPangu-2.0-Flash 모델을 오픈 소스로 공개했습니다.
  • Flash 모델은 총 92B 파라미터와 6B 활성 파라미터를 특징으로 합니다.
  • 이 모델은 512K 컨텍스트 윈도우를 지원합니다.
  • Huawei는 Flash 모델을 위한 가중치, 추론 코드 및 학습 작업을 공개했습니다.
  • 505B 파라미터를 갖춘 더 큰 플래그십 Pro 모델이 7월에 출시될 예정입니다.

개발자들은 자체 호스팅이 가능하고 긴 컨텍스트 작업에 최적화된 새로운 오픈 웨이트 모델에 액세스할 수 있습니다.

SOURCES

7. NVIDIA, Qwen3.6-27B-NVFP4 양자화 버전 출시

NVIDIA가 Hugging Face에 FP4 양자화된 Qwen 3.6 27B 모델을 출시함에 따라 개발자들이 소비자용 하드웨어에 대규모 언어 모델을 더 쉽게 배포할 수 있게 되었습니다. FP4 형식은 모델의 기본 기능을 유지하면서 메모리 대역폭과 저장 공간 요구 사항을 크게 낮춥니다.

  • NVIDIA가 Hugging Face에 Qwen3.6-27B-NVFP4 모델을 호스팅했습니다.
  • 이 모델은 NVIDIA의 FP4 양자화 형식을 활용합니다.
  • Qwen 3.6 27B 아키텍처를 기반으로 합니다.

개발자들은 FP4 양자화를 사용하여 VRAM 요구 사항을 줄이고 로컬에서 고성능 27B 파라미터 모델을 실행할 수 있습니다.

SOURCES

8. DeepSeek-V4-Flash, 로컬 배포를 위한 GGUF 형식으로 제공

최근 DeepSeek-V4-Flash 출시와 이후 llama.cpp의 추측적 디코딩 지원 통합을 바탕으로, 이 모델이 이제 GGUF 형식으로 제공됩니다. 이번 출시로 로컬 배포가 간소화되어 개발자들은 GGUF 호환 런타임을 사용하여 CPU 및 GPU 하드웨어에서 최적화된 모델을 직접 실행할 수 있습니다.

  • DeepSeek-V4-Flash가 이제 Hugging Face에서 GGUF 형식으로 제공됩니다.
  • GGUF 형식은 원시 체크포인트에 비해 더 쉬운 로컬 배포를 가능하게 합니다.
  • 이번 출시는 DeepSeek-V4 추측적 디코딩에 대한 기존 llama.cpp 지원을 보완합니다.

이번 GGUF 출시는 이전에 출시된 DSpark 체크포인트와 원활한 로컬 실행 사이의 간극을 메워주며, 개발자들이 DeepSeek-V4-Flash를 로컬 추론 파이프라인에 통합할 수 있는 표준화된 형식을 제공합니다.

SOURCES

9. Claude Code, API 요청을 은밀하게 표시하는 것으로 발견

Claude Code 버전 2.1.196에 대한 분석 결과, 도구에 내장된 스테가노그래피 추적 메커니즘이 밝혀졌습니다. 시스템 시간대, 호스트 이름 및 프록시 키워드를 기반으로 시스템 프롬프트의 날짜 문자열을 미묘하게 변경함으로써, 이 도구는 분류 신호를 Anthropic으로 다시 전송합니다. 이러한 은밀한 동작은 도구의 광범위한 파일 시스템 및 셸 액세스에 의존하는 개발자들 사이에서 개인정보 보호 우려를 불러일으켰습니다.

  • Claude Code 버전 2.1.196은 유니코드 마커를 사용하여 시스템 프롬프트 날짜 문자열을 은밀하게 수정합니다.
  • 수정 사항은 환경 변수 및 API 호스트 이름을 기반으로 아포스트로피와 하이픈 같은 문자를 변경합니다.
  • 바이너리는 base64로 인코딩되고 XOR로 디코딩된 목록을 사용하여 프록시, 리셀러 또는 승인되지 않은 게이트웨이를 식별합니다.
  • 수정된 날짜 문자열은 시스템 컨텍스트로 전송되어 Anthropic이 특정 API 사용 패턴을 감지할 수 있게 합니다.
  • 추적 메커니즘은 시스템 호스트 이름이나 시간대를 변경하여 우회할 수 있습니다.

Claude Code를 사용하는 개발자들은 환경 및 프록시 세부 정보를 Anthropic으로 전송하는 숨겨진 추적 메커니즘을 인지해야 합니다.

SOURCES

10. Cognition, Devin Fusion 멀티 모델 하네스 도입

Devin Fusion은 LLM 지출을 최적화하려는 개발자를 위한 효율적인 오케스트레이션 패턴을 도입합니다. 메인 에이전트와 사이드킥 에이전트를 활용하여 시스템은 작업을 처리할 수 있는 가장 비용 효율적인 모델로 동적으로 라우팅하여 값비싼 캐시 미스를 완화합니다.

  • Cognition은 프론티어 모델과 비용 효율적인 모델을 결합하기 위해 Devin Fusion을 도입했습니다.
  • 이 시스템은 FrontierCode 벤치마크에서 비용을 35% 절감합니다.
  • Devin Fusion은 메인 에이전트와 사이드킥을 특징으로 하는 듀얼 에이전트 아키텍처를 활용합니다.
  • 이 아키텍처는 작업 처리를 최적화하고 캐시 미스를 방지하기 위해 동적 모델 라우팅을 수행합니다.
  • Fable 5와의 통합을 통해 Devin Fusion은 41%의 비용 절감을 달성할 수 있습니다.

개발자들은 복잡한 코딩 작업에서 성능을 희생하지 않으면서 API 비용을 크게 낮추기 위해 동적 모델 라우팅을 구현할 수 있습니다.

SOURCES

11. Couchbase, 에이전트 메모리를 위한 AI 데이터 플레인 출시

Couchbase의 AI 데이터 플레인은 에이전트 개발의 중요한 과제인 다양한 네트워크 조건에서 일관된 저지연 컨텍스트 유지를 해결합니다. 빠른 인메모리 캐싱과 Couchbase Lite를 통한 로컬 벡터 검색을 결합함으로써, 이 플랫폼은 개발자가 클라우드와 완전히 연결이 끊긴 상태에서도 메모리와 도구 액세스를 유지하는 에이전트를 배포할 수 있게 합니다.

  • Couchbase가 지속적인 에이전트 메모리 및 컨텍스트 검색을 위한 AI 데이터 플레인을 발표했습니다.
  • 이 플랫폼에는 엔터프라이즈 지원 MCP(Model Context Protocol) 서버가 포함되어 있습니다.
  • 클라우드, 온프레미스 및 연결이 끊긴 엣지 환경 전반에서 동일하게 실행됩니다.
  • Couchbase Lite는 기기 내 로컬 SQL, 전체 텍스트 검색 및 벡터 검색을 가능하게 합니다.
  • 캐싱 기반 아키텍처는 디스크보다 최대 10배 빠른 메모리 쓰기를 지원합니다.

개발자들은 클라우드와 엣지 환경 전반에서 통합된 메모리를 갖춘 오프라인 지원 저지연 에이전트 애플리케이션을 구축할 수 있습니다.

SOURCES

12. X, 호스팅된 MCP 서버 출시

X의 MCP 채택은 AI 에이전트가 웹 플랫폼과 상호 작용하는 방식을 표준화하는 중요한 단계입니다. MCP 서버를 호스팅함으로써 X는 개발자가 자신의 에이전트에게 플랫폼의 데이터와 기능에 대한 안전하고 구조화된 액세스 권한을 쉽게 부여할 수 있도록 합니다.

  • X가 호스팅된 MCP(Model Context Protocol) 서버를 출시했습니다.
  • 이 서버는 AI 애플리케이션과 X API의 통합을 간소화합니다.
  • AI 도구가 플랫폼과 상호 작용하는 표준화된 방법을 제공합니다.

개발자들은 표준화된 MCP 프로토콜을 사용하여 자신의 AI 에이전트와 LLM 애플리케이션을 X 플랫폼에 쉽게 연결할 수 있습니다.

SOURCES

13. Mistral, 워크플로우 오케스트레이션 플랫폼 출시

Mistral Workflows는 멀티 에이전트 파이프라인을 관리하기 위한 전용 플랫폼을 제공함으로써 안정적인 에이전트 오케스트레이션의 필요성을 해결합니다. 내구성과 결함 허용 오차에 중점을 둔 이 시스템은 장기 실행 문서 처리 및 추론 작업이 규모에 맞게 안정적으로 실행되도록 보장합니다.

  • Mistral Workflows는 멀티 에이전트 AI 파이프라인을 실행하기 위한 오케스트레이션 플랫폼입니다.
  • 이 플랫폼은 내구성이 뛰어나고 결함 허용이 가능하도록 설계되었습니다.
  • 복잡한 문서 처리 및 에이전트 워크플로우를 모니터링하기 위한 도구를 제공합니다.

개발자들은 내장된 결함 허용 오차를 갖춘 복잡한 멀티 에이전트 워크플로우를 구축, 모니터링 및 확장할 수 있습니다.

SOURCES

14. Lullabeast 자율 개발 파이프라인 출시

Lullabeast는 LLM 기반 계획과 엄격한 비LLM 검증 단계를 결합하여 에이전트 기반 소프트웨어 개발을 위한 구조화된 프레임워크를 제공합니다. 파일 매니페스트와 테스트 결과를 확인하기 위해 결정론적 게이트를 적용함으로써, 파이프라인은 에이전트가 생성한 코드가 다음 단계로 진행되기 전에 철저히 검증되도록 보장합니다.

  • Lullabeast는 플래너, 실행자 및 검토자 에이전트를 사용하는 오픈 소스 자율 개발 파이프라인입니다.
  • 이 파이프라인은 OpenClaw에서 실행되며 비LLM 결정론적 게이트를 사용하여 git diff와 테스트 결과를 검증합니다.
  • 테스트 결과 로컬 RTX 4090 빌드는 API 비용 없이 3.5시간이 소요되었으며, 클라우드 LLM에서는 2시간이 소요되었습니다.
  • 이 도구는 초기 베타 단계이며 작고 집중적인 웹 애플리케이션에 권장됩니다.
  • 에이전트가 작성한 코드를 직접 실행하므로 가상 머신에서 도구를 실행하는 것이 좋습니다.

개발자들은 결정론적 검증 게이트가 있는 파이프라인을 사용하여 다단계 소프트웨어 개발 작업을 자동화할 수 있습니다.

SOURCES

15. Ornith-1.0-35B, hf-claude 통합에 추가

6월 27일 hf-claude 통합 도구 출시와 6월 25일 Ornith-1.0 모델 제품군 출시에 이어, 개발자들은 이제 Claude Code 내에서 Ornith-1.0-35B 모델을 직접 활용할 수 있습니다. 이번 업데이트는 자동화된 hf-claude 인터페이스를 통해 사용할 수 있는 지원되는 오픈 웨이트 모델 목록을 확장하여 모델의 성능 및 비용 프로필을 더 쉽게 실험할 수 있게 합니다.

  • Ornith-1.0-35B가 이제 hf-claude 통합 도구와 호환됩니다.
  • 이번 개발을 통해 수동 구성 없이 Claude Code 내에서 모델을 직접 사용할 수 있습니다.
  • 이 통합은 이전에 출시된 hf-claude 유틸리티와 Ornith-1.0 모델 제품군을 기반으로 합니다.

개발자들은 이제 Ornith-1.0-35B 모델을 Claude Code의 대체 백엔드로 활용하여 이 특정 모델에 대한 설정 과정을 간소화할 수 있습니다.

SOURCES

16. Open-Fusion, Claude Code용 hf-claude 도구에 추가

Claude Code에 대한 멀티 모델 지원을 간소화한 6월 27일 hf-claude 유틸리티 출시를 바탕으로, 개발자들은 이제 Open-Fusion을 워크플로우에 직접 통합할 수 있습니다. 이번 업데이트는 hf-claude 패키지를 통해 사용할 수 있는 호환 도구 라이브러리를 확장하여 더 유연한 AI 지원 코딩 구성을 가능하게 합니다.

  • Open-Fusion이 이제 hf-claude 도구에서 지원됩니다.
  • 이번 업데이트는 6월 27일 출시에서 도입된 자동화된 통합 프레임워크를 기반으로 합니다.
  • 개발자들은 이제 hf-claude 패키지를 사용하여 Claude Code 내에서 Open-Fusion을 구성할 수 있습니다.

이번 통합은 hf-claude 도구의 유용성을 더욱 확장하여 개발자들이 Open-Fusion의 기능을 기존 Claude Code 터미널 환경에 통합할 수 있게 합니다.

SOURCES

17. Hugging Face Buckets, S3 API 지원 추가

Hugging Face Buckets에 S3 API 지원이 추가됨에 따라 AI 개발자를 위한 데이터 관리가 크게 간소화되었습니다. 표준 S3 호환 인터페이스를 제공함으로써 Hugging Face는 개발자들이 통합 코드를 다시 작성하지 않고도 기존 저장 유틸리티, 백업 스크립트 및 데이터 파이프라인을 재사용할 수 있도록 합니다.

  • Hugging Face Buckets가 이제 S3 API를 지원합니다.
  • 이 통합을 통해 수백 개의 표준 저장 도구와 호환됩니다.
  • 개발자들은 코드 한두 줄만 변경하여 도구를 연결할 수 있습니다.

개발자들은 최소한의 코드 변경으로 기존 데이터 파이프라인과 도구를 Hugging Face Buckets에 연결할 수 있습니다.

SOURCES

18. TurboOCR v3 로컬 OCR 서버 출시

TurboOCR v3는 클라우드 기반 문서 처리 API에 대한 강력한 로컬 대안을 제공합니다. C++ 및 TensorRT를 기반으로 구축된 이 서버는 대규모 처리량 개선과 함께 복잡한 레이아웃, 표 및 수식을 깨끗한 HTML, LaTeX 또는 Markdown으로 직접 변환하는 새로운 구조화된 파싱 기능을 제공합니다.

  • TurboOCR v3는 완전히 로컬에서 작동하는 자체 호스팅 고속 문서 OCR 서버입니다.
  • 이번 업데이트는 파이프라인을 PP-OCRv6로 업그레이드하여 RTX 5090에서 성능을 약 520 img/s로 두 배 향상시켰습니다.
  • HTML 표로의 레이아웃 변환 및 LaTeX로의 수식 변환을 포함한 구조화된 파싱을 도입했습니다.
  • 소프트웨어 스택은 C++, TensorRT FP16 및 멀티 스트림 처리를 활용합니다.
  • 구조화된 파싱 기능은 비용 관리를 위해 엄격한 요청별 옵트인으로 제공됩니다.

개발자들은 고급 구조화된 파싱 기능을 갖춘 고속 자체 호스팅 문서 처리 서버를 배포할 수 있습니다.

SOURCES

19. 비NVIDIA CUDA 실행을 위한 ZLUDA 6 출시

ZLUDA 6은 NVIDIA 하드웨어 종속에서 벗어나려는 개발자들에게 중요한 호환성 계층을 제공합니다. 프로젝트가 개인적인 주말 작업으로 전환되어 업데이트 빈도가 낮아질 것으로 예상되지만, 이번 릴리스는 Windows 안정성을 개선하고 대체 GPU에서 CUDA 애플리케이션을 실행하기 위한 워크로드 지원을 확장합니다.

  • ZLUDA 버전 6이 출시되어 6-preview.79 빌드와 일치합니다.
  • 이 도구를 사용하면 수정되지 않은 CUDA 애플리케이션을 비NVIDIA GPU에서 실행할 수 있습니다.
  • 새로운 워크로드에는 사전 알파 PhysX 지원과 Blender용 텍스처 지원이 포함됩니다.
  • Windows 지원이 더 강력한 로더로 향상되었습니다.
  • 개발이 상업적으로 자금 지원을 받는 프로젝트에서 개인적인 주말 프로젝트로 전환되었습니다.

개발자들은 코드를 다시 작성하지 않고도 AMD 및 기타 비NVIDIA 하드웨어에서 CUDA 의존 AI 워크로드를 실행할 수 있습니다.

SOURCES

20. 미국, Anthropic의 Fable 5에 대한 잔여 수출 제한 해제

미국 정부는 6월 26일 Mythos 5 승인으로 시작된 규제 반전을 완료하며 Anthropic의 Fable 5 모델에 대한 수출 제한을 공식적으로 해제했습니다. Mythos 5는 지난주 승인된 기관에서 사용할 수 있도록 허가되었지만, Fable 5는 추가 안전 협상이 진행되는 동안 차단된 상태였습니다. 이번 새로운 조치로 Anthropic은 탈옥에 대한 더 강력한 보호 장치를 구현하고 안전 프로토콜에 대해 정부와 긴밀히 협력하겠다는 약속을 이행한 후, 일반 사용자에 대한 두 모델의 액세스를 복원할 수 있게 되었습니다.

  • 미국 정부가 Anthropic의 Fable 5 모델에 대한 수출 제한을 해제했습니다.
  • 이번 조치는 6월 26일 Mythos 5 승인에 따른 것이며, Fable 5는 유일하게 제한된 모델로 남아 있었습니다.
  • Anthropic은 정부 안전 요구 사항을 충족하기 위해 모델 탈옥에 대한 더 강력한 보호 장치를 구축하기로 약속했습니다.
  • 이러한 통제 해제로 Fable 5와 Mythos 5 모두에 대한 일반 액세스를 복원할 수 있게 되었습니다.

개발자와 일반 사용자는 6월 13일 글로벌 중단 이후 수출 제한 상태로 남아 있던 시리즈의 마지막 모델인 Anthropic의 Fable 5에 대한 전체 액세스 권한을 다시 얻을 수 있게 되었습니다.

21. Moondream HQ, Photon 디코딩 기술 도입

Photon은 고성능 하드웨어가 토큰 선택과 같은 CPU 하우스키핑 작업을 기다리며 유휴 상태로 있는 'GPU 버블'이라는 일반적인 병목 현상을 목표로 합니다. 디코딩 과정을 파이프라인화하고 포워드 패스를 샘플링에서 분리함으로써, Photon은 자유 텍스트 및 제약 디코딩 워크로드 모두에 대해 하드웨어 활용도를 극대화합니다.

  • Moondream HQ는 AI 모델 추론에서 GPU 버블을 제거하기 위해 Photon을 개발했습니다.
  • Photon은 두 세트의 버퍼를 번갈아 사용하는 핑퐁 슬롯과 함께 파이프라인 디코딩을 사용합니다.
  • '지금 포워드, 나중에 샘플링' 메커니즘을 통해 샘플링이 완료되기 전에 다음 포워드 패스를 시작할 수 있습니다.
  • 성능 향상은 NVIDIA 3090에서 12%, 32개 스트림의 B200에서 35%까지 다양합니다.
  • 이 기술은 동일한 파이프라인 내에서 프리필 및 디코딩 작업을 모두 처리합니다.

로컬 추론을 실행하는 개발자들은 CPU-GPU 조정을 최적화하여 최대 35%의 성능 향상을 달성할 수 있습니다.

SOURCES

22. Qwen3.6-35B에 규범 보존적 아블리테이션 적용

전통적인 모델 아블리테이션은 거부 벡터를 투영하면 가중치 규범이 축소되기 때문에 일반적인 성능을 저하시키는 경우가 많습니다. 하이브리드 MoE Qwen3.6-35B-A3B 모델에 규범 보존적 이중 투영 기술을 적용함으로써, 개발자들은 이제 복잡한 수학 및 코딩 작업에서 원래의 기능을 유지하는 완전히 검열되지 않은 모델에 액세스할 수 있습니다.

  • Qwen3.6-35B-A3B의 거부 방향을 아블리테이션하기 위해 규범 보존적 이중 투영 기술이 사용되었습니다.
  • 이 기술은 가중치 행을 거부 방향에 대해 직교화하면서 원래의 L2 규범으로 재조정합니다.
  • 결과 모델은 수학 및 코드 벤치마크 점수를 유지하면서 테스트 세트에서 0% 거부를 달성했습니다.
  • 편향되지 않은 거부 방향을 추출하기 위해 7,356개의 프롬프트로 구성된 풍부한 유해 데이터셋이 생성되었습니다.
  • 모델, GGUF 양자화 및 데이터셋이 Hugging Face에 출시되었습니다.

개발자들은 가중치 수정으로 인한 저하 없이 완전한 추론 및 코딩 기능을 유지하는 검열되지 않은 모델을 활용할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.