Inference Brew

Z.ai, GLM-5.3 모델의 오픈 웨이트 공개

00:00 / --:--

이 브리핑에는 아직 오디오가 없습니다.

← 메인으로

Z.ai, GLM-5.3 모델의 오픈 웨이트 공개

1. Z.ai, GLM-5.3 모델의 오픈 웨이트 공개

Z.ai는 자사의 플래그십 모델인 GLM-5.3의 웨이트를 공식적으로 공개하며, 지난 8월 14일 초기 API 출시 당시 약속했던 일정을 이행했습니다. 7,530억 개의 파라미터를 가진 이 Mixture-of-Experts(MoE) 모델은 100만 토큰의 컨텍스트 윈도우와 12만 8,000토큰의 최대 출력 길이를 지원합니다. 웨이트는 공개되었으나, Z.ai는 연간 매출 100억 달러 이상의 기업이 상업적으로 사용할 경우 보안 검토를 거쳐야 한다는 새로운 상업용 라이선스를 도입했습니다. 이 모델은 vLLM 및 SGLang과 같은 런타임과 호환되지만, 로컬 실행을 위해서는 상당한 하드웨어 자원이 필요합니다.

  • • GLM-5.3 오픈 웨이트는 현재 Hugging Face에서 BF16 및 FP8 형식으로 제공됩니다.
  • • 이번 공개는 8월 14일 API 출시 당시 약속했던 오픈 소스 공약을 이행한 것입니다.
  • • 연간 매출 100억 달러 이상의 기업은 상업적 사용 전 보안 검토를 통과해야 하는 새로운 라이선스가 적용됩니다.
  • • 로컬 실행에는 상당한 하드웨어가 필요하며, 2비트 양자화에는 245GB, 8비트 양자화에는 810GB의 메모리가 필요합니다.
  • • 이 모델은 vLLM, SGLang, KTransformers 및 Transformers와 계속 호환됩니다.

이전에는 API를 통해서만 접근 가능했던 대규모 GLM-5.3 모델을 이제 개발자가 직접 호스팅할 수 있게 되었으며, 100만 토큰 컨텍스트 MoE 아키텍처를 로컬 환경에 배포할 수 있게 되었습니다.

2. Cohere, North-Micro-Vision-Instruct를 Parse 5 API로 상용화

Cohere는 이전에 오픈 웨이트 모델로 공개되었던 North-Micro-Vision-Instruct 아키텍처를 기반으로 한 상업용 API 서비스 'Parse 5'를 출시했습니다. Parse 5는 PDF, 슬라이드, 이미지를 구조화된 마크다운으로 변환하는 데 최적화된 23억 파라미터 규모의 비전 언어 모델로, 비용은 1,000페이지당 1.50달러입니다. 이 서비스는 현재 Cohere API, AWS SageMaker, Microsoft Foundry를 통해 이용 가능하며, 기존 연구 중심 모델보다 프로덕션 환경에 적합한 대안을 제공합니다.

  • • Parse 5는 North-Micro-Vision-Instruct 아키텍처를 기반으로 구축된 상업용 API 서비스입니다.
  • • 서비스 가격은 1,000페이지당 1.50달러입니다.
  • • 9개 언어를 지원하며, 구조화된 마크다운 또는 HTML 표와 경계 상자가 포함된 '블록' 모드로 출력할 수 있습니다.
  • • Cohere API, AWS SageMaker, Microsoft Foundry를 통해 즉시 이용 가능합니다.
  • • 8,192토큰의 컨텍스트 윈도우와 23억 파라미터 아키텍처를 특징으로 합니다.

개발자들은 이제 오픈 웨이트 모델인 North-Micro-Vision-Instruct로 프로토타이핑을 마친 후, 예측 가능한 가격과 엔터프라이즈 지원을 갖춘 관리형 프로덕션급 문서 파싱 서비스로 전환할 수 있습니다.

SOURCES

3. Agnes AI, 저비용 API를 갖춘 Agnes 2.5 Pro Beta 출시

싱가포르에 본사를 둔 Agnes AI는 에이전트 벤치마크에서 상당한 성능 향상을 보인 멀티모달 모델 Agnes 2.5 Pro Beta를 출시했습니다. Artificial Analysis Intelligence Index에서 49점을 기록한 이 모델은 Gemini 3.5 Flash 및 GPT-5.6 Luna의 바로 뒤를 잇는 위치를 차지했습니다. 100만 토큰의 컨텍스트 윈도우를 제공하며 최대 65,000개의 출력 토큰을 지원합니다. Agnes AI는 이 모델을 무료 옴니모달 API를 통해 제공하며, 상업용 가격은 100만 입력 토큰당 0.10달러, 100만 출력 토큰당 0.30달러라는 매우 낮은 수준으로 책정했습니다.

  • • Agnes 2.5 Pro Beta는 Artificial Analysis Intelligence Index에서 49점을 기록하여 Gemini 3.5 Flash와 GPT-5.6 Luna의 뒤를 잇는 성적을 거두었습니다.
  • • 이 모델은 100만 토큰의 컨텍스트 윈도우를 특징으로 하며 최대 65,000개의 출력 토큰을 지원합니다.
  • • 상업용 가격은 100만 입력 토큰당 0.10달러, 100만 출력 토큰당 0.30달러, 100만 캐시 히트 토큰당 0.01달러로 설정되었습니다.
  • • 텍스트와 이미지 입력 모달리티를 모두 지원하며 무료 옴니모달 API를 통해 이용 가능합니다.
  • • 이 모델은 이전 모델보다 약 2배 많은 평균 50,000개의 출력 토큰을 사용하여 에이전트 성능을 향상시켰습니다.

개발자들은 무료 옴니모달 API 또는 매우 저렴한 상업용 요금제를 통해 100만 토큰 컨텍스트 윈도우를 갖춘 고성능 에이전트 모델을 사용할 수 있습니다.

SOURCES

4. Halo Neuro, 음성 복제 모델 Sopro V2 Turbo 오픈 소스 공개

Halo Neuro는 자사의 음성 복제 모델 Sopro V2를 도입하고, 1억 2,000만 파라미터의 소형 다국어 변형 모델인 Sopro V2 Turbo를 오픈 소스로 공개했습니다. Sopro V2 Turbo는 로컬 실행에 최적화되어 있어 표준 노트북 CPU와 웹 브라우저 내에서 실시간 음성 복제 스트리밍을 가능하게 합니다. 이번 공개를 통해 개발자들은 클라우드 기반 음성 합성 API를 대체할 수 있는 가볍고 지연 시간이 없는 대안을 확보하게 되었습니다.

  • • Sopro V2 Turbo는 1억 2,000만 파라미터의 다국어 음성 복제 모델입니다.
  • • 이 모델은 완전한 오픈 소스이며 노트북 CPU와 웹 브라우저에서 로컬로 실행되도록 설계되었습니다.
  • • Halo Neuro는 오픈 소스 공개와 함께 상업용 Sopro V2 음성 복제 모델도 함께 선보였습니다.

개발자들은 값비싼 클라우드 기반 오디오 API에 의존하지 않고도 클라이언트 기기에서 직접 지연 시간이 짧은 다국어 음성 복제 기능을 배포할 수 있습니다.

SOURCES

5. OpenAI Python SDK, HTTPX2로 마이그레이션

공식 OpenAI Python SDK는 기본 HTTP 클라이언트를 기존 HTTPX에서 HTTPX2로 마이그레이션했습니다. 이번 전환으로 인해 몇 가지 주요 변경 사항이 도입되었으며, 가장 눈에 띄는 점은 TLS 검증 방식을 certifi CA 번들에서 truststore 라이브러리를 통한 운영체제 기본 신뢰 저장소로 변경한 것입니다. 사용자 정의 인증서 구성, 사용자 정의 전송 또는 사용자 정의 미들웨어 후크에 의존하는 개발자는 HTTPX2의 새로운 요청 및 응답 객체와 인터페이스하도록 코드를 업데이트해야 합니다.

  • • OpenAI Python SDK는 이제 자동으로 HTTPX2를 설치 및 사용하며, 기본 설치에서 기존 httpx 패키지를 제거합니다.
  • • HTTPX2는 TLS 검증을 위해 certifi CA 번들 대신 운영체제의 기본 신뢰 저장소를 기본값으로 사용합니다.
  • • 사용자 정의 인증서가 필요한 개발자는 이제 SSL_CERT_FILE/DIR 환경 변수를 구성하거나 ssl.SSLContext를 전달해야 합니다.
  • • SDK는 타임아웃과 연결 풀을 관리하기 위해 DefaultHttpx2Client 및 DefaultAsyncHttpx2Client 도우미를 도입했습니다.
  • • 사용자 정의 인증 핸들러, 후크 및 전송 인터페이스는 HTTPX2 요청 및 응답 객체를 지원하도록 업데이트되어야 합니다.

OpenAI Python SDK를 사용하는 개발자는 의존성 업데이트와 사용자 정의 TLS 검증 또는 사용자 정의 HTTP 클라이언트 구성에서 발생할 수 있는 잠재적인 호환성 문제를 대비해야 합니다.

SOURCES

6. Pydantic, Python HTTP 클라이언트 라이브러리 HTTPX2 인수

Pydantic은 HTTPX 프로젝트의 관리를 인수하여 Python을 위한 차세대 HTTP 클라이언트 라이브러리인 HTTPX2를 출시했습니다. HTTPX2는 requests API와의 호환성을 유지하면서 완전히 타입이 지정된 동기 및 비동기 인터페이스, 기본 HTTP/2 지원 및 연결 풀링을 제공합니다. 특히 API 파이프라인을 모니터링하는 AI 개발자에게 중요한 점은 HTTPX2에 Pydantic Logfire를 위한 내장 계측 기능이 포함되어 있어, OpenTelemetry 호환 관측성을 즉시 사용할 수 있다는 것입니다.

  • • HTTPX2는 Pydantic의 관리 하에 기존 HTTPX 프로젝트를 계승하는 Python용 완전한 기능을 갖춘 HTTP 클라이언트 라이브러리입니다.
  • • 이 라이브러리는 완전히 타입이 지정된 동기 및 비동기 API를 통해 HTTP/1.1 및 HTTP/2 프로토콜을 모두 지원합니다.
  • • OpenTelemetry 기반 관측성을 지원하기 위해 Pydantic Logfire를 위한 내장 계측 기능을 갖추고 있습니다.
  • • HTTPX2는 BSD 라이선스로 출시되었으며 100% 테스트 커버리지를 유지합니다.
  • • 핵심 의존성으로는 httpcore2, h11, anyio, truststore, idna가 있습니다.

Python 개발자들은 LLM 제공업체에 대한 API 호출을 더 쉽게 추적할 수 있도록 OpenTelemetry 계측 기능이 내장된 현대적이고 타입이 지정된 HTTP 클라이언트를 사용할 수 있게 되었습니다.

SOURCES

7. Meta와 UIUC, 장기 에이전트를 위한 EvoHarness-RL 도입

Meta AI와 UIUC의 연구진은 복잡하고 장기적인 엔터프라이즈 작업에서 AI 에이전트의 성능을 향상시키기 위해 설계된 프레임워크인 EvoHarness-RL을 도입했습니다. 통합된 Belief, Progress, Experience(BPE) 인터페이스를 활용하여 에이전트 상호작용을 추적(track), 커밋(commit), 회상(recall), 메모(note)라는 4가지 핵심 메타 액션으로 제한합니다. 평가 결과, 이 방법으로 훈련된 경량 Qwen3-8B 모델은 ALFWorld 벤치마크에서 96.9%의 성공률을 달성하여 여러 대형 프론티어 모델을 능가했습니다. 개발자에게 중요한 점은 EvoHarness-RL이 기존 오케스트레이션 스택에 추가적인 상태 관리 계층으로 직접 통합되도록 설계되었다는 것입니다.

  • • EvoHarness-RL은 통합된 Belief, Progress, Experience(BPE) 인터페이스를 사용하여 에이전트 상태를 관리합니다.
  • • 이 프레임워크는 에이전트 상호작용을 추적, 커밋, 회상, 메모라는 4가지 메타 액션으로 구조화합니다.
  • • EvoHarness-RL로 훈련된 Qwen3-8B 모델은 ALFWorld 벤치마크에서 96.9%의 성공률을 달성하여 더 큰 프론티어 모델들을 앞섰습니다.
  • • 훈련 파이프라인은 지도 학습 하니스 미세 조정과 도구 사용 최적화를 위한 비용 인식 강화 학습을 결합합니다.
  • • EvoHarness-RL은 기존 도구를 교체하지 않고도 상태 관리 계층으로 기존 오케스트레이션 시스템에 추가할 수 있습니다.

개발자들은 EvoHarness-RL을 기존 에이전트 오케스트레이션 시스템에 추가 상태 관리 계층으로 통합하여, 값비싼 프론티어 API로 업그레이드하지 않고도 작업 성공률을 높일 수 있습니다.

SOURCES

8. Vercel, WebGPU 셰이더 배포를 위한 vgpu 오픈 소스 공개

Vercel은 WebGPU 셰이더 배포를 간소화하기 위해 설계된 TypeScript 라이브러리인 vgpu를 오픈 소스로 공개했습니다. `.wgsl` 파일을 표준 임포트 가능 모듈로 취급함으로써 vgpu는 바인딩 및 레이아웃의 빌드 타임 리플렉션을 가능하게 합니다. 이 라이브러리는 브라우저 캔버스, Google의 Dawn을 통한 헤드리스 Node.js 환경, CI 파이프라인을 위한 결정론적 모의 테스트를 지원하는 등 매우 다재다능합니다. gzipped 기준 25KB에 불과한 이 패키지는 CLI와 호스팅된 읽기 전용 MCP(Model Context Protocol) 서버도 함께 제공합니다.

  • • vgpu는 WebGPU 셰이더(.wgsl) 파일을 임포트 가능한 모듈로 취급하는 MIT 라이선스 TypeScript 라이브러리입니다.
  • • 이 라이브러리는 브라우저 캔버스, Dawn을 통한 헤드리스 Node.js, CI 테스트를 위한 결정론적 모의 테스트 등 세 가지 런타임을 지원합니다.
  • • vgpu로 컴파일된 전체 화면 효과는 gzipped 기준 약 25KB이며, CI 예산에 의해 강제됩니다.
  • • 이 패키지는 npm 버전 0.3.1에서 이용 가능하며 CLI, 문서, 호스팅된 읽기 전용 MCP 서버를 포함합니다.
  • • 단일 컨텍스트 핸들을 특징으로 하며 통합을 단순화하기 위해 숨겨진 전역 상태를 피합니다.

개발자들은 빌드 타임 타입이 지정된 25KB 라이브러리와 포함된 MCP 서버를 사용하여 고성능 WebGPU 셰이더를 웹 앱과 AI 에이전트에 쉽게 통합할 수 있습니다.

SOURCES

9. Perplexity Search API, Artificial Analysis Index 1위 차지

Perplexity Search가 Artificial Analysis Search Index에 추가되어 즉시 낮음, 중간, 높음 컨텍스트 변형 전반에서 1위를 차지했습니다. 이는 8월 18일 인덱스가 처음 출시된 이후 AI 에이전트의 검색 API 성능에 대한 표준화된 벤치마크를 확립한 결과입니다. Perplexity의 중간 변형 모델은 80점을 기록하여 Parallel 및 Brave Search와 같은 이전 선두 주자들을 능가했으며, 테스트된 제공업체 중 가장 낮은 모델 추론 비용을 유지했습니다.

  • • Perplexity Search가 Artificial Analysis Search Index에서 1위로 데뷔했습니다.
  • • 중간 변형 모델은 80점을 기록하여 이전 선두 주자인 Parallel 및 Brave Search를 앞섰습니다.
  • • Perplexity는 작업당 가장 낮은 모델 추론 비용(0.028달러~0.034달러)을 달성했습니다.
  • • 중간 및 높음 컨텍스트 변형의 작업당 총 비용은 약 0.091달러입니다.
  • • 평가는 오픈 소스 Stirrup 에이전트 하니스를 사용하여 수행되었습니다.

개발자들은 이제 Perplexity의 API가 다른 검색 제공업체와 비교하여 Artificial Analysis 벤치마크에서 어떤 위치에 있는지 확인할 수 있으며, 에이전트 워크플로우를 위한 높은 정확도의 검색과 비용 효율성을 확인할 수 있습니다.

SOURCES

10. llama.cpp의 폴백 동작으로 인한 GGUF 양자화 크기 오표기 문제

llama.cpp 양자화 파이프라인의 자동 폴백 동작으로 인해 많은 GGUF 모델이 파일명에 표시된 것보다 훨씬 큰 것으로 나타났습니다. 텐서 차원이 256으로 나누어떨어지지 않으면 양자화기는 자동으로 IQ4_NL 또는 Q4_0과 같은 더 높은 비트의 폴백 유형으로 대체합니다. 443개의 GGUF 파일을 감사한 결과, Nemotron-3.5-Lightning을 포함하여 64개의 모델이 영향을 받았으며, 라벨링된 IQ2 변형 모델이 실제로는 4.58 bpw(bits-per-weight)로 측정되었습니다. 개발자가 이러한 불일치를 식별할 수 있도록 전체 파일을 다운로드하지 않고도 GGUF 텐서 구성을 검사할 수 있는 ggufaudit이라는 새로운 도구가 GitHub에 공개되었습니다.

  • • llama.cpp 양자화기는 텐서 차원이 256으로 나누어떨어지지 않을 때 IQ4_NL 또는 Q4_0과 같은 더 높은 비트의 폴백 유형으로 자동 대체합니다.
  • • 25개 저장소에 걸친 443개의 GGUF 양자화 감사 결과, 64개의 모델이 이러한 자동 폴백 동작의 영향을 받는 것으로 나타났습니다.
  • • Nemotron-3.5-Lightning은 심각한 영향을 받아 4개의 IQ2 등급 모두가 라벨링된 낮은 비트 크기가 아닌 4.58 bpw로 측정되었습니다.
  • • 개발자가 GGUF 파일의 실제 텐서 구성을 확인할 수 있도록 GitHub에 ggufaudit이라는 새로운 명령줄 도구가 공개되었습니다.
  • • 이 문제는 업로더의 파이프라인이나 의도가 아닌 모델의 고유한 텐서 차원에 의해 전적으로 결정됩니다.

로컬 모델을 실행하는 개발자들은 새로운 ggufaudit 도구를 사용하여 모델 크기를 부풀리고 로컬 성능을 저하시키는 자동 폴백 대체를 감지할 수 있습니다.

SOURCES

11. Qwen3.8-27B를 위한 새로운 GSQ-RCO 양자화 공개

ISTA Deep Algorithms and Systems Lab은 Qwen3.8-27B 모델을 위한 고도로 최적화된 GGUF 양자화 세트를 공개했습니다. Gumbel-Softmax Quantization(GSQ) 및 Riemannian Constrained Optimization(RCO)을 활용하여 저비트 스칼라 양자화에서 일반적으로 나타나는 성능 격차를 해소했습니다. 2.75 bpw 버전(9.3GB)은 제로샷 평균에서 양자화되지 않은 BF16 기본 모델보다 뛰어난 성능을 보이며, 3.00 bpw 버전은 AIME25 벤치마크에서 기본 모델과 동일한 성능을 기록했습니다. 모든 버전은 llama.cpp, Ollama 및 LM Studio와 완벽하게 호환됩니다.

  • • 이번 공개는 Gumbel-Softmax Quantization(GSQ) 및 Riemannian Constrained Optimization(RCO)을 사용하여 양자화된 Qwen3.8-27B를 특징으로 합니다.
  • • 2.50, 2.75, 3.00 bpw의 세 가지 GGUF 버전이 제공되며 파일 크기는 8.4GB에서 10.1GB 사이입니다.
  • • 2.75 bpw 버전은 제로샷 평균 75.70을 달성하여 양자화되지 않은 BF16 기본 모델의 점수인 74.34를 능가했습니다.
  • • 3.00 bpw 버전은 AIME25 벤치마크에서 100.00점을 기록하여 BF16 기본 모델과 동일한 성능을 보입니다.
  • • 이 모델들은 llama.cpp, Ollama, LM Studio를 포함한 표준 로컬 런타임과 완벽하게 호환됩니다.

로컬 모델을 실행하는 개발자들은 이러한 고급 GGUF 양자화 버전을 사용하여 성능 저하 없이 소비자용 하드웨어에서 27B 파라미터 모델을 배포할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.