Inference Brew

Tencent, 100만 컨텍스트 윈도우를 지원하는 Hy4 프리뷰 공개

00:00 / --:--

← 메인으로

Tencent, 100만 컨텍스트 윈도우를 지원하는 Hy4 프리뷰 공개

1. Tencent, 100만 컨텍스트 윈도우를 지원하는 Hy4 프리뷰 공개

Hy4 프리뷰는 소프트웨어 엔지니어링, 게임 개발, 과학 연구를 포함한 생산성 작업을 위해 설계되었습니다. 엔지니어링 작업에 대한 내부 평가에서 이 모델은 4.00점 만점에 2.99점을 기록하며 GLM-5.3 및 Kimi K3를 능가했습니다. 또한, 모델은 자체 추론 시스템을 자율적으로 최적화하여 엔드투엔드 처리량을 31.8% 향상시키는 등 개발 과정에 직접 참여했습니다.

  • • Hy4 프리뷰는 총 7,700억 개의 파라미터, 490억 개의 활성 파라미터, 100만 토큰 이상의 컨텍스트 윈도우를 제공합니다.
  • • API 가격은 입력 토큰 100만 개당 0.834달러, 출력 토큰 100만 개당 2.501달러, 캐시 히트 시 100만 토큰당 0.042달러로 책정되었습니다.
  • • 이 모델은 Tencent Cloud TokenHub, OpenRouter, WorkBuddy, CodeBuddy를 통해 전 세계적으로 이용 가능합니다.
  • • Tencent는 모델을 1.5TB에서 GGUF 형식의 약 200GB로 압축하면서도 원래 성능의 약 98%를 유지했습니다.

개발자들은 OpenRouter와 Tencent Cloud를 통해 매우 경쟁력 있는 API 가격으로 고성능의 긴 컨텍스트 Mixture-of-Experts 모델을 전 세계 어디서나 사용할 수 있습니다.

2. vLLM v0.28.0, DeepSeek V4 지원 및 배치 토큰 용량 2배 확대

이번 메이저 릴리스에는 270명의 기여자가 참여한 584개의 커밋이 포함되었습니다. 모델 및 하드웨어 지원 확장 외에도 Transformers 라이브러리 의존성이 버전 5.15.0으로 업데이트되었으며, bitsandbytes 지원은 아웃 오브 트리(out-of-tree) 플러그인으로 이전되었습니다. 사전 빌드된 휠(wheel)은 CUDA 12.9 및 13.0과 macOS를 포함한 CPU 전용 환경에서 사용할 수 있습니다.

  • • vLLM v0.28.0은 Sparse MLA, AMD Quark NVFP4 지원 및 ROCm 활성화를 포함한 DeepSeek V4 지원을 도입했습니다.
  • • 기본 max_num_batched_tokens가 8,192에서 16,384로 두 배 증가하여 처리량이 향상되었습니다.
  • • Kimi-K3에 대한 성능 최적화에는 Decode Context Parallel 지원, 융합된 FlashKDA 커널, 적응형 추론 토큰 예산이 포함됩니다.
  • • 이번 릴리스는 Muse Glimmer, Ling 3.0 Flash, Dots3 NOTE, Interns2mobius를 포함한 새로운 모델에 대한 지원을 추가했습니다.

오픈 웨이트 모델을 호스팅하는 개발자는 최적화된 DeepSeek V4 서빙을 활용하고 기본 배치 토큰 용량을 두 배로 늘려 더 높은 처리량을 확보할 수 있습니다.

SOURCES

3. 에이전트 평가 비용 절감을 위한 TerminalBench 4.0 출시

이전 버전의 Terminal-Bench 제품군을 기반으로 하는 TerminalBench 4.0은 초기 버전의 높은 비용과 토큰 요구 사항을 해결하기 위해 설계된 경량 프레임워크를 도입했습니다. 이를 통해 개발자는 이전 벤치마크에서 요구되던 방대한 토큰 수 없이도 에이전트 하네스(harness)와 도구 통합을 빠르게 반복할 수 있습니다.

  • • TerminalBench 4.0은 이전 Terminal-Bench 시리즈의 후속 버전입니다.
  • • 새 버전은 50억~100억 토큰 규모에서 벗어나 벤치마킹을 위한 토큰 요구 사항을 줄였습니다.
  • • 맞춤형 코딩 에이전트 하네스의 빠른 반복을 위해 최적화되었습니다.
  • • 도구 수정 및 프롬프트 엔지니어링을 평가할 수 있는 보다 접근하기 쉬운 방법을 제공합니다.

이번 업데이트를 통해 개발자는 에이전트 수정이 성능과 토큰 효율성에 미치는 영향을 더 저렴하게 측정할 수 있어 개발 주기를 단축할 수 있습니다.

SOURCES

4. StemDeck, 오픈 소스 로컬 AI 오디오 스템 분리 도구 출시

StemDeck은 DAW 스타일의 멀티트랙 믹서, 파형 편집기, BPM, 키, 스케일 및 라우드니스(LUFS) 분석 도구가 통합된 완전한 로컬 오디오 조작 환경을 제공합니다. 기기 내에서 완전히 작동하므로 구독, 계정 생성, 클라우드 업로드가 필요 없어 로컬 오디오 전처리를 위한 안전하고 비용 효율적인 옵션입니다.

  • • StemDeck은 오디오 파일이나 YouTube URL을 보컬, 드럼, 베이스, 기타, 피아노, 기타 등 6개 트랙으로 분리합니다.
  • • 이 도구는 Python 3.12, FastAPI 백엔드, Tauri v2 데스크톱 셸로 구축되었으며 완전히 로컬에서 실행됩니다.
  • • 고품질 오디오 분리를 위해 Demucs htdemucs_6s 신경망을 활용합니다.
  • • macOS, Windows, Linux 전반에서 NVIDIA 하드웨어의 CUDA 및 Apple Silicon의 MPS를 통한 GPU 가속을 지원합니다.

오디오 처리 또는 멀티모달 애플리케이션을 구축하는 개발자는 클라우드 의존성 없이 완전히 로컬에서 GPU 가속 파이프라인을 활용하여 보컬과 악기를 분리할 수 있습니다.

SOURCES

5. Claude Code, 일시적 상향 조정 후 영구적인 주간 사용 제한 설정

Claude Code의 이전 제한 확대 조치를 기반으로, ClaudeDevs는 새로운 영구 정책을 발표했습니다. 9월 14일부터 Pro, Max, Team 및 Enterprise 플랜 사용자는 표준 주간 제한이 25% 영구적으로 증가합니다. 이는 현재 적용 중인 일시적인 50% 상향 조치를 대체하는 것으로, 일시적 수준보다는 17% 감소하지만 개발자 워크플로우를 위한 더 높은 장기적 기준을 확립하게 됩니다.

  • • Pro, Max, Team 및 Enterprise 플랜에 대해 9월 14일부터 주간 제한이 25% 영구적으로 증가합니다.
  • • 이번 변경으로 사용자는 현재 적용 중인 일시적인 50% 제한 상향 조치에서 전환됩니다.
  • • 새로운 영구 제한은 일시적인 50% 수준보다 17% 감소한 수치입니다.
  • • 이는 2026년 5월과 6월에 보고된 Claude Code의 이전 제한 확대 조치에 따른 것입니다.

이번 업데이트는 Claude Code 사용자를 위한 장기적인 용량을 공식화하여, 이전 제한 확대 조치에서 설정된 초기 기준보다 영구적으로 증가된 사용량을 제공합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.