Inference Brew

수수께끼의 'Ox Alpha' 모델, 일일 100조 토큰 무료 제공으로 데뷔

00:00 / --:--

← 메인으로

수수께끼의 'Ox Alpha' 모델, 일일 100조 토큰 무료 제공으로 데뷔

1. 수수께끼의 'Ox Alpha' 모델, 일일 100조 토큰 무료 제공으로 데뷔

이 모델의 일일 100조 토큰 처리 용량은 Zhipu AI의 1만 개 GPU 클러스터와 같은 상당한 컴퓨팅 자원을 보유한 제공업체의 지원을 시사합니다. 토크나이저 연산 및 비디오 인코딩을 포함한 아키텍처상의 단서들은 Zhipu의 GLM 계보를 강력히 가리키고 있으나, 일각에서는 Microsoft나 DeepSeek의 모델일 가능성도 제기하고 있습니다.

  • • Ox Alpha는 100만 토큰의 멀티모달 컨텍스트 윈도우와 131,072 토큰의 출력 제한을 특징으로 합니다.
  • • 이 모델은 8월 20일부터 OpenRouter와 OpenCode에서 무료로 이용 가능합니다.
  • • Kingbench 리더보드에서 87.5%의 점수를 기록했습니다.
  • • 추측에 따르면 이 모델은 Zhipu AI의 미출시 GLM-5, DeepSeek의 V4-Flash, 또는 Microsoft의 MAI 2와 관련이 있습니다.
  • • 이 모델은 코딩, 지속적인 에이전트 작업, 텍스트와 시각적 컨텍스트를 결합한 프로덕션 워크로드에 최적화되어 있습니다.

개발자들은 코딩 및 에이전트 워크로드를 위해 매우 뛰어난 성능의 긴 컨텍스트 멀티모달 모델을 완전히 무료로 활용할 수 있게 되었습니다.

SOURCES

2. Model Context Protocol, 에이전트 프리미티브 및 보안을 위한 로드맵 발표

핵심 관리자와 커뮤니티 워킹 그룹이 개발한 이 로드맵은 이러한 핵심 영역에 부합하는 사양 개선 제안(SEP)을 우선시합니다. 개발자들은 SEP를 제안하거나 활발한 워킹 그룹에 참여하여 직접 기여할 수 있습니다.

  • • 로드맵은 에이전트 메시징 프리미티브와 HTTP 네이티브 전송 통합을 포함한 5가지 우선순위 영역을 식별합니다.
  • • HTTP 네이티브 전송 통합은 원격 MCP 서버를 표준 HTTP 워크로드로 취급하여 개발을 간소화하는 것을 목표로 합니다.
  • • 보안 우선순위에는 DPoP(Demonstrating Proof of Possession) 마무리와 워크로드 ID 연합 표준 정의가 포함됩니다.
  • • 에이전트 메시징 작업에는 서버 시작 이벤트 구현과 Tasks 확장(SEP-2663)의 성숙화가 포함됩니다.
  • • 개선된 프리미티브는 도구 호출 결과 처리를 표준화하고 대규모 도구 카탈로그를 위한 점진적 검색 기능을 도입할 것입니다.

이 로드맵은 에이전트 간 통신을 위한 향후 표준을 제시하며, 보안성이 뛰어나고 상호 운용 가능한 프로덕션 수준의 AI 에이전트를 더 쉽게 구축할 수 있게 합니다.

SOURCES

3. 오픈소스 'Decode' 에이전트, 에이전트 워크플로우를 위한 3가지 실행 모드 시연

이 프로젝트는 에이전트 아키텍처의 경제적 측면과 성능 간의 상충 관계를 강조합니다. 높은 처리량이 필요한 워크로드의 경우, 피크 대비 평균 수요 비율이 예약 할인율을 초과할 때 서버리스 GPU 사용이 예약된 용량보다 비용 효율적임을 보여줍니다.

  • • Decode 에이전트는 다양한 실행 환경을 처리하기 위해 대화형, 원격, 비동기 실행 모드를 제공합니다.
  • • 대화형 모드는 도구 실행 중 사용자 입력을 관리하기 위해 우선순위 게이트가 있는 스티어링 큐를 사용합니다.
  • • 원격 모드는 Kitaru와 같은 에이전트 런타임에서 실행되며, Modal과 같은 플랫폼에서 작업을 병렬로 수행합니다.
  • • 비동기 모드는 작업을 작업 큐로 오프로드하여 백그라운드 워크플로우가 시작 클라이언트보다 오래 지속될 수 있도록 합니다.
  • • LangChain의 Terminal-Bench 결과, 모델을 고정한 상태에서 에이전트의 하네스를 변경했을 때 성능이 30위권에서 5위권으로 향상되었습니다.
  • • 1,000개의 문서를 처리하는 데 드는 비용은 프론티어 API 사용 시 약 97달러인 반면, 배치 GPU 시간 사용 시 13달러입니다.

개발자들은 이러한 아키텍처 패턴을 채택하여 사용자 지연 시간, 서버리스 처리량 또는 장기 실행 백그라운드 작업에 맞게 에이전트를 최적화할 수 있습니다.

SOURCES

4. NeMo Guardrails를 활용한 계층형 안전 파이프라인 구현

이 가이드는 OpenAI 모델 구성, YAML 설정 정의, 상태 유지형 다중 턴 상호작용 중 레일 활성화 추적 방법을 다룹니다. 또한 개발자가 프로덕션 배포 전에 가드레일의 효과를 감사할 수 있도록 레드팀 스타일의 커버리지 보고서도 포함하고 있습니다.

  • • 이 튜토리얼은 LLM 기반 금융 비서를 위한 계층형 파이프라인 구축을 시연합니다.
  • • 파이프라인에는 결정론적 PII 탐지, 계좌 번호 마스킹, 정책 기반 도구 게이팅이 포함됩니다.
  • • 결정론적 제어를 위해 Colang 플로우를 사용하고, ActionResult 컨텍스트 업데이트를 위해 파이썬 액션을 사용합니다.
  • • 내부 문서가 모델에 도달하기 전에 필터링하기 위해 키워드 기반 지식 검색기가 구현되었습니다.
  • • 이 프레임워크는 통과율, 하드 스톱, 토큰 소비량을 측정하는 커버리지 제품군을 사용하여 검증됩니다.

개발자들은 프롬프트 인젝션 및 데이터 유출로부터 엔터프라이즈 LLM 애플리케이션을 보호하기 위해 강력하고 결정론적인 안전 제어 장치와 레드팀 검증을 구현할 수 있습니다.

SOURCES

5. Qwen3.6-27B 도구 호출 실패의 근본 원인 규명

Qwen3.6-27B의 JSON 형식 오류에 대한 이전 보고서를 바탕으로 진행된 새로운 기술 분석에 따르면, 저비트 KV 캐시 및 가중치 양자화(특히 Int4 및 NVFP4)가 재현 가능한 도구 호출 실패와 토큰 발산을 유발하는 것으로 나타났습니다. 이 연구는 이러한 오류가 모델 아키텍처 자체의 결함이 아니라 과도한 압축의 결과물임을 확인했으며, 개발자들은 안정적인 에이전트 워크플로우를 위해 INT8 또는 FP8 형식을 우선적으로 고려해야 함을 시사합니다.

  • • Int4 KV 캐시 양자화는 BF16이나 int8에서는 발생하지 않는 재현 가능한 도구 호출 오류를 유발합니다.
  • • NVIDIA의 NVFP4 양자화는 88k 컨텍스트에서 50%의 플립에 도달하며 가장 높은 토큰 발산을 보였습니다.
  • • NVFP4와 AWQ W4A16 모델 모두 Cisco 명령줄 도구 호출을 올바르게 실행하지 못했습니다.
  • • INT8 W8A16은 도구 호출 충실도를 유지하는 데 가장 신뢰할 수 있는 양자화 방식으로 남아 있습니다.
  • • 토큰 생성 발산은 클러스터 단위로 발생하며, 이는 초기 다중 에이전트 평가에서 관찰된 형식 오류의 간헐적인 특성을 설명합니다.

개발자들은 도구 오케스트레이션에 문제가 있다고 알려진 특정 고압축 양자화 방식을 피함으로써 에이전트의 조용한 실패를 방지할 수 있게 되었습니다.

SOURCES

6. 단일 RTX 5090에서 262K 컨텍스트로 구동되는 Qwen3.8-27B

로컬 배포는 KDE 데스크탑 환경을 실행하는 Arch Linux 시스템에서 구성되었습니다. 모델의 내장 다중 토큰 예측(MTP) 헤드가 성능을 저하시키고 VRAM 소비를 증가시켰기 때문에 실행 중 추론적 디코딩(Speculative decoding)은 명시적으로 비활성화되었습니다.

  • • 이 설정은 짧은 컨텍스트에서 초당 77.2 토큰, 128K 상주 컨텍스트에서 초당 64.7 토큰의 성능을 달성했습니다.
  • • 구성은 모델의 NVFP4 ModelOpt 내보내기, FP8 KV 캐싱, vLLM 0.27.1의 FlashInfer 커널을 활용합니다.
  • • 전체 262,000 토큰 프리필 작업이 166초 만에 완료되었습니다.
  • • 프리픽스 캐싱을 통해 22.3배의 속도 향상을 달성하여 첫 토큰 생성 시간을 6.437초에서 0.288초로 단축했습니다.
  • • 시스템은 RTX 5090의 32GB VRAM 중 약 30.5GB를 사용했습니다.

이 시연은 개발자들이 단일 소비자용 GPU에서 높은 처리량으로 긴 컨텍스트의 중형 모델을 로컬로 호스팅할 수 있음을 보여줍니다.

SOURCES

7. Llama.cpp 버전 0.2.0 출시

이번 릴리스는 널리 사용되는 로컬 LLM 추론 프레임워크의 마일스톤 버전 업데이트를 의미합니다. 개발자들은 공식 저장소에서 업데이트된 소스 코드와 사전 빌드된 바이너리를 직접 액세스할 수 있습니다.

  • • Llama.cpp 버전 0.2.0이 공식적으로 출시되었습니다.
  • • 릴리스를 위한 사전 빌드는 GitHub 태그 b10566에서 이용 가능합니다.
  • • 전체 변경 로그와 소스 코드는 프로젝트의 GitHub 저장소에 호스팅되어 있습니다.

로컬 추론을 위해 llama.cpp를 사용하는 개발자들은 최신 안정 릴리스로 업데이트하여 새로운 기능과 최적화의 이점을 누릴 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.