Inference Brew

Alibaba, Qwen3.8-Max API 출시 및 오픈 웨이트 공개 일정 발표

00:00 / --:--

← 메인으로

Alibaba, Qwen3.8-Max API 출시 및 오픈 웨이트 공개 일정 발표

1. Alibaba, Qwen3.8-Max API 출시 및 오픈 웨이트 공개 일정 발표

Alibaba는 2.4조 개의 파라미터를 가진 Qwen3.8-Max 모델을 제한적 프리뷰에서 정식 API 출시로 전환했습니다. 이 모델은 현재 QwenCloud에서 액세스할 수 있으며, Max 버전과 27B 버전의 오픈 웨이트는 다음 주에 공개될 예정입니다. 이 모델은 자율 소프트웨어 엔지니어링 및 장기적 기업 과제를 위해 설계되었으며, OpenAI 및 DashScope 호환 통합 기능을 갖추고 있습니다.

  • Qwen3.8-Max는 현재 QwenCloud에서 API를 통해 사용할 수 있습니다.
  • Qwen3.8-Max 및 Qwen3.8-27B의 오픈 웨이트는 다음 주 공개 예정입니다.
  • API 가격은 입력 토큰 100만 개당 2달러, 출력 토큰 100만 개당 6달러로 책정되었습니다.
  • 이 모델은 100만 토큰의 컨텍스트 윈도우를 지원하며 OSWorld-Verified 벤치마크에서 86.1점을 기록했습니다.

개발자들은 이제 OpenAI 호환 API를 통해 이 최첨단 모델을 프로덕션 워크플로우에 통합할 수 있으며, 곧 자체 호스팅 옵션도 제공될 예정입니다.

2. NVIDIA, NemotronLabs-VoiceChat-11B 모델 출시

Hugging Face에 공개된 NVIDIA-NemotronLabs-VoiceChat-11B는 개발자들에게 대화형 음성 애플리케이션을 구축하기 위한 오픈 웨이트 옵션을 제공합니다. 이 모델의 기본 전이중 지원 기능은 더욱 자연스럽고 동시적인 양방향 오디오 상호작용을 가능하게 합니다.

  • NVIDIA가 Hugging Face 플랫폼에 NVIDIA-NemotronLabs-VoiceChat-11B 모델을 공개했습니다.
  • 이 모델은 기본적으로 전이중 음성 통신을 지원합니다.

개발자들은 이 모델을 통합하여 동시 양방향 통신이 가능한 저지연의 자연스러운 음성 에이전트를 구축할 수 있습니다.

SOURCES

3. Hoplite, 코딩 에이전트 배포를 위한 클라우드 플랫폼 출시

Hoplite는 AI 모델이 수동 코드 리뷰의 필요성을 줄임에 따라 사용자 흐름 평가, 시각적 검증, API/CLI 테스트에 집중합니다. Temporal과 Modal을 활용하여 복잡한 에이전트 워크플로우를 클라우드에서 실행할 수 있는 강력하고 샌드박스화된 환경을 제공합니다.

  • Hoplite는 기능 QA를 촉진하기 위해 코딩 에이전트를 배포하도록 설계된 클라우드 플랫폼입니다.
  • 로컬 세션, 메모리, MCP 서버를 클라우드로 포팅하여 온보딩을 자동화합니다.
  • Codex나 Claude Code와 같은 기성 솔루션 대신 자체 구축한 에이전트 하네스를 사용합니다.
  • 인프라는 AWS에서 호스팅되며 워크플로우에는 Temporal, 샌드박스에는 Modal, 데이터베이스에는 Planetscale을 활용합니다.
  • 창업자들은 'HACKERNEWS' 코드를 사용하여 100달러 크레딧이 포함된 무료 체험을 제공하고 있습니다.

개발자들은 로컬 에이전트 워크플로우를 내구성이 뛰어난 클라우드 호스팅 환경으로 쉽게 이동하여 기능 QA 및 시각적 검증을 자동화할 수 있습니다.

SOURCES

4. Armature, MCP를 위한 세션 분석 및 평가 도구 출시

Armature는 MCP 도구 호출 뒤에 숨겨진 세션을 재구성하여 사용자 요청과 에이전트 추론을 캡처합니다. 이 플랫폼은 armature.tech에서 무료 티어를 포함한 셀프 서비스 도구로 제공되며, 향후 자동화된 평가를 통합하여 수정 사항을 권장하고 대규모로 PR을 생성할 계획입니다.

  • Armature는 Model Context Protocol(MCP)에서 실행되는 에이전트 세션에 대한 제품 분석 및 평가를 제공합니다.
  • 이 도구는 3줄의 코드 통합이 필요하며 TypeScript, Python, Go용 SDK를 제공합니다.
  • 주요 기능으로는 세션 재구성, 클러스터링을 통한 인기 사용 사례 순위 지정, 빈번한 에이전트 문제 식별 등이 있습니다.
  • 계측은 870번의 테스트 실행을 기준으로 계측이 없을 때의 89.15%와 비교하여 89.17%의 성공률을 유지합니다.
  • 데이터 개인정보 보호는 정보가 Armature 서버에 도달하기 전 클라이언트 측에서 수정(redaction)을 통해 관리됩니다.

개발자들은 이제 최소한의 코드 통합으로 에이전트 세션을 재구성하고, 인기 있는 사용 사례를 추적하며, MCP 도구 호출 뒤에 발생하는 빈번한 에이전트 오류를 식별할 수 있습니다.

SOURCES

5. WorkOS, 인증 플랫폼 관리를 위한 전용 MCP 서버 출시

기존의 MCP 호환 OAuth 통합을 기반으로 WorkOS는 전용 MCP 서버를 출시했습니다. 이 새로운 도구를 통해 AI 에이전트는 스코프가 지정된 OAuth 토큰을 사용하여 안전하고 런타임에 검색 가능한 상호작용을 통해 수백 가지의 인증 관련 작업을 직접 수행할 수 있습니다. 이러한 개발을 통해 개발자는 복잡한 사용자 관리 및 시각적 디자인 검증 작업을 자율 에이전트에 위임할 수 있습니다.

  • WorkOS가 자사 인증 플랫폼을 위한 전용 MCP 서버를 출시했습니다.
  • 서버는 런타임에 검색 가능한 수백 가지의 인증 작업을 지원합니다.
  • 연결은 마스터 API 키보다 보안이 강화된 스코프 지정 OAuth 토큰을 사용합니다.
  • 에이전트는 이제 로그인 페이지 디자인 일치와 같은 시각적 입력을 기반으로 작업을 수행할 수 있습니다.

개발자들은 이제 기본적인 OAuth 호환성을 넘어 자율 에이전트를 인증 워크플로우에 완전히 통합할 수 있으며, 시각적 디자인 검증과 같은 복잡한 작업도 수행할 수 있습니다.

SOURCES

6. AI 모델 평가 실행을 위한 smevals 프레임워크 출시

smevals 프레임워크는 평가를 Tasks, Evals, Suites로 구조화하여 AI 모델 벤치마킹 프로세스를 단순화합니다. 이러한 파일 시스템 친화적인 구성은 개발자가 로컬 또는 CI/CD에서 일관된 평가 파이프라인을 유지하고 실행하는 데 도움을 줍니다.

  • smevals는 소형 및 대형 AI 모델에 대한 평가를 실행하기 위해 설계된 프레임워크입니다.
  • 프레임워크의 Eval은 특정 고수준 기능을 측정하는 데 사용되는 Tasks의 모음으로 구성됩니다.
  • Tasks는 AI 모델이 평가받기 위해 완료해야 하는 개별 연습으로 정의됩니다.
  • 이 프레임워크를 사용하면 Evals를 Suites로 그룹화하여 디스크상의 파일 구성을 용이하게 할 수 있습니다.

개발자들은 이 프레임워크를 사용하여 사용자 지정 기능 테스트를 구성, 그룹화 및 실행함으로써 모델 성능을 체계적으로 측정할 수 있습니다.

SOURCES

7. Deasy, 문서 검색을 위한 비정형 데이터 준비 도구 출시

Deasy는 검색 증강 생성(RAG) 파이프라인의 데이터 준비 병목 현상을 해결합니다. 비정형 데이터의 매핑, 필터링 및 강화를 몇 분 만에 자동화함으로써, 이 도구는 개발자가 더 안정적인 검색 및 검색 기능을 구축하도록 돕습니다.

  • Deasy는 비정형 데이터를 매핑, 필터링 및 강화하도록 설계된 소프트웨어 도구입니다.
  • 이 도구는 문서 검색 정확도를 향상시켜 첫 번째 시도에서 올바른 문서가 추출되도록 하는 것을 목표로 합니다.
  • Deasy는 데이터 처리 및 강화 작업을 몇 분 만에 수행합니다.

개발자들은 Deasy를 사용하여 비정형 데이터 세트를 몇 분 만에 정리하고 준비함으로써 RAG 시스템이 첫 번째 시도에서 올바른 문서를 검색하도록 보장할 수 있습니다.

SOURCES

8. Cloudflare Workers AI, Kimi 및 GLM 모델 최적화

Cloudflare의 최적화는 동시 요청 용량과 컨텍스트 제한을 크게 증가시킵니다. 향후 개발 계획에는 FP8 KV 캐시 확장, NVIDIA의 Blackwell 아키텍처에서 NVFP4 웨이트 검증, 무결성 검사 효율성 개선이 포함됩니다.

  • Cloudflare의 Workers AI는 SGLang 추론 서빙 프레임워크를 사용하여 Moonshot의 Kimi K-시리즈와 Z.ai의 GLM을 실행합니다.
  • Cloudflare는 KV 캐시를 16비트(BF16)에서 8비트 부동 소수점(FP8)으로 양자화하여 Kimi K2.6의 컨텍스트 용량을 137만 토큰으로 두 배 늘렸습니다.
  • GLM 5.2의 모델 웨이트는 8비트 부동 소수점에서 4비트 정수(INT4)로 압축되어 체크포인트 크기가 705GB에서 421GB로 줄었습니다.
  • 분산 설계는 디코드 단계에서는 INT4 웨이트를, 프리필 단계에서는 FP8 웨이트를 적용하여 성능을 최적화합니다.
  • Cloudflare는 처리량에 1% 미만의 영향을 미치면서 데이터 손상을 방지하는 KV 캐시 무결성 검사 시스템을 구현했습니다.

이러한 인프라 최적화를 통해 개발자는 Cloudflare의 엣지에서 더 높은 컨텍스트 제한과 동시 요청 용량을 가진 더 큰 모델을 실행할 수 있습니다.

SOURCES

9. Moonshot, 멀티모달 비전 평가를 위한 PerceptionBench 출시

평가 결과는 예측, 기능 보고서 및 구성 메타데이터가 포함된 JSONL, CSV 및 JSON 파일로 내보내집니다. 이러한 구조화된 출력은 개발자가 비전 중심 애플리케이션에 대한 모델 트레이드오프를 쉽게 비교할 수 있도록 합니다.

  • PerceptionBench는 OCR, 카운팅, 위치 파악, 문맥 추론 및 깊이 이해를 포함한 세밀한 시각적 기능을 측정합니다.
  • 평가 워크플로우는 OpenAI 호환 API 및 로컬 Hugging Face 비전-언어 모델을 포함한 여러 백엔드를 지원합니다.
  • 파이프라인에는 탄력적인 데이터 세트 로딩, 이미지 전처리, 프롬프트 구성 및 LLM 지원 판단이 포함됩니다.
  • 프레임워크는 전체 및 기능별 정확도, 부트스트랩 신뢰 구간 및 난이도 슬라이스 성능을 계산합니다.
  • 평가 파이프라인은 블라인드 사전(blind-prior) 기준을 사용하여 API 키나 GPU 없이도 실행할 수 있습니다.

개발자들은 이 오픈 소스 프레임워크를 사용하여 로컬 및 API 기반 비전 모델 전반에서 OCR, 위치 파악 및 깊이 이해를 체계적으로 평가할 수 있습니다.

SOURCES

10. Mend.io, AI 에이전트 및 MCP를 위한 실용적인 보안 프레임워크 출시

이 프레임워크는 중요한 것을 확인하고, 중요한 것을 더 빠르게 수정하며, 프로덕션 환경에서 AI를 보호하는 세 가지 핵심 영역으로 구성됩니다. 또한 NIST AI RMF, OWASP AIMA, ISO/IEC 42001 및 EU AI 법과 일치하는 4단계 성숙도 로드맵도 포함되어 있습니다.

  • Mend.io는 보안 격차를 해결하기 위해 'AI 에이전트, MCP 서버 및 LLM 앱 보안: 실용적인 프레임워크'를 출시했습니다.
  • 가이드는 상호작용, 에이전트, 통합, 모델 및 코드라는 AI 공격 표면의 5개 계층을 식별합니다.
  • Artifact 2.1은 ID, 모델 종속성, 자율성 수준 및 도구 권한을 포함한 9개의 필드가 포함된 AI-BOM을 도입합니다.
  • Artifact 2.2는 자격 증명 범위 지정, 인간 승인 및 시스템 프롬프트 버전 관리를 다루는 12개 항목의 잘못된 구성 체크리스트를 제공합니다.
  • 런타임 보호는 인앱 Python SDK 또는 독립형 Docker API 서버를 통해 구현할 수 있습니다.

개발자들은 이 가이드의 체크리스트와 AI-BOM 사양을 사용하여 프로덕션 환경에서 에이전트 워크플로우와 런타임 환경을 보호할 수 있습니다.

SOURCES

11. JFrog, AI가 생성한 50개 이상의 조작된 SQLite CVE 노출

이 사건은 2024년 2월 NIST가 수동 검증 노력을 줄인 이후 직면한 CVE 제출 프로세스의 시스템적 취약성을 강조합니다. JFrog는 영향을 받는 기록을 수정하기 위해 GHSA, Red Hat 및 NVD에 조사 결과를 보고했습니다.

  • JFrog 연구원들은 GitHub(programmervuln/cveadvisory-)에 있는 50개 이상의 SQLite 취약점 권고가 AI가 생성한 조작물일 가능성이 높다고 식별했습니다.
  • 보고된 취약점은 존재하지 않는 코드를 인용하고, 비기능적인 PoC 페이로드를 제공했으며, SQLite의 공식 보안 페이지에는 없었습니다.
  • Red Hat은 처음에 CVE-2026-51302에 10.0의 치명적 심각도 점수를 할당했으나 나중에 7.6의 높음으로 하향 조정되었습니다.
  • 55개의 권고 사항을 감사한 결과 54개가 완전히 조작되었으며, 하나는 검증되지 않은 메타데이터로 포장된 실제 버그를 포함하고 있었습니다.
  • JFrog는 AddressSanitizer 하의 격리된 Docker 컨테이너에서 PoC 페이로드를 테스트하여 주장의 허위성을 검증했습니다.

조작된 CVE는 자동화된 에이전트에 의한 불필요한 코드 변경과 조사 시간 낭비로 이어질 수 있으므로 개발자는 자동화된 보안 경고에 주의해야 합니다.

SOURCES

12. AirLLM, 4GB GPU에서 70B 모델 추론 가능

Gavin Li가 2023년 11월에 처음 출시한 AirLLM은 Llama, Qwen, DeepSeek, Mistral 및 Gemma를 포함한 주요 모델 제품군과 호환됩니다. 이 라이브러리는 MacOS용 Apple 실리콘도 지원하며 초기화 중에 모델을 레이어별로 분해하고 저장하기 위해 충분한 디스크 공간이 필요합니다.

  • AirLLM은 한 번에 하나의 모델 레이어만 GPU에 유지하여 추론 메모리 사용량을 줄이는 라이브러리입니다.
  • 이 도구를 사용하면 4GB GPU에서 70B 모델을, 8GB GPU에서 405B Llama 3.1 모델을 실행할 수 있습니다.
  • AirLLM은 2.8T Kimi K3 모델을 지원하며 3.72GB의 VRAM을 사용하여 단일 RTX 6000 Ada 카드에서 실행합니다.
  • 버전 3.0에서는 FP8 모델 지원과 DeepSeek-V3 및 Qwen3와의 호환성이 추가되었습니다.
  • 이 라이브러리는 4비트 또는 8비트 모드에서 블록 단위 양자화를 지원하며, 이는 추론 속도를 최대 3배까지 높일 수 있습니다.

개발자들은 값비싼 다중 GPU 설정 없이도 70B LLM이나 2.8T Kimi K3와 같은 거대한 모델을 소비자용 하드웨어에서 로컬로 실행하고 테스트할 수 있습니다.

SOURCES

13. EU AI 법의 투명성 및 라벨링 규칙 발효

유럽 위원회는 플랫폼이 사용할 수 있는 선택적 표준화 AI 공개 라벨을 제공했습니다. 8월 2일 이전에 출시된 AI 모델 및 서비스는 12월 2일까지 새로운 규정을 준수해야 합니다.

  • 유럽 연합의 AI 법 투명성 의무가 8월 2일에 발효되었습니다.
  • 규칙에 따라 기업은 사용자가 AI와 상호작용할 때와 콘텐츠가 AI에 의해 생성되거나 변경될 때 이를 공개해야 합니다.
  • 제공자는 합성 오디오, 이미지, 비디오 및 텍스트에 기계 판독 가능한 표시를 포함해야 합니다.
  • 배포자는 실제처럼 보이도록 설계된 모든 AI 생성 또는 조작된 콘텐츠에 라벨을 부착해야 합니다.
  • 규정 미준수 시 최대 1,500만 유로 또는 전 세계 연간 매출액의 3%에 해당하는 벌금이 부과되며, 기존 서비스에는 4개월의 유예 기간이 주어집니다.

유럽에서 AI 애플리케이션을 배포하는 개발자는 최대 1,500만 유로의 벌금을 피하기 위해 사용자 알림 및 기계 판독 가능한 워터마크를 구현해야 합니다.

SOURCES

14. Cloudflare, 프로그래밍 방식의 비용 가시성을 위한 청구 가능 사용량 API 출시

청구 가능 사용량 API는 개발자가 리소스 소비를 모니터링할 수 있도록 매일 업데이트를 제공합니다. Cloudflare는 향후 업데이트에서 엔터프라이즈 범위, 더 세분화된 시간 창 및 비용 예측을 포함하도록 API를 확장할 계획입니다.

  • Cloudflare는 셀프 서비스 계정에 대한 계정 사용량 및 비용에 대한 프로그래밍 방식의 가시성을 제공하는 청구 가능 사용량 API를 출시했습니다.
  • API는 Workers, R2, D1, Workers AI, Vectorize, Images 및 Stream을 포함한 사용량 기반 제품을 다룹니다.
  • 데이터는 단일 엔드포인트를 통해 제공되며 매일 업데이트되고 제품 및 서비스 기간별로 분류됩니다.
  • API 명명 규칙은 FinOps Open Cost and Usage Specification(FOCUS)과 일치합니다.
  • Cloudflare는 Vantage와 파트너십을 맺고 다른 클라우드 제공업체와 함께 지출을 볼 수 있는 기본 통합을 제공합니다.

개발자들은 코드나 대시보드에서 직접 Workers AI 및 Vectorize를 포함한 AI 및 인프라 지출을 프로그래밍 방식으로 추적하고 예측할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.