Inference Brew

Google, Gemini Distillation Service 출시

00:00 / --:--

← 메인으로

Google, Gemini Distillation Service 출시

1. Google, Gemini Distillation Service 출시

Google은 자사의 최첨단 모델이 가진 추론 패턴을 효율적인 학생 모델로 전이하도록 설계된 관리형 서비스인 Gemini Distillation Service를 출시했습니다. 이 서비스는 현재 gemini-3.1-pro의 지식을 gemini-2.5-flash로 증류하는 것을 지원합니다. 이를 통해 개발자는 고급 추론 능력을 유지하면서도 프로덕션 애플리케이션의 추론 비용을 크게 절감할 수 있는 특화된 저지연 모델을 구축할 수 있습니다.

  • Gemini Distillation Service는 더 큰 교사 모델을 사용하여 더 작은 학생 모델의 학습을 자동화합니다.
  • 이 서비스는 현재 교사 모델로 gemini-3.1-pro를, 학생 모델로 gemini-2.5-flash를 지원합니다.
  • 복잡한 추론 능력이 필요한 대규모 트래픽 및 지연 시간에 민감한 애플리케이션에 최적화되어 있습니다.

개발자는 이제 복잡한 추론 능력을 더 작고 빠르며 저렴한 모델로 쉽게 증류하여 대규모 트래픽과 지연 시간에 민감한 애플리케이션에 적용할 수 있습니다.

SOURCES

2. Microsoft, Mage-VL 스트리밍 멀티모달 모델 공개

Microsoft는 이미지와 비디오 이해에 최적화된 오픈 웨이트 코덱 네이티브 스트리밍 멀티모달 파운데이션 모델인 Mage-VL을 출시했습니다. Mage-VL은 맞춤형 4B 규모의 비주얼 인코더와 Qwen3-4B 언어 백본을 결합했습니다. 비디오 스트림을 앵커 프레임과 예측 프레임으로 분리함으로써 모델의 희소성 메커니즘이 중복된 시각적 토큰을 75% 이상 필터링하여 추론 시간을 3.5배 단축합니다. 또한 내장된 '인지 게이트(cognition gate)'는 중요한 이벤트가 감지될 때만 전체 비전-언어 모델을 호출하여 불필요한 연산을 크게 줄입니다.

  • Mage-VL은 이미지 및 비디오 이해를 위한 코덱 네이티브, 프로액티브 스트리밍 멀티모달 파운데이션 모델입니다.
  • 이 모델은 처음부터 학습된 4B 규모의 비주얼 인코더와 Qwen3-4B-Instruct-2507 언어 백본을 특징으로 합니다.
  • 코덱 정렬 희소성 메커니즘이 비디오 스트림을 앵커(I) 프레임과 예측(P) 프레임으로 분리하여 시각적 토큰을 75% 이상 줄입니다.
  • 이 아키텍처는 균일한 프레임 샘플링 대비 최대 3.5배의 실제 추론 속도 향상을 달성합니다.
  • 이중 프로세스 설계를 통해 '인지 게이트'가 응답 가치가 있는 이벤트가 감지될 때만 전체 VLM을 호출합니다.

개발자는 추론 지연 시간과 토큰 소비를 크게 줄이는 고효율 비디오 처리 파이프라인을 구축할 수 있습니다.

SOURCES

3. Runway, Characters 실시간 비디오 모델 및 증류 워크플로우 상세 공개

VB Transform 2026에서 Runway는 지연 시간 없는 아바타 상호작용을 가능하게 하는 실시간 비디오 모델인 Runway Characters의 프로덕션 인사이트를 공유했습니다. 실시간 속도를 달성하기 위해 Runway는 대규모 파운데이션 모델을 더 작은 학생 모델로 증류하여 생성 지연 시간을 80%~90% 단축하는 동시에, 적대적 사후 학습(APT)을 사용하여 시각적 선명도를 유지합니다. 또한 캐릭터 드리프트 버그를 해결하기 위한 프론트엔드 재중심화 기능 사용, 클라우드 데이터 센터의 하드웨어 수준 성능 저하를 격리하기 위한 AI 모니터링 에이전트 배포 등 실용적인 엔지니어링 해결책을 상세히 설명했습니다.

  • Runway Characters는 AI 생성 아바타와 지연 시간 없는 상호작용을 가능하게 하는 실시간 비디오 모델입니다.
  • Runway는 증류를 사용하여 더 작은 학생 모델을 학습시킴으로써 비디오 생성 시간을 80%~90% 단축합니다.
  • 팀은 적대적 사후 학습(APT)을 사용하여 증류된 모델의 시각적 선명도를 유지합니다.
  • Runway는 입력 이미지를 재중심화하는 '이미지 품질 최적화' 프론트엔드 기능을 구현하여 캐릭터 드리프트 버그를 해결했습니다.
  • 회사는 AI 에이전트와 모니터링 도구를 사용하여 API 속도 저하(호출의 8%가 16fps로 떨어짐)의 원인을 us-east-1의 결함 있는 하드웨어로 추적했습니다.

대화형 비디오 애플리케이션을 구축하는 개발자는 Runway의 프로덕션 전략을 통해 지연 시간을 최적화하고 캐릭터 드리프트 문제를 해결하는 방법을 배울 수 있습니다.

SOURCES

4. Microsoft, 사이버 보안 특화 MAI-Cyber-1-Flash로 MAI 모델 제품군 확장

Microsoft는 Build 2026에서 처음 소개된 독점 MAI 모델 제품군을 MAI-Cyber-1-Flash 출시와 함께 확장했습니다. 이 새로운 50억 활성 파라미터 모델은 이전에 출시된 MAI-Code-1-Flash를 코드베이스 패치와 같은 방어적 사이버 보안 작업에 맞게 특화하여 미세 조정(fine-tune)한 모델입니다. 이 모델은 Microsoft의 MDASH 스캐닝 하네스를 구동하여 운영 비용을 절감하면서 자동화된 보안 워크플로우를 가능하게 합니다.

  • MAI-Cyber-1-Flash는 MAI-Code-1-Flash 모델을 사이버 보안에 특화하여 미세 조정한 모델입니다.
  • 이 모델은 총 137B 파라미터, 5B 활성 파라미터, 256k 컨텍스트 길이를 특징으로 합니다.
  • CyberGym 벤치마크에서 95.95점을 기록한 MDASH 스캐닝 하네스를 구동합니다.
  • 이 모델은 방어적 작업으로 제한되어 있으며 익스플로잇을 생성할 수 없고, ExploitGym에서 0점을 기록했습니다.
  • MDASH에 통합되어 더 큰 모델로 넘어가기 전 일상적인 작업을 로컬에서 처리함으로써 운영 비용을 50% 절감합니다.

이번 출시는 MAI 모델 제품군의 첫 사이버 보안 특화 확장으로, 개발자에게 자동화된 보안 패치를 위한 비용 효율적인 방어 도구를 제공합니다.

SOURCES

5. Model Context Protocol, 상태 비저장 아키텍처 공식 출시

Agentic AI Foundation(AAIF)은 Model Context Protocol(MCP) 사양의 최종 버전을 공식 출시하며, 5월에 발표된 릴리스 후보에서 완전히 상태 비저장(stateless)인 요청/응답 아키텍처로 전환했습니다. 이번 GA 릴리스를 통해 개발자는 표준 로드 밸런서와 Kubernetes 뒤에 MCP 서버를 배포할 수 있게 되었으며, 필수적인 보안 강화와 레거시 기능에 대한 12개월 지원 종료 정책이 도입되었습니다.

  • 최종 MCP 사양은 이제 GA 상태이며, 상태 비저장 릴리스 후보에서 프로덕션 준비가 완료된 아키텍처로 이동했습니다.
  • 상태 비저장 설계는 표준 로드 밸런서 및 Kubernetes 뒤에서의 배포를 지원합니다.
  • 보안을 위해 필수적인 RFC 9207 발급자 검증이 포함되었습니다.
  • HTTP+SSE와 같은 레거시 기능에 대해 12개월의 공식 지원 종료 정책을 수립했습니다.
  • MCP Apps와 MCP Tasks라는 두 가지 새로운 공식 확장이 추가되었습니다.

이번 공식 릴리스는 상태 비저장 아키텍처로의 전환을 확정하여 클라우드 네이티브 환경에서 프로덕션급 MCP 서버 배포를 가능하게 합니다.

6. Snowflake, AI 에이전트 거버넌스를 위한 Cortex AI Gateway 출시

Snowflake는 자율 AI 에이전트를 관리하기 위해 설계된 중앙 집중식 거버넌스 및 보안 계층인 Cortex AI Gateway를 발표했습니다. Natoma 인수를 통해 확보한 기술을 기반으로 구축된 이 게이트웨이는 100개 이상의 Model Context Protocol(MCP) 서버를 지원하여 개발자가 액세스 정책과 권한을 중앙 집중화할 수 있도록 합니다. 책임성을 보장하기 위해 이 플랫폼은 에이전트의 신원과 승인한 인간을 모두 기록하는 이중 귀속(dual attribution)을 구현하며, 재무 팀에 실시간 비용 귀속 및 과도한 API 청구를 방지하기 위한 엄격한 지출 한도를 제공합니다.

  • Snowflake의 Cortex AI Gateway는 AI 에이전트가 엔터프라이즈 데이터, 도구 및 모델에 액세스하는 것을 관리하기 위한 중앙 제어 계층 역할을 합니다.
  • 이 게이트웨이는 100개 이상의 Model Context Protocol(MCP) 서버를 지원하여 인증, 권한 및 감사 로그를 중앙 집중화합니다.
  • 에이전트의 비인간 신원과 작업을 승인한 특정 인간을 모두 기록하는 이중 귀속 기능을 제공합니다.
  • 1Password, Aembit, Linx Security, SailPoint 및 Saviynt와의 보안 통합이 포함되어 있습니다.
  • 게이트웨이는 통합된 비용 귀속 및 지출 한도를 제공하여 통제 불능의 엔터프라이즈 API 비용을 방지합니다.

엔터프라이즈 에이전트를 구축하는 개발자는 이 게이트웨이를 사용하여 보안 정책을 시행하고, 권한을 관리하며, 통제 불능의 API 비용을 방지할 수 있습니다.

SOURCES

7. Fireworks AI, Fireworks Nexus 라우팅 계층 출시

Fireworks AI는 LLM 지출을 최적화하기 위해 설계된 지능형 라우팅 및 비용 제어 플랫폼인 Fireworks Nexus를 발표했습니다. 이 플랫폼의 핵심 오픈 소스 구성 요소인 FireConnect를 통해 개발자는 Claude Code와 같은 기존 개발자 도구에 한 줄 설치만으로 Fireworks 모델을 통합할 수 있습니다. 지능형 라우터는 맞춤형 학습 모델을 사용하여 들어오는 요청의 난이도를 평가하고, 일상적인 코딩 작업은 비용 효율적인 오픈 웨이트 모델로 자동 오프로드하는 동시에 복잡한 쿼리는 최첨단 API로 예약하여 병합된 풀 리퀘스트당 33%의 비용 절감 효과를 보고했습니다.

  • Fireworks Nexus는 엔터프라이즈 비용 제어 및 트래픽 관리 기능을 갖춘 AI 관리 및 라우팅 플랫폼입니다.
  • FireConnect 구성 요소는 Apache 2.0 라이선스 하의 오픈 소스로, Claude Code, Codex 및 OpenCode와의 한 줄 통합을 가능하게 합니다.
  • 지능형 라우터는 맞춤형 모델을 사용하여 요청 난이도를 점수화하고, 단순한 작업은 오픈 웨이트 모델로, 복잡한 작업은 최첨단 API로 라우팅합니다.
  • 초기 고객 테스트 결과 병합된 풀 리퀘스트당 비용이 33% 절감되었습니다.
  • 라우터는 연구 프리뷰 단계이며 Claude Opus 5와 GLM-5.2 간의 라우팅과 같은 구성을 지원합니다.

개발자는 단 한 줄의 코드로 이 라우팅 계층을 통합하여 일상적인 코딩 작업에 대한 API 비용을 자동으로 절감할 수 있습니다.

SOURCES

8. OpenAI, CLI 및 SDK를 통해 Codex 보안 도구 공개

OpenAI는 이전에 발표된 'Daybreak' 비공개 프리뷰에서 Codex 기반 보안 이니셔티브를 범용 개발자 도구로 전환했습니다. 새로운 @openai/codex-security 패키지는 개발자가 자신의 빌드 워크플로우 내에서 취약점 탐지 및 수정을 자동화할 수 있는 CLI와 TypeScript SDK를 제공합니다. 이전의 판매 제한적인 에이전트 프리뷰와 달리, 이번 릴리스는 ChatGPT 인증을 통한 대화형 스캔과 함께 API 키를 사용한 비대화형 CI/CD 통합을 지원합니다.

  • Codex 기반 보안을 'Daybreak' 비공개 프리뷰에서 공개 CLI 및 SDK로 전환합니다.
  • API 키를 통해 CI/CD 파이프라인에서 자동화된 취약점 스캔 및 수정을 지원합니다.
  • 사용자 지정 통합을 위한 프로그래밍 방식의 CodexSecurity 클래스를 포함합니다.
  • Node.js 22+ 및 Python 3.10+가 필요합니다.

이번 릴리스는 OpenAI의 보안 기능을 제한된 엔터프라이즈 프리뷰에서 셀프 서비스 개발자 도구로 전환하여 표준 CI/CD 파이프라인에서 자동화된 보안 통합을 가능하게 합니다.

SOURCES

9. Visa, 에이전트 기반 취약점 스캔 하네스 오픈 소스화

Visa는 자사의 글로벌 결제 인프라에서 버그를 찾기 위해 개발한 다중 모델 보안 파이프라인인 Visa Vulnerability Agentic Harness를 오픈 소스로 공개했습니다. 이 하네스는 코드 수집, 위협 모델링, 익스플로잇 체인 합성을 포함한 복잡한 보안 워크플로우를 자동화합니다. 이번 릴리스와 함께 Visa는 중요 인프라를 위한 12가지 아키텍처 관행을 요약한 백서를 발표하며, 자율 에이전트가 보안 경계를 유지하기 위해 별도의 범위가 지정된 신원으로 작동해야 함을 강조했습니다.

  • Visa Vulnerability Agentic Harness는 이제 GitHub에서 오픈 소스로 제공되며 코드 수집, 위협 모델링 및 익스플로잇 합성을 관리합니다.
  • 이 하네스는 Visa가 원래 Anthropic의 Claude Mythos 모델과 결합하여 글로벌 결제 네트워크를 스캔하는 데 사용했던 다중 모델 파이프라인을 활용합니다.
  • Visa는 팀이 공격 경로의 폐쇄를 확인, 수정 및 검증하는 속도를 측정하기 위해 MTTA(Mean Time to Adapt)라는 지표를 도입했습니다.
  • 이 프로젝트의 아키텍처 가이드라인은 AI 에이전트를 엄격하게 범위가 지정된 권한을 가진 별도의 신원으로 취급할 것을 요구합니다.

개발자는 이 검증된 다중 모델 파이프라인을 채택하여 자신의 코드베이스 내에서 위협 모델링 및 익스플로잇 체인 합성을 자동화할 수 있습니다.

SOURCES

10. Molt 에이전트 강화 학습 프레임워크 출시

오픈 소스 커뮤니티는 AI 에이전트를 구조화된 프로그램으로 취급하도록 설계된 PyTorch 네이티브 프레임워크인 Molt를 도입했습니다. Molt는 개발자에게 사용자 지정 Python 보상, 도구 통합, 멀티모달 환경 및 LLM 기반 평가에 대한 기본 지원을 포함하여 강화 학습을 사용하여 에이전트를 학습시킬 수 있는 강력한 환경을 제공합니다. Ray, vLLM, NVIDIA AutoModel 및 FSDP2의 고성능 스택을 기반으로 구축된 이 프레임워크는 조 단위 파라미터의 전문가 혼합(Mixture-of-Experts) 모델까지 학습을 확장하도록 설계되었습니다.

  • Molt는 AI 에이전트를 프로그램 그 자체로 취급하는 PyTorch 네이티브 프레임워크입니다.
  • 이 프레임워크는 사용자 지정 Python 보상, 도구 사용, 멀티모달 환경 및 LLM 판사를 지원합니다.
  • Molt의 기술 스택은 Ray, vLLM, NVIDIA AutoModel 및 FSDP2를 통합합니다.
  • 이 프레임워크는 조 단위 파라미터의 전문가 혼합 모델까지 학습을 확장할 수 있습니다.

개발자는 이 프레임워크를 사용하여 사용자 지정 보상, 도구 사용 및 LLM-in-the-loop 판사가 포함된 복잡한 에이전트 워크플로우를 구축하고 학습시킬 수 있습니다.

SOURCES

11. Agenta, 오픈 소스 Claude Cowork 대안 출시

Agenta는 Claude Cowork의 오픈 소스, 자체 호스팅 대안을 출시하여 개발자에게 AI 동료를 구축하고 배포할 수 있는 유연한 플랫폼을 제공합니다. GitHub에서 사용할 수 있는 Agenta를 통해 사용자는 Claude Code, OpenAI Codex 또는 로컬 자체 호스팅 모델 등 원하는 모델 하네스를 선택하여 예약되거나 이벤트 트리거 방식의 자동화를 실행할 수 있습니다. AI 에이전트는 자연스러운 채팅 상호작용을 통해 구성되며, 사용자 피드백을 기반으로 격리된 작업 공간, 사용자 지정 도구 및 자체 개선 구성을 유지합니다.

  • Agenta는 GitHub에서 사용할 수 있는 Claude Cowork의 오픈 소스, 자체 호스팅 대안입니다.
  • 이 플랫폼을 통해 개발자는 일정에 따라 실행되거나 외부 앱 이벤트에 따라 트리거되는 AI 동료를 구축할 수 있습니다.
  • Claude Code, OpenAI Codex 및 자체 호스팅 모델을 포함한 여러 실행 하네스를 지원합니다.
  • 에이전트는 채팅을 통해 생성되며 개별 지침, 도구, 기술 및 전용 작업 폴더를 유지합니다.

개발자는 기존 API 구독이나 자체 호스팅 모델을 활용하면서 벤더 종속을 피하고 로컬에서 직접 AI 동료를 구축하고 호스팅할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.