Inference Brew

Microsoft, 핵심 제품에 자체 MAI 모델 통합 및 OpenAI 모델 대체

00:00 / --:--

← 메인으로

Microsoft, 핵심 제품에 자체 MAI 모델 통합 및 OpenAI 모델 대체

1. Microsoft, 핵심 제품에 자체 MAI 모델 통합 및 OpenAI 모델 대체

Microsoft는 초기 MAI 모델 제품군 발표와 후속 Foundry API 출시를 기반으로, 이제 자사 모델을 핵심 소비자 제품에 통합했습니다. MAI-Image-2.5-Pro와 MAI-Voice-2-Flash를 PowerPoint 및 Bing과 같은 서비스에 배포한 것은 OpenAI에 대한 독점적 의존에서 벗어나는 전략적 전환을 의미하며, Microsoft는 이러한 워크로드에서 GPU 비용이 89% 절감되었다고 밝혔습니다.

  • Microsoft는 PowerPoint 및 Bing과 같은 제품에서 OpenAI의 이미지 생성 모델을 자체 MAI 모델로 교체하고 있습니다.
  • MAI 모델로의 전환을 통해 이미지 및 음성 작업의 GPU 비용이 89% 절감되었습니다.
  • MAI-Voice-2-Flash는 현재 100만 문자당 15달러의 비용으로 저지연 음성 에이전트 워크로드에 활용되고 있습니다.
  • Microsoft는 내부 '힐 클라이밍(hill-climbing)' 툴체인과 'Frontier Tuning'을 기업 고객을 위한 Azure 제품으로 패키징하고 있습니다.

이번 통합은 Microsoft의 독자적인 모델 전략이 개발자용 API를 넘어 인프라 비용 최적화를 위해 소비자 제품에 직접 구현되는 실질적인 적용 사례를 보여줍니다.

SOURCES

2. Black Forest Labs, 로봇 공학을 위한 멀티모달 FLUX 3 및 FLUX-mimic 출시

Black Forest Labs는 통합 'Self-Flow' 아키텍처를 사용하여 이미지, 오디오, 비디오 및 로봇 동작을 포함한 여러 모달리티 전반에서 학습하는 멀티모달 모델 FLUX 3를 공개했습니다. 오픈 소스 FLUX 3 Dev 버전은 올해 말 출시 예정이며, 비디오 및 액션 라인은 현재 얼리 액세스 프로그램으로 제한되어 있습니다. 또한, Mimic Robotics와의 협업을 통해 개발자가 단 30분의 로봇 데이터만으로 로봇 조작 작업을 미세 조정할 수 있는 FLUX-mimic을 도입했습니다.

  • FLUX 3는 통합 Self-Flow 아키텍처를 사용하여 이미지, 오디오, 최대 20초의 비디오 클립 및 로봇 동작을 생성하는 멀티모달 모델입니다.
  • 이 모델은 FLUX 3 Video, FLUX 3 Image, FLUX 3 Action 및 향후 출시될 오픈 소스 FLUX 3 Dev의 4가지 제품 라인으로 나뉩니다.
  • FLUX 3 Video와 Action은 현재 승인이 필요한 얼리 액세스 프로그램으로 제한되어 있습니다.
  • FLUX-mimic 프로젝트를 통해 단 30분의 로봇 데이터만으로 로봇 조작 미세 조정이 가능합니다.
  • FLUX 3의 오픈 웨이트 버전은 올해 말 출시될 예정이지만, 현재 다운로드 가능한 가중치는 없습니다.

개발자들은 이미지, 비디오, 오디오 및 물리적 로봇 제어를 아우르는 통합 멀티모달 아키텍처에 조기에 접근할 수 있게 되었습니다.

SOURCES

3. KwaiPilot, 오픈 웨이트 코딩 MoE 모델 KAT-Coder-V2.5-Dev 출시

KwaiPilot은 에이전트 코딩을 위해 설계된 오픈 웨이트 Mixture-of-Experts(MoE) 모델인 KAT-Coder-V2.5-Dev를 출시했습니다. 총 350억 개의 파라미터 중 토큰당 30억 개만 활성화되는 이 모델은 일반적인 에이전트 실패 모드를 해결하기 위해 강화 학습을 사용하여 개선되었습니다. 특히, RL 학습을 통해 비정상적인 도구 호출 레이블을 9.34%에서 0.28%로 성공적으로 줄였으며 반복적인 단일 턴 루프를 제거하여 로컬 에이전트 런타임에 강력한 후보가 되었습니다.

  • KAT-Coder-V2.5-Dev는 총 35B 파라미터와 3B 활성화 파라미터를 가진 오픈 웨이트 Mixture-of-Experts(MoE) 모델입니다.
  • 이 모델은 지도 미세 조정(SFT) 및 강화 학습(RL)을 사용하여 에이전트 코딩 작업에 최적화되었습니다.
  • RL 학습을 통해 비정상적인 도구 호출 레이블이 9.34%에서 0.28%로 감소했습니다.
  • 또한 학습을 통해 에이전트 실행 중 발생하는 단일 턴 연속 반복 문제를 제거했습니다.

개발자들은 에이전트 도구 사용 및 다중 턴 안정성에 최적화된 고효율 코딩 모델을 직접 호스팅할 수 있습니다.

SOURCES

4. 오픈 소스 ASR 시장: Cohere, IBM, Meta가 Whisper에 도전

2026년 오픈 자동 음성 인식(ASR) 시장에 대한 검토 결과, 순수 리더보드 순위에서 라이선스, 언어 커버리지 및 처리량으로 초점이 이동하고 있음을 보여줍니다. OpenAI의 Whisper large-v3가 MIT 라이선스 배포의 표준으로 남아 있지만, Cohere의 Transcribe(Apache 2.0) 및 IBM의 Granite Speech 4.1 2B와 같은 새로운 옵션은 키워드 편향 및 양방향 번역과 같은 고급 기능과 함께 경쟁력 있는 단어 오류율(WER)을 제공합니다. 원시 처리량 측면에서는 Parakeet TDT 0.6B v3가 앞서고 있으며, Meta의 Omnilingual ASR은 타의 추종을 불허하는 언어 커버리지를 제공합니다.

  • Cohere의 Transcribe(2B, Apache 2.0)는 14개 언어를 지원하며 5.42%의 평균 단어 오류율(WER)을 달성했습니다.
  • IBM의 Granite Speech 4.1 2B는 5.33%의 WER, 양방향 번역 및 키워드 리스트 편향 기능을 제공합니다.
  • Parakeet TDT 0.6B v3는 3332.74의 실시간 계수 승수(RTFx)로 처리량 면에서 앞서고 있습니다.
  • Meta의 Omnilingual ASR은 1,600개 이상의 언어를 기본적으로 지원하며 제로샷 학습을 통해 5,400개 이상으로 확장됩니다.
  • Whisper large-v3는 MIT 라이선스와 성숙한 런타임 생태계가 필요한 프로젝트를 위한 표준 선택지로 남아 있습니다.

음성 기능을 구축하는 개발자들은 처리량, 언어 커버리지 또는 낮은 지연 시간에 맞춰 최적화되고 허용적인 라이선스를 가진 오픈 ASR 모델을 선택할 수 있습니다.

SOURCES

5. Anthropic, Claude 음성 모드를 Opus 및 Sonnet 모델로 확장

Anthropic은 Claude 음성 모드를 업그레이드하여 자사의 주력 모델인 Opus와 Sonnet에 해당 기능을 도입했습니다. 이번 업데이트를 통해 사용자는 텍스트와 음성 간을 원활하게 전환하고 대화 도중 모델을 변경할 수 있습니다. 또한 음성 모드는 Gmail, Slack, Canva와 같은 타사 플랫폼과 통합되어 이메일 작성 및 회의 일정 조정과 같은 음성 기반 작업을 수행할 수 있습니다.

  • Anthropic은 음성 모드 기능을 더 강력한 Claude Opus 및 Sonnet 모델로 확장했습니다.
  • 음성 모드는 Gmail, Slack, Canva를 포함한 타사 애플리케이션과 통합되었습니다.
  • 사용자는 단일 대화 중에 텍스트와 음성 모드 간, 그리고 서로 다른 모델 간에 전환할 수 있습니다.
  • 프랑스어, 독일어, 스페인어, 힌디어, 일본어를 포함한 9개 언어에 대한 지원이 추가되었습니다.

개발자들은 이제 음성 기반 워크플로우 및 멀티모달 에이전트 상호작용을 위해 Anthropic의 가장 뛰어난 모델을 활용할 수 있습니다.

SOURCES

6. OpenAI, GPT-Live를 데스크톱 앱으로 확장 및 코딩 워크플로우 통합

OpenAI는 7월 8일 모바일 및 웹용으로 출시된 GPT-Live 전이중 음성 모델을 macOS 및 Windows 데스크톱 애플리케이션으로 확장했습니다. 이번 통합을 통해 소프트웨어 엔지니어는 디버깅, 풀 리퀘스트 검토 및 코드베이스 분석을 위해 자연스러운 음성 명령을 사용할 수 있습니다. macOS에서 이 애플리케이션은 'Appshots'와 화면 컨텍스트를 활용하여 로컬 파일 및 다중 폴더 프로젝트와 상호작용하며, 전문 개발 환경으로 음성 모델의 유용성을 크게 확장했습니다.

  • 7월 8일에 출시된 GPT-Live를 이제 macOS 및 Windows용 ChatGPT 데스크톱 애플리케이션에서 사용할 수 있습니다.
  • 이번 통합으로 디버깅, PR 검토 및 다중 스레드 코딩 작업을 위한 핸즈프리 음성 제어가 가능해졌습니다.
  • macOS 사용자는 로컬 코드베이스 구조와 활성 창을 분석하기 위한 'Appshots'에 접근할 수 있습니다.
  • 이 기능은 다중 폴더 프로젝트를 지원하며 유료 구독자에게 제공됩니다.

이번 업데이트는 GPT-Live를 범용 대화 도구에서 데스크톱 기반 소프트웨어 개발을 위한 전문 보조 도구로 전환하여 복잡한 코딩 작업을 핸즈프리로 수행할 수 있게 합니다.

SOURCES

7. Andrew Ng, 오픈 소스 데스크톱 AI 에이전트 OpenWorker 출시

Andrew Ng은 다단계 작업을 실행하고 최종 결과물을 생성하도록 설계된 오픈 소스 로컬 우선 데스크톱 AI 동료인 OpenWorker를 발표했습니다. Ng의 공급자 독립적 aisuite 라이브러리를 기반으로 구축된 이 에이전트는 로컬 Python FastAPI 서버와 함께 Tauri 2 및 React 데스크톱 셸을 실행합니다. 로컬 실행의 보안 문제를 해결하기 위해 OpenWorker는 도구 호출을 별도의 위험 수준(Workspace 또는 Shell 등)으로 분류하는 유형화된 위험 엔진을 구현하고, 프롬프트 주입을 방지하기 위해 모든 외부 도구 및 파일 데이터를 신뢰할 수 없는 것으로 처리하는 특수 'ops 페르소나'를 활용합니다.

  • OpenWorker는 채팅 응답이 아닌 최종 결과물을 생성하도록 설계된 오픈 소스 로컬 우선 데스크톱 에이전트입니다.
  • 아키텍처는 Tauri 2 및 React 프론트엔드와 aisuite 라이브러리를 기반으로 구축된 로컬 Python FastAPI 에이전트 서버를 결합합니다.
  • 도구 호출을 5가지 권한 모드에 걸쳐 4가지 위험 수준(None, Workspace, Shell, External)으로 분류하는 유형화된 위험 엔진을 갖추고 있습니다.
  • 이 에이전트는 OpenAI, Anthropic, Google 및 Ollama와 같은 로컬 런타임의 30개 큐레이팅된 모델을 지원합니다.
  • 내장된 'ops 페르소나'는 프롬프트 주입 위험을 완화하기 위해 도구, 로그 및 파일의 모든 데이터를 신뢰할 수 없는 것으로 처리합니다.

개발자들은 OpenWorker를 셸 및 파일 작업을 안전하게 실행하는 로컬 우선 데스크톱 에이전트를 구축하기 위한 강력하고 안전한 프레임워크로 사용할 수 있습니다.

SOURCES

8. Amazon, Alexa Plus AI 업데이트를 위해 Model Context Protocol(MCP) 채택

Amazon은 곧 출시될 Alexa Plus AI 어시스턴트 업데이트가 AI 모델과 외부 시스템 간의 연결을 촉진하기 위해 오픈 소스 Model Context Protocol(MCP)을 채택할 것이라고 발표했습니다. 새로운 AI 개발자 툴킷으로 구동되는 이 통합을 통해 Alexa는 사용자의 설명에 따라 특정 세탁기 코스를 선택하는 것과 같은 복잡한 다단계 지침을 처리할 수 있습니다. MCP를 채택함으로써 Amazon은 방대한 스마트 홈 및 음성 어시스턴트 생태계를 표준화된 개발자 통합에 개방하며, Priceline, Canva, Lyft와 같은 파트너들이 이미 통합 출시를 예정하고 있습니다.

  • Amazon은 AI 모델을 Alexa Plus의 외부 시스템에 연결하기 위해 오픈 소스 Model Context Protocol(MCP)을 채택하고 있습니다.
  • 업데이트된 Alexa Plus 미리보기는 자동 요청 라우팅 및 복잡한 다단계 스마트 홈 통합 기능을 제공합니다.
  • 새로운 AI 개발자 툴킷을 통해 Bosch, iRobot, Yale Home, Whirlpool과 같은 브랜드와의 통합이 가능합니다.
  • Priceline, Canva, Lyft를 포함한 파트너들이 올해 말 Alexa Plus 통합을 출시할 예정입니다.

MCP 서버를 구축하는 개발자들은 이제 방대한 Alexa 생태계를 타겟팅하여 애플리케이션과의 직접적인 음성 제어 및 다단계 통합을 구현할 수 있습니다.

SOURCES

9. Anthropic, Claude Code 터미널 도구를 위한 Claude 보안 플러그인 출시

Anthropic은 Claude Code를 위한 Claude 보안 플러그인을 도입하여 명령줄 개발자 도구에 터미널 기반의 다중 에이전트 취약점 스캐너를 추가했습니다. /claude-security 명령을 통해 트리거되는 이 도구는 인벤토리, 위협 모델링, 적대적 검토에 걸친 6단계 워크플로우를 실행하여 보안 결함을 탐지합니다. 오탐지를 최소화하기 위해 결과는 3중 렌즈 적대적 패널을 통과해야 하며, 생성된 모든 패치는 기존 애플리케이션 동작을 손상시키지 않고 문제를 해결하는지 확인하기 위해 스크래치 클론에서 자동으로 검증됩니다.

  • Anthropic은 Claude 보안 플러그인을 베타 버전으로 출시하여 Claude Code에 /claude-security 명령을 추가했습니다.
  • 스캐너는 6단계 다중 에이전트 워크플로우를 사용하여 코드베이스를 분석하고 패치 파일을 생성합니다.
  • 취약점은 3중 렌즈 적대적 패널(REACHABILITY, IMPACT, DEFENSES)에 의해 검증되며 2/3 정족수가 필요합니다.
  • 생성된 패치는 스크래치 클론에서 개발되며 기존 동작을 유지하고 새로운 버그를 도입하지 않는지 검증됩니다.
  • 이 플러그인은 Claude Code v2.1.154 이상, Python 3.9.6 이상 및 Git이 필요합니다.

개발자들은 이제 Claude Code를 사용하여 터미널에서 직접 자동화된 다중 에이전트 보안 감사를 실행하고 안전한 패치를 생성할 수 있습니다.

SOURCES

10. OneCLI: AI 에이전트 비밀 정보를 보호하기 위한 오픈 소스 자격 증명 게이트웨이

OneCLI는 원시 API 키를 자율 AI 에이전트에 노출하는 보안 위험을 해결하기 위해 설계된 오픈 소스 자격 증명 게이트웨이로 출시되었습니다. 로컬 HTTPS 프록시로 작동하는 이 Rust 기반 도구는 Claude Code나 Cursor와 같은 프레임워크에서 나가는 네트워크 요청을 가로채어, 안전한 자리 표시자 토큰을 휴지 상태에서 암호화되거나 1Password에서 가져온 실제 비밀 정보로 교체합니다. 이 아키텍처는 에이전트가 원시 자격 증명을 컨텍스트 창에 절대 입력하지 않도록 보장하는 동시에 개발자에게 상세한 액세스 로그와 인간 개입 승인 게이트를 제공합니다.

  • OneCLI는 에이전트 요청을 가로채어 자리 표시자 토큰을 실제 자격 증명으로 교체하는 HTTPS 프록시 역할을 합니다.
  • 비밀 정보는 AES-256-GCM을 사용하여 암호화되거나 Bitwarden 또는 1Password에서 동적으로 가져옵니다.
  • 이 도구는 Claude Code 및 Cursor를 포함하여 HTTPS_PROXY 구성을 허용하는 모든 에이전트 프레임워크를 지원합니다.
  • 민감한 작업에 대한 인간 개입 승인 기능을 제공하며 상세한 액세스 로그를 유지합니다.
  • 프록시는 Rust로 작성되었으며 Next.js 대시보드를 통해 관리되고 Docker 컨테이너 내부에서 배포됩니다.

개발자들은 프로덕션 자격 증명을 LLM 컨텍스트 및 에이전트 환경에서 완전히 분리함으로써 에이전트 배포를 보호할 수 있습니다.

SOURCES

11. Runway, 멀티모달 생성을 위한 미디어 라우터 출시

Runway는 멀티모달 애플리케이션에서 모델 선택을 단순화하기 위해 설계된 유틸리티인 미디어 라우터를 출시했습니다. 생성형 미디어 공간이 점점 더 혼잡해짐에 따라, 라우터는 개발자가 출력 품질, 생성 속도 또는 전체 비용 중 무엇을 우선시하는지에 따라 사용자 요청을 가장 적절한 이미지, 비디오 또는 오디오 모델로 자동으로 전달합니다.

  • Runway는 특정 요청에 대해 최적의 생성 모델을 자동으로 선택하는 미디어 라우터를 출시했습니다.
  • 이 도구는 이미지, 비디오 및 오디오 생성 모델을 지원합니다.
  • 모델 선택은 품질, 속도, 비용이라는 개발자가 정의한 우선순위에 따라 최적화될 수 있습니다.

멀티모달 애플리케이션을 구축하는 개발자들은 다양한 미디어 생성 모델 전반에서 성능과 예산의 균형을 동적으로 맞출 수 있습니다.

SOURCES

12. Claude-Thermos, 비용 절감을 위해 Claude Code 프롬프트 캐시 유지

Claude Code를 사용하는 개발자들은 도구의 엄격한 5분 프롬프트 캐시 TTL로 인해 부풀려진 API 청구서에 직면하는 경우가 많습니다. 하위 에이전트 작업이나 개발자 일시 중지가 5분을 초과하면 전체 접두사가 프리미엄 1.25배 쓰기 요율로 다시 인코딩되어야 합니다. 이를 해결하기 위해 오픈 소스 도구인 claude-thermos는 Claude CLI 트래픽을 가로채는 로컬 리버스 프록시를 실행합니다. 이 도구는 캐시 접두사가 만료되기 전에 API에 가벼운 단일 토큰 유지 요청을 자동으로 보내 캐시를 새로 고침으로써 캐시를 보존하고 긴 세션 비용을 최대 22% 절감합니다.

  • Claude Code의 프롬프트 캐시는 동일한 접두사에 대한 요청 사이에 5분 이상의 간격이 있으면 만료됩니다.
  • 캐시 만료는 1.25배 쓰기 요율로 전체 재인코딩을 강제하며, 이는 긴 세션에서 전체 청구 비용의 최대 22%를 차지합니다.
  • claude-thermos 도구는 로컬 리버스 프록시 역할을 하며 5분 TTL 전에 캐시 접두사를 새로 고치기 위해 가벼운 요청(max_tokens=1)을 보냅니다.
  • 이 도구는 Python 3.11+가 필요하며 uvx claude-thermos를 사용하여 즉시 실행할 수 있습니다.

Claude Code를 사용하는 개발자들은 프롬프트 접두사에 대한 엄격한 5분 TTL로 인해 발생하는 값비싼 캐시 재인코딩 수수료를 피할 수 있습니다.

SOURCES

13. 사례 연구: 프롬프트 캐싱으로 에이전트 스레드 비용을 80% 절감한 방법

Viktor AI 직원 플랫폼에 대한 기술적 분석은 프롬프트 캐싱이 장기 실행 에이전트 세션의 복합 비용을 어떻게 완화할 수 있는지 보여줍니다. 85,000토큰의 대본을 처리하는 40단계 에이전트 스레드의 경우, 시스템은 기록 재전송으로 인해 이전에 217만 개의 입력 토큰을 누적했습니다. 도구를 SDK 함수로 구조화하고, 추가 전용 스레드를 시행하며, 바이트 안정적인 접두사를 유지하기 위해 내부 캐시 압축을 활용함으로써 Viktor는 Opus 4.8 실행 비용을 80% 이상 절감했습니다.

  • 전체 기록을 다시 보내는 40단계 에이전트 스레드는 85,000토큰 대본에 대해 217만 개의 입력 토큰을 누적했습니다.
  • 프롬프트 캐싱을 구현하면 접두사를 바이트 안정적으로 유지하여 재전송 비용을 0.1배 읽기 요율로 줄일 수 있습니다.
  • 이 최적화는 Claude Opus 4.8에서 특정 스레드를 실행하는 비용을 11.35달러에서 2.07달러로 줄였습니다.
  • Viktor의 스레드 엔진은 도구를 SDK 함수로 사용하고, 추가 전용 스레드 및 내부 캐시 압축을 사용하여 이를 달성합니다.

개발자들은 추가 전용 스레드 및 캐시 압축과 같은 특정 아키텍처 패턴을 적용하여 다단계 에이전트 워크플로우 비용을 획기적으로 낮출 수 있습니다.

SOURCES

14. Gigatoken 0.9.0 출시: 호환성 모드 및 확장된 모델 지원

Gigatoken 토크나이저의 초기 릴리스를 기반으로 버전 0.9.0이 이제 PyPI에서 제공됩니다. 이번 업데이트는 표준 Hugging Face 또는 tiktoken 토크나이저를 래핑하여 출력 패리티를 유지하면서도 200~300배의 처리량을 제공하는 호환성 모드를 도입했습니다. 이 라이브러리는 이제 Llama 3/4 및 Qwen 2/3.6을 포함한 23개 토크나이저 제품군을 지원하며, 수동으로 작성된 SWAR 프리토크나이저를 통해 고코어 하드웨어에서 최대 24.53 GB/s의 처리 속도를 달성합니다.

  • Gigatoken 0.9.0은 이제 Llama 3/4 및 Qwen 2/3.6을 포함한 23개 토크나이저 제품군을 지원하며 PyPI에서 사용할 수 있습니다.
  • 새로운 호환성 모드를 통해 개발자는 기존 Hugging Face 또는 tiktoken 토크나이저를 래핑하여 출력 패리티를 유지하면서 200~300배의 속도 향상을 달성할 수 있습니다.
  • 토크나이저는 144코어 하드웨어에서 최대 24.53 GB/s의 처리 속도를 달성합니다.
  • 성능은 수동으로 작성된 SWAR 프리토크나이저와 프리토큰 캐싱에 의해 구동됩니다.

개발자들은 이제 새로운 호환성 모드를 사용하여 최소한의 마찰로 기존 워크플로우에 Gigatoken을 통합할 수 있으며, 처리량 향상과 더 넓은 모델 지원의 이점을 누릴 수 있습니다.

SOURCES

15. LangChain, 에이전트 평가 자동화를 위한 Eval Engineering Skill 출시

LangChain은 AI 에이전트의 평가 프로세스를 자동화하기 위한 도구인 Eval Engineering Skill을 도입했습니다. 이 유틸리티는 기존 에이전트 저장소와 프로덕션 추적을 분석하여 테스트를 간소화하기 위해 Harbor 프레임워크 내의 실행 가능한 평가로 직접 변환합니다.

  • LangChain은 새로운 Eval Engineering Skill을 출시했습니다.
  • 이 도구는 에이전트 저장소와 프로덕션 추적을 실행 가능한 Harbor 평가로 매핑합니다.

개발자들은 실제 프로덕션 추적에서 평가 제품군 생성을 자동화하여 에이전트 워크플로우의 테스트 및 개선을 단순화할 수 있습니다.

SOURCES

16. Palmier Pro: 로컬 MCP 서버를 통해 제어되는 오픈 소스 macOS 비디오 편집기

Swift로 구축된 오픈 소스 macOS 비디오 편집기인 Palmier Pro는 로컬 AI와 에이전트 제어의 강력한 통합을 보여줍니다. 로컬 Model Context Protocol(MCP) 서버를 노출함으로써 이 편집기는 Claude와 같은 외부 코딩 에이전트가 타임라인을 프로그래밍 방식으로 조작하고, 미디어를 검색하며, 자산을 생성할 수 있도록 합니다. 이 애플리케이션은 프레임 임베딩을 위한 SigLip2와 전사를 위한 SpeechAnalyzer를 포함하여 여러 모델을 CoreML을 통해 로컬에서 실행하며, 에이전트 호환 데스크톱 소프트웨어를 구축하는 개발자를 위한 청사진을 제공합니다.

  • Palmier Pro는 CoreML과 같은 기본 macOS API를 사용하여 Swift로 구축된 오픈 소스 macOS 비디오 편집기입니다.
  • 로컬 Model Context Protocol(MCP) 서버를 노출하여 Claude와 같은 에이전트가 프로젝트를 관리하고 타임라인을 편집할 수 있도록 합니다.
  • 편집기는 전사(SpeechAnalyzer), 프레임 임베딩(SigLip2) 및 무음 감지(Silero VAD)를 위한 로컬 모델을 실행합니다.
  • 이 애플리케이션은 무료로 사용할 수 있으며 클라우드 기반 AI 생성 기능을 위한 무료 크레딧을 제공합니다.

개발자들은 복잡한 데스크톱 GUI에 대한 핸즈프리 에이전트 제어를 가능하게 하는 로컬 MCP 서버와 CoreML 모델의 실제 구현 사례를 연구할 수 있습니다.

SOURCES

17. Blackwell 커널의 Triton 포팅으로 RTX 4090 GPU에서 DeepSeek-V4-Flash 실행 가능

DeepGEMM, FlashInfer sparse-MLA 및 블록 스케일 FP8을 포함한 Blackwell 특정 커널의 새로운 Triton 기반 재구현은 RTX 4090d와 같은 sm89 아키텍처 GPU에 대한 기본 지원을 제공합니다. 듀얼 GPU 설정에서 실행되는 이 최적화는 병렬 에이전트 워크플로우에 대해 llama.cpp보다 2~3배의 성능 향상을 제공하며 262k 컨텍스트 길이를 지원합니다.

  • DeepGEMM 및 FlashInfer sparse-MLA를 포함한 Blackwell 전용 커널이 sm89(RTX 4090d) 아키텍처를 지원하기 위해 Triton에서 재구현되었습니다.
  • 이 구현을 통해 각각 48GB VRAM을 갖춘 2개의 RTX 4090d GPU에서 DeepSeek-V4-Flash를 실행할 수 있습니다.
  • 이 설정은 262k 컨텍스트 길이를 달성하며 병렬 에이전트 워크플로우에 대해 llama.cpp 대비 2~3배의 성능 향상을 제공합니다.
  • 96GB VRAM 공간에 맞추기 위해 모델을 iq2 형식으로 압축하는 데 최대 60분이 소요됩니다.

개발자들은 이제 에이전트 워크플로우를 위해 방대한 컨텍스트 창과 높은 동시성을 갖춘 소비자용 Ada Lovelace GPU에서 DeepSeek-V4-Flash를 로컬로 실행할 수 있습니다.

SOURCES

18. 맞춤형 w8a8 커널, Apple M5 실리콘에서 1.4배 프리필 속도 향상

Apple의 M5 세대 실리콘은 기본적으로 INT8 활성화를 지원하지만, MLX 및 llama.cpp와 같은 인기 있는 로컬 추론 엔진은 여전히 16비트 활성화를 기본값으로 사용합니다. 이 격차를 해소하기 위해 한 개발자가 하드웨어의 잠재력을 발휘하는 맞춤형 w8a8 커널을 생성하여 Gemma4 프리필 작업에서 1.4배의 속도 향상을 입증했습니다. M5 MacBook Air에서 테스트한 결과, 맞춤형 커널은 130k 토큰 입력에서 프리필 처리량을 초당 3,029토큰으로 높여 소비자용 Mac 하드웨어에서 고도로 최적화된 로컬 실행을 위한 경로를 제시했습니다.

  • Apple M5 실리콘은 기본적으로 INT8 활성화를 지원하지만, 현재 MLX 및 llama.cpp와 같은 백엔드는 16비트 활성화를 기본값으로 사용합니다.
  • 이러한 하드웨어 기능을 활용하기 위해 맞춤형 w8a8 커널이 개발되었으며, Gemma4 프리필 작업에서 1.4배의 속도 향상을 가져왔습니다.
  • M5 MacBook Air에서의 프리필 성능은 130,173토큰 입력에 대해 초당 2,193토큰에서 3,029토큰으로 증가했습니다.
  • 더 작은 컨텍스트 길이에서 맞춤형 커널을 사용한 프리필 속도는 초당 거의 10,000토큰에 근접했습니다.

Apple Silicon에서 로컬 LLM을 실행하는 개발자들은 긴 컨텍스트 입력에 대해 훨씬 빠른 프리필 속도와 낮은 지연 시간을 달성할 수 있습니다.

SOURCES

19. 모델 정체성 파편화와 조용한 양자화의 부상

모델 라우팅과 API 집계가 표준이 됨에 따라 개발자들은 '모델 정체성 파편화'라는 점점 커지는 도전에 직면하고 있습니다. 이 현상은 공급자가 모델을 조용히 대체하거나(Anthropic이 차단된 Claude Fable 5 요청을 Opus 4.8로 리디렉션하는 등), 로그를 업데이트하지 않고 더 저렴한 양자화 가중치를 제공하거나(OpenRouter 문서에 언급된 바와 같이), 조용한 가중치 업데이트를 푸시할 때 발생합니다. 이로 인한 출력 드리프트와 성능 저하에 대응하기 위해 업계에서는 모델 해시, 정밀도 수준 및 시스템 프롬프트에 대한 암호화 서명된 주장인 '증명 가능한 모델 정체성'을 요구하고 있습니다.

  • 모델 정체성은 조용한 모델 대체, 양자화를 통한 성능 저하, 조용한 가중치 업데이트로 인한 드리프트라는 세 가지 축으로 파편화되고 있습니다.
  • OpenRouter 문서는 일부 다운스트림 공급자가 더 낮은 가격에 양자화된 가중치를 제공하여 기록되지 않은 출력 차이를 유발한다고 경고합니다.
  • Cursor가 새로 출시한 라우터는 60만 개의 요청으로 학습된 분류기를 사용하여 쿼리를 동적으로 전달하며 초기 사용자들의 비용을 30~50% 절감했습니다.
  • Anthropic의 Claude Fable 5는 이제 차단된 요청을 Opus 4.8로 자동 리디렉션하고 사용자에게 알립니다.
  • 이 분석은 API 응답에 가중치, 정밀도 및 시스템 프롬프트의 서명된 해시가 포함되는 '증명 가능한 모델 정체성'을 제안합니다.

개발자들은 API 공급자가 모델을 뒤에서 교체하거나 양자화함으로써 발생하는 조용한 성능 저하를 감지하기 위해 강력한 평가 및 모니터링 파이프라인을 설계해야 합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.