Inference Brew

Google, DiffusionGemma 성능을 초당 1,500 토큰으로 업데이트

00:00 / --:--

← 메인으로

Google, DiffusionGemma 성능을 초당 1,500 토큰으로 업데이트

1. Google, DiffusionGemma 성능을 초당 1,500 토큰으로 업데이트

지난 6월 DiffusionGemma가 처음 출시된 이후, Google은 NVIDIA H100에서 모델의 처리량을 초당 1,500 토큰까지 끌어올리는 추가 최적화 내용을 담은 기술 보고서를 발표했습니다. 이번 업데이트는 기존의 초당 1,000 토큰 벤치마크를 기반으로 하며, 모델의 이산 확산(discrete diffusion) 아키텍처가 가진 지속적인 효율성 개선을 입증합니다.

  • • DiffusionGemma의 처리량이 NVIDIA H100 기준 초당 1,500 토큰으로 증가했습니다.
  • • 이번 성능 향상은 6월 초기 출시 이후 발표된 새로운 기술 보고서에 상세히 기술되어 있습니다.
  • • 이 모델은 38억 개의 활성 파라미터를 가진 Gemma 4 MoE 아키텍처를 계속 사용합니다.
  • • 이러한 최적화를 위한 학습 파이프라인은 기존 자기회귀 모델 학습 예산의 10% 미만을 소요했습니다.

처리량 증가는 DiffusionGemma를 로컬 배포를 위한 자기회귀(autoregressive) 모델의 고성능 대안으로 확고히 하며, 실시간 애플리케이션의 지연 시간을 크게 낮춰줍니다.

SOURCES

2. Liquid AI, 최대 3.18배 빠른 로컬 추론을 위한 DSpark 드래프트 모델 출시

DSpark 드래프터는 대상 모델에 3억 개의 파라미터를 추가하여 메모리 사용량을 약간 늘리는 대신 디코딩 속도를 대폭 향상시킵니다. 이 방식은 다중 도구 함수 호출 시나리오에서 매우 효과적이며, LFM2.5-2.6B 모델의 경우 지연 시간을 평균 57% 줄여줍니다. 다만, 현재 llama.cpp Metal 백엔드의 MoE 제한으로 인해 Apple 실리콘 환경에서 8B 모델의 속도 향상은 제한적입니다.

  • • Liquid AI가 LFM2.5-1.2B-Instruct, LFM2.5-2.6B, LFM2.5-8B-A1B용 DSpark 드래프트 모델 체크포인트를 출시했습니다.
  • • 드래프트 모델은 추측 디코딩을 사용하여 9토큰 블록을 제안하며, H100에서 최대 3.18배, M4 Max에서 2.87배의 속도 향상을 달성합니다.
  • • 드래프터가 탐욕적 디코딩(greedy decoding)을 사용하므로 출력 시퀀스가 대상 모델과 동일하여 벤치마크 정확도가 유지됩니다.
  • • 모델은 SGLang 또는 llama.cpp를 통한 자체 호스팅을 위해 Safetensors 및 GGUF 형식으로 제공됩니다.
  • • LFM Open License v1.0은 연간 매출 1,000만 달러 미만 기업의 무료 상업적 이용을 허용합니다.

개발자는 이를 통해 로컬 추론 지연 시간을 크게 줄이고, 자체 하드웨어에서 llama.cpp나 SGLang을 사용하여 다중 도구 함수 호출 속도를 높일 수 있습니다.

SOURCES

3. Superwhisper, ASR 전사본을 위한 오픈 웨이트 0.6B 텍스트 정규화 모델 S1-mini 출시

S1-mini는 클라우드 기반의 S1-Voice 및 S1-Language 모델을 포함하는 Superwhisper의 새로운 S1 모델 제품군 중 하나입니다. 클라우드 모델과 달리 S1-mini는 오픈 웨이트이며 로컬 실행에 최적화되어 있어 음성 지원 애플리케이션을 구축하는 개발자가 쉽게 접근할 수 있습니다. 모델이 올바르게 작동하려면 컨텍스트, 구조 및 스타일 설정을 관리하기 위한 제어 라인을 포함한 특정 입력 형식이 필요합니다.

  • • Superwhisper가 Qwen3-0.6B를 파인튜닝한 오픈 웨이트 0.6B 파라미터 텍스트 정규화 모델 S1-mini를 출시했습니다.
  • • 이 모델은 채움 단어 제거, 자기 교정 해결, 날짜 및 이메일과 같은 엔티티 포맷팅을 통해 원시 ASR 전사본을 정리하도록 설계되었습니다.
  • • Q4_K_M GGUF 빌드는 462MB이며 노트북 CPU에서 로컬로 실행됩니다.
  • • S1-mini는 7,519건의 내부 테스트 세트에서 94.8%의 토큰 정확도를 달성했습니다.
  • • 모델은 Apache 2.0(명명 조항 포함) 라이선스를 따르며 고정 시스템 프롬프트, 온도 0, 3축 제어 라인이 필요합니다.

개발자는 노트북 CPU에서 462MB의 가벼운 모델을 로컬로 실행하여 채움 단어(filler words)를 제거하고, 자기 교정을 수정하며, 원시 ASR 출력을 높은 정확도로 포맷할 수 있습니다.

4. Google, Hugging Face에 TIPS 비전-언어 모델 공개

TIPS의 출시는 개발자들에게 공간 비전 작업을 위한 강력한 오픈 웨이트 도구를 제공합니다. 밀도 높은 이해에 집중함으로써, 이 모델은 범용 비전-언어 모델보다 더 정밀한 객체 세분화 및 깊이 매핑을 가능하게 하여 공간 분석 파이프라인 통합에 이상적입니다.

  • • Google이 Hugging Face에 TIPS 비전-언어 모델을 공개했습니다.
  • • 이 모델은 공간 인식 기능을 갖추도록 설계되었습니다.
  • • TIPS는 밀도 높은 이해 작업, 특히 세분화 및 깊이 추정에 최적화되어 있습니다.

공간 컴퓨팅, 로봇 공학 또는 고급 이미지 분석 기능을 구축하는 개발자는 정밀한 깊이 및 세분화 작업을 위해 이 특화된 오픈 모델을 활용할 수 있습니다.

SOURCES

5. Ornith-1.5-35B-A3B, 학습되지 않은 MTP 헤드와 함께 배포

Ornith-1.5-35B-A3B 릴리스에서 학습되지 않은 MTP 헤드가 발견된 것은 모델 패키징 과정의 중대한 실수를 보여줍니다. 다중 토큰 예측 헤드의 가중치가 전혀 학습되지 않았기 때문에, 이 기능을 활용하려는 개발자는 성능 저하를 겪게 되며 수정된 릴리스를 기다리거나 MTP 헤드를 비활성화해야 합니다.

  • • Hugging Face 게시물에 따르면 Ornith-1.5-35B-A3B 모델이 학습되지 않은 MTP 헤드와 함께 배포되었습니다.
  • • MTP 헤드에는 무작위로 초기화된 가중치만 포함되어 있습니다.
  • • 이 문제는 모델의 다중 토큰 예측 성능이 느린 이유를 설명합니다.

이 보고서는 예상보다 느린 성능의 원인인 학습되지 않은 MTP 헤드에 대해 해당 모델을 사용하려는 개발자들에게 경고를 제공합니다.

SOURCES

6. Replit, GPT-5.6 Luna 기반의 무료 모드 도입

Replit의 새로운 무료 모드는 표준 개발 작업에 OpenAI의 GPT-5.6 Luna에 대한 무제한 액세스를 제공하여 AI 지원 코딩의 진입 장벽을 낮춥니다. 이번 릴리스와 함께 채팅 기반 지원, 개별 작업, 전체 프로젝트 빌드 간의 이동을 쉽게 하도록 설계된 UI 개편이 이루어졌습니다.

  • • Replit이 OpenAI의 GPT-5.6 Luna 모델을 크레딧 없이 사용할 수 있는 '무료 모드'를 도입했습니다.
  • • 회사는 새로운 모드를 통해 사용자가 최대 30배 더 많은 콘텐츠를 생성할 수 있다고 주장합니다.
  • • 재설계된 Replit UI는 채팅, 작업, 전체 빌드 간의 전환을 간소화합니다.
  • • Pro 사용자는 사용 제한이 늘어나며, Core 구독자는 고품질 프로젝트를 대규모로 구축할 수 있는 기능을 얻게 됩니다.

개발자는 크레딧 소모 걱정 없이 Replit 플랫폼에서 일상적인 코딩 작업을 위해 새로운 최첨단 모델을 활용할 수 있습니다.

SOURCES

7. LinkedIn의 가짜 코딩 챌린지, 자격 증명 탈취 악성코드 유포

이 고도로 타겟팅된 캠페인은 약 180개의 파일이 포함된 프로젝트 내에 악성 코드를 숨겨 표준 개발자 워크플로우를 악용합니다. 악성코드가 일반적인 개발 명령에서 트리거되고 사용자 소유의 자격 증명 파일에 액세스하기 위해 관리자 권한이 필요하지 않기 때문에, 베어메탈 호스트에서 이러한 프로젝트를 실행하는 것은 개발자의 클라우드 인프라에 심각한 보안 위험을 초래합니다.

  • • 공격자들이 가짜 LinkedIn 채용 제안을 통해 코딩 챌린지로 위장한 악성코드를 유포하고 있습니다.
  • • 악성코드는 개발자가 `npm run dev`나 `npm start`와 같은 표준 명령을 실행할 때 자동으로 실행됩니다.
  • • 루트 권한 없이도 AWS 자격 증명, SSH 키, 브라우저 프로필, .env 파일 등 민감한 개발자 데이터를 타겟팅합니다.
  • • 악성 페이로드는 `147.189.174.138`의 C&C 서버에 연결하여 원격 액세스 트로이 목마(RAT)와 자격 증명 탈취 도구를 다운로드합니다.
  • • 보안 전문가들은 모든 신뢰할 수 없는 코딩 챌린지를 호스트 데이터를 마운트하지 않은 Docker나 Vagrant와 같은 격리된 환경에서 실행할 것을 권장합니다.

이 보고서는 민감한 클라우드 자격 증명 및 SSH 키의 무단 탈취를 방지하기 위해 신뢰할 수 없는 코딩 챌린지를 호스트 디렉토리를 마운트하지 않은 Docker나 Vagrant 환경에서 격리하여 실행할 것을 개발자들에게 경고합니다.

SOURCES

8. Grok, 암호화된 웹 지침을 통한 프롬프트 인젝션에 취약

Adversa의 보안 연구원 Rony Utevsky가 발견한 이 취약점은 악성 페이로드를 암호화된 형식으로 숨겨 표준 LLM 가드레일을 우회합니다. Grok에게 페이지 요약을 요청하면, 모델이 지침을 복호화하고 실행합니다. 이는 RAG(검색 증강 생성) 시스템 개발자가 경계해야 할 정교한 데이터 유출 벡터를 보여줍니다.

  • • Grok의 프롬프트 인젝션 취약점을 통해 공격자가 사용자 채팅 및 개인 정보를 훔칠 수 있습니다.
  • • 이 공격은 웹페이지에 암호화된 악성 지침과 복호화 키를 함께 호스팅하여, AI가 요약 중에 이를 실행하도록 하는 방식으로 작동합니다.
  • • 익스플로잇은 어시스턴트의 경고나 확인 없이 자동으로 실행됩니다.
  • • xAI는 6월에 취약점을 통보받았으나, 보고 시점까지 어시스턴트는 여전히 취약한 상태였습니다.

LLM을 사용하여 웹 스크래핑이나 요약 기능을 구축하는 개발자들은 암호화된 페이로드가 애플리케이션을 탈취하지 못하도록 엄격한 입력 살균(input sanitization)을 구현해야 합니다.

SOURCES

9. Slack, 협업 AI 에이전트 워크플로우를 위한 Slack Code 채널 출시

Slack Code는 AI 지원 개발을 팀 채팅으로 직접 가져와 개발자가 에이전트를 태그하여 기능 구축이나 버그 수정과 같은 코딩 작업을 시작할 수 있게 합니다. 이 환경은 에이전트 작업에 대한 완전한 가시성을 제공하며, 승인 전 팀 검토를 위해 HTML 출력의 실시간 미리보기와 코드 변경 비교 기능을 제공합니다. 이 기능은 오늘부터 모든 Slack 플랜에서 사용할 수 있습니다.

  • • Slack이 AI 코딩 에이전트와 협업하기 위해 설계된 전용 채널인 'Slack Code'를 출시했습니다.
  • • 이 기능은 Claude Code, Devin, Vercel Agent, GitHub Copilot을 포함한 파트너 에이전트와 통합됩니다.
  • • Slack Code에는 프로젝트별 채널, 전용 사용자 탭, 코드 변경 비교 도구, HTML 출력 미리보기가 포함되어 있습니다.
  • • 팀은 완전한 가시성, 실시간 미리보기, 감사 로그를 통해 에이전트 출력을 검토하고 승인할 수 있습니다.
  • • 채널은 할당된 코딩 작업이 완료되면 자동으로 보관되도록 설계되었습니다.

개발자는 내장된 코드 비교 도구, 실시간 미리보기, 감사 로그를 갖춘 전용 Slack 채널에서 AI 코딩 에이전트와 협업하고 모니터링할 수 있습니다.

SOURCES

10. Cursor, 이벤트 기반 클라우드 에이전트 및 서브에이전트 VM 도입

이번 업데이트는 Cursor의 에이전트 기능을 로컬 편집기 너머로 크게 확장합니다. 클라우드 호스팅 에이전트가 백그라운드에서 지속적으로 실행되고 전용 VM에서 격리된 서브에이전트를 가동할 수 있게 함으로써, 개발자는 PR 모니터링 및 Slack 기반 이슈 해결과 같은 복잡하고 장기적인 작업을 위임할 수 있습니다.

  • • Cursor 에이전트는 이제 풀 리퀘스트나 Slack 스레드와 같은 이벤트 소스를 구독하여 이벤트 발생 시 자동으로 깨어날 수 있습니다.
  • • 이벤트 기반 구독은 현재 Cursor의 클라우드 기반 에이전트로 제한됩니다.
  • • Cursor 서브에이전트는 이제 자체 전용 가상 머신에서 실행될 수 있습니다.
  • • 사용자는 실행을 중단하지 않고도 활성 Cursor 에이전트에 실시간 조정 메시지를 보낼 수 있습니다.

개발자는 코딩 에이전트가 외부 이벤트에 반응하고 중단 없이 작업 중간에 안내를 받을 수 있는 보다 자율적이고 백그라운드에서 실행되는 워크플로우를 구축할 수 있습니다.

SOURCES

11. NVIDIA, 공식 CUDA Model Context Protocol 서버 출시

공식 CUDA MCP 서버의 출시는 개발자들이 고성능 GPU 코드를 작성하는 것을 훨씬 쉽게 만듭니다. 표준화된 Model Context Protocol을 통해 공식 문서와 성능 분석 기능을 노출함으로써, 개발자는 기존 AI 코딩 설정을 활용하여 더 정확하고 최적화된 CUDA 구현을 생성할 수 있습니다.

  • • NVIDIA가 공식 NVIDIA 호스팅 CUDA Model Context Protocol(MCP) 서버를 출시했습니다.
  • • 이 도구를 통해 AI 어시스턴트는 최신 공식 CUDA 문서를 검색할 수 있습니다.
  • • AI 도구가 최적화된 GPU 코드를 작성하고 성능 데이터를 분석하는 것을 지원합니다.

개발자는 MCP 호환 AI 어시스턴트를 NVIDIA의 공식 CUDA 문서 및 성능 분석 도구에 직접 연결할 수 있습니다.

SOURCES

12. NanoClaw, 자체 호스팅 AI 에이전트 팀을 위한 Slack 통합 출시

MIT 라이선스의 오픈 소스 에이전트 하니스인 NanoClaw는 이제 팀이 Slack 프롬프트에서 직접 자율 에이전트 팀을 가동할 수 있게 합니다. NanoClaw는 자체 호스팅 솔루션이므로 조직은 자체 로컬 머신이나 클라우드 가상 머신에서 기본 에이전트 인프라를 실행하여 데이터 및 모델 선택에 대한 통제권을 유지합니다. 또한 이 플랫폼은 교차 채널 연속성을 지원하여 이러한 지속적인 에이전트가 Slack, Telegram, WhatsApp 전반에서 컨텍스트를 공유하며 작동할 수 있게 합니다.

  • • NanoCo가 오픈 소스 자체 호스팅 AI 에이전트 하니스인 NanoClaw를 위한 무료 Slack 통합을 출시했습니다.
  • • 각 에이전트에는 고유한 ID, 이름, 아바타가 할당되며 특정 역할, 메모리 컨텍스트, 권한으로 구성될 수 있습니다.
  • • 시스템은 재귀적 프로비저닝을 지원하여 기존 에이전트가 Slack 채널 내에서 추가 에이전트를 생성하고 조정할 수 있습니다.
  • • NanoClaw는 교차 채널 연속성을 지원하여 Slack, Telegram, WhatsApp 간에 지속적인 컨텍스트를 공유합니다.
  • • 통합은 Slack Marketplace를 통해 무료로 제공되며, 사용자는 자체 모델 추론 및 호스팅 비용을 부담해야 합니다.

개발자는 자체 호스팅 인프라와 모델 API를 사용하여 Slack, Telegram, WhatsApp 전반에서 지속적인 다중 에이전트 워크플로우를 배포하고 관리할 수 있습니다.

SOURCES

13. Serval, 자동화된 IT 워크플로우를 위한 Catalyst AI 에이전트 플랫폼 출시

Serval의 Catalyst는 관리형 슈퍼 에이전트로서 과거 티켓 데이터와 표준 운영 절차를 분석하여 맞춤형 워크플로우와 액세스 정책을 초안으로 작성합니다. 이 플랫폼은 데이터 개인정보 보호를 우선시하여 고객의 입력 및 출력이 기본 모델을 학습하거나 파인튜닝하는 데 절대 사용되지 않도록 보장하며, 규제가 엄격한 엔터프라이즈 환경에 적합합니다.

  • • Serval이 2026년 8월 20일 엔터프라이즈 자동화 에이전트 Catalyst를 정식 출시했습니다.
  • • Catalyst는 워크플로우를 위한 기본 TypeScript 코드를 생성하여 관리자가 배포 전 검토하고 승인할 수 있게 합니다.
  • • 플랫폼은 백그라운드 에이전트를 사용하여 시스템을 지속적으로 모니터링하고 지원 티켓이 접수되기 전에 자동화된 수정 사항을 제안합니다.
  • • OpenAI 및 Anthropic 모델을 지원하는 모델 독립적 플랫폼이며, 고객이 자체 API 키를 제공할 수 있습니다.
  • • Catalyst는 클라우드 SaaS, 온프레미스 또는 고객의 VPC나 Kubernetes 클러스터 내에 배포될 수 있습니다.

개발자는 시스템 모니터링 및 문제 해결을 자동화하기 위해 TypeScript 코드를 작성하고 실행하는 모델 독립적이고 자체 호스팅 가능한 에이전트 플랫폼을 배포할 수 있습니다.

SOURCES

14. Atlassian, Jira AI 통합에 Teamwork Graph 추가하여 토큰 사용량 48% 절감

개발자가 Jira 작업을 AI 에이전트에 직접 할당할 수 있게 한 7월 발표에 이어, Atlassian은 이제 Teamwork Graph를 도입했습니다. 이 새로운 기능은 이슈, 코드, 팀 활동 전반의 관계를 매핑하여 에이전트에게 더 관련성 높은 컨텍스트를 제공하며, 이전 보고된 44%의 출력 정확도 향상을 유지하면서 토큰 소비를 48% 줄였습니다.

  • • Teamwork Graph는 7월에 발표된 Jira AI 통합에 새로 추가된 기능입니다.
  • • AI 에이전트를 위한 컨텍스트 전달을 최적화하여 토큰 사용량을 48% 줄입니다.
  • • 이 기능은 이전에 보고된 44%의 출력 정확도 향상을 유지합니다.
  • • Claude, Cursor, Copilot을 포함한 에이전트와 통합됩니다.

이번 업데이트는 더 효율적인 컨텍스트 관리를 통해 Claude, Cursor, Copilot과 같은 에이전트를 사용하는 개발자들의 API 비용을 크게 낮춤으로써 기존 Jira-AI 통합을 향상시킵니다.

SOURCES

15. Agent Lightning v1.0 프레임워크, SWE-bench 성능 14.6점 향상

Agent Lightning v1.0은 에이전트 워크플로우에 강화 학습을 적용하려는 개발자들에게 간소화된 경로를 제공합니다. 하니스 통합과 학습 안정성에 집중함으로써, 이 소형 프레임워크는 개발자들이 더 작고 비용 효율적인 오픈 웨이트 모델에서 최첨단 수준의 소프트웨어 엔지니어링 역량을 달성할 수 있게 합니다.

  • • Agent Lightning v1.0은 3,500줄의 코드로 작성된 경량 에이전트 강화 학습 프레임워크입니다.
  • • 이 프레임워크는 임의의 에이전트 하니스를 통합하여 재토큰화 및 학습 불안정성과 같은 문제를 해결합니다.
  • • SWE-bench Verified에서 Qwen3.5-9B의 성능을 14.6점 향상시켰습니다.
  • • 벤치마크 향상은 6,000개의 학습 예제를 사용하여 달성되었습니다.

개발자는 소형 프레임워크를 사용하여 Qwen3.5-9B와 같은 더 작은 모델을 복잡한 소프트웨어 엔지니어링 작업에 파인튜닝하여 벤치마크에서 상당한 향상을 얻을 수 있습니다.

SOURCES

16. TRL 및 LoRA를 사용한 DPO 파인튜닝 단계별 튜토리얼 상세 안내

이 튜토리얼은 소형 로컬 모델을 특정 사용자 선호도에 맞추려는 개발자들에게 매우 유용합니다. 데이터셋 감사 및 학습 진단을 단계별로 안내함으로써, 개발자가 모델이 응답 길이와 같은 표면적인 패턴을 악용하게 두지 않고 진정한 선호도 학습을 달성할 수 있도록 보장합니다.

  • • 이 튜토리얼은 TRL 라이브러리를 사용한 DPO(Direct Preference Optimization)를 위한 엔드투엔드 워크플로우를 제공합니다.
  • • 선택적 LoRA 적응을 사용하여 Qwen2.5-0.5B-Instruct 모델을 파인튜닝하는 방법을 보여줍니다.
  • • 가이드에는 구조, 길이, 어휘적 지름길 편향에 대해 데이터셋을 감사하는 단계가 포함되어 있습니다.
  • • 보상 정확도 평가, 학습 동작, 최종 정책 및 토크나이저 저장 방법을 다룹니다.

개발자는 구조화된 워크플로우를 따라 선호도 데이터에 대해 소형의 작업별 모델을 파인튜닝하면서 일반적인 데이터셋 편향을 감사할 수 있습니다.

SOURCES

17. 100만 달러 보조금과 함께 오픈 소스 인간 이미지 선호도 데이터셋 출시

이 방대한 데이터셋은 개발자들에게 이미지 모델 성능에 대한 경험적이고 인간이 투표한 데이터를 제공합니다. 제품 디자인 및 마케팅과 같은 다양한 카테고리를 다룸으로써, 이 데이터셋은 개발자가 특정 비즈니스 사용 사례에 가장 적합한 이미지 생성 모델을 선택하도록 돕습니다.

  • • 이 프로젝트는 200만 개 이상의 주석을 특징으로 하는 최대 규모의 오픈 소스 인간 이미지 선호도 데이터셋을 출시했습니다.
  • • 데이터셋 출시와 함께 100만 달러 규모의 데이터 보조금이 발표되었습니다.
  • • 데이터셋은 마케팅 및 제품 디자인을 포함한 10개의 뚜렷한 카테고리에서 30개의 최첨단 이미지 모델의 순위를 매깁니다.

멀티모달 또는 이미지 생성 기능을 구축하는 개발자는 방대한 인간 주석 데이터셋을 활용하여 이미지 모델을 평가하고 파인튜닝할 수 있습니다.

SOURCES

18. Endpoint Accuracy Index, 암묵적 모델 저하 정량화

'모델 정체성 파편화'—제공업체가 암묵적으로 양자화되거나 수정된 가중치를 제공하는 현상—에 대한 우려에 따라, 'Inference, Measured' 이벤트에서 Endpoint Accuracy Index가 도입되었습니다. 이 도구는 개발자들이 추적하기 어려웠던 성능 저하를 정량화하는 표준화된 방법을 제공합니다. 제공업체 엔드포인트를 자체 호스팅된 비양자화 참조 가중치와 비교함으로써, 이 지수는 일부 호스팅 모델이 73%의 정확도로 작동함을 밝혀내며 KV-캐시 압축 및 양자화와 같은 암묵적 최적화가 출력 품질에 상당한 영향을 미친다는 것을 확인했습니다.

  • • Endpoint Accuracy Index는 제공업체 엔드포인트를 100% 참조값인 자체 호스팅 비양자화 가중치와 비교하여 측정합니다.
  • • 테스트된 제공업체 엔드포인트는 지수에서 73%에서 100% 사이의 점수를 기록하여 암묵적 최적화의 영향을 정량화했습니다.
  • • 이 지수는 이전에 보고된 '모델 정체성 파편화' 및 암묵적 양자화 문제에 대한 구체적인 지표를 제공합니다.
  • • KV-캐시 압축 및 양자화와 같은 성능에 영향을 미치는 최적화는 제공업체 가격 페이지에 대부분 공개되지 않은 상태로 남아 있습니다.

이 지수는 업계가 암묵적 모델 저하 문제를 식별하는 단계에서 적극적으로 측정하는 단계로 나아가게 하며, 개발자들이 제공하는 모델의 성능에 대해 API 제공업체에 책임을 물을 수 있게 합니다.

SOURCES

19. 초최적화된 Qwen3.8-27B 추론 엔진, RTX 3090에서 382 TPS 달성

이 초최적화된 엔진은 27B 파라미터 모델을 단일 소비자용 GPU에서 실행하는 것을 프로덕션 수준의 워크로드에 매우 실용적으로 만듭니다. int8 KV 캐시의 구현은 대형 문서를 한 번 로드하고 반복적으로 쿼리하는 문서 QA 작업에 특히 적합하며, 프리픽스 캐싱 및 추측 검증의 처리량 이점을 극대화합니다.

  • • Qwen3.8-27B를 위한 오픈 소스 추론 엔진이 GitHub에 출시되었으며 RTX 3090에 최적화되었습니다.
  • • 엔진은 실제 채팅 프롬프트에서 133 tps, 컨텍스트 재생산 시 최대 382 tps를 달성합니다.
  • • int8 KV 캐시는 컨텍스트 용량을 138,696 토큰으로 늘리지만 bf16 프리필의 두 배 비용이 듭니다.
  • • 엔진은 DFlash2 블록 드래프팅, 룩업 증강 드래프팅, 프리픽스 캐싱 및 int8 활성화를 활용하면서 96.5%의 GSM8K 점수를 유지합니다.
  • • 새로운 업데이트를 통해 더 긴 검증 블록을 사용하여 단계당 16개의 토큰을 검증할 수 있습니다.

개발자는 138k 토큰 용량과 엄청난 토큰 처리량으로 소비자용 하드웨어에서 로컬로 매우 유능한 27B 모델을 실행할 수 있습니다.

SOURCES

20. Anthropic, 고객 클라우드 시스템에서의 엔터프라이즈 데이터 보존 허용 예정

Anthropic은 비즈니스 고객이 가장 진보된 인공지능 모델을 활용할 때 데이터에 대한 통제권을 강화할 수 있도록 준비하고 있습니다. 표준 30일 데이터 보존 요구 사항은 유지되지만, 저장 위치를 고객의 자체 클라우드 인프라로 전환함으로써 기업은 내부 보안 및 규정 준수 요구 사항을 충족할 수 있습니다.

  • • Anthropic은 비즈니스 고객이 필수 데이터를 자체 클라우드 시스템에 보존할 수 있도록 허용할 계획입니다.
  • • 정책 변경은 올해 말로 예정되어 있습니다.
  • • 기업은 여전히 30일 동안 데이터를 보존해야 하지만, 호스팅 환경은 직접 제어하게 됩니다.

엔터프라이즈급 AI 애플리케이션을 구축하는 개발자는 Anthropic의 최첨단 모델을 계속 사용하면서도 엄격한 규정 준수 및 데이터 주권 요구 사항을 충족할 수 있습니다.

SOURCES

21. Ramp, 내부 'Router'를 공개 API 서비스로 제공

Ramp는 Router 서비스를 공식 출시하여 7월에 상세히 설명된 내부 아키텍처를 공개 API로 전환했습니다. 이 서비스는 개발자가 성능을 유지하면서 가장 비용 효율적인 모델로 요청을 동적으로 라우팅할 수 있게 하며, 내부 구현에 대해 이전에 보고된 30% 대비 평균 40%의 비용 절감을 제공합니다.

  • • Ramp가 내부 라우팅 아키텍처를 공개 API 서비스로 출시했습니다.
  • • 서비스는 성능 기준을 충족하는 가장 저렴한 모델에 요청을 동적으로 매칭합니다.
  • • Ramp는 새로운 서비스 사용자에 대해 평균 40%의 비용 절감을 보고합니다.
  • • 시스템은 실시간 지연 시간과 실패율을 모니터링하여 모델 선택을 실시간으로 최적화합니다.

개발자는 이제 Ramp가 내부적으로 사용하던 것과 동일한 동적 라우팅 기술을 활용하여 단일 게이트웨이를 통해 자체 LLM API 비용과 지연 시간을 최적화할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.