Inference Brew

OpenAI, GPT-Live-1을 API 개발자에게 공개

00:00 / --:--

← 메인으로

OpenAI, GPT-Live-1을 API 개발자에게 공개

1. OpenAI, GPT-Live-1을 API 개발자에게 공개

OpenAI는 GPT-Live-1 모델에 대한 접근성을 확대하여 ChatGPT 전용 기능에서 개발자용 API 제품으로 전환했습니다. 분당 0.05달러로 책정된 이 모델을 통해 개발자는 전이중 음성 기능(동시 듣기 및 말하기)을 자신의 애플리케이션에 통합할 수 있습니다. 이번 출시는 7월의 초기 소비자 출시를 뒤따르는 것으로, 개발자에게 음성 에이전트를 위한 네이티브 중단 처리 및 실시간 추론 기능을 제공합니다.

  • • GPT-Live-1은 이제 OpenAI API에서 분당 0.05달러로 이용 가능합니다.
  • • 이 모델은 전이중 음성을 지원하여 동시 듣기와 말하기가 가능합니다.
  • • 12가지 음성 옵션과 네이티브 중단 처리가 포함되어 있습니다.
  • • 실시간 음성 상호작용 중에 백그라운드 추론이나 작업을 수행할 수 있습니다.
  • • 초기 테스트 결과, 이전의 턴 기반 시스템 대비 중단이 80% 감소한 것으로 나타났습니다.

개발자는 이제 ChatGPT에만 국한되었던 기술을 사용하여 중단을 자연스럽게 처리하고 대화 도중 복잡한 추론을 수행하는 매우 자연스러운 실시간 음성 인터페이스를 구축할 수 있습니다.

SOURCES

2. OpenAI, GPT Image 2.5 Flare 및 Sunburst 모델 출시

OpenAI는 GPT Image 2.5 Flare와 Sunburst를 출시하며 이미지 생성 제품군을 업데이트했습니다. Flare는 저지연 일상 이미지 생성용으로, Sunburst는 상세한 창작 작업 및 정밀한 편집 제어용으로 설계되었습니다. 두 모델 모두 100만 이미지 출력 토큰당 30달러로 GPT Image 2와 동일한 가격이 책정되었으며, OpenAI API를 통해 즉시 액세스할 수 있습니다. Sunburst는 Artificial Analysis 이미지 편집 리더보드에서 1위를 차지하며 복잡한 레이아웃, 텍스트 렌더링 및 구조적 편집 처리에서 상당한 개선을 입증했습니다.

  • • OpenAI는 GPT Image 2 출시 5개월 만에 GPT Image 2.5 Flare와 Sunburst를 출시했습니다.
  • • Flare는 저지연 일상 생성에 최적화되어 있으며, Sunburst는 고품질 창작 작업과 정밀한 편집 제어에 맞춰 설계되었습니다.
  • • 두 모델 모두 텍스트 투 이미지(Text to Image) 및 이미지 편집을 지원하며, 100만 이미지 출력 토큰당 30달러입니다.
  • • Flare와 Sunburst는 Artificial Analysis 이미지 리더보드에서 1, 2위를 차지하고 있습니다.
  • • Sunburst는 10가지 이미지 편집 사용 사례 중 8개에서 선두를 차지하며 복잡한 구성, 다이어그램 및 창작 콘텐츠에서 큰 성과를 보였습니다.
  • • 이 모델들은 OpenAI API를 통해 이용 가능하며 ChatGPT 및 Codex에 통합되었습니다.

개발자는 이전 세대 모델보다 더 높은 비용을 지불하지 않고도 더 빠르고 고품질의 이미지 생성 및 정밀한 구성 편집 기능을 애플리케이션에 통합할 수 있습니다.

SOURCES

3. Cohere, North Small Translate 218B MoE 모델 출시

Cohere는 50개 언어에 걸쳐 고품질 기계 번역에 최적화된 2,180억 파라미터의 희소 Mixture-of-Experts(MoE) 모델인 North Small Translate를 출시했습니다. 토큰당 250억 파라미터를 활성화하는 이 모델은 128개의 전문가를 갖춘 디코더 전용 아키텍처를 특징으로 하며 16K 입력/출력 컨텍스트 윈도우를 지원합니다. 개발자는 Cohere의 API를 통해 모델에 액세스하거나 단일 B200 또는 듀얼 H100 설정에서 4비트 양자화 버전을 자체 호스팅할 수 있어 로컬 고처리량 번역 파이프라인을 위한 실행 가능한 옵션이 됩니다.

  • • North Small Translate는 총 218B, 활성 25B 파라미터를 가진 희소 Mixture-of-Experts(MoE) 모델입니다.
  • • 이 모델은 16K 입력 및 16K 출력 컨텍스트 윈도우로 50개 언어 번역을 지원합니다.
  • • Cohere API를 통해 이용 가능하며, 비상업적 자체 호스팅 또는 상업적 라이선스로 제공됩니다.
  • • 4비트 양자화 버전은 단일 B200 또는 두 개의 H100 GPU에서 로컬로 실행할 수 있습니다.
  • • 에이전트 변형 모델은 다중 패스 워크플로우를 사용하여 오류를 수정하며 Cohere의 WMT26 평가에서 84.36점을 기록했습니다.

개발자는 표준 엔터프라이즈 하드웨어에서 로컬로 매우 정확한 오픈 가중치 번역 모델을 배포하거나 다국어 애플리케이션을 위해 API를 통해 액세스할 수 있습니다.

SOURCES

4. 25개 언어 음성 인식 모델 Orukeet 출시

Orukeet은 NVIDIA Parakeet TDT 0.6B v3 아키텍처를 기반으로 구축된 고성능 25개 언어 자동 음성 인식(ASR) 모델로 출시되었습니다. 인코더의 시간적 깊이별 필터 절반을 12,288개의 고정된 Gabor 커널로 교체함으로써, Orukeet은 기존 Parakeet 모델 대비 25개 FLEURS 언어 전반에서 단어 오류율(WER)을 10.6% 상대적으로 감소시켰습니다. 이 오픈 가중치 모델은 개발자에게 로컬 배포를 위한 매우 정확한 다중 억양 음성-텍스트 변환 솔루션을 제공합니다.

  • • Orukeet은 NVIDIA Parakeet TDT 0.6B v3 모델을 기반으로 구축된 25개 언어 음성 인식기입니다.
  • • 이 모델은 인코더의 시간적 깊이별 필터 절반을 12,288개의 고정된 Gabor 커널로 교체합니다.
  • • Orukeet은 LibriSpeech test-clean에서 1.46%의 단어 오류율(WER)을 달성했으며, Parakeet은 1.53%를 기록했습니다.
  • • 25개 FLEURS 언어 전반에서 Orukeet은 9.85%의 통합 WER을 달성하여 Parakeet 대비 10.6%의 상대적 감소를 보였습니다.
  • • 이 모델은 다국어 및 다중 억양 데이터로 학습되었으며 최종 적응을 위해 LibriSpeech test-other를 사용했습니다.

음성 및 언어 기능을 구축하는 개발자는 여러 언어에서 단어 오류율을 줄이는 매우 정확한 오픈 가중치 음성-텍스트 변환 모델을 채택할 수 있습니다.

SOURCES

5. Qwen3.8-27B-Humanlike-Chat 모델 출시

표준 AI 비서의 지나치게 장황하고 정제된 어조에 대응하기 위해 한 개발자가 Qwen3.8-27B-Humanlike-Chat을 출시했습니다. abliterated Qwen3.8-27B 기본 모델에 rank-256 LoRA를 사용하여 미세 조정되었으며, 125,000개 이상의 익명화된 인간 대 인간 메시지 데이터셋을 활용했습니다. 결과 모델은 복잡한 시스템 프롬프트 없이도 자연스럽게 더 짧고 덜 형식적이며 현실적인 대화형 응답을 생성합니다. 현재 Hugging Face에서 오픈 가중치로, 그리고 속도 제한이 있는 OpenAI 호환 API 엔드포인트를 통해 이용할 수 있습니다.

  • • 이 모델은 표준 AI 비서의 전형인 지나치게 도움이 되고 정제되며 장황한 어조를 해결하기 위해 학습되었습니다.
  • • 1,396개의 대화에 걸친 125,217개의 익명화된 인간 대 인간 메시지 데이터셋을 사용하여 학습되었습니다.
  • • 학습에는 huihui-ai/Huihui-Qwen3.8-27B-abliterated 기본 모델에 적용된 rank-256 LoRA가 포함되었습니다.
  • • 이 모델은 특정 시스템 프롬프트 없이도 더 짧고 덜 정제된 응답을 생성합니다.
  • • Hugging Face, 데모 공간 및 속도 제한이 있는 OpenAI 호환 API 엔드포인트를 통해 이용 가능합니다.

대화형 에이전트를 구축하는 개발자는 지나치게 장황하고 로봇 같은 비서 템플릿을 우회하여 현실적인 인간 대 인간 대화를 자연스럽게 모방하는 모델을 배포할 수 있습니다.

SOURCES

6. Sakana AI, Fugu Max 및 Fugu Ultra v2로 Fugu 오케스트레이션 플랫폼 확장

이전에 Fugu-Cyber 엔드포인트로 확장된 Fugu 오케스트레이션 플랫폼을 기반으로, Sakana AI는 Fugu Max와 Fugu Ultra v2라는 두 가지 새로운 모델을 출시했습니다. 이 모델들은 단일 OpenAI 호환 API를 통해 이용 가능하며, 개발자가 비용 효율성이나 복잡한 추론을 위해 모델 풀 전체에 작업을 라우팅할 수 있게 합니다. Fugu Max는 저비용에 최적화되어 있으며, Fugu Ultra v2는 고성능 다단계 추론에 중점을 둡니다. 이 모델들은 자체 호스팅이 불가능하며 EU/EEA 지역에서는 제외된다는 점에 유의하십시오.

  • • Fugu Max와 Fugu Ultra v2는 Fugu 오케스트레이션 플랫폼의 새로운 추가 기능입니다.
  • • Fugu Max는 비용 효율성을 목표로 입력 100만 토큰당 2달러, 출력 100만 토큰당 6달러로 책정되었습니다.
  • • Fugu Ultra v2는 복잡한 추론을 위해 설계되었으며 DeepSWE 벤치마크에서 74.3점을 기록했습니다.
  • • 이 모델들은 호스팅된 OpenAI 호환 API를 통해 이용 가능합니다.
  • • 이전 Fugu 엔드포인트와 마찬가지로 자체 호스팅이 불가능하며 EU/EEA 지역에서는 제외됩니다.

이번 업데이트는 개발자에게 Fugu 생태계 내에서 추가적인 전문 라우팅 옵션을 제공하여 비용과 추론 성능에 대한 더 세밀한 제어를 가능하게 합니다.

SOURCES

7. 초저지연 및 저비용의 Octen Search 출시

Octen Search는 AI 에이전트를 위한 속도와 비용 효율성에 중점을 두고 검색 API 시장에 진입했습니다. Artificial Analysis 검색 인덱스에서 3위로 데뷔한 이 서비스는 평균 쿼리 지연 시간이 0.2초에 불과하여 Perplexity Search 변형보다 5배 빠르며, 복잡한 검색 작업을 16.9초 만에 완료합니다. 1,000건의 쿼리당 1달러라는 매우 경쟁력 있는 가격으로 제공되는 Octen Search는 개발자에게 실시간 웹 데이터로 LLM과 에이전트를 접지(grounding)하기 위한 고성능 저비용 옵션을 제공합니다.

  • • Octen Search는 Artificial Analysis 검색 인덱스에서 77점으로 3위를 차지했습니다.
  • • 작업당 가장 빠른 시간인 16.9초를 달성하여 모델 전용 기준인 22.6초를 앞섰습니다.
  • • 쿼리당 평균 0.2초로 Perplexity Search 변형보다 5배 빠릅니다.
  • • Octen Search는 1,000건의 검색 쿼리당 1달러(검색 인덱스 작업당 0.058달러)로 책정되었습니다.
  • • 벤치마크는 고정된 기본 모델을 사용하여 Stirrup 오픈 소스 에이전트 하니스를 통해 수행되었습니다.

검색 지원 에이전트를 구축하는 개발자는 속도에 최적화된 검색 제공업체로 전환하여 지연 시간과 API 비용을 대폭 절감할 수 있습니다.

SOURCES

8. Devin Fusion 다중 모델 코딩 에이전트 벤치마크 및 출시

최근 SWE-2 모델 통합을 기반으로, Cognition은 Devin Fusion을 공식 출시했습니다. 이 다중 모델 에이전트 아키텍처는 Claude Fable 5.1 또는 GPT-6 Astra와 같은 프론티어 모델을 SWE-2 사이드킥 모델과 결합하여 성능과 실행 비용의 균형을 맞춥니다. 이 시스템은 이제 Artificial Analysis 코딩 에이전트 인덱스에 데뷔하여 개발자에게 에이전트 워크플로우의 속도와 비용 효율성에 대한 벤치마크 데이터를 제공합니다.

  • • Devin Fusion은 Artificial Analysis 코딩 에이전트 인덱스에 소개된 최초의 다중 모델 코딩 에이전트입니다.
  • • Claude Fable 5.1(xhigh)과 SWE-2(medium)를 결합한 구성은 코딩 에이전트 인덱스 v1.5에서 62점을 기록했습니다.
  • • GPT-6 Astra(xhigh)와 SWE-2(medium) 구성은 59점을 기록했으며, Claude Fable 설정보다 43% 저렴하고 31% 더 빠릅니다.
  • • Cognition은 Fusion 모델의 기술적 분석을 자세히 설명하는 출시 블로그 게시물을 게시했습니다.

개발자는 이제 Artificial Analysis 코딩 에이전트 인덱스의 표준화된 벤치마크를 사용하여 Devin Fusion의 다중 모델 구성에 대한 성능 및 비용 절충안을 평가할 수 있습니다.

SOURCES

9. Anthropic, Claude Code용 플러그인 평가 기능 도입

Anthropic은 버전 2.1.269부터 Claude Code에 네이티브 플러그인 평가 워크플로우를 추가했습니다. 이 새로운 기능을 통해 개발자는 플러그인이 비활성화된 기준선과 비교하여 사용자 지정 플러그인의 성능을 측정하고 명확한 델타 점수를 생성할 수 있습니다. 이 프레임워크는 6가지 평가자 유형을 지원하며, 그중 4개는 무료로 실행할 수 있고 2개는 유료 LLM 호출을 사용하여 심사위원 역할을 합니다. 새로운 'claude-code eval' 명령을 통해 개발자는 자동으로 테스트 스위트를 생성하고 이를 CI 파이프라인에 직접 통합하여 에이전트 기술의 회귀를 방지할 수 있습니다.

  • • Anthropic은 Claude Code(v2.1.269 이상)를 위한 새로운 플러그인 평가 워크플로우를 도입했습니다.
  • • 이 워크플로우는 플러그인 성능을 플러그인 없는 기준선과 비교하여 델타 점수를 계산합니다.
  • • 이 시스템은 4개의 무료 평가자와 2개의 유료 LLM 심사위원 평가자를 포함한 6가지 평가자 유형을 지원합니다.
  • • 'claude-code eval' 명령은 플러그인에 대한 초기 테스트 스위트와 평가자를 자동으로 생성할 수 있습니다.
  • • 평가는 CI 파이프라인에 직접 통합되어 새로운 기술에 대한 품질 게이트 역할을 할 수 있습니다.

Claude Code용 사용자 지정 플러그인이나 기술을 구축하는 개발자는 이제 자동화된 다중 평가자를 사용하여 코드를 체계적으로 테스트, 벤치마킹 및 게이트할 수 있습니다.

SOURCES

10. Litelm: LiteLLM의 경량 저의존성 대안

애플리케이션 의존성을 줄이려는 개발자는 이제 인기 있는 LiteLLM 라이브러리의 경량 대안인 litelm을 사용할 수 있습니다. 단 2,900줄의 코드와 두 가지 의존성('openai' 및 'httpx')으로 작성된 litelm은 프록시 서버나 캐싱과 같은 무거운 기능을 제외하고 핵심 라우팅, 메시지 번역, 스트리밍, 도구 사용 및 임베딩에 엄격하게 집중합니다. API는 LiteLLM을 직접 미러링하도록 설계되어 드롭인 교체가 가능하며, DSPy와의 검증된 통합과 함께 전체 비동기 지원을 포함합니다.

  • • litelm은 약 2,900줄의 코드와 단 두 가지 의존성(openai 및 httpx)으로 구성된 최소 LLM 라우팅 라이브러리입니다.
  • • API는 LiteLLM을 미러링하므로 개발자는 import 문만 업데이트하여 전환할 수 있습니다.
  • • 표준 제공업체/모델 이름 구문을 사용하여 19개 제공업체로의 라우팅을 지원하며 acompletion과 같은 비동기 변형을 포함합니다.
  • • 이 라이브러리는 제공업체 오류를 사용자 지정 예외 계층 구조(예: ContextWindowExceededError)로 매핑합니다.
  • • 현재 알파 버전인 이 라이브러리는 7개 실행 경로에 걸쳐 DSPy 통합을 검증했습니다.

개발자는 비대해진 라우팅 라이브러리를 API 호환성과 네이티브 비동기 지원을 유지하는 고도로 최적화된 최소 의존성 래퍼로 교체할 수 있습니다.

SOURCES

11. CodeFinetuner, 로컬 자동 완성 모델 미세 조정 간소화

CodeFinetuner는 개발자가 자신의 개인 코드베이스에서 작은 로컬 코드 자동 완성 모델(예: Qwen2.5-Coder-3B)을 미세 조정할 수 있도록 돕기 위해 설계된 엔드투엔드 파이프라인으로 출시되었습니다. 'uv tool install codefinetuner'를 통해 설치할 수 있는 이 도구는 Mac(MPS) 및 NVIDIA(CUDA) 하드웨어 모두에서 학습을 지원하며, Unsloth를 활용하여 VRAM 사용량을 최소화합니다. 이 파이프라인은 tree-sitter 파싱부터 LoRA 미세 조정, 평가 및 GGUF 변환에 이르는 전체 프로세스를 자동화하여 llama.vim이나 llama.vscode와 같은 로컬 편집기 확장에 직접 넣을 수 있는 모델을 생성합니다.

  • • CodeFinetuner는 특정 코드베이스에서 작은 코드 자동 완성 모델을 LoRA 미세 조정하기 위한 엔드투엔드 파이프라인입니다.
  • • 이 도구는 선택적 Unsloth 통합과 함께 Mac(MPS) 및 NVIDIA(CUDA) 하드웨어 모두에서 학습을 지원합니다.
  • • 워크플로우는 tree-sitter 파싱, LoRA 미세 조정, 평가(CodeBLEU/perplexity) 및 GGUF 변환을 처리합니다.
  • • 결과물인 GGUF 모델은 llama.vim 및 llama.vscode와 같은 로컬 편집기 도구와 호환됩니다.
  • • 이 도구는 'uv tool install codefinetuner'를 통해 즉시 설치할 수 있습니다.

개발자는 로컬 자동 완성 모델을 개인 코드베이스에 쉽게 맞춤화하고 Mac 또는 NVIDIA 하드웨어에서 효율적으로 실행할 수 있습니다.

SOURCES

12. Google, Agent Plugins 1.0.0 표준 기반 클라우드 개발자 플러그인 출시

8월에 Agent Plugins 1.0.0 오픈 표준이 출시된 이후, Google은 Google Cloud Developer Plugin을 출시했습니다. 이 새로운 도구 세트는 AI 코딩 에이전트가 Google Cloud 인프라와 상호 작용하고 구성하며 관리할 수 있는 전문 기술을 갖추도록 하는 설치 가능한 번들을 제공하며, 최근 확립된 플러그인 사양의 실용적인 적용을 보여줍니다.

  • • Google은 Agent Plugins 1.0.0 표준을 구현하는 Google Cloud Developer Plugin을 출시했습니다.
  • • 이 플러그인은 Google Cloud 리소스를 관리하기 위한 설치 가능한 도구 번들을 제공합니다.
  • • AI 에이전트가 Google Cloud 환경 내에서 배포, 관리 및 문제 해결 작업을 수행할 수 있도록 합니다.

이번 출시는 Agent Plugins 1.0.0 표준의 채택을 입증하며, 개발자가 표준화되고 이식 가능한 클라우드 관리 기능을 AI 에이전트 워크플로우에 직접 통합할 수 있게 합니다.

SOURCES

13. Google Research, 도구 사용 데이터 생성을 위한 ToolGrad 프레임워크 출시

Google, 도쿄 대학, RIKEN 및 도호쿠 대학의 연구원들은 도구 사용 및 함수 호출 모델을 위한 고품질 학습 데이터를 생성하도록 설계된 오픈 소스 프레임워크인 ToolGrad를 출시했습니다. 전통적인 파이프라인을 반전시켜 검증된 도구 사용 체인을 먼저 구축한 다음 해당 사용자 쿼리를 생성함으로써, ToolGrad는 ToolBench에서 99.8%의 데이터 생성 통과율을 달성합니다. 이 방법을 사용하여 연구원들은 Berkeley Function Calling 리더보드에서 83.1점을 기록한 Gemma-3 12B 모델을 미세 조정했으며, 이는 실제로 교사 모델인 Gemini 2.5 Flash-Lite를 능가했습니다. 이 프레임워크는 Apache-2.0 라이선스 하에 PyPI 패키지로 제공됩니다.

  • • ToolGrad는 검증된 도구 사용 체인을 먼저 구성한 다음 일치하는 사용자 쿼리를 생성하여 표준 데이터 생성을 반전시킵니다.
  • • 이 프레임워크는 깊이 우선 탐색과 비교하여 ToolBench에서의 데이터 생성 통과율을 63.8%에서 99.8%로 향상시켰습니다.
  • • 연구원들은 Gemini 2.5 Flash-Lite를 사용하여 Gemma-3 모델(1B, 4B, 12B)을 미세 조정하는 데 ToolGrad를 사용했습니다.
  • • 결과물인 ToolGrad-12B 모델은 Berkeley Function Calling 리더보드에서 83.1점을 기록하여 교사 모델을 능가했습니다.
  • • ToolGrad 코드는 Apache-2.0 라이선스로 출시되었으며 모델, 데이터셋 및 PyPI 패키지를 이용할 수 있습니다.

개발자는 고품질 함수 호출 데이터셋을 생성하고 도구 사용에서 프론티어 API를 능가하는 작고 효율적인 로컬 모델을 미세 조정할 수 있습니다.

SOURCES

14. Llama-Manager, 동적 생성 중 모델 재구성 지원

llama-manager라는 새로운 도구는 개발자에게 활성 토큰 생성을 중단하지 않고 llama.cpp에서 실행 중인 로컬 모델을 동적으로 재구성하는 방법을 제공합니다. 재구성 중에 KV 캐시를 보존함으로써, llama-manager는 추측적 디코딩을 전환하거나 구성 요소를 CPU로 이동하거나 KV 캐시 양자화를 조정할 때 프롬프트를 다시 처리할 필요를 없앱니다. 단일 32GB GPU에서의 베타 테스트에서, 이 도구는 동적 메모리 전략을 사용하여 Qwen3.8-27B 모델의 컨텍스트 윈도우를 167,680 토큰에서 262,144 토큰으로 성공적으로 확장했습니다.

  • • llama-manager는 로드 후 동적 모델 구성을 가능하게 하는 llama.cpp 포크용 래퍼입니다.
  • • 이 도구는 토큰 생성 중 모델의 핫 리로딩을 지원하며, 프롬프트 재처리를 피하기 위해 KV 캐시를 보존합니다.
  • • 사용자가 추측적 디코딩을 동적으로 전환하고, 구성 요소를 CPU로 이동하며, KV 캐시 양자화를 업데이트할 수 있습니다.
  • • 32GB GPU에서 Qwen3.8-27B-UD-Q4_K_XL을 실행할 때 컨텍스트 윈도우를 167,680에서 262,144 토큰으로 확장했습니다.
  • • 이 프로젝트는 현재 베타 버전이며 단일 GPU 추론으로 제한됩니다.

로컬 모델을 실행하는 개발자는 양자화, 추측적 디코딩 및 오프로딩 전략을 즉석에서 동적으로 조정하여 제한된 GPU 메모리에서 컨텍스트 길이를 최대화할 수 있습니다.

SOURCES

15. Qwen 3 4B 모델, 100개 논리 퍼즐 미세 조정으로 수학 벤치마크 31% 향상

표적 미세 조정의 놀라운 시연은 Qwen 3 4B 기본 모델을 단 100개의 얼룩말 퍼즐 데이터셋으로 학습시키면 MATH-500 벤치마크에서 31%의 성능 향상을 얻을 수 있음을 보여줍니다. 전체 학습 실행은 단일 H100 또는 H200 GPU에서 6.5분 만에 완료되었습니다. 공유된 재현 노트북과 함께 제공되는 이 레시피는 개발자가 방대한 컴퓨팅 예산 대신 고도로 큐레이팅된 도메인별 데이터셋을 사용하여 작고 로컬인 모델에서 어떻게 엄청난 추론 이득을 얻을 수 있는지 강조합니다.

  • • Qwen 3 4B 기본 모델을 100개의 얼룩말 퍼즐로 미세 조정한 결과 MATH-500 벤치마크에서 31%의 향상을 보였습니다.
  • • 학습 프로세스는 단일 H100 또는 H200 GPU에서 단 6.5분 만에 완료되었습니다.
  • • 미세 조정 프로세스를 위한 완전한 재현 노트북이 공개되었습니다.

개발자는 고도로 표적화된 초소형 데이터셋을 적용하여 최소한의 컴퓨팅 비용으로 작고 로컬인 모델의 추론 능력을 극적으로 향상시킬 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.