Inference Brew

DeepSeek-V4-Flash 추론 노력 모드의 장황함 및 API 불일치 문제

00:00 / --:--

← 메인으로

DeepSeek-V4-Flash 추론 노력 모드의 장황함 및 API 불일치 문제

1. DeepSeek-V4-Flash 추론 노력 모드의 장황함 및 API 불일치 문제

DeepSeek-V4-Flash-0731의 추론 노력 모드 분석 결과, 로컬 배포와 공식 API 간의 중요한 동작 차이가 확인되었습니다. 이 모델은 4가지 추론 수준을 지원하지만, 'Low' 모드는 예상보다 장황하며 'Max' 모드에서의 로컬 토큰 소비량은 공식 API 대비 두 배에 달할 수 있습니다. 또한, 현재 OpenRouter에 이러한 추론 노력 설정을 방해하는 버그가 있으며, 기존 공개 벤치마크는 'Max' 설정만 반영하고 있다는 점에 개발자들의 주의가 필요합니다.

  • DeepSeek-V4-Flash-0731은 추론 없음, 낮음(Low), 높음(High), 최대(Max)의 4가지 추론 노력 모드를 지원합니다.
  • 테스트 결과 'Low' 추론 노력 모드가 예상보다 장황한 것으로 확인되었습니다.
  • 20개 요청에 대한 평균 토큰 사용량을 측정한 결과, 로컬 'Max' 모드는 1,301.4 토큰을 사용한 반면 공식 API는 698.7 토큰을 사용했습니다.
  • 현재 OpenRouter에는 이 모델의 추론 노력 모드를 정상적으로 작동하지 않게 하는 버그가 있습니다.
  • DeepSeek 및 Artificial Analysis의 공식 벤치마크는 현재 'Max' 추론 노력 모드만 다루고 있습니다.

DeepSeek-V4-Flash를 사용하는 개발자는 추론 노력 파라미터를 신중하게 관리해야 하며, 라우팅 버그가 해결될 때까지는 해당 모델에 OpenRouter 사용을 피해야 합니다.

SOURCES

2. AMD MI355X 최적화를 통한 비용 효율적인 Kimi K3 서빙

Kimi K3 모델의 최근 출시와 초기 비용 편익 분석을 바탕으로, 새로운 소프트웨어 최적화를 통해 AMD MI355X 하드웨어에서 효율적인 배포가 가능해졌습니다. sglang의 병목 현상을 해결하고 AITER MLA 프리필(prefill) 커널을 구현함으로써, 엔지니어들은 초당 13k 토큰의 콜드 프리필 속도를 달성했습니다. GPU 시간당 2.50달러의 비용으로, 이 구성은 이전에 모델 호스팅을 위해 확인되었던 NVIDIA B200 및 B300 설정보다 더 비용 효율적인 대안을 제공합니다.

  • sglang 및 AITER MLA 프리필 커널의 최적화를 통해 AMD MI355X에서 Kimi K3 배포가 가능해졌습니다.
  • MI355X 구성은 콜드 프리필 속도에서 초당 13k 토큰을 달성합니다.
  • GPU 시간당 2.50달러인 MI355X는 NVIDIA B200(4.25달러) 및 B300(6.00달러) 옵션보다 훨씬 저렴합니다.
  • 이는 기존에 분석되었던 NVIDIA 중심의 배포 전략에 대한 새롭고 경제적인 대안을 제공합니다.

이번 개발은 인프라 엔지니어들에게 Kimi K3와 같은 프론티어급 MoE 모델을 서빙하기 위한 더 저렴한 하드웨어 경로를 제공합니다.

SOURCES

3. Andrej Karpathy, 복잡한 3D 렌더링 작업에서 Opus 5 테스트

Andrej Karpathy는 Opus 5에 대한 엄격한 테스트 결과를 공유했습니다. 그는 모델에게 '반지의 제왕' 첫 문단을 복잡한 three.js 렌더링으로 생성하도록 요청했습니다. 100만 토큰 예산 내에서 모델은 2시간 동안 10달러를 사용하여 5,500줄의 코드를 생성했습니다. 이 실험은 프론티어 모델이 고도로 맞춤화되고 노동 집약적인 작업을 수행할 수 있는 지구력을 갖추고 있음을 입증했지만, 동시에 중요한 병목 현상도 노출했습니다. 즉, 네이티브 실시간 시각적 인지 능력이 부족하여 모델이 느리고 오류가 발생하기 쉬운 스크린샷 기반 감사 루프에 의존해야 한다는 점입니다.

  • Andrej Karpathy는 100만 토큰 예산을 사용하여 '반지의 제왕' 첫 문단을 three.js로 렌더링하도록 요청하여 Opus 5를 테스트했습니다.
  • 생성 과정은 약 2시간이 소요되었고, 약 10달러의 비용이 들었으며, 5,500줄의 코드가 생성되었습니다.
  • 이 테스트는 LLM이 인간이 수동으로 실행하기에는 비실용적인 고도로 맞춤화된 작업을 수행할 수 있는 지구력을 가지고 있음을 보여주었습니다.
  • 확인된 주요 한계는 네이티브 실시간 인지 능력 부족으로 인해 비디오나 게임 환경에서 자신의 작업을 효율적으로 감사할 수 없다는 점입니다.
  • Opus 5는 렌더링 작업에서 어려움을 겪었으며, 느리고 수동적인 스크린샷 기반 감사에 의존하여 오류가 발생했습니다.

복잡하고 장기적인 에이전트를 구축하는 개발자는 자체 감사 루프를 설계할 때 네이티브 실시간 시각적 인지 능력의 부재를 고려해야 합니다.

SOURCES

4. AI 에이전트를 위한 67개의 내장 MCP 도구를 갖춘 Mu 출시

Mu라는 새로운 오픈 소스 프로젝트는 단일 Model Context Protocol(MCP) 엔드포인트를 통해 67개의 내장 인터넷 도구를 제공함으로써 에이전트 도구 통합을 간소화합니다. 일반적인 도구 래퍼와 달리 Mu는 메일 서버, 검색 인덱스, 애플리케이션 샌드박스를 포함한 자체 인프라를 운영합니다. AGPL-3.0 라이선스 하에 단일 Go 바이너리로 배포되는 Mu는 Cursor 및 Claude Desktop과 직접 통합되며, Claude와 DeepSeek부터 로컬 Ollama 인스턴스에 이르는 다양한 백엔드를 지원합니다.

  • Mu는 단일 Model Context Protocol(MCP) 엔드포인트를 통해 에이전트에 67개의 인터넷 기반 도구를 제공합니다.
  • 이 플랫폼은 타사 API를 래핑하는 대신 메일 서버, 검색 인덱스, 앱 샌드박스를 포함한 자체 인프라를 실행합니다.
  • Mu는 AGPL-3.0 라이선스 하의 오픈 소스이며 단일 Go 바이너리로 자체 호스팅할 수 있습니다.
  • MCP 인증 사양을 사용하여 Claude Desktop 및 Cursor와의 통합을 지원합니다.
  • Claude, Atlas Cloud(DeepSeek), 로컬 Ollama 또는 OpenAI 호환 엔드포인트를 포함한 여러 LLM 백엔드를 지원합니다.

개발자는 타사 API 래퍼에 의존하지 않고도 Cursor나 Claude Desktop의 에이전트에 수십 개의 안전한 자체 호스팅 도구를 즉시 장착할 수 있습니다.

SOURCES

5. 공식 llama.app 및 'llama serve' 명령으로 macOS 모델 관리 간소화

llama.cpp 프로젝트는 기존 모델 수명 주기 관리 API를 기반으로 하는 두 가지 주요 사용성 업데이트를 도입했습니다. 팀은 macOS용 공식 DMG 기반 설치 프로그램인 llama.app과 새로운 'llama serve' 명령을 출시했습니다. 이 명령은 기존의 'llama-server'를 대체하며, 프로젝트의 기존 핫스왑 및 수명 주기 관리 기능을 활용하여 수동 시작 인수 없이도 요청 시 모델을 자동으로 로드합니다.

  • 새로운 llama.app은 macOS용 DMG 기반 설치 프로그램을 제공하여 패키지 관리자가 필요 없습니다.
  • 'llama serve' 명령은 'llama-server'를 대체하며 들어오는 요청에 따라 모델 로딩을 자동화합니다.
  • 이러한 기능은 이전에 출시된 모델 핫스왑 및 수명 주기 관리 API를 기반으로 합니다.
  • 이 앱에는 API 상태 및 모델 권장 사항을 모니터링하기 위한 메뉴 막대 유틸리티가 포함되어 있습니다.

이러한 도구는 이전에 도입된 백엔드 모델 관리 기능을 위한 사용자 친화적인 인터페이스와 자동화된 워크플로우를 제공하여 macOS에서 로컬 LLM 배포를 더 쉽게 만듭니다.

SOURCES

6. llama.cpp 및 TensorSharp, DeepSeek V4 Flash를 위한 다중 토큰 예측 추가

DSpark 추측 디코딩의 초기 통합 이후, 로컬 추론 런타임은 DeepSeek V4 Flash를 위한 최적화 제품군을 확장했습니다. llama.cpp와 TensorSharp 모두 다중 토큰 예측(MTP)에 대한 지원을 도입했으며, 이는 DSpark와 함께 최대 2배의 속도 향상을 가능하게 합니다. Nvidia A40 GPU에서의 TensorSharp 벤치마크는 이러한 이득을 확인시켜 주며, 긴 문맥 문서에서 2.03배, 짧은 생성에서 1.74배의 속도 향상을 보여줍니다.

  • llama.cpp와 TensorSharp는 DeepSeek V4 Flash에 대한 다중 토큰 예측(MTP) 지원을 추가했습니다.
  • 이번 업데이트는 이전에 출시된 DSpark 추측 디코딩 지원을 기반으로 합니다.
  • TensorSharp 벤치마크는 Nvidia A40 GPU에서 최대 2.03배의 속도 향상을 보여줍니다.
  • TensorSharp는 이제 해당 모델에 대해 CUDA, Metal 및 연속 배칭을 포함한 전체 기능 제품군을 지원합니다.

개발자는 이제 기존 추측 디코딩 외에도 MTP를 활용하여 로컬 하드웨어에서 DeepSeek V4 Flash에 대해 훨씬 더 높은 추론 처리량을 달성할 수 있습니다.

SOURCES

7. GraphRAG 벤치마킹: 성능 향상 및 비용 절충

그래프 강화 RAG를 위한 이전 아키텍처 패턴을 기반으로, Microsoft Research, Meta 및 Michigan State의 최근 평가는 이 접근 방식의 절충안을 정량화했습니다. GraphRAG는 다중 홉 리콜을 73.4%에서 87.8%로 향상시키지만, GPT-4o를 사용하여 코퍼스당 48달러로 추정되는 상당한 인덱싱 비용이 발생하며 단순 조회에는 이점이 없습니다. 개발자들은 이제 성능과 비용을 최적화하기 위해 하이브리드 라우팅을 구현할 것을 권장받고 있습니다.

  • GraphRAG는 다중 홉 QA 리콜을 73.4%에서 87.8%로 향상시킵니다.
  • 인덱싱 비용은 높으며, GPT-4o 사용 시 코퍼스당 48달러로 추정됩니다.
  • GraphRAG는 단일 홉 사실 조회에 대해 성능상의 이점을 제공하지 않습니다.
  • 성능과 비용의 균형을 맞추기 위해 하이브리드 라우팅 아키텍처가 권장됩니다.

개발자는 이제 GraphRAG를 언제 배포할지에 대해 데이터 기반 결정을 내릴 수 있으며, 복잡한 쿼리만 그래프 기반 시스템으로 라우팅하여 불필요한 비용을 피할 수 있습니다.

SOURCES

8. DeepSeek-V4-Flash 채팅 템플릿, 대화 중간 시스템 역할 지원 부족

DeepSeek-V4-Flash-0731을 통합하는 개발자들은 모델에 네이티브 jinja 템플릿이 부족하여 심각한 프롬프트 캐싱 문제가 발생할 수 있다는 경고를 받았습니다. 모델의 형식은 대화 중간의 시스템 턴을 지원하지 않기 때문에, 대화 도중에 주입된 모든 시스템 메시지는 상단으로 이동되어 llama.cpp와 같은 엔진의 프리픽스 캐시를 깨뜨립니다. 최적의 캐싱 성능을 유지하려면 개발자는 시스템 수준 지침에 'latest_reminder' 역할을 대신 사용해야 합니다.

  • DeepSeek-V4-Flash-0731은 네이티브 jinja 템플릿을 포함하지 않으며, 채팅 템플릿 형식은 대화 중간의 시스템 턴을 지원하지 않습니다.
  • 시스템 메시지는 시스템 프롬프트의 상단으로 이동되므로, 대화 중간의 주입은 프리픽스를 방해합니다.
  • 시스템 수준 지침의 역할로 'latest_reminder'를 사용하면 대부분의 템플릿 및 양자화 제공업체가 모델을 처리하는 방식과의 호환성이 보장됩니다.
  • 'latest_reminder' 역할을 적용하면 llama.cpp 사용 시 저조한 프롬프트 캐싱 성능 문제가 해결되었습니다.

개발자는 심각한 프롬프트 캐시 저하를 방지하기 위해 시스템 지침에 'latest_reminder' 역할을 사용하도록 채팅 템플릿을 조정해야 합니다.

SOURCES

9. Mference 엔진, 소비자용 Mac에서 DeepSeek-V4-Flash 284B 구동

Mference라는 새로운 오픈 소스 추론 엔진은 소비자급 하드웨어에서 대규모 Mixture-of-Experts(MoE) 모델을 실행할 수 있게 합니다. 공유 코어와 KV 캐시만 RAM에 유지하고 활성 전문가를 필요에 따라 SSD에서 직접 스트리밍함으로써, Mference는 24GB M5 Pro Mac에서 단 6.8GB의 최대 메모리 점유율로 DeepSeek-V4-Flash 284B를 실행할 수 있습니다. 이 엔진은 또한 OpenAI 호환 서버를 제공하여 기존 개발자 워크플로우에 쉽게 도입할 수 있습니다.

  • Mference는 공유 코어와 KV 캐시를 메모리에 유지하면서 선택된 전문가를 SSD에서 스트리밍하는 오픈 소스 엔진입니다.
  • 이 엔진은 2비트 동적 양자화를 사용하여 DeepSeek-V4-Flash 284B-A13B를 실행하며, 디스크에서 91GB를 필요로 하고 24GB M5 Pro에서 초당 최대 4.8 토큰을 달성합니다.
  • M5 Pro에서 284B 모델의 최대 메모리 사용량은 6.8GB로 제한되었습니다.
  • Mference는 또한 Gemma 4 26B-A4B(2GB 메모리에서 31–35 tok/s) 및 Qwen 3.6 35B-A3B(1.45GB 메모리에서 19–23 tok/s)를 지원합니다.
  • 이 엔진에는 다중 턴 채팅, OpenAI 호환 서버 및 로컬 문서 첨부 기능을 갖춘 네이티브 Mac 앱이 포함되어 있습니다.

개발자는 대규모 통합 메모리 풀 없이도 표준 Mac에서 DeepSeek-V4-Flash 284B와 같은 대규모 MoE 모델을 로컬에서 실행할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.