Inference Brew

DeepSeek-V4-Flash API 퍼블릭 베타 출시

00:00 / --:--

← 메인으로

DeepSeek-V4-Flash API 퍼블릭 베타 출시

1. DeepSeek-V4-Flash API 퍼블릭 베타 출시

DeepSeek가 DeepSeek-V4-Flash 모델을 퍼블릭 베타로 출시하며 관리형 API 제품군을 확장했습니다. 이는 지난 5월 모델의 오픈 웨이트 공개와 7월 V4 시리즈의 본격적인 프로덕션 출시를 잇는 행보입니다. 새로운 API 엔드포인트는 개발자들에게 고성능 및 저지연 옵션을 제공하며, 가격은 입력 토큰 100만 개당 0.09달러, 출력 토큰 100만 개당 0.18달러로 책정되었습니다. 이는 기존의 오픈 웨이트 배포 옵션 및 플래그십 V4 Pro API를 보완합니다.

  • DeepSeek-V4-Flash API가 퍼블릭 베타로 제공됩니다.
  • 가격은 입력 토큰 100만 개당 0.09달러, 출력 토큰 100만 개당 0.18달러입니다.
  • 해당 모델은 ArtificialAnalysis 인덱스에서 50점을 기록했습니다.
  • 벤치마크 결과는 Terminal Bench 2.1(82.7), DSBench-FullStack(68.7), DeepSWE(54.4)를 포함합니다.
  • DeepSeek-V4-Pro의 공식 출시가 뒤따를 예정입니다.

개발자들은 이제 관리형 API를 통해 효율적인 V4-Flash 아키텍처에 액세스할 수 있게 되었으며, 이는 오픈 웨이트 버전을 직접 호스팅하는 것보다 비용 효율적인 대안을 제공합니다.

2. Google, 실시간 음성 및 비전을 위한 Gemini Live API 일반 공개

Google이 Gemini Live API를 정식 출시하며 초기 번역 프리뷰를 넘어선 기능을 제공합니다. 이제 개발자들은 저지연 실시간 음성 및 비전 상호작용을 애플리케이션에 통합하여, 오디오, 이미지, 텍스트의 연속적인 스트림을 처리하는 반응형 대화형 에이전트를 구축할 수 있습니다. 이번 릴리스는 복잡한 스트리밍 파이프라인을 수동으로 관리할 필요 없이 고도로 상호작용적인 멀티모달 대화 경험을 개발할 수 있도록 간소화합니다.

  • Gemini Live API가 실시간 음성 및 비전 통합을 위해 정식 출시되었습니다.
  • 음성-음성 번역에 중점을 둔 초기 프리뷰 기능을 확장했습니다.
  • 오디오, 이미지, 텍스트의 연속적이고 동시적인 스트림을 지원합니다.
  • 상호작용적인 멀티모달 대화형 에이전트 개발을 간소화합니다.

프리뷰에서 정식 출시로 전환됨에 따라 개발자들은 복잡한 스트리밍 파이프라인 관리 없이도 프로덕션 수준의 고도로 상호작용적인 멀티모달 대화형 경험을 구축할 수 있게 되었습니다.

SOURCES

3. MiniMax, 멀티모달 비디오 및 오디오 생성 모델 H3 출시

MiniMax가 텍스트, 이미지, 비디오, 오디오 전반의 통합 컨텍스트를 처리하도록 설계된 오픈 멀티모달 모델 H3를 출시했습니다. 이 모델은 네이티브 스테레오 사운드와 함께 최대 15초 분량의 2K 해상도 비디오를 생성할 수 있습니다. 또한 MiniMax H3는 강력한 지시 이행 능력, 정확한 텍스트 및 브랜드 렌더링, 비디오-투-비디오(V2V) 모션 전송 기능을 갖추고 있어 상업용 콘텐츠 제작 및 편집 도구를 구축하는 개발자들에게 즉시 활용 가능합니다.

  • MiniMax H3는 텍스트, 이미지, 비디오, 오디오 전반의 통합 컨텍스트를 처리하도록 설계된 오픈 모델입니다.
  • 네이티브 스테레오 사운드와 함께 최대 15초 분량의 2K 해상도 비디오를 생성할 수 있습니다.
  • 지시 이행, 정확한 텍스트 및 브랜드 렌더링, 비디오-투-비디오(V2V) 모션 전송을 지원합니다.
  • 초기 테스트 결과 상업용 콘텐츠 제작 사례에 즉시 활용 가능한 것으로 나타났습니다.

개발자들은 고해상도 비디오 생성 및 모션 전송을 포함한 풍부한 멀티모달 콘텐츠 제작 기능을 앱에 직접 구축할 수 있습니다.

SOURCES

4. Meituan, LongCat-Flash-Lite-Sparse MoE 모델 출시

Meituan이 30억 개의 활성 파라미터를 특징으로 하는 오픈 Mixture-of-Experts(MoE) 모델인 LongCat-Flash-Lite-Sparse를 선보였습니다. 이 모델의 가장 큰 특징은 300억 개의 n-gram 룩업 테이블을 시스템 RAM으로 오프로딩하여 단일 24GB GPU에서 256k 컨텍스트 윈도우를 처리할 수 있다는 점입니다. 아키텍처는 Gemma 4의 PLE 기술과 비교되지만, 초기 개발자 피드백에 따르면 일반적인 사용 사례에서 Qwen 3.6 27b와 같은 기존 옵션을 능가하지는 못할 것으로 보입니다.

  • LongCat-Flash-Lite-Sparse는 약 30억 개의 활성 파라미터를 가진 Mixture-of-Experts(MoE) 모델입니다.
  • RAM으로 오프로딩된 300억 개의 n-gram 룩업 테이블을 활용하여 단일 24GB GPU에서 256k 컨텍스트 윈도우를 구현합니다.
  • 아키텍처는 Google의 Gemma 4에 사용된 PLE 트릭과 비교됩니다.
  • 초기 개발자 분석에 따르면 표준 작업에서 Qwen 3.6 27b 모델을 대체할 것으로 기대되지는 않습니다.

이 모델은 소비자용 하드웨어에서 방대한 컨텍스트 윈도우를 처리하는 새로운 방법을 제시하지만, 초기 테스트 결과 Qwen과 같은 기존 모델을 대체하기에는 아직 부족할 수 있음을 시사합니다.

SOURCES

5. AI 에이전트 원격 탈취를 허용하는 AgentForger 취약점 발견

Zenity Labs가 시장의 거의 모든 에이전트 브라우저에 영향을 미치는 치명적인 보안 취약점인 'AgentForger'를 공개했습니다. 이 취약점은 공격자가 사용자나 에이전트를 속여 조작된 링크를 클릭하게 함으로써 조직의 환경 내에 공격자가 제어하는 자율 에이전트를 심을 수 있게 합니다. OpenAI는 이미 이 문제를 해결하기 위한 패치를 발표했습니다. 개발자들은 자체 배포 환경을 보호하기 위해 '최소 에이전시(least agency)' 원칙을 채택하고 브라우저 사용이 가능한 모든 에이전트에 대해 엄격한 런타임 경계를 설정할 것을 권장합니다.

  • AgentForger 취약점은 조작된 링크를 통해 조직 내에 공격자가 제어하는 자율 에이전트를 심을 수 있게 했습니다.
  • 이 취약점은 시장 전반의 에이전트 브라우저에 영향을 미쳤습니다.
  • OpenAI는 AgentForger 취약점을 해결하기 위한 패치를 발표했습니다.
  • Zenity의 CISO 가이드는 이러한 위협을 완화하기 위해 '최소 에이전시'와 엄격한 런타임 경계 구현을 권장합니다.

에이전트 애플리케이션을 구축하는 개발자들은 악성 링크가 에이전트를 탈취하는 것을 방지하기 위해 엄격한 런타임 경계와 '최소 에이전시' 원칙을 구현해야 합니다.

SOURCES

6. DataFlow-Harness 프레임워크, AI 에이전트의 NL2Pipeline 격차 해소

북경대학교, 중관촌 아카데미, 상하이 고급 알고리즘 연구소의 연구진이 'NL2Pipeline 격차'를 해결하기 위해 설계된 프레임워크인 DataFlow-Harness를 오픈 소스로 공개했습니다. 이 격차는 AI 에이전트가 엄격한 스키마를 가진 실제 프로덕션 플랫폼에서 생성된 코드를 기반으로 작업하는 데 어려움을 겪을 때 발생합니다. DataFlow-Harness는 에이전트가 자유 형식의 코드를 작성하게 하는 대신, 파이프라인을 방향성 비순환 그래프(DAG)로 표현하고 타입 지정 변형을 사용하여 에이전트가 연산자를 추가하거나 연결할 수 있도록 합니다. 벤치마크에서 이 접근 방식은 표준 Claude Code 대비 93.3%의 통과율을 달성하면서 API 비용을 72.5%, 지연 시간을 49.9% 절감했습니다.

  • 북경대학교 등의 연구진이 구조화된 시각적 데이터 처리 워크플로우 구축을 위한 오픈 소스 프레임워크 DataFlow-Harness를 도입했습니다.
  • 프레임워크는 파이프라인을 DAG로 표현하고 타입 지정 변형을 사용하여 에이전트가 자유 형식 코드 대신 연산자를 추가하거나 연결하도록 합니다.
  • 12개 작업 데이터 엔지니어링 벤치마크에서 DataFlow-Harness는 93.3%의 엔드투엔드 통과율을 달성했습니다.
  • 표준 Claude Code 대비 API 비용을 72.5%, 응답 지연 시간을 49.9% 절감했습니다.
  • 프레임워크는 Apache 2.0 라이선스로 출시되었으며 GitHub에서 이용 가능합니다.
  • 데이터 파이프라인 백엔드, DataFlow-WebUI, MCP 도구 계층, DataFlow-Skills라는 AI 가이드 계층의 4가지 구성 요소로 이루어져 있습니다.

개발자들은 이 프레임워크를 사용하여 AI 에이전트가 위험한 자유 형식 코드를 작성하지 않고도 구조화된 데이터 파이프라인을 안정적으로 구축하고 수정하도록 할 수 있습니다.

SOURCES

7. Cursor, 코딩 에이전트를 위한 클라우드 환경 최적화

Cursor가 AI 에이전트가 코드를 이해하고 실행하며 테스트하는 데 최적화된 개발 환경을 대폭 개선했습니다. 환경 컨텍스트를 에이전트 친화적으로 구조화함으로써, Cursor는 클라우드 에이전트가 기여한 병합된 풀 리퀘스트의 비율이 약 10%에서 50% 이상으로 급증했다고 보고했습니다. 이번 업데이트는 모델뿐만 아니라 런타임 환경을 조정하는 것이 에이전트 생산성을 극적으로 높일 수 있음을 보여줍니다.

  • Cursor는 에이전트가 코드를 더 쉽게 이해하고 실행하며 테스트할 수 있도록 개발 환경을 개선했습니다.
  • 이러한 환경 최적화를 통해 클라우드 에이전트의 병합된 풀 리퀘스트 기여도가 약 10%에서 50% 이상으로 증가했습니다.

Cursor를 사용하는 개발자들은 최적화된 환경 컨텍스트 덕분에 통합된 에이전트로부터 훨씬 더 자율적이고 성공적인 코드 기여를 기대할 수 있습니다.

SOURCES

8. 코드 리뷰 에이전트 구축 및 자체 호스팅을 위한 Tilde SDK 출시

개발자 Tilde가 맞춤형 AI 에이전트 구축 및 자체 호스팅을 간소화하기 위해 설계된 하네스 SDK 플랫폼을 출시했습니다. 지난 1년간 사이드 프로젝트로 개발된 Tilde는 OpenClaw와 Hermes의 기능을 모듈식 클라우드 API 빌딩 블록으로 분해합니다. 개발자들이 시작할 수 있도록 제작자는 전용 코드 리뷰 에이전트를 구축하고 자체 호스팅하는 방법을 보여주는 구체적인 예제가 포함된 GitHub 저장소를 공개했습니다.

  • Tilde는 지난 1년간 사이드 프로젝트로 개발된 하네스 SDK 플랫폼입니다.
  • 이 플랫폼은 OpenClaw와 Hermes의 기능을 클라우드 API 빌딩 블록으로 분해합니다.
  • Tilde를 통해 사용자는 특정 사용 사례에 맞는 AI 에이전트를 생성하고 자체 호스팅할 수 있습니다.
  • 개발자는 API 기능을 보여주는 예제가 포함된 GitHub 저장소를 제공했습니다.

개발자들은 Tilde의 SDK와 예제 저장소를 사용하여 자신만의 코드 리뷰 에이전트를 빠르게 구축, 커스터마이징 및 자체 호스팅할 수 있습니다.

SOURCES

9. AI 에이전트 평가를 위한 에이전트 행동 오픈 표준 출시

자율 AI 에이전트 평가의 어려움을 해결하기 위해 '에이전트 행동(Agent Behavior)'이라는 새로운 오픈 표준이 출시되었습니다. 이 표준은 간단한 Markdown 파일을 사용하여 에이전트가 신뢰할 수 있다고 간주되기 위해 필요한 반복적인 행동과 경계를 지정합니다. 검토자, 루브릭, 점수 산정자를 위한 구체적인 프레임워크를 제공함으로써, 에이전트 행동 표준은 개발자들이 실행 추적을 체계적으로 검토하고, 강력한 평가 사례를 작성하며, 에이전트의 행동을 팀의 기대치에 맞게 조정하기 위해 프롬프트나 도구를 개선하도록 돕습니다.

  • 에이전트 행동은 전체 궤적에 걸쳐 AI 에이전트의 행동을 정의하고 평가하는 오픈 표준입니다.
  • 각 행동 사양은 에이전트 신뢰성에 필요한 반복적인 행동을 개략적으로 설명하는 Markdown 파일로 작성됩니다.
  • 이 표준은 검토자, 루브릭, 점수 산정자 및 평가를 위한 구체적인 프레임워크를 제공합니다.
  • 추적 검토, 평가 사례 작성, 프롬프트나 도구 수정, 팀에 의도된 에이전트 행동 소통을 지원합니다.

개발자들은 평가 사례를 작성하고, 에이전트 추적을 검토하며, 신뢰할 수 있는 에이전트 행동을 보장하기 위한 구조화된 표준 프레임워크를 얻게 됩니다.

SOURCES

10. MarbleOS, AI 에이전트 상호작용을 시각적 작업 공간으로 재해석

제작자 Akilan과 Miguel이 AI 상호작용의 지배적인 채팅 기반 패러다임에 도전하는 다운로드 가능한 베타 인터페이스인 MarbleOS를 출시했습니다. Xerox PARC 및 NeXTSTEP과 같은 고전적인 GUI 이정표에서 영감을 받은 MarbleOS는 AI를 시각적 작업 공간으로 취급합니다. 이 플랫폼은 작업을 카드로 표현하여 여러 에이전트 작업을 동시에 실행하면서도 파일, 도구, 아티팩트를 완전히 볼 수 있게 합니다. 또한 실행 전에 에이전트가 사용할 도구를 표시하며, 단순한 텍스트 기록 대신 스프레드시트와 같이 직접 사용 가능한 파일을 출력합니다.

  • MarbleOS는 Xerox PARC, 1984년 매킨토시, NeXTSTEP에서 영감을 받아 AI를 채팅 앱이 아닌 작업 공간으로 취급하도록 설계된 인터페이스입니다.
  • 플랫폼은 작업을 카드로 표현하여 여러 작업을 동시에 실행하면서 파일, 도구, 아티팩트를 볼 수 있게 합니다.
  • MarbleOS는 작업 실행 전 에이전트가 사용할 것으로 예상되는 도구를 표시합니다.
  • 시스템은 채팅 기록 대신 스프레드시트나 PowerPoint 프레젠테이션과 같이 직접 사용 가능한 파일을 생성합니다.
  • 현재 프로젝트 웹사이트에서 MarbleOS의 다운로드 가능한 베타 버전을 이용할 수 있습니다.

개발자들은 명령줄 및 채팅 인터페이스를 시각적인 멀티태스킹 작업 공간으로 대체하는 에이전트 워크플로우를 위한 새로운 GUI 패러다임을 탐색할 수 있습니다.

SOURCES

11. WASTE 엔진, 64GB 소비자용 하드웨어에서 Kimi K3 추론 가능

Kimi K3의 출시와 Atomic Chat 및 Unsloth의 후속 양자화 노력에 이어, 하드웨어 요구 사항을 더욱 낮추기 위해 새로운 WASTE 추론 엔진이 출시되었습니다. 방대한 RAM(1.5TB)이나 표준 양자화가 필요했던 이전 방식과 달리, WASTE는 모델 트렁크를 RAM에 유지하고 디스크에서 전문가를 스트리밍함으로써 2.78조 파라미터의 Kimi K3 모델을 64GB MacBook Pro에서 실행할 수 있게 합니다. 이 접근 방식은 추론 속도는 느리지만 표준 소비자용 하드웨어에서 로컬 실행을 가능하게 합니다.

  • WASTE는 오픈 소스이며 의존성이 없는 C 추론 엔진입니다.
  • 디스크에서 전문가를 스트리밍하여 64GB MacBook Pro에서 Kimi K3를 실행할 수 있게 합니다.
  • Kimi K3에 대해 초당 0.49~0.54 토큰을 달성합니다.
  • Kimi-Linear-48B와 같은 소형 모델을 초당 10.7 토큰으로 지원합니다.
  • 엔진은 런타임에 SIMD 명령어를 선택하며 Linux, macOS, Windows를 지원합니다.

이번 개발은 엔터프라이즈급 메모리 요구 사항에서 표준 소비자용 노트북으로 전환함으로써 조 단위 파라미터 모델을 실행하기 위한 하드웨어 장벽을 크게 낮춥니다.

SOURCES

12. Hugging Face 스토리지 버킷, TB당 가격 책정으로 제공

이전에 발표된 S3 API 호환성을 바탕으로, Hugging Face가 이제 스토리지 버킷 서비스를 공식 출시했습니다. 이번 릴리스는 모델, 데이터 세트, 아티팩트 저장을 위한 간단하고 평평한 TB당 가격 모델을 도입하여, 개발자들에게 Hugging Face 생태계 내에서 기존 클라우드 객체 스토리지에 대한 전용 대안을 제공합니다.

  • Hugging Face가 스토리지 버킷 서비스를 공식 출시했습니다.
  • 이 서비스는 새로운 평평한 TB당 가격 구조를 특징으로 합니다.
  • 이는 이전에 발표된 S3 API 지원을 따르며, 기존 스토리지 도구와의 원활한 통합을 가능하게 합니다.

개발자들은 이제 기존의 S3 호환 워크플로우와 통합되는 완전한 기능을 갖춘 유료 스토리지 서비스를 활용할 수 있습니다.

SOURCES

13. 하네스 설계, 소형 모델 분류에서 22% 정확도 변동 유도

4B 모델에 대해 수행된 상세한 절제 연구는 소형 모델 성능에 대한 하네스 및 프롬프트 설계의 엄청난 영향을 강조합니다. Kubernetes 분류 작업을 위해 6GB 노트북 GPU에서 실행된 이 연구는 가중치를 고정하고 하네스 변수를 격리했습니다. 결과는 정확도에서 22% 포인트의 변동(60%에서 82%)을 보여주었습니다. 주요 발견 사항으로는 프롬프트의 명시적 규칙이 13포인트를 추가했고, 참조 자료 앞에 작업을 배치한 것이 6.5포인트를 추가했습니다. 반대로 원시 증거 대신 요약을 전달한 것은 12포인트를 잃었고, 단계 간의 새로운 세션 핸드오프는 15포인트를 잃었습니다.

  • 6GB 노트북 GPU에서 실행되는 4B 모델에 대한 절제 연구는 Kubernetes SIG 분류 작업에서 하네스 설계의 영향을 격리했습니다.
  • 동일한 고정 가중치, 250개 이슈 골드 코퍼스, 단일 점수 산정자를 사용하여 정확도는 60%에서 82%까지 다양했습니다.
  • 프롬프트의 명시적 규칙은 정확도를 13포인트 향상시켰고, 참조 자료 앞에 작업을 배치한 것은 6.5포인트 향상시켰습니다.
  • 추가적인 추론 단계를 추가하면 정확도가 5포인트 감소했고, 원시 증거 대신 요약을 전달하면 12포인트 감소했습니다.
  • 단계 간의 새로운 세션 핸드오프를 사용하면 정확도가 15포인트 감소했습니다.
  • 최악의 성능을 보인 하네스 설계는 추가 단계와 250개의 도구 호출을 활용했음에도 불구하고 기본 모델 정확도를 보였습니다.
  • 코퍼스, 점수 산정자, 사전 등록 및 실행 매니페스트는 GitHub에서 공개적으로 이용 가능합니다.

소형 모델을 미세 조정하거나 배포하는 개발자들은 재학습 없이 프롬프트 배치와 세션 관리를 최적화하는 것만으로도 엄청난 정확도 향상을 달성할 수 있습니다.

SOURCES

14. 오픈 웨이트 LLM, 규제 작업에서 폐쇄형 모델과 동등한 수준 달성

ClinReg 벤치마크를 사용한 새로운 평가 결과, 오픈 웨이트 LLM이 규제 및 임상 작업에서 선도적인 폐쇄형 소스 모델과 정확도 동등성을 달성했음이 밝혀졌습니다. GLM 5.2 및 Kimi K3와 같은 모델은 OpenAI의 독점 GPT 5.6 Sol 모델의 1표준 편차 내에서 수행되었습니다. 이러한 오픈 웨이트 모델은 최고 수준의 독점 API 비용의 약 3분의 1로 작동하기 때문에, 개발자들은 일반적인 리더보드 순위가 아닌 작업별 오류 프로필에 따라 모델을 선택한다면 운영 비용을 크게 절감할 수 있습니다.

  • ClinReg 벤치마크는 GLM 5.2 및 Kimi K3와 같은 오픈 웨이트 모델이 독점 GPT 5.6 Sol 모델의 1표준 편차 내에서 수행됨을 보여줍니다.
  • 오픈 웨이트 모델은 최고 독점 모델 비용의 약 3분의 1로 작동합니다.
  • 이 연구는 서로 다른 모델이 뚜렷한 오류 프로필을 나타내므로 모델 선택은 작업별로 이루어져야 함을 강조합니다.

특수 애플리케이션을 구축하는 개발자들은 정확도를 희생하지 않으면서 API 비용을 최대 3분의 2까지 절감하기 위해 오픈 웨이트 모델로 전환할 수 있습니다.

SOURCES

15. Manifest, 수동 선택 및 캐싱을 위해 LLM 라우터 지원 중단

Manifest가 7,000명의 클라우드 사용자를 대상으로 한 4개월간의 시험 끝에 LLM 라우터 기능을 공식적으로 지원 중단하고 종료했습니다. 회사는 자동화된 라우팅이 프로덕션 애플리케이션에 역효과를 낸다고 결론지었습니다. Manifest에 따르면, 컨텍스트는 종종 도구 호출을 통해 동적으로 드러나기 때문에 프롬프트 복잡성은 초기 프롬프트만으로는 정확하게 예측할 수 없습니다. 또한 자동화된 라우팅은 에이전트 워크플로우를 깨뜨리는 행동 불일치를 도입합니다. Manifest는 이제 개발자들에게 의도에 따라 모델을 수동으로 선택하고 컨텍스트 캐싱을 활용할 것을 권장하며, 이는 예측 가능성을 희생하지 않으면서 비용을 75%에서 90%까지 절감합니다.

  • Manifest는 3월에 LLM 라우터를 출시했으며 4개월 동안 7,000명의 클라우드 사용자를 테스트한 후 9월 1일에 공식적으로 종료했습니다.
  • 회사는 컨텍스트가 종종 도구 호출 및 웹 검색을 통해 드러나기 때문에 프롬프트 복잡성은 프롬프트만으로는 결정할 수 없음을 발견했습니다.
  • Manifest는 LLM 라우터가 행동 일관성을 깨뜨리고 예측 불가능성을 도입하여 자동화된 에이전트 워크플로우의 유지 관리 비용을 증가시킨다고 보고합니다.
  • 회사는 캐시 읽기가 캐시되지 않은 입력보다 75%~90% 저렴하다는 점에 주목하며 컨텍스트 캐싱이 비용 절감에 더 효과적이라고 주장합니다.
  • Manifest는 이제 엔지니어들이 특정 의도에 따라 모델과 파라미터를 수동으로 선택할 것을 권장합니다.

에이전트 워크플로우를 구축하는 개발자들은 수동 모델 선택과 컨텍스트 캐싱이 더 나은 예측 가능성과 비용 절감을 제공하므로 자동화된 LLM 라우터를 재고해야 합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.