Inference Brew

Moonshot AI, Kimi K3 오픈 웨이트 모델 공개

00:00 / --:--

AI 개발자가 놓치면 안 될 오늘의 뉴스.

하루 5분, 반드시 알아야 할 핵심만 간결하게 추렸습니다. 바쁜 출퇴근길엔 오디오 요약으로 챙겨 들으세요.

오늘의 브리핑

모두 보기 →

1. Moonshot AI, Kimi K3 오픈 웨이트 모델 공개

Moonshot AI는 7월 16일의 약속을 이행하며 Kimi K3 모델 웨이트를 Hugging Face에 공개했습니다. 2.8조 파라미터의 MoE(Mixture-of-Experts) 모델인 Kimi K3는 100만 토큰의 컨텍스트 윈도우와 네이티브 비전 기능을 갖추고 있으며, 이제 배포가 가능합니다. MXFP4 양자화 인식 학습으로 인해 모델 웨이트 다운로드 용량은 약 1.4TB에 달하며, 실행을 위해서는 멀티 노드 H200 또는 B300 구성과 같은 상당한 하드웨어 자원이 필요합니다.

  • Moonshot AI가 7월 16일 발표 이후 Hugging Face에 Kimi K3 웨이트를 공식 공개함.
  • 이 모델은 896개의 전문가 모델과 토큰당 16개의 활성 전문가를 사용하는 2.8조 파라미터 MoE 아키텍처임.
  • 100만 토큰 컨텍스트 윈도우와 네이티브 비전 기능을 지원함.
  • 1.4TB의 다운로드 용량(MXFP4 양자화)으로 인해 8x H200 또는 8x B300 멀티 노드 설정과 같은 상당한 인프라가 요구됨.

개발자들은 이제 최첨단급 Kimi K3 모델을 직접 배포할 수 있게 되었으나, 1.4TB에 달하는 거대한 용량으로 인해 로컬 운영을 위해서는 고성능 멀티 노드 하드웨어가 필수적입니다.

2. Celeris-1 언어 모델, 15배 빠른 응답 속도 주장

Celeris-1은 확산 기반 아키텍처를 채택하여 저지연 LLM 추론에 대한 새로운 접근 방식을 제시합니다. 이 설계 덕분에 범용 모델임에도 불구하고 기존 자기회귀(autoregressive) 모델보다 최대 15배 빠른 속도로 GPT-5 수준의 지능을 제공합니다. 157ms의 p50 응답 지연 시간과 초당 1,280 토큰의 처리량을 갖춘 Celeris-1은 실시간 대화형 인터페이스와 빠른 에이전트 루프에 매우 적합합니다.

  • Celeris-1은 GPT-5 수준의 지능을 표방하는 범용 언어 모델임.
  • 새로운 확산 기반 추론 아키텍처를 활용하여 표준 모델 대비 15배 빠른 응답 속도를 제공함.
  • 157ms의 p50 응답 지연 시간을 달성함.
  • 초당 1,280 토큰의 초고속 처리량을 지원함.

개발자들은 초당 1,280 토큰의 처리량을 지원하는 모델을 사용하여 매우 인터랙티브한 실시간 애플리케이션을 구축할 수 있습니다.

SOURCES

3. NVIDIA, SANA 비디오 라인업 2.0 버전으로 확장

2026년 5월 출시된 SANA-WM 월드 모델을 기반으로 NVIDIA가 SANA-Video 2.0을 선보였습니다. 이전의 SANA-WM이 Gated DeltaNet을 사용하여 긴 호흡의 생성에 집중했다면, 이번 2.0 버전은 선형 어텐션과 주기적 소프트맥스 아키텍처로 전환했습니다. 5B 및 14B 파라미터 모델은 단일 GPU 하드웨어에서 고해상도 720p 출력을 유지하도록 설계되어, 개발자들에게 장편 비디오 생성을 위한 새로운 도구를 제공합니다.

  • NVIDIA가 5B 및 14B 파라미터 모델을 포함한 SANA-Video 2.0을 출시함.
  • 새로운 아키텍처는 기존 SANA-WM의 Gated DeltaNet과 달리 선형 어텐션과 주기적 소프트맥스 레이어를 사용함.
  • 단일 GPU에서 720p 비디오 생성을 지원함.
  • 2026년 5월 SANA-WM 월드 모델 출시 이후 SANA 생태계를 확장함.

이번 출시는 개발자들에게 SANA 제품군 내에서 더 크고 뛰어난 성능의 모델을 제공하며, 기존 SANA-WM 대비 고해상도 비디오 생성을 위한 새로운 아키텍처 선택지를 제공합니다.

SOURCES

4. Baseten, GLM-5.2용 최적화 'Fast' API 출시

기존 GLM-5.2의 가용성을 바탕으로, Baseten은 지연 시간에 민감한 코딩 및 에이전트 작업을 위해 특별히 최적화된 'Fast' API 변형을 배포했습니다. 이번 업데이트는 초기 출시 당시의 성능을 2배 향상시켜, 최대 초당 280 토큰, 평균 초당 100 토큰의 처리량을 달성했습니다. 또한 향후 추측 디코딩(speculative decoding) 업데이트를 통해 성능을 더욱 개선할 계획이라고 밝혔습니다.

  • Baseten의 새로운 GLM-5.2용 'Fast' API는 최대 초당 280 토큰의 속도를 제공함.
  • 이번 업데이트는 초기 출시 당시의 API 성능을 2배 향상시킴.
  • 코딩 어시스턴트 및 에이전트 기반 워크플로우의 지연 시간을 줄이기 위해 특별히 튜닝됨.
  • Baseten은 향후 추측 디코딩 알고리즘 업데이트를 통해 추가적인 성능 향상을 계획 중임.

이번 최적화는 개발자들에게 GLM-5.2를 위한 더 빠른 추론 경로를 제공하여, 인터랙티브 코딩 어시스턴트와 에이전트의 지연 시간 요구 사항을 해결합니다.

SOURCES

5. Feyn, FeyNoBg 모델 및 NoBg 학습 라이브러리 오픈소스화

Feyn은 FeyNoBg와 이를 지원하는 NoBg 파이썬 라이브러리를 통해 이미지 전처리를 위한 강력한 오픈소스 솔루션을 도입했습니다. FeyNoBg는 기존 모델들을 여러 벤치마크에서 능가하는 최첨단 성능을 제공하는 자동 배경 제거 모델입니다. 맞춤형 학습을 용이하게 하기 위해 오픈소스 NoBg 라이브러리는 전처리부터 평가까지 전체 파이프라인을 처리하는 통합 파이썬 인터페이스를 제공하며, 현재 BiRefNet 아키텍처에 중점을 두고 있습니다. 이를 통해 개발자들은 고품질 이미지 매팅을 로컬 워크플로우에 쉽게 통합할 수 있습니다.

  • Feyn은 10개 데이터셋에 걸친 26,100개의 다양한 예제로 학습된 자동 배경 제거 모델 FeyNoBg를 출시함.
  • 이 모델은 8개 벤치마크 중 4개에서 최고 점수를 기록했으며, 나머지 4개에서도 1위 모델과 2% 이내의 성능 차이를 보임.
  • Feyn은 이미지 매팅 모델의 전처리, 학습, 평가를 위한 파이썬 라이브러리 NoBg를 오픈소스화함.
  • FeyNoBg 학습 과정에서 BiRefNet 특징 추출기의 3단계를 기존 18개 블록에서 24개 블록으로 확장하면서 사전 학습된 웨이트를 유지함.
  • NoBg는 현재 BiRefNet 아키텍처를 지원하며 향후 더 많은 아키텍처를 추가할 계획임.

개발자들은 최첨단 배경 제거 모델을 직접 호스팅하고 맞춤형 이미지 매팅 파이프라인을 쉽게 학습시킬 수 있습니다.

SOURCES

6. ENCFORGE 랜섬웨어 캠페인, Langflow 인스턴스 타깃

Langflow의 치명적인 취약점이 공개된 이후 새로운 위협이 등장했습니다. 위협 행위자 그룹 JADEPUFFER는 인증 누락 결함인 CVE-2025-3248을 적극적으로 악용하여 ENCFORGE 랜섬웨어를 배포하고 있습니다. 2026년 7월에 관찰된 이 캠페인은 특히 PyTorch, TensorFlow 및 GGUF 모델 파일을 타깃으로 삼아 파괴합니다. CISA가 여러 Langflow 취약점을 '알려진 악용 취약점(KEV)' 카탈로그에 추가함에 따라, 노출된 인스턴스에 대한 위험은 단순 무단 액세스를 넘어 파괴적인 랜섬웨어 공격으로 격상되었습니다.

  • 위협 그룹 JADEPUFFER가 7월 1일과 7월 20일에 인터넷에 노출된 Langflow 서버를 타깃으로 캠페인을 시작함.
  • 공격은 원격 파이썬 실행을 허용하는 인증 누락 취약점인 CVE-2025-3248을 악용함.
  • ENCFORGE 랜섬웨어가 PyTorch, TensorFlow, GGUF 모델 파일을 암호화하고 파괴하는 데 사용됨.
  • CISA는 CVE-2025-3248을 포함한 여러 Langflow 취약점을 '알려진 악용 취약점(KEV)' 카탈로그에 추가함.
  • 보안 팀은 Langflow를 업데이트하고 Docker 소켓 액세스를 제한하며 모델 웨이트의 변경 불가능한 백업을 유지해야 함.

Langflow 배포에 대한 위협이 일반적인 취약점 노출에서 파괴적인 랜섬웨어 공격으로 격상됨에 따라, 즉각적인 패치와 모델 아티팩트에 대한 보안 강화가 필요합니다.

SOURCES

7. 공유된 Claude 채팅 및 아티팩트, 검색 엔진 인덱스에 노출

사용자가 대화와 인터랙티브 아티팩트에 대한 공개 링크를 생성할 수 있는 Anthropic Claude의 '채팅 공유' 기능에서 보안 노출이 확인되었습니다. Anthropic은 공유 페이지에 'noindex' 태그를 구현하는 대신 robots.txt에 의존했기 때문에, 구글과 빙 같은 주요 검색 엔진이 이 URL들을 인덱싱하여 비공개 사용자 대화와 비즈니스 문서가 공개적으로 검색 가능하게 되었습니다. 무단 계정 액세스 증거는 없지만, 이번 사건은 개인정보 보호를 위한 robots.txt의 한계를 보여주며, 기업들이 공유 AI 링크를 다른 협업 소프트웨어와 동일한 거버넌스로 관리해야 할 필요성을 강조합니다.

  • 공유된 Claude 대화와 인터랙티브 아티팩트가 구글과 빙에서 인덱싱되어 검색되는 것이 발견됨.
  • Anthropic이 robots.txt 파일에 의존했기 때문에 발생한 노출이며, 검색 엔진은 페이지가 다른 곳에 링크되어 있으면 인덱싱 방지 지침으로 존중하지 않음.
  • 검토 결과, 공유된 Claude 채팅 페이지에는 검색 엔진의 인덱싱 방지를 위해 권장되는 'noindex' 메타 태그가 누락된 것으로 확인됨.
  • 노출된 콘텐츠에는 정치적 조언, 법률 윤리, 비즈니스 문서 등 민감한 사용자 데이터가 포함됨.
  • Anthropic은 인덱싱된 검색 결과를 삭제하거나 찾기 어렵게 조치하기 시작했으나, 기업들에게 공유된 콘텐츠를 감사할 것을 권장함.

개발자와 팀은 공유된 Claude 링크를 감사하고, 민감한 데이터 노출을 방지하기 위해 AI 협업 플랫폼을 엄격한 데이터 거버넌스 하에 관리해야 합니다.

8. Moonshot AI, 확장 가능한 에이전트 강화 학습을 위한 AgentENV 오픈소스화

AgentENV는 Moonshot의 2.8조 파라미터 Kimi K3 모델 학습에 사용된, 대규모 에이전트 강화 학습 환경을 실행하기 위해 설계된 분산 플랫폼입니다. Firecracker microVM을 활용하여 AgentENV는 컨테이너 기반 샌드박스의 속도를 희생하지 않으면서 커널 수준의 격리를 달성합니다. 이 플랫폼은 100ms 미만의 일시 중지, 50ms 미만의 스냅샷 부팅 또는 재개 등 고급 상태 관리를 지원합니다. 또한 실행 중인 샌드박스를 단일 노드에서 최대 16개의 독립적인 하위 샌드박스로 포크(fork)할 수 있어 단일 작업 상태에서 효율적인 병렬 롤아웃이 가능합니다.

  • Moonshot AI와 kvcache-ai가 MIT 라이선스로 AgentENV를 오픈소스화함.
  • 이 플랫폼은 에이전트 샌드박스에 커널 수준의 격리를 제공하기 위해 Firecracker microVM을 사용함.
  • 스냅샷, 일시 중지, 재개, 포크를 지원하며 부팅 및 재개 시간은 50ms 미만임.
  • 단일 실행 샌드박스는 병렬 롤아웃을 위해 동일 노드에서 최대 16개의 독립적인 하위 샌드박스로 포크될 수 있음.
  • AgentENV는 E2B 호환 HTTP API를 제공하여 기존 E2B 파이썬 및 타입스크립트 SDK를 코드 변경 없이 사용할 수 있음.

개발자들은 50ms 미만의 부팅 시간과 네이티브 E2B SDK 호환성을 갖춘 안전하고 격리된 에이전트 환경을 실행할 수 있습니다.

SOURCES

9. Perplexity, 검색 API용 공식 CLI 출시

이전에 출시된 Agent API와 Search as Code SDK를 기반으로, Perplexity는 단일 바이너리 명령줄 도구인 pplx를 선보였습니다. 이 CLI는 개발자가 실시간 웹 검색을 실행하고 정리된 페이지 텍스트를 가져올 수 있는 직접적인 인터페이스를 제공하여, Perplexity의 검색 스택을 터미널 기반 코딩 에이전트와 자동화된 파이프라인에 더 쉽게 통합할 수 있게 합니다.

  • Perplexity가 검색 API를 위한 공식 단일 바이너리 명령줄 클라이언트인 pplx를 출시함.
  • 이 도구는 인간과 코딩 에이전트를 위해 설계되었으며 검색 및 가져오기 명령을 제공함.
  • 표준 종료 코드를 사용하여 JSON 형식의 구조화된 데이터를 출력함.
  • 설치는 macOS 및 Linux의 ~/.local/bin에 단일 바이너리를 설치하는 셸 스크립트를 통해 이루어짐.
  • 이 도구는 긴 문자열을 자르는 토큰 예산 기능을 포함하며 비 TTY 환경을 지원함.

개발자들은 이제 공식 CLI를 사용하여 코딩 에이전트와 터미널 워크플로우에 실시간 웹 검색 및 깔끔한 마크다운 형태의 텍스트 추출 기능을 더 쉽게 탑재할 수 있습니다.

SOURCES

10. OpenRouter, 추론 태깅을 위한 Classifiers 베타 도입

OpenRouter의 새로운 Classifiers 기능은 개발자들에게 LLM API 사용에 대한 세밀한 관찰 가능성을 제공합니다. 현재 베타 버전인 Classifiers를 통해 팀은 추론 요청에 메타데이터 태그를 첨부할 수 있습니다. 이를 통해 개발자는 작업 유형, 부서, 에이전트 복잡성 등 특정 차원별로 API 호출을 분류하여 비용 추적, 성능 분석 및 멀티 에이전트 시스템 디버깅을 더 쉽게 수행할 수 있습니다.

  • OpenRouter가 현재 베타 버전인 새로운 기능 Classifiers를 출시함.
  • 이 기능을 통해 개발자는 워크스페이스 내에서 추론 활동을 태그 지정하고 분류할 수 있음.
  • 개발자는 작업 유형, 부서, 에이전트 복잡성 또는 사용자 지정 기준에 따라 API 호출을 정리할 수 있음.

개발자들은 작업, 부서 또는 에이전트 복잡성별로 API 호출에 태그를 지정하여 LLM 비용을 더 잘 모니터링, 분석 및 할당할 수 있습니다.

SOURCES

11. Ninfer 추론 엔진 성능, RTX 5090에서 720 t/s로 향상

초기 출시를 기반으로 오픈소스 Ninfer 추론 엔진은 NVIDIA RTX 5090에서 초당 최대 720 토큰을 제공하며 상당한 성능 향상을 달성했습니다. 이번 업데이트는 7월 20일에 보고된 542 t/s 벤치마크를 개선한 것으로, 250k 컨텍스트 윈도우를 갖춘 Qwen3.6 27B 및 35B 모델에 대해 엔진을 더욱 최적화했습니다. 이 엔진은 Linux와 Windows 모두를 지원하며 GitHub에서 계속 이용할 수 있습니다.

  • RTX 5090에서의 Ninfer 성능이 초당 550~720 토큰으로 증가함.
  • 이번 업데이트는 7월 20일에 보고된 542 t/s 벤치마크를 개선함.
  • 엔진은 250k 컨텍스트 윈도우를 갖춘 Qwen3.6 27B 및 35B 모델을 계속 지원함.
  • 소프트웨어는 오픈소스로 유지되며 Linux 및 Windows 지원과 함께 GitHub에서 이용 가능함.

이번 성능 향상은 플래그십 소비자 하드웨어에서 로컬 추론 엔진의 빠른 최적화를 보여주며, 고컨텍스트 모델에 대해 훨씬 더 빠른 응답 시간을 가능하게 합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.