Inference Brew

Ant Group, LingBot-World-Infinity 인과적 비디오 세계 모델 출시

00:00 / --:--

← 메인으로

Ant Group, LingBot-World-Infinity 인과적 비디오 세계 모델 출시

1. Ant Group, LingBot-World-Infinity 인과적 비디오 세계 모델 출시

Ant Group의 체화 지능(embodied-intelligence) 부서인 Robbyant가 LingBot-World-Infinity(LingBot-World 2.0)를 출시했습니다. 이 인과적 비디오 생성 모델은 대화형 세계 시뮬레이터로 작동하며, MoBA(Mixture of Bidirectional and Autoregressive) 어텐션 마스크를 사용하여 장기 드리프트와 지연 시간을 완화합니다. Director-Pilot Co-Simulation 프레임워크를 특징으로 하며, 14B 파라미터 버전과 단일 GPU 배포를 위해 설계된 1.3B 파라미터 경량 버전으로 제공됩니다. 라이선스는 비상업적 용도의 CC BY-NC-SA 4.0입니다.

  • LingBot-World-Infinity(LingBot-World 2.0)는 대화형 세계 시뮬레이터로 작동하는 인과적 비디오 생성 모델입니다.
  • 이 모델은 기본 14B 파라미터 버전과 단일 GPU 배포용 1.3B 파라미터 경량 버전으로 제공됩니다.
  • 장기 드리프트와 대화형 지연 시간을 해결하기 위해 MoBA(Mixture of Bidirectional and Autoregressive) 어텐션 마스크를 사용합니다.
  • 아키텍처는 비전-언어 모델과 확산 트랜스포머를 결합한 Director-Pilot Co-Simulation 프레임워크를 채택했습니다.
  • 이 프로젝트는 비상업적 CC BY-NC-SA 4.0 라이선스로 출시되었으며, 참조 스크립트는 480x832 해상도에서 실행됩니다.

물리적 및 의미론적 시뮬레이션을 위해 단일 GPU에서 실행 가능한 1.3B 경량 버전을 포함한 오픈 웨이트 대화형 세계 시뮬레이터를 제공합니다.

SOURCES

2. Google, TabFM을 BigQuery에 통합 및 Scikit-Learn API 출시

TabFM 파운데이션 모델의 초기 릴리스를 기반으로, Google은 JAX 및 PyTorch를 지원하는 scikit-learn 호환 API를 제공하여 접근성을 확장했습니다. 또한, 이 모델은 BigQuery에 통합되어 사용자가 100,000행 미만의 데이터셋에 대해 'AI.PREDICT' 명령을 통해 직접 제로샷 표 예측을 수행할 수 있게 되었습니다.

  • TabFM은 이제 JAX 및 PyTorch용 scikit-learn 호환 API를 통해 액세스할 수 있습니다.
  • Google은 TabFM을 BigQuery에 통합하기 시작하여 'AI.PREDICT' 명령을 통한 제로샷 예측을 가능하게 했습니다.
  • 이 통합은 100,000행 미만의 표 데이터셋에 대한 신속한 프로토타이핑을 지원합니다.
  • 모델은 여전히 10개의 출력 클래스와 최대 500개의 특징을 가진 테이블로 제한됩니다.

이번 업데이트를 통해 TabFM은 연구용 릴리스에서 개발자를 위한 실용적인 도구로 전환되어 기존 데이터 워크플로우에 직접 통합할 수 있게 되었습니다.

SOURCES

3. Kyutai, 오픈 웨이트 음악-MIDI 트랜스포머 MuScriptor 출시

Kyutai와 Mirelo는 다중 악기 음악 녹음을 MIDI로 변환하는 데 최적화된 오픈 웨이트 디코더 전용 트랜스포머 모델인 MuScriptor를 출시했습니다. 103M, 307M, 1.4B 파라미터 버전으로 제공되며, 추론 코드는 MIT 라이선스를 따르고 가중치는 CC BY-NC 4.0에 따라 비상업적 용도로 제한됩니다. 1.3B 모델은 트랜스크립션 벤치마크에서 기준 모델보다 훨씬 뛰어난 성능을 보이지만, 현재 5초 세그먼트 크기 제한이 있으며 음표 속도나 겹치는 동일 음정을 표현할 수 없습니다.

  • MuScriptor는 다중 악기 음악을 MIDI로 변환하기 위한 오픈 웨이트 디코더 전용 트랜스포머 모델입니다.
  • 이 모델은 103M, 307M, 1.4B 파라미터의 세 가지 가중치 버전으로 제공됩니다.
  • 1.3B 파라미터 모델은 D_Test 데이터셋에서 Multi F1 점수 48.2를 기록하여 YourMT3+ 기준인 21.9를 능가했습니다.
  • 추론 코드는 MIT 라이선스로 출시되었으며, 가중치는 CC BY-NC 4.0에 따라 비상업적 용도로 제한됩니다.
  • 현재 제한 사항으로는 5초 세그먼트 크기 제한과 음표 속도 또는 동일 음정의 겹침을 표현할 수 없는 점이 있습니다.

복잡한 다중 악기 녹음을 직접 MIDI 파일로 변환할 수 있는 전문화된 오픈 웨이트 오디오 모델을 개발자에게 제공합니다.

SOURCES

4. Databricks, 수백만 줄 코드베이스 대상 코딩 에이전트 벤치마크

Databricks는 수백만 줄의 코드베이스를 대상으로 코딩 에이전트를 평가하는 벤치마크를 발표했습니다. 결과에 따르면 bash와 미니멀리스트 도구 세트를 사용하는 pi-coding-agent가 더 복잡한 에이전트보다 최대 2배 저렴하고 더 높은 통과율을 기록했습니다. 또한 벤치마크는 GLM 5.2 모델이 코딩 작업에서 Claude Opus 4.8 high와 동등한 성능을 보이지만, 시각적 워크플로우를 위한 기본 이미지 입력 지원이 부족하다는 점을 보여줍니다.

  • Databricks는 수백만 줄의 코드베이스를 대상으로 코딩 에이전트를 평가했습니다.
  • bash와 최소한의 도구를 사용하는 pi-coding-agent는 다른 에이전트보다 최대 2배 저렴하고 더 높은 통과율을 달성했습니다.
  • GLM 5.2의 성능은 코딩 작업에서 Claude Opus 4.8 high와 동등한 것으로 나타났습니다.
  • GLM 5.2는 기본 이미지 입력 지원이 부족하여 Playwright와 같은 도구를 사용하는 에이전트에 비해 시각적 작업에는 덜 적합합니다.

코딩 에이전트를 설계하는 개발자에게 실증적인 비용 및 성능 데이터를 제공하며, 미니멀리스트 도구 세트가 복잡한 설정보다 뛰어난 성능을 낼 수 있음을 입증합니다.

SOURCES

5. 튜토리얼: DeepAnalyze-8B를 활용한 T4 친화적 데이터 과학 에이전트 구축

단계별 튜토리얼은 DeepAnalyze-8B 모델을 사용하여 자율 데이터 과학 에이전트를 구축하는 방법을 보여줍니다. 모델을 4비트 모드로 로드함으로써 개발자는 저비용 T4 GPU 하드웨어에서 전체 파이프라인을 실행할 수 있습니다. 이 아키텍처는 샌드박스 처리된 Python 실행 환경을 활용하여 에이전트가 코드를 생성, 실행하고 결과를 관찰하는 반복 루프를 통해 전자상거래 데이터셋을 정리, 분석 및 시각화한 후 구조화된 보고서를 출력할 수 있게 합니다.

  • 이 튜토리얼은 표준 T4 GPU 하드웨어에서 DeepAnalyze-8B 모델을 4비트 모드로 실행하는 방법을 보여줍니다.
  • 에이전트 루프 내에서 모델이 생성한 코드를 실행하기 위해 샌드박스 처리된 Python 실행 환경을 활용합니다.
  • 에이전트는 전자상거래 데이터셋을 자율적으로 정리, 결합, 분석 및 시각화합니다.
  • 워크플로우는 에이전트가 구조화된 분석가 수준의 보고서와 시각적 출력을 생성하는 것으로 마무리됩니다.

접근성이 높은 저비용 클라우드 하드웨어에서 완전히 샌드박스 처리되고 코드를 실행하는 데이터 과학 에이전트를 배포하는 단계별 가이드를 제공합니다.

SOURCES

6. OpenFox, 로컬 AI 코딩을 위한 추측적 캐시 워밍 도입

로컬 AI 코딩을 위한 MIT 라이선스 하네스인 OpenFox가 '추측적 캐시 워밍(speculative cache warming)'이라는 기능을 도입했습니다. 이 기술은 사용자가 프롬프트를 제출할 때까지 기다리는 대신, 타이핑하는 동안 백그라운드에서 시스템 프롬프트와 도구 배열을 처리합니다. 이러한 사전 캐싱은 초당 500토큰 속도에서 약 10초의 처리 시간을 절약하며, 캐시 안정성을 유지하고 옵트인 캐시 무효화를 처리하는 내장 메커니즘을 포함합니다.

  • OpenFox는 로컬 AI 코딩 작업을 위해 설계된 MIT 라이선스 하네스입니다.
  • 개발자는 사용자가 타이핑하는 동안 시스템 프롬프트와 도구 배열을 처리하기 위해 '추측적 캐시 워밍'을 구현했습니다.
  • 이 기능은 초당 500토큰 속도에서 약 10초의 처리 시간을 절약합니다.
  • OpenFox는 캐시 안정성을 유지하기 위한 메커니즘을 포함하며 캐시 무효화를 위한 옵트인 시스템을 제공합니다.

사용자가 전송 버튼을 누르기 전에 프롬프트 캐시를 사전에 워밍업하여 로컬 코딩 워크플로우에서 최대 10~20초의 지연 시간을 제거합니다.

SOURCES

7. Wispr Flow, Claude, ChatGPT 및 Cursor용 음성 입력 레이어 추가

Wispr Flow는 Claude, ChatGPT 및 Cursor를 사용하는 개발자를 위해 특별히 설계된 음성 입력 레이어를 도입했습니다. 이 도구는 타이핑 대비 프롬프트 속도를 최대 4배까지 높이는 것을 목표로 하며, 말한 텍스트를 자동으로 정리하고 코드 구문을 관리합니다. 이 소프트웨어는 현재 무료 체험판으로 다운로드할 수 있습니다.

  • Wispr Flow를 통해 개발자는 Claude, ChatGPT 및 Cursor에 음성으로 프롬프트를 입력할 수 있습니다.
  • 이 도구는 표준 타이핑 방식 대비 입력 속도를 4배 향상시킨다고 주장합니다.
  • 말한 텍스트를 정리하고 코드 구문을 관리하는 내장 기능을 포함합니다.
  • 소프트웨어는 현재 무료 체험판으로 다운로드할 수 있습니다.

Cursor 및 LLM 인터페이스 내에서 직접 코드 구문을 처리하고 말한 텍스트를 정리하는 통합 음성 레이어를 제공하여 개발자의 프롬프트 워크플로우를 가속화합니다.

SOURCES

8. 오픈 소스 llm-serve-dashboard, 로컬 llama.cpp 및 vLLM 박스 모니터링

llm-serve-dashboard라는 새로운 오픈 소스 도구는 로컬 LLM 서빙 박스를 모니터링하기 위한 단일 파일, 무종속성 라이브 대시보드를 제공합니다. llama.cpp와 vLLM을 모두 지원하며, 단일 파일 HTML 프론트엔드와 nvidia-smi 및 Prometheus 메트릭을 읽는 Python 백엔드를 특징으로 합니다. 이 도구는 디코드 및 프리필 토큰/초, 활성 요청 수, KV 캐시 채우기 속도를 포함한 실시간 작업자 성능과 함께 중요한 GPU 메트릭을 추적합니다.

  • llm-serve-dashboard는 로컬 LLM 서빙 박스를 모니터링하기 위한 단일 파일, 무종속성 라이브 대시보드입니다.
  • llama.cpp 및 vLLM 프레임워크를 모두 지원하며, 리스닝 소켓에서 작업자 포트를 자동으로 검색합니다.
  • 프론트엔드는 단일 index.html 파일이며, 백엔드는 nvidia-smi 및 Prometheus 메트릭을 읽는 표준 Python 파일입니다.
  • GPU 메트릭(사용률, VRAM, 전력, 온도)과 작업자 성능(초당 디코드/프리필 토큰, 요청 수, KV 채우기)을 추적합니다.
  • 이 프로젝트는 오픈 소스이며 GitHub(NHClimber87/llm-serve-dashboard)에서 이용할 수 있습니다.

개발자에게 로컬 서빙 박스에서 GPU 메트릭, 토큰 생성 속도 및 KV 캐시 채우기 속도를 모니터링할 수 있는 가볍고 종속성이 없는 도구를 제공합니다.

SOURCES

9. 비교 연구, 코딩 작업에서 12개 AI 모델 평가

비교 연구는 레이캐스터, 3D 루빅스 큐브, 계산기, 콘웨이의 생명 게임 등 4가지 코딩 작업에 걸쳐 12개 AI 모델을 평가했습니다. 방법론은 성능 변동성을 고려하여 작업당 5회의 시도를 허용했습니다. GPT-5.6 Sol 및 Claude Fable 5와 같은 프론티어 모델이 복잡한 작업을 지배한 반면, Qwen 3.7 Plus 및 GLM-5.2와 같은 오픈 웨이트 모델은 더 간단한 작업에 충분한 것으로 입증되었습니다. Meta의 Muse Spark 1.1은 중간 정도의 성능을 보이며 오픈 웨이트 모델보다는 뛰어났지만 Grok 4.5에는 뒤처졌습니다.

  • 이 연구는 레이캐스터, 3D 루빅스 큐브, 계산기, 콘웨이의 생명 게임 등 4가지 코딩 작업에 걸쳐 12개 모델을 평가했습니다.
  • GPT-5.6 Sol과 Claude Fable 5가 복잡한 작업에서 최고의 성능을 보였으며, Sol은 레이캐스터에서, Fable은 루빅스 큐브에서 앞섰습니다.
  • Qwen 3.7 Plus 및 GLM-5.2와 같은 오픈 웨이트 모델은 생명 게임과 같은 간단한 작업에는 성공했지만 복잡하거나 새로운 도전에는 어려움을 겪었습니다.
  • Grok 4.5는 여러 작업에서 Claude Opus 4.8과 동등한 성능을 보였습니다.
  • Meta의 Muse Spark 1.1은 오픈 웨이트 모델보다는 나은 성능을 보였지만 Grok 4.5보다는 약간 낮았습니다.

개발자가 특정 코딩 복잡성에 최적의 모델을 선택하도록 돕고, 오픈 웨이트 모델이 성공하는 영역과 프론티어 모델이 여전히 필요한 영역을 강조합니다.

SOURCES

10. Unsloth, Qwen3.6 모델을 위한 더 빠른 NVFP4 양자화 출시

Unsloth는 Qwen3.6 27B 및 35B-A3B 모델을 위한 최적화된 NVFP4 양자화를 출시했습니다. NVIDIA의 W4A16 구현 대신 4비트 텐서 코어에 W4A4를 활용하여 Unsloth는 최대 2.5배의 속도 향상을 달성합니다. 이번 릴리스에는 컨텍스트 길이를 두 배로 늘리기 위한 FP8 KV 캐시 보정, 사전 임베딩된 다중 토큰 예측(MTP), 더 높은 정확도가 필요한 개발자를 위한 35B-A3B 모델의 혼합 정밀도 NVFP4 변형이 포함되어 있습니다.

  • Unsloth는 NVIDIA 버전 대비 Qwen3.6 27B(2.5배 빠름) 및 35B-A3B(1.56배~1.79배 빠름)를 위한 NVFP4 양자화를 출시했습니다.
  • 구현은 4비트 텐서 코어에 W4A4를 활용하며, NVIDIA 버전은 W4A16을 사용합니다.
  • FP8 KV 캐시 보정이 포함되어 최대 2배 더 긴 컨텍스트 길이를 가능하게 합니다.
  • 35B-A3B 모델은 NVFP4-Fast(전체 W4A4) 및 NVFP4(더 높은 정확도를 위한 혼합 정밀도) 버전으로 제공됩니다.
  • 모델은 생성을 더욱 가속화하기 위해 사전 임베딩된 다중 토큰 예측(MTP) 기능을 갖추고 있습니다.

로컬 모델을 실행하는 개발자가 보정된 FP8 KV 캐싱을 사용하여 4비트 텐서 코어에서 엄청난 속도 향상과 두 배의 컨텍스트 길이를 달성할 수 있게 합니다.

SOURCES

11. ONNX를 사용하여 음성 비서 ASR 및 TTS를 CPU로 오프로드

오픈 소스 프로젝트 'fulloch'는 ASR 및 TTS 작업을 CPU로 오프로드하여 로컬 음성 비서를 위한 리소스 효율적인 아키텍처를 탐구합니다. Daumee/Qwen3-ASR-0.6B-ONNX-CPU 및 Kokoro-82M-v1.0-ONNX를 CPU에서 실행함으로써 시스템은 GPU 리소스를 LLM 추론을 위해서만 예약합니다. 이 설정은 음성 활동 감지(VAD)와 5초 후속 창을 활용하여 자연스럽고 웨이크워드 없는 상호 작용을 가능하게 하며, 소스 코드는 GitHub에서 제공됩니다.

  • 프로젝트 'fulloch'는 LLM을 위해 GPU 리소스를 절약하고자 ONNX 모델을 사용하여 ASR 및 TTS 작업을 CPU로 오프로드합니다.
  • Daumee/Qwen3-ASR-0.6B-ONNX-CPU 및 onnx-community/Kokoro-82M-v1.0-ONNX를 활용합니다.
  • AMD Ryzen 9 7900에서 테스트한 결과 빠른 성능을 달성했으며, 2022 Macbook M2에서도 대부분 사용 가능한 것으로 확인되었습니다.
  • 시스템은 음성 활동 감지(VAD)와 5초 후속 창을 사용하여 반복적인 웨이크워드 없이 명령을 트리거합니다.
  • 소스 코드는 오픈 소스이며 GitHub(liampetti/fulloch)에서 이용할 수 있습니다.

개발자가 음성 인식 및 음성 합성을 위해 귀중한 GPU VRAM을 소비하지 않고 저지연 로컬 음성 비서를 구축할 수 있는 구체적인 패턴을 제공합니다.

SOURCES

12. 개발자들, 지연 시간 우려로 Google에 Gemini 2.5 Flash 유지 청원

Google의 Gemini 3.5 Flash가 더 높은 토큰 처리량을 도입했지만, 개발자들은 완료 시간이 300-400ms에서 600-800ms로 증가하고 비용이 3배 증가하는 등 상당한 지연 시간 퇴보를 보고하고 있습니다. 이에 대응하여 점점 더 많은 개발자가 Google에 Gemini 2.5 Flash에 대한 액세스를 유지해 달라고 청원하고 있으며, 이전 모델이 폐기될 경우 오픈 웨이트 대안으로 마이그레이션할 수 있다고 경고하고 있습니다.

  • 개발자들은 300-400ms의 지연 시간을 이유로 Gemini 2.5 Flash를 활성 상태로 유지해 달라고 Google에 청원하고 있습니다.
  • Gemini 3.5 Flash는 더 높은 지연 시간(600-800ms)을 보이며 이전 모델보다 약 3배 더 비쌉니다.
  • 지연 시간 퇴보는 호주와 같이 로컬 배포가 없는 지역에서 특히 심각합니다.
  • 개발자들은 Gemini 2.5 Flash가 은퇴할 경우 오픈 웨이트 모델로 전환하겠다고 위협하고 있습니다.

이번 반발은 Google의 최신 모델 반복에서 나타난 심각한 성능 격차를 강조하며, 개발자들이 독점적인 업그레이드와 더 비용 효율적이고 지연 시간이 짧은 오픈 소스 대안 사이에서 선택하도록 강요하고 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.