Inference Brew

MirroS, 비디오-물리 변환을 위한 Code-as-World 오픈 웨이트 모델 공개

00:00 / --:--

← 메인으로

MirroS, 비디오-물리 변환을 위한 Code-as-World 오픈 웨이트 모델 공개

1. MirroS, 비디오-물리 변환을 위한 Code-as-World 오픈 웨이트 모델 공개

MirroS는 물리적 장면을 픽셀이나 캡션이 아닌 실행 가능한 코드로 표현하는 프레임워크인 Code-as-World를 도입했습니다. 이 프레임워크와 함께 Apache 2.0 라이선스로 Code-as-World-VL-4B 및 Code-as-World-VL-9B 오픈 웨이트 모델을 공개했습니다. Qwen3.5를 기반으로 미세 조정되었으며 vLLM을 통해 서비스되는 9B 모델은 QuantiPhy 벤치마크에서 Gemini-3.1 Flash를 능가하는 성능을 보입니다. 이 시스템은 MuJoCo를 실행 엔진으로 사용하여 5단계의 반복 과정을 거쳐 물리적 일관성을 검증합니다.

  • • MirroS는 Code-as-World-VL-4B 및 Code-as-World-VL-9B를 Apache 2.0 라이선스로 공개했습니다.
  • • 이 모델들은 Qwen3.5를 미세 조정했으며 vLLM을 통해 BF16 safetensors 형식으로 제공됩니다.
  • • Code-as-World-VL-9B는 QuantiPhy 벤치마크에서 55.4점을 기록하여 Gemini-3.1 Flash의 54.8점을 앞섰습니다.
  • • 이 프레임워크는 에이전트 루프를 사용하여 MuJoCo를 통해 물리적 일관성을 제안, 인스턴스화, 실행, 렌더링 및 검증합니다.
  • • 현재 구현은 강체 물리(rigid-body physics)로 제한되며 모델 내부에 발견 루프가 내장되어 있지는 않습니다.

개발자들은 Apache 2.0 라이선스 모델을 사용하여 비디오 파일에서 구조화되고 실행 가능한 물리적 세계 표현을 추출할 수 있습니다.

SOURCES

2. Claude Code, 기본적으로 Git 커밋에 세션 URL 추가

개발자들은 Claude Code가 기본적으로 모든 git 커밋 메시지와 풀 리퀘스트 설명에 세션 URL을 자동으로 추가한다는 사실을 발견했습니다. 이 동작은 온보딩 과정에서 명시적인 동의 요청이나 경고 없이 발생합니다. 이러한 URL이 git 기록을 어지럽히거나 세션 세부 정보를 노출하는 것을 방지하려면, 개발자가 .claude/settings.json 파일에서 attribution.commit 설정을 수정하여 기능을 수동으로 비활성화해야 합니다.

  • • Claude Code는 동의 요청 없이 모든 커밋 메시지와 PR 설명에 세션 URL을 자동으로 추가합니다.
  • • 사용자들은 자동 URL 포함이 git 기록을 어지럽히고 외부 기여자에게 비전문적으로 보인다고 보고합니다.
  • • '.claude/settings.json' 파일에서 'attribution.commit'을 false로 설정하여 이 동작을 억제할 수 있습니다.
  • • 해당 설정은 현재 온보딩이나 처음 사용할 때 쉽게 발견하기 어렵습니다.

개발자는 내부 세션 URL이 공개 git 기록에 노출되는 것을 방지하기 위해 이 설정을 수동으로 비활성화해야 합니다.

SOURCES

3. Anthropic, 정보 탈취 악성코드 공격 이후 Claude 세션 초기화

Anthropic은 일부 사용자의 PC에 있는 정보 탈취 악성코드가 활성 Claude 로그인 세션을 성공적으로 탈취했다는 사실을 발견한 후 보호 조치를 취했습니다. 무단 사용 및 결제 피해를 완화하기 위해 Anthropic은 영향을 받은 사용자를 로그아웃시키고, 저장된 결제 수단을 삭제했으며 환불을 처리했습니다. 개발자는 세션 탈취 악성코드로부터 로컬 개발 환경을 안전하게 보호해야 합니다.

  • • Anthropic은 로컬 정보 탈취 악성코드와 관련하여 Claude 사용자에게 경고를 발령했습니다.
  • • 악성코드는 사용자의 PC에서 활성 Claude 로그인 세션을 탈취하여 사용량을 소진시켰습니다.
  • • Anthropic은 영향을 받은 사용자를 로그아웃시키고, 저장된 결제 수단을 삭제하며 환불을 진행하는 방식으로 대응했습니다.

Claude를 사용하는 개발자는 무단 API 사용 및 결제 피해로 이어질 수 있는 세션 탈취를 방지하기 위해 로컬 환경을 보호해야 합니다.

SOURCES

4. Google, 정적 에이전트 벤치마크를 학습용으로 조정하는 EnvHarness 공개

Google Cloud AI Research는 학계 파트너들과 협력하여 Apache-2.0 라이선스로 EnvHarness를 공개했습니다. EnvHarness는 기본 시뮬레이터를 수정하지 않고도 정책 학습을 위해 정적 에이전트 벤치마크를 조정하도록 설계된 프로그래밍 계층입니다. 이 도구는 EnvRigger라는 LLM 기반 설계자를 사용하여 정책 결함을 진단하고 타겟팅된 래퍼를 생성합니다. SWE-bench Verified를 포함한 5개 벤치마크에서 이 도구는 에이전트 성능을 최대 9.0점 향상시키고 실행 단계를 거의 10% 줄였습니다.

  • • EnvHarness는 표준 step/reset 인터페이스를 통해 플러그인 구성 요소를 사용하여 기존 환경을 래핑합니다.
  • • 이 도구는 LLM 기반 설계자인 EnvRigger를 사용하여 정책 결함을 진단하고 타겟팅된 래퍼를 작성합니다.
  • • Stage(작업 재생), Contract(단계별 후크 설치), Chain(환경 구성)의 세 가지 수정 구성 요소를 제공합니다.
  • • 이 도구는 Apache-2.0 라이선스로 공개되었으나 실제 사용자 계정이나 물리적 로봇은 포함하지 않습니다.
  • • SWE-bench Verified 및 ALFWorld 테스트에서 최대 9.0점의 성능 향상과 9.8%의 실행 단계 감소를 보였습니다.

개발자는 정책 결함을 자동으로 진단하고 기존 에이전트 환경을 래핑하여 성능을 향상시킬 수 있습니다.

SOURCES

5. 벤치마크 결과, Gemma 4 및 Qwen 오픈 VLM이 자기중심 데이터에서 Gemini Flash와 대등한 성능 기록

Hebbian-Robotics는 HFlow 도구를 사용하여 자기중심 데이터를 처리하는 오픈 웨이트 비전-언어 모델(VLM)에 대한 평가를 발표했습니다. Egocentric-10k 데이터셋 테스트 결과, Gemma 4 26B-A4B와 Qwen 3.8 27B가 Gemini 2.5 Flash 기준 모델과 거의 대등한 성능을 보였습니다. 특히 Gemma 4는 19배 더 저렴한 비용으로 유사한 결과를 달성하여, 자체 호스팅 오픈 VLM이 개인용 고처리량 데이터 처리에 매우 실용적임을 입증했습니다.

  • • Hebbian-Robotics는 HFlow 도구를 사용하여 Egocentric-10k 데이터셋에서 오픈 웨이트 VLM을 평가했습니다.
  • • Gemma 4 26B-A4B는 Gemini 2.5 Flash 기준 모델(91.65%)과 90.87%의 일치도를 보이면서 비용은 19배 저렴했습니다.
  • • 동일한 평가에서 Qwen 3.8 27B는 90.79%, GLM 5.3 Flash는 91.00%를 기록했습니다.
  • • 이 연구는 현대 오픈 VLM의 주요 차별화 요소로 비용, 처리량, 출력 신뢰성, 자체 호스팅의 용이성을 강조합니다.

개발자는 상용 API보다 19배 저렴한 비용으로 개인용 고처리량 비디오 및 이미지 처리를 위해 Gemma 4 또는 Qwen 3.8을 자체 호스팅할 수 있습니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.