1. MirroS, 비디오-물리 변환을 위한 Code-as-World 오픈 웨이트 모델 공개
MirroS는 물리적 장면을 픽셀이나 캡션이 아닌 실행 가능한 코드로 표현하는 프레임워크인 Code-as-World를 도입했습니다. 이 프레임워크와 함께 Apache 2.0 라이선스로 Code-as-World-VL-4B 및 Code-as-World-VL-9B 오픈 웨이트 모델을 공개했습니다. Qwen3.5를 기반으로 미세 조정되었으며 vLLM을 통해 서비스되는 9B 모델은 QuantiPhy 벤치마크에서 Gemini-3.1 Flash를 능가하는 성능을 보입니다. 이 시스템은 MuJoCo를 실행 엔진으로 사용하여 5단계의 반복 과정을 거쳐 물리적 일관성을 검증합니다.
- • MirroS는 Code-as-World-VL-4B 및 Code-as-World-VL-9B를 Apache 2.0 라이선스로 공개했습니다.
- • 이 모델들은 Qwen3.5를 미세 조정했으며 vLLM을 통해 BF16 safetensors 형식으로 제공됩니다.
- • Code-as-World-VL-9B는 QuantiPhy 벤치마크에서 55.4점을 기록하여 Gemini-3.1 Flash의 54.8점을 앞섰습니다.
- • 이 프레임워크는 에이전트 루프를 사용하여 MuJoCo를 통해 물리적 일관성을 제안, 인스턴스화, 실행, 렌더링 및 검증합니다.
- • 현재 구현은 강체 물리(rigid-body physics)로 제한되며 모델 내부에 발견 루프가 내장되어 있지는 않습니다.
개발자들은 Apache 2.0 라이선스 모델을 사용하여 비디오 파일에서 구조화되고 실행 가능한 물리적 세계 표현을 추출할 수 있습니다.
2. Claude Code, 기본적으로 Git 커밋에 세션 URL 추가
개발자들은 Claude Code가 기본적으로 모든 git 커밋 메시지와 풀 리퀘스트 설명에 세션 URL을 자동으로 추가한다는 사실을 발견했습니다. 이 동작은 온보딩 과정에서 명시적인 동의 요청이나 경고 없이 발생합니다. 이러한 URL이 git 기록을 어지럽히거나 세션 세부 정보를 노출하는 것을 방지하려면, 개발자가 .claude/settings.json 파일에서 attribution.commit 설정을 수정하여 기능을 수동으로 비활성화해야 합니다.
- • Claude Code는 동의 요청 없이 모든 커밋 메시지와 PR 설명에 세션 URL을 자동으로 추가합니다.
- • 사용자들은 자동 URL 포함이 git 기록을 어지럽히고 외부 기여자에게 비전문적으로 보인다고 보고합니다.
- • '.claude/settings.json' 파일에서 'attribution.commit'을 false로 설정하여 이 동작을 억제할 수 있습니다.
- • 해당 설정은 현재 온보딩이나 처음 사용할 때 쉽게 발견하기 어렵습니다.
개발자는 내부 세션 URL이 공개 git 기록에 노출되는 것을 방지하기 위해 이 설정을 수동으로 비활성화해야 합니다.
3. Anthropic, 정보 탈취 악성코드 공격 이후 Claude 세션 초기화
Anthropic은 일부 사용자의 PC에 있는 정보 탈취 악성코드가 활성 Claude 로그인 세션을 성공적으로 탈취했다는 사실을 발견한 후 보호 조치를 취했습니다. 무단 사용 및 결제 피해를 완화하기 위해 Anthropic은 영향을 받은 사용자를 로그아웃시키고, 저장된 결제 수단을 삭제했으며 환불을 처리했습니다. 개발자는 세션 탈취 악성코드로부터 로컬 개발 환경을 안전하게 보호해야 합니다.
- • Anthropic은 로컬 정보 탈취 악성코드와 관련하여 Claude 사용자에게 경고를 발령했습니다.
- • 악성코드는 사용자의 PC에서 활성 Claude 로그인 세션을 탈취하여 사용량을 소진시켰습니다.
- • Anthropic은 영향을 받은 사용자를 로그아웃시키고, 저장된 결제 수단을 삭제하며 환불을 진행하는 방식으로 대응했습니다.
Claude를 사용하는 개발자는 무단 API 사용 및 결제 피해로 이어질 수 있는 세션 탈취를 방지하기 위해 로컬 환경을 보호해야 합니다.
4. Google, 정적 에이전트 벤치마크를 학습용으로 조정하는 EnvHarness 공개
Google Cloud AI Research는 학계 파트너들과 협력하여 Apache-2.0 라이선스로 EnvHarness를 공개했습니다. EnvHarness는 기본 시뮬레이터를 수정하지 않고도 정책 학습을 위해 정적 에이전트 벤치마크를 조정하도록 설계된 프로그래밍 계층입니다. 이 도구는 EnvRigger라는 LLM 기반 설계자를 사용하여 정책 결함을 진단하고 타겟팅된 래퍼를 생성합니다. SWE-bench Verified를 포함한 5개 벤치마크에서 이 도구는 에이전트 성능을 최대 9.0점 향상시키고 실행 단계를 거의 10% 줄였습니다.
- • EnvHarness는 표준 step/reset 인터페이스를 통해 플러그인 구성 요소를 사용하여 기존 환경을 래핑합니다.
- • 이 도구는 LLM 기반 설계자인 EnvRigger를 사용하여 정책 결함을 진단하고 타겟팅된 래퍼를 작성합니다.
- • Stage(작업 재생), Contract(단계별 후크 설치), Chain(환경 구성)의 세 가지 수정 구성 요소를 제공합니다.
- • 이 도구는 Apache-2.0 라이선스로 공개되었으나 실제 사용자 계정이나 물리적 로봇은 포함하지 않습니다.
- • SWE-bench Verified 및 ALFWorld 테스트에서 최대 9.0점의 성능 향상과 9.8%의 실행 단계 감소를 보였습니다.
개발자는 정책 결함을 자동으로 진단하고 기존 에이전트 환경을 래핑하여 성능을 향상시킬 수 있습니다.
5. 벤치마크 결과, Gemma 4 및 Qwen 오픈 VLM이 자기중심 데이터에서 Gemini Flash와 대등한 성능 기록
Hebbian-Robotics는 HFlow 도구를 사용하여 자기중심 데이터를 처리하는 오픈 웨이트 비전-언어 모델(VLM)에 대한 평가를 발표했습니다. Egocentric-10k 데이터셋 테스트 결과, Gemma 4 26B-A4B와 Qwen 3.8 27B가 Gemini 2.5 Flash 기준 모델과 거의 대등한 성능을 보였습니다. 특히 Gemma 4는 19배 더 저렴한 비용으로 유사한 결과를 달성하여, 자체 호스팅 오픈 VLM이 개인용 고처리량 데이터 처리에 매우 실용적임을 입증했습니다.
- • Hebbian-Robotics는 HFlow 도구를 사용하여 Egocentric-10k 데이터셋에서 오픈 웨이트 VLM을 평가했습니다.
- • Gemma 4 26B-A4B는 Gemini 2.5 Flash 기준 모델(91.65%)과 90.87%의 일치도를 보이면서 비용은 19배 저렴했습니다.
- • 동일한 평가에서 Qwen 3.8 27B는 90.79%, GLM 5.3 Flash는 91.00%를 기록했습니다.
- • 이 연구는 현대 오픈 VLM의 주요 차별화 요소로 비용, 처리량, 출력 신뢰성, 자체 호스팅의 용이성을 강조합니다.
개발자는 상용 API보다 19배 저렴한 비용으로 개인용 고처리량 비디오 및 이미지 처리를 위해 Gemma 4 또는 Qwen 3.8을 자체 호스팅할 수 있습니다.