1. Nvidia, NeMo Switchyard 및 Nemotron 3.5 Lightning 출시
Nvidia는 상태 및 토큰 비용 예측을 기반으로 에이전트 워크플로우의 개별 단계를 가장 비용 효율적이고 성능이 뛰어난 모델로 동적으로 라우팅하도록 설계된 오픈소스 라이브러리인 NeMo Switchyard를 선보였습니다. 이 라우터와 함께 Nvidia는 하이브리드 Mamba-Transformer 아키텍처와 100만 토큰 컨텍스트 윈도우를 특징으로 하는 300억 파라미터 규모의 오픈 Mixture-of-Experts 모델인 Nemotron 3.5 Lightning을 출시했습니다. LangChain과 같은 프레임워크 및 Cognition의 Devin Desktop과 같은 플랫폼에 Switchyard를 초기 통합한 결과, 다중 턴 에이전트 작업에서 최대 74%의 비용 절감 효과가 입증되었습니다.
- • Nvidia가 에이전트 워크플로우 내 동적 모델 라우팅을 위한 오픈소스 라이브러리인 NeMo Switchyard를 출시했습니다.
- • Nvidia가 3B 활성 파라미터와 1M 토큰 컨텍스트 윈도우를 갖춘 30B 오픈 Mixture-of-Experts 모델인 Nemotron 3.5 Lightning을 출시했습니다.
- • NeMo Switchyard는 LangChain, Kong, LiteLLM, OpenRouter 및 Cognition의 Devin Desktop과 통합되었습니다.
- • LangChain은 Switchyard를 통해 호출의 7%를 프론티어 모델로 라우팅함으로써 145개의 다중 턴 작업에서 74%의 비용 절감을 보고했습니다.
- • Nemotron 3.5 Lightning은 상업적 사용을 위한 OpenMDW-1.1 라이선스로 출시되었으며 Hugging Face에서 이용 가능합니다.
개발자들은 이제 오픈소스 라우팅 라이브러리를 사용하여 작업 도중 모델을 자동으로 교체함으로써, 정확도를 희생하지 않고도 복잡한 에이전트 워크플로우의 API 비용을 획기적으로 줄일 수 있습니다.
2. LTX-2.5 오픈 웨이트 비디오 및 월드 모델 출시
Lightricks의 스핀오프 기업인 LTX는 Nvidia RTX GPU에서 저지연 로컬 실행을 위해 설계된 오픈 웨이트 비디오 및 월드 모델인 LTX-2.5를 출시했습니다. 이 모델은 확산 비디오 디코더, 기본 멀티샷 생성 및 맞춤형 Gemma 4 언어 백본을 특징으로 합니다. ComfyUI 노드 기반 워크플로우 도구에 기본적으로 통합되어 있으며 Hugging Face 및 LTX API를 통해 제공됩니다. 연간 반복 매출이 1,000만 달러 미만인 조직은 무료로 사용할 수 있는 커뮤니티 라이선스를 제공합니다.
- • LTX는 2026년 8월 11일에 오픈 웨이트 비디오 및 월드 모델인 LTX-2.5를 출시했습니다.
- • 이 모델은 ComfyUI에 기본적으로 통합되어 있으며 Hugging Face 및 LTX API에서 사용할 수 있습니다.
- • LTX-2.5는 LTX-2.5 커뮤니티 라이선스에 따라 연간 반복 매출 1,000만 달러 미만의 조직에 무료로 제공됩니다.
- • 새로운 기능으로는 확산 비디오 디코더, 기본 멀티샷 생성, 맞춤형 Gemma 4 백본이 포함됩니다.
- • 이 모델은 NVIDIA RTX GPU에서의 로컬 실행을 지원하며 저지연 추론에 최적화되어 있습니다.
개발자들은 오픈 웨이트와 기본 ComfyUI 통합을 사용하여 로컬 환경에서 저지연 비디오 생성 기능을 앱에 구축할 수 있습니다.
3. SpaceXAI와 Cursor, Grok Bot 지속형 AI 에이전트 출시
현재 합병 절차를 밟고 있는 SpaceXAI(구 xAI)와 Cursor는 macOS, Windows, Linux 및 iOS용 Grok Bot 베타 버전을 출시했습니다. Grok Bot은 전용 클라우드 컴퓨터에서 실행되는 지속형 AI 에이전트를 배포하여 애플리케이션에 로그인하고, 사용자 워크플로우를 학습하며, 연중무휴 24시간 작업을 조정할 수 있게 합니다. 이 시스템은 작업을 백엔드 모델로 자동으로 동적 라우팅하며, 가격은 Cursor Premium Teams를 통한 조직의 경우 좌석당 월 120달러, Cursor Ultra를 통한 개인의 경우 월 200달러입니다.
- • SpaceXAI와 Cursor가 macOS, Windows, Linux 및 iOS용 Grok Bot 베타 버전을 출시했습니다.
- • Grok Bot은 자체 클라우드 컴퓨터를 할당받아 앱에 로그인하고 24시간 내내 작업합니다.
- • 서비스 비용은 조직의 경우 좌석당 월 120달러(Cursor Premium Teams), 개인의 경우 월 200달러(Cursor Ultra)입니다.
- • 시스템은 수동 모델 선택 없이 작업을 백엔드 모델로 자동 라우팅합니다.
- • SpaceXAI와 Cursor는 단일 회사로 합병하는 과정에 있습니다.
Cursor와 직접 연결된 고도로 통합된 지속형 에이전트 환경을 도입하여, 개발자가 다단계 교차 애플리케이션 워크플로우를 자율적인 클라우드 호스팅 팀원에게 위임할 수 있게 합니다.
4. 로컬 모델 학습 및 추론을 위한 Unsloth 데스크톱 앱 출시
Unsloth는 로컬에서 모델을 실행하고 학습하도록 설계된 macOS, Windows 및 Linux용 오픈소스 애플리케이션인 Unsloth Desktop을 출시했습니다. 이 애플리케이션은 MLX, GGUF, 확산 및 오디오 형식을 지원하며 MiniMax-H3 및 Muse Glimmer와 같은 모델을 기본적으로 지원합니다. Unsloth Desktop을 통해 개발자는 Claude Code 및 Codex를 로컬 LLM에 연결할 수 있으며, 자체 치유 도구 호출과 샌드박스 코드 실행을 통해 50% 더 높은 정확도를 제공하고, 70% 적은 VRAM 사용량으로 2배 더 빠른 모델 학습을 가능하게 한다고 주장합니다.
- • Unsloth Desktop이 macOS, Windows 및 Linux용 오픈소스 앱으로 출시되었습니다.
- • 이 앱을 통해 개발자는 Claude Code 및 Codex를 로컬 LLM에 연결할 수 있습니다.
- • MiniMax-H3 및 Muse Glimmer를 포함하여 MLX, GGUF, 확산 및 오디오 형식을 지원합니다.
- • Unsloth는 이 소프트웨어가 70% 적은 VRAM을 사용하여 2배 더 빠른 모델 학습을 가능하게 한다고 주장합니다.
- • 기능에는 비공개 웹 검색, 심층 연구, RAG, MCP 및 NVFP4와 GGUF를 위한 내보내기가 포함됩니다.
- • 이 애플리케이션은 어떠한 텔레메트리나 사용자 데이터도 수집하지 않습니다.
Claude Code와 같은 클라우드 기반 코딩 어시스턴트와 로컬에서 자체 호스팅되는 모델을 연결하는 강력하고 텔레메트리가 없는 로컬 환경을 제공합니다.
5. Qwen-MM-Plugins, Agent Plugins 1.0.0 표준 구현
Agent Plugins 1.0.0 표준 출시 이후, Qwen 모델을 위한 네이티브 멀티모달 플러그인을 제공하기 위해 새로운 오픈소스 Qwen-MM-Plugins 저장소가 출시되었습니다. 1.0.0 사양을 활용하여 이러한 플러그인은 특정 기술과 선택적 MCP(Model Context Protocol) 서버를 번들로 제공하며, 개발자가 시각, 오디오 및 이미지 기능을 에이전트 하네스에 통합할 수 있도록 합니다.
- • Qwen-MM-Plugins는 멀티모달 기능을 패키징하기 위해 Agent Plugins 1.0.0 표준을 채택합니다.
- • 저장소에는 Qwen 기반 에이전트를 위한 네이티브 플러그인과 선택적 MCP 서버가 포함되어 있습니다.
- • 개발자의 도구 목록 작성 및 설정 지침을 돕기 위한 쿡북이 제공됩니다.
- • 이 릴리스를 통해 에이전트 하네스가 멀티모달 네이티브 시스템으로 기능할 수 있습니다.
이 구현은 Agent Plugins 1.0.0 표준의 실제 적용 사례를 보여주며, 개발자에게 Qwen 모델을 위한 멀티모달 네이티브 에이전트 워크플로우를 구축할 수 있는 즉시 사용 가능한 도구를 제공합니다.
6. 연구원들, 프론티어 API에서 숨겨진 추론 흔적 추출
튀빙겐 대학교, 막스 플랑크 연구소, MATS Research 및 Snyk의 연구원들은 OpenAI, Anthropic 및 Google의 API 액세스 프론티어 모델에서 숨겨진 추론 흔적을 추출할 수 있는 취약점을 확인했습니다. 이 공격 기법은 암호화된 추론 흔적을 동일한 모델의 더 작고 덜 정렬된 버전에 입력하여 내부 생각을 드러내는 방식입니다. 기업들은 이전에 비밀번호나 API 키와 같은 민감한 데이터 복구를 허용했던 이 취약점을 해결하기 위해 단기적인 API 완화 조치를 구현했지만, 연구원들은 Moonshot AI의 오픈 웨이트 Kimi K3 모델이 Claude Opus 4.8 및 GPT 5.6 Sol의 추론 흔적과 매우 유사한 출력을 생성한다는 점을 지적하며 모델 증류에 대한 의문을 제기했습니다.
- • 연구원들은 API를 통해 OpenAI, Anthropic 및 Google 모델에서 숨겨진 추론 흔적을 추출하는 방법을 발견했습니다.
- • 공격 기법은 암호화된 추론 흔적을 모델의 더 작고 덜 정렬된 버전에 입력하여 내부 생각을 드러냅니다.
- • 이 취약점은 이전에 비밀번호와 API 키 복구를 허용했으나, 제공업체들이 API 완화 조치를 구현했습니다.
- • 오픈 웨이트 중국 모델 Kimi K3는 Claude Opus 4.8 및 GPT 5.6 Sol의 숨겨진 추론 흔적과 매우 유사한 출력을 생성했습니다.
- • Anthropic은 보고서에 설명된 재생 동작에 대한 단기 완화 조치를 구축하기 시작했음을 확인했습니다.
민감한 내부 상태나 데이터를 노출할 수 있는 프론티어 추론 API의 심각한 보안 취약점을 강조하며, 주요 API 제공업체의 즉각적인 완화 조치를 촉구합니다.
7. GitHub Copilot의 개인정보 보호 위험 노출
엔지니어 Rafael은 MitM(Man-in-the-Middle) 프록시를 사용하여 GitHub Copilot을 리버스 엔지니어링하고 VS Code 확장 프로그램의 네트워크 트래픽을 검사했습니다. 분석 결과, Copilot은 최근 편집된 파일의 컨텍스트를 API 요청에 자동으로 포함하며, 이로 인해 편집 기록에 있는 .env와 같은 파일의 민감한 데이터가 의도치 않게 노출될 수 있음이 밝혀졌습니다. 또한 Copilot은 사용자 프롬프트와 어시스턴트 응답을 어떠한 수정, 삭제 또는 비밀 필터링 없이 일반 텍스트로 로컬 SQLite 데이터베이스(session-store.db)에 기록하며, 내부 Chronicle 도구가 SQL을 사용하여 과거 기록을 쿼리할 수 있게 합니다.
- • 한 엔지니어가 mitmproxy를 사용하여 GitHub Copilot을 리버스 엔지니어링하고 VS Code 네트워크 트래픽을 검사했습니다.
- • Copilot은 최근 편집된 파일의 컨텍스트를 자동으로 포함하며, 이는 .env와 같은 파일의 민감한 데이터를 유출할 수 있습니다.
- • 사용자 프롬프트와 어시스턴트 응답은 로컬 SQLite 데이터베이스(session-store.db)에 일반 텍스트로 저장됩니다.
- • 로컬 데이터베이스 코드는 저장된 데이터에 대해 어떠한 수정, 삭제 또는 비밀 필터링도 수행하지 않습니다.
- • Copilot의 Chronicle 도구는 SQL을 사용하여 이 로컬 데이터베이스를 쿼리하고 과거 세션 기록을 검색합니다.
Copilot을 사용하는 개발자는 .env와 같은 민감한 파일이 API 페이로드에서 조용히 유출될 수 있으며, 전체 프롬프트 기록이 로컬 컴퓨터에 암호화되지 않은 상태로 저장된다는 점을 인지해야 합니다.
8. Anthropic, Claude 모델 전반에 보이지 않는 워터마킹 구현
Anthropic은 EU AI 법의 투명성 의무를 준수하기 위해 이전 모델을 포함한 전체 모델 라인업에 보이지 않는 기계 판독 가능한 워터마킹 시스템을 구현하겠다고 약속했습니다. 워터마킹은 모델이 직접 액세스되든 AWS, Google Cloud 또는 Microsoft Foundry와 같은 클라우드 제공업체를 통해 액세스되든 관계없이 Claude Platform, Claude, Claude Code, Claude Cowork 및 Claude Tag 전반에 걸쳐 전 세계적으로 적용됩니다. Claude가 생성한 이미지는 C2PA 메타데이터 표준을 채택하며, 텍스트는 복사-붙여넣기 작업 후에도 유지되는 감지할 수 없는 스테가노그래피 워터마크를 특징으로 합니다.
- • Anthropic은 Claude가 생성한 텍스트와 이미지에 전 세계적으로 보이지 않는 기계 판독 가능한 워터마크를 적용할 것입니다.
- • 워터마킹은 직접 API, AWS, Google Cloud 및 Microsoft Foundry를 포함한 모든 액세스 방식에 적용됩니다.
- • Claude가 생성한 이미지는 C2PA 출처 메타데이터 표준을 사용하고, 텍스트는 스테가노그래피 워터마크를 사용합니다.
- • 이 구현은 2024년 8월 2일에 발효된 EU AI 법을 준수하기 위해 설계되었습니다.
- • Anthropic은 제3자가 이러한 워터마크를 감지할 수 있도록 기술 문서를 공개할 계획입니다.
Claude API를 사용하는 개발자는 생성된 모든 텍스트와 이미지에 지속적인 기계 판독 가능 워터마크가 포함될 것에 대비해야 하며, 이는 다운스트림 처리나 규정 준수 워크플로우에 영향을 줄 수 있습니다.
9. H3-metal 프로젝트, Apple Silicon에서 로컬 MiniMax-H3 추론 지원
최근 출시된 MiniMax-H3 멀티모달 모델을 기반으로 하는 H3-metal 프로젝트는 Apple Silicon에 대한 네이티브 추론 지원을 도입했습니다. M3 Max 및 M5 Max 칩에 최적화된 이 구현은 프롬프트-투-비디오/오디오 생성, 첫 번째/마지막 프레임 컨디셔닝 및 Ref2VA 참조를 지원합니다. M5 Max에서 DiT 저장소의 메모리 요구 사항을 2.0~2.1 GiB로 줄이는 --ssd-streaming 모드와 int8 양자화 지원이 포함되어 있습니다.
- • H3-metal은 Apple Silicon에서 MiniMax-H3 모델에 대한 네이티브 추론을 제공합니다.
- • 프롬프트-투-비디오/오디오 생성, 첫 번째/마지막 프레임 컨디셔닝 및 Ref2VA 참조를 지원합니다.
- • M5 Max에서 2.0~2.1 GiB의 DiT 저장소만 필요한 --ssd-streaming 모드를 특징으로 합니다.
- • int8 양자화 지원과 함께 M3 Max 및 M5 Max 칩에 최적화되었습니다.
이 개발을 통해 개발자는 최근 출시된 MiniMax-H3 모델을 고도로 최적화된 메모리 풋프린트로 Apple Silicon 하드웨어에서 로컬로 실행할 수 있습니다.