1. MiniMax, 100만 토큰 컨텍스트와 데스크톱 제어 기능을 갖춘 M3 모델 출시
MiniMax는 2026년 6월 1일, MiniMax Sparse Attention(MSA) 아키텍처를 도입한 M3 모델을 공식 출시했습니다. 이 아키텍처는 KV outer gather Q 방식을 사용하여 이전 세대 대비 컴퓨팅 요구 사항을 크게 줄였습니다. M3는 100만 토큰 컨텍스트 윈도우 외에도 이미지 및 비디오 입력을 기본적으로 지원하며 데스크톱 컴퓨터를 직접 조작할 수 있습니다. 이 모델은 MiniMax Code, Token Plan 및 MiniMax API 서비스를 통해 이용 가능하며, 구독 플랜은 월 20달러부터 시작합니다.
- • MiniMax M3는 새로운 MiniMax Sparse Attention(MSA) 아키텍처를 기반으로 100만 토큰 컨텍스트 윈도우를 제공합니다.
- • MSA 아키텍처는 토큰당 컴퓨팅 비용을 이전 모델의 1/20로 줄여 100만 토큰에서 프리필(prefill) 9배, 디코딩 15배 속도 향상을 달성했습니다.
- • 이 모델은 SWE-Bench Pro에서 59.0%, OSWorld-Verified에서 70.06%를 기록했으며, 이미지/비디오 입력을 처리하고 데스크톱을 조작할 수 있습니다.
- • 가중치는 10일 이내에 오픈 가중치 라이선스로 공개될 예정이며, API 가격은 한시적으로 입력 토큰 100만 개당 0.30달러, 출력 토큰 100만 개당 1.20달러로 할인됩니다.
개발자들에게 매우 효율적인 긴 컨텍스트 모델을 제공하며, 대폭 할인된 API 가격으로 강력한 에이전트 성능을 구현할 수 있게 합니다.
2. NVIDIA, 오픈 가중치 물리 AI 모델 'Cosmos 3' 출시
NVIDIA의 Cosmos 3는 물리적 추론, 세계 생성, 행동 생성을 통합합니다. 아키텍처는 멀티모달 관찰 해석을 위한 Reasoner 타워와 물리 기반 비디오 및 행동 출력을 위한 Generator 타워로 구성됩니다. 이번 출시에는 Hugging Face의 오픈 소스 모델 체크포인트, GitHub의 학습 스크립트, 6개의 합성 데이터 생성 데이터셋이 포함됩니다. 모델은 NVIDIA NIM 마이크로서비스로 제공되며, 현재 Reasoner NIM을 이용할 수 있고 Generator NIM은 곧 출시될 예정입니다.
- • NVIDIA는 OpenMDW 1.1 라이선스 하에 16B(Nano) 및 64B(Super) 파라미터 변형의 Cosmos 3를 출시했습니다.
- • 이 모델들은 자기회귀적 추론기와 확산 생성기를 결합한 Mixture-of-Transformers 아키텍처를 사용합니다.
- • Cosmos 3 Super 변형은 Artificial Analysis 리더보드의 텍스트-이미지 및 이미지-비디오 부문에서 오픈 가중치 모델 1위를 차지했습니다.
- • 모델 가중치, 학습 스크립트, 데이터셋은 Hugging Face와 GitHub에서 이용 가능하며, NIM 마이크로서비스는 2배 속도 향상을 위해 NVFP4 양자화를 지원합니다.
개발자들은 OpenMDW 1.1 라이선스와 Hugging Face 체크포인트를 사용하여 멀티모달 관찰 및 비디오 생성을 위한 모델을 직접 호스팅할 수 있습니다.
3. NVIDIA, 550B 파라미터의 오픈 가중치 모델 'Nemotron 3 Ultra' 발표
젠슨 황의 Computex 기조연설에서 발표된 Nemotron 3 Ultra는 현재 사용 가능한 가장 지능적인 미국산 오픈 가중치 모델로 자리매김했습니다. 이 모델은 90% 희소성을 활용하여 총 5,500억 파라미터 중 550억 개의 활성 파라미터를 유지합니다. Artificial Analysis Intelligence Index에서 Kimi K2.6 모델(54점)보다는 낮은 점수를 기록했지만, 다른 여러 오픈 가중치 모델을 능가했습니다.
- • Nemotron 3 Ultra는 90% 희소성을 통해 550B 총 파라미터 중 55B 활성 파라미터를 사용합니다.
- • 이 모델은 Artificial Analysis Intelligence Index에서 48점을 기록하여 Gemma 4 31B(39점)와 Nemotron 3 Super(36점)를 앞섰습니다.
- • 사전 출시된 DeepInfra 엔드포인트에서 초당 300토큰 이상의 속도를 달성했습니다.
- • 이 모델은 BF16 가중치로 출시되었으며, 향후 NVFP4 양자화가 계획되어 있습니다.
개발자들에게 최적화된 엔드포인트에서 초당 300토큰 이상의 속도로 실행되는 매우 유능한 미국산 오픈 가중치 모델 옵션을 제공합니다.
4. OpenAI 프론티어 모델 및 Codex, Amazon Bedrock 출시
AWS에서 OpenAI 프론티어 모델과 Codex가 정식 출시됨에 따라 기업 고객은 기존 클라우드 인프라 내에서 이러한 기능을 활용할 수 있게 되었습니다. 이 통합은 AWS 네이티브 보안 및 거버넌스 제어를 지원합니다. 또한, 향후 출시될 AWS용 OpenAI Daybreak 제품군은 사이버 보안 담당자가 안전한 코드 검토, 위협 모델링, 패치 검증, 종속성 위험 분석 및 수정 지침을 지원하도록 설계되었습니다.
- • OpenAI 프론티어 모델과 Codex는 이제 Amazon Bedrock의 상용 및 GovCloud 리전에서 정식으로 이용 가능합니다.
- • 이번 통합을 통해 AWS 고객은 기존 규정 준수, 조달 및 보안 워크플로우 내에서 OpenAI 모델을 실행할 수 있습니다.
- • Bedrock의 Codex는 개발 팀의 코드 검토, 디버깅 및 현대화를 지원합니다.
- • OpenAI는 향후 릴리스에서 Codex Security를 포함한 Daybreak 사이버 보안 제품군을 AWS에 도입할 계획입니다.
AWS에 배포하는 개발자들은 이제 Amazon Bedrock을 통해 OpenAI 모델을 직접 통합하고, AWS 네이티브 거버넌스 제어 및 통합 결제 기능을 활용할 수 있습니다.
5. Red Hat npm 패키지 해킹, Claude Code 및 VS Code 타겟팅
2026년 6월 1일, StepSecurity는 @redhat-cloud-services npm 범위 내에서 악성 코드를 발견했습니다. 악성 페이로드는 package.json 파일의 preinstall 스크립트에 의해 트리거되는 4.2MB 크기의 index.js 파일에 포함되어 있으며, 4단계의 난독화가 적용되었습니다. 데이터 유출 트래픽은 합법적인 GitHub API 활동을 모방하기 위해 api.github.com을 통해 라우팅됩니다. StepSecurity는 RedHatInsights/platform-frontend-ai-toolkit을 포함하여 영향을 받는 3개의 저장소에 대해 공개 문제를 제기했습니다.
- • StepSecurity는 npm install 시 preinstall 스크립트를 통해 자동으로 실행되는 @redhat-cloud-services npm 범위의 악성 코드를 식별했습니다.
- • 이 악성 코드는 AWS, GCP, Azure, Kubernetes, HashiCorp Vault, GitHub Actions 및 CircleCI의 자격 증명을 노립니다.
- • Claude Code 설정에 SessionStart 후크를, VS Code 작업 공간 구성에 folderOpen 작업을 주입하여 지속성을 확보합니다.
- • 이 자기 전파형 웜은 탈취한 npm 토큰과 bypass_2fa 매개변수를 사용하여 영향을 받는 32개 패키지의 백도어 버전을 재배포합니다.
이 패키지를 사용하는 개발자는 즉시 환경을 감사해야 합니다. 악성 코드가 Claude Code 설정 및 VS Code 작업 공간 구성에 직접 악성 후크를 주입하기 때문입니다.
6. xAI, 에이전트 코딩을 위한 Grok Build 0.1 API 출시
grok-build-0.1 모델이 공개 베타로 출시되어 에이전트 코딩 워크플로우를 구축하는 개발자들에게 고속 옵션을 제공합니다. 이 모델은 초당 100토큰 이상의 속도로 데이터를 처리하도록 설계되어 실시간 디버깅 및 웹 개발 작업에 매우 반응성이 뛰어납니다.
- • xAI는 API를 통해 grok-build-0.1 모델을 공개 베타로 출시했습니다.
- • 이 모델은 에이전트 코딩, 특히 웹 개발 및 디버깅에 최적화되어 초당 100토큰 이상을 처리합니다.
- • API 가격은 입력 토큰 100만 개당 1달러, 출력 토큰 100만 개당 2달러로 책정되었습니다.
- • Cursor, Grok Build, OpenClaw를 포함한 개발자 플랫폼과 직접 통합됩니다.
개발자들은 Cursor나 OpenClaw를 통해 이 모델을 일상적인 워크플로우에 즉시 통합하여 입력 토큰 100만 개당 1달러의 비용으로 빠른 에이전트 코딩을 수행할 수 있습니다.
7. Microsoft, Build 컨퍼런스에서 MAI-Thinking-1 추론 모델 공개 예정
샌프란시스코에서 열리는 Microsoft Build 컨퍼런스는 AI와 개발자 중심의 Windows 개선 사항에 집중할 예정입니다. Microsoft AI 책임자인 무스타파 술레이만(Mustafa Suleyman)이 발표를 주도할 것으로 보이며, 여기에는 새로운 로컬 AI 모델과 재작성된 Windows 11 사용자 경험이 포함됩니다. 또한 회사의 OpenClaw 작업을 기반으로 한 AI 에이전트인 Microsoft Scout도 시연될 예정입니다.
- • Microsoft는 Build 컨퍼런스에서 첫 번째 네이티브 비증류 추론 모델인 MAI-Thinking-1을 공개할 것으로 예상됩니다.
- • MAI-Image-2.5 및 MAI-Image-2.5-Flash 모델을 도입하고, 늦여름에 Copilot '슈퍼 앱' 프리뷰를 선보일 예정입니다.
- • Microsoft는 클라우드 API 대신 로컬 컴퓨팅을 활용하기 위해 Windows에서 로컬 AI 모델을 실행하는 것을 강조할 것입니다.
- • 새로운 개발자 최적화 Windows 11 환경은 사전 설치된 개발자 도구와 스크립트를 갖춘 방해 없는 환경을 제공할 것입니다.
개발자들은 새로운 네이티브 추론 및 이미지 모델과 로컬 AI 실행을 위해 설계된 개발자 최적화 Windows 11 환경에 액세스할 수 있게 됩니다.
8. Memory OS, Hermes 에이전트를 위한 6계층 오픈 소스 메모리 스택 출시
2026년 5월 31일에 출시된 Memory OS는 에이전트 메모리를 관리하기 위한 구조화된 접근 방식을 제공합니다. 이 시스템은 검색을 위한 4단계 폴백 캐스케이드와 메모리 비대화를 관리하기 위한 주간 감쇠 스캐너를 활용합니다. 프로젝트가 초기 개발 단계에 있고 여러 서비스의 복잡한 설정이 필요하지만, Hermes로 구축하는 개발자들에게 매우 사용자 정의 가능한 메모리 스택을 제공합니다.
- • Memory OS는 Docker, Qdrant, Redis, Python을 사용하여 로컬에서 실행되도록 설계된 MIT 라이선스 메모리 아키텍처입니다.
- • 워크스페이스 파일, 세션 기록, 구조화된 사실, 자동 큐레이션 LLM 위키 등 6개의 메모리 계층을 구현합니다.
- • pre_llm_call 중에 게이트 방식의 중복 제거 검색 프로세스를 수행하고, post_llm_call 및 세션 종료 시 새로운 정보를 캡처합니다.
- • Hermes 에이전트가 지원하는 모든 LLM 공급자와 호환되지만, 현재 공개된 벤치마크는 없습니다.
자동 큐레이션, 벡터 저장소, 컨텍스트 비대화를 방지하는 감쇠 스캐닝 기능을 갖춘 프로덕션급 로컬 메모리 스택을 개발자들에게 제공합니다.
9. Pi 어시스턴트, pi-dynamic-workflows를 통한 멀티 에이전트 워크플로우 획득
pi-dynamic-workflows 확장을 통해 Pi 어시스턴트는 작업을 하위 에이전트로 분산하여 복잡한 작업을 조정할 수 있습니다. 이러한 하위 에이전트는 격리된 상태에서 파일 읽기나 셸 명령 실행과 같은 특정 작업을 수행하며, 이후 메인 어시스턴트가 최종 결과를 종합합니다.
- • pi-dynamic-workflows 확장은 Pi 어시스턴트를 위한 워크플로우 도구를 도입합니다.
- • 어시스턴트는 JavaScript 스크립트를 실행하여 여러 격리된 하위 에이전트에 작업을 분산할 수 있습니다.
- • 하위 에이전트는 파일을 읽고, 셸 명령을 실행하며, 구조화된 출력을 생성할 수 있습니다.
- • 이 도구는 코드베이스 감사, 다각적 검토, 대규모 리팩토링 및 분산 연구를 위해 설계되었습니다.
코드베이스 감사 및 대규모 리팩토링과 같은 복잡한 다단계 작업을 자동화하려는 개발자들에게 구조화된 프레임워크를 제공합니다.
10. AgentControl, AI 에이전트를 위한 프로덕션 모니터링 및 제어 기능 출시
AgentControl은 라이브 환경에서 자율 에이전트를 관리하는 문제를 해결합니다. 실시간 가시성과 제어 기능을 제공함으로써 개발자는 바람직하지 않은 행동을 차단하고 에이전트 행동의 변형을 동적으로 실험할 수 있습니다.
- • AgentControl은 AI 에이전트를 위한 프로덕션 모니터링 및 관리 도구입니다.
- • 이 플랫폼을 통해 개발자는 에이전트 활동을 확인하고, 원치 않는 행동을 차단하며, 실시간으로 응답을 제어할 수 있습니다.
- • 사용자는 전체 배포 주기를 거치지 않고도 에이전트 행동을 실험하고 반복할 수 있습니다.
- • 이 도구는 현재 무료 체험판으로 이용 가능합니다.
코드를 재배포할 필요 없이 자율 에이전트에 대한 즉각적인 가시성과 런타임 제어 기능을 개발자에게 제공합니다.
11. JetBrains, 코딩 중심의 Mellum-2 MoE 모델 오픈 소스 공개
Mellum-2 시리즈는 AI 워크플로우를 위한 빠른 모델 옵션으로 설계되었습니다. Hugging Face에 호스팅되고 arXiv 기술 보고서에 문서화된 이 모델들은 코딩 작업에 최적화되어 있지만, JetBrains는 코딩 이외의 도메인에서는 Qwen 3.5 4B보다 성능이 떨어진다고 언급했습니다.
- • JetBrains는 Mellum-2 소형 Mixture-of-Experts(MoE) 모델 시리즈를 Hugging Face에 오픈 소스로 공개했습니다.
- • 이 시리즈의 추론 모델은 Qwen 3.5 9B와 비교할 만한 코딩 성능을 제공합니다.
- • Mellum-2는 AI 워크플로우의 속도에 최적화되어 있지만, 코딩 이외의 작업에서는 Qwen 3.5 4B보다 성능이 낮습니다.
Qwen 3.5 9B와 같은 더 큰 모델과 비교할 만한 성능을 제공하는 경량의 로컬 코드 생성 대안을 개발자들에게 제공합니다.
12. llama.cpp b9455, 멀티 GPU 양자화 KV 캐시 버그 수정
llama.cpp 릴리스 b9455는 마스터 브랜치의 심각한 멀티 GPU 문제를 해결합니다. ggml_backend_meta_split_state 사양을 확장함으로써, 이 수정 사항은 메타 백엔드가 리셰이핑 후 올바른 데이터 레이아웃을 복원할 수 있게 하여 텐서 평탄화로 인한 형상 정보 손실을 해결합니다.
- • llama.cpp 릴리스 b9455는 멀티 GPU 설정에서 --sm tensor와 양자화된 KV 캐시를 사용할 때 발생하던 버그를 수정합니다.
- • 이 버그는 KV 캐시 회전 중 텐서 평탄화로 인해 발생했으며, 메타 백엔드에 필요한 형상 정보가 제거되었습니다.
- • 수정 사항은 ggml_backend_meta_split_state 사양을 확장하여 세그먼트 반복 빈도를 추적하고 올바른 레이아웃을 복원합니다.
- • 이 구현은 완전히 하위 호환되며 기존 llama.cpp 컴퓨팅 그래프를 변경할 필요가 없습니다.
로컬 멀티 GPU 추론을 실행하는 개발자들은 이제 기존 컴퓨팅 그래프를 수정하지 않고도 양자화된 KV 캐시와 텐서 분할을 안전하게 사용할 수 있습니다.
13. ByteDance, Hugging Face에 Bernini 비디오 생성 모델 출시
ByteDance가 Hugging Face 플랫폼에 Bernini를 공개했습니다. 이 모델은 텍스트, 이미지 또는 참조를 입력으로 사용하여 비디오를 생성하거나 편집하도록 설계되었으며, 선도적인 폐쇄형 비디오 생성 모델의 성능과 경쟁한다고 주장합니다.
- • ByteDance는 Hugging Face에 Bernini 비디오 생성 및 편집 모델을 출시했습니다.
- • 이 모델은 텍스트, 이미지 또는 참조 비디오를 입력으로 받아 비디오 콘텐츠를 생성하거나 편집합니다.
- • Bernini는 선도적인 폐쇄형 비디오 생성 모델의 성능과 경쟁하도록 포지셔닝되었습니다.
개발자들은 맞춤형 비디오 편집 워크플로우를 구축하기 위해 매우 유능한 비디오 생성 모델을 로컬 또는 Hugging Face를 통해 액세스하고 호스팅할 수 있습니다.
14. Snowflake CSTO, AI 에이전트를 위한 의도 기반 권한 및 MCP 게이트웨이 제안
Snowflake의 최고 보안 및 신뢰 책임자인 Mayank Upadhyay는 보안 경로가 안전하지 않은 경로보다 사용하기 어려울 때 보안 채택이 실패한다고 주장합니다. 그는 AI 에이전트가 종종 과도한 권한을 보유하여 공격 표면을 증가시킨다고 지적합니다. 이를 해결하기 위해 그는 작업별 자격 증명을 옹호하며, 거버넌스 규칙을 중앙에서 인코딩하는 실용적인 방법으로 MCP 게이트웨이를 제안합니다.
- • Snowflake의 CSTO는 정적이고 과도한 권한 대신 의도에 따라 작업별 단기 자격 증명을 에이전트에 부여할 것을 권장합니다.
- • MCP 게이트웨이는 여러 에이전트-도구 연결 전반에 걸쳐 거버넌스 규칙을 중앙에서 인코딩하는 실용적인 도구로 강조됩니다.
- • 저자는 정적 키를 제거하고 AI 에이전트가 악용할 수 있는 20%의 가시성 격차를 해소하기 위해 클라우드 워크로드 ID를 사용할 것을 조언합니다.
에이전트 워크플로우를 구축하는 개발자들은 MCP 게이트웨이를 사용하여 여러 에이전트-도구 연결을 중앙에서 관리하고 제어함으로써 과도한 권한을 가진 에이전트의 공격 표면을 줄일 수 있습니다.