1. Google, Gemini 3.5 Flash에 네이티브 컴퓨터 사용 기능 통합
Gemini 3.5 Flash를 위한 Google의 네이티브 컴퓨터 사용 통합은 지속적인 소프트웨어 테스트 및 전문 지식 업무를 포함한 장기적이고 복잡한 엔터프라이즈 자동화 작업을 위해 설계되었습니다. 보안 문제를 해결하기 위해 Google은 사용자 확인 게이트 및 자동 작업 종료와 같은 내장된 안전 장치를 보안 샌드박싱, 인간 개입 검증, 엄격한 액세스 제어와 결합할 것을 권장합니다.
- • Google은 Gemini API 및 Gemini Enterprise Agent Platform을 통해 액세스할 수 있는 Gemini 3.5 Flash 모델에 네이티브 컴퓨터 사용 기능을 통합했습니다.
- • 이 도구를 통해 개발자는 브라우저, 모바일 및 데스크톱 환경 전반에서 보고, 추론하고, 작업을 수행할 수 있는 에이전트를 구축할 수 있습니다.
- • Google은 라이브 환경에서 작동하는 에이전트의 프롬프트 주입 위험을 완화하기 위해 타겟팅된 적대적 학습을 사용합니다.
- • 기업은 두 가지 선택적 안전 장치 시스템을 활용하여 민감한 작업에 대한 사용자 확인을 요구하고 간접적인 프롬프트 주입이 식별될 경우 작업을 자동으로 중지할 수 있습니다.
- • 컴퓨터 사용 기능을 테스트하기 위한 데모 환경은 현재 Browserbase에서 호스팅하고 있습니다.
개발자는 이제 Gemini API를 통해 브라우저, 모바일 및 데스크톱 환경을 네이티브로 보고 상호작용할 수 있는 비용 효율적이고 지연 시간이 짧은 에이전트를 구축할 수 있습니다.
2. Gradium, 실시간 음성 번역 모델 출시
Hibiki-Zero 프레임워크를 기반으로 하는 Gradium의 새로운 모델은 강화 학습을 활용하여 정확도와 지연 시간 간의 균형을 최적화했으며, BLEU 및 MetricX 정확도 지표에서 gpt-realtime-translate를 능가합니다. 이 시스템은 PCM 24kHz 16비트 서명 모노, WAV, Opus, mu-law, A-law 등 다양한 입력 오디오 형식을 지원하여 실시간 통신 애플리케이션에 매우 유용합니다.
- • Gradium은 stt-translate(음성-텍스트) 및 s2s-translate(음성-음성) 실시간 번역 모델을 출시했습니다.
- • 이 모델들은 20개 언어 쌍에 걸쳐 5개 언어(영어, 프랑스어, 독일어, 스페인어, 포르투갈어)를 지원합니다.
- • 아키텍처는 전사와 번역을 결합한 단일 패스 설계를 사용하여 표준 3단계 모델 캐스케이드를 2단계로 줄였습니다.
- • Gradium은 평균 종단 간 지연 시간이 3.0초로, gpt-realtime-translate(3.6초)보다 우수하다고 보고했습니다.
- • s2s-translate 모델은 출력 음성 선택 및 음성 복제를 지원하며, 오디오 스트리밍을 위해 이중 WebSocket을 사용합니다.
개발자는 음성 복제를 지원하는 이중 WebSocket API를 사용하여 지연 시간이 짧은 단일 패스 음성-음성 및 음성-텍스트 번역을 앱에 통합할 수 있습니다.
3. Alibaba, Qwen-AgentWorld 환경 시뮬레이션 모델 출시
Alibaba의 Qwen 팀은 분리된 환경 시뮬레이터 역할을 하는 언어 월드 모델에 중점을 둔 프로젝트인 Qwen-AgentWorld를 도입했습니다. 이 모델들은 에이전트의 행동을 예측하는 대신 7개 도메인에 걸쳐 환경 반응을 예측하며, GUI 기반 작업을 위해 텍스트 접근성 트리와 UI 계층 구조를 처리합니다. 학습은 실제 에이전트 실행에서 얻은 1,000만 개 이상의 궤적을 사용하여 3단계(CPT, SFT, RL)로 완료되었습니다. 실증적 결과에 따르면 월드 모델 사전 학습은 에이전트별 미세 조정 없이도 BFCL v4 및 Claw-Eval과 같은 벤치마크에서 에이전트 성능을 향상시키는 것으로 나타났습니다.
- • Alibaba는 Apache 2.0 라이선스 하에 30억 개의 활성 매개변수를 가진 오픈 웨이트 Mixture-of-Experts 모델인 Qwen-AgentWorld-35B-A3B를 출시했습니다.
- • 이 모델들은 표준 채팅이나 자율 에이전트가 아닌, 에이전트 행동에 따른 환경 상태를 예측하도록 설계되었습니다.
- • MCP/도구 호출, 검색, 터미널, 소프트웨어 엔지니어링, Android, 웹, 운영 체제 GUI 등 7개 상호작용 도메인을 다룹니다.
- • 더 큰 3,970억 매개변수 버전(170억 활성)이 도입되었으나 가중치는 비공개로 유지됩니다.
- • 이번 출시에는 실제 상호작용을 기반으로 언어 월드 모델을 평가하기 위한 벤치마크인 AgentWorldBench가 포함되어 있습니다.
개발자는 라이브 API에 의존하지 않고 MCP, 터미널, OS와 같은 시뮬레이션 환경에서 AI 에이전트를 테스트하고 학습시킬 수 있습니다.
4. NVIDIA, NVFP4 양자화 MiniMax-M3 모델 출시
NVIDIA는 Hugging Face에서 MiniMax-M3 모델의 NVFP4 양자화 버전을 사용할 수 있도록 했습니다. 이 4,280억 매개변수 멀티모달 Mixture-of-Experts 모델은 100만 토큰의 방대한 컨텍스트 윈도우를 지원합니다. NVFP4 형식을 사용하여 모델을 4비트 정밀도로 압축함으로써 개발자는 NVIDIA Blackwell GPU에 배포할 때 2배의 메모리 절감 효과를 얻을 수 있습니다.
- • NVIDIA는 Hugging Face에 MiniMax-M3 모델의 NVFP4 양자화 버전을 출시했습니다.
- • MiniMax-M3는 4,280억 매개변수의 멀티모달 Mixture-of-Experts(MoE) 모델입니다.
- • 이 모델은 100만 토큰의 컨텍스트 윈도우를 특징으로 합니다.
- • 4비트 정밀도로의 압축은 특히 Blackwell GPU에서 2배의 메모리 절감 효과를 제공합니다.
Blackwell GPU를 사용하는 개발자는 이제 4비트 정밀도로 100만 토큰 컨텍스트 윈도우를 갖춘 4,280억 매개변수 멀티모달 MoE 모델을 배포하여 2배의 메모리 절감 효과를 누릴 수 있습니다.
5. Kog, Hugging Face에 초고속 2B 모델 오픈 소스 공개
Kog는 Hugging Face에 20억 매개변수 모델을 오픈 소스로 공개했습니다. 이 모델의 주요 특징은 극도로 빠른 추론 속도로, 초당 3,000 토큰 이상의 속도로 실행할 수 있어 지연 시간이 짧은 로컬 애플리케이션에 매우 적합합니다.
- • Kog는 Hugging Face 플랫폼에 20억 매개변수 모델을 오픈 소스로 공개했습니다.
- • 이 모델은 초당 3,000 토큰 이상의 속도로 실행할 수 있습니다.
초당 3,000 토큰 이상의 초고속 로컬 추론이 가능한 오픈 소스 20억 매개변수 모델을 제공합니다.
6. 개발자, Claude Code를 사용하여 PostHog SQL 파서를 70배 빠르게 재작성
이 사례 연구는 복잡한 시스템을 위한 AI 지원 엔지니어링의 힘을 강조합니다. 병렬 Claude Code 세션을 조정함으로써 개발자는 ANTLR 기반 파서를 고성능 Rust 구현으로 성공적으로 교체했습니다. 마이그레이션은 엄격한 속성 기반 테스트와 트래픽을 전환하기 전에 레거시 파서에 대해 수백만 개의 프로덕션 쿼리를 검증하는 섀도우 모드 배포를 통해 안전하게 이루어졌습니다.
- • 작성자는 2026년 5월 Claude Opus 4.7을 사용한 병렬 Claude Code 세션을 통해 PostHog의 SQL 파서를 Rust로 재작성했습니다.
- • 새로 직접 작성한 재귀 하강 파서는 프로덕션에서 454배, 로컬 노트북에서 70배의 속도 향상을 달성했습니다.
- • 개발 과정에서는 Hypothesis 라이브러리와 사용자 지정 SQL 생성기를 사용한 속성 기반 테스트가 활용되었습니다.
- • 기존 C++ ANTLR 기반 파서는 동일한 AST 및 소스 위치 출력을 보장하기 위한 오라클로 사용되었습니다.
- • 최종 구현은 16,000줄의 파서 코드, 5,000줄의 도구, 수천 줄의 테스트로 구성됩니다.
- • 파서는 전체 롤아웃 전에 수백만 개의 프로덕션 쿼리에 대해 섀도우 모드에서 검증되었으며 차이가 전혀 없었습니다.
개발자가 병렬 Claude Code 세션과 속성 기반 테스트를 활용하여 복잡한 레거시 시스템을 프로덕션 회귀 없이 고성능 Rust 코드로 재작성하는 방법을 보여줍니다.
7. Shopify, LLM 프록시 및 증류를 통한 탄력적인 AI 스택 상세 설명
Farhan Thawar가 이끄는 Shopify의 엔지니어링 팀은 공급업체 가동 중단 및 높은 API 비용으로부터 회사를 보호하는 AI 인프라를 설계했습니다. 모든 트래픽을 중앙 집중식 LLM 프록시를 통해 라우팅함으로써 회로 차단기로 토큰 지출을 관리하고 지속적인 가동 시간을 보장합니다. 또한 Tangle 플랫폼은 대형 교사 모델을 고도로 전문화된 SLM으로 증류하는 과정을 자동화하여 비용과 지연 시간을 크게 절감합니다.
- • Shopify는 사용자 연결을 라우팅하고, 토큰을 대량 구매하며, 여러 AI 공급업체 간에 자동 장애 조치를 제공하는 LLM 프록시를 개발했습니다.
- • 이 프록시를 통해 Shopify는 가동 중단 시 개발자 워크플로우를 중단하지 않고 Claude Opus와 GPT 5.5와 같은 모델 간에 전환할 수 있습니다.
- • Shopify는 모델 증류를 사용하여 AI 어시스턴트인 Sidekick을 위해 대형 교사 모델로부터 전문화된 소형 언어 모델(SLM)을 생성합니다.
- • Shopify에서 증류된 모델은 일반 모델보다 2배에서 30배 더 저렴하고 빠른 것으로 입증되었습니다.
- • Shopify의 내부 플랫폼인 Tangle을 통해 엔지니어는 일반적으로 약 하루 동안 실행되는 증류 파이프라인을 시각화할 수 있습니다.
자동 장애 조치 및 고도로 최적화된 작업별 소형 언어 모델을 갖춘 탄력적인 다중 공급업체 AI 스택을 구축하기 위한 청사진을 제공합니다.
8. DFlash 추측 디코딩, Blackwell에서 최대 15배 처리량 달성
UC San Diego 연구팀이 개발한 DFlash는 대상 숨겨진 기능을 모든 초안 레이어의 Key 및 Value 투영에 주입하여 추측 디코딩을 최적화함으로써 수용 길이를 초안 깊이에 따라 확장할 수 있게 합니다. 이 모델은 이전의 확산 기반 추측 디코딩 방식에서 사용된 70억 매개변수 초안 작성기보다 훨씬 작은 5레이어 초안 작성기를 활용하여 프로덕션 배포에 매우 효율적입니다.
- • DFlash는 경량 블록 확산 모델을 사용하여 단일 순방향 패스로 전체 토큰 블록을 초안 작성하는 추측 디코딩 방식입니다.
- • 이 방식은 대상 자기회귀 모델을 사용하여 초안 작성된 블록을 병렬로 검증함으로써 손실 없는 출력을 유지합니다.
- • NVIDIA 엔지니어링은 고정된 상호작용 목표에서 Blackwell GPU의 gpt-oss-120b 모델에 대해 최대 15배 더 높은 처리량을 보고합니다.
- • 연구팀은 Qwen3-8B 모델에서 최대 6.08배의 손실 없는 가속을 보고합니다.
- • DFlash는 vLLM, SGLang 및 Transformers를 포함한 널리 사용되는 서빙 프레임워크와 호환됩니다.
개발자가 널리 사용되는 서빙 프레임워크 전반에서 손실 없이 최대 15배 더 높은 LLM 추론 처리량을 달성할 수 있게 합니다.
9. llama.cpp의 새로운 JavaScript 실행 기능에 대한 보안 우려 제기
llama.cpp의 웹 UI에 최근 병합된 기능은 언어 모델이 Web Workers를 통해 브라우저에서 직접 생성된 JavaScript를 실행할 수 있게 합니다. 실행은 iframe 내에서 샌드박스 처리되지만, 개발자들은 네트워크 요청이 격리를 우회하여 민감한 데이터를 유출할 가능성에 대해 경고하고 있습니다. 사용자들은 주의를 권고하며 더 나은 문서화와 명시적인 실행 전 검토 게이트를 요구하고 있습니다.
- • run_javascript 도구가 llama.cpp 메인라인 저장소에 병합되어 모델이 브라우저에서 코드를 실행할 수 있게 되었습니다.
- • 이 도구는 sandbox='allow-scripts' 속성을 사용하여 샌드박스 처리된 iframe 내에서 코드를 실행합니다.
- • 사용자들은 네트워크 요청이 가능해 보이며 데이터 유출에 악용될 수 있다고 지적하며 보안 우려를 제기합니다.
- • 이 기능은 널리 알려지지 않았으며 현재 데스크톱 Firefox에서만 나타나는 등 가시성이 제한적일 수 있습니다.
- • 커뮤니티 구성원들은 샌드박스 제한 사항에 대한 명확한 문서화와 실행 전 코드 검토 인터페이스를 포함한 개선 사항을 제안합니다.
llama.cpp의 웹 UI를 사용하는 개발자는 iframe에서 코드를 실행하지만 네트워크 기반 데이터 유출을 허용할 수 있는 새로운 비공개 JavaScript 실행 도구와 관련된 보안 위험을 인지해야 합니다.
10. Nous Research, Hermes Agent에 자동 기술 생성 기능 추가
Hermes Agent의 새로운 /learn 기능은 SKILL.md 파일을 수동으로 작성하는 지루한 과정을 없애기 위해 설계되었습니다. 점진적 공개를 활용하여 에이전트는 컨텍스트 윈도우가 부풀려지는 것을 방지하고, 엄격히 필요한 경우에만 전체 기술 콘텐츠를 로드합니다. 이 기능은 CLI, TUI, 메시징 게이트웨이 및 대시보드 환경 전반에서 완전히 일관되며 검토 게이트를 위한 skill_manage 도구와 통합됩니다.
- • Nous Research는 재사용 가능한 기술을 자동으로 작성하기 위한 새로운 /learn 명령으로 오픈 소스 Hermes Agent를 업데이트했습니다.
- • /learn 명령은 로컬 디렉토리, URL, 과거 대화 또는 붙여넣은 메모를 처리하여 SKILL.md 파일을 생성합니다.
- • 에이전트는 read_file, search_files, web_extract와 같은 도구를 사용하여 오프라인에서 정보를 수집합니다.
- • Hermes Agent는 점진적 공개 패턴을 사용하여 컨텍스트 윈도우 사용을 최소화하기 위해 처음에 약 3k 토큰 인덱스를 로드합니다.
- • 생성된 모든 기술은 agentskills.io 오픈 표준과 호환되며 선택적인 쓰기 승인 게이트를 지원합니다.
개발자가 수동으로 마크다운 구성 파일을 작성하지 않고도 코드베이스, URL 또는 대화에서 재사용 가능한 에이전트 기술을 자동으로 생성할 수 있게 합니다.
11. Browserbase, AI 에이전트의 CAPTCHA 및 로그인 벽 우회 지원
Browserbase는 보안 조치로 인해 자주 차단되는 웹 브라우징 AI 에이전트를 구축하는 개발자를 위한 강력한 솔루션을 제공합니다. 이 플랫폼은 CAPTCHA 및 로그인 벽과 같은 복잡한 웹 문제를 처리하여 에이전트가 변경되는 웹 페이지를 안정적으로 탐색할 수 있도록 합니다. 이 서비스는 이미 널리 채택되어 매월 수천만 건의 세션을 처리하고 있습니다.
- • Browserbase는 로그인 벽, CAPTCHA 및 변경되는 웹 페이지를 처리하여 AI 에이전트를 프로덕션 준비 상태로 만들기 위해 설계된 서비스입니다.
- • 이 플랫폼은 매월 3,500만 건 이상의 세션을 처리합니다.
- • 현재 10,000개 이상의 팀이 신뢰하고 있습니다.
- • 프로모션 코드 TLDR1MO를 사용하여 1개월 무료 체험을 이용할 수 있습니다.
CAPTCHA, 로그인 벽 및 동적 페이지 레이아웃을 자동으로 처리하는 AI 에이전트용 프로덕션 준비 완료 브라우저 환경을 제공합니다.
12. IBM, CUGA 오픈 소스 에이전트 하니스 출시
IBM의 CUGA는 거버넌스와 유연성을 유지하면서 에이전트 애플리케이션을 개발에서 프로덕션으로 전환하는 과정을 간소화하도록 설계되었습니다. 상태 유지, 오류 수정 및 계획의 복잡한 작업을 처리함으로써 CUGA는 개발자가 프롬프트 설계 및 도구 선택에 집중할 수 있도록 합니다. 이 프레임워크에는 구성 가능한 추론 모드와 통합 정책 시스템도 포함되어 있습니다.
- • IBM은 에이전트 애플리케이션 개발을 단순화하기 위해 설계된 오픈 소스 에이전트 하니스인 CUGA를 출시했습니다.
- • 이 프레임워크는 계획, 실행 및 상태 관리를 관리하여 개발자가 도구 선택 및 프롬프트에 집중할 수 있도록 합니다.
- • CUGA는 상태 유지, 오류 수정 및 통합 정책 시스템을 위한 내장 기능을 포함합니다.
- • 이 프레임워크는 AppWorld와 같은 벤치마크에서 다른 프레임워크를 능가하는 것으로 보고되었습니다.
- • 구성 가능한 추론 모드를 특징으로 하며 개발에서 프로덕션으로의 전환을 지원합니다.
계획, 상태 관리 및 오류 수정을 즉시 처리하는 경량 오픈 소스 에이전트 하니스를 제공합니다.
13. NVIDIA, 전문 AI 에이전트를 위한 에이전트 툴킷 출시
NVIDIA의 에이전트 툴킷은 보안 런타임과 일련의 도구, 기술 및 오픈 모델을 제공하여 복잡한 도메인별 워크플로우를 가속화하는 것을 목표로 합니다. 이 툴킷은 기업이 프로덕션 환경에서 신뢰할 수 있는 고도로 전문화된 AI 에이전트를 구축하도록 돕기 위해 설계되었으며, 사이버 보안 및 의료와 같은 산업에서 이미 초기 도입이 진행 중입니다.
- • NVIDIA는 기업이 전문화되고 사용자 정의 가능한 AI 에이전트를 구축할 수 있도록 에이전트 툴킷을 출시했습니다.
- • 이 툴킷은 오픈 모델, 도구, 기술 및 보안 런타임 환경을 활용합니다.
- • 생명 과학, 의료, 사이버 보안 및 산업 운영을 포함한 산업 전반의 복잡한 워크플로우를 가속화하도록 설계되었습니다.
- • Cadence, Synopsys, CrowdStrike와 같은 기업들이 현재 이 툴킷을 활용하고 있습니다.
오픈 모델을 사용하여 전문화된 도메인별 AI 에이전트를 구축하고 배포하기 위한 보안 런타임과 툴킷을 제공합니다.
14. Mindstone, Rebel 로컬 우선 에이전트 AI OS 출시
Mindstone의 Rebel은 기업이 AI 에이전트를 안전하게 배포할 수 있도록 돕기 위해 설계되었습니다. 상태와 메모리에 마크다운 파일을 활용함으로써 플랫폼은 데이터가 로컬 우선으로 유지되도록 보장합니다. 로컬 및 클라우드 모델 전반에서 작업을 조정하여 개발자가 비용과 민감도에 맞게 최적화할 수 있도록 합니다. 고객사인 Epignosis에 초기 배포한 결과 12주 동안 8명의 정규직 역할에 해당하는 용량을 회복한 것으로 보고되었습니다.
- • Mindstone은 macOS 및 Windows용 로컬 우선 에이전트 AI 운영 체제인 Rebel을 출시했습니다.
- • Rebel은 100명 미만의 사용자 팀에게는 무료이며 대규모 팀에게는 상업용 라이선스가 필요한 Fair Source 라이선스로 배포됩니다.
- • 이 플랫폼은 마크다운 파일을 사용하여 상태, 프롬프트, 작업 지침 및 메모리 계층 구조를 저장합니다.
- • 데이터 민감도와 비용에 따라 로컬 및 클라우드 기반 모델 간에 작업을 라우팅하는 다중 모델 조정을 지원합니다.
- • Fair Source 라이선스에는 2년의 일몰 조항이 포함되어 있으며, 이후 소프트웨어 버전은 자동으로 MIT 라이선스로 전환됩니다.
데이터를 안전하게 유지하면서 로컬 및 클라우드 모델 간의 작업을 조정하는 로컬 우선 마크다운 기반 에이전트 운영 체제를 제공합니다.
15. OpenHarness 에이전트 런타임을 처음부터 구축하는 방법 상세 튜토리얼
MarkTechPost가 게시한 이 튜토리얼은 개발자들에게 OpenHarness의 핵심 아키텍처, 도구 레이어, 모델 브레인 레이어 및 메인 에이전트 루프를 구축하는 과정을 안내합니다. 이 가이드는 개발자들이 에이전트 런타임의 기본 메커니즘을 이해하도록 돕기 위해 설계되었으며, 외부 API 키 없이도 수명 주기 후크, 비용 추적 및 컨텍스트 압축에 대한 실용적인 시연을 제공합니다.
- • 이 튜토리얼은 에이전트 시스템 프레임워크인 OpenHarness를 처음부터 구축하기 위한 가이드를 제공합니다.
- • OpenHarness는 도구 사용, 유형이 지정된 도구 스키마, 권한, 수명 주기 후크, 메모리, 기술, 컨텍스트 압축, 재시도 로직, 비용 추적 및 다중 에이전트 조정과 같은 기능을 포함합니다.
- • 구현은 API 키나 복잡한 인프라 없이 실행 가능하도록 설계되었습니다.
- • 이 프레임워크는 Anthropic 또는 OpenAI API와 호환되는 결정론적 모의 브레인과 실제 LLM 공급업체 간의 전환을 지원합니다.
- • 튜토리얼은 권한 거버넌스, 온디맨드 기술, 메모리 지속성 및 다중 에이전트 위임을 시연합니다.
도구 스키마, 권한 거버넌스 및 다중 에이전트 조정을 갖춘 프로덕션급 에이전트 런타임을 구축하기 위한 단계별 아키텍처 청사진을 제공합니다.
16. Graphify, Python 및 SQL 코드베이스를 오프라인에서 지식 그래프로 매핑
Graphify는 LLM 기반 코드베이스 분석에 대한 경량 오프라인 대안을 제공합니다. tree-sitter로 코드베이스를 파싱하여 개발자가 NetworkX를 사용하여 분석할 수 있는 구조화된 graph.json 파일을 생성합니다. 이를 통해 팀은 코드를 외부 API로 보내지 않고도 다중 모듈 애플리케이션을 매핑하고, 아키텍처 병목 현상을 식별하며, 종속성 흐름을 시각화할 수 있습니다.
- • Graphify는 tree-sitter 기반 분석을 사용하여 Python 및 SQL 코드베이스를 지식 그래프로 변환합니다.
- • 워크플로우는 완전히 오프라인으로 작동하며 API 키나 LLM 백엔드가 필요하지 않습니다.
- • 생성된 graph.json 파일은 NetworkX에 로드되어 중심성을 계산하고, 커뮤니티를 감지하며, 최단 경로를 추적할 수 있습니다.
- • 이 과정은 아키텍처 핫스팟, 갓 노드 및 종속성 흐름을 식별하는 데 도움이 됩니다.
- • Matplotlib을 통한 정적 시각화와 Pyvis를 사용한 대화형 시각화를 지원합니다.
개발자가 LLM이나 API 키 없이도 Python 및 SQL 코드베이스 구조를 오프라인에서 지식 그래프로 매핑하고 분석할 수 있게 합니다.
17. NVIDIA와 AWS, Blackwell GPU를 EC2 G7 인스턴스에 도입하기 위해 파트너십 체결
NVIDIA와 AWS는 클라우드 개발자들에게 Blackwell 세대 하드웨어를 제공하기 위해 협력을 확대했습니다. 새로운 NVIDIA RTX PRO 4500 Blackwell GPU를 AWS EC2 G7 인스턴스에 통합함으로써, 이번 파트너십은 프로덕션 규모의 AI 추론 워크로드에 엄청난 성능 향상을 제공하는 것을 목표로 합니다.
- • NVIDIA와 AWS는 새로운 NVIDIA RTX PRO 4500 Blackwell GPU를 사용하여 대규모 AI 배포를 최적화하기 위해 파트너십을 체결했습니다.
- • 새로운 GPU는 AWS EC2 G7 인스턴스에 통합되고 있습니다.
- • 이번 협력은 이전 구성 대비 최대 4.6배의 AI 추론 성능을 제공합니다.
개발자는 이제 Blackwell GPU로 구동되는 AWS EC2 G7 인스턴스에 AI 모델을 배포하여 최대 4.6배 더 빠른 추론 성능을 얻을 수 있습니다.
18. AMD, 로컬 LLM을 위한 하이브리드 NPU 및 GPU 처리 활성화
AMD는 ROCm 소프트웨어 스택 업데이트를 통해 로컬 LLM 워크로드를 위해 Ryzen AI NPU를 잠금 해제했습니다. 새로운 하이브리드 모드를 활용하여 개발자는 NPU와 통합 GPU 모두에 처리를 분산할 수 있으며, NPU가 프롬프트 처리를 병렬로 처리할 수 있게 합니다. 공식 문서 및 모델 준비 가이드는 ryzenai.docs.amd.com에서 확인할 수 있습니다.
- • AMD Ryzen AI NPU는 ROCm 소프트웨어 스택의 개선 이후 LLM 워크로드에 사용할 수 있게 되었습니다.
- • 하이브리드 모드를 사용하면 LLM이 NPU와 iGPU를 동시에 사용하여 실행될 수 있으며, NPU가 프롬프트 처리를 병렬로 처리할 수 있습니다.
- • FastFlowLM NPU 모델은 NPU 하드웨어에서 실행되도록 특별히 설계되었습니다.
- • Ryzen AI 하드웨어 기능을 테스트하기 위해 Lemonade 소프트웨어(lemonade-server.ai)가 권장됩니다.
- • 하이브리드 실행을 위해 Qwen 3.6 GGUF 모델을 ONNX 형식으로 변환하는 것은 여전히 기술적인 과제로 남아 있습니다.
개발자는 이제 AMD Ryzen AI 하드웨어에서 NPU와 iGPU를 동시에 활용하여 로컬 LLM 프롬프트 처리 및 추론을 가속화할 수 있습니다.
19. WebGPU 확장을 통해 브라우저에서 로컬로 SDXL 실행
generate-ai-images 확장은 로컬 이미지 생성을 브라우저로 직접 가져옵니다. 14인치 MacBook M4에서 이 확장은 이미지 한 장을 처리하는 데 약 50-60초가 소요됩니다. 모델 로딩 중과 생성 종료 시 동기식 WebGPU 셰이더 컴파일로 인해 브라우저가 약 10초 동안 일시적으로 멈추지만, SDXL-Lightning을 오프라인에서 실행할 수 있는 매우 접근하기 쉬운 방법을 제공합니다.
- • generate-ai-images 브라우저 확장은 가상 환경이나 복잡한 설치 없이 WebGPU를 사용하여 로컬 이미지 생성을 가능하게 합니다.
- • 이 확장은 텍스트 인코더, UNet 및 VAE 구성 요소에 ONNX 그래프를 활용하여 사용자의 GPU에서 모델을 오프라인으로 실행합니다.
- • 지원되는 모델에는 SDXL-Lighting fp16(약 7GB 저장 공간 및 8GB VRAM 필요)과 4비트 버전(약 3.6GB 저장 공간 및 4-5GB VRAM 필요)이 포함됩니다.
- • 이 도구는 WebGPU를 지원하는 브라우저, 특히 Chrome 또는 Edge 버전 122 이상, 또는 최신 버전의 Firefox가 필요합니다.
- • 이 프로젝트는 오픈 소스이며 GitHub, Firefox Add-ons 스토어 및 Chrome 웹 스토어를 통해 이용할 수 있습니다.
개발자가 복잡한 로컬 Python 환경 없이 ONNX 그래프를 사용하여 WebGPU를 통해 브라우저에서 로컬로 SDXL-Lightning을 실행할 수 있게 합니다.