Inference Brew

스탠퍼드와 Lambda Labs, 로컬 에이전트 프레임워크 OpenJarvis 공개

00:00 / --:--

← 메인으로

스탠퍼드와 Lambda Labs, 로컬 에이전트 프레임워크 OpenJarvis 공개

1. 스탠퍼드와 Lambda Labs, 로컬 에이전트 프레임워크 OpenJarvis 공개

스탠퍼드 대학교와 Lambda Labs의 연구진이 추론, 에이전트, 메모리, 학습을 온디바이스에서 완전히 실행하기 위한 오픈소스 로컬 우선 프레임워크인 OpenJarvis를 공개했습니다. 이 프레임워크는 'spec'이라 불리는 선언적 구성 객체를 사용하여 AI 시스템을 지능(Intelligence), 엔진(Engine), 에이전트(Agents), 도구 및 메모리(Tools & Memory), 학습(Learning)이라는 5가지 교체 가능한 기본 요소로 분해합니다. OpenJarvis는 검색 시간 동안 클라우드 모델을 교사로 활용하여 로컬 spec을 최적화함으로써 추론 시 클라우드 호출을 완전히 제거합니다. 이 프레임워크는 Qwen3.5, Gemma4, Nemotron, Granite를 포함한 4개 제품군, 11개의 로컬 모델을 지원합니다.

  • 2026년 3월 12일 Apache 2.0 라이선스로 출시.
  • 최고 수준의 클라우드 모델과 3.2% 포인트 이내의 성능을 내며, 한계 API 비용은 800배 낮고 지연 시간은 4배 짧음.
  • 선언적 구성 spec을 사용하여 AI 시스템을 5가지 교체 가능한 기본 요소로 분해.
  • Qwen3.5, Gemma4, Nemotron, Granite 제품군 등 11개의 로컬 모델 지원.
  • 25개 이상의 데이터 커넥터와 32개 이상의 메시징 채널에 대한 내장 지원 제공.

개발자가 API 비용을 800배 절감하면서도 최고 수준의 클라우드 모델과 3.2% 포인트 이내의 성능을 내는 로컬 우선 개인용 AI 에이전트를 구축할 수 있게 합니다.

SOURCES

2. 화웨이, vLLM에서 3~5배 KV 캐시 압축을 지원하는 KVarN 오픈소스 공개

화웨이가 에이전트 및 긴 컨텍스트 워크로드를 위해 설계된 KV 캐시 양자화 방식인 KVarN을 오픈소스로 공개했습니다. 네이티브 vLLM 어텐션 백엔드로 구현된 KVarN은 단일 플래그를 사용하여 vLLM 프레임워크에 통합되며, 모델 변경, 재학습 또는 보정이 필요하지 않습니다. 이 시스템은 4단계 프로세스를 통해 KV 캐시를 양자화하며, 기본 구성(kvarn_k4v2_g128)은 4비트 키와 2비트 값을 사용합니다. KVarN은 FP16 수준의 출력 품질과 추론 정확도를 유지하면서도 3~5배 더 많은 컨텍스트 용량과 최대 1.3배의 처리량을 제공합니다.

  • Apache 2.0 라이선스로 출시되었으며 vLLM v0.22.0 기반으로 구축.
  • FP8이 제공하는 약 2배의 용량 대비 3~5배 더 많은 컨텍스트 용량 제공.
  • FP16 수준의 출력 품질을 유지하면서 최대 약 1.4배의 FP16 처리량 달성.
  • 추론 작업에서 더 높은 정확도를 유지하면서 TurboQuant 대비 최대 약 2.4배의 처리량 제공.
  • 모델 변경이나 보정 없이 단일 플래그를 사용하여 vLLM에 통합.

개발자가 메모리 사용량을 크게 줄이고 FP16 대비 최대 1.3배 높은 처리량으로 vLLM에서 더 긴 컨텍스트와 에이전트 워크로드를 실행할 수 있게 합니다.

SOURCES

3. Boxes.dev, Claude Code 및 Codex를 위한 클라우드 전용 환경 출시

Nick과 Drew가 설립한 boxes.dev는 Codex 및 Claude Code 에이전트를 실행하기 위한 전용 원격 컴퓨팅을 제공하는 클라우드 전용 에이전트 개발 환경(ADE)입니다. 이 플랫폼을 통해 개발자는 전체 개발 환경의 스냅샷을 사용하여 원격 컴퓨팅에서 리소스 집약적인 코딩 에이전트를 실행할 수 있으며, 로컬 하드웨어 제약과 git 워크트리 관리 문제를 우회할 수 있습니다. Boxes.dev는 데스크톱 앱, 모바일 앱, 예약 자동화 및 Slack 통합 기능을 제공합니다.

  • Codex 및 Claude Code 에이전트를 위한 전용 클라우드 컴퓨터 제공.
  • 전체 개발 환경의 스냅샷을 사용하여 원격 컴퓨팅에서 에이전트 실행.
  • 데스크톱 앱, 모바일 앱, 예약 자동화 및 Slack 통합 기능 제공.
  • Gem의 공동 창업자/CTO 및 첫 번째 채용 담당자가 개발.

개발자가 로컬 git 워크트리를 복잡하게 만들거나 로컬 하드웨어 제약에 부딪히지 않고 리소스 집약적인 코딩 에이전트를 병렬로 실행할 수 있게 합니다.

SOURCES

4. Anthropic, AI 기반 취약점 탐지를 위한 참조 구현 오픈소스 공개

Anthropic이 Claude를 사용하여 자율적인 취약점 탐지 및 수정을 수행하는 유지 관리되지 않는 참조 구현을 출시했습니다. 이 저장소는 gVisor 샌드박싱을 사용하여 실행 중 자율 에이전트를 격리하는 다단계 파이프라인(빌드, 정찰, 탐지, 검증, 중복 제거, 보고, 패치)을 제공합니다. 이 파이프라인은 Docker와 ASAN을 사용하여 C/C++ 메모리 취약점을 찾는 데 특화되어 있으며, Bedrock, Vertex, Azure 전반의 Claude API를 지원합니다.

  • 자율적인 정찰, 탐지, 분류, 보고 및 패치 프로세스를 위한 참조 구현 제공.
  • 실행 중 자율 에이전트를 격리하기 위해 gVisor 샌드박싱 사용.
  • Bedrock, Vertex, Azure를 포함한 Claude API 지원.
  • Docker와 ASAN을 사용하여 C/C++ 메모리 취약점을 찾는 데 특화된 구성.
  • 해당 저장소는 유지 관리되지 않으며 기여를 받지 않음.

개발자에게 자체적인 자율 보안 및 패치 에이전트를 구축할 수 있는 구체적인 다단계 파이프라인 아키텍처를 제공합니다.

SOURCES

5. Miso Labs, MisoTTS 8B 오픈 웨이트 감정 표현 음성 모델 출시

Miso Labs가 수정된 MIT 라이선스 하에 80억 파라미터 오픈 웨이트 텍스트 음성 변환(TTS) 모델인 MisoTTS를 출시했습니다. 이 모델은 시간 예측을 위한 77억 파라미터 백본과 깊이 예측을 위한 3억 파라미터 디코더로 구성된 잔차 벡터 양자화(RVQ) 아키텍처를 활용합니다. 텍스트와 오디오 컨텍스트를 모두 조건으로 삼아 MisoTTS는 화자의 어조에 동적으로 반응할 수 있습니다. Miso Labs는 Sesame의 300ms, ElevenLabs의 700ms와 비교하여 110ms의 지연 시간을 주장하지만, 현재 이 모델은 반이중(half-duplex), 단일 턴 상호작용으로 제한됩니다.

  • 오픈 웨이트로 수정된 MIT 라이선스 하에 출시.
  • 80억 파라미터(77억 백본, 3억 디코더) 구성.
  • 32개의 오디오 코드북을 갖춘 잔차 벡터 양자화(RVQ) 아키텍처 활용.
  • 화자의 어조에 반응하기 위해 텍스트와 오디오 컨텍스트를 모두 조건으로 사용.
  • Sesame의 300ms, ElevenLabs의 700ms와 비교하여 110ms의 지연 시간 주장.

개발자가 ElevenLabs의 700ms 대비 110ms의 지연 시간을 자랑하는 매우 반응성이 뛰어난 음성 에이전트를 구축할 수 있게 합니다.

SOURCES

6. NVIDIA, 로컬 UI 및 객체 접지(Grounding)를 위한 LocateAnything 3B 출시

NVIDIA가 UI 및 객체 접지(grounding)를 위해 로컬에서 실행되도록 설계된 경량 모델 LocateAnything 3B를 출시했습니다. 이 모델은 접지, OCR, UI 이해를 결합하여 자연어 언어 설명에 따라 객체, 버튼 또는 텍스트를 즉시 찾습니다. 빠른 온디바이스 자동화 및 인터페이스 상호작용을 지원하기 위해 로컬 배포에 최적화되어 있습니다.

  • 로컬에서 실행되도록 설계된 30억 파라미터 모델.
  • 접지, OCR 및 UI 이해 결합.
  • 언어적 설명에 따라 객체, 버튼 또는 텍스트를 즉시 탐색.

개발자가 클라우드 API에 의존하지 않고 사용자 인터페이스 및 문서와 상호작용할 수 있는 빠르고 로컬인 에이전트 워크플로우를 구축할 수 있게 합니다.

SOURCES

7. BeeLlama v0.3.1, 업스트림 llama.cpp 기능 및 DFlash 속도 향상 통합

BeeLlama 버전 0.3.0 및 0.3.1이 업스트림 llama.cpp와 정렬된 아키텍처 업데이트와 함께 출시되었습니다. 이번 업데이트는 다중 토큰 예측(MTP) 및 Gemma 4 12B 지원과 같은 기능을 통합하고, 멀티 슬롯 및 멀티 GPU 구성을 처리하도록 DFlash를 개선했습니다. 또한 q6_0 KV 캐시와 TQ3_1S 및 TQ4_1S 모델 양자화 옵션에 대한 지원을 추가하여 모든 주요 플랫폼에 대한 사전 빌드된 바이너리와 Docker 이미지를 제공합니다.

  • 업스트림 llama.cpp와 정렬 및 다중 토큰 예측(MTP) 통합.
  • Gemma 4 12B 및 q6_0 KV 캐시 지원 추가.
  • 멀티 슬롯 및 멀티 GPU 구성을 처리하도록 DFlash 개선.
  • 단일 RTX 3090에서 Qwen 3.6 27B 및 Gemma 4 31B에 대해 최대 4.93배 속도 향상 달성.
  • 모든 주요 플랫폼에 대한 사전 빌드된 바이너리 및 Docker 이미지 제공.

로컬 모델을 실행하는 개발자는 단일 RTX 3090과 같은 소비자용 하드웨어에서 Qwen 3.6 27B 및 Gemma 4 31B에 대해 최대 4.93배의 속도 향상을 누릴 수 있습니다.

SOURCES

8. Anthropic, Claude Code를 위한 보안 격리 및 샌드박싱 상세 설명

Anthropic이 Claude Code 및 Claude Cowork와 같은 에이전트 제품을 격리하기 위한 보안 관행을 상세히 설명했습니다. 사용자 오용, 모델 오작동, 외부 공격과 같은 위험을 완화하기 위해 Claude Code는 OS 수준 샌드박싱(macOS의 Seatbelt 및 Linux의 bubblewrap)을 활용하며, 이를 통해 권한 프롬프트를 84% 줄였습니다. Anthropic은 또한 신뢰 경계를 설정하기 전에 프로젝트 로컬 구성이 구문 분석되었던 과거 취약점을 공개했으며, 내부 레드팀 연습을 통해 직원이 피싱을 당해 Claude Code를 통해 AWS 자격 증명이 유출될 수 있음을 입증했습니다.

  • Claude Code는 OS 수준 샌드박싱(macOS의 Seatbelt, Linux의 bubblewrap)을 활용하여 권한 프롬프트를 84% 감소.
  • Claude Code 자동 모드는 실행 전 과도한 에이전트 동작의 약 83%를 포착하도록 설계됨.
  • 사용자 신뢰 경계를 설정하기 전에 프로젝트 로컬 구성이 구문 분석되었던 과거 취약점 공개.
  • 내부 레드팀 연습을 통해 직원이 피싱을 당해 Claude Code를 통해 AWS 자격 증명이 유출될 수 있음을 입증.
  • Claude Cowork는 macOS의 Apple 가상화 프레임워크 또는 Windows의 HCS를 사용하는 전체 가상 머신 아키텍처를 채택.

Claude Code를 로컬에서 실행하는 개발자에게 프로젝트 로컬 구성의 과거 취약점과 환경 계층 격리의 중요성을 강조하며 중요한 보안 맥락을 제공합니다.

SOURCES

9. Gradio 6.16.0 출시, 보안 패치 및 MCP 업데이트 포함

Gradio 버전 6.16.0이 출시되어 GRADIO_HEARTBEAT_INTERVAL 환경 변수를 통한 구성 가능한 하트비트 기능이 도입되었으며, MCP 엔드포인트가 브라우저 랜딩 페이지를 표시하도록 업데이트되었습니다. 이번 릴리스는 gr.FileExplorer의 경로 탐색(path traversal), OAuth의 오픈 리다이렉트 우회, 이미지, 갤러리 및 오디오 후처리의 SSRF에 대한 중요한 보안 패치를 구현합니다. 또한 Dataframe 및 Tabs 브라우저 멈춤 현상에 대한 버그 수정도 포함되어 있습니다.

  • gr.FileExplorer의 경로 탐색 및 OAuth의 오픈 리다이렉트 우회 패치.
  • 이미지, 갤러리 및 오디오 후처리의 SSRF 패치.
  • GRADIO_HEARTBEAT_INTERVAL 환경 변수를 통한 구성 가능한 하트비트 도입.
  • 브라우저를 통해 방문할 때 랜딩 페이지를 표시하도록 MCP 엔드포인트 업데이트.
  • Dataframe 및 Tabs의 브라우저 멈춤 현상 수정.

Gradio를 사용하는 개발자는 FileExplorer의 경로 탐색 및 이미지/오디오 후처리의 SSRF를 포함한 취약점을 패치하기 위해 업데이트해야 합니다.

SOURCES

10. NVIDIA, 간접 프롬프트 주입 테스트를 위한 에이전트 안전 데이터셋 출시

NVIDIA가 1,272개의 합성 레드팀 기록으로 구성된 에이전트 안전 데이터셋을 Hugging Face에 출시했습니다. 이 데이터셋은 9개의 서로 다른 엔터프라이즈 도메인을 다루며, 도구 사용 에이전트가 도구 반환 데이터 내에 숨겨진 간접 프롬프트 주입에 저항하는 능력을 테스트하도록 설계되었습니다.

  • 1,272개의 합성 레드팀 기록으로 구성.
  • 9개의 서로 다른 엔터프라이즈 도메인 포함.
  • 도구 반환 데이터에 숨겨진 간접 프롬프트 주입에 대한 저항력을 테스트하도록 설계.
  • Hugging Face 플랫폼에 게시.

개발자에게 검색된 데이터에 숨겨진 간접 프롬프트 주입에 대해 도구 사용 에이전트를 평가하고 강화할 수 있는 구체적인 데이터셋을 제공합니다.

SOURCES

11. 다국어 음성 채팅을 위한 Higgs Audio v3 TTS 4B 출시

Higgs Audio v3 TTS 4B는 음성 채팅 애플리케이션을 위해 특별히 구축된 텍스트 음성 변환 모델입니다. 이 모델은 100개 언어를 지원하며 인라인 제어 기능을 포함하여 개발자가 매우 상호작용적이고 다국어 대화형 오디오 인터페이스를 구축할 수 있도록 합니다.

  • 40억 파라미터 텍스트 음성 변환 모델.
  • 음성 채팅 애플리케이션을 위해 특별히 구축.
  • 100개 언어 지원.
  • 인라인 제어 지원 포함.

개발자에게 실시간 대화형 오디오 인터페이스에 최적화된 경량의 다국어 모델을 제공합니다.

SOURCES

12. Alibaba, 빠른 이미지 생성을 위한 Qwen-Image-Flash 출시

Alibaba가 빠르고 고품질의 텍스트-이미지 생성 및 지침 기반 편집을 위해 설계된 모델 Qwen-Image-Flash를 출시했습니다. 이 모델은 고성능과 낮은 지연 시간을 달성하기 위해 소수 단계 증류(few-step distillation), 데이터 구성, 교사 지침 및 작업 혼합을 활용합니다.

  • 빠르고 고품질의 텍스트-이미지 생성을 위해 설계.
  • 지침 기반 이미지 편집 지원.
  • 소수 단계 증류, 데이터 구성, 교사 지침 및 작업 혼합 활용.

애플리케이션에 이미지 생성 및 편집 기능을 통합하는 개발자에게 가볍고 빠른 옵션을 제공합니다.

SOURCES

13. SynthTraces 출시, 합성 코딩 에이전트 세션 추적 생성

SynthTraces는 Pi를 사용하여 합성 코딩 에이전트 세션 추적을 생성하도록 설계된 새로운 최소 코드베이스입니다. 이 프로젝트는 오픈소스 Hugging Face 프로젝트에 대한 읽기 및 bash 액세스 권한을 가진 코딩 에이전트로서 오픈 모델이 작동하고, llama.cpp에서 실행되는 작은 로컬 모델이 에이전트에게 프롬프트를 제공하는 인간 사용자 역할을 하는 하네스를 사용합니다. 이 프로젝트는 LLM 학습 또는 미세 조정을 위해 2,000개 이상의 세션 추적을 생성하여 Hugging Face에 게시했습니다.

  • 합성 코딩 에이전트 세션 추적 생성을 위한 최소 코드베이스.
  • 읽기 및 bash 액세스 권한을 가진 코딩 에이전트로 오픈 모델 사용.
  • 인간 사용자 역할을 하기 위해 llama.cpp에서 실행되는 로컬 모델 사용.
  • Hugging Face에 게시된 2,000개 이상의 Pi 세션 추적 생성.

개발자에게 자체적인 작업별 LLM 및 코딩 에이전트를 학습하거나 미세 조정할 수 있는 2,000개 이상의 세션 추적 데이터셋을 제공합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.