Inference Brew

Shanghai AI Lab, Intern-S2-397B 멀티모달 모델 공개

00:00 / --:--

← 메인으로

Shanghai AI Lab, Intern-S2-397B 멀티모달 모델 공개

1. Shanghai AI Lab, Intern-S2-397B 멀티모달 모델 공개

Shanghai AI Lab은 과학적 지능과 장기 에이전트 작업에 특화된 새로운 오픈 웨이트 멀티모달 파운데이션 모델인 Intern-S2-397B를 공개했습니다. 이 모델은 과학 문헌의 원본 페이지를 직접 학습하여 복잡한 시각적 관계와 기호 의미론을 포착하는 독특한 비전-언어 사전 학습 패러다임을 사용합니다. 20개 이상의 과학 분야에서 학습되었으며 샌드박스 환경에서의 블랙박스 에이전트 강화 학습을 통해 최적화된 Intern-S2-397B는 생체 분자 상호작용 설계 및 재료 구조 생성과 같은 전문 작업에서 뛰어난 성능을 발휘하도록 설계되었습니다.

  • • Intern-S2-397B는 과학적 지능과 장기 에이전트 작업을 위해 설계된 새로운 멀티모달 파운데이션 모델입니다.
  • • 이 모델은 과학 문헌의 원본 페이지를 직접 학습하여 기호 의미론을 모델링하는 비전-언어 사전 학습 패러다임을 활용합니다.
  • • 생체 분자 설계를 포함한 20개 이상의 분야에서 다양한 과학적 강화 학습 작업을 통해 학습되었습니다.
  • • 일반화 성능을 향상하기 위해 샌드박스 환경에서 블랙박스 에이전트 강화 학습을 사용합니다.
  • • 사전 학습, 강화 학습 작업 범위, 대화형 에이전트 환경이라는 세 가지 차원에서 확장성을 갖췄습니다.

복잡한 과학적 추론과 샌드박스 에이전트 환경을 처리할 수 있는 대규모 오픈 웨이트 모델을 개발자들에게 제공합니다.

SOURCES

2. AWS, 백그라운드 AI 에이전트를 위한 오픈소스 받은 편지함 'Pizza Bot' 출시

AWS는 백그라운드 AI 에이전트를 관리하기 위해 설계된 오픈소스 자체 호스팅 애플리케이션인 Pizza Bot을 출시했습니다. Apache 2.0 라이선스로 제공되는 Pizza Bot은 작업 결과, 스레드 기록, 보류 중인 결정을 정리할 수 있는 이메일 스타일의 받은 편지함 인터페이스를 제공합니다. DeepAgents와 LangGraph를 기반으로 구축된 이 시스템은 MCP 서버를 통해 외부 도구에 대한 인간의 승인 과정을 지원하며 Bedrock, Anthropic, Gemini, OpenAI, OpenRouter, Ollama 등 주요 모델 제공업체와 통합됩니다.

  • • Pizza Bot은 Apache 2.0 라이선스의 오픈소스 자체 호스팅 애플리케이션으로 macOS, Windows, Linux용 데스크톱 빌드를 지원합니다.
  • • 이 애플리케이션은 AI 작업 결과와 보류 중인 결정을 스레드 기록 및 완료된 작업 범주가 포함된 이메일 스타일의 받은 편지함으로 정리합니다.
  • • 상태 유지 실행을 위해 DeepAgents와 LangGraph를 활용하며, 체크포인트를 사용하여 스레드 상태와 승인 대기 상태를 유지합니다.
  • • Amazon Bedrock, Anthropic, Google Gemini, OpenAI, OpenRouter, Ollama 등 다양한 모델 제공업체와 호환됩니다.
  • • 사용자는 MCP 서버를 통해 외부 도구를 관리하고 제안된 작업을 승인, 편집 또는 거부하는 정책을 구성할 수 있습니다.
  • • 데스크톱 클라이언트가 종료되어도 작업이 계속 실행되려면 상시 가동되는 백엔드가 필요합니다.

개발자들에게 백그라운드 에이전트를 모니터링하고, 보류 중인 작업을 검토하며, 도구 실행 정책을 관리할 수 있는 즉시 사용 가능한 자체 호스팅 대시보드를 제공합니다.

SOURCES

3. 장기 에이전트를 위한 새로운 컨텍스트 엔지니어링 패턴

자율 에이전트가 장기 작업에서 성능 저하를 겪음에 따라 업계는 단순한 브레드크럼 워크플로우를 넘어 더욱 강력한 컨텍스트 엔지니어링으로 이동하고 있습니다. 새로운 개발 사항으로는 OpenAI의 서버 측 컨텍스트 캐싱, AWS AgentCore의 병렬 MicroVM 서브에이전트 아키텍처, Deep Agents의 특수 파일 시스템 오프로딩 등이 있으며, 이를 통해 개발자는 에이전트의 집중력을 유지하고 비용을 제어할 수 있는 보다 효과적인 도구를 확보하게 되었습니다.

  • • OpenAI의 Responses API는 이제 'context_caching'을 통한 서버 측 압축 기능을 포함합니다.
  • • AWS AgentCore는 병렬 MicroVM 서브에이전트를 활용하여 작업 런타임을 최대 3배까지 단축합니다.
  • • Deep Agents는 20,000 토큰을 초과하는 도구 응답에 대해 파일 시스템 오프로딩을 구현합니다.
  • • Claude Code는 아키텍처 결정을 보존하기 위해 선택적 압축 기능을 지속적으로 개선하고 있습니다.

이러한 발전은 개발자들에게 이전에 확인된 실험적인 '브레드크럼' 접근 방식을 넘어 컨텍스트 윈도우 제한을 완화할 수 있는 표준화되고 확장 가능한 아키텍처 패턴을 제공합니다.

SOURCES

4. Llama.cpp 포크, 핫스왑 가능한 추측 디코딩 및 적응형 KV 스트리밍 추가

Raymond의 llama.cpp KV 캐시 스트리밍 프로젝트의 새로운 포크가 출시되어 적응형 KV 스트리밍과 핫스왑 가능한 추측 디코딩을 도입했습니다. 제한된 하드웨어에서 성능을 극대화하도록 설계된 이 시스템은 VRAM 용량을 초과할 경우 호스트 RAM에서 컨텍스트를 스트리밍하는 VRAM 메모리 풀을 사용합니다. 특히 컨텍스트가 높을 때 추측 모델(MTP 또는 DFlash2 등)을 동적으로 제거하고 컨텍스트가 낮을 때 다시 로드할 수 있어 16GB GPU에서 Qwen 3.8 27B와 같은 모델을 더 빠르게 로컬 실행할 수 있습니다.

  • • 이 포크는 Raymond의 llama.cpp KV 캐시 스트리밍 프로젝트에 핫스왑 가능한 추측 디코딩 기능을 추가했습니다.
  • • VRAM 용량을 초과할 때 호스트 RAM에서 컨텍스트를 스트리밍하는 VRAM 메모리 풀을 사용하여 표준 오프로딩보다 뛰어난 성능을 제공합니다.
  • • 컨텍스트가 높을 때 추측 모델(MTP 또는 DFlash2 등)을 제거하고 낮을 때 다시 로드할 수 있는 시스템을 제공합니다.
  • • 이 구현은 16GB 5060Ti GPU에서 Qwen 3.8 27B UD-IQ4_XS 모델을 사용하여 테스트되었습니다.
  • • 프로젝트 저장소는 https://github.com/troed/llama.cpp-adaptive-kv-streaming에서 공개적으로 호스팅됩니다.

개발자가 메모리 제약이 있는 하드웨어에서도 더 큰 모델을 더 높은 성능으로 로컬에서 실행할 수 있게 합니다.

SOURCES

5. VLLM 구성으로 RTX 3090에서 고속 Qwen3.8 27B 추론 가능

개발자 벤치마크에 따르면 vLLM 0.27.1에서 Qwen3.8-27B-int4-AutoRound 모델을 실행하면 단일 RTX 3090 GPU에서 고속 로컬 추론이 가능합니다. FP8 E4M3 KV 캐시를 구성함으로써 이 설정은 147,456 토큰의 방대한 컨텍스트 윈도우를 지원하며, 평균 프리필 속도 초당 871.93 토큰, 디코딩 속도 초당 38.39 토큰을 제공합니다. 이 모델은 접두사 캐싱(prefix caching) 및 bfloat16 정밀도와 같은 최적화된 vLLM 플래그를 활용하여 도구 호출 및 지시 이행을 위한 BenchLocal-CLI 벤치마크에서 94.7%의 점수를 기록했습니다.

  • • 벤치마크는 RTX 3090 GPU가 장착된 WSL2 환경의 vLLM 0.27.1에서 Qwen3.8-27B-int4-AutoRound를 사용하여 수행되었습니다.
  • • 이 구성은 FP8 E4M3 KV 캐시를 사용하여 147,456 토큰의 컨텍스트 윈도우를 지원했습니다.
  • • 프리필 성능은 평균 초당 871.93 토큰, 디코딩 성능은 평균 초당 38.39 토큰을 기록했습니다.
  • • 이 모델은 도구 호출, 지시 이행 및 추론을 테스트하는 BenchLocal-CLI 벤치마크에서 71/75(94.7%)의 점수를 달성했습니다.
  • • 사용된 주요 vLLM 설정은 --dtype bfloat16, --gpu-memory-utilization 0.9475, --enable-prefix-caching입니다.

개발자가 일반 소비자용 하드웨어에서 144K 컨텍스트 윈도우를 갖춘 27B 모델을 실행할 수 있는 구체적이고 고도로 최적화된 구성을 제공합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.