Inference Brew

Anthropic, Claude Fable 5 및 Mythos 5 재배포 및 사용 할당량 적용

00:00 / --:--

← 메인으로

Anthropic, Claude Fable 5 및 Mythos 5 재배포 및 사용 할당량 적용

1. Anthropic, Claude Fable 5 및 Mythos 5 재배포 및 사용 할당량 적용

최근 미국 수출 통제 조치가 해제됨에 따라 Anthropic은 Claude Fable 5와 Mythos 5 모델을 공식적으로 재배포했습니다. Fable 5는 현재 주간 사용량의 50%로 제한되며, 7월 7일 이후에는 크레딧 기반 모델로 전환될 예정입니다. 또한, Mythos 5에 대한 접근 권한이 일부 미국 조직으로 확대되었으며, Anthropic은 정부와 협력하여 Glasswing 프로그램을 통해 국내외 파트너들에게 가용성을 넓히고 있습니다.

  • Claude Fable 5와 Mythos 5가 공식적으로 재배포되었습니다.
  • Fable 5 사용량은 7월 7일 크레딧 기반 시스템으로 전환되기 전까지 주간 한도의 50%로 제한됩니다.
  • Mythos 5에 대한 접근 권한이 일부 미국 조직으로 확대되고 있습니다.
  • Anthropic은 미국 정부와 협력하여 Glasswing 프로그램의 국제 파트너들에게 Mythos 5 접근 권한을 확대하고 있습니다.

개발자들은 이제 두 모델을 다시 프로덕션 환경에서 사용할 수 있게 되었으나, 새로운 사용 할당량과 Mythos 5 모델에 대한 업데이트된 접근 경로를 고려해야 합니다.

SOURCES

2. Google, LM Arena에서 Gemini 3.5 Flash의 후속 모델 테스트 시작

Google은 LM Arena 플랫폼에서 Gemini Flash 모델의 업그레이드 버전을 테스트하고 있으며, 이는 최근 출시된 Gemini 3.5 Flash의 후속 모델일 가능성을 시사합니다. LM Arena 테스트는 관례적으로 공식 공개 이전에 진행되므로, 이번 개발은 Google이 고속 및 비용 효율적인 모델 계층을 위해 Gemini 3.6 또는 4 Flash로 추정되는 새로운 버전을 준비 중임을 나타냅니다.

  • 업그레이드된 Gemini Flash 모델이 현재 LM Arena 플랫폼에서 테스트 중입니다.
  • 이번 테스트는 최근 Gemini 3.5 Flash 출시 이후에 진행되었습니다.
  • LM Arena 활동은 역사적으로 Google의 공식 모델 출시 전조 역할을 해왔습니다.
  • 새로운 모델은 현재 3.5 Flash 버전보다 점진적인 성능 향상을 제공할 것으로 예상됩니다.

대규모 API 트래픽에 Gemini 3.5 Flash를 사용하는 개발자들은 이번 테스트가 Google의 저지연 모델 로드맵에서 다음 성능 업그레이드를 예고하는 만큼 주의 깊게 지켜봐야 합니다.

SOURCES

3. Kimi K2.7 Code, GitHub Copilot에서 정식 사용 가능

2026년 6월 12일 오픈 웨이트 모델로 처음 출시된 Kimi K2.7 Code가 이제 GitHub Copilot 내에서 정식으로 사용 가능합니다. 이번 통합을 통해 개발자는 IDE에서 직접 모델을 선택할 수 있으며, 사용량은 Microsoft Azure를 통해 청구됩니다. 이 기능은 Copilot Pro, Pro+, Max 플랜에서 활성화되며, Business 및 Enterprise 사용자는 관리자 정책을 통해 활성화해야 합니다.

  • 이전에 오픈 웨이트 모델로 출시된 Kimi K2.7 Code를 이제 GitHub Copilot 모델 선택기에서 사용할 수 있습니다.
  • 통합은 Microsoft Azure에서 호스팅되며 사용량 기반으로 과금됩니다.
  • VS Code, Visual Studio, JetBrains, Xcode, Eclipse 등 주요 IDE 전반의 Copilot Pro, Pro+, Max 플랜을 지원합니다.
  • Business 및 Enterprise 사용자는 모델에 접근하기 위해 수동으로 정책을 활성화해야 합니다.

이번 통합으로 개발자들은 오픈 소스 가중치를 수동으로 배포할 필요 없이 기존 IDE 워크플로우 내에서 Kimi K2.7 Code 모델에 직접 접근할 수 있는 간소화된 방법을 얻게 되었습니다.

SOURCES

4. 개발자, 창의적 글쓰기 및 카피라이팅을 위해 Gemma-4-31B 파인튜닝

개발자 akwin123은 직접 반응형 카피라이팅과 창의적 글쓰기에 최적화된 Gemma-4-31B-it 모델의 파인튜닝 버전을 출시했습니다. 마케팅 브리프와 실제 광고 데이터셋을 활용해 QLoRA SFT 방식으로 학습된 이 모델은 커스텀 EQ-Bench 3 벤치마크에서 1657 Elo를 기록하며 기본 모델 대비 290점 향상된 성능을 보였습니다. 최종 가중치는 전체 bf16으로 병합되었으며 256K 컨텍스트 윈도우를 지원합니다. Hugging Face에서 이용 가능하며, 개발자는 최적의 창의적 결과물을 위해 사고 모드(thinking mode)를 비활성화할 것을 권장합니다.

  • Gemma-4-31B-it 모델은 마케팅 브리프와 실제 광고 예시 데이터셋을 활용해 QLoRA SFT 방식으로 파인튜닝되었습니다.
  • 파인튜닝된 모델은 커스텀 EQ-Bench 3 벤치마크에서 기본 모델의 1367점 대비 1657점의 Elo 점수를 기록했습니다.
  • DeepSeek V4 Flash가 블라인드 테스트한 30개의 일대일 테스트 사례 중 24개(80%)에서 승리했습니다.
  • 최종 모델 가중치는 전체 bf16으로 병합되었으며 256K 컨텍스트 윈도우를 지원하고 Hugging Face에서 이용 가능합니다.
  • 개발자는 최적의 출력 품질을 위해 사고 모드(enable_thinking = false)를 비활성화할 것을 권장합니다.

마케팅이나 창의적 글쓰기 애플리케이션을 구축하는 개발자들은 일반적인 AI 전문 용어를 줄이고 감성 지능을 향상시키기 위해 특별히 최적화된 오픈 웨이트 모델을 다운로드할 수 있습니다.

SOURCES

5. Fijik 2.0 350m, Apache-2.0 라이선스로 출시

개발자 'Fijik'은 Granite 4 350M 아키텍처를 기반으로 한 소형 오픈 웨이트 모델인 Fijik 2.0 350m을 출시했습니다. Apache-2.0 라이선스로 배포된 이 모델은 60억 개의 토큰으로 지속적인 사전 학습을 거쳤으며, 혼합 추론 노력이 포함된 커스텀 SFT 데이터셋으로 사후 학습되었습니다. Hugging Face에서 Safetensors 및 GGUF 형식으로 제공되며, 제약이 많은 환경에 최적화되어 있습니다. 다만, 파라미터 크기가 작아 웹 검색 도구와 함께 사용할 것을 권장합니다.

  • Fijik 2.0 350m은 Granite 4 350M 아키텍처를 기반으로 하며 Apache-2.0 라이선스로 출시되었습니다.
  • 이 모델은 2025년 8월까지의 지식 컷오프를 포함하여 60억 개의 토큰으로 지속적인 사전 학습을 거쳤습니다.
  • 혼합 추론 노력이 포함된 커스텀 SFT 데이터셋으로 사후 학습을 진행했습니다.
  • Hugging Face에서 Safetensors 및 GGUF 형식으로 이용 가능합니다.
  • 파라미터 크기가 작아 웹 검색 도구와 함께 사용할 것을 권장합니다.

매우 제한적인 로컬 환경이나 웹 검색 보조 작업에 적합한 소형 오픈 라이선스 모델을 제공합니다.

SOURCES

6. Manufact, Model Context Protocol 앱을 위한 MCP 클라우드 플랫폼 출시

YC 지원 스타트업인 Manufact는 Model Context Protocol(MCP) 생태계 전용 클라우드 플랫폼을 출시했습니다. Next.js와 Vercel의 관계와 유사하게 MCP를 위한 수직적 클라우드로 자리매김한 Manufact는 개발 팀이 MCP 앱과 서버를 구축, 테스트, 모니터링 및 배포할 수 있게 합니다. 이 플랫폼은 GitHub 통합, 실험적 브랜치에 대한 미리보기 배포, ChatGPT 및 Claude 전반의 자동화된 테스트, AI 클라이언트 인터페이스 내에서 직접 맞춤형 브랜딩을 표시하는 대화형 UI 지원 기능을 제공합니다.

  • Manufact는 Model Context Protocol(MCP) 앱과 서버를 구축, 테스트, 모니터링 및 배포하기 위해 설계된 클라우드 플랫폼입니다.
  • 이 플랫폼은 MCP 수직 클라우드로서 GitHub 통합, 미리보기 배포 및 MCP 전용 분석 기능을 제공합니다.
  • ChatGPT 및 Claude와 같은 주요 클라이언트 전반의 자동화된 테스트를 지원합니다.
  • MCP 서버는 대화형 UI를 반환할 수 있어 기업이 AI 제품 내에서 직접 데이터와 브랜딩을 표시할 수 있습니다.
  • 창립자들은 이전에 mcp-use라는 이름으로 운영되었으며 MCP를 위한 오픈 소스 SDK를 유지 관리하고 있습니다.

MCP 서버를 위한 Vercel과 같은 배포 및 테스트 워크플로우를 제공하여 ChatGPT와 Claude를 위한 대화형 도구를 더 쉽게 구축하고 배포할 수 있게 합니다.

SOURCES

7. Alibaba, 브라우저 내 GUI 자동화를 위한 Page Agent 오픈 소스 공개

Alibaba는 페이지 내 브라우저 자동화를 위해 설계된 TypeScript 기반 JavaScript 라이브러리인 Page Agent를 오픈 소스로 공개했습니다. Selenium이나 Playwright와 같은 외부 도구와 달리, Page Agent는 브라우저 세션 내에서 직접 실행되어 사용자의 활성 쿠키, 인증 및 세션 상태를 상속받습니다. 'DOM 탈수' 기술을 사용하여 라이브 DOM을 압축된 텍스트 맵으로 변환함으로써, 모든 OpenAI 호환 엔드포인트를 통해 표준 텍스트 기반 LLM으로 인터페이스를 자동화할 수 있습니다.

  • Page Agent는 MIT 라이선스로 출시된 오픈 소스 TypeScript 기반 JavaScript 라이브러리입니다.
  • 라이브러리는 브라우저 세션 내에서 실행되어 사용자의 쿠키, 인증 및 세션 상태를 상속받습니다.
  • 'DOM 탈수' 기술을 사용하여 라이브 DOM을 텍스트 맵으로 변환함으로써 텍스트 전용 LLM과의 호환성을 가능하게 합니다.
  • 모델에 구애받지 않으며 모든 OpenAI 호환 엔드포인트를 지원합니다.
  • 단일 페이지 상호작용으로 제한되며 프롬프트 기반 안전성에 의존하므로 민감한 작업에는 서버 측 검증이 필요합니다.

외부 자동화 도구를 거치지 않고 사용자의 활성 세션, 쿠키 및 인증 상태를 직접 상속받는 AI 코파일럿을 구축할 수 있습니다.

SOURCES

8. Alibaba의 SkillWeaver, 에이전트 토큰 소비량 99% 절감

Alibaba의 연구원들은 복잡한 엔터프라이즈 AI 워크플로우에서 하위 작업을 적절한 도구로 라우팅하도록 설계된 오픈 소스 프레임워크인 SkillWeaver를 개발했습니다. LLM에 전체 도구 라이브러리를 노출하는 대신 검색 및 라우팅 방식을 채택하여 컨텍스트 윈도우 소비량을 99% 이상 줄였습니다. 이 프레임워크는 3단계 프로세스를 통해 병렬 실행을 위한 비순환 방향 그래프(DAG)를 생성하며, 7B 모델의 작업 분해 정확도를 51.0%에서 67.7%로 높이는 피드백 루프를 도입했습니다.

  • SkillWeaver는 3단계 프로세스(분해, 검색, 구성)를 사용하여 다단계 작업을 위한 실행 그래프를 생성합니다.
  • 프레임워크는 검색된 도구를 기반으로 작업 분해를 개선하는 피드백 루프인 Skill-Aware Decomposition(SAD)을 도입했습니다.
  • SAD 피드백 루프를 활성화하면 7B 모델의 분해 정확도가 51.0%에서 67.7%로 향상되었습니다.
  • 검색 및 라우팅 방식은 전체 도구 라이브러리를 노출하는 것보다 컨텍스트 윈도우 소비량을 99% 이상 줄였습니다.
  • 프레임워크는 의존성을 매핑하고 병렬 실행을 가능하게 하기 위해 비순환 방향 그래프(DAG)를 생성합니다.

컨텍스트 윈도우를 소진하거나 막대한 토큰 비용을 지불하지 않고도 수천 개의 도구를 사용하는 복잡한 에이전트 워크플로우를 구축할 수 있습니다.

SOURCES

9. Z.ai, GLM-5.2를 위한 ZCode 에이전트 개발 환경 출시

Z.ai(구 Zhipu AI)는 Cursor 및 Claude Code와 경쟁하기 위해 설계된 무료 데스크톱 애플리케이션 ZCode를 출시했습니다. 새로 오픈 소스로 공개된 GLM-5.2 모델을 위한 에이전트 개발 환경으로 구축된 ZCode는 macOS, Windows 및 Linux에서 실행됩니다. 기반이 되는 GLM-5.2 모델은 Huawei 실리콘에서 완전히 학습되었으며 MIT 라이선스로 출시된 7,440억 파라미터 규모의 전문가 혼합 모델입니다. ZCode는 API 키 설정을 통해 타사 모델도 지원하며, WeChat 및 Telegram과 같은 메시징 플랫폼과의 고유한 원격 제어 통합 기능을 제공합니다.

  • ZCode는 macOS, Windows 및 Linux에서 사용할 수 있는 무료 데스크톱 에이전트 개발 환경입니다.
  • 이 환경은 100만 토큰 컨텍스트 윈도우를 가진 7,440억 파라미터 규모의 전문가 혼합 모델인 GLM-5.2를 위해 설계되었습니다.
  • Z.ai는 6월 16일 Hugging Face에 GLM-5.2 오픈 소스 가중치를 MIT 라이선스로 출시했습니다.
  • ZCode는 타사 모델을 위한 API 키 설정 구성을 지원합니다.
  • 이 환경은 WeChat, Feishu 또는 Telegram을 통한 원격 제어 기능을 제공하여 모바일에서 코딩 작업을 관리할 수 있습니다.

개발자들에게 GLM-5.2로 구축할 수 있는 무료 크로스 플랫폼 데스크톱 환경을 제공하며, 메시징 앱을 통한 원격 제어 기능과 타사 모델 지원을 포함합니다.

SOURCES

10. 오픈 소스 claude-real-video, LLM 분석을 위한 비디오 콘텐츠 준비

오픈 소스 도구인 `claude-real-video`가 개발자들이 LLM 분석을 위해 비디오 콘텐츠를 준비할 수 있도록 돕기 위해 MIT 라이선스로 출시되었습니다. 고정된 시간 간격 대신, 이 Python 기반 도구는 장면 변화와 밀도 하한을 기준으로 프레임을 추출하여 중복에 가까운 프레임을 제거함으로써 컨텍스트 윈도우 사용을 최적화합니다. 또한 Whisper나 기존 자막을 사용하여 오디오를 전사하고, 멀티모달 LLM과 호환되는 프레임, 전사본 및 매니페스트 파일이 포함된 구조화된 폴더를 출력합니다.

  • claude-real-video는 MIT 라이선스로 출시된 오픈 소스 Python 도구입니다.
  • 이 도구는 고정된 시간 간격이 아닌 장면 변화와 밀도 하한을 기준으로 프레임을 추출하여 중복을 제거하고 컨텍스트를 절약합니다.
  • 기존 자막이나 Whisper CLI를 사용하여 오디오를 전사하고 구조화된 매니페스트를 생성합니다.
  • 로컬 파일뿐만 아니라 YouTube, Instagram, TikTok의 URL을 지원합니다.
  • Python 3.10+, ffmpeg, ffprobe가 필요합니다.

중복 프레임을 제거하고 전사본을 정렬하여 로컬 파일이나 URL(YouTube, TikTok)의 비디오 콘텐츠를 LLM에 쉽게 입력할 수 있게 합니다.

SOURCES

11. Rust 기반 CLI 도구 'ctx', 코딩 에이전트를 위한 로컬 메모리 제공

코딩 에이전트에게 장기 기억을 제공하기 위해 `ctx`라는 새로운 Rust 기반 CLI 도구가 출시되었습니다. 전사본과 로그를 로컬 SQLite 데이터베이스로 수집함으로써, `ctx`는 순위가 지정된 텍스트 매칭을 사용하여 에이전트가 복잡한 그래프 데이터베이스나 외부 호스팅 메모리 API 없이도 과거 세션을 검색할 수 있게 합니다. 이 로컬 설정을 통해 개발자는 새로운 작업을 시작하기 전에 과거의 실패와 성공적인 해결 방법을 코딩 도구에 브리핑하는 기록 연구 하위 에이전트를 구현할 수 있습니다.

  • ctx는 로컬 SQLite 데이터베이스를 사용하여 코딩 에이전트에 장기 기억을 제공하는 Rust CLI 도구입니다.
  • 이 도구는 검색을 위해 순위가 지정된 텍스트 매칭을 사용하여 그래프 데이터베이스나 호스팅된 메모리 서비스가 필요 없습니다.
  • 개발자는 새로운 작업을 시작하기 전에 과거 세션에 대한 브리핑을 준비하는 에이전트 기록 연구 하위 에이전트를 구현할 수 있습니다.
  • 이 도구는 에이전트가 과거의 실패와 성공적인 해결 방법을 참조하여 반복되는 문제를 식별하고 해결하도록 돕습니다.
  • 공유하거나 풀 리퀘스트에 첨부할 수 있는 정리된 세션 전사본 생성을 지원합니다.

복잡한 그래프 데이터베이스나 호스팅된 메모리 서비스 없이도 코딩 에이전트가 과거 세션 기록과 해결 방법을 참조할 수 있게 합니다.

SOURCES

12. 오픈 소스 ghealth CLI, AI 에이전트를 위한 Google Health API 래핑

Fitbit Web API의 공식 후속 제품으로 `ghealth`라는 새로운 오픈 소스 CLI 도구가 출시되었습니다. Google Health API v4의 래퍼 역할을 하는 이 도구는 Apache 2.0 라이선스 하에 단일 Go 바이너리로 배포됩니다. Fitbit, Pixel Watch 및 타사 소스에서 검증된 40가지 데이터 유형을 구조화된 JSON으로 노출합니다. 터미널 및 AI 에이전트 통합을 위해 특별히 설계된 `ghealth`는 결정론적 종료 코드를 특징으로 하며, 설정 및 인증을 간소화하기 위한 두 개의 에이전트 스킬 파일을 포함합니다.

  • ghealth는 Apache 2.0 라이선스 하에 Google Health API v4의 래퍼 역할을 하는 오픈 소스 CLI 도구입니다.
  • 이 도구는 Fitbit Web API의 공식 후속 제품이며 인증을 위해 Google OAuth 2.0을 사용합니다.
  • 단일 Go 바이너리로 배포되며 40가지 검증된 데이터 유형을 구조화된 JSON으로 노출합니다.
  • CLI는 터미널 및 AI 에이전트 통합을 위해 설계된 결정론적 종료 코드와 간소화된 JSON 출력을 특징으로 합니다.
  • 인증, 설정 및 데이터 유형 문서화를 돕기 위한 두 개의 에이전트 스킬 파일을 포함합니다.

결정론적 종료 코드와 사전 구축된 에이전트 스킬 파일을 사용하여 구조화된 건강 및 피트니스 데이터를 AI 에이전트에 쉽게 입력할 수 있게 합니다.

SOURCES

13. FriendliAI, 코딩 에이전트를 위한 고속 추론 계층 제공

FriendliAI는 AI 에이전트 실행에 특별히 최적화된 추론 계층을 도입했습니다. 이 플랫폼은 GLM-5.2, MiniMax-M3, Kimi-K2.7을 포함한 여러 프론티어 모델을 지원하며, OpenRouter에서 GLM-5.1에 대해 가장 빠른 출력 속도를 제공한다고 주장합니다. 99.99% 가동 시간 SLA를 지원하는 FriendliAI의 인프라는 현재 Claude Code, Cursor, Kilo Code, Hermes Agents, Ollama와 같은 개발자 중심 서비스를 구동하고 있습니다.

  • FriendliAI는 AI 에이전트 실행을 위해 특별히 설계된 전용 추론 계층을 제공합니다.
  • 이 플랫폼은 OpenRouter에서 GLM-5.1 모델에 대해 가장 빠른 출력 속도를 제공한다고 주장합니다.
  • 지원되는 프론티어 모델에는 GLM-5.2, MiniMax-M3, Kimi-K2.7이 포함됩니다.
  • FriendliAI는 99.99% 가동 시간 서비스 수준 협약(SLA)을 제공합니다.
  • 이 플랫폼은 Claude Code, Cursor, Kilo Code, Hermes Agents 및 Ollama를 위한 백엔드 서비스를 구동합니다.

코딩 에이전트를 구축하는 개발자들은 Claude Code와 Cursor 같은 도구를 구동하기 위해 99.99% 가동 시간 SLA를 갖춘 빠르고 안정적인 추론 제공업체를 활용할 수 있습니다.

SOURCES

14. OpenLumara, 로컬 모델 통합을 위한 OpenAI 호환 API 브리지 추가

모듈형 에이전트 프레임워크로 처음 출시된 OpenLumara는 이제 OpenAI 호환 API 브리지를 포함합니다. 8000번 포트에서 작동하는 이 브리지는 KoboldLite나 OpenWebUI와 같은 프론트엔드 UI를 llama.cpp나 KoboldCPP와 같은 로컬 백엔드 엔진에 연결하여, 클라우드 중심 API 관례를 최적화된 로컬 성능과 사고 헤더 축소와 같은 토큰 절약 기능으로 대체합니다.

  • OpenLumara는 이제 8000번 포트에서 실행되는 OpenAI 호환 API 브리지를 특징으로 합니다.
  • 이 브리지는 KoboldLite 및 OpenWebUI와 같은 프론트엔드 UI를 llama.cpp 및 KoboldCPP와 같은 로컬 백엔드에 연결합니다.
  • 로컬 모델의 성능을 향상시키기 위해 클라우드 중심 API 관례를 대체합니다.
  • 토큰 사용량을 더욱 줄이기 위해 사고 헤더를 축소하는 특정 설정을 포함합니다.

이번 업데이트는 OpenLumara 생태계의 호환성을 넓혀 개발자들이 프레임워크의 토큰 효율성에 집중하면서도 표준 UI 도구를 로컬 모델과 함께 사용할 수 있게 합니다.

SOURCES

15. Thinking Machines Lab과 Bridgewater, 프론티어 LLM을 능가하는 오픈 웨이트 모델 파인튜닝

Mira Murati의 Thinking Machines Lab과 헤지펀드 Bridgewater Associates는 투자 뉴스 필터링을 위한 AI 평가 결과를 공동 발표했습니다. GPT, Claude, Gemini와 같은 프론티어 모델은 전문가 프롬프팅을 사용해도 70% 중반대에 머물렀지만, Bridgewater는 Tinker API를 사용하여 오픈 웨이트 모델을 파인튜닝했습니다. 결과 모델은 84.7%의 정확도를 달성하여 80%의 운영 신뢰 임계값을 넘어섰으며, 최고의 프론티어 모델 대비 비용을 13.8배 절감했습니다.

  • 프론티어 모델(GPT, Claude, Gemini)은 6가지 투자 뉴스 필터링 테스트에서 평균 약 50%의 정확도만 달성했습니다.
  • 전문가가 작성한 프롬프트는 프론티어 모델의 정확도를 70% 중반대로 향상시켰으나, 여전히 Bridgewater의 80% 운영 신뢰 임계값에는 미치지 못했습니다.
  • Bridgewater는 실제 전문가 판단을 기반으로 Thinking Machines Lab의 Tinker API를 사용하여 오픈 웨이트 모델을 파인튜닝했습니다.
  • 파인튜닝된 모델은 84.7%의 정확도를 달성하여 테스트된 최고의 프론티어 모델 대비 실수를 29.8% 줄였습니다.
  • 파인튜닝된 모델은 테스트된 최고 성능의 프론티어 모델 대비 작업당 13.8배 낮은 비용을 제공했습니다.

전문가 데이터로 소형 오픈 웨이트 모델을 파인튜닝하는 것이 프론티어 API에 의존하는 것보다 더 높은 정확도와 훨씬 낮은 비용을 제공한다는 구체적인 사례를 보여줍니다.

SOURCES

16. Hugging Face 개발자, Claude Agents SDK와 Modal을 사용하여 역할 자동화

aiDotEngineer 이벤트에서 한 Hugging Face 개발자는 자신의 역할 중 일부를 자동화하기 위해 설계된 워크플로우를 시연했습니다. 이 구현은 Claude Agents SDK와 추론 제공업체를 통해 액세스되는 GLM-5.2를 결합합니다. 프로덕션 모니터링 및 배포를 위해 이 설정은 추적을 위해 Langfuse를 통합하고 Modal의 서버리스 플랫폼에서 실행되어, 자율 에이전트를 구축하는 개발자들에게 구체적인 스택 참조를 제공합니다.

  • 자동화 워크플로우는 aiDotEngineer 이벤트에서 Hugging Face 개발자에 의해 발표되었습니다.
  • 시스템은 추론 제공업체를 통해 Claude Agents SDK와 GLM-5.2를 활용합니다.
  • Langfuse는 LLM 추적 및 모니터링에 사용됩니다.
  • 전체 에이전트 워크플로우는 Modal의 서버리스 인프라에 배포됩니다.

SDK, 추적 및 서버리스 배포를 결합한 프로덕션급 에이전트 워크플로우의 실제 청사진을 제공합니다.

SOURCES

17. RAG-Anything 튜토리얼, Google Colab에서의 멀티모달 검색 상세 설명

새로운 튜토리얼은 텍스트, 표, 방정식 및 이미지를 포함하는 멀티모달 검색을 위한 RAG-Anything 워크플로우 구축 방법을 설명합니다. 채팅, 비전 및 임베딩을 위해 OpenAI API를 사용하여 Google Colab에서 구현된 이 가이드는 복잡한 문서를 구조화된 JSON 콘텐츠 목록으로 변환하는 방법을 상세히 다룹니다. RAG-Anything 시스템은 나이브, 로컬, 글로벌 및 하이브리드 검색 모드를 지원하여 개발자가 혼합 미디어 데이터셋에 대해 교차 모달 추론을 구현할 수 있게 합니다.

  • 튜토리얼은 채팅, 비전 및 임베딩을 위해 OpenAI API를 사용하여 Google Colab에서 RAG-Anything 워크플로우를 구축하는 방법을 보여줍니다.
  • 워크플로우는 합성 멀티모달 보고서(표, 차트, PDF 포함)를 구조화된 JSON 콘텐츠 목록으로 변환합니다.
  • RAG-Anything은 나이브, 로컬, 글로벌 및 하이브리드를 포함한 여러 검색 모드를 지원합니다.
  • 시스템은 구조화된 값과 멀티모달 증거를 기반으로 교차 모달 추론을 수행하고 쿼리에 답변하는 능력에 대해 테스트되었습니다.

개발자들이 표준 OpenAI API를 사용하여 교차 모달 추론 및 검색 파이프라인을 구현하기 위한 단계별 가이드를 제공합니다.

SOURCES

18. vLLM 업데이트, OOM 문제 해결 및 컨텍스트 윈도우 두 배 확장

오픈 소스 vLLM 엔진 개발자들은 메모리 부족(OOM) 문제를 해결하기 위한 세 가지 주요 업데이트를 출시했습니다. 이 업데이트는 사전 할당 및 튜닝 매개변수로 인한 메모리 병목 현상을 해결합니다. 실제 테스트에서 이 최적화는 한 개발자가 RTX 5090 GPU에서 Qwen2-7B를 실행할 때 사용 가능한 컨텍스트 윈도우를 120k에서 240k 토큰으로 두 배 늘릴 수 있게 하여 로컬 추론 기능을 크게 향상시켰습니다.

  • vLLM 개발자들은 사전 할당 및 튜닝으로 인한 메모리 부족(OOM) 문제를 해결하는 세 가지 주요 업데이트를 출시했습니다.
  • 한 사용자는 RTX 5090에서 Qwen2-7B를 사용하여 사용 가능한 컨텍스트 윈도우 크기를 120k에서 240k 토큰으로 두 배 늘렸다고 보고했습니다.
  • 업데이트는 로컬 추론을 위해 메모리 사전 할당 및 튜닝 매개변수를 최적화합니다.

로컬 모델을 실행하는 개발자들은 이제 RTX 5090과 같은 소비자용 GPU에서 사용 가능한 컨텍스트 윈도우를 두 배(예: 최대 240k 토큰)로 늘릴 수 있습니다.

SOURCES

19. GLM 5.2, DSpark를 통한 추측 디코딩 지원 획득

GLM 5.2 DSpark 프리뷰가 출시되었으며, 이는 오픈 소스 DSpark 프레임워크를 DeepSeek 이외의 모델에 적용한 첫 사례입니다. 프레임워크의 추측 디코딩 기능을 활용하여, 이 프리뷰는 vLLM nightly를 통해 4x B300 하드웨어에서 GLM-5.2의 FP8 디코딩을 약 1.5배 가속화합니다. 이번 출시는 다양한 오픈 웨이트 아키텍처 전반에서 추론 지연 시간을 최적화하기 위한 프레임워크의 유용성을 입증합니다.

  • GLM 5.2 DSpark 프리뷰는 오픈 소스 DSpark 프레임워크를 사용하여 DeepSeek 이외의 모델을 위해 개발된 첫 번째 추측기입니다.
  • 4x B300 하드웨어에서 GLM-5.2-FP8에 대해 1.5배 더 빠른 디코딩을 달성합니다.
  • 구현은 vLLM nightly에서 실행됩니다.
  • 향후 업데이트에서 더 강력한 체크포인트가 예상됩니다.

개발자들은 이제 DSpark 추측 디코딩 프레임워크를 GLM-5.2에 적용하여 추론 지연 시간을 크게 줄일 수 있으며, 이는 원래의 DeepSeek-V4 모델을 넘어선 프레임워크의 더 넓은 호환성을 검증합니다.

SOURCES

20. llama.cpp 풀 리퀘스트, Intel ARC에서 프롬프트 처리 속도 두 배 향상

`llama.cpp` 저장소를 위한 새로운 풀 리퀘스트는 Intel ARC GPU에 대한 상당한 프롬프트 처리 속도 향상을 도입합니다. Claude의 도움을 받아 개발된 이 최적화는 262k 컨텍스트 크기의 Qwen3.6 35B 모델을 실행하는 Intel B580 GPU에서 테스트되었습니다. 이 업데이트는 116k 컨텍스트 대화의 처리 시간을 510초에서 262초로 줄여 처리량을 245 t/s에서 462 t/s로 효과적으로 두 배 늘렸습니다. 현재 최적화는 F16 KV 캐시로 제한됩니다.

  • 새로운 llama.cpp 풀 리퀘스트는 Intel ARC GPU에 대한 성능 최적화를 제공합니다.
  • 116k 컨텍스트 대화에서 Intel B580 GPU를 테스트한 결과 처리 시간이 510초에서 262초로 단축되었습니다.
  • 프롬프트 처리 속도가 245 t/s에서 462 t/s로 증가했습니다.
  • 벤치마크는 262,144 컨텍스트 크기의 Qwen3.6 35B A3B Q5_K_XL 모델을 사용하여 수행되었습니다.
  • 현재 최적화는 F16 KV 캐시로 제한됩니다.

Intel ARC 하드웨어에서 로컬 모델을 실행하는 개발자들은 긴 컨텍스트 대화에 대한 지연 시간을 크게 줄일 수 있습니다.

SOURCES

21. 개발자, MiniMax-M2.7을 위한 6x NVIDIA P40 홈 랩 벤치마크

한 개발자가 총 144GB의 VRAM을 제공하는 6개의 NVIDIA P40 GPU를 사용하여 대규모 모델을 로컬에서 실행하도록 설계된 홈 랩 구성을 문서화했습니다. 수정된 BIOS와 Intel Xeon 프로세서가 장착된 Asus X99-E-WS 마더보드를 기반으로 구축된 이 시스템은 MiniMax-M2.7-GGUF를 실행하기 위한 최적의 구성을 찾기 위해 llama.cpp를 사용하여 벤치마크되었습니다. 개발자의 검증된 설정은 F16 KV 캐시, Flash Attention, 2048의 배치 크기 및 레이어 기반 텐서 분할을 활용합니다.

  • 홈 랩 시스템은 총 144GB의 VRAM을 제공하는 6개의 NVIDIA P40 GPU를 특징으로 합니다.
  • 하드웨어에는 수정된 BIOS가 장착된 Asus X99-E-WS 마더보드, Intel Xeon E5-2680 v4 CPU 및 128GB DDR4 RAM이 포함됩니다.
  • 최적의 llama.cpp 구성은 F16 KV 캐시, Flash Attention, 2048의 배치 크기, 256의 ubatch 크기 및 레이어 기반 텐서 분할을 사용합니다.
  • 설정은 llama-server를 통해 MiniMax-M2.7-GGUF 모델을 실행하며 벤치마크되었습니다.

오래된 비용 효율적인 엔터프라이즈 GPU에서 대규모 모델을 로컬로 실행하려는 개발자들에게 구체적인 하드웨어 및 소프트웨어 구성 청사진을 제공합니다.

SOURCES

22. 로컬 벤치마크, RTX 3090에서 Qwen3.6, Gemma4 및 Ornith1.0 비교

한 독립 개발자가 inspect-ai 프레임워크를 사용하여 RTX 3090 GPU에서 Qwen3.6 27b, Gemma4 26B 및 Ornith1.0 35B를 비교한 로컬 벤치마크 결과를 발표했습니다. 테스트 결과 Qwen3.6 27b가 일반 지식 및 추론에서 앞섰고, Ornith1.0 35B는 최대 100k 토큰까지의 접지 및 회상 작업에서 뛰어난 성능을 보였습니다. 벤치마크는 또한 LM Studio를 통해 Gemma4 26B를 실행할 때 발생하는 무한 루프 문제와 같은 실질적인 통합 과제를 강조했습니다.

  • 벤치마크는 RTX 3090에서 inspect-ai 프레임워크를 사용하여 Qwen3.6 27b, Gemma4 26B 및 Ornith1.0 35B를 평가했습니다.
  • Qwen3.6 27b는 6개의 일반 지식 및 추론 벤치마크 중 4개에서 가장 높거나 공동으로 가장 높은 점수를 기록했습니다.
  • Ornith1.0 35B는 100k 토큰 Needle in a Haystack 테스트를 포함한 접지 및 회상 작업에서 다른 모델보다 뛰어난 성능을 보였습니다.
  • 평가자는 Gemma4 26B의 무한 루프와 코딩 벤치마크의 긴 처리 시간을 포함한 기술적 문제를 보고했습니다.

개발자들에게 추론 및 회상 작업을 위해 인기 있는 오픈 웨이트 모델 중에서 선택할 수 있도록 객관적인 로컬 하드웨어 성능 데이터를 제공합니다.

SOURCES

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.

Inference Brew를 인박스로

하루 5분. 무료, 언제든 해지할 수 있습니다.