1. Tencent, 770B 파라미터 오픈 웨이트 모델 'Hy4 Preview' 공개
Tencent이 총 7,700억 개의 파라미터와 490억 개의 활성 파라미터를 가진 오픈 웨이트 대규모 언어 모델 'Hy4 Preview'를 공개했습니다. 이 모델은 100만 토큰의 컨텍스트 윈도우를 지원하며 Hugging Face에서 이용할 수 있으나, 1.56TB에 달하는 거대한 파일 크기로 인해 상당한 호스팅 자원이 필요합니다. Hy4는 개발자가 기본 'high' 추론 레벨과 추론을 완전히 비활성화하는 'no_think' 레벨 사이를 전환할 수 있는 이중 추론 기능을 도입했습니다.
- • Hy4는 7,700억 개의 총 파라미터와 490억 개의 활성 파라미터를 가진 오픈 웨이트 텍스트 입력 대규모 언어 모델입니다.
- • 이 모델은 100만 토큰의 컨텍스트 윈도우를 지원합니다.
- • 모델 파일 크기는 Hugging Face 기준 1.56TB입니다.
- • 기본 'high' 레벨과 추론을 비활성화하는 'no_think' 레벨 등 두 가지 추론 레벨을 제공합니다.
개발자들은 100만 컨텍스트 윈도우를 지원하고 'no_think' 레벨을 통해 추론을 비활성화할 수 있는 거대한 오픈 웨이트 모델을 실험해 볼 수 있습니다.
2. OpenAI, ChatGPT Work 구독 티어 및 로컬 자동화 기능 상세 공개
지난 7월 ChatGPT Work의 초기 출시 이후, OpenAI는 제품의 구독 구조를 상세히 밝혔습니다. 서비스는 코드 실행 환경과 웹 자동화를 위한 헤드리스 Chrome을 제공하는 'Work Cloud'와 데스크톱 애플리케이션을 통해 로컬 파일에 직접 액세스할 수 있는 'Work Local'로 나뉩니다. 또한 사용자는 Cloudflare Workers 기반의 'ChatGPT Sites'를 사용하여 상태 유지 웹사이트를 배포할 수 있으며, 하위 에이전트 세션 및 예약된 프롬프트 자동화에 대한 새로운 지원도 추가되었습니다.
- • ChatGPT Work는 이제 Work Cloud와 Work Local 티어로 구분됩니다.
- • Work Local은 데스크톱 애플리케이션을 통해 로컬 파일에 직접 액세스할 수 있게 합니다.
- • Work Cloud에는 영구 파일 시스템, 코드 실행, 웹 자동화를 위한 헤드리스 Chrome이 포함됩니다.
- • 사용자는 Cloudflare Workers를 사용하여 ChatGPT Sites를 통해 상태 유지 웹사이트를 배포할 수 있습니다.
- • 플랫폼은 이제 하위 에이전트 세션과 예약된 프롬프트 자동화를 지원합니다.
이 기능들은 ChatGPT Work를 일반적인 에이전트에서 로컬 파일 조작 및 자동화된 웹 배포가 가능한 전문 개발 환경으로 탈바꿈시킵니다.
3. Google AI, 다변량 시계열 예측을 위한 'TimesFM-3' 공개
Google Research가 다변량 시계열 예측을 위해 설계된 3억 3천만 파라미터 규모의 제로샷 파운데이션 모델 'TimesFM-3'를 공개했습니다. 1조 개 이상의 시계열 데이터 포인트로 사전 학습된 이 모델은 작업별 미세 조정 없이도 다중 타겟, 과거 공변량, 과거-미래 공변량을 지원합니다. 이 모델은 인과적 시간 주의(causal temporal attention)와 전체 변량 주의(full variate attention)를 교차 사용하여 시계열 간 의존성을 모델링하는 디코더 전용 트랜스포머 아키텍처를 활용합니다. 저장소 코드는 Apache-2.0 라이선스를 따르지만, 모델 가중치는 비상업적 및 비생산적 용도로 제한된다는 점에 유의해야 합니다.
- • Google Research는 다변량 시계열 예측을 위한 3억 3천만 파라미터 파운데이션 모델인 TimesFM-3를 공개했습니다.
- • 이 모델은 1조 개 이상의 실제 및 합성 시계열 데이터 포인트로 사전 학습되었습니다.
- • 작업별 미세 조정 없이 다중 타겟, 과거 공변량, 과거-미래 공변량을 지원합니다.
- • 아키텍처는 인과적 시간 주의와 전체 변량 주의를 교차 사용하는 디코더 전용 트랜스포머를 사용합니다.
- • TimesFM-3 가중치는 비상업적/비생산적 용도로 제한되며, 저장소 코드는 Apache-2.0 라이선스입니다.
- • GIFT-Eval, fev-bench, TIME 벤치마크에서 사전 학습된 파운데이션 모델 중 1위를 차지했습니다.
개발자들은 복잡한 다변량 예측을 위해 최첨단 제로샷 모델을 사용할 수 있지만, 비상업적 라이선스 준수가 필요합니다.
4. Apodex 1.1 벤치마크 결과 및 API 가격 상세 공개
8월 27일 Apodex 1.1 모델 제품군 발표에 이어, Apodex가 상세 성능 지표와 상업용 가격을 공개했습니다. 이 모델은 Artificial Analysis Intelligence Index에서 44점을 기록했으며, GDPval-AA v2 에이전트 벤치마크에서 1348의 Elo를 달성했습니다. TerminalBench v2.1에서 70%의 점수로 강력한 성능을 보였으나, AA-Omniscience 벤치마크에서는 78.4%의 환각률을 보였습니다. 모델은 현재 Apodex 자체 API를 통해 입력 토큰 100만 개당 0.30달러, 출력 토큰 100만 개당 3.00달러에 이용 가능합니다.
- • Apodex 1.1은 Artificial Analysis Intelligence Index에서 44점을 기록했습니다.
- • GDPval-AA v2 에이전트 벤치마크에서 1348의 Elo를 달성했습니다.
- • TerminalBench v2.1 성능은 70%에 도달했습니다.
- • API 가격은 입력 토큰 100만 개당 0.30달러, 출력 토큰 100만 개당 3.00달러입니다.
- • 모델은 256K 토큰의 컨텍스트 윈도우를 제공합니다.
- • AA-Omniscience 벤치마크에서 78.4%의 환각률을 보였습니다.
개발자들은 표준화된 벤치마크 데이터와 공식 가격을 사용하여 Apodex 1.1 모델의 비용 대비 성능을 평가하고 에이전트 워크플로우에 통합할지 결정할 수 있습니다.
5. DeepSeek-V4-Pro-0813-NVFP4 양자화 모델 출시
DeepSeek의 자기회귀 Mixture-of-Experts 언어 모델의 양자화 버전인 DeepSeek-V4-Pro-0813-NVFP4 모델이 출시되었습니다. Model Optimizer를 사용하여 양자화된 이 모델은 고급 추론, 도구 사용 및 에이전트 AI 애플리케이션에 최적화되어 있습니다. 이 모델은 상업적 및 비상업적 용도로 모두 개방되어 있어 프로덕션 배포에 접근 가능합니다.
- • DeepSeek-V4-Pro-0813-NVFP4는 자기회귀 Mixture-of-Experts 언어 모델 DeepSeek-V4-Pro-0813의 양자화 버전입니다.
- • 이 모델은 Model Optimizer를 사용하여 양자화되었습니다.
- • 고급 추론, 에이전트 AI 애플리케이션, 도구 사용 및 복잡한 문제 해결을 위해 설계되었습니다.
- • 상업적 및 비상업적 용도로 모두 이용 가능합니다.
개발자들은 에이전트 워크플로우 및 복잡한 문제 해결을 위해 고도로 최적화된 DeepSeek 추론 모델의 양자화 버전을 배포할 수 있습니다.
6. DeepSeek-V4-Flash-Vision-Exp 가중치, Hugging Face에 공개
8월 21일 DeepSeek-V4-Flash-Vision-Exp 실험 모델 발표에 이어, DeepSeek가 모델 가중치를 Hugging Face에서 다운로드할 수 있도록 공개했습니다. 이번 공개를 통해 개발자들은 이전에 발표된 API 기반 액세스 외에도 비전 기능 모델을 로컬에서 호스팅할 수 있게 되었습니다.
- • DeepSeek-V4-Flash-Vision-Exp 가중치가 Hugging Face에 호스팅되었습니다.
- • 이는 8월 21일 모델의 API 기반 비전 기능에 대한 초기 발표 이후 이루어진 조치입니다.
- • 이번 공개로 실험적인 비전 모델의 로컬 배포 및 자체 호스팅이 가능해졌습니다.
개발자들은 이제 API 전용 액세스를 넘어 맞춤형 멀티모달 애플리케이션을 위해 실험적인 비전 모델을 직접 호스팅할 수 있습니다.
7. 에이전트 계획 및 메모리 강화를 위한 'ContextPilot-14B' 출시
ContextPilot-14B가 에이전트 기능을 강화하기 위해 설계된 특수 Qwen3-14B 체크포인트로 Hugging Face에 출시되었습니다. 이 모델은 에이전트가 계획을 세우고, 장기 기억을 유지하며, 추론 및 도구 실행을 계속하는 동안 덜 유용한 컨텍스트를 오프로드하는 방법을 학습하는 데 중점을 둡니다. 이는 개발자들에게 더 강력한 자율 워크플로우를 구축하기 위한 타겟팅된 오픈 웨이트 옵션을 제공합니다.
- • ContextPilot-14B는 Hugging Face에 호스팅된 Qwen3-14B 체크포인트입니다.
- • 이 모델은 에이전트 기능을 강화하도록 설계되었습니다.
- • 에이전트가 계획을 세우고, 장기 기억을 유지하며, 추론 및 도구 사용을 계속하면서 덜 유용한 컨텍스트를 오프로드하도록 학습시킵니다.
자율 에이전트를 구축하는 개발자들은 이 특수 체크포인트를 사용하여 장기 추론 및 컨텍스트 관리를 개선할 수 있습니다.
8. 가속 추론을 위한 'Nanbeige4.2-3B-DSpark' 출시
7월에 도입된 Nanbeige4.2-3B 모델을 기반으로, 새로운 Nanbeige4.2-3B-DSpark 변형이 Hugging Face에 출시되었습니다. 이 버전은 자원이 제한된 환경에 특별히 최적화되어 초당 약 35토큰의 자기회귀 생성 속도를 달성합니다. GPU 자원이 제한된 개발자들을 위해 Qwen 3.5 9B 모델보다 더 빠른 대안으로 포지셔닝되었습니다.
- • Nanbeige4.2-3B-DSpark는 7월에 출시된 Nanbeige4.2-3B 모델의 새로운 최적화 버전입니다.
- • 이 모델은 Hugging Face에 호스팅되어 있으며 자원이 제한된 환경을 위해 설계되었습니다.
- • 초당 약 35토큰의 자기회귀 생성 속도를 달성합니다.
- • 제한된 GPU 설정을 사용하는 개발자들에게 Qwen 3.5 9B 모델보다 더 빠른 대안으로 포지셔닝되었습니다.
이번 출시는 기존 Nanbeige4.2-3B 아키텍처에 최적화된 고속 추론 경로를 제공하여 제한된 하드웨어에서 더 빠른 성능을 가능하게 합니다.
9. Anthropic, 새로운 코드 실행 취약점 발견 후 Auto Mode 보안 입장 명확화
한 보안 연구원이 Python 모듈 스푸핑을 악용하여 임의 코드 실행을 달성하는 Claude Code Opus 5의 Auto Mode 공격 체인을 시연했습니다. 이 발견은 Anthropic이 8월 14일 Auto Mode를 Claude Code의 기본 설정으로 전환한 이후에 나왔습니다. 취약점에 대한 대응으로 Anthropic은 과거 안전성에 대한 주장에도 불구하고 Auto Mode는 보안 경계가 아닌 최선의 분류기를 갖춘 편의 기능임을 명확히 했습니다. 개발자들은 코딩 에이전트를 컨테이너나 가상 머신과 같은 격리된 환경에서 실행하고 네트워크 송신을 제한할 것을 권장받습니다.
- • 한 연구원이 Auto Mode의 Claude Code Opus 5에 대해 최대 80% 성공률로 코드 실행을 달성하는 공격 체인을 시연했습니다.
- • 이 취약점은 Python 모듈 스푸핑을 사용하여 에이전트가 오염된 ZIP 아카이브에서 악성 코드를 실행하도록 유도합니다.
- • Anthropic은 Auto Mode를 안전한 기본값으로 포지셔닝했던 과거와 달리, 보안 경계가 아닌 편의 기능임을 명확히 했습니다.
- • 개발자들은 코딩 에이전트 사용 시 격리된 환경(컨테이너/VM)을 사용하고 네트워크 송신을 제한할 것을 권장합니다.
이번 공개는 기본 에이전트 모드의 인식된 보안과 실제 복원력 사이의 격차를 강조하며, 더 엄격한 로컬 환경 제어의 필요성을 시사합니다.
10. OpenClaw 2.0 출시: 가이드 설정 및 재구축된 제어 UI
OpenClaw 팀이 오픈 소스 프로젝트 역사상 가장 큰 업데이트인 OpenClaw 2.0을 출시했으며, 16,000개 이상의 풀 리퀘스트가 통합되었습니다. 단일 운영자 및 팀 배포를 위해 설계된 이 릴리스는 OpenAI, Anthropic, Ollama, LM Studio와 같은 공급자의 자격 증명을 자동으로 감지하고 확인하는 재작성된 설치 프로세스를 특징으로 합니다. 재구축된 제어 UI는 시작 시간을 575밀리초로 단축했으며, 새로운 도킹 패널은 워크스페이스 파일 편집기, Git 기반 변경 사항 패널, 전체 화면 웹 터미널을 추가했습니다. 세션과 기록도 SQLite 저장소로 마이그레이션되었습니다.
- • OpenClaw 2.0은 기존 구독, API 키, 로컬 모델을 자동으로 감지하는 재작성된 설치 프로세스를 제공합니다.
- • 재구축된 제어 UI는 시작 시간을 1.6초에서 575밀리초로 단축하고 JavaScript 요청을 140개에서 45개로 줄였습니다.
- • 세션과 기록은 SQLite 저장소로 마이그레이션되었으며, 새로운 도킹 패널은 워크스페이스 파일 편집기, Git 기반 변경 사항 패널, 웹 터미널을 제공합니다.
- • 공유 클라우드 세션은 다중 사용자 협업을 가능하게 하지만 보안 경계나 테넌트 격리 역할을 하지는 않습니다.
- • 이번 릴리스는 933명의 기여자로부터 16,000개 이상의 풀 리퀘스트를 통합했으며, 이는 프로젝트에 병합된 전체 풀 리퀘스트의 약 50%에 해당합니다.
단일 운영자 또는 팀 AI 게이트웨이를 배포하는 개발자들은 내장된 모델 검증 및 협업 세션을 갖춘 더 빠르고 통합된 워크스페이스를 활용할 수 있습니다.
11. uv 0.12.8, BLAKE3를 사용한 파일 수준 캐시 중복 제거 도입
Astral이 uv 0.12.8 버전을 출시하여 휠 캐시의 파일 수준 중복 제거 기능을 도입했습니다. 파일을 BLAKE3 해시로 files-v0 버킷에 저장하고 하드링크를 사용하여 객체를 원래 위치에 배치함으로써, 이 업데이트는 기존 설치 워크플로우를 변경하지 않고도 디스크 사용량을 크게 줄입니다. 또한 이 릴리스는 getattrlistbulk를 사용하여 macOS에서 하드링크 수를 일괄 읽어 캐시 정리를 최적화하고, 의존성 그래프 구축 속도를 높이며, 휠 추출 중 할당을 줄이고, 중복 다운로드를 방지합니다.
- • uv 0.12.8 버전은 파일을 BLAKE3 해시로 files-v0 버킷에 저장하여 휠 캐시의 파일 수준 중복 제거를 도입합니다.
- • 중복 제거 기능은 하드링크를 사용하여 객체를 원래 위치에 저장함으로써 기존 워크플로우를 유지합니다.
- • 콘텐츠 주소 지정 캐시에 대한 캐시 정리는 getattrlistbulk를 사용하여 macOS에서 하드링크 수를 일괄 읽도록 최적화되었습니다.
- • 성능 개선 사항으로는 더 빠른 의존성 그래프 구축, 휠 추출 중 할당 감소, 중복 다운로드 방지가 포함됩니다.
- • 버그 수정은 Azure Storage API 호환성, Azure 공유 액세스 서명에 대한 URL 수정, 워크스페이스 검색 문제를 해결합니다.
uv를 사용하는 개발자들은 더 빠른 의존성 그래프 구축, 디스크 사용량 감소, macOS에서의 최적화된 캐시 정리를 경험하게 됩니다.
12. OpenAI Codex 메모리 기능, 로컬 채팅 콘텐츠 유출 의혹
OpenAI Codex의 메모리 기능이 로컬 공급자 채팅 콘텐츠를 OpenAI 서버로 유출한다는 보안 우려가 제기되었습니다. 보고서에 따르면 이 데이터 전송은 사용자에게 알림을 제공하지 않고 발생하며, OpenAI의 개발자 도구와 함께 로컬 LLM 환경을 사용하는 개발자들에게 개인정보 보호 및 보안 우려를 불러일으키고 있습니다.
- • OpenAI Codex의 메모리 기능이 로컬 공급자 채팅 콘텐츠를 OpenAI로 유출한다는 의혹이 있습니다.
- • 데이터 전송은 사용자에게 알림 없이 발생합니다.
- • 이는 로컬 및 클라우드 기반 개발 도구를 혼합하여 사용하는 개발자들에게 영향을 미칩니다.
OpenAI 도구와 함께 로컬 LLM 공급자를 사용하는 개발자들은 개인 코드베이스에 영향을 미칠 수 있는 잠재적인 데이터 유출 위험을 인지해야 합니다.
13. Memoryfields, 휴대용 에이전트 메모리 파일 형식 도입
Memoryfields는 휴대용의 저메커니즘 에이전트 메모리 파일 형식으로 도입되었습니다. Markdown 페이지, 선택적 YAML 프론트매터, 의미론적 검색을 위한 선택적 SQLite 벡터 인덱스로 구성된 이 형식은 메모리를 엄격하게 데이터로 취급합니다. 이 설계는 청킹이나 재순위 지정과 같은 복잡한 RAG 파이프라인을 피하고, 에이전트가 bash나 SQLite와 같은 간단한 액세스 패턴을 사용하여 메모리와 상호 작용할 수 있도록 합니다. Memoryfields는 zip 파일로 패키징되며 전송 방식에 구애받지 않아 로컬 저장소, Amazon S3, GitHub, HTTP를 지원합니다. CLI 도구와 관리 기술을 이용할 수 있으며, 임베딩에는 nomic-embed-text-v1.5가 권장됩니다.
- • Memoryfields는 Markdown 페이지, 선택적 YAML 프론트매터, 선택적 SQLite 벡터 인덱스로 구성된 휴대용 에이전트 메모리 파일 형식입니다.
- • 이 형식은 메모리를 데이터로 취급하여 청킹이나 재순위 지정과 같은 복잡한 RAG 프로세스를 피합니다.
- • 각 메모리 페이지는 약 8kb 또는 2000토큰의 소프트 제한을 가집니다.
- • Memoryfields는 zip 파일로 저장되지만 전송 방식에 구애받지 않으며 로컬 저장소, Amazon S3, GitHub, HTTP를 지원합니다.
- • 작성자는 Memoryfields 관리를 위한 CLI 도구와 기술을 제공하며, 임베딩에는 nomic-embed-text-v1.5 모델을 권장합니다.
개발자들은 Memoryfields를 사용하여 복잡한 RAG 파이프라인 없이 저메커니즘의 전송 방식에 구애받지 않는 에이전트 메모리를 구현할 수 있습니다.
14. Hebbian Robotics, 멀티모달 로봇 데이터용 HFlow SDK 출시
Hebbian Robotics가 확장 가능한 로봇 데이터 파이프라인을 구축하기 위해 설계된 SDK인 HFlow를 오픈 소스로 공개했습니다. Apache-2.0 라이선스로 출시된 HFlow는 비디오, 관절 상태, 동작과 같은 원시 멀티모달 기록을 표준화된 에피소드와 쿼리 가능한 데이터셋 매니페스트로 변환합니다. 이 SDK는 MCAP 컨테이너 형식을 사용하여 센서 스트림을 동기화된 상태로 유지합니다. 파이프라인은 Airflow 3 DAG로 실행될 수 있는 Python 함수로 작성되며, 측정값과 메타데이터를 추가 전용 Parquet 카탈로그에 저장합니다. 개발자들은 DuckDB SQL을 사용하여 이 카탈로그를 쿼리함으로써 원시 기록을 다시 열지 않고도 버전이 고정된 학습 매니페스트를 생성할 수 있습니다.
- • HFlow는 멀티모달 로봇 데이터를 처리하기 위해 설계된 오픈 소스 SDK이며 Apache-2.0 라이선스로 출시되었습니다.
- • 이 SDK는 원시 기록(비디오, 관절 상태, 동작)을 표준화된 에피소드와 쿼리 가능한 데이터셋 매니페스트로 변환합니다.
- • 센서 스트림 전반의 동기화를 유지하기 위해 MCAP 컨테이너 형식을 활용합니다.
- • HFlow 파이프라인은 Python 함수를 사용하여 구축되며 Airflow 3 DAG로 실행될 수 있습니다.
- • 시스템은 측정값, 메타데이터, 품질 증거를 DuckDB SQL을 통해 쿼리 가능한 추가 전용 Parquet 카탈로그에 저장합니다.
로봇 공학이나 멀티모달 AI 애플리케이션을 구축하는 개발자들은 HFlow를 사용하여 DuckDB SQL을 통해 구조화되고 버전이 고정된 학습 데이터셋을 구축할 수 있습니다.
15. Keenable AI, 'NEEDLE' 라이브 검색 벤치마크 오픈 소스화
Keenable AI가 과적합을 방지하기 위해 쿼리 세트를 매시간 또는 매일 재생성하도록 설계된 웹 검색 API용 라이브 벤치마크인 NEEDLE을 오픈 소스로 공개했습니다. MIT 라이선스로 출시된 NEEDLE은 뉴스, 일상, 전문가, 딥테일, 법률 등 5개 분야에서 검색 API를 평가하는 Python CLI 도구입니다. 이 도구는 경험적 상한선을 설정하기 위해 풀링된 오라클 엔진을 기반으로 하는 'ultimate' 메트릭을 사용합니다. 2026년 8월 28일로 끝나는 주간의 지연 시간 벤치마크에서 Keenable-realtime은 p50 지연 시간 193ms를 기록했으며, Exa는 1,876ms, Bing은 2,767ms를 기록했습니다.
- • Keenable AI는 쿼리 세트를 매시간 또는 매일 재생성하는 웹 검색 API용 라이브 벤치마크인 NEEDLE을 오픈 소스로 공개했습니다.
- • 이 벤치마크는 뉴스, 일상, 전문가, 딥테일, 법률 등 5개 분야에서 검색 API를 평가합니다.
- • NEEDLE은 MIT 라이선스로 출시된 Python CLI 도구이며 판단을 위해 OpenRouter 키가 필요합니다.
- • 2026년 8월 28일로 끝나는 7일간의 지연 시간 벤치마크에서 Keenable-realtime은 193ms(p50), Exa는 1,876ms(p50), Bing은 2,767ms(p50)를 기록했습니다.
- • 실제 에이전트 트래픽을 나타내는 딥테일 쿼리가 가장 어려운 것으로 판명되었으며, Exa는 ultimate 상한선의 0.557을 달성했습니다.
검색 기반 에이전트를 구축하는 개발자들은 NEEDLE을 사용하여 Exa, Bing, Keenable과 같은 검색 API의 지연 시간과 검색 품질을 평가하고 비교할 수 있습니다.
16. llama.cpp, Qwen 3.8 Flash Next에 대한 기본 lazy-mode 동작 변경
최근 llama.cpp(b10726) 업데이트는 lazy-mode 설정을 auto로 기본값으로 지정하여 Qwen 3.8 Flash Next 모델을 처리하는 방식을 변경했습니다. 이 구성은 모델의 51B 파라미터 PLE n-gram 임베딩 테이블을 mmap을 통해 디스크에 유지하고 추론 중에 필요에 따라 읽습니다. 이는 메모리 사용량을 줄이지만, 벤치마크에 따르면 50%의 퍼플렉서티 속도 저하와 15%의 토큰 생성 속도 저하를 초래합니다. 개발자들은 lazy-mode off 플래그를 명시적으로 전달하여 이 동작을 우회하고 임베딩 테이블을 RAM으로 강제 로드할 수 있습니다.
- • 업데이트 b10726은 Qwen 3.8 Flash Next 모델에 대한 기본 lazy-mode 동작을 auto로 변경합니다.
- • 이 변경 사항은 load-mode none 설정에서도 모델의 51B 파라미터 PLE n-gram 임베딩 테이블을 mmap을 통해 디스크에 유지합니다.
- • 새로운 기본 lazy-mode는 보고된 바에 따르면 50%의 퍼플렉서티 속도 저하와 15%의 토큰 생성 속도 저하를 유발합니다.
- • 사용자는 lazy-mode off 플래그를 사용하여 임베딩 테이블을 RAM으로 강제 로드할 수 있습니다.
llama.cpp를 통해 로컬에서 Qwen 3.8 Flash Next를 실행하는 개발자들은 50%의 퍼플렉서티 속도 저하와 15%의 토큰 생성 속도 저하를 피하기 위해 lazy-mode를 수동으로 비활성화해야 합니다.
17. Qwen 3.8 Flash Next llama.cpp 벤치마크, VRAM 및 메모리 레이아웃 트레이드오프 공개
llama.cpp b10666에서 unsloth/Qwen3.8-Flash-Next-GGUF 모델의 성능 테스트는 하이엔드 하드웨어를 위한 중요한 메모리 및 레이아웃 구성을 강조합니다. 96GB VRAM을 탑재한 NVIDIA RTX PRO 6000에서 실행한 결과 2K 프롬프트에서 초당 109.07토큰의 디코딩 속도를 기록한 반면, CPU 전용에서는 초당 8.34토큰에 불과했습니다. 결정적으로, 27.2 GiB의 레이어별 토큰 임베딩 테이블을 CUDA VRAM으로 강제 할당했을 때 디코딩 속도가 초당 1.95토큰으로 급락했습니다. 또한 비통합 KV 레이아웃을 활용했을 때 16의 동시성에서 초당 92.0토큰을 달성하여 통합 레이아웃보다 뛰어난 성능을 보였습니다.
- • llama.cpp b10666에서 unsloth/Qwen3.8-Flash-Next-GGUF 벤치마크는 96GB VRAM에서 초당 109.07토큰 디코딩을 달성했으며, CPU 전용에서는 초당 8.34토큰을 기록했습니다.
- • 27.2 GiB의 레이어별 토큰 임베딩 테이블을 CUDA VRAM으로 강제 할당했을 때 디코딩 속도가 108.5 tok/s에서 1.95 tok/s로 심각하게 저하되었습니다.
- • RAM 상주 로딩은 48GB 텐서 배치에서 mmap에 비해 1.87배 더 높은 프리필 속도를 제공했습니다.
- • 16의 동시성에서 비통합 KV 레이아웃은 초당 92.0토큰에 도달하여 통합 KV 레이아웃보다 뛰어난 성능을 보였습니다.
- • 96GB VRAM이 24GB VRAM보다 갖는 성능 이점은 2K 컨텍스트에서 2.80배였으나 245K 컨텍스트에서는 1.45배로 감소했습니다.
로컬 추론을 최적화하는 개발자들은 최적의 메모리 및 레이아웃 구성을 통해 하이엔드 하드웨어에서 초당 최대 109토큰을 달성할 수 있습니다.
18. BeeLlama 최적화 포크, 높은 컨텍스트 깊이에서 KVarN 성능 개선
BeeLlama.cpp의 초기 KVarN 구현을 기반으로, 새로운 GitHub 포크(valujin/beellama-kvarn)는 높은 컨텍스트 깊이에서의 성능 저하 문제를 해결하기 위한 최적화를 도입했습니다. 5070Ti GPU가 탑재된 Windows 11 시스템에서 Qwen3.8 IQ4 XS 모델을 사용한 테스트 결과, 이 포크는 원래 구현보다 최대 76% 더 빠른 토큰 생성을 달성했습니다. 개발자들은 kvarn 사용 시 -ngl 플래그를 제거하면 두 구현 모두에서 성능 문제가 발생한다는 점에 유의해야 합니다.
- • valujin/beellama-kvarn 포크는 높은 컨텍스트 깊이를 위해 기존 KVarN 구현을 최적화합니다.
- • 성능 테스트 결과 원래 BeeLlama 구현보다 최대 76% 더 빠른 토큰 생성을 보여줍니다.
- • 이 포크는 Qwen3.8 IQ4 XS 모델을 사용하여 5070Ti GPU, 16GB VRAM, 48GB RAM을 갖춘 Windows 11 시스템에서 테스트되었습니다.
- • kvarn 사용 시 -ngl 플래그를 제거하면 원래 구현과 포크된 구현 모두에서 성능 문제가 발생합니다.
KV-캐시 양자화를 위해 KVarN을 사용하는 개발자들은 이제 이 최적화된 포크로 전환하여 긴 컨텍스트 추론 중 성능 저하를 완화할 수 있습니다.
19. llama.cpp 풀 리퀘스트, IQ 모델의 AVX2 프롬프트 처리 속도 향상
llama.cpp 저장소의 새로운 풀 리퀘스트(#27402)는 IQ 양자화 모델의 대규모 배치 크기 프롬프트 처리를 가속화하기 위해 설계된 AVX2 최적화를 도입했습니다. 이 업데이트는 IQ 모델을 활용하는 개발자들을 위해 CPU 기반 로컬 추론 성능을 직접적으로 향상시킵니다.
- • llama.cpp의 bartowski1182에 의한 풀 리퀘스트(#27402)는 AVX2 최적화를 도입합니다.
- • 이 업데이트는 CPU에서 IQ 모델의 대규모 배치 크기 프롬프트 처리 속도를 높입니다.
CPU에서 로컬 추론을 실행하는 개발자들은 IQ 양자화 모델 사용 시 프롬프트 처리 속도가 향상되는 것을 확인할 수 있습니다.