1. PrismML, Qwen3.8 기반의 Ternary Bonsai 2로 Bonsai 27B 라인업 업데이트
PrismML은 기존 Bonsai 27B를 개선한 Ternary Bonsai 2 27B를 출시했습니다. 이번 버전은 기본 아키텍처를 Qwen3.8로 업그레이드하면서도 5.9GB라는 매우 압축된 용량을 유지했습니다. 이 모델은 262K 토큰의 컨텍스트 윈도우를 지원하며, CUDA, MLX, WebGPU를 통한 로컬 실행이 가능해 고성능·저용량 로컬 추론에 집중하는 회사의 방향성을 이어가고 있습니다.
- • Ternary Bonsai 2 27B는 이전 Qwen3.6 기반 릴리스에서 업그레이드된 Qwen3.8 27B 아키텍처를 기반으로 합니다.
- • Ternary 가중치와 FP16 그룹별 스케일링을 사용하여 5.9GB의 용량을 유지합니다.
- • 풀 정밀도 모델 대비 98.2%의 벤치마크 성능을 유지합니다.
- • 262K 토큰의 컨텍스트 윈도우를 지원하며 Apache 2.0 라이선스로 배포됩니다.
- • NVIDIA GeForce RTX 5090에서 초당 143 토큰, Apple M5 Max에서 초당 46.8 토큰의 성능을 기록합니다.
개발자들은 기존 Bonsai 27B의 로컬 우선 및 저용량 이점을 유지하면서도 아키텍처가 개선된 27B급 모델을 사용할 수 있게 되었습니다.
2. IFM, 확산 모델(Diffusion)이 결합된 LLM 'K2-Horizon-7B' 출시
K2-Horizon-7B는 기존의 인과적 자기회귀(causal autoregressive) 가중치와 확산 어댑터를 결합하여 표준 생성 과정의 병목 현상을 해결했습니다. 이러한 하이브리드 아키텍처는 실시간 텍스트 생성이 필요한 고처리량, 저지연 애플리케이션을 위한 유망한 경로를 제시합니다.
- • K2-Horizon-7B는 IFM이 출시한 확산 모델 결합형 거대언어모델입니다.
- • 품질 저하 없는 속도 향상을 통해 초당 최대 5,200 토큰의 속도를 달성합니다.
- • 인과적 LLM 아키텍처와 자기회귀 가중치에 플러그 앤 플레이 확산 어댑터를 결합했습니다.
- • 관련 연구는 새로 공개된 arXiv 논문에 문서화되어 있습니다.
개발자들은 표준 자기회귀 가중치와 함께 플러그 앤 플레이 방식의 확산 어댑터를 활용하여 품질 저하 없이 대규모 추론 속도 향상을 달성할 수 있습니다.
3. World Labs, 3D 생성 모델 'Atlas' 정식 출시
World Labs는 이달 초 발표한 얼리 액세스 프로그램을 거쳐 Atlas 모델을 정식 출시했습니다. 단일 사진을 탐색 가능한 3D 환경으로 변환하는 이 모델은 이제 초기 파트너 그룹을 넘어 시뮬레이션, 게임, 로봇 공학 훈련 등 더 넓은 분야에서 활용할 수 있게 되었습니다.
- • World Labs가 Atlas를 얼리 액세스에서 정식 출시로 전환했습니다.
- • 단일 사진을 탐색 가능한 3D 월드로 변환할 수 있습니다.
- • 시뮬레이션, 게임, 로봇 공학 훈련 애플리케이션을 위한 광범위한 도입을 지원합니다.
개발자들은 이제 제한된 테스트 단계를 넘어 2D 이미지로부터 대화형 3D 공간을 생성하는 Atlas를 프로덕션 파이프라인에 통합할 수 있습니다.
4. Cactus, 엣지 자동화 역량을 확장한 'Needle 3' 출시
Cactus는 기존 Needle과 에이전트 중심의 Needle 2에 이어 Needle 3를 선보였습니다. 121M 파라미터 모델인 Needle 3는 밀집 레이어를 Monarch Hadamard MLP로 교체하고 '지능형 사다리(intelligence ladder)' 아키텍처를 도입하여 리소스 제약에 따라 2개에서 20개의 레이어를 유연하게 배포할 수 있습니다. 로컬 실행에 초점을 맞춘 이 모델은 일반 CPU와 엣지 기기에 최적화되어 있으며 최소 8MB의 용량으로 실행 가능합니다.
- • Needle 3는 Monarch Hadamard MLP를 사용하는 121M 파라미터 아키텍처를 특징으로 합니다.
- • 2개에서 20개의 레이어를 독립적으로 배포할 수 있는 '지능형 사다리'를 지원합니다.
- • 가중치는 2.125비트로 양자화되어 8MB에서 29MB의 용량을 차지합니다.
- • macOS, Linux, Windows, Android, iOS, WebAssembly 등 다양한 환경의 CPU에서 로컬 실행에 최적화되었습니다.
- • Hugging Face, GitHub, PyPI에서 'cactus-needle' 패키지로 즉시 이용 가능합니다.
Needle 3는 더 확장 가능하고 슬라이스 가능한 아키텍처를 제공하여 제약이 있는 하드웨어에서도 자동화 작업을 유연하게 배포할 수 있도록 지원합니다.
5. Anthropic, Claude Code 프로젝트에 지속 가능한 병렬 클라우드 세션 도입
Anthropic은 Claude Code 플랫폼의 프로젝트 기능을 재설계하여 병렬적이고 지속적인 클라우드 기반 실행을 가능하게 했습니다. 로컬 터미널 세션에 의존하던 기존의 세션 간 메시징과 달리, 이번 베타 업데이트를 통해 Claude는 클라우드에서 지속되는 백그라운드 스레드 전반에서 복잡한 워크플로우를 조정할 수 있습니다. Claude는 이제 중앙 조정자 역할을 하며, 프로젝트 전체 컨텍스트를 상속받고 사용자의 로컬 기기가 오프라인 상태일 때도 계속 실행되는 스레드에 작업을 위임합니다.
- • Claude Code 프로젝트가 이제 병렬적이고 지속적인 클라우드 세션을 지원합니다.
- • Claude는 조정자 역할을 수행하며 클라우드에서 독립적으로 작동하는 스레드에 작업을 위임합니다.
- • 기존의 로컬 전용 세션 간 메시징과 달리, 사용자가 노트북을 닫아도 스레드는 지속됩니다.
- • 각 스레드는 리포지토리와 지침을 포함한 프로젝트 전체 컨텍스트를 상속받습니다.
- • 이 기능은 현재 일부 Claude Pro 및 Max 구독자를 대상으로 베타 서비스 중입니다.
이번 업데이트는 Claude Code를 로컬 우선 조정에서 클라우드 네이티브 지속 실행으로 전환하여, 개발자가 로컬 기기를 계속 켜두지 않고도 백그라운드 스레드에 다단계 작업을 위임할 수 있게 합니다.
6. Cloudflare, 코딩 에이전트를 위한 보안 감사 스킬 오픈소스화
Cloudflare의 내부 취약점 탐지 도구에서 파생된 이 스킬은 architecture.md 및 findings.json과 같은 구조화된 파일을 사용하여 감사를 관리합니다. 테스트 결과, 단일 실행으로 취약점의 약 절반을 식별하며, 여러 번 실행할 경우 결과가 누적되어 강력한 자동화 방어 체계를 제공하는 것으로 나타났습니다.
- • 보안 감사 스킬은 정찰부터 보고까지 6단계에 걸쳐 격리된 에이전트를 오케스트레이션합니다.
- • MIT 라이선스로 배포되며 Skills CLI를 통해 설치할 수 있습니다.
- • 도구 사용 기능, Node.js, OS 강제 샌드박스를 갖춘 코딩 에이전트가 필요합니다.
- • 필수 샌드박스는 외부 네트워크를 차단하고, 정화된 환경을 사용하며, 리소스 제한을 강제해야 합니다.
- • 이 시스템은 탐지 에이전트와 검증 에이전트를 분리하는 적대적 검증 방식을 채택합니다.
개발자들은 샌드박스화된 적대적 AI 에이전트를 사용하여 자동화된 다단계 보안 감사를 개발 파이프라인에 통합할 수 있습니다.
7. Agent Substrate, GKE에 고밀도 샌드박스 런타임 도입
Agent Substrate는 LLM이 생성한 코드를 대규모로 실행할 때 발생하는 인프라 문제를 해결합니다. 기본적으로 제로 트러스트 격리를 제공하는 고밀도 샌드박싱을 통해, 개발자는 성능 저하나 높은 인프라 오버헤드 없이 에이전트 워크플로우 내에서 신뢰할 수 없는 코드를 안전하게 실행할 수 있습니다.
- • Agent Substrate는 GKE에 최적화된 오픈소스 보안 우선 에이전트 실행 런타임입니다.
- • 표준 컨테이너 런타임 대비 10배 높은 밀도로 수백만 개의 샌드박스를 지원합니다.
- • 초당 500회 이상의 일시 중지/재개 활성화 속도로 500ms 미만의 재개 작업을 제공합니다.
- • 네이티브 제로 트러스트 커널 및 네트워크 격리 기능을 갖추고 있습니다.
- • 모든 Kubernetes 인프라와 호환됩니다.
개발자들은 표준 컨테이너 런타임보다 10배 높은 밀도와 500ms 미만의 재개 시간으로 수백만 개의 격리된 에이전트 샌드박스를 실행할 수 있습니다.
8. 연구 결과, AI 워터마킹이 샘플링 드리프트 및 안전 위험을 초래할 수 있다고 경고
이번 연구 결과는 규제 준수로 인한 예상치 못한 부작용을 강조합니다. 워터마킹 과정이 토큰 확률 분포를 변경하기 때문에, 의도치 않게 안전 가드레일을 약화시키고 도구 호출 동작을 방해할 수 있어 개발자들은 프롬프트 방어 체계를 재평가해야 합니다.
- • Anthropic은 EU 법규 준수를 위해 향후 Claude 모델에 Google의 SynthID-Text 워터마킹을 적용할 것이라고 발표했습니다.
- • SynthID-Text는 비밀 키를 사용하여 다음 단어 선택에 영향을 주어 AI 생성 콘텐츠를 식별합니다.
- • 연구에 따르면 워터마킹은 '샘플링 드리프트'를 유발하여 모델이 안전 가드레일과 도구 호출을 처리하는 방식을 변경합니다.
- • 워터마킹은 특히 프롬프트 인젝션과 결합될 때 모델이 유해한 요청을 수행할 가능성을 높일 수 있습니다.
- • 해당 연구는 Hugging Face의 SynthID-Text 구현을 사용하여 6개의 오픈 웨이트 모델을 대상으로 수행되었습니다.
향후 Claude 모델을 통합하는 개발자들은 능동적 워터마킹으로 인해 발생하는 행동 변화와 안전 위험을 고려하여 엄격한 레드팀 테스트를 수행해야 합니다.
9. 개인용 검색 엔진 Hister, MCP와 통합
Hister는 완전히 로컬에서 실행되며 바이너리 다운로드, Homebrew, Docker, Nix를 통해 설치할 수 있습니다. 전체 텍스트 인덱스를 MCP 서버를 통해 노출함으로써 로컬 코딩 어시스턴트와 에이전트를 위한 강력하고 개인정보를 보호하는 컨텍스트 제공자 역할을 합니다.
- • Hister는 방문한 웹 페이지와 로컬 파일을 인덱싱하도록 설계된 개인용 검색 엔진입니다.
- • 사용자는 웹 인터페이스, 터미널 또는 MCP를 통해 연결된 AI 어시스턴트를 통해 인덱싱된 정보에 액세스할 수 있습니다.
- • AGPLv3 라이선스를 따르며 기본적으로 텔레메트리나 필수 클라우드 서비스가 없습니다.
- • Firefox 또는 Chrome 확장 프로그램을 통한 자동 브라우저 인덱싱을 지원합니다.
- • 사용자가 구성한 임베딩 엔드포인트를 통해 선택적 의미론적 검색을 지원합니다.
개발자들은 표준화된 Model Context Protocol 연결을 사용하여 로컬 AI 에이전트에 자신의 전체 브라우징 기록과 로컬 파일에 대한 안전하고 비공개적인 액세스 권한을 제공할 수 있습니다.
10. Jev, 인덱싱된 액션 공간을 갖춘 초고속 오픈소스 브라우저 에이전트 공개
Jev는 특정 작업 세트(CLICK, TYPE_TEXT, SCROLL 등)와 추측적 팬아웃(speculative fan-out) 아키텍처를 활용하여 네트워크 왕복을 최소화합니다. 현재 섀도우 루트, 프레임, 캔버스, 파일 업로드는 지원하지 않지만, 일반적인 HTML 및 ARIA 제어 상호작용을 위한 매우 효율적인 기준을 제공합니다.
- • Jev는 GitHub에서 이용 가능한 오픈소스 브라우저 에이전트입니다.
- • 스크린샷에 의존하는 대신 브라우저로부터 구조화된 상태를 소비하여 작동합니다.
- • 작업 및 대상 헤드가 동일한 관찰 상태를 공유하는 추측적 팬아웃 방식을 채택합니다.
- • OpenRouter, Gemini, GLM, DeepSeek의 OpenAI 호환 텍스트 모델을 지원합니다.
- • 내부 테스트에서 Google 항공편 검색 작업을 중앙값 7.092초 만에 완료했습니다.
개발자들은 비용이 많이 드는 시각적 입력 대신 구조화된 HTML/ARIA 상태를 소비하는 더 빠르고 지연 시간이 짧은 웹 자동화 에이전트를 구축할 수 있습니다.
11. 사례 연구: 9달러로 GLiNER를 파인튜닝하여 Gemini API 대체하기
이 실용적인 사례 연구는 매우 반복 가능한 비용 절감 패턴을 보여줍니다. 개발자는 고가의 API에서 수행하던 대량 추론 작업을 고도로 전문화된 로컬 GLiNER 모델로 이전함으로써, Reddit 토론을 추적하는 프로젝트인 'New Knife Day'를 위한 비용 효율적인 파이프라인을 구축했습니다.
- • Gemini 3.1 Pro를 사용하여 4,290개의 Reddit 댓글을 9달러의 비용으로 개체명 인식 라벨링했습니다.
- • Modal의 Tesla T4 GPU를 사용하여 GLiNER large v2.5 모델을 라벨링된 데이터로 파인튜닝했습니다.
- • 총 GPU 훈련 비용은 10회 실행에 걸쳐 약 2.50달러가 소요되었습니다.
- • 파인튜닝된 모델은 검증 세트에서 Gemini의 라벨 대비 0.83의 F1 점수를 달성했습니다.
- • 전역 컷오프 대신 클래스별 임계값을 구현하여 재현율을 0.911로 개선했습니다.
개발자들은 프론티어 LLM을 사용하여 훈련 데이터를 라벨링하고 소형의 작업별 로컬 모델을 파인튜닝함으로써 운영 비용을 획기적으로 낮출 수 있습니다.
12. 패턴: LLM 분류를 피처 엔지니어링으로 다루기
LLM을 직접 분류기로 사용하면 운영 임계값을 조정해야 하는 프로덕션 시스템에서 필요한 유연성이 부족합니다. LLM의 출력을 다른 결정론적 공변량과 함께 피처로 취급함으로써, 개발자들은 전통적인 ML 알고리즘을 활용하여 우수한 보정을 달성하고 정밀도-재현율 트레이드오프를 쉽게 조정할 수 있습니다.
- • 분류기로 직접 사용되는 LLM은 종종 보정 및 임계값 제어에 어려움을 겪습니다.
- • 제안된 프레임워크는 LLM 판정 결과를 로지스틱 회귀 모델의 입력 피처로 취급합니다.
- • 이 접근 방식은 더 나은 보정과 추가적인 공변량 포함을 가능하게 합니다.
- • SemEval 2018 데이터셋에서 테스트한 결과, 초기 원샷 LLM 분류기는 0.747의 점수를 기록하여 대회 우승자를 능가했습니다.
- • 기본 분류기 아키텍처는 XGBoost나 신경망과 같은 알고리즘으로 교체할 수 있습니다.
개발자들은 LLM 출력과 전통적인 머신러닝을 결합하여 정밀도와 재현율 임계값을 정밀하게 제어할 수 있는 고도로 보정된 분류기를 구축할 수 있습니다.
13. Microsoft, Kubernetes GPU 워크로드를 위한 TauGrid 오픈소스화
TauGrid는 고가의 GPU 리소스를 관리하기 위한 통합된 자체 호스팅 제어 평면을 제공합니다. Azure Data Explorer와 같은 일부 관측성 통합은 현재 Azure 전용이지만, 핵심 플랫폼은 표준 Kubernetes 인프라에서 실행되어 개발자들에게 독점 오케스트레이션 도구에 대한 강력한 대안을 제공합니다.
- • Microsoft가 MIT 라이선스로 TauGrid를 오픈소스화했습니다.
- • TauGrid는 Tau CLI, 큐잉을 위한 Kueue, 오케스트레이션을 위한 KubeRay, GPU 상태 모니터링 및 관측성을 번들로 제공합니다.
- • GPU 노드가 있는 Kubernetes 1.30+ 클러스터와 Helm 3.0 이상이 필요합니다.
- • 재현성을 위해 구성, 로그, 메트릭 및 체크포인트를 캡처하는 Evidence 레코드를 활용합니다.
- • 소프트웨어는 기본적으로 Microsoft에 텔레메트리를 전송하지 않습니다.
개발자들은 기본 텔레메트리 없이 자체 Kubernetes 클러스터에서 재현 가능한 AI 훈련 및 추론 스택을 배포할 수 있습니다.
14. Grok Build, 컨텍스트 유지를 위한 지속적 메모리 기능 추가
2026년 6월 Grok Build API 베타 출시 이후, xAI는 플랫폼을 지속적 메모리 기능으로 업데이트했습니다. 이 기능을 통해 AI는 프로젝트 사실, 코딩 관례, 결정 사항을 세션 전반에 걸쳐 유지할 수 있어 반복적인 프롬프팅의 필요성을 줄이고 일관된 출력을 보장합니다.
- • Grok Build가 기존 API 플랫폼에 지속적 메모리 기능을 추가했습니다.
- • 이 기능은 프로젝트 사실, 관례 및 결정 사항을 저장합니다.
- • 초기 베타 릴리스와 비교하여 일관성을 개선하고 반복적인 프롬프팅을 줄입니다.
개발자들은 이제 여러 세션에 걸쳐 프로젝트 컨텍스트와 코딩 표준을 유지할 수 있어, 초기 베타에서 확립된 에이전트 코딩 워크플로우의 효율성을 향상시킬 수 있습니다.
15. Google, Gemini 플랫폼에서 에이전트 이상 탐지 기능 프리뷰 공개
AI 에이전트의 자율성이 높아짐에 따라 실행 모니터링이 중요해졌습니다. Google의 새로운 도구는 엔터프라이즈 개발자에게 에이전트 추적 및 로그를 분석할 수 있는 내장 메커니즘을 제공하여, 프롬프트 인젝션, 무한 루프 또는 승인되지 않은 작업을 피해가 발생하기 전에 식별하도록 돕습니다.
- • 에이전트 이상 탐지 기능이 Gemini Enterprise Agent Platform에서 비공개 프리뷰로 제공됩니다.
- • 이 도구는 AI 에이전트의 행동을 모니터링하여 이상 징후를 탐지합니다.
- • 로그와 추적을 활용하여 에이전트 플랫폼 내의 의심스러운 활동에 플래그를 지정합니다.
개발자들은 로그와 추적을 실시간으로 모니터링하여 예상치 못하거나 악의적인 AI 에이전트 작업을 자동으로 탐지하고 완화할 수 있습니다.
16. Nunchux AI, 비디오 DiT를 위한 VC-Attention 커널 출시
Nunchux AI의 새로운 커널은 희소 어텐션(sparse attention), 증류(distillation), 다중 GPU 실행과 호환됩니다. 값 양자화 및 소프트맥스 단계를 최적화함으로써 VC-Attention은 모델 재훈련 없이 비디오 생성 파이프라인에 즉시 적용 가능한 속도 향상을 제공합니다.
- • VC-Attention은 비디오 Diffusion Transformer(DiT)를 위해 설계된 훈련 불필요, 저비트 어텐션 커널입니다.
- • 이 커널은 비디오 생성 시 값 양자화 오류와 느린 소프트맥스 단계를 해결합니다.
- • V-Smooth 구성 요소는 값 토큰을 클러스터링하고 블록 평균을 뺀 후 잔차만 양자화합니다.
- • ExpCast-FP8은 표준 FP32 지수 및 캐스트 연산을 단일 곱셈-덧셈 연산으로 대체합니다.
- • NVIDIA B200에서 VC-Attention은 SageAttention2보다 6.02배 빠르게 실행됩니다.
비디오 생성 기능을 구축하는 개발자들은 추론 지연 시간을 크게 줄이고 최신 GPU에서 소프트맥스 병목 현상을 우회할 수 있습니다.