1. TensorSharp, Qwen-Image 2.1 및 LoRA 어댑터에 대한 로컬 지원 추가
TensorSharp은 9월 20일 Alibaba가 출시한 Qwen-Image 2.1 모델을 지원하도록 플랫폼을 업데이트했습니다. 이번 업데이트를 통해 Pruna 8-step 및 Viggle Turbo와 같은 Qwen-Image 2.1 LoRA 어댑터를 포함한 로컬 텍스트-이미지 생성 및 편집이 가능해졌습니다. 개발자는 이제 기본 구성 파일과 선택적 LoRA 설정을 지정하여 TensorSharp CLI를 통해 모델을 실행할 수 있습니다.
- • TensorSharp은 이제 9월 20일에 출시된 Qwen-Image 2.1 모델의 로컬 실행을 지원합니다.
- • 이번 업데이트로 Pruna 8-step 및 Viggle Turbo를 포함한 Qwen-Image 2.1 LoRA 어댑터 지원이 추가되었습니다.
- • 개발자는 Qwen-Image 2.1 GGUF 및 Qwen-Image 2.1 VAE를 포함한 다양한 모델 파일에 접근할 수 있습니다.
- • 엔진은 기본 구성 파일과 선택적 LoRA 설정을 사용하여 TensorSharp CLI를 통해 액세스할 수 있습니다.
이번 통합을 통해 개발자는 최근 출시된 Qwen-Image 2.1 모델을 맞춤형 LoRA 어댑터와 함께 로컬에서 실행하여 특화된 이미지 생성 및 편집 작업을 수행할 수 있습니다.
2. KoboldCpp, 내장 에이전트 하네스 도입 및 피싱 사이트 경고
KoboldCpp는 Claude Code와 같은 도구의 경량 대안으로 설계된 내장 에이전트 하네스를 도입했습니다. 이 하네스에는 9개의 내장 도구가 포함되어 있으며, 2k 토큰 시스템 프롬프트를 지원하고 mcp.json 파일을 로드하여 MCP 도구를 통합함으로써 기능을 확장할 수 있습니다. 이번 릴리스와 함께 개발자는 블랙햇 SEO를 사용하여 악성코드를 배포하는 피싱 사이트인 kobolcpp.com에 대한 긴급 경고를 발표했습니다.
- • KoboldCpp에 9개의 내장 도구와 2k 토큰 시스템 프롬프트를 갖춘 통합 에이전트 하네스가 추가되었습니다.
- • 에이전트 런타임은 mcp.json 구성 파일을 로드하여 MCP(Model Context Protocol) 도구를 지원합니다.
- • 에이전트는 GUI 런처의 Admin 탭이나 --agent 명령줄 플래그를 통해 활성화할 수 있으며, OpenAI 호환 엔드포인트를 지원합니다.
- • 에이전트의 권장 시스템 요구 사항은 최소 28k 컨텍스트, 8k 생성 제한, 12GB VRAM입니다.
- • 개발자는 블랙햇 SEO를 통해 악성코드를 배포하는 피싱 사이트 kobolcpp.com에 대해 긴급 경고를 발표했습니다.
개발자에게 KoboldCpp 내부에서 직접 내장 도구와 MCP 지원을 갖춘 경량 로컬 에이전트 런타임을 제공하는 동시에, 악성코드를 배포하는 피싱 사이트를 피하도록 경고합니다.
3. DeepSeek, 에이전트용 DSec 프로덕션 샌드박스 플랫폼 도입
DeepSeek Elastic Compute(DSec)는 대규모 에이전트 학습 및 평가를 위해 설계된 프로덕션 규모의 샌드박스 플랫폼입니다. 이 플랫폼은 함수 호출, 컨테이너, microVM 및 전체 VM 샌드박스 백엔드를 지원하는 통합 SDK를 제공합니다. DSec은 Fire-Flyer File System(3FS)을 활용하여 클러스터 전반에서 이미지 데이터를 온디맨드로 로드하며, 상태 저장 롤아웃 실행을 선점 가능한 GPU 학습과 분리하기 위해 강화 학습 프레임워크와 공동 설계되었습니다.
- • DeepSeek Elastic Compute(DSec)는 대규모 에이전트 학습 및 평가를 위해 설계된 프로덕션급 샌드박스 플랫폼입니다.
- • 이 플랫폼은 함수 호출, 컨테이너, microVM, 전체 가상 머신 등 다양한 백엔드를 지원하는 통합 SDK를 제공합니다.
- • DSec은 Fire-Flyer File System(3FS)을 사용하여 클러스터 전반에서 컨테이너 이미지 데이터를 온디맨드로 로드합니다.
- • DSec의 단일 프로덕션 규모 유닛은 약 160개의 노드에 걸쳐 있으며, 38만 개 이상의 동시 샌드박스와 일일 300만 건의 실행을 지원합니다.
- • 이 시스템은 상태 저장 에이전트 실행을 GPU 학습 리소스와 격리하기 위해 강화 학습 프레임워크와 공동 설계되었습니다.
에이전트 워크플로우를 프로덕션 규모에서 안전하게 실행, 학습 및 평가할 수 있는 확장성이 뛰어난 통합 샌드박스 인프라를 제공합니다.
4. Drawgent, 코딩 에이전트와 실시간 Excalidraw 화이트보드 통합
Drawgent는 Claude Code, Codex 또는 opencode를 Excalidraw 화이트보드와 통합하여 실시간 다이어그램 편집을 가능하게 하는 코딩 에이전트 도구입니다. 이 도구는 ACP(Agent Communication Protocol)를 사용하여 코딩 에이전트와 인터페이스하며, get_scene, add_elements, update_elements를 포함한 전용 MCP 도구 모음을 제공합니다. Drawgent는 렌더링을 위해 헤드리스 Chrome 또는 Chromium을 지원하며, 에이전트가 협업 Excalidraw 룸에 활성 참여자로 참여할 수 있도록 합니다.
- • Drawgent는 Claude Code나 Codex와 같은 코딩 에이전트를 Excalidraw 캔버스에 연결하여 실시간 대화형 다이어그램 편집을 지원합니다.
- • 이 도구는 에이전트의 캔버스 조작을 위해 get_scene, add_elements, update_elements를 포함한 전용 MCP 도구 모음을 제공합니다.
- • 에이전트는 협업 Excalidraw 룸에 활성 참여자로 참여하여 캔버스 텍스트 트리거 또는 채팅 패널 명령에 응답할 수 있습니다.
- • 이 시스템은 Node.js(버전 18 이상)에서 실행되며 Excalidraw 캔버스를 렌더링하기 위해 헤드리스 Chrome 또는 Chromium을 사용합니다.
- • 장면은 로컬의 git-ignored JSON 파일에 저장되며, 이 도구는 외부 통합을 위한 REST 및 WebSocket API를 노출합니다.
개발자가 코딩 에이전트를 협업 화이트보드에 직접 통합하여 에이전트가 실시간으로 다이어그램을 읽고, 편집하고, 검증할 수 있게 합니다.
5. Reladraw 다이어그램 언어, AI 친화적인 레이아웃 제어 제공
Reladraw는 Mermaid와 같은 도구의 자동 배치 기능과 Draw.io와 같은 소프트웨어의 수동 제어 사이의 균형을 맞추기 위해 설계된 새로운 다이어그램 언어입니다. 이 도구는 인간과 AI 에이전트 모두가 쉽게 조작할 수 있도록 최적화되어 있습니다. npm을 통해 설치할 수 있으며, Claude 및 기타 AI 에이전트와 직접 통합할 수 있는 사전 구축된 스킬을 제공하여 개발자가 구조화된 시각적 레이아웃을 쉽게 생성할 수 있도록 합니다.
- • Reladraw는 자동 레이아웃 배치와 정밀한 수동 제어 사이의 균형을 맞추도록 설계된 다이어그램 언어입니다.
- • 이 도구는 인간 개발자와 AI 에이전트 모두가 쉽게 조작할 수 있도록 최적화되어 있습니다.
- • npm을 통해 설치할 수 있으며 Claude 및 기타 에이전트와 직접 통합하기 위한 사전 구축된 스킬이 포함되어 있습니다.
- • 로컬 설치 없이 테스트할 수 있는 웹 기반 플레이그라운드가 GitHub에서 제공됩니다.
개발자가 Claude 및 기타 에이전트에 쉽게 통합하여 구조화되고 제어 가능한 시각적 레이아웃을 생성할 수 있는 AI 친화적인 다이어그램 언어를 제공합니다.
6. Splash 1.1.0 출시, Apple Silicon용 GGUF 및 MLX 지원
Splash 버전 1.1.0이 출시되어 Apple Silicon을 위한 최적화된 로컬 추론 런타임을 제공합니다. 이 소프트웨어는 최적화된 커널, 추측적 디코딩(speculative decoding), 접두사 캐싱(prefix caching) 및 혼합 가중치 지원을 단일 프로그램으로 결합했습니다. 커뮤니티 테스트에서 한 사용자는 64GB RAM을 탑재한 M5 Pro에서 Unsloth의 UD-Q4_K_XL 형식으로 Qwen3.8 27B 모델을 실행하여 초당 50토큰의 속도를 달성했다고 보고했습니다.
- • Splash 버전 1.1.0이 출시되어 Apple Silicon에 GGUF 양자화 지원 및 MLX 가져오기 기능을 제공합니다.
- • 이 소프트웨어는 최적화된 커널, 추측적 디코딩, 접두사 캐싱 및 혼합 가중치 지원을 단일 런타임으로 결합합니다.
- • 한 사용자는 64GB RAM을 탑재한 M5 Pro에서 Unsloth의 UD-Q4_K_XL 형식으로 Qwen3.8 27B 모델을 실행하여 초당 50토큰의 속도를 달성했다고 보고했습니다.
Apple Silicon 개발자에게 GGUF, MLX 가져오기 및 추측적 디코딩을 지원하여 빠른 모델 실행을 가능하게 하는 고도로 최적화된 로컬 추론 엔진을 제공합니다.
7. GPT-OSS Jinja 템플릿 수정, 채팅 기록에서 답변 누락 문제 해결
GPT-OSS Jinja 템플릿(원래 Unsloth 버전 기반)에서 추론이 포함된 채팅 기록을 재생할 때 모델의 답변 내용이 누락되는 버그가 확인되었습니다. 이 버그로 인해 GPT-OSS 20B 모델이 오작동했으며, 더 큰 120B 변형은 정상적으로 작동했습니다. Hugging Face에 수정된 템플릿이 릴리스되었으며, 이 템플릿은 접두사 캐싱을 통해 다중 턴 추론 속도를 향상시키는 preserve_thinking 기능도 도입했습니다.
- • GPT-OSS Jinja 템플릿(Unsloth에서 파생)의 버그로 인해 추론이 포함된 채팅 기록 재생 시 모델 답변이 누락되는 현상이 발견되었습니다.
- • 이 버그로 인해 GPT-OSS 20B 모델이 오작동했으며, 더 큰 120B 변형은 정상적으로 작동했습니다.
- • Hugging Face에 수정된 템플릿이 릴리스되어 참조 템플릿의 복사-붙여넣기 오류를 해결했습니다.
- • 업데이트된 템플릿은 접두사 캐싱을 사용하여 다중 턴 추론을 가속화하는 preserve_thinking 기능을 도입했지만, 토큰 사용량이 증가할 수 있습니다.
추론이 많은 채팅 기록에서 답변이 누락되는 GPT-OSS 템플릿의 치명적인 버그를 수정하고, 다중 턴 추론 속도를 높이는 접두사 캐싱 기능을 도입합니다.
8. GLM-5.3-Flash에서 단일 토큰 결정을 가능하게 하는 프롬프팅 방식
개발자는 이제 첫 번째 출력 토큰이 질문에 답하도록 프롬프트를 작성하여 표준 LLM이 Jev와 유사한 결정 속성을 갖도록 구성할 수 있습니다. 이 방식을 사용하면 단일 순방향 패스 내에서 의사 결정이 가능하며, GLM-5.3-Flash 및 vLLM 추론 엔진에서의 사용 사례가 문서화되었습니다. 이 설정은 비전 입력을 지원하므로 빠른 시각적 분류 작업에 매우 적합합니다.
- • 새로운 프롬프팅 방식을 통해 표준 LLM이 첫 번째 출력 토큰으로 질문에 답하도록 강제하여 단일 순방향 패스 내에서 결정을 내릴 수 있습니다.
- • 이 접근 방식은 GLM-5.3-Flash 및 vLLM 추론 엔진을 사용하여 문서화 및 테스트되었습니다.
- • 이 설정은 비전 입력을 지원하여 빠른 시각적 분류 작업을 가능하게 합니다.
- • 벤치마크에 따르면 이 설정은 정확도와 속도 면에서 Jev와 일치하며 Laya보다 우수하지만, 비용 효율성 면에서는 Jev가 여전히 앞서 있습니다.
개발자가 단일 순방향 패스를 사용하여 GLM-5.3-Flash와 같은 표준 LLM에서 초저지연 의사 결정을 구현할 수 있게 합니다.
9. LLM 로그 확률을 통한 빠른 비전 분류를 가능하게 하는 단일 함수 래퍼
경량 기술을 통해 개발자는 전체 텍스트를 생성하는 대신 LLM의 토큰 확률을 읽어 컴퓨터 비전 작업을 수행할 수 있습니다. 이 방식은 표준 Chat Completions 요청에서 max_completion_tokens를 1로, logprobs를 true로, top_logprobs를 20으로 설정해야 합니다. 작성자는 Jev 프로젝트의 요청 형식을 확장하여 attachments 필드에 base64로 인코딩된 이미지 데이터를 지원하도록 했으며, 웹캠 프레임 캡처를 위해 OpenCV를 사용하는 Python 스크립트를 제공합니다.
- • 이 래퍼는 특정 질문에 대한 LLM의 토큰 확률을 읽어 컴퓨터 비전 분류를 수행합니다.
- • 이 기술을 사용하려면 Chat Completions 요청에서 max_completion_tokens를 1로, logprobs를 true로, top_logprobs를 20으로 설정해야 합니다.
- • 구현은 Jev 프로젝트의 형식을 확장하여 attachments 필드에 base64로 인코딩된 이미지 데이터를 지원합니다.
- • 제공된 Python 스크립트는 OpenCV를 사용하여 웹캠을 캡처하며 로컬 llama.cpp 및 OpenAI API 엔드포인트 모두와 호환됩니다.
- • RTX 3090에서 Gemma 4 12B를 사용할 경우 초당 약 1프레임, OpenAI의 gpt-6-luna를 사용할 경우 초당 0.2프레임의 성능을 기록했습니다.
전체 텍스트를 생성하는 대신 LLM 토큰 확률을 읽어 빠른 컴퓨터 비전 분류를 수행할 수 있는 경량의 단일 함수 래퍼를 제공합니다.
10. FreeToken 프레임워크, 대규모 MoE 모델을 위한 Overspill 디스크 계층 추가
로컬 MoE 서빙을 위한 FreeToken 프레임워크의 기존 기능을 기반으로 하는 새로운 실험적 Overspill 디스크 계층을 통해 모델이 사용 가능한 시스템 RAM을 초과할 수 있습니다. 테스트에서 85GB DeepSeek-V4-Flash REAP-150B 모델이 64GB DDR5 RAM을 탑재한 RTX 3060에서 성공적으로 실행되었으며, 초당 2.8~3.4토큰의 속도를 달성했습니다. 이 구현은 전문가를 위한 메모리 매핑과 병렬 읽기를 사용하여 성능을 최적화합니다.
- • Overspill은 FreeToken 프레임워크를 위한 새로운 실험적 디스크 계층입니다.
- • 사용 가능한 시스템 RAM을 초과하는 MoE 모델을 실행할 수 있게 합니다.
- • 테스트 결과 RTX 3060에서 85GB 모델로 초당 2.8~3.4토큰을 달성했습니다.
- • 프레임워크는 전문가 로딩을 관리하기 위해 메모리 매핑과 병렬 읽기를 사용합니다.
- • 이 프로젝트는 Apache-2.0 라이선스 하에 오픈 소스로 제공됩니다.
이 개발은 RAM이 제한된 하드웨어에서 대규모 MoE 모델을 실행할 수 있게 하여 로컬 모델 서빙을 위한 새로운 옵션을 제공함으로써 FreeToken 프레임워크의 유용성을 확장합니다.