1. TensorSharp añade soporte local para Qwen-Image 2.1 y adaptadores LoRA
TensorSharp ha actualizado su plataforma para soportar el modelo Qwen-Image 2.1, lanzado por Alibaba el 20 de septiembre. Esta actualización permite la generación y edición local de texto a imagen, incluyendo soporte para adaptadores LoRA de Qwen-Image 2.1 como Pruna 8-step y Viggle Turbo. Los desarrolladores ahora pueden ejecutar el modelo a través de la CLI de TensorSharp especificando un archivo de configuración base y ajustes LoRA opcionales.
- • TensorSharp ahora soporta la ejecución local del modelo Qwen-Image 2.1 lanzado el 20 de septiembre.
- • La actualización añade soporte para adaptadores LoRA de Qwen-Image 2.1, incluyendo Pruna 8-step y Viggle Turbo.
- • Los desarrolladores pueden acceder a múltiples archivos de modelo, incluyendo Qwen-Image 2.1 GGUF y Qwen-Image 2.1 VAE.
- • El motor es accesible mediante la CLI de TensorSharp usando un archivo de configuración base y ajustes LoRA opcionales.
Esta integración permite a los desarrolladores ejecutar el recientemente lanzado modelo Qwen-Image 2.1 de forma local con adaptadores LoRA personalizados para tareas especializadas de generación y edición de imágenes.
2. KoboldCpp introduce un Agent Harness integrado y advierte sobre un sitio de phishing
KoboldCpp ha introducido un Agent Harness integrado diseñado como una alternativa ligera a herramientas como Claude Code. El harness incluye 9 herramientas integradas, soporta un prompt de sistema de 2k tokens y permite a los desarrolladores ampliar la funcionalidad cargando un archivo mcp.json para integrar herramientas MCP. Junto con este lanzamiento, el desarrollador emitió una advertencia urgente sobre un sitio de phishing, kobolcpp.com, que utiliza SEO de sombrero negro para distribuir malware.
- • KoboldCpp ha añadido un Agent Harness integrado que cuenta con 9 herramientas integradas y un prompt de sistema de 2k tokens.
- • El entorno de ejecución de agentes soporta herramientas del Protocolo de Contexto de Modelo (MCP) mediante la carga de un archivo de configuración mcp.json.
- • El agente puede habilitarse a través de la pestaña Admin del lanzador GUI o mediante el flag de línea de comandos --agent, y soporta endpoints compatibles con OpenAI.
- • Los requisitos de sistema recomendados para el agente incluyen al menos 28k de contexto, un límite de generación de 8k y 12GB de VRAM.
- • El desarrollador emitió una advertencia urgente contra el sitio de phishing kobolcpp.com, que utiliza SEO de sombrero negro para distribuir malware.
Proporciona a los desarrolladores un entorno de ejecución de agentes local y ligero con herramientas integradas y soporte para MCP directamente dentro de KoboldCpp, al tiempo que les advierte evitar un sitio de phishing que distribuye malware.
3. DeepSeek presenta la plataforma de sandbox de producción DSec para agentes
DeepSeek Elastic Compute (DSec) es una plataforma de sandbox a escala de producción diseñada para el entrenamiento y evaluación de agentes a gran escala. La plataforma proporciona un SDK unificado que soporta backends de sandbox para llamadas a funciones, contenedores, microVM y máquinas virtuales completas. DSec utiliza el sistema de archivos Fire-Flyer (3FS) para cargar datos de imágenes bajo demanda a través de clústeres y está co-diseñado con un marco de aprendizaje por refuerzo para desacoplar la ejecución de despliegue con estado del entrenamiento de GPU predecible.
- • DeepSeek Elastic Compute (DSec) es una plataforma de sandbox de grado de producción diseñada para el entrenamiento y evaluación de agentes a gran escala.
- • La plataforma ofrece un SDK unificado que soporta múltiples backends, incluyendo llamadas a funciones, contenedores, microVMs y máquinas virtuales completas.
- • DSec utiliza el sistema de archivos Fire-Flyer (3FS) para cargar datos de imágenes de contenedores bajo demanda a través de clústeres.
- • Una unidad de escala de producción de DSec abarca aproximadamente 160 nodos, soportando más de 380,000 sandboxes concurrentes y 3 millones de ejecuciones diarias.
- • El sistema está co-diseñado con un marco de aprendizaje por refuerzo para aislar la ejecución de agentes con estado de los recursos de entrenamiento de GPU.
Proporciona una infraestructura de sandbox unificada y altamente escalable para ejecutar, entrenar y evaluar flujos de trabajo de agentes de forma segura a escala de producción.
4. Drawgent integra agentes de codificación con pizarras Excalidraw en vivo
Drawgent es una herramienta de agente de codificación que integra Claude Code, Codex u opencode con una pizarra Excalidraw para la edición de diagramas en vivo. La herramienta utiliza el Protocolo de Comunicación de Agentes (ACP) para interactuar con agentes de codificación y proporciona un conjunto dedicado de herramientas MCP, incluyendo get_scene, add_elements y update_elements. Drawgent soporta Chrome o Chromium headless para el renderizado y permite a los agentes unirse a salas colaborativas de Excalidraw como colaboradores activos.
- • Drawgent conecta agentes de codificación como Claude Code o Codex a un lienzo de Excalidraw para la edición de diagramas interactiva y en vivo.
- • La herramienta proporciona un conjunto dedicado de herramientas MCP, incluyendo get_scene, add_elements y update_elements, para la manipulación de lienzos por agentes.
- • Los agentes pueden unirse a salas colaborativas de Excalidraw como participantes activos, respondiendo a disparadores de texto en el lienzo o comandos del panel de chat.
- • El sistema funciona en Node.js (versión 18+) y utiliza Chrome o Chromium headless para renderizar el lienzo de Excalidraw.
- • Las escenas se guardan localmente en un archivo JSON ignorado por git, y la herramienta expone APIs REST y WebSocket para integraciones externas.
Permite a los desarrolladores integrar agentes de codificación directamente en pizarras colaborativas, permitiendo a los agentes leer, editar y verificar diagramas en tiempo real.
5. El lenguaje de diagramación Reladraw ofrece control de diseño amigable para IA
Reladraw es un nuevo lenguaje de diagramación diseñado para equilibrar las capacidades de colocación automática de herramientas como Mermaid con el control manual de software como Draw.io. La herramienta está optimizada para una fácil manipulación tanto por humanos como por agentes de IA. Se puede instalar a través de npm y proporciona una habilidad preconstruida para la integración directa con Claude y otros agentes de IA, permitiendo a los desarrolladores generar fácilmente diseños visuales estructurados.
- • Reladraw es un lenguaje de diagramación diseñado para equilibrar la colocación automática de diseño con un control manual preciso.
- • La herramienta está optimizada para una fácil manipulación tanto por desarrolladores humanos como por agentes de IA.
- • Se puede instalar a través de npm e incluye una habilidad preconstruida para la integración directa con Claude y otros agentes.
- • Un entorno de pruebas basado en web está disponible en GitHub para realizar pruebas sin necesidad de instalación local.
Proporciona un lenguaje de diagramación amigable para la IA que los desarrolladores pueden integrar fácilmente en Claude y otros agentes para generar diseños visuales estructurados y controlables.
6. Lanzamiento de Splash 1.1.0 con soporte GGUF y MLX para Apple Silicon
Se ha lanzado la versión 1.1.0 de Splash, que ofrece un tiempo de ejecución de inferencia local optimizado para Apple Silicon. El software combina kernels optimizados, decodificación especulativa, almacenamiento en caché de prefijos y soporte de pesos mixtos en un solo programa. En pruebas de la comunidad, un usuario informó haber ejecutado el modelo Qwen3.8 27B en el formato UD-Q4_K_XL de Unsloth en un M5 Pro con 64GB de RAM, alcanzando velocidades de 50 tokens por segundo.
- • Se ha lanzado la versión 1.1.0 de Splash, trayendo soporte de cuantización GGUF e importaciones MLX a Apple Silicon.
- • El software combina kernels optimizados, decodificación especulativa, almacenamiento en caché de prefijos y soporte de pesos mixtos en un solo tiempo de ejecución.
- • Un usuario informó haber alcanzado 50 tokens por segundo ejecutando el modelo Qwen3.8 27B en el formato UD-Q4_K_XL de Unsloth en un M5 Pro con 64GB de RAM.
Ofrece a los desarrolladores de Apple Silicon un motor de inferencia local altamente optimizado que soporta GGUF, importaciones MLX y decodificación especulativa para una ejecución rápida de modelos.
7. La plantilla Jinja corregida de GPT-OSS resuelve la pérdida de respuestas en el historial de chat
Se identificó un error en la plantilla Jinja de GPT-OSS (originalmente basada en la versión de Unsloth) que provoca que el contenido de la respuesta del modelo se pierda cuando se reproduce el historial de chat que contiene razonamiento. Este error causó que GPT-OSS 20B funcionara mal, mientras que la variante más grande de 120B permaneció funcional. Se ha lanzado una plantilla corregida en Hugging Face, que también introduce una función preserve_thinking que mejora la velocidad de inferencia en múltiples turnos a través del almacenamiento en caché de prefijos.
- • Se encontró un error en la plantilla Jinja de GPT-OSS (derivada de Unsloth) que provocaba la pérdida de respuestas del modelo al reproducir historiales de chat que contenían razonamiento.
- • El error causó que el modelo GPT-OSS 20B funcionara mal, mientras que la variante más grande de 120B permaneció funcional.
- • Se ha lanzado una plantilla corregida en Hugging Face, resolviendo el error de copiar y pegar de la plantilla de referencia.
- • La plantilla actualizada introduce una función preserve_thinking, que utiliza el almacenamiento en caché de prefijos para acelerar la inferencia en múltiples turnos a costa de un mayor uso de tokens.
Corrige un error crítico en las plantillas de GPT-OSS que provoca que los historiales de chat con mucho razonamiento pierdan respuestas, al tiempo que introduce una función de almacenamiento en caché de prefijos para acelerar la inferencia en múltiples turnos.
8. El método de prompting permite decisiones de un solo token en GLM-5.3-Flash
Los desarrolladores ahora pueden configurar LLM estándar para lograr propiedades de decisión similares a Jev mediante la creación de prompts donde el primer token de salida responde a la pregunta. Este método permite la toma de decisiones dentro de una sola pasada hacia adelante y ha sido documentado para su uso con GLM-5.3-Flash y el motor de inferencia vLLM. La configuración soporta entradas de visión, lo que la hace altamente aplicable para tareas rápidas de clasificación visual.
- • Un nuevo método de prompting permite a los LLM estándar tomar decisiones dentro de una sola pasada hacia adelante al forzar que el primer token de salida responda a la pregunta.
- • El enfoque está documentado y probado utilizando GLM-5.3-Flash y el motor de inferencia vLLM.
- • La configuración soporta entradas de visión, permitiendo tareas rápidas de clasificación visual.
- • Los benchmarks indican que la configuración iguala a Jev en precisión y velocidad, superando a Laya, aunque Jev sigue siendo más rentable.
Permite a los desarrolladores lograr una toma de decisiones de latencia ultra baja en LLM estándar como GLM-5.3-Flash utilizando una sola pasada hacia adelante.
9. El wrapper de función única permite una clasificación de visión rápida mediante logprobs de LLM
Una técnica ligera permite a los desarrolladores realizar tareas de visión artificial leyendo las probabilidades de los tokens de un LLM en lugar de generar texto completo. El método requiere establecer max_completion_tokens en 1, logprobs en true y top_logprobs en 20 en una solicitud estándar de Chat Completions. El autor extendió el formato de solicitud del proyecto Jev para soportar datos de imagen codificados en base64 en un campo de adjuntos, proporcionando un script de Python que utiliza OpenCV para la captura de fotogramas de la cámara web.
- • El wrapper realiza una clasificación de visión artificial leyendo las probabilidades de los tokens de un LLM para preguntas específicas.
- • La técnica requiere configurar las solicitudes de Chat Completions con max_completion_tokens establecido en 1, logprobs establecido en true y top_logprobs establecido en 20.
- • La implementación extiende el formato del proyecto Jev para soportar datos de imagen codificados en base64 en un campo de adjuntos.
- • Un script de Python proporcionado utiliza OpenCV para la captura de cámara web y es compatible tanto con llama.cpp local como con endpoints de la API de OpenAI.
- • El rendimiento alcanzó aproximadamente 1 fotograma por segundo usando Gemma 4 12B en una RTX 3090, y 0.2 fotogramas por segundo con gpt-6-luna de OpenAI.
Proporciona un wrapper ligero de función única para realizar una clasificación de visión artificial rápida leyendo las probabilidades de los tokens del LLM en lugar de generar texto completo.
10. El framework FreeToken añade un nivel de disco 'Overspill' para modelos MoE masivos
Basándose en las capacidades existentes del framework FreeToken para el servicio local de MoE, el nuevo nivel de disco experimental Overspill permite que los modelos excedan la RAM del sistema disponible. En las pruebas, un modelo DeepSeek-V4-Flash REAP-150B de 85 GB se ejecutó con éxito en una RTX 3060 con 64 GB de RAM DDR5, alcanzando de 2.8 a 3.4 tokens por segundo. La implementación utiliza mapeo de memoria para expertos y lecturas paralelas para optimizar el rendimiento.
- • Overspill es un nuevo nivel de disco experimental para el framework FreeToken.
- • Permite ejecutar modelos MoE que exceden la RAM del sistema disponible.
- • Las pruebas alcanzaron de 2.8 a 3.4 tokens por segundo para un modelo de 85 GB en una RTX 3060.
- • El framework utiliza mapeo de memoria y lecturas paralelas para gestionar la carga de expertos.
- • El proyecto es de código abierto bajo la licencia Apache-2.0.
Este desarrollo amplía la utilidad del framework FreeToken al permitir la ejecución de modelos MoE masivos en hardware con RAM limitada, proporcionando una nueva opción para el servicio de modelos locales.