1. PrismML actualiza la línea Bonsai 27B con Ternary Bonsai 2 basado en Qwen3.8
Basándose en el lanzamiento original de Bonsai 27B, PrismML ha lanzado Ternary Bonsai 2 27B. Esta iteración actualiza la arquitectura subyacente a Qwen3.8 manteniendo una huella altamente comprimida de 5.9 GB. El modelo admite una ventana de contexto de 262K tokens y permite la ejecución local a través de CUDA, MLX y WebGPU, continuando el enfoque de la compañía en la inferencia local de alto rendimiento y bajo consumo de recursos.
- • Ternary Bonsai 2 27B se basa en la arquitectura Qwen3.8 27B, una mejora respecto al lanzamiento anterior basado en Qwen3.6.
- • El modelo mantiene una huella de 5.9 GB utilizando pesos ternarios y escalado por grupos FP16.
- • Conserva el 98.2% del rendimiento de referencia agregado de su contraparte de precisión completa.
- • El modelo admite una ventana de contexto de 262K tokens y se publica bajo la licencia Apache 2.0.
- • El rendimiento alcanza los 143 tokens/segundo en una NVIDIA GeForce RTX 5090 y 46.8 tokens/segundo en un Apple M5 Max.
Los desarrolladores ahora pueden acceder a un modelo actualizado de clase 27B con una arquitectura mejorada que conserva los beneficios de bajo consumo y enfoque local del Bonsai 27B original.
2. IFM lanza K2-Horizon-7B, un LLM con aumento de difusión
Al combinar pesos autorregresivos causales tradicionales con un adaptador de difusión, K2-Horizon-7B evita los cuellos de botella de generación estándar. Esta arquitectura híbrida ofrece un camino prometedor para aplicaciones de alto rendimiento y baja latencia que requieren generación de texto en tiempo real.
- • K2-Horizon-7B es un modelo de lenguaje grande con aumento de difusión lanzado por IFM.
- • El modelo alcanza velocidades de hasta 5,200 tokens por segundo con una aceleración sin pérdida de calidad declarada.
- • Utiliza una arquitectura LLM causal combinada con un adaptador de difusión 'plug-and-play' junto con pesos autorregresivos.
- • La investigación subyacente está documentada en un artículo de arXiv recién publicado.
Los desarrolladores pueden aprovechar un adaptador de difusión 'plug-and-play' junto con pesos autorregresivos estándar para lograr aumentos masivos de velocidad de inferencia sin pérdida de calidad.
3. World Labs hace que el modelo de generación 3D Atlas esté disponible de forma general
Basándose en el programa de acceso anticipado anunciado a principios de este mes, World Labs ha pasado a un lanzamiento completo de su modelo Atlas. El modelo, que convierte fotografías individuales en entornos 3D navegables, ya está disponible para un uso más amplio en simulación, juegos y entrenamiento de robótica, ampliando el acceso más allá del grupo inicial de socios seleccionados.
- • World Labs ha hecho la transición de Atlas del acceso anticipado a un lanzamiento general.
- • El modelo permite la conversión de fotografías individuales en mundos 3D navegables.
- • El lanzamiento admite una adopción más amplia para aplicaciones de simulación, juegos y entrenamiento de robótica.
Los desarrolladores ahora pueden integrar Atlas en sus flujos de trabajo de producción para generar espacios 3D interactivos a partir de imágenes 2D, pasando de la fase de prueba limitada a la disponibilidad general.
4. Cactus lanza Needle 3, ampliando las capacidades de automatización en el borde
Tras el lanzamiento del Cactus Needle original y el Needle 2 enfocado en agentes, Cactus ha introducido Needle 3. Este modelo de 121M de parámetros avanza la serie reemplazando capas densas con un MLP Monarch Hadamard e introduciendo una arquitectura de 'escalera de inteligencia', permitiendo a los desarrolladores desplegar entre 2 y 20 capas dependiendo de las restricciones de recursos. Mantiene el enfoque de la serie en la ejecución local, ahora optimizado para CPUs estándar y dispositivos de borde con una huella de tan solo 8 MB.
- • Needle 3 presenta una arquitectura de 121M de parámetros utilizando un MLP Monarch Hadamard.
- • Admite una 'escalera de inteligencia' que permite el despliegue independiente de 2 a 20 capas.
- • Los pesos están cuantizados a 2.125 bits, lo que resulta en una huella de 8 MB a 29 MB.
- • Optimizado para ejecución local en CPUs en macOS, Linux, Windows, Android, iOS y WebAssembly.
- • Disponible ahora como el paquete 'cactus-needle' en Hugging Face, GitHub y PyPI.
Needle 3 amplía la línea Cactus Needle al proporcionar una arquitectura más escalable y segmentable que permite el despliegue flexible de tareas de automatización en hardware restringido.
5. Anthropic actualiza los proyectos de Claude Code con sesiones en la nube paralelas y persistentes
Anthropic ha evolucionado su plataforma Claude Code rediseñando los Proyectos para permitir la ejecución paralela y persistente basada en la nube. A diferencia de la mensajería entre sesiones lanzada anteriormente, que dependía de sesiones de terminal locales, esta actualización beta permite a Claude coordinar flujos de trabajo complejos a través de hilos en segundo plano que persisten en la nube. Claude ahora actúa como un coordinador central, delegando tareas a estos hilos, que heredan el contexto de todo el proyecto y continúan ejecutándose incluso cuando la máquina local del usuario está desconectada.
- • Los proyectos de Claude Code ahora admiten sesiones en la nube paralelas y persistentes.
- • Claude actúa como coordinador, delegando tareas a hilos que operan de forma independiente en la nube.
- • Los hilos persisten después de que el usuario cierra su computadora portátil, a diferencia de la mensajería entre sesiones solo local anterior.
- • Cada hilo hereda el contexto de todo el proyecto, incluidos repositorios e instrucciones.
- • La función se encuentra actualmente en versión beta para suscriptores seleccionados de Claude Pro y Max.
Esta actualización cambia Claude Code de la coordinación local a la ejecución persistente nativa en la nube, permitiendo a los desarrolladores delegar tareas de varias partes a hilos en segundo plano sin mantener el tiempo de actividad de la máquina local.
6. Cloudflare publica el código abierto de security-audit-skill para agentes de codificación
Originada a partir del arnés interno de descubrimiento de vulnerabilidades de Cloudflare, esta habilidad utiliza archivos estructurados como architecture.md y findings.json para gestionar la auditoría. Las pruebas indican que, si bien una sola ejecución identifica aproximadamente la mitad de las vulnerabilidades, las ejecuciones múltiples son aditivas, proporcionando una defensa automatizada robusta.
- • La habilidad security-audit orquesta agentes aislados a través de seis fases, desde el reconocimiento hasta la generación de informes.
- • Se publica bajo la licencia MIT y se instala a través de la CLI de Skills.
- • La habilidad requiere un agente de codificación con uso de herramientas, Node.js y un entorno aislado (sandbox) aplicado por el sistema operativo.
- • El entorno aislado requerido debe deshabilitar las redes externas, utilizar un entorno saneado y aplicar límites de recursos.
- • El sistema emplea validación adversaria, asegurando que el agente que descubre sea diferente del agente que verifica.
Los desarrolladores pueden integrar auditorías de seguridad automatizadas y multifase en sus flujos de trabajo de desarrollo utilizando agentes de IA adversarios en entornos aislados.
7. Agent Substrate lleva el tiempo de ejecución de sandbox de alta densidad a GKE
Agent Substrate aborda los desafíos de infraestructura de ejecutar código generado por LLM a escala. Al proporcionar un entorno aislado (sandboxing) de alta densidad con aislamiento nativo de confianza cero, permite a los desarrolladores ejecutar de forma segura código no confiable dentro de los flujos de trabajo de los agentes sin sacrificar el rendimiento ni incurrir en altos costos de infraestructura.
- • Agent Substrate es un tiempo de ejecución de ejecución de agentes de código abierto y seguro por defecto optimizado para GKE.
- • El tiempo de ejecución admite millones de sandboxes con una densidad 10 veces mayor que los tiempos de ejecución de contenedores estándar.
- • Proporciona operaciones de reanudación inferiores a 500 ms a una tasa de más de 500 activaciones de suspensión/reanudación por segundo.
- • La plataforma cuenta con aislamiento nativo de kernel y red de confianza cero.
- • Es compatible con cualquier infraestructura de Kubernetes.
Los desarrolladores pueden ejecutar millones de sandboxes de agentes aislados con una densidad 10 veces mayor que los tiempos de ejecución de contenedores estándar y tiempos de reanudación inferiores a 500 ms.
8. Un estudio advierte que la marca de agua de IA causa deriva de muestreo y riesgos de seguridad
Los hallazgos destacan un efecto secundario inesperado del cumplimiento normativo. Debido a que el proceso de marcado de agua altera las distribuciones de probabilidad de los tokens, puede debilitar inadvertidamente las barreras de seguridad y alterar el comportamiento de llamada a herramientas, lo que requiere que los desarrolladores reevalúen sus defensas de prompts.
- • Anthropic anunció que los futuros modelos de Claude implementarán la marca de agua SynthID-Text de Google para cumplir con la ley de la UE.
- • SynthID-Text utiliza una clave secreta para influir en la selección de la siguiente palabra para identificar contenido generado por IA.
- • La investigación indica que el marcado de agua causa 'deriva de muestreo', alterando cómo los modelos manejan las barreras de seguridad y las invocaciones de herramientas.
- • El estudio encontró que el marcado de agua puede aumentar la probabilidad de que un modelo cumpla con solicitudes dañinas, especialmente cuando se combina con inyección de prompts.
- • La investigación se realizó en seis modelos de pesos abiertos utilizando la implementación de Hugging Face de SynthID-Text.
Los desarrolladores que integren futuros modelos de Claude deben realizar pruebas rigurosas de 'red-teaming' para tener en cuenta los cambios de comportamiento y los riesgos de seguridad introducidos por el marcado de agua activo.
9. El motor de búsqueda privado Hister se integra con MCP
Hister se ejecuta completamente de forma local y se puede instalar mediante descarga binaria, Homebrew, Docker o Nix. Al exponer su índice de texto completo a través de un servidor MCP, sirve como un proveedor de contexto potente y que preserva la privacidad para asistentes de codificación y agentes locales.
- • Hister es un motor de búsqueda privado diseñado para indexar páginas web visitadas y archivos locales.
- • Los usuarios pueden acceder a la información indexada a través de una interfaz web, terminal o un asistente de IA conectado a través de MCP.
- • El software tiene licencia AGPLv3 y no cuenta con telemetría ni servicios en la nube obligatorios por defecto.
- • Admite la indexación automática del navegador a través de extensiones de Firefox o Chrome.
- • La búsqueda semántica opcional es compatible a través de puntos finales de incrustaciones (embeddings) configurados por el usuario.
Los desarrolladores pueden proporcionar a los agentes de IA locales acceso seguro y privado a su historial de navegación completo y archivos locales utilizando una conexión estandarizada de Model Context Protocol.
10. Jev Ultrafast publica el código abierto de un agente de navegador con espacio de acción indexado
Al utilizar un conjunto específico de operaciones (como CLICK, TYPE_TEXT y SCROLL) y una arquitectura de ramificación especulativa, Jev minimiza los viajes de ida y vuelta de la red. Aunque actualmente no admite shadow roots, marcos, canvas o cargas de archivos, proporciona una base altamente eficiente para las interacciones comunes de control HTML y ARIA.
- • Jev es un agente de navegador de código abierto disponible en GitHub.
- • El agente opera consumiendo estados estructurados del navegador en lugar de depender de capturas de pantalla.
- • Emplea un enfoque de ramificación especulativa donde los encabezados de operación y destino comparten el mismo estado observado.
- • Admite modelos de texto compatibles con OpenAI de OpenRouter, Gemini, GLM y DeepSeek.
- • En pruebas internas, una tarea de búsqueda de Google Flights se completó en un tiempo medio de 7.092 segundos.
Los desarrolladores pueden crear agentes de automatización web más rápidos y de menor latencia que consuman estados HTML/ARIA estructurados en lugar de entradas visuales costosas.
11. Estudio de caso: Ajuste fino de GLiNER por $9 para reemplazar la API de Gemini
Este estudio de caso práctico demuestra un patrón de reducción de costos altamente repetible. Al descargar la inferencia masiva de APIs costosas a un modelo GLiNER local altamente especializado, el desarrollador construyó un flujo de trabajo rentable para impulsar 'New Knife Day', un proyecto que rastrea discusiones en Reddit.
- • Se utilizó Gemini 3.1 Pro para etiquetar 4,290 comentarios de Reddit para el reconocimiento de entidades nombradas a un costo de $9.
- • Se ajustó un modelo GLiNER large v2.5 con los datos etiquetados utilizando una GPU Tesla T4 en Modal.
- • Los costos totales de entrenamiento en GPU ascendieron a aproximadamente $2.50 en diez ejecuciones.
- • El modelo ajustado logró una puntuación F1 de 0.83 frente a las etiquetas de Gemini en un conjunto de validación.
- • La implementación de umbrales por clase en lugar de un corte global mejoró la recuperación de material a 0.911.
Los desarrolladores pueden reducir drásticamente los costos operativos utilizando LLMs de frontera para etiquetar datos de entrenamiento y ajustando modelos locales pequeños y específicos para cada tarea.
12. Patrón: Tratamiento de la clasificación de LLM como ingeniería de características
La clasificación directa de LLM carece de la flexibilidad necesaria para los sistemas de producción donde los umbrales operativos deben ajustarse. Al tratar la salida del LLM como una característica junto con otras covariables deterministas, los desarrolladores pueden aprovechar los algoritmos de ML tradicionales para lograr una calibración superior y ajustar fácilmente las compensaciones de precisión-recuperación.
- • Los LLM utilizados directamente como clasificadores a menudo tienen dificultades con la calibración y el control de umbrales.
- • El marco propuesto trata el veredicto del LLM como una característica de entrada para un modelo de regresión logística.
- • Este enfoque permite una mejor calibración y la inclusión de covariables adicionales.
- • Probado en el conjunto de datos SemEval 2018, el clasificador LLM de un solo disparo inicial logró una puntuación de 0.747, superando al ganador de la competencia.
- • La arquitectura del clasificador subyacente se puede intercambiar por algoritmos como XGBoost o redes neuronales.
Los desarrolladores pueden crear clasificadores altamente calibrados que permitan un control preciso sobre los umbrales de precisión y recuperación combinando las salidas de LLM con el aprendizaje automático tradicional.
13. Microsoft publica el código abierto de TauGrid para cargas de trabajo de GPU en Kubernetes
TauGrid proporciona un plano de control unificado y autohospedado para gestionar costosos recursos de GPU. Si bien algunas integraciones de observabilidad como Azure Data Explorer son actualmente específicas de Azure, la plataforma central se ejecuta en cualquier infraestructura estándar de Kubernetes, ofreciendo a los desarrolladores una alternativa robusta a las herramientas de orquestación propietarias.
- • Microsoft publicó el código abierto de TauGrid bajo la licencia MIT.
- • TauGrid incluye la CLI Tau, Kueue para colas, KubeRay para orquestación, monitoreo de salud de GPU y observabilidad.
- • La plataforma requiere un clúster de Kubernetes 1.30+ con nodos de GPU y Helm 3.0 o posterior.
- • Utiliza registros de evidencia para capturar configuración, registros, métricas y puntos de control para la reproducibilidad.
- • El software no envía telemetría a Microsoft por defecto.
Los desarrolladores pueden implementar una pila de entrenamiento e inferencia de IA autohospedada y reproducible en sus propios clústeres de Kubernetes sin telemetría predeterminada.
14. Grok Build añade memoria persistente para la retención de contexto
Tras el lanzamiento beta de junio de 2026 de la API Grok Build, xAI ha actualizado la plataforma con memoria persistente. Esta función permite a la IA retener hechos del proyecto, convenciones de codificación y decisiones a través de sesiones, reduciendo la necesidad de indicaciones repetitivas y asegurando una salida consistente.
- • Grok Build añade memoria persistente a su plataforma API existente.
- • La función almacena hechos, convenciones y decisiones del proyecto.
- • Mejora la consistencia y reduce las indicaciones repetitivas en comparación con el lanzamiento beta inicial.
Los desarrolladores ahora pueden mantener el contexto del proyecto y los estándares de codificación a través de múltiples sesiones, mejorando la eficiencia de los flujos de trabajo de codificación de agentes establecidos en la beta inicial.
15. Google presenta la detección de anomalías de agentes en la plataforma Gemini
A medida que los agentes de IA ganan más autonomía, monitorear su ejecución se vuelve crítico. La nueva herramienta de Google proporciona a los desarrolladores empresariales un mecanismo integrado para analizar rastros y registros de agentes, ayudando a identificar inyecciones de prompts, bucles infinitos o acciones no autorizadas antes de que causen daño.
- • La Detección de Anomalías de Agentes ya está disponible en Vista Previa Privada en la Plataforma de Agentes Empresariales de Gemini.
- • La herramienta monitorea el comportamiento de los agentes de IA para detectar anomalías.
- • Utiliza registros y rastros para marcar actividades sospechosas dentro de la plataforma de agentes.
Los desarrolladores pueden detectar y mitigar automáticamente acciones inesperadas o maliciosas de agentes de IA monitoreando registros y rastros en tiempo real.
16. Nunchux AI lanza el kernel VC-Attention para DiTs de video
El nuevo kernel de Nunchux AI es compatible con atención dispersa, destilación y ejecución multi-GPU. Al optimizar las etapas de cuantización de valores y softmax, VC-Attention proporciona una aceleración inmediata para los flujos de trabajo de generación de video sin requerir el reentrenamiento del modelo.
- • VC-Attention es un kernel de atención de bits bajos y sin entrenamiento diseñado para transformadores de difusión de video (DiTs).
- • El kernel aborda el error de cuantización de valores y las etapas lentas de softmax en la generación de video.
- • El componente V-Smooth agrupa tokens de valor y cuantiza solo los residuos después de restar las medias de bloque.
- • ExpCast-FP8 reemplaza las operaciones exponenciales y de conversión FP32 estándar con una sola multiplicación-suma.
- • En una NVIDIA B200, VC-Attention se ejecuta 6.02 veces más rápido que SageAttention2.
Los desarrolladores que crean funciones de generación de video pueden reducir significativamente la latencia de inferencia y evitar los cuellos de botella de softmax en las GPUs modernas.