1. Z.ai lanza el modelo de pesos abiertos GLM-5.2 con una ventana de contexto de 1M
GLM-5.2 de Z.ai está diseñado para codificación, razonamiento y flujos de trabajo de agentes de largo alcance, admitiendo tres modos de esfuerzo de pensamiento (sin pensamiento, alto y máximo). Aunque carece de capacidades multimodales, lo que le dificulta tareas como la depuración visual en comparación con Claude Opus 4.8, ofrece una alternativa altamente rentable para el razonamiento basado en texto. El modelo puede ejecutarse localmente utilizando marcos como vLLM, SGLang, Transformers o llama.cpp, y está disponible en Hugging Face y ModelScope.
- • GLM-5.2 cuenta con 744 mil millones de parámetros totales, 40 mil millones de parámetros activos y una ventana de contexto de 1 millón de tokens bajo licencia MIT.
- • El modelo ocupa el tercer lugar general y el primero entre los modelos de pesos abiertos en el benchmark de trabajo de agentes GDPval-AA con una puntuación Elo de 1524.
- • Es un modelo solo de texto que carece de capacidades multimodales, lo que puede afectar tareas que requieren autoinspección visual.
- • La ejecución local es compatible mediante Unsloth Dynamic GGUFs, reduciendo los requisitos de espacio en disco a 239 GB para cuantizaciones de 2 bits y 217 GB para las de 1 bit.
- • El precio de los tokens de salida es menos de una quinta parte del costo de Claude Opus 4.8.
Los desarrolladores pueden alojar por cuenta propia un modelo de razonamiento altamente capaz con una ventana de contexto de 1 millón de tokens a una fracción del costo de los modelos de frontera propietarios.
2. Los modelos Gemma 4 aprovechan QAT para una inferencia local de 4 bits de alta calidad
Aunque Gemma 4 ofrece ventajas técnicas significativas, como MTP nativo y cuantización de baja precisión de alta calidad, el mayor tiempo de entrenamiento ha ralentizado la adopción de ajustes personalizados. Sin embargo, los primeros lanzamientos de la comunidad como Equinox y MeroMero demuestran un creciente interés de los desarrolladores en la arquitectura.
- • Los modelos Gemma 4 están disponibles en tamaños de 12B, 26B-A4B y 31B bajo licencia Apache 2.0, con comprensión nativa de imágenes y video.
- • El entrenamiento consciente de cuantización (QAT) permite que las versiones cuantizadas de 4 bits mantengan niveles de calidad comparables a los modelos base BF16.
- • El modelo de 12B cabe en 8 GB de VRAM, mientras que el de 31B cabe en 20-24 GB de VRAM.
- • El ajuste fino de los modelos Gemma 4 puede tardar hasta el doble de tiempo porque requiere entrenamiento tanto en las versiones originales BF16 como en las versiones QAT no cuantizadas.
- • Todos los modelos cuentan con soporte global de predicción de múltiples tokens (MTP).
Los desarrolladores pueden ejecutar modelos multimodales altamente capaces, con licencia Apache 2.0, localmente en GPU de consumo con tan solo 8 GB de VRAM.
3. Inception Labs lanza el modelo de razonamiento basado en difusión Mercury 2
Al cambiar de la generación autorregresiva tradicional a una arquitectura basada en difusión, Mercury 2 logra enormes ganancias de rendimiento. Esto lo convierte en una herramienta especializada para desarrolladores que necesitan ejecutar bucles de agentes de múltiples pasos y alta frecuencia donde la latencia ha sido históricamente un factor limitante.
- • Mercury 2 genera aproximadamente 1,000 tokens por segundo, superando a DiffusionGemma de Google.
- • El modelo utiliza tecnología de difusión, adaptando los procesos de generación utilizados típicamente en modelos de imagen al razonamiento de texto.
- • Está optimizado específicamente para flujos de trabajo de alto volumen y sensibles a la velocidad, en lugar de tareas complejas de razonamiento de nivel de frontera.
- • Mercury 2 está disponible exclusivamente a través de API o servicios en la nube.
Los desarrolladores pueden crear flujos de trabajo de latencia ultrabaja y tuberías de agentes de alto rendimiento que requieren un razonamiento rápido y estructurado.
4. Alibaba lanza el modelo de generación de video HappyHorse 1.1 con referencia de múltiples imágenes
La actualización de Alibaba representa un paso significativo en la generación multimodal, consolidando múltiples activos en una sola pasada de generación. El lanzamiento coincide con la expansión masiva de la red global en la nube de 52.7 mil millones de dólares de Alibaba, aunque la compañía fue agregada recientemente a la lista del Pentágono de empresas militares chinas.
- • HappyHorse 1.1 está disponible en Alibaba Cloud Model Studio con acceso completo a la API y un descuento de lanzamiento del 40% durante las primeras dos semanas.
- • El modelo cuenta con capacidad de referencia de múltiples imágenes R2V para la consistencia de personajes, mejor calidad de movimiento y sincronización labial sin deriva.
- • Está construido sobre un Transformer de autoatención unificado de 15 mil millones de parámetros que procesa texto, imagen, video y audio en una sola pasada de generación.
- • La versión anterior, HappyHorse 1.0, ocupa la posición número 2 en las tablas de clasificación de Artificial Analysis Video Arena.
Los desarrolladores pueden crear funciones avanzadas de generación y edición de video con personajes consistentes y audio sincronizado utilizando un modelo unificado accesible por API.
5. InclusionAI lanza los modelos Ling-2.6 y el ultrarrápido Ling-mini-2.0
El lanzamiento proporciona una gama escalable de opciones para la implementación local, desde el modelo insignia de un billón de parámetros hasta modelos de borde altamente optimizados. El rendimiento del modelo mini en hardware de CPU estándar y GPU de gama baja lo convierte en un fuerte candidato para tareas de agentes en el dispositivo.
- • InclusionAI lanzó modelos base para el Ling-2.6-1T de un billón de parámetros y el Ling-2.6-flash de 100 mil millones de parámetros.
- • Ling-2.6-flash puede ejecutarse en 24 GB o 32 GB de VRAM cuando se utiliza cuantización Q4.
- • El Ling-mini-2.0-IQ4_XS más pequeño (un modelo de 16B-A1.4B) alcanza 160 tokens por segundo en una sola GPU de 8 GB de VRAM.
- • En inferencia solo de CPU con 32 GB de RAM, Ling-mini-2.0-IQ4_XS ofrece de 50 a 70 tokens por segundo.
Los desarrolladores pueden ejecutar inferencia local rápida y de baja latencia en hardware altamente restringido, incluyendo GPU de 8 GB de VRAM y CPU estándar.
6. Moebius: Un modelo de relleno de imágenes de 0.2B de parámetros con rendimiento de nivel 10B
Detallado en el artículo de arXiv 2606.19195, Moebius aborda las caídas de capacidad causadas típicamente por la compresión estructural extrema. Al combinar LCG con su U-Net reestructurada, el marco ofrece un relleno de imágenes de alta calidad sin la huella computacional masiva de los modelos de difusión tradicionales de 10B de parámetros.
- • Moebius utiliza una arquitectura de modelo de difusión latente (LDM) equipada con guía de categorías latentes (LCG) para lograr un rendimiento de alta capacidad.
- • El marco funciona 15 veces más rápido que los modelos rivales de 10 mil millones de parámetros mientras utiliza solo 0.2 mil millones de parámetros.
- • Una estrategia de destilación adaptativa de multigranularidad alinea el modelo ligero con un profesor de alta capacidad para evitar caídas de capacidad.
- • La U-Net de eliminación de ruido se reestructura utilizando bloques LλM I para maximizar la eficiencia arquitectónica.
Los desarrolladores pueden implementar funciones de edición y relleno de imágenes altamente eficientes y de baja latencia directamente en dispositivos de borde o instancias en la nube de bajo costo.
7. Sakana AI lanza la API de orquestación multiagente Fugu
La arquitectura de Fugu se basa en los artículos de investigación TRINITY y Conductor de Sakana, ocultando las estrategias específicas de selección y coordinación de modelos del usuario por diseño. Ofrece una versión de alta velocidad para tareas cotidianas y el buque insignia Fugu Ultra para tareas complejas como investigación y ciberseguridad. Sin embargo, los primeros informes de los usuarios indican que Fugu Ultra puede ser lento, con algunas pruebas de codificación complejas que tardan hasta 30 minutos en ejecutarse.
- • Fugu y Fugu Ultra operan como un solo modelo a través de una API compatible con OpenAI, gestionando la selección, delegación y síntesis de modelos.
- • Fugu Ultra tiene un precio de 5 dólares por millón de tokens de entrada y 30 dólares por millón de tokens de salida, con tarifas más altas para cargas de trabajo que superan los 272K tokens.
- • Fugu Ultra obtuvo una puntuación de 73.7 en SWE-Bench Pro, superando a Claude Opus 4.8 pero quedando detrás de Claude Fable 5.
- • Los usuarios pueden optar por no participar en el uso de datos de entrenamiento y excluir modelos o proveedores específicos de su grupo de enrutamiento.
- • El servicio no está disponible actualmente en la Unión Europea y el Espacio Económico Europeo debido a la alineación con el cumplimiento del RGPD.
Los desarrolladores pueden acceder a un rendimiento de nivel de frontera y mitigar el bloqueo del proveedor sin gestionar ellos mismos una infraestructura compleja de enrutamiento de múltiples modelos.
8. Ai2 lanza modelos de agentes de terminal TMax de hasta 27B de parámetros
La receta de entrenamiento de TMax utiliza GRPO con correcciones de estabilidad para entrenar modelos que van desde 2B hasta 27B de parámetros. Al aprovechar el conjunto de datos TMax-15k recién lanzado, que es más de 2.5 veces más grande que el siguiente conjunto de datos de terminal abierto más grande, estos modelos ofrecen sólidas capacidades de ejecución de línea de comandos. La variante de 9B basada en Qwen 3.5 se construyó utilizando DPPO en el conjunto de datos OpenThoughts, liderando las ablaciones de TMax.
- • Ai2 lanzó los modelos de agentes de terminal TMax 9B y TMax 27B en Hugging Face.
- • TMax 27B logra una puntuación del 42.7% en Terminal Bench 2.0, acercándose al rendimiento de modelos mucho más grandes como Kimi K2.5.
- • El modelo TMax-9B logra un 27.2% en Terminal Bench 2.0 y un 53.0% en Terminal Bench Lite.
- • Los modelos fueron entrenados utilizando el conjunto de datos TMax-15k, que contiene 14,600 entornos de aprendizaje por refuerzo.
Los desarrolladores pueden integrar agentes de terminal de pesos abiertos altamente especializados en sus herramientas CLI y flujos de trabajo de automatización local.
9. Codex fusiona una corrección para el error de registro de SQLite que causaba un desgaste excesivo de SSD
El error mostraba una brecha de 10,000x entre las filas retenidas y los ID de fila insertados históricamente, lo que indica una grave amplificación de escritura. Los desarrolladores que ejecutan Codex localmente deben aplicar las últimas actualizaciones para implementar estos filtros de registro y proteger la vida útil de su hardware.
- • Un valor predeterminado de registro TRACE global en la base de datos de retroalimentación SQLite de Codex causó escrituras excesivas en disco, alcanzando hasta 37 TB durante 21 días de tiempo de actividad.
- • El problema se debió a la persistencia de registros internos, ruido de dependencias y cargas útiles de WebSocket sin procesar, combinado con una alta amplificación de escritura de los ciclos de inserción y poda.
- • El 22 de junio de 2026, se fusionaron dos solicitudes de extracción para filtrar objetivos ruidosos y dejar de registrar cada evento de WebSocket.
- • Se espera que las correcciones fusionadas reduzcan el volumen de registros locales de Codex en un 85%.
Los desarrolladores que utilizan Codex deben actualizar su instalación inmediatamente para evitar una grave amplificación de escritura y fallos prematuros de SSD.
10. OpenAI lanza la iniciativa de seguridad 'Patch the Planet' y GPT-5.5-Cyber
La iniciativa surge en medio de advertencias de la alianza de inteligencia Five Eyes de que los modelos de IA de frontera transformarán rápidamente las capacidades cibernéticas ofensivas y defensivas. Al colaborar con empresas de seguridad, OpenAI tiene como objetivo ayudar a los mantenedores a integrar herramientas de seguridad impulsadas por IA directamente en sus tuberías de desarrollo, con más de 30 proyectos de código abierto ya participando.
- • OpenAI lanzó su escáner de seguridad Codex como un complemento de aplicación, subsidiando 20 billones de tokens para código abierto y privado.
- • La iniciativa 'Patch the Planet', en asociación con Trail of Bits, HackerOne y Calif, ofrece consultoría de seguridad y parches de vulnerabilidades gratuitos.
- • GPT-5.5-Cyber obtuvo un 85.6% en el benchmark CyberGym, superando al modelo Mythos 5 de Anthropic.
- • Los participantes del programa reciben seis meses de ChatGPT Pro gratuito y seis meses de acceso al escáner de seguridad Codex.
- • Un sprint inicial de cinco días realizado por ingenieros de Trail of Bits descubrió cientos de errores y produjo docenas de parches en los proyectos participantes.
Los desarrolladores de código abierto pueden aprovechar el escaneo de seguridad subsidiado y la aplicación de parches por expertos para asegurar sus bases de código contra las amenazas cibernéticas emergentes impulsadas por IA.
11. Aumentan los riesgos de seguridad en aplicaciones 'vibe-coded'
La facilidad de generar software funcional con IA ha llevado a un aumento de aplicaciones implementadas sin auditorías de seguridad adecuadas. Aunque herramientas como Claude Code pueden ayudar a identificar fallas, los desarrolladores deben permanecer vigilantes, realizar revisiones de seguridad manuales periódicas y considerar la contratación de ingenieros de seguridad profesionales al manejar información comercial confidencial.
- • Un informe de Red Access encontró que casi 2,000 de 5,000 aplicaciones 'vibe-coded' accesibles públicamente filtraban datos médicos, financieros o estratégicos confidenciales.
- • La red social de agentes de IA Moltbook expuso decenas de miles de mensajes privados y correos electrónicos debido a una base de datos de producción abierta.
- • Las herramientas de codificación de IA como Claude Code ofrecen comandos de seguridad integrados, como `/security-review`, pero requieren una invocación manual por parte del desarrollador.
- • Los expertos en seguridad aconsejan tratar las aplicaciones solo locales como de bajo riesgo, pero advierten que la transición a datos compartidos y alojados requiere estándares de seguridad profesionales.
Los desarrolladores que utilizan asistentes de codificación de IA deben ejecutar activamente revisiones de seguridad y establecer modelos de amenazas para evitar la filtración de datos confidenciales de los usuarios en producción.
12. El marco Self-Harness permite a los agentes de IA reescribir sus propias reglas operativas
Desarrollado por el Laboratorio de Inteligencia Artificial de Shanghái, Self-Harness está optimizado para entornos con resultados medibles y deterministas. Al automatizar el refinamiento de las reglas de ejecución, el marco reduce la necesidad de ingeniería de prompts manual, aunque los desarrolladores deben sopesar las ganancias de rendimiento frente al aumento de los costos de tokens y la latencia.
- • Self-Harness utiliza un bucle de tres etapas de minería de debilidades, propuesta de arnés y validación de propuestas para actualizar los protocolos de los agentes.
- • El marco logró ganancias de rendimiento relativo del 33% al 60% en tareas de Terminal-Bench-2.0 utilizando modelos como GLM-5 y Qwen-3.5.
- • Permite a los agentes adaptarse a debilidades específicas del modelo sin requerir ingeniería humana o modelos externos más fuertes.
- • El sistema introduce una sobrecarga computacional significativa, incluyendo un mayor uso de tokens de API, latencia e infraestructura de pruebas de regresión.
- • Los investigadores desaconsejan el uso de Self-Harness en campos de alto riesgo o subjetivos como la medicina o los sistemas críticos para la seguridad.
Los desarrolladores pueden implementar bucles de agentes que se auto-mejoran para aumentar el rendimiento hasta en un 60% en entornos deterministas como la codificación y DevOps.
13. Oak: Una alternativa a Git diseñada para agentes de IA
Al eliminar la necesidad de clones de repositorio completos, Oak aborda un cuello de botella importante en los flujos de trabajo de agentes donde los entornos aislados deben iniciarse y modificar código rápidamente. Aunque está en desarrollo temprano y depende de GitHub Actions para sus propias compilaciones, representa un cambio hacia herramientas de desarrollo nativas para agentes.
- • Oak utiliza montajes virtuales para permitir que los agentes trabajen localmente o en la nube sin requerir una copia completa de un repositorio.
- • El sistema permite la ejecución de tareas en paralelo sin necesidad de descargas completas o árboles de trabajo de Git.
- • El proyecto está en desarrollo temprano, actualmente carece de características como CI, seguimiento de problemas, comentarios y soporte para Windows.
- • El proyecto ha sido completamente arrancado en su propio sistema sin copias de seguridad de Git durante varios meses.
Los desarrolladores que crean agentes de codificación pueden usar Oak para permitir una ejecución de tareas rápida y paralela y reducir la sobrecarga de espacio en disco en los entornos aislados de los agentes.
14. La solicitud de extracción de llama.cpp ofrece una aceleración del 50% para la inferencia local de Gemma 4
La operación de clasificación redundante se identificó como un cuello de botella en cadenas de muestreadores específicas. Aunque el autor de la solicitud de extracción señaló cierta incertidumbre sobre cómo el cambio podría afectar a otras configuraciones de muestreadores que dependen del comportamiento heredado, las ganancias de rendimiento para los modelos Gemma 4 son sustanciales.
- • La solicitud de extracción #22645 en llama.cpp elimina una operación de softmax y clasificación incondicional redundante del muestreador Top-N-Sigma.
- • La optimización es efectiva cuando el muestreador Top-N-Sigma es seguido por un muestreador Dist.
- • Las pruebas en un MacBook Pro M3 Max con un modelo Gemma 4 mostraron que la velocidad aumentó de 30 a 45 tokens por segundo.
- • El cambio reduce la latencia en 10 ms por token en el hardware probado.
Los desarrolladores que ejecutan modelos Gemma 4 locales pueden lograr una latencia significativamente menor adoptando la cadena de muestreadores optimizada.
15. Nuevas técnicas optimizan la generación de código local y las interconexiones de GPU
Estos desarrollos se dirigen a los principales cuellos de botella de la ejecución de modelos locales. Al optimizar las capas de software, como adaptar la decodificación especulativa a dominios específicos y automatizar el ajuste del kernel de GPU de bajo nivel, los desarrolladores pueden extraer un rendimiento de nivel empresarial de configuraciones de hardware asequibles y de grado de consumo.
- • Morph LLM logra una aceleración de 3.07x en la generación de código al entrenar un redactor de decodificación especulativa específicamente en la salida de codificación.
- • Autoresearch automatiza el ajuste del kernel para GPU NVIDIA y AMD de baja demanda, permitiendo que los kernels de decodificación warp alcancen 162 tokens por segundo.
- • Un nuevo método de interconexión PCIe reemplaza las costosas configuraciones NVLink, utilizando kernels personalizados para compartir cachés a través de TCP y reduciendo el tiempo hasta el primer token en un 84%.
Los desarrolladores pueden ejecutar modelos de codificación locales y configuraciones de múltiples GPU significativamente más rápido en hardware de grado de consumo o de baja demanda sin costosas interconexiones empresariales.
16. Claude Code cifra los registros de pensamiento locales, restringiendo el acceso del usuario
Esta elección de diseño garantiza que el razonamiento paso a paso real que impulsa las acciones del modelo siga siendo propietario. Aunque los desarrolladores pueden ver las acciones finales y una ruta lógica resumida, no pueden auditar los registros locales exactos generados durante sesiones complejas de agentes.
- • Los registros de sesión de Claude Code guardados en el disco contienen bloques de pensamiento con una firma cifrada de 600 caracteres.
- • Anthropic posee las claves de cifrado para estos bloques, impidiendo que los usuarios descifren sus registros locales.
- • La API de Claude y la salida de pensamiento extendido de Claude Code proporcionan un resumen de la lógica del modelo en lugar del razonamiento sin procesar.
- • El acceso a la salida de pensamiento completa y sin cifrar requiere un acuerdo empresarial con Anthropic.
Los desarrolladores que analizan el comportamiento de los agentes deben confiar en resúmenes de alto nivel en lugar de registros de razonamiento sin procesar, ya que Anthropic posee las claves de descifrado exclusivas.
17. Apostate añade un operador co-vectorial contrastivo para eludir las negativas del modelo
Este enfoque minimiza la divergencia KL (logrando 0.081 nats en Granite) para garantizar que las capacidades generales del modelo permanezcan intactas después de la edición. Al apuntar al componente de negativa específico en lugar de aplicar un ajuste fino amplio, los desarrolladores pueden dirigir los modelos locales con mayor precisión para tareas especializadas.
- • Apostate añadió un operador de edición co-vectorial contrastivo, definido como E = I − R Dᵀ, para aislar y eliminar las direcciones de negativa.
- • La técnica preserva la varianza inofensiva ajustando un predictor a prompts seguros y suprimiéndolo en los dañinos.
- • Las pruebas en el modelo granite-3.3-8b redujeron la tasa de negativa del 96.0% al 5.0% mientras mantenían una tasa de cumplimiento del 95.0%.
- • El método es altamente efectivo en arquitecturas con multiplicadores de escala residual o de incrustación.
Los desarrolladores pueden eludir las obstinadas negativas de seguridad en modelos de pesos abiertos como Granite sin degradar el rendimiento general del modelo ni causar una divergencia grave.
18. La prohibición de exportación de EE. UU. restringe el acceso extranjero a Mythos y Fable de Anthropic
Las restricciones destacan los crecientes riesgos geopolíticos asociados con la dependencia de API propietarias de un solo proveedor. A medida que el acceso a los modelos de primer nivel de EE. UU. se vuelve políticamente restringido, los desarrolladores internacionales buscan cada vez más modelos de pesos abiertos y proveedores no estadounidenses para asegurar sus tuberías de aplicaciones.
- • El gobierno de EE. UU. ha prohibido a los ciudadanos extranjeros acceder a los últimos modelos de IA de Anthropic, Mythos y Fable.
- • Un análisis del FT encontró que Anthropic discutió sobre riesgos y regulación a una tasa ocho veces mayor que OpenAI en 2026.
- • Los críticos, incluido Yann LeCun, atribuyen la prohibición de exportación a las frecuentes advertencias públicas de Anthropic sobre los riesgos de la IA.
- • La prohibición ha generado preocupaciones generalizadas en Europa y Silicon Valley sobre futuras restricciones de EE. UU. al acceso no estadounidense a modelos de frontera.
Los desarrolladores no estadounidenses enfrentan restricciones inmediatas para construir con los modelos de frontera más nuevos de Anthropic, lo que los obliga a buscar proveedores alternativos o arquitecturas de pesos abiertos.