1. Google lanza el servicio de destilación de Gemini
Google ha lanzado el servicio de destilación de Gemini, una oferta gestionada diseñada para transferir los patrones de razonamiento de sus modelos de frontera a modelos estudiantes altamente eficientes. El servicio actualmente admite la destilación de conocimiento desde gemini-3.1-pro hacia gemini-2.5-flash. Esto permite a los desarrolladores crear modelos especializados de baja latencia que conservan capacidades de razonamiento avanzadas, reduciendo significativamente los costos de inferencia para aplicaciones de producción.
- • El servicio de destilación de Gemini automatiza el entrenamiento de modelos estudiantes más pequeños utilizando modelos profesores más grandes.
- • El servicio actualmente admite gemini-3.1-pro como modelo profesor y gemini-2.5-flash como modelo estudiante.
- • El servicio está optimizado para aplicaciones de alto volumen y sensibles a la latencia que requieren capacidades de razonamiento complejas.
Los desarrolladores ahora pueden destilar fácilmente capacidades de razonamiento complejas en modelos más pequeños, rápidos y económicos para aplicaciones de alto volumen y sensibles a la latencia.
2. Microsoft lanza el modelo multimodal de streaming Mage-VL
Microsoft ha lanzado Mage-VL, un modelo fundacional multimodal de streaming nativo de códec con pesos abiertos, optimizado para la comprensión de imágenes y videos. Mage-VL combina un codificador visual personalizado a escala de 4B con una base de lenguaje Qwen3-4B. Al separar los flujos de video en fotogramas de anclaje y predichos, el mecanismo de dispersión del modelo filtra más del 75% de los tokens visuales redundantes, lo que resulta en una aceleración de 3.5 veces en el tiempo de inferencia. Además, una 'puerta de cognición' integrada asegura que el modelo completo de visión-lenguaje solo se invoque cuando se detecta un evento significativo, reduciendo drásticamente el cómputo innecesario.
- • Mage-VL es un modelo fundacional multimodal de streaming proactivo y nativo de códec para la comprensión de imágenes y videos.
- • El modelo cuenta con un codificador visual a escala de 4B entrenado desde cero y una base de lenguaje Qwen3-4B-Instruct-2507.
- • Un mecanismo de dispersión alineado con el códec separa los flujos de video en fotogramas de anclaje (I) y predichos (P), reduciendo los tokens visuales en más del 75%.
- • La arquitectura logra una aceleración de inferencia de hasta 3.5 veces en comparación con el muestreo de fotogramas uniforme.
- • Un diseño de doble proceso utiliza una 'puerta de cognición' para invocar el VLM completo solo cuando se detecta un evento que merece respuesta.
Los desarrolladores pueden construir tuberías de procesamiento de video altamente eficientes que reducen drásticamente la latencia de inferencia y el consumo de tokens.
3. Runway detalla el modelo de video en tiempo real Characters y flujos de trabajo de destilación
En VB Transform 2026, Runway compartió perspectivas de producción de su modelo de video en tiempo real, Runway Characters, que permite interacciones con avatares sin latencia. Para lograr velocidades en tiempo real, Runway destila modelos fundacionales grandes en modelos estudiantes más pequeños, reduciendo la latencia de generación entre un 80% y un 90% mientras utiliza post-entrenamiento adversarial (APT) para preservar la nitidez visual. El equipo también detalló soluciones de ingeniería prácticas, como el uso de una función de recentrado en el frontend para resolver errores de deriva de personajes y el despliegue de agentes de monitoreo de IA para aislar caídas de rendimiento a nivel de hardware en centros de datos en la nube.
- • Runway Characters es un modelo de video en tiempo real que permite interacciones sin latencia con avatares generados por IA.
- • Runway utiliza destilación para entrenar modelos estudiantes más pequeños, reduciendo los tiempos de generación de video entre un 80% y un 90%.
- • El equipo emplea post-entrenamiento adversarial (APT) para mantener la nitidez visual en los modelos destilados.
- • Runway resolvió un error de deriva de personajes implementando una función de frontend 'Optimizar para calidad de imagen' que recentra las imágenes de entrada.
- • La empresa utilizó agentes de IA y herramientas de monitoreo para rastrear una ralentización de la API (8% de las llamadas cayendo a 16 fps) hasta hardware defectuoso en us-east-1.
Los desarrolladores que crean aplicaciones de video interactivas pueden aprender de las estrategias de producción de Runway para optimizar la latencia y manejar la deriva de personajes.
4. Microsoft expande la familia de modelos MAI con MAI-Cyber-1-Flash enfocado en ciberseguridad
Microsoft ha expandido su familia de modelos propietarios MAI, introducida por primera vez en Build 2026, con el lanzamiento de MAI-Cyber-1-Flash. Este nuevo modelo de 5 mil millones de parámetros activos es un ajuste fino especializado del MAI-Code-1-Flash lanzado anteriormente, diseñado específicamente para tareas de ciberseguridad defensiva como la aplicación de parches en bases de código. El modelo impulsa el sistema de escaneo MDASH de Microsoft, permitiendo flujos de trabajo de seguridad automatizados mientras reduce los costos operativos.
- • MAI-Cyber-1-Flash es un ajuste fino especializado en ciberseguridad del modelo MAI-Code-1-Flash.
- • El modelo cuenta con 137B de parámetros totales, 5B de parámetros activos y una longitud de contexto de 256k.
- • Impulsa el sistema de escaneo MDASH, que obtuvo una puntuación de 95.95% en el benchmark CyberGym.
- • El modelo está restringido a tareas defensivas y no puede generar exploits, obteniendo una puntuación de cero en ExploitGym.
- • La integración en MDASH reduce los costos operativos en un 50% al manejar tareas rutinarias localmente antes de escalar a modelos más grandes.
Este lanzamiento marca la primera expansión específica de ciberseguridad de la familia de modelos MAI, proporcionando a los desarrolladores una herramienta defensiva rentable para la aplicación automatizada de parches de seguridad.
5. El Protocolo de Contexto de Modelo lanza oficialmente una arquitectura sin estado
La Agentic AI Foundation (AAIF) ha lanzado oficialmente la versión final de la especificación del Protocolo de Contexto de Modelo (MCP), pasando del lanzamiento candidato anunciado en mayo a una arquitectura de solicitud/respuesta totalmente sin estado. Este lanzamiento GA permite a los desarrolladores desplegar servidores MCP detrás de balanceadores de carga estándar y Kubernetes, al tiempo que introduce un endurecimiento de seguridad obligatorio y una política de obsolescencia de 12 meses para funciones heredadas.
- • La especificación final de MCP es ahora GA, pasando del candidato de lanzamiento sin estado a una arquitectura lista para producción.
- • El diseño sin estado admite el despliegue detrás de balanceadores de carga estándar y Kubernetes.
- • Incluye validación de emisor RFC 9207 obligatoria para mayor seguridad.
- • Establece una política formal de obsolescencia de 12 meses para funciones heredadas como HTTP+SSE.
- • Gradúa dos nuevas extensiones oficiales: MCP Apps y MCP Tasks.
Este lanzamiento oficial confirma la transición a una arquitectura sin estado, permitiendo el despliegue de grado de producción de servidores MCP en entornos nativos de la nube.
6. Snowflake lanza Cortex AI Gateway para gobernar agentes de IA
Snowflake ha anunciado Cortex AI Gateway, una capa centralizada de gobernanza y seguridad diseñada para gestionar agentes de IA autónomos. Construida sobre la tecnología de la adquisición de Natoma por parte de Snowflake, la puerta de enlace admite más de 100 servidores del Protocolo de Contexto de Modelo (MCP), permitiendo a los desarrolladores centralizar políticas de acceso y permisos. Para garantizar la responsabilidad, la plataforma implementa una doble atribución, registrando tanto la identidad del agente como la del humano autorizante, al tiempo que proporciona a los equipos financieros una atribución de costos en tiempo real y límites de gasto estrictos para evitar facturas de API descontroladas.
- • Cortex AI Gateway de Snowflake sirve como una capa de control centralizada para gobernar el acceso de los agentes de IA a datos, herramientas y modelos empresariales.
- • La puerta de enlace admite más de 100 servidores del Protocolo de Contexto de Modelo (MCP) para centralizar la autenticación, los permisos y el registro de auditoría.
- • Cuenta con doble atribución, registrando tanto la identidad no humana del agente como el humano específico que autorizó la tarea.
- • Se incluyen integraciones de seguridad con 1Password, Aembit, Linx Security, SailPoint y Saviynt.
- • La puerta de enlace proporciona atribución de costos unificada y límites de gasto para evitar costos de API empresariales descontrolados.
Los desarrolladores que crean agentes empresariales pueden usar esta puerta de enlace para aplicar políticas de seguridad, gestionar permisos y evitar costos de API descontrolados.
7. Fireworks AI lanza la capa de enrutamiento Fireworks Nexus
Fireworks AI ha anunciado Fireworks Nexus, una plataforma inteligente de enrutamiento y control de costos diseñada para optimizar los gastos en LLM. El componente central de código abierto de la plataforma, FireConnect, permite a los desarrolladores integrar modelos de Fireworks en herramientas de desarrollo existentes como Claude Code con una instalación de una sola línea. Al utilizar un modelo entrenado a medida para evaluar la dificultad de las solicitudes entrantes, el enrutador inteligente descarga automáticamente las tareas de codificación rutinarias a modelos de pesos abiertos rentables, mientras reserva consultas complejas para APIs de frontera, lo que resulta en una reducción de costos reportada del 33% por solicitud de extracción fusionada.
- • Fireworks Nexus es una plataforma de gestión y enrutamiento de IA que cuenta con controles de costos empresariales y gestión de tráfico.
- • El componente FireConnect es de código abierto bajo una licencia Apache 2.0, lo que permite la integración de una sola línea con Claude Code, Codex y OpenCode.
- • Un enrutador inteligente utiliza un modelo personalizado para calificar la dificultad de la solicitud, enrutando tareas simples a modelos de pesos abiertos y las complejas a APIs de frontera.
- • Las pruebas preliminares de los clientes mostraron una reducción del 33% en el costo por solicitud de extracción fusionada.
- • El enrutador está en vista previa de investigación y admite configuraciones como el enrutamiento entre Claude Opus 5 y GLM-5.2.
Los desarrolladores pueden integrar esta capa de enrutamiento con una sola línea de código para reducir automáticamente los costos de API para tareas de codificación rutinarias.
8. OpenAI hace públicas las herramientas de seguridad de Codex a través de CLI y SDK
OpenAI ha hecho la transición de su iniciativa de seguridad impulsada por Codex desde la vista previa cerrada 'Daybreak' anunciada anteriormente a una herramienta de desarrollo de propósito general. El nuevo paquete @openai/codex-security proporciona una CLI y un SDK de TypeScript que permite a los desarrolladores automatizar la detección y remediación de vulnerabilidades dentro de sus propios flujos de trabajo de compilación. A diferencia de la vista previa agente restringida por ventas anterior, este lanzamiento admite la integración de CI/CD no interactiva utilizando una clave API, junto con el escaneo interactivo a través de la autenticación de ChatGPT.
- • Transiciona la seguridad basada en Codex de la vista previa cerrada 'Daybreak' a una CLI y SDK públicos.
- • Admite escaneo y remediación automatizada de vulnerabilidades en tuberías de CI/CD a través de clave API.
- • Incluye una clase programática CodexSecurity para integración personalizada.
- • Requiere Node.js 22+ y Python 3.10+.
Este lanzamiento mueve las capacidades de seguridad de OpenAI de una vista previa empresarial restringida a una herramienta de desarrollo de autoservicio, permitiendo la integración de seguridad automatizada en tuberías de CI/CD estándar.
9. Visa abre el código fuente de su sistema de escaneo de vulnerabilidades agente
Visa ha abierto el código fuente del Visa Vulnerability Agentic Harness, una tubería de seguridad multimodelo que la empresa desarrolló para buscar errores en su infraestructura de pagos global. El sistema automatiza flujos de trabajo de seguridad complejos, incluyendo la ingesta de código, el modelado de amenazas y la síntesis de cadenas de exploits. Junto con el lanzamiento, Visa publicó un libro blanco que describe 12 prácticas arquitectónicas para infraestructura crítica, enfatizando que los agentes autónomos deben operar bajo identidades distintas y con alcance limitado para mantener los límites de seguridad.
- • El Visa Vulnerability Agentic Harness es ahora de código abierto en GitHub, gestionando la ingesta de código, el modelado de amenazas y la síntesis de exploits.
- • El sistema utiliza una tubería multimodelo, que Visa originalmente combinó con el modelo Claude Mythos de Anthropic para escanear su red de pagos global.
- • Visa introdujo el Tiempo Medio de Adaptación (MTTA) como una métrica para medir qué tan rápido los equipos pueden confirmar, corregir y validar el cierre de rutas de ataque.
- • Las directrices arquitectónicas del proyecto exigen que los agentes de IA sean tratados como identidades distintas con permisos estrictamente definidos.
Los desarrolladores pueden adoptar esta tubería multimodelo probada para automatizar el modelado de amenazas y la síntesis de cadenas de exploits dentro de sus propias bases de código.
10. Lanzamiento del marco de aprendizaje por refuerzo agente Molt
La comunidad de código abierto ha introducido Molt, un marco nativo de PyTorch diseñado para tratar a los agentes de IA como programas estructurados. Molt proporciona a los desarrolladores un entorno robusto para entrenar agentes utilizando aprendizaje por refuerzo, con soporte nativo para recompensas personalizadas en Python, integración de herramientas, entornos multimodales y evaluación basada en LLM. Construido sobre una pila de alto rendimiento de Ray, vLLM, NVIDIA AutoModel y FSDP2, el marco está diseñado para escalar el entrenamiento hasta modelos de mezcla de expertos de billones de parámetros.
- • Molt es un marco nativo de PyTorch que trata al agente de IA como el programa mismo.
- • El marco admite recompensas personalizadas en Python, uso de herramientas, entornos multimodales y jueces LLM.
- • La pila técnica de Molt integra Ray, vLLM, NVIDIA AutoModel y FSDP2.
- • El marco es capaz de escalar el entrenamiento hasta modelos de mezcla de expertos de billones de parámetros.
Los desarrolladores pueden usar este marco para construir y entrenar flujos de trabajo agentes complejos con recompensas personalizadas, uso de herramientas y jueces LLM en el bucle.
11. Agenta lanza una alternativa de código abierto a Claude Cowork
Agenta ha lanzado una alternativa de código abierto y autohospedada a Claude Cowork, brindando a los desarrolladores una plataforma flexible para construir y desplegar compañeros de trabajo de IA. Disponible en GitHub, Agenta permite a los usuarios ejecutar automatizaciones programadas o activadas por eventos utilizando su elección de sistema de modelos, incluyendo Claude Code, OpenAI Codex o modelos locales autohospedados. Los agentes de IA se configuran a través de interacciones de chat naturales y mantienen espacios de trabajo aislados, herramientas personalizadas y configuraciones de auto-mejora basadas en los comentarios de los usuarios.
- • Agenta es una alternativa de código abierto y autohospedada a Claude Cowork, disponible en GitHub.
- • La plataforma permite a los desarrolladores construir compañeros de trabajo de IA que se ejecutan en horarios o se activan según eventos de aplicaciones externas.
- • Admite múltiples sistemas de ejecución, incluyendo Claude Code, OpenAI Codex y modelos autohospedados.
- • Los agentes se crean a través de chat, manteniendo instrucciones individuales, herramientas, habilidades y carpetas de trabajo dedicadas.
Los desarrolladores pueden construir y alojar sus propios compañeros de trabajo de IA localmente, evitando el bloqueo del proveedor mientras utilizan suscripciones de API existentes o modelos autohospedados.