1. Google traslada Gemini 3.5 Transcribe a disponibilidad general y lanza Gemini 3.8 Live
Google ha ampliado sus capacidades de voz y audio al sacar Gemini 3.5 Transcribe de la vista previa pública a la disponibilidad general e introducir el nuevo modelo Gemini 3.8 Live. Estas actualizaciones proporcionan a los desarrolladores herramientas más estables y listas para producción para aplicaciones de voz en tiempo real, tras la vista previa inicial del modelo Transcribe anunciada en agosto y el lanzamiento más amplio de la API de Gemini Live en julio.
- • Gemini 3.5 Transcribe ya está disponible de forma general, tras su lanzamiento en vista previa pública el 26 de agosto de 2026.
- • Google presentó Gemini 3.8 Live, un nuevo modelo optimizado para la interacción de voz en tiempo real.
- • El lanzamiento proporciona a los desarrolladores herramientas listas para producción para el reconocimiento de voz de baja latencia y agentes conversacionales en vivo.
Los desarrolladores ahora pueden implementar aplicaciones de voz en tiempo real de grado de producción utilizando el Gemini 3.5 Transcribe finalizado y el nuevo modelo Gemini 3.8 Live.
2. Prior Labs lanza el modelo fundacional tabular TabPFN-3.5
Prior Labs ha lanzado TabPFN-3.5, una actualización importante de su modelo fundacional tabular que escala el número de parámetros a 220 millones. Diseñado para ejecutarse en datos sin procesar con configuraciones predeterminadas, el modelo realiza tareas de clasificación y regresión al instante sin necesidad de entrenamiento por conjunto de datos. El lanzamiento incluye una versión más rápida de 84 millones de parámetros, una versión Plus exclusiva para empresas con manejo nativo de texto y una versión Thinking que utiliza cómputo de inferencia adicional.
- • Prior Labs ha lanzado TabPFN-3.5, un modelo fundacional tabular de 220 millones de parámetros que realiza predicciones en una sola pasada hacia adelante.
- • El modelo obtuvo una puntuación de 0.375 en el desafío de clasificación de productos del Grupo Otto, superando la solución ganadora original de Kaggle.
- • TabPFN-3.5 ocupa el primer lugar en siete puntos de referencia tabulares, incluidos TabArena y ScoringBench.
- • El modelo admite hasta 1 millón de filas y hasta 20,000 características (se recomiendan 6,000).
- • Los pesos abiertos están disponibles para investigación, evaluación y uso en Kaggle, mientras que la implementación en producción requiere una licencia comercial o la API de Prior Labs.
Los desarrolladores pueden realizar clasificaciones y regresiones tabulares de alta precisión en una sola pasada hacia adelante sin necesidad de entrenar o ajustar modelos por conjunto de datos.
3. Nums AI lanza el modelo fundacional tabular Causilo
Nums AI ha presentado Causilo, un modelo fundacional tabular preentrenado completamente con datos sintéticos. Causilo se integra directamente en los flujos de trabajo de Python existentes a través de una interfaz estándar de scikit-learn, con su código bajo licencia Apache-2.0. Al emplear atención cruzada, el modelo mantiene una complejidad computacional lineal en relación con el número de características, lo que lo hace altamente eficiente para conjuntos de datos tabulares a gran escala.
- • Nums AI ha lanzado Causilo, un modelo fundacional tabular preentrenado para tareas de clasificación y regresión.
- • El modelo cuenta con una interfaz de scikit-learn, con código bajo Apache-2.0 y pesos preentrenados disponibles en Hugging Face.
- • Causilo tiene el Elo más alto entre los modelos individuales en el punto de referencia TabArena tanto para clasificación como para regresión.
- • La arquitectura utiliza un proceso de tres fases (refinamiento, compresión y aprendizaje en contexto) y atención cruzada para mantener los costos computacionales lineales respecto al número de características.
- • El modelo requiere Python 3.10 a 3.12 y PyTorch 2.13 o superior, y es gratuito para investigación y evaluación.
Los desarrolladores pueden integrar un modelo tabular de alto rendimiento y código abierto en sus tuberías de Python utilizando una interfaz familiar de scikit-learn.
4. Knowledgator lanza el codificador condicionado por esquema GLiFormer
Knowledgator Engineering ha lanzado GLiFormer, un marco de codificador de código abierto diseñado para manejar múltiples tareas de extracción sin generar tokens de texto. Al puntuar la compatibilidad con los esquemas y anclajes proporcionados directamente, el modelo evita la latencia de los LLM generativos tradicionales. Los puntos de control con licencia Apache 2.0 están disponibles en tamaños Base (264M) y Large (575M), ofreciendo una alternativa rápida y rentable para la extracción de datos estructurados.
- • Knowledgator Engineering ha lanzado GLiFormer, un marco de codificador condicionado por esquema para la extracción de información.
- • El modelo realiza reconocimiento de entidades nombradas, clasificación de texto, extracción de relaciones, estructuración JSON anidada e incrustaciones de texto utilizando un solo codificador.
- • GLiFormer Large (575.6M parámetros) obtuvo una puntuación F1 de 91.10 en puntos de referencia de extracción JSON anidada.
- • Los puntos de control del modelo se lanzan bajo la licencia Apache 2.0 y son compatibles con hardware de CPU y GPU.
- • GLiFormer-base (264.2M parámetros) informó una latencia media de 69 ms en una GPU NVIDIA RTX PRO 6000 Blackwell.
Los desarrolladores pueden realizar una extracción de información condicionada por esquema de alta precisión y estructuración JSON anidada sin la latencia y el costo de los tokens de LLM generativos.
5. Ant Group lanza el modelo de pesos abiertos Ling-3.0-flash-Fin
Ant Group ha lanzado Ling-3.0-flash-Fin, un modelo financiero especializado construido sobre la arquitectura Ling-3.0-flash. El modelo está diseñado para ayudar con tareas específicas del dominio, como la verificación de fuentes, la redacción de informes y la creación de hojas de cálculo. Aunque demuestra una alta precisión en el conocimiento empresarial, las evaluaciones muestran que también conlleva una mayor tasa de alucinación en comparación con la variante de visión-lenguaje de la misma arquitectura.
- • Ant Group ha lanzado Ling-3.0-flash-Fin, un modelo de pesos abiertos centrado en finanzas bajo la licencia MIT.
- • El modelo cuenta con una arquitectura de mezcla de expertos con 124B de parámetros totales y 5.1B de parámetros activos por token.
- • Admite una ventana de contexto de 256K tokens y está limitado a entrada y salida solo de texto.
- • El modelo está disponible en OpenRouter, incluido un punto final gratuito con límite de velocidad.
- • Ling-3.0-flash-Fin obtiene una puntuación de 23 en el Índice de Inteligencia de Artificial Analysis, igualando a MiniMax-M2.7 mientras utiliza la mitad de los parámetros activos.
Los desarrolladores que crean aplicaciones financieras pueden aprovechar un modelo de pesos abiertos especializado con licencia MIT y una ventana de contexto de 256K para tareas de redacción de informes y valoración.
6. TypeSafe AI lanza el modelo Jev System One para decisiones rápidas
TypeSafe AI ha lanzado el acceso anticipado a Jev, un modelo especializado de "System One" construido para la integración directa en flujos de trabajo de software. A diferencia de los LLM tradicionales que generan texto de forma libre, Jev está diseñado exclusivamente para salidas estructuradas y selección de opciones. La arquitectura está optimizada para eliminar las alucinaciones por completo mientras opera a velocidades hasta dos órdenes de magnitud más rápidas que los modelos convencionales.
- • TypeSafe AI ha introducido Jev, una nueva clase de modelo System One diseñado para decisiones rápidas y estructuradas en software.
- • El modelo está optimizado para salidas estructuradas y se afirma que es incapaz de alucinar.
- • Se afirma que Jev es dos órdenes de magnitud más rápido y eficiente que los modelos de lenguaje grandes existentes, manteniendo una inteligencia comparable.
- • El modelo está actualmente disponible en acceso anticipado.
Los desarrolladores pueden acceder a una nueva clase de modelos altamente eficientes y libres de alucinaciones, optimizados específicamente para la toma de decisiones estructurada y rápida en software.
7. Google lanza el servidor de protocolo de contexto de modelo para Google Home
Google está abriendo su ecosistema de hogar inteligente a agentes de IA creados por desarrolladores mediante el lanzamiento de un servidor de Protocolo de Contexto de Modelo (MCP) en acceso anticipado. Esta integración permite a agentes externos, incluidos Claude y ChatGPT, consultar estados de dispositivos, revisar transmisiones de cámaras y controlar hardware de hogar inteligente utilizando lenguaje natural. Para comenzar, los desarrolladores deben configurar un proyecto de Google Cloud para interactuar con el servidor Home MCP.
- • Google ha lanzado el acceso anticipado a un servidor de Protocolo de Contexto de Modelo (MCP) para Google Home.
- • La integración permite que agentes de IA de terceros como Claude y ChatGPT controlen dispositivos domésticos inteligentes conectados y accedan a resúmenes de cámaras.
- • La configuración requiere que los desarrolladores creen y configuren un proyecto de Google Cloud para Home MCP.
- • La función está disponible inicialmente para los usuarios de Google Home Premium Advanced en los EE. UU. por $20 al mes o $200 al año.
- • Google ha implementado protecciones de seguridad, incluidos límites de velocidad y una restricción que impide que los agentes desbloqueen puertas.
Los desarrolladores ahora pueden crear agentes de IA que interactúen, supervisen y controlen directamente dispositivos inteligentes de Google Home utilizando el Protocolo de Contexto de Modelo.
8. Investigadores de Stanford lanzan la tubería Paper2Agent
Investigadores de Stanford han introducido Paper2Agent, una tubería de código abierto que automatiza el proceso de convertir trabajos científicos y sus repositorios de código en servidores de Protocolo de Contexto de Modelo (MCP). El sistema gestiona entornos, extrae herramientas y ejecuta una puerta de validación estricta para garantizar que las salidas del agente generado coincidan con las figuras y resultados numéricos del trabajo original. La herramienta con licencia MIT permite a los desarrolladores crear rápidamente agentes científicos altamente especializados.
- • Investigadores de Stanford han lanzado Paper2Agent, un sistema que convierte trabajos de investigación y bases de código en servidores MCP ejecutables.
- • La tubería cuenta con una puerta de validación estricta que requiere que los resultados numéricos coincidan dentro del 3% y que las figuras coincidan por hash perceptual.
- • En pruebas a escala en 100 trabajos de bioRxiv, 74 trabajos se convirtieron con éxito, con 593 de 599 herramientas pasando la validación.
- • El software tiene licencia MIT y los servidores preconstruidos se alojan en Hugging Face Spaces.
- • Crear el agente AlphaGenome tomó 45 minutos y costó $14, con las 22 herramientas pasando la validación.
Los desarrolladores pueden convertir automáticamente trabajos científicos y sus bases de código asociadas en servidores de Protocolo de Contexto de Modelo totalmente validados para que los agentes de IA los ejecuten.
9. Ory Agent Security lanza la gobernanza de capa de arnés para agentes de IA
Ory Agent Security ha introducido una solución de seguridad agnóstica al proveedor diseñada específicamente para gobernar agentes de codificación de IA. Al operar en la capa de arnés, la herramienta intercepta y evalúa las acciones antes de que lleguen a las puertas de enlace externas. El sistema es compatible con 11 arneses de agentes de codificación de IA principales, proporcionando a los desarrolladores una forma concreta de implementar la gestión de identidad y acceso para agentes autónomos.
- • Ory Agent Security se ha lanzado para gobernar la ejecución de agentes de IA en la capa de arnés.
- • La herramienta es agnóstica al proveedor y opera antes de que se realicen llamadas de puerta de enlace.
- • Ory Agent Security es compatible con 11 arneses de agentes de codificación de IA principales.
- • La solución está diseñada para abordar los desafíos de seguridad a medida que los agentes de IA superan en número a los usuarios humanos.
Los desarrolladores pueden asegurar y gobernar sus agentes de codificación de IA ejecutando políticas de seguridad en la capa de arnés antes de realizar llamadas de puerta de enlace externas.
10. Cloudflare implementa la configuración 'Disallow AI Training' tras la fecha límite de septiembre
Cloudflare ha implementado la configuración 'Disallow AI Training', cumpliendo con la fecha límite del 15 de septiembre para la separación de rastreadores establecida en julio. Esta nueva función permite a los propietarios de sitios bloquear rastreadores de uso mixto para que no entrenen modelos de IA mientras les permite continuar indexando contenido para la búsqueda. El lanzamiento reemplaza las herramientas de gestión de bots anteriores con un sistema unificado de 'Bot Preference Sync' e incluye compromisos de los principales operadores como Google, Apple y Microsoft para respetar la nueva configuración de exclusión.
- • Cloudflare ha lanzado oficialmente la configuración 'Disallow AI Training', cumpliendo con la fecha límite del 15 de septiembre para la separación de rastreadores.
- • La función permite a los propietarios de sitios bloquear el entrenamiento de IA por parte de rastreadores de uso mixto mientras mantienen la capacidad de descubrimiento en la búsqueda.
- • Los principales operadores, incluidos Google, Apple y Microsoft, se han comprometido a respetar la nueva configuración de exclusión.
- • La actualización reemplaza las herramientas de gestión de bots heredadas con un nuevo sistema de 'Bot Preference Sync'.
- • Cloudflare planea introducir más controles granulares para los resúmenes generados por IA a principios del próximo año.
Este lanzamiento proporciona el mecanismo final para que los propietarios de sitios apliquen la política de separación de rastreadores, asegurando que el contenido esté protegido contra el entrenamiento de IA no autorizado sin sacrificar las clasificaciones en los motores de búsqueda.
11. El proyecto Openjev ofrece selección de opciones de una sola pasada de código abierto
El proyecto openjev ofrece una alternativa de código abierto con licencia MIT a los modelos de selección de opciones comerciales como Jev de TypeSafe. Al utilizar un cabezal de atención de opciones para puntuar las entradas en una sola pasada, el modelo evita la latencia de la generación de tokens estándar. El repositorio admite el entrenamiento con un codificador de bytes predeterminado o un codificador preentrenado congelado de Hugging Face, como Qwen2.5-0.5B, y se informa que es unas 100 veces más rápido que un decodificador pequeño obligado a escribir 400 tokens al evaluar ocho opciones.
- • El proyecto openjev proporciona un modelo inicial independiente con licencia MIT diseñado para elegir entre una lista cambiante de opciones de texto en una sola pasada.
- • Se informa que el modelo es aproximadamente 100 veces más rápido que un decodificador pequeño obligado a escribir 400 tokens al evaluar ocho opciones.
- • Utiliza un cabezal de atención de opciones para puntuar las entradas, convirtiendo las opciones en vectores de consulta que asignan pesos de atención a los tokens de contexto.
- • En experimentos locales, el anotador de una pasada alcanzó aproximadamente un 98% de precisión en menús sintéticos y un 29% de precisión en datos de siguiente clic de Wikispeedia.
Los desarrolladores pueden implementar una clasificación y selección de opciones de una sola pasada ultrarrápida en sus aplicaciones sin depender de decodificadores de generación de tokens lentos.
12. La cuantización GSQ-RCO optimiza aún más Qwen3.8-Flash-Next para GPU locales
Basándose en lanzamientos de optimización anteriores para el modelo Qwen3.8-Flash-Next de 125B, incluidos NVFP4 de NVIDIA y la descarga SSD de AtomicChat, el nuevo método de cuantización GSQ-RCO proporciona una ruta adicional para la implementación local. Al optimizar las variantes Q2_0 e IQ3_XXS, este método permite que el modelo se ejecute en hardware con 12GB de VRAM mientras mantiene un rendimiento cercano a la línea base, ofreciendo una alternativa a las estrategias de cuantización y descarga existentes.
- • La cuantización GSQ-RCO reduce el tamaño del modelo Qwen3.8-Flash-Next a 68-76GB.
- • La variante Q2_0 ofrece un rendimiento de prompt 6.2 veces mejor y una latencia 1.9 veces menor que IQ2_XS.
- • La variante IQ3_XXS logra una salida de 15 tokens/segundo en una RTX 5070 de 12GB.
- • El rendimiento coincide con el modelo base en AIME25 y se mantiene dentro de 0.51 puntos en GPQA-Diamond.
Los desarrolladores ahora tienen una opción de cuantización adicional altamente eficiente para ejecutar el modelo masivo Qwen3.8-Flash-Next en hardware de consumo, complementando las técnicas de NVFP4 y descarga SSD lanzadas anteriormente.
13. La implementación de vLLM descarga la caché KV de Qwen3.8-Flash-Next a la RAM
Los desarrolladores ahora pueden ejecutar Qwen3.8-Flash-Next con una longitud de contexto de 1 millón de tokens en vLLM descargando la caché KV a la RAM del sistema. Este enfoque aprovecha la arquitectura única del modelo, que combina 12 capas de caché KV con 36 capas de delta-net cerradas. Al utilizar el mecanismo QSA para indexar y leer un máximo de 2,048 posiciones por paso de decodificación, el sistema mantiene un alto rendimiento incluso cuando la cuantización del modelo apenas cabe en la VRAM.
- • Una nueva implementación permite a los desarrolladores descargar la mayor parte de la caché KV de Qwen3.8-Flash-Next a la RAM del sistema con una desaceleración mínima de la decodificación.
- • La configuración logró una longitud de contexto de 1 millón de tokens en vLLM utilizando tres GPU NVIDIA 3090.
- • La arquitectura del modelo utiliza 12 capas con una caché KV y 36 capas de delta-net cerradas con estados recurrentes de tamaño fijo para gestionar la memoria.
- • El mecanismo QSA limita la cantidad de datos de caché KV leídos durante cada paso de decodificación seleccionando un máximo de 2,048 posiciones.
Los desarrolladores pueden ejecutar modelos locales de contexto extremadamente largo de hasta 1 millón de tokens sin verse limitados por la VRAM de la GPU.