Inference Brew

OpenAI actualiza GPT-5.5 Instant con reconocimiento de intención mejorado

00:00 / --:--

← Volver al inicio

OpenAI actualiza GPT-5.5 Instant con reconocimiento de intención mejorado

1. OpenAI actualiza GPT-5.5 Instant con reconocimiento de intención mejorado

Tras el lanzamiento inicial de GPT-5.5 Instant el 5 de mayo de 2026, OpenAI ha desplegado una versión mejorada del modelo. Esta actualización se centra en mejorar la interacción natural mediante un mejor reconocimiento de intención y un manejo más robusto de restricciones complejas. El modelo actualizado ya está disponible para todos los usuarios de ChatGPT y a través del alias de API chat-latest, que ha sido actualizado para apuntar a esta nueva versión.

  • OpenAI actualizó el modelo GPT-5.5 Instant el 24 de junio de 2026, tras su lanzamiento inicial el 5 de mayo.
  • El alias de API chat-latest ahora apunta a la versión actualizada de GPT-5.5 Instant.
  • Las nuevas capacidades incluyen un mejor reconocimiento de intención y un mejor manejo de restricciones complejas.
  • El modelo mantiene una ventana de contexto de 400.000 tokens y un límite máximo de salida de 128.000 tokens.
  • El precio de chat-latest se mantiene en 5,00 dólares por cada millón de tokens de entrada y 30,00 dólares por cada millón de tokens de salida, con un descuento del 90% para entradas en caché.

Los desarrolladores que utilizan actualmente el alias de API chat-latest obtienen acceso inmediato a un modelo más capaz y consciente de las restricciones con una ventana de contexto de 400K sin necesidad de realizar cambios en el código.

SOURCES

2. Liquid AI lanza LFM2.5-230M para flujos de trabajo de agentes en el dispositivo

LFM2.5-230M de Liquid AI es un modelo base altamente optimizado diseñado para ejecutarse localmente en hardware con recursos limitados como teléfonos inteligentes, computadoras portátiles y robótica. Además de su bajo consumo de memoria, una demostración de la comunidad mostró el modelo ejecutándose localmente en el navegador a 1.400 tokens por segundo utilizando kernels WebGPU personalizados en un procesador M4 Max.

  • Liquid AI lanzó LFM2.5-230M, un modelo de 230 millones de parámetros optimizado para flujos de trabajo de agentes y extracción de datos en el dispositivo.
  • El modelo utiliza la arquitectura LFM2, combinando convoluciones de corto alcance con atención de consulta agrupada para una huella de memoria inferior a 400 MB.
  • Admite una ventana de contexto de 32K y se ejecuta localmente, alcanzando 213 tokens/seg en un Samsung Galaxy S25 Ultra y 42 tokens/seg en una Raspberry Pi 5.
  • Obtuvo una puntuación de 43,26 en el punto de referencia de uso de herramientas BFCLv3, superando al modelo Google Gemma 3 1B de mil millones de parámetros.
  • Lanzado bajo la licencia LFM Open License v1.0, es gratuito para individuos y empresas con menos de 10 millones de dólares en ingresos anuales.
  • El modelo está disponible en Hugging Face con soporte nativo para llama.cpp, MLX, vLLM, SGLang y ONNX.

Los desarrolladores pueden ejecutar un modelo altamente capaz de menos de 400 MB localmente en dispositivos periféricos, logrando un alto rendimiento de tokens y superando a modelos más grandes en puntos de referencia de uso de herramientas.

SOURCES

3. DeepReinforce lanza modelos de codificación de código abierto Ornith-1.0

DeepReinforce ha lanzado Ornith-1.0, una familia de modelos de código abierto diseñada específicamente para tareas de codificación de agentes. Construidos sobre las arquitecturas preentrenadas Gemma 4 y Qwen 3.5, estos modelos están alojados en Hugging Face y son totalmente compatibles con marcos de servicio populares. El modelo denso de 9B también está disponible para pruebas en Hugging Face Spaces, respaldado por una aplicación de servidor Gradio.

  • DeepReinforce lanzó la familia de modelos Ornith-1.0 bajo la licencia MIT, post-entrenada sobre las arquitecturas Gemma 4 y Qwen 3.5.
  • La línea incluye cuatro tamaños: 9B denso, 31B denso, 35B mezcla de expertos (MoE) y 397B MoE.
  • Los modelos aprenden sus propios andamiajes de orquestación durante el aprendizaje por refuerzo en lugar de depender de arneses diseñados a mano.
  • Para evitar el pirateo de recompensas, DeepReinforce implementó tres capas de defensa: un límite de confianza fijo, un monitor determinista y un juez LLM congelado.
  • El modelo insignia 397B MoE obtuvo puntuaciones de 77,5 en Terminal-Bench 2.1 y 82,4 en SWE-Bench Verified.
  • Todos los modelos proporcionan puntos finales compatibles con OpenAI y admiten vLLM, SGLang y Transformers.

Los desarrolladores obtienen acceso a modelos de codificación de código abierto altamente capaces y con licencia MIT que admiten de forma nativa marcos de servicio populares como vLLM y SGLang.

4. Microsoft hace que los modelos MAI-Image-2.5 estén disponibles a través de Foundry API

Microsoft ha trasladado la familia de modelos MAI-Image-2.5 desde su anuncio inicial en Build 2026 a la disponibilidad general en Foundry API. Este lanzamiento incluye el modelo estándar MAI-Image-2.5 y una variante más eficiente MAI-Image-2.5-Flash, proporcionando a los desarrolladores nuevas herramientas para la generación de texto a imagen y la edición de imágenes.

  • MAI-Image-2.5 y MAI-Image-2.5-Flash ya están disponibles a través de Microsoft Foundry API.
  • MAI-Image-2.5 ocupa el puesto n.º 2 en texto a imagen y el n.º 3 en edición de imágenes en Artificial Analysis Image Arena.
  • MAI-Image-2.5-Flash es una variante más rápida y de menor costo que ocupa el puesto n.º 8 en texto a imagen y el n.º 6 en edición de imágenes.
  • El precio se establece en 48 dólares por cada 1.000 imágenes para el modelo estándar y 20 dólares por cada 1.000 imágenes para la variante Flash.
  • Los modelos admiten la generación de texto a imagen y la edición de imágenes con 32K de contexto y una resolución de salida de ~1MP.

Los desarrolladores ahora pueden integrar estos modelos de imagen de alto rendimiento en sus aplicaciones, con la nueva variante Flash que ofrece una opción de menor costo para tareas de generación de imágenes.

SOURCES

5. NVIDIA lanza el modelo de lenguaje de difusión Nemotron-TwoTower-30B

El nuevo Nemotron-TwoTower-30B-A3B-Base-BF16 de NVIDIA representa un enfoque inusual para el modelado de lenguaje al combinar arquitecturas de difusión y autorregresivas. Al utilizar una torre de contexto autorregresiva congelada junto con una torre de eliminación de ruido por difusión, el modelo es capaz de generar bloques de tokens en paralelo, ofreciendo una aceleración significativa para la implementación local.

  • NVIDIA lanzó Nemotron-TwoTower-30B-A3B-Base-BF16, construido sobre la columna vertebral Nemotron 3 Nano 30B-A3B.
  • El modelo utiliza una torre de contexto autorregresiva congelada y una torre de eliminación de ruido por difusión para generar bloques de tokens en paralelo.
  • Logra 2,42 veces el rendimiento de generación de reloj de pared de la línea base autorregresiva.
  • La configuración predeterminada de difusión de máscara conserva el 98,7% de la calidad de referencia agregada de la línea base autorregresiva.

Este lanzamiento introduce una arquitectura de generación de tokens paralelos altamente eficiente que aumenta drásticamente el rendimiento mientras conserva el 98,7% de la calidad de referencia de la línea base.

SOURCES

6. BatonBot automatiza flujos de trabajo de codificación de IA local a través de Kanban

BatonBot introduce un flujo de trabajo Kanban centrado en lo local para ayudar a los desarrolladores a gestionar múltiples tareas de codificación de IA de forma asíncrona. Al integrarse con herramientas populares como Aider, Cline y Claude Code, la aplicación permite a los desarrolladores poner tareas en cola y dejar que los agentes las realicen sin necesidad de una supervisión manual constante.

  • BatonBot es una aplicación de código abierto centrada en lo local diseñada para automatizar los flujos de trabajo de codificación de IA y reducir la supervisión manual.
  • La aplicación permite a los usuarios configurar tareas de codificación, delegarlas a agentes y monitorear el progreso a través de un tablero estilo Kanban.
  • Está diseñada para usuarios de herramientas de codificación de IA locales o semilocales, incluidos Aider, Cline, Roo, Codex CLI, Claude Code y LLM locales.
  • El proyecto está alojado en GitHub en https://github.com/mdoty4/batonbot.

Los desarrolladores pueden ejecutar y monitorear agentes de codificación locales (como Aider, Cline o Claude Code) de forma asíncrona sin tener que supervisar manualmente cada paso.

SOURCES

7. NVIDIA lanza NeMo AutoModel para acelerar el ajuste fino de MoE

NeMo AutoModel de NVIDIA aborda la naturaleza intensiva en recursos del ajuste fino de modelos de mezcla de expertos (MoE). Al aprovechar kernels de comunicación avanzados y paralelismo de expertos, el marco hace que sea significativamente más fácil y económico para los desarrolladores adaptar modelos masivos de pesos abiertos a sus propios conjuntos de datos utilizando clústeres de GPU estándar.

  • NVIDIA lanzó NeMo AutoModel en Hugging Face para optimizar los procesos de ajuste fino para arquitecturas MoE.
  • El marco admite modelos MoE, incluidos Qwen3 y DeepSeek V3.
  • Utiliza paralelismo de expertos y kernels de comunicación fusionados DeepEP para distribuir dinámicamente pesos de expertos especializados en clústeres de GPU.
  • NeMo AutoModel ofrece un aumento de hasta 3,7 veces en el rendimiento de entrenamiento en comparación con las bibliotecas nativas Transformers v5.
  • El marco reduce el uso máximo de memoria de la GPU en un 32% en comparación con las bibliotecas nativas Transformers v5.

Los desarrolladores que ajustan modelos MoE grandes pueden lograr un aumento de hasta 3,7 veces en el rendimiento de entrenamiento y una reducción del 32% en el uso máximo de memoria de la GPU.

SOURCES

8. Lanzamiento de API RAG médica gratuita con soporte MCP

Se ha lanzado una nueva API RAG médica ligera para proporcionar a los LLM locales un acceso rápido a hechos médicos verificados. Construida sobre artículos médicos de Wikipedia y alojada en un VPS ARM de bajos recursos, la API admite de forma nativa el Protocolo de Contexto de Modelo (MCP), lo que facilita su conexión a flujos de trabajo de agentes para evitar errores fácticos.

  • Una API RAG gratuita basada en artículos médicos de Wikipedia está accesible en https://hyfl.uk.
  • La API está diseñada para proporcionar hechos médicos a los LLM locales para corregir alucinaciones.
  • El servicio está alojado en un único VPS ARM, utiliza ~2 GB de RAM y apunta a tiempos de respuesta inferiores a un segundo.
  • Admite el Protocolo de Contexto de Modelo (MCP) para una fácil integración con agentes de IA.
  • Una demostración mostró que la API corrigió alucinaciones en el modelo qwen3.5-0.8B con respecto al signo de Lhermitte.

Los desarrolladores pueden conectar fácilmente sus LLM y agentes locales a una base de conocimientos médicos verificada utilizando el Protocolo de Contexto de Modelo para reducir las alucinaciones.

SOURCES

9. Audio.cpp unifica 12 modelos de audio en un único tiempo de ejecución C++/GGML

Audio.cpp proporciona un tiempo de ejecución C++ unificado y ligero para ejecutar modelos de audio localmente. Al aprovechar ggml, el marco evita la necesidad de entornos Python complejos y ofrece mejoras de rendimiento significativas, incluido un proceso de redoblaje en el mismo idioma que combina Qwen3-ASR y Qwen3-TTS en un solo comando CLI.

  • Audio.cpp es un marco de inferencia C++ nativo para modelos de audio construido sobre ggml.
  • El marco incluye actualmente 25 familias de modelos, con 12 lanzadas y listas para uso sin conexión (incluidos Qwen3-TTS, PocketTTS y VeVo2).
  • Los modelos lanzados cubren tareas de TTS, clonación de voz, ASR, alineación, VAD, conversión de voz y códec.
  • Elimina la necesidad de entornos Python separados al unificar el tiempo de ejecución, el manejo de sesiones, la CLI y la lógica del servidor.
  • Los puntos de referencia muestran que PocketTTS logra una aceleración de 3,68 veces en CUDA en comparación con Python, con velocidades de generación en tiempo real de hasta 48,40 veces.
  • El marco admite backends de CPU, CUDA, Vulkan y Metal según el modelo.

Los desarrolladores pueden implementar modelos de texto a voz, clonación de voz y ASR localmente sin entornos Python pesados, logrando aceleraciones masivas y manejo de sesiones unificado.

SOURCES

10. JetSpec logra una aceleración LLM sin pérdidas de hasta 9,64 veces

La investigación de JetSpec introduce un método de decodificación especulativa que utiliza redacción de árbol paralela causal para evitar las limitaciones de los cabezales de redacción autorregresivos o de difusión de bloques más antiguos. Al redactar un árbol que preserva la causalidad en una sola pasada, el sistema logra aceleraciones masivas y sin pérdidas en los puntos de referencia estándar.

  • JetSpec utiliza la redacción de árbol paralela causal para cooptimizar el costo y la calidad de la redacción para la generación de LLM.
  • El sistema logra una aceleración de extremo a extremo de hasta 9,64 veces en MATH-500 y 4,58 veces en chat abierto mientras mantiene una generación sin pérdidas.
  • Alcanza aproximadamente 1.000 tokens por segundo en una sola GPU B200 cuando se utilizan optimizaciones de gráficos y kernels de CUDA.
  • El método redacta un árbol que preserva la causalidad en una sola pasada para superar las limitaciones de los enfoques de decodificación especulativa anteriores.

Los desarrolladores pueden acelerar drásticamente las velocidades de inferencia de LLM locales sin perder calidad de generación mediante la adopción de la redacción de árbol paralela.

SOURCES

11. El muestreador de retroceso aumenta drásticamente el rendimiento de codificación de modelos pequeños

Una novedosa técnica de muestreador y verificador de retroceso ofrece una forma de aumentar drásticamente las capacidades de codificación de los modelos pequeños sin alterar sus pesos. Si bien introduce una penalización en la velocidad de decodificación y aumenta los requisitos de VRAM y cómputo durante la inferencia, la técnica reduce significativamente las alucinaciones y eventualmente podría integrarse directamente en tiempos de ejecución como llama.cpp.

  • Una nueva técnica de muestreador de retroceso permite potencialmente que un modelo de 0,5B funcione a la par con los modelos de 2B-4B en tareas de codificación.
  • Se estima que la técnica reduce las alucinaciones en modelos grandes en un 30-50%, pero incurre en una penalización de velocidad de decodificación del 5-30%.
  • La implementación de la técnica requiere entrenar un modelo verificador de tamaño similar, lo que duplica los requisitos de VRAM y aumenta las necesidades de cómputo entre 1,5 y 3 veces.
  • El entrenamiento del modelo verificador requiere aproximadamente el 0,01% del tamaño original del token de preentrenamiento.
  • El modelo verificador se generaliza a otros modelos de la misma clase de peso o inferior que comparten la misma distribución de datos.

Los desarrolladores que ejecutan modelos locales pueden mejorar significativamente el rendimiento de codificación y reducir las alucinaciones en un 30-50% a costa de una penalización de velocidad de decodificación del 5-30%.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.