Inference Brew

OpenAI lanza los modelos GPT-5.6 y ChatGPT Work a disponibilidad general

00:00 / --:--

← Volver al inicio

OpenAI lanza los modelos GPT-5.6 y ChatGPT Work a disponibilidad general

1. OpenAI lanza los modelos GPT-5.6 y ChatGPT Work a disponibilidad general

OpenAI ha sacado la familia de modelos GPT-5.6 (Sol, Terra y Luna) de la fase de vista previa y los ha puesto a disponibilidad general. Junto con el lanzamiento completo, la compañía presentó ChatGPT Work, un agente diseñado para automatizar proyectos de varios pasos mediante la integración con herramientas laborales como Slack y Google Drive. Como parte de esta transición, OpenAI retirará su navegador independiente Atlas el 9 de agosto, migrando sus funciones de agente a la aplicación de escritorio principal y a una nueva extensión de Chrome.

  • Los modelos GPT-5.6 (Sol, Terra, Luna) ya están disponibles de forma general.
  • Se presentó ChatGPT Work para automatizar flujos de trabajo laborales de varios pasos.
  • La API de respuestas ahora admite llamadas a herramientas programáticas.
  • El nuevo ajuste 'ultra' coordina cuatro agentes en paralelo para tareas complejas.
  • El navegador ChatGPT Atlas será retirado el 9 de agosto.

Los desarrolladores ahora tienen acceso total a los modelos de frontera GPT-5.6, que incluyen llamadas a herramientas programáticas y un modo de aceleración multi-agente 'ultra', junto con el nuevo agente ChatGPT Work.

2. Meta lanza la vista previa de la API del modelo de codificación Muse Spark 1.1

Meta ha incursionado en el espacio de codificación con IA con el lanzamiento de Muse Spark 1.1, ahora disponible en una vista previa de API pública para desarrolladores de EE. UU. Diseñado para manejar grandes cargas de trabajo de agentes, el modelo está creado para tareas como la corrección de errores y migraciones de código de extremo a extremo. Cuenta con percepción multimodal nativa para procesar imágenes, videos y documentos junto con el código. Para fomentar la adopción, Meta ofrece 20 dólares en créditos gratuitos para las nuevas cuentas de la API de Meta Model.

  • Muse Spark 1.1 está disponible para desarrolladores de EE. UU. a través de una vista previa de API pública desde hoy.
  • Meta ofrece 20 dólares en créditos gratuitos por cada nueva cuenta de la API de Meta Model.
  • El modelo presenta una detección de errores mejorada, soporte para flujos de trabajo de agentes de extremo a extremo y percepción multimodal nativa para imágenes, videos y documentos.
  • El modelo es accesible en "modo de pensamiento" a través de la aplicación y el sitio web de Meta AI.
  • Meta está posicionando al agente Spark para ayudar a las empresas con tareas a gran escala como la corrección de errores y migraciones de código.

Los desarrolladores pueden aprovechar un nuevo modelo de codificación competitivo con percepción multimodal nativa y soporte para flujos de trabajo de agentes, respaldado por 20 dólares en créditos de API gratuitos.

3. Lanzamiento de MOSS-Transcribe-Diarize 0.9B para procesamiento de audio en una sola pasada

Se ha lanzado el modelo de pesos abiertos MOSS-Transcribe-Diarize 0.9B, que ofrece una solución de extremo a extremo para el procesamiento de audio de larga duración. A diferencia de las tuberías tradicionales que separan la transcripción y la diarización, este modelo ejecuta ambas en una sola pasada, produciendo texto alineado en el tiempo con etiquetas de hablante anónimas. Construido sobre un decodificador causal estilo Qwen3-0.6B y un codificador Whisper-Medium, el modelo admite instrucciones de transcripción personalizadas, palabras clave y anotaciones de eventos acústicos, con pesos GGUF disponibles en Hugging Face.

  • MOSS-Transcribe-Diarize 0.9B es un modelo de comprensión de audio de extremo a extremo para transcripción y diarización de múltiples hablantes de larga duración.
  • El modelo realiza la transcripción y la diarización en una sola pasada, generando texto alineado en el tiempo con etiquetas de hablante anónimas (por ejemplo, [S01]).
  • La arquitectura combina un decodificador causal estilo Qwen3-0.6B, un codificador Whisper-Medium y una fusión temporal 4x con un adaptador MLP.
  • Admite generación mediante prompts, incluyendo instrucciones de transcripción personalizadas, palabras clave y anotaciones de eventos acústicos.
  • Una versión GGUF del modelo está disponible en Hugging Face para despliegue local.

Los desarrolladores pueden ejecutar un modelo de audio local y ligero que genera texto alineado en el tiempo con etiquetas de hablante anónimas, evitando complejas tuberías de múltiples modelos.

SOURCES

4. ByteDance lanza el modelo de diseño multimodal Seedream 5.0 Pro

ByteDance ha lanzado Seedream 5.0 Pro, un modelo de creación de imágenes multimodal construido específicamente para flujos de trabajo de diseño de producción. Alejándose de la generación simple de un solo paso, el modelo se centra en capacidades de edición precisa y herramientas de diseño avanzadas. También cuenta con un sólido soporte multilingüe para más de 10 idiomas, incluido el manejo especializado de diseños de derecha a izquierda y acentos, lo que lo hace altamente aplicable para el diseño de productos globales.

  • Seedream 5.0 Pro está diseñado para flujos de trabajo de diseño de producción en lugar de la generación de imágenes de un solo paso.
  • El modelo cuenta con capacidades de edición precisa y herramientas avanzadas de diseño de producción.
  • Admite más de 10 idiomas, incluido soporte específico para diseños de derecha a izquierda y acentos.
  • El modelo está dirigido a creadores, diseñadores, desarrolladores y equipos de producto.

Los desarrolladores y diseñadores obtienen un modelo de imagen de grado de producción con capacidades de edición precisa y soporte de diseño multilingüe.

SOURCES

5. NetSuite añade soporte para el Protocolo de Contexto de Modelo (MCP)

NetSuite ha anunciado soporte nativo para el Protocolo de Contexto de Modelo (MCP) junto con un nuevo Servicio de Conector de IA. Esta integración permite a los desarrolladores conectar modelos de IA externos directamente a los datos operativos y flujos de trabajo integrados de NetSuite. Fundamentalmente, el sistema mantiene los permisos y políticas de gobernanza existentes de NetSuite, asegurando que los agentes de IA no puedan acceder a información no autorizada mientras automatizan tareas empresariales como informes de ingresos y recuperación de datos de clientes.

  • NetSuite ahora admite el Protocolo de Contexto de Modelo (MCP) y proporciona un Servicio de Conector de IA.
  • La integración permite que los modelos de IA externos se conecten con flujos de trabajo integrados y datos operativos.
  • Se mantienen los permisos existentes de NetSuite, como las políticas de gobernanza y seguridad, para evitar el acceso no autorizado a los datos.
  • Los estudios de casos empresariales muestran ganancias de eficiencia significativas, como la reducción de los tiempos de búsqueda de pedidos pendientes de clientes de minutos a segundos.

Los desarrolladores ahora pueden construir servidores MCP estandarizados e integraciones que conectan LLM externos directamente a los datos operativos y permisos de NetSuite.

SOURCES

6. Lanzamiento de PostHog FOSS con funciones de observabilidad de LLM

PostHog ha lanzado un repositorio dedicado y totalmente de código abierto (posthog-foss) bajo la licencia MIT, ofreciendo a los desarrolladores una alternativa autohospedable a su plataforma en la nube. Junto con la analítica de productos estándar, las repeticiones de sesiones y las banderas de funciones, el lanzamiento incluye funciones integradas de observabilidad de IA diseñadas para capturar trazas, generaciones, latencia y costos para aplicaciones impulsadas por LLM. La plataforma puede ser autohospedada a través de Docker en Linux con un mínimo de 4 GB de memoria, e incluye SDK para los principales backends y frontends.

  • PostHog ha lanzado un repositorio separado posthog-foss bajo la licencia MIT expat para software 100% libre y de código abierto.
  • La plataforma incluye funciones de observabilidad de IA para capturar trazas, generaciones, latencia y costos para aplicaciones impulsadas por LLM.
  • Proporciona analítica, repeticiones de sesiones, banderas de funciones, experimentos, seguimiento de errores y encuestas en una plataforma todo en uno.
  • Los usuarios pueden autohospedar PostHog usando Docker en Linux, con una memoria recomendada de 4 GB para instancias de aficionados.
  • PostHog proporciona SDK para múltiples lenguajes y marcos, incluidos Go, Django, .NET/C# y Angular.

Los desarrolladores pueden autohospedar una pila completa de analítica de productos y observabilidad de IA localmente o en sus propios servidores sin depender de un proveedor de nube.

SOURCES

7. FableCut lanza un editor de video para navegador controlado por agentes

FableCut ha lanzado un editor de video no lineal de código abierto basado en navegador diseñado específicamente para flujos de trabajo colaborativos entre humanos e IA. Al exponer toda su línea de tiempo como un documento JSON, FableCut permite a los agentes de IA editar pistas de video, pistas de audio y transiciones en tiempo real junto con humanos usando MCP, REST o manipulación directa de JSON. El sistema emplea un contador de revisiones para manejar ediciones concurrentes sin problemas e incluye herramientas integradas para la eliminación de fondos por IA y el análisis de referencia de video.

  • FableCut es un editor de video no lineal basado en navegador sin dependencias que expone su línea de tiempo como un documento JSON.
  • Los agentes de IA y los humanos pueden editar la misma línea de tiempo simultáneamente usando MCP, REST o modificación directa de JSON.
  • El editor cuenta con 4 pistas de video, 3 pistas de audio, animación de fotogramas clave, transiciones y eliminación de fondo por IA.
  • Un contador de revisiones gestiona la edición concurrente para evitar conflictos entre los cambios humanos y de IA.
  • Incluye una herramienta de análisis de referencia para extraer límites de tomas, BPM y música de videos existentes.
  • La herramienta requiere Node 18+ y un navegador basado en Chromium, con soporte opcional para ffmpeg.

Los desarrolladores pueden construir agentes de edición de video que manipulen programáticamente líneas de tiempo, transiciones y efectos en tiempo real junto con editores humanos.

SOURCES

8. OpenMed 1.8 añade desidentificación clínica local para móviles y web

OpenMed ha lanzado la versión 1.8 de su kit de herramientas de PNL clínica con licencia Apache-2.0, centrándose en la desidentificación totalmente local y del lado del cliente. La actualización introduce OpenMedKit para Android, puentes para iOS/Swift y React Native, y un tiempo de ejecución de navegador impulsado por Transformers.js y ONNX Runtime Web. Para abordar fallas de seguridad comunes, el lanzamiento incluye una herramienta verify-pdf que asegura que las capas de texto redactadas se eliminen por completo en lugar de solo ocultarse bajo cajas negras, junto con nuevo soporte para DICOM y dominios de NER clínicos.

  • OpenMed 1.8 es un kit de herramientas con licencia Apache-2.0 para PNL clínica que se ejecuta totalmente de forma local en hardware de consumo.
  • El lanzamiento introduce OpenMedKit para Android (usando ONNX Runtime Mobile y ML Kit OCR) y puentes para iOS/Swift y React Native.
  • Un nuevo tiempo de ejecución de navegador utiliza Transformers.js y ONNX Runtime Web para la desidentificación del lado del cliente.
  • La nueva herramienta verify-pdf evita vulnerabilidades de redacción donde las capas de texto permanecen accesibles debajo de cajas negras.
  • La actualización añade desidentificación DICOM, cinco nuevos paquetes de identificación de idiomas y cinco nuevos dominios de NER clínicos.

Los desarrolladores que manejan datos médicos o PII sensibles ahora pueden realizar una redacción segura del lado del cliente en móviles y web sin enviar datos a API externas.

SOURCES

9. Context.dev lanza una API para la extracción estructurada de datos web

Context.dev ha lanzado una API diseñada para simplificar la extracción de datos web para LLM y agentes de IA. El servicio convierte cualquier URL en Markdown limpio, HTML renderizado, capturas de pantalla o JSON estructurado basado en un esquema proporcionado por el usuario. También cuenta con extracción automatizada de contexto de marca (extrayendo logotipos, colores, fuentes y descripciones) mientras incorpora una capa de caché y respeta las solicitudes de exclusión de los sitios web.

  • Context.dev proporciona una API para extraer Markdown limpio, HTML renderizado, capturas de pantalla e imágenes de URL.
  • Los usuarios pueden extraer datos estructurados de sitios web proporcionando una URL y un esquema JSON de destino.
  • El servicio extrae el contexto de la marca, incluidos nombres de empresas, descripciones, logotipos, colores, fuentes y enlaces sociales.
  • La plataforma incluye una capa de caché para gestionar la frecuencia de las solicitudes y respeta las solicitudes de exclusión de los sitios web.
  • El uso de datos de marca está restringido a la identificación de clientes dentro del software y no puede utilizarse para marketing externo.

Proporciona una API de scraping web y extracción de marca limpia y lista para LLM que respeta las exclusiones de los sitios web y maneja el almacenamiento en caché automáticamente.

SOURCES

10. Un informe revela que el 69% de las empresas comparten claves de API entre agentes de IA

El informe de seguridad de agentes del segundo trimestre de VentureBeat ha destacado graves brechas de seguridad en los despliegues de IA empresarial, revelando que el 69% de las organizaciones comparten credenciales de API entre múltiples agentes de IA. Este intercambio generalizado de credenciales ha contribuido a que el 54% de las empresas encuestadas experimentaran un incidente de seguridad o un casi incidente relacionado con agentes de IA. Además, solo el 30% de las empresas actualmente aíslan (sandbox) sus agentes de mayor riesgo, confiando en su lugar en los controles nativos del proveedor. El informe subraya un impulso masivo de la industria para asegurar las identidades de los agentes, marcado por más de 22 mil millones de dólares en adquisiciones de seguridad durante el último año.

  • El informe de seguridad de agentes del segundo trimestre de VentureBeat encontró que el 69% de las empresas encuestadas comparten credenciales entre agentes de IA.
  • El estudio revela que el 54% de las empresas han experimentado un incidente de seguridad o un casi incidente relacionado con agentes de IA.
  • Solo el 30% de las empresas actualmente aíslan (sandbox) sus agentes de IA de mayor riesgo.
  • Los principales proveedores de seguridad han gastado más de 22 mil millones de dólares en adquisiciones en el último año para abordar las brechas de seguridad de los agentes, incluida la Identidad Continua para Agentes de IA de CrowdStrike.
  • El 82% de las empresas confían en los controles nativos del proveedor o del hiperescalador como su capa de seguridad principal, con OpenAI liderando con un 51%.

Destaca vulnerabilidades de seguridad críticas en la forma en que los desarrolladores despliegan agentes, enfatizando la necesidad inmediata de sandboxing y gestión de credenciales aisladas.

SOURCES

11. El motor Colibrì ejecuta el modelo MoE GLM 5.2 de 744B en 32GB de RAM

Un nuevo proyecto de código abierto llamado Colibrì ha demostrado un método para ejecutar el enorme modelo de mezcla de expertos (MoE) GLM 5.2 de 744 mil millones de parámetros en hardware de consumo estándar. Al cuantizar el modelo a int4, Colibrì mantiene el núcleo denso de 17B de parámetros en la RAM (usando alrededor de 9.9 GB) mientras transmite los 370 GB restantes de expertos desde el disco bajo demanda. Escrito en un solo archivo C de 1,300 líneas sin dependencias externas como Python o GPU, el motor logra 0.1 tokens por segundo en una computadora portátil de 12 núcleos, lo que demuestra la viabilidad de ejecutar modelos ultra grandes localmente.

  • El motor Colibrì ejecuta el modelo MoE GLM 5.2 de 744B de parámetros en una computadora estándar con 32GB de RAM.
  • Colibrì convierte el modelo a int4, manteniendo la porción densa de 17B de parámetros residente en la RAM a aproximadamente 9.9 GB.
  • Los 21,504 expertos enrutados restantes (370 GB) se almacenan en el disco y se transmiten bajo demanda utilizando una caché LRU por capa y la caché de página del sistema operativo.
  • El motor está implementado en un solo archivo C de aproximadamente 1,300 líneas y no requiere BLAS, Python ni GPU.
  • Las pruebas en una computadora portátil de 12 núcleos con 25GB de RAM arrojaron un rendimiento de inferencia local de 0.1 tokens por segundo.

Demuestra una novedosa técnica de inferencia local que permite a los desarrolladores ejecutar modelos abiertos masivos de clase frontera en computadoras portátiles estándar sin costosos clústeres de GPU.

SOURCES

12. Un estudio revela que la cuantización afecta desproporcionadamente la precisión matemática

Una evaluación sistemática que compara modelos FP16 con varios niveles de cuantización GGUF ha revelado que la cuantización no degrada todas las capacidades por igual. Las pruebas en un modelo de 27B mostraron que, si bien la cuantización Q4_K_M resultó en una caída del rendimiento de menos del 2% para tareas conversacionales y de recuperación de conocimientos, causó una caída de casi el 9% en la precisión matemática de varios pasos. La actualización a la cuantización Q5_K_M eliminó efectivamente esta brecha de precisión matemática, lo que sugiere que los desarrolladores que construyen aplicaciones de razonamiento o intensivas en matemáticas deberían evitar la cuantización estándar de 4 bits en favor de variantes de 5 bits.

  • Las pruebas sistemáticas compararon FP16 frente a varios niveles de cuantización GGUF en un modelo de 27B en matemáticas, código, razonamiento y recuperación.
  • La cuantización Q4_K_M resultó en una degradación de menos del 2% para tareas conversacionales y de conocimiento en comparación con FP16.
  • La misma cuantización Q4_K_M causó una caída de casi el 9% en la precisión matemática de varios pasos.
  • La actualización a la cuantización Q5_K_M eliminó efectivamente la brecha de precisión matemática en comparación con FP16.
  • El estudio señala una falta de pruebas rigurosas sobre si los modelos cuantizados pierden precisión en la recuperación de contexto más rápido a medida que se llena la ventana de contexto.

Los desarrolladores que ajustan o despliegan modelos locales deben elegir los niveles de cuantización con cuidado, ya que la cuantización Q4 estándar puede degradar silenciosamente las capacidades de razonamiento y matemáticas mientras parece funcionar bien en pruebas conversacionales.

SOURCES

13. Un estudio identifica el "techo de co-fallo" en el enrutamiento de LLM de múltiples modelos

Un estudio que evaluó 67 modelos de frontera ha identificado una limitación matemática en la orquestación de múltiples modelos llamada "techo de co-fallo": la tasa a la que todos los modelos en un grupo de enrutamiento fallan simultáneamente en el mismo prompt. Los investigadores encontraron que las métricas estándar de correlación de errores por pares subestiman las tasas reales de co-fallo en 2.25 veces. Además, el estudio advierte que la votación mayoritaria ingenua entre modelos de capacidad desigual a menudo degrada el rendimiento porque los modelos más débiles superan en votos al más fuerte. Para mitigar esto, se aconseja a los desarrolladores que solo combinen modelos dentro de una banda de calidad coincidente y utilicen el límite de Clopper-Pearson para calcular los techos de rendimiento absoluto antes del despliegue.

  • Una evaluación de 67 modelos de frontera identificó el "techo de co-fallo": el porcentaje de prompts donde cada modelo en un grupo falla simultáneamente.
  • Las métricas estándar de correlación de errores por pares subestiman las tasas reales de co-fallo en 2.25 veces (por ejemplo, prediciendo una tasa de falla del 2.3% en MATH-500 cuando la tasa real era del 5.2%).
  • La votación mayoritaria ingenua entre modelos de capacidad desigual puede disminuir el rendimiento general porque los modelos más débiles superan en votos al más capaz.
  • Los investigadores recomiendan combinar modelos solo dentro de una banda de calidad coincidente o confiar en el mejor modelo individual para una tarea.
  • Los desarrolladores pueden usar el límite de Clopper-Pearson como una prueba previa al despliegue sin costo para calcular el techo de rendimiento absoluto de un sistema de múltiples modelos.

Los desarrolladores que construyen sistemas de enrutamiento o conjuntos de LLM deben tener en cuenta el techo de co-fallo y evitar la votación mayoritaria ingenua entre modelos desiguales.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.