Inference Brew

Anthropic amplía la familia Claude 5.5 con el nuevo modelo Sonnet

00:00 / --:--

← Volver al inicio

Anthropic amplía la familia Claude 5.5 con el nuevo modelo Sonnet

1. Anthropic amplía la familia Claude 5.5 con el nuevo modelo Sonnet

Anthropic ha ampliado su familia de modelos Claude 5.5 con el lanzamiento de Claude Sonnet 5.5, basándose en el modelo insignia Opus 5.5 lanzado la semana pasada. Sonnet 5.5 ofrece un salto sustancial en las capacidades de codificación agentica, alcanzando una puntuación del 70,6% en Terminal-Bench 4.0 en comparación con el 10,3% del Sonnet 5 anterior. Aunque los precios se mantienen consistentes con el Sonnet 5 anterior, el nuevo modelo es un 30% más rápido y más eficiente en el uso de tokens para tareas estándar, aunque los desarrolladores deben tener en cuenta posibles aumentos en el consumo de tokens durante el esfuerzo máximo de razonamiento.

  • • Claude Sonnet 5.5 obtiene una puntuación de 56 en el Artificial Analysis Intelligence Index, ocupando el segundo lugar en general.
  • • Los precios siguen siendo idénticos a los de Sonnet 5: 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida.
  • • El rendimiento de codificación agentica en Terminal-Bench 4.0 alcanzó el 70,6%, frente al 10,3% en Sonnet 5.
  • • El modelo funciona un 30% más rápido que Sonnet 5 y mantiene una ventana de contexto de 1 millón de tokens.
  • • Disponible ahora en AWS, Google Cloud y Azure con opciones de retención de datos cero.

Proporciona un modelo de nivel medio más rápido y altamente capaz para flujos de trabajo agenticos que cierra la brecha de rendimiento entre la generación anterior y el nuevo buque insignia Opus 5.5.

2. ElevenLabs lanza los modelos Eleven v4 y v4 Turbo TTS

ElevenLabs ha lanzado Eleven v4 y Eleven v4 Turbo, sus últimos modelos de texto a voz. Eleven v4 amplía el soporte de idiomas a más de 90 y casi duplica el rendimiento de generación a 73,4 caracteres por segundo en comparación con la v3. Los modelos permiten a los desarrolladores clonar voces utilizando una muestra de audio de 10 segundos e introducen un control emocional detallado mediante señales de texto en línea como [suspira] o [susurra]. Eleven v4 ocupa actualmente el puesto número 1 en la tabla de clasificación de Artificial Analysis Provider Voice TTS Arena y tiene un precio de 80 dólares por millón de caracteres.

  • • Eleven v4 admite más de 90 idiomas (frente a los más de 70 de la v3) y ocupa el puesto número 1 en la tabla de clasificación de Artificial Analysis Provider Voice TTS Arena.
  • • El modelo procesa 73,4 caracteres por segundo, casi duplicando la velocidad de generación de Eleven v3.
  • • Eleven v4 Turbo admite respuestas casi instantáneas para aplicaciones conversacionales en tiempo real.
  • • Los modelos permiten la clonación de voz de alta calidad a partir de una muestra de audio de 10 segundos.
  • • Los desarrolladores pueden controlar el estilo y la emoción de la salida de voz insertando señales de texto como [suspira] o [susurra] directamente en los guiones.
  • • El costo de Eleven v4 se establece en 80 dólares por 1 millón de caracteres.

Los desarrolladores pueden crear aplicaciones de voz altamente realistas y casi instantáneas en más de 90 idiomas con controles de emoción avanzados basados en guiones.

3. OpenAI amplía el acceso al modo API 'Ultrafast' impulsado por Cerebras

Tras su vista previa inicial en agosto como un nivel solo por lista de espera para GPT-5.6 Sol, OpenAI ahora está preparando un despliegue más amplio de su modo API 'Ultrafast'. Las actualizaciones recientes de la plataforma de desarrolladores y la documentación de la API indican que el servicio, que aprovecha el hardware de Cerebras para alcanzar velocidades de hasta 750 tokens de salida por segundo, está pasando de su fase de evaluación restringida a una disponibilidad más amplia.

  • • OpenAI está ampliando el acceso al modo API 'Ultrafast' más allá de la vista previa inicial solo por lista de espera.
  • • El modo sigue siendo impulsado por hardware de Cerebras, manteniendo su rendimiento de 750 tokens de salida por segundo.
  • • Este desarrollo marca un cambio desde la fase limitada de evaluación empresarial anunciada en agosto de 2026.
  • • El aumento de velocidad de 14 veces sobre la inferencia estándar sigue siendo la principal propuesta de valor para las aplicaciones en tiempo real.

La expansión de este nivel de alta velocidad hace que las respuestas de LLM casi instantáneas sean más accesibles para los desarrolladores que crean interfaces conversacionales en tiempo real y bucles de agentes de alta frecuencia.

SOURCES

4. Fireworks AI lanza el modelo de razonamiento Ember-1

Fireworks AI ha lanzado Ember-1, un modelo de razonamiento especializado construido mediante el post-entrenamiento de Kimi K3 de peso abierto de Moonshot AI. Ember-1 está optimizado para producir trazas de razonamiento significativamente más cortas, logrando una reducción del 39% en el total de tokens y una reducción del 71,3% en los tokens de razonamiento durante las pruebas A/B de producción. A pesar de las trazas más cortas, el modelo mantiene una alta precisión en las tareas, superando a Kimi K3 Max en Terminal Bench 2.1 y DeepSWE 1.1. Actualmente está disponible como una vista previa de investigación en la API sin servidor de Fireworks, con un precio idéntico al de Kimi K3.

  • • Ember-1 es un modelo especializado construido mediante el post-entrenamiento de Kimi K3 de peso abierto de Moonshot AI.
  • • El modelo está diseñado para producir trazas de razonamiento más cortas, lo que resulta en aproximadamente un 40% menos de tokens totales y una reducción del 71,3% en los tokens de razonamiento.
  • • Está disponible como una vista previa de investigación exclusivamente a través de la API sin servidor de Fireworks; los pesos y el código de entrenamiento no se han publicado.
  • • Ember-1 superó a Kimi K3 Max en los puntos de referencia Terminal Bench 2.1 y DeepSWE 1.1.
  • • El precio es idéntico al de Kimi K3: 3,00 dólares por 1 millón de tokens de entrada, 0,30 dólares por 1 millón de tokens de entrada en caché y 15,00 dólares por 1 millón de tokens de salida.

Ofrece a los desarrolladores un modelo de razonamiento más barato y rápido en una API sin servidor con una precisión de tarea comparable.

SOURCES

5. Jeff lanza modelos de decisión locales ultrarrápidos

El proyecto de código abierto Jeff ha lanzado una colección de modelos de decisión ultrarrápidos de 0.8B y 2B diseñados para clasificación y enrutamiento de disparo cero. Derivados de la receta AutoJev, estos modelos omiten la generación de texto por completo, devolviendo probabilidades calibradas para opciones estructuradas (elección, sí/no o escala) en una sola pasada hacia adelante. Ejecutándose localmente, el modelo de 0.8B ofrece latencias de decisión de aproximadamente 28 milisegundos en un Apple M4 Max usando MLX y 22 milisegundos en una RTX PRO 6000, lo que los hace ideales para enrutamiento de alta velocidad y control de seguridad en bucles agenticos.

  • • Jeff proporciona modelos Qwen3.5 y Gemma 4 ajustados diseñados para tareas de clasificación de disparo cero sin generación de texto.
  • • Los modelos logran latencias de decisión de ~22 ms en una RTX PRO 6000 y ~28 ms en un Apple M4 Max usando MLX.
  • • Jeff admite tres tipos de preguntas estructuradas: elección (hasta 255 opciones), noul (probabilidad de sí/no) y puntuación (basada en escala).
  • • El modelo Jeff 2B logró una puntuación del 83,1% en un panel de cinco puntos de referencia que incluye BBH, JudgeBench y RAGTruth.
  • • Los pesos del modelo se publican bajo la licencia Apache 2.0 y el código de entrenamiento se publica bajo la licencia MIT.

Los desarrolladores pueden ejecutar modelos de toma de decisiones y enrutamiento altamente calibrados de menos de 30 ms localmente en hardware de consumo como Macs o GPU individuales.

SOURCES

6. El modelo de decisión multimodal ImaJev-4B encabeza JevBench

ImaJev-4B es un modelo de decisión multimodal de pesos abiertos recientemente lanzado, diseñado para procesar texto, JSON y hasta dos fotos para generar probabilidades calibradas en una sola pasada hacia adelante. Construido utilizando LoRA y un cabezal de decisión personalizado sobre Qwen3.5-4B, el modelo alcanzó el primer puesto en JevBench (obteniendo 67,37) y superó a GPT-5.6 Luna en DecisionBench. ImaJev está altamente calibrado, prefiriendo generar 'desconocido' en lugar de alucinar, y puede ejecutarse localmente en una Mac a través de MLX o en una sola GPU bajo la licencia Apache-2.0.

  • • ImaJev está construido utilizando LoRA y un pequeño cabezal de decisión sobre Qwen3.5-4B, costando solo 1.200 dólares en recursos de GPU alquilados para entrenar.
  • • El modelo ocupó el puesto número 1 en JevBench con una puntuación de 67,37, superando a Jev 1.13.0, y se situó por delante de GPT-5.6 Luna en DecisionBench.
  • • Acepta registros de texto o JSON junto con hasta dos fotos, devolviendo probabilidades de opción calibradas en una sola pasada hacia adelante.
  • • El modelo está altamente calibrado, por defecto indica 'desconocido' en lugar de adivinar cuando no está seguro.
  • • Los pesos se publican bajo la licencia Apache-2.0 y pueden ejecutarse localmente en una Mac con MLX o en una sola GPU.

Ofrece a los desarrolladores un modelo multimodal local y ligero que destaca en la toma de decisiones estructuradas y tareas de verificación visual.

SOURCES

7. Nvidia lanza la plataforma Open Agent Safety con el sandbox OpenShell

Nvidia ha lanzado la plataforma Open Agent Safety, un marco de seguridad de código abierto regido por la Open Secure AI Alliance bajo la Linux Foundation. La plataforma aborda los riesgos de seguridad de los agentes de IA autónomos al proporcionar dos componentes principales: OpenShell, un sandbox de tiempo de ejecución seguro, y Sentry, un vigilante fuera de banda. OpenShell gestiona los ciclos de vida de los agentes y aplica reglas estrictas de red, sistema de archivos y procesos. Sentry se ejecuta en chips de red separados para monitorear continuamente el comportamiento del agente y poner en cuarentena a los agentes rebeldes en milisegundos sin depender de la CPU o GPU del host.

  • • Nvidia lanzó la plataforma Open Agent Safety, un marco de código abierto y diseño de referencia para la seguridad de agentes de IA.
  • • OpenShell es un tiempo de ejecución seguro con licencia Apache 2.0 que aísla agentes a través de Docker, Podman, MicroVM o Kubernetes en Linux, macOS y Windows WSL 2.
  • • Nvidia Sentry es un vigilante fuera de banda que se ejecuta en DPU BlueField-4 diseñado para monitorear continuamente a los agentes y ponerlos en cuarentena en milisegundos.
  • • La plataforma está optimizada para las CPU Nvidia Vera, que ofrecen un rendimiento de sandbox hasta un 80% más rápido en comparación con la infraestructura de CPU tradicional.
  • • Más de 100 organizaciones están colaborando en la plataforma, incluidas Anthropic, Salesforce, SAP, Red Hat y SpaceXAI.

Proporciona a los desarrolladores un entorno de tiempo de ejecución seguro a nivel de kernel para aislar agentes de IA y evitar que ejecuten acciones no autorizadas del sistema o de la red.

8. Cloudflare lanza cf Agentic CLI en versión beta abierta

Cloudflare ha lanzado 'cf', una nueva CLI diseñada específicamente para el desarrollo de software agentico, ahora disponible en versión beta abierta. El lanzamiento aborda un aumento masivo en el uso agentico, con agentes que ahora impulsan el 48% de la actividad de Wrangler. La CLI cf expone más de 3.000 operaciones de API de Cloudflare (frente a las 280 de Wrangler) y utiliza por defecto una interfaz JSON para optimizar el uso de la ventana de contexto para los agentes de IA. También introduce un formato de configuración cloudflare.config.ts basado en TypeScript para la verificación de tipos y un comando de búsqueda de lenguaje natural cf cli que ayuda a los agentes a descubrir los comandos correctos basados en las descripciones de la API.

  • • Cloudflare lanzó la CLI cf en versión beta abierta, instalable globalmente a través de npm i -g cf.
  • • La CLI admite más de 3.000 operaciones de API de Cloudflare, en comparación con solo 280 admitidas por Wrangler.
  • • Utiliza JSON como interfaz predeterminada para optimizar el uso del contexto para los agentes de IA.
  • • Un nuevo formato de configuración cloudflare.config.ts utiliza TypeScript para proporcionar verificación de tipos y una interacción mejorada con los agentes.
  • • La CLI cuenta con un comando cf cli search que permite a los agentes descubrir comandos apropiados utilizando lenguaje natural.
  • • Wrangler recibirá soporte de mantenimiento durante 18 meses después de que finalice la versión beta de cf.

Permite a los desarrolladores crear agentes que pueden gestionar y configurar programáticamente la infraestructura de Cloudflare utilizando interfaces seguras de tipo y amigables para los agentes.

SOURCES

9. Shopify abre el proceso de pago a agentes de IA basados en navegador

Shopify ha ampliado su soporte WebMCP para incluir el proceso de pago, permitiendo que los agentes de IA basados en navegador actualicen programáticamente los detalles del pedido y completen las compras. Con la autorización explícita del comprador, los agentes ahora pueden navegar por todo el flujo de transacciones de forma autónoma. Esta actualización reduce significativamente la fricción para los desarrolladores que crean asistentes de compras y agentes de comercio electrónico, yendo más allá del simple descubrimiento de productos hasta la ejecución completa de transacciones.

  • • Shopify está ampliando su soporte WebMCP para incluir el proceso de pago.
  • • La actualización permite que los agentes de IA basados en navegador actualicen los detalles del pedido y completen las compras.
  • • Los agentes deben tener la autorización explícita del comprador para ejecutar estas acciones.

Permite a los desarrolladores crear agentes de compras autónomos que pueden completar programáticamente todo el flujo de pago con la autorización del comprador.

SOURCES

10. Vespper lanza un servidor MCP de última generación para Docx

Vespper (YC F24) ha lanzado un nuevo servidor de Model Context Protocol (MCP) diseñado para permitir que los agentes de IA editen documentos de Word (.docx). En lugar de depender de bibliotecas tradicionales como python-docx, Vespper convierte los archivos de Word a HTML para editarlos y luego reconcilia los cambios con el formato original. Impulsado por un modelo de 3-8B ajustado con un adaptador LoRA, la herramienta expone tres herramientas principales a los agentes: leer, buscar y editar. Vespper ofrece un nivel gratuito de 500 ediciones por mes, admite retención de datos cero y puede ser autoalojado.

  • • Vespper es un servidor MCP que convierte documentos de Word (.docx) a HTML para editarlos, luego reconcilia los cambios con el archivo original.
  • • El sistema está impulsado por un modelo base de 3-8B ajustado con un adaptador LoRA.
  • • Afirma ser 3 veces más rápido, 2 veces más barato y más preciso que alternativas como python-docx.
  • • El MCP expone tres herramientas para agentes: leer, buscar y editar (actualmente no admite imágenes ni comentarios).
  • • Vespper ofrece un nivel gratuito de 500 ediciones por mes, con opciones de privacidad que incluyen retención de datos cero (ZDR) y autoalojamiento.

Proporciona una forma rápida, barata y altamente precisa para que los agentes de IA editen documentos de Word programáticamente.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.