Inference Brew

El Opus 5 de Anthropic, más barato, supera al Fable 5 en gasto corporativo

00:00 / --:--

← Volver al inicio

El Opus 5 de Anthropic, más barato, supera al Fable 5 en gasto corporativo

1. El Opus 5 de Anthropic, más barato, supera al Fable 5 en gasto corporativo

A menos de un mes de su lanzamiento, el Opus 5 de Anthropic ha superado al Fable 5 en gasto corporativo, impulsado por un precio un 50% menor. Aunque el Fable 5 está diseñado para proyectos largos y autónomos que requieren coherencia en múltiples pasos, las empresas están aprovechando los bajos costes de cambio para derivar tareas rutinarias al Opus 5, más económico, aunque pueda requerir más intentos o revisión humana.

  • • El Opus 5 superó al Fable 5 en gasto corporativo en modelos en el primer mes tras su lanzamiento.
  • • El Opus 5 tiene un precio equivalente a la mitad del Fable 5.
  • • Los bajos costes de cambio permiten a las empresas derivar dinámicamente el trabajo rutinario al modelo más barato.
  • • El Fable 5 sigue posicionado para proyectos autónomos largos que requieren coherencia entre pasos conectados.
  • • El Opus 5 puede requerir más intentos, prompts más largos o más revisión humana que el Fable 5.

Los desarrolladores pueden optimizar los costes operativos utilizando el Opus 5, más barato, para tareas rutinarias y reservando los modelos premium para proyectos autónomos complejos.

SOURCES

2. Meta lanza MobileMoE, modelos de mezcla de expertos para dispositivos móviles

Meta ha presentado MobileMoE, una familia de modelos de lenguaje de mezcla de expertos para dispositivos móviles optimizados para hardware móvil. Disponibles en tres escalas (0,3B, 0,5B y 0,9B de parámetros activos), los modelos están diseñados para mantener su huella cuantizada INT4 por debajo de los 3 GB para evitar el agotamiento de memoria en dispositivos de consumo. La variante más grande, MobileMoE-L-Base, utiliza 60 expertos enrutados con 4 expertos activos por token junto con un experto compartido, soportando una ventana de contexto de 8.192 tokens.

  • • MobileMoE es una familia de modelos MoE para dispositivos móviles con 0,3B, 0,5B y 0,9B de parámetros activos.
  • • Cada escala de modelo está diseñada con un peso inferior a 3 GB en precisión INT4 para caber en la DRAM móvil.
  • • El modelo MobileMoE-L-Base cuenta con 922 millones de parámetros activos y 5.300 millones de parámetros totales.
  • • La arquitectura incluye 60 expertos enrutados con 4 expertos activos por token y un experto compartido.
  • • Los modelos soportan una longitud de contexto de 8.192 tokens y fueron lanzados bajo una licencia FAIR NC.

Los desarrolladores pueden desplegar modelos MoE de pesos abiertos altamente eficientes directamente en dispositivos móviles para minimizar el uso de memoria.

SOURCES

3. Fastino lanza GLiNER2.5 para la extracción de información mediante predicción de límites

Fastino ha lanzado GLiNER2.5, un nuevo modelo de extracción de información que cambia la tradicional enumeración de spans por una arquitectura de predicción de límites. Este cambio elimina las restricciones de ancho máximo de entidad y permite funciones avanzadas como la decodificación conjunta de entidad-relación y atributos por span. Lanzado bajo la licencia Apache 2.0, el modelo está disponible en tres puntos de control ligeros (74M, 194M y 287M de parámetros) optimizados para el autoalojamiento local en CPU, CUDA o MPS.

  • • Fastino lanzó GLiNER2.5, sustituyendo la enumeración de spans por la predicción de límites para eliminar los límites de ancho de entidad.
  • • El modelo soporta un contexto de 4.096 palabras, decodificación conjunta de entidad-relación y restricciones de etiquetas entre tareas.
  • • Tres puntos de control (74M, 194M y 287M de parámetros) están disponibles en Hugging Face bajo la licencia Apache 2.0.
  • • El punto de control multilingüe alcanzó una puntuación F1 macro global de 56,17 en 16 pruebas de referencia zero-shot.
  • • El modelo está diseñado para el autoalojamiento y soporta inferencia en CPU, CUDA o MPS usando Python 3.10+.

Los desarrolladores pueden autoalojar un modelo de extracción de información altamente eficiente que soporta un contexto de 4.096 palabras y elimina las restricciones de ancho de entidad.

SOURCES

4. Lanzamiento de SHADOW-250M como modelo de lenguaje local ultraligero

SHADOW-250M ofrece una opción ultraligera para la inferencia local, empaquetando 250 millones de parámetros en una huella de 60 MB mediante cuantización sub-2-bit. Ejecutándose en un tiempo de ejecución compilado con licencia MIT, el modelo alcanza los 400 tokens por segundo en CPUs de portátiles estándar. Su arquitectura única mantiene una caché KV fp16 de 2.048 tokens mientras comprime el historial antiguo a 1 bit en el disco, permitiendo a los desarrolladores recuperar contexto de hasta 100 millones de tokens de datos históricos.

  • • SHADOW-250M es un modelo de 250 millones de parámetros entrenado desde cero con 30.000 millones de tokens de datos Fineweb.
  • • El modelo está cuantizado a menos de 2 bits, requiriendo un tamaño de despliegue de 60 MB y 80 MB de RAM.
  • • Funciona a aproximadamente 400 tokens por segundo en una CPU de portátil estándar sin GPU.
  • • La arquitectura almacena los 2.048 tokens más recientes en una caché KV fp16 y comprime los tokens antiguos a 1 bit en el disco, permitiendo la recuperación de hasta 100 millones de tokens de historial.
  • • El modelo utiliza un tiempo de ejecución compilado con licencia MIT que soporta Windows y Linux, y está disponible en GitHub y Hugging Face.

Los desarrolladores pueden desplegar un modelo de lenguaje extremadamente rápido y de baja memoria localmente en CPUs de portátiles estándar sin necesidad de aceleración por GPU.

SOURCES

5. Lanzamiento de TielCoder 35B MoE como modelo de codificación local de alto rendimiento

TielCoder es un nuevo modelo de mezcla de expertos 35B-A3B diseñado específicamente para resolver problemas de bases de código del mundo real. Construido sobre el ajuste fino Ornith-1.5, el modelo utiliza una imatrix ponderada por código para la cuantización dinámica y una plantilla de chat optimizada para maximizar la eficiencia de tokens durante la ejecución agentica. Las versiones GGUF y MLX ya están disponibles en Hugging Face, ofreciendo una alternativa local rápida y consistente a las APIs propietarias.

  • • TielCoder es un modelo de codificación de mezcla de expertos 35B-A3B construido sobre el ajuste fino Ornith-1.5.
  • • El modelo iguala al Opus 4.6 medium en problemas de codificación de la vida real en su formato cuantizado de 4 bits de 22 GB.
  • • Utiliza una imatrix ponderada por código para la cuantización dinámica y una plantilla de chat optimizada para la codificación agentica eficiente en tokens.
  • • Las versiones GGUF y MLX del modelo están disponibles en Hugging Face bajo el usuario peculiar-ragdoll.

Los desarrolladores pueden ejecutar un modelo de codificación local cuantizado a 4 bits altamente eficiente que iguala el rendimiento de Opus 4.6 medium en problemas de bases de código del mundo real.

SOURCES

6. Los sistemas de rack LPU Groq 3 de Nvidia alcanzan los 3.400 tokens por segundo

Las pruebas de referencia independientes realizadas por Artificial Analysis han revelado que los sistemas de rack LPX de Nvidia, que integran LPU Groq 3, alcanzaron los 3.400 tokens por segundo ejecutando el modelo Gemma 4 31B de Google. Esta arquitectura heterogénea divide la carga de trabajo, enrutando la fase de prellenado, que requiere mucha computación, a las GPU y la fase de decodificación, que requiere mucho ancho de banda de memoria, a las LPU Groq 3. Las LPU aprovechan 500 MB de SRAM integrada para ofrecer 150 TB/s de ancho de banda de memoria, superando a la alternativa más cercana de Cerebras en cuatro veces en la prueba de referencia.

  • • Los sistemas de rack LPX de Nvidia, equipados con LPU Groq 3, alcanzaron 3.400 tok/s ejecutando Gemma 4 31B en pruebas de referencia independientes.
  • • Se informa que el sistema probado es 4 veces más rápido que la plataforma de Cerebras, que registró 882 tok/s.
  • • Las LPU Groq 3 utilizan una arquitectura con mucha SRAM que proporciona 150 TB/s de ancho de banda de memoria.
  • • La arquitectura heterogénea de Nvidia descarga la fase de prellenado, que requiere mucha computación, a las GPU y la fase de decodificación a las LPU Groq 3.
  • • Cada LPU Groq 3 contiene 500 MB de SRAM, lo que requiere una distribución Ethernet a través de hasta 256 LPU por rack.

Los desarrolladores que ejecutan inferencia de alto rendimiento pueden aprovechar las nuevas configuraciones de hardware heterogéneo para lograr una latencia ultrabaja.

SOURCES

7. Vulnerabilidad crítica en vLLM CVE-2025-9141 permite la ejecución arbitraria de código

Investigadores de seguridad han advertido que los LLMs maliciosos pueden explotar vulnerabilidades en motores de inferencia modernos como vLLM y SGLang para obtener el control de las máquinas anfitrionas. Un ejemplo principal es CVE-2025-9141, una vulnerabilidad de ejecución de código arbitrario en el analizador de herramientas basado en XML de vLLM para Qwen3 Coder que permitía la ejecución de código a través de una llamada eval() insegura. Debido a que los analizadores de chat complejos y los decodificadores multimodales amplían la superficie de ataque, se aconseja a los desarrolladores aislar los hosts de GPU de los analizadores de tokens y restringir los permisos del host.

  • • CVE-2025-9141 fue un error de ejecución de código arbitrario en el analizador de herramientas basado en XML de vLLM para Qwen3 Coder.
  • • La vulnerabilidad permitía la ejecución de código arbitrario a través de una llamada eval() insegura.
  • • A pesar de las banderas de seguridad críticas de Gemini, el mantenedor principal de vLLM forzó la fusión de los cambios.
  • • Las arquitecturas multimodales y los analizadores de formato de chat complejos aumentan la superficie de ataque de los motores de inferencia modernos.
  • • Las mitigaciones propuestas incluyen separar los hosts de GPU de los analizadores de tokens y restringir los permisos del host de GPU.

Los desarrolladores que ejecutan instancias de vLLM o SGLang autoalojadas deben asegurar sus entornos, ya que las secuencias de tokens maliciosas pueden explotar las vulnerabilidades del analizador para obtener el control del host.

SOURCES

8. Microsoft amplía Agent Lightning con una nueva habilidad de optimización

Basándose en el marco de aprendizaje por refuerzo Agent Lightning v1.0 lanzado el 20 de agosto, Microsoft ha introducido Agent Lightning v1.0.1. Esta nueva habilidad de línea de comandos permite a los desarrolladores optimizar sistemáticamente los prompts, herramientas y flujos de trabajo para agentes de codificación, incluyendo Claude Code, Codex y GitHub Copilot. Los desarrolladores ahora pueden integrar las capacidades de optimización del ecosistema Agent Lightning directamente en sus tuberías agenticas para equilibrar la precisión, el coste y la latencia.

  • • Agent Lightning v1.0.1 es una habilidad de línea de comandos que amplía el ecosistema Agent Lightning.
  • • Automatiza la optimización de prompts, herramientas y ajustes de razonamiento para agentes de codificación.
  • • Compatible con Claude Code, Codex y GitHub Copilot.
  • • La instalación está disponible a través de la CLI de GitHub: gh skill install microsoft/agent-lightning agent-lightning --agent <agente>.
  • • Incluye informes de referencia automatizados para realizar un seguimiento de las mejoras en precisión, coste y fiabilidad.

Este lanzamiento proporciona una interfaz práctica para que los desarrolladores apliquen la lógica de optimización del marco Agent Lightning a sus agentes de codificación activos, automatizando las mejoras en los prompts y los ajustes de razonamiento.

SOURCES

9. Anthropic mejora el agente Claude Tag en Slack con contexto de conversación completo

Basándose en el lanzamiento inicial del agente Claude Tag, Anthropic ha actualizado la herramienta para evaluar el contexto completo de la conversación en lugar de mensajes individuales. Esta mejora aumenta en un 30% la capacidad del agente para intervenir de forma proactiva en las discusiones de equipo. La actualización aprovecha el Protocolo de Contexto de Modelo (MCP) para mantener un acceso seguro a los datos, asegurando que la visibilidad del agente permanezca alineada con los permisos de cada usuario.

  • • Claude Tag ahora evalúa el historial completo de conversaciones en lugar de mensajes aislados.
  • • La actualización mejora la precisión de las intervenciones no solicitadas del agente en un 30%.
  • • El agente sigue utilizando el Protocolo de Contexto de Modelo (MCP) para un acceso a datos seguro y consciente de los permisos.
  • • Actualmente no hay coste adicional por la función de contexto de canal ampliado.

Esta actualización mejora la fiabilidad de Claude Tag como miembro proactivo del equipo, permitiendo a los desarrolladores desplegar agentes más conscientes del contexto dentro de Slack.

SOURCES

10. Liquid AI y Artificial Analysis estandarizan la evaluación comparativa de inferencia móvil para modelos LFM2.5

Liquid AI y Artificial Analysis han introducido un arnés de evaluación comparativa de inferencia en dispositivos móviles impulsado por la aplicación de código abierto Pipette. Esta iniciativa proporciona métricas estandarizadas de rendimiento y memoria para la familia de modelos LFM2.5, incluido el modelo de 2,6B lanzado a principios de este mes. Las pruebas en el iPhone 17 Pro y el Galaxy S26 Ultra revelaron que Nanbeige4.2-3B y LFM2.5-2.6B lideran las clasificaciones de inteligencia con una puntuación de 63, al tiempo que destacan las limitaciones de memoria de los modelos más grandes de 9B en dispositivos estándar de 12 GB.

  • • La asociación de evaluación comparativa utiliza la aplicación gratuita y de código abierto 'Pipette' de Liquid AI en iOS y Android.
  • • Las evaluaciones se realizan en el iPhone 17 Pro y el Galaxy S26 Ultra bajo un límite de contexto de 16K.
  • • Nanbeige4.2-3B y LFM2.5-2.6B empataron en la puntuación de evaluación media más alta con 63.
  • • LFM2.5-2.6B demostró una mayor eficiencia, procesando un prompt de 1.024 tokens en 8,0 segundos utilizando 2,3 GB de memoria en un iPhone 17 Pro.
  • • El uso máximo de memoria con un contexto de 4K oscila entre 0,4 GB para LFM2.5-230M y 6,9 GB para Qwen3.5 9B, lo que limita fuertemente los dispositivos con 12 GB de RAM.

Los desarrolladores ahora pueden utilizar puntos de referencia estandarizados para evaluar la eficiencia y la huella de memoria de los modelos de Liquid AI en hardware móvil, facilitando una mejor selección de modelos para aplicaciones en el dispositivo.

SOURCES

11. OpenAI introduce un recorte de precio temporal del 20% para la API de GPT-5.6 Sol

Tras las actualizaciones de precios para el modelo GPT-5.6 Sol el 17 y 21 de agosto, OpenAI ha anunciado una reducción de precio temporal adicional de más del 20% para la API, válida al menos hasta el 21 de noviembre de 2026. La actualización también introduce una prima de precio del 10% para los puntos finales de procesamiento regional en modelos lanzados después del 5 de marzo de 2026, y confirma el cierre de la plataforma de ajuste fino de la compañía.

  • • OpenAI ofrece una reducción de precio temporal del 20% para el uso de la API de GPT-5.6 Sol hasta el 21 de noviembre de 2026.
  • • Los puntos finales de procesamiento regional para modelos lanzados después del 5 de marzo de 2026 ahora tienen una prima de precio del 10%.
  • • OpenAI está cerrando su plataforma de ajuste fino, bloqueando nuevos registros mientras mantiene los modelos existentes.
  • • La API sigue soportando niveles de servicio prioritarios y rápidos.

Los desarrolladores pueden reducir aún más sus costes de API para las cargas de trabajo de GPT-5.6 Sol durante esta ventana promocional de tres meses.

SOURCES

12. Las tarjetas de tarifas de GPU Neocloud revelan los precios de B200 y B300

Un análisis de mercado de las neoclubes de GPU especializadas ha revelado factores diferenciadores clave de precios y hardware para los desarrolladores que escalan la infraestructura de IA. Lambda lidera actualmente la asequibilidad bajo demanda para la NVIDIA B200 a 6,69 $ por hora de GPU, mientras que Nebius destaca como el único proveedor que publica tarifas bajo demanda para la B300 más reciente. Para los desarrolladores que buscan alternativas de AMD, Crusoe es el proveedor exclusivo que incluye la MI300X y la MI355X en su tarjeta de tarifas estándar.

  • • Lambda ofrece la tarifa bajo demanda de NVIDIA B200 publicada más baja a 6,69 $ por hora de GPU.
  • • Nebius es el único proveedor del grupo que publica precios bajo demanda para la NVIDIA B300.
  • • Crusoe es el único proveedor entre los cinco principales que incluye AMD MI300X y MI355X en su tarjeta de tarifas.
  • • CoreWeave completó la primera puesta en marcha y validación de la industria del sistema NVIDIA Vera Rubin NVL72 en el segundo trimestre de 2026.
  • • CoreWeave es el único proveedor calificado como Platino en la evaluación ClusterMAX 2.0 de SemiAnalysis.

Los desarrolladores pueden optimizar sus presupuestos de entrenamiento e inferencia comparando las tarifas bajo demanda y la disponibilidad de hardware entre proveedores de nube especializados.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.