Inference Brew

SpaceXAI actualiza su modelo de frontera a Grok 4.6

00:00 / --:--

← Volver al inicio

SpaceXAI actualiza su modelo de frontera a Grok 4.6

1. SpaceXAI actualiza su modelo de frontera a Grok 4.6

SpaceXAI ha lanzado Grok 4.6, el sucesor del modelo Grok 4.5. Diseñado para agentes de larga ejecución, programación y trabajo de conocimiento, el nuevo modelo presenta salvaguardas mejoradas y entrenamiento en trayectorias SFT regeneradas. Ya está disponible a través de la plataforma Grok Build, Cursor, OpenRouter, Vercel y Cloudflare.

  • • Grok 4.6 sucede a Grok 4.5, obteniendo una puntuación de 61 en el Artificial Analysis Intelligence Index.
  • • El precio se mantiene constante respecto a la versión anterior en 2 dólares por millón de tokens de entrada y 6 dólares por millón de tokens de salida.
  • • Cuenta con una ventana de contexto de 500.000 tokens, llamada a funciones y salidas estructuradas.
  • • Disponible de inmediato a través de Grok Build, Cursor, OpenRouter, Vercel y Cloudflare.

Los desarrolladores obtienen acceso a un modelo de frontera actualizado y optimizado para agentes que iguala el rendimiento de GPT-5.6 Sol, basándose en las capacidades establecidas en el lanzamiento anterior de Grok 4.5.

2. Alibaba lanza el modelo MoE Qwen3.8-2.4T-A95B-FP8 de pesos abiertos

Alibaba ha cumplido su promesa de publicar los pesos abiertos del modelo Qwen3.8-Max, ahora disponible como Qwen3.8-2.4T-A95B-FP8. Este modelo masivo de mezcla de expertos (MoE) cuenta con 95 mil millones de parámetros activos, una ventana de contexto nativa de 262K y un modo de pensamiento obligatorio para el razonamiento. Ya está disponible para autoalojamiento a través de los principales marcos de inferencia.

  • • Qwen3.8-2.4T-A95B-FP8 cuenta con 2,4 billones de parámetros totales con 95 mil millones de parámetros activados a través de 512 expertos.
  • • El modelo admite una longitud de contexto nativa de 262.144 tokens, extensible hasta 1.010.000 tokens.
  • • Requiere un modo de pensamiento obligatorio donde el razonamiento se genera y se encierra en etiquetas antes de la salida.
  • • Los usuarios pueden ajustar la profundidad del razonamiento utilizando el parámetro reasoning_effort (xhigh, medium, low).
  • • El modelo es compatible con los marcos de inferencia Transformers, vLLM y SGLang.

Los desarrolladores ahora pueden autoalojar el modelo de frontera Qwen3.8-Max, que anteriormente estaba restringido al acceso mediante API en QwenCloud.

3. Nuevos modelos de pesos abiertos de DeepSeek, NVIDIA y Mistral se unen al ecosistema

El panorama de los modelos de pesos abiertos continúa expandiéndose rápidamente. Basándose en el reciente lanzamiento de Muse Glimmer de Meta, esta semana se suman DeepSeek-V4-Flash-0731, Nemotron-3.5-Lightning-30B-A3B y VoiceChat-11B de NVIDIA, LFM2.5-2.6B de Liquid AI y Shieldstral-1.0-3B de Mistral, proporcionando a los desarrolladores un conjunto diverso de nuevas herramientas para el despliegue local.

  • • DeepSeek-V4-Flash-0731 es un modelo MoE de 304B bajo la licencia MIT.
  • • NVIDIA lanzó Nemotron-3.5-Lightning-30B-A3B y el modelo dúplex completo VoiceChat-11B.
  • • Liquid AI lanzó LFM2.5-2.6B, que admite 131k de contexto.
  • • Mistral lanzó Shieldstral-1.0-3B, un modelo multimodal de barreras de seguridad.

Los desarrolladores ahora tienen una selección aún más amplia de modelos especializados con licencias permisivas para despliegue local, inferencia de baja latencia y flujos de trabajo agentes más allá del recientemente lanzado Muse Glimmer.

SOURCES

4. Upstage lanza el modelo de razonamiento Solar Pro 4

Upstage ha lanzado Solar Pro 4, un modelo de razonamiento insignia propietario que demuestra mejoras significativas en el rendimiento en tareas de agentes y de contexto largo. El modelo cuenta con una ventana de contexto masiva y un límite máximo de salida alto, lo que lo hace adecuado para flujos de trabajo de razonamiento complejos y de varios pasos.

  • • Upstage lanzó Solar Pro 4, obteniendo una puntuación de 42 en el Artificial Analysis Intelligence Index, frente a la puntuación de 14 de Solar Pro 3.
  • • El precio se establece en 0,30 dólares por millón de tokens de entrada y 1,20 dólares por millón de tokens de salida a través de la API propia de Upstage.
  • • El modelo cuenta con una ventana de contexto de 512K tokens y un límite máximo de salida de 128K tokens.
  • • Está disponible a través de la API propia de Upstage, OpenRouter y TimelyRouter.
  • • Solar Pro 4 redujo su tasa de alucinación al 24% y aumentó su puntuación en Terminal-Bench v2.1 a 57%.

Los desarrolladores pueden aprovechar un modelo de razonamiento de bajo costo con una ventana de contexto masiva y un rendimiento de agentes mejorado para tareas de alto volumen.

SOURCES

5. Liquid AI lanza el modelo de visión en dispositivo LFM2.5-VL-3B

Liquid AI ha lanzado LFM2.5-VL-3B, una variante multimodal de su familia de modelos híbridos LFM2.5. Combinando una base de lenguaje LFM2.5-2.6B con un codificador de visión SigLIP2 NaFlex 400M, el modelo está optimizado para el despliegue local en el dispositivo, ofreciendo una inferencia de alto rendimiento con una pequeña huella de memoria.

  • • Liquid AI lanzó LFM2.5-VL-3B, un modelo de visión-lenguaje de 3,1 mil millones de parámetros con una ventana de contexto de 32K.
  • • El modelo se ejecuta localmente, alcanzando 228 tokens/s en un Apple M5 Max y 20 tokens/s en un Galaxy S26 Ultra con 3 GB de memoria.
  • • Cuenta con un codificador de visión SigLIP2 NaFlex 400M y admite 16 idiomas.
  • • El modelo está optimizado para detección de objetos casi en tiempo real, OCR con anotación de diseño y traducción en el dispositivo.
  • • Está disponible en Hugging Face y se puede probar utilizando la aplicación móvil atomic.chat.

Los desarrolladores pueden desplegar un modelo de visión rápido y ligero localmente en hardware de consumo para detección de objetos en tiempo real, OCR y traducción.

SOURCES

6. GitHub actualiza Copilot con MAI-Code-1.1-Flash

Basándose en el lanzamiento inicial del modelo MAI-Code-1-Flash en junio de 2026, GitHub ha lanzado ahora MAI-Code-1.1-Flash. Este modelo actualizado ofrece un 25% más de eficiencia de tokens y tiene un precio de una cuarta parte del costo del modelo original, al tiempo que proporciona un rendimiento mejorado en tareas de programación.

  • • MAI-Code-1.1-Flash sucede al modelo original MAI-Code-1-Flash lanzado en junio de 2026.
  • • El nuevo modelo ofrece un 25% más de eficiencia de tokens y cuesta un 75% menos que su predecesor.
  • • Las mejoras de rendimiento incluyen una ganancia del 22% en Terminal-Bench 2.1 y una mejora del 15% en tareas de .NET.
  • • El modelo ya está disponible para su uso dentro de GitHub Copilot.

Los desarrolladores que utilizan GitHub Copilot se beneficiarán de una generación de código más rápida y de mayor calidad, así como de un mejor rendimiento de la CLI a un costo significativamente menor que la iteración anterior.

SOURCES

7. Cohere lanza el modelo North-Micro-Vision-Instruct

CohereLabs ha lanzado North-Micro-Vision-Instruct, un modelo de visión-lenguaje de pesos abiertos diseñado para tareas de investigación y desarrollo. El modelo cuenta con una base de lenguaje de 2 mil millones de parámetros y un codificador de visión de 400 millones de parámetros, lo que permite el procesamiento de imágenes de resolución nativa y entradas de múltiples imágenes.

  • • North Micro Vision Instruct es un modelo de 2,4 mil millones de parámetros que combina una base de lenguaje de 2 mil millones y un codificador de visión SigLIP 2 de 400 millones.
  • • El modelo se publica bajo la licencia Apache 2.0 y está disponible en Hugging Face.
  • • Admite procesamiento de imágenes de resolución nativa, entradas de múltiples imágenes y una ventana de contexto de lenguaje de 128K tokens.
  • • El modelo está diseñado para investigación, creación de prototipos, ajuste fino y comprensión de documentos.
  • • No admite llamadas a herramientas ni flujos de trabajo de agentes, y tiene capacidades limitadas de matemáticas y generación de código.

Los desarrolladores pueden autoalojar un modelo de visión ligero con licencia permisiva para la creación de prototipos, comprensión de documentos y control de calidad visual.

SOURCES

8. Mistral lanza puntos finales regionales y un nivel de prioridad

Mistral está avanzando en la soberanía de la IA al proporcionar a las empresas un mayor control sobre los modelos de IA y la infraestructura. La compañía ha hecho que sus puntos finales regionales estén disponibles de forma general, lo que permite a los clientes seleccionar Europa o EE. UU. para el procesamiento de inferencia, y ha introducido un nivel de prioridad que ofrece niveles de servicio comprometidos y límites de tasa personalizados.

  • • Los puntos finales regionales de Mistral están disponibles de forma general, lo que permite a los clientes seleccionar Europa o EE. UU. para el procesamiento de inferencia.
  • • El nivel de prioridad de Mistral está en vista previa pública, ofreciendo niveles de servicio comprometidos, límites de tasa personalizados y un SLA de tiempo de actividad.
  • • Mistral está expandiendo su plataforma para admitir modelos abiertos de terceros, comenzando con GLM-5.2 de Z.ai.
  • • La compañía introdujo unidades de cómputo europeas (ECU) para convertir compromisos plurianuales en acceso a infraestructura.

Los desarrolladores ahora pueden garantizar el procesamiento de inferencia en la región en Europa o EE. UU. y asegurar niveles de servicio comprometidos para cargas de trabajo de misión crítica.

SOURCES

9. Un ataque a la cadena de suministro de LiteLLM expone las credenciales de más de 2.500 organizaciones

Un importante ataque a la cadena de suministro en la herramienta de código abierto LiteLLM ha expuesto las credenciales de más de 2.500 organizaciones, incluidas Microsoft, Amazon, Cisco, Samsung y Salesforce. La brecha ocurrió porque las víctimas descargaron versiones comprometidas de LiteLLM del Python Package Index (PyPI), originadas por un ataque previo a la cadena de suministro en el escáner de vulnerabilidades Trivy.

  • • Un ataque a la cadena de suministro en LiteLLM expuso credenciales, incluidas claves en la nube, tokens de repositorio y claves de proveedores de IA, para más de 2.500 organizaciones.
  • • La brecha ocurrió porque los usuarios descargaron versiones comprometidas de LiteLLM del Python Package Index (PyPI).
  • • El compromiso se originó a partir de un ataque previo a la cadena de suministro en el escáner de vulnerabilidades Trivy, que también afectó a KICS y al SDK de Python de Telnyx.
  • • Las credenciales robadas se filtraron durante una ventana de 40 minutos en marzo, y la legitimidad de los datos ha sido confirmada por investigadores de seguridad.

Los desarrolladores que utilizan LiteLLM deben auditar inmediatamente sus entornos, rotar las claves API expuestas y asegurarse de que no están ejecutando versiones comprometidas del paquete.

SOURCES

10. Cursor cambia el nombre de 'Origin' a 'Cursor Review' para el canal de relaciones públicas automatizado

Tras el lanzamiento inicial de la forja compatible con Git 'Origin' en junio, Cursor ahora está sacando la plataforma de la versión beta cerrada bajo el nuevo nombre 'Cursor Review'. La plataforma actualizada contará con una pestaña 'Codebase' para la gestión de repositorios y una pestaña 'Review' para facilitar los flujos de trabajo automatizados de solicitudes de extracción entre humanos y agentes de IA.

  • • Cursor está cambiando el nombre de su plataforma 'Origin' a 'Cursor Review'.
  • • La plataforma está saliendo de una versión beta cerrada para socios.
  • • Las nuevas funciones incluyen una pestaña 'Codebase' para la gestión de repositorios y una pestaña 'Review' para canales de relaciones públicas automatizados.
  • • Se espera el lanzamiento público para esta misma semana.

Esta transición marca el paso de la forja Git nativa de agentes de Cursor de una versión beta cerrada a una plataforma más amplia centrada en funciones para la revisión de código colaborativa.

SOURCES

11. La decodificación especulativa acelera Muse Glimmer 30B en Apple Silicon

Un desarrollador ha implementado la decodificación especulativa para el modelo Muse Glimmer 30B de Meta en el proyecto mlx-dspark en Apple Silicon. La implementación logra aceleraciones significativas en tareas de matemáticas, código y chat, al tiempo que garantiza que la salida permanezca idéntica a nivel de bytes a la decodificación normal, preservando la calidad del modelo.

  • • La decodificación especulativa en el proyecto mlx-dspark aumentó la velocidad de Muse Glimmer 30B en un M4 Pro de 8,2 a hasta 26 tokens/segundo.
  • • Los factores de aceleración para el modelo de 8 bits fueron 3,27x para matemáticas, 2,5x para código y 2,22x para chat.
  • • La salida permanece idéntica a nivel de bytes a la decodificación normal, lo que garantiza que no haya pérdida en la calidad del modelo.
  • • La ejecución de 8 bits alcanza un pico de 40 GB de uso de memoria, mientras que la compilación de 4 bits proporciona una aceleración de 1,7x que requiere 18 GB de memoria.
  • • El proyecto es de código abierto y está disponible en GitHub.

Los desarrolladores que ejecutan modelos locales en Apple Silicon pueden reducir drásticamente la latencia sin ninguna pérdida en la calidad de salida.

SOURCES

12. Un nuevo estudio revela que las herramientas de reducción de tokens pueden aumentar los costos de LLM

Tras informes anteriores de que las herramientas de compresión de tokens como rtk y headroom ofrecen solo ahorros marginales en el mundo real debido al 'efecto denominador', un nuevo estudio de PointFive sugiere que el impacto puede ser peor de lo que se entendía anteriormente. Al evaluar 2.908 sesiones de Claude Code en 103 tareas, el estudio encontró que estas herramientas, a menudo comercializadas como medidas de ahorro de costos, pueden aumentar los costos totales de LLM hasta en un 46,4% dependiendo del modelo y la configuración de la tarea.

  • • PointFive evaluó 2.908 sesiones de Claude Code y 103 tareas para medir el impacto en el costo real de las herramientas de reducción de tokens.
  • • El estudio encontró que estas herramientas pueden aumentar los costos de LLM hasta en un 46,4%, contradiciendo las afirmaciones de marketing de hasta un 90% de ahorro.
  • • Este hallazgo amplía los puntos de referencia anteriores de junio de 2026 que identificaron ahorros mínimos del 3,7% y riesgos operativos asociados con estas herramientas.

Los desarrolladores deben ir más allá del escepticismo sobre los ahorros anunciados y comparar activamente sus estrategias de reducción de tokens, ya que estas herramientas ahora pueden identificarse como una fuente de mayor gasto en API en lugar de una solución de optimización de costos.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.