Inference Brew

Microsoft lanza MAI-Image-2.6-Flash; Meta amplía las capacidades de imagen de Muse

00:00 / --:--

← Volver al inicio

Microsoft lanza MAI-Image-2.6-Flash; Meta amplía las capacidades de imagen de Muse

1. Microsoft lanza MAI-Image-2.6-Flash; Meta amplía las capacidades de imagen de Muse

Microsoft ha actualizado su línea de generación de imágenes con el lanzamiento de MAI-Image-2.6-Flash, que ofrece mejoras de rendimiento respecto a la serie 2.5. Además, Meta ha proporcionado más detalles sobre su modelo Muse Image, destacando sus características agénticas como la integración de búsqueda y el auto-refinamiento, las cuales fueron presentadas inicialmente a finales de agosto.

  • • Microsoft lanzó MAI-Image-2.6-Flash, proporcionando un aumento de 69 puntos Elo en texto a imagen y un aumento de 34 puntos Elo en edición de imágenes sobre la versión 2.5.
  • • MAI-Image-2.6-Flash está disponible en Microsoft Foundry y optimizado para la generación de activos inmobiliarios y de juegos.
  • • Muse Image de Meta, lanzado anteriormente con conexión a búsqueda, ahora se posiciona como un modelo agéntico capaz de ejecutar código y auto-refinar resultados.
  • • Muse Image está disponible a través de la API de modelos de Meta y socios como fal, Runway y OpenRouter.

Los desarrolladores ahora tienen acceso a un modelo de Microsoft actualizado y más eficiente, además de una comprensión más clara de las capacidades de uso de herramientas agénticas dentro de Muse Image de Meta.

2. TheDrummer lanza el modelo de pesos abiertos Artemis-31B-v1.1

TheDrummer ha ampliado su cartera de modelos de pesos abiertos con el lanzamiento de Artemis-31B-v1.1. Este modelo está diseñado para proporcionar capacidades de prosa y escritura creativa de alta calidad con una estabilidad mejorada respecto al lanzamiento inicial v1, ofreciendo una opción sólida de alojamiento propio para desarrolladores que crean aplicaciones de narrativa o generación de contenido.

  • • TheDrummer lanzó Artemis-31B-v1 y Artemis-31B-v1.1 en Hugging Face.
  • • Artemis-31B-v1.1 es una versión refinada de v1 que mejora la estabilidad mientras mantiene la calidad de prosa y escritura.
  • • El creador también está desarrollando BeaverNet, una plataforma de inferencia colaborativa similar a HordeAI.
  • • El catálogo del desarrollador incluye próximos modelos basados en arquitecturas Gemma, Qwen, Muse y Mistral.

Los desarrolladores que buscan generación de texto de alta calidad pueden alojar por cuenta propia un modelo estable y refinado de 31B de parámetros optimizado para la escritura creativa y la prosa.

SOURCES

3. NVIDIA lanza la versión cuantizada NVFP4 de Qwen3.8-Flash-Next

Basándose en el lanzamiento del 26 de agosto del modelo Qwen3.8-Flash-Next de 125B de parámetros de Alibaba, NVIDIA ha publicado una versión cuantizada NVFP4 en Hugging Face. Esta optimización mejora significativamente la accesibilidad para el modelo masivo de Mezcla de Expertos (MoE) al reducir sus requisitos de memoria y almacenamiento en un 63% mientras mantiene una pérdida de precisión mínima, permitiendo una inferencia más eficiente en la nube local o privada.

  • • NVIDIA lanzó una versión cuantizada NVFP4 del modelo Qwen3.8-Flash-Next en Hugging Face.
  • • La cuantización reduce la huella de almacenamiento y memoria del modelo de 125B de parámetros en un 63%.
  • • El lanzamiento mantiene las capacidades de atención híbrida y los niveles de precisión del modelo base no cuantizado lanzado por Alibaba.
  • • Este desarrollo permite un despliegue más eficiente de la arquitectura de Mezcla de Expertos a gran escala en infraestructura local o de nube privada.

Esta cuantización hace que el modelo Qwen3.8-Flash-Next de 125B de parámetros sea significativamente más fácil de alojar por cuenta propia al reducir drásticamente la huella de VRAM requerida.

SOURCES

4. Sonos lanza la plataforma Sonos 27 con agentes personalizados y soporte para MCP

La nueva plataforma de software Sonos 27 adopta estándares modernos de IA al integrar el Protocolo de Contexto de Modelo (MCP). Esta adición permite a los desarrolladores crear integraciones que permiten a LLMs externos y asistentes de IA controlar directamente el hardware de audio de Sonos, mientras que la función de Agentes Personalizados de la plataforma permite a los usuarios ejecutar inferencias de los principales proveedores con personalidades únicas.

  • • Sonos lanzó la plataforma de software Sonos 27, introduciendo Sonos Fabric para integrar servicios y dispositivos de audio heterogéneos.
  • • La plataforma incluye Agentes Personalizados, permitiendo a los usuarios invocar motores de inferencia de IA como OpenAI, Anthropic, Gemini y Grok.
  • • Sonos 27 admite el Protocolo de Contexto de Modelo (MCP), permitiendo que asistentes de IA externos controlen los sistemas Sonos.
  • • La compañía también anunció la barra de sonido Beam Ultra y los auriculares Ace Ultra con transferencia de audio fluida.

Los desarrolladores ahora pueden usar asistentes de IA externos como ChatGPT para controlar el hardware de Sonos a través del Protocolo de Contexto de Modelo.

SOURCES

5. Funes añade una capa de memoria local y duradera para agentes de codificación

Funes aborda una limitación común en los flujos de trabajo agénticos al proporcionar una capa de memoria local y autónoma. Al indexar e incrustar historiales de sesiones localmente, permite que los agentes de codificación populares mantengan el contexto en diferentes entornos de desarrollo y máquinas sin requerir configuraciones complejas de bases de datos externas.

  • • Funes proporciona una capa de memoria duradera para que los agentes de codificación retengan y recuerden historiales de sesiones entre máquinas.
  • • El sistema admite múltiples agentes, incluidos Claude Code, Codex, pi y Hermes.
  • • Funes gestiona el almacenamiento y la recuperación de memoria contextual localmente mediante indexación e incrustación.
  • • La capa de memoria opera completamente sin dependencias externas, asegurando que los desarrolladores sean dueños de los datos de memoria de sus agentes.

Los desarrolladores pueden dotar a agentes de codificación como Claude Code y Codex de una memoria persistente y alojada por cuenta propia sin depender de bases de datos externas.

SOURCES

6. GitHub presenta Project HydraFusion, orquestación multimodelo para Copilot

Project HydraFusion de GitHub demuestra el poder de los sistemas de IA compuestos sobre los modelos de frontera únicos. Al seleccionar dinámicamente patrones de ejecución y enrutar tareas a través de modelos locales y en la nube, HydraFusion logra un rendimiento de codificación cercano a la frontera en benchmarks como DeepSWE y TerminalBench, al tiempo que reduce drásticamente los costos de inferencia, proporcionando un modelo para los desarrolladores que construyen arquitecturas de agentes rentables.

  • • GitHub introdujo Project HydraFusion, una vista previa de investigación para GitHub Copilot que utiliza orquestación en tiempo de ejecución para coordinar múltiples modelos.
  • • El sistema enruta dinámicamente las tareas entre modelos locales, en la nube y compuestos utilizando patrones de tipo Single, Cascade o Critique.
  • • En las evaluaciones de TerminalBench 2.1, HydraFusion mejoró la calidad de las tareas en 4.9 puntos porcentuales y redujo los costos en un 67% en comparación con Claude Opus 5.
  • • En el benchmark DeepSWE, logró una calidad dentro de 1.5 puntos porcentuales de Opus 5 mientras reducía los costos en un 36%.
  • • La vista previa se centra actualmente en tareas de codificación de un solo prompt y primer turno, con planes de expandirse a sesiones de múltiples turnos.

Los desarrolladores pueden igualar la calidad de los modelos de frontera en tareas de codificación mientras reducen los costos de API hasta en un 67%.

SOURCES

7. Un estudio revela que los agentes de codificación prefieren frecuentemente Grep sobre la navegación LSP

Un estudio comparativo sobre el uso de herramientas por parte de agentes de codificación destaca que la capacidad del agente depende en gran medida de las interfaces de herramientas y los formatos de salida. Si bien la navegación respaldada por LSP ofrece una precisión superior (1.00 frente a 0.76 para grep en tareas de completitud de referencia), los agentes a menudo tienen dificultades para utilizarla de manera efectiva. El estudio sugiere que los desarrolladores deben evaluar las interfaces de recuperación dentro del bucle completo del agente y enriquecer las salidas de LSP con texto fuente para minimizar las lecturas de archivos de seguimiento.

  • • Un estudio comparó la búsqueda léxica con grep frente a la navegación semántica respaldada por LSP para agentes de codificación.
  • • Los agentes prefirieron frecuentemente grep sobre la navegación semántica, incluso cuando LSP proporcionaba resultados más precisos.
  • • Forzar una ruta de navegación semántica primero redujo el éxito de la tarea del 100% al 89% en tareas simples de ubicación de código.
  • • Actualizar la salida de LSP para incluir texto fuente en lugar de solo ubicaciones de archivos mejoró el Pass@1 de la tarea de cambio de nombre de 0.67 a 0.83.
  • • La navegación respaldada por LSP mejoró las puntuaciones F1 en 0.246 en repositorios ruidosos, pero no proporcionó ninguna ganancia en repositorios limpios de TypeScript.

Los desarrolladores que crean agentes de codificación deben evaluar las interfaces de herramientas dentro del bucle completo del agente, ya que forzar una navegación semántica primero puede reducir el éxito de la tarea.

SOURCES

8. Compile by Training convierte lenguaje natural en programas neuronales locales

Compile by Training ofrece un enfoque novedoso para la ejecución local al compilar lenguaje natural directamente en pequeños programas neuronales especializados. Debido a que estos programas se ejecutan en un intérprete compacto, los desarrolladores pueden ejecutar especificaciones complejas localmente con una sobrecarga de recursos mínima, logrando una alta precisión semántica en una fracción del tiempo de la inferencia tradicional de LLM local.

  • • Compile by Training traduce especificaciones de lenguaje natural en pequeños programas neuronales.
  • • Los programas generados se ejecutan localmente en un intérprete compacto, evitando la necesidad de grandes LLMs locales durante la ejecución.
  • • El proceso de compilación tarda aproximadamente un minuto en completarse.
  • • La herramienta logra un 83.6% de precisión semántica en el benchmark FuzzyBench-Hard.

Los desarrolladores pueden generar programas neuronales ligeros y locales a partir de especificaciones de texto con alta precisión semántica y tiempos de compilación rápidos.

SOURCES

9. Microsoft presenta Project Zenith para el desarrollo de modelos locales de 30B+

Project Zenith de Microsoft está diseñado específicamente para desarrolladores que desean ejecutar modelos a gran escala localmente. Construida sobre hardware con al menos 64GB de memoria unificada y silicio AMD Ryzen AI Halo, la plataforma elimina las distracciones y notificaciones estándar de Windows mientras preconfigura herramientas y ajustes esenciales para desarrolladores para admitir la inferencia local sin límites.

  • • Microsoft introdujo Project Zenith, una experiencia de Windows optimizada para desarrolladores para dispositivos con 64GB o más de memoria unificada.
  • • Los primeros dispositivos Project Zenith cuentan con chips AMD Ryzen AI Halo y fueron anunciados en IFA.
  • • La plataforma proporciona un entorno libre de distracciones optimizado para ejecutar modelos de más de 30B de parámetros localmente y sin límites.
  • • Las herramientas preinstaladas incluyen VS Code, GitHub Copilot, PowerToys, WinAppCLI y Windows Dev Skills.
  • • Las modificaciones del SO incluyen soporte habilitado para rutas largas, extensiones de archivo visibles y la eliminación de notificaciones y consejos estándar.

Los desarrolladores pueden ejecutar modelos de más de 30B de parámetros localmente y sin límites en hardware especializado de Windows con chips AMD Ryzen AI Halo.

SOURCES

10. El formato B3S GGUF reduce el uso de VRAM de modelos ternarios en un 22%

La introducción del formato B3S GGUF proporciona un método de empaquetado sin pérdida altamente eficiente diseñado específicamente para modelos ternarios. Al empaquetar pesos en un diseño de 1.75 bits por peso, B3S reduce el uso de VRAM en aproximadamente un 22% en comparación con Q2_0. Aunque actualmente está verificado en backends de AMD ROCm y CPU, el formato es exclusivo para modelos ternarios y causará pérdida de calidad si se aplica a modelos FP16 estándar.

  • • El formato B3S GGUF fue desarrollado para modelos ternarios (por ejemplo, BitNet-b1.58, Ternary-Bonsai) para almacenar pesos restringidos a -1, 0 o +1.
  • • B3S utiliza empaquetado de base 3 con 128 pesos por bloque, lo que resulta en 1.75 bits por peso.
  • • El formato reduce el tamaño del modelo de 2.5 GB a 2.0 GB para un modelo de 9B, y de 7.6 GB a 5.9 GB para un modelo de 27B.
  • • La implementación se basa en una bifurcación de llama.cpp con soporte verificado para backends de AMD ROCm/HIP y CPU.
  • • Una herramienta de reempaquetado separada está disponible para convertir GGUFs Q2_B3 antiguos al nuevo diseño B3S.

Los desarrolladores que ejecutan modelos ternarios locales como BitNet pueden reducir significativamente su huella de VRAM sin experimentar pérdida de calidad.

SOURCES

11. Artificial Analysis actualiza el Índice de Inteligencia a v4.2 con benchmarks de agentes integrados

Basándose en el Índice de Inteligencia existente, Artificial Analysis ha lanzado la versión 4.2 para abordar la saturación de los benchmarks. Esta actualización integra el benchmark AA-Briefcase (anteriormente una evaluación independiente) en el índice central y aumenta la ponderación de los conjuntos de pruebas privadas y retenidas al 40% para evitar la manipulación de modelos. La actualización proporciona una medida más robusta del razonamiento y la eficiencia de costos de los modelos para los desarrolladores.

  • • Índice de Inteligencia actualizado a v4.2.
  • • El benchmark AA-Briefcase ahora está integrado en el índice.
  • • Los conjuntos de pruebas privadas ahora representan el 40% de la ponderación del índice.
  • • Nuevo benchmark GDP.pdf añadido para el razonamiento de documentos.
  • • Claude Fable 5.1 y GPT-6 Astra lideran las clasificaciones actualizadas.

La integración de AA-Briefcase y los conjuntos de pruebas privadas proporciona una medida más robusta y resistente a la manipulación del razonamiento y la eficiencia de costos de los modelos para los desarrolladores.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.