1. Meta expande el ecosistema Muse con una plataforma de agentes de IA para consumidores
Tras el lanzamiento del modelo Muse Spark 1.3 y el agente de terminal Muse Code, Meta ha lanzado la plataforma de agentes de IA personales Muse. Disponible en iOS, Android y web, la plataforma utiliza Muse Spark 1.3 para automatizar tareas personales como la gestión de correo electrónico y la reserva de viajes. Para garantizar la seguridad, a cada usuario se le asigna una máquina virtual segura (Muse Secure VM), con un agente Sentinel que supervisa la salida de red y las acciones de los conectores.
- • Meta lanzó la plataforma de agentes de IA personales Muse para iOS, Android y web.
- • La plataforma funciona con el modelo Muse Spark 1.3, lanzado anteriormente para uso de desarrolladores.
- • Cada usuario recibe una Muse Secure VM dedicada para aislar los datos del navegador y las credenciales.
- • Un agente de seguridad, Sentinel, gestiona la salida de red y las acciones de los conectores mediante tokens sustitutos.
- • La plataforma automatiza tareas personales, incluyendo correo electrónico, reserva de viajes y negociación de facturas.
Este lanzamiento lleva las capacidades de agentes de Meta a los dispositivos de consumo, yendo más allá del agente de terminal Muse Code enfocado en desarrolladores y la API de modelo sin procesar.
2. Detalles de precios de Mercury 2.5: descuento del 80% ya activo
Basándose en el lanzamiento de Mercury 2.5 anunciado el 8 de septiembre, Inception Labs ha detallado ahora la estructura de precios del modelo. El modelo está disponible a 0,04 dólares por millón de tokens de entrada y 0,15 dólares por millón de tokens de salida, lo que representa un descuento del 80% respecto a las tarifas estándar mencionadas anteriormente. Mercury 2.5 sigue ofreciendo una ventana de contexto de 260.000 tokens y velocidades de generación de 1.107 tokens por segundo.
- • Mercury 2.5 ya está disponible a 0,04 dólares por millón de tokens de entrada y 0,15 dólares por millón de tokens de salida.
- • Este precio representa un descuento del 80% sobre las tarifas estándar del modelo.
- • El modelo mantiene su ventana de contexto de 260.000 tokens y una velocidad de generación de 1.107 tokens por segundo.
Los desarrolladores ahora pueden calcular el ahorro de costes específico al integrar el nuevo modelo de contexto de 260K en sus flujos de trabajo de producción.
3. Suno lanza modelos de música con IA v6 entrenados con datos licenciados
Suno ha lanzado su suite de modelos de música con IA v6, desarrollada en colaboración con importantes socios de la industria, incluidos Warner Music Group, BMG y Believe, tras la resolución de disputas legales. El lanzamiento incluye tres modelos: el buque insignia v6, el experimental v6-wild y una versión gratuita v6-mini. Los nuevos modelos introducen capacidades avanzadas como la edición en lenguaje natural de partes específicas de una canción, el aislamiento de elementos de la pista y la capacidad de utilizar imágenes, vídeo o audio como prompts de referencia.
- • Suno lanzó su suite de modelos de música con IA v6, que consta de los modelos insignia v6, el experimental v6-wild y el gratuito v6-mini.
- • Los modelos fueron entrenados desde cero con un nuevo conjunto de datos que incluye contenido licenciado de Warner Music Group, BMG y Believe.
- • Las nuevas funciones incluyen edición en lenguaje natural de partes específicas de la canción, combinación de elementos de la biblioteca del usuario y prompts mediante texto, audio, imágenes o vídeo.
- • El acceso a los modelos insignia v6 y v6-wild requiere una suscripción Pro (8 dólares/mes) o Premier (24 dólares/mes).
- • Los modelos demuestran una mejor comprensión de los géneros, pero producen una perfección armónica y rítmica constante, siendo incapaces de producir imperfecciones naturales.
Los desarrolladores que crean aplicaciones creativas y de audio pueden aprovechar los nuevos modelos v6 de Suno para permitir la edición en lenguaje natural, la combinación de pistas y los prompts de referencia multimodales.
4. Desert Ant Labs lanza 18 modelos de inteligencia en el dispositivo
La startup europea Desert Ant Labs ha lanzado una suite de 18 modelos de inteligencia especializados en el dispositivo, diseñados para ejecutarse localmente en hardware tan antiguo como teléfonos de hace cinco años. Accesible a través de un SDK unificado para Swift, Kotlin y JavaScript, la suite incluye Voz (un modelo de transcripción 4,7 veces más rápido que Whisper), Clear (un potenciador de audio de 9 MB), Redact (una herramienta de enmascaramiento de PII en tiempo real) y Clips (un generador de clips de vídeo de 284 MB). Los modelos son gratuitos para implementar en hasta 100.000 dispositivos activos mensuales, ofreciendo una alternativa de coste cero por token a las API en la nube.
- • Desert Ant Labs lanzó 18 modelos especializados en el dispositivo (12 estables, 6 beta) diseñados para ejecutarse localmente, incluso en teléfonos antiguos.
- • Los modelos son accesibles a través de un SDK que admite Swift, Kotlin y JavaScript.
- • Los modelos clave incluyen Voz (transcripción 4,7 veces más rápida que Whisper), Clear (potenciador de audio de calidad de estudio de 9 MB) y Redact (enmascaramiento de PII en tiempo real en 27 idiomas).
- • Clips es un modelo de 284 MB que genera clips de vídeo 10 veces más rápido y con 470 veces menos energía que Claude Sonnet.
- • Los modelos son gratuitos para su uso en hasta 100.000 dispositivos activos mensuales.
Los desarrolladores pueden integrar funciones rápidas de procesamiento local de audio, vídeo y texto en aplicaciones móviles y web sin costes de API en la nube ni latencia.
5. Tencent lanza el modelo de generación y edición de voz AuK
Tencent ha lanzado AuK, un modelo unificado de generación y edición de voz que opera a través de una interfaz de lenguaje natural. AuK admite conversión de texto a voz (TTS) zero-shot, mejora de audio, separación y edición basada en instrucciones de contenido, acústica y paralingüística. Para aplicaciones sensibles a la latencia, Tencent también ha lanzado AuK-Flash, una versión destilada que funciona 4,5 veces más rápido que el modelo estándar.
- • Tencent lanzó AuK, un modelo unificado para la generación y edición de voz.
- • El modelo admite conversión de texto a voz (TTS) zero-shot, edición basada en instrucciones de contenido, acústica y paralingüística, y mejora de audio.
- • AuK utiliza una interfaz de lenguaje natural para todas las operaciones.
- • Una versión destilada llamada AuK-Flash funciona 4,5 veces más rápido que la versión estándar.
Los desarrolladores pueden crear aplicaciones de voz avanzadas que editen el habla existente, mejoren el audio y realicen TTS zero-shot utilizando una interfaz de lenguaje natural.
6. Gradium lanza la API Voice Design para la generación de voz sintética
Gradium ha lanzado Voice Design, una herramienta disponible a través de API y Studio que genera voces sintéticas completamente nuevas a partir de descripciones escritas sin necesidad de audio de referencia. Con soporte para inglés, francés, español, portugués y alemán, el sistema procesa prompts de 1 a 500 caracteres para devolver hasta 5 candidatos de voz no deterministas en 3 a 5 segundos. La herramienta está disponible en el nivel gratuito de Gradium, y los candidatos no convertidos se eliminan automáticamente después de 30 días.
- • Voice Design de Gradium genera nuevas voces sintéticas a partir de descripciones escritas de 1 a 500 caracteres sin necesidad de audio de referencia.
- • La herramienta está disponible en la API y Studio de Gradium, incluido un nivel gratuito, y admite inglés, francés, español, portugués y alemán.
- • El sistema devuelve de 1 a 5 candidatos de voz no deterministas en 3 a 5 segundos.
- • Los candidatos de voz no convertidos se eliminan después de 30 días y tienen una funcionalidad restringida.
- • Gradium logró una tasa de éxito del 72,6% en pruebas de escucha ciegas por pares frente a otros cinco sistemas de diseño de voz.
Los desarrolladores pueden generar mediante programación voces sintéticas personalizadas y no deterministas en segundos utilizando simples prompts de texto en lugar de audio de referencia.
7. Google abre el código del kit de herramientas de seguridad Mantis
Google ha abierto oficialmente el código del kit de herramientas de seguridad Mantis bajo una licencia Apache 2.0, basándose en el marco de trabajo Mantis Skills introducido en julio. El kit de herramientas proporciona comandos de barra (slash commands) modulares y reglas compatibles con marcos como Gemini CLI y Google ADK, lo que permite a los agentes gestionar el ciclo de vida completo de las vulnerabilidades, desde la detección y la reproducción en entorno aislado (sandbox) hasta la aplicación de parches y la verificación de re-ataque.
- • Google ha abierto el código del kit de herramientas de seguridad Mantis bajo una licencia Apache 2.0.
- • El lanzamiento sigue a la introducción inicial del marco de trabajo Mantis Skills en julio de 2026.
- • El kit de herramientas admite la gestión integral de vulnerabilidades, incluida la reproducción en sandbox y el re-ataque de parches.
- • Compatible con Gemini CLI, Antigravity CLI y Google ADK.
- • Cuenta con un árbol de resumen jerárquico para reducir la sobrecarga de tokens en más del 85 por ciento.
Los desarrolladores ahora pueden integrar el marco de trabajo Mantis, anunciado anteriormente, en sus tuberías de producción para automatizar las revisiones de seguridad con reproducción en sandbox y verificación de parches.
8. OtoDock 1.6.0 lanza un sistema operativo de agentes autohospedado con kernels en sandbox
OtoDock 1.6.0 se ha lanzado como un sistema operativo de empresa autohospedado diseñado para ejecutar agentes de IA persistentes en entornos seguros. La plataforma integra capacidades similares a Claude Code y admite modelos de Anthropic, OpenAI o locales. Para garantizar la seguridad, los agentes se ejecutan dentro de un sandbox de kernel utilizando bubblewrap y aislamiento de red mediante pasta, y pueden conectarse a máquinas remotas a través de WebSockets salientes para eliminar la necesidad de puertos entrantes o VPN. OtoDock está disponible en GitHub bajo una licencia Fair Source y es gratuito para hasta 5 usuarios.
- • OtoDock es un sistema operativo de empresa autohospedado para la gestión empresarial y la colaboración multiinquilino.
- • Integra capacidades similares a Claude Code, Cowork y sesiones en la nube en una sola aplicación.
- • Los agentes se ejecutan como procesos persistentes dentro de un sandbox de kernel utilizando bubblewrap y aislamiento de red mediante pasta.
- • Los agentes pueden ejecutarse en ordenadores remotos utilizando WebSockets salientes, eliminando la necesidad de puertos entrantes o VPN.
- • OtoDock tiene licencia Fair Source, es gratuito para hasta 5 usuarios y se instala mediante Docker Compose.
Los desarrolladores pueden implementar y gestionar agentes de codificación y de negocio persistentes y multiinquilino de forma local o remota sin exponer puertos entrantes.
9. Apple presenta la API de imagen de referencia para autenticar fotos
Apple ha anunciado una herramienta de autenticación de fotos basada en hardware llamada Apple Reference Image, que llegará con la línea iPhone 18 Pro. Cuando se configura en modo Referencia, un nuevo sensor de cámara firma cada píxel capturado, que el Private Cloud Compute de Apple procesa en una imagen de referencia inalterable. Para ayudar a los desarrolladores a integrar esta verificación, Apple está lanzando una API de imagen de referencia en iOS, iPadOS y macOS, lo que permite a las aplicaciones de terceros inspeccionar fotos firmadas y compararlas con versiones editadas para detectar manipulación por IA.
- • La función de imagen de referencia de Apple utiliza un nuevo sensor de cámara para firmar cada píxel capturado en modo Referencia.
- • El Private Cloud Compute de Apple procesa los datos del sensor firmados en una imagen de referencia inalterable que se puede ver en la aplicación Fotos.
- • Una API de imagen de referencia permitirá a los desarrolladores inspeccionar fotos firmadas en aplicaciones de terceros en iOS, iPadOS y macOS.
- • La función está integrada directamente en el hardware, lo que la distingue de estándares como SynthID, C2PA y Content Seal de Meta.
- • La función se lanzará con la línea iPhone 18 Pro a finales de este mes, aunque los usuarios de la UE recibirán soporte de desarrollo y visualización en iOS 27.
Los desarrolladores pueden usar la nueva API de imagen de referencia para inspeccionar mediante programación fotos firmadas e inalterables en aplicaciones de iOS, iPadOS y macOS para detectar ediciones de IA.
10. El nuevo motor de servicio Megakernel acelera North Mini Code
Tras el lanzamiento en junio del modelo North Mini Code, se ha desarrollado un nuevo motor de servicio para optimizar su implementación. Al aprovechar un megakernel de decodificación, el motor logra un rendimiento 1,58 veces más rápido que vLLM en todos los tamaños de lote. Admite procesamiento por lotes continuo, atención paginada y longitudes de contexto de hasta 256K, al tiempo que proporciona un endpoint compatible con OpenAI con soporte para llamadas a herramientas.
- • El nuevo motor está específicamente optimizado para North Mini Code, el modelo MoE de 30B lanzado en junio.
- • El rendimiento es 1,58 veces más rápido que vLLM en varios tamaños de lote.
- • Logra 292 tokens por segundo con un tamaño de lote de 1.
- • Admite procesamiento por lotes continuo, atención paginada y longitudes de contexto de 256K.
- • Incluye un endpoint compatible con OpenAI con soporte para llamadas a herramientas.
Los desarrolladores ahora pueden implementar el modelo North Mini Code con una latencia significativamente reducida y un rendimiento mejorado en comparación con las implementaciones estándar de vLLM.
11. Artificial Analysis lanza páginas de lanzamiento de modelos para niveles de esfuerzo
Artificial Analysis ha lanzado páginas de lanzamiento de modelos diseñadas para ayudar a los desarrolladores a navegar por los complejos perfiles de rendimiento y coste de los modelos de frontera. Con modelos como GPT-6 Astra y Claude Fable 5.1 que ahora ofrecen hasta seis niveles de esfuerzo distintos, estas páginas proporcionan comparaciones lado a lado del coste por tarea, velocidad de salida, latencia y puntuaciones del Índice de Capacidad específicas del dominio. Esta herramienta permite a los desarrolladores tomar decisiones basadas en datos al configurar los niveles de esfuerzo para sus cargas de trabajo de aplicaciones específicas.
- • Artificial Analysis lanzó páginas de lanzamiento de modelos para comparar la inteligencia, el coste y la velocidad en diferentes niveles de esfuerzo del modelo.
- • Los modelos de frontera ahora cuentan con hasta seis niveles de esfuerzo diferentes, que alteran significativamente los perfiles de rendimiento y coste.
- • Las páginas proporcionan comparaciones lado a lado de los niveles de esfuerzo, incluido el coste por tarea, la velocidad de salida y la latencia.
- • Se proporcionan puntuaciones del Índice de Capacidad para dominios que incluyen Ingeniería, Finanzas, Legal y Salud.
- • GPT-6 Astra oscila entre 46 y 53 en el Índice de Inteligencia, mientras que Claude Fable 5.1 oscila entre 47 y 53.
Los desarrolladores pueden evaluar y optimizar las compensaciones entre coste, latencia y precisión para modelos como GPT-6 Astra y Claude Fable 5.1.
12. Ejecute DeepSeek-V4-Flash-Vision-Exp localmente en GPU de consumo
Un nuevo proyecto de código abierto permite ejecutar el modelo MoE DeepSeek-V4-Flash-Vision-Exp de 285B localmente en hardware de consumo utilizando de 10 a 12 GPU RTX 3090. Utilizando expertos FP4 y atención FP8, la configuración logra velocidades de decodificación de más de 120 tokens por segundo en 12 GPU con decodificación especulativa. El proyecto proporciona una imagen de Docker preconstruida junto con parches de tiempo de ejecución que resuelven problemas de memoria y programación, admitiendo una ventana de contexto de hasta 1M de tokens completamente en la memoria de la GPU.
- • DeepSeek-V4-Flash-Vision-Exp es un modelo MoE de 285B que utiliza expertos FP4 y atención FP8 con 157 GB de pesos.
- • El modelo puede ejecutarse en hardware de consumo utilizando de 10 a 12 GPU RTX 3090 con una compilación de vLLM compatible con SM86.
- • El rendimiento alcanza más de 60 tokens por segundo en 10 GPU y más de 120 tokens por segundo en 12 GPU utilizando decodificación especulativa.
- • El sistema admite una ventana de contexto de 1M de tokens sin descarga y hasta 4M de tokens con descarga a RAM.
- • El proyecto proporciona una imagen de Docker preconstruida, guías de compilación, scripts de inicio y parches de tiempo de ejecución en GitHub.
Los desarrolladores pueden autohospedar un modelo MoE masivo de 285B con capacidad de visión en 10 a 12 GPU de consumo, logrando hasta 120 tokens por segundo de decodificación.
13. Qwen3.8-Flash-Next lanzado en MLX-serve con contexto de 1M
El co-creador del soporte del motor Qwen3.8-Flash-Next en MLX-serve ha anunciado su lanzamiento, aportando capacidades de contexto de 1 millón de tokens a Apple Silicon. Probado en un sistema M5 Max de 128 GB, el motor utiliza una caché KV de 8 bits, cuantización de capa densa de 8 bits y cuantización de capa experta de 4 bits para mantener una alta calidad de salida. Ejecutar el contexto completo de 1 millón requiere establecer el límite cableado de la GPU en 120.000 MB, ofreciendo velocidades de generación de hasta 75 tokens por segundo para la codificación.
- • El soporte del motor Qwen3.8-Flash-Next en MLX-serve admite una longitud de contexto de hasta 1 millón de tokens.
- • El motor utiliza una caché KV de 8 bits y requiere aproximadamente 117 GB de memoria máxima en un sistema M5 Max de 128 GB.
- • El modelo utiliza cuantización de 8 bits para capas densas y cuantización de 4 bits para capas expertas para preservar la calidad.
- • Las velocidades de generación alcanzan los 40 tokens por segundo para prosa y 75 tokens por segundo para codificación con un contexto de 1 millón.
- • El código fuente y los pesos del modelo están disponibles en GitHub y Hugging Face, incluido un plugin MLX Serve Monitor.
Los desarrolladores pueden ejecutar inferencia local con una ventana de contexto de 1 millón de tokens en Mac con Apple Silicon, logrando hasta 75 tokens por segundo para tareas de codificación.
14. Mentria.ai permite la inferencia de modelos de 27B de 1 bit en el navegador
Mentria.ai ha introducido un motor de inferencia basado en navegador construido sobre WebGPU y WGSL que ejecuta modelos grandes completamente en el lado del cliente. Al optimizar el kernel de matriz por vector de 1 bit para eliminar conflictos de banco de memoria temporal, el motor puede ejecutar el modelo Bonsai-27B de 1 bit de Prism ML a 25 a 30 tokens por segundo en una GPU de portátil RTX 3060. La plataforma no requiere instalación ni procesamiento del lado del servidor, y admite adaptadores LoRA intercambiables en caliente, una torre de visión y modelos Qwen3.5 más pequeños.
- • Mentria.ai es un motor de inferencia basado en navegador construido con WebGPU y WGSL.
- • El motor ejecuta el modelo Bonsai-27B de 1 bit (que requiere 3,8 GB de memoria GPU) a 25 a 30 tokens por segundo en un portátil RTX 3060.
- • Las ganancias de rendimiento se lograron optimizando el kernel de matriz por vector de 1 bit para resolver conflictos de banco en la memoria temporal.
- • El motor opera completamente dentro del navegador sin requerir instalaciones ni procesamiento del lado del servidor.
- • La plataforma admite adaptadores LoRA intercambiables en caliente, una torre de visión para entrada de imágenes y modelos Qwen3.5 más pequeños.
Los desarrolladores pueden implementar modelos grandes y altamente cuantizados directamente en los navegadores de los clientes sin costes ni instalaciones del lado del servidor.
15. Implementada la cuantización INT4 de Cosmos3 (64B) para CUDA y MLX
Una implementación de código abierto del modelo Cosmos3 de 64 mil millones de parámetros aporta capacidades INT4 de texto a imagen y de imagen a vídeo al hardware local. Compatible con los tiempos de ejecución CUDA y Apple Silicon MLX, el proyecto aloja pesos cuantizados en Hugging Face y código en GitHub. En un Mac M4 Max de 128 GB, generar un solo clip de vídeo lleva aproximadamente 5 minutos.
- • El modelo Cosmos3 de 64B se ha implementado para tareas INT4 de texto a imagen y de imagen a vídeo.
- • El código está disponible en GitHub y los pesos del modelo están alojados en Hugging Face.
- • Generar un solo clip de vídeo lleva aproximadamente 5 minutos en un Mac M4 Max de 128 GB.
- • La implementación admite tiempos de ejecución CUDA y Apple Silicon MLX.
Los desarrolladores pueden ejecutar tareas locales de generación de imágenes y vídeos de alta fidelidad en hardware Apple Silicon y Nvidia utilizando pesos INT4 optimizados.
16. El modelo de audio Foundation-1 permite teclados con timbre bloqueado
Un investigador independiente ha lanzado Foundation-1, un modelo de audio personalizado diseñado para generar one-shots infinitos y convertir prompts de texto en sintetizadores reproducibles. Al separar el control de timbre del instrumento, el modelo logra teclados con timbre bloqueado que permanecen consistentes en múltiples llamadas de difusión. Los pesos del modelo están alojados en Hugging Face, y la tubería de inferencia completa y las herramientas han sido de código abierto en GitHub bajo el repositorio RC-stable-audio-tools.
- • Foundation-1 es un modelo de IA personalizado que controla el timbre como un elemento separado del instrumento.
- • El modelo logra teclados con timbre bloqueado que permanecen consistentes en múltiples llamadas de difusión.
- • El modelo está disponible en Hugging Face y la tubería de inferencia es de código abierto en GitHub bajo RC-stable-audio-tools.
- • El sistema puede generar one-shots infinitos para la producción musical y convertir prompts de texto en sintetizadores totalmente reproducibles.
Los desarrolladores que crean herramientas de producción musical pueden aprovechar los modelos de pesos abiertos para generar sintetizadores consistentes y reproducibles a partir de prompts de texto.