Inference Brew

El modelo destilado LivePortrait se ejecuta a 25 FPS en el navegador mediante WebGPU

00:00 / --:--

← Volver al inicio

El modelo destilado LivePortrait se ejecuta a 25 FPS en el navegador mediante WebGPU

1. El modelo destilado LivePortrait se ejecuta a 25 FPS en el navegador mediante WebGPU

Un desarrollador ha lanzado una versión destilada del modelo LivePortrait que se ejecuta completamente dentro del navegador utilizando WebGPU. Mientras que el modelo ONNX original requería 30 segundos por fotograma, esta versión destilada logra un rendimiento en tiempo real de 25 fotogramas por segundo (menos de 30 ms por fotograma en una Nvidia 5090). Aunque la calidad de salida actual es limitada debido a un breve entrenamiento en un conjunto de datos pequeño, demuestra la viabilidad de la animación de retratos acelerada por hardware en el lado del cliente.

  • Un desarrollador creó una versión destilada del modelo LivePortrait optimizada para Chrome mediante WebGPU.
  • La versión ONNX original de LivePortrait tardaba 30 segundos en generar un solo fotograma en el navegador.
  • El modelo destilado genera un fotograma en menos de 30 ms en una GPU Nvidia 5090, ejecutándose completamente en el navegador.
  • El modelo tiene actualmente una calidad de salida limitada debido a que fue entrenado en un conjunto de datos pequeño durante solo unas pocas horas.

Desbloquea funciones de animación de retratos y video local de alto rendimiento y baja latencia dentro de aplicaciones web sin necesidad de costosos renderizados de GPU en el servidor.

SOURCES

2. SupraLabs lanza un modelo de 800M para resumir trazas de pensamiento de agentes

SupraLabs ha lanzado un modelo de 800 millones de parámetros entrenado específicamente para analizar el razonamiento bruto y las llamadas a herramientas de agentes y convertirlos en resúmenes JSON estructurados. Esto permite a los desarrolladores mostrar actualizaciones de progreso limpias y legibles a los usuarios finales en lugar de registros brutos del modelo. Junto con el modelo, SupraLabs ha publicado un conjunto de datos de 61k entradas en Hugging Face para apoyar el desarrollo posterior en la sumarización de trazas de agentes.

  • SupraLabs lanzó el modelo SupraLabs/reasoning-summarizer-800m-pre-gguf para resumir trazas de pensamiento de agentes.
  • El modelo procesa el razonamiento bruto y las llamadas a herramientas para generar un objeto JSON estructurado que contiene un título, subtítulo, resumen y tarea actual.
  • Se lanzó un conjunto de datos de código abierto que contiene 61,000 resúmenes de razonamiento ('reasoning-summaries-61k') junto con el modelo en Hugging Face.
  • El modelo tiene actualmente un vocabulario limitado para iniciar resúmenes, con una versión especializada para codificación agéntica en desarrollo.

Permite a los desarrolladores presentar resúmenes de razonamiento limpios, estructurados y fáciles de usar en lugar de exponer trazas de pensamiento de agentes crudas y desordenadas.

SOURCES

3. SupraLabs lanza un modelo de enrutamiento de prompts de 51M de parámetros

SupraLabs ha publicado Supra-Router-51M, un modelo altamente compacto de 51 millones de parámetros diseñado para el enrutamiento dinámico de prompts. Al evaluar los prompts entrantes de los usuarios, el modelo determina si debe enrutar la solicitud a un modelo pequeño y rápido o a uno más grande y capaz. Este orquestador de baja latencia está disponible en Hugging Face junto con su conjunto de datos de entrenamiento.

  • SupraLabs lanzó Supra-Router-51M, un modelo de enrutamiento de prompts con 51 millones de parámetros.
  • El modelo está optimizado para entornos de baja latencia para enrutar dinámicamente las solicitudes de los usuarios a modelos más pequeños o más grandes.
  • Tanto los pesos del modelo como el conjunto de datos de entrenamiento se han puesto a disposición en Hugging Face Hub.

Ayuda a los desarrolladores a reducir los costos de inferencia y la latencia mediante el enrutamiento dinámico de consultas simples a modelos más pequeños y las complejas a modelos más grandes.

SOURCES

4. shadcn/ui cambia su biblioteca de componentes predeterminada de Radix a Base UI

En un cambio arquitectónico importante, shadcn/ui ha convertido a Base UI en su biblioteca de componentes subyacente predeterminada, alejándose de Radix. Aunque Radix sigue siendo totalmente compatible y accesible a través de una bandera de CLI, la transición refleja una fuerte preferencia de los desarrolladores, con nuevos proyectos eligiendo Base UI por un margen de 2 a 1. Para facilitar la transición, shadcn ha introducido una habilidad de migración compatible con asistentes de codificación de IA como Cursor y Claude Code para automatizar la refactorización componente por componente.

  • A partir de julio de 2026, Base UI es la biblioteca de componentes predeterminada para shadcn/ui, reemplazando a Radix, que era la predeterminada desde el lanzamiento.
  • Base UI se encuentra actualmente en la versión 1.6.0 y tiene más de 6 millones de descargas semanales.
  • Los nuevos proyectos creados a través de shadcn/create seleccionan Base UI sobre Radix en una proporción de 2 a 1.
  • Radix no está en desuso y continuará recibiendo soporte y nuevos lanzamientos de componentes.
  • Los desarrolladores aún pueden inicializar nuevos proyectos con Radix usando la bandera -b radix durante el proceso de inicialización de shadcn.
  • Se encuentra disponible una nueva habilidad de migración compatible con Claude Code y Cursor para ayudar a realizar la transición de componentes de Radix a Base UI.

Los desarrolladores que inicien nuevos proyectos de shadcn/ui ahora construirán sobre Base UI de forma predeterminada, aunque pueden optar por no hacerlo o utilizar herramientas de migración automatizadas para realizar la transición de los componentes existentes.

SOURCES

5. Qualcomm lanza GenieX para la ejecución local de LLM en portátiles con Windows

Qualcomm ha lanzado GenieX, un kit de desarrollo de software diseñado para ejecutar LLM localmente en portátiles con Windows. El SDK se integra con llama.cpp, lo que permite a los desarrolladores ejecutar cualquier modelo Q4_0 GGUF a través del hardware de CPU, GPU y NPU de Qualcomm. Los primeros puntos de referencia de los usuarios muestran un rendimiento prometedor, alcanzando 20 tokens por segundo en un modelo Gemma 4 26B utilizando aceleración por hardware.

  • Qualcomm lanzó GenieX para permitir la ejecución local de LLM en portátiles con Windows.
  • El SDK permite ejecutar cualquier modelo Q4_0 GGUF en hardware de Qualcomm (CPU, GPU y NPU) utilizando llama.cpp.
  • Un usuario informó haber alcanzado 20 tokens por segundo ejecutando el modelo Gemma 4 26B A4B en una GPU o NPU de Qualcomm.
  • El mismo usuario alcanzó 10 tokens por segundo ejecutando el modelo Qwen 3.6 27B MTP en una GPU de Qualcomm.

Permite a los desarrolladores crear y ejecutar aplicaciones de IA locales en portátiles con Windows basados en Snapdragon, aprovechando la aceleración por hardware.

SOURCES

6. Lanzan prompt de sistema de diseño de Claude para evitar estéticas de IA genéricas

Claude Design ha lanzado un prompt de sistema y una biblioteca de habilidades de código abierto con licencia MIT destinados a mejorar la salida de diseño de los LLM. El sistema proporciona 20 capítulos de filosofía de diseño y 14 habilidades procedimentales para ayudar a los modelos a generar interfaces limpias, accesibles y profesionales. Al prohibir explícitamente los clichés de diseño de IA comunes, como los emojis excesivos y los degradados pesados, el prompt ayuda a los desarrolladores a generar código de interfaz de usuario listo para producción.

  • Claude Design es un prompt de sistema y una biblioteca de habilidades de código abierto con licencia MIT para la colaboración en diseño de interfaz de usuario.
  • El sistema incluye 20 capítulos de filosofía de diseño y 14 habilidades procedimentales invocables para producción, extracción y revisión.
  • El prompt instruye explícitamente a los LLM a rechazar tropos de diseño de IA comunes como degradados agresivos, decoraciones con emojis y plantillas SaaS genéricas.
  • Es compatible con Claude, GPT, Gemini y modelos locales, con una variante específica disponible para Codex de OpenAI.
  • El prompt está calibrado para los modelos de frontera de Anthropic, incluidos Fable 5 y el linaje Opus 4.7/4.8.

Ayuda a los desarrolladores a alejar a los LLM de las plantillas SaaS genéricas y los degradados agresivos, asegurando un código de interfaz de usuario más limpio y accesible.

SOURCES

7. Benchmark de contexto largo identifica cuellos de botella clave para cargas de trabajo agénticas locales

Un benchmark integral de 13 LLM locales ejecutándose en llama.cpp destaca factores arquitectónicos críticos para cargas de trabajo agénticas de contexto largo. El estudio muestra que la velocidad de prellenado domina el tiempo de reloj, haciendo que las métricas estándar de generación de tokens sean secundarias. Los desarrolladores que crean agentes locales pueden aprovechar estos hallazgos, como el escalado superior de las arquitecturas de 4 cabezales KV y las penalizaciones de rendimiento de las cachés KV cuantizadas, para optimizar sus configuraciones de hardware.

  • El benchmark evaluó 13 LLM locales con longitudes de contexto de 65K-128K utilizando una GPU RX 7900 XT de 20 GB y la compilación 9860 de llama.cpp.
  • La velocidad de prellenado representa del 94% al 99% del tiempo de reloj para salidas agénticas cortas a 65K de contexto, lo que hace que la velocidad de generación de tokens sea en gran medida irrelevante.
  • Los modelos con 4 cabezales KV escalaron significativamente mejor para la velocidad de prellenado de contexto largo que aquellos con 8 cabezales KV.
  • Los modelos híbridos Mamba2 como Granite-4.0-H-Small retuvieron el 69% de su velocidad de contexto de 4K con un escalado de prellenado casi plano hasta 131K de contexto.
  • El uso de caché KV F16 puede ser entre un 20% y un 53% más rápido que la caché KV cuantizada Q8 o Q4 para modelos MoE y modelos densos pequeños debido a la sobrecarga de des-cuantización.
  • Las arquitecturas de atención latente de cabezales múltiples (MLA) como GLM-4.7-Flash mostraron un escalado de prellenado deficiente en Vulkan, perdiendo el 80% de velocidad a 16K y bloqueándose a 65K.

Permite a los desarrolladores optimizar la selección y configuración de modelos locales para tareas agénticas de contexto largo sin desperdiciar VRAM o cómputo.

SOURCES

8. Las optimizaciones de oMLX aumentan significativamente la inferencia de DeepSeek V4 en Apple Silicon

Tras informes anteriores sobre la ejecución de DeepSeek V4 en Apple Silicon mediante streaming de SSD y benchmarks de referencia, los desarrolladores han lanzado optimizaciones de oMLX que mejoran sustancialmente el rendimiento. Al implementar kernels MoE afines nativos de DeepSeek e instanciaciones de kernel Metal afines de 8 bits, los parches logran una aceleración de 1.6x en el prellenado (533 tok/s) y una aceleración de 3x en la decodificación (hasta 22 tok/s) en un Mac Studio M3 Ultra.

  • Los nuevos parches de oMLX permiten kernels MoE afines nativos de DeepSeek e instanciaciones de kernel Metal afines de 8 bits.
  • El rendimiento en Mac Studio M3 Ultra mejoró a 533 tok/s de prellenado y hasta 22 tok/s de decodificación.
  • Estas optimizaciones se basan en métodos existentes para ejecutar DeepSeek V4 en Apple Silicon, como el streaming de SSD.
  • El autor está solicitando actualmente comentarios de la comunidad sobre posibles compensaciones en la precisión.

Estas optimizaciones proporcionan una ganancia de rendimiento importante para los desarrolladores que ejecutan modelos MoE masivos localmente, yendo más allá de las capacidades básicas reportadas anteriormente.

SOURCES

9. ByteDance y Alibaba desactivan agentes de IA personalizados en China para cumplir con las nuevas reglas

ByteDance y Alibaba están desactivando las funciones de agentes de IA personalizados en sus respectivas plataformas Doubao y Qwen en China. Esta medida es una respuesta directa a las Medidas Provisionales para la Administración de Servicios de Interacción Antropomórfica de Inteligencia Artificial, que entran en vigor el 15 de julio. Las regulaciones se dirigen a los sistemas de IA que simulan personalidades humanas o fomentan interacciones emocionales sostenidas, aunque los asistentes de trabajo estándar y los bots de servicio al cliente siguen estando exentos.

  • Doubao de ByteDance y Qwen de Alibaba están desactivando las funciones de agentes de IA personalizados en respuesta a las próximas regulaciones.
  • Las Medidas Provisionales para la Administración de Servicios de Interacción Antropomórfica de Inteligencia Artificial entran en vigor el 15 de julio.
  • Las regulaciones se dirigen a los servicios de IA que simulan la personalidad humana, los patrones de pensamiento y los estilos de comunicación para una interacción emocional sostenida.
  • Las reglas tienen como objetivo mitigar riesgos como ideas extremistas, filtraciones de privacidad, daños a la salud mental y adicción a la IA.
  • Los bots de servicio al cliente, los asistentes de trabajo y las herramientas de investigación científica están excluidos de las reglas, siempre que eviten la interacción emocional sostenida.

Los desarrolladores que distribuyen agentes de IA conversacionales o emocionales en China deben adaptarse a las nuevas y estrictas reglas de cumplimiento o arriesgarse a la interrupción del servicio.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.