1. Google integra el uso nativo de computadoras en Gemini 3.5 Flash
La integración nativa de uso de computadoras de Google para Gemini 3.5 Flash está diseñada para tareas de automatización a largo plazo y empresariales, incluyendo pruebas de software continuas y trabajo de conocimiento profesional. Para abordar las preocupaciones de seguridad, Google recomienda combinar sus salvaguardas integradas —como puertas de confirmación del usuario y terminación automatizada de tareas— con entornos de pruebas seguros (sandboxing), verificación humana y controles de acceso estrictos.
- • Google integró la capacidad nativa de uso de computadoras en el modelo Gemini 3.5 Flash, accesible a través de la API de Gemini y la plataforma Gemini Enterprise Agent.
- • La herramienta permite a los desarrolladores crear agentes que pueden ver, razonar y realizar acciones en entornos de navegador, móviles y de escritorio.
- • Google utiliza entrenamiento adversarial dirigido para mitigar los riesgos de inyección de prompts para agentes que operan en entornos en vivo.
- • Las empresas pueden utilizar dos sistemas de salvaguarda opcionales para requerir la confirmación del usuario en acciones sensibles y detener automáticamente las tareas si se identifica una inyección de prompt indirecta.
- • Un entorno de demostración para probar las capacidades de uso de computadoras está actualmente alojado por Browserbase.
Los desarrolladores ahora pueden crear agentes rentables y de baja latencia que pueden ver e interactuar con entornos de navegador, móviles y de escritorio de forma nativa a través de la API de Gemini.
2. Gradium lanza modelos de traducción de voz en tiempo real
Basados en el marco Hibiki-Zero, los nuevos modelos de Gradium utilizan aprendizaje por refuerzo para optimizar el equilibrio entre precisión y latencia, superando a gpt-realtime-translate tanto en las métricas de precisión BLEU como MetricX. El sistema admite múltiples formatos de audio de entrada, incluyendo PCM 24 kHz 16-bit signed mono, WAV, Opus, mu-law y A-law, lo que lo hace altamente versátil para aplicaciones de comunicación en tiempo real.
- • Gradium lanzó los modelos de traducción en tiempo real stt-translate (voz a texto) y s2s-translate (voz a voz).
- • Los modelos admiten cinco idiomas (inglés, francés, alemán, español y portugués) en 20 pares de idiomas.
- • La arquitectura utiliza un diseño de paso único que combina transcripción y traducción, reduciendo la cascada estándar de tres modelos a dos.
- • Gradium reporta una latencia promedio de extremo a extremo de 3.0 segundos, superando a gpt-realtime-translate (3.6s).
- • El modelo s2s-translate admite la selección de voz de salida y clonación de voz, y utiliza un WebSocket dúplex para transmitir audio.
Los desarrolladores pueden integrar traducción de voz a voz y de voz a texto de baja latencia y paso único en sus aplicaciones utilizando una API WebSocket dúplex que admite clonación de voz.
3. Alibaba lanza modelos de simulación de entorno Qwen-AgentWorld
El equipo Qwen de Alibaba ha introducido Qwen-AgentWorld, un proyecto centrado en modelos de lenguaje del mundo que actúan como simuladores de entorno desacoplados. En lugar de predecir las acciones del agente, estos modelos predicen las respuestas del entorno en siete dominios, procesando árboles de accesibilidad textual y jerarquías de interfaz de usuario para tareas basadas en GUI. El entrenamiento se completó en tres etapas (CPT, SFT y RL) utilizando más de 10 millones de trayectorias de ejecuciones reales de agentes. Los resultados empíricos muestran que el preentrenamiento del modelo del mundo mejora el rendimiento del agente en benchmarks como BFCL v4 y Claw-Eval sin requerir ajuste fino específico para el agente.
- • Alibaba lanzó Qwen-AgentWorld-35B-A3B, un modelo de mezcla de expertos (MoE) de pesos abiertos con 3B de parámetros activos bajo una licencia Apache 2.0.
- • Los modelos están diseñados para predecir estados del entorno tras las acciones del agente en lugar de actuar como agentes de chat o autónomos estándar.
- • Cubre siete dominios de interacción: MCP/llamada a herramientas, búsqueda, terminal, ingeniería de software, Android, web y GUI de sistemas operativos.
- • Se introdujo una versión más grande de 397B de parámetros (17B activos), pero sus pesos permanecen privados.
- • El lanzamiento incluye AgentWorldBench, un benchmark para evaluar modelos de lenguaje del mundo basado en interacciones del mundo real.
Permite a los desarrolladores probar y entrenar agentes de IA en entornos simulados como MCP, terminal y SO sin conexión, sin depender de APIs en vivo.
4. NVIDIA lanza el modelo MiniMax-M3 cuantizado en NVFP4
NVIDIA ha puesto a disposición una versión cuantizada en NVFP4 del modelo MiniMax-M3 en Hugging Face. Este modelo multimodal de mezcla de expertos (MoE) de 428 mil millones de parámetros admite una amplia ventana de contexto de 1 millón de tokens. Al comprimir el modelo a una precisión de 4 bits utilizando el formato NVFP4, los desarrolladores pueden lograr un ahorro de memoria de 2x al desplegarlo en GPUs NVIDIA Blackwell.
- • NVIDIA lanzó una versión cuantizada en NVFP4 del modelo MiniMax-M3 en Hugging Face.
- • MiniMax-M3 es un modelo multimodal de mezcla de expertos (MoE) de 428 mil millones de parámetros.
- • El modelo cuenta con una ventana de contexto de 1 millón de tokens.
- • La compresión a una precisión de 4 bits proporciona un ahorro de memoria de 2x específicamente en GPUs Blackwell.
Los desarrolladores que ejecutan GPUs Blackwell ahora pueden desplegar un modelo MoE multimodal de 428 mil millones de parámetros con una ventana de contexto de 1 millón de tokens a una precisión de 4 bits para un ahorro de memoria de 2x.
5. Kog lanza modelo ultrarrápido de 2B de código abierto en Hugging Face
Kog ha lanzado un modelo de 2B de parámetros de código abierto en Hugging Face. La característica principal del modelo es su velocidad de inferencia extrema, demostrando la capacidad de ejecutarse a más de 3,000 tokens por segundo, lo que lo hace altamente adecuado para aplicaciones locales de baja latencia.
- • Kog lanzó un modelo de 2B de parámetros de código abierto en la plataforma Hugging Face.
- • El modelo es capaz de ejecutarse a velocidades superiores a 3,000 tokens por segundo.
Proporciona un modelo de 2B de parámetros de código abierto capaz de realizar inferencia local de ultra alta velocidad a más de 3,000 tokens por segundo.
6. Desarrollador reescribe el analizador SQL de PostHog 70 veces más rápido usando Claude Code
Este estudio de caso destaca el poder de la ingeniería asistida por IA para sistemas complejos. Al orquestar sesiones paralelas de Claude Code, el desarrollador reemplazó con éxito un analizador basado en ANTLR con una implementación en Rust de alto rendimiento. La migración se hizo segura mediante pruebas rigurosas basadas en propiedades y un despliegue en modo sombra que verificó millones de consultas de producción contra el analizador heredado antes de cambiar el tráfico.
- • El autor reescribió el analizador SQL de PostHog en Rust usando sesiones paralelas de Claude Code con Claude Opus 4.7 en mayo de 2026.
- • El nuevo analizador de descenso recursivo escrito a mano logró un aumento de velocidad de 454x en producción y 70x en una computadora portátil local.
- • El proceso de desarrollo utilizó pruebas basadas en propiedades con la biblioteca Hypothesis y un generador de SQL personalizado.
- • El analizador basado en C++ ANTLR existente se utilizó como oráculo para garantizar una salida idéntica de AST y posición de origen.
- • La implementación final consta de 16,000 líneas de código de analizador, 5,000 líneas de herramientas y varios miles de líneas de pruebas.
- • El analizador fue validado en modo sombra contra millones de consultas de producción con cero divergencias antes del despliegue completo.
Demuestra cómo los desarrolladores pueden aprovechar sesiones paralelas de Claude Code y pruebas basadas en propiedades para reescribir sistemas heredados complejos en código Rust de alto rendimiento sin regresiones en producción.
7. Shopify detalla una pila de IA resiliente con proxy LLM y destilación
El equipo de ingeniería de Shopify, dirigido por Farhan Thawar, ha diseñado una infraestructura de IA que aísla a la empresa del tiempo de inactividad del proveedor y de los altos costos de API. Al enrutar todo el tráfico a través de un proxy LLM centralizado, gestionan el gasto de tokens con disyuntores y garantizan un tiempo de actividad continuo. Además, su plataforma Tangle automatiza la destilación de grandes modelos maestros en SLMs altamente especializados, ofreciendo reducciones masivas de costos y latencia.
- • Shopify desarrolló un proxy LLM que enruta las conexiones de los usuarios, compra tokens al por mayor y proporciona conmutación por error automática entre múltiples proveedores de IA.
- • El proxy permite a Shopify cambiar entre modelos como Claude Opus y GPT 5.5 sin interrumpir los flujos de trabajo de los desarrolladores durante el tiempo de inactividad.
- • Shopify utiliza la destilación de modelos para crear modelos de lenguaje pequeños (SLMs) especializados a partir de modelos maestros más grandes para su asistente de IA, Sidekick.
- • Los modelos destilados en Shopify han demostrado ser de 2x a 30x más baratos y rápidos que los modelos generalizados.
- • La plataforma interna de Shopify, Tangle, permite a los ingenieros visualizar la tubería de destilación, que generalmente se ejecuta durante aproximadamente un día.
Proporciona un modelo para construir una pila de IA resiliente y de múltiples proveedores con conmutación por error automática y modelos de lenguaje pequeños (SLMs) altamente optimizados y específicos para tareas.
8. La decodificación especulativa DFlash logra hasta 15x de rendimiento en Blackwell
Desarrollado por un equipo de investigación de la UC San Diego, DFlash optimiza la decodificación especulativa inyectando características ocultas objetivo en las proyecciones de Clave y Valor de cada capa de borrador, permitiendo que la longitud de aceptación escale con la profundidad del borrador. Utiliza un borrador compacto de cinco capas, que es significativamente más pequeño que los borradores de 7B utilizados en métodos anteriores de decodificación especulativa basados en difusión, lo que lo hace altamente eficiente para el despliegue en producción.
- • DFlash es un método de decodificación especulativa que utiliza un modelo de difusión de bloques ligero para redactar bloques completos de tokens en una sola pasada hacia adelante.
- • El método mantiene una salida sin pérdidas al verificar los bloques redactados en paralelo utilizando un modelo autorregresivo objetivo.
- • La ingeniería de NVIDIA reporta hasta 15x más rendimiento para modelos gpt-oss-120b en GPUs Blackwell con un objetivo de interactividad fijo.
- • El equipo de investigación reporta hasta 6.08x de aceleración sin pérdidas en modelos Qwen3-8B.
- • DFlash es compatible con marcos de servicio populares, incluyendo vLLM, SGLang y Transformers.
Permite a los desarrolladores lograr hasta 15x más rendimiento de inferencia de LLM sin pérdidas en marcos de servicio populares.
9. Preocupaciones de seguridad sobre la nueva función de ejecución de JavaScript de llama.cpp
Una función recientemente fusionada en la interfaz web de llama.cpp permite a los modelos de lenguaje ejecutar JavaScript generado directamente en el navegador a través de Web Workers. Aunque la ejecución está aislada dentro de un iframe, los desarrolladores han hecho sonar las alarmas sobre el potencial de que las solicitudes de red eludan el aislamiento y exfiltren datos confidenciales. Los usuarios aconsejan precaución y piden una mejor documentación y puertas de revisión explícitas antes de la ejecución.
- • Se fusionó una herramienta run_javascript en el repositorio principal de llama.cpp, permitiendo a los modelos ejecutar código en el navegador.
- • La herramienta ejecuta código dentro de un iframe aislado utilizando el atributo sandbox='allow-scripts'.
- • Los usuarios reportan preocupaciones de seguridad, señalando que las solicitudes de red parecen ser posibles y podrían utilizarse potencialmente para la exfiltración de datos.
- • La función no está ampliamente anunciada y actualmente puede tener una visibilidad limitada, como aparecer solo en Firefox de escritorio.
- • Los miembros de la comunidad sugieren mejoras, incluyendo una documentación más clara de las limitaciones del sandbox y una interfaz de revisión de código antes de la ejecución.
Los desarrolladores que utilizan la interfaz web de llama.cpp deben ser conscientes de los riesgos de seguridad asociados con la nueva herramienta de ejecución de JavaScript no anunciada que ejecuta código en un iframe pero que puede permitir la exfiltración de datos basada en la red.
10. Nous Research añade generación automatizada de habilidades a Hermes Agent
La nueva funcionalidad /learn en Hermes Agent está diseñada para eliminar el tedioso proceso de escribir manualmente archivos SKILL.md. Al aprovechar la divulgación progresiva, el agente evita saturar la ventana de contexto, cargando el contenido completo de la habilidad solo cuando es estrictamente necesario. La función es totalmente consistente en los entornos de CLI, TUI, puerta de enlace de mensajería y panel de control, e integra una herramienta skill_manage para puertas de revisión.
- • Nous Research actualizó su Hermes Agent de código abierto con un nuevo comando /learn para crear automáticamente habilidades reutilizables.
- • El comando /learn procesa directorios locales, URLs, conversaciones pasadas o notas pegadas para generar un archivo SKILL.md.
- • El agente utiliza herramientas como read_file, search_files y web_extract para recopilar información sin conexión.
- • Hermes Agent utiliza un patrón de divulgación progresiva, cargando un índice de ~3k tokens inicialmente para minimizar el uso de la ventana de contexto.
- • Todas las habilidades creadas son compatibles con el estándar abierto agentskills.io y admiten una puerta de aprobación de escritura opcional.
Permite a los desarrolladores generar automáticamente habilidades de agente reutilizables a partir de bases de código, URLs o conversaciones sin escribir manualmente archivos de configuración markdown.
11. Browserbase ayuda a los agentes de IA a eludir CAPTCHAs y muros de inicio de sesión
Browserbase ofrece una solución robusta para los desarrolladores que crean agentes de IA de navegación web que a menudo son bloqueados por medidas de seguridad. La plataforma maneja desafíos web complejos como CAPTCHAs y muros de inicio de sesión, asegurando que los agentes puedan navegar por páginas web cambiantes de manera confiable. El servicio ya es ampliamente adoptado, procesando decenas de millones de sesiones mensualmente.
- • Browserbase es un servicio diseñado para hacer que los agentes de IA estén listos para producción al manejar muros de inicio de sesión, CAPTCHAs y páginas web cambiantes.
- • La plataforma procesa más de 35 millones de sesiones mensualmente.
- • Actualmente cuenta con la confianza de más de 10,000 equipos.
- • Hay disponible una prueba gratuita de un mes utilizando el código promocional TLDR1MO.
Proporciona un entorno de navegador listo para producción para agentes de IA que maneja automáticamente CAPTCHAs, muros de inicio de sesión y diseños de página dinámicos.
12. IBM lanza el arnés de agentes de código abierto CUGA
CUGA de IBM está diseñado para agilizar la transición de aplicaciones de agentes desde el desarrollo hasta la producción mientras se mantiene la gobernanza y la flexibilidad. Al manejar el trabajo pesado del mantenimiento de estados, la corrección de errores y la planificación, CUGA permite a los desarrolladores centrarse en diseñar prompts y seleccionar herramientas. El marco también incluye modos de razonamiento configurables y sistemas de políticas integrados.
- • IBM lanzó CUGA, un arnés de agentes de código abierto diseñado para simplificar el desarrollo de aplicaciones de agentes.
- • El marco gestiona la planificación, la ejecución y la gestión de estados, permitiendo a los desarrolladores centrarse en la selección de herramientas y los prompts.
- • CUGA incluye capacidades integradas para el mantenimiento de estados, la corrección de errores y sistemas de políticas integrados.
- • El marco supuestamente supera a otros marcos en benchmarks como AppWorld.
- • Cuenta con modos de razonamiento configurables y admite la transición del desarrollo a la producción.
Proporciona un arnés de agentes ligero y de código abierto que maneja la planificación, la gestión de estados y la corrección de errores de forma inmediata.
13. NVIDIA lanza el kit de herramientas para agentes de IA especializados
El Agent Toolkit de NVIDIA tiene como objetivo acelerar flujos de trabajo complejos y específicos de dominio al proporcionar un tiempo de ejecución seguro y un conjunto de herramientas, habilidades y modelos abiertos. El kit de herramientas está diseñado para ayudar a las empresas a construir agentes de IA altamente especializados en los que se pueda confiar en entornos de producción, con una adopción temprana ya en marcha en industrias como la ciberseguridad y la atención médica.
- • NVIDIA lanzó el Agent Toolkit para permitir a las empresas construir agentes de IA especializados y personalizables.
- • El kit de herramientas utiliza modelos abiertos, herramientas, habilidades y un entorno de ejecución seguro.
- • Está diseñado para acelerar flujos de trabajo complejos en industrias que incluyen ciencias de la vida, atención médica, ciberseguridad y operaciones industriales.
- • Empresas como Cadence, Synopsys y CrowdStrike están aprovechando actualmente el kit de herramientas.
Proporciona un tiempo de ejecución seguro y un kit de herramientas para construir y desplegar agentes de IA especializados y específicos de dominio utilizando modelos abiertos.
14. Mindstone lanza Rebel, un SO de IA agente local primero
Rebel de Mindstone está diseñado para ayudar a las empresas a desplegar agentes de IA de forma segura. Al utilizar archivos markdown para el estado y la memoria, la plataforma garantiza que los datos permanezcan locales primero. Orquesta tareas entre modelos locales y en la nube, permitiendo a los desarrolladores optimizar por costo y sensibilidad. El despliegue temprano en el cliente Epignosis supuestamente recuperó la capacidad equivalente de ocho roles a tiempo completo durante un período de 12 semanas.
- • Mindstone lanzó Rebel, un sistema operativo de IA agente local primero para macOS y Windows.
- • Rebel se distribuye bajo una licencia Fair Source, que es gratuita para equipos de menos de 100 usuarios y requiere una licencia comercial para equipos más grandes.
- • La plataforma utiliza archivos markdown para almacenar el estado, los prompts, las instrucciones de tareas y la jerarquía de memoria.
- • Admite la orquestación de múltiples modelos, enrutando tareas entre modelos locales y basados en la nube según la sensibilidad de los datos y el costo.
- • La licencia Fair Source incluye una cláusula de extinción de dos años, después de la cual las versiones de software se convierten automáticamente a la licencia MIT.
Proporciona un sistema operativo de agentes impulsado por markdown y local primero que orquesta tareas entre modelos locales y en la nube mientras mantiene los datos seguros.
15. Tutorial detalla cómo construir el tiempo de ejecución de agentes OpenHarness desde cero
Publicado por MarkTechPost, este tutorial guía a los desarrolladores a través de la construcción de la arquitectura central, la capa de herramientas, la capa de cerebro del modelo y el bucle principal del agente de OpenHarness. La guía está diseñada para ayudar a los desarrolladores a comprender los mecanismos subyacentes de los tiempos de ejecución de agentes, ofreciendo demostraciones prácticas de ganchos de ciclo de vida, seguimiento de costos y compactación de contexto sin requerir claves de API externas.
- • El tutorial proporciona una guía para construir OpenHarness, un marco de sistema de agentes, desde cero.
- • OpenHarness incluye características como uso de herramientas, esquemas de herramientas tipados, permisos, ganchos de ciclo de vida, memoria, habilidades, compactación de contexto, lógica de reintento, seguimiento de costos y coordinación de múltiples agentes.
- • La implementación está diseñada para ser ejecutable sin requerir claves de API o infraestructura compleja.
- • El marco admite el cambio entre cerebros simulados deterministas y proveedores de LLM reales compatibles con las APIs de Anthropic u OpenAI.
- • El tutorial demuestra la gobernanza de permisos, habilidades bajo demanda, persistencia de memoria y delegación de múltiples agentes.
Proporciona un modelo arquitectónico paso a paso para construir un tiempo de ejecución de agentes de grado de producción completo con esquemas de herramientas, gobernanza de permisos y coordinación de múltiples agentes.
16. Graphify mapea bases de código Python y SQL sin conexión en grafos de conocimiento
Graphify proporciona una alternativa ligera y sin conexión al análisis de bases de código basado en LLM. Al analizar bases de código con tree-sitter, genera un archivo graph.json estructurado que los desarrolladores pueden analizar utilizando NetworkX. Esto permite a los equipos mapear aplicaciones de múltiples módulos, identificar cuellos de botella arquitectónicos y visualizar flujos de dependencia sin enviar código a APIs externas.
- • Graphify convierte bases de código Python y SQL en grafos de conocimiento utilizando análisis basado en tree-sitter.
- • El flujo de trabajo opera completamente sin conexión y no requiere una clave de API o un backend de LLM.
- • El archivo graph.json generado se puede cargar en NetworkX para calcular la centralidad, detectar comunidades y trazar rutas más cortas.
- • El proceso ayuda a identificar puntos críticos arquitectónicos, nodos maestros y flujos de dependencia.
- • Admite visualizaciones estáticas a través de Matplotlib y visualizaciones interactivas utilizando Pyvis.
Permite a los desarrolladores mapear y analizar estructuras de bases de código Python y SQL sin conexión como grafos de conocimiento sin necesidad de un LLM o claves de API.
17. NVIDIA y AWS se asocian para llevar GPUs Blackwell a instancias EC2 G7
NVIDIA y AWS han ampliado su colaboración para llevar hardware de generación Blackwell a los desarrolladores en la nube. Al integrar las nuevas GPUs NVIDIA RTX PRO 4500 Blackwell en las instancias AWS EC2 G7, la asociación tiene como objetivo ofrecer un impulso masivo de rendimiento para cargas de trabajo de inferencia de IA a escala de producción.
- • NVIDIA y AWS se asociaron para optimizar el despliegue de IA a escala utilizando nuevas GPUs NVIDIA RTX PRO 4500 Blackwell.
- • Las nuevas GPUs se están integrando en las instancias AWS EC2 G7.
- • La colaboración proporciona hasta 4.6 veces el rendimiento de inferencia de IA en comparación con configuraciones anteriores.
Los desarrolladores ahora pueden desplegar modelos de IA en instancias AWS EC2 G7 impulsadas por GPUs Blackwell para un rendimiento de inferencia hasta 4.6 veces más rápido.
18. AMD habilita el procesamiento híbrido de NPU y GPU para LLMs locales
AMD ha desbloqueado la NPU Ryzen AI para cargas de trabajo de LLM locales a través de actualizaciones en su pila de software ROCm. Al utilizar un nuevo Modo Híbrido, los desarrolladores pueden distribuir el procesamiento tanto en la NPU como en la GPU integrada, permitiendo que la NPU maneje el procesamiento de prompts en paralelo. La documentación oficial y las guías de preparación de modelos están disponibles en ryzenai.docs.amd.com.
- • La NPU AMD Ryzen AI ahora es utilizable para cargas de trabajo de LLM tras las mejoras en la pila de software ROCm.
- • El modo híbrido permite que los LLMs se ejecuten utilizando tanto la NPU como la iGPU simultáneamente, permitiendo que la NPU maneje el procesamiento de prompts en paralelo.
- • Los modelos FastFlowLM NPU están diseñados específicamente para ejecutarse en el hardware NPU.
- • Se recomienda el software Lemonade (lemonade-server.ai) para probar las capacidades del hardware Ryzen AI.
- • Convertir modelos Qwen 3.6 GGUF al formato ONNX para ejecución híbrida sigue siendo un desafío técnico.
Los desarrolladores ahora pueden aprovechar tanto la NPU como la iGPU en el hardware AMD Ryzen AI simultáneamente para acelerar el procesamiento de prompts e inferencia de LLM locales.
19. Ejecute SDXL localmente en el navegador a través de la extensión WebGPU
La extensión generate-ai-images lleva la generación de imágenes local directamente al navegador. En un MacBook M4 de 14 pulgadas, la extensión tarda aproximadamente 50-60 segundos en procesar una sola imagen. Aunque el navegador experimenta una breve congelación de unos 10 segundos durante la carga del modelo y al final de la generación debido a la compilación síncrona de sombreadores WebGPU, ofrece una forma altamente accesible de ejecutar SDXL-Lightning sin conexión.
- • La extensión de navegador generate-ai-images permite la generación de imágenes local utilizando WebGPU sin entornos virtuales o instalaciones complejas.
- • La extensión utiliza grafos ONNX para los componentes de codificadores de texto, UNet y VAE para ejecutar modelos sin conexión en la GPU del usuario.
- • Los modelos admitidos incluyen SDXL-Lighting fp16 (requiere ~7 GB de almacenamiento y 8 GB de VRAM) y una versión de 4 bits (requiere ~3.6 GB de almacenamiento y 4-5 GB de VRAM).
- • La herramienta requiere un navegador con soporte WebGPU, específicamente Chrome o Edge versión 122 o superior, o la última versión de Firefox.
- • El proyecto es de código abierto y está disponible a través de GitHub, la tienda de complementos de Firefox y Chrome Web Store.
Permite a los desarrolladores ejecutar SDXL-Lightning localmente en el navegador a través de WebGPU utilizando grafos ONNX, evitando la necesidad de entornos locales de Python complejos.