1. Z.ai publica los pesos abiertos del modelo GLM-5.3
Z.ai ha publicado oficialmente los pesos de su modelo insignia GLM-5.3, cumpliendo con el cronograma establecido durante el lanzamiento inicial de la API del modelo el 14 de agosto. El modelo de mezcla de expertos (MoE) de 753 mil millones de parámetros cuenta con una ventana de contexto de 1 millón de tokens y una salida máxima de 128,000 tokens. Aunque los pesos ya están disponibles, Z.ai ha introducido una nueva licencia comercial que requiere que las empresas con más de 10 mil millones de dólares en ingresos anuales superen una revisión de seguridad. El modelo es compatible con entornos de ejecución como vLLM y SGLang, aunque la ejecución local requiere recursos de hardware significativos.
- • Los pesos abiertos de GLM-5.3 ya están disponibles en Hugging Face en formatos BF16 y FP8.
- • El lanzamiento cumple con el compromiso de código abierto realizado durante el lanzamiento de la API del modelo el 14 de agosto.
- • Una nueva licencia requiere que las empresas con más de 10 mil millones de dólares en ingresos anuales superen una revisión de seguridad antes de su uso comercial.
- • La ejecución local requiere hardware sustancial, con cuantizaciones de 2 bits que necesitan 245 GB de memoria y las de 8 bits que necesitan 810 GB.
- • El modelo sigue siendo compatible con vLLM, SGLang, KTransformers y Transformers.
Los desarrolladores ahora pueden alojar por cuenta propia el modelo GLM-5.3 a gran escala, que anteriormente estaba restringido al acceso por API, permitiendo el despliegue local de la arquitectura MoE con ventana de contexto de 1 millón de tokens.
2. Cohere comercializa North-Micro-Vision-Instruct como API Parse 5
Cohere ha lanzado Parse 5, un servicio de API comercial construido sobre la arquitectura North-Micro-Vision-Instruct, previamente lanzada como modelo de pesos abiertos. Parse 5 es un modelo de lenguaje visual de 2.3 mil millones de parámetros optimizado para convertir archivos PDF, diapositivas e imágenes en Markdown estructurado a un costo de 1.50 dólares por cada 1,000 páginas. Ya está disponible a través de la API de Cohere, AWS SageMaker y Microsoft Foundry, ofreciendo una alternativa lista para producción al lanzamiento anterior enfocado en la investigación.
- • Parse 5 es un servicio de API comercial construido sobre la arquitectura North-Micro-Vision-Instruct.
- • El servicio tiene un precio de 1.50 dólares por cada 1,000 páginas.
- • Admite nueve idiomas y genera Markdown estructurado o modo 'bloques' con tablas HTML y cuadros delimitadores.
- • Disponible inmediatamente a través de la API de Cohere, AWS SageMaker y Microsoft Foundry.
- • Cuenta con una ventana de contexto de 8,192 tokens y una arquitectura de 2.3 mil millones de parámetros.
Los desarrolladores ahora pueden pasar de la creación de prototipos con el modelo de pesos abiertos North-Micro-Vision-Instruct al despliegue de un servicio de análisis de documentos gestionado y de grado de producción con precios predecibles y soporte empresarial.
3. Agnes AI lanza Agnes 2.5 Pro Beta con una API de bajo costo
Agnes AI, con sede en Singapur, ha lanzado Agnes 2.5 Pro Beta, un modelo multimodal que muestra mejoras significativas en los benchmarks de agentes. Con una puntuación de 49 en el Artificial Analysis Intelligence Index, el modelo se posiciona muy cerca de Gemini 3.5 Flash y GPT-5.6 Luna. Cuenta con una ventana de contexto de 1 millón de tokens y admite hasta 65,000 tokens de salida. Agnes AI ofrece el modelo a través de una API omnimodal gratuita, con precios comerciales estructurados a una tasa extremadamente baja de 0.10 dólares por millón de tokens de entrada y 0.30 dólares por millón de tokens de salida.
- • Agnes 2.5 Pro Beta obtuvo una puntuación de 49 en el Artificial Analysis Intelligence Index, situándose justo detrás de Gemini 3.5 Flash y GPT-5.6 Luna.
- • El modelo cuenta con una ventana de contexto de 1 millón de tokens y admite un máximo de 65,000 tokens de salida.
- • El precio comercial se establece en 0.10 dólares por millón de tokens de entrada, 0.30 dólares por millón de tokens de salida y 0.01 dólares por millón de tokens de acierto de caché.
- • El modelo admite modalidades de entrada tanto de texto como de imagen y está disponible a través de una API omnimodal gratuita.
- • El modelo logra sus ganancias en capacidad de agentes consumiendo aproximadamente el doble de tokens de salida que su predecesor, con un promedio de 50,000 tokens por tarea.
Los desarrolladores pueden acceder a un modelo de agentes altamente capaz con una ventana de contexto de 1M a través de una API omnimodal gratuita o a tasas comerciales extremadamente bajas.
4. Halo Neuro publica el código abierto del modelo de clonación de voz Sopro V2 Turbo
Halo Neuro ha presentado su modelo de clonación de voz Sopro V2 y ha publicado el código abierto de Sopro V2 Turbo, una variante multilingüe altamente compacta de 120 millones de parámetros. Sopro V2 Turbo está optimizado específicamente para la ejecución local, permitiendo flujos de clonación de voz en tiempo real directamente en CPU de portátiles estándar y dentro de navegadores web. Este lanzamiento proporciona a los desarrolladores una alternativa ligera y de latencia cero a las API de síntesis de voz alojadas en la nube.
- • Sopro V2 Turbo es un modelo de clonación de voz multilingüe de 120 millones de parámetros.
- • El modelo es totalmente de código abierto y está diseñado para ejecutarse localmente en CPU de portátiles y dentro de navegadores web.
- • Halo Neuro también presentó su modelo comercial de clonación de voz Sopro V2 junto con el lanzamiento de código abierto.
Los desarrolladores pueden desplegar clonación de voz multilingüe de baja latencia directamente en los dispositivos cliente sin depender de costosas API de audio basadas en la nube.
5. El SDK de Python de OpenAI migra a HTTPX2
El SDK oficial de Python de OpenAI ha migrado su cliente HTTP subyacente de HTTPX heredado a HTTPX2. Esta transición introduce varios cambios clave, destacando el cambio de la verificación TLS del paquete CA certifi al almacén de confianza nativo del sistema operativo a través de la biblioteca truststore. Los desarrolladores que dependen de configuraciones de certificados personalizadas, transportes personalizados o ganchos de middleware personalizados deberán actualizar su código para interactuar con los nuevos objetos de solicitud y respuesta de HTTPX2.
- • El SDK de Python de OpenAI ahora instala y utiliza automáticamente HTTPX2, eliminando el paquete httpx heredado de las instalaciones predeterminadas.
- • HTTPX2 utiliza de forma predeterminada el almacén de confianza nativo del sistema operativo para la verificación TLS, reemplazando el paquete CA certifi.
- • Los desarrolladores que requieran certificados personalizados ahora deben configurar las variables de entorno SSL_CERT_FILE/DIR o pasar un ssl.SSLContext.
- • El SDK introduce los ayudantes DefaultHttpx2Client y DefaultAsyncHttpx2Client para gestionar tiempos de espera y grupos de conexiones.
- • Los controladores de autenticación, ganchos e interfaces de transporte personalizados deben actualizarse para admitir los objetos de solicitud y respuesta de HTTPX2.
Los desarrolladores que utilizan el SDK de Python de OpenAI deben prepararse para actualizaciones de dependencias y posibles cambios disruptivos en la verificación TLS personalizada o configuraciones de cliente HTTP personalizadas.
6. Pydantic asume el control de la biblioteca de cliente Python HTTPX2
Pydantic ha asumido la administración del proyecto HTTPX, lanzando HTTPX2 como una biblioteca de cliente HTTP de próxima generación para Python. HTTPX2 mantiene la compatibilidad con la API de requests mientras ofrece interfaces síncronas y asíncronas totalmente tipadas, soporte nativo para HTTP/2 y agrupación de conexiones. Crucialmente para los desarrolladores de IA que monitorean tuberías de API, HTTPX2 incluye instrumentación integrada para Pydantic Logfire, lo que permite una observabilidad compatible con OpenTelemetry lista para usar.
- • HTTPX2 es una biblioteca de cliente HTTP con todas las funciones para Python, que continúa el proyecto HTTPX original bajo la administración de Pydantic.
- • La biblioteca admite protocolos HTTP/1.1 y HTTP/2 con API síncronas y asíncronas totalmente tipadas.
- • Cuenta con instrumentación integrada para Pydantic Logfire para admitir la observabilidad basada en OpenTelemetry.
- • HTTPX2 se publica bajo una licencia BSD y mantiene una cobertura de prueba del 100%.
- • Las dependencias principales incluyen httpcore2, h11, anyio, truststore e idna.
Los desarrolladores de Python obtienen un cliente HTTP moderno y totalmente tipado con instrumentación OpenTelemetry integrada para facilitar el rastreo de llamadas a API de proveedores de LLM.
7. Meta y UIUC presentan EvoHarness-RL para agentes de largo horizonte
Investigadores de Meta AI y UIUC han presentado EvoHarness-RL, un marco diseñado para aumentar el rendimiento de los agentes de IA en tareas empresariales complejas y de largo horizonte. Al utilizar una interfaz unificada de Creencia, Progreso y Experiencia (BPE), el marco restringe las interacciones del agente a cuatro meta-acciones principales: rastrear, confirmar, recordar y anotar. En las evaluaciones, un modelo ligero Qwen3-8B entrenado con este método logró una tasa de éxito del 96.9% en el benchmark ALFWorld, superando a varios modelos de frontera más grandes. Crucialmente para los desarrolladores, EvoHarness-RL está diseñado para integrarse directamente en las pilas de orquestación existentes como una capa adicional de gestión de estado.
- • EvoHarness-RL gestiona el estado del agente utilizando una interfaz unificada de Creencia, Progreso y Experiencia (BPE).
- • El marco estructura las interacciones del agente en cuatro meta-acciones: rastrear, confirmar, recordar y anotar.
- • Un modelo Qwen3-8B entrenado con EvoHarness-RL logró una tasa de éxito del 96.9% en el benchmark ALFWorld, superando a modelos de frontera más grandes.
- • La tubería de entrenamiento combina el ajuste fino supervisado con aprendizaje por refuerzo consciente de los costos para optimizar el uso de herramientas.
- • EvoHarness-RL se puede agregar a los sistemas de orquestación existentes como una capa de gestión de estado sin reemplazar las herramientas actuales.
Los desarrolladores pueden integrar EvoHarness-RL como una capa adicional de gestión de estado en sus sistemas de orquestación de agentes existentes para aumentar las tasas de éxito de las tareas sin actualizar a costosas API de frontera.
8. Vercel publica el código abierto de vgpu para el despliegue de sombreadores WebGPU
Vercel ha publicado el código abierto de vgpu, una biblioteca de TypeScript diseñada para agilizar el despliegue de sombreadores WebGPU. Al tratar los archivos `.wgsl` como módulos importables estándar, vgpu permite la reflexión en tiempo de compilación de enlaces y diseños. La biblioteca es altamente versátil, admitiendo lienzos de navegador, entornos Node.js sin cabeza a través de Dawn de Google y simulacros deterministas para tuberías de CI. Con solo 25 KB comprimidos, el paquete también se envía con una CLI y un servidor de Protocolo de Contexto de Modelo (MCP) alojado y de solo lectura.
- • vgpu es una biblioteca de TypeScript con licencia MIT que trata los archivos de sombreador WebGPU (.wgsl) como módulos importables.
- • La biblioteca admite tres entornos de ejecución: lienzo de navegador, Node.js sin cabeza a través de Dawn y un simulacro determinista para pruebas de CI.
- • Un efecto de pantalla completa completo compilado con vgpu tiene aproximadamente 25 KB comprimidos, aplicado por presupuestos de CI.
- • El paquete está disponible en npm en la versión 0.3.1 e incluye una CLI, documentación y un servidor MCP de solo lectura alojado.
- • Cuenta con un único identificador de contexto y evita el estado global oculto para simplificar la integración.
Los desarrolladores pueden integrar fácilmente sombreadores WebGPU de alto rendimiento en aplicaciones web y agentes de IA utilizando una biblioteca tipada en tiempo de compilación de 25 KB con un servidor MCP incluido.
9. La API de búsqueda de Perplexity ocupa el primer lugar en el Artificial Analysis Index
Perplexity Search se ha agregado al Artificial Analysis Search Index, reclamando inmediatamente las primeras posiciones en las variantes de contexto bajo, medio y alto. Esto sigue al lanzamiento inicial del índice el 18 de agosto, que estableció un benchmark estandarizado para el rendimiento de la API de búsqueda en agentes de IA. La variante media de Perplexity obtuvo una puntuación de 80, superando a líderes anteriores como Parallel y Brave Search, mientras mantiene los costos de inferencia de modelo más bajos entre los proveedores probados.
- • Perplexity Search debutó en la cima del Artificial Analysis Search Index.
- • La variante media obtuvo una puntuación de 80, superando a los líderes anteriores Parallel y Brave Search.
- • Perplexity logró el costo de inferencia de modelo por tarea más bajo (0.028 a 0.034 dólares).
- • El costo total por tarea para las variantes de contexto medio y alto es de aproximadamente 0.091 dólares.
- • Las evaluaciones se realizaron utilizando el arnés de agentes de código abierto Stirrup.
Los desarrolladores ahora pueden ver cómo se compara la API de Perplexity con otros proveedores de búsqueda en el benchmark de Artificial Analysis, confirmando su recuperación de alta precisión y rentabilidad para los flujos de trabajo de agentes.
10. El comportamiento de respaldo de Llama.cpp causa tamaños de cuantización GGUF mal etiquetados
Un comportamiento de respaldo silencioso en la tubería de cuantización de llama.cpp está causando que muchos modelos GGUF sean significativamente más grandes de lo que indican sus nombres de archivo. Cuando las dimensiones del tensor no son divisibles por 256, el cuantizador sustituye automáticamente tipos de respaldo de bits más altos como IQ4_NL o Q4_0. Una auditoría de 443 archivos GGUF encontró que 64 estaban afectados, incluido Nemotron-3.5-Lightning, donde las variantes IQ2 etiquetadas medían en realidad 4.58 bits por peso. Para ayudar a los desarrolladores a identificar estas discrepancias, se ha lanzado una nueva herramienta llamada ggufaudit en GitHub para inspeccionar las composiciones de tensores GGUF sin descargar archivos completos.
- • El cuantizador de llama.cpp sustituye automáticamente respaldos de bits más altos como IQ4_NL o Q4_0 cuando las dimensiones del tensor no son divisibles por 256.
- • Una auditoría de 443 cuantizaciones GGUF en 25 repositorios encontró que 64 modelos estaban afectados por este comportamiento de respaldo silencioso.
- • Nemotron-3.5-Lightning está fuertemente afectado, con los cuatro niveles IQ2 midiendo 4.58 bits por peso (bpw) en lugar de sus tamaños de bits más bajos etiquetados.
- • Se ha lanzado una nueva herramienta de línea de comandos llamada ggufaudit en GitHub para permitir a los desarrolladores verificar la composición real de los tensores de los archivos GGUF.
- • El problema está determinado completamente por las dimensiones nativas del tensor del modelo en lugar de la tubería o la intención del cargador.
Los desarrolladores que ejecutan modelos locales pueden usar la nueva herramienta ggufaudit para detectar sustituciones de respaldo silenciosas que inflan los tamaños de los modelos y degradan el rendimiento local esperado.
11. Nuevas cuantizaciones GSQ-RCO lanzadas para Qwen3.8-27B
El ISTA Deep Algorithms and Systems Lab ha lanzado un conjunto de cuantizaciones GGUF altamente optimizadas para el modelo Qwen3.8-27B. Utilizando la cuantización Gumbel-Softmax (GSQ) y la optimización restringida de Riemann (RCO), estos modelos cierran la brecha de rendimiento que normalmente se observa en la cuantización escalar de bits bajos. La versión de 2.75 bpw (9.3 GB) supera al modelo base BF16 no cuantizado en promedios de disparo cero, mientras que la versión de 3.00 bpw lo iguala en el benchmark AIME25. Todas las versiones son totalmente compatibles con llama.cpp, Ollama y LM Studio.
- • El lanzamiento presenta Qwen3.8-27B cuantizado utilizando la cuantización Gumbel-Softmax (GSQ) y la optimización restringida de Riemann (RCO).
- • Hay tres versiones GGUF disponibles a 2.50, 2.75 y 3.00 bits por peso (bpw), con tamaños de archivo que van desde 8.4 GB a 10.1 GB.
- • La versión de 2.75 bpw logró un promedio de disparo cero de 75.70, superando la puntuación de 74.34 del modelo base BF16 no cuantizado.
- • La versión de 3.00 bpw iguala al modelo base BF16 en el benchmark AIME25 con una puntuación de 100.00.
- • Los modelos son totalmente compatibles con los entornos de ejecución locales estándar, incluidos llama.cpp, Ollama y LM Studio.
Los desarrolladores que ejecutan modelos locales pueden desplegar un modelo de 27B parámetros en hardware de consumo con prácticamente cero pérdida de rendimiento utilizando estas cuantizaciones GGUF avanzadas.