1. Anthropic lanza Claude Sonnet 5
Claude Sonnet 5 representa un gran avance para los flujos de trabajo agénticos, ofreciendo un rendimiento casi de primer nivel a un precio de gama media. El modelo está equipado para manejar navegadores y terminales de forma autónoma, lo que lo hace muy adecuado para tareas complejas de ingeniería de software y planificación. Aunque utiliza un tokenizador actualizado que puede aumentar el recuento de tokens entre 1,0 y 1,35 veces, su descuento de introducción y sus límites de tasa ampliados lo hacen muy accesible para una implementación inmediata.
- • Anthropic ha lanzado Claude Sonnet 5, reemplazando al modelo anterior Sonnet 4.6.
- • El modelo está diseñado para la planificación, el uso de herramientas y la operación autónoma en sesiones largas.
- • El precio de introducción es de 2 dólares por millón de tokens de entrada y 10 dólares por millón de tokens de salida hasta el 31 de agosto de 2026.
- • El precio estándar aumentará a 3 dólares por millón de tokens de entrada y 15 dólares por millón de tokens de salida después del período promocional.
- • Sonnet 5 obtuvo un 63,2% en SWE-bench Pro y un 81,2% en OSWorld-Verified.
- • El modelo cuenta con una ventana de contexto de 1 millón de tokens y utiliza un tokenizador actualizado.
- • Anthropic ha aumentado los límites de tasa en Chat, Cowork, Claude Code y la plataforma Claude.
Los desarrolladores pueden crear agentes más autónomos capaces de planificar y controlar herramientas a un costo menor que los modelos de frontera anteriores.
2. Google lanza Gemini 3.1 Flash-Lite Image y Gemini Omni Flash
Google presentó dos modelos multimodales dentro del mismo ciclo de anuncio. Gemini 3.1 Flash-Lite Image, comercializado como Nano Banana 2 Lite, apunta a generación de imágenes rápida y de bajo costo, mientras que Gemini Omni Flash lleva la generación y edición conversacional de video a flujos de trabajo para desarrolladores.
- • Gemini 3.1 Flash-Lite Image es el nombre oficial del modelo Nano Banana 2 Lite.
- • El modelo de imagen está optimizado para generación rápida y de bajo costo.
- • Gemini Omni Flash admite generación y edición conversacional de video.
- • El precio reportado de Gemini Omni Flash es de $0.10 por segundo de video generado.
- • Ambos modelos pertenecen al stack multimodal gestionado de Google, no a lanzamientos open-weight locales.
Los desarrolladores pueden evaluar esta actualización como un lanzamiento coordinado del stack multimodal de Google, no como noticias separadas de imagen y video.
3. GLM-5.2 clasificado como el mejor modelo de pesos abiertos en el Índice de Inteligencia
Basándose en su reciente lanzamiento de pesos abiertos, GLM-5.2 ha sido evaluado por el Índice de Inteligencia de Artificial Analysis, asegurando el primer puesto entre los modelos de pesos abiertos. Aunque el modelo demuestra capacidades de razonamiento que rivalizan con las alternativas de código cerrado, la evaluación destaca una verbosidad significativa, con el 95% de los tokens de salida dedicados al razonamiento, lo que los desarrolladores deben considerar para la planificación de costos de inferencia.
- • GLM-5.2 es ahora el modelo de pesos abiertos con mejor rendimiento en el Índice de Inteligencia de Artificial Analysis.
- • El modelo obtuvo una puntuación de 51, solo por detrás de modelos de código cerrado como Claude Opus 4.8 y GPT-5.5.
- • Las evaluaciones confirman una alta verbosidad, con el modelo utilizando 1,8 veces el promedio de tokens de salida.
- • Los procesos de razonamiento representan el 95% del uso total de tokens de salida del modelo.
- • El modelo superó a GPT-5.5 en el benchmark GDPval-AA v2.
Esta clasificación independiente proporciona un punto de referencia de rendimiento estandarizado para los desarrolladores que deciden si integrar el recientemente lanzado GLM-5.2 en sus flujos de trabajo agénticos locales.
4. Microsoft actualiza el modelo de agente GUI de 4B con un éxito de tareas mejorado
Tras el lanzamiento inicial del modelo Phi-Ground-Any 4B en mayo, Microsoft ha lanzado una versión actualizada de su agente GUI. Esta iteración demuestra una ganancia de rendimiento sustancial, con la tasa de éxito de tareas de Sico-Evolution aumentando del 39,8% al 82,9%, superando a modelos de frontera más grandes como GPT-5.4 y Claude Opus 4.7 en benchmarks de tareas específicos.
- • Microsoft lanzó un agente GUI actualizado de 4B de parámetros en Hugging Face.
- • El modelo mejora la tasa de éxito de tareas de Sico-Evolution al 82,9%, frente al 39,8% anterior.
- • El agente actualizado supuestamente supera a GPT-5.4 y Claude Opus 4.7 en el éxito de las tareas.
Los desarrolladores ahora pueden utilizar una versión más capaz del agente GUI de pesos abiertos y ligero de Microsoft para una automatización en pantalla más confiable.
5. Google Research presenta el modelo fundamental TabFM
TabFM representa un cambio en la forma en que los desarrolladores manejan los datos tabulares, aplicando técnicas de modelos fundamentales a las tareas tradicionales de clasificación y regresión. Al aprovechar el aprendizaje en contexto de disparo cero, TabFM elimina la necesidad de una tediosa ingeniería de características y entrenamiento de modelos, y su próxima integración en BigQuery permitirá a los desarrolladores ejecutar predicciones directamente usando SQL.
- • Google Research presentó TabFM para la clasificación y regresión de datos tabulares.
- • El modelo utiliza el aprendizaje en contexto de disparo cero para realizar predicciones.
- • TabFM fue entrenado en conjuntos de datos sintéticos generados mediante modelos causales estructurales.
- • El modelo está disponible en Hugging Face y GitHub desde el 30 de junio de 2026.
- • Google planea integrar TabFM en BigQuery a través del comando SQL AI.PREDICT.
Los desarrolladores pueden realizar predicciones tabulares sin entrenamiento manual de modelos, ajuste de hiperparámetros o ingeniería de características.
6. Huawei abre el código de OpenPangu-2.0-Flash
El lanzamiento de OpenPangu-2.0-Flash por parte de Huawei proporciona a los desarrolladores un modelo de Mezcla de Expertos (MoE) altamente eficiente. Con solo 6 mil millones de parámetros activos de un total de 92 mil millones, el modelo está diseñado para una inferencia rápida mientras admite una ventana de contexto expansiva de 512K, completa con pesos de código abierto y código de inferencia.
- • Huawei ha abierto el código del modelo OpenPangu-2.0-Flash.
- • El modelo Flash cuenta con 92B de parámetros totales y 6B de parámetros activos.
- • El modelo admite una ventana de contexto de 512K.
- • Huawei lanzó los pesos, el código de inferencia y las operaciones de entrenamiento para el modelo Flash.
- • Un modelo Pro insignia más grande con 505B de parámetros está programado para su lanzamiento en julio.
Los desarrolladores tienen acceso a un nuevo modelo de pesos abiertos optimizado para tareas de contexto largo que puede ser autoalojado.
7. NVIDIA lanza la cuantización Qwen3.6-27B-NVFP4
El lanzamiento por parte de NVIDIA del modelo Qwen 3.6 27B cuantizado en FP4 en Hugging Face facilita a los desarrolladores la implementación de modelos de lenguaje a gran escala en hardware de grado de consumo. El formato FP4 reduce significativamente los requisitos de ancho de banda de memoria y almacenamiento mientras preserva las capacidades subyacentes del modelo.
- • NVIDIA ha alojado el modelo Qwen3.6-27B-NVFP4 en Hugging Face.
- • El modelo utiliza el formato de cuantización FP4 de NVIDIA.
- • Se basa en la arquitectura Qwen 3.6 27B.
Los desarrolladores pueden ejecutar un modelo de 27B de parámetros altamente capaz localmente con requisitos de VRAM reducidos utilizando la cuantización FP4.
8. DeepSeek-V4-Flash ya está disponible en formato GGUF para implementación local
Basándose en el reciente lanzamiento de DeepSeek-V4-Flash y la posterior integración del soporte de decodificación especulativa en llama.cpp, el modelo ya está disponible en formato GGUF. Este lanzamiento simplifica la implementación local, permitiendo a los desarrolladores ejecutar el modelo optimizado directamente en hardware de CPU y GPU utilizando tiempos de ejecución compatibles con GGUF.
- • DeepSeek-V4-Flash ya está disponible en formato GGUF en Hugging Face.
- • El formato GGUF permite una implementación local más fácil en comparación con los puntos de control sin procesar.
- • El lanzamiento complementa el soporte existente de llama.cpp para la decodificación especulativa de DeepSeek-V4.
Este lanzamiento de GGUF cierra la brecha entre los puntos de control DSpark lanzados anteriormente y la ejecución local sin problemas, proporcionando un formato estandarizado para que los desarrolladores integren DeepSeek-V4-Flash en tuberías de inferencia locales.
9. Se descubre que Claude Code marca silenciosamente las solicitudes de API
Un análisis de la versión 2.1.196 de Claude Code ha revelado un mecanismo de seguimiento esteganográfico incrustado en la herramienta. Al alterar sutilmente la cadena de fecha del mensaje del sistema en función de las zonas horarias del sistema, los nombres de host y las palabras clave del proxy, la herramienta transmite señales de clasificación de vuelta a Anthropic. Este comportamiento silencioso ha generado preocupaciones de privacidad entre los desarrolladores que dependen del amplio acceso al sistema de archivos y al shell de la herramienta.
- • La versión 2.1.196 de Claude Code modifica silenciosamente las cadenas de fecha del mensaje del sistema utilizando marcadores Unicode.
- • Las modificaciones alteran caracteres como apóstrofes y guiones en función de las variables de entorno y los nombres de host de la API.
- • El binario utiliza listas codificadas en base64 y decodificadas con XOR para identificar proxies, revendedores o puertas de enlace no autorizadas.
- • La cadena de fecha modificada se envía como contexto del sistema, lo que permite a Anthropic detectar patrones de uso de API específicos.
- • El mecanismo de seguimiento se puede omitir cambiando el nombre de host o la zona horaria del sistema.
Los desarrolladores que utilizan Claude Code deben ser conscientes de los mecanismos de seguimiento ocultos que transmiten detalles del entorno y del proxy a Anthropic.
10. Cognition presenta el arnés multimodelo Devin Fusion
Devin Fusion introduce un patrón de orquestación eficiente para los desarrolladores que buscan optimizar su gasto en LLM. Al utilizar un agente principal junto con un agente secundario, el sistema enruta dinámicamente las tareas al modelo más rentable capaz de manejarlas, mitigando los costosos errores de caché.
- • Cognition presentó Devin Fusion para combinar modelos de frontera y rentables.
- • El sistema reduce los gastos en un 35% en el benchmark FrontierCode.
- • Devin Fusion utiliza una arquitectura de doble agente que cuenta con un agente principal y un asistente.
- • La arquitectura realiza un enrutamiento dinámico de modelos para optimizar el manejo de tareas y evitar errores de caché.
- • La integración con Fable 5 permite a Devin Fusion lograr una reducción del 41% en los costos.
Los desarrolladores pueden implementar el enrutamiento dinámico de modelos para reducir significativamente los gastos de API sin sacrificar el rendimiento en tareas de codificación complejas.
11. Couchbase lanza el plano de datos de IA para la memoria de agentes
El plano de datos de IA de Couchbase aborda un desafío crítico en el desarrollo de agentes: mantener un contexto consistente y de baja latencia en condiciones de red variables. Al combinar el almacenamiento en caché rápido en memoria con la búsqueda vectorial local a través de Couchbase Lite, la plataforma permite a los desarrolladores implementar agentes que conservan su memoria y acceso a herramientas incluso cuando están completamente desconectados de la nube.
- • Couchbase anunció su plano de datos de IA para la memoria persistente de agentes y la recuperación de contexto.
- • La plataforma incluye un servidor de Protocolo de Contexto de Modelo (MCP) con soporte empresarial.
- • Se ejecuta de forma idéntica en entornos de nube, locales y de borde desconectados.
- • Couchbase Lite permite SQL local, búsqueda de texto completo y búsqueda vectorial en el dispositivo.
- • La arquitectura basada en caché admite escrituras de memoria hasta 10 veces más rápidas que el disco.
Los desarrolladores pueden crear aplicaciones agénticas de baja latencia y capaces de funcionar sin conexión con memoria unificada en entornos de nube y borde.
12. X lanza un servidor MCP alojado
La adopción por parte de X del Protocolo de Contexto de Modelo (MCP) representa un paso significativo hacia la estandarización de cómo los agentes de IA interactúan con las plataformas web. Al alojar un servidor MCP, X facilita a los desarrolladores otorgar a sus agentes acceso seguro y estructurado a los datos y funciones de la plataforma.
- • X ha lanzado un servidor de Protocolo de Contexto de Modelo (MCP) alojado.
- • El servidor simplifica la integración de aplicaciones de IA con la API de X.
- • Proporciona una forma estandarizada para que las herramientas de IA interactúen con la plataforma.
Los desarrolladores pueden conectar fácilmente sus agentes de IA y aplicaciones LLM a la plataforma de X utilizando el protocolo estandarizado MCP.
13. Mistral lanza la plataforma de orquestación de flujos de trabajo
Mistral Workflows aborda la necesidad de una orquestación de agentes confiable al proporcionar una plataforma dedicada para gestionar tuberías multiagente. El enfoque del sistema en la durabilidad y la tolerancia a fallas garantiza que las tareas de procesamiento y razonamiento de documentos de larga duración puedan ejecutarse de manera confiable a escala.
- • Mistral Workflows es una plataforma de orquestación para ejecutar tuberías de IA multiagente.
- • La plataforma está diseñada para ser duradera y tolerante a fallas.
- • Proporciona herramientas para monitorear el procesamiento complejo de documentos y los flujos de trabajo de agentes.
Los desarrolladores pueden crear, monitorear y escalar flujos de trabajo multiagente complejos con tolerancia a fallas incorporada.
14. Lanzamiento de la tubería de desarrollo autónomo Lullabeast
Lullabeast proporciona un marco estructurado para el desarrollo de software agéntico, combinando la planificación impulsada por LLM con pasos de verificación estrictos que no son LLM. Al aplicar puertas deterministas para verificar manifiestos de archivos y resultados de pruebas, la tubería garantiza que el código generado por el agente se valide minuciosamente antes de pasar a la siguiente fase.
- • Lullabeast es una tubería de desarrollo autónomo de código abierto que utiliza agentes planificadores, ejecutores y revisores.
- • La tubería se ejecuta en OpenClaw y utiliza puertas deterministas que no son LLM para verificar las diferencias de git y los resultados de las pruebas.
- • Las pruebas mostraron una compilación local en RTX 4090 que tomó 3,5 horas sin costos de API, en comparación con 2 horas en LLM en la nube.
- • La herramienta se encuentra en fase beta temprana y se recomienda para aplicaciones web pequeñas y enfocadas.
- • Se recomienda ejecutar la herramienta en una máquina virtual, ya que ejecuta código escrito por agentes directamente.
Los desarrolladores pueden automatizar tareas de desarrollo de software multifase utilizando una tubería con puertas de verificación deterministas.
15. Ornith-1.0-35B añadido a la integración hf-claude
Tras el lanzamiento de la herramienta de integración hf-claude el 27 de junio y la familia de modelos Ornith-1.0 el 25 de junio, los desarrolladores ahora pueden utilizar el modelo Ornith-1.0-35B directamente dentro de Claude Code. Esta actualización amplía la lista de modelos de pesos abiertos compatibles disponibles a través de la interfaz automatizada hf-claude, lo que permite una experimentación más fácil con los perfiles de rendimiento y costo del modelo.
- • Ornith-1.0-35B ahora es compatible con la herramienta de integración hf-claude.
- • Este desarrollo permite el uso directo del modelo dentro de Claude Code sin configuración manual.
- • La integración se basa en la utilidad hf-claude lanzada anteriormente y la familia de modelos Ornith-1.0.
Los desarrolladores ahora pueden aprovechar el modelo Ornith-1.0-35B como un backend alternativo para Claude Code, simplificando el proceso de configuración para este modelo específico.
16. Open-Fusion añadido a la herramienta hf-claude para Claude Code
Basándose en el lanzamiento del 27 de junio de la utilidad hf-claude, que simplificó el soporte multimodelo para Claude Code, los desarrolladores ahora pueden integrar Open-Fusion directamente en sus flujos de trabajo. Esta actualización amplía la biblioteca de herramientas compatibles disponibles a través del paquete hf-claude, lo que permite configuraciones de codificación asistida por IA más flexibles.
- • Open-Fusion ahora es compatible con la herramienta hf-claude.
- • Esta actualización se basa en el marco de integración automatizado introducido en el lanzamiento del 27 de junio.
- • Los desarrolladores ahora pueden configurar Open-Fusion dentro de Claude Code utilizando el paquete hf-claude.
Esta integración extiende aún más la utilidad de la herramienta hf-claude, permitiendo a los desarrolladores incorporar las capacidades de Open-Fusion en sus entornos de terminal de Claude Code existentes.
17. Los buckets de Hugging Face añaden soporte para la API S3
La adición del soporte de la API S3 a los buckets de Hugging Face simplifica enormemente la gestión de datos para los desarrolladores de IA. Al proporcionar una interfaz estándar compatible con S3, Hugging Face permite a los desarrolladores reutilizar sus utilidades de almacenamiento, scripts de respaldo y tuberías de datos existentes sin reescribir el código de integración.
- • Los buckets de Hugging Face ahora admiten la API S3.
- • La integración permite la compatibilidad con cientos de herramientas de almacenamiento estándar.
- • Los desarrolladores pueden conectar herramientas cambiando solo una o dos líneas de código.
Los desarrolladores pueden conectar sus tuberías de datos y herramientas existentes a los buckets de Hugging Face con cambios mínimos en el código.
18. Lanzamiento del servidor OCR local TurboOCR v3
TurboOCR v3 ofrece una poderosa alternativa local a las API de procesamiento de documentos basadas en la nube. Construido sobre C++ y TensorRT, el servidor proporciona mejoras masivas de rendimiento junto con nuevas capacidades de análisis estructurado que convierten diseños complejos, tablas y fórmulas directamente en HTML, LaTeX o Markdown limpios.
- • TurboOCR v3 es un servidor OCR de documentos de alta velocidad autoalojado que opera completamente de forma local.
- • La actualización mejora la tubería a PP-OCRv6, duplicando el rendimiento a ~520 img/s en una RTX 5090.
- • Introduce el análisis estructurado, incluido el diseño a tablas HTML y fórmulas a LaTeX.
- • La pila de software utiliza C++, TensorRT FP16 y procesamiento de múltiples flujos.
- • Las funciones de análisis estructurado están disponibles como una opción estricta por solicitud para gestionar los costos.
Los desarrolladores pueden implementar un servidor de procesamiento de documentos autoalojado de alta velocidad con capacidades avanzadas de análisis estructurado.
19. Lanzamiento de ZLUDA 6 para la ejecución de CUDA que no es de NVIDIA
ZLUDA 6 proporciona una capa de compatibilidad crucial para los desarrolladores que buscan liberarse del bloqueo de hardware de NVIDIA. Aunque el proyecto ha hecho la transición a un esfuerzo personal de fin de semana con actualizaciones menos frecuentes, este lanzamiento ofrece una mayor estabilidad en Windows y un soporte de carga de trabajo ampliado para ejecutar aplicaciones CUDA en GPU alternativas.
- • Se ha lanzado la versión 6 de ZLUDA, que coincide con la compilación 6-preview.79.
- • La herramienta permite que las aplicaciones CUDA no modificadas se ejecuten en GPU que no son de NVIDIA.
- • Las nuevas cargas de trabajo incluyen soporte pre-alfa para PhysX y soporte de texturas para Blender.
- • El soporte para Windows se ha mejorado con un cargador más robusto.
- • El desarrollo ha pasado de ser un proyecto financiado comercialmente a un proyecto personal de fin de semana.
Los desarrolladores pueden ejecutar cargas de trabajo de IA dependientes de CUDA en AMD y otro hardware que no sea de NVIDIA sin reescribir el código.
20. EE. UU. levanta las restricciones de exportación restantes sobre Fable 5 de Anthropic
El gobierno de EE. UU. ha levantado oficialmente las restricciones de exportación sobre el modelo Fable 5 de Anthropic, completando la reversión regulatoria que comenzó con la autorización de Mythos 5 el 26 de junio. Aunque Mythos 5 fue autorizado para su uso por instituciones aprobadas la semana pasada, Fable 5 permaneció bajo un bloqueo a la espera de más negociaciones de seguridad. Con este nuevo desarrollo, Anthropic ahora tiene permiso para restaurar el acceso a ambos modelos para los usuarios generales, tras los compromisos de implementar salvaguardas más robustas contra los jailbreaks y mantener una estrecha colaboración con el gobierno en los protocolos de seguridad.
- • El gobierno de EE. UU. ha eliminado las restricciones de exportación sobre el modelo Fable 5 de Anthropic.
- • Esta acción sigue a la autorización del 26 de junio de Mythos 5, que había dejado a Fable 5 como el único modelo restringido restante.
- • Anthropic se ha comprometido a construir salvaguardas más robustas contra los jailbreaks de modelos para cumplir con los requisitos de seguridad del gobierno.
- • La eliminación de estos controles permite la restauración del acceso general tanto a Fable 5 como a Mythos 5.
Los desarrolladores y los usuarios generales ahora pueden recuperar el acceso total a Fable 5 de Anthropic, que fue el último modelo de la serie en permanecer bajo restricciones de exportación tras la suspensión global del 13 de junio.
21. Moondream HQ presenta la técnica de decodificación Photon
Photon se dirige al cuello de botella común de las "burbujas de GPU", donde el hardware de alto rendimiento permanece inactivo esperando tareas de mantenimiento de la CPU como la selección de tokens. Al canalizar el proceso de decodificación y desacoplar el paso hacia adelante del muestreo, Photon maximiza la utilización del hardware tanto para cargas de trabajo de texto libre como de decodificación restringida.
- • Moondream HQ desarrolló Photon para eliminar las burbujas de GPU en la inferencia de modelos de IA.
- • Photon utiliza decodificación en tubería con ranuras de ping-pong para alternar entre dos conjuntos de búferes.
- • El mecanismo de "avanzar ahora, muestrear después" permite que el siguiente paso hacia adelante comience antes de que se finalice el muestreo.
- • Las ganancias de rendimiento oscilan entre el 12% en una NVIDIA 3090 y el 35% en una B200 a 32 flujos.
- • La técnica maneja tanto las tareas de prellenado como de decodificación dentro de la misma tubería.
Los desarrolladores que ejecutan inferencia local pueden lograr ganancias de rendimiento de hasta un 35% optimizando la coordinación CPU-GPU.
22. Abliteración de preservación de norma aplicada a Qwen3.6-35B
La abliteración tradicional de modelos a menudo degrada el rendimiento general porque proyectar vectores de rechazo reduce las normas de peso. Al aplicar una técnica de biproyección de preservación de norma al modelo híbrido MoE Qwen3.6-35B-A3B, los desarrolladores ahora pueden acceder a un modelo completamente sin censura que conserva sus capacidades originales en tareas complejas de matemáticas y codificación.
- • Se utilizó una técnica de biproyección de preservación de norma para abliterar las direcciones de rechazo en Qwen3.6-35B-A3B.
- • La técnica ortogonaliza las filas de peso contra las direcciones de rechazo mientras las vuelve a escalar a su norma L2 original.
- • El modelo resultante logró un 0% de rechazo en un conjunto de pruebas mientras mantenía las puntuaciones de los benchmarks de matemáticas y código.
- • Se creó un conjunto de datos dañino enriquecido de 7.356 mensajes para extraer direcciones de rechazo imparciales.
- • El modelo, las cuantizaciones GGUF y el conjunto de datos se han lanzado en Hugging Face.
Los desarrolladores pueden utilizar modelos sin censura que mantienen capacidades completas de razonamiento y codificación sin degradación por modificaciones de peso.