1. SpaceXAI actualiza su modelo de frontera a Grok 4.7
SpaceXAI ha lanzado Grok 4.7, el sucesor del modelo Grok 4.6. La nueva versión ofrece mejoras significativas en los benchmarks de trabajo de conocimiento agente y tareas de codificación, manteniendo al mismo tiempo la ventana de contexto de 500k. Aunque los precios de entrada y salida se mantienen en $2/$6 por millón de tokens, el modo 'xhigh' del modelo consume hasta un 125% más de tokens de salida que su predecesor, lo que aumenta el costo total de la API para tareas complejas.
- • Grok 4.7 sucede a Grok 4.6, alcanzando una puntuación de 46 en el Artificial Analysis Intelligence Index.
- • El rendimiento de agentes mejoró en 111 puntos en el benchmark AA-Briefcase en comparación con Grok 4.6.
- • Mantiene una ventana de contexto de 500k tokens con un precio base de $2/$6 por millón de tokens.
- • El modo xhigh consume un 125% más de tokens de salida que Grok 4.6, aumentando los costos para tareas complejas.
Los desarrolladores obtienen acceso a un modelo de razonamiento y codificación más capaz, aunque deben tener en cuenta el aumento de costos en el modo 'xhigh' en comparación con la versión anterior de Grok 4.6.
2. Xiaomi lanza MiMo-V2.6-Pro, sucesor de V2.5-Pro
Basándose en la serie MiMo-V2.5-Pro lanzada anteriormente en junio de 2026, Xiaomi ha lanzado MiMo-V2.6-Pro. Este nuevo modelo de mezcla de expertos de 1.02 billones de parámetros cuenta con 42 mil millones de parámetros activos y ha logrado una puntuación de 46 en el Artificial Analysis Intelligence Index, lo que supone un aumento significativo de rendimiento respecto a la puntuación de 26 del V2.5-Pro. El modelo tiene un precio de $0.435 por millón de tokens de entrada y $0.87 por millón de tokens de salida, manteniendo una economía competitiva para los desarrolladores.
- • MiMo-V2.6-Pro es un modelo MoE de 1.02 billones de parámetros con 42 mil millones de parámetros activos.
- • El modelo obtiene una puntuación de 46 en el Artificial Analysis Intelligence Index, superando la puntuación de 26 del V2.5-Pro.
- • El precio se establece en $0.435 por millón de tokens de entrada y $0.87 por millón de tokens de salida.
- • El modelo incluye un descuento del 99% por acierto de caché, lo que mejora la eficiencia de costos para los desarrolladores.
Los desarrolladores ahora tienen acceso a un sucesor más capaz del MiMo-V2.5-Pro, que ofrece una mayor inteligencia a precios competitivos.
3. Meta lanza Segment Anything Model (SAM) 3.1 en Model API
Meta ha lanzado oficialmente Segment Anything Model (SAM) 3.1 en la Meta Model API. Esta actualización permite a los desarrolladores realizar detección, segmentación y seguimiento de objetos mediante prompts de texto tanto en imágenes estáticas como en secuencias de video. Para garantizar una baja latencia y alta fiabilidad, Meta ofrece SAM 3.1 en una infraestructura de inferencia personalizada. La API tiene un precio de $2.50 por cada 1,000 imágenes y $0.20 por cada 1,000 fotogramas de video.
- • Meta lanzó SAM 3.1 en la Meta Model API, soportando detección, segmentación y seguimiento de objetos mediante prompts de texto.
- • El modelo se sirve en una infraestructura de inferencia dedicada optimizada para su arquitectura específica.
- • El precio se establece en $2.50 por cada 1,000 imágenes o $0.20 por cada 1,000 fotogramas de video.
Los desarrolladores pueden integrar fácilmente capacidades avanzadas de visión artificial en sus aplicaciones a través de una API gestionada sin necesidad de alojar modelos de visión complejos.
4. Cloudflare anuncia la disponibilidad general de Python Workers
Cloudflare ha anunciado la disponibilidad general de Python Workers, brindando soporte de primera clase para Python a su plataforma de desarrollo serverless. Este lanzamiento permite a los desarrolladores escribir y desplegar código Python nativo que interactúa directamente con servicios de Cloudflare como Workers AI, R2 y Durable Objects sin necesidad de envoltorios (wrappers) de JavaScript. Python Workers admite frameworks web populares como FastAPI y Flask, así como bibliotecas de IA fundamentales como OpenAI, LangChain y MCP. Además, un nuevo puente de sockets permite conexiones fluidas a bases de datos relacionales a través de Hyperdrive.
- • Python es ahora un lenguaje de primera clase totalmente compatible en la plataforma de desarrollo de Cloudflare.
- • Python Workers se integra de forma nativa con servicios de Cloudflare, incluidos Workers AI, R2, D1 y Durable Objects.
- • Los desarrolladores pueden ejecutar frameworks ASGI/WSGI como FastAPI, Django y Flask utilizando conectores integrados.
- • Las bibliotecas de IA populares, incluidas openai, langchain y mcp, son compatibles de forma nativa.
- • Un nuevo puente de sockets permite conexiones directas a bases de datos PostgreSQL y MySQL a través de Hyperdrive.
Los desarrolladores ahora pueden desplegar aplicaciones de IA basadas en Python, backends de FastAPI y servidores MCP directamente en Cloudflare sin escribir código de unión en JavaScript.
5. Foremerge: Una capa de coordinación local para agentes de codificación paralelos
Foremerge ha sido lanzado como una capa de coordinación local de código abierto diseñada para gestionar agentes de codificación paralelos que trabajan en la misma base de código. Construido como un binario de Rust, Foremerge proporciona una CLI y un servidor MCP con 18 herramientas que se integran perfectamente con Claude Code, Codex y Cursor. Al utilizar una base de datos SQLite compartida dentro del directorio común de git, la herramienta rastrea las operaciones y alcances de los agentes para detectar de forma determinista los conflictos de intención antes de que ocurran, todo ello sin modificar el historial de git ni depender de costosos jueces basados en LLM.
- • Foremerge es una capa de coordinación local que rastrea las operaciones y alcances previstos entre agentes de codificación paralelos.
- • La herramienta está implementada como un binario de Rust con una CLI y un servidor MCP que contiene 18 herramientas.
- • Opera por encima de git y worktrees, utilizando un archivo SQLite compartido en el directorio común de git para evitar modificar el historial de git.
- • La detección de conflictos es totalmente determinista y se basa en operaciones declaradas en lugar de jueces LLM.
- • El sistema es compatible con Claude Code, Codex y Cursor, y ha sido probado con hasta 98 agentes paralelos.
Los desarrolladores que ejecutan múltiples agentes de codificación paralelos pueden evitar cambios de código conflictivos sin depender de costosos jueces LLM.
6. AX: Un orquestador declarativo de alto rendimiento para agentes autónomos
AX se ha presentado como un orquestador de código abierto de alto rendimiento diseñado para gestionar y escalar miles de millones de cargas de trabajo de agentes autónomos dentro de un clúster. Operando sobre Agent Substrate, AX aporta una experiencia declarativa similar a Kubernetes para el despliegue de agentes. Los desarrolladores definen tareas utilizando especificaciones de espacio de trabajo y puerta de enlace (gateway), y AX maneja automáticamente el sandboxing, el cableado y el aislamiento de red necesarios para ejecutar esos agentes de forma segura a escala.
- • AX es un orquestador declarativo de alto rendimiento construido para ejecutar cargas de trabajo de agentes autónomos a gran escala.
- • El sistema opera sobre Agent Substrate y proporciona una experiencia de usuario similar a Kubernetes.
- • AX realiza el sandboxing, cableado y aislamiento de red de las tareas de los agentes basándose en especificaciones de espacio de trabajo y puerta de enlace definidas por el usuario.
Los desarrolladores pueden desplegar, aislar y escalar cargas de trabajo de agentes masivas utilizando especificaciones familiares de espacio de trabajo y puerta de enlace declarativas.
7. El equipo Qwen de Alibaba lanza el sandbox de agentes RecreationWorld
El equipo Qwen de Alibaba ha lanzado RecreationWorld, un entorno sandbox especializado alojado en Hugging Face. Diseñado para agentes híbridos de uso informático, RecreationWorld proporciona un entorno de cinco plataformas donde los agentes autónomos pueden interactuar con aplicaciones reales, ejecutar flujos de trabajo complejos y verificar visualmente sus propias compilaciones. Este lanzamiento ofrece a los desarrolladores un entorno estandarizado y seguro para evaluar y refinar los comportamientos de los agentes basados en GUI.
- • RecreationWorld es un sandbox de cinco plataformas diseñado específicamente para agentes híbridos de uso informático.
- • La plataforma permite a los agentes explorar aplicaciones reales, ejecutar tareas y verificar visualmente sus compilaciones.
- • El sandbox ha sido lanzado por el equipo Qwen de Alibaba y está alojado en Hugging Face.
Los desarrolladores pueden probar de forma segura y verificar visualmente agentes de uso informático en múltiples plataformas dentro de un sandbox estandarizado.
8. El framework Halo acelera el post-entrenamiento de modelos de código abierto
Se ha introducido un nuevo framework de post-entrenamiento llamado Halo, con el objetivo de optimizar el ajuste fino (fine-tuning) y la alineación de modelos de código abierto. Halo ofrece hasta 2.8 veces el rendimiento de la biblioteca TRL estándar de Hugging Face, reduciendo simultáneamente el consumo máximo de memoria. Fundamentalmente para los desarrolladores, los modelos entrenados utilizando el framework Halo siguen siendo totalmente compatibles con sus formatos nativos de Hugging Face, lo que permite un despliegue fluido en los pipelines existentes.
- • Halo es un nuevo framework diseñado para el post-entrenamiento de modelos de código abierto.
- • El framework ofrece hasta 2.8 veces el rendimiento del TRL (Transformer Reinforcement Learning) estándar.
- • Halo requiere menos memoria máxima que el TRL estándar durante las ejecuciones de entrenamiento.
- • Los modelos procesados con Halo permanecen en su formato nativo de Hugging Face.
Los desarrolladores que realizan ajustes finos en modelos locales pueden acelerar significativamente sus pipelines de post-entrenamiento y reducir los costos de hardware.
9. ZCode abre su código, apila y parchea vulnerabilidades de seguridad tras el incidente de carga de datos
En respuesta a los recientes hallazgos de seguridad relacionados con cargas de espacio de trabajo no autorizadas, ZCode ha hecho la transición a un modelo de código abierto, lanzando su aplicación de escritorio, espacio de trabajo web, backend, CLI de agente y tiempo de ejecución en GitHub. La actualización v3.14.0 adjunta aborda las vulnerabilidades reportadas eliminando la función Repo Wiki y deshabilitando las cargas automáticas de instantáneas de repositorios locales. Además, auditorías de terceros realizadas por CAICT y NSFOCUS han verificado que los buckets de almacenamiento en la nube de ZCode han sido eliminados y se encuentran en un estado de cero datos, confirmando que no se retuvo código de usuario para el entrenamiento de modelos.
- • ZCode ha abierto el código de su aplicación de escritorio, espacio de trabajo web, backend, CLI de agente y tiempo de ejecución en GitHub.
- • La versión v3.14.0 aborda problemas de seguridad eliminando Repo Wiki y deshabilitando las cargas de instantáneas de repositorios locales.
- • Auditorías independientes de CAICT y NSFOCUS confirmaron que el bucket OSS de Alibaba Cloud de zcode-prod se encuentra en un estado verificado de cero datos y ha sido eliminado.
- • La empresa confirmó que no se retuvieron datos de código de usuario ni se utilizaron para el entrenamiento de modelos.
- • ZCode está estableciendo un programa continuo de reporte de vulnerabilidades con recompensas para los desarrolladores.
Esta actualización proporciona un camino para que los desarrolladores continúen utilizando ZCode de forma segura al pasar a un entorno de código abierto y autohospedado con remediaciones verificadas para los riesgos de privacidad de datos identificados anteriormente.
10. Meta abre la plataforma Muse AI a conectores de terceros
Meta ha ampliado su plataforma de agentes de IA para consumidores Muse, lanzada a principios de este mes, abriendo el acceso a los desarrolladores para construir conectores de API personalizados. Los desarrolladores ahora pueden integrar sus propios servicios directamente en el ecosistema Muse, con Meta encargándose de la orquestación de agentes subyacente y la gestión del contexto. Todos los envíos están sujetos a un proceso de revisión que cubre la seguridad, la funcionalidad y el cumplimiento legal.
- • Meta está aceptando envíos de conectores de API personalizados para la plataforma Muse.
- • Los desarrolladores proporcionan la API, mientras que Muse gestiona la orquestación de agentes y el contexto.
- • Los conectores deben pasar revisiones funcionales, de seguridad y legales antes de estar disponibles para los usuarios.
- • Las integraciones aprobadas pueden recibir una ubicación destacada dentro del ecosistema Muse.
Este desarrollo permite que servicios de terceros se integren directamente en el asistente Muse, extendiendo las capacidades de la plataforma más allá del conjunto de características inicial de Meta.
11. Kev: Modelos de decisión pequeños basados en Qwen3.5 para inferencia local
Kev ha introducido una familia de modelos de decisión pequeños con licencia Apache-2.0 construidos sobre la arquitectura Qwen3.5 utilizando un adaptador LoRA de rango 16 y un cabezal de puntero. Disponibles en tamaños de 0.8B, 4B y 9B, estos modelos están optimizados para tareas estructuradas como preguntas de sí/no, opción múltiple y calificación. Los modelos se ejecutan localmente en CUDA, ROCm y Apple Silicon, y las variantes más grandes caben fácilmente en un Mac de 32 GB. Kev cuenta con compatibilidad inmediata con System One de TypeSafe, lo que permite a los desarrolladores apuntar el SDK de Python de TypeSafe directamente a un servidor Kev local.
- • Kev es una familia de modelos de decisión pequeños basados en Qwen3.5, disponibles en tamaños de 0.8B, 4B y 9B parámetros.
- • Los modelos admiten tipos de preguntas estructuradas de sí/no, opción múltiple y calificación bajo la licencia Apache-2.0.
- • Las versiones 4B y 9B se ejecutan en CUDA, ROCm y Apple Silicon, ajustándose a un Mac de 32 GB utilizando precisión bf16.
- • El servidor Kev local es totalmente compatible con System One de TypeSafe, permitiendo la integración directa con el SDK de Python de TypeSafe.
- • Los modelos pueden ajustarse con datos específicos del dominio utilizando un formato JSONL simple y el flag --init_from.
Los desarrolladores pueden ejecutar modelos de toma de decisiones estructurados y rápidos localmente en Apple Silicon o CUDA con compatibilidad total con el SDK de TypeSafe.
12. Lanzamiento de Sharp-Spark-X2.5-4B-GGUF para codificación agente con baja RAM
Se ha lanzado un nuevo modelo cuantizado, Sharp-Spark-X2.5-4B-GGUF, en Hugging Face para llevar la codificación agente local al hardware de gama baja. Desarrollado como un esfuerzo voluntario sin fines de lucro, el modelo está calibrado específicamente para dispositivos con GPUs pequeñas o 16 GB de RAM o menos. El proceso de cuantización utiliza una matriz de importancia personalizada ponderada para tareas de codificación y ciberseguridad, priorizando el rendimiento real de SWE-bench-Live sobre las métricas de fidelidad matemática estándar.
- • Sharp-Spark-X2.5-4B-GGUF es un modelo cuantizado diseñado para la codificación agente en hardware de gama baja.
- • El proceso de cuantización utiliza una matriz de importancia personalizada calibrada para la codificación agente y la ciberseguridad.
- • El modelo prioriza el rendimiento de SWE-bench-Live sobre las métricas tradicionales de divergencia KL.
- • Está diseñado para ejecutarse en teléfonos inteligentes y computadoras portátiles más antiguas con 16 GB de RAM o menos.
- • El modelo está disponible en Hugging Face como un esfuerzo voluntario sin fines de lucro.
Los desarrolladores con hardware limitado pueden ejecutar agentes de codificación locales capaces en dispositivos con 16 GB de RAM o menos.
13. phantom-kv: Descensura LLMs mediante inyección de KV-Cache intercambiable en caliente
Un nuevo proyecto de código abierto llamado phantom-kv introduce un método novedoso para modificar el comportamiento de los modelos de lenguaje grandes sin alterar sus pesos subyacentes. Al inyectar un pequeño banco de tensores de clave/valor de 18 MB entrenado fuera de línea directamente en la caché KV del modelo, phantom-kv puede suprimir comportamientos de rechazo en prompts dañinos mientras preserva el comportamiento estándar en los inofensivos. Este enfoque permite a los desarrolladores intercambiar modos de capacidad sobre la marcha utilizando diferentes ranuras de caché. Aunque es altamente flexible, una auditoría de un modelo de 8B reveló que el injerto de caché tiene una vida media de 2-4k tokens en sesiones largas, lo que requiere una cadencia de reinyección periódica para mantener la efectividad.
- • phantom-kv es un sistema de eliminación de rechazo que carga un banco aprendido de tensores de clave/valor (~18 MB) en la caché KV de un LLM.
- • El sistema no modifica los pesos del modelo base ni requiere hooks del motor, dejando el modelo idéntico byte a byte cuando se descarga.
- • Admite modos de capacidad intercambiables en caliente (por ejemplo, defensivo u ofensivo) utilizando diferentes ranuras de caché.
- • Una auditoría de un modelo de 8B mostró una vida media de 2-4k tokens en sesiones largas, lo que puede mitigarse mediante reinyección periódica.
- • La auditoría señaló que las métricas de supresión de rechazo léxico pueden sobreestimar el cumplimiento, ya que el rechazo semántico puede persistir como reformulación.
Los desarrolladores pueden alternar dinámicamente los modos de seguridad y capacidad en modelos locales sin la sobrecarga de alojar múltiples pesos ajustados.
14. Apple M5 Ultra Mac Studio ofrece ganancias masivas de rendimiento de IA local
Una nueva revisión del M5 Ultra Mac Studio destaca su posición como una estación de trabajo de primer nivel para ejecutar agentes de IA locales y flujos de trabajo complejos. Construida sobre una arquitectura de cuatro chips que conecta dos chips M5 Max, la máquina cuenta con una GPU de 80 núcleos con aceleradores neuronales y un ancho de banda de memoria masivo de 1.2 TB/s. En pruebas prácticas utilizando el backend oMLX, el M5 Ultra demostró una aceleración del 70% en la generación de tokens y una mejora del 150% en el procesamiento de prompts sobre el M3 Ultra, lo que lo hace altamente efectivo para ejecutar modelos locales como Qwen3.8-Flash-Next sin las limitaciones de VRAM de las tarjetas gráficas tradicionales.
- • El M5 Ultra Mac Studio cuenta con una GPU de 80 núcleos con aceleradores neuronales, entregando hasta 4.5 veces el cómputo de IA máximo del M3 Ultra.
- • El ancho de banda de memoria ha aumentado un 50% a 1.2 TB/s, en comparación con los 819 GB/s del M3 Ultra.
- • Las pruebas del mundo real muestran que el M5 Ultra es un 70% más rápido en la generación de tokens y un 150% más rápido en el procesamiento de prompts que el M3 Ultra.
- • El hardware ejecuta con éxito agentes locales como Open Minis y Hermes Agent impulsados por Qwen3.8-Flash-Next.
- • Aunque la NVIDIA RTX 5090 ofrece un cómputo bruto más alto, la memoria unificada del Mac Studio evita la limitación de 32 GB de VRAM de las GPUs de consumo.
Los desarrolladores que ejecutan agentes de IA locales y análisis de documentos a gran escala obtienen una alternativa de hardware altamente capaz a las GPUs limitadas por VRAM.
15. Hugging Face lanza Tokenizers v1 en Rust
Hugging Face ha lanzado oficialmente la versión 1 de su popular biblioteca de tokenizadores. Reescripta en Rust, la versión v1 se centra en el rendimiento y la eficiencia, ofreciendo escalado multihilo y un tamaño de paquete significativamente reducido. La biblioteca proporciona una tokenización robusta y de alta velocidad en múltiples idiomas, lo que la convierte en una dependencia altamente optimizada para motores de inferencia locales y pipelines de modelos personalizados.
- • Hugging Face lanzó oficialmente la versión 1 de su biblioteca de tokenizadores basada en Rust.
- • La actualización introduce escalado multihilo y una huella de paquete mínima.
- • La biblioteca incluye un soporte robusto para múltiples idiomas.
Los desarrolladores que construyen pipelines de inferencia locales o flujos de trabajo de entrenamiento personalizados se benefician de una tokenización más rápida y altamente optimizada en múltiples idiomas.