Inference Brew

Google DeepMind lanza Gemini Robotics 2

00:00 / --:--

← Volver al inicio

Google DeepMind lanza Gemini Robotics 2

1. Google DeepMind lanza Gemini Robotics 2

La suite Gemini Robotics 2 de Google DeepMind presenta tres modelos: Gemini Robotics 2 (VLA), Gemini Robotics ER 2 (razonamiento encarnado) y Gemini Robotics On-Device 2. El modelo ER 2 actúa como un planificador de alto nivel, procesando transmisiones de video en vivo desde las cámaras de los robots para seguir el progreso y coordinar tareas entre múltiples robots. El modelo en dispositivo está optimizado para la ejecución local y una adaptación rápida. El sistema ha demostrado control de cuerpo completo y destreza con cinco dedos en el robot humanoide Apptronik Apollo 2.

  • Gemini Robotics ER 2 es un modelo de razonamiento encarnado mejorado basado en Gemini 3.5 Flash con una ventana de contexto de 128k.
  • El modelo ER 2 está integrado con la API de Gemini Live y está disponible para los desarrolladores a partir de hoy.
  • Gemini Robotics On-Device 2 está construido sobre la tecnología Gemma y puede adaptarse a nuevas encarnaciones robóticas en pocas horas con menos de 200 ejemplos.
  • El lanzamiento incluye el benchmark de seguridad ASIMOV-Agentic en Hugging Face bajo una licencia CC-BY-4.0.

Los desarrolladores ahora pueden crear flujos de trabajo de agentes físicos utilizando transmisiones de video en vivo y razonamiento de varios pasos a través de la API de Gemini Live.

2. Investigadores destilan DeepSeek V4 Flash en GPT-OSS-120B

Utilizando un método de destilación evolucionado basado en HINT-SD, los investigadores transfirieron con éxito capacidades complejas de razonamiento financiero a modelos de código abierto. El modelo resultante de 120B completa el 98,7% de los problemas dentro de un presupuesto de 8k tokens en una sola GPU H100, con un costo aproximado de $0,00026 por consulta. El equipo también lanzó el marco LineageEval en GitHub para ayudar a los desarrolladores a estudiar la transferencia de censura en modelos destilados.

  • Los investigadores destilaron el razonamiento financiero de DeepSeek V4 Flash en un modelo GPT-OSS-120B.
  • El modelo de 120B obtuvo un 83,61% en el benchmark FinanceReasoning, superando a Kimi K3.
  • Se publicaron pesos abiertos para un modelo financiero de 20B que funciona en una sola GPU de 80GB.
  • Un estudio de 152 pares de prompts emparejados mostró que la censura del modelo profesor no se transfirió a los estudiantes destilados.

Los desarrolladores pueden acceder a modelos financieros altamente especializados y de bajo costo, y utilizar el nuevo marco LineageEval para auditar la transferencia de censura.

SOURCES

3. Lanzamiento del modelo MoE Inkling-Small 276B con 1M de contexto

Inkling-Small ofrece una arquitectura de Mezcla de Expertos de alta capacidad con una enorme ventana de contexto de 1M de tokens. Al activar solo 12 mil millones de parámetros por token, el modelo equilibra la profundidad del razonamiento con la eficiencia computacional. Los desarrolladores pueden experimentar con el despliegue local de este modelo utilizando compilaciones especializadas de llama.cpp que admiten la descarga de CPU para cuantizaciones GGUF.

  • Inkling-Small cuenta con 276 mil millones de parámetros totales y 12 mil millones de parámetros activos.
  • El modelo admite una ventana de contexto de 1 millón de tokens.
  • Está disponible en formatos NVFP4 y GGUF en Hugging Face.
  • Una rama de desarrollo de llama.cpp admite la ejecución de la cuantización GGUF de Unsloth en CUDA con descarga de CPU.

Los desarrolladores pueden ejecutar un modelo MoE de contexto largo localmente utilizando una rama de desarrollo de llama.cpp con CUDA y descarga de CPU.

SOURCES

4. LG AI Research lanza el modelo K-EXAONE 2.0 750B

Desarrollado bajo la Fase 2 del Proyecto de Modelo de Fundación de IA Soberana de Corea, K-EXAONE 2.0 es tres veces más grande que su predecesor. El modelo presenta una alineación de seguridad robusta, obteniendo 94,6 en benchmarks de seguridad, y demuestra un rendimiento competitivo en codificación y uso de herramientas agenticas. Su licencia Apache 2.0 lo hace altamente accesible, aunque su tamaño masivo presenta requisitos de alojamiento significativos.

  • K-EXAONE 2.0 es un modelo de 750 mil millones de parámetros lanzado bajo la licencia Apache 2.0.
  • El modelo admite 10 idiomas y obtuvo 94,4 en el benchmark de contexto largo OpenAI-MRCR.
  • Logró una puntuación de 14,2 en el benchmark Tau3-Bench Banking para el uso de herramientas agenticas, superando a Qwen 3.5.
  • El rendimiento en codificación muestra un aumento promedio del 30% en las métricas principales en comparación con la versión 1.

El lanzamiento proporciona un modelo de base masivo de pesos abiertos con sólidas capacidades de uso de herramientas agenticas y contexto largo.

SOURCES

5. Baseten añade capacidades de visión a GLM 5.2 mediante un nuevo modelo combinado

Tras la reciente optimización del rendimiento de la API de GLM 5.2, Baseten ha ampliado la utilidad del modelo lanzando GLM-5.2-Vision-NVFP4. Este modelo combinado integra el codificador de visión de Kimi k2.6 en la arquitectura de GLM 5.2, permitiendo el procesamiento multimodal. El lanzamiento está disponible en OpenRouter, abordando los comentarios previos de los desarrolladores sobre la falta de soporte nativo de visión en el lanzamiento original de GLM 5.2.

  • GLM-5.2-Vision-NVFP4 ya está disponible para inferencia en OpenRouter.
  • El modelo es una combinación de la arquitectura GLM 5.2 y el codificador de visión Kimi k2.6.
  • Este lanzamiento añade capacidades multimodales a la familia GLM 5.2, abordando limitaciones anteriores.

Los desarrolladores ahora pueden utilizar una versión con visión de GLM 5.2 para aplicaciones multimodales, aprovechando la infraestructura existente de GLM 5.2.

SOURCES

6. SpaceXAI lanza Grok Voice Think Fast 2.0

SpaceXAI ha lanzado Grok Voice Think Fast 2.0, un modelo de voz actualizado diseñado para aumentar la fiabilidad en los flujos de trabajo de producción de los clientes. El modelo está disponible a través del Agent Builder a $0,09 por minuto de audio. Los desarrolladores que actualmente integran el modelo `grok-voice-latest` deben prepararse para la transición automática a esta nueva versión el 5 de agosto.

  • Grok Voice Think Fast 2.0 ya está disponible en el Agent Builder de SpaceXAI.
  • El servicio tiene un precio de $0,09 por minuto de audio.
  • El endpoint de la API grok-voice-latest realizará la transición automática a la nueva versión el 5 de agosto.
  • El lanzamiento se centra en mejorar la fiabilidad en los flujos de trabajo reales de los clientes.

Los desarrolladores que utilizan Grok Voice pueden esperar una mayor fiabilidad en los flujos de trabajo de producción, con una transición de API programada para la próxima semana.

SOURCES

7. La extensión MCP Token Saver reduce los costos de tokens de PDF en Claude en un 90-99%

Token Saver proporciona una forma segura y sin configuración para consultar documentos PDF locales utilizando Claude 3.5 Sonnet y Claude 3 Opus. Operando a través de un proceso de 8 etapas, la extensión se ejecuta completamente de forma local a través de E/S estándar, asegurando que no se suban archivos a servidores externos. Cuenta con listas blancas de carpetas configuradas por el usuario y aislamiento de red, lo que la hace muy adecuada para entornos empresariales.

  • Token Saver es una extensión de código abierto del Protocolo de Contexto de Modelo (MCP) para Claude Desktop (v1.0).
  • La herramienta implementa un sistema RAG híbrido local utilizando coincidencia de palabras clave BM25 (0.4) y búsqueda semántica all-MiniLM-L6-v2 (0.6).
  • Reduce el consumo de tokens de LLM entre un 92% y un 99% al extraer y enviar solo los pasajes relevantes del documento.
  • La extensión se distribuye como un paquete .mcpb, sin requerir entorno de Python ni configuración de terminal.

Los desarrolladores pueden reducir drásticamente los costos de la API de Claude al trabajar con archivos PDF locales grandes enviando solo los pasajes altamente relevantes al modelo.

SOURCES

8. Agent-Manager TUI simplifica la ejecución de múltiples agentes en Tmux

Agent-manager ofrece un potente plano de control basado en terminal para desarrolladores que ejecutan múltiples agentes de codificación de IA. Al aislar cada agente en su propia sesión de tmux, la herramienta permite a los desarrolladores monitorear métricas del sistema en tiempo real, agrupar agentes en árboles de proyectos y enviar comentarios de revisión a los agentes como prompts individuales. También cuenta con detección automática de estado mediante sondeo de paneles o eventos de gancho para Claude Code.

  • Agent-manager ejecuta agentes de codificación como Claude Code, Codex y OpenCode en sesiones individuales de tmux.
  • La herramienta proporciona una TUI unificada para ver el estado en vivo, agrupar agentes y enviar prompts sin necesidad de adjuntar sesiones.
  • Admite revisiones de diffs de archivos completos con resaltado de sintaxis e incluye un servidor MCP para la gestión de sesiones impulsada por agentes.
  • La instalación es compatible a través de Homebrew, script de shell, AUR, mise o Go.

Los desarrolladores pueden orquestar, solicitar y revisar diferencias (diffs) en múltiples agentes de codificación concurrentes desde una única interfaz de terminal unificada.

SOURCES

9. Deep Agents v0.7 reduce los tokens de entrada base en un 65%

El lanzamiento de Deep Agents v0.7 se centra en optimizar la eficiencia del tiempo de ejecución para los flujos de trabajo agenticos. Al reestructurar cómo se manejan las entradas base, el marco reduce el uso de tokens de entrada en un 65%. Esta optimización permite a los desarrolladores ejecutar bucles de agentes complejos a una fracción del costo anterior de la API mientras mantienen una calidad de salida idéntica.

  • Deep Agents v0.7 reduce los tokens de entrada base en un 65% en comparación con las versiones anteriores.
  • La reducción de tokens se logra sin degradación en el rendimiento del agente.
  • La actualización está diseñada para mejorar directamente el costo y la eficiencia de los tokens para los desarrolladores.

Los desarrolladores que utilizan Deep Agents pueden reducir inmediatamente sus costos de API y mejorar la eficiencia de los tokens sin sacrificar el rendimiento del agente.

SOURCES

10. Perplexity publica la suite de seguridad para agentes Numbat

Numbat de Perplexity aborda los desafíos de seguridad únicos de ejecutar agentes de IA autónomos en dispositivos cliente. Al integrarse directamente con los arneses de ejecución de agentes, la suite de código abierto proporciona a los desarrolladores herramientas para monitorear el comportamiento del agente, prevenir fallos accidentales y mitigar los riesgos de seguridad a nivel de endpoint.

  • Numbat es una suite de seguridad de código abierto desarrollada por Perplexity específicamente para agentes de IA.
  • La suite se dirige a los riesgos de seguridad asociados con el despliegue de agentes autónomos en endpoints de clientes.
  • Numbat se integra directamente con los arneses de agentes para detectar y mitigar incidentes de seguridad en tiempo de ejecución.

Los desarrolladores pueden integrar Numbat en sus arneses de agentes para prevenir, detectar y mitigar fallos accidentales de agentes a nivel de cliente.

SOURCES

11. Hush Security lanza Identity Gateway para agentes de IA autónomos

La startup israelí Hush Security está abordando los desafíos de seguridad del ecosistema de agentes de IA en rápido crecimiento. Debido a que los agentes autónomos a menudo heredan credenciales humanas amplias o utilizan claves API de larga duración, presentan riesgos de seguridad significativos. La plataforma Identity Gateway de Hush Security permite a las organizaciones asignar identidades únicas a los agentes y aplicar permisos granulares específicos para cada tarea. Hay un nivel gratuito disponible para ayudar a los desarrolladores a obtener visibilidad en tiempo de ejecución e implementar controles de acceso.

  • Hush Security recaudó 30 millones de dólares en financiación de Serie A para expandir su plataforma para gobernar agentes de IA autónomos.
  • La plataforma Identity Gateway descubre agentes de IA y aplica la 'mínima agencia' mediante la intermediación de permisos específicos para cada tarea.
  • Hay un plan gratuito disponible que proporciona visibilidad en tiempo de ejecución, análisis de riesgos y controles de acceso basados en identidad.
  • La plataforma aborda los riesgos de seguridad de los agentes que operan con credenciales humanas heredadas o claves API de larga duración.

Los desarrolladores pueden asegurar los despliegues agenticos asignando identidades no humanas únicas y aplicando permisos específicos para cada tarea.

SOURCES

12. Habilidad de agente de código abierto aplica el inglés técnico simplificado

Esta habilidad de agente de código abierto proporciona adaptaciones específicas para mensajes de error, manuales de operación, informes de incidentes y notas de lanzamiento. Al aplicar el inglés técnico simplificado, la habilidad no solo mejora la claridad de la documentación, sino que también disminuye constantemente el recuento de tokens de salida en todos los modelos probados. Los desarrolladores pueden añadir fácilmente la habilidad a sus configuraciones de agente existentes o prompts del sistema.

  • La habilidad de código abierto obliga a los LLM a escribir en inglés técnico simplificado (STE) ASD-STE100.
  • Es compatible con Claude Code, Cursor, VS Code Copilot y otros arneses de agentes importantes.
  • Las pruebas mostraron una reducción del 72,9% en las violaciones de STE y una reducción de la longitud media de las oraciones de 11,2 a 9,7 palabras.
  • La habilidad tiene licencia MIT y se puede instalar a través de `npx skills add AminBlg/SimpleEnglish`.

Los desarrolladores pueden integrar esta habilidad en Claude Code, Cursor o Copilot para generar automáticamente documentación más clara y concisa, y ahorrar tokens.

SOURCES

13. Tencent publica el marco de decodificación especulativa AngelSpec

AngelSpec de Tencent proporciona un marco unificado para entrenar modelos de borrador de decodificación especulativa. Ofrece dos arquitecturas complementarias: un modelo MTP para datos conversacionales y un modelo de difusión de bloques (DFly) optimizado para código y matemáticas. AngelSpec incluye características avanzadas como el paralelismo de secuencia Ulysses para entrenamiento de contexto largo y empaquetado de secuencias consciente del documento, lo que permite a los desarrolladores desplegar tuberías de inferencia local altamente optimizadas.

  • AngelSpec es un marco de código abierto nativo de torch construido sobre TorchSpec para entrenar modelos de borrador de decodificación especulativa.
  • El marco admite la predicción autorregresiva de múltiples tokens (MTP) y la familia DFlash de bloques paralelos.
  • En el modelo HY3-295B-A21B, el modelo de borrador DFly-8 ofrece una aceleración de 1.98x a 2.40x sobre la decodificación autorregresiva estándar.
  • AngelSpec se integra con vLLM, SGLang y Hugging Face Transformers, e incluye siete puntos de control preentrenados.

Los desarrolladores pueden entrenar modelos de borrador personalizados para lograr una aceleración de hasta 2.4x en la inferencia local de LLM sin modificar sus modelos objetivo.

SOURCES

14. Cisco lanza el explorador gratuito de procedencia de la cadena de suministro de IA

El AI Supply Chain Provenance Explorer de Cisco aborda la falta de verificación en la IA de código abierto, donde hasta el 69% de los modelos abiertos tienen un linaje no verificado. Al analizar señales a nivel de peso como la similitud de anclaje de incrustación (Embedding Anchor Similarity), la herramienta evita los metadatos autoinformados para establecer los verdaderos orígenes del modelo. Esta verificación es cada vez más crítica a medida que la Comisión Europea comienza a aplicar la Ley de IA de la UE el 2 de agosto de 2026, que conlleva fuertes multas por modificaciones no verificadas de modelos abiertos.

  • El AI Supply Chain Provenance Explorer es una base de datos pública gratuita que cubre casi 900 modelos de código abierto.
  • La herramienta utiliza huellas dactilares estáticas y análisis de similitud conductual para verificar el linaje del modelo con una precisión del 96,4%.
  • Proporciona datos buscables sobre la sede del proveedor, restricciones de licencia y archivos escaneados.
  • La base de datos está disponible públicamente en provenance.aidefense.cisco.com sin necesidad de una cuenta de Cisco.

Los desarrolladores pueden verificar el verdadero linaje y la licencia de los modelos de código abierto para garantizar el cumplimiento de las próximas regulaciones como la Ley de IA de la UE.

SOURCES

15. Lanzamiento del modelo MoE Qwen cuantizado Escha-W2 para GPU locales

Escha-W2 hace que el alojamiento de un modelo masivo de Mezcla de Expertos de 256 expertos sea accesible en hardware de grado de consumo. Al comprimir el modelo Qwen3.6-35B-A3B hasta una cuantización de 2 bits, la compilación cabe en 12,3 GB de espacio en disco. Viene preempaquetado con la infraestructura de servicio necesaria para exponer una API HTTP compatible con OpenAI desde el primer momento.

  • Escha-W2 es una compilación cuantizada de 2 bits del modelo MoE Qwen3.6-35B-A3B, que cuenta con 256 expertos.
  • El modelo está empaquetado con herramientas para servirlo localmente a través de una API HTTP compatible con OpenAI.
  • Ocupa 12,3 GB de espacio en disco y se ejecuta en una sola GPU de consumo con 16 GB o 24 GB de VRAM.

Los desarrolladores pueden alojar un modelo de Mezcla de Expertos de 256 expertos localmente en hardware con 16GB o 24GB de VRAM utilizando una API compatible con OpenAI.

SOURCES

16. Los benchmarks de MindControl muestran una reducción del 50% de tokens en tareas de codificación

Tras el lanzamiento inicial de la bifurcación llama.cpp de MindControl, el desarrollador Laurence Hardman ha publicado resultados de benchmark que cuantifican su rendimiento. Al reemplazar el truncamiento estricto con presupuestos de razonamiento guiado a nivel de muestreador, la herramienta permite que modelos como Qwen3.6-27B mantengan una alta precisión en los benchmarks de codificación mientras reducen el uso de tokens en más del 50% en LiveCodeBench.

  • Los benchmarks de MindControl en Qwen3.6-27B muestran una reducción del 50% en el consumo de tokens en LiveCodeBench.
  • La configuración más restringida logró una puntuación del 95,7% en HumanEval+.
  • La técnica mantiene una alta precisión mientras optimiza los presupuestos de tokens, aunque se observaron costos de rendimiento en los subconjuntos de problemas más difíciles.

Estos resultados confirman que la bifurcación MindControl lanzada anteriormente puede mejorar significativamente la eficiencia de la inferencia de modelos locales para tareas de codificación sin penalizaciones de precisión agregada.

SOURCES

17. OpenAI ajusta los precios de GPT-5.6 y añade un 'modo rápido' de alto rendimiento

Basándose en la disponibilidad general de la familia de modelos GPT-5.6 lanzada a principios de este mes, OpenAI ha implementado ajustes de precios significativos para seguir siendo competitivos. La compañía ha reducido los precios de la API para el modelo Luna, optimizado en costos, en un 80% y para el modelo Terra, equilibrado, en un 20%. Además, OpenAI ha introducido un nuevo 'modo rápido' para el modelo insignia Sol, proporcionando un rendimiento 2.5x mayor para flujos de trabajo de producción sensibles a la latencia a un precio premium.

  • Precios de GPT-5.6 Luna reducidos en un 80% a $1,40/M de tokens combinados.
  • Precios de GPT-5.6 Terra reducidos en un 20% a $14,00/M de tokens combinados.
  • El nuevo 'modo rápido' para GPT-5.6 Sol ofrece un rendimiento 2.5x a $70/M de tokens combinados.
  • El precio estándar para GPT-5.6 Sol permanece sin cambios.

Estas actualizaciones brindan a los desarrolladores opciones de costo y rendimiento más flexibles para la serie GPT-5.6, lo que permite un razonamiento ligero más barato o capacidades de producción de mayor rendimiento.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.