Inference Brew

Poolside lanza el modelo Laguna M.1 225B Mixture-of-Experts

00:00 / --:--

← Volver al inicio

Poolside lanza el modelo Laguna M.1 225B Mixture-of-Experts

1. Poolside lanza el modelo Laguna M.1 225B Mixture-of-Experts

Poolside ha lanzado Laguna M.1, un modelo de Mixture-of-Experts de 225B de parámetros optimizado para codificación agentica y tareas de largo alcance. Lanzado bajo la licencia Apache 2.0, el modelo activa 23B de parámetros por token y admite una ventana de contexto de 262,144 tokens. Laguna M.1 cuenta con soporte nativo para pensamiento entrelazado entre llamadas a herramientas y ofrece un rendimiento sólido en benchmarks de codificación, obteniendo un 74.6% en SWE-bench Verified y un 49.2% en SWE-bench Pro.

  • Laguna M.1 es un modelo MoE de 225B de parámetros totales con 23B de parámetros activos por token, lanzado bajo la licencia Apache 2.0.
  • El modelo cuenta con 70 capas (3 SwiGLU densas, 67 MoE dispersas) con 256 expertos y enrutamiento top-k=16.
  • Admite una ventana de contexto de 262,144 tokens utilizando RoPE con YaRN.
  • El modelo incluye soporte nativo para pensamiento entrelazado entre llamadas a herramientas, que puede activarse por solicitud.
  • Obtiene un 74.6% en SWE-bench Verified, 63.1% en SWE-bench Multilingual y 49.2% en SWE-bench Pro.

Los desarrolladores tienen acceso a un modelo de codificación de pesos abiertos altamente capaz, con soporte nativo para pensamiento entrelazado y una ventana de contexto de 262k.

SOURCES

2. Lanzamiento de los modelos LFM2.5 Multilingual Embedding y ColBERT

Liquid AI ha lanzado dos nuevos modelos de recuperación de 350M de parámetros: LFM2.5-Embedding-350M, un bi-encoder denso, y LFM2.5-ColBERT-350M, un recuperador de interacción tardía. Diseñados como reemplazos directos para pipelines RAG existentes, ambos modelos ofrecen una precisión multilingüe líder en su clase en 11 idiomas. Gracias a la arquitectura base LFM2, mantienen altas velocidades de inferencia comparables a modelos mucho más pequeños, facilitando una indexación rápida y recuperación multilingüe.

  • LFM2.5-Embedding-350M es un bi-encoder denso diseñado para recuperación multilingüe en 11 idiomas.
  • LFM2.5-ColBERT-350M es un recuperador de interacción tardía que almacena un vector por token, utilizando MaxSim para coincidencias multilingües.
  • Ambos modelos tienen 350M de parámetros y están diseñados como reemplazos directos en pipelines RAG existentes.
  • Los modelos ofrecen una precisión multilingüe líder en su clase para su tamaño, con velocidades de inferencia comparables a modelos más pequeños gracias a la arquitectura LFM2.

Los desarrolladores pueden actualizar sus pipelines RAG con modelos de recuperación multilingüe rápidos y altamente precisos que admiten 11 idiomas con un tamaño compacto de 350M de parámetros.

SOURCES

3. North Mini Code 1.0 recibe cuantización de 4 bits y soporte para Ollama

CohereLabs ha lanzado una versión cuantizada de 4 bits de su modelo North Mini Code 1.0 en Hugging Face. Esta cuantización reduce el requisito de memoria a aproximadamente 20 GB, permitiendo a los desarrolladores ejecutar el modelo localmente en hardware estándar como un Mac. El modelo ahora es totalmente compatible con Ollama y otros runtimes basados en llama.cpp, y sigue siendo accesible a través de la API de OpenRouter.

  • CohereLabs lanzó una versión cuantizada de 4 bits del modelo North Mini Code 1.0 en Hugging Face.
  • El modelo cuantizado de 4 bits requiere aproximadamente 20 GB de memoria para ejecutarse en hardware local.
  • North Mini Code 1.0 ahora es compatible con Ollama y otros runtimes locales construidos sobre llama.cpp.
  • El modelo también está disponible para acceso a través de la API de OpenRouter.

Los desarrolladores ahora pueden ejecutar el modelo North Mini Code 1.0 localmente en hardware estándar como un Mac con solo 20 GB de memoria.

SOURCES

4. Divulgación de vulnerabilidades críticas en LiteLLM, Langflow y Microsoft Copilot

Una serie de revelaciones de seguridad críticas ha afectado a herramientas populares para desarrolladores de IA. Obsidian Security reveló una cadena de tres CVE en la pasarela LiteLLM que permite a usuarios con pocos privilegios ejecutar código remoto y acceder a claves API de proveedores, mientras que una vulnerabilidad de inyección de comandos en los endpoints de prueba MCP de LiteLLM ha sido añadida a la lista KEV de CISA. Además, la vulnerabilidad de recorrido de rutas de Langflow (CVE-2026-5027) está siendo explotada activamente, y se descubrió que Microsoft 365 Copilot es vulnerable a una cadena de exfiltración de datos llamada SearchLeak.

  • Obsidian Security reveló una cadena de tres CVE (CVE-2026-47101, CVE-2026-47102, CVE-2026-40217) en la pasarela LiteLLM que permite la ejecución remota de código y el acceso a claves de proveedores.
  • LiteLLM también enfrentó una vulnerabilidad de inyección de comandos (CVE-2026-42271) en sus endpoints de prueba MCP, añadida a la lista KEV de CISA con fecha límite de remediación del 22 de junio.
  • La vulnerabilidad CVE-2026-5027 de Langflow, un fallo de recorrido de rutas que permite la ejecución remota de código sin autenticación, está siendo explotada activamente por MuddyWater.
  • Varonis reveló SearchLeak (CVE-2026-42824), una cadena de exfiltración crítica en Microsoft 365 Copilot Enterprise Search.
  • Un ataque a la cadena de suministro que involucró al gusano Mini Shai-Hulud comprometió 32 paquetes npm de Red Hat Cloud Services el 1 de junio.

Los desarrolladores que utilizan LiteLLM o Langflow deben parchear sus instancias inmediatamente para evitar la ejecución remota de código y el acceso no autorizado a las claves API de los proveedores.

SOURCES

5. Anthropic lanza Claude Code Artifacts para espacios de trabajo interactivos

Anthropic ha actualizado su herramienta de desarrollo basada en terminal, Claude Code, con soporte para Artifacts. Disponible para los suscriptores de Claude Team y Enterprise, la función permite a los desarrolladores renderizar las salidas de las sesiones de terminal en páginas web HTML en vivo, interactivas y compartibles. Estas páginas sin estado y autónomas (de hasta 16 MiB de tamaño) se actualizan en tiempo real a medida que el agente de IA trabaja. Para mantener la seguridad empresarial, Anthropic aplica una estricta Política de Seguridad de Contenido que bloquea todas las solicitudes de red externas, manteniendo los espacios de trabajo generados seguros y privados por defecto.

  • Anthropic ha introducido Artifacts para Claude Code, disponible para los suscriptores de Claude Team y Enterprise.
  • La función transforma el trabajo de las sesiones de terminal en páginas web HTML en vivo, interactivas y compartibles.
  • Las páginas web se actualizan en tiempo real a medida que el agente de IA trabaja, accesibles a través de una URL persistente.
  • Artifacts son páginas HTML sin estado y autónomas con un tamaño máximo renderizado de 16 MiB.
  • Anthropic aplica una estricta Política de Seguridad de Contenido (CSP) que bloquea todas las solicitudes de red externas (fetch, XHR, WebSocket) por seguridad.
  • El acceso es privado por defecto y restringido a miembros autenticados de una organización.

Los desarrolladores ahora pueden generar y compartir instantáneamente paneles visuales interactivos y diagramas de sistema directamente desde sus sesiones de Claude Code basadas en terminal.

SOURCES

6. Elastic lanza Agent Builder con capa de memoria persistente

Elastic ha anunciado la disponibilidad general de su Agent Builder en Elastic Cloud, introduciendo una capa de memoria de agente persistente construida sobre Elasticsearch. La arquitectura separa la memoria en índices episódicos, semánticos y procedimentales, utilizando un pipeline de recuperación híbrido con BM25 y vectores densos Jina v5. El sistema admite de forma nativa el Model Context Protocol (MCP) para una integración perfecta con Cursor y Claude Desktop, y aplica un estricto aislamiento multi-inquilino mediante seguridad a nivel de documento.

  • Agent Builder de Elastic ya está disponible de forma general en Elastic Cloud.
  • La arquitectura utiliza tres índices de Elasticsearch para gestionar la memoria: episódica, semántica y procedimental.
  • El sistema emplea un pipeline de recuperación híbrido (BM25 y vectores densos Jina v5) fusionado con RRF y un reranker cross-encoder Jina v2.
  • Admite el Model Context Protocol (MCP) para la integración con clientes como Claude Desktop y Cursor.
  • El aislamiento multi-inquilino se aplica a nivel de clúster utilizando la seguridad a nivel de documento (DLS) de Elasticsearch.
  • En las evaluaciones, el sistema logró un R@10 promedio de 0.89 sin fugas entre inquilinos.

Los desarrolladores pueden implementar una capa de memoria de agente robusta y multi-inquilino con alta recuperación e integración nativa de MCP utilizando su infraestructura de Elasticsearch existente.

SOURCES

7. La extensión OAuth Zero-Touch para MCP alcanza estado estable

La extensión Enterprise-Managed Authorization (EMA) para el Model Context Protocol (MCP) ha alcanzado un estado estable. EMA permite a las organizaciones gestionar centralizadamente el acceso al servidor MCP a través de proveedores de identidad existentes como Okta, eliminando la necesidad de configurar OAuth por usuario y las repetidas solicitudes de consentimiento. Anthropic ya ha integrado la extensión en su capa MCP compartida para Claude, Claude Code y Cowork, junto con el soporte de VS Code y plataformas como Supabase, Linear y Figma.

  • La extensión Enterprise-Managed Authorization (EMA) para el Model Context Protocol (MCP) ha alcanzado un estado estable.
  • EMA permite a las organizaciones gestionar centralizadamente el acceso al servidor MCP a través de proveedores de identidad, eliminando las solicitudes de OAuth por usuario.
  • La extensión utiliza una concesión de autorización JWT de aserción de identidad (ID-JAG) para una configuración sin intervención.
  • Okta es el primer proveedor de identidad compatible, utilizando su protocolo Cross App Access (XAA).
  • Anthropic ha implementado EMA en su capa MCP compartida para Claude, Claude Code y Cowork, y VS Code también ha añadido soporte.
  • Las plataformas compatibles incluyen Supabase, Linear, Figma, Canva, Atlassian y Asana.

Los desarrolladores pueden construir y desplegar servidores MCP en entornos empresariales sin requerir que los usuarios individuales completen repetidamente las solicitudes de consentimiento de OAuth.

SOURCES

8. El framework Arbor automatiza la optimización autónoma de software

Investigadores de la Universidad Renmin de China y Microsoft Research han introducido Arbor, un framework de código abierto diseñado para automatizar la optimización de sistemas de software complejos. Arbor estructura su proceso de optimización como un árbol ramificado de hipótesis, experimentos y evidencia gestionado por un agente coordinador de larga duración, mientras que los agentes ejecutores de corta duración prueban cambios en árboles de trabajo git aislados. En los benchmarks, Arbor ofreció más de 2.5 veces las ganancias de rendimiento de los agentes de codificación estándar como Claude Code y Codex bajo el mismo presupuesto de cómputo, e integra directamente con los flujos de trabajo de Git estándar para una fácil revisión de código.

  • Arbor es un framework diseñado para automatizar la optimización autónoma de sistemas de software complejos.
  • El framework utiliza un agente coordinador de larga duración para gestionar la estrategia de investigación y agentes ejecutores de corta duración en árboles de trabajo git aislados.
  • Organiza la investigación en una estructura de árbol ramificado que rastrea hipótesis, experimentos y evidencia mediante el refinamiento de árboles de hipótesis (HTR).
  • Arbor ofreció más de 2.5 veces las ganancias de rendimiento de Codex y Claude Code bajo el mismo presupuesto de cómputo.
  • En la tarea BrowseComp, Arbor mejoró la precisión al 67.67% en comparación con el 53.33% de Claude Code.
  • El framework se integra con los flujos de trabajo de Git existentes, permitiendo a los desarrolladores revisar las ramas optimizadas antes de fusionarlas.

Los desarrolladores pueden desplegar agentes coordinadores de larga duración para optimizar autónomamente sistemas de software complejos con un rendimiento 2.5 veces mejor que los agentes de codificación estándar.

SOURCES

9. Vercel lanza Connect para reemplazar tokens de agente persistentes

Vercel ha lanzado Connect en beta pública, una función de seguridad diseñada específicamente para despliegues de agentes de IA. En lugar de depender de tokens de proveedor persistentes y de larga duración que representan un riesgo de seguridad significativo si se filtran, Connect implementa un sistema de intercambio de credenciales en tiempo de ejecución. La plataforma emite automáticamente credenciales de corta duración y alcance de tarea, minimizando la superficie de ataque para los agentes autónomos que ejecutan tareas.

  • Vercel ha lanzado Connect en beta pública.
  • Connect reemplaza los tokens de proveedor de larga duración con un sistema de intercambio de credenciales en tiempo de ejecución.
  • El sistema emite credenciales de corta duración y alcance de tarea para agentes de IA.
  • La actualización tiene como objetivo reducir los riesgos de seguridad asociados con los tokens de acceso compartidos y persistentes.

Los desarrolladores pueden asegurar sus despliegues de agentes reemplazando los tokens de API persistentes y arriesgados por credenciales efímeras y de alcance de tarea.

SOURCES

10. Lanzamiento de la integración de Replit dentro de Claude

Replit ha lanzado una integración directa dentro de Claude, permitiendo a los desarrolladores transicionar sin problemas desde conversaciones de diseño iniciales al desarrollo activo. La integración agiliza el flujo de trabajo de tomar prototipos de código generados por IA y abrirlos directamente dentro del entorno de desarrollo basado en la nube de Replit.

  • Replit se ha integrado en Claude.
  • La integración está diseñada para permitir transiciones del diseño al desarrollo.

Los desarrolladores que usan Claude ahora pueden transicionar sus diseños y prototipos de código directamente al entorno de desarrollo de Replit.

SOURCES

11. El benchmark AA-Briefcase evalúa modelos en proyectos de largo alcance

Se ha lanzado un nuevo benchmark de evaluación agentica llamado AA-Briefcase para probar modelos de IA en trabajo de conocimiento complejo y de largo alcance. Desarrollado por expertos de la industria, el benchmark simula contextos organizacionales del mundo real al requerir que los modelos razonen a través de miles de entradas fragmentadas, incluyendo más de 25,000 mensajes de Slack y 3,500 correos electrónicos. Claude Fable 5 lidera actualmente el benchmark, pero a un costo promedio alto de $31 por tarea, en comparación con $10.40 para Claude Opus 4.8 y $2.40 para GLM-5.2.

  • AA-Briefcase es un nuevo benchmark diseñado para evaluar modelos de IA en trabajo de conocimiento de largo alcance dentro de proyectos complejos de varias semanas.
  • Los modelos deben razonar a través de miles de entradas fragmentadas, incluyendo documentos de la empresa, transcripciones de reuniones, más de 25,000 mensajes de Slack y más de 3,500 correos electrónicos.
  • Claude Fable 5 lidera el benchmark con una puntuación Elo de 1587, seguido por Claude Opus 4.8 con 1356 y GLM 5.2 con 1266.
  • El costo promedio por tarea es de $31 para Claude Fable 5, $10.40 para Claude Opus 4.8 y $2.40 para GLM-5.2 (máximo).
  • Un escenario de demostración pública, AA-Briefcase Lite, está disponible en Hugging Face.

Los desarrolladores pueden usar este benchmark para evaluar qué tan bien manejan los diferentes modelos los flujos de trabajo empresariales complejos del mundo real y estimar los costos de API asociados.

SOURCES

12. Nvidia lanza la plataforma XR AI en beta pública

Nvidia ha lanzado Nvidia XR AI en beta pública, proporcionando una base para conectar dispositivos de realidad extendida (XR) a servicios de IA acelerados por GPU. La plataforma incluye una biblioteca de código abierto que permite a los desarrolladores construir agentes inteligentes para gafas de IA, gafas de RA y cascos XR. Estos agentes pueden procesar entradas visuales en tiempo real, interpretar la intención del usuario, ejecutar llamadas a herramientas empresariales y entregar respuestas directamente dentro de una sesión XR activa.

  • Nvidia XR AI se ha lanzado en beta pública para conectar dispositivos de realidad extendida (XR) a servicios de IA acelerados por GPU.
  • La plataforma admite servicios de IA que se ejecutan en la nube, centros de datos, estaciones de trabajo o en el borde.
  • Hay una biblioteca de código abierto disponible para que los desarrolladores construyan agentes inteligentes para gafas de IA, gafas de RA y cascos XR.
  • Los agentes construidos con la biblioteca pueden procesar entradas visuales, entender la intención, llamar a herramientas empresariales y responder dentro de una sesión XR.

Los desarrolladores pueden construir agentes inteligentes para gafas de RA y cascos XR que procesen entradas visuales, entiendan la intención y llamen a herramientas empresariales en tiempo real.

SOURCES

13. TesterArmy lanza una plataforma de pruebas agenticas para aplicaciones web y móviles

TesterArmy, una empresa de YC P26, ha lanzado una plataforma de pruebas agenticas diseñada para automatizar comprobaciones de extremo a extremo para aplicaciones web y móviles. La plataforma permite a los desarrolladores definir casos de prueba en lenguaje natural, que luego son ejecutados por agentes de IA tanto antes del despliegue como en producción. TesterArmy se integra directamente con GitHub para la programación y envía alertas a través de Slack o Discord cuando se detectan errores en flujos críticos.

  • TesterArmy es una plataforma de pruebas agenticas que realiza comprobaciones de extremo a extremo antes del despliegue y en producción.
  • Los usuarios definen pruebas en lenguaje natural, que son ejecutadas y gestionadas por agentes de IA.
  • La plataforma se integra con GitHub para la programación de pruebas y alertas a través de Slack o Discord.
  • Más de 30 equipos utilizan el producto diariamente para identificar errores en flujos de onboarding, pago y chat de IA.

Los desarrolladores pueden automatizar las pruebas de extremo a extremo de flujos críticos de aplicaciones como el onboarding y el pago utilizando definiciones de prueba en lenguaje natural.

SOURCES

14. Hermes introduce una herramienta de migración para configuraciones de agentes heredadas

Hermes ha lanzado una utilidad de migración, accesible a través del comando hermes claw migrate, diseñada para importar configuraciones heredadas de OpenClaw, Clawdbot y Moldbot. La herramienta escanea automáticamente los directorios predeterminados y migra personas, memoria, archivos de espacio de trabajo, habilidades y servidores MCP. Aunque resuelve claves API estándar de archivos de entorno, los desarrolladores deben configurar manualmente los objetos SecretRef que dependen de fuentes de archivo o ejecución.

  • El comando hermes claw migrate importa configuraciones heredadas de OpenClaw, Clawdbot o Moldbot a Hermes.
  • La herramienta detecta automáticamente directorios de configuración heredados como ~/.clawdbot/ y ~/.moltbot/.
  • Los datos migrados incluyen personas, memoria, instrucciones, archivos de espacio de trabajo, habilidades y servidores MCP.
  • Las claves API se resuelven a partir de valores de configuración, archivos de entorno y perfiles de autenticación de agente.
  • Los objetos SecretRef que utilizan fuentes de archivo o ejecución no pueden resolverse automáticamente y deben añadirse manualmente.

Los desarrolladores pueden migrar fácilmente configuraciones de agentes heredadas, incluyendo memoria, habilidades y claves API, a la plataforma Hermes utilizando un solo comando CLI.

SOURCES

15. Prueba de carga de trabajo del mundo real mide los ahorros reales de las herramientas de compresión de tokens

Una evaluación del mundo real de tres herramientas populares de ahorro de tokens (rtk, headroom y caveman) reveló que su impacto real en las facturas de API es significativamente menor de lo anunciado. Probadas frente a 500 sesiones de Claude Code que totalizaron 614 millones de tokens, las herramientas lograron un ahorro combinado de solo el 3.7%. Aunque las herramientas comprimen con éxito sus cargas útiles objetivo, la reducción general de la factura se diluye mucho porque no optimizan los prompts del sistema, las lecturas de archivos o los tokens cacheados, mientras introducen riesgos de seguridad al acceder a código sensible y claves API.

  • Tres herramientas de ahorro de tokens (rtk, headroom y caveman) fueron probadas frente a 500 sesiones de Claude Code que totalizaron 614 millones de tokens y $926 en gasto base.
  • El ahorro combinado real logrado fue solo del 3.7% ($34.12), con headroom ahorrando un 2.8%, rtk un 0.5% y caveman un 0.4%.
  • Las tasas de compresión anunciadas por las herramientas se confirmaron como precisas, pero solo para las cargas útiles específicas a las que apuntan.
  • El bajo impacto general en la factura se debe al 'efecto denominador', donde los trucos de alta compresión no se aplican a los prompts del sistema, lecturas de archivos o tokens cacheados.
  • La prueba destacó los riesgos de seguridad, señalando que estas herramientas requieren acceso a código, prompts y claves API.

Los desarrolladores deben esperar reducciones de costos en el mundo real mucho menores de lo anunciado por las herramientas de compresión de tokens, ya que los trucos de alta compresión no se aplican a los prompts cacheados o lecturas de archivos.

SOURCES

16. Análisis advierte sobre riesgos operativos en la herramienta de compresión de tokens RTK

Un análisis técnico de la herramienta de compresión de salida de terminal RTK ha planteado preocupaciones sobre su viabilidad en los flujos de trabajo de agentes de producción. Aunque RTK afirma ahorros de tokens del 60-90% al comprimir la salida de CLI, los críticos señalan que esta métrica ignora los principales impulsores de costos como las lecturas de archivos y los prompts del sistema. Además, el análisis frágil de la salida de CLI de la herramienta introduce riesgos operativos, como la eliminación de trazas de pila críticas o contexto del compilador, lo que puede causar que los agentes de codificación fallen silenciosamente.

  • RTK está diseñado para comprimir la salida de terminal para agentes LLM con el fin de reducir el uso de tokens, afirmando ahorros del 60-90%.
  • Una crítica técnica argumenta que la métrica de ahorro es engañosa porque solo se aplica a la salida de línea de comandos sin procesar, ignorando las lecturas de archivos y los prompts del sistema.
  • Los críticos advierten que RTK puede causar fallos silenciosos al eliminar información crítica como trazas de pila o contexto del compilador.
  • RTK actualmente carece de benchmarks rigurosos de tasa de éxito de tareas, como SWE-bench, para validar su impacto.
  • La herramienta se basa en un análisis frágil de la salida de CLI que podría romperse con las actualizaciones estándar de las herramientas.

Los desarrolladores que utilizan herramientas de compresión de tokens para agentes de codificación deben sopesar los ahorros de costos menores frente al riesgo de que los agentes fallen silenciosamente debido a la eliminación de contexto.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.