1. Moonshot AI anuncia el modelo MoE Kimi K3 de 2,8 billones de parámetros
Moonshot AI ha anunciado Kimi K3, un modelo disperso de tipo Mixture-of-Experts con 2,8 billones de parámetros. Construido sobre las arquitecturas Kimi Delta Attention y Attention Residuals, el modelo activa 16 de sus 896 expertos para mejorar la velocidad de decodificación y la eficiencia de escalado. Kimi K3 ya está disponible a través de la API de Kimi, y el lanzamiento completo de los pesos del modelo está programado para el 27 de julio de 2026.
- • Moonshot AI anunció Kimi K3, un modelo MoE disperso de 2,8 billones de parámetros cuyos pesos se lanzarán el 27 de julio de 2026.
- • El modelo cuenta con comprensión visual nativa, una capacidad de razonamiento de 'modo de pensamiento' siempre activo y una ventana de contexto de 1 millón de tokens.
- • Utiliza Kimi Delta Attention y Attention Residuals para mejorar la velocidad de decodificación y la eficiencia de escalado.
- • El precio de la API se ha fijado en 3,00 $ por millón de tokens de entrada (0,30 $ para aciertos de caché) y 15,00 $ por millón de tokens de salida.
- • En una demostración de 48 horas, Kimi K3 diseñó de forma autónoma un chip funcional de 4 milímetros cuadrados utilizando herramientas de automatización de diseño electrónico de código abierto.
Los desarrolladores pueden construir sobre un modelo masivo de pesos abiertos de clase frontera con soporte multimodal nativo y razonamiento de contexto largo.
2. GPT-5.6 Sol lidera el benchmark Web Design Arena
Basándose en la vista previa global de la familia de modelos GPT-5.6, el modelo insignia Sol de OpenAI ha alcanzado el primer lugar en el Web Design Arena de Design Arena. Este hito de rendimiento destaca la capacidad del modelo para reconocer y comprimir antipatrones de diseño de IA, marcando una mejora significativa sobre el modelo GPT-5.5, que actualmente se sitúa 18 posiciones por debajo.
- • GPT-5.6 Sol ha alcanzado el puesto número uno en el benchmark Web Design Arena.
- • El modelo demuestra una ventaja de rendimiento significativa sobre GPT-5.5, que actualmente ocupa 18 posiciones menos.
- • Los resultados del benchmark validan la capacidad del modelo para identificar y comprimir eficazmente los antipatrones de diseño de IA comunes.
Los desarrolladores que prueban el modelo GPT-5.6 Sol en la vista previa global actual pueden aprovechar su rendimiento validado de primer nivel para generar diseños web personalizados y de alta calidad.
3. OpenLLM-France lanza Luciole-23B-Instruct-1.1
LINAGORA y el consorcio OpenLLM-France han lanzado Luciole-23B-Instruct-1.1, una versión ajustada y alineada del modelo multilingüe de código abierto Luciole-23B-Base. El entrenamiento se llevó a cabo en el superordenador Jean Zay en tres fases, incluyendo un ajuste fino supervisado con y sin trazas de pensamiento, seguido de una Optimización de Preferencia Directa (DPO). La colección tiene licencia Apache 2.0 e incluye versiones de 8B y 1B de parámetros.
- • Luciole-23B-Instruct-1.1 es una versión ajustada y alineada del modelo multilingüe de código abierto Luciole-23B-Base.
- • El modelo fue desarrollado por LINAGORA y el consorcio OpenLLM-France, con financiación de BPI France.
- • El entrenamiento se realizó en el superordenador Jean Zay utilizando ajuste fino supervisado con y sin trazas de pensamiento, seguido de una alineación DPO.
- • La colección se publica bajo una licencia Apache 2.0 e incluye versiones de 23B, 8B y 1B de parámetros.
Los desarrolladores tienen acceso a un nuevo modelo multilingüe con licencia Apache 2.0 ajustado en tareas de matemáticas, ciencia, codificación y RAG.
4. OpenAI detalla la causa raíz y la mitigación del error de eliminación de archivos en GPT-5.6
Tras los informes anteriores sobre problemas de eliminación de archivos en GPT-5.6, OpenAI ha identificado que la causa raíz es un error en la variable de entorno donde el modelo sobrescribe erróneamente el directorio $HOME al intentar definir una ruta temporal. Para mitigar el riesgo, OpenAI está actualizando los mensajes para desarrolladores y proporcionando orientación sobre modos de permiso más seguros mientras prepara un análisis post-mortem completo.
- • La eliminación de archivos es causada por el modelo al sobrescribir incorrectamente la variable de entorno $HOME.
- • OpenAI está mitigando el problema actualizando los mensajes para desarrolladores y recomendando modos de permiso más seguros.
- • Se espera un análisis post-mortem detallado sobre el incidente en los próximos días.
Comprender el fallo técnico específico permite a los desarrolladores configurar mejor sus entornos y aplicar el sandboxing necesario para evitar la pérdida de datos hasta que se despliegue una solución permanente.
5. LM Studio lanza el agente de IA Bionic para modelos abiertos
LM Studio ha lanzado Bionic, una nueva aplicación de agente de IA diseñada para modelos abiertos. La plataforma admite tanto la ejecución local de modelos como la ejecución en la nube a través de LM Studio Secure Cloud, comprometiéndose a la retención cero de datos. Para tareas de codificación, Bionic puede inspeccionar bases de código locales, depurar y realizar diffs en línea, con soporte para modelos como GLM 5.2 y Kimi K2.7 Code.
- • LM Studio lanzó Bionic, una aplicación de agente de IA independiente que admite la ejecución local de modelos y la ejecución en la nube a través de LM Studio Secure Cloud.
- • Bionic cuenta con retención cero de datos y no entrena con los datos del usuario.
- • Para la codificación, puede inspeccionar bases de código locales, depurar y realizar diffs en línea utilizando modelos como GLM 5.2 y Kimi K2.7 Code.
- • Incluye un teclado de voz que utiliza el modelo Voxtral de Mistral AI para la transcripción local en tiempo real.
- • La plataforma proporciona un entorno aislado (sandboxed) para tareas de documentos con puntos de control automáticos para el control de versiones.
Los desarrolladores pueden utilizar un entorno de agente dedicado para ejecutar modelos abiertos localmente o a través de una nube segura para tareas de codificación, depuración y documentos con retención cero de datos.
6. Modal reconstruye su plataforma de sandbox para soportar 1 millón de entornos concurrentes
Modal ha reconstruido su plataforma de sandbox para soportar millones de sandboxes concurrentes y decenas de miles de creaciones de sandbox por segundo. La nueva arquitectura elimina los cuellos de botella centrales al reemplazar la coordinación global con un diseño asíncrono escalable horizontalmente utilizando flujos de Redis. Los tiempos de inicio medianos de los sandboxes son ahora inferiores a medio segundo, requiriendo solo dos saltos de red y una operación de CPU.
- • Modal reconstruyó su plataforma de sandbox para soportar millones de sandboxes concurrentes y decenas de miles de creaciones por segundo.
- • La nueva arquitectura reemplaza la coordinación global con un diseño asíncrono escalable horizontalmente utilizando flujos de Redis.
- • Los tiempos de inicio medianos de los sandboxes son ahora inferiores a medio segundo, requiriendo solo dos saltos de red y una operación de CPU.
- • Modal probó la plataforma creando con éxito 1 millón de sandboxes en menos de un minuto.
- • La nueva plataforma está actualmente disponible en versión Beta para que los usuarios puedan optar por ella.
Los desarrolladores que ejecutan cargas de trabajo de agentes pueden escalar a un número masivo de entornos de ejecución aislados y concurrentes con tiempos de inicio inferiores al segundo.
7. Perplexity lanza la plataforma de sandbox efímero SPACE para agentes
Perplexity AI ha lanzado SPACE, una plataforma de sandbox diseñada para asegurar los agentes de IA que realizan tareas sensibles. La plataforma utiliza sandboxes efímeros que se destruyen automáticamente una vez completada la tarea. SPACE gestiona y protege el acceso a las credenciales a través de un plano de control y servicios a nivel de nodo, ofreciendo características de seguridad como aislamiento de credenciales, instantáneas continuas y almacenamiento cifrado.
- • Perplexity AI lanzó SPACE, una plataforma de sandbox diseñada para la ejecución segura y eficiente de agentes de IA.
- • La plataforma utiliza sandboxes efímeros que se destruyen automáticamente al finalizar la tarea.
- • Aísla y protege las credenciales utilizando un plano de control y servicios a nivel de nodo.
- • Las características de seguridad incluyen aislamiento de credenciales, instantáneas continuas y almacenamiento cifrado.
- • SPACE admite operaciones tanto locales como fuera de línea.
Los desarrolladores pueden ejecutar tareas de agentes sensibles en entornos seguros, aislados y destruidos automáticamente para evitar la exposición de credenciales y fugas de datos.
8. 1Password se integra con Claude para el autorrelleno seguro de credenciales
1Password ha lanzado una integración de navegador que permite al chatbot Anthropic Claude utilizar credenciales de seguridad almacenadas para completar tareas. La integración utiliza un marco de seguridad de exposición cero que inyecta credenciales a través de un canal seguro, evitando que el modelo de IA vea las contraseñas reales o los códigos MFA. Los usuarios deben aprobar cada solicitud mediante un aviso biométrico, y 1Password bloquea automáticamente el acceso solo a las credenciales específicas concedidas.
- • 1Password lanzó una integración de navegador que permite al chatbot Anthropic Claude utilizar credenciales almacenadas para completar tareas.
- • Un marco de seguridad de exposición cero inyecta credenciales a través de un canal seguro, evitando que el modelo de IA vea contraseñas o códigos MFA.
- • Los usuarios deben aprobar cada solicitud de credenciales mediante un aviso biométrico, y 1Password bloquea el acceso solo a las credenciales concedidas.
- • La función está disponible para usuarios de 1Password en Mac en planes empresariales, familiares e individuales, requiriendo tanto aplicaciones de escritorio como extensiones de navegador.
- • Las futuras actualizaciones planean añadir soporte para tarjetas de pago y detalles de identidad.
Los desarrolladores pueden conceder de forma segura a los agentes de Claude acceso a credenciales seguras sin exponer contraseñas sin procesar o códigos MFA al LLM subyacente.
9. ReasonGate lanza una puerta de seguridad de inyección de prompts explicable de código abierto
ReasonGate se ha lanzado como una puerta de seguridad explicable y agnóstica al modelo, diseñada para proteger las aplicaciones LLM mediante la inspección de los prompts del usuario, el contexto recuperado y las salidas del modelo. Escrita en Python puro sin dependencias, la herramienta principal envuelve cualquier función de prompt-a-cadena e incluye detectores de normalización, inyección, inyección indirecta, riesgo de múltiples turnos y fuga de salidas.
- • ReasonGate es una puerta de seguridad explicable y agnóstica al modelo con licencia Apache-2.0.
- • La herramienta principal está escrita en Python puro sin dependencias y envuelve cualquier función de prompt-a-cadena.
- • Incluye detectores de normalización, inyección, inyección indirecta, riesgo de múltiples turnos y fuga de salidas.
- • Un motor de políticas fusiona señales para decidir si permitir, marcar o bloquear solicitudes, generando registros de auditoría estructurados y legibles por máquina.
- • Un complemento empresarial opcional proporciona detección de ML basada en incrustaciones, mientras que el núcleo sigue siendo solo de reglas.
Los desarrolladores pueden envolver cualquier LLM o pipeline RAG en una capa de seguridad ligera y autónoma para inspeccionar prompts y generar registros de auditoría estructurados.
10. Granola lanza la integración MCP para notas de reuniones
Granola ha lanzado una integración del Protocolo de Contexto de Modelo (MCP) que expone las notas de las reuniones directamente a herramientas de IA como Claude y ChatGPT. Esta integración permite a los desarrolladores automatizar flujos de trabajo, como actualizar sistemas CRM u organizar tareas en Linear, de forma asíncrona. Al utilizar MCP, los desarrolladores pueden procesar datos de reuniones sin necesidad de que los bots de IA se unan a las llamadas en vivo.
- • Granola lanzó una integración MCP que expone las notas de las reuniones a herramientas de IA como Claude y ChatGPT.
- • La integración permite flujos de trabajo automatizados, como actualizar sistemas CRM u organizar tareas en Linear.
- • Procesa las notas de forma asíncrona, eliminando la necesidad de que los bots de IA se unan a las llamadas en vivo.
- • Granola ofrece el primer mes de servicio gratis con el código TLDR1MO.
Los desarrolladores pueden conectar las notas de las reuniones directamente a sus flujos de trabajo de IA, permitiendo tareas automatizadas como actualizar CRMs o Linear sin invitar a bots a llamadas en vivo.
11. Los agentes PR de Libretto corrigen automáticamente scripts de Playwright fallidos
Saffron Health ha lanzado los agentes PR de Libretto, una biblioteca de TypeScript gratuita y de código abierto diseñada para mantener las automatizaciones de navegador Playwright. La herramienta permite que un agente abra automáticamente solicitudes de extracción en GitHub para corregir scripts de Playwright cuando fallan. Se conecta a una sesión de navegador fallida a través de CDP y utiliza una herramienta de ejecución para inyectar Playwright y JavaScript en la página para inspeccionar el fallo.
- • Saffron Health lanzó los agentes PR de Libretto, una biblioteca de TypeScript gratuita y de código abierto para mantener las automatizaciones de navegador Playwright.
- • La herramienta abre automáticamente solicitudes de extracción en GitHub para corregir scripts de Playwright cuando fallan.
- • Se integra en scripts existentes con una sola línea de código y se conecta a sesiones de navegador fallidas a través de CDP.
- • La biblioteca admite claves API de LLM proporcionadas por el usuario y funciona con cualquier proveedor de navegador, incluidas las opciones autohospedadas.
Los desarrolladores pueden integrar esta biblioteca con una sola línea de código para permitir que los agentes de IA depuren y reparen de forma autónoma las pruebas de extremo a extremo rotas.
12. Atlassian integra agentes de IA directamente en Jira
Atlassian ha introducido nuevas capacidades en Jira que permiten a los usuarios asignar tareas directamente a agentes de IA, incluyendo Claude, Cursor o GitHub Copilot. Esta integración pasa el contexto relevante de la tarea directamente desde la interfaz de Jira al agente. Atlassian afirma que estas nuevas capacidades proporcionan un 44% mejor rendimiento del agente.
- • Atlassian añadió capacidades a Jira para asignar tareas directamente a agentes de IA, incluyendo Claude, Cursor o GitHub Copilot.
- • La integración pasa el contexto relevante de la tarea directamente desde la interfaz de Jira al agente.
- • Atlassian afirma que las nuevas capacidades proporcionan un 44% mejor rendimiento del agente.
Los desarrolladores pueden recibir y ejecutar tareas de Jira directamente dentro de sus entornos de codificación nativos de IA con contexto completo.
13. Un desarrollador automatiza la gestión del backlog con Claude Code
Un desarrollador ha automatizado su proceso de gestión de backlog configurando un bucle de auto-mejora utilizando Claude Code. El sistema automatizado es capaz de realizar el triaje de tareas, descomponer tareas grandes en otras más pequeñas, implementar el código, ejecutar pruebas y abrir solicitudes de extracción. Todo el pipeline se ejecutó por un coste de aproximadamente 110 $ al mes.
- • Un desarrollador automatizó su proceso de gestión de backlog utilizando Claude Code.
- • El sistema realiza el triaje de tareas, descompone tareas grandes en otras más pequeñas, implementa código, ejecuta pruebas y abre solicitudes de extracción.
- • Todo el pipeline de auto-mejora se ejecutó por un coste de 110 $ al mes.
Los desarrolladores pueden implementar bucles automatizados similares para realizar el triaje de tareas, escribir código, ejecutar pruebas y abrir solicitudes de extracción de forma autónoma.
14. El SDK de Patter permite la creación de prototipos locales de agentes de voz
Un nuevo tutorial demuestra cómo utilizar el SDK de Patter para construir un flujo de trabajo de agente de voz para un caso de uso de reserva de restaurante. El SDK permite a los desarrolladores crear prototipos y probar agentes de voz en un entorno autónomo, definiendo variables dinámicas de llamada, registrando herramientas invocables y aplicando barandillas de salida. El tutorial también proporciona una plantilla para desplegar la lógica probada a telefonía en vivo utilizando Twilio y OpenAI Realtime.
- • El tutorial del SDK de Patter describe la construcción de un flujo de trabajo de agente de voz para un caso de uso de reserva de restaurante.
- • El flujo de trabajo admite variables dinámicas de llamada, herramientas invocables, barandillas de salida y simulación de voz a texto/texto a voz.
- • El sistema rastrea métricas de latencia y coste e incluye un arnés de evaluación determinista para pruebas de regresión.
- • La lógica prototipada puede desplegarse en telefonía en vivo utilizando Twilio y OpenAI Realtime.
Los desarrolladores pueden crear prototipos y probar agentes de voz en un entorno autónomo antes de desplegarlos en una infraestructura de telefonía en vivo como Twilio y OpenAI Realtime.
15. Lanzamiento de ReactBench v1 para evaluar agentes de codificación
ReactBench v1 se ha lanzado como un marco de evaluación diseñado para probar el rendimiento de los agentes de codificación. El marco evalúa específicamente qué tan bien manejan los agentes de codificación las tareas realistas de desarrollo en React, proporcionando a los desarrolladores un benchmark estandarizado para las capacidades de los agentes frontend.
- • ReactBench v1 es un marco de evaluación diseñado específicamente para agentes de codificación.
- • El marco prueba el rendimiento del agente en tareas realistas de desarrollo en React.
Los desarrolladores pueden utilizar este marco para comparar el rendimiento de diferentes agentes de codificación en tareas de React frontend.
16. Open Interpreter ejecuta agentes de codificación localmente
Open Interpreter proporciona un entorno de código abierto para ejecutar agentes de codificación localmente. El software está diseñado para probar tanto interfaces de aplicaciones web como nativas, permitiendo a los desarrolladores automatizar y evaluar las interacciones de la interfaz de usuario directamente en sus máquinas locales.
- • Open Interpreter ejecuta agentes de codificación localmente en la máquina del usuario.
- • El software está diseñado para probar tanto interfaces de aplicaciones web como nativas.
Los desarrolladores pueden ejecutar agentes de codificación locales para automatizar y probar interfaces de usuario sin depender de entornos alojados en la nube.
17. Los benchmarks revelan una aceleración de 6x para la decodificación especulativa DFlash en llama.cpp
Basándose en la reciente integración del soporte de decodificación especulativa DFlash en llama.cpp, nuevos benchmarks utilizando el modelo Qwen 3.6 27B en una GPU NVIDIA RTX PRO 6000 muestran ganancias de rendimiento significativas. La combinación de DFlash con redactores de búsqueda de n-gramas logró una aceleración de 6,01x para tareas de codificación iterativas, con un rendimiento que alcanzó 7,5x durante el mantenimiento de código. Estos resultados cuantifican los beneficios prácticos del soporte DFlash anunciado anteriormente, señalando que las tablas de búsqueda de n-gramas almacenadas en la RAM del host no incurren en costes adicionales de VRAM.
- • Los benchmarks que combinan DFlash y redactores de búsqueda de n-gramas en llama.cpp lograron una aceleración de 6,01x (321,5 tok/s) en una tarea de codificación iterativa de 18 turnos.
- • Las aceleraciones alcanzaron 7,5x (385 tok/s) durante los turnos de mantenimiento que involucran ediciones en código existente.
- • Los redactores de n-gramas almacenan tablas de búsqueda en la RAM del host, incurriendo en cero costes adicionales de VRAM.
- • El sistema permanece sin pérdida de salida a temperatura codiciosa porque el modelo objetivo verifica cada token redactado.
- • DFlash se recomienda para tareas de codificación estructuradas, mientras que MTP se recomienda para chat y escritura creativa.
Estos benchmarks validan el potencial de rendimiento de la integración de decodificación especulativa DFlash, mostrando que los desarrolladores pueden lograr aceleraciones sustanciales para tareas de codificación sin aumentar el uso de VRAM.
18. El rendimiento de DeepSeek V4 Flash gana un 300% tras las actualizaciones de llama.cpp
Basándose en la integración reportada anteriormente del soporte de DeepSeek V4 y las capacidades de caché KV cuantizadas en llama.cpp, las actualizaciones recientes entre las versiones b9986 y b10034 han mejorado significativamente el rendimiento de inferencia. Los usuarios que ejecutan el modelo DeepSeek-V4-Flash-UD-Q2_K_XL de 98GB en hardware de consumo —específicamente un AMD Ryzen 5 9600X con una NVIDIA RTX 4060 Ti— ahora ven aumentar las velocidades de generación de 2 a 7 tokens por segundo. Estas ganancias se lograron utilizando un tamaño de contexto de 131.072 y un modo de división basado en capas.
- • Las velocidades de generación para el modelo DeepSeek-V4-Flash-UD-Q2_K_XL de 98GB mejoraron de 2 a 7 tokens por segundo.
- • Las ganancias de rendimiento se atribuyen a las actualizaciones de llama.cpp entre las versiones b9986 y b10034.
- • Las pruebas se realizaron en hardware de consumo: AMD Ryzen 5 9600X, 138GB RAM y una NVIDIA RTX 4060 Ti (16GB VRAM).
- • La configuración utilizó una ventana de contexto de 131.072 y un modo de división basado en capas.
Estas mejoras de rendimiento hacen que ejecutar modelos masivos de alto parámetro localmente en hardware de consumo económico sea significativamente más práctico para los desarrolladores.
19. La UE ordena a Google abrir Android y Search a asistentes de IA rivales
La Comisión Europea ha emitido medidas legalmente vinculantes bajo la Ley de Mercados Digitales que requieren que Google abra Android y Google Search a plataformas de IA competidoras. Según el fallo, Google debe permitir que los asistentes de IA rivales accedan a las funciones del sistema, al hardware del dispositivo y a las interacciones de las aplicaciones en Android para julio de 2027. Además, Google debe compartir datos de búsqueda con motores de búsqueda y chatbots de IA competidores a partir de enero de 2027.
- • La UE ordenó a Google compartir datos de búsqueda para enero de 2027 e implementar cambios de interoperabilidad de Android para julio de 2027.
- • El fallo de Android exige que Google permita a los asistentes de IA rivales acceder a las funciones del sistema, al hardware del dispositivo y a las interacciones de las aplicaciones.
- • El fallo de Search requiere que Google comparta datos de búsqueda con motores de búsqueda y chatbots de IA competidores.
- • El incumplimiento podría resultar en multas de la Comisión Europea de hasta el 10 por ciento de la facturación anual mundial de Google.
Los desarrolladores de asistentes de IA alternativos como ChatGPT o Claude obtendrán una integración profunda a nivel de sistema en dispositivos Android en Europa, terminando con el acceso exclusivo de Gemini.