Inference Brew

Publicados los resultados de referencia de KAT-Coder-V2.5 y detalles de AutoBuilder

00:00 / --:--

← Volver al inicio

Publicados los resultados de referencia de KAT-Coder-V2.5 y detalles de AutoBuilder

1. Publicados los resultados de referencia de KAT-Coder-V2.5 y detalles de AutoBuilder

Basándose en el reciente lanzamiento del modelo de codificación KAT-Coder-V2.5-Dev, KwaiKAT ha proporcionado datos técnicos adicionales, incluyendo puntuaciones de referencia y detalles sobre el sistema AutoBuilder. El modelo alcanzó 94.9 en PinchBench, 65.2 en SWE-Bench Pro y 60.7 en Terminal-Bench 2.1. Además, el sistema AutoBuilder, que construye entornos de repositorio para el entrenamiento, mejoró las tasas de éxito del 16.5% al 57.2% en 12 lenguajes de programación.

  • KAT-Coder-V2.5 alcanzó 94.9 en PinchBench, 65.2 en SWE-Bench Pro y 60.7 en Terminal-Bench 2.1.
  • El sistema AutoBuilder mejoró las tasas de éxito de construcción de entornos del 16.5% al 57.2%.
  • Una auditoría del proceso de entrenamiento RL redujo los fallos de la infraestructura sandbox del 16% a menos del 2%.
  • El modelo fue post-entrenado en Qwen3.6-35B-A3B utilizando 127,000 ejemplos SFT.

Estos puntos de referencia y detalles del sistema proporcionan a los desarrolladores una comprensión más clara de las capacidades del modelo y la eficacia de la infraestructura de entrenamiento utilizada para construirlo.

SOURCES

2. Lanzamiento de GigaChat Audio 10B con capacidades de conexión temporal

El equipo de GigaChat ha lanzado GigaChat Audio 10B, un modelo de mezcla de expertos (MoE) nativo de audio diseñado para procesar y razonar directamente sobre audio. Al integrar un codificador de voz Conformer con un adaptador de modalidad, el modelo puede realizar tareas complejas como respuesta a preguntas sobre audio, clasificación y uso de herramientas. Cabe destacar que sus capacidades de conexión temporal le permiten localizar eventos específicos en archivos de audio largos y generar resúmenes con marcas de tiempo precisas, abriendo nuevas posibilidades para aplicaciones de análisis de audio.

  • GigaChat Audio 10B es un LLM nativo de audio construido sobre el modelo de texto GigaChat 3.1 Lightning.
  • La arquitectura combina un codificador de voz Conformer, un adaptador de modalidad y un decodificador de mezcla de expertos.
  • El modelo admite respuesta a preguntas sobre audio, clasificación, uso de herramientas y habilidades de conexión temporal.
  • Las capacidades de conexión temporal fueron entrenadas en el conjunto de datos TimeGround-1M para permitir descripciones de eventos con marca de tiempo y localización.
  • Una demostración y los pesos del modelo están disponibles en Hugging Face, con la investigación documentada en el artículo de arXiv 2607.10387.

Proporciona a los desarrolladores un modelo nativo de audio capaz de realizar descripciones de eventos precisas con marca de tiempo y localización en archivos de audio largos.

SOURCES

3. Sakana AI expande Fugu Orchestrator con un nuevo endpoint de ciberseguridad

Tras el lanzamiento inicial de su orquestador de API Fugu en junio de 2026, Sakana AI ha ampliado la plataforma con un nuevo endpoint especializado, Fugu-Cyber. Esta adición está diseñada para tareas de ciberseguridad, incluyendo la escritura de exploits de prueba de concepto y el mapeo de técnicas MITRE ATT&CK, y ya está disponible para desarrolladores sujeto a revisión manual y restricciones regionales.

  • Fugu-Cyber fue lanzado el 21 de julio de 2026 como un nuevo endpoint para el orquestador Fugu.
  • El modelo alcanzó una tasa de éxito del 86.9% en el benchmark CyberGym.
  • El precio es de 6 dólares por millón de tokens de entrada y 36 dólares por millón de tokens de salida, con tarifas más altas para contextos superiores a 272K.
  • El acceso está restringido por revisión manual y actualmente no está disponible en la UE y el EEE.

Esta expansión proporciona a los desarrolladores una herramienta especializada para la telemetría de seguridad automatizada y el análisis de vulnerabilidades dentro del ecosistema de orquestación Fugu existente.

SOURCES

4. Cursor Bridge ejecuta la CLI de Claude Code mediante la suscripción a Cursor

Los desarrolladores que buscan aprovechar el poder de la CLI de Claude Code sin pagar por una clave de API de Anthropic por separado ahora pueden usar cursor-bridge. Esta utilidad de Rust de código abierto actúa como un proxy local, enrutando las solicitudes agénticas de Claude Code (incluyendo la edición de archivos y la ejecución de shell) directamente a través de una suscripción activa a Cursor. La herramienta maneja automáticamente la autenticación leyendo tokens del llavero de macOS o variables de entorno, ofreciendo una forma fluida y rentable de ejecutar agentes de codificación basados en terminal.

  • cursor-bridge es un binario de Rust de código abierto lanzado bajo la licencia MIT.
  • La herramienta permite a los suscriptores de Cursor ejecutar la CLI de Claude Code sin incurrir en costes adicionales de API de Anthropic.
  • Automatiza el ciclo de vida del proxy leyendo el token de autenticación de Cursor del llavero de macOS o de las variables de entorno de Linux.
  • La herramienta proporciona acceso completo a las capacidades de agente de Claude Code, incluyendo edición de archivos, comandos de shell y uso de herramientas.
  • Los requisitos previos incluyen tener instalado Cursor con la CLI del agente autenticada y la CLI de Claude Code instalada.

Permite a los desarrolladores ejecutar el agente de la CLI de Claude Code utilizando su suscripción a Cursor existente, evitando costes de API de Anthropic por separado.

SOURCES

5. World Model Optimizer lanza 'wmo serve' para la reducción de costes de agentes

El proyecto de código abierto world-model-optimizer ha introducido wmo serve, una herramienta diseñada para ayudar a los desarrolladores a optimizar y reducir el tamaño de los modelos que impulsan sus agentes de IA. Al analizar los rastros de ejecución de los agentes, la herramienta destila automáticamente las tareas repetitivas en modelos más pequeños y especializados, y gestiona el enrutamiento entre estos modelos personalizados y las API de frontera. Los desarrolladores pueden poner en marcha un endpoint local compatible con OpenAI que maneja la compactación de tokens y el entrenamiento continuo, reduciendo significativamente los costes de inferencia mientras se mantiene el rendimiento del agente.

  • El proyecto world-model-optimizer lanzó 'wmo serve', una herramienta de código abierto diseñada para mejorar continuamente los modelos especializados en agentes.
  • La herramienta enruta tareas repetitivas a modelos destilados más pequeños para mejorar el rendimiento y reducir costes.
  • Utiliza rastros de agentes para realizar destilación de modelos, enrutamiento de modelos y compactación de tokens.
  • Los usuarios pueden pasar rastros de agentes y una clave de OpenRouter para crear un endpoint local compatible con OpenAI.
  • Una versión alojada está disponible a través de una lista de espera, prometiendo endpoints de calidad de frontera con una reducción de costes del 40% o más.

Permite a los desarrolladores reducir los costes de API enrutando automáticamente las tareas repetitivas de los agentes desde modelos de frontera a endpoints locales destilados y específicos para cada tarea.

SOURCES

6. Sentient OS lanza un agente de IA local de código abierto para macOS

Sentient OS se ha lanzado como un agente de IA local gratuito y de código abierto diseñado para ejecutarse completamente en macOS. Al analizar archivos locales, capturas de pantalla y correos electrónicos durante la noche utilizando un modelo Gemma 4 personalizado, el sistema construye una base de conocimiento segura para automatizar de forma proactiva las tareas del navegador y las aplicaciones a través de su función "Sidekick". Para un razonamiento complejo, los desarrolladores pueden configurar el sistema para enrutar tareas a modelos de frontera basados en la nube, con controles de privacidad integrados que eliminan la información de identificación personal antes de que los datos salgan del dispositivo.

  • Sentient OS es una herramienta de IA local de código abierto que analiza archivos, capturas de pantalla, correos electrónicos y mensajes para ayudar a los usuarios de forma proactiva.
  • El software requiere Apple Silicon (M1 o posterior), macOS 15+ y al menos 8 GB de RAM.
  • Ejecuta inferencia diaria en el dispositivo a las 3 a.m. utilizando un modelo Gemma 4 E4B personalizado en una bifurcación de LiteRT-LM.
  • Una función 'Sidekick' automatiza tareas en aplicaciones y navegadores basándose en una base de conocimiento local.
  • El sistema admite el enrutamiento de tareas complejas a modelos de frontera como Qwen 3.7 35B o Kimi K3 a través de OpenRouter o LM Studio.
  • La privacidad se mantiene manteniendo los datos sin procesar locales y eliminando la PII de los resúmenes enviados a los endpoints de la nube.

Proporciona un marco de agente local de código abierto centrado en la privacidad que automatiza las tareas del navegador y las aplicaciones utilizando inferencia en el dispositivo.

SOURCES

7. Ruff v0.16.0 amplía las reglas predeterminadas y añade formato de bloque de código Markdown

El linter y formateador de Python basado en Rust, Ruff, ha lanzado la versión 0.16.0, introduciendo una expansión masiva de su conjunto de reglas predeterminadas a 413 reglas. Un punto destacado para los desarrolladores de IA es la nueva capacidad de formatear bloques de código Python incrustados dentro de archivos Markdown, lo que facilita el mantenimiento de fragmentos de código limpios en prompts y documentación. La actualización también mejora los flujos de trabajo de los desarrolladores al generar diffs para las correcciones propuestas de forma predeterminada y añadir comentarios de supresión más granulares.

  • Ruff v0.16.0 aumenta el número de reglas activas habilitadas por defecto de 59 a 413.
  • El lanzamiento introduce la capacidad de formatear bloques de código Python incrustados directamente dentro de archivos Markdown.
  • Los nuevos comentarios de supresión, ruff: ignore y ruff: file-ignore, permiten una supresión de diagnóstico granular.
  • Los subcomandos check y format --check ahora generan diffs para las correcciones propuestas de forma predeterminada.
  • Doce reglas han sido estabilizadas y sacadas de la vista previa, incluyendo missing-copyright-notice.

Agiliza el linting y el formato de Python, especialmente para gestionar bloques de código incrustados en archivos Markdown comunes en la documentación y los prompts de LLM.

SOURCES

8. AST-grep reescribe el núcleo de Tree-sitter en Rust para una aceleración del 30%

El proyecto ast-grep ha reescrito con éxito el núcleo C del marco de trabajo de análisis Tree-sitter en Rust, ofreciendo un aumento del 30% en la velocidad de análisis y una mejora del 22% en el rendimiento de extremo a extremo. Al utilizar un asignador de arena y eliminar las funciones de análisis incremental, el equipo también redujo el uso máximo de memoria en bases de código pesadas de más de 1 GiB a solo 91.2 MiB. Crucialmente, el nuevo núcleo mantiene una compatibilidad ABI completa con las gramáticas existentes de Tree-sitter, lo que lo convierte en una actualización directa para las herramientas que analizan bases de código para el contexto de LLM.

  • El proyecto ast-grep reescribió el núcleo C del marco de trabajo de análisis Tree-sitter en Rust.
  • El nuevo núcleo basado en Rust logra un aumento del rendimiento del 30% en el análisis y un aumento del 22% en el rendimiento de ast-grep de extremo a extremo.
  • El uso máximo de memoria en el corpus de estrés de TypeScript se redujo de más de 1 GiB a 91.2 MiB.
  • La reescritura mantiene la compatibilidad de la interfaz binaria (ABI) con las gramáticas y herramientas existentes de Tree-sitter.
  • Se eliminó el soporte para el análisis incremental y la carga nativa de gramáticas compiladas en WebAssembly para optimizar el análisis de instantáneas de archivos.

Acelera el análisis de código y el análisis de instantáneas de archivos para herramientas de desarrollo y tuberías de recopilación de contexto de LLM.

SOURCES

9. llama.cpp fusiona el soporte de visión para Minimax-M3

La base de código de llama.cpp ha integrado oficialmente el soporte para el modelo Minimax-M3, incluyendo tanto sus capacidades de visión como la arquitectura de Atención Multi-Escala (MSA). Esta fusión permite a los desarrolladores ejecutar inferencia multimodal local y eficiente en recursos en hardware de consumo. Al llevar Minimax-M3 al ecosistema de llama.cpp, los desarrolladores ahora pueden construir aplicaciones de visión a texto sin conexión sin depender de API externas.

  • El soporte de visión para el modelo Minimax-M3 se ha fusionado oficialmente en la base de código de llama.cpp.
  • La integración incluye soporte para Minimax M3 con Atención Multi-Escala (MSA).
  • La actualización permite la inferencia multimodal local acelerada por CPU y GPU para Minimax-M3.

Permite a los desarrolladores que ejecutan inferencia local a través de llama.cpp implementar flujos de trabajo de visión multimodal utilizando el modelo Minimax-M3.

SOURCES

10. Benchmark compara DeepSeek V4 Flash a través de arneses de codificación

Un benchmark de desarrollador que prueba DeepSeek V4 Flash en tres arneses de codificación populares (Claude Code, OpenCode y Pi) ha revelado que, aunque los tres producen una calidad de diff de código idéntica, sus estrategias operativas difieren enormemente. Claude Code tardó casi cuatro veces más que el arnés más rápido debido a su extensa exploración de la base de código, mientras que Pi se basó en el razonamiento y OpenCode delegó tareas. Para los desarrolladores que ejecutan modelos locales como DeepSeek V4 Flash en vLLM, elegir el arnés correcto puede afectar drásticamente la latencia de ejecución.

  • DeepSeek V4 Flash se probó en tres arneses (Claude Code, OpenCode y Pi) utilizando un benchmark de base de código.
  • La calidad de los diffs de código producidos fue idéntica en los tres arneses.
  • Claude Code tardó casi cuatro veces más que el arnés más rápido en completar las mismas tareas.
  • Los arneses utilizaron diferentes estrategias: Pi se centró en el razonamiento, OpenCode en la delegación y Claude Code en la exploración extensa de la base de código.
  • DeepSeek V4 Flash se ejecutó en vLLM a aproximadamente 180 tokens por segundo durante la evaluación.

Ayuda a los desarrolladores a elegir el arnés de ejecución más eficiente para ejecutar modelos DeepSeek en tareas de base de código sin sacrificar la calidad del código.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.