1. OpenBMB lanza el modelo on-device MiniCPM5-2B
MiniCPM5-2B de OpenBMB es un modelo de lenguaje causal denso altamente optimizado, diseñado para ejecutarse de manera eficiente en el dispositivo. Construido mediante un proceso de entrenamiento que incorporó 400 mil millones de tokens de ajuste fino supervisado (SFT) y destilación on-policy de 16 expertos en aprendizaje por refuerzo, el modelo logra un rendimiento sólido en el uso de herramientas, agentes de codificación y recuperación de contexto largo. Supera al modelo base Qwen3.5-4B en promedio en 34 benchmarks y demuestra una alta eficiencia de tokens, utilizando solo 19k tokens de salida por tarea en el Artificial Analysis Intelligence Index.
- • MiniCPM5-2B es un modelo denso de 2.52 mil millones de parámetros lanzado bajo la licencia Apache 2.0.
- • El modelo cuenta con una ventana de contexto nativa de 131,072 tokens y una arquitectura de 42 capas con atención de consulta agrupada (grouped-query attention).
- • Obtuvo una puntuación de 15 en el Artificial Analysis Intelligence Index v4.2, la puntuación más alta para cualquier modelo de pesos abiertos de menos de 4 mil millones de parámetros.
- • El modelo es compatible con entornos de ejecución estándar, incluidos vLLM, SGLang, Transformers, llama.cpp, Ollama, LM Studio y MLX.
- • OpenBMB lanzó los pesos del modelo junto con puntos de control intermedios y conjuntos de datos como Ultra-FineWeb y UltraX.
Este modelo ofrece a los desarrolladores una opción de pesos totalmente abiertos, eficiente en tokens y altamente capaz para flujos de trabajo de agentes locales y recuperación de contexto largo en hardware de consumo.
2. Tencent lanza los modelos de recuperación de documentos visuales EVIE
Los nuevos modelos EVIE-8B y EVIE-4.5B de Tencent abordan los desafíos de la recuperación de documentos visuales en pipelines de RAG. Al representar las páginas de documentos visualmente, preservan información crítica de diseño, tablas y tipografía que los analizadores de solo texto a menudo pierden. El modelo EVIE-4.5B está particularmente optimizado para producción, presentando elasticidad Prefix-MRL para el truncamiento dinámico de dimensiones y una agrupación avanzada que comprime las páginas hasta 32 vectores, reduciendo drásticamente los costos de almacenamiento en bases de datos vectoriales.
- • EVIE-8B logra un rendimiento de recuperación de vanguardia de 66.75 nDCG@10 en el benchmark ViDoRe V3.
- • Los modelos utilizan representaciones de 4096 dimensiones para preservar detalles finos como tipografía, gráficos y tablas.
- • EVIE-4.5B cuenta con elasticidad Prefix-MRL, lo que permite el truncamiento en tiempo de ejecución de dimensiones entre 64 y 2048.
- • EVIE-4.5B utiliza agrupamiento jerárquico aglomerativo para comprimir los conteos de tokens a 32 vectores por página.
- • La compresión reduce los requisitos de almacenamiento del índice a 3.81 GiB por millón de páginas.
Estos modelos permiten a los desarrolladores construir pipelines de RAG visual altamente precisos que preservan diseños de documentos complejos, gráficos y tablas sin una sobrecarga de almacenamiento masiva.
3. Engrim lanza un motor de memoria SQLite local-first para CLIs de IA
Creado por Tim Gordon, Engrim aborda el desafío de la fragmentación del contexto al usar múltiples asistentes de codificación de IA en la misma base de código. Al actuar como una capa de memoria universal y local-first, garantiza que las decisiones arquitectónicas y los estados del proyecto se conserven en herramientas como Cursor y Claude Code. El motor combina la búsqueda por palabras clave con incrustaciones vectoriales ligeras para una carga rápida de contexto, y su arquitectura offline-first garantiza que los metadatos sensibles de la base de código permanezcan seguros en la máquina local del desarrollador.
- • Engrim es un motor de memoria local-first con alcance de proyecto, bajo licencia MIT.
- • Admite múltiples entornos, incluidos Claude Code, Cursor, Windsurf y Google Antigravity.
- • El motor utiliza una búsqueda híbrida que combina la búsqueda por palabras clave SQLite FTS5 y las incrustaciones vectoriales estáticas model2vec.
- • Opera completamente fuera de línea, almacenando datos en un archivo SQLite con permisos restringidos en ~/.engrim/memory.db.
- • Engrim rastrea la procedencia de cada entrada de memoria para identificar qué agente o usuario la creó.
Los desarrolladores pueden usar Engrim para mantener un contexto y estado consistentes en diferentes herramientas de codificación como Claude Code, Cursor y Windsurf sin filtrar datos fuera de línea.
4. Lanzamiento del framework LLM-as-a-Verifier para retroalimentación de agentes
El framework de código abierto LLM-as-a-Verifier ofrece un método sin entrenamiento para mejorar la confiabilidad de los agentes de IA. Al generar retroalimentación detallada paso a paso, el framework permite a los desarrolladores implementar escalado en tiempo de prueba y seguimiento del progreso directamente dentro de sus pipelines de agentes. El sistema ha demostrado resultados de vanguardia en diversos dominios, incluyendo ingeniería de software y robótica, lo que lo convierte en una herramienta versátil para desarrolladores que construyen agentes complejos de múltiples pasos.
- • LLM-as-a-Verifier es un framework de propósito general sin entrenamiento disponible en GitHub.
- • El framework proporciona retroalimentación detallada para guiar y corregir flujos de trabajo de agentes.
- • Logra un rendimiento de vanguardia en benchmarks de agentes de codificación, robótica y medicina.
- • La retroalimentación del verificador se puede aplicar directamente al escalado en tiempo de prueba y al aprendizaje por refuerzo.
Los desarrolladores pueden integrar este framework para implementar escalado en tiempo de prueba, seguimiento del progreso y aprendizaje por refuerzo para sus agentes sin la sobrecarga del ajuste fino.
5. El servidor MCP de FreeCAD integra asistentes de IA con flujos de trabajo CAD
El proyecto freecad-mcp lleva el Protocolo de Contexto de Modelo al diseño asistido por computadora, permitiendo a los desarrolladores controlar FreeCAD a través de agentes de IA locales. Al configurar el servidor MCP e iniciar el servidor RPC complementario dentro de FreeCAD, los desarrolladores pueden pasar prompts de lenguaje natural a modelos locales para ejecutar tareas complejas de diseño geométrico. Además, al utilizar modelos GGUF con capacidad de visión, el asistente puede inspeccionar visualmente las capturas de pantalla de FreeCAD para verificar que sus operaciones geométricas se ejecutaron correctamente.
- • El proyecto freecad-mcp es un complemento que integra FreeCAD con asistentes de modelado de IA.
- • Admite el uso de entornos de ejecución locales como llama.cpp o pi como asistentes de modelado a través de una configuración de servidor MCP.
- • El sistema incluye un servidor RPC dentro de FreeCAD para manejar la comunicación con el asistente de IA.
- • Cargar un modelo con capacidad multimedia con la opción --mmproj permite a la IA analizar capturas de pantalla y verificar operaciones geométricas.
- • Los requisitos previos incluyen FreeCAD, llama.cpp, un modelo GGUF y el gestor de paquetes uv.
Esta integración permite a los desarrolladores construir flujos de trabajo de agentes que pueden generar, modificar y verificar modelos 3D físicos utilizando comandos de lenguaje natural.