Inference Brew

DeepReinforce actualiza la familia de modelos Ornith con el lanzamiento de la versión 1.5

00:00 / --:--

← Volver al inicio

DeepReinforce actualiza la familia de modelos Ornith con el lanzamiento de la versión 1.5

1. DeepReinforce actualiza la familia de modelos Ornith con el lanzamiento de la versión 1.5

Basándose en los lanzamientos anteriores Ornith-1.0 y 2.0, DeepReinforce ha lanzado la familia de modelos Ornith-1.5. Esta actualización introduce un modelo denso de 9B, un MoE de 35B y un MoE de 397B, entrenados mediante un bucle de auto-mejora de extremo a extremo. La versión 1.5 mejora el rendimiento de las versiones anteriores, con el modelo de 397B igualando los benchmarks de Claude Opus 4.8 y el modelo de 9B ahora compatible con despliegue móvil en iOS y Android.

  • • La familia Ornith-1.5 incluye un modelo denso de 9B, un MoE de 35B y un modelo MoE de 397B.
  • • El modelo MoE de 397B iguala el rendimiento de Claude Opus 4.8 en benchmarks clave.
  • • El modelo denso de 9B incluye una versión optimizada para móviles en iOS y Android.
  • • Los modelos se entrenan utilizando un bucle de auto-mejora de extremo a extremo para la generación de tareas y el despliegue de soluciones.
  • • La familia está disponible en Hugging Face en formatos estándar y GGUF.

Este lanzamiento proporciona a los desarrolladores modelos de pesos abiertos actualizados y más capaces para razonamiento complejo y flujos de trabajo de agentes, incluyendo nuevas opciones optimizadas para móviles.

2. InclusionAI expande el ecosistema Ling-3.0 con puntos de control de modelos base

Tras el lanzamiento inicial de los pesos del modelo Ling-3.0, InclusionAI ha publicado ahora seis puntos de control de modelos base de código abierto para Ling-3.0-tiny y Ling-3.0-flash. Estos puntos de control, que abarcan etapas pre-entrenadas, entrenadas a nivel intermedio y fusionadas mediante WSM, proporcionan a los desarrolladores puntos de partida granulares para el ajuste fino personalizado y el pre-entrenamiento continuo. Los modelos utilizan Weighted Checkpoint Merging (WSM) para reemplazar la caída tradicional de la tasa de aprendizaje, con la variante Flash de 124B de parámetros demostrando un fuerte rendimiento en tareas de codificación y razonamiento.

  • • El lanzamiento incluye seis puntos de control que cubren etapas pre-entrenadas, entrenadas a nivel intermedio y fusionadas mediante WSM para Ling-3.0-tiny y Ling-3.0-flash.
  • • Ling-3.0-tiny-base tiene 7.9B de parámetros totales (1.3B activos) y supera al antiguo Ling-2.5-mini-base.
  • • Ling-3.0-flash-base tiene 124B de parámetros totales (5.1B activos) y se enfoca en tareas de codificación, razonamiento y contexto largo.
  • • El proceso de entrenamiento utiliza Weighted Checkpoint Merging (WSM) en lugar de la caída tradicional de la tasa de aprendizaje.
  • • Las versiones totalmente post-entrenadas siguen estando disponibles como Ling-3.0-tiny y Ling-3.0-flash.

Estos puntos de control intermedios ofrecen a los desarrolladores una mayor flexibilidad para el ajuste fino y el pre-entrenamiento continuo en comparación con los pesos finales lanzados anteriormente.

SOURCES

3. TrueFoundry lanza TrueForge, un arnés para agentes de IA de código abierto

TrueFoundry ha publicado TrueForge, un arnés para agentes de IA bajo licencia MIT diseñado para ayudar a los desarrolladores empresariales a construir y gestionar agentes rentables y neutrales respecto al proveedor. TrueForge emplea técnicas de ingeniería de contexto —como descargar resultados de herramientas grandes a archivos y compactar historiales de conversación— para minimizar los costos de API. Además, su arquitectura de sandbox-as-a-tool proporciona entornos aislados bajo demanda para una ejecución de código segura, ofreciendo una alternativa altamente eficiente a las plataformas de agentes gestionadas.

  • • TrueForge es lanzado bajo la Licencia MIT por TrueFoundry.
  • • Utiliza ingeniería de contexto (descargar resultados de herramientas grandes a archivos, compactar historial) para reducir el gasto en modelos.
  • • El arnés cuenta con una arquitectura de sandbox-as-a-tool que proporciona entornos aislados solo cuando es necesario.
  • • TrueFoundry afirma que TrueForge con GLM-5.2 es un 75% más barato que Claude Managed Agents con Claude Opus 4.8 en Enterprise-Bench.
  • • Puede combinarse con la AI Gateway comercial de TrueFoundry para controles de acceso y gobernanza.

Proporciona a los desarrolladores un marco neutral y rentable para desplegar y gestionar agentes de IA con sandboxing integrado y optimización de contexto.

SOURCES

4. Lanzamiento de Miles v0.1 para el post-entrenamiento de agentes a nivel de producción

Miles v0.1 ha sido lanzado como un sistema abierto para el post-entrenamiento de agentes de IA a nivel de producción. El marco permite a los desarrolladores ejecutar múltiples instancias de agentes en entornos sandbox aislados, puntuando automáticamente su rendimiento y retroalimentando los resultados en un bucle de aprendizaje por refuerzo. Miles admite entrenamiento asíncrono y actualizaciones de modelos en caliente para trabajadores activos, permitiendo la mejora continua de los agentes sin tiempo de inactividad en la tubería.

  • • Miles v0.1 es un sistema abierto para el post-entrenamiento de agentes de IA utilizando aprendizaje por refuerzo.
  • • Ejecuta múltiples copias de agentes en entornos aislados para puntuar el rendimiento de las tareas y retroalimentar los resultados al entrenamiento.
  • • El sistema permite distribuir modelos actualizados a los trabajadores sin detener la tubería de entrenamiento.
  • • Incluye componentes para despliegue, sandboxing, entrenamiento asíncrono, repetición, actualización de modelos y escalado de hardware múltiple.

Proporciona a los desarrolladores una tubería automatizada para entrenar, evaluar y desplegar continuamente modelos de agentes actualizados sin detener los flujos de trabajo de producción.

SOURCES

5. Lanzamiento de CHAP 0.2 para la colaboración auditable entre humanos y agentes

Brightbeam AI ha lanzado CHAP 0.2 (Collaborative Human-Agent Protocol), un protocolo abierto diseñado para la colaboración estructurada y auditable entre humanos y agentes de IA. CHAP almacena las ediciones humanas en borradores de agentes en sobres consultables y con hash de contenido para mantener una única fuente de verdad. El lanzamiento incluye implementaciones de referencia en Python y TypeScript, soporte para MCP y puentes de marco para bibliotecas populares como LangGraph, Pydantic AI y LlamaIndex.

  • • CHAP (Collaborative Human-Agent Protocol) 0.2 está disponible como borrador público.
  • • El protocolo almacena las ediciones humanas en borradores de agentes en sobres consultables y verificables vinculados por hash de contenido.
  • • Incluye implementaciones de referencia en TypeScript y Python, un arnés de conformidad y soporte para transportes MCP y A2A.
  • • Proporciona puentes de marco para LangGraph, Pydantic AI, AG2, LlamaIndex y Google ADK.
  • • Las características de seguridad opcionales incluyen firmas vinculadas a OIDC y anclaje en registros de transparencia externos.

Proporciona a los desarrolladores un marco estandarizado y seguro para construir flujos de trabajo de agentes con intervención humana y pistas de auditoría integradas.

SOURCES

6. Herramientas de codificación adoptan AGENTS.md para la comprensión de bases de código

Herramientas de codificación de IA, incluyendo Cursor, Codex y Amp, están adoptando un nuevo formato Markdown estandarizado llamado AGENTS.md para mejorar la comprensión de la base de código para los agentes de IA. Diseñado como una alternativa agnóstica a la herramienta al formato CLAUDE.md específico de Claude Code, AGENTS.md proporciona una forma unificada para que los desarrolladores documenten la estructura de la base de código, las pautas y el contexto específicamente para agentes de codificación autónomos.

  • • Codex, Amp y Cursor están adoptando AGENTS.md como un formato de archivo Markdown estandarizado.
  • • El formato está diseñado para proporcionar una forma unificada para que los agentes de codificación comprendan una base de código.
  • • Sirve como una alternativa agnóstica a la herramienta a CLAUDE.md, que es específico para Claude Code.

Ofrece a los desarrolladores una forma agnóstica a la herramienta para documentar sus bases de código específicamente para agentes de codificación de IA, reemplazando formatos propietarios.

SOURCES

7. Modular libera Mojo 1.0 como código abierto y expande el soporte de plataforma

Modular ha anunciado que el lenguaje de programación Mojo 1.0 es ahora completamente de código abierto bajo la licencia Apache 2.0. Junto con el lanzamiento de código abierto, Modular lanzó Modular Cloud para despliegues compartidos y dedicados y expandió el soporte de hardware de su plataforma para incluir AWS Trainium, Google TPUs y aceleradores Qualcomm. Además, la licencia MAX se ha actualizado para eliminar las restricciones de uso de dispositivos, haciendo la transición a un modelo de código disponible bajo un nuevo programa de alianza abierta.

  • • Mojo 1.0 es ahora completamente de código abierto bajo una licencia Apache 2.0.
  • • Modular Cloud está disponible públicamente en console.modular.com, ofreciendo puntos finales compartidos y despliegues dedicados.
  • • La plataforma Modular expandió el soporte de hardware a AWS Trainium, Google TPUs y aceleradores Qualcomm Cloud AI 100 y Dragonfly.
  • • Modular está colaborando con Microsoft para desarrollar soporte nativo para Windows para Mojo.
  • • La licencia MAX se actualizó para eliminar las restricciones de uso de dispositivos y será de código disponible.

Ofrece a los desarrolladores un lenguaje de alto rendimiento totalmente de código abierto para la ingeniería de sistemas de IA con una compatibilidad de hardware más amplia.

SOURCES

8. Aprovechando PostgreSQL para búsqueda vectorial y flujos de trabajo de IA

PostgreSQL continúa expandiendo su utilidad en la ingeniería de IA a través de extensiones especializadas. Al aprovechar la extensión pgvector para incrustaciones vectoriales y la extensión pgai para la indexación directa de LLM y llamadas a modelos, los desarrolladores pueden consolidar sus capas de base de datos, búsqueda vectorial e integración de LLM. Este ecosistema, combinado con soporte nativo para almacenamiento JSON, búsqueda de texto completo y almacenamiento en caché de alto rendimiento a través de tablas no registradas, permite a los equipos construir backends de IA robustos completamente dentro de una sola base de datos.

  • • La extensión pgvector permite que PostgreSQL sirva como una base de datos vectorial para flujos de trabajo de IA.
  • • La extensión pgai facilita la indexación de datos y la llamada a modelos LLM directamente dentro de PostgreSQL.
  • • PostgreSQL admite búsqueda de texto completo, almacenamiento de documentos JSON, particionamiento y expresiones de tabla comunes.
  • • Puede funcionar como un sistema de colas de alto rendimiento utilizando SELECT .. FOR UPDATE y SKIP LOCKED.
  • • Las tablas no registradas se pueden utilizar para el almacenamiento en caché de alto rendimiento no persistente.

Ayuda a los desarrolladores a simplificar su pila utilizando una base de datos única y confiable para datos relacionales, incrustaciones vectoriales e integración de LLM.

SOURCES

9. Desarrolladores lanzan herramientas para eludir las nuevas marcas de agua de Claude

Basándose en la reciente implementación de las marcas de agua SynthID-Text de Google en los modelos de Claude, los desarrolladores ya han creado métodos para eludir la tecnología. A las cuatro horas del lanzamiento, el desarrollador Guillaume Meyer lanzó una herramienta de anulación de código abierto diseñada para eliminar las marcas de agua. Otros métodos de elusión identificados por la comunidad incluyen parafrasear, traducir o reordenar el texto, destacando la tensión continua entre los esfuerzos de procedencia de la IA y la modificación por parte del usuario.

  • • Anthropic implementó recientemente marcas de agua SynthID-Text en los modelos de Claude para cumplir con la Ley de IA de la UE.
  • • El desarrollador Guillaume Meyer lanzó una herramienta de código abierto para eliminar estas marcas de agua a las cuatro horas del anuncio.
  • • Los miembros de la comunidad han identificado técnicas de elusión adicionales, incluyendo el reordenamiento de texto y la traducción.
  • • Anthropic sostiene que las marcas de agua no afectan la calidad de la respuesta y planea lanzar una API de detección.

Demuestra la respuesta inmediata de la comunidad a la nueva implementación de marcas de agua de Anthropic y proporciona a los desarrolladores herramientas para eliminar identificadores sintéticos de las salidas de los modelos.

SOURCES

10. Inco AI lanza DFlash 2, basándose en la investigación original de decodificación especulativa

Basándose en la investigación original de decodificación especulativa DFlash, Inco AI ha lanzado DFlash 2. Esta actualización introduce un selector de ruta ligero y un módulo de convolución local para mitigar la degradación del sufijo, añadiendo 16.5 millones de parámetros mientras aumenta el rendimiento entre un 16% y un 25% sobre el DFlash original. La tecnología ya está disponible para su integración, con soporte añadido a llama.cpp y vLLM, permitiendo que Qwen3.8-27B alcance hasta 3.4 veces el rendimiento de la decodificación autorregresiva estándar.

  • • DFlash 2 mejora el rendimiento entre un 16% y un 25% sobre el DFlash original.
  • • Las nuevas características incluyen un selector de ruta ligero y un módulo de convolución local de 16.5M de parámetros para abordar la degradación del sufijo.
  • • Inco AI lanzó borradores de DFlash 2 para Qwen3.8-27B y Muse Glimmer de Meta en Hugging Face.
  • • La solicitud de extracción #27342 de Llama.cpp añade soporte para DFlash 2, mostrando una aceleración de hasta 3x para Qwen3.8-27B en una RTX 6000.
  • • Una implementación basada en vLLM alcanzó 138 tokens por segundo para solicitudes de usuario único en una RTX 3090.

Proporciona una mejora de rendimiento significativa para los desarrolladores que ya utilizan el marco de decodificación especulativa DFlash para la inferencia local de LLM.

11. Unsloth lanza cuantizaciones GGUF dinámicas v3.0

Unsloth ha introducido su formato de cuantización dinámica v3.0, lanzando modelos GGUF actualizados para Qwen3.8-27B. El nuevo método de cuantización aprovecha un conjunto de datos de calibración imatrix refinado para optimizar el rendimiento en codificación de agentes, chat y multilingüe. Al evitar QAT y QAD, Unsloth ofrece una mejora de precisión del 10% sobre las versiones anteriores, incluyendo una cuantización ultra baja de 1 bit que conserva más del 70% de precisión en hardware con solo 8GB de RAM.

  • • Los GGUFs dinámicos v3.0 son compatibles con llama.cpp y Unsloth Desktop.
  • • El método de cuantización utiliza un conjunto de datos de calibración imatrix de alta calidad refinado para tareas de codificación de agentes, chat y multilingües.
  • • El proceso se basa completamente en la cuantización post-entrenamiento sin entrenamiento consciente de la cuantización (QAT) o destilación consciente de la cuantización (QAD).
  • • Un nuevo quant UD-IQ1_S de 1 bit tiene un tamaño de 6.2GB, conserva entre el 72% y el 77% de precisión y puede ejecutarse en 8GB de RAM.
  • • Unsloth eliminó el módulo MTP de los quants más pequeños bajo UD-Q2_K_XL para ahorrar aproximadamente 500MB de espacio en disco.

Permite a los desarrolladores ejecutar modelos cuantizados de alta precisión localmente en hardware de consumo con huellas de memoria mínimas.

12. FreeToken permite un servicio eficiente de MoE local

Los investigadores han introducido FreeToken, una tecnología diseñada para el servicio eficiente y nativo de borde de modelos de Mezcla de Expertos (MoE). Al reasignar dinámicamente expertos, el estado del modelo, las cargas de trabajo de CPU/GPU y la reutilización del estado del agente para que coincidan con la memoria y el ancho de banda disponibles de la máquina anfitriona, FreeToken permite que el hardware de consumo ejecute modelos masivos. El sistema admite más de 20 modelos MoE, que van desde modelos de 35B en una GPU de portátil de 8GB hasta un modelo GLM de 753B en una sola GPU de estación de trabajo.

  • • FreeToken reasigna dinámicamente expertos, estado del modelo, trabajo de CPU/GPU y reutilización del estado del agente según la memoria disponible.
  • • La tecnología admite más de 20 modelos MoE.
  • • Las configuraciones admitidas van desde ejecutar modelos de 35B en una GPU de portátil de 8GB hasta un modelo GLM de 753B en una sola GPU de estación de trabajo.

Permite a los desarrolladores ejecutar modelos MoE masivos localmente en estaciones de trabajo o portátiles estándar optimizando la memoria y el ancho de banda.

SOURCES

13. Motor de software permite FP4/FP8 nativo en GPUs Tesla V100

Un desarrollador ha lanzado 'v100-skinny', un motor de software diseñado para ejecutar pesos de modelo NVFP4 y FP8 de forma nativa en GPUs Tesla V100 de generación Volta. Al utilizar núcleos de Red de Procesamiento Cuantizado (QPN) personalizados, el motor traduce pesos de baja precisión a formatos FP16 compatibles con los Tensor Cores de Volta, evitando la falta de soporte nativo de FP4/FP8 del hardware. En pruebas con Qwen 3.8, un clúster de cuatro V100s alcanzó 219.1 tokens por segundo, igualando el rendimiento de decodificación de solicitud única de una RTX 5090 moderna.

  • • El motor 'v100-skinny' permite que cuatro GPUs Tesla V100 alcancen un rendimiento de decodificación de 219.1 tokens por segundo en Qwen 3.8.
  • • El rendimiento iguala la velocidad de decodificación de solicitud única de una RTX 5090 ejecutando el motor NInfer.
  • • El sistema utiliza núcleos de Red de Procesamiento Cuantizado (QPN) para traducir pesos FP4 y FP8 a formatos FP16 compatibles con los Tensor Cores de Volta.
  • • La versión 1.1 proporciona rutas de ejecución SM70 específicas para mantener intacta la asignación mixta FP4/FP8 del modelo.
  • • La configuración se construyó utilizando cuatro GPUs V100 adquiridas por aproximadamente A$600 en costos de hardware.

Permite a los desarrolladores reutilizar GPUs empresariales antiguas y baratas para igualar el rendimiento de decodificación de solicitud única de las tarjetas insignia modernas.

SOURCES

14. OpenAI prueba el procesamiento de seguridad privado para retención de datos cero

OpenAI ha comenzado a probar el Procesamiento de Seguridad Privado con clientes empresariales seleccionados. Esta nueva técnica está diseñada para detectar patrones de uso indebido y violaciones de seguridad mientras preserva completamente las protecciones de retención de datos cero (ZDR), permitiendo a las organizaciones con necesidades de cumplimiento estrictas aprovechar los modelos de frontera de OpenAI de forma segura.

  • • La técnica se llama Procesamiento de Seguridad Privado.
  • • Está diseñada para identificar patrones de uso indebido mientras preserva las protecciones de retención de datos cero.
  • • La función se está probando actualmente con clientes empresariales tempranos.
  • • Permite a las empresas utilizar los modelos más avanzados de OpenAI sin requerir que OpenAI retenga sus datos.

Permite a los desarrolladores en industrias altamente reguladas utilizar modelos avanzados de OpenAI sin comprometer los estrictos requisitos de privacidad y retención de datos.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.