1. Microsoft lanza la familia de modelos MAI, encabezada por el modelo de razonamiento MAI-Thinking-1
En Build 2026, Microsoft presentó siete nuevos modelos de IA internos, lo que marca un cambio hacia el desarrollo de modelos propietarios. El modelo insignia, MAI-Thinking-1, es un modelo de razonamiento de 35B de parámetros entrenado desde cero con datos limpios que iguala a los modelos líderes en benchmarks de ingeniería de software. Para los desarrolladores, el lanzamiento también introduce MAI-Code-1-Flash, que está integrado directamente en VS Code y GitHub Copilot, y MAI-Transcribe-1.5, un modelo de voz a texto excepcionalmente rápido disponible en Microsoft Foundry.
- • MAI-Thinking-1 es un modelo de razonamiento de tamaño mediano con 35 mil millones de parámetros activos y una ventana de contexto de 128K, entrenado desde cero con datos limpios.
- • MAI-Code-1-Flash es un modelo de codificación eficiente en inferencia integrado en GitHub Copilot y Visual Studio Code.
- • MAI-Transcribe-1.5 es un modelo de transcripción de voz que alcanza un factor de velocidad de aproximadamente 276x en tiempo real y una tasa de error de palabra del 2.4% en el leaderboard de Artificial Analysis.
- • MAI-Transcribe-1.5 tiene un precio de $6 por cada 1,000 minutos de audio a través de Microsoft Foundry y admite 43 idiomas.
- • Otros modelos incluyen MAI-Image 2.5 para texto a imagen y MAI-Voice-2 con 15 nuevos idiomas.
Los desarrolladores obtienen acceso a un nuevo conjunto de modelos especializados de Microsoft integrados directamente en herramientas como GitHub Copilot y Visual Studio Code.
2. Alibaba lanza el modelo de agente multimodal Qwen3.7-Plus
El equipo de Qwen de Alibaba ha lanzado Qwen3.7-Plus, un modelo multimodal de código cerrado optimizado para flujos de trabajo de agentes. El modelo integra capacidades de visión y lenguaje para actuar como un agente híbrido que puede combinar interacciones GUI y CLI. Cuenta con una ventana de contexto de 1M de tokens con 256K tokens dedicados a la cadena de pensamiento interna, respaldado por un nuevo parámetro de API 'preserve_thinking' para mantener el estado de razonamiento entre turnos. La entrada estándar tiene un precio altamente competitivo de $0.40 por millón de tokens.
- • Qwen3.7-Plus tiene un precio de $0.40 por millón de tokens de entrada y $0.04 por millón de tokens de lectura en caché.
- • El modelo cuenta con una ventana de contexto de 1 millón de tokens, incluidos 256K tokens para el procesamiento interno de cadena de pensamiento.
- • Un nuevo parámetro de API 'preserve_thinking' permite a los desarrolladores mantener bucles de lógica interna en conversaciones de múltiples turnos.
- • El modelo es propietario, de código cerrado y accesible a través de los endpoints internacionales de la plataforma Bailian (Model Studio) de Alibaba Cloud.
- • Obtuvo 70.3 en Terminal Bench 2.0-Terminus y 79.0 en ScreenSpot Pro, ocupando el puesto 16 en general en el LM Arena Vision Arena.
Los desarrolladores pueden crear bucles de agentes multimodales complejos que combinan interfaces visuales y de línea de comandos a un costo significativamente menor que los modelos anteriores.
3. Microsoft introduce el sandbox a nivel de SO MXC para agentes de IA
Microsoft ha introducido Microsoft Execution Containers (MXC), una capa de seguridad diseñada para ejecutar agentes de IA de forma segura en Windows. MXC permite a los desarrolladores definir límites de acceso que se aplican a nivel de kernel del SO en tiempo de ejecución, aislando la ejecución del agente del escritorio, el portapapeles y los dispositivos de entrada del usuario para evitar la suplantación de UI y la inyección de entrada. El sistema admite una variedad de opciones de sandboxing, desde aislamiento de procesos ligero hasta micro-VMs, y actualmente está disponible en vista previa temprana con soporte para SDK.
- • MXC proporciona una capa de ejecución basada en políticas para agentes de IA aplicada a nivel de kernel del SO Windows en tiempo de ejecución.
- • El espectro de sandbox varía desde el aislamiento de procesos ligero hasta micro-máquinas virtuales e instancias completas en la nube.
- • MXC aísla la ejecución del agente del escritorio, el portapapeles, la UI y los dispositivos de entrada del usuario.
- • Cada agente está vinculado a una identidad local o respaldada por Microsoft Entra para fines de auditoría y gobernanza.
- • Socios como OpenAI, Nvidia, Manus, Nous Research y OpenClaw están integrando MXC en sus marcos de trabajo.
- • MXC está actualmente disponible en vista previa temprana para que los desarrolladores prueben políticas de contención y construyan sobre el SDK.
Los desarrolladores pueden crear y ejecutar agentes autónomos con límites de seguridad estrictos aplicados por el kernel, mitigando riesgos como la suplantación de UI y la inyección de entrada.
4. Microsoft lanza el marco de evaluación de IA de código abierto ASSERT
Microsoft ha liberado ASSERT (Adaptive Spec-driven Scoring for Evaluation and Regression Testing), un marco diseñado para simplificar las pruebas de aplicaciones de IA. ASSERT utiliza IA para traducir descripciones en lenguaje natural de objetivos, políticas o restricciones en casos de prueba estructurados y puntuados. Durante la ejecución, el marco registra las acciones intermedias y las llamadas a herramientas del sistema objetivo, lo que permite a los desarrolladores inspeccionar los puntos de falla y aplicar políticas de agente personalizadas mediante archivos de política portátiles.
- • ASSERT (Adaptive Spec-driven Scoring for Evaluation and Regression Testing) es un marco de código abierto.
- • Convierte descripciones en lenguaje natural de objetivos, políticas o comportamientos en pruebas estructuradas y puntuadas.
- • El marco genera escenarios de problemas, los ejecuta contra un sistema objetivo y registra las acciones intermedias y las llamadas a herramientas.
- • Los desarrolladores pueden personalizar las evaluaciones proporcionando contexto del sistema, herramientas y restricciones.
- • Permite a los equipos definir políticas de agente personalizadas utilizando archivos de política portátiles.
Los desarrolladores pueden crear fácilmente pruebas de regresión repetibles y evaluaciones de comportamiento para sus aplicaciones de IA utilizando texto plano.
5. Mistral lanza el kit de herramientas de búsqueda de código abierto en vista previa pública
Mistral ha lanzado su Search Toolkit en vista previa pública. El marco de código abierto está diseñado para agilizar los pipelines de IA de producción unificando la ingesta, recuperación y evaluación de datos dentro de una interfaz única y compartida, facilitando a los desarrolladores la creación y evaluación comparativa de sistemas RAG.
- • Search Toolkit se lanza en vista previa pública.
- • Es un marco de código abierto.
- • Unifica la ingesta, recuperación y evaluación de datos dentro de una interfaz compartida.
Proporciona una interfaz estandarizada de código abierto para construir y evaluar pipelines RAG de producción.
6. Perplexity introduce el SDK Search as Code para búsqueda agentica
Perplexity ha introducido Search as Code (SaC), un SDK diseñado para modernizar las arquitecturas de búsqueda para aplicaciones de IA. SaC se aleja de los sistemas de búsqueda monolíticos al dar a los modelos de IA control directo sobre el proceso de búsqueda, permitiéndoles configurar dinámicamente pipelines de búsqueda adaptados a tareas específicas. Perplexity informa que este enfoque de búsqueda agentica mejora el rendimiento y la eficiencia de costos, superando a la competencia en benchmarks complejos como WANDR.
- • Search as Code (SaC) proporciona un SDK para el control directo del modelo sobre el proceso de búsqueda.
- • Los modelos pueden configurar pipelines de búsqueda adaptados a tareas específicas.
- • SaC ha superado a la competencia en benchmarks, particularmente en tareas complejas como WANDR.
- • Perplexity posiciona a SaC como una capacidad de búsqueda agentica robusta y rentable.
Permite a los desarrolladores construir pipelines de búsqueda altamente personalizados y específicos para tareas, controlados directamente por LLMs, superando a los sistemas de búsqueda monolíticos.
7. TinyFish lanza BigSet, un sistema de extracción de datos multi-agente de código abierto
TinyFish ha lanzado BigSet, un sistema multi-agente de código abierto con licencia AGPL-3.0 diseñado para generar conjuntos de datos estructurados a partir de descripciones en lenguaje natural. Operando a través de Docker, BigSet utiliza una arquitectura de dos niveles donde un modelo de inferencia de esquema define la estructura de datos y un orquestador coordina sub-agentes paralelos para extraer datos. El sistema cuenta con actualizaciones programadas, exportaciones a CSV/XLSX y protege contra la inyección de prompts aislando el ID del conjunto de datos en un cierre de JavaScript.
- • BigSet es un sistema multi-agente de código abierto con licencia AGPL-3.0.
- • Utiliza una arquitectura de agentes de dos niveles: un modelo de inferencia de esquema define la estructura y un agente orquestador gestiona sub-agentes paralelos para la extracción.
- • El sistema admite actualizaciones programadas de conjuntos de datos (desde 30 minutos hasta semanalmente) y exportaciones a CSV o XLSX.
- • Es autohospedado a través de Docker y requiere claves de API para TinyFish, OpenRouter y Clerk.
- • La inyección de prompts se evita capturando el ID del conjunto de datos en un cierre de JavaScript inaccesible para el LLM.
Los desarrolladores pueden implementar un sistema de agentes paralelizado y autohospedado para extraer y actualizar datos estructurados de fuentes web con protección integrada contra inyección de prompts.
8. Microsoft presenta Surface RTX Spark Dev Box para desarrollo local de IA
Microsoft ha anunciado Surface RTX Spark Dev Box, una PC de escritorio en miniatura diseñada para trasladar las cargas de trabajo de IA de los precios por token basados en la nube al hardware local de costo fijo. Impulsado por el procesador RTX Spark basado en Arm con arquitectura Blackwell de Nvidia, el dispositivo ofrece un petaflop de cómputo de IA y cuenta con 128GB de memoria unificada, lo que permite a los desarrolladores ejecutar modelos que superan los 120 mil millones de parámetros localmente. La unidad ejecuta Windows 11 Pro y viene preconfigurada con herramientas esenciales para desarrolladores, incluyendo WSL 2, VS Code y Python.
- • Surface RTX Spark Dev Box cuenta con el procesador RTX Spark con arquitectura Blackwell de Nvidia y 128GB de memoria unificada.
- • Está clasificado en un petaflop de cómputo de IA y diseñado para ejecutar modelos que superan los 120B de parámetros localmente.
- • El dispositivo cuenta con un envolvente térmico de 100 vatios con un chasis de metal impreso en 3D enfriado pasivamente que actúa como disipador de calor.
- • Se envía con Windows 11 Pro preconfigurado con WSL 2, VS Code, GitHub Copilot, Git, Python y Node.js.
- • Estará disponible en los EE. UU. a través de Microsoft.com más adelante en 2026; el precio aún no se ha revelado.
Proporciona a los desarrolladores una opción de hardware local dedicada capaz de ejecutar modelos con hasta 120 mil millones de parámetros, evitando los costos por token de la nube.
9. OpenAI actualiza la plataforma Codex con sitios y complementos específicos para roles
OpenAI ha lanzado una actualización significativa de su plataforma de IA agentica Codex, introduciendo funciones destinadas a agilizar la edición de documentos y la creación de aplicaciones. La actualización presenta 'Sites', una herramienta en vista previa para los niveles Business y Enterprise que convierte texto o datos estáticos en aplicaciones web interactivas alojadas por OpenAI. Además, una nueva herramienta de 'Anotaciones' permite la edición localizada de secciones específicas de documentos para evitar la regeneración completa del documento, mientras que seis nuevos complementos específicos para roles agrupan integraciones para tareas como análisis de datos y diseño de productos.
- • La nueva función Sites (en vista previa para Business/Enterprise) convierte datos estáticos o documentos de texto en aplicaciones internas funcionales alojadas en la web por OpenAI.
- • La herramienta de Anotaciones permite la edición localizada de documentos (hojas de cálculo, diapositivas) sin regeneración completa del documento.
- • Seis categorías de complementos específicos para roles agregan 62 aplicaciones empresariales y 110 habilidades automatizadas (por ejemplo, análisis de datos, diseño de productos).
- • Las funciones son accesibles a través de la CLI de Codex y la aplicación de escritorio bajo la licencia empresarial propietaria de OpenAI.
- • El precio está integrado en los niveles de suscripción existentes ($20/mes Plus, $100/mes Pro) o un modelo de pago por uso sin asiento.
Los desarrolladores y equipos empresariales pueden crear y compartir aplicaciones web interactivas alojadas directamente a partir de datos y documentos estáticos.
10. Cursor aumenta los límites de los equipos e introduce el asiento Premium
Cursor ha anunciado actualizaciones de su plan de Equipos, ampliando los límites de uso para adaptarse mejor a los flujos de trabajo de desarrollo intensivos. La compañía ha introducido un nuevo nivel de asiento Premium adaptado específicamente para usuarios intensivos de agentes, junto con nuevos controles de gasto administrativo para ayudar a los equipos a gestionar y monitorear sus costos de uso.
- • Cursor aumentó los límites de uso para su plan de Equipos.
- • Introdujo un nuevo asiento Premium diseñado específicamente para usuarios intensivos de agentes.
- • Agregó nuevos controles de gasto para que los administradores gestionen el uso.
Los equipos que utilizan Cursor para flujos de trabajo de codificación agentica intensivos obtienen límites más altos y mejores controles de gestión de costos.
11. Kapa comparte estrategia de procesamiento de imágenes en tiempo de indexación para RAG
Kapa ha compartido detalles sobre su estrategia de indexación de imágenes para sistemas RAG que manejan documentación técnica. En lugar de realizar un costoso procesamiento multimodal en el momento de la consulta (que a menudo alcanza los límites de carga útil), Kapa utiliza un modelo de visión para describir las imágenes en el momento de la indexación, almacenando los subtítulos como fragmentos de texto separados. Este enfoque reduce la sobrecarga por consulta a solo el 1% al 6% de los sistemas de solo texto, filtra imágenes no esenciales con un clasificador zero-shot y logró una colocación correcta de imágenes del 94% al 99% en proyectos iniciales de clientes.
- • Kapa procesa imágenes en el momento de la indexación utilizando un modelo de visión para generar descripciones de texto, en lugar de procesar imágenes en el momento de la consulta.
- • Este método reduce la sobrecarga por consulta al 1% al 6% en comparación con los sistemas de solo texto y evita los límites de carga útil en el momento de la consulta.
- • Se utiliza un clasificador zero-shot para filtrar imágenes no esenciales como logotipos y banners.
- • La calidad de los subtítulos se mejora proporcionando al modelo de visión el contexto de texto circundante.
- • Almacenar subtítulos como fragmentos separados es más rentable que incrustarlos en línea.
Proporciona un patrón arquitectónico altamente rentable y confiable para los desarrolladores que construyen sistemas RAG sobre documentación técnica rica en imágenes.
12. Microsoft anuncia Microsoft IQ y el SDK Rayfin para Fabric
Para abordar los silos de datos y los desafíos de contexto en la IA empresarial, Microsoft ha anunciado Microsoft IQ y el SDK de código abierto Rayfin. Microsoft IQ unifica el contexto a través de fuentes de Trabajo, Foundry, Fabric y Web. El SDK y la CLI de Rayfin permiten a los desarrolladores implementar aplicaciones creadas por agentes directamente en Microsoft Fabric, enrutando los datos de la aplicación hacia Microsoft OneLake para mantener un backend de producción gobernado.
- • Microsoft IQ unifica cuatro fuentes de contexto: Work IQ, Foundry IQ, Fabric IQ y Web IQ.
- • Rayfin es un SDK y CLI de código abierto diseñado para implementar aplicaciones creadas por agentes directamente en Microsoft Fabric.
- • Rayfin enruta los datos de la aplicación hacia Microsoft OneLake para evitar silos de datos fuera de la capa de contexto de la organización.
- • Se espera que las ontologías dentro de Fabric IQ alcancen disponibilidad general en los próximos meses.
Los desarrolladores que crean agentes empresariales pueden evitar los silos de datos enrutando los datos de la aplicación directamente hacia un backend de OneLake gobernado.
13. El libro de cocina de OpenAI guía los flujos de trabajo de producción en Amazon Bedrock
El libro de cocina de OpenAI ha lanzado una nueva guía que detalla cómo construir flujos de trabajo de producción con modelos de OpenAI alojados en Amazon Bedrock. El tutorial utiliza la API de Respuestas para demostrar características clave para desarrolladores como salidas estructuradas, llamadas a herramientas y entradas de archivos, al tiempo que cubre las mejores prácticas operativas como la gestión de estado y el almacenamiento en caché de prompts.
- • La guía demuestra la construcción de flujos de trabajo de producción utilizando modelos de OpenAI alojados en Amazon Bedrock.
- • Utiliza la API de Respuestas para mostrar salidas estructuradas, llamadas a herramientas y entradas de archivos.
- • Cubre las mejores prácticas operativas, incluyendo la gestión de estado y el almacenamiento en caché de prompts.
Proporciona patrones de código concretos y procesables para implementar salidas estructuradas, llamadas a herramientas y almacenamiento en caché de prompts en Bedrock.
14. Gemma 4 E4B logra una aceleración de 2.4x con el motor LiteRT
Un benchmark de la comunidad ha demostrado que ejecutar modelos Gemma 4 E4B en el motor LiteRT de Google produce una aceleración de 2.4x en la generación de texto en comparación con el formato llama.cpp GGUF. Probado en una NVIDIA 4060ti, el modelo LiteRT-LM 4B con predicción de múltiples tokens alcanzó 157.2 tokens por segundo. Aunque hay un contenedor de Python disponible en GitHub para exponer un endpoint compatible con OpenAI, los desarrolladores deben tener en cuenta las limitaciones actuales del motor, incluyendo salidas deterministas, falta de procesamiento por lotes de solicitudes y soporte solo para Linux.
- • Las pruebas en una GPU NVIDIA 4060ti mostraron que LiteRT-LM 4B con predicción de múltiples tokens (MTP) alcanzó 157.2 tok/s, en comparación con 66.3 tok/s para llama.cpp GGUF.
- • El rendimiento del subtitulado de imágenes mostró una aceleración menor de 1.1x, limitada por el codificador de visión.
- • Se desarrolló un contenedor de Python para crear un endpoint compatible con OpenAI para el modelo LiteRT, disponible en GitHub.
- • Las limitaciones actuales de LiteRT-LM incluyen salida determinista independientemente de la temperatura, operación de sesión única, falta de procesamiento por lotes de solicitudes y soporte solo para Linux.
Los desarrolladores que ejecutan modelos locales en Linux pueden aprovechar LiteRT y la predicción de múltiples tokens para reducir significativamente la latencia de inferencia.
15. Benchmark evalúa 20 LLMs pequeños en una GPU de 6GB para tareas repetitivas
Un desarrollador ha publicado un benchmark evaluando 20 LLMs pequeños en una GPU económica RTX 4050 de 6GB para tareas repetitivas como la organización de archivos y el triaje de registros. El estudio probó modelos en llamadas a herramientas, rigor de JSON y adherencia a instrucciones, encontrando que todos los modelos sufrieron una caída de velocidad del 20% al 35% al escalar el contexto de 1k a 32k tokens. LFM2.5-1.2B-Instruct fue destacado como una opción rápida y de bajo VRAM, Granite-4.1-3B como una base sólida y LFM2.5-8B-A1B de LiquidAI como el mejor orquestador.
- • La evaluación probó 20 modelos pequeños en una GPU de 6GB utilizando un conjunto de 6 sondas para llamadas a herramientas, rigor de JSON, adherencia a instrucciones y alucinación de rutas.
- • Todos los modelos experimentaron una reducción del 20% al 35% en la velocidad de generación cuando el contexto escaló de 1k a 32k tokens.
- • LFM2.5-1.2B-Instruct fue identificado como una opción rápida y de bajo VRAM, mientras que Granite-4.1-3B (instruct) sirvió como base de calidad por VRAM.
- • La compilación liquidai de LFM2.5-8B-A1B fue seleccionada como el mejor orquestador, superando a los modelos densos de 8B en velocidad y contexto utilizable.
- • Los ajustes finos de terceros exhibieron frecuentemente problemas como nombres de funciones alucinados y plantillas de chat rotas.
Proporciona puntos de referencia concretos de rendimiento y calidad para los desarrolladores que seleccionan modelos pequeños y locales para tareas de automatización en segundo plano.
16. Desarrollador evalúa Qwen3.6-27B como orquestador multi-agente local
Un desarrollador compartió una evaluación de dos semanas de reemplazar a Claude con un modelo local Qwen3.6-27B (cuantización Q6_K en una RTX 3090) en un orquestador multi-agente a través de 47 flujos de trabajo de codificación. Aunque Qwen logró un 95% de validez de esquema para la generación de planes, exhibió una tasa de error de formato del 12% en llamadas a herramientas JSON (en comparación con el 0.5% de Claude) y sufrió deriva de contexto largo después de 14K tokens. El autor concluyó que Qwen3.6-27B es viable para sistemas multi-agente locales solo si se combina con la aplicación de salida estructurada y lógica de re-planificación en caso de falla.
- • Qwen3.6-27B (cuantización Q6_K, 22GB VRAM en RTX 3090) se probó durante dos semanas en el orquestador OpenYabby a través de 47 flujos de trabajo de codificación de varios pasos.
- • El modelo logró un 95% de validez de esquema para la generación de planes y extrajo hechos con éxito cada 6 turnos.
- • Exhibió una tasa de error de formato del 12% en llamadas a herramientas JSON, en comparación con el 0.5% con Claude.
- • Un proceso de revisión automática utilizando una segunda instancia de Qwen detectó aproximadamente el 60% de los errores que Claude habría identificado.
- • El modelo sufrió deriva de contexto largo después de 14k tokens y no detectó fallas de sub-agentes en 3 de 47 ejecuciones.
Destaca las limitaciones prácticas y las salvaguardas necesarias (como la aplicación de salida estructurada) al reemplazar APIs comerciales con modelos locales para flujos de trabajo de agentes.
17. Optimización de DeepSeek-V4-Flash en aceleradores AMD MI300X
Un análisis técnico detalla el proceso de implementación de DeepSeek-V4-Flash en el acelerador MI300X de AMD, que ofrece 192GB de memoria HBM3 a un precio de alquiler más bajo que el hardware equivalente de Nvidia. Debido a que el MI300X utiliza el dialecto FP8 'fnuz', que es incompatible con el FP8 estándar OCP utilizado en chips AMD más nuevos, los desarrolladores implementaron soluciones de software personalizadas y ayudantes específicos de ROCm. Estas optimizaciones resolvieron problemas de compatibilidad en vLLM y lograron un rendimiento de alto rendimiento de 2,699 tokens de salida por segundo por GPU.
- • El AMD MI300X cuenta con 192GB de memoria HBM3, más del doble de la capacidad de 80GB del NVIDIA H100.
- • Ejecutar vLLM con DeepSeek-V4-Flash en el MI300X requirió soluciones de software personalizadas debido a incompatibilidades de dialecto FP8.
- • El MI300X utiliza el dialecto FP8 'fnuz', que difiere en el sesgo de exponente del FP8 estándar OCP utilizado en chips AMD más nuevos.
- • Se requirieron ayudantes específicos de ROCm debido a la cobertura desigual en la biblioteca de kernels ajustados AITER de AMD.
- • Las optimizaciones lograron 2,699 tokens de salida por segundo por GPU, lo que representa una mejora del rendimiento del 8.6%.
Permite el alojamiento local de alto rendimiento y rentable de modelos DeepSeek en hardware AMD fácilmente disponible.
18. Comparación de desarrolladores de APIs de búsqueda web para análisis RAG local
Una discusión comunitaria ha compilado evaluaciones de APIs de búsqueda web optimizadas para devolver Markdown limpio y libre de ruido para el análisis RAG local. La API LLM Context de Brave Search y Exa (anteriormente Metaphor) fueron destacadas por proporcionar fragmentos de Markdown preformateados directamente, mientras que la API Extract de Parallel AI fue señalada por comprimir páginas con mucho JavaScript. Otras herramientas discutidas incluyen el índice de desarrolladores de You.com, Tavily y convertidores de URL a Markdown como Firecrawl y Jina Reader.
- • Brave Search ofrece una API LLM Context que devuelve fragmentos de Markdown preformateados y clasificados por relevancia.
- • Parallel AI proporciona una API Extract diseñada para comprimir páginas con mucho JavaScript en Markdown denso en tokens.
- • La API de You.com ofrece un índice de desarrolladores con salida Markdown sin procesar.
- • Exa (anteriormente Metaphor) cuenta con extracción nativa de Markdown creada específicamente para LLMs.
- • Tavily es popular pero recibió comentarios mixtos sobre la sobrecarga de tokens y el filtrado de ruido, mientras que Firecrawl y Jina Reader se destacan por la conversión de URL a Markdown.
Ayuda a los desarrolladores a seleccionar APIs de búsqueda que minimizan la sobrecarga de tokens y eliminan la necesidad de middleware de scraping personalizado en los pipelines RAG.
19. Hugging Face introduce la verificación de compatibilidad de hardware para modelos
Hugging Face ha introducido una función de verificación de compatibilidad de hardware directamente en sus páginas de repositorio de modelos. Esta herramienta permite a los desarrolladores verificar instantáneamente si un tamaño de modelo específico o nivel de cuantización puede ejecutarse en su configuración de hardware local, agilizando el proceso de selección de modelos para la implementación local.
- • Hugging Face introdujo una función de verificación de compatibilidad de hardware para modelos en su plataforma.
- • La función ayuda a los desarrolladores a evaluar si los modelos (como el dphnAI X1 Trinity Nano de 6B parámetros) pueden ejecutarse en sus configuraciones de hardware.
Simplifica la selección de modelos locales al mostrar instantáneamente a los desarrolladores si un tamaño de modelo o cuantización específico se ejecutará en su hardware.