Inference Brew

Shanghai AI Lab lanza el modelo multimodal Intern-S2-397B

00:00 / --:--

← Volver al inicio

Shanghai AI Lab lanza el modelo multimodal Intern-S2-397B

1. Shanghai AI Lab lanza el modelo multimodal Intern-S2-397B

Shanghai AI Lab ha lanzado Intern-S2-397B, un nuevo modelo base multimodal de pesos abiertos diseñado para la inteligencia científica y tareas de agentes de largo alcance. El modelo emplea un paradigma de preentrenamiento visión-lenguaje único que aprende directamente de páginas sin procesar de literatura científica para capturar relaciones visuales complejas y semántica simbólica. Entrenado en más de 20 dominios científicos y optimizado mediante aprendizaje por refuerzo de agentes de caja negra en entornos aislados, Intern-S2-397B está diseñado para destacar en tareas especializadas como el diseño de interacciones biomoleculares y la generación de estructuras de materiales.

  • • Intern-S2-397B es un nuevo modelo base multimodal diseñado para inteligencia científica y tareas de agentes de largo alcance.
  • • El modelo utiliza un paradigma de preentrenamiento visión-lenguaje que aprende directamente de páginas de literatura científica para modelar semántica simbólica.
  • • Fue entrenado en diversas tareas de aprendizaje por refuerzo científico en más de 20 dominios, incluyendo el diseño biomolecular.
  • • El modelo emplea aprendizaje por refuerzo de agentes de caja negra en entornos aislados para mejorar la generalización.
  • • Escala a través de tres dimensiones: preentrenamiento, cobertura de tareas de aprendizaje por refuerzo y entornos de agentes interactivos.

Proporciona a los desarrolladores un modelo masivo de pesos abiertos capaz de manejar razonamiento científico complejo y entornos de agentes aislados.

SOURCES

2. AWS lanza Pizza Bot, una bandeja de entrada de código abierto para agentes de IA en segundo plano

AWS ha lanzado Pizza Bot, una aplicación de código abierto y autohospedada diseñada para gestionar agentes de IA en segundo plano. Con licencia Apache 2.0, Pizza Bot proporciona una interfaz tipo bandeja de entrada de correo electrónico para organizar resultados de tareas, historiales de hilos y decisiones pendientes. Construido sobre DeepAgents y LangGraph, el sistema admite aprobaciones con intervención humana para herramientas externas a través de servidores MCP y se integra con los principales proveedores de modelos, incluyendo Bedrock, Anthropic, Gemini, OpenAI, OpenRouter y Ollama.

  • • Pizza Bot es una aplicación de código abierto y autohospedada con licencia Apache 2.0, con versiones de escritorio para macOS, Windows y Linux.
  • • La aplicación organiza los resultados de las tareas de IA y las decisiones pendientes en una bandeja de entrada tipo correo electrónico con categorías para el historial de hilos y el trabajo completado.
  • • Utiliza DeepAgents y LangGraph para la ejecución con estado, empleando puntos de control para mantener el estado del hilo y las pausas de aprobación.
  • • El sistema es compatible con múltiples proveedores de modelos, incluyendo Amazon Bedrock, Anthropic, Google Gemini, OpenAI, OpenRouter y Ollama.
  • • Los usuarios pueden gestionar herramientas externas a través de servidores MCP y configurar políticas para aprobar, editar o rechazar acciones propuestas.
  • • Se requiere un backend siempre activo para que las tareas continúen ejecutándose si se cierra el cliente de escritorio.

Ofrece a los desarrolladores un panel de control autohospedado y listo para usar para monitorear agentes en segundo plano, revisar acciones pendientes y gestionar políticas de ejecución de herramientas.

SOURCES

3. Nuevos patrones de ingeniería de contexto para agentes de IA de largo alcance

A medida que los agentes autónomos enfrentan una degradación del rendimiento en tareas de largo alcance, la industria ha avanzado más allá de los flujos de trabajo simples de 'migas de pan' hacia una ingeniería de contexto más robusta. Los nuevos desarrollos incluyen el almacenamiento en caché de contexto del lado del servidor de OpenAI, la arquitectura de subagentes MicroVM paralelos de AWS AgentCore y la descarga especializada en sistemas de archivos en Deep Agents, proporcionando a los desarrolladores herramientas más efectivas para mantener el enfoque del agente y controlar los costos.

  • • La API de respuestas de OpenAI ahora incluye compactación del lado del servidor mediante 'context_caching'.
  • • AWS AgentCore utiliza subagentes MicroVM paralelos para reducir el tiempo de ejecución de tareas hasta en 3 veces.
  • • Deep Agents implementa la descarga en sistemas de archivos para respuestas de herramientas que superan los 20,000 tokens.
  • • Claude Code continúa refinando la compactación selectiva para preservar las decisiones arquitectónicas.

Estos avances proporcionan a los desarrolladores patrones arquitectónicos estandarizados y escalables para mitigar los límites de la ventana de contexto, superando los enfoques experimentales de 'migas de pan' identificados anteriormente.

SOURCES

4. La bifurcación de Llama.cpp añade decodificación especulativa intercambiable en caliente y transmisión adaptativa de KV

Se ha lanzado una nueva bifurcación del proyecto de transmisión de caché KV de llama.cpp de Raymond, que introduce la transmisión adaptativa de KV y la decodificación especulativa intercambiable en caliente. Diseñado para maximizar el rendimiento en hardware limitado, el sistema utiliza un grupo de memoria VRAM que transmite el contexto desde la RAM del host cuando se supera la capacidad de la VRAM. Fundamentalmente, permite a los desarrolladores expulsar dinámicamente modelos especulativos (como MTP o DFlash2) cuando el contexto es alto y recargarlos cuando el contexto es bajo, permitiendo una ejecución local más rápida de modelos como Qwen 3.8 27B en una GPU de 16GB.

  • • La bifurcación añade decodificación especulativa intercambiable en caliente al proyecto de transmisión de caché KV de llama.cpp de Raymond.
  • • Utiliza un grupo de memoria VRAM que transmite el contexto desde la RAM del host cuando supera la capacidad de la VRAM, superando la descarga estándar.
  • • El sistema permite la expulsión de modelos especulativos (como MTP o DFlash2) cuando el contexto es alto, recargándolos cuando el contexto es bajo.
  • • La implementación se probó utilizando el modelo Qwen 3.8 27B UD-IQ4_XS en una GPU 5060Ti de 16GB.
  • • El repositorio del proyecto está alojado públicamente en https://github.com/troed/llama.cpp-adaptive-kv-streaming.

Permite a los desarrolladores ejecutar modelos más grandes localmente con un mayor rendimiento en hardware con memoria limitada.

SOURCES

5. La configuración de VLLM permite la inferencia de alta velocidad de Qwen3.8 27B en RTX 3090

Un punto de referencia de desarrollador ha demostrado que ejecutar el modelo Qwen3.8-27B-int4-AutoRound en vLLM 0.27.1 puede lograr una inferencia local de alta velocidad en una sola GPU RTX 3090. Al configurar una caché KV FP8 E4M3, la configuración admite una ventana de contexto masiva de 147,456 tokens, ofreciendo una velocidad de prellenado promedio de 871.93 tokens por segundo y una velocidad de decodificación de 38.39 tokens por segundo. El modelo obtuvo un 94.7% en el punto de referencia BenchLocal-CLI para llamadas a herramientas y seguimiento de instrucciones, utilizando indicadores optimizados de vLLM como el almacenamiento en caché de prefijos y la precisión bfloat16.

  • • El punto de referencia utilizó Qwen3.8-27B-int4-AutoRound en vLLM 0.27.1 ejecutándose en WSL2 con una GPU RTX 3090.
  • • La configuración admitió una ventana de contexto de 147,456 tokens utilizando una caché KV FP8 E4M3.
  • • El rendimiento de prellenado promedió 871.93 tokens por segundo, y el rendimiento de decodificación promedió 38.39 tokens por segundo.
  • • El modelo logró una puntuación de 71/75 (94.7%) en el punto de referencia BenchLocal-CLI, que prueba la llamada a herramientas, el seguimiento de instrucciones y el razonamiento.
  • • Los ajustes clave de vLLM utilizados incluyen --dtype bfloat16, --gpu-memory-utilization 0.9475 y --enable-prefix-caching.

Proporciona una configuración concreta y altamente optimizada para que los desarrolladores ejecuten un modelo de 27B con una ventana de contexto de 144K en hardware de consumo estándar.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.