Inference Brew

La API de DeepSeek-V4-Flash entra en fase beta pública

00:00 / --:--

← Volver al inicio

La API de DeepSeek-V4-Flash entra en fase beta pública

1. La API de DeepSeek-V4-Flash entra en fase beta pública

DeepSeek ha ampliado su oferta de API gestionada con el lanzamiento de DeepSeek-V4-Flash en beta pública. Esto sigue al lanzamiento inicial del modelo como pesos abiertos en mayo y al despliegue de la serie V4 en producción en julio. El nuevo endpoint de la API ofrece a los desarrolladores una opción de alto rendimiento y baja latencia, con un precio de 0,09 dólares por millón de tokens de entrada y 0,18 dólares por millón de tokens de salida, complementando las opciones de despliegue de pesos abiertos existentes y la API insignia V4 Pro.

  • La API de DeepSeek-V4-Flash ya está en fase beta pública.
  • El precio se ha fijado en 0,09 dólares por 1 millón de tokens de entrada y 0,18 dólares por 1 millón de tokens de salida.
  • El modelo obtuvo una puntuación de 50 en el ArtificialAnalysis Index.
  • Los benchmarks incluyen Terminal Bench 2.1 (82,7), DSBench-FullStack (68,7) y DeepSWE (54,4).
  • Se espera que el lanzamiento oficial de DeepSeek-V4-Pro siga a este anuncio.

Los desarrolladores ahora pueden acceder a la eficiente arquitectura V4-Flash a través de una API gestionada, lo que proporciona una alternativa rentable al autoalojamiento de la versión de pesos abiertos.

2. Google generaliza la API de Gemini Live para voz y visión en tiempo real

Google ha lanzado oficialmente la API de Gemini Live para uso general, ampliando sus capacidades más allá de la vista previa inicial de traducción. Los desarrolladores ahora pueden integrar interacciones de voz y visión en tiempo real y de baja latencia en sus aplicaciones, procesando flujos continuos de audio, imágenes y texto para crear agentes conversacionales receptivos y similares a los humanos. Este lanzamiento simplifica el desarrollo de experiencias conversacionales multimodales altamente interactivas al eliminar la necesidad de gestionar manualmente complejos flujos de transmisión.

  • La API de Gemini Live ya está disponible de forma general para la integración de voz y visión en tiempo real.
  • Amplía la vista previa inicial que se centraba en la traducción de voz a voz.
  • Admite flujos continuos y simultáneos de audio, imágenes y texto.
  • Simplifica el desarrollo de agentes conversacionales multimodales e interactivos.

Esta transición de la vista previa a la disponibilidad general permite a los desarrolladores crear experiencias conversacionales multimodales listas para producción y altamente interactivas sin gestionar complejos flujos de transmisión.

SOURCES

3. MiniMax lanza H3, un modelo multimodal de generación de vídeo y audio

MiniMax ha lanzado H3, un modelo multimodal abierto diseñado para manejar contexto unificado a través de texto, imágenes, vídeo y audio. El modelo es capaz de generar hasta 15 segundos de vídeo con resolución 2K, completo con sonido estéreo nativo. MiniMax H3 también cuenta con sólidas capacidades de seguimiento de instrucciones, renderizado preciso de texto y marcas, y transferencia de movimiento de vídeo a vídeo (V2V), lo que lo hace inmediatamente viable para desarrolladores que crean herramientas comerciales de creación y edición de contenido.

  • MiniMax H3 es un modelo abierto diseñado para procesar contexto unificado a través de texto, imágenes, vídeo y audio.
  • El modelo puede generar hasta 15 segundos de vídeo con resolución 2K con sonido estéreo nativo.
  • Admite el seguimiento de instrucciones, el renderizado preciso de texto y marcas, y la transferencia de movimiento de vídeo a vídeo (V2V).
  • Las pruebas iniciales indican que el modelo está listo para casos de uso de creación de contenido comercial.

Los desarrolladores pueden crear funciones de creación de contenido multimodal enriquecidas, incluida la generación de vídeo de alta resolución y la transferencia de movimiento, directamente en sus aplicaciones.

SOURCES

4. Meituan lanza el modelo MoE LongCat-Flash-Lite-Sparse

Meituan ha presentado LongCat-Flash-Lite-Sparse, un modelo abierto de mezcla de expertos (MoE) que cuenta con 3 mil millones de parámetros activos. La característica destacada del modelo es su capacidad para procesar una ventana de contexto de 256k en una sola GPU de 24GB, lo cual se logra descargando una tabla de búsqueda de n-gramas de 30 mil millones a la memoria RAM del sistema. Aunque la arquitectura guarda similitudes con la técnica PLE en Gemma 4, los comentarios iniciales de los desarrolladores sugieren que aún podría no superar a opciones establecidas como Qwen 3.6 27b para casos de uso generales.

  • LongCat-Flash-Lite-Sparse es un modelo de mezcla de expertos (MoE) con aproximadamente 3 mil millones de parámetros activos.
  • El modelo utiliza una tabla de búsqueda de n-gramas de 30 mil millones descargada a la RAM para permitir una ventana de contexto de 256k en una sola GPU de 24GB.
  • La arquitectura se compara con el truco PLE utilizado en Gemma 4 de Google.
  • El análisis inicial de los desarrolladores indica que no se espera que el modelo reemplace al modelo Qwen 3.6 27b para tareas estándar.

Este modelo demuestra una forma novedosa de manejar ventanas de contexto masivas en hardware de consumo, aunque las pruebas iniciales sugieren que aún no puede reemplazar a modelos establecidos como Qwen.

SOURCES

5. La vulnerabilidad AgentForger permite la toma de control remota de agentes de IA

Zenity Labs ha revelado 'AgentForger', una vulnerabilidad de seguridad crítica que afectó a prácticamente todos los navegadores con agentes del mercado. La vulnerabilidad permitía a un atacante plantar un agente autónomo controlado por él mismo dentro del entorno de una organización simplemente engañando a un usuario o agente para que hiciera clic en un enlace manipulado. OpenAI ya ha lanzado un parche para solucionar el problema. Para proteger sus propios despliegues, se insta a los desarrolladores a adoptar principios de 'mínima agencia' y establecer límites estrictos de tiempo de ejecución para cualquier agente con capacidad de navegación.

  • La vulnerabilidad AgentForger permitía que un enlace manipulado plantara un agente autónomo controlado por un atacante dentro de una organización.
  • La vulnerabilidad afectó a los navegadores con agentes en todo el mercado.
  • OpenAI ha lanzado un parche para solucionar la vulnerabilidad AgentForger.
  • La guía del CISO de Zenity para asegurar la IA con agentes recomienda implementar la 'mínima agencia' y límites estrictos de tiempo de ejecución para mitigar estas amenazas.

Los desarrolladores que crean aplicaciones con agentes deben implementar límites estrictos de tiempo de ejecución y principios de 'mínima agencia' para evitar que enlaces maliciosos secuestren a sus agentes.

SOURCES

6. El framework DataFlow-Harness cierra la brecha NL2Pipeline para agentes de IA

Investigadores de la Universidad de Pekín, la Academia Zhongguancun y el Instituto de Investigación de Algoritmos Avanzados de Shanghái han publicado DataFlow-Harness, un framework diseñado para resolver la 'brecha NL2Pipeline'. Esta brecha ocurre cuando los agentes de IA tienen dificultades para basar el código generado en plataformas de producción en vivo con esquemas estrictos. En lugar de permitir que los agentes escriban código de forma libre, DataFlow-Harness representa los pipelines como grafos acíclicos dirigidos (DAG) y utiliza mutaciones tipadas para permitir que los agentes añadan o conecten operadores. En los benchmarks, este enfoque logró una tasa de éxito del 93,3% mientras reducía los costes de API en un 72,5% y la latencia en un 49,9% en comparación con Claude Code estándar.

  • Investigadores de la Universidad de Pekín y otras instituciones presentaron DataFlow-Harness, un framework de código abierto para construir flujos de trabajo de procesamiento de datos visuales y estructurados.
  • El framework representa los pipelines como grafos acíclicos dirigidos (DAG) y utiliza mutaciones tipadas para permitir que los agentes añadan o conecten operadores en lugar de escribir código de forma libre.
  • En un benchmark de ingeniería de datos de 12 tareas, DataFlow-Harness logró una tasa de éxito de extremo a extremo del 93,3%.
  • En comparación con Claude Code estándar, el framework redujo los costes de API en un 72,5% y la latencia de respuesta en un 49,9%.
  • El framework se publica bajo la licencia Apache 2.0 y está disponible en GitHub.
  • Consta de cuatro componentes: un backend de Data Pipeline, una DataFlow-WebUI, una capa de herramientas MCP y una capa de guía de IA llamada DataFlow-Skills.

Los desarrolladores pueden utilizar este framework para permitir que los agentes de IA construyan y modifiquen de forma fiable pipelines de datos estructurados sin escribir código arriesgado y de forma libre.

SOURCES

7. Cursor optimiza los entornos en la nube para agentes de codificación

Cursor ha implementado mejoras significativas en sus entornos de desarrollo, optimizados específicamente para ayudar a los agentes de IA a comprender, ejecutar y probar código. Al estructurar el contexto del entorno para que sea más amigable para los agentes, Cursor informa que el porcentaje de solicitudes de extracción fusionadas con contribuciones de agentes en la nube ha aumentado de aproximadamente el 10% a más del 50%. Esta actualización destaca cómo adaptar el entorno de tiempo de ejecución, en lugar de solo el modelo, puede aumentar drásticamente la productividad de los agentes.

  • Cursor mejoró sus entornos de desarrollo para facilitar que los agentes comprendan, ejecuten y prueben código.
  • Estas optimizaciones del entorno permitieron que los agentes en la nube aumentaran su contribución a las solicitudes de extracción fusionadas de aproximadamente el 10% a más del 50%.

Los desarrolladores que utilizan Cursor pueden esperar contribuciones de código significativamente más autónomas y exitosas por parte de los agentes integrados debido al contexto del entorno optimizado.

SOURCES

8. Lanzamiento del SDK Tilde para construir y autoalojar agentes de revisión de código

El desarrollador Tilde ha lanzado una plataforma de SDK de arnés diseñada para simplificar la construcción y el autoalojamiento de agentes de IA personalizados. Desarrollado como un proyecto paralelo durante el último año, Tilde descompone las características de OpenClaw y Hermes en bloques de construcción de API en la nube modulares. Para ayudar a los desarrolladores a comenzar, el creador ha publicado un repositorio de GitHub con ejemplos concretos que demuestran cómo construir y autoalojar un agente de revisión de código dedicado.

  • Tilde es una plataforma de SDK de arnés desarrollada como un proyecto paralelo durante el último año.
  • La plataforma descompone las características de OpenClaw y Hermes en bloques de construcción de API en la nube.
  • Tilde permite a los usuarios crear y autoalojar agentes de IA para sus casos de uso específicos.
  • El desarrollador ha proporcionado un repositorio de GitHub que contiene ejemplos para mostrar la funcionalidad de la API.

Los desarrolladores pueden utilizar el SDK y el repositorio de ejemplos de Tilde para construir, personalizar y autoalojar rápidamente sus propios agentes de revisión de código.

SOURCES

9. Lanzamiento del estándar abierto de comportamiento de agentes para la evaluación de agentes de IA

Se ha lanzado un nuevo estándar abierto llamado Comportamiento de Agentes para abordar los desafíos de evaluar agentes de IA autónomos. El estándar utiliza archivos Markdown simples para especificar la conducta recurrente y los límites necesarios para que un agente sea considerado fiable. Al proporcionar un marco concreto para revisores, rúbricas y puntuadores, el Comportamiento de Agentes ayuda a los desarrolladores a revisar sistemáticamente los rastros de ejecución, escribir casos de evaluación sólidos y refinar las instrucciones o herramientas para alinear las acciones del agente con las expectativas del equipo.

  • El Comportamiento de Agentes es un estándar abierto que define y evalúa el comportamiento de los agentes de IA a lo largo de una trayectoria completa.
  • Cada especificación de comportamiento se escribe como un archivo Markdown que describe la conducta recurrente necesaria para la fiabilidad del agente.
  • El estándar proporciona un marco concreto para que los revisores, rúbricas, puntuadores y evaluaciones puedan medir los resultados.
  • Admite la revisión de rastros, la escritura de casos de evaluación, la revisión de instrucciones o herramientas y la comunicación de la conducta prevista del agente a los equipos.

Los desarrolladores obtienen un marco estructurado y estandarizado para escribir casos de evaluación, revisar rastros de agentes y garantizar una conducta fiable de los agentes.

SOURCES

10. MarbleOS reimagina la interacción con agentes de IA como un espacio de trabajo visual

Los creadores Akilan y Miguel han lanzado MarbleOS, una interfaz beta descargable que desafía el paradigma dominante basado en chat de la interacción con la IA. Inspirándose en hitos clásicos de la interfaz gráfica de usuario como Xerox PARC y NeXTSTEP, MarbleOS trata a la IA como un espacio de trabajo visual. La plataforma representa las tareas como tarjetas, lo que permite que múltiples trabajos de agentes se ejecuten simultáneamente mientras se mantienen los archivos, herramientas y artefactos totalmente visibles. También muestra las herramientas que un agente planea usar antes de la ejecución y genera archivos directamente utilizables como hojas de cálculo en lugar de simples transcripciones de texto.

  • MarbleOS es una interfaz diseñada para tratar a la IA como un espacio de trabajo en lugar de una aplicación de chat, inspirada en Xerox PARC, el Macintosh de 1984 y NeXTSTEP.
  • La plataforma representa las tareas como tarjetas, lo que permite que múltiples trabajos se ejecuten simultáneamente mientras se mantienen los archivos, herramientas y artefactos visibles.
  • MarbleOS muestra las herramientas que un agente espera usar antes de que comience la ejecución de una tarea.
  • El sistema produce archivos directamente utilizables, como hojas de cálculo o presentaciones de PowerPoint, en lugar de transcripciones de chat.
  • Actualmente hay disponible una versión beta descargable de MarbleOS en el sitio web del proyecto.

Los desarrolladores pueden explorar un nuevo paradigma de interfaz gráfica de usuario para flujos de trabajo con agentes que reemplaza las interfaces de línea de comandos y chat con un espacio de trabajo visual y multitarea.

SOURCES

11. El motor WASTE permite la inferencia de Kimi K3 en hardware de consumo de 64GB

Tras el lanzamiento de Kimi K3 y los posteriores esfuerzos de cuantización de Atomic Chat y Unsloth, se ha lanzado el nuevo motor de inferencia WASTE para reducir aún más los requisitos de hardware. A diferencia de los métodos anteriores que requerían una RAM masiva (1,5 TB) o una cuantización estándar, WASTE permite ejecutar el modelo Kimi K3 de 2,78 billones de parámetros en un MacBook Pro de 64GB manteniendo el tronco del modelo en la RAM y transmitiendo expertos desde el disco. Este enfoque permite la ejecución local en hardware de consumo estándar, aunque a una velocidad de inferencia más lenta.

  • WASTE es un motor de inferencia C de código abierto y sin dependencias.
  • Permite ejecutar Kimi K3 en un MacBook Pro de 64GB mediante la transmisión de expertos desde el disco.
  • Logra entre 0,49 y 0,54 tokens por segundo para Kimi K3.
  • Admite modelos más pequeños como Kimi-Linear-48B a 10,7 tokens por segundo.
  • El motor selecciona instrucciones SIMD en tiempo de ejecución y es compatible con Linux, macOS y Windows.

Este desarrollo reduce significativamente la barrera de hardware para ejecutar modelos de billones de parámetros, pasando de requisitos de memoria de nivel empresarial a portátiles de consumo estándar.

SOURCES

12. Los buckets de almacenamiento de Hugging Face ya están disponibles con precios por TB

Basándose en la compatibilidad con la API de S3 anunciada anteriormente, Hugging Face ha lanzado oficialmente su servicio de Storage Buckets. Este lanzamiento introduce un modelo de precios simple y fijo por TB para almacenar modelos, conjuntos de datos y artefactos, proporcionando a los desarrolladores una alternativa dedicada al almacenamiento de objetos en la nube tradicional dentro del ecosistema de Hugging Face.

  • Hugging Face ha lanzado oficialmente su servicio de Storage Buckets.
  • El servicio cuenta con una nueva estructura de precios fija por TB.
  • Esto sigue al soporte de la API de S3 anunciado anteriormente, lo que permite una integración perfecta con las herramientas de almacenamiento existentes.

Los desarrolladores ahora pueden utilizar un servicio de almacenamiento con todas las funciones y precios que se integra con sus flujos de trabajo existentes compatibles con S3.

SOURCES

13. El diseño del arnés impulsa un cambio de precisión del 22% en la clasificación de modelos pequeños

Un estudio de ablación detallado realizado en un modelo de 4B destaca el impacto masivo del diseño del arnés y del prompt en el rendimiento de los modelos pequeños. Ejecutándose en una GPU de portátil de 6GB para una tarea de triaje de Kubernetes, el estudio mantuvo los pesos congelados y aisló las variables del arnés. Los resultados mostraron un cambio de 22 puntos porcentuales en la precisión (del 60% al 82%). Los hallazgos clave incluyen: reglas explícitas en el prompt añadieron 13 puntos, y colocar la tarea antes del material de referencia añadió 6,5 puntos. Por el contrario, llevar resúmenes en lugar de evidencia bruta perdió 12 puntos, y las transferencias de sesión fresca entre etapas perdieron 15 puntos.

  • Un estudio de ablación en un modelo de 4B que se ejecuta en una GPU de portátil de 6GB aisló el impacto del diseño del arnés en una tarea de triaje SIG de Kubernetes.
  • La precisión varió del 60% al 82% utilizando pesos congelados idénticos, un corpus de oro de 250 problemas y un solo puntuador.
  • Las reglas explícitas en el prompt mejoraron la precisión en 13 puntos, mientras que colocar la tarea antes del material de referencia la mejoró en 6,5 puntos.
  • Añadir un turno de razonamiento adicional disminuyó la precisión en 5 puntos, y llevar un resumen hacia adelante en lugar de evidencia bruta la disminuyó en 12 puntos.
  • Usar una transferencia de sesión fresca entre etapas disminuyó la precisión en 15 puntos.
  • El diseño de arnés con peor rendimiento resultó en una precisión de modelo básico a pesar de utilizar una etapa adicional y 250 llamadas a herramientas.
  • El corpus, el puntuador, el registro previo y los manifiestos de ejecución están disponibles públicamente en GitHub.

Los desarrolladores que ajustan o despliegan modelos pequeños pueden lograr ganancias de precisión masivas simplemente optimizando la ubicación del prompt y la gestión de sesiones, sin necesidad de reentrenamiento.

SOURCES

14. Los LLM de pesos abiertos logran la paridad con los modelos cerrados en tareas regulatorias

Una nueva evaluación que utiliza el benchmark ClinReg revela que los LLM de pesos abiertos han logrado la paridad de precisión con los principales modelos de código cerrado para tareas regulatorias y clínicas. Modelos como GLM 5.2 y Kimi K3 funcionaron dentro de una desviación estándar del modelo propietario GPT 5.6 Sol de OpenAI. Debido a que estos modelos de pesos abiertos operan a aproximadamente un tercio del coste de las API propietarias de primer nivel, los desarrolladores pueden reducir significativamente los gastos operativos, siempre que seleccionen modelos basados en perfiles de error específicos de la tarea en lugar de clasificaciones generales de tablas de clasificación.

  • El benchmark ClinReg demuestra que los modelos de pesos abiertos como GLM 5.2 y Kimi K3 funcionan dentro de una desviación estándar del modelo propietario GPT 5.6 Sol.
  • Los modelos de pesos abiertos operan a aproximadamente un tercio del coste de los principales modelos propietarios.
  • El estudio destaca que diferentes modelos exhiben perfiles de error distintos, lo que significa que la selección del modelo debe ser específica para la tarea.

Los desarrolladores que crean aplicaciones especializadas pueden hacer la transición a modelos de pesos abiertos para reducir los costes de API hasta en dos tercios sin sacrificar la precisión.

SOURCES

15. Manifest descontinúa el enrutador LLM en favor de la selección manual y el almacenamiento en caché

Manifest ha descontinuado y cerrado oficialmente su función de enrutador LLM tras una prueba de cuatro meses con 7.000 usuarios en la nube. La empresa concluyó que el enrutamiento automatizado es contraproducente para las aplicaciones de producción. Según Manifest, la complejidad del prompt no puede predecirse con precisión solo a partir del prompt inicial, ya que el contexto a menudo se revela dinámicamente a través de llamadas a herramientas. Además, el enrutamiento automatizado introduce una inconsistencia de comportamiento que rompe los flujos de trabajo de los agentes. Manifest ahora aconseja a los desarrolladores que seleccionen manualmente los modelos en función de la intención y aprovechen el almacenamiento en caché de contexto, lo que reduce los costes entre un 75% y un 90% sin sacrificar la previsibilidad.

  • Manifest lanzó su enrutador LLM en marzo y lo cerró oficialmente el 1 de septiembre tras probarlo con 7.000 usuarios en la nube durante cuatro meses.
  • La empresa descubrió que la complejidad del prompt no puede determinarse solo por el prompt porque el contexto a menudo se revela a través de llamadas a herramientas y búsquedas web.
  • Manifest informa que los enrutadores LLM rompen la consistencia del comportamiento e introducen imprevisibilidad, aumentando los costes de mantenimiento para los flujos de trabajo automatizados de los agentes.
  • La empresa afirma que el almacenamiento en caché de contexto es más eficaz para la reducción de costes, señalando que las lecturas de caché son entre un 75% y un 90% más baratas que las entradas no almacenadas en caché.
  • Manifest ahora recomienda que los ingenieros seleccionen manualmente los modelos y parámetros en función de la intención específica.

Los desarrolladores que crean flujos de trabajo con agentes deberían reconsiderar los enrutadores LLM automatizados, ya que la selección manual de modelos y el almacenamiento en caché de contexto ofrecen una mejor previsibilidad y ahorro de costes.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.