Inference Brew

La API de DeepSeek-V4 pasa a versión de producción

00:00 / --:--

← Volver al inicio

La API de DeepSeek-V4 pasa a versión de producción

1. La API de DeepSeek-V4 pasa a versión de producción

Tras el lanzamiento inicial de pesos abiertos y la disponibilidad en vista previa de la serie DeepSeek-V4, la versión lista para producción ya está disponible en la API de DeepSeek. Esta actualización marca el fin de la fase de vista previa para el modelo, que anteriormente estaba disponible como pesos abiertos y mediante acceso anticipado a la API.

  • DeepSeek-V4 ha pasado del estado de vista previa al de listo para producción en la API oficial.
  • El lanzamiento sigue a la disponibilidad inicial de pesos abiertos de los modelos V4 Pro y V4 Flash.
  • La versión de producción mantiene la huella de parámetros optimizada y la arquitectura de alto rendimiento del modelo.

Los desarrolladores ahora pueden confiar en la API de DeepSeek-V4, estable para producción, para integraciones de alto rendimiento, aprovechando la arquitectura de pesos abiertos del modelo establecida anteriormente.

SOURCES

2. Alibaba lanza el modelo de texto a voz alojado Qwen-Audio-3.0-TTS

Disponible exclusivamente como servicio alojado a través de Alibaba Cloud Model Studio, Qwen-Audio-3.0-TTS utiliza un tokenizador de voz de baja tasa de fotogramas de 12.5 Hz y un paradigma de entrenamiento progresivo de cinco etapas. Esta arquitectura garantiza una alta consistencia del contenido y naturalidad prosódica, lo que la convierte en una opción potente para agentes de voz en tiempo real.

  • Qwen-Audio-3.0-TTS está disponible en niveles Flash (optimizado para tiempo real, latencia de ~300 ms) y Plus (alta calidad, en la cima de la tabla de clasificación de Artificial Analysis).
  • El servicio tiene un precio de 27.59 dólares por cada millón de caracteres, aproximadamente un tercio del costo de ElevenLabs o MiniMax.
  • Los desarrolladores pueden controlar las salidas mediante instrucciones en lenguaje natural o 86 etiquetas integradas de grano fino para efectos no verbales como risas y respiración.
  • El modelo admite 16 idiomas y 20 dialectos chinos, a los que se accede mediante un protocolo de transmisión WebSocket bidireccional.
  • La API admite formatos PCM, WAV, MP3 y Opus con frecuencias de muestreo de hasta 48 kHz.

Los desarrolladores pueden integrar síntesis de voz de alta calidad y baja latencia en sus aplicaciones a aproximadamente un tercio del costo de los principales competidores.

SOURCES

3. Un desarrollador ajusta MiniCPM5 para crear un modelo de razonamiento local de 657 MB

Creado por el desarrollador GnLOLot, este modelo compacto conserva el formato de llamada a herramientas de MiniCPM5 y una longitud de contexto de 131,072 tokens. Aunque su estado de licencia es incierto debido al uso de salidas generadas por Claude para el entrenamiento, ofrece una ruta experimental para ejecutar modelos de razonamiento en hardware local altamente restringido.

  • El modelo MiniCPM5-1B-Claude-Opus-Fable5-Thinking se ejecuta localmente y se basa en MiniCPM5-1B de OpenBMB.
  • El modelo fue entrenado mediante ajuste supervisado con trazas de razonamiento de Claude Fable 5.
  • Admite una plantilla de razonamiento nativa con modos Think y No Think conmutables.
  • Las cuantizaciones GGUF están disponibles, desde 657 MB (Q4_K_M) hasta 2.1 GB (F16).
  • El modelo es compatible con llama.cpp, Ollama, LM Studio, jan y KoboldCpp.

Los desarrolladores pueden ejecutar un modelo altamente compacto y capaz de razonar localmente en hardware de consumo con una huella de memoria tan pequeña como 657 MB.

SOURCES

4. Ternary-Bonsai-27B evaluado en Terminal-Bench 2.0 con 8 GB de VRAM

La evaluación destaca los límites prácticos de la cuantización extrema. Si bien el modelo de 2 bits evitó con éxito los errores de análisis de llamadas a herramientas y se ajustó a una GPU de computadora portátil, su precisión general en las tareas fue menor que la de un modelo denso más pequeño de 9B, y la variante de 1 bit resultó totalmente inutilizable en flujos de trabajo de agentes.

  • Ternary-Bonsai-27B (2 bits) se evaluó en el arnés terminal-bench 2.0 con 89 tareas utilizando una GPU de 8 GB de VRAM.
  • El modelo Bonsai de 2 bits se ajustó completamente a la GPU y demostró cero errores de análisis durante la llamada a herramientas.
  • Ternary-Bonsai-27B logró una puntuación del 7.9%, en comparación con el 9.2% de Qwen3.5-9B y el 24.3% de Qwen3.6-35B-A3B.
  • El modelo Bonsai de 1 bit no funcionó en un arnés de agente, produciendo terminaciones que no finalizaban y que agotaron la ventana de contexto.

Los desarrolladores pueden ejecutar modelos más grandes de 27B de parámetros en hardware de consumo altamente restringido, aunque deben esperar una caída significativa en la precisión de los puntos de referencia.

SOURCES

5. Investigadores evaden sandboxes en Cursor, Codex y Gemini CLI

Las vulnerabilidades permitieron a los investigadores eludir los límites establecidos al explotar cómo los agentes de codificación interactúan con los archivos locales. Debido a que estos agentes a menudo tienen una integración profunda con el sistema anfitrión, escribir archivos que otras herramientas confiables consumen posteriormente resultó ser un vector de escape viable.

  • Investigadores de seguridad lograron escapar de los sandboxes de cuatro agentes de codificación de IA ampliamente utilizados.
  • Las herramientas afectadas incluyen Cursor, Codex de OpenAI, Gemini CLI y Antigravity.
  • Los escapes se lograron escribiendo archivos que las herramientas confiables ejecutan o utilizan posteriormente.
  • La mayoría de los escapes de sandbox y elusiones de límites identificados han sido parcheados.

Los desarrolladores que utilizan asistentes de codificación de IA deben asegurarse de que sus entornos locales estén protegidos contra escrituras de archivos no confiables que puedan activar escapes de sandbox.

SOURCES

6. Descubren fallas críticas de seguridad y rendimiento en OpenCode

A pesar de su enorme popularidad en GitHub, un análisis detallado sugiere que OpenCode sufre de fallas arquitectónicas fundamentales. La combinación de restricciones de comandos fácilmente eludidas, alto consumo de memoria y vulnerabilidades de ejecución remota pasadas hace que la herramienta sea una responsabilidad significativa para los entornos de desarrollo locales.

  • OpenCode, que tiene 161,000 estrellas en GitHub, es criticado por facilitar la explotación trivial de las máquinas de los usuarios.
  • Un CVE anterior permitió a OpenCode exponer un servidor HTTP con encabezados CORS permisivos, arriesgando la ejecución remota de código.
  • Las restricciones de comandos bash de la herramienta, implementadas mediante el análisis AST de tree-sitter, se eluden fácilmente.
  • OpenCode sufre frecuentemente de fallas en la caché de prompts, lo que causa retrasos significativos en la generación de tokens.
  • Se informa que la interfaz de usuario está rota, con un cuadro de mensaje que consume hasta un gigabyte de RAM.

Los desarrolladores deben revisar o suspender inmediatamente su uso de OpenCode para proteger sus máquinas locales de la ejecución remota de código y el agotamiento de recursos.

SOURCES

7. Unsloth añade soporte oficial para hardware AMD

Desarrollado en colaboración con AMD, este lanzamiento lleva las optimizaciones de memoria características de Unsloth a una amplia gama de silicio AMD en Windows, Linux, WSL y macOS. También incluye funciones como exportaciones de adaptadores GGUF y LoRA, junto con seguimiento de RAM y VRAM en tiempo real.

  • Unsloth ahora admite oficialmente hardware AMD para inferencia local, ajuste fino, aprendizaje por refuerzo y despliegue.
  • El hardware compatible incluye Radeon RX 9000/7000, Instinct MI350/MI300, Strix Halo, Ryzen AI Max y CPU AMD.
  • Unsloth permite entrenar modelos con hasta un 70% menos de VRAM y aprendizaje por refuerzo con hasta un 80% menos de VRAM.
  • La plataforma proporciona compilaciones optimizadas para ROCm, Triton, bitsandbytes, PyTorch y llama.cpp.
  • Los modelos compatibles incluyen Qwen, Gemma, DeepSeek, GLM, Kimi, MiniMax y DiffusionGemma.

Los desarrolladores ahora pueden utilizar hardware AMD para ajustar y ejecutar modelos localmente con ahorros masivos de VRAM, rompiendo el bloqueo exclusivo de Nvidia.

SOURCES

8. El motor NInfer alcanza 542 tokens/seg en RTX 5090

NInfer está altamente optimizado para hardware y puntos de control de modelos específicos, admitiendo entradas de texto, imagen y video. Aunque actualmente carece de procesamiento por lotes continuo y está restringido a modelos Qwen seleccionados, muestra los límites de rendimiento extremos de la inferencia local en las GPU de consumo de próxima generación.

  • NInfer logró una velocidad de generación sostenida de 542 tokens por segundo en una finalización de 65,536 tokens utilizando una sola RTX 5090.
  • El motor es un motor de inferencia C++/CUDA de código abierto construido desde cero y especializado para puntos de control Qwen3.6.
  • Los modelos compatibles incluyen Qwen3.6-27B y Qwen3.6-35B-A3B, con artefactos disponibles en Hugging Face.
  • NInfer permite una longitud de contexto nativa completa de 262,144 tokens mediante el uso de caché KV INT8 en la RTX 5090.
  • El motor proporciona puntos finales HTTP compatibles con OpenAI y Anthropic.

Los desarrolladores que ejecutan inferencia local pueden lograr velocidades de generación casi instantáneas y longitudes de contexto masivas en hardware insignia de grado de consumo.

SOURCES

9. La aplicación Nativ ejecuta modelos abiertos de frontera localmente en Mac

Nativ proporciona métricas de rendimiento en tiempo real, incluidos tokens por segundo en vivo, presión de memoria y estado térmico. Al aprovechar el marco MLX de Apple, ofrece una forma fluida y privada para que los desarrolladores integren modelos locales directamente en sus flujos de trabajo de desarrollo diarios.

  • Nativ ejecuta modelos de código abierto de Google, Cohere y Liquid AI localmente en Apple Silicon (M1+).
  • La aplicación está construida sobre MLX-VLM y optimizada para la memoria unificada de la serie M y la arquitectura Metal.
  • Proporciona un punto final local para conectar agentes de codificación existentes a modelos locales.
  • Las capacidades compatibles incluyen chat LLM, subtitulado de imágenes, resumen de video, autocompletado de código y transcripción de voz.
  • La aplicación tiene licencia MIT, funciona completamente sin conexión y no requiere cuentas ni suscripciones.

Los desarrolladores pueden ejecutar y probar fácilmente modelos abiertos localmente en sus Mac y conectar sus agentes de codificación existentes a través de un punto final local.

SOURCES

10. Anthropic detalla la estrategia de arnés ligero para Claude Code

Dirigido por la jefa de producto Cat Wu, el equipo de Claude Code mantiene intencionalmente el arnés de la herramienta ligero. Este enfoque contrasta con otros arneses de codificación como Codex de OpenAI, Antigravity de Google y ofertas de startups, que a menudo intentan construir un contexto predeterminado más estructurado alrededor de las bases de código.

  • Claude Code actúa como una capa de gestión ligera entre los modelos de IA y la base de código de un desarrollador.
  • El equipo evita crear funciones opinativas o limitantes porque los modelos están mejorando rápidamente.
  • Claude Code no construye un contexto estructurado alrededor de una base de código de forma predeterminada.
  • La estrategia de Anthropic permite a los desarrolladores integrar sus propias herramientas según lo deseen.

Los desarrolladores pueden esperar que Claude Code siga siendo altamente personalizable, lo que les permite integrar sus propias herramientas en lugar de estar encerrados en un marco rígido.

SOURCES

11. El arnés de agentes de Writer reduce el gasto en tokens en un 38%

El artículo aborda la paradoja del ROI de la IA empresarial al criticar el 'tokenmaxxing', la tendencia de la industria a depender de ventanas de contexto masivas en lugar de flujos de trabajo eficientes. Al utilizar el arnés de agentes de Writer, los investigadores mantuvieron una tasa de éxito de tareas del 81% mientras reducían drásticamente los costos, lo que demuestra que la orquestación inteligente es clave para la viabilidad de la producción.

  • La optimización de la capa de orquestación redujo el costo por tarea exitosa hasta en un 61% y el consumo de tokens en un 38% sin ajuste fino del modelo.
  • La latencia de las tareas de extremo a extremo disminuyó un 44% (de 48 a 27 segundos) debido al almacenamiento en caché de prompts y la eliminación de bucles de razonamiento ineficientes.
  • El estudio recomienda el 'Two-Zone Prompting' para activar el almacenamiento en caché de prompts y el 'Context Offloading' para mover el historial a un almacenamiento recuperable.
  • Se descubrió que la delegación de subagentes solo era confiable en modelos más fuertes como Claude Sonnet 4.6 y Palmyra X6.
  • Los investigadores aconsejan implementar barandillas estrictas en el código, como presupuestos de tokens por tarea, para evitar bucles de agentes fuera de control.

Los desarrolladores pueden reducir significativamente sus facturas de API y disminuir la latencia mediante la implementación de patrones de orquestación eficientes en lugar de depender de ventanas de contexto de fuerza bruta.

SOURCES

12. Los enjambres de agentes y la economía de planificador-trabajador reducen drásticamente los costos

Al separar la planificación de alto nivel de la ejecución de bajo nivel, esta arquitectura evita el alto costo de ejecutar modelos de frontera para cada tarea. El sistema también introduce una 'Guía de campo', una carpeta de contexto compartida propiedad de los agentes para curar e institucionalizar el conocimiento, asegurando la consistencia y eficiencia de las tareas a largo plazo.

  • El sistema de enjambre utiliza una descomposición similar a un árbol con agentes planificadores (modelos inteligentes) y agentes trabajadores (modelos rápidos y baratos).
  • En un experimento de construcción de SQLite desde cero en Rust, el enjambre logró el 100% en la suite sqllogictest.
  • El enjambre híbrido produjo un código significativamente más conciso, utilizando 9,908 líneas en comparación con las 64,305 líneas del sistema anterior.
  • Los mecanismos de coordinación incluyen agentes externos neutrales para conflictos de fusión y lentes de revisión apiladas para el control de calidad.
  • El sistema cuenta con un sistema de control de versiones personalizado capaz de manejar 1,000 confirmaciones por segundo.

Los desarrolladores pueden diseñar sistemas multiagente que dirijan la planificación compleja a modelos de frontera costosos mientras delegan la ejecución a modelos baratos, reduciendo los costos operativos.

SOURCES

13. Los líderes de la industria cambian hacia la evaluación de agentes de IA basada en cohortes

El panel enfatizó la tensión entre el juicio automatizado escalable pero sin fundamento y la falta de escalabilidad en la revisión humana. Si bien los procesos de humano en el bucle siguen siendo esenciales para la confianza y el aprendizaje del sistema, los desarrolladores pueden reducir significativamente los costos mediante el uso de expresiones regulares simples para barandillas básicas y el ajuste fino de modelos más pequeños para la detección de errores.

  • Las empresas están pasando de calificar trazas individuales de agentes de IA a comparar cohortes de usuarios con una línea base.
  • LangChain ajustó un modelo Qwen de código abierto para detectar errores de usuario, igualando el rendimiento de Claude Sonnet a un costo de 10 a 100 veces menor.
  • La industria está adoptando cada vez más modelos de juicio más baratos y estrechos, aunque LLM-as-judge sigue siendo el valor predeterminado.
  • Los criterios de evaluación se están tratando como una especificación de producto viva (un nuevo PRD) en lugar de una suite de pruebas única.
  • El monitoreo amplio y siempre activo se destaca como más efectivo para detectar fallas reales que las suites de pruebas exhaustivas previas al lanzamiento.

Los desarrolladores deben adoptar el análisis de cohortes contrastivo y el monitoreo siempre activo para detectar fallas sistémicas que son invisibles al evaluar trazas de interacción únicas.

SOURCES

14. La trampa de la limpieza: por qué RAG no puede arreglar los malos canales de datos

Muchas iniciativas de IA generativa empresarial no llegan a producción debido a la poca confiabilidad de los datos en lugar de las limitaciones del modelo. Para construir sistemas de grado de producción, los desarrolladores deben tratar la ingeniería de datos como la base principal, aplicando una validación estricta y una ingesta de confianza cero antes de que los datos lleguen a la base de datos vectorial.

  • La 'Trampa de la limpieza' es la falsa creencia de que los problemas de datos heredados pueden resolverse en la capa de recuperación de una arquitectura RAG.
  • Las fallas en los canales de datos, como la deriva del esquema o los campos faltantes, degradan directamente el rendimiento del almacén vectorial y de la IA posterior.
  • El liderazgo técnico a menudo culpa incorrectamente a las limitaciones del modelo, como la latencia o las ventanas de contexto, por las fallas del proyecto.
  • Se aconseja a los equipos de datos que implementen la validación de esquema en línea y la validación algorítmica de varios niveles.
  • La seguridad, el control de acceso y la detección de anomalías deben gestionarse dentro de la infraestructura de datos, no en el modelo.

Los desarrolladores deben centrarse en la ingesta de datos de confianza cero y la validación de canales en lugar de esperar que las bases de datos vectoriales o los LLM limpien los datos incorrectos.

SOURCES

15. Cómo Claude Code y Codex manejan la opción de objetivo con alcance de sesión

La implementación de funciones de seguimiento de objetivos en los asistentes de codificación de IA varía significativamente entre plataformas. Mientras que Claude Code se basa en una capa de gestión ligera para detectar salidas tempranas, Codex utiliza un estado de hilo más integrado para autoevaluarse, destacando las compensaciones en la autonomía y el control del agente.

  • Claude Code implementa la opción /goal como un gancho de parada con alcance de sesión que detecta salidas tempranas.
  • La implementación de Claude Code no puede determinar si serían beneficiosas más iteraciones del solucionador.
  • Codex trata la opción /goal como un estado de hilo persistente donde el modelo evalúa su propio trabajo utilizando archivos y herramientas disponibles.
  • El uso de la opción /goal puede potencialmente amplificar la toma de decisiones deficiente tanto como las buenas decisiones.

Los desarrolladores deben comprender cómo los diferentes agentes de codificación evalúan su propio trabajo para evitar que los bucles automatizados amplifiquen la toma de decisiones deficiente.

SOURCES

16. La tabla de clasificación de LoRA Speedrun rastrea la eficiencia del ajuste fino

Al restringir el entrenamiento a la división de entrenamiento GSM8K y una sola GPU, la tabla de clasificación de LoRA Speedrun aísla el impacto de técnicas de optimización específicas. El proyecto tiene como objetivo establecer un registro público verificado de qué métodos, como el empaquetado de secuencias o los programas de tasa de aprendizaje agresivos, se traducen realmente en aceleraciones de entrenamiento en tiempo real.

  • La competencia desafía a los participantes a ajustar Qwen2.5-1.5B al 57% de precisión en GSM8K utilizando una sola GPU L40S.
  • Las ejecuciones de tiempo oficiales se realizan en sandboxes Modal L40S y se verifican en tres semillas nuevas.
  • El récord actual para la Pista 1 es de 1 minuto 44 segundos, y la Pista 2 se sitúa en 11 minutos 08 segundos.
  • Se prohíbe a los participantes utilizar modelos docentes, datos sintéticos o múltiples GPU.

Los desarrolladores pueden adoptar técnicas de ajuste fino verificadas y altamente eficientes para reducir drásticamente los tiempos y costos de entrenamiento en configuraciones de una sola GPU.

SOURCES

17. Los mejores LLM locales para una sola GPU de 24 GB en 2026

Ejecutar modelos locales requiere equilibrar los pesos del modelo, la caché KV y la sobrecarga del tiempo de ejecución. Si bien los modelos densos como Mistral Small 3.2 24B sobresalen en tareas de asistente de baja latencia, los modelos de mezcla de expertos (MoE) como Gemma 4 y Qwen3.6-35B-A3B ofrecen una decodificación rápida pero requieren VRAM dimensionada para su recuento total de parámetros en lugar de parámetros activos.

  • Una GPU de 24 GB de VRAM es el mínimo práctico para una inferencia de IA local seria en 2026.
  • Qwen3.6-27B (Apache 2.0) de Alibaba se recomienda como el mejor modelo integral para GPU de 24 GB.
  • DeepSeek-R1-Distill-Qwen-32B (licencia MIT) se destaca como un modelo de razonamiento denso que ocupa 18–20 GB de VRAM.
  • Q4_K_M es el nivel de cuantización estándar recomendado para equilibrar la calidad del modelo y la huella de memoria.
  • Los modelos de clase servidor como GLM-5.2, Kimi K2.7, DeepSeek V4 y Mistral Large 3 no pueden ejecutarse en una sola GPU de 24 GB.

Los desarrolladores pueden seleccionar el modelo de pesos abiertos óptimo para el desarrollo y las pruebas locales en función de las restricciones de VRAM y los requisitos específicos de la tarea.

SOURCES

18. Conformer ASR de 13M de parámetros portado al microcontrolador ESP32

Al aprovechar la aceleración de hardware del ESP32-S3 para matemáticas de 8 bits, este puerto demuestra la viabilidad de ejecutar modelos complejos de voz a texto en microcontroladores baratos y de bajo consumo. Esto abre nuevas posibilidades para interfaces de voz fuera de línea basadas en el borde en productos de IoT y hardware.

  • Un modelo de transformador de convolución de 13.1 millones de parámetros, basado en el conformador pequeño de Nvidia, fue portado a un ESP32-S3.
  • El modelo está destilado y cuantizado para caber en 14 MB de flash, 256 KB de SRAM y 4 MB de PSRAM.
  • El modelo es capaz de transcribir 8 segundos de audio localmente en el microcontrolador.
  • El proceso de destilación y cuantización resultó en solo un aumento del 3% en la tasa de error de palabras en los puntos de referencia ASR.
  • El modelo conformador local es significativamente más rápido que Whisper tiny, que tardó 50 minutos en transcribir 5 segundos de audio en el mismo hardware.

Los desarrolladores pueden construir dispositivos de hardware fuera de línea de bajo consumo capaces de transcribir voz en tiempo real sin depender de API en la nube.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.