Inference Brew

ByteDance lanza Seedance 2.5 con generación de 30 segundos y controles multimodales

00:00 / --:--

← Volver al inicio

ByteDance lanza Seedance 2.5 con generación de 30 segundos y controles multimodales

1. ByteDance lanza Seedance 2.5 con generación de 30 segundos y controles multimodales

Basándose en las capacidades de la línea Seedance, ByteDance ha lanzado oficialmente Seedance 2.5. Esta versión amplía la capacidad de generación a 30 segundos de contenido audiovisual de alta calidad en una sola pasada e introduce referencias multimodales avanzadas, permitiendo la entrada simultánea de hasta 30 imágenes, 10 clips de video y 10 clips de audio. También añade controles de edición a nivel de marca de tiempo y referencias de renderizado de arcilla. El acceso a la API está programado para ser lanzado a través de BytePlus ModelArk.

  • Seedance 2.5 aumenta la capacidad de generación a 30 segundos de contenido audiovisual en una sola pasada.
  • La nueva referencia multimodal admite la entrada simultánea de hasta 30 imágenes, 10 clips de video y 10 clips de audio.
  • Introduce edición a nivel de marca de tiempo, pantalla verde, edición de perspectiva de cámara y referencia de renderizado de arcilla.
  • Disponible en Jimeng AI y Doubao Pro, con acceso a la API de BytePlus ModelArk programado para su lanzamiento.

Esta actualización mejora significativamente el control creativo y la duración de la generación para los desarrolladores que utilizan la plataforma Seedance, superando las capacidades de la versión 2.0 anterior.

SOURCES

2. LongCat-Flash-Lite-Sparse actualizado para soportar un contexto de 1 millón de tokens

Se han publicado los pesos oficiales para el modelo LongCat-Flash-Lite-Sparse, basándose en el anuncio inicial de ayer. Esta versión introduce LongCat Sparse Attention (LSA) para reemplazar la anterior Multi-Head Latent Attention (MLA) densa, permitiendo el soporte nativo para 1 millón de tokens, un aumento significativo respecto al límite de 256k reportado en el lanzamiento inicial.

  • Los pesos del modelo para LongCat-Flash-Lite-Sparse ya están disponibles para su descarga.
  • El soporte de contexto nativo se ha ampliado a 1 millón de tokens.
  • La arquitectura ahora utiliza LongCat Sparse Attention (LSA) en lugar de la densa Multi-Head Latent Attention (MLA).

Esta actualización aumenta significativamente la utilidad del modelo para procesar documentos masivos o bases de código localmente al cuadruplicar la ventana de contexto disponible.

SOURCES

3. Poolside lanza puntos de control FP8 y NVFP4 optimizados para Laguna S 2.1

Basándose en el lanzamiento del 21 de julio del modelo de mezcla de expertos Laguna S 2.1, Poolside ha publicado puntos de control actualizados en FP8 y NVFP4. Estos nuevos pesos, acompañados de modificaciones de configuración, proporcionan a los desarrolladores opciones optimizadas para implementar el modelo de contexto de 1 millón de tokens.

  • Poolside lanzó puntos de control oficiales FP8 y NVFP4 para el modelo Laguna S 2.1.
  • La actualización incluye modificaciones de configuración junto con los nuevos pesos.
  • Estos puntos de control ya están disponibles para su descarga para soportar una inferencia optimizada.

Estos puntos de control cuantizados permiten una implementación local más eficiente y tuberías de inferencia especializadas para el modelo Laguna S 2.1.

SOURCES

4. Solid Queue 1.6.0 introduce trabajadores de fibra para cargas de trabajo LLM limitadas por E/S

Solid Queue v1.6.0 ha introducido un modo de ejecución de trabajador de fibra, permitiendo que los trabajos en segundo plano se ejecuten en un solo hilo de reactor de fibra en lugar de un grupo de hilos tradicional. Este modo de ejecución está optimizado para cargas de trabajo limitadas por E/S, lo que lo hace muy adecuado para aplicaciones que realizan llamadas frecuentes a la API de LLM externas. Para usar la función, los desarrolladores deben configurar el número de fibras, incluir la dependencia Async y habilitar el aislamiento de fibra en Rails.

  • Solid Queue v1.6.0 introduce un modo de ejecución de trabajador de fibra que ejecuta trabajos en un solo hilo de reactor de fibra.
  • La función está destinada específicamente a cargas de trabajo limitadas por E/S, como aquellas que involucran llamadas a LLM.
  • Requiere la dependencia Async y el aislamiento de fibra habilitado en Rails mediante config.active_support.isolation_level = :fiber.
  • La versión también incluye una corrección para revertir transacciones filtradas por hilos de trabajo eliminados en las pruebas.

Esto permite a los desarrolladores de Rails ejecutar trabajos de LLM en segundo plano en un solo hilo de reactor de fibra en lugar de un grupo de hilos pesado, mejorando la eficiencia de los recursos.

SOURCES

5. llama.cpp soluciona problemas de llamadas a herramientas para DeepSeek-V4-Flash-0731

Se ha fusionado una solicitud de extracción en el repositorio principal de llama.cpp para abordar problemas críticos de llamada a herramientas con el modelo DeepSeek-V4-Flash-0731. La actualización, identificada como la solicitud de extracción #26269, corrige el bucle del modelo y el comportamiento deficiente, restaurando un rendimiento estable para los desarrolladores que utilizan las capacidades de llamada a herramientas del modelo en entornos locales.

  • La solicitud de extracción #26269 se fusionó en el repositorio principal de llama.cpp.
  • La corrección aborda problemas con el bucle del modelo y el comportamiento deficiente durante la llamada a herramientas.
  • La actualización resolvió problemas de rendimiento experimentados por los usuarios que ejecutan DeepSeek-V4-Flash-0731.
  • La corrección se añadió a la rama principal del repositorio.

Esto restaura capacidades confiables de llamada a herramientas para los desarrolladores que ejecutan DeepSeek-V4-Flash-0731 localmente a través de llama.cpp.

SOURCES

6. Lanzamiento de la plataforma de evaluación comparativa de LLM locales beta.locallm.top

Se ha lanzado la plataforma beta.locallm.top, proporcionando un espacio dedicado para la evaluación comparativa de LLM locales. El sitio alberga actualmente más de 10 evaluaciones comparativas de dominio estrecho y más de 25 evaluaciones comparativas más pequeñas. Los desarrolladores pueden crear evaluaciones comparativas personalizadas, definir combinaciones de modelos y avisos del sistema (tuberías), evaluar respuestas y ver tablas de comparación. La arquitectura de la plataforma se basa en llama-server para la ejecución del modelo, coordinada por una API de backend, y admite evaluaciones comparativas privadas para evitar la contaminación de datos.

  • El sitio web beta.locallm.top se lanzó como una plataforma para la evaluación comparativa de LLM locales.
  • La plataforma alberga actualmente más de 10 evaluaciones comparativas de dominio estrecho y más de 25 evaluaciones comparativas más pequeñas.
  • Admite evaluaciones comparativas y tuberías privadas para mitigar la contaminación y permitir la experimentación.
  • La arquitectura del sistema utiliza llama-server para la ejecución del modelo, coordinada por una API de backend y un relé de servicio de modelo.

Esto brinda a los desarrolladores un entorno estructurado y privado para evaluar el rendimiento del modelo local en avisos personalizados sin contaminación de datos.

SOURCES

7. Cursor elimina el seguimiento de costos basado en dólares de los paneles de autoservicio

Cursor ha eliminado el seguimiento de costos basado en dólares de su panel de uso y exportaciones CSV para planes individuales y de equipos de autoservicio. El panel ahora muestra recuentos de tokens en lugar de montos en dólares, y los datos históricos de costos se han puesto a cero o eliminado. Cursor declaró que esta es una elección de diseño intencional para evitar la confusión entre el uso del plan incluido y los cargos bajo demanda, aunque los usuarios han expresado su frustración por la pérdida de seguimiento granular por solicitud y eficiencia del modelo.

  • Cursor eliminó el seguimiento de costos basado en dólares para planes individuales y de equipos de autoservicio a partir del 31 de julio de 2026.
  • El panel de uso ahora muestra recuentos de tokens en lugar de montos en dólares, y los datos históricos de costos en las exportaciones se han eliminado o puesto a cero.
  • El representante de Cursor, Kevin Neilson, declaró que el cambio tiene la intención de evitar la confusión del usuario entre el uso del plan incluido y los cargos bajo demanda.
  • Los planes empresariales no se ven afectados y continúan mostrando el seguimiento de costos basado en dólares.
  • Los usuarios pueden consultar el panel de Gastos para conocer los costos totales del ciclo de facturación o utilizar la API de administración para obtener datos de gastos a nivel de equipo.

Esto obliga a los desarrolladores a realizar un seguimiento de los recuentos de tokens en lugar de los costos directos en dólares, lo que complica el monitoreo del presupuesto y el análisis de la eficiencia del modelo.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.