Inference Brew

UkisAI lanza el modelo Swift-1.5-Qwen3.8-27b

00:00 / --:--

← Volver al inicio

UkisAI lanza el modelo Swift-1.5-Qwen3.8-27b

1. UkisAI lanza el modelo Swift-1.5-Qwen3.8-27b

Basándose en las técnicas de destilación On-Policy anunciadas el 14 de septiembre, UkisAI ha lanzado oficialmente Swift-1.5-Qwen3.8-27b. Esta variante está ajustada para maximizar la eficiencia de tokens en tareas rápidas que requieren poco razonamiento. Las pruebas comparativas muestran que la cuantización IQ4_XS del modelo supera a la Q4_K_S de Unsloth en escenarios de bajo razonamiento, manteniendo un alto rendimiento en hardware local como la NVIDIA 3090.

  • • UkisAI ha lanzado Swift-1.5-Qwen3.8-27b, una variante de modelo optimizada para la eficiencia de tokens.
  • • Este lanzamiento sigue al anuncio del equipo del 14 de septiembre sobre la destilación On-Policy para Qwen 3.8 27B.
  • • El modelo demuestra un rendimiento superior en tareas de bajo razonamiento en comparación con la cuantización Q4_K_S de Unsloth.
  • • Las pruebas de la comunidad confirman una ejecución local en una NVIDIA 3090 a 67 tokens por segundo.

Proporciona a los desarrolladores una variante de modelo lista para producción y eficiente en tokens, basada en la investigación de optimización anunciada previamente por UkisAI.

SOURCES

2. Agentes de codificación empresarial actualizan precios, indemnización y cambio de marca

El panorama de los asistentes de codificación con IA para empresas ha experimentado cambios importantes en propiedad, precios y protecciones legales. Cognition ha adquirido el IDE Windsurf, renombrándolo como Devin Desktop. En cuanto a los precios, GitHub Copilot ha hecho la transición a un modelo de créditos basado en el uso, al tiempo que relaja sus requisitos de indemnización de propiedad intelectual para código no modificado. Mientras tanto, AWS Kiro ofrece indemnización por derechos de autor sin límites, lo que contrasta con el MSA de Cursor, que excluye la indemnización de su límite de responsabilidad.

  • • Cognition adquirió el IDE Windsurf y lo renombró como Devin Desktop el 2 de junio de 2026.
  • • GitHub Copilot hizo la transición a un modelo de créditos de IA basado en el uso el 1 de junio de 2026, con un precio de 0,01 $ por crédito.
  • • La política de indemnización de propiedad intelectual de GitHub Copilot de Microsoft ya no requiere mitigaciones adicionales para código no modificado.
  • • AWS Kiro ofrece indemnización por derechos de autor sin límites, mientras que el Acuerdo de Nivel de Servicio de Cursor excluye la indemnización de su límite de tarifas.
  • • GitHub Enterprise Cloud ahora admite la residencia de datos en la UE o EE. UU. por un aumento del 10 % en el consumo de créditos de IA.
  • • El modo de privacidad de Cursor evita la retención y el entrenamiento de datos, aunque las solicitudes aún se procesan a través del backend de Cursor.

Ayuda a los desarrolladores y equipos empresariales a navegar por los cambiantes panoramas legales, de privacidad y de precios de los principales asistentes de codificación con IA.

SOURCES

3. Google Research presenta el Massive Sound Embedding Benchmark (MSEB)

Google Research ha lanzado el Massive Sound Embedding Benchmark (MSEB), un marco diseñado para estandarizar la evaluación de codificadores de audio. En lugar de depender de una única métrica principal, MSEB califica los modelos en cuatro tareas distintas: clasificación, agrupación, recuperación y segmentación. Los desarrolladores pueden integrar modelos como Whisper, wav2vec, CLAP, EnCodec y SoundStream implementando un contrato simple de tres métodos, y el marco se encarga de todo el procesamiento por lotes, la validación y los cálculos estadísticos.

  • • Google Research ha introducido el Massive Sound Embedding Benchmark (MSEB) para evaluar codificadores de sonido.
  • • El marco prueba modelos en tareas de clasificación, agrupación, recuperación y segmentación.
  • • Los codificadores deben implementar un contrato simple de tres métodos: _setup, _check_input_types y _encode.
  • • MSEB admite la integración con modelos de audio populares, incluidos Whisper, wav2vec, CLAP, EnCodec y SoundStream.
  • • El benchmark maneja el procesamiento por lotes, la validación y las estadísticas, y puede ejecutarse en un tiempo de ejecución de CPU gratuito sin descargas de conjuntos de datos.

Proporciona un marco estandarizado para evaluar y calificar codificadores de sonido en múltiples tareas, ayudando a los desarrolladores a elegir el mejor modelo de incrustación de audio para su aplicación.

SOURCES

4. Lanzan servidor MCP público para datos de leyes de privacidad canadienses

El investigador de privacidad Mohammad Movahedi ha lanzado un servidor gratuito y público del Protocolo de Contexto de Modelo (MCP) y una API REST que contiene datos sobre las leyes de privacidad canadienses. Operando a través del transporte HTTP transmitible, el servidor expone cinco herramientas especializadas que permiten a los agentes de IA buscar acciones de cumplimiento de la comisión de acceso a la información de Quebec, consultar términos en un glosario de privacidad de 263 palabras y evaluar el cumplimiento frente a una lista de verificación de preparación de 11 puntos de la Ley 25 de Quebec.

  • • Se ha lanzado un servidor gratuito y público del Protocolo de Contexto de Modelo (MCP) que proporciona acceso a datos sobre las leyes de privacidad canadienses.
  • • El servidor utiliza transporte HTTP transmitible y está alojado públicamente en https://movahedi.ca/mcp.
  • • Incluye cinco herramientas para buscar acciones de cumplimiento, consultar términos del glosario y verificar la preparación para la Ley 25 de Quebec.
  • • Hay disponible una API REST complementaria con cuotas de 2000 llamadas diarias para usuarios anónimos y 10 000 para titulares de claves API gratuitas.

Ofrece a los desarrolladores un servidor MCP listo para usar para consultar las leyes de privacidad canadienses y los requisitos de cumplimiento de la Ley 25 de Quebec directamente dentro de sus agentes de IA.

SOURCES

5. Llama.cpp acelera el Prompt Lookup Drafting en 42 veces

El repositorio llama.cpp ha recibido una importante actualización de rendimiento, acelerando su implementación de Prompt Lookup Drafting en 42 veces. Esta optimización acelera drásticamente la decodificación especulativa, permitiendo que los modelos locales redacten y verifiquen tokens mucho más rápido durante la inferencia sin necesidad de hardware adicional.

  • • El Prompt Lookup Drafting en llama.cpp se ha actualizado para ofrecer un aumento de 42 veces en la velocidad.
  • • La optimización mejora significativamente el rendimiento de la decodificación especulativa para ejecuciones de modelos locales.

Reduce drásticamente la latencia para la inferencia de LLM local al acelerar la decodificación especulativa mediante el borrador de búsqueda de prompts.

SOURCES

6. Las penalizaciones de logit-bias en palabras de sobrepensamiento aumentan la precisión de Qwen

Un experimento intrigante demuestra que aplicar penalizaciones de logit-bias a 49 marcadores específicos de "sobrepensamiento" (como "quizás", "tal vez", "espera" y "en realidad") puede mejorar significativamente la precisión del modelo Qwen. Las pruebas en el modelo Qwen3.5-4B-GGUF utilizando el conjunto de datos MATH-500 mostraron que la precisión del formato BF16 aumentó del 74 % al 84 %, mientras que simultáneamente se redujeron los tokens de razonamiento en un 19,4 %. Incluso el formato Q2_K altamente cuantizado vio duplicada su precisión, lo que sugiere que desalentar los pasos de razonamiento circular puede generar mejores respuestas y menores costos de tokens.

  • • La aplicación de penalizaciones de logit-bias a 49 palabras de "sobrepensamiento" (como "quizás", "tal vez", "espera") mejoró la precisión del modelo Qwen.
  • • En las pruebas con Qwen3.5-4B-GGUF, la precisión del formato BF16 aumentó del 74 % al 84 % en el conjunto de datos MATH-500.
  • • La técnica redujo los tokens de razonamiento en un 19,4 % para el modelo BF16 y un 11,5 % para el modelo Q2_K.
  • • La precisión para el formato Q2_K altamente cuantizado se duplicó del 12 % al 24 %.
  • • Las penalizaciones desalientan los pasos de razonamiento innecesarios, aunque los resultados se basan actualmente en una prueba preliminar única.

Permite a los desarrolladores aumentar la precisión del modelo de razonamiento y reducir los costos de tokens mediante la aplicación de simples penalizaciones de logit-bias a las palabras de sobrepensamiento durante la inferencia.

SOURCES

7. El motor de streaming SSD ejecuta modelos MoE de 177B en GPU de consumo

Un motor de inferencia innovador para modelos de mezcla de expertos (MoE) permite a los desarrolladores ejecutar modelos masivos localmente transmitiendo expertos directamente desde un SSD cuando superan los límites de VRAM y RAM. En las pruebas, el motor alcanzó de 9 a 10 tokens por segundo decodificando el modelo Qwen3.8-Flash-Next NVFP4 de 176,9 mil millones de parámetros utilizando solo una única GPU RTX 5060 Ti de 16 GB, 32 GB de RAM y un SSD NVMe Gen5. El sistema utiliza la expulsión GCLOCK, la captación previa de búsqueda anticipada y multiplicaciones de matriz NVFP4 nativas que se ejecutan directamente en los núcleos tensoriales Blackwell, aunque actualmente está limitado a GPU de la serie RTX 50, Windows 11/WSL2 y decodificación codiciosa.

  • • Los desarrolladores han creado un motor de inferencia que transmite expertos MoE desde un SSD para ejecutar modelos que superan los límites de VRAM y RAM.
  • • El motor alcanzó de 9 a 10 tokens por segundo decodificando un modelo Qwen3.8-Flash-Next NVFP4 de 176,9B en una sola RTX 5060 Ti de 16 GB.
  • • El sistema utiliza 20 GiB de RAM y 99 GiB de almacenamiento SSD, aprovechando la expulsión GCLOCK y la captación previa de búsqueda anticipada.
  • • Cuenta con multiplicaciones de matriz NVFP4 nativas que se ejecutan directamente en los núcleos tensoriales Blackwell sin desempaquetar.
  • • Actualmente, el motor está limitado a GPU de la serie RTX 50 (Blackwell), Windows 11 o WSL2, y decodificación codiciosa.
  • • El proyecto incluye un servidor compatible con OpenAI con chat integrado y soporte para llamadas a herramientas.

Permite a los desarrolladores ejecutar modelos masivos de 177 mil millones de parámetros localmente en GPU de consumo económicas mediante la transmisión de pesos del modelo directamente desde SSD de alta velocidad.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.