Inference Brew

Anthropic lanza Claude Opus 5.5 con precios más bajos y seguridad mejorada

00:00 / --:--

← Volver al inicio

Anthropic lanza Claude Opus 5.5 con precios más bajos y seguridad mejorada

1. Anthropic lanza Claude Opus 5.5 con precios más bajos y seguridad mejorada

Tras el lanzamiento de Claude Opus 5 y la serie Fable 5.1, Anthropic ha lanzado Claude Opus 5.5. El nuevo modelo insignia presenta una reducción del 20% en el precio base de los tokens, situándose en 4 dólares por millón de entrada y 20 dólares por millón de salida, junto con un recorte del 60% en los costes de lectura de caché. Opus 5.5 es un 30% más rápido que su predecesor e introduce medidas de seguridad más estrictas, incluyendo una reducción del 85% en los intentos de elusión de límites y enrutamiento automatizado para consultas sensibles de ciberseguridad y biología.

  • • Claude Opus 5.5 es la última incorporación a la familia Claude 5, con una ventana de contexto de 1 millón de tokens.
  • • El precio base se reduce un 20% a 4 dólares por millón de tokens de entrada y 20 dólares por millón de salida, con los costes de lectura de caché reducidos un 60% a 0,20 dólares por millón.
  • • El modelo es más de un 30% más rápido que Opus 5 y actualmente ocupa el primer lugar en el Artificial Analysis Intelligence Index con una puntuación de 58.
  • • Los protocolos de seguridad mejorados reducen los intentos de elusión de límites en un 85% en comparación con versiones anteriores.
  • • Las solicitudes sensibles de ciberseguridad y biología se redirigen automáticamente a versiones anteriores del modelo (Opus 4.8 y Opus 5, respectivamente).

Los desarrolladores ahora pueden acceder a un modelo insignia más rentable y seguro que actualmente lidera el Artificial Analysis Intelligence Index, basándose en las capacidades establecidas en los lanzamientos anteriores de Claude 5.

2. OpenAI amplía la línea GPT-6 con los modelos Sol y Luna

OpenAI ha ampliado su familia de modelos GPT-6 con la disponibilidad general de GPT-6 Sol y GPT-6 Luna, tras el lanzamiento inicial del modelo agente GPT-6 Astra a principios de este mes. Estas nuevas incorporaciones ofrecen a los desarrolladores alternativas convencionales y económicas al modelo de gama alta Astra, con reducciones de precio significativas en comparación con la serie GPT-5.6 y mejores tasas de alucinación.

  • • OpenAI amplió la serie GPT-6 con el lanzamiento de los modelos Sol y Luna.
  • • GPT-6 Sol tiene un precio de 2 dólares por millón de tokens de entrada y 10 dólares por millón de salida.
  • • GPT-6 Luna tiene un precio de 0,10 dólares por millón de tokens de entrada y 0,50 dólares por millón de salida.
  • • Ambos modelos presentan mejores tasas de alucinación y mantienen el descuento del 90% en caché de prompts introducido con la arquitectura GPT-6.
  • • GPT-6 Sol supera a Claude Opus 5 en el benchmark AutomationBench a un coste menor.

Los desarrolladores ahora tienen una gama más amplia de modelos GPT-6 para elegir, lo que les permite equilibrar el rendimiento, el coste y las capacidades de razonamiento en la nueva arquitectura.

3. Xiaomi amplía la serie MiMo-V2.6 con el modelo omnimodal Flash

Ampliando el reciente lanzamiento de MiMo-V2.6-Pro, Xiaomi ha lanzado el modelo omnimodal Flash, diseñado para coordinar agentes en la construcción de escenas 3D. La compañía también ha publicado como código abierto el informe técnico, los entornos de entrenamiento y el código de aprendizaje por refuerzo para la serie V2.6. Ambos modelos cuentan con una ventana de contexto de 1 millón de tokens y admiten entradas de texto, imagen, voz y vídeo.

  • • Xiaomi lanzó el modelo omnimodal Flash junto con el previamente anunciado MiMo-V2.6-Pro.
  • • Los modelos están diseñados para coordinar agentes para construir y probar escenas 3D interactivas.
  • • Xiaomi publicó como código abierto el informe técnico, los entornos de entrenamiento y el código de aprendizaje por refuerzo para la serie V2.6.
  • • Ambos modelos admiten entradas de texto, imagen, voz y vídeo con una ventana de contexto de 1 millón de tokens.

Los desarrolladores ahora tienen acceso a la suite completa MiMo-V2.6, incluido el nuevo modelo Flash y recursos integrales de entrenamiento de código abierto para crear flujos de trabajo de agentes 3D interactivos.

4. StepFun lanza Step 5 Preview con una ventana de contexto de 1 millón

StepFun ha lanzado Step 5 Preview, un nuevo modelo insignia con 600 mil millones de parámetros totales (27 mil millones activos) y una ventana de contexto de 1 millón de tokens. El modelo acepta entradas de texto, imagen y vídeo, e iguala el rendimiento de Kimi K3 (max) en el Artificial Analysis Intelligence Index, ofreciendo un coste 2,8 veces menor por tarea. Actualmente está disponible a través de la API de primera parte de StepFun a 1 dólar por millón de tokens de entrada y 2,70 dólares por millón de tokens de salida, con un lanzamiento de pesos abiertos programado para el 15 de octubre.

  • • StepFun lanzó Step 5 Preview, un modelo insignia con 600B de parámetros totales y 27B de parámetros activos.
  • • El modelo admite una ventana de contexto de 1 millón de tokens y acepta entradas de texto, imagen y vídeo.
  • • Step 5 Preview iguala el rendimiento de Kimi K3 (max) en el Artificial Analysis Intelligence Index mientras cuesta 2,8 veces menos por tarea.
  • • El precio es de 1 dólar por millón de tokens de entrada y 2,70 dólares por millón de tokens de salida, con entrada en caché a 0,05 dólares por millón de tokens.
  • • El modelo está disponible a través de la API de StepFun, con un lanzamiento de pesos abiertos programado para el 15 de octubre.

Los desarrolladores obtienen un modelo insignia altamente rentable para tareas multimodales de contexto largo, con un lanzamiento de pesos abiertos programado para el próximo mes.

5. AntLing publica como código abierto la familia de modelos Ming-Image-0.1-Design 6B

AntLing ha publicado como código abierto la familia de modelos Ming-Image-0.1-Design, que consta de los modelos Ming-Image-0.1-Design de 6B y Ming-Image-0.1-Design-Layer de 6B. Diseñado específicamente para tareas de UI/UX, el modelo base ocupa actualmente el primer lugar entre los modelos de pesos abiertos en la tabla de clasificación de diseño UI/UX de Artificial Analysis. El lanzamiento también incluye dos habilidades de agente de código abierto: la Ling UI Design Skill y la Image-to-Editable-PPT Skill.

  • • AntLing publicó como código abierto los modelos Ming-Image-0.1-Design y Ming-Image-0.1-Design-Layer de 6B de parámetros.
  • • El lanzamiento incluye dos habilidades de agente de código abierto: la Ling UI Design Skill y la Image-to-Editable-PPT Skill.
  • • Ming-Image-0.1-Design ocupa el primer lugar entre los modelos de pesos abiertos en la tabla de clasificación de diseño UI/UX de Artificial Analysis.

Los desarrolladores pueden autoalojar un modelo de pesos abiertos de primer nivel ajustado específicamente para generar diseños de interfaz de usuario y presentaciones editables.

SOURCES

6. StepFun lanza StepAudio 3 ASR con una tasa de error de palabra del 1,7%

StepFun ha lanzado StepAudio 3 ASR, un nuevo modelo de voz a texto no continuo disponible a través de su API. El modelo logra una tasa de error de palabra (WER) del 1,7% en el índice AA-WER, empatando en el primer lugar con Fun-Realtime-ASR-preview de Alibaba y marcando una mejora significativa sobre el 4,7% de WER de StepAudio 2.5. Sin embargo, a una velocidad 88 veces superior a la del tiempo real, se queda atrás de alternativas más rápidas como MAI-Transcribe-2 (374x) y tiene un precio premium de 0,40 dólares por hora.

  • • StepFun lanzó StepAudio 3 ASR, un modelo de voz a texto no continuo disponible a través de su API.
  • • El modelo logró una tasa de error de palabra (WER) del 1,7% en el índice AA-WER, empatando con Fun-Realtime-ASR-preview de Alibaba.
  • • StepAudio 3 ASR transcribe a una velocidad 88 veces superior a la del tiempo real, por detrás de competidores como MAI-Transcribe-2 (374x) y Grok Voice Transcribe 2.0 (154x).
  • • El modelo tiene un precio de 0,40 dólares por hora (6,67 dólares por 1.000 minutos), lo que lo convierte en el más caro de los cinco modelos más precisos.

Los desarrolladores que crean funciones de voz obtienen una opción de voz a texto altamente precisa, aunque deben sopesar su alto coste frente a transcriptores rápidos alternativos.

SOURCES

7. Qwen-Image 2.1 utiliza un reescritor de prompts de 9B para la generación de imágenes

Qwen-Image 2.1 utiliza un reescritor de prompts de 9B de parámetros para expandir las solicitudes de los usuarios antes de generar imágenes. Este reescritor requiere 20 GB de memoria en formato bf16, utiliza un prompt del sistema de 1.700 palabras y procesa aproximadamente 1.600 tokens de "pensamiento" antes de generar una salida. Para entornos con recursos limitados, se ha lanzado una versión comprimida de 0,8B de parámetros del modelo para permitir su ejecución en portátiles.

  • • Qwen-Image 2.1 utiliza un reescritor de prompts de 9B de parámetros para expandir las solicitudes de los usuarios antes de generar imágenes.
  • • El reescritor de prompts de 9B requiere 20 GB de memoria en formato bf16 y utiliza un prompt del sistema de 1.700 palabras.
  • • El reescritor piensa durante aproximadamente 1.600 tokens antes de generar una respuesta.
  • • Una versión comprimida de 0,8B de parámetros del modelo está disponible para ejecutarse en portátiles.

Comprender la arquitectura de expansión de prompts de Qwen-Image 2.1 ayuda a los desarrolladores a optimizar sus tuberías de generación de imágenes y sus requisitos de hardware.

SOURCES

8. AWS integra el framework Strands en el nuevo Agent Harness

Tras el lanzamiento de código abierto del framework Strands Agents en junio, AWS ha lanzado ahora Strands Agent Harness. Esta nueva oferta transiciona el framework a un entorno gestionado y listo para usar que incluye capacidades integradas de búsqueda web, ejecución de comandos, edición de archivos y delegación de tareas, lo que permite a los desarrolladores desplegar agentes simplemente proporcionando un LLM.

  • • AWS ha lanzado Strands Agent Harness, una evolución del framework de código abierto Strands Agents.
  • • El harness proporciona un entorno listo para usar para búsqueda web, ejecución de comandos y edición de archivos.
  • • Incluye memoria integrada y delegación de tareas a agentes auxiliares.
  • • Los desarrolladores solo necesitan proporcionar el LLM subyacente para comenzar la ejecución.

Los desarrolladores ahora pueden aprovechar el framework Strands establecido dentro de un entorno AWS totalmente gestionado, simplificando el despliegue de flujos de trabajo de agentes con ejecución de herramientas y delegación integradas.

SOURCES

9. DigitalOcean lanza Managed Agents en vista previa pública

DigitalOcean ha lanzado Managed Agents en vista previa pública, proporcionando un entorno de ejecución sin servidor diseñado específicamente para ejecutar agentes autónomos como Claude Code, Codex o flujos de trabajo de LangGraph personalizados. El servicio admite más de 75 modelos abiertos y propietarios, consolida la facturación y proporciona un único punto final gobernado para las herramientas de agentes. Para optimizar los costes de infraestructura, el entorno de ejecución gestionado se pausa automáticamente cuando los agentes están inactivos.

  • • DigitalOcean Managed Agents ha entrado en vista previa pública.
  • • El servicio ejecuta agentes de Claude Code, Codex o LangGraph personalizados en un entorno de ejecución que se pausa cuando está inactivo.
  • • Admite más de 75 modelos abiertos y propietarios.
  • • La plataforma proporciona un único punto final gobernado para las herramientas de agentes y consolida la facturación.

Los desarrolladores pueden desplegar y ejecutar agentes autónomos en un entorno seguro y gestionado que se pausa automáticamente cuando está inactivo para ahorrar costes.

SOURCES

10. Rabbit lanza el sistema operativo de agentes OS3 con modelo BYOK

Rabbit ha anunciado OS3, un sistema operativo de agentes diseñado para ejecutarse en dispositivos Windows, Mac y Linux sin necesidad del hardware R1 de la compañía (cuya fabricación ha cesado). OS3 opera bajo un modelo de "Trae tu propia clave" (BYOK), lo que permite a los usuarios integrar sus propias claves API de proveedores como OpenAI o Anthropic. El sistema ejecuta un nodo de agente local en la máquina del usuario para ejecutar tareas de software, escribir código y depurar, coordinando automáticamente los archivos, aplicaciones y modelos necesarios.

  • • Rabbit anunció OS3, un sistema operativo de agentes que se ejecuta en Windows, Mac y Linux, así como en el gadget R1.
  • • OS3 utiliza un modelo de "Trae tu propia clave" (BYOK), lo que permite a los usuarios proporcionar sus propias claves API de OpenAI o Anthropic.
  • • La plataforma utiliza un nodo de agente local en la máquina host para ejecutar tareas de software, escribir código y depurar.
  • • Rabbit ha cesado la fabricación del hardware R1 y planea lanzar un dispositivo "Cyberdeck" para "vibe coding" en los próximos meses.

Los desarrolladores y usuarios avanzados pueden ejecutar nodos de agentes locales para realizar tareas de software y escribir código utilizando sus propias claves API.

11. Firecrawl recauda 75 millones de dólares y lanza el servicio en la nube Alexandria

La startup de web scraping Firecrawl ha recaudado 75 millones de dólares en una ronda de financiación de serie B liderada por Smash Ventures. Junto con la financiación, Firecrawl ha lanzado Alexandria, un nuevo servicio en la nube que integra datos de web scraping con conjuntos de datos de terceros y curados, incluidos resúmenes científicos y archivos de código. Alexandria expone estos datos a través de una única API, eliminando la necesidad de que los desarrolladores creen conectores personalizados, mientras aprovecha las funciones de scraping optimizadas para agentes de Firecrawl, como la espera inteligente y el envío automatizado de formularios.

  • • Firecrawl recaudó 75 millones de dólares en una ronda de financiación de serie B liderada por Smash Ventures.
  • • La plataforma proporciona herramientas de web scraping optimizadas para agentes de IA, con espera inteligente y acciones de usuario automatizadas (desplazamiento, clic).
  • • Firecrawl lanzó Alexandria, un nuevo servicio en la nube que integra datos web con conjuntos de datos de terceros y curados (resúmenes científicos, archivos de código).
  • • Alexandria proporciona datos a través de una única API, eliminando la necesidad de conectores personalizados.

Los desarrolladores que crean agentes de IA obtienen una plataforma de scraping más robusta y financiada, y una API unificada para acceder a datos web junto con conjuntos de datos de código y científicos curados.

SOURCES

12. Jev Catalog cura herramientas e integraciones para modelos de decisión

Jev es una herramienta especializada diseñada para responder consultas de datos seleccionando opciones, proporcionando probabilidades de sí/no o puntuando elementos en una escala en lugar de generar texto de forma libre. Para integrar Jev, los desarrolladores utilizan SDKs oficiales de JavaScript, TypeScript o Python configurados con una clave API typesafe-sdk. Un catálogo curado de 36 proyectos revisados, que incluye herramientas para la automatización del navegador y soporte para agentes de codificación, se actualiza cada cuatro horas para mostrar las integraciones de la comunidad.

  • • Jev es una herramienta que responde preguntas seleccionando opciones, proporcionando probabilidades de sí/no o puntuando elementos en lugar de generar texto.
  • • El proyecto requiere el typesafe-sdk y una TYPESAFE_API_KEY.
  • • El soporte oficial se proporciona a través de SDKs de JavaScript, TypeScript y Python.
  • • El catálogo curado presenta 36 selecciones, incluidas herramientas para la automatización del navegador, soporte para agentes de codificación y juegos.

Los desarrolladores pueden explorar un catálogo curado de 36 proyectos e integraciones construidos en torno a modelos de decisión estructurados.

SOURCES

13. Optimización del rendimiento del código Rust mediante LLMs de agentes

Un desarrollador ha documentado un método altamente efectivo para utilizar LLMs de agentes para optimizar iterativamente el código Rust, logrando aceleraciones de rendimiento de 2x a 20x. El flujo de trabajo se basa en un "Ur-Prompt" estructurado y un conjunto de reglas definidas en un archivo AGENTS.md para guiar a los LLMs a través de la evaluación comparativa con el crate criterion, evitando comportamientos de trampa. El proceso emplea subagentes GPT-5.6 Luna para explorar hipótesis de optimización e incluye un paso de refactorización para reducir las líneas de código fuente en al menos un 20% sin regresiones de rendimiento.

  • • El autor desarrolló un "Ur-Prompt" y reglas en AGENTS.md para guiar a los LLMs en la evaluación comparativa y optimización del código Rust.
  • • El proceso logró aceleraciones de rendimiento que van de 2x a 20x en varios dominios.
  • • La evaluación comparativa se realiza utilizando el crate criterion, con restricciones que prohíben el código inseguro y las ejecuciones paralelizadas.
  • • El flujo de trabajo utiliza subagentes GPT-5.6 Luna para explorar hipótesis de optimización e incluye un paso de refactorización para reducir las líneas de código fuente en un 20%.
  • • Modelos de frontera recientes como GPT-6 Astra demostraron la capacidad de encontrar reimplementaciones algorítmicas para una aceleración adicional de 2x-3x.

Los desarrolladores pueden adoptar reglas de prompts estructuradas y flujos de trabajo de subagentes para automatizar la evaluación comparativa y la optimización de sus bases de código locales.

SOURCES

14. Artificial Analysis amplía Speech Arena con soporte multilingüe y benchmark de pronunciación

Artificial Analysis ha ampliado su Controlled Voice Arena para incluir nueve nuevos idiomas (japonés, mandarín, hindi, español, alemán, francés, portugués, vietnamita y árabe) e introdujo un benchmark de robustez de pronunciación. Esta actualización se basa en la Speech Arena existente de la plataforma, que anteriormente rastreaba el rendimiento del modelo en inglés y otros idiomas principales. El nuevo benchmark evalúa los modelos TTS en 454 oraciones desafiantes, con Google Gemini 3.1 Flash TTS liderando actualmente con un 88,1% de precisión. Sonic 3.6 de Cartesia, previamente señalado como uno de los mejores desempeños en la plataforma, ahora lidera en siete de los nueve idiomas recién añadidos.

  • • Artificial Analysis añadió nueve idiomas a su Controlled Voice Arena, incluidos japonés, mandarín y árabe.
  • • Un nuevo benchmark de robustez de pronunciación evalúa la precisión de TTS en 454 oraciones.
  • • Google Gemini 3.1 Flash TTS lidera el nuevo benchmark de pronunciación con un 88,1% de precisión.
  • • Sonic 3.6 de Cartesia ocupa el primer lugar en siete de los nueve idiomas recién añadidos.
  • • Kokoro 82M v1.0 es el modelo más rápido probado a 242 caracteres por segundo, pero obtuvo un 55,5% en robustez de pronunciación.

Los desarrolladores ahora pueden evaluar modelos TTS para aplicaciones globales utilizando soporte de idiomas ampliado y métricas específicas de precisión de pronunciación, extendiendo la utilidad de la suite de evaluación comparativa de Artificial Analysis existente.

15. Lanzamiento de JevBench para estandarizar la evaluación de modelos de clase Jev

A medida que el ecosistema de modelos de clase Jev (sistemas especializados diseñados para la toma de decisiones estructurada) continúa creciendo, los desarrolladores han lanzado JevBench. Esta herramienta de evaluación comparativa de código abierto proporciona un harness reproducible de 534 decisiones en inglés, lo que permite la evaluación estandarizada de la inteligencia, la calibración, la velocidad y el coste en diferentes implementaciones de estilo Jev.

  • • JevBench proporciona un harness de código abierto estandarizado para evaluar modelos de clase Jev.
  • • La herramienta mide la precisión, la calibración, la latencia y el coste en 534 tareas de decisión en inglés.
  • • Este lanzamiento respalda el creciente ecosistema de modelos de estilo Jev, incluidas implementaciones comerciales, de código abierto y de bricolaje.
  • • El harness, los artefactos y el código de puntuación están disponibles en GitHub.

La evaluación comparativa estandarizada permite a los desarrolladores comparar el rendimiento de varios modelos de clase Jev e implementaciones de bricolaje, facilitando una mejor selección y optimización para tareas de toma de decisiones estructuradas.

SOURCES

16. TypeSafe AI lanza los modelos Jev2 y SemIf para la optimización de sentencias If

Tras el lanzamiento del framework Jev el 16 de septiembre, TypeSafe AI ha introducido Jev2 y SemIf, dos nuevos modelos diseñados específicamente para agilizar la toma de decisiones si-entonces. Estos modelos se basan en la arquitectura Jev original, demostrando una reducción del 99% en los costes y un aumento de la precisión del 47% a más del 80% en las pruebas, refinando aún más la economía de la lógica condicional impulsada por IA.

  • • Jev2 y SemIf son nuevos modelos diseñados para optimizar la toma de decisiones si-entonces.
  • • Estos modelos siguen el lanzamiento inicial del framework Jev del 16 de septiembre.
  • • Las pruebas muestran una reducción de costes del 99% y una mejora de la precisión del 47% a más del 80%.
  • • Los modelos tienen como objetivo transformar aún más la economía de los sistemas de producción de IA.

Estas actualizaciones proporcionan a los desarrolladores herramientas más especializadas y eficientes para reemplazar la lógica condicional compleja, reduciendo significativamente los costes de API en comparación con el lanzamiento original de Jev.

SOURCES

17. El sandbox de Linux rootless de código abierto Drop añade soporte para gVisor

Drop es un sandbox de Linux rootless de código abierto diseñado para ejecutar programas de terceros en entornos aislados, lo que lo hace muy útil para los desarrolladores que ejecutan código no confiable generado por LLM. La herramienta aprovecha los espacios de nombres de Linux para aplicar el aislamiento, proporcionando un directorio de inicio grabable y desechable mientras monta los archivos de configuración como de solo lectura. La última actualización introduce soporte opcional para el kernel de espacio de usuario gVisor, ofreciendo una protección mejorada contra exploits del kernel del host sin requerir privilegios de root.

  • • Drop es un sandbox de Linux rootless diseñado para ejecutar programas de terceros en entornos aislados.
  • • La herramienta utiliza espacios de nombres de Linux (usuario, montaje, red, PID, IPC, cgroup) para aplicar el aislamiento.
  • • Proporciona un directorio de inicio grabable y desechable y monta los archivos de configuración como de solo lectura.
  • • La última actualización añade soporte opcional para el kernel de espacio de usuario gVisor para proteger contra exploits del kernel del host.

Los desarrolladores que crean entornos de ejecución de agentes o ejecutan código no confiable generado por LLM pueden usar Drop para proteger sus sistemas host sin requerir privilegios de root.

SOURCES

18. Cisco Talos lanza el framework CAIRN para analizar malware integrado con IA

Cisco Talos ha lanzado un framework de código abierto llamado Cognitive Artifact Intelligence Research Network (CAIRN) para clasificar y analizar malware integrado con IA. Utilizando CAIRN, los investigadores identificaron CLOSEDQUORUM, un malware de Windows que roba credenciales y criptomonedas y que determina de forma autónoma sus acciones sondeando cuatro LLMs (DeepSeek, Qwen, Mistral y Google Gemini). El lanzamiento destaca una tendencia creciente de atacantes que operacionalizan APIs de LLM, como el malware LAMEHUG previamente documentado que se comunicaba con Qwen2.5-Coder a través de Hugging Face.

  • • Cisco Talos lanzó el framework de código abierto Cognitive Artifact Intelligence Research Network (CAIRN) para clasificar y analizar malware integrado con IA.
  • • Los investigadores utilizaron CAIRN para identificar CLOSEDQUORUM, un malware de Windows que sondea de forma autónoma DeepSeek, Qwen, Mistral y Gemini para determinar sus acciones.
  • • CLOSEDQUORUM está diseñado para robar credenciales de inicio de sesión y criptomonedas.
  • • En julio de 2025, se encontró una campaña de phishing que utilizaba malware LAMEHUG para comunicarse con Qwen2.5-Coder-32B-Instruct a través de una API de Hugging Face.

Los desarrolladores y equipos de seguridad pueden usar CAIRN para analizar amenazas emergentes impulsadas por IA, como el malware que utiliza APIs de LLM para coordinar ataques.

SOURCES

19. Lanzamiento del modelo de pesos abiertos Aikido Altar para pruebas de penetración locales

Aikido Altar se ha lanzado como un modelo de IA de pesos abiertos diseñado para mejorar las capacidades de pruebas de penetración de Aikido Machine. Construido específicamente para la seguridad soberana, el modelo se ejecuta completamente dentro de la propia infraestructura local del cliente, lo que permite a los desarrolladores realizar pruebas de seguridad automatizadas sin exponer código confidencial o datos de red a APIs de nube externas.

  • • Aikido Altar es un modelo de IA de pesos abiertos diseñado para mejorar las capacidades de pruebas de penetración de Aikido Machine.
  • • El modelo está construido para operar completamente dentro de la propia infraestructura de un cliente.

Los desarrolladores preocupados por la seguridad pueden desplegar un modelo de pruebas de penetración especializado localmente para escanear su infraestructura sin enviar datos confidenciales a APIs externas.

SOURCES

20. Qwen Image 2.1 Fast FP8 compatible en Unsloth Studio

Los usuarios han informado de una ejecución local exitosa del modelo Qwen Image 2.1 (Fast FP8) con menos de 10 GB de VRAM usando Unsloth Studio. Para acceder a esta opción de generación de imágenes de alto rendimiento y baja memoria, se recomienda a los desarrolladores que actualicen Unsloth Studio a la última versión.

  • • Qwen Image 2.1 (Fast FP8) se puede ejecutar con menos de 10 GB de VRAM en Unsloth Studio.
  • • El modelo genera imágenes de calidad premium con alto rendimiento.
  • • Los usuarios deben actualizar Unsloth Studio para acceder a las últimas opciones de modelos.

Los desarrolladores pueden ejecutar la generación de imágenes de alta calidad localmente en GPUs de consumo con bajos requisitos de memoria.

SOURCES

21. Cuantizaciones GGUF ahora disponibles para los modelos K2-Horizon

Basándose en el lanzamiento del 3 de septiembre de la familia de modelos de pesos abiertos K2-Horizon, las versiones GGUF cuantizadas ya están disponibles en Hugging Face. Estas versiones, que van desde 0,9B hasta el modelo MoVA de 36B, permiten la ejecución local, aunque actualmente requieren una bifurcación específica de llama.cpp mientras el soporte oficial está pendiente.

  • • Las versiones GGUF cuantizadas de la serie de modelos K2-Horizon ya están disponibles en Hugging Face.
  • • Los modelos compatibles incluyen K2-Horizon-MoVA-36B, 32B, 7B, 3.7B y 0.9B.
  • • La ejecución local requiere una bifurcación específica de llama.cpp, ya que el soporte oficial aún está en progreso.

Esta actualización permite a los desarrolladores ejecutar los modelos K2-Horizon localmente en hardware de consumo, ampliando el lanzamiento inicial de los pesos del modelo.

SOURCES

22. La herramienta Dynamic Quantiser optimiza archivos GGUF

Dynamic Quantiser es una nueva herramienta de código abierto diseñada para crear cuantizaciones GGUF personalizadas y de alta calidad de modelos locales. Al minimizar la desviación de coseno de todo el modelo utilizando el algoritmo de Dinkelbach y un bucle interno lagrangiano separable, la herramienta determina el nivel de cuantización óptimo para cada tensor. Aunque es menos eficiente que Unsloth dynamic 3.0 en tareas de texto puro, se informa que es más precisa que las K-quants estándar.

  • • Dynamic Quantiser es un repositorio de GitHub de código abierto para crear cuantizaciones GGUF personalizadas.
  • • La herramienta minimiza la desviación de coseno de todo el modelo para mejorar la precisión del modelo utilizando el algoritmo de Dinkelbach.
  • • Ofrece tres algoritmos: cuantización dinámica, minimización de la desviación de coseno y minimización del tamaño del disco.
  • • La herramienta es más precisa que las K-quants estándar, aunque menos eficiente que Unsloth dynamic 3.0 en tareas de texto puro.
  • • La construcción inicial de la tabla toma unos 25 minutos para un modelo de 27B en un procesador Ryzen 5 3600.

Los desarrolladores que ejecutan modelos locales pueden generar cuantizaciones personalizadas altamente precisas que superan a las K-quants estándar.

SOURCES

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.

Inference Brew en tu correo

5 minutos al día. Gratis, cancela cuando quieras.