El equipo Qwen de Alibaba lanzó Qwen3.8-Omni-Flash el 18 de septiembre, un modelo omnimodal que acepta texto, imágenes, audio y vídeo y decide por su cuenta qué partes de un archivo merecen ser examinadas. En OmniVideoBench, ese enfoque selectivo elevó la precisión de 63,4 a 67,8 y redujo el consumo de tokens de 145.736 a 79.117: alrededor de un 45,7% menos de tokens para dar una respuesta mejor, según la publicación de lanzamiento de Qwen.
Claves del lanzamiento
- La percepción agéntica subió la precisión de Qwen3.8-Omni-Flash en OmniVideoBench de 63,4 a 67,8 usando cerca de un 45,7% menos de tokens que leer el vídeo de principio a fin.
- En 29 evaluaciones el modelo promedia más de un 25% por encima de Qwen3.5-Omni-Plus, con WildClawBench-MM en 71,0 (+36,5 puntos) y el error de diarización de hablantes en AliMeeting cayendo del 88,1% al 3,4%.
- A diferencia de la mayoría de los lanzamientos recientes de Qwen, llega solo como API a 0,15 dólares por millón de tokens de entrada y 0,47 por millón de salida, sin pesos descargables.
Qué cambia la percepción agéntica
Los modelos de vídeo convencionales procesan un archivo de principio a fin incluso cuando la respuesta vive en un tramo de tres minutos. Los investigadores de Qwen describen el orden inverso: el modelo parte de la pregunta, decide qué segmentos mirar y escuchar, y reúne evidencia en varias pasadas que van de lo general a lo fino.
El cómputo cae sobre las imágenes que contienen la respuesta en vez de repartirse por igual a lo largo de una hora de vídeo. La ganancia de eficiencia es el objetivo, y la precisión sube con ella en lugar de pagar el precio, algo poco habitual en una técnica que lee menos material.
Cómo se lee la hoja de resultados
Qwen reporta mejoras en 29 evaluaciones, con una media superior al 25% frente al anterior buque insignia multimodal, Qwen3.5-Omni-Plus. Los mayores saltos se dan en terreno agéntico: WildClawBench-MM alcanza 71,0, 36,5 puntos más, con UniClawBench en 69,6 y AgenticVBench mejorando 22,3 puntos.
La percepción básica también se movió, aunque Qwen presentó la mayor parte como ganancia en puntos y no como puntuación absoluta. OmniVideoBench queda en 63,4 en modo estático, antes de aplicar la percepción agéntica, una mejora de 9,6 puntos; LongAudioSpan sube 8,3 puntos en comprensión de audio largo y OmniCap-IF avanza 8,5 y 14,1 puntos en estructura del contenido de subtítulos y seguimiento de instrucciones. El salto más nítido está en la transcripción de reuniones en chino con varios hablantes: el error de diarización de AliMeeting baja del 88,1% al 3,4% y el de transcripción del 89,6% al 17,2%. Qwen sitúa su rendimiento audiovisual cerca de Gemini 3.8 Flash y el rendimiento global de audio por delante. Todas las cifras son autoinformadas; no había evaluación independiente en el lanzamiento.
Cuánto cuesta y dónde se ejecuta
QwenCloud lista 0,15 dólares por millón de tokens de entrada y 0,47 por millón de salida, con aciertos de caché implícita a 0,016 por millón. Frente a Qwen3.5-Omni-Plus, Qwen sostiene que el coste de una hora de entrada de audio cayó más de un 98% y el de entrada audiovisual más de un 93%.
La ventana de contexto es de un millón de tokens: QwenCloud especifica un máximo de 991K de entrada y 131K de salida, con la longitud de razonamiento limitada a 262K. Los archivos de vídeo se aceptan por URL hasta dos horas y 2 GB, muestreados a un máximo de 15 fotogramas por segundo, con soporte para estéreo de dos canales y audio espacial de cuatro. El reconocimiento de voz cubre 74 idiomas y 39 dialectos chinos. El servicio se despliega desde seis regiones: Pekín, Singapur, Hong Kong, Tokio, Fráncfort y Virginia.
Modelo cerrado, tuberías abiertas
El modelo en sí es solo API. Está construido sobre la arquitectura Qwen3.8-Flash-Next, cuyos pesos Alibaba Qwen sí publicó en agosto de 2026, un contraste que el equipo no repitió aquí. La salida es únicamente texto; a quienes necesiten voz generada se les remite de vuelta a Qwen3.5-Omni.
Lo que sí se abrió fue el instrumental que lo rodea. Qwen-MM-Plugins se distribuye bajo Apache-2.0 con un instalador guiado para Claude Code, Codex, Gemini CLI, Qwen Code y otros entornos, y expone cada capacidad como una skill más un servidor MCP opcional. Junto a él se anunció un Qwen-Live Harness, aunque su repositorio seguía devolviendo un 404 poco después del lanzamiento.
Por qué importa para quien construye agentes
La capa de plugins señala dónde cree Qwen que está el cuello de botella. La mayoría de los entornos de agentes no puede pasar audio de forma nativa a un modelo principal, así que el audio sigue pasando por la API incluso con los plugins instalados. Al liberar el tejido conectivo y mantener cerrado el modelo, Alibaba apuesta a que la adopción llegará de convertir el audio y el vídeo en entradas corrientes para los agentes, una postura distinta a la de los lanzamientos de pesos abiertos que construyeron la reputación de Qwen. Si los desarrolladores aceptarán un modelo omnimodal solo por API de un laboratorio conocido por los descargables es la pregunta abierta.
Preguntas frecuentes
¿Es Qwen3.8-Omni-Flash de código abierto?
No. El modelo está disponible únicamente como API alojada a través de QwenCloud, Alibaba Cloud Model Studio y Qwen Studio, sin pesos publicados en el lanzamiento. Su arquitectura base, Qwen3.8-Flash-Next, sí salió con pesos abiertos en agosto de 2026, pero eso no permite alojar el modelo omnimodal por cuenta propia.
¿Puede generar voz?
No en la API estándar. Qwen3.8-Omni-Flash acepta audio y vídeo pero devuelve solo texto, y la documentación de Alibaba remite a Qwen3.5-Omni a quien necesite voz sintetizada. En el lanzamiento se mencionó una variante en tiempo real aparte para uso conversacional en directo.
¿Cómo se compara con Gemini 3.8 Flash?
Qwen afirma un rendimiento audiovisual cercano al de Gemini 3.8 Flash y un rendimiento global de audio superior. Esas comparaciones salen de las propias pruebas de Alibaba en 29 benchmarks, y no se había publicado ninguna verificación independiente en el momento del lanzamiento.






