El brazo investigador de Alibaba publicó RADAR, un modelo de visión y lenguaje que interpreta tomografías computarizadas abdominales con contraste y reporta 146 hallazgos clínicos distintos, acompañado tanto de los pesos como del estudio que lo respalda. El trabajo apareció el 17 de septiembre en Science, con un área bajo la curva media de 0,913 en ese conjunto de hallazgos.
Lo llamativo del lanzamiento no es tanto la cifra de precisión como su formato: un lector generalista entrenado sin anotaciones manuales, comparado con radiólogos en ejercicio y después distribuido de forma gratuita.
Claves del anuncio
- RADAR se entrenó con 424.911 exploraciones de TC abdominal con contraste y unos 15 millones de pares imagen-texto a nivel anatómico, aprendiendo de informes clínicos en lugar de etiquetas manuales.
- Promedió 0,913 de AUC en 146 hallazgos, sostuvo 0,895 en ocho centros de validación externa y alcanzó 0,904 en más de 27.000 casos de urgencias para los que nunca fue entrenado específicamente.
- El mejor modelo rival de visión y lenguaje en la misma evaluación se quedó en 0,776, y los radiólogos que trabajaron con RADAR ganaron alrededor de un 10 por ciento en sensibilidad de detección.
Cómo se aprenden 146 hallazgos sin etiquetas
Los modelos convencionales de imagen médica nacen acotados. Uno se entrena para detectar lesiones pancreáticas, otro para señalar anomalías hepáticas, y cada uno exige que un radiólogo dibuje los contornos de aquello que debe aprender. Ese cuello de botella de anotación explica por qué el campo acumuló muchas herramientas de enfermedad única y muy pocas generalistas.
DAMO Academy tomó el camino contrario. Desarrollado junto al Primer Hospital Afiliado de la Facultad de Medicina de la Universidad de Zhejiang y el Laboratorio Hupan, RADAR empareja los volúmenes de TC con los informes clínicos que los radiólogos ya habían redactado y usa ese texto como supervisión. Así el corpus de entrenamiento se convierte en un subproducto del trabajo hospitalario rutinario y no en un proyecto de etiquetado aparte, que es como el equipo llegó a 424.911 exploraciones.
El modelo abarca 18 órganos abdominales y, a través de ellos, varios cientos de enfermedades potenciales, desde tumores malignos hasta anomalías halladas por casualidad. El equipo lo describe como el primer modelo generalista de nivel experto en imagen médica y sostiene que la misma receta de entrenamiento debería trasladarse a otras modalidades.
Qué resiste detrás de las cifras
Una única cifra interna de precisión es fácil de inflar, así que la evaluación pesa más que el titular. En ocho centros externos el AUC medio solo bajó a 0,895 y, en una cohorte de urgencias con más de 27.000 casos —un entorno con otra mezcla de pacientes y sin entrenamiento dedicado—, se mantuvo en 0,904. El modelo multimodal más fuerte de la comparación alcanzó 0,776.
El estudio con lectores arroja el resultado más práctico. En un grupo de 26 radiólogos procedentes de varios hospitales, el modelo superó de media a 23 de ellos. Cuando esos mismos clínicos trabajaron con RADAR al lado, la sensibilidad de detección subió cerca de un 10 por ciento y el tiempo de lectura cayó alrededor de un 30 por ciento: un argumento de productividad tanto como de precisión.
Por qué los pesos abiertos cambian el cálculo
La IA médica ha estado dominada por productos cerrados y regulados que se venden por puesto o por exploración. Publicar el modelo, el código y el marco de trabajo altera ese esquema: hospitales ajenos a la cohorte original pueden validarlo con sus propias poblaciones antes de confiar en él, y los investigadores pueden sondear directamente sus modos de fallo en vez de deducirlos de una ficha técnica.
También llega en un contexto competitivo concreto. Alibaba lleva tiempo empujando modelos descargables en distintos dominios, desde la familia de modelos de lenguaje Qwen hasta este lanzamiento médico, y trata los pesos abiertos como estrategia de distribución, no como filantropía.
Lo que viene ahora
Publicar y desplegar son problemas distintos. Un modelo validado sobre cohortes mayoritariamente chinas todavía debe probarse en otras poblaciones y parques de escáneres, y ningún regulador considera que un artículo en Science equivalga a una autorización. El uso realista a corto plazo es el de segundo lector que marca hallazgos para que el radiólogo los confirme, que es justamente la configuración medida en el estudio.
Preguntas frecuentes
¿RADAR es realmente de código abierto?
El equipo publicó el modelo, el código y el marco técnico junto con el artículo en Science. Como en otros lanzamientos de pesos abiertos, eso permite el despliegue local y la validación independiente, aunque el uso clínico sigue sujeto a la aprobación regulatoria que corresponda en cada país.
¿Supera RADAR a los radiólogos humanos?
En el estudio con lectores publicado superó de media a 23 de los 26 radiólogos participantes en los hallazgos evaluados. El resultado más útil es la condición asistida: los radiólogos que trabajaron con el modelo ganaron cerca de un 10 por ciento en sensibilidad y leyeron los casos alrededor de un 30 por ciento más rápido.
¿Qué tipo de exploraciones necesita?
RADAR está construido para TC abdominal con contraste que cubra 18 órganos. Los investigadores afirman que el enfoque de entrenamiento —supervisar con informes clínicos existentes en vez de anotaciones manuales— debería extenderse a otros tipos de imagen, pero el modelo publicado se limita a la TC abdominal.






