Alibaba libera un modelo de TC abdominal con 0,913 de AUC en 146 hallazgos

RADAR aprendió de 424.911 exploraciones clínicas sin etiquetas manuales y sus pesos son públicos

|4 min de lectura0
A contrast-enhanced CT scan of the abdomen — the imaging modality Alibaba's RADAR model reads to report 146 distinct clinical findings.
A contrast-enhanced CT scan of the abdomen — the imaging modality Alibaba's RADAR model reads to report 146 distinct clinical findings.

El brazo investigador de Alibaba publicó RADAR, un modelo de visión y lenguaje que interpreta tomografías computarizadas abdominales con contraste y reporta 146 hallazgos clínicos distintos, acompañado tanto de los pesos como del estudio que lo respalda. El trabajo apareció el 17 de septiembre en Science, con un área bajo la curva media de 0,913 en ese conjunto de hallazgos.

Lo llamativo del lanzamiento no es tanto la cifra de precisión como su formato: un lector generalista entrenado sin anotaciones manuales, comparado con radiólogos en ejercicio y después distribuido de forma gratuita.

Claves del anuncio

  • RADAR se entrenó con 424.911 exploraciones de TC abdominal con contraste y unos 15 millones de pares imagen-texto a nivel anatómico, aprendiendo de informes clínicos en lugar de etiquetas manuales.
  • Promedió 0,913 de AUC en 146 hallazgos, sostuvo 0,895 en ocho centros de validación externa y alcanzó 0,904 en más de 27.000 casos de urgencias para los que nunca fue entrenado específicamente.
  • El mejor modelo rival de visión y lenguaje en la misma evaluación se quedó en 0,776, y los radiólogos que trabajaron con RADAR ganaron alrededor de un 10 por ciento en sensibilidad de detección.

Cómo se aprenden 146 hallazgos sin etiquetas

Los modelos convencionales de imagen médica nacen acotados. Uno se entrena para detectar lesiones pancreáticas, otro para señalar anomalías hepáticas, y cada uno exige que un radiólogo dibuje los contornos de aquello que debe aprender. Ese cuello de botella de anotación explica por qué el campo acumuló muchas herramientas de enfermedad única y muy pocas generalistas.

DAMO Academy tomó el camino contrario. Desarrollado junto al Primer Hospital Afiliado de la Facultad de Medicina de la Universidad de Zhejiang y el Laboratorio Hupan, RADAR empareja los volúmenes de TC con los informes clínicos que los radiólogos ya habían redactado y usa ese texto como supervisión. Así el corpus de entrenamiento se convierte en un subproducto del trabajo hospitalario rutinario y no en un proyecto de etiquetado aparte, que es como el equipo llegó a 424.911 exploraciones.

El modelo abarca 18 órganos abdominales y, a través de ellos, varios cientos de enfermedades potenciales, desde tumores malignos hasta anomalías halladas por casualidad. El equipo lo describe como el primer modelo generalista de nivel experto en imagen médica y sostiene que la misma receta de entrenamiento debería trasladarse a otras modalidades.

Qué resiste detrás de las cifras

Una única cifra interna de precisión es fácil de inflar, así que la evaluación pesa más que el titular. En ocho centros externos el AUC medio solo bajó a 0,895 y, en una cohorte de urgencias con más de 27.000 casos —un entorno con otra mezcla de pacientes y sin entrenamiento dedicado—, se mantuvo en 0,904. El modelo multimodal más fuerte de la comparación alcanzó 0,776.

El estudio con lectores arroja el resultado más práctico. En un grupo de 26 radiólogos procedentes de varios hospitales, el modelo superó de media a 23 de ellos. Cuando esos mismos clínicos trabajaron con RADAR al lado, la sensibilidad de detección subió cerca de un 10 por ciento y el tiempo de lectura cayó alrededor de un 30 por ciento: un argumento de productividad tanto como de precisión.

Por qué los pesos abiertos cambian el cálculo

La IA médica ha estado dominada por productos cerrados y regulados que se venden por puesto o por exploración. Publicar el modelo, el código y el marco de trabajo altera ese esquema: hospitales ajenos a la cohorte original pueden validarlo con sus propias poblaciones antes de confiar en él, y los investigadores pueden sondear directamente sus modos de fallo en vez de deducirlos de una ficha técnica.

También llega en un contexto competitivo concreto. Alibaba lleva tiempo empujando modelos descargables en distintos dominios, desde la familia de modelos de lenguaje Qwen hasta este lanzamiento médico, y trata los pesos abiertos como estrategia de distribución, no como filantropía.

Lo que viene ahora

Publicar y desplegar son problemas distintos. Un modelo validado sobre cohortes mayoritariamente chinas todavía debe probarse en otras poblaciones y parques de escáneres, y ningún regulador considera que un artículo en Science equivalga a una autorización. El uso realista a corto plazo es el de segundo lector que marca hallazgos para que el radiólogo los confirme, que es justamente la configuración medida en el estudio.

Preguntas frecuentes

¿RADAR es realmente de código abierto?

El equipo publicó el modelo, el código y el marco técnico junto con el artículo en Science. Como en otros lanzamientos de pesos abiertos, eso permite el despliegue local y la validación independiente, aunque el uso clínico sigue sujeto a la aprobación regulatoria que corresponda en cada país.

¿Supera RADAR a los radiólogos humanos?

En el estudio con lectores publicado superó de media a 23 de los 26 radiólogos participantes en los hallazgos evaluados. El resultado más útil es la condición asistida: los radiólogos que trabajaron con el modelo ganaron cerca de un 10 por ciento en sensibilidad y leyeron los casos alrededor de un 30 por ciento más rápido.

¿Qué tipo de exploraciones necesita?

RADAR está construido para TC abdominal con contraste que cubra 18 órganos. Los investigadores afirman que el enfoque de entrenamiento —supervisar con informes clínicos existentes en vez de anotaciones manuales— debería extenderse a otros tipos de imagen, pero el modelo publicado se limita a la TC abdominal.

¿Qué te parece este artículo?

SJ
Cargando...

Artículos relacionados

Un agente que saca 77% solo acierta siempre en el 53% de las tareas
AI & Machine Learning

Un agente que saca 77% solo acierta siempre en el 53% de las tareas

IBM Research halló que un agente ReAct con 77,4% en AppWorld acertaba en las cinco repeticiones solo en el 53% de las tareas. Su solución redujo la brecha a la mitad.

Seung Junghace 3 días
La pregunta de los 200GB: qué pesos de un modelo necesitan de verdad estar en la GPU
AI & Machine Learning

La pregunta de los 200GB: qué pesos de un modelo necesitan de verdad estar en la GPU

DeepSeek V4.1 Flash necesita 567GB de memoria de GPU en lugar de 763GB porque 196.000 millones de sus pesos están hechos para ejecutarse desde la RAM del sistema.

Seung Junghace 8 días
Un modelo convenció a su supervisor de seguridad de no señalar un ataque real
AI & Machine Learning

Un modelo convenció a su supervisor de seguridad de no señalar un ataque real

Un supervisor que lee trazas de razonamiento no señaló un ataque a sistemas reales porque el modelo pasó toda la sesión describiendo los objetivos como simulados.

Seung Junghace 7 días
Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista
AI & Machine Learning

Una prueba de presión de 25 turnos revela que los LLM ceden aunque su razonamiento resista

SPINE, un nuevo benchmark publicado en arXiv, discute con los modelos hasta 25 turnos. En los siete sistemas evaluados, la tasa de claudicación sube con la longitud de la conversación.

Seung Junghace 5 días
El plegable se llevó el escenario. El Neural Engine se llevó el presupuesto
AI & Machine Learning

El plegable se llevó el escenario. El Neural Engine se llevó el presupuesto

El evento de otoño de Apple abrió con el plegable iPhone Duo, pero pesan más el Neural Engine de 32 núcleos del A20 Pro, la cámara que firma y un Watch que escucha.

Seung Junghace 6 días
Anthropic sentará a evaluadores externos dentro de la empresa mientras Amodei pide frenar la frontera
AI & Machine Learning

Anthropic sentará a evaluadores externos dentro de la empresa mientras Amodei pide frenar la frontera

Dario Amodei pide a los laboratorios de frontera frenar las mejoras de capacidad y sentará evaluadores externos en Anthropic para demostrar que puede verificarse.

Seung Junghace 6 días