Cribado del cáncer de pulmón: MedGemma ajustado frente a doce radiólogos Lung-RADS, más constante pero menos sensible

Un equipo de la empresa francesa Median Technologies (Valbonne) comparó MedGemma, el modelo visión-lenguaje médico de Google, con doce radiólogos que asignaban categorías Lung-RADS v2022 a las tomografías de 481 pacientes del National Lung Screening Trial, 132 de ellos con cáncer confirmado. Usado tal cual, el modelo alcanza un AUC de 0,70; ajustado con 7 585 pacientes NLST distintos sube a 0,83, frente a una media de 0,90 de los radiólogos (de 0,80 a 0,94 según el lector), pero entonces solo detecta el 63 % de los cánceres frente al 85 %. El artículo destaca la constancia del modelo frente a la variabilidad humana; es una pregunta real, pero un modelo constante también puede equivocarse de forma constante, y todo aquí queda dentro de una sola base de datos de hace veinte años.

El contexto

El cribado del cáncer de pulmón con TC de baja dosis reduce la mortalidad en grandes fumadores: es la lección de los ensayos NLST (Estados Unidos, 2011) y NELSON (Países Bajos, 2020). Para convertir cada estudio en una decisión, el American College of Radiology creó Lung-RADS, una escala que asigna a cada TC una categoría de 1 (nada sospechoso) a 4X (muy sospechoso), cada una ligada a una conducta: control al año, a los seis meses, a los tres meses o biopsia. La escala reduce los falsos positivos, pero no el desacuerdo entre lectores: dos radiólogos colocan a menudo el mismo nódulo en dos categorías distintas, es decir, en dos itinerarios distintos.

Los modelos de IA especializados — la red 3D de Google publicada en 2019, Sybil del MIT en 2023 — han mostrado buenos resultados en NLST. La novedad es la llegada de los foundation models: modelos generalistas preentrenados sobre enormes corpus, pensados para adaptarse a muchas tareas. MedGemma, publicado por Google en 2025, es un modelo visión-lenguaje (lee imágenes y produce texto) que acepta volúmenes de TC como secuencias de cortes. La pregunta del artículo es sencilla: ¿puede un modelo así hacer una clasificación Lung-RADS, qué aporta ajustarlo y dónde se sitúa respecto a la dispersión de los radiólogos?

El método

Los datos. 481 pacientes de un subconjunto del NLST anotado previamente por el mismo equipo y publicado en The Cancer Imaging Archive. 132 cánceres (27,4 %), confirmados por biopsia en el año posterior a la TC, y 349 no cánceres, confirmados por al menos tres años de seguimiento sin tumor. La cohorte está por tanto enriquecida: en la población NLST, la proporción de cánceres es de alrededor del 4 %, según los autores. Una TC por paciente, en cortes finos (menos de 5 mm), de varios fabricantes.

Los lectores. Doce radiólogos titulados, júnior (menos de tres años de ejercicio) y sénior, sin acceso a la verdad de referencia ni a datos clínicos. Cada paciente fue leído por tres radiólogos distintos, 1 443 lecturas en total; cada radiólogo vio unos 120 casos. Punto importante: no había imágenes previas disponibles, aunque Lung-RADS se apoya mucho en la evolución de un nódulo en el tiempo.

El modelo nativo. MedGemma 1.5 en su versión de 4 000 millones de parámetros, usado sin reentrenamiento (zero-shot). La TC se divide en bloques de 25 cortes consecutivos con un paso de 5. Para cada bloque, un prompt «de lo global al detalle» (coarse-to-fine) pide primero un análisis de conjunto de los pulmones, después una descripción de los nódulos y por último una categoría Lung-RADS, leída en las probabilidades que el modelo asigna a cada categoría. La puntuación del paciente es el máximo de todos los bloques, una elección que favorece la sensibilidad.

El modelo ajustado. El mismo modelo, adaptado con QLoRA: en lugar de reentrenar los 4 000 millones de parámetros, se congela el modelo comprimido a 4 bits y solo se aprenden pequeñas matrices adicionales. Datos de entrenamiento: 7 585 pacientes NLST distintos (393 cánceres), con 21 533 nódulos anotados a mano. Solo los bloques con un nódulo maligno se etiquetan como positivos, y una focal loss — una función de pérdida que da más peso a los ejemplos difíciles — compensa el desequilibrio.

La evaluación. Radiólogos y modelos producen una puntuación en la misma escala ordinal de Lung-RADS. Se mide el AUC (la probabilidad de que un cáncer reciba una puntuación más alta que un no cáncer; 0,5 = azar, 1 = perfecto) y luego sensibilidad y especificidad en el punto que maximiza el índice de Youden (sensibilidad + especificidad − 1). Los intervalos de confianza proceden de 5 000 remuestreos. El acuerdo entre radiólogos se mide con el kappa de Fleiss y el coeficiente de correlación intraclase (ICC).

Los resultados

Los radiólogos no se ponen de acuerdo. Kappa de Fleiss de 0,33, acuerdo «aceptable»; ICC de 0,68, fiabilidad «moderada». Los sénior coinciden más (kappa 0,38) que los júnior (0,24). De media, dos lectores difieren en algo menos de una categoría.

La discriminación. Radiólogos: AUC 0,90 [0,88-0,92], de 0,80 para el más flojo a 0,94 para el mejor. MedGemma nativo: 0,70 [0,64-0,75]. MedGemma ajustado: 0,83 [0,78-0,87]. En los unos 120 casos del radiólogo menos preciso, el modelo ajustado obtiene 0,84 frente a 0,80, con intervalos muy amplios (0,76-0,92 y 0,67-0,92): la diferencia no está demostrada.

El punto de funcionamiento. En el umbral de Youden, los radiólogos tienen una sensibilidad del 85 % y una especificidad del 90 %. El modelo ajustado: 63 % y 91 %. El modelo nativo: 75 % y 58 %. El ajuste mejora sobre todo la especificidad.

Traducción clínica. Apliquemos estas cifras a 1 000 personas cribadas con la prevalencia de alrededor del 4 % citada por los autores, es decir, 40 cánceres. Los radiólogos detectarían unos 34 y se les escaparían 6, con unos 96 falsos positivos. El modelo ajustado detectaría 25 y se le escaparían 15, con unos 86 falsos positivos. El modelo nativo detectaría 30 pero generaría más de 400 falsos positivos. El cálculo es optimista: los umbrales se eligieron sobre los propios datos de prueba.

Lo que está bien

Un comparador humano real, con su dispersión. Doce radiólogos, tres lecturas independientes por paciente, 1 443 lecturas en total, a ciegas, con la escala clínica realmente utilizada. Muchos artículos comparan un modelo con «un radiólogo» o con una media; aquí se ve el abanico del rendimiento humano y se puede situar el modelo dentro de él, lo que es más honesto.

Una verdad de referencia sólida y un fracaso reconocido. Los cánceres están confirmados por biopsia y los no cánceres por tres años de seguimiento. Y los autores informan con claridad de que MedGemma usado tal cual (0,70) no alcanza un nivel clínicamente útil: una información valiosa frente al discurso de modelos generalistas que funcionarían en todas partes sin adaptación.

Limitaciones reconocidas y código abierto. El propio artículo nombra el enriquecimiento de la cohorte, la falta de validación externa, el riesgo de sobreajuste a NLST y la ausencia de estudios de ablación. El código y el protocolo están en GitHub, y el subconjunto anotado está depositado en The Cancer Imaging Archive.

Lo que está menos bien

Sin validación externa y con una fuga no descartada. El modelo se ajusta con NLST y se prueba con NLST: misma época (principios de los años 2000), mismos centros, mismos escáneres. El artículo no indica explícitamente que los 481 pacientes de prueba estén separados del conjunto de entrenamiento de 7 585 pacientes, y los propios autores escriben que no pueden descartar un sobreajuste. Es el escenario típico de data leakage y de sesgo de población: un AUC de 0,83 dentro de una sola base no dice nada del rendimiento en el parque actual de escáneres de Europa o Asia.

Un comparador en desventaja y métricas halagadoras. Los radiólogos leían sin estudios previos, aunque el crecimiento del nódulo es central en Lung-RADS: un comparador sesgado, aunque lo sea para todos. Sobre todo, los umbrales de Youden se optimizan sobre los datos de prueba, y la prevalencia enriquecida al 27 % hace engañosa la exactitud. La comparación favorable con el «radiólogo más flojo» descansa en unos 120 casos e intervalos que se solapan ampliamente: una métrica engañosa si se lee como equivalencia. Y un 63 % de sensibilidad sigue lejos del 85 % humano.

La constancia no es fiabilidad, y los autores son juez y parte. El modelo da siempre la misma respuesta ante la misma entrada porque su temperatura está fijada en cero: es repetibilidad mecánica, no robustez. No se hizo ninguna prueba con variaciones de prompt, de reconstrucción o de escáner, como reconoce el artículo. Un modelo que pasa por alto un cáncer de cada tres de forma constante no es más seguro que un lector variable. Por último, todos los autores están afiliados a Median Technologies, que desarrolla el software de apoyo al cribado eyonis; el preprint no detalla financiación ni conflictos de interés.

Lo que cambia

Para la comunidad investigadora, el artículo ofrece una referencia útil: un foundation model visión-lenguaje de 4 000 millones de parámetros, ajustado de forma ligera, queda claramente por debajo de los radiólogos en una tarea de cribado estructurada, y la brecha se nota sobre todo en sensibilidad. Medir la variabilidad humana junto al rendimiento es una buena idea, pero exige el experimento simétrico: medir la variabilidad del modelo bajo perturbaciones realistas y compararlo con los modelos especializados existentes (Sybil, redes 3D), ausentes del análisis.

Para los clínicos, hoy no cambia nada. Una herramienta a la que se le escaparían 15 cánceres de 40, donde a los radiólogos se les escapan 6, no puede servir de lector autónomo, ni siquiera de red de seguridad. El argumento de un apoyo «en contextos con poca experiencia» no está demostrado: haría falta un estudio en el que radiólogos lean con y sin la herramienta.

Para los pacientes y el público, el mensaje es prudente: los grandes modelos médicos polivalentes no están listos para interpretar solos una TC de cribado pulmonar. El desacuerdo entre radiólogos es real y es un buen motivo para buscar herramientas de apoyo; pero una herramienta constante y menos sensible todavía no es una respuesta.

Para profundizar

El artículo: Performance vs Consistency: Evaluating a Foundation Model in Lung-RADS Screening, Benjamin Renoust, Pierre Baudot, Tiffany Foriel, Yousra Haddou, Charles Voyton, Pierre-Henri Siot, Ezequiel Geremia, Danny Francis, Jean-Christophe Brisset, Valérie Bourdès, Sylvain Bodard, Benoit Huet (Median Technologies, Valbonne; afiliaciones secundarias: University of Osaka, AP-HP Necker, Memorial Sloan Kettering, Massachusetts General Hospital, Sorbonne Université), arXiv:2609.22281 (cs.CV), depositado el 13 de septiembre de 2026, workshop MICCAI CAPTION 2026, DOI 10.48550/arXiv.2609.22281. Preprint sin revisión por pares.

El código: EYONIS-AIDS-DS/medgemma-miccai. El modelo base: MedGemma (Sellergren et al., 2025, arXiv:2507.05201). La escala: ACR Lung-RADS v2022. Sobre el cribado pulmonar con TC de baja dosis, véase también nuestro análisis sobre la degradación sintética de TC y la radiómica de nódulos.