Cáncer de pulmón en TC de baja dosis: ¿y si entrenáramos la IA con TC de dosis estándar «degradados» en lugar de con imágenes filtradas de ruido?

Un equipo del Politecnico di Milano (Italia) puso a prueba una idea que da la vuelta al problema: para el cribado del cáncer de pulmón con TC de baja dosis (LDCT), en lugar de eliminar el ruido de imágenes ruidosas, degradar las abundantes TC de dosis estándar (SDCT) en falsas imágenes de baja dosis para entrenar un clasificador de nódulos por radiómica. Al comparar tres métodos de degradación sobre la base pública LIDC-IDRI, los autores muestran que un modelo entrenado con dosis estándar se hunde con la baja dosis real (sensibilidad 0,571), y que las tres degradaciones restablecen un AUC superior a 0,84 — el mejor, un CycleGAN, alcanza 0,861 con una sensibilidad de 0,743. Pero ordenar los tres métodos entre sí sigue siendo estadísticamente frágil.

El contexto

El cribado del cáncer de pulmón en grandes fumadores se apoya en la TC de baja dosis, o LDCT. El principio: reducir con fuerza la dosis de rayos X para limitar el riesgo de una irradiación repetida, a costa de imágenes más ruidosas, con menos contraste y a veces marcadas por artefactos. Grandes ensayos (NLST en EE. UU., NELSON en Europa) mostraron que ese cribado reduce la mortalidad. Quedaba automatizar la lectura —detectar y clasificar los nódulos pulmonares— con modelos de aprendizaje automático.

Pero estos modelos chocan con una penuria: hay muy pocos conjuntos de datos LDCT anotados. Por eso la literatura ha trabajado sobre todo en eliminar el ruido de la baja dosis para acercarla a la dosis estándar. Dos problemas: eliminar el ruido a menudo exige pares SDCT/LDCT del mismo paciente (imposibles de adquirir éticamente, pues habría que escanear dos veces a la misma persona), y la cadena «degradar y luego filtrar» es pesada. El equipo de Milán propone lo inverso: partir de las imágenes de dosis estándar, numerosas y anotadas, y degradarlas en falsas imágenes de baja dosis para aumentar los datos de entrenamiento — y luego comprobar que un clasificador así entrenado funciona con baja dosis real. La tarea medida es una clasificación binaria (nódulo maligno o no), evaluada sobre todo por el AUC (área bajo la curva ROC), una puntuación entre 0,5 y 1: 0,5 es azar, 1 es la separación perfecta entre maligno y benigno.

El método

El núcleo del trabajo es una comparación de tres maneras de fabricar «falso LDCT» a partir de SDCT real. Método 1: inserción de ruido en el dominio del sinograma (los datos de proyección brutos del escáner), añadiendo ruido de Poisson y gaussiano para imitar el ruido cuántico y electrónico — enfoque determinista y ligero. Método 2: la réplica de un modelo físico validado (Yu et al.) mediante un Pix2Pix, una red generativa antagónica (GAN) condicional entrenada con pares de imágenes; una GAN enfrenta a un generador, que fabrica imágenes, con un discriminador, que intenta distinguir lo real de lo falso, hasta que lo falso resulta convincente. Método 3: un CycleGAN, variante que aprende a traducir de un dominio (dosis estándar) a otro (baja dosis) sin pares, a partir de dos conjuntos de imágenes no emparejadas — valioso aquí, ya que los pares SDCT/LDCT reales no existen.

Los datos provienen de dos fuentes públicas. La principal, LIDC-IDRI, reúne 1018 TC torácicas anotadas por radiólogos. Los autores separan 695 pacientes de dosis estándar (1950 nódulos), reservados al entrenamiento tras degradación, y 315 pacientes de baja dosis (675 nódulos) reservados en exclusiva a la validación (50 %) y la prueba (50 %). Un nódulo se etiqueta «maligno» cuando la probabilidad media asignada por los radiólogos supera 4 sobre 5 — es decir, 225 malignos frente a 1725 benignos en el entrenamiento, un fuerte desequilibrio. La segunda fuente (el conjunto Low-Dose CT Image and Projection, 50 exámenes torácicos emparejados) sirve solo para entrenar el Pix2Pix. El preprocesamiento es homogéneo: conversión a unidades Hounsfield, ventana [−1200, 600], ligero filtrado gaussiano, normalización.

Sobre cada conjunto degradado entra la radiómica: PyRadiomics extrae 851 características cuantitativas (forma, intensidad, textura, ondículas) conformes al estándar IBSI, reducidas por varios selectores (LASSO, MRMR, PCA, RFE, bosques aleatorios y gradient boosting). El desequilibrio se corrige aumentando la clase minoritaria (perturbaciones de contorno que llevan los 225 malignos a 900) y submuestreando los benignos (a 900). Se prueban seis clasificadores (AdaBoost, árbol de decisión, k vecinos más cercanos, regresión logística, bosque aleatorio, XGBoost). La mitad de los LDCT reales sirve para elegir umbral, subconjunto de variables y mejor par selector/clasificador; la otra mitad, nunca vista, es la prueba final, con 1000 remuestreos bootstrap para los intervalos de confianza y pruebas de Friedman y luego de Wilcoxon (corregidas Bonferroni) para comparar los métodos. Punto clave de rigor: ningún paciente de baja dosis participa en el entrenamiento del clasificador.

Los resultados

Primera lección: sin degradación, se rompe. Un clasificador entrenado con dosis estándar bruta se comporta bien en validación (AUC 0,863) pero cae con la baja dosis real: AUC 0,789 y, sobre todo, una sensibilidad que se hunde a 0,571, con una especificidad de 0,917. Dicho de otro modo, de cada 100 nódulos realmente sospechosos, este modelo pasa por alto unos 43 — justo el error que una herramienta de cribado no puede permitirse.

Segunda lección: las tres degradaciones reparan lo esencial. Todas restablecen un AUC de prueba superior a 0,84: 0,844 (método 1, sensibilidad 0,656), 0,859 (método 2, sensibilidad 0,684) y 0,861 para el CycleGAN (método 3), que ofrece el mejor equilibrio — exactitud equilibrada 0,800, sensibilidad 0,743, especificidad 0,858. En traducción clínica, se pasa de unos 43 nódulos sospechosos perdidos por cada 100 (modelo no degradado) a unos 26 por cada 100 (CycleGAN); del lado de los falsos positivos, una especificidad de 0,86 deja unos 14 nódulos benignos por cada 100 marcados por error como sospechosos — un punto sensible en cribado, donde el exceso de falsos positivos desencadena estudios e intervenciones innecesarias.

Tercera lección, más sutil, sobre la calidad de imagen. Medida por distancias entre distribuciones (FID y KID, donde más bajo es mejor), el alineamiento con la baja dosis real es netamente mejor para el CycleGAN (FID 0,17) que para los métodos 1 y 2 (FID 4,07 y 4,67) — que hacen peor que las imágenes de dosis estándar no degradadas (FID 1,15). La paradoja es instructiva: el método 2 produce un ruido y unas estrías visualmente muy «realistas», pero estadísticamente más lejanos de la baja dosis real. El realismo percibido por el ojo no es el alineamiento medido de las distribuciones. Por último, pese a imágenes de aspecto distinto, las características radiómicas retenidas se solapan mucho (60 variables comunes a los tres métodos), y solo dos se seleccionan en todos: la longitud del eje mayor y la esfericidad del nódulo — coherente con los criterios clínicos Lung-RADS, que juzgan primero por el tamaño y la regularidad.

Lo que está bien

Una verdadera prueba de esfuerzo del desajuste de dominio. El punto fuerte del protocolo es la separación estricta: las TC de baja dosis reales solo sirven para validar y probar, nunca para entrenar el clasificador, lo que descarta la fuga de datos (data leakage). La demostración de que el modelo de dosis estándar se hunde con la baja dosis (sensibilidad 0,571) no es un detalle: establece con claridad que la dosis es una frontera de dominio que no se puede ignorar.

Un desacople honesto entre realismo y alineamiento. Al reportar a la vez el aspecto visual y distancias de distribución, los autores muestran que una imagen que «parece» de baja dosis (método 2, estrías marcadas) puede estar más lejos de la baja dosis real que una más borrosa (CycleGAN). Es una salvaguarda útil contra la ilusión de que un sintético convincente al ojo es forzosamente buen sintético — y guiar el entrenamiento del CycleGAN con esas distancias es coherente.

Reproducibilidad cuidada. Datos públicos (LIDC-IDRI y el conjunto Low-Dose CT Image and Projection, ambos en The Cancer Imaging Archive), código publicado en GitHub, radiómica conforme al estándar IBSI, intervalos de confianza por bootstrap y pruebas estadísticas explícitas. El trabajo se puede reejecutar y discutir — la base de toda crítica constructiva.

Lo que está menos bien

La diana no es la verdad biológica. Lo «maligno» se define aquí por la probabilidad media estimada por radiólogos (> 4 sobre 5), no por confirmación histológica. El modelo aprende pues a reproducir una impresión radiológica, no un diagnóstico probado: una posible métrica engañosa, que no debe leerse como detección de cáncer confirmado. A ello se suma un fuerte desequilibrio de clases (en torno al 11 % de malignos) que el aumento y el submuestreo corrigen artificialmente.

Una generalización todavía local. Las TC de baja dosis reales de validación y prueba proceden todas de LIDC-IDRI: el desajuste de dominio probado es en parte interno a una misma base, sin cohorte realmente externa (los autores remiten a una futura prueba en LUNA25). Además, el Pix2Pix se entrena solo con 50 exámenes de un único conjunto. Este sesgo de población — un solo ecosistema de equipos y protocolos — deja abierta la cuestión del traslado a otros centros.

Un orden frágil entre métodos. Las pruebas de Friedman y de Wilcoxon salen significativas, pero los intervalos de confianza al 95 % se solapan mucho (AUC 0,859 frente a 0,861 para los métodos 2 y 3), y los propios autores reconocen que el tamaño de los remuestreos bootstrap vuelve las pruebas hipersensibles a diferencias minúsculas. La conclusión robusta no es, pues, «gana el CycleGAN» sino «las tres degradaciones se equivalen a grandes rasgos y baten con claridad la ausencia de degradación». La sensibilidad de 0,743 sigue además siendo modesta y se presenta con los intervalos más anchos. Nótese, por último, que el CycleGAN «vio» la distribución de las imágenes de baja dosis reales (sin etiquetas) durante su entrenamiento — práctica estándar en adaptación de dominio, pero que conviene señalar.

Lo que cambia

Para la comunidad de investigación, el estudio reformula un problema recurrente de la baja dosis: en vez de filtrar imágenes escasas, se pueden degradar imágenes de dosis estándar abundantes para construir datos de entrenamiento — y la traducción no emparejada (CycleGAN) ofrece una vía pragmática donde los pares reales son éticamente inaccesibles. El mensaje metodológico es doble: la adaptación de dominio es necesaria (el modelo ingenuo se hunde), y la calidad de un conjunto sintético se juzga por el alineamiento de distribuciones, no por su realismo aparente.

Para los clínicos y los decisores, la advertencia es concreta: una IA validada con TC diagnósticas de dosis estándar puede fallar en silencio con TC de cribado de baja dosis. El régimen de dosis es una diferencia de dominio en sí mismo; una herramienta destinada al cribado debe desarrollarse y validarse en las condiciones de dosis del cribado. Y la especificidad importa tanto como la sensibilidad, porque el talón de Aquiles del cribado LDCT sigue siendo el falso positivo y su cortejo de estudios inútiles.

Para los pacientes y el público, dos ideas simples. Primero, «TC de cribado» y «TC diagnóstica» no producen las mismas imágenes, y un algoritmo que rinde en una no lo hace forzosamente en la otra. Segundo, una imagen sintética que parece más realista no es automáticamente mejor para entrenar una IA. En esta etapa — AUC en torno a 0,86, sensibilidad en torno a 0,74, sobre una sola base y sin confirmación histológica — se trata de un trabajo de investigación prometedor, no de una herramienta lista para la clínica.

Para saber más

El preprint «A Comparative Analysis of CT Degradation for LDCT Nodule Classification using Radiomics» está disponible en arXiv (2605.12164), fechado el 13 de mayo de 2026, por Jiaying Liu, Valentina D. A. Corino, Anna Corti y Luca Mainardi (Politecnico di Milano; Corino también en el Cardiotech Lab del Centro Cardiologico Monzino IRCCS, Milán). El código está publicado en GitHub, y los datos son públicos a través de The Cancer Imaging Archive (LIDC-IDRI; Low-Dose CT Image and Projection Data). El preprint consultado no incluye declaración de financiación ni de conflictos de interés. Sobre los puntos ciegos de la generalización y los datos de entrenamiento en imagen, véanse nuestros descifrados sobre la mezcla de bases que degrada la IA de cribado, sobre las firmas radiómicas profundas y la interpretabilidad, y sobre los sesgos ocultos por subgrupos en la imagen médica.

Transparencia editorial: versión francesa redactada y firmada por la redacción de Tatakoto a partir de la lectura del preprint. Traducciones al inglés, español y chino producidas con asistencia de IA y revisadas.