Detección de cambio de distribución en el diagnóstico de cáncer de piel: SAGE mejora la precisión pero excluye a la mayoría de los pacientes de piel oscura

Un equipo de Oregon Health & Science University (OHSU) construyó SAGE, un detector que combina tres señales de incertidumbre para identificar, antes de cualquier diagnóstico, fotos de lesiones cutáneas demasiado distintas de aquellas con las que se entrenó un modelo. Probado en cinco conjuntos de datos de siete países, SAGE distingue casi a la perfección las imágenes totalmente ajenas al dominio y detecta correctamente el 92 % de los cambios que combinan un dispositivo de imagen distinto con enfermedades nuevas, y filtrar las imágenes según su puntuación mejora la precisión de un modelo de predicción de malignidad situado más adelante en el proceso. Pero ese filtro, calibrado para conservar el 90 % de los casos similares al entrenamiento, retiene solo el 16,4 % de las fotos de pacientes de piel oscura, precisamente el grupo que la herramienta debía proteger mejor.

El contexto

Los modelos de deep learning para el diagnóstico del cáncer de piel muestran cifras impresionantes en conjuntos de referencia como HAM10000 —decenas de miles de fotos dermoscópicas, una técnica de imagen que usa un dermatoscopio (una lupa iluminada apoyada sobre la piel) para visualizar mejor la estructura de una lesión—. El problema, bien documentado desde hace años, es que ese rendimiento se derrumba en cuanto el modelo se encuentra con imágenes distintas a las de su entrenamiento: otra cámara, un smartphone en lugar de un dermatoscopio, una población de pacientes con tonos de piel más variados, o simplemente una patología ausente del conjunto de entrenamiento original. Este fenómeno tiene nombre en aprendizaje automático: el cambio de distribución (distribution shift), o datos out-of-distribution (OOD), es decir, datos que se alejan de lo que el modelo aprendió.

Hasta ahora, la mayoría de las herramientas para detectar este cambio se apoyaban en una sola señal —la confianza del modelo en su propia predicción, o la distancia de una imagen respecto a su conjunto de entrenamiento—. El equipo de OHSU parte de una observación simple: una sola señal capta mal tipos de cambio muy distintos (un nuevo tipo de cámara no tiene nada que ver con una enfermedad nueva), y propone combinarlas. El otro punto ciego que documenta es demográfico: la mayoría de los conjuntos públicos de dermatología sobrerrepresentan las pieles claras (tipos de Fitzpatrick I a IV), lo que expone a los pacientes de piel más oscura a un doble riesgo: infrarrepresentación en el entrenamiento y, potencialmente, subdetección de los casos problemáticos.

El método

SAGE (Supervised Autoencoders for Generalization Estimates) se basa en una ResNet-50, una arquitectura de red neuronal convolucional estándar en visión por computador, preentrenada en ImageNet y reutilizada aquí como codificador: comprime cada imagen en un vector de 256 números que resume su contenido visual. Ese vector alimenta tres módulos. Un decodificador intenta reconstruir la imagen original a partir del vector comprimido —cuanto peor la reconstrucción, más probable que la imagen sea inusual—. Un clasificador predice la categoría diagnóstica y entrega una puntuación de confianza. Y una búsqueda de los 20 vecinos más cercanos en el espacio comprimido mide cuánto se parece la imagen a ejemplos ya vistos durante el entrenamiento. Las tres señales —error de reconstrucción, confianza del clasificador, distancia a los vecinos— se convierten en probabilidades y se combinan mediante una media geométrica en una puntuación única entre 0 y 1: cuanto más alta, más se aleja la imagen de la distribución de entrenamiento.

El modelo se entrenó con HAM10000 (10.015 imágenes dermoscópicas, Australia y Austria), y se probó luego en cuatro conjuntos independientes que representan un cambio creciente: HIBA (Argentina, 1.616 imágenes, mezcla de dermoscopia y fotos de smartphone), UFES (Brasil, 2.255 imágenes, solo fotos clínicas de smartphone), DDI (Stanford, EE. UU., 656 imágenes, con 36 diagnósticos ausentes de HAM10000, algunos cánceres poco frecuentes), y MILK10K (el conjunto del desafío ISIC 2025, 10.480 imágenes, cinco países). Un conjunto totalmente ajeno al ámbito médico, Caltech-101 (fotos de objetos cotidianos), sirve de control extremo. Más adelante en el proceso, los autores midieron el efecto de filtrar por puntuación SAGE sobre un modelo distinto de predicción de malignidad —un Inception v3 preentrenado que clasifica cada lesión como benigna o maligna (carcinoma basocelular, carcinoma epidermoide o melanoma)—.

Los resultados

En la detección de cambios, medida por el AUROC (el área bajo la curva que indica la capacidad de la puntuación para distinguir una imagen normal de una fuera de distribución), SAGE alcanza 1,00 frente a Caltech-101 (los objetos cotidianos obviamente no tienen nada que ver con una lesión cutánea), 0,92 en cambios mixtos que combinan dispositivo nuevo y enfermedades nuevas, 0,88 en el cambio de dispositivo únicamente (dermatoscopio a smartphone), y 0,81 en imágenes aún relativamente cercanas a la distribución de entrenamiento. La puntuación mediana sube lógicamente con la distancia respecto al entrenamiento: 0,63 en el conjunto de prueba de HAM10000, 0,74 en HIBA, 0,79 en UFES, 0,80 en MILK10K, hasta 0,96 en DDI —el conjunto más alejado, con los diagnósticos más raros—.

Traducción clínica: en los casos de malignidad totalmente ausentes del entrenamiento (linfoma cutáneo de células T, sarcoma de Kaposi, carcinoma metastásico), el 81 % de los falsos negativos del modelo de diagnóstico —cánceres que habría clasificado erróneamente como benignos— son correctamente señalados como sospechosos por SAGE y así excluidos de una decisión automática. De cada 100 casos de este tipo que un modelo de diagnóstico dejaría pasar trabajando solo, alrededor de 81 serían atrapados por el filtro. Pero el filtrado tiene un costo directo sobre la precisión global del modelo de malignidad situado más adelante: en pacientes de piel oscura, el AUROC sube de 0,68 sin filtrar a 0,78 tras filtrar —una mejora real—, pero solo el 16,4 % de las imágenes de ese grupo pasa el filtro calibrado para conservar el 90 % de los casos similares al entrenamiento. En pacientes de piel clara, el AUROC sube de 0,75 a 0,77, sin que el artículo informe la tasa de cobertura correspondiente.

El artículo documenta también qué eleva la puntuación SAGE independientemente de cualquier patología: presencia de una regla de medición (+7,2 %), flash de la cámara (+5,8 %), fondo no cutáneo (+7,4 a +10,5 % según la densidad), vello (+5,1 %), y la combinación de vello y fondo (+11,5 %). El efecto de la regla es más marcado en piel oscura (+9,8 %) que en piel clara (+6,1 %). Tras filtrar las imágenes de mala calidad, la brecha de sesgo entre tonos de piel (medida por la delta de Cliff, un indicador de la distancia entre dos distribuciones) se reduce de −0,434 a −0,206, sin desaparecer.

Lo que está bien

Tres señales en lugar de una, validadas sobre un gradiente controlado de cambios. Muchos artículos sobre detección OOD prueban un solo tipo de cambio. Aquí los autores distinguen explícitamente el cambio de modalidad (dermatoscopio vs. smartphone), el cambio de clase (enfermedades nuevas) y su combinación, y muestran que SAGE se mantiene competitivo en las cuatro configuraciones, no solo en el caso más fácil (objetos no médicos).

Una anotación manual que busca causas, no solo síntomas. Se anotaron a mano 4.527 imágenes según doce criterios (densidad de vello, contraste, flash, regla, fondo, desenfoque) por un observador ciego al diagnóstico, la malignidad y el tipo de piel. Ese trabajo es lo que permite identificar artefactos fotográficos precisos como causa de una puntuación alta, en lugar de conformarse con una cifra agregada.

Código, pesos y datos publicados con licencia abierta. Todo el código y los modelos SAGE entrenados están disponibles en GitHub (github.com/pdxgx/sage) bajo licencia CC BY 4.0, y todas las imágenes utilizadas son públicas. La réplica independiente es posible desde hoy, algo que sigue siendo poco frecuente en este campo.

Lo que está menos bien

Un sesgo de población que el filtro reduce sin resolver, y que empeora paradójicamente en cobertura. La propia puntuación SAGE es estructuralmente más alta en pieles oscuras debido a artefactos correlacionados (regla, fondo) más frecuentes en los conjuntos de datos correspondientes. Consecuencia directa: en el umbral elegido para preservar el 90 % de los casos similares al entrenamiento, el 83,6 % de las imágenes de pacientes de piel oscura queda excluido del diagnóstico automatizado. La ganancia de AUROC (0,68 a 0,78) es real, pero se aplica a una fracción residual muy pequeña del grupo —un ejemplo de manual de métrica engañosa: presentar una mejora de rendimiento sin dar el mismo peso a la tasa de cobertura que la acompaña oculta que, en la práctica, la herramienta excluye a la mayoría de los pacientes a quienes debía proteger mejor de la decisión automatizada.

Shortcut learning documentado pero no corregido en su origen. El modelo reacciona a elementos que nada tienen que ver con la patología —una regla, un flash, un fondo de habitación— en lugar de reaccionar exclusivamente a la lesión. Los autores lo nombran y lo cuantifican con precisión, lo cual es un mérito, pero la solución propuesta (filtrar después de los hechos) trata el síntoma: retira las imágenes de riesgo en vez de impedir que el modelo aprenda esas correlaciones espurias desde el principio.

Una sola arquitectura de diagnóstico probada, sobre un conjunto de entrenamiento que siguió siendo modesto. El modelo de malignidad situado más adelante es un único Inception v3 publicado en 2023, un comparador que ya no es la referencia en 2026. Nada indica que las mismas ganancias y los mismos costos de cobertura se repetirían con una arquitectura más reciente o un conjunto de entrenamiento mayor que las 7.207 imágenes usadas aquí. Los propios autores señalan un riesgo de fuga de datos (data leakage) entre entrenamiento y prueba —lesiones distintas del mismo paciente que podrían aparecer en ambos lados— sin haber podido descartarlo por completo.

Qué cambia esto

Para la comunidad de investigación, SAGE fija un método reproducible para probar un detector de cambio sobre un gradiente controlado de severidades, y su principal fortaleza —capturar el 81 % de los falsos negativos en cánceres raros nunca vistos en el entrenamiento— merece reproducirse con otros modelos de diagnóstico posteriores. El siguiente paso necesario ya lo señalan los propios autores: corregir el sesgo demográfico en el entrenamiento en lugar de compensarlo con un filtro que excluye desproporcionadamente a los pacientes de piel oscura.

Para los clínicos, nada cambia en la práctica inmediata: SAGE es una herramienta de investigación, no un dispositivo validado para la clínica. Sí ilustra un principio trasladable a cualquier IA diagnóstica en dermatología: una puntuación de confianza alta puede reflejar la calidad de la foto (regla, flash, fondo) más que la claridad del diagnóstico, y un filtro de calidad de imagen mal calibrado puede privar a ciertos pacientes de una opinión automatizada sin que eso se note en las métricas globales.

Para los pacientes y el público general, el estudio muestra de forma concreta por qué una IA de diagnóstico cutáneo entrenada mayoritariamente con piel clara sigue siendo menos fiable, o menos disponible, para otros tonos de piel —una brecha que no se resuelve solo añadiendo un filtro de seguridad a la salida, sino diversificando los datos desde la fuente, desde el entrenamiento mismo—.

Para saber más

El artículo: Multi-criterion uncertainty estimation improves skin cancer distribution shift detection and malignancy prediction, W. Max Schreyer, Ravi Samatham, Elizabeth Berry, Reid F. Thompson et al. (Oregon Health & Science University; VA Portland Healthcare System; Washington University in St. Louis), npj Digital Medicine, 24 de septiembre de 2026, DOI 10.1038/s41746-026-03293-y. Código y modelos: github.com/pdxgx/sage.

Sobre el sesgo de subgrupos en imagenología dermatológica, ver también nuestro análisis de la predicción selectiva con MC-Dropout en HAM10000. Sobre la subclasificación automatizada de cánceres de piel, ver nuestro análisis de la subclasificación del carcinoma basocelular sin biopsia.