Subtipificar un carcinoma basocelular sin biopsia: lo que vale realmente un AUC de 0,784 en dermatoscopia
Un equipo de la Universidad Aristóteles de Tesalónica entrenó un transformador de visión preentrenado para separar los carcinomas basocelulares agresivos de las formas menos graves a partir de una sola imagen dermatoscópica, sobre 1 271 imágenes recogidas en un único servicio griego entre 2018 y 2022. El modelo alcanza 0,784 de AUC frente a 0,755 de un ResNet-50, y 70,0 % de sensibilidad con 70 % de especificidad, allí donde un estudio publicado comunicaba 56,4 % para dermatólogos formados. Pero el comparador humano procede de otro conjunto de imágenes, el punto de funcionamiento se fijó para hacer posible la comparación, no se realizó ninguna validación externa, y el artículo no dice en ningún momento cuántos pacientes hay detrás de sus 1 271 imágenes.
El contexto
El carcinoma basocelular es, con mucho, el cáncer más frecuente en el ser humano: los autores recuerdan que representa cerca del 80 % de los diagnósticos de cáncer cutáneo. Casi nunca metastatiza, pero destruye localmente y, sobre todo, no es una entidad homogénea. La anatomía patológica distingue varios subtipos histológicos, y esa distinción determina el tratamiento. Las formas llamadas agresivas — infiltrante, morfeiforme, micronodular, metatípica — se extienden de forma irregular bajo la piel, con prolongaciones que el ojo no ve; requieren la cirugía micrográfica de Mohs, una exéresis por capas con control histológico intraoperatorio de los márgenes, lenta y costosa. Las formas superficiales, en cambio, suelen poder tratarse con crioterapia, imiquimod, terapia fotodinámica o simple exéresis.
El problema práctico es que ese triaje exige hoy una biopsia diagnóstica previa: un gesto invasivo, doloroso, que cuesta dinero y tiempo, y que retrasa el tratamiento. De ahí la pregunta de este preprint: ¿contiene la dermatoscopia — el examen de la lesión a través de una lupa iluminada que neutraliza el reflejo superficial de la piel — información suficiente para predecir el subtipo sin pasar por el laboratorio?
Clínicamente la pregunta no es nueva. La literatura dermatoscópica ha descrito criterios asociados a los subtipos agresivos, y un estudio citado por los autores midió lo que los expertos humanos extraen de ellos: treinta lectores, antes y después de una formación específica, clasificando 235 carcinomas basocelulares. Su sensibilidad para detectar las formas agresivas pasó del 42,3 % al 56,4 % tras la formación, con una especificidad constante en torno al 71 %. Dicho de otro modo, incluso formado, un dermatólogo experto pasa por alto a simple vista más de cuatro tumores agresivos de cada diez. Ese es el listón bajo que este artículo pretende superar — y, según los autores, ningún trabajo anterior había combinado dermatoscopia y aprendizaje profundo en esta tarea concreta de subtipificación.
El método
Una tarea binaria, no una subtipificación. Pese al título, el modelo no predice el subtipo histológico. Los autores agrupan sus lesiones en tres familias — superficial (275 imágenes), no superficial no agresiva (726, en su mayoría nodular) y agresiva (270) — y luego fusionan las dos primeras en una clase de «riesgo bajo» de 1 001 imágenes. El modelo responde por tanto a una sola pregunta: ¿agresivo o no? Es defendible clínicamente, ya que esa es la frontera que desencadena la cirugía de Mohs, pero cambia el sentido de la palabra «subtipificación».
El modelo. Los autores parten de BEiT-Large, un transformador de visión (vision transformer, ViT): una arquitectura que trocea la imagen en pequeños cuadrados — aquí de 16 × 16 píxeles sobre una entrada de 512 × 512, es decir una rejilla de 32 × 32 tokens — y los trata como las palabras de una frase, pudiendo cada cuadrado «mirar» a todos los demás. Unos 300 millones de parámetros, 24 capas, 16 cabezas de atención. Los pesos de partida provienen de un preentrenamiento por modelado de imagen enmascarada (se ocultan trozos de la imagen y el modelo aprende a reconstituirlos) sobre imágenes naturales — el corpus exacto nunca se nombra en el artículo, una omisión incómoda para la reproducibilidad.
Dos etapas de adaptación. Primero una adaptación de dominio: el modelo se reentrena por completo durante 100 épocas sobre 53 826 imágenes del archivo público ISIC repartidas en nueve clases de lesiones cutáneas (melanoma, nevo, queratosis, carcinoma epidermoide y otras). Después un segundo reentrenamiento completo sobre las 1 271 imágenes de Tesalónica: 10 épocas, tasa de aprendizaje de 10⁻⁵ con decaimiento coseno, lotes de 16, sobremuestreo de la clase minoritaria para equilibrar cada lote, aumentos clásicos (volteos, rotaciones, desplazamientos, variaciones de brillo y contraste). Los comparadores son un ResNet-18 y un ResNet-50 entrenados «con el mismo dispositivo y el mismo presupuesto de cómputo».
Los datos. Un conjunto privado, constituido en el primer servicio de dermatología de la Universidad Aristóteles entre enero de 2018 y diciembre de 2022, sobre pacientes caucásicos, con un dermatoscopio Dermlite Foto a aumento ×10. El subtipo histológico confirmado por biopsia sirve de patrón de referencia; los subtipos mixtos y las exéresis incompletas quedan excluidos. El fototipo de Fitzpatrick no se comunica, el origen de los pacientes solo se describe con la palabra «caucásico» y — punto al que volvemos más abajo — el número de pacientes nunca se indica.
La evaluación. Validación cruzada estratificada de cinco pliegues, repetida tres veces, es decir quince particiones; el 20 % del conjunto de entrenamiento de cada pliegue sirve de validación, y el punto de control se elige según el AUC de validación. Ningún centro externo. Ninguna evaluación prospectiva. Todos los datos son retrospectivos.
Los resultados
En métricas de aprendizaje automático. El AUC (área bajo la curva ROC: la probabilidad de que un tumor agresivo extraído al azar reciba una puntuación mayor que un tumor no agresivo extraído al azar) se sitúa en 0,784 ± 0,026 para BEiT, frente a 0,755 ± 0,018 del ResNet-50 y 0,735 ± 0,023 del ResNet-18. Los ± son desviaciones típicas sobre las quince particiones, no intervalos de confianza. En un punto de funcionamiento fijado arbitrariamente en el 70 % de especificidad, la sensibilidad alcanza 70,0 % ± 6,6 para BEiT, 67,4 % ± 4,3 para el ResNet-50 y 61,6 % ± 5,8 para el ResNet-18. Son las únicas métricas publicadas: ni exactitud, ni F1, ni valor predictivo positivo, ni matriz de confusión, ni resultados por subtipo, ni curvas ROC, ni prueba estadística.
En traducción clínica. Aquí es donde la cifra se vuelve elocuente. En la composición del conjunto de datos, el 21,2 % de las lesiones son agresivas. Tomemos 1 000 carcinomas basocelulares con esa misma proporción: 212 agresivos, 788 no agresivos. En el punto de funcionamiento elegido, el modelo señala unos 384 como sospechosos. De ellos, 148 son realmente agresivos y 236 no lo son: esos 236 pacientes serían derivados a una cirugía de Mohs que no necesitan. Y 64 tumores agresivos quedarían por debajo del umbral, es decir hacia un tratamiento conservador inadecuado, con el riesgo de recidiva que ello implica. Una de cada tres decisiones entre las lesiones señaladas es correcta; alrededor de un tumor agresivo de cada tres se pasa por alto.
Frente al humano. Sobre esas mismas 1 000 lesiones, los dermatólogos formados del estudio citado (56,4 % de sensibilidad con 70,7 % de especificidad) capturarían unos 120 tumores agresivos frente a 148 del modelo, con un número comparable de falsos positivos. La diferencia de catorce puntos de sensibilidad representa por tanto, en esta aritmética, unos 28 tumores agresivos correctamente derivados de más por cada 1 000 lesiones. No es poco. Pero, como veremos, tampoco es una comparación.
Lo que está bien
La pregunta clínica es la correcta y está bien planteada. Buena parte de la dermatología computacional sigue insistiendo en la detección — benigno frente a maligno — cuando esa etapa está ya en gran medida resuelta y el cuello de botella se ha desplazado. Aquí, la elección de la frontera «agresivo frente a no agresivo» se corresponde exactamente con una decisión terapéutica real y binaria: Mohs o no Mohs. La ganancia potencial no es una puntuación, es una biopsia evitada y un plazo acortado. Pocos artículos de imagen cutánea identifican con tanta precisión el momento del recorrido asistencial en el que se insertaría su modelo.
El comparador algorítmico es honesto y los autores no se sobrevenden. Los ResNet-18 y ResNet-50 se entrenan con el mismo dispositivo y el mismo presupuesto de cómputo, lo que hace interpretable la diferencia de 0,03 de AUC. Sobre todo, los autores no visten 0,784 de éxito: el resumen habla de una «investigación preliminar», la conclusión de una «exploración inicial de prueba de concepto», y las limitaciones — centro único, población caucásica, comparación humana no controlada — se enuncian con claridad en lugar de diluirse. En un ámbito donde se leen con regularidad AUC de 0,95 presentados como listos para la clínica, esa contención merece destacarse.
La restricción de datos se aborda con un método adecuado. Con 270 casos positivos, entrenar un modelo de 300 millones de parámetros debería estar condenado al fracaso. La adaptación de dominio intermedia sobre las 53 826 imágenes públicas de ISIC es la respuesta metodológica correcta: primero se acerca el modelo al mundo de las lesiones cutáneas, luego se afina en la tarea rara. La elección de un transformador preentrenado por enmascaramiento en lugar de una CNN entrenada desde cero va en la misma dirección, y que la diferencia con los ResNet sea modesta y no espectacular es coherente con el tamaño del conjunto de datos.
Lo que está menos bien
La fuga de datos no está excluida, y no puede estarlo. El artículo nunca dice si la validación cruzada separa los pliegues por paciente o solo por imagen. Los términos «patient-level», «lesion-level», «grupo» o «GroupKFold» no aparecen en ninguna parte, la variable de estratificación no se nombra y, sobre todo, el número de pacientes no se comunica — solo se conocen 1 271 imágenes. Ahora bien, en dermatoscopia es habitual que una misma lesión se fotografíe varias veces y que un mismo paciente presente varios carcinomas basocelulares, a menudo del mismo subtipo. Si dos imágenes de un mismo tumor caen a ambos lados de un pliegue, el modelo no generaliza: reconoce. Este es el modo de fallo que más sistemáticamente infla los AUC publicados en imagen médica, y nada en el texto permite descartarlo.
Los metadatos ausentes delatan un ensamblaje heterogéneo. La tabla demográfica contiene una anomalía que los autores no comentan: en el grupo agresivo, 158 de 270 lesiones (58,5 %) no tienen registrados ni el sexo ni la localización anatómica, frente al 32 % del grupo superficial y el 25,8 % del grupo no superficial. Falta exactamente el mismo número en ambas variables, lo que sugiere un bloque de 158 casos agresivos procedente de una fuente de datos distinta del resto. Si esa fuente difiere además en aparato, ajustes o periodo — y el artículo se contradice en este punto, anunciando un único dermatoscopio en la sección II y luego «aparatos dermatoscópicos diferentes» en la sección III —, el modelo puede aprender una firma de procedencia en lugar de una morfología tumoral. La distribución de los sitios anatómicos apunta en la misma dirección: el 37,1 % de los superficiales están en el tronco frente al 9,3 % de los agresivos, y el 51,4 % de los no superficiales en cabeza y cuello frente al 25,1 % de los superficiales. Un modelo que adivinara la región corporal a partir de la imagen obtendría ya una puntuación decente sin mirar nunca el tumor. No se realiza ninguna auditoría — clasificador de dominio, mapa de saliencia, descomposición de errores por fuente. Ya describimos este mecanismo a propósito de la fusión de conjuntos de datos en mamografía de cribado, y el efecto de los metadatos ausentes sobre los sesgos ocultos a propósito de la auditoría de subgrupos en imagen médica.
La comparación con el humano no lo es, y el artículo lo admite a medias. El 56,4 % de sensibilidad de los dermatólogos proviene de un estudio distinto, realizado sobre otros 235 carcinomas basocelulares, con treinta lectores y un protocolo diferente. El punto de funcionamiento del 70 % de especificidad no se eligió por una razón clínica: se eligió, y los autores lo escriben explícitamente en el pie de la tabla, para permitir la comparación con ese estudio. Se selecciona por tanto el umbral que alinea el eje de abscisas y luego se anuncia la diferencia en el eje de ordenadas. Los autores reconocen que «las distintas composiciones de los conjuntos de datos impiden conclusiones definitivas» — pero la frase del resumen afirma un rendimiento «superior al comunicado previamente para lectores humanos». Añádanse dos detalles: la introducción da un 71,7 % de especificidad para los lectores antes de la formación donde la tabla da 71,1 %, y el coautor clínico firma por otra parte una de las referencias dermatoscópicas que el artículo moviliza, sin que ese solapamiento se declare en ningún sitio.
Nada es verificable, y la ética no está documentada. Ningún repositorio de código, ningún peso publicado, ninguna declaración de disponibilidad de datos: el conjunto de Tesalónica es privado y nada indica que vaya a difundirse. No existe ninguna declaración de conflictos de interés y, sobre todo, ninguna mención de aprobación por un comité de ética ni de consentimiento, tratándose de imágenes clínicas retrospectivas asociadas a la edad, el sexo y la localización anatómica. La única financiación declarada es la cuenta especial de investigación de la Universidad Aristóteles (referencia 90169/2024). Por último, este preprint no ha sido revisado por pares, y la ausencia total de ablaciones — en particular sobre la etapa de adaptación ISIC, de la que por tanto se ignora si aporta algo — deja abierta la cuestión de dónde procede realmente la diferencia de 0,03.
Lo que cambia
Para la comunidad investigadora. El resultado útil no es 0,784, es la cartografía de un techo. Un transformador de 300 millones de parámetros, correctamente adaptado al dominio, se estanca en torno a 0,78 de AUC sobre 1 271 imágenes de un único centro — tres centésimas por encima de un ResNet-50, aproximadamente lo que cabe esperar de un cambio de arquitectura cuando los datos son el factor limitante. El mensaje, formulado por los propios autores, es que el cuello de botella es el tamaño y la diversidad del corpus anotado, no la capacidad del modelo. El paso lógico siguiente no es por tanto un modelo mayor, sino un conjunto multicéntrico y multiétnico con separación por paciente declarada, y un protocolo de lectura humana realizado sobre las mismas imágenes. Mientras eso no se haga, la afirmación «mejor que los dermatólogos» seguirá siendo inverificable.
Para los clínicos. Hoy no cambia nada. La tasa de falsos negativos — alrededor de un tumor agresivo de cada tres pasado por alto — es incompatible con una decisión de ahorrar la biopsia, porque el error no es simétrico: un carcinoma infiltrante tratado con crioterapia recidiva, a veces años después, y el rescate es más mutilante. La única lectura prudente del resultado es la contraria de la que sugiere el título: no «sustituir la biopsia», sino eventualmente priorizar qué lesiones biopsiar o derivar de entrada a cirugía micrográfica cuando el acceso al quirófano está limitado. Esa priorización exige una calibración de las probabilidades que el artículo no proporciona, y una validación sobre la población local que el artículo no permite. La generalización entre centros en dermatoscopia se examinó con más finura en otros trabajos de validación externa sobre cáncer cutáneo.
Para los pacientes y el público. La intuición que conviene retener es que la piel negra, morena o mestiza está ausente de este trabajo: la cohorte se describe como exclusivamente caucásica y el fototipo ni siquiera se comunica. Una herramienta de subtipificación entrenada así no ofrece ninguna garantía de funcionar en otros lugares, y los carcinomas basocelulares de fototipos oscuros se presentan a menudo de forma pigmentada, es decir visualmente distinta. De manera más general, conviene resistirse a la lectura que el título invita a hacer: «sin biopsia» describe una ambición, no un resultado. Hoy la biopsia sigue siendo la única forma de saber qué tipo de carcinoma basocelular se tiene, y una puntuación de 0,78 no se le acerca.
Para saber más
El preprint: Deep Learning for Biopsy-Free Subtyping of Basal Cell Carcinoma from Dermatoscopic Images, arXiv:2609.07180 [cs.CV], DOI 10.48550/arXiv.2609.07180, depositado el 7 de septiembre de 2026, bajo licencia CC BY 4.0. Autores: Alexandros Papadopoulos, Chrysa Episkopou, Ioannis Sarafis y Anastasios Delopoulos (Escuela de Ingeniería Eléctrica e Informática, Universidad Aristóteles de Tesalónica) y Aimilios Lallas (Primer Servicio de Dermatología, Universidad Aristóteles de Tesalónica). Financiación: cuenta especial de investigación de la Universidad Aristóteles de Tesalónica, referencia 90169/2024. En el manuscrito no figura ninguna declaración de conflictos de interés ni de aprobación ética. La arquitectura reutilizada es BEiT (Bao et al., arXiv:2106.08254), y el corpus de adaptación de dominio procede del archivo ISIC. El comparador humano es el estudio de Camela y colegas publicado en 2024 en el Journal of the American Academy of Dermatology, sobre treinta lectores y 235 carcinomas basocelulares; los criterios dermatoscópicos movilizados remiten a los trabajos de Lallas y colegas de 2014. Sobre el papel de la cirugía micrográfica en el manejo de los subtipos agresivos, las recomendaciones europeas de la EADO y las guías NCCN sobre cánceres cutáneos no melanoma constituyen la base a consultar.