CRS-Bench: puntuar los codificadores medicos en cuatro ejes en lugar del AUROC invierte 21 de 105 comparaciones, pero predice peor el paso a otro hospital

Xingtao Lin, Hangqi Ren, Caiwan Sun y You Chen, del Vanderbilt University Medical Center, compararon quince familias de codificadores de imagenes preentrenados en tres especialidades — dermatologia, oftalmologia, radiologia toracica — en 17 575 ejecuciones emparejadas, puntuando cada una en cuatro ejes en lugar del AUROC solo. Su puntuacion compuesta, la Clinical Reliability Score (CRS), invierte 21 de las 105 comparaciones por pares que produciria el AUROC solo, con un desplazamiento medio de 1,87 posiciones. Pero a la hora de predecir el rendimiento en un hospital externo, esa puntuacion compuesta funciona peor (rho = 0,529) que el AUROC bruto que pretende complementar (rho = 0,864) — y son los propios autores quienes lo reportan.

El contexto

Un codificador de imagenes es la mitad invisible de casi todo sistema de IA en imagen medica: la red que convierte una fotografia de una lesion cutanea, un fondo de ojo o una radiografia de torax en un vector de unos cientos de numeros. El clasificador que viene despues — el que dice melanoma o no melanoma — suele ser trivial en comparacion. Elegir el codificador, en cambio, se ha convertido en una decision de modelado por derecho propio, porque la oferta ha estallado en tres familias. Los generalistas entrenados con imagenes de la web (ResNet-50, ViT-B/16, CLIP, SigLIP, DINOv2, MAE). Los medicos amplios entrenados con figuras de articulos biomedicos o corpus medicos de imagen-texto (BiomedCLIP, LLaVA-Med, MedSigLIP, MedGemma). Los especialistas entrenados exclusivamente con piel (PanDerm), retina (RETFound) o torax (RAD-DINO, BioViL, CheXzero).

Como se decide hoy? En la inmensa mayoria de los articulos, con una sola fila de tabla: el AUROC sobre un conjunto de prueba limpio. El AUROC (area bajo la curva ROC) es la probabilidad de que el modelo puntue mas alto un caso positivo tomado al azar que uno negativo — 1,0 es perfecto, 0,5 es azar. Es una buena medida de ordenacion, y una medida ciega a tres cosas que importan en clinica. Es honesta la confianza declarada? Cuantas anotaciones de experto hacen falta para alcanzar ese nivel? Que ocurre cuando la imagen esta borrosa, comprimida, o viene de otro hospital? El articulo parte de esa constatacion e intenta convertirla en un protocolo medible.

El metodo

Los datos. Cuatro conjuntos publicos. CheXpert (191 229 radiografias de torax, 14 etiquetas, multietiqueta) para radiologia; ISIC 2019 (25 331 imagenes dermoscopicas, 8 clases) para dermatologia; APTOS 2019 (3 662 fotografias de fondo de ojo, 5 grados ordinales de retinopatia diabetica) para oftalmologia. MIMIC-CXR sirve de objetivo de desplazamiento institucional: las sondas entrenadas en CheXpert se aplican alli sin reentrenamiento, compartiendo ambas bases las mismas 14 etiquetas pero difiriendo en institucion, poblacion, protocolo y etiquetado.

El protocolo. Todos los codificadores estan congelados. Se extraen las caracteristicas en una pasada, se estandarizan con las estadisticas del conjunto de entrenamiento, y encima se ajusta una regresion logistica regularizada — esto es el linear probing, y el objetivo es medir la calidad de la representacion, no la del optimizador. Dos sondas de control (un perceptron de dos capas, un k vecinos mas proximos con k = 5) verifican que las conclusiones no dependen del clasificador. Cinco semillas aleatorias compartidas, mismas particiones, mismas submuestras de etiquetas, mismas semillas de perturbacion, mismo presupuesto de hiperparametros para todos. Total: 17 575 ejecuciones y 3 515 filas de metricas agregadas por semilla, sobre 43 de las 45 celdas codificador-conjunto posibles (BioViL y CheXzero no tienen celda APTOS, al ser sus interfaces publicadas especificas de torax; los valores ausentes nunca se imputan).

Los cuatro ejes. La discriminacion es el macro-AUROC. La calibracion se mide con el ECE (error de calibracion esperado, 15 casillas): la brecha media entre la confianza declarada y el acierto real — un ECE de 0,15 significa que, en promedio, cuando el modelo dice 90 %, acierta alrededor del 75 % de las veces. La eficiencia de etiquetas es la razon media entre el AUROC obtenido con 1 %, 5 %, 10 % y 25 % de las etiquetas y el AUROC con etiquetado completo; mide por tanto preservacion, no nivel absoluto. La robustez combina la caida media y la peor caida de AUROC bajo cinco perturbaciones (desenfoque gaussiano, compresion JPEG, reduccion de contraste, ruido riciano, recorte del campo de vision) en tres severidades, mas, solo para CheXpert, la caida real observada al pasar a MIMIC-CXR.

La puntuacion. La CRS agrega esos cuatro ejes, normalizados por anclajes fijos, mediante tres componentes: dominancia de Pareto (a cuantos pares del panel domina el codificador en todos los ejes a la vez), proximidad al perfil ideal y rendimiento en el peor eje, ponderados 0,60, 0,25 y 0,15. Los autores precisan que esos pesos son parametros de diseno explicitos, no utilidades clinicas aprendidas. Punto importante: como los anclajes son fijos, la llegada de un codificador nuevo no modifica las puntuaciones ya publicadas.

Los resultados

La frontera depende de la metrica. En AUROC agregado, MedGemma y MedSigLIP lideran (0,909 y 0,908). En CRS agregada, son PanDerm (0,703) y MedSigLIP (0,701) — separados por 0,002, es decir, nada. En 10 000 replicas bootstrap emparejadas por semilla, PanDerm y MedSigLIP ocupan el puesto 1 con probabilidades de 0,664 y 0,336, y el intervalo al 95 % de su diferencia, [-0,097; 0,017], contiene el cero. Los autores se niegan por tanto a designar un ganador y hablan de un escalon de cabeza estable: PanDerm, MedSigLIP, MedGemma, los tres con probabilidad 1,000 de estar en el trio de cabeza, frente a exactamente cero para los otros doce.

El desacuerdo medido entre AUROC y CRS. Sobre los quince codificadores, tau de Kendall = 0,600, rho de Spearman = 0,811, 21 de 105 elecciones por pares se invierten, desplazamiento absoluto medio de 1,87 posiciones, solapamiento del top-3 de 0,667. Los movimientos individuales son elocuentes: CheXzero pasa del 11.o al 5.o puesto, LLaVA-Med del 5.o al 11.o, PanDerm del 4.o al 1.o, DINOv2 del 6.o al 9.o.

La calibracion se repara, la discriminacion no. En seis pruebas principales, una recalibracion a posteriori (temperatura, vector, isotonica o Dirichlet, ajustada sobre una particion de calibracion reservada) reduce el ECE en un 54 a 77 % — reduccion media absoluta de 0,067, IC 95 % [0,024; 0,110] — sin cambiar el AUROC (delta medio de unos +0,001). Ejemplos: DINOv2 en APTOS pasa de 0,150 a 0,034; MedSigLIP en APTOS de 0,121 a 0,028. Traduccion practica: un codificador que ordena bien pero declara mal sus probabilidades no es un mal codificador, es un codificador que nadie ha recalibrado todavia, y la operacion cuesta unos cientos de casos etiquetados.

La degradacion de imagen rompe la confianza antes que la ordenacion. Bajo perturbacion, el ECE de LLaVA-Med en APTOS sube en promedio 0,128, con un pico de 0,418; en ISIC, MedGemma y MedSigLIP ven subir su ECE en 0,113 y 0,094 sin dejar de ser buenos discriminadores. En el conjunto de las 43 celdas, perdida de discriminacion y perdida de calibracion solo estan moderadamente asociadas (r = 0,63). Dicho de otro modo, una imagen algo borrosa puede dejar la ordenacion de pacientes casi intacta y a la vez volver claramente falsas las probabilidades mostradas — precisamente el modo de fallo mas peligroso para una herramienta de apoyo a la decision que muestra un porcentaje.

El desplazamiento institucional. Al pasar de CheXpert a MIMIC-CXR sin reentrenamiento, los codificadores preentrenados medicamente conservan un macro-AUROC de 0,717 frente a 0,540 de los generalistas (prueba de Welch, p = 0,0029). La cifra 0,540 merece leerse literalmente: en una tarea de ordenacion binaria, eso esta cerca del azar. Y el origen medico no basta — LLaVA-Med cae a 0,504.

Dos resultados secundarios utiles. Con el 1 % de las etiquetas, MedGemma alcanza ya 0,884 de AUROC en APTOS, y MedSigLIP, MedGemma y PanDerm alcanzan 0,819, 0,815 y 0,806 en ISIC; en CheXpert, seis codificadores medicos igualan a ViT-B/16 ya con el 1 % de etiquetas, mientras que MAE y ResNet-50 no lo alcanzan nunca. Y las capas intermedias ganan a la capa final en 5 de 8 barridos de profundidad: RAD-DINO gana entre 1,3 y 1,6 puntos de AUROC en torno al 50 % de profundidad, DINOv2 prefiere el 75 %. El ultimo bloque de un transformer no es, por tanto, automaticamente la mejor representacion clinica.

Lo que esta bien

El emparejamiento es serio, y eso es raro. Mismas particiones, mismas submuestras de etiquetas, semillas de perturbacion derivadas de un hash SHA-256 del identificador de imagen — de modo que la misma imagen degradada llega a cada codificador. Misma capacidad de sonda, mismo presupuesto de hiperparametros, mismo tope de tiempo de calculo. La mayoria de las comparaciones de codificadores publicadas no emparejan nada de eso, y sus diferencias de 0,01 de AUROC son indistinguibles del ruido de protocolo.

Los autores demuelen una de sus propias metricas candidatas. Muestran que la medida de eficiencia de etiquetas mas habitual, el area bajo la curva de aprendizaje (AULC), es esencialmente una reformulacion del AUROC con etiquetado completo: rho = 0,986 entre codificadores, 0,977 sobre las 43 celdas. Su medida de retencion relativa hace caer esas correlaciones a 0,339 y -0,342. Es autocritica cuantificada, y justifica la eleccion de formula en lugar de postularla.

La invariancia de referencia se demuestra, no se afirma. En 30 ensayos de insercion de tres codificadores nuevos en un panel de doce, una renormalizacion por cohorte desplaza las puntuaciones ya publicadas en 0,053 de media y hasta 0,167; la regla de anclajes fijos da exactamente cero desplazamiento. Es la diferencia entre una clasificacion que se puede citar dentro de seis meses y otra que se mueve con cada nuevo modelo.

Lo que esta menos bien

La validez externa de la puntuacion compuesta es debil — e inferior a la del AUROC. Retirando MIMIC-CXR del calculo de la CRS y tratando luego de predecir el AUROC en MIMIC, la CRS da rho = 0,529 frente a 0,864 del AUROC de CheXpert solo. En validacion cruzada dejando fuera un conjunto, rho vale 0,550 / 0,709 / 0,271 para ISIC / APTOS / CheXpert, y el ganador del conjunto excluido no se recupera en ningun pliegue. Los autores son explicitos: la CRS es un resumen comparativo a nivel de banco de pruebas, no un predictor del AUROC en una tarea desconocida. Es honesto, pero relativiza mucho el uso que uno estaria tentado de darle — elegir un codificador para un proyecto que no es ninguno de los tres probados.

La clasificacion congelada no sobrevive a la adaptacion, y nadie despliega un codificador congelado. Con un ajuste fino parametricamente eficiente LoRA (rango 8, alpha 16, ocho epocas, tres semillas), la discriminacion mejora en todas partes (+0,026 / +0,030 / +0,010 en ISIC / APTOS / CheXpert) pero el orden cambia: tau de Kendall de 0,829 / 0,667 / 0,448, y el lider en dominio cambia en los tres dominios (MedGemma cede ante MedSigLIP en ISIC y APTOS, MedSigLIP cede ante RAD-DINO en CheXpert). Frente a la CRS congelada, la comparacion de cuatro ejes tras la adaptacion da tau = 0,562 y un desplazamiento medio de 2,0 posiciones, con BiomedCLIP cayendo del 4.o al 13.o puesto. El trio de cabeza aguanta, el centro de la tabla se reorganiza por completo. Aqui aparece el comparador sesgado: el protocolo mide un regimen (codificador congelado) que no es el de la practica.

Los estreses sinteticos no modelan ni la poblacion ni la patologia, y solo se observa un desplazamiento real. Los autores lo escriben: las perturbaciones modelan la adquisicion y la calidad de imagen, no los cambios de anatomia, patologia o poblacion. El unico desplazamiento institucional autentico del banco de pruebas es CheXpert hacia MIMIC-CXR, dos hospitales universitarios estadounidenses — lo que deja intacto el sesgo de poblacion, especialmente critico en ISIC 2019, cuya infrarrepresentacion de pieles oscuras esta documentada desde hace anos. Ningun analisis por subgrupos, ninguna eleccion de punto de funcionamiento, ninguna interaccion humano-maquina figura en el protocolo, cosa que los autores reconocen. Anadamos dos reservas que ellos no formulan: el ruido riciano es un modelo de ruido propio de las imagenes de RM en magnitud, y su aplicacion a dermoscopia, fondo de ojo y radiografia digital es fisicamente discutible; y el articulo no incluye ni enlace a un repositorio de codigo, ni declaracion de financiacion, ni declaracion de conflictos de interes, cuando clasifica modelos publicados por Google (MedSigLIP, MedGemma) y Microsoft (BiomedCLIP, RAD-DINO, BioViL).

Lo que cambia

Para la comunidad de investigacion. El resultado mas reutilizable no es la clasificacion, sino la demostracion cuantificada de que el desacuerdo entre AUROC y perfil multieje es estructural y no marginal: 21 inversiones de 105, una tau de 0,600. Publicar un perfil de cuatro ejes en lugar de un escalar pasa a ser defendible. Y la idea de anclajes fijos — una clasificacion que no se renormaliza con cada modelo nuevo — merece ser adoptada por otros bancos de pruebas medicos, donde anadir un competidor hoy modifica las puntuaciones de todos los predecesores.

Para clinicos y equipos de despliegue. Dos consecuencias inmediatas y baratas. Primero, si una herramienta muestra probabilidades, su calibracion debe verificarse y, si hace falta, repararse sobre una cohorte local: un 54 a 77 % de reduccion del ECE sin perdida de ordenacion es la mejor relacion esfuerzo-beneficio del articulo. Segundo, la degradacion de calidad de imagen debe vigilarse por si misma, porque puede dejar la ordenacion intacta y volver falsos los porcentajes mostrados — un modo de fallo silencioso que ningun cuadro de mando basado en AUROC detectara.

Para pacientes y publico general. Hoy no cambia nada: ninguno de los quince modelos se evalua aqui en condiciones clinicas, ninguno tiene un estatus regulatorio discutido en el articulo, y los autores excluyen explicitamente la validacion prospectiva de su protocolo. Lo que el articulo aporta al debate publico es mas modesto y mas duradero: la frase el modelo X supera al modelo Y no significa nada sin precisar en que eje, y el porcentaje de confianza que muestra una herramienta medica es una cantidad que se mide, se equivoca y se corrige.

Para saber mas

El preprint: CRS-Bench: A Reference-Relative Reliability Benchmark for Medical Image Encoders, arXiv:2608.22059, depositado el 22 de agosto de 2026, licencia CC BY 4.0, enviado a WACV 2027. Todos los conjuntos de datos son publicos: ISIC 2019, APTOS 2019, CheXpert y MIMIC-CXR. El articulo no indica hasta la fecha ningun repositorio de codigo.