Segmentar el páncreas indistintamente en TC y en RM: lo que muestra, y lo que nunca mide, el alineamiento adversarial de modalidades

Un equipo del departamento de radiología de Northwestern University, junto a dos gastroenterólogos de Northwestern y de la Mayo Clinic de Florida, entrenó una sola red para segmentar el páncreas en 4 604 exploraciones de TC y RM mezcladas, añadiendo al modelo una restricción explícita: no poder reconocer ya de qué modalidad procede la imagen. El solapamiento alcanza el 87,31 % en el test interno y se mantiene entre el 84,20 y el 88,09 % en cuatro conjuntos de datos externos, y las representaciones así aprendidas permiten dividir el páncreas en cabeza, cuerpo y cola en exploraciones de TC pese a que nunca se vio ninguna anotación de subregión en TC. El problema está en otra parte: las dos tablas de resultados del artículo contienen únicamente el método propuesto, sin comparador numérico, sin desviación típica, sin prueba estadística — y el resultado presentado como más notable se apoya en diecisiete exploraciones anotadas por un solo lector.

El contexto

El páncreas es el órgano abdominal que más fallan los algoritmos de segmentación. Es retroperitoneal, es decir, está pegado al fondo del abdomen detrás del estómago; su forma y su posición varían mucho de una persona a otra; y su contraste con el duodeno, el bazo y los vasos que lo rodean es escaso. Segmentar, aquí, significa asignar a cada vóxel — el píxel tridimensional de una exploración volumétrica — una etiqueta «páncreas» o «no páncreas». Es el ladrillo básico de todo lo demás: medir un volumen, seguir un quiste, trazar un contorno antes de una radioterapia, extraer descriptores de textura.

En la práctica conviven dos modalidades. La TC sigue siendo la referencia en oncología pancreática. La RM gana terreno en la vigilancia de lesiones quísticas, en particular las NMPI, porque no irradia y esas exploraciones se repiten durante años. Las dos imágenes no tienen nada en común en cuanto a intensidades: en TC, el valor de un vóxel es una unidad Hounsfield física y reproducible; en RM depende de la secuencia, de la máquina y del ajuste, y carece de unidad absoluta.

La respuesta habitual es construir dos modelos, uno por modalidad. Sale caro en anotación y no aprende nada común sobre la anatomía. Mezclar ingenuamente ambos conjuntos suele degradar el rendimiento: la red empieza a explotar la firma de intensidad propia de cada modalidad en lugar de la forma del órgano — un caso de manual de shortcut learning, el aprendizaje de un atajo correlacionado con la respuesta en vez de la estructura buscada. La literatura de adaptación de dominio ofrece desde hace tiempo un remedio, el entrenamiento adversarial de dominio introducido por Ganin y colegas, trasladado a la imagen médica por Kamnitsas en lesiones cerebrales y luego por SIFA para la transferencia TC-RM. Los autores citan además PaNSegNet como el estado del arte actual del páncreas en RM. Retenga ese nombre: no volverá a aparecer.

El método

Un codificador compartido, un discriminador y una capa que invierte los gradientes. El esqueleto es un nnU-Net 3D estándar — la arquitectura codificador-decodificador que sigue siendo, en 2026, la referencia difícil de batir en segmentación médica. El codificador comprime el volumen en una representación abstracta; el decodificador la despliega de nuevo en una máscara. Aquí un único codificador-decodificador es compartido por ambas modalidades, y la función de coste de segmentación combina una pérdida de Dice y una entropía cruzada.

La contribución se enchufa en el cuello de botella de la red, allí donde la representación es más compacta. Se añade un pequeño clasificador, el discriminador de dominio, con una única tarea: adivinar si la imagen es TC o RM. Entre el codificador y ese discriminador, los autores insertan una capa de inversión de gradiente — un dispositivo que deja pasar la información intacta a la ida, pero invierte el signo del gradiente a la vuelta. Consecuencia: el discriminador aprende a distinguir las modalidades mientras que al codificador se le empuja a hacerle fracasar. En el equilibrio, la representación ya no lleva firma de modalidad. El coste total pondera ambos objetivos con un factor lambda, inicializado a 0 y elevado progresivamente hasta 0,5; el calendario exacto de esa subida lo califican los propios autores de «empírico».

El entrenamiento. Dos etapas: 2 000 épocas de segmentación sola con TC y RM mezcladas, y después 1 000 épocas con el discriminador. Parches de 80 × 160 × 192 vóxeles, optimizador Adam a 0,001, normalización z-score, inferencia por ventana deslizante, en un servidor con ocho A6000. No se reportan el número de parámetros, la arquitectura del discriminador, el tamaño de lote ni el detalle del aumento de datos.

La transferencia de subregión. Es la segunda mitad del artículo, y la idea es limpia. Una vez entrenado el codificador, se congela y se le conecta un nuevo decodificador, entrenado para dividir el páncreas en cabeza, cuerpo y cola — pero únicamente con etiquetas de RM, las del conjunto Cyst-X, el único de los cuatro conjuntos de entrenamiento que aporta esa división. Después se aplica todo a exploraciones de TC. Si el codificador es realmente indiferente a la modalidad, un decodificador entrenado en RM debería funcionar en TC. No se da ninguna definición anatómica operativa de las tres subregiones — ni plano de corte, ni referencia vascular del tipo vena mesentérica superior.

Los datos. 4 604 exploraciones en distribución: 1 461 RM de Cyst-X, 1 888 RM de un conjunto privado no descrito, 1 000 TC de AbdomenCT-1K, 255 TC de un conjunto de «edema peripancreático». Están representadas tres secuencias de RM — T1, T2 y oposición de fase — sin desglose numérico. El conjunto se reparte 8:1:1 entre entrenamiento, validación y test, sin que el texto precise si esa partición es a nivel de paciente o de exploración. A ello se suman 440 exploraciones declaradas fuera de distribución: AMOS en RM (60) y en TC (300), U-Mamba en RM (50), BTCV en TC (30). Ninguna demografía, ningún criterio de inclusión o exclusión, ninguna lista de centros pese a la afirmación «multicéntrico», ninguna información sobre el conjunto privado que representa sin embargo el 41 % del corpus.

Los resultados

Páncreas completo. En el test interno, Dice global del 87,31 %, HD95 de 5,23 mm, ASSD de 0,94 mm, IoU del 78,42 %. Por subgrupo: T1 con 85,59, T2 con 88,27, oposición de fase con 89,76, TC con 87,53. En los cuatro conjuntos externos: AMOS-TC con 84,20, BTCV-TC con 84,58, AMOS-RM con 86,87, U-Mamba-RM con 88,09. El Dice mide el solapamiento entre la máscara predicha y la de referencia; el HD95 mide, en milímetros, el error de contorno en el percentil 95, es decir, a qué distancia quedan los puntos más equivocados una vez descartados los casos extremos. Ambos no dicen lo mismo, y el artículo ofrece un buen ejemplo: la secuencia en oposición de fase tiene el mejor Dice de todo el test (89,76) y el peor HD95 (8,47 mm, casi el triple que el T2 con 2,92 mm). Buen solapamiento volumétrico con contornos localmente muy erróneos — típicamente, un fragmento de estructura vecina capturado lejos del órgano.

Subregiones. En RM, media del 80,53 %: cabeza 85,19, cuerpo 80,23, cola 76,18. En TC, sin ninguna etiqueta de subregión vista en el entrenamiento, media del 83,05 %: cabeza 82,29, cuerpo 83,26, cola 83,61. Es el resultado que los autores presentan como más notable, y se apoya en diecisiete exploraciones — 7 de AMOS y 10 de BTCV — anotadas a mano para la ocasión por un radiólogo experto, solo, sin doble lectura ni medida de acuerdo interobservador.

Lo que las tablas no contienen. Ninguna desviación típica, ningún intervalo de confianza, ninguna prueba estadística, en ninguna parte. Y sobre todo: ninguna fila de comparación. Ni nnU-Net sin discriminador, ni lambda a cero, ni modelo entrenado en una sola modalidad, ni PaNSegNet. Las tablas II y III contienen solo el método propuesto.

Traducción clínica. Un Dice del 76 % en la cola del páncreas significa que alrededor de una cuarta parte del volumen delimitado discrepa de la referencia. Para una medida de volumen glandular en investigación sobre diabetes, es aceptable; para trazar el límite cuerpo-cola que separa la indicación de una duodenopancreatectomía cefálica de la de una pancreatectomía distal, queda muy lejos de un margen quirúrgico. El artículo tampoco pretende tal cosa: no incluye ningún criterio de valoración clínica, ninguna evaluación por clínicos de si los contornos son utilizables, ninguna medida del tiempo de corrección.

Lo que está bien

La escala y la heterogeneidad son reales. 4 604 exploraciones internas y 440 externas, dos modalidades, tres secuencias de RM, cuatro conjuntos externos nombrados y de acceso público. Muchos trabajos de segmentación pancreática siguen conformándose con unos cientos de TC de un solo centro. Aquí la afirmación «multicéntrico» no está documentada, pero el volumen y la diversidad de secuencias no se discuten.

La prueba de transferencia de subregión está bien concebida. Los autores podrían haberse conformado con una figura cualitativa mostrando contornos elegantes en TC. En lugar de eso hicieron anotar diecisiete volúmenes a mano para producir una cifra. La muestra es minúscula, pero la intención metodológica es la correcta: no se reivindica una transferencia sin ir a medirla en la modalidad de destino.

Las métricas de distancia se publican junto al Dice, y desglosadas. HD95, ASSD e IoU figuran secuencia por secuencia y conjunto por conjunto, no solo en agregado. Es lo que hace visible la anomalía de la oposición de fase señalada arriba. Publicar cifras que contradicen en parte el propio relato es una virtud, incluso cuando el texto no las comenta.

Lo que está menos bien

La contribución central nunca se mide. Es la debilidad dominante, y es estructural. El artículo afirma que el alineamiento adversarial produce representaciones independientes de la modalidad y que eso es lo que genera el rendimiento. La única prueba aportada es una proyección t-SNE — una visualización bidimensional del espacio latente — de la que los propios autores reconocen que es «cualitativa». Existe una ablación, pero solo cubre el ajuste fino posterior, sus valores viven únicamente en una figura, y su formulación ya es una concesión: el modelo preentrenado «supera o es comparable» a una línea base que el texto no define nunca. «Comparable» no es un resultado. Se trata de un comparador ausente más que sesgado, una variante más radical del mismo defecto. PaNSegNet, designado estado del arte unos párrafos antes, es un trabajo del mismo laboratorio con datos ampliamente solapados: su ausencia de la tabla es difícil de explicar salvo como la decisión de no hacerla.

El riesgo de fuga de datos no queda descartado. La partición 8:1:1 se anuncia sin una palabra sobre estratificación por paciente. Ahora bien, Cyst-X aporta T1, T2 y oposición de fase para los mismos pacientes, y la tabla de resultados informa precisamente del rendimiento por secuencia. Un sorteo a nivel de exploración colocaría el T1 de un paciente en entrenamiento y su T2 en test — misma anatomía, mismo quiste, misma morfología glandular. Es el modo de fallo más banal de la literatura de IA en salud, el que hunde las puntuaciones publicadas en cuanto se controla correctamente, y también el que una frase de tres palabras bastaría para despejar. Esa frase no está. Una duda vecina planea sobre el estatus «fuera de distribución» de AMOS-TC y de BTCV: AbdomenCT-1K, usado en entrenamiento, es por construcción una agregación de conjuntos públicos de TC abdominal, y no se describe ningún procedimiento de deduplicación. El mismo mecanismo de firma de origen de los conjuntos de datos ya se ha documentado en mamografía.

El resultado estrella compara dos poblaciones, no dos modalidades. La TC supera a la RM en subregiones — 83,05 frente a 80,53 — pese a no haber visto ninguna etiqueta de subregión. Los autores no comentan esa inversión. Hay disponible una explicación sencilla que no se discute: el test de RM procede de Cyst-X, una cohorte constituida para estudiar lesiones quísticas, es decir, páncreas patológicos y deformados; el test de TC procede de AMOS y de BTCV, conjuntos de segmentación de órganos abdominales mayoritariamente normales. La diferencia mide, por tanto, tanto la dificultad de los casos como la capacidad del modelo: un sesgo de población sumado a una métrica engañosa. La misma crítica vale para el 87,31 % destacado en el resumen: agrega 3 349 RM y 1 255 TC sin ponderación explícita, y refleja por tanto sobre todo el rendimiento en RM. A ello se añade la ausencia total de caracterización de las cohortes — ni edad, ni sexo, ni estado patológico, nada sobre las 1 888 RM privadas — que hace imposible cualquier análisis de subgrupos, incluso por proxy.

Lo que cambia

Para la comunidad investigadora, la idea merece retomarse, con independencia de cómo se demuestre aquí. Un codificador indiferente a la modalidad es un objeto reutilizable: convierte un acervo de anotaciones disponible en una modalidad en supervisión aprovechable en la otra, y anotar subregiones pancreáticas en TC es exactamente el tipo de trabajo que nadie quiere hacer dos veces. Pero la pregunta que este artículo no responde es la única que decide la adopción: ¿aporta el alineamiento adversarial algo que un nnU-Net entrenado con ambas modalidades mezcladas no aporte ya? Una sola fila más en la tabla II lo zanjaría. Mientras falte, el lector no puede separar el efecto del método del efecto de las 4 604 exploraciones.

Para los clínicos, nada hoy. El código y los pesos se anuncian «tras la aceptación», es decir, no disponibles, y el propio preprint está bajo licencia CC BY-NC-ND, que prohíbe las obras derivadas y el uso comercial. No hay validación prospectiva, ni lectura por radiólogos de los contornos producidos, ni medida del tiempo necesario para corregirlos. La pregunta de fondo — ¿es un contorno automático lo bastante bueno para que un operador gane tiempo en lugar de perderlo? — no se plantea, aunque sea el verdadero criterio de adopción y sepamos medirla, como han hecho otros trabajos sobre la carga de trabajo del operador.

Para los pacientes y el público, una distinción útil: segmentar no es diagnosticar. Un Dice del 87 % no significa «87 % de diagnósticos correctos», significa que el contorno trazado por la máquina se solapa en un 87 % con el trazado por un humano. Es fontanería, imprescindible e invisible, aguas arriba de todo lo demás. La pregunta interesante para un paciente en seguimiento por un quiste de páncreas no es el Dice del modelo, sino si el volumen medido este año es comparable al medido el año pasado en otra máquina — una cuestión de reproducibilidad que este artículo hace plausible sin medirla.

Para saber más

El preprint: Unified CT and MRI Pancreas Segmentation for Label-Efficient Cross-Modality Subregion Transfer, arXiv:2609.13043, depositado el 11 de septiembre de 2026 en cs.CV, DOI 10.48550/arXiv.2609.13043, bajo licencia CC BY-NC-ND 4.0. Autores: Ziliang Hong, Hongyi Pan, Halil Ertugrul Aktas, Andrea Bejar, Elif Keles, Frank H. Miller, Michael B. Wallace, Rajesh N. Keswani, Gorkem Durak y Ulas Bagci, departamento de radiología de Northwestern University, con la división de gastroenterología y hepatología de Northwestern y la de la Mayo Clinic de Florida.

Código y pesos: anunciados como publicados «tras la aceptación», por tanto no disponibles a día de hoy; no se indica ningún repositorio. Conjuntos públicos utilizados: AbdomenCT-1K, AMOS, BTCV, U-Mamba. Las condiciones de acceso a Cyst-X y al conjunto de «edema peripancreático» no se precisan en este manuscrito, y el conjunto privado de 1 888 RM no se comparte. No figura en el texto ninguna mención de aprobación por un comité de ética.

Financiación declarada: ayudas NIH U01-CA268808 y NHLBI R01-HL171376. No figura ninguna declaración de conflictos de interés en el manuscrito, pese a que dos de los autores son gastroenterólogos clínicos en ejercicio.

En el mismo terreno, los trabajos citados como antecedentes: DANN de Ganin y colegas para la inversión de gradiente, SIFA de Chen y colegas para la adaptación TC-RM, nnU-Net de Isensee y colegas para el esqueleto, y PaNSegNet del mismo grupo para el estado del arte en RM pancreática.