Percival, un modelo visión-lenguaje para la TC: lo que cambia el aprendizaje contrastivo con 436.787 exámenes del biobanco de Penn Medicine

Un equipo de la Universidad de Pensilvania entrenó Percival, un modelo que aprende a asociar tomografías 3D con sus informes radiológicos, con 436.787 exámenes del biobanco de Penn Medicine. Sus representaciones predicen diagnósticos y pronóstico mejor que dos modelos de comparación entrenados sin texto, pero la mejora es desigual: Percival es el mejor de los cuatro enfoques solo en 279 de los 702 diagnósticos evaluados en la TC torácica. Conviene leerlo como un modelo de investigación prometedor, validado casi únicamente dentro de un solo sistema hospitalario.

El contexto

Una tomografía computarizada (TC) es un volumen tridimensional de millones de puntos. Los modelos de IA que la analizan suelen entrenarse para una tarea estrecha: detectar un nódulo pulmonar, segmentar el hígado, medir el calcio coronario. Cada tarea exige anotaciones de expertos, costosas de producir.

Una alternativa reciente es construir un foundation model (modelo de base): un modelo grande entrenado una sola vez, sin una tarea concreta, cuyas representaciones internas sirven luego de punto de partida para muchas aplicaciones. Para la TC existían dos familias. Los modelos «solo visión», como CT-FM, aprenden únicamente de las imágenes. Los modelos de segmentación multiorgánica, como TotalSegmentator, se entrenan para delimitar decenas de estructuras anatómicas. Percival explora una tercera vía: usar como supervisión gratuita el informe que el radiólogo ya redactó para cada examen. Es la idea de CLIP, trasladada a la imagen médica 3D.

El método

Percival es un modelo visión-lenguaje (VLM) de dos ramas. La rama de imagen es un vision transformer (ViT), una arquitectura que divide la imagen en pequeños bloques y aprende cómo se relacionan entre sí. Aquí los bloques son cubos de 16 x 16 x 8 vóxeles (un vóxel es el píxel de un volumen 3D), sobre tomografías normalizadas a 352 x 352 píxeles en el plano y 128 cortes. Existen tres tamaños: Tiny (6 millones de parámetros), Small (22 millones) y Base (86 millones). La rama de texto es CXR-BERT, un modelo de lenguaje preentrenado con textos de radiología.

El entrenamiento es contrastivo: para cada lote de exámenes, el modelo debe acercar en un espacio matemático común cada tomografía y su propio informe, y alejar los pares que no se corresponden. Nunca se le dijo «busca un cáncer de páncreas»; solo aprende lo que distingue un examen de otro, apoyándose en lo que escribieron los radiólogos.

Los datos proceden del Penn Medicine BioBank (PMBB), que reúne varios hospitales de ese sistema asistencial: 436.787 volúmenes de 51.966 participantes para el entrenamiento, 123.603 volúmenes de 20.599 participantes para la validación, es decir, 72.565 participantes en total. La separación parece hacerse a nivel de participante, lo que limita la fuga de datos entre ambos conjuntos. Los exámenes abarcan varias regiones anatómicas, fases de contraste y tipos de escáner.

Después, el modelo se congela y se evalúa mediante sonda lineal: solo se entrena un clasificador muy simple sobre sus representaciones. Si ese clasificador funciona bien, es que la información útil ya estaba en las representaciones. Las «etiquetas» son phecodes, agrupaciones de códigos diagnósticos de la historia clínica electrónica: 702 para la TC torácica y 624 para la TC de abdomen-pelvis.

Los resultados

Métricas de ML. En la TC torácica, el AUC medio (la probabilidad de que el modelo clasifique un caso positivo por encima de uno negativo elegido al azar) es de 0,84 para las enfermedades circulatorias, 0,83 para las respiratorias y 0,84 para las neoplásicas, con grandes diferencias entre diagnósticos (de 0,65 a 0,98 en las circulatorias). Algunos ejemplos: aterosclerosis coronaria 0,85 (frente a 0,79 de TotalSegmentator), cáncer de páncreas 0,91 (frente a 0,84), insuficiencia cardiaca con fracción de eyección preservada 0,91.

El recuento por diagnóstico es más informativo que los promedios. De los 702 phecodes torácicos, Percival supera a un simple modelo demográfico (edad, sexo) en 555, a CT-FM en 512 y a TotalSegmentator en 315, alrededor del 45 %. Es el mejor de los cuatro enfoques en 279 diagnósticos. En abdomen-pelvis las cifras son parecidas: 511 de 624, 442 y 272, y 230 diagnósticos en los que queda primero.

Para el pronóstico (modelos de Cox, que estiman el riesgo de un evento a lo largo del tiempo), el índice de concordancia (índice C; 0,5 = azar, 1 = ordenación perfecta de los pacientes según el tiempo hasta el evento) medio es de 0,68 en la TC torácica, frente a 0,65 de TotalSegmentator, 0,61 de CT-FM y 0,61 del modelo demográfico. En abdomen-pelvis: 0,70, 0,66, 0,63 y 0,62.

Otros análisis: 1.022 asociaciones significativas tras la corrección de Bonferroni entre representaciones y diagnósticos (PheWAS, un análisis a escala de todos los diagnósticos), y 113 asociaciones con 39 pruebas de laboratorio replicadas en una segunda cohorte. En cambio, la predicción directa de valores de laboratorio sigue siendo débil: R² medio de 0,04 en 64 mediciones (el R² es la parte de la varianza explicada), con máximos para la albúmina (0,40) y la hemoglobina (0,30). En la validación externa, el conjunto público CT-RATE (1.564 TC torácicas, 18 etiquetas), los autores describen un rendimiento «comparable» al de un modelo entrenado en ese dominio.

Traducción clínica. Un AUC de 0,84 no dice nada por sí solo sobre el número de falsos positivos: depende de la frecuencia del diagnóstico y del umbral elegido. Ejemplo puramente ilustrativo: para una enfermedad presente en el 1 % de los pacientes, un umbral con 90 % de sensibilidad y 90 % de especificidad señalaría, de cada 1.000 pacientes, a 9 de los 10 enfermos, se le escaparía 1 y generaría 99 falsas alarmas. Los resultados aquí descritos no aportan este tipo de cifra, algo normal en un modelo de representación, pero que limita la interpretación clínica.

Nota sobre las fuentes: estas cifras proceden de la versión preprint (medRxiv, versión 5). La versión publicada en npj Digital Medicine el 29 de septiembre de 2026 no pudo leerse en texto completo para este análisis; son posibles diferencias.

Lo que está bien

Una escala poco frecuente en imagen 3D. Más de 436.000 tomografías emparejadas con su informe, en varios hospitales, regiones anatómicas y protocolos, cuando muchos modelos de TC se entrenan con unos pocos miles de exámenes de un solo tipo.

Una evaluación amplia y sincera sobre el número de victorias. Los autores evalúan 702 y 624 diagnósticos en lugar de escoger tres enfermedades favorables, y el artículo permite ver que el modelo no gana en todas partes. Los PheWAS se corrigen por comparaciones múltiples, y la replicación de las asociaciones con el laboratorio en una segunda cohorte (113 de 153) es un control útil.

Una apertura concreta. El código, los pesos de los tres tamaños, el entrenamiento y los clasificadores posteriores están publicados en GitHub y Hugging Face; en mayo de 2026 salió una versión 2.0. El repositorio prevé también la evaluación en CT-RATE, lo que facilita reproducirla con datos públicos.

Lo que no está tan bien

Sesgo de población y validación externa escasa. Los datos proceden de un solo sistema de salud estadounidense, y la única validación externa descrita es torácica (1.564 TC), aunque los resultados abarcan también la TC de abdomen-pelvis y más de 1.300 diagnósticos. Los propios autores señalan la ausencia de cohortes públicas con datos de laboratorio y diagnósticos longitudinales. La demografía detallada y los criterios de exclusión no figuran en los extractos que pudimos consultar.

Shortcut learning y fuga a través del lenguaje. El modelo se entrena para alinearse con el texto de los radiólogos. Los autores reconocen que no se puede separar lo que proviene de la imagen de lo que proviene del vocabulario de los informes. Los informes describen sobre todo exámenes normales, y un único informe resume a veces varios volúmenes de una misma visita. Se suman dos riesgos: el sesgo de evento índice (los exámenes se piden porque se sospecha un problema, de modo que los diagnósticos próximos al examen ya se conocen en parte) y etiquetas derivadas de códigos de la historia clínica y no de diagnósticos adjudicados.

Comparadores y métricas que limitan el alcance. Los comparadores son otros paradigmas (solo visión, segmentación), no otros modelos visión-lenguaje para TC; y la mejora pronóstica media (índice C de 0,68 frente a 0,65 de TotalSegmentator) es modesta. No se precisa el seguimiento (censura en el último contacto del registro), no aparecen razones de riesgo y se dan pocos intervalos de confianza. Por último, la licencia del código es CC BY-NC 4.0, no comercial, lo que impide su uso en producción sin un acuerdo aparte. En cuanto a la financiación: NIH y fundaciones de Penn Medicine; un autor declara actividades de consultoría con laboratorios farmacéuticos.

Qué cambia esto

Para la comunidad investigadora, Percival ofrece un punto de partida público y documentado para los modelos de TC alineados con texto, con un protocolo de evaluación a gran escala y clasificadores ya publicados. Los próximos estudios deberán probar la transferibilidad a otros hospitales y comparar Percival con otros modelos visión-lenguaje.

Para los clínicos, hoy no cambia nada: es una herramienta de investigación, sin validación prospectiva ni estatus regulatorio. A largo plazo, extraer una señal de riesgo de una TC realizada por otro motivo (la llamada lectura «oportunista») es plausible, pero habrá que demostrar un beneficio para el paciente, y no solo un AUC.

Para los pacientes y el público, el mensaje es prudente: una TC contiene más información de la que retiene un informe, y los modelos empiezan a aprovecharla. Que esa información mejore la atención está aún por demostrar, hospital por hospital.

Para saber más

El artículo (versión publicada): Generalizable CT vision-language modeling for population health and disease risk, Cameron A. Beeche, Joonghyun Kim, Walter R. Witschey et al. (University of Pennsylvania), npj Digital Medicine, 29 de septiembre de 2026, DOI 10.1038/s41746-026-03257-2. Preprint: medRxiv, versión 5. Código y pesos: github.com/cams2b/percival (CC BY-NC 4.0).

Sobre el alineamiento contrastivo entre dos modalidades, véase nuestro análisis sobre el ECG y la RM cardiaca en la enfermedad de Chagas. Sobre la fiabilidad de los codificadores de imagen, véase nuestro análisis de CRS-Bench.