Un solo modelo para todo el PSMA PET/TC: informe, preguntas y respuestas y segmentación — con etiquetas de evaluación escritas por Gemini

Catorce autores, encabezados por la University of Florida, ensamblan un único modelo visión-lenguaje que redacta el informe de un PSMA PET/TC, responde preguntas sobre él y segmenta las lesiones, entrenado con 5 747 estudios internos y con el subconjunto PSMA de AutoPET. Supera a sus comparadores en todo: BLEU 36,2 frente a 27,4 de PET2REP, 83,6 % de aciertos en preguntas de opción múltiple frente a 70,9 %, Dice lesional 0,588 frente a 0,550 de nnUNet. Pero las 10 274 preguntas del conjunto de test fueron escritas y después verificadas por Gemini-2.5-Pro sin que ningún humano las revisara, ningún médico nuclear leyó una sola salida del modelo, y el anclaje a nivel de vóxel que reivindica el resumen no está —según reconocen los propios autores— ni entrenado ni evaluado.

El contexto

El PSMA PET/TC se ha convertido en pocos años en la exploración pivote del cáncer de próstata. La sigla designa el prostate-specific membrane antigen, una proteína masivamente sobreexpresada en la superficie de las células prostáticas cancerosas. Se inyecta al paciente una molécula que se fija a ella, marcada con un isótopo emisor de positrones —aquí 18F-DCFPyL— y la cámara PET muestra dónde se acumula el trazador, mientras la TC aporta la referencia anatómica. El resultado es un estudio de cuerpo entero mucho más sensible que la imagen convencional para la estadificación y la búsqueda de recidiva tras el tratamiento.

Esa sensibilidad tiene un coste de lectura. Un solo estudio puede contener decenas de focos dispersos desde la pelvis hasta el esqueleto axial, y el médico debe separar las lesiones de las captaciones fisiológicas: el trazador se fija normalmente en riñones, vejiga, hígado, bazo y glándulas salivales, a veces con más intensidad que una metástasis. La lectura consume tiempo y su reproducibilidad entre lectores no es perfecta.

La IA aplicada a esta modalidad ha avanzado hasta ahora por tareas separadas: modelos de segmentación que delimitan lesiones —el reto público AutoPET estructuró ese trabajo—, modelos de generación de informes como PET2REP, y modelos de preguntas y respuestas visuales (VQA: formular una pregunta en lenguaje natural sobre una imagen y obtener una respuesta textual). Cada uno con sus datos, su pipeline y sus métricas. El argumento del artículo es arquitectónico: un lector humano no separa esos gestos, describe lo que ve y señala lo que describe. Un modelo único podría, por tanto, anclar su texto en los vóxeles que ha segmentado. Esa es la promesa; lo que sigue es comprobar si se cumple.

El método

Los datos de lenguaje. Una cohorte retrospectiva de la University of Florida: 5 747 estudios PSMA PET/TC de cuerpo entero realizados entre 2022 y 2025, todos con 18F-DCFPyL, con su informe clínico emparejado y convertido a JSON estructurado (fecha, sección findings, sección impression). Aprobación del IRB con exención de consentimiento. La partición es de 4 023 / 574 / 1 150 estudios para entrenamiento, validación y test, y el artículo precisa que se hace «at the case level», a nivel de estudio. No se reporta ningún dato demográfico: ni edad, ni PSA, ni estadio, ni indicación. Tampoco criterios de inclusión, ni número de pacientes distintos, ni equipos utilizados.

Los datos de segmentación. El subconjunto PSMA del reto AutoPET: 597 estudios en 378 pacientes varones del LMU University Hospital de Múnich, adquiridos entre 2014 y 2022, con máscaras de lesión anotadas manualmente en 3D sobre las imágenes PET. Partición a nivel de paciente esta vez: 419 / 59 / 119. Ambas cohortes reciben la misma normalización espacial: remuestreo a 2,73 × 2,73 × 2,8 mm, matriz fija de 256 × 256 × 400 vóxeles, campo de visión detenido en la parte alta de los muslos, PET convertido a SUV (standardized uptake value, la unidad que normaliza la captación por la dosis inyectada y el peso del paciente).

La arquitectura. El montaje sigue el esquema LLaVA, ya estándar en los modelos visión-lenguaje. Un codificador de visión 3D (un vision transformer de dos canales, PET y TC) se preentrena primero de forma contrastiva al estilo CLIP: se enseña al modelo a acercar un volumen a su propio informe y a alejarlo de todos los demás. Un módulo de proyección MLP-Mixer comprime después la secuencia visual —demasiado larga en 3D para un modelo de lenguaje— en 512 tokens de dimensión 2 048. Esos tokens entran en un modelo de lenguaje ajustado con LoRA (low-rank adaptation: se congelan los pesos originales y solo se entrenan pequeñas matrices adicionales, aquí de rango 128). Por último, una rama de segmentación 3D tipo nnUNet recibe, mediante un token especial [SEG] y un mecanismo de atención cruzada tomado de LISA, el estado interno del modelo de lenguaje: el puente que debería unir texto y vóxeles. Se añade una supervisión anatómica auxiliar derivada de TotalSegmentator sobre diez grupos de órganos (riñones, vejiga, hígado, bazo, cerebro, pulmones, corazón, próstata, estómago, glándulas salivales) para enseñar al modelo a no confundir captación fisiológica con enfermedad.

Conviene señalar de inmediato un punto: el modelo de lenguaje empleado nunca se nombra. Ni su fabricante, ni su tamaño, ni su versión. La figura de arquitectura dice «LLM Backbone» y el texto no añade nada.

Cómo se construyeron las preguntas. Este es el punto metodológico decisivo. El conjunto de VQA no lo escribieron médicos: fue generado por la API de Gemini-2.5-Pro a partir de los informes anonimizados, con una receta tomada de CT-CHAT. Nueve ítems por estudio —tres de descripción, tres de opción múltiple, tres de respuesta libre— sobre temas impuestos: presencia de enfermedad, distribución, recidiva local en el lecho prostático, adenopatías pélvicas y extrapélvicas, metástasis. Una segunda pasada pide al mismo modelo que verifique que cada respuesta está respaldada por el informe, identificando el pasaje justificativo; los ítems no conformes se rechazan o se regeneran. Quedan 35 838 preguntas de entrenamiento, 5 166 de validación y 10 274 de test. No se reporta ninguna revisión humana en ninguna etapa.

El entrenamiento se desarrolla en cuatro etapas: preentrenamiento contrastivo del codificador de visión; alineamiento únicamente de la capa de proyección, con visión y lenguaje congelados; ajuste fino de la rama visión-lenguaje en informe y VQA; y ajuste multitarea final donde texto y segmentación se optimizan conjuntamente, con pérdida autorregresiva por un lado y entropía cruzada más Dice por el otro. El hardware se detalla (ocho GPU NVIDIA B200, PyTorch 2.7) pero ningún hiperparámetro: ni tasa de aprendizaje, ni tamaño de lote, ni número de épocas, ni ponderación entre tareas. Solo se da el optimizador, AdamW.

Los resultados

Recuperación imagen-texto. El codificador preentrenado se evalúa primero solo, por su capacidad de encontrar el informe correcto a partir de un volumen. En los 1 150 estudios de test, el informe correcto aparece entre los 100 primeros resultados en el 35,6 % de los casos [IC 95 %: 32,6–38,3], frente al 14,2 % de un CT-CLIP entrenado solo con TC y al 7,5 % del azar. La diferencia es clara y está medida con limpieza: el preentrenamiento específico PET/TC aporta algo real.

Generación de informes. El modelo propuesto obtiene ROUGE 23,4, BLEU 36,2, METEOR 19,6, CIDEr 3,13 y BERTScore 86,1. Los comparadores son PET2REP (ROUGE 16,7, BLEU 27,4, METEOR 17,0, CIDEr 0,53, BERTScore 84,2) y MedVL-SAM2, una base multimodal que solo ve la TC (ROUGE 12,5, BLEU 9,1, CIDEr 0,015). Todos los intervalos de confianza bootstrap son disjuntos. Pero hay que saber qué miden estas métricas: BLEU, ROUGE, METEOR y CIDEr cuentan solapamientos de secuencias de palabras entre el texto generado y el de referencia. No dicen nada sobre la exactitud diagnóstica. Un informe que escribe «sin lesión ósea» donde la referencia escribe «lesión ósea» pierde dos palabras de cada cien en BLEU, y un paciente en la clínica. No se reporta ninguna métrica clínica de exactitud factual —RadGraph F1, GREEN, RaTEScore, hoy disponibles para este tipo de evaluación—. El BERTScore no lo es: mide proximidad semántica, no verdad.

VQA. En las preguntas de opción múltiple el modelo alcanza un 83,60 % de aciertos [82,39–84,87] frente al 70,89 % [69,29–72,39] de MedVL-SAM2. En respuesta libre, el CIDEr pasa de 17,5 a 91,6. Traducción: una pregunta de opción múltiple de cada seis sigue siendo errónea, sobre un conjunto cuya dificultad fue fijada por otro modelo de lenguaje.

Segmentación. El Dice —la medida de solapamiento entre volumen predicho y volumen anotado— alcanza 0,5875 [0,5426–0,6314] en la variante guiada por lenguaje, 0,5858 en la variante semántica, frente a 0,5498 [0,4962–0,6012] de nnUNet y 0,4653 de SegAnyPET. Los autores añaden tres F1 a nivel de lesión con tres criterios de emparejamiento: solapamiento simple (0,736 frente a 0,653 de nnUNet), cobertura del vóxel de SUV máximo (0,727 frente a 0,637) y Dice lesional superior a 0,5 (0,593 frente a 0,492).

En términos clínicos. Un F1 lesional de 0,736 con el criterio más permisivo significa que aproximadamente una cuarta parte de las lesiones contadas están o bien omitidas o bien inventadas. Un Dice de 0,59 significa que el volumen delimitado solo cubre el 59 % del volumen real: utilizable para una detección simple, no para una dosimetría de terapia con radioligandos de lutecio-177, donde el volumen tumoral condiciona la dosis. Y en el Dice concretamente, el intervalo de confianza del modelo propuesto se solapa ampliamente con el de nnUNet: la ganancia de 0,038 puntos no está establecida. No se reporta ningún test estadístico pareado en todo el artículo: la sección estadística se limita a intervalos bootstrap, cuyo número de remuestreos no se precisa.

Lo que está bien

El preentrenamiento contrastivo PET/TC se justifica con una medición, no con una intuición. Los autores podrían haberse limitado a afirmar que un codificador específico supera a uno de TC reciclado. Lo demuestran en una tarea intermedia, la recuperación imagen-texto, con un comparador pertinente (CT-CLIP) y un suelo explícito (el azar). CT-CLIP resulta estar apenas por encima del azar en recuperación texto-imagen, lo que en sí mismo es un resultado útil para la comunidad: reutilizar un codificador de TC en medicina nuclear no funciona.

Las métricas de segmentación están elegidas con honestidad. El Dice global es una mala medida en PET PSMA porque está dominado por las escasas lesiones grandes e ignora los focos pequeños que sí cambian la estadificación. Reportar tres F1 a nivel de lesión, uno de ellos anclado en el vóxel de SUV máximo, es el reflejo correcto. Y los tres criterios se dan juntos, incluido el más severo, en el que la diferencia con nnUNet es mayor.

La supervisión anatómica apunta a un modo de fallo real. Añadir diez grupos de órganos de TotalSegmentator no es un adorno: la captación fisiológica renal, vesical y salival es la primera fuente de falsos positivos en la lectura PSMA. Dar al modelo un mapa anatómico para aprender a descartarlas responde a un problema identificado por los clínicos, no a una necesidad arquitectónica. Los autores enumeran además sus limitaciones principales sin adornos, y declaran su financiación (NIH R01EB034692 y R01AG078250) y la ausencia de conflicto de intereses.

Lo que está menos bien

La evaluación del VQA es circular. Esta es la limitación central. Gemini-2.5-Pro escribe las preguntas a partir de los informes y después Gemini-2.5-Pro verifica que sus propias respuestas están respaldadas por esos mismos informes. Las 10 274 preguntas de test constituyen la verdad de referencia, y ninguna fue revisada por un médico. Lo que mide el 83,6 % es, por tanto, la concordancia entre un modelo entrenado y otro modelo juzgando sus propias producciones. Falta además el control que zanjaría la cuestión: ninguna referencia ciega a la imagen. Una pregunta de opción múltiple derivada de un informe suele ser adivinable sin la imagen, por coherencia interna o por distribución de respuestas: es un caso de manual de shortcut learning, en el que el modelo aprende la correlación espuria en vez de la tarea. Mientras no se pase por el mismo conjunto un modelo de lenguaje solo, privado de toda imagen, no se sabe qué parte del 83,6 % procede de leer el PET.

No hay ninguna validación externa, y la partición deja la puerta abierta a una fuga de datos. Las tres tareas de lenguaje se entrenan y se testean en la misma cohorte, un solo centro, un solo trazador, un solo periodo. Ningún otro hospital, ningún otro equipo, ninguna prueba con 68Ga-PSMA-11, muy utilizado en otras partes del mundo. Más preocupante: el artículo indica explícitamente una partición a nivel de estudio, no de paciente. Pero un hombre en seguimiento por cáncer de próstata se somete típicamente a varios PSMA PET/TC: estadificación inicial, control postratamiento, búsqueda de recidiva. Si el mismo paciente cae a ambos lados de la barrera, eso es data leakage en sentido estricto, y el rendimiento reportado es optimista en una cantidad desconocida. El artículo no da el número de pacientes distintos detrás de los 5 747 estudios, lo que impide incluso estimar la magnitud del riesgo. En cuanto a AutoPET, se usa en entrenamiento y en test: no es una validación externa, es una segunda fuente interna al pipeline. No se intenta ninguna prueba cruzada —entrenar en Florida, evaluar en Múnich—.

Ningún humano leyó una sola salida del modelo, y la promesa de anclaje no se pone a prueba. Ni estudio de lectores, ni análisis de errores, ni recuento de alucinaciones: los autores remiten explícitamente ese trabajo al futuro. Para un sistema cuya salida principal es un informe destinado a un médico, esa es la evaluación que falta, y ninguna métrica factual la sustituye. Sobre todo, el argumento que justifica la arquitectura unificada —el voxel-level grounding anunciado en el resumen— no existe en sentido fuerte, y los autores lo reconocen: los conjuntos de informes y de segmentación no están emparejados a nivel de caso, de modo que nada obliga a que una lesión segmentada se mencione en el texto ni a que una lesión descrita en el texto corresponda a una máscara. La tesis del artículo se afirma en el resumen y se invalida en la discusión.

A ello se suman carencias de reproducibilidad que no son detalles: el modelo de lenguaje no se nombra, no se da ningún hiperparámetro de entrenamiento y no hay ningún estudio de ablación sobre una arquitectura compuesta por cinco bloques distintos: es imposible saber qué aportan el MLP-Mixer, la supervisión de TotalSegmentator, la atención cruzada o el rango de LoRA. El código y los pesos no se publican, pese a una sección titulada «Code availability» que solo contiene números de versión de bibliotecas. Los datos internos están disponibles únicamente previa solicitud al autor correspondiente.

Lo que cambia

Para la comunidad investigadora, el artículo tiene valor de cartografía. Muestra que un montaje LLaVA estándar trasladado a PET/TC 3D se sostiene y supera a modelos monotarea en sus propias métricas, e identifica el cuello de botella con precisión: lo que falta no son arquitecturas sino conjuntos de datos donde el informe y las máscaras de lesión describan los mismos estudios. Mientras esas dos fuentes sigan disjuntas, el anclaje texto-vóxel seguirá siendo una promesa ilustrativa. La segunda lección es negativa e igual de útil: la generación de benchmarks de VQA mediante modelos de lenguaje, práctica ya habitual por su bajo coste, produce puntuaciones que nadie sabe interpretar sin una referencia ciega a la imagen y una muestra revisada por clínicos.

Para los clínicos, hoy no cambia nada. Ni estudio de lectores, ni validación externa, ni código, ni pesos, ni marcado regulatorio, un solo trazador. Lo que merece atención a tres o cinco años es la dirección: un asistente de lectura al que se puede preguntar y que responde mostrando los vóxeles en los que se apoya sería, a diferencia de una puntuación de detección opaca, verificable a pie de cama. Siempre que el anclaje esté realmente entrenado, y que alguien haya medido cuántas veces se equivoca.

Para los pacientes y el público general, la lección es de vocabulario. Un titular que anunciara que «la IA ya lee los PET de próstata mejor que los modelos existentes» sería literalmente exacto y prácticamente engañoso: el modelo supera a otros modelos en métricas de solapamiento de palabras y en preguntas escritas por otra IA, en un único hospital estadounidense. Ningún médico ha verificado todavía que uno solo de sus informes fuera correcto.

Para saber más

El preprint: A Unified Vision-Language Model for PSMA PET/CT Report Generation, Visual Question Answering, and Lesion Segmentation, arXiv:2609.15603, depositado el 14 de septiembre de 2026, licencia CC BY 4.0, 24 páginas. Autores: Yang Xing, Jiong Wu, Savas Ozdemir, Yang Zhou, Boxiao Yu, Ying Zhang, Zheren Zhu, Chenyu You, Wei Shao, Yang Lu, Kang Wang, Tinsu Pan, Yang Yang y Kuang Gong (correspondiente), por la University of Florida en Gainesville y Jacksonville, la University of California San Francisco, Stony Brook University y el UT MD Anderson Cancer Center. Financiación: NIH R01EB034692 y R01AG078250; sin conflicto de intereses declarado. Ni el código ni los pesos se publican; los datos internos están disponibles previa solicitud motivada al autor correspondiente. El conjunto de segmentación es público: AutoPET.

Sobre las mismas cuestiones, véanse nuestros decryptages sobre la segmentación UNETR del cáncer de próstata en PET/TC con PSMA y la predicción de supervivencia, sobre la evaluación clínica de los informes de patología generados, y sobre la circularidad de los benchmarks cuyas etiquetas escribe un modelo de lenguaje.