Seno maxilar en CBCT: cuando el texto y la etiqueta salen del mismo LLM, el AUC cae de 1,00 a 0,84
Tres investigadores de Queen Mary University of London y de King Abdulaziz University comparan, sobre los mismos 300 cortes de escáner dental, ocho redes de visión, siete modelos de lenguaje y cinco modelos visión-lenguaje en una tarea binaria: ¿este seno maxilar es normal o patológico? Los modelos de lenguaje alcanzan un AUC de 0,99 a 1,00 — hasta que un radiólogo relee los 297 casos, reclasifica 62 (21 %) y devuelve esos mismos modelos a 0,84–0,85, mientras que las redes de visión no se mueven. El artículo está construido para producir exactamente esta demostración: cuando el texto de entrenamiento y la etiqueta provienen del mismo modelo de lenguaje, el rendimiento mide la coherencia de una máquina consigo misma, no un contenido diagnóstico.
El contexto
El CBCT (cone-beam computed tomography, tomografía computarizada de haz cónico) es el escáner de rutina de la consulta dental: una adquisición 3D de dosis reducida usada para planificar un implante, preparar un tratamiento endodóntico o una cirugía maxilofacial. Su campo de visión capta casi siempre los senos maxilares, las cavidades aéreas situadas encima de los molares superiores. Por eso aparecen con regularidad anomalías que nadie buscaba: engrosamiento mucoso, pseudoquiste de retención, opacificación parcial, nivel hidroaéreo. Estos hallazgos incidentales no son triviales — condicionan la decisión de colocar un implante posterior o de realizar una elevación de seno. Pero su notificación depende por completo del operador y consume tiempo.
De ahí el impulso a automatizar. Hasta ahora, la literatura sobre CBCT dental ha evaluado sobre todo redes convolucionales de una sola modalidad. Los autores — Seba Al-Hebshi, Hanadi Khalifa y Tuan D. Pham — declaran haber buscado en PubMed de enero de 2015 a julio de 2026 y no haber encontrado ningún estudio que comparase, sobre un mismo conjunto de datos y con validación cruzada idéntica, las tres familias: solo imagen, solo texto y visión-lenguaje.
Pero el interés real de este preprint está en otra parte, y va mucho más allá del seno maxilar. Una práctica se está extendiendo con rapidez en la investigación de IA en salud: hacer que un gran modelo de lenguaje produzca las descripciones textuales — y a veces las etiquetas — necesarias para entrenar otros modelos, ante la falta de anotación humana suficiente. Este artículo construye un protocolo para medir lo que cuesta esa práctica. La respuesta está cifrada, y es brutal.
El método
Los datos. El conjunto es MMDental, publicado en Scientific Data en 2025 y disponible libremente en Figshare bajo licencia CC-BY. Los autores extraen 300 cortes sagitales medios — una sola imagen 2D por caso, sin volumen 3D. La fuente es un único hospital en China (aprobación ética del comité de la Universidad de Lishui, n.º 2022YR014). El número de pacientes nunca se indica: los casos se designan mediante identificadores de imagen. La tarea es binaria: «anormal» abarca engrosamiento mucoso, pseudoquiste de retención, opacificación y nivel hidroaéreo; «normal» designa un seno bien aireado con paredes íntegras.
La fábrica de etiquetas — el núcleo del diseño. Cada imagen se somete tres veces de forma independiente a ChatGPT, con una instrucción detallada que le pide actuar como radiólogo maxilofacial y describir lateralidad, localización, gravedad y relación con los dientes adyacentes. Las tres lecturas se fusionan por voto mayoritario en una descripción representativa con una etiqueta provisional. Esa descripción y la imagen se entregan después a una radióloga (una de las autoras), que emite su propio diagnóstico, revisado además por un prostodoncista del equipo. Se excluyen tres casos por insuficientes: quedan 297 casos, 146 normales y 151 anormales.
El protocolo compara entonces tres condiciones sobre los mismos pliegues: Raw (n = 300, etiquetas de ChatGPT), Pre (n = 297, etiquetas provisionales de ChatGPT) y Post (n = 297, etiquetas confirmadas por la radióloga). El punto decisivo: entre Pre y Post solo cambia la etiqueta. El texto de los hallazgos permanece rigurosamente idéntico. Cualquier diferencia de rendimiento es por tanto atribuible a la procedencia de la etiqueta y a nada más — ni a la arquitectura, ni al contenido de la imagen, ni a una reescritura del texto.
Los modelos. Ocho redes de visión preentrenadas en ImageNet y afinadas para la tarea: ResNet-50, DenseNet-121, EfficientNet-B0, GoogLeNet, AlexNet, NASNet-Large, PNASNet-5-Large y ViT-B/16 (AdamW, tasa de aprendizaje 10⁻⁴, hasta 50 épocas, lotes de 16, semilla 42). Siete modelos de lenguaje entrenados solo sobre el campo de hallazgos, despojado de la línea explícita de clasificación: BiLSTM, TextCNN, BERT-base, RoBERTa-base, DistilBERT, BioBERT y Bio_ClinicalBERT. Cinco modelos visión-lenguaje mediante sonda lineal (linear probing: se congela el codificador, se extrae un vector de representación y solo se entrena una regresión logística encima): CLIP ViT-B/16, BiomedCLIP, Qwen2.5-VL-7B, MedGemma-4B y LLaVA-Med v1.5, con sondas de solo imagen, solo texto e imagen+texto cuando la arquitectura lo permite.
La evaluación. Validación cruzada estratificada de 10 pliegues, con la misma asignación de pliegues para todos los brazos y ambas condiciones de etiquetado. Medias por pliegue ± desviación típica, intervalos de confianza del 95 % por la distribución t de Student, matrices de confusión agregadas. Grad-CAM para la interpretabilidad de las redes convolucionales.
Los resultados
Visión: honesta y estable. En las ocho arquitecturas, el AUC — el área bajo la curva ROC, es decir, la probabilidad de que el modelo puntúe más alto un seno patológico tomado al azar que uno sano — va de 0,799 a 0,880. PNASNet-5-Large encabeza (0,880, IC 95 % 0,850–0,910), seguido de DenseNet-121 y EfficientNet-B0 (0,863 cada uno). EfficientNet-B0 ofrece el perfil más equilibrado: exactitud 0,800, sensibilidad 0,787, especificidad 0,813. ViT-B/16 se descuelga claramente (exactitud 0,700, AUC 0,799) con una asimetría reveladora: especificidad 0,860 pero sensibilidad 0,540, es decir 69 senos patológicos clasificados como normales. Es la firma esperable de una arquitectura ávida de datos entrenada con unos pocos cientos de imágenes.
Lenguaje: el techo sospechoso. Los siete modelos de texto alcanzan de 0,977 a 0,993 de exactitud y de 0,992 a 1,000 de AUC. Bio_ClinicalBERT logra un AUC perfecto de 1,000; BERT-base, DistilBERT y BioBERT llegan a 0,993 de exactitud, dos errores sobre 300. Un texto radiológico bien redactado puede efectivamente ser más fácil de clasificar que una imagen — pero una puntuación perfecta en una tarea clínica debería disparar siempre una verificación.
La prueba de procedencia. Aquí es donde el artículo se gana su interés. La radióloga reclasificó 62 de 297 casos, el 21 %, casi a partes iguales: 32 infravaloraciones (ChatGPT lee «normal» donde la radióloga ve una anomalía, casi siempre un engrosamiento mucoso leve) y 30 sobrevaloraciones. Al reentrenar con esas etiquetas corregidas, con el texto de entrada intacto:
- Los modelos de lenguaje se desploman. BERT-base pasa de 0,999 a 0,837. RoBERTa-base de 1,000 a 0,853. Todos caen, sin excepción.
- Las sondas textuales de los VLM también. CLIP ViT-B/16 en solo texto: 0,999 → 0,841. MedGemma-4B en imagen+texto: 1,000 → 0,892.
- Los modelos de visión no se inmutan. Seis de los ocho mejoran ligeramente (+0,006 a +0,030): DenseNet-121 sube de 0,867 a 0,891, PNASNet-5-Large de 0,857 a 0,887. EfficientNet-B0 queda igual (−0,003), ViT-B/16 retrocede un poco (−0,027).
- Las sondas de solo imagen de los VLM apenas se mueven. MedGemma-4B: 0,875 → 0,835. Qwen2.5-VL: 0,741 → 0,723.
La lectura no admite ambigüedad. El texto producido por ChatGPT no codificaba contenido diagnóstico: codificaba la etiqueta que ChatGPT se había asignado a sí mismo. Los modelos de lenguaje no aprendían a leer un seno, aprendían a recuperar la conclusión de otro modelo a partir de su propia formulación. Es una fuga de etiqueta por circularidad — una variante de la fuga de datos clásica, en la que la información sobre la diana no se escapa por los pacientes sino por el propio proceso de anotación. Corregir el 21 % de las etiquetas basta para perder 0,15 puntos de AUC. Las imágenes, en cambio, portaban una señal real: su rendimiento no depende de quién escribió la etiqueta, e incluso mejora cuando esta se vuelve más exacta.
La redacción generativa. Un brazo exploratorio pide a Qwen2.5-VL-7B, MedGemma-4B y LLaVA-Med v1.5 que produzcan un informe estructurado. Qwen genera las notas más largas (161 palabras de media frente a 78 y 88) y el 66 % de ellas termina sin puntuación final, señal de haber topado con el límite de generación. Sobre todo, entre los casos anormales cuya entrada no precisaba el lado, Qwen inventa una lateralidad en 17 de 150 casos (11 %), MedGemma en 4 de 150 (3 %), LLaVA-Med en ninguno. MedGemma reproduce además una plantilla clínica sin rellenar, con campos vacíos incluidos, en 200 de 300 notas (67 %).
Traducción clínica. Sobre 1 000 senos leídos por el mejor modelo de imagen (EfficientNet-B0, sensibilidad 0,787 / especificidad 0,813, con una prevalencia de anomalía del 51 %), se pasarían por alto unos 109 senos patológicos y se señalarían erróneamente unos 92 sanos. A escala de consulta sigue siendo una herramienta de prelectura, no de decisión. Y en la redacción automática de informes, una lateralidad inventada una vez de cada nueve es descalificante: un lado equivocado en un informe de seno es potencialmente una elevación de seno en el lado equivocado.
Lo que está bien
1. El protocolo aísla exactamente la variable que importa. Mismos pliegues, misma semilla (42), mismo texto, solo cambia la etiqueta entre Pre y Post. Es un experimento controlado en sentido estricto, y produce un resultado que no puede atribuirse a otra cosa. La literatura de IA en salud está llena de efectos confundidos; este no lo está.
2. El artículo documenta el mecanismo por el que podría haberse engañado. Los autores eliminaron la línea «Classification: normal/abnormal» del texto de entrada — la precaución correcta — y aun así obtuvieron un AUC de 1,000. Entonces fueron a buscar por qué, en lugar de publicar la cifra. Sin el brazo Post, este preprint sería un artículo más anunciando un AUC perfecto en radiología dental. Es el gesto contrario al que premia la carrera de los benchmarks.
3. La transparencia material es real. Código público en GitHub (sinus-cbct-benchmark, commit 32d5595 del 8 de agosto de 2026), conjunto de datos público bajo CC-BY, textos generados por ChatGPT y textos de la radióloga puestos a disposición, preprint bajo CC BY 4.0, sin financiación, sin conflictos de interés declarados. Grad-CAM se usa con honestidad: los autores muestran que AlexNet, en un caso correctamente clasificado, concentra su activación en la dentición y no en la cavidad sinusal — un caso de manual de aprendizaje por atajo, que comentan señalando que «una predicción correcta y una razón correcta para producirla no son lo mismo».
Lo que está menos bien
1. El patrón de referencia sigue contaminado por lo que el artículo denuncia. La radióloga no releyó las imágenes a ciegas: recibió la imagen junto con la descripción de ChatGPT. Un sesgo de anclaje es por tanto estructuralmente posible — y los autores lo reconocen («el patrón de referencia se derivó en parte de lecturas por LLM antes de la confirmación radiológica, lo que puede introducir un sesgo sistemático»). Hay una sola lectora, sin segundo radiólogo independiente, de modo que no hay kappa ni ninguna medida de concordancia interobservador. La tasa de reclasificación del 21 % es por tanto probablemente un suelo: a ciegas sería verosímilmente mayor.
2. La base experimental es delgada y no estratificable. Trescientos cortes sagitales medios 2D de un único hospital en China, sin validación externa, sin validación prospectiva, sin conjunto de prueba reservado — todo descansa en la validación cruzada. No se describe cómo se eligió el corte sagital medio (¿automáticamente? ¿manualmente?), y la unidad de análisis es la imagen, no el paciente: como nunca se da el número de pacientes, no puede descartarse que cortes del mismo paciente caigan en pliegues distintos. Los autores no fusionaron los metadatos de MMDental, así que ningún análisis por subgrupos es posible: ni por sexo (el conjunto original declara 51,06 % de hombres), ni por edad, ni por gravedad. El origen étnico no consta en la fuente. Por último, la tarea binaria aplasta un continuo clínico: un engrosamiento mucoso de 2 mm y una opacificación completa caen en la misma casilla.
3. El aparato estadístico queda por debajo de la ambición del argumento. Ninguna prueba de significación — ni DeLong, ni prueba pareada, ni valor p en ninguna parte — cuando la tesis del artículo se apoya enteramente en diferencias entre condiciones. Ningún análisis de calibración (ni puntuación de Brier, ni error de calibración esperado, ni diagrama de fiabilidad), pese a que ChatGPT emitía un índice de confianza que nunca se aprovecha. La versión de ChatGPT utilizada no se precisa nunca — ni el modelo, ni la fecha, ni la temperatura, ni si fue por API o por interfaz: el resultado central del estudio no es, por tanto, exactamente reproducible. El brazo generativo es cualitativo y no puntuado, como dicen los autores. Y el resumen anuncia sondas de solo imagen a «0,63–0,69» de AUC mientras los resultados llegan hasta 0,874: el resumen describe solo los modelos contrastivos y generaliza mal.
Lo que cambia
Para la comunidad investigadora. Es el punto de aplicación más directo. La anotación por LLM se extiende porque es barata y escala; este artículo aporta el protocolo mínimo para comprobar que no ha fabricado un resultado vacío. La prueba cabe en una línea: reentrenar con etiquetas corregidas por un humano, texto de entrada intacto, pliegues idénticos, y comparar. Si el rendimiento se desploma, estaba midiendo la coherencia del LLM consigo mismo. Es barato, y debería convertirse en una exigencia de revisión para todo artículo cuyas etiquetas o descripciones sean de origen sintético. El corolario también es útil: aquí eran las imágenes las que portaban la señal, y su rendimiento mejoró ligeramente con mejores etiquetas. Una modalidad robusta al ruido de etiquetado es un indicio — no una prueba — de que aprende algo real.
Para los clínicos. Nada desplegable a corto plazo. Un AUC de 0,88 sobre un corte 2D de un solo centro no justifica ningún cambio de práctica, y la madurez regulatoria es nula — no es un dispositivo con marcado CE, ni un SaMD autorizado por la FDA, ni siquiera un prototipo validado clínicamente. El mensaje operativo es más bien defensivo: ante cualquier herramienta de redacción automática de informes, la lateralidad es lo primero que hay que verificar, porque es lo que los modelos inventan con más facilidad cuando falta la información — el 11 % de los casos en el modelo más verboso.
Para los pacientes y el público general. El resultado se resume fácil: cuando a una IA se la califica sobre un examen que ella misma redactó, casi siempre saca la máxima nota. Eso no dice nada de su competencia. Muchas cifras impresionantes publicadas en IA médica descansan sobre anotaciones automáticas que nadie ha contrastado con la realidad clínica. Aquí la comprobación se hizo: una radióloga corrigió una lectura de cada cinco, y la nota perfecta desapareció.
Para saber más
- El preprint: Al-Hebshi S., Khalifa H., Pham T. D., Vision and Language Models for Classifying Maxillary Sinus Disease on Cone-Beam Computed Tomography: A Transparent Multimodal Benchmark, medRxiv, publicado el 12 de agosto de 2026, DOI 10.64898/2026.08.11.26360189 — bajo licencia CC BY 4.0.
- El código: github.com/sebaalhebshi/sinus-cbct-benchmark (commit 32d5595, 8 de agosto de 2026). La licencia del repositorio no se precisa en el preprint.
- El conjunto de datos: Wang C., Zhang Y., Wu C. et al., MMDental — A multimodal dataset of tooth CBCT images with expert medical records, Scientific Data, 2025;12:1172, disponible en Figshare bajo CC-BY (DOI 10.6084/m9.figshare.28505276).
- Sobre los modelos evaluados: Qwen2.5-VL (arXiv:2502.13923), MedGemma (arXiv:2507.05201), LLaVA-Med (NeurIPS 2023), BiomedCLIP (NEJM AI, 2025;2:AIoa2400640).
- Sobre la prevalencia de hallazgos sinusales incidentales en CBCT: Rege I. et al., BMC Oral Health, 2012;12:30, y Dogan S. et al., Scientific Reports, 2024;14:15529.
Tatakoto no ofrece consejo clínico individual. Este artículo describe y critica una publicación científica; no recomienda ninguna herramienta ni ninguna conducta diagnóstica.