Análisis
Todos los análisis de publicaciones científicas en Tatakoto.
Lesiones cutáneas: 96 % de exactitud y 0,99 de AUC — sobre las tres cuartas partes de las imágenes que el modelo aceptó decidir
Dos autores combinan tres redes (MaxViT-Tiny, ConvNeXt-Tiny, EfficientNetV2-B0) con estimación de incertidumbre por MC Dropout para clasificar siete tipos de lesiones cutáneas en HAM10000, y anuncian 96 % de exactitud y 0,99 de AUC. Esas cifras se calculan tras descartar los casos inciertos: la tabla de resultados cubre 1 508 imágenes cuando un conjunto de prueba del 20 % contiene 2 003, es decir, cerca de una cuarta parte de los casos nunca decididos, una cobertura que el artículo no reporta nunca. La tasa de abstención no es uniforme: reconstruida clase por clase, alcanza alrededor de un tercio en el melanoma.
Sepsis en cuidados intensivos: un agente de aprendizaje por refuerzo que baja el tratamiento cuando sube el lactato, y al que las métricas estándar puntúan como el mejor
Dos ingenieros de Vanderbilt y Duke someten dos agentes de aprendizaje por refuerzo entrenados en MIMIC-III a una prueba sencilla: elevar artificialmente el lactato y observar hacia dónde se mueve el tratamiento recomendado. El modelo que mejor imita a los clínicos (MSE 0,0098) reduce la intensidad del tratamiento en torno a un 15 % cuando el lactato sube — correlación de Spearman de −0,67, lo contrario de lo que indica la Surviving Sepsis Campaign. El diagnóstico es acertado; la demostración se apoya en una única semilla aleatoria, sin intervalos de confianza, y el preprint nunca dice cuántos pacientes utilizó.
Ecografía tiroidea: una IA «agéntica» auditable evaluada en 35 centros, y las tres cifras que el resumen no dice
Catorce autores de la Universidad Sun Yat-sen, el Hospital Zhujiang y Zhejiang presentan ThyroidXAgent, un sistema que encadena segmentación del nódulo, clasificación benigno/maligno y redacción del informe ecográfico conservando cada salida intermedia como prueba corregible. La segmentación alcanza un Dice medio del 87,21 %; en 4 999 casos de 35 centros chinos independientes, el AUROC de clasificación cae a 0,819. El artículo nunca indica cómo se estableció el carácter benigno o maligno en sus conjuntos de prueba, la media de AUROC anunciada en el resumen (0,9466) no coincide con su propia tabla suplementaria (0,9001), y la palabra «sobrediagnóstico» no aparece ni una sola vez.
AMIE en videoconsulta: un sistema multiagente de Google supera a médicos de familia en un OSCE simulado, con la cámara de los médicos apagada
Google Research y Google DeepMind sometieron a AMIE a un examen clínico objetivo estructurado por vídeo: 100 escenarios, 15 actores profesionales y diez médicos de atención primaria estadounidenses como comparador. El diagnóstico principal es correcto en 0,91 de los casos frente a 0,77 de los médicos, y añadir vídeo eleva la puntuación de observación y exploración de 0,41 a 0,74. Pero el comparador humano debía mantener la cámara apagada, los cuadros clínicos se limitaron a lo que un actor puede representar, y los propios actores solo hallaron diferencia significativa en 2 de los 29 criterios que puntuaban.
Etiquetas derivadas de informes frente a relectura de imágenes: en la cardiomegalia de MIMIC-CXR, la concordancia es casi nula
Radiólogos releyeron 2.160 radiografías de tórax de MIMIC-CXR y compararon su lectura con las etiquetas extraídas automáticamente de los informes. Para la cardiomegalia, el kappa de Cohen es 0,011 y la etiqueta solo recupera el 1,3 % de los casos confirmados; el 94,8 % de los desacuerdos procede de una omisión en el informe, no de una negación. Sobre la cohorte reanotada por expertos, un DenseNet121 alcanza un ROC-AUC de 0,853. Una auditoría útil y honesta, pero limitada a un repositorio, un hallazgo y una cohorte artificialmente equilibrada.
Cinco patologías de la retina, "expertos" que se especializan: lo que revela un Mixture-of-Experts disperso en el fondo de ojo
Nagur Shareef Shaik y sus colegas proponen una arquitectura que no aplica el mismo cálculo a todas las imágenes del fondo de ojo: un enrutamiento "disperso" envía cada fotografía a un "experto" especializado según la patología presente. En cinco clases (ojo sano, retinopatía diabética, DMAE, membrana epirretiniana, glaucoma) con validación cruzada disjunta por paciente, el modelo alcanza un AUC macro de 0,912 y un F1 macro de 0,653, y sus expertos se especializan realmente por enfermedad (p < 0,001). Aportación elegante a la interpretabilidad, pero la brecha AUC/F1 y la ausencia de validación externa recuerdan que un mecanismo elegante todavía no es una herramienta de cribado.
Entrenar un modelo de historia clínica sin reunir jamás los datos: el aprendizaje federado puesto a prueba con 122 251 ingresos en cuidados intensivos
Michael Burkhart, Brett Beaulieu-Jones y colaboradores plantean una pregunta concreta: ¿se puede entrenar un «foundation model» de historia clínica sin reunir jamás en un mismo lugar los datos de varios hospitales? Con 122 251 ingresos en cuidados intensivos de tres sistemas de salud independientes y doce tareas de predicción, sus modelos generativos de eventos se transportan mucho mejor de un hospital a otro que los modelos clásicos (penalización de 0,025 puntos de AUC frente a 0,079), y el aprendizaje federado casi iguala al entrenamiento centralizado. Pero el hallazgo más útil es contraintuitivo: mancomunar los datos solo aporta una mejora modesta frente al entrenamiento puramente local, y esa ventaja se desvanece a medida que cada hospital acumula sus propios datos.
Predecir la anatomía del día antes de escanear: un «gemelo digital» para la protonterapia adaptativa de cabeza y cuello
Yizhou Wu, Yuheng Li, Xiaofeng Yang y Chih-Wei Chang proponen un gemelo digital que predice la anatomía de un paciente de cabeza y cuello el día del tratamiento, antes de adquirir imagen alguna, transfiriendo a su TC de planificación la forma en que otros pacientes cambiaron durante el tratamiento. En 88 pacientes, estas TC predichas se ajustan mejor a la anatomía real del día que la TC de planificación fija: +22,8 % de correlación de imagen, +20,2 % de solapamiento de órganos de riesgo, −23,4 % de error en los números CT. Anticipar la anatomía para acelerar la radioterapia adaptativa es una idea ingeniosa, pero la demostración se limita a métricas de semejanza de imagen y nunca evalúa la dosis administrada — la única magnitud que realmente decide el beneficio en protonterapia.
Representar a cada paciente como un grafo para saltarse la limpieza de datos: PatTree y su 98,5 % de precisión en la clasificación del Alzheimer
Cuatro investigadores proponen PatTree, un método que estructura automáticamente datos médicos heterogéneos —valores ausentes, modalidades múltiples, formatos incoherentes— en un único grafo de conocimiento por paciente, sin paso previo de armonización. En un subconjunto de la cohorte ADNI-1 (763 sujetos), clasificar directamente sobre este grafo alcanza un 98,5 % de precisión equilibrada y un F1 de 0,987 para distinguir enfermedad de Alzheimer, deterioro cognitivo leve y cognición normal. Evitar la armonización manual es una idea valiosa; pero una puntuación casi perfecta en una tarea reputadamente difícil, en una sola cohorte y sin validación externa, se lee primero como una alarma metodológica que investigar, no como una prueba.
Superresolución por IA en la resonancia cerebral: reconstruir cortes finos ¿borra o inventa pequeñas lesiones de la sustancia blanca?
Un equipo de la Universidad de Pensilvania comprueba si la superresolución por IA, aplicada a resonancias FLAIR de cortes gruesos antes de contar automáticamente las lesiones de la sustancia blanca, preserva esas lesiones. En 29 sujetos de ADNI degradados artificialmente, el peligro principal no es la alucinación temida de los modelos generativos, sino el borrado silencioso de pequeñas lesiones reales, más marcado cuanto más gruesos son los cortes. Toda reconstrucción sigue siendo mejor que el corte grueso en bruto; el modelo autosupervisado ECLARE preserva mejor la señal, mientras que un método de fundación por red implícita no supera a una simple interpolación cúbica. Muestra pequeña, degradación simulada: una alarma metodológica, no un veredicto clínico.
Hemorragia intraventricular: una «línea dorsal del tronco» en la TC, leída por un modelo de fundación tabular, para predecir la discapacidad a seis meses
Nueve hospitales chinos, 728 pacientes. Un equipo liderado por el Southwest Hospital (Army Medical University) propone la BSDL, un grado sencillo de compresión del tronco encefálico medido en la TC de ingreso, y lo entrega con otras ocho variables a TabICLv2, un modelo de fundación para datos tabulares, para predecir un mal desenlace a seis meses (mRS 4-6). AUC externa de 0,90 y buena calibración — pero la validación externa se apoya en solo 118 pacientes, todos chinos, retrospectiva, y la BSDL aún se gradúa a mano.
Reingresos y multimorbilidad: un modelo autosupervisado que aprende al paciente antes de conocer el desenlace
El consorcio AI-MULTIPLY (Newcastle, Queen Mary, Birmingham) construye Self-HR, un modelo que primero aprende a «resumir» las historias de 99 207 pacientes británicos con al menos dos enfermedades crónicas, y luego predice un reingreso urgente a 30 días. AUROC de 0,92, validación externa en 79 224 pacientes de una segunda base — pero la mayor parte de la señal viene del diagnóstico de ingreso, sobre una población poco representativa y sin validación prospectiva.
Casos raros en medicina: entrenar a un LLM para elegir la próxima acción, no solo el diagnóstico final
Un equipo de Ben-Gurión construye MedUPSQA, 21 874 puntos de decisión clínica «en curso» extraídos de 5 535 casos raros reales, y muestra que alinear un modelo de lenguaje con la próxima acción ayuda más que agrandarlo — siempre que se mire quién define la respuesta correcta.
ChatGPT Health en el triaje: más conversación no hace que el consejo sea más seguro
Un equipo de Mount Sinai evalúa ChatGPT Health en 255 casos de triaje reales y sintéticos. Conversar más no mejora la orientación y, cuando la IA se aparta del estándar de enfermería, subestima la urgencia casi siete de cada diez veces — con un subtriaje grave alrededor de una de cada diez.
Predecir el delirium en cuidados intensivos de un hospital a otro: qué se transfiere y qué no
Shengliang Ni y Kengo Sato (Institute of Science Tokyo) entrenan cinco familias de modelos para predecir el delirium en la UCI y luego los cambian de base de datos: de eICU (208 hospitales de EE. UU.) a MIMIC-IV (un único centro de Boston) y a la inversa. La ordenación de los pacientes por riesgo se transfiere bastante bien (AUROC externa de hasta 0,88–0,95 en un sentido), pero la calibración de las probabilidades y el umbral de alerta no la siguen. La aportación no es una cifra: es una distinción — la transportabilidad de un modelo clínico se descompone en capas que no viajan juntas.
Cuando un LLM clínico rellena mal las casillas: medir y luego reparar el cumplimiento de los esquemas ICD-10, CPT y FHIR
Jianru Shen (University of Montana) prueba tres LLMs de código abierto en 320 escenarios clínicos de diez especialidades, pidiéndoles salidas estructuradas conformes a los estándares ICD-10, CPT y HL7 FHIR. Sin salvaguarda, el cumplimiento de formato se estanca entre el 85,9% y el 91,6%. Un bucle de validación-reparación lo eleva al 99,0% en dos iteraciones, con cerca del 1% de casos derivados a un humano. Pero la métrica capta la corrección estructural, no la clínica: un código perfectamente bien formado puede seguir siendo médicamente incorrecto, y esa es la brecha que el artículo no cierra.
Operar o no un cáncer de páncreas: lo que un modelo multimodal TC + datos clínicos aprende realmente a triar
Un equipo de Basilea, Aarau y Londres entrena un modelo de deep learning que fusiona la TC 3D con 17 variables clínicas para clasificar a 159 pacientes con adenocarcinoma ductal de páncreas en las tres categorías de resecabilidad NCCN. El AUC alcanza 0,86 en validación cruzada y 0,86 en una cohorte externa independiente de 52 pacientes de Aarau. El modelo aprende una anatomía « consciente de los vasos » sin exigir una máscara en la inferencia. Pero la verdad de referencia es solo el consenso de un comité de tumores, la cohorte es pequeña y suiza, y ningún estudio compara el modelo con radiólogos.
Una semana de movimiento de la muñeca para predecir la enfermedad futura: lo que dos foundation models de acelerometría leen realmente en el UK Biobank
Un equipo de Stanford y Dinamarca codifica una semana de movimiento de la muñeca en 97 696 participantes del UK Biobank con dos foundation models congelados, y luego predice 390 enfermedades futuras con un solo modelo de supervivencia. La concordancia media es de 0,688, un único eje de « vigor » explica el 76 % del riesgo predicho, y emerge una firma prodrómica de la enfermedad de Parkinson (AUROC a cinco años de 0,90, 428 casos). Pero todo se apoya en una sola cohorte no representativa, sin validación externa, y los codificadores se preentrenaron con esos mismos datos.
Predecir antes de operar las cirugías de Mohs más pesadas: lo que treinta modelos de machine learning aprenden sobre todo del tamaño del tumor
Un equipo de Sídney entrena treinta algoritmos de machine learning para predecir, antes de la cirugía, si una cirugía micrográfica de Mohs necesitará 13 cortes de tejido o más — un umbral de « caso pesado » copiado del baremo de reembolso australiano. En 408 procedimientos de un solo centro, el mejor modelo alcanza un AUC de 0,884 en el test y un 81,7 % de exactitud. Pero el conjunto de test solo tiene 82 casos, no se realiza validación externa, y el análisis de importancia de variables muestra que el modelo repite sobre todo una evidencia: cuanto mayor es el tumor, más hay que cortar.
Cribar la apnea del sueño a partir de una simple foto de la cara: qué hace un sistema multimodal basado en un VLM, y por qué su « exactitud » adorna las cifras
Un equipo de Shanghái (Shanghai University of Engineering Science, Tencent Youtu Lab, hospital ORL de Fudan) propone EviOSAHS, un sistema que estima el riesgo de apnea del sueño orquestando, mediante prompts y sin entrenamiento, un modelo de visión-lenguaje y un LLM: descompone una foto de la cara en siete observaciones anatómicas estructuradas y luego decide añadiendo un perfil clínico. En 642 pacientes con polisomnografía, declara una exactitud del 88,47 % y una sensibilidad del 94,86 %. Pero la cohorte está desequilibrada (584 positivos frente a 58 negativos), la especificidad nunca se informa — se puede reconstruir en torno al 24 % — y un modelo « siempre positivo » superaría su exactitud.
Cáncer de pulmón en TC de baja dosis: ¿y si entrenáramos la IA con TC de dosis estándar «degradados» en lugar de con imágenes filtradas de ruido?
Un equipo del Politecnico di Milano pone a prueba una idea a contracorriente para el cribado del cáncer de pulmón: en vez de eliminar el ruido de las TC de baja dosis (LDCT), degradar las abundantes TC de dosis estándar (SDCT) en falsas imágenes de baja dosis para entrenar un clasificador de nódulos. Se comparan tres métodos de degradación sobre la base pública LIDC-IDRI. Hallazgo robusto: un modelo entrenado con dosis estándar se hunde con la baja dosis real (sensibilidad 0,571), mientras que las tres degradaciones restablecen un AUC superior a 0,84 — pero el orden entre ellas sigue siendo frágil.
Mezclar conjuntos de datos de mamografía no mejora la IA de cribado: cuando el modelo aprende la «firma» del dataset en lugar del cáncer
Un equipo de la Memorial University of Newfoundland pone a prueba una intuición extendida: completar un conjunto real de cribado mamográfico (NLBSD, 5997 exámenes, 1,29 % de casos sospechosos) con cánceres confirmados de bases públicas (CBIS-DDSM, CMMD) mejoraría un modelo de triaje. Ocurre lo contrario: el AUC baja de 0,737 a 0,620 a medida que se añaden fuentes, y una prueba diagnóstica muestra por qué: el modelo separa las imágenes por dataset de origen con un AUC de 0,9998, aprendiendo la «firma» del conjunto de datos en vez del cáncer.
¿Son intercambiables los foundation models de imagen médica? Lo que revela una disección controlada de 25 codificadores sobre la «convergencia» de las representaciones
Un equipo académico alemán puso a prueba una idea convertida en lugar común: al crecer, los codificadores de imágenes médicas convergerían hacia una representación compartida, lo que los haría intercambiables. Al diseccionar 25 codificadores open-weight (18 de imagen, 7 de texto), de 7 millones a 27 mil millones de parámetros, en cinco modalidades y 650 982 radiografías de tórax, los autores muestran que la convergencia es real pero modesta, que la impulsa el objetivo de aprendizaje autosupervisado y no la escala ni la supervisión clínica, y que no reproduce cómo un radiólogo juzga la similitud entre dos casos.
Informes de patología generados por IA: por qué las puntuaciones BLEU sobrestiman la calidad, y qué corrige la métrica clínica CRQS
Un equipo de Stony Brook y de la Universidad de Utah montó el primer banco de pruebas estandarizado para la generación automática de informes de patología a partir de láminas digitalizadas, reevaluando cuatro modelos y tres codificadores de imagen en tres conjuntos de datos. Su hallazgo: las métricas de lenguaje habituales (BLEU, ROUGE, METEOR) premian el parecido de superficie y pueden puntuar alto un informe que invirtió el diagnóstico. Para remediarlo proponen CRQS, una puntuación que compara los hechos clínicos extraídos en vez de las palabras —pero la métrica-juez se apoya ella misma en un modelo de lenguaje y se mide contra referencias ruidosas.
Predecir la mortalidad a partir de un ECG, sin etiquetas: qué mide en realidad el «error de reconstrucción» de un autocodificador
Un equipo de la Medical University de Innsbruck entrenó un autocodificador enmascarado con 7,2 millones de electrocardiogramas brasileños, sin mostrarle nunca quién iba a morir. La idea: cuanto más se aparta un ECG de la «normalidad» aprendida, mayor es su error de reconstrucción, y mayor sería el riesgo de muerte. Validado en 1,6 millones de pacientes de tres continentes, el score predice bien la mortalidad por cualquier causa —pero un examen atento muestra que la palabra «autosupervisado» esconde una selección guiada por las etiquetas, y que la cifra estrella nunca aísla lo que el ECG aporta más allá de la edad.
Predecir el parto prematuro a partir de una ecografía del cuello uterino: por qué estos modelos de IA se desploman en otro ecógrafo
Un equipo de la cohorte GARBH-Ini (norte de la India), con la Universidad de Oxford, entrenó varios modelos —entre ellos un Vision Transformer— para predecir el parto prematuro espontáneo a partir de una sola ecografía del cuello uterino en el segundo trimestre. Internamente, el mejor modelo alcanzó un AUC de 0,71; probado en una cohorte independiente adquirida con otro ecógrafo, cayó a 0,52, apenas por encima del azar. Un resultado negativo, publicado con honestidad, que sobre todo dice lo que la IA de imagen médica aún no sabe hacer: salir del laboratorio.
Auditar los sesgos ocultos de una IA médica sin metadatos: lo que propone CAPRA, que adivina los subgrupos de pacientes a partir de la propia imagen
Seis investigadores de la Beijing University of Posts and Telecommunications proponen CAPRA, un método que reconstruye ejes demográficos y técnicos — edad, sexo, tipo de aparato, incidencia — directamente a partir de las imágenes, para detectar los subgrupos de pacientes en los que un modelo falla cuando los metadatos necesarios para esa auditoría han desaparecido. Evaluado en tres modalidades — fondo de ojo (retinopatía diabética), dermoscopia (HAM10000) y radiografía de tórax (CheXpert) —, saca a la luz disparidades que el troceo por metadatos solos no ve, y mejora el rendimiento del peor subgrupo en catorce comparaciones de quince cuando un aprendizaje robusto reutiliza sus particiones. La idea es útil y se presenta con honestidad, pero adivinar atributos sensibles a partir de la imagen abre un riesgo de circularidad, y nada se valida en condiciones clínicas.
Diagnóstico molecular del glioma infantil por resonancia: lo que aporta, y lo que no demuestra, un aprendizaje contrastivo que corrige sus propios «falsos negativos»
Seis investigadores de la Universidad de Toronto y del hospital infantil SickKids proponen MSeaCL, un método que aprende a vincular resonancias cerebrales e informes de radiología teniendo en cuenta su proximidad de sentido, para dejar de tratar como opuestos a dos tumores en realidad parecidos. Preentrenado con 341 pares imagen–informe de un solo hospital y luego afinado para clasificar el subtipo molecular de gliomas de bajo grado infantiles, gana apenas una centésima de AUC en interno pero salta 0,23 puntos en un conjunto de prueba externo de otros escáneres. El resultado sobre la generalización es real e instructivo, pero se apoya en efectivos minúsculos, una sola secuencia de imagen y una evaluación que sigue lejos de la clínica.
Robustez de los foundation models en patología: lo que un banco de pruebas de «perturbaciones más cambio de distribución» revela de su fragilidad
Tres investigadores de la Universidad de Warwick someten a doce foundation models de patología digital, y a dos redes convolucionales de referencia, a once perturbaciones de imagen realistas y a un protocolo de validación diseñado para romper el parecido entre los datos de entrenamiento y de prueba. Los grandes modelos resisten mejor que las redes antiguas, pero su robustez se estanca mucho antes de los mil millones de parámetros, y todos pierden precisión en cuanto se enfrentan a distribuciones realmente distintas. Un recordatorio útil: la fiabilidad clínica dependerá de la calidad y la diversidad de los datos de entrenamiento, no del tamaño del modelo.
Predecir el Parkinson por la genética: cuando el enriquecimiento de una cohorte convierte un gen de riesgo en un gen "protector"
Un investigador de la Claremont Graduate University entrena, sobre 1.987 participantes de la cohorte Fox Insight, una batería de modelos —desde una regresión logística penalizada hasta un conjunto de algoritmos— para predecir un diagnóstico de enfermedad de Parkinson a partir de unos pocos variantes genéticos dirigidos. El mejor modelo alcanza un AUC de 0,929 en una muestra de prueba, cifra en apariencia excelente. Pero la cohorte cuenta con 1.861 enfermos frente a solo 126 controles, y el variante de riesgo mejor conocido del campo aparece "protector": el rendimiento mide sobre todo un artefacto de reclutamiento, no una capacidad de cribado.
MedQADE: una IA que corrige respuestas médicas iguala a los médicos en acuerdo, pero nunca en prudencia
Un equipo de las universidades de Lübeck, Tübingen, Würzburg y la Charité de Berlín construye MedQADE, el primer banco de pruebas clínico de respuesta libre en alemán: 3.800 preguntas del examen nacional de medicina, calificadas por médicos y por nueve modelos de lenguaje que hacen de correctores. El mejor, Gemini 3 Flash, alcanza un acuerdo con el consenso médico (kappa 0,694) estadísticamente indistinguible del techo humano (0,709). Pero donde los médicos se abstienen cuando una pregunta supera su competencia, los modelos de vanguardia deciden en el 100 % de los casos: acuerdo de superficie, sin la prudencia clínica que normalmente lo acompaña.
ALICE: un único modelo de fundación en patología destilado a partir de ocho expertos — mejor rango medio en 96 tareas, pero sin validación prospectiva
Un equipo de Tsinghua Shenzhen, Oxford y la Universidad Sun Yat-sen fusiona ocho modelos de fundación de patología digital en una sola red mediante una «destilación aglomerativa» en tres etapas (ALICE). En 96 tareas repartidas en 48 fuentes de datos, ALICE obtiene el mejor rango medio frente a modelos especializados, superando al segundo por 1,79, 6,39 y 3,04 puntos según el tipo de tarea. Pero la evaluación es enteramente retrospectiva, los comparadores son los propios modelos-profesores de ALICE, y no se informa de ningún control de fuga de datos aunque preentrenamiento y prueba comparten la base TCGA.
MedPMC: curar la literatura médica para entrenar modelos multimodales — +7,1 puntos de AUC en 26 pruebas, pero una validación clínica aún escasa
Un equipo liderado por Yale convierte 6,1 millones de artículos de PubMed Central en 11 millones de pares imagen-texto médicos mediante un pipeline automatizado de cinco etapas (MedPMC). Un modelo de visión-lenguaje entrenado con ese corpus, MedPMC-CLIP, gana 7,1 puntos de AUC de media en 26 pruebas de 11 especialidades, frente al mejor modelo comparable, con menos de la mitad de los pares. Pero la única evaluación con datos de pacientes reales se reduce a una recuperación de imágenes en dermatología, y los autores advierten que nada está listo para uso clínico.
RAG y salud pública: 99 % de aciertos en opción múltiple, pero apenas dos tercios de respuestas fieles a las recomendaciones oficiales
Un equipo británico amplía PubHealthBench —7929 preguntas extraídas de 687 documentos de recomendaciones de salud pública del Gobierno del Reino Unido— para evaluar la Retrieval-Augmented Generation. Anclar un modelo de lenguaje en los pasajes correctos lleva la precisión en opción múltiple a cerca del 99 %, con modelos abiertos pequeños superando a uno propietario grande; pero en respuesta libre, la mejor configuración solo es fiel a las recomendaciones el 64 % de las veces, y el juez automático se hunde justo en la «exactitud factual» (κ cercano a 0).
Convertir la atención de una red en biomarcador: «firmas radiómicas» guiadas por Grad-CAM para clasificar tumores — mejoras marginales, validación clínica apenas por encima del azar
Un equipo de la Universidad de Florida propone convertir los mapas de atención Grad-CAM de una red de segmentación en regiones «firma», de las que se extraen variables radiómicas para clasificar tumores de mama, cerebro y riñón. En los conjuntos públicos (BUSI, BraTS), la firma mejora la clasificación entre 0,2 y 3 puntos de AUC; pero en la única cohorte clínica privada (TC renal de UF Health), todas las redes profundas se quedan cerca del azar (AUC ≈ 0,49–0,59). El preprint no reporta ningún tamaño de muestra, ningún código ni declaración de financiación o conflictos de interés.
Resincronización cardíaca: un gemelo digital para elegir dónde colocar el electrodo en el seno coronario — piloto de 74 pacientes, nada validado de forma prospectiva
Un equipo ruso combina un gemelo digital del corazón, simulaciones electrofisiológicas y un clasificador explicable (SVM) para predecir, sitio por sitio dentro del seno coronario, la respuesta a la terapia de resincronización cardíaca. Sobre 74 pacientes, el modelo supera a un calculador clínico de referencia (AUC 0,78 en validación interna, exactitud 0,78 frente a 0,58). Pero la validación es puramente interna y retrospectiva, la cohorte pequeña, y el resultado central — «otra posición habría funcionado» — sigue siendo una predicción in silico nunca verificada en un paciente.
ER-JEPA: aprender el ECG de 12 derivaciones sin etiquetas — estado del arte en un benchmark, nada clínico todavía
Un modelo autosupervisado jerárquico, ER-JEPA, se preentrena sobre unos 174 000 trazados de ECG de 12 derivaciones sin etiquetar, procedentes de China y Brasil, y luego se evalúa en dos conjuntos de test públicos. Iguala el estado del arte en el benchmark ST-MEM y lo supera en el fine-tuning sobre PTB-XL (AUC 0,936 y 0,943), en una sola tarjeta gráfica de consumo — pero el autor reconoce un entrenamiento inestable, el código aún no está publicado, y ninguna cifra se traduce en rendimiento clínico.
Un índice de fragilidad electrónico construido por deep learning sobre las notas clínicas: en 193 629 finlandeses, un riesgo de muerte multiplicado por 7 en los más frágiles — pero un umbral calibrado sobre la mortalidad que predice
Un equipo finlandés construye un índice de fragilidad electrónico extrayendo con deep learning diez déficits funcionales de las notas clínicas libres, además de los códigos CIE-10 y los análisis. En 193 629 personas de 35 a 103 años, el riesgo de muerte de los más frágiles se multiplica por 7,3 y el de infección grave por 9,2 — pero los umbrales de fragilidad están calibrados sobre la mortalidad que predicen, los comparadores son débiles y la validación sigue siendo monocéntrica.
Genosolver: grandes modelos de lenguaje que leen las notas clínicas para diagnosticar enfermedades raras — gen causal en primer lugar en el 72 % de los casos resueltos, pero solo 1,7 % más de diagnósticos en los no resueltos
Un equipo de Aquisgrán combina grandes modelos de lenguaje, modelos de razonamiento y RAG para extraer fenotipos de notas clínicas no estructuradas y reordenar variantes genéticas en enfermedades raras. El gen causal se sitúa primero en el 72 % de los casos ya resueltos y supera a Exomiser, pero reanalizar 1 875 casos no resueltos añade solo un 1,7 % de diagnósticos — y el comparador recibe menos información que el modelo.
Predecir el riesgo de ictus isquémico a diez años: un XGBoost que supera a las escalas clásicas pero cuyo riesgo absoluto se derrumba de un hospital a otro
Un equipo de Birmingham y del Mount Sinai combina la historia clínica electrónica, trayectorias de laboratorio y veinte puntuaciones de riesgo poligénico en un XGBoost para predecir el ictus isquémico a diez años. El modelo supera con holgura a las escalas clásicas y su capacidad de clasificar se traslada a una cohorte externa, pero el riesgo absoluto se derrumba de un hospital a otro, el aporte del genoma es marginal y la raza autodeclarada casi no añade nada.
Segmentar la retina interna en la retinosis pigmentaria: dos modelos de IA, incluido el foundation model SAM, entrenados con solo 228 cortes de OCT
Un equipo de Göttingen adapta el foundation model SAM y un nnU-Net para medir las capas internas de la retina en OCT en pacientes con retinosis pigmentaria, con muy pocos datos anotados. Fiable en las capas internas, pero falla justo donde se juega la estadificación de la enfermedad, y validado en una sola cohorte.
RadGrounder: un modelo de visión-lenguaje para radiología que muestra dónde mira, entrenado con 1,2 millones de cortes sin anotación manual
RadGrounder redacta informes, responde preguntas y localiza en la imagen la estructura que menciona, entrenado con 1,2 millones de cortes de TC y RM etiquetados por completo por otras IA. Rinde bien en dos benchmarks públicos, pero el anclaje solo señala órganos — nunca las lesiones.
Pancreatitis aguda grave: un bosque aleatorio supera a todos los modelos de aprendizaje profundo en 722 pacientes
En una cohorte china de 722 pacientes, once modelos predicen la pancreatitis aguda grave desde el ingreso: los modelos clásicos ganan (Random Forest, AUC 0,877) y el aprendizaje profundo fracasa, pero la cohorte tiene un 81 % de casos graves, al revés de la realidad.
Pronóstico del ictus: seis neurólogos, un modelo clásico y un modelo de aprendizaje profundo comparados en el ensayo MR CLEAN
En el ensayo MR CLEAN, los modelos predicen la discapacidad a tres meses tras un ictus por oclusión de gran vaso mejor que seis neurólogos, cuyo optimismo sistemático sesga el pronóstico.
Clasificar un electrocardiograma de urgencia desde su imagen: un conjunto ConvNeXt se acerca a los cardiólogos en 18 519 trazados
En InCor (São Paulo), un modelo que lee la imagen de un ECG clasifica 12 tipos de trazados de urgencia con un F1 macro de 0,807, frente a 0,820 de los cardiólogos anotadores — útil cuando solo se dispone de un trazado en papel o fotografiado.
Mortalidad en cuidados intensivos: predecir la muerte con las primeras 24 horas en MIMIC-IV, y por qué calibrar importa tanto como discriminar
Cinco modelos tabulares predicen la mortalidad en la UCI sobre 53 866 ingresos de MIMIC-IV. AUROC de 0,856, pero una AUPRC de 0,45 y un solo centro recuerdan los límites.
Cáncer de próstata: segmentar lesiones en la PET/TC con PSMA mediante un transformador, y estratificar la supervivencia antes de la terapia con radioligandos
Fine-UNETR, un transformador de visión, segmenta automáticamente lesiones PSMA en PET/TC de cuerpo entero. Dice del 66,63 % interno, pero 44,11 % en validación externa.
StrokeTHG: predecir la mortalidad tras un ictus a 30, 90 y 365 días con un grafo heterogéneo de historias clínicas
Una red neuronal sobre grafo heterogéneo predice la mortalidad posictus a tres horizontes a partir de datos EHR. AUROC 0,837-0,878, pero evaluación monocéntrica y transductiva sin validación externa.
Foundation models en oncología multimodal: lo que revela una auditoría de la patología y el transcriptoma
Cinco foundation models probados en láminas de patología y transcriptoma de 7600 pacientes: en ómica un simple ACP supera al modelo dedicado, y fusionar modalidades no siempre ayuda.
Cribado del cáncer de cuello uterino con IA: lo que revela una validación en cuatro países
Un modelo multitarea clasifica las lesiones a tratar (CIN2+) a partir de una sola imagen de colposcopia. Sólido en Alemania y la India, cae al nivel del azar en Rumanía.
Interpretar automáticamente los valores Ct de la qPCR: lo que muestra un modelo entrenado con 41 770 curvas de amplificación
Un modelo XGBoost aprende el Ct «normal» con 41 770 curvas qPCR para señalar amplificaciones anómalas — pero su referencia sigue siendo la máquina y falla de un instrumento a otro.
Cuando un detector de cáncer de piel cambia de país: un clasificador en cascada de imágenes dermoscópicas cae de 0,96 a 0,80 de AUC entre el archivo ISIC y la clínica rusa (arXiv, 2026)
Descifrado de un preprint publicado el 11 de junio de 2026 en arXiv por Elena Kozachok y colaboradores: cuatro arquitecturas de aprendizaje profundo (ViT-B/16, Swin-S, ConvNeXt-S, EfficientNetV2-S) y tres esquemas de clasificación —binario, cuatro clases y una cascada de "triaje y luego diferenciación"— se entrenan en el archivo abierto ISIC y se prueban en dos pequeños conjuntos clínicos rusos. Internamente la discriminación benigno/maligno es excelente (AUC ROC 0,952 a 0,966); en los datos de la Universidad Sechenov cae a 0,797–0,893, la sensibilidad baja a 0,53–0,67 y el error de calibración sube de 0,02 a 0,27–0,39, subestimando el modelo la malignidad. La cascada añade un control explícito de la sensibilidad, ausente en los clasificadores de una sola etapa. El trabajo es honesto sobre la brecha de generalización, pero las cohortes externas son diminutas y desequilibradas, sin comparador dermatólogo ni validación prospectiva.
Predecir la fibrilación auricular cinco minutos antes: una red neuronal personalizada lee el ECG de dispositivos portátiles (arXiv, 2026)
Análisis de un preprint publicado el 9 de junio de 2026 en arXiv por un equipo de la Universidad Nacional de Seúl: a partir de un segmento de ECG de una sola derivación de 60 segundos, una red neuronal intenta predecir si un episodio de fibrilación auricular comenzará en los próximos 5 minutos. Personalizar el modelo con las primeras 24 horas de registro de cada paciente eleva el AUROC de cerca de 0,61 a 0,71 en la cohorte interna, y de 0,59 a 0,69 en una cohorte coreana externa. El trabajo es concreto, el código es abierto y la validación abarca tres cohortes — pero la discriminación sigue siendo modesta, los umbrales se ajustan con los propios datos de prueba del paciente, la cohorte europea externa solo tiene 6 pacientes, y dos autores están vinculados al fabricante del dispositivo.
SchistoTrackNet: una red neuronal lee la ecografía del hígado para detectar la fibrosis de la bilharziasis (medRxiv, 2026)
Análisis de un preprint publicado el 2 de junio de 2026 en medRxiv: una red neuronal clasifica imágenes de ecografía hepática para detectar la fibrosis periportal causada por la esquistosomiasis, en la Uganda rural. Entrenado con 3.710 imágenes de la cohorte SchistoTrack, SchistoTrackNet alcanza un 82,2 % de exactitud en seis clases y concuerda mejor con el ecografista que tomó la imagen (kappa 0,77) que un segundo ecografista (0,54). El trabajo aborda una enfermedad desatendida con un rigor poco común — pero la verdad de referencia es un único lector humano, los datos provienen de un solo país y un solo aparato, y la fibrosis más grave se detecta solo la mitad de las veces.
Diagnosticar la leucemia mieloide aguda en el mielograma: un pipeline «célula a paciente» que esquiva el recuento de blastos (arXiv, 2026)
Análisis de un preprint publicado el 9 de junio de 2026 en arXiv: un pipeline de deep learning detecta y clasifica las células de un frotis de médula ósea y luego agrega esas observaciones en una puntuación por paciente para asistir el diagnóstico de leucemia mieloide aguda. Validado en 258 pacientes de seis centros (89 reservados para validación externa), alcanza un F1 ponderado de 0,87 a 0,91 en tres centros no vistos. La demostración es cuidadosa y el enlace célula a paciente está bien pensado — pero el objetivo aprendido es un proxy morfológico, no el blasto leucémico, y el preprint no publica ninguna métrica diagnóstica a nivel de paciente, ni código, ni comparación con un citólogo.
Cuando la densidad mamaria distorsiona la evaluación de las IA de cribado: el banco de pruebas Mass-Bench y la degradación oculta (Mathematics, 2026)
Análisis de un estudio publicado el 10 de junio de 2026 en Mathematics: Mass-Bench reúne cuatro conjuntos de datos públicos de mamografía (32 930 imágenes, 8245 pacientes) para medir la detección de masas y la clasificación BI-RADS no de forma global, sino estratificada por densidad mamaria. El hallazgo — el rendimiento se desploma cuando la mama se vuelve densa, algo que las evaluaciones desequilibradas ocultan — es real y útil. Pero el artículo reproduce algunos defectos que denuncia: una cifra de titular ausente de sus propias tablas, casillas de prueba de una sola imagen y ningún código publicado para algo presentado como un benchmark.
Diseñar proteínas que reconocen solo una forma de su diana: AlloGen y la selectividad de conformación aprendida (arXiv, 2026)
Análisis de AlloGen, un preprint de arXiv publicado el 3 de junio de 2026: un marco que genera proteínas a medida que se unen a una sola conformación de su diana — la forma activa de una enzima y no su forma en reposo. Su núcleo es un evaluador aprendido, Q_θ, que puntúa la selectividad de conformación de una interfaz proteína-proteína. En ocho dianas nunca vistas en el entrenamiento alcanza una correlación de rango media de 0,520, y en la calmodulina péptidos diseñados de novo se unen a la forma holo sin unión detectable a la forma apo. Una prueba elegante y reproducible de que la selectividad de conformación se aprende, pero una sola diana validada en el laboratorio, una métrica indirecta, comparadores débiles y una licencia no comercial la sitúan muy lejos de cualquier fármaco.
Predecir la falta de adherencia al tratamiento contra el VIH con machine learning: ¿cuánto vale una validación «real» sobre 192 732 registros multipaís? (medRxiv, 2026)
Análisis de un preprint publicado en mayo de 2026 en medRxiv: modelos de machine learning validados sobre 192 732 registros clínicos multipaís para predecir la falta de adherencia al tratamiento contra el VIH y cuantificar las brechas del recorrido asistencial. La validación temporal alcanza un AUC de 0,772 y el estudio documenta una demora mediana de 74 días entre diagnóstico e inicio del tratamiento. Una demostración honesta y útil a gran escala, pero una discriminación modesta, un criterio de adherencia opaco en el resumen público y un modelo económico con supuestos sin detallar invitan a leer las cifras por lo que son.
Topología y transformers de visión para clasificar tumores cerebrales: ¿cuánto vale una exactitud del 99,1 % en una sola base de RM? (Ahmed 2026, arXiv)
Análisis del preprint publicado el 30 de mayo de 2026 en arXiv por Faisal Ahmed (Embry-Riddle Aeronautical University, Arizona): un modelo que fusiona un transformer de visión con el análisis topológico de datos (homología persistente) para clasificar RM cerebrales en cuatro categorías. Declara un 99,10 % de exactitud y un AUC del 99,98 % en el benchmark público BRISC2025, pero la ganancia sobre los modelos existentes queda dentro del ruido, la evaluación se apoya en una sola base con una partición imagen por imagen que no descarta la fuga de datos, y el conjunto de prueba también sirve para seleccionar el modelo.
BreastGPT: un solo modelo multimodal para todo el recorrido del cáncer de mama — cuánto vale realmente un 90 % en un benchmark casero (Liu et al. 2026, arXiv)
Análisis crítico del preprint depositado el 3 de junio de 2026 en arXiv por Yang Liu y colaboradores (DAMO Academy de Alibaba, Universidad de Zhejiang, Hupan Lab, West China Hospital, China Medical University): BreastGPT, un modelo de lenguaje multimodal de 8.000 millones de parámetros que dice cubrir todo el recorrido clínico del cáncer de mama —cribado, diagnóstico, planificación del tratamiento— en cinco modalidades de imagen (mamografía, ecografía, RM, TC, láminas de patología) y el texto. Entrenado con 1,86 millones de pares pregunta-respuesta construidos en gran parte por los propios grandes modelos de Alibaba, alcanza un 75,66 % de exactitud en las preguntas de opción múltiple y un 89,92 % en las abiertas de su propio benchmark BreastStage-Bench. Una proeza de ingeniería real, pero la mayor parte de la brecha viene de entrenar sobre la distribución exacta del test: el comparador justo solo gana unos pocos puntos, nada se evaluó en pacientes reales ni se comparó con clínicos, y el corpus está en gran medida generado por los modelos de la casa.
MCEN: predecir la respuesta completa a la quimioterapia del cáncer de mama a partir de una biopsia, con la arquitectura Mamba (Zhang et al. 2026, npj Digital Medicine)
Análisis crítico del artículo publicado el 2 de junio de 2026 en npj Digital Medicine por Wenchuan Zhang, Shuwan Zhang, Fengling Li, Qingjie Lv, Yuhao Yi y Hong Bu (West China Hospital, Universidad de Sichuan, y colaboradores): MCEN, un modelo de aprendizaje profundo basado en la arquitectura Mamba que predice, a partir de una biopsia con aguja leída como lámina digital, si una paciente con cáncer de mama logrará una respuesta patológica completa tras quimioterapia neoadyuvante. Entrenado con 1.023 pacientes de un hospital chino y probado en cuatro centros independientes (1.646 pacientes en total), alcanza un AUROC de 0,923 en entrenamiento pero cae a 0,76–0,81 en validación externa, y sube hasta 0,84 al fusionar los datos clinicopatológicos. Sólido por su verdadera validación multicéntrica y la eficiencia de Mamba sobre imágenes gigapíxel, el trabajo queda limitado por una marcada brecha entrenamiento-validación, una cohorte exclusivamente china, exclusiones que descartan las formas atípicas y la ausencia de comparación con patólogos.
SKELEX: un foundation model entrenado con 1,3 millones de radiografías para leer el hueso, del quiste a la fractura (Kim et al. 2026, npj Digital Medicine)
Análisis crítico del artículo publicado el 2 de junio de 2026 en npj Digital Medicine por Shinn Kim, Soobin Lee, Ilkyu Han, Sunghoon Kwon y colegas de la Universidad Nacional de Seúl: SKELEX, presentado como el primer foundation model a gran escala dedicado a las radiografías del aparato locomotor. Un autoencoder enmascarado con dorsal ViT-Large se preentrena de forma autosupervisada con 1 296 540 radiografías sin etiquetar de un solo hospital coreano (2010-2016) y luego se adapta a 12 tareas diagnósticas en 7 conjuntos de datos públicos. Supera a cinco modelos de referencia en un 6,21 % de media relativa (AUROC de 0,953 frente a 0,884 de su propio modelo de inicialización en la detección de tumor óseo), está mejor calibrado y alcanza el nivel de los mejores con la mitad de las etiquetas. Convincente en eficiencia de etiquetas e higiene metodológica, el trabajo está limitado por datos de entrenamiento de un solo centro y un solo país, una verdadera validación externa restringida solo a la aplicación de tumor óseo, la ausencia de comparación con radiólogos, una resolución reducida a 224×224 y pesos publicados únicamente para uso académico.
PINNOCHIO: predecir el rostro postoperatorio en cirugía ortognática con una red guiada por la física, tan precisa como los elementos finitos pero en segundos (Lee et al. 2026, arXiv)
Análisis crítico del preprint publicado en arXiv el 1 de junio de 2026 (enviado a MICCAI 2026) por Jungwook Lee, Daeseung Kim, Kevin Gu, Zhangfeng Hu, Tianshu Kuang, Finn Hopeman, Michael A.K. Liebschner, Jaime Gateno y Pingkun Yan (Rensselaer Polytechnic Institute, Houston Methodist, Baylor College of Medicine): PINNOCHIO, una red neuronal guiada por la física que predice cómo se deforman los tejidos blandos del rostro tras el reposicionamiento quirúrgico de los maxilares, separando el movimiento de la interfaz hueso–tejido de la deformación hiperelástica del volumen. En 40 casos clínicos reales (TC preoperatoria + superficie 3dMD postoperatoria) iguala o supera al simulador de elementos finitos de referencia en fidelidad de superficie (distancia de Chamfer 1,12 mm frente a 1,30; 86,55 % de los puntos a menos de 2 mm frente a 80,90 %) ejecutándose en 3,24 segundos en lugar de 3,5 horas. Convincente en velocidad y plausibilidad biomecánica, el trabajo está limitado por una cohorte de 40 pacientes, una supervisión que solo cubre la superficie externa, parámetros mecánicos fijos idénticos para todos y la ausencia de código o pesos publicados.
Cuando un LLM debe llevar la anamnesis por sí mismo: un banco de pruebas inspirado en el examen clínico muestra que el razonamiento diagnóstico interactivo degrada el rendimiento (Zhan & Gan 2026, arXiv)
Análisis crítico del preprint publicado en arXiv el 21 de mayo de 2026 por Chen Zhan, Xihe Qiu, Xiaoyu Tan, Xibing Zhuang, Gengchen Ma, Yue Zhang, Shuo Li, Peifeng Liu, Xiaoxiao Ge, Liang Liu y Lu Gan: un banco de pruebas «inspirado en el OSCE» en el que un simulador de paciente estandarizado obliga a quince grandes modelos de lenguaje (LLM) a llevar ellos mismos la entrevista, turno a turno, antes de emitir un diagnóstico. En 468 casos, pasar de la información servida de entrada a la recogida activa de la anamnesis reduce la exactitud diagnóstica en un 12,75 % y la calidad de las pruebas aportadas en un 24,36 %, con errores debidos sobre todo al cierre diagnóstico prematuro y a un interrogatorio ineficaz. La conclusión, sobria y útil: los rankings sobre exámenes médicos estáticos de opción múltiple probablemente sobreestiman lo que estos modelos pueden hacer en una consulta real. Límites: el simulador de paciente es a su vez algorítmico, la procedencia de los casos no se detalla en el resumen accesible (riesgo de contaminación) y las cifras se reportan en valores relativos sin comparador humano explícito.
GTBIS: un modelo de deep learning que lee la morfología de los carcinomas neuroendocrinos pulmonares combinados para predecir el pronóstico (Yang y Zhou 2026, npj Digital Medicine)
Análisis crítico del artículo de npj Digital Medicine del 30 de mayo de 2026 por Lin Yang, Ruyu Sheng, Zijian Yang, Shilong Liu y Meng Zhou (National Cancer Center / Cancer Hospital de la Academia China de Ciencias Médicas en Pekín, Wenzhou Medical University y Harbin Medical University Cancer Hospital): GTBIS, un modelo de deep learning interpretable que lee la morfología de las láminas de patología para distinguir el carcinoma de células pequeñas (SCLC) del carcinoma neuroendocrino de células grandes (LCNEC), y luego aplica esa lectura a los tumores combinados cSCLC-LCNEC para estratificar su pronóstico. En cohortes multicéntricas que totalizan 670 pacientes, el modelo separa los tumores combinados tratados con quimiorradioterapia en un subgrupo SCLC-like de pronóstico favorable (supervivencia global a cinco años del 100 % frente al 39,5 %, supervivencia libre de enfermedad del 87,5 % frente al 36,0 %) y un subgrupo LCNEC-like de mal pronóstico, manteniéndose la clasificación como factor pronóstico independiente en el análisis multivariable. Pero la muestra es modesta, todos los centros son chinos, la validación es retrospectiva sin comparador humano explícito, y la licencia CC BY-NC-ND cierra la adaptación.
Pathog-PDx: un sistema de aprendizaje automático para identificar 22 patógenos respiratorios pediátricos a partir del registro electrónico (Su 2026, npj Digital Medicine)
Análisis crítico del artículo de npj Digital Medicine del 29 de mayo de 2026 por Dubin Su, Qun Chen, Ruizhi Xu y colegas (First Affiliated Hospital of Xiamen University, Zhengzhou University, Nanjing University, Shenzhen Second People's Hospital y UIUC): Pathog-PDx, un sistema diagnóstico que combina 42 variables clínicas y de laboratorio del registro electrónico para distinguir 22 subtipos de patógenos responsables de infecciones respiratorias en niños hospitalizados. Cohorte de desarrollo de 134.500 niños en tres centros y dos bases de datos, validación prospectiva independiente en 1.338 niños, AUC promedio 0,88 sobre los 22 patógenos y 0,95 para el virus de la gripe, despliegue público de una herramienta de apoyo a la decisión en línea. Pero todos los centros de desarrollo son chinos, falta el comparador clínico humano, la licencia CC BY-NC-ND cierra la adaptación académica, y la propia naturaleza del gold standard para 22 clases merece una discusión aparte.
EpiVLM: un modelo visión-lenguaje para detectar y clasificar crisis epilépticas en vídeo, del hospital al domicilio (He 2026, npj Digital Medicine)
Análisis crítico del artículo publicado en npj Digital Medicine el 26 de mayo de 2026 por Mengqiao He, Leihao Sha, Pengfei Wei, Lei Chen y colegas (West China Hospital, Universidad de Sichuan y Shenzhen Institutes of Advanced Technology, CAS): EpiVLM, un modelo visión-lenguaje (VLM) que combina prompts estructurados clínicamente con razonamiento sobre vídeo para reconocer cinco semiologías de crisis en 232 grabaciones vídeo de 127 pacientes (11 666 segmentos anotados) procedentes de dos centros terciarios, grabaciones domiciliarias no controladas y un dataset público independiente. Exactitud 0,795–0,947, sensibilidad 0,842–0,957, falsos positivos por vídeo 0,47–2,45 %, retardo medio entre inicio de crisis y detección por debajo de 6 segundos, con prompts y umbrales fijados a priori sin recalibración por sitio. Pero todos los centros terciarios son chinos, la cohorte domiciliaria apenas se describe en el resumen, no hay comparación frontal con anotadores humanos, y un coautor está afiliado a una empresa privada (Brain Everest LLC) sin declaración de conflicto.
Un pipeline de neuroimagen automatizado para el pronóstico cognitivo personalizado post-ictus (Brzus 2026, npj Digital Medicine)
Análisis crítico del artículo del 27 de mayo de 2026 en npj Digital Medicine por Michal Brzus, Joseph Griffis, Aaron D. Boes y colegas (Universidad de Iowa): un pipeline DICOM a PDF totalmente automatizado que segmenta lesiones isquémicas con una 3D Residual U-Net, predice 28 desenlaces neuropsicológicos mediante lesion network mapping, y redacta un informe personalizado vía LLaMA 3.3 70B air-gapped en menos de tres minutos. Entrenamiento sobre 604 pacientes del Iowa Lesion Registry, test independiente sobre 153 pacientes con ictus isquémico imagenados con 17 modelos de escáner. AUC de 0,74 a 0,90 en cinco dominios cognitivos detallados, 96 % de concordancia entre predicciones obtenidas a partir de segmentaciones automáticas y manuales. Pero entrenamiento y test del mismo centro, ningún comparador clínico (NIHSS, mRS, demografía sola), revisión clínica de los informes por el propio autor sénior, y cuatro de los siete autores son titulares de la patente asociada y cofundan NeuroPred Inc.
SHAP y SVM para predecir la trombosis venosa profunda tras cirugía por cáncer de endometrio (estudio Zhou 2026, npj Digital Medicine)
Análisis crítico del artículo de Qing Zhou y colegas publicado el 27 de mayo de 2026 en npj Digital Medicine: un modelo SVM de cuatro variables (dímero D postoperatorio, edad, fibrinógeno, estadio FIGO) predice la trombosis venosa profunda tras cirugía por cáncer de endometrio, con AUC 0,828 en validación interna y 0,819 en cohorte externa sobre 841 + 95 pacientes chinas. SHAP hace que las contribuciones sean interpretables. Pero las imágenes se realizan por síntomas (sesgo de detección), cohorte 100 % china, sin comparación frontal con los scores Caprini/Wells, y dímero D medido tras la cirugía — se trata más de una ayuda a la detección precoz que de una predicción estricta.
UNet-MoE-Cli: un mixture-of-experts para personalizar el neoadyuvante del cáncer de recto (Liu 2026, npj Digital Medicine)
Análisis crítico del artículo de npj Digital Medicine del 26 de mayo de 2026 de Xiangyu Liu y colegas: UNet-MoE-Cli, un modelo de deep learning mixture-of-experts sobre IRM multiparamétrica y variables clínicas, estima probabilidades de respuesta patológica completa por régimen en el neoadyuvante del cáncer de recto localmente avanzado. AUC 0,827 en validación interna, 0,790 en cohorte prospectiva (ChiCTR2400085797), pero sensibilidad solo de 0,45–0,53, experto nCT mono-céntrico, cohorte 100 % china, y beneficio de la escalada calculado por el propio modelo.
Cuando el texto se come la imagen: lo que el estudio Restrepo 2026 revela sobre la fragilidad contextual de los VLMs clínicos en MIMIC-CXR
Análisis crítico del preprint arXiv 2605.17436 del 17 de mayo de 2026 de David Restrepo (CentraleSupélec-Université Paris-Saclay) y colegas: ocho modelos vision-language evaluados sobre 1 000 radiografías torácicas de MIMIC-CXR pierden hasta el 66 % de sus decisiones correctas cuando se sustituye el texto clínico por el de un paciente de clase opuesta. Imagen sola se queda en 0,50–0,68, texto solo iguala al multimodal. Incluso MedGemma, adaptado a lo médico, se derrumba. Estos VLMs son clasificadores de informes disfrazados de lectores de imágenes.
PromptRad: etiquetar informes de TC hepática con solo 32 ejemplos anotados, y empatar con GPT-4
Análisis crítico del preprint arXiv 2605.20052 de mayo de 2026 (BioNLP 2026 @ ACL) de Ying-Jia Lin y colegas (Chang Gung University, Taiwán): un PubMedBERT de 110 millones de parámetros, ajustado por prompt-tuning con un verbalizador enriquecido por UMLS, alcanza el 89,2 % de F1 macro en siete categorías de lesiones hepáticas en TC, partiendo de solo 32 informes anotados, y con mejor manejo de negaciones que GPT-4.
10 000 casos sintéticos frente a cuatro LLM de frontera: lo que el estudio Auger 2026 revela sobre los puntos ciegos clínicos de Gemini 3 y GPT-5 en esclerosis múltiple
Análisis crítico del preprint medRxiv de abril de 2026 de Stephen D. Auger (Imperial College London): hasta 10 000 casos sintéticos de esclerosis múltiple con verdad-terreno, cuatro modelos de frontera (Gemini 3 Pro/Flash, GPT-5.2/5-mini) evaluados sobre diagnóstico, localización, exploraciones y manejo. La precisión diagnóstica no predice la seguridad terapéutica: Gemini infrautiliza los corticoides apropiados, GPT-5 recomienda trombolisis intravenosa en casi uno de cada diez casos.
GPT-4 en radiología: por qué el formato de explicación de un LLM cambia la precisión diagnóstica de los médicos
Análisis del artículo de Spitzer et al. en npj Digital Medicine 2026: ensayo aleatorizado con 101 radiólogos que compara tres formatos de explicación de GPT-4. La cadena de pensamiento aporta 12,2 puntos de precisión, el diagnóstico diferencial induce sesgo de automatización. Implicaciones para el despliegue clínico de LLMs.
GigaPath en patología digital: lo que cambia un foundation model entrenado en 1.300 millones de teselas
Análisis crítico del artículo de Nature 2024 sobre Prov-GigaPath, foundation model transformer para patología digital. Arquitectura, datos, rendimiento en 26 benchmarks de cáncer, y lo que realmente cambia para el diagnóstico.