El cuarenta por ciento de una columna de diagnóstico rellenada por defecto: auditoría cuenta por cuenta de un cribado cognitivo chino, y veinticuatro formas de entrenar un modelo sobre ella

Catorce autores chinos abrieron la columna de estado cognitivo de un programa comunitario de cribado en uso rutinario en China continental — 112 023 filas escritas por 2 597 cuentas de introducción de datos — y comprobaron que 181 cuentas, cada una con al menos 100 diagnósticos introducidos sin registrar nunca un solo deterioro, produjeron 45 315 de esas filas, el 40,5 % de la columna. Después entrenaron 24 modelos sobre los mismos pacientes bajo un estándar de referencia especialista: ni el ajuste fino, ni la optimización de preferencias, ni el aprendizaje por refuerzo sobre unos cientos de casos superaron a la regresión logística de 21 variables ya en producción (AUROC 0,926). El único brazo que sí la supera — un Qwen3-4B corriendo en una GPU de consumo, con 0,940 — no vio ninguna etiqueta médica: fue destilado a partir de 943 veredictos de un modelo frontera consultado sobre los propios registros no etiquetados del programa.

El contexto

Las bases de datos de servicio — las que rellena una enfermera, un trabajador social o un médico en cada contacto, en el curso normal de la atención — se han convertido en la fuente preferida de etiquetas para los modelos clínicos. Son enormes y gratuitas. El problema, formulado sin rodeos por los autores, es que el proceso que escribe esas etiquetas casi nunca se audita antes de entrenar sobre él. La literatura sobre ruido de etiquetado (label noise) sabe tratar el ruido aleatorio o condicional a la clase; está mal armada frente a un ruido concentrado en un puñado de cuentas de introducción de datos, que ningún aumento del tamaño muestral promedia.

El terreno es un programa comunitario de cribado cognitivo en uso rutinario en China continental, cuyos datos custodia la Beijing Medical Award Foundation. Cada residente pasa dos instrumentos: el AD-8, ocho preguntas dirigidas a un allegado (entrevista al informante: responde el entorno, no el paciente), y el HKBC (Hong Kong Brief Cognitive Test), prueba derivada del CSI-D con nueve ítems cognitivos más un recuerdo inmediato. Una regresión logística de 21 variables — los 8 ítems del AD-8, los 9 ítems del CSI-D, el recuerdo inmediato, la edad, el sexo y el nivel educativo — señala a los residentes que deben derivarse, con un umbral de probabilidad de 0,10.

Esta base contiene dos activos de naturaleza opuesta. Uno grande y barato: 112 023 filas de estado cognitivo, que cubren 105 893 personas evaluadas — 103 688 registradas como normales, 2 197 con deterioro cognitivo no especificado, 1 deterioro cognitivo leve y 7 demencias. Uno pequeño y caro: los 672 individuos cuyo estado fue registrado por un médico titulado (rango de attending o superior). La pregunta del artículo es qué compra cada manera de usar estos dos activos, y a qué precio.

El método

La auditoría. Para cada una de las 2 597 cuentas de operador los autores cuentan solo dos cosas: diagnósticos introducidos y proporción que registra algún deterioro. La regla de detección señala las cuentas con al menos 100 diagnósticos y cero deterioros. El movimiento metodológico crucial: prueban una explicación competidora. Si esos ceros vinieran de un proceso masivo (una importación automática), deberían agruparse en las marcas de tiempo de escritura. Y en efecto lo hacen — el segundo más denso de la tabla contiene 26 694 filas — pero el efecto alcanza a todas las clases de operador, y las filas de los médicos titulados están más concentradas temporalmente que las de las cuentas no tituladas. Conclusión: la columna de hora de escritura es un artefacto puntual de migración de base de datos, no una firma de autocompletado. Queda descalificada; el eje de operador se mantiene. En todo el estudio no se hace ninguna afirmación temporal.

Los 24 brazos. Cubren el espacio de decisiones de supervisión al que se enfrenta un programa real. La regresión de 21 variables reajustada sobre etiquetas médicas es el listón. Cuatro modelos de lenguaje locales — Qwen2.5-1.5B y 3B, Qwen3-4B y 8B, cargados en 4 bits y entrenados con LoRA en una sola GPU de consumo de 8 GB — aparecen en modo cero-shot, con un paso explícito de cadena de pensamiento, ajustados sobre etiquetas médicas, ajustados sobre etiquetas de rutina con y sin «descontaminación» (eliminando filas de cuentas con ≥ 200 diagnósticos y cero deterioros: 54 cuentas, 27 616 filas), o ajustados sobre una tarea proxy — la banda de puntuación del HKBC — que ocupa deliberadamente un espacio de etiquetas distinto del veredicto clínico. A esto se añaden variantes con DPO (optimización directa de preferencias) y GRPO (optimización de política relativa de grupo), la receta preregistrada en dos etapas «proxy y luego refuerzo» con tres penalizaciones de falso negativo, un modelo frontera propietario (gpt-5.6-pro) consultado en cero-shot, y por último la destilación de ese modelo frontera en la regresión y en el 4B local.

La destilación, con su factura. El pool no etiquetado del programa se reduce a 42 823 filas, que se colapsan en 15 127 patrones distintos. Un muestreo estratificado sin etiquetas (endosos del AD-8 más errores del CSI-D, nueve bandas) con probabilidades de inclusión almacenadas produce los 943 patrones efectivamente etiquetados por el modelo frontera. El alumno 4B se entrena sobre ellos con entropía cruzada ponderada (pesos de Horvitz-Thompson, media 1, máximo 44,8), en siete minutos. Coste total de supervisión: 943 llamadas de unos 12 segundos cada una, alrededor de tres horas de tiempo de profesor. Ni una sola etiqueta médica entra en el entrenamiento de este brazo.

La evaluación. Una única partición en cinco pliegues, estratificada por el desenlace y agrupada por conglomerados de institución resueltos mediante el registro de equipos de la plataforma, de modo que ningún conglomerado cruce la frontera de un pliegue — verificado programáticamente. Los autores señalan de paso que una versión anterior del proyecto comparaba nombres de institución en texto plano y filtraba; los pliegues publicados están recortados de nuevo. Todos los brazos se puntúan fuera de pliegue. Una institución entera (el Peking University Sixth Hospital) queda apartada, dejando un panel de desarrollo de 642 individuos en 38 instituciones, 259 de ellos con deterioro (40,3 %). Los contrastes pareados usan un bootstrap de conglomerados con 2 000 extracciones. Métricas: AUROC, error de calibración esperado (ECE), pendiente de calibración, saturación y beneficio neto en el umbral desplegado de 0,10, expresado por cada 100 individuos frente a la mejor política trivial.

Los resultados

La auditoría. Las 181 cuentas señaladas escribieron 45 315 filas, el 40,5 % de la columna; seis cuentas introdujeron cada una más de 1 000 diagnósticos sin un solo deterioro, la mayor con 3 960. El deterioro registrado desciende de forma monótona con el volumen de la cuenta: 15,7 % para cuentas de 1–9 filas, 3,4 % en 10–49, 2,1 % en 100–499, 0,7 % en 500–999. Excluir las cuentas señaladas eleva la tasa de deterioro observada del programa del 2,60 % al 4,37 % — la prevalencia aparente de un cribado nacional casi se duplica solo por la exclusión de unos cientos de cuentas de introducción de datos.

La clasificación de los brazos. Bajo el estándar especialista, la regresión en producción obtiene un AUROC de 0,926 [0,873–0,956]. Ningún brazo entrenado localmente la supera. El ajuste fino sobre etiquetas médicas se detiene en 0,924 (tanto en 4B como en 1,5B); el DPO cae a 0,881 y el GRPO a 0,789 — es decir, −0,043 y −0,135 frente a su hermano supervisado, con idéntico punto de partida, pliegues e hiperparámetros. La receta preregistrada en dos etapas es peor que su base contaminada de una etapa (−0,030; IC 95 % −0,077 a −0,004), y peor aún que la ablación que sustituye el refuerzo por entropía cruzada (−0,057). El brazo entrenado sobre el corpus de rutina contaminado (0,899) es indistinguible del mismo modelo sin entrenar (0,890; Δ +0,009, −0,014 a +0,024): la supervisión contaminada no compró nada. El brazo entrenado únicamente sobre la tarea proxy se hunde hasta 0,792, es decir 0,098 por debajo de su propia base cero-shot.

La cadena de pensamiento degrada. Pedir al modelo que razone explícitamente antes de responder reduce la discriminación en todos los tamaños: −0,072 en 1,5B, −0,080 en 3B, −0,041 en 4B y −0,012 (no significativo) en 8B. La penalización se encoge con la escala pero nunca se convierte en ganancia.

El modelo frontera y su alumno. gpt-5.6-pro en cero-shot alcanza 0,932, estadísticamente indistinguible de la regresión (+0,007, n.s.): como predictor no aporta nada. Como instrumento de etiquetado, es otra cosa. El 4B destilado alcanza 0,940 [0,898–0,963], por encima de la regresión (+0,014; 0,004 a 0,031) y por encima de su propio profesor (+0,008; 0,001 a 0,017). El presupuesto de etiquetas se satura muy pronto: 0,937 con solo 50 etiquetas del profesor, 0,940 con 200, y 0,940 con las 943 completas.

La calibración separa mejor que la discriminación. Solo tres brazos están bien calibrados — la regresión (ECE 0,039), el modelo frontera (0,041) y el 4B destilado (0,045) — y son exactamente los tres cuyo valor decisional a umbral fijo se sostiene. El 4B ajustado sobre etiquetas médicas presenta un ECE de 0,102, una pendiente de 0,40 y un 68 % de salidas saturadas. Los brazos cero-shot de 1,5B, 3B y 8B señalan al 100 % del panel en el umbral desplegado: colapsan sobre la política trivial de derivar a todo el mundo. El brazo DPO satura el 99 % de sus salidas. En términos decisionales: por cada 100 personas evaluadas, el brazo destilado aporta un beneficio neto de +3,13 frente a la mejor política trivial, y el profesor +2,94 — pero los autores advierten que en el artículo compañero, donde estos contrastes llevan intervalos y corrección por multiplicidad, ningún contraste entre brazos desplegables excluye el cero.

El centro apartado lo invierte todo. En los 58 individuos del hospital apartado, la clasificación se reordena por completo: cero-shot 3B 0,925, cero-shot 4B 0,894, 8B 0,875, regresión congelada 0,869, modelo frontera 0,851, 4B destilado 0,843, cero-shot 1,5B 0,808. El ganador del panel termina penúltimo. Los propios autores lo dicen: allí ningún brazo es separable de otro, y la verificación se publica por transparencia, no para seleccionar.

Lo que está bien

La prueba de la explicación competidora es lo que separa una auditoría de una anécdota. Habría sido fácil publicar «el 40 % de la columna procede de cuentas sospechosas» y detenerse ahí. Los autores construyeron explícitamente la hipótesis rival — un relleno masivo identificable en las marcas de tiempo —, la pusieron a prueba y la refutaron mostrando que la concentración temporal alcanza también a los médicos titulados. La consecuencia es operativa, no cosmética: si la hipótesis temporal hubiera sobrevivido, el remedio habría sido «eliminar las filas escritas en masa»; el remedio correcto es «eliminar las filas de las cuentas señaladas y dejar de confiar en la columna de fecha». Llegan a prohibirse cualquier afirmación temporal en el resto del artículo, y a revelar que una versión anterior de su propio pipeline filtraba al comparar cadenas de texto con nombres de institución.

Los resultados preregistrados se publican en negativo. La receta anunciada — primero el proxy abundante, después el refuerzo sobre los casos especialistas — no funcionó, y de hecho resultó peor que la versión contaminada de una sola etapa. Los autores lo informan así, con tres contrastes cuantificados y tres valores de penalización, en lugar de reformular el objetivo a posteriori. Además replican la comparación SFT/DPO/GRPO en 4B para mostrar que el fracaso de los objetivos de refuerzo no es un artefacto de modelo pequeño, y precisan honestamente que en este escenario de dos acciones el GRPO se reduce a un gradiente de política clásico y el DPO a una pérdida logística — de modo que nada aquí dice nada sobre el aprendizaje por refuerzo en tareas de razonamiento largo.

La destilación está contabilizada hasta el final. Presupuesto de llamadas (943), rendimiento (mediana de 12,1 s, cero respuestas no analizables en el primer tramo de 472), ruido del profesor medido reetiquetando 100 patrones (24 % de repeticiones idénticas, 72 % dentro de ±0,05, rango absoluto medio 0,053), curva de eficiencia del presupuesto de etiquetas y análisis de sensibilidad al solapamiento entrenamiento-prueba (16 de los 944 patrones coinciden con un patrón del panel, cubriendo 18 de 642 individuos; excluirlos mueve el AUROC de 0,940 a 0,940). Es el nivel de contabilidad que falta en casi todos los artículos de destilación clínica.

Lo que está menos bien

La auditoría, que es el corazón del artículo, es enteramente descriptiva. El gradiente monótono del 15,7 % al 0,7 % no viene acompañado de ninguna prueba, ningún intervalo, ningún valor p. La «refutación» de la hipótesis de las marcas de tiempo se apoya en una comparación cualitativa — las filas de los médicos titulados están «más concentradas» — sin cuantificar esa diferencia. Los propios autores califican su auditoría de cota inferior, ya que detecta cuentas que nunca registran un positivo y deja pasar cualquier comportamiento de relleno por defecto más sutil. La conclusión probablemente sea correcta; se presenta sin el aparato que permitiría al lector comprobarlo.

El panel está enriquecido al 40,3 % de deterioro mientras el programa registra un 2,6 %, y no existe ninguna tabla de características de los pacientes. Los autores señalan el primer punto y se niegan explícitamente a reclamar rendimiento poblacional — algo que hay que reconocerles. Pero todos los AUROC agrupados del artículo viven en ese mundo enriquecido, y el modo de fallo de la métrica engañosa está ahí mismo: un AUROC de 0,940 en una cohorte con 40 % de positivos no dice nada sobre lo que el modelo haría al umbral de 0,10 en la población real del cribado. Más incómodo aún: la edad, el sexo y el nivel educativo de los 672 individuos no aparecen en ningún sitio como valores; solo figuran como variables de entrada. Resulta por tanto imposible evaluar el sesgo de población — qué franja de edad, qué proporción de mujeres, qué nivel de escolarización, en un país donde la educación formal de las cohortes mayores varía enormemente según la provincia. El mismo punto ciego afecta a la evaluación: el tamaño muestral efectivo se estima cerca de 158 sobre 642 individuos, con una correlación intraclase del desenlace de 0,360; varios resultados nulos son por tanto indeterminados y no igualdades establecidas, como los autores reconocen.

La palabra «preregistrado» aparece cuatro veces sin ir nunca acompañada de un identificador. Ni registro, ni número de OSF, ni DOI de protocolo, ni fecha de depósito. En un artículo cuyo argumento central es que hay que auditar la procedencia de los datos antes de usarlos, la ausencia de procedencia verificable de su propio protocolo es una ironía costosa. Se suman tres debilidades de la misma familia. Los datos y el código se anuncian como «artefactos congelados regenerables mediante scripts publicados», pero siguen disponibles a petición del autor correspondiente: nada está depositado públicamente. La institución usada como centro apartado es exactamente la afiliación de la autora correspondiente y de todas las personas agradecidas por la curación de datos; no es una validación externa, y los autores tampoco la presentan como tal. Por último, los brazos de 1,5B y 3B son Qwen2.5 mientras que los de 4B y 8B son Qwen3, de modo que toda comparación entre tamaños confunde la escala con la generación de modelo — incluida la conclusión más citable del artículo, la de que la penalización de la cadena de pensamiento se reduce a medida que el modelo crece.

Lo que cambia

Para la comunidad investigadora. El resultado transferible no es la cifra de 0,940, sino el procedimiento de dos columnas. Identificador de operador, volumen y positividad: esos tres campos ya existen en casi cualquier base de datos de servicio y bastan para descubrir que el 40 % de una columna de desenlace está rellenada por defecto, antes de entrenar un solo modelo. La segunda lección resulta más incómoda para la moda actual: con unos cientos de casos especialistas, una regresión logística de 21 variables bien calibrada no es superada por ningún ajuste fino, ninguna optimización de preferencias, ningún refuerzo. El techo lo fijan los instrumentos y el estándar de referencia, no la capacidad del modelo. Es el mismo veredicto que en nuestro decriptaje sobre la pancreatitis aguda grave, donde el random forest planta cara al aprendizaje profundo, y sigue verificándose.

Para clínicos y gestores de programa. La cifra que hay que recordar es 2,60 % frente a 4,37 %. La prevalencia aparente de un cribado nacional dependía, en aproximadamente la mitad, del comportamiento de introducción de datos de unos cientos de cuentas. Cualquier indicador de gestión construido sobre esa columna — cobertura, tasa de derivación, rendimiento del cribado — estaba equivocado en la misma proporción, con independencia de cualquier cuestión de inteligencia artificial. El segundo punto práctico atañe a la calibración: solo tres brazos producían probabilidades utilizables en el umbral de 0,10 del programa, y varios modelos por lo demás fuertes en discriminación señalaban a todo el mundo. Un AUROC no dice nada sobre lo que ocurre en un umbral dado, como ya mostraba nuestra lectura de los scores de mortalidad en cuidados intensivos y sus curvas de decisión.

Para pacientes y público. De 105 893 personas evaluadas por este programa, la base registró 1 deterioro cognitivo leve y 7 demencias. Eso no es una realidad epidemiológica: es la huella de una columna rellenada por defecto. La consecuencia no es un mal diagnóstico emitido por una máquina, sino algo más corriente y más extendido — personas realmente cribadas cuya derivación nunca se registró, y una estadística de salud pública que subestima la necesidad. La paradoja final del artículo merece enunciarse tal cual: el mejor modelo del estudio no vio nunca una sola etiqueta médica, y su superioridad sobre su propio profesor puede explicarse igual de bien porque promedia el ruido del profesor como porque el propio estándar especialista es un registro rutinario ruidoso, de un solo lector y sin adjudicación. Los dos mecanismos son indistinguibles aquí, y los autores no pretenden separarlos.

Para saber más

El preprint: Default-filled outcome labels in a deployed cognitive-screening programme: an operator-level audit and the construction of twenty-four language-model arms, medRxiv, DOI 10.64898/2026.08.28.26361585, publicado el 2 de septiembre de 2026, bajo licencia CC BY 4.0. Autores: Jun Ji (Universidad de Qingdao, autor remitente), Zhigang Sun, Xiaofang Ying, Jinyu Hao, Zhiqiang Fu, Dongmei Shi, Xiaoming Kong, Yijie Xu, Xiaojuan Zhang, Xiaoli Du, Zhiyan Zhang, Xinhong Liu, Ping Lin y Huali Wang (Peking University Sixth Hospital, autora correspondiente) — catorce autores repartidos entre centros de salud mental y centros de salud comunitaria de diez provincias chinas. Aprobación ética: Comité de Ética del Medical College de la Universidad de Qingdao, n.º QDU-HEC-2025431, 22 de mayo de 2025. Sin financiación específica, sin conflictos de interés declarados. El conjunto de datos desidentificado, el código de análisis y los artefactos derivados se anuncian como disponibles a petición de la autora correspondiente; los registros fuente identificables los custodia la Beijing Medical Award Foundation y no pueden redistribuirse. Los autores declaran haber utilizado Claude (Anthropic) de forma extensiva y bajo su dirección para escribir y revisar los scripts de análisis y entrenamiento, construir las herramientas de verificación que cotejan las cifras del manuscrito con los ficheros de resultados congelados, y redactar el texto. Un artículo compañero, anunciado pero aún no identificable, reutiliza las predicciones congeladas de este estudio para cuantificar el efecto de las decisiones de diseño de la evaluación frente a la elección de modelo. Instrumentos citados: AD-8 (Galvin et al., Neurology 2005) y el Hong Kong Brief Cognitive Test, derivado del CSI-D.