一列诊断数据中有四成是默认填写:对中国某社区认知筛查项目的逐账号审计,以及在其上训练模型的二十四种方式

十四位中国作者打开了一个在中国内地常规运行的社区认知筛查项目的"认知状态"列——112 023 行数据,由 2 597 个录入账号写入——并发现其中 181 个账号(每个都录入了至少 100 条诊断,却从未记录过一例认知损害)写下了 45 315 行,占该列的 40.5%。随后他们在同一批患者上、以专科医师记录为参照标准,构建了 24 个模型分支:无论是监督微调、偏好优化还是强化学习,在几百例专科病例上都没能胜过项目里已在运行的 21 变量逻辑回归(AUROC 0.926)。唯一超过它的分支——一个跑在消费级显卡上的 Qwen3-4B,达到 0.940——完全没有见过医师标签:它是从一个前沿模型对项目自有未标注记录给出的 943 条判定中蒸馏出来的。

背景

服务型数据库——护士、社工或医生在每次服务接触时、在正常诊疗流程中填写的那些库——已经成为临床模型最青睐的标签来源。它们体量巨大且免费。作者毫不迂回地点出了问题:写下这些标签的过程,几乎从来没有在被拿去训练之前接受过审计。关于标签噪声(label noise)的文献懂得处理随机噪声或类条件噪声;但面对集中在少数几个录入账号里的噪声,它是没有武器的——这种噪声不会因样本量增大而被平均掉。

研究场景是一个在中国内地常规运行的社区认知筛查项目,其数据由Beijing Medical Award Foundation保管。每位居民接受两项工具:AD-8,向知情者提出的八个问题(知情者访谈:作答的是家属而非患者本人),以及 HKBC(香港简短认知测验),一项由 CSI-D 衍生的测验,包含九个认知条目加一项即时回忆。一个 21 变量的逻辑回归——8 个 AD-8 条目、9 个 CSI-D 条目、即时回忆、年龄、性别、受教育程度——在概率阈值 0.10 处标记需要转诊的居民。

这个数据库里有两类性质相反的资产。一类大而廉价:112 023 行认知状态记录,覆盖 105 893 名接受评估者——103 688 人记为正常,2 197 人记为未特指的认知损害,1 例轻度认知障碍,7 例痴呆。另一类小而昂贵:672 名由具备职称(主治及以上)的医师记录了认知状态的个体。本文要回答的问题是:使用这两类资产的每一种方式,究竟买到了什么,代价又是多少。

方法

审计。对 2 597 个操作员账号中的每一个,作者只数两件事:录入的诊断条数,以及其中记录了任何损害的比例。检测规则标记出录入至少 100 条诊断且零损害的账号。方法上的关键一步:他们检验了一个竞争性解释。如果这些零来自批量处理(一次自动导入),它们应当在写入时间戳上聚集。事实上确实如此——表中最密集的一秒钟包含 26 694 行——但这一效应波及所有操作员类别,而且有职称医师的记录在时间戳上比无职称账号更集中。结论:写入时间列是一次性的数据库迁移产物,而不是自动填充的特征。该列被取消资格;操作员这一维度则成立。全文任何地方都没有做出时间性的论断。

24 个分支。它们覆盖了一个真实项目所面临的监督选择空间。以医师标签重新拟合的 21 变量回归是标杆。四个本地语言模型——Qwen2.5-1.5B 与 3B、Qwen3-4B 与 8B,以 4 比特加载,在一块 8 GB 的消费级显卡上用 LoRA 训练——分别以零样本、带显式思维链、在医师标签上微调、在常规标签上微调(分"去污染"与不去污染两版,去污染即剔除录入 ≥ 200 条诊断且零损害的账号所写的行:54 个账号、27 616 行)、以及在一项代理任务(HKBC 分数段)上微调等形式出现——后者刻意占据与临床判定不同的标签空间。此外还有 DPO(直接偏好优化)与 GRPO(组相对策略优化)变体、预注册的"先代理后强化"两阶段配方(含三档漏诊惩罚)、一个零样本查询的专有前沿模型(gpt-5.6-pro),以及最后把该前沿模型分别蒸馏进回归和本地 4B。

蒸馏,连成本一起算清。项目的未标注池被缩减为 42 823 行,归并后为 15 127 个不同的渲染模式。一种无标签的分层抽样(AD-8 阳性条目数加 CSI-D 错误数,共九个区间)配合存储的入样概率,产生了实际由前沿模型标注的 943 个模式。4B 学生模型在其上以加权交叉熵训练(Horvitz-Thompson 权重,均值 1,最大 44.8),耗时 七分钟。监督总成本:943 次调用,每次约 12 秒,大约三小时的"教师时间"。该分支的训练中没有进入任何一个医师标签。

评估。单一的五折划分,按结局分层并以机构簇分组(机构身份通过平台的团队注册表解析),使任何一个簇都不跨折——这一点经程序化核查。作者顺带指出,该项目的一个早期版本曾以原始机构名称字符串做比较并发生了泄漏;公布的折是重新切分过的。所有分支均按折外评分。一整家机构(北京大学第六医院)被完全留出,余下的开发面板为 38 家机构的 642 人,其中 259 人有损害(40.3%)。配对对比采用 2 000 次抽样的簇自助法。指标包括:AUROC、期望校准误差(ECE)、校准斜率、饱和度,以及在项目部署阈值 0.10 处的净获益,按每 100 人相对最佳平凡策略报告。

结果

审计。181 个被标记的账号写下 45 315 行,占该列的 40.5%;有六个账号各自录入超过 1 000 条诊断而无一例损害,最多的一个为 3 960 条。记录到的损害比例随账号录入量单调下降:1–9 行的账号为 15.7%,10–49 行为 3.4%,100–499 行为 2.1%,500–999 行为 0.7%。剔除被标记的账号后,项目观察到的损害率从 2.60% 上升到 4.37%——仅仅排除几百个录入账号,一个全国性筛查项目的表观患病率就几乎翻倍。

分支排名。在专科参照标准下,在用的回归取得 AUROC 0.926[0.873–0.956]。没有任何本地训练的分支超过它。在医师标签上微调最高只到 0.924(4B 与 1.5B 皆然);DPO 降至 0.881,GRPO 降至 0.789——在起点、折划分与超参数完全相同的条件下,分别比其监督同胞低 0.043 和 0.135。预注册的两阶段配方劣于它那个受污染的单阶段基线(−0.030;95% CI −0.077 至 −0.004),也劣于把强化目标换成交叉熵的消融版本(−0.057)。在受污染的常规标签语料上训练的分支(0.899)与同一个未训练模型(0.890;Δ +0.009,−0.014 至 +0.024)无法区分:受污染的监督什么也没买到。仅在代理任务上训练的分支塌到 0.792,比它自己的零样本基线还低 0.098。

思维链会拉低表现。要求模型在作答前显式推理,在每一个规模上都降低了区分度:1.5B 为 −0.072,3B 为 −0.080,4B 为 −0.041,8B 为 −0.012(不显著)。这一惩罚随规模缩小,但从未变成增益。

前沿模型与它的学生。gpt-5.6-pro 零样本达到 0.932,与回归在统计上无法区分(+0.007,n.s.):作为预测器,它没有带来任何东西。作为标注工具,情况就不同了。蒸馏得到的 4B 达到 0.940[0.898–0.963],高于回归(+0.014;0.004 至 0.031),也高于它自己的教师(+0.008;0.001 至 0.017)。标签预算很早就饱和:仅 50 个教师标签时已达 0.937,200 个时为 0.940,用满 943 个仍是 0.940。

校准比区分度更能分辨优劣。只有三个分支校准良好——回归(ECE 0.039)、前沿模型(0.041)和蒸馏 4B(0.045)——而它们恰好就是固定阈值下决策价值站得住脚的那三个。在医师标签上微调的 4B 则是 ECE 0.102、斜率 0.40、68% 的输出饱和。1.5B、3B 和 8B 的零样本分支在部署阈值上把面板中 100% 的人都标记出来:它们塌缩成"全部转诊"这一平凡策略。DPO 分支的输出有 99% 饱和。换算成决策:每评估 100 人,蒸馏分支相对最佳平凡策略的净获益为 +3.13,教师为 +2.94——但作者提醒,在配套论文中,这些对比带上区间并做了多重性校正之后,可部署分支之间没有任何一个对比排除零。

留出机构把一切颠倒过来。在留出医院的 58 人上,排名完全重排:零样本 3B 为 0.925,零样本 4B 为 0.894,8B 为 0.875,冻结的回归为 0.869,前沿模型为 0.851,蒸馏 4B 为 0.843,零样本 1.5B 为 0.808。面板上的赢家在这里排到倒数第二。作者自己说得很清楚:在那里没有任何一个分支能与另一个区分开来,这项核查是为了透明而报告的,不是用来做选择的。

做得好的地方

对竞争性解释的检验,是审计与轶事之间的分界线。发表"该列 40% 来自可疑账号"然后收笔,本来是很容易的。作者明确构造了对立假设——可在时间戳中识别的批量填充——加以检验,并通过展示时间集中同样发生在有职称医师身上而将其驳倒。后果是操作层面的,不是修辞层面的:如果时间戳假设成立,补救办法应是"剔除批量写入的行";而正确的补救办法是"剔除被标记账号所写的行,并且不再信任日期列"。他们甚至因此禁止自己在论文其余部分做任何时间性论断,并主动披露自己流程的早期版本曾在机构名称字符串上发生泄漏。

预注册的结果以否定形式发表。他们宣称的配方——先用大量代理标签,再在专科病例上做强化——没有奏效,而且实际比受污染的单阶段版本更差。作者就这样报告出来,附上三个量化对比和三档惩罚取值,而不是事后重新表述目标。他们还在 4B 上复现了 SFT/DPO/GRPO 的比较,以证明强化目标的失败不是小模型的产物,并诚实地指出:在这个两动作的设定里,GRPO 退化为带精确基线的普通策略梯度,DPO 退化为逻辑边际损失——因此本文对长程推理任务上的强化学习没有任何发言权。

蒸馏的账算到了底。调用预算(943)、吞吐(中位 12.1 秒,首批 472 次调用中零条无法解析的响应)、通过对 100 个模式重复标注测得的教师噪声(24% 的重复完全一致,72% 在 ±0.05 以内,平均绝对极差 0.053)、标签预算效率曲线,以及训练-测试重叠的敏感性分析(944 个模式中有 16 个与面板模式相同,覆盖 642 人中的 18 人;剔除后 AUROC 从 0.940 变为 0.940)。这是几乎所有临床蒸馏论文都缺少的记账水平。

做得不够好的地方

作为全文核心的审计,完全是描述性的。从 15.7% 到 0.7% 的单调梯度,没有配任何检验、任何区间、任何 p 值。对时间戳假设的"驳倒"依赖于一个定性比较——有职称医师的记录"更集中"——却没有量化这一差距。作者自己也把这次审计称为下界,因为它只能发现从不记录阳性的账号,而放过任何更隐蔽的默认填写行为。结论很可能是对的;但它的呈现方式并未附带让读者自行核验的工具。

面板被富集到 40.3% 的损害率,而项目本身记录的是 2.6%,并且全文没有任何一张患者特征表。作者指出了第一点,并明确拒绝据此宣称人群层面的性能——这一点值得肯定。但论文中所有的合并 AUROC 都活在那个被富集的世界里,误导性指标这一失败模式就在眼前:在一个 40% 为阳性的队列上取得 0.940 的 AUROC,并不能说明该模型在真实筛查人群中、在 0.10 阈值处会做什么。更麻烦的是,这 672 人的年龄、性别和受教育程度从未以数值形式出现在任何地方:它们只作为模型的输入变量存在。因此无法评估人群偏倚——年龄分布如何、女性占比多少、受教育水平如何,而在一个老年队列正规教育程度因省份而差异极大的国家,这些都不是小事。同样的盲区也影响评估:有效样本量估计约为 642 人中的 158,结局的组内相关系数为 0.360;因此若干零结果只是不确定,而非已确立的等价——这一点作者也承认。

"预注册"一词出现了四次,却从未附带任何标识号。没有注册平台,没有 OSF 编号,没有方案 DOI,没有提交日期。在一篇核心论点是"使用数据前必须审计其来源"的论文里,自身方案缺乏可核验来源是一种代价不小的反讽。同一类的还有三处弱点。数据与代码被宣称为"可由公开脚本重新生成的冻结产物",但实际仍是向通讯作者索取——没有任何公开存档。被用作留出机构的那家医院,恰好就是通讯作者以及所有因数据整理而致谢者的所属单位;这不是外部验证,作者本人也没有把它当作外部验证来呈现。最后,1.5B 与 3B 分支用的是 Qwen2.5,而 4B 与 8B 用的是 Qwen3,因此任何跨规模的比较都把规模与模型代际混在了一起——包括本文最容易被引用的那个结论:思维链的惩罚随模型增大而缩小。

这意味着什么

对研究界。可迁移的成果不是 0.940 这个分数,而是那套只需两列数据的流程。操作员标识、录入量、阳性率:这三个字段几乎存在于所有服务型数据库中,而且足以在训练任何模型之前,就发现一列结局数据中有 40% 是默认填写的。第二个教训对当下的风潮更不友好:在几百例专科病例上,一个校准良好的 21 变量逻辑回归,没有被任何微调、任何偏好优化、任何强化学习击败。天花板是由测量工具和参照标准设定的,而不是由模型容量设定的。这与我们此前解读重症急性胰腺炎中随机森林与深度学习分庭抗礼时得出的判断相同,并且仍在不断被验证。

对临床医生与项目管理者。要记住的数字是 2.60% 对 4.37%。一个全国性筛查项目的表观患病率,大约有一半取决于几百个账号的录入行为。任何建立在这一列之上的管理指标——覆盖率、转诊率、筛查阳性产出——都以同样的比例失真,这与人工智能与否毫无关系。第二个实务要点关于校准:只有三个分支能在项目的 0.10 阈值上给出可用的概率,而另外几个区分度不俗的模型却把所有人都标记了出来。AUROC 对某个特定阈值上会发生什么只字未提,这一点我们在解读重症监护死亡风险评分及其决策曲线时就已指出。

对患者与公众。在该项目评估过的 105 893 人中,数据库记录下 1 例轻度认知障碍和 7 例痴呆。这不是流行病学现实:这是一列被默认填写的数据留下的痕迹。后果不是机器做出的错误诊断,而是更平常、也更普遍的东西——真正接受了筛查、但转诊从未被记录下来的人,以及一项低估了实际需求的公共卫生统计。本文最后的那个悖论值得原样说出:研究中表现最好的模型从未见过一个医师标签,而它胜过自己教师的原因,既可以是它把教师的表述噪声平均掉了,也同样可以是专科参照标准本身就是一份有噪声的常规记录,单人阅读、无仲裁。这两种机制在此无法分开,作者也没有声称能分开。

延伸阅读

预印本:Default-filled outcome labels in a deployed cognitive-screening programme: an operator-level audit and the construction of twenty-four language-model arms,medRxiv,DOI 10.64898/2026.08.28.26361585,2026 年 9 月 2 日上线,采用 CC BY 4.0 许可。作者:Jun Ji(青岛大学,投稿作者)、Zhigang Sun、Xiaofang Ying、Jinyu Hao、Zhiqiang Fu、Dongmei Shi、Xiaoming Kong、Yijie Xu、Xiaojuan Zhang、Xiaoli Du、Zhiyan Zhang、Xinhong Liu、Ping Lin,以及 Huali Wang(北京大学第六医院,通讯作者)——十四位作者分布在中国十个省份的精神卫生中心和社区卫生服务中心。伦理批准:青岛大学医学院伦理委员会,批件号 QDU-HEC-2025431,2025 年 5 月 22 日。无专项经费资助,无利益冲突声明。去标识化数据集、分析代码与衍生产物据称可向通讯作者索取;可识别的源记录由Beijing Medical Award Foundation保管,不可再分发。作者声明在本研究中广泛使用了 Claude(Anthropic)并由作者主导,用于撰写和修订分析与训练脚本、构建将稿件数字与冻结结果文件交叉核对的验证工具,以及起草与修订正文。一篇已宣布但尚无法确认标识的配套论文,复用了本研究冻结的预测结果,用以量化评估设计选择相对于模型选择的影响。所引工具:AD-8(Galvin 等,Neurology 2005),以及由 CSI-D 衍生的香港简短认知测验(HKBC)。