CBCT 上颌窦:当文本和标签出自同一个大模型,AUC 从 1.00 跌到 0.84
来自伦敦玛丽女王大学和阿卜杜勒-阿齐兹国王大学的三位研究者,在同样的 300 张牙科 CT 断层图像上,比较了八个视觉网络、七个语言模型和五个视觉-语言模型,任务只有一个二分类问题:这个上颌窦是正常还是病变?语言模型的 AUC 达到 0.99 至 1.00——直到一位放射科医生重新审阅这 297 个病例,重新判定了其中 62 例(21%),这些模型随即跌回 0.84–0.85,而视觉网络纹丝不动。这篇论文正是为了得出这个结论而设计的:当训练文本和标签出自同一个语言模型时,所谓性能衡量的是一台机器与自身的一致性,而不是诊断内容。
背景
CBCT(cone-beam computed tomography,锥形束计算机断层扫描)是牙科诊所的常规扫描设备:一种低剂量三维成像,用于种植体规划、根管治疗准备或口腔颌面外科手术。它的视野几乎总会覆盖上颌窦——位于上磨牙上方的含气腔隙。因此常常会发现无人刻意寻找的异常:黏膜增厚、潴留性假性囊肿、部分不透光、气液平面。这些偶然发现并非无关紧要——它们会影响是否植入后牙区种植体或是否进行上颌窦提升术的决策。但是否报告完全取决于操作者,而且耗时。
于是产生了自动化的需求。迄今为止,牙科 CBCT 的文献主要评估单模态卷积网络。作者 Seba Al-Hebshi、Hanadi Khalifa 和 Tuan D. Pham 表示,他们在 PubMed 上检索了 2015 年 1 月至 2026 年 7 月的文献,未发现任何研究在同一数据集、同一交叉验证划分下比较三大类方法:纯图像、纯文本和视觉-语言。
不过这篇预印本真正的价值在别处,而且远远超出上颌窦本身。一种做法正在健康人工智能研究中迅速蔓延:因缺乏足够的人工标注,就让大语言模型生成训练其他模型所需的文本描述——有时甚至是标签。这篇论文构建了一套协议来衡量这种做法的代价。答案是量化的,而且相当刺眼。
方法
数据。数据集是 MMDental,2025 年发表于 Scientific Data,以 CC-BY 许可公开于 Figshare。作者从中抽取了 300 张正中矢状面断层图像——每个病例仅一张二维图像,没有三维体数据。数据来源是中国的单一家医院(丽水学院医学伦理委员会批准,编号 2022YR014)。患者人数从未给出:病例仅以图像编号标识。任务是二分类:「异常」涵盖黏膜增厚、潴留性假性囊肿、不透光和气液平面;「正常」指气化良好、窦壁完整的上颌窦。
标签工厂——整个设计的核心。每张图像独立提交给 ChatGPT 三次,提示词要求它扮演口腔颌面放射科顾问医师,描述侧别、窦内位置、严重程度以及与邻牙的关系。三次阅片通过多数表决融合为一份代表性描述,并附带一个临时标签。随后,这份描述连同图像一起交给一位放射科医生(本文作者之一),由她独立作出自己的诊断,并再由团队中的一位口腔修复科医师复核。三个病例因资料不足被剔除,剩下 297 例,146 例正常、151 例异常。
随后协议在完全相同的折上比较三种条件:Raw(n = 300,ChatGPT 标签)、Pre(n = 297,ChatGPT 的临时标签)和 Post(n = 297,放射科医生确认的标签)。关键之处在于:Pre 与 Post 之间只有标签改变。所见描述文本完全一致。因此任何性能差异都只能归因于标签的来源——与架构无关,与图像内容无关,也与文本改写无关。
模型。八个在 ImageNet 上预训练并针对该任务微调的视觉网络:ResNet-50、DenseNet-121、EfficientNet-B0、GoogLeNet、AlexNet、NASNet-Large、PNASNet-5-Large 和 ViT-B/16(AdamW,学习率 10⁻⁴,最多 50 轮,批大小 16,随机种子 42)。七个仅在所见描述字段上训练的语言模型,已删除其中显式的分类行:BiLSTM、TextCNN、BERT-base、RoBERTa-base、DistilBERT、BioBERT 和 Bio_ClinicalBERT。五个采用线性探针(linear probing:冻结编码器,提取表征向量,只在其上训练一个逻辑回归)的视觉-语言模型:CLIP ViT-B/16、BiomedCLIP、Qwen2.5-VL-7B、MedGemma-4B 和 LLaVA-Med v1.5,在架构允许时分别设置纯图像、纯文本和图像+文本探针。
评估。十折分层交叉验证,所有分支和两种标签条件共用同一套折划分。逐折均值 ± 标准差,基于 t 分布的 95% 置信区间,以及汇总混淆矩阵。卷积网络的可解释性使用 Grad-CAM。
结果
视觉:诚实而稳定。八种架构的 AUC——即 ROC 曲线下面积,也就是模型给随机抽取的病变上颌窦打分高于健康上颌窦的概率——分布在 0.799 至 0.880 之间。PNASNet-5-Large 领先(0.880,95% CI 0.850–0.910),其后是 DenseNet-121 和 EfficientNet-B0(各为 0.863)。EfficientNet-B0 的表现最为均衡:准确率 0.800,敏感度 0.787,特异度 0.813。ViT-B/16 明显落后(准确率 0.700,AUC 0.799),且不对称性很说明问题:特异度 0.860,但敏感度仅 0.540,意味着 69 个病变上颌窦被判为正常。这正是一个数据饥渴型架构在数百张图像上训练时的典型特征。
语言:可疑的天花板。七个文本模型的准确率达到 0.977 至 0.993,AUC 达到 0.992 至 1.000。Bio_ClinicalBERT 取得完美的 AUC 1.000;BERT-base、DistilBERT 和 BioBERT 的准确率均为 0.993,即 300 例中仅错 2 例。一份撰写规范的放射学文本确实可能比图像更容易分类——但临床任务上的满分成绩,永远应该触发一次核查。
来源检验。论文的价值正在于此。放射科医生重新判定了 297 例中的 62 例,即 21%,两个方向几乎各占一半:32 例低判(ChatGPT 读作「正常」,而医生看到异常,多数为轻度黏膜增厚)和 30 例高判。在输入文本保持不变的前提下,用这些修正后的标签重新训练:
- 语言模型全线崩塌。BERT-base 从 0.999 降至 0.837。RoBERTa-base 从 1.000 降至 0.853。无一例外,全部下滑。
- 视觉-语言模型的文本探针同样如此。CLIP ViT-B/16 纯文本:0.999 → 0.841。MedGemma-4B 图像+文本:1.000 → 0.892。
- 视觉模型毫不动摇。八个中有六个略有提升(+0.006 至 +0.030):DenseNet-121 从 0.867 升至 0.891,PNASNet-5-Large 从 0.857 升至 0.887。EfficientNet-B0 基本持平(−0.003),ViT-B/16 小幅回落(−0.027)。
- 视觉-语言模型的纯图像探针几乎不动。MedGemma-4B:0.875 → 0.835。Qwen2.5-VL:0.741 → 0.723。
结论毫不含糊。ChatGPT 生成的文本编码的并不是诊断内容,而是 ChatGPT 自己给自己贴的标签。语言模型学到的不是如何读一个上颌窦,而是如何从另一个模型的措辞中还原它自己的结论。这是一种循环式标签泄漏——经典数据泄漏的一个变体,其中关于目标的信息不是通过患者泄漏,而是通过标注流程本身泄漏。修正 21% 的标签,就足以让 AUC 损失 0.15。而图像承载的是真实信号:其性能不依赖于标签由谁书写,标签更准确时甚至还有所提升。
生成式报告撰写。一个探索性分支要求 Qwen2.5-VL-7B、MedGemma-4B 和 LLaVA-Med v1.5 生成结构化报告。Qwen 生成的报告最长(平均 161 词,另两者为 78 和 88 词),且其中 66% 结尾没有句末标点,说明触及了生成长度上限。更关键的是,在输入未指明侧别的异常病例中,Qwen 在 150 例中有 17 例(11%)凭空编造了侧别,MedGemma 为 150 例中的 4 例(3%),LLaVA-Med 则一例也没有。此外,MedGemma 在 300 份报告中的 200 份(67%)里原样复制了未填写的临床模板,连占位字段都保留了下来。
临床换算。假设由最佳图像模型(EfficientNet-B0,敏感度 0.787 / 特异度 0.813,异常患病率 51%)阅读 1 000 个上颌窦,约有 109 个病变上颌窦被漏诊,约 92 个健康上颌窦被误标。在诊所层面,它仍然只是一个预阅片工具,而非决策工具。至于自动撰写报告,每九例就编造一次侧别足以判其出局:上颌窦报告里的一个错误侧别,可能意味着在错误的一侧做了上颌窦提升。
做得好的地方
1. 该协议精确隔离了真正关键的变量。相同的折、相同的种子(42)、相同的文本,Pre 与 Post 之间只有标签不同。这是严格意义上的对照实验,其结果无法归因于别的因素。健康人工智能文献中充斥着混杂效应;这一篇没有。
2. 论文记录了自己本可能被蒙蔽的机制。作者从输入文本中删除了「Classification: normal/abnormal」这一行——这是正确的预防措施——结果 AUC 仍然是 1.000。于是他们去追查原因,而不是把这个数字发表出去。如果没有 Post 这一分支,这篇预印本不过是又一篇宣称在牙科放射学中取得完美 AUC 的论文。这与基准竞赛所鼓励的做法恰好相反。
3. 材料层面的透明度是实实在在的。代码公开于 GitHub(sinus-cbct-benchmark,提交 32d5595,2026 年 8 月 8 日),数据集以 CC-BY 公开,ChatGPT 生成的文本和放射科医生的文本均已提供,预印本采用 CC BY 4.0,无资助,无申报的利益冲突。Grad-CAM 的使用也很诚实:作者展示了 AlexNet 在一个分类正确的病例上,激活集中在牙列而非上颌窦腔——这是典型的捷径学习,他们对此评论道,「正确的预测和产生该预测的正确理由,并不是一回事」。
做得不够好的地方
1. 金标准本身仍被论文所批判的东西污染。放射科医生并非盲法重读图像:她同时拿到了图像和 ChatGPT 的描述。因此结构上存在锚定偏倚的可能——作者也承认了这一点(「参考标准部分源自放射科医生确认之前的 LLM 阅片,这可能引入系统性偏倚」)。只有一位阅片者,没有第二位独立放射科医生,因此没有 kappa 值,也没有任何观察者间一致性指标。21% 的重判率很可能只是下限:若采用盲法,这一比例大概率更高。
2. 实验基础单薄,且无法分层。三百张来自中国单一家医院的二维正中矢状面断层图像,没有外部验证,没有前瞻性验证,没有独立留出的测试集——全部依赖交叉验证。正中矢状面是如何选定的(自动还是手动?)未作说明,而分析单位是图像而非患者:由于从未给出患者人数,无法排除同一患者的多张断层落入不同折的可能。作者没有合并 MMDental 的元数据,因此无法做任何亚组分析:既不能按性别(原数据集报告男性占 51.06%),也不能按年龄或严重程度。原始病历中未记录族裔。最后,二分类任务压平了一个临床连续谱:2 毫米的黏膜增厚与完全不透光被归入同一格。
3. 统计工具的严谨程度配不上论点的野心。没有任何显著性检验——没有 DeLong 检验,没有配对检验,全文没有一个 p 值——而论文的核心论点完全建立在条件之间的差值上。没有校准分析(既无 Brier 分数,也无期望校准误差和可靠性图),尽管 ChatGPT 曾输出置信度评级,却从未被使用。所使用的 ChatGPT 版本始终未予说明——模型、日期、温度参数、走 API 还是走网页界面,一概没有:因此该研究的核心结果并不能被精确复现。生成式分支是定性的、未评分的,作者也承认这一点。此外,摘要称纯图像探针的 AUC 为「0.63 至 0.69」,而结果部分最高达到 0.874:摘要只描述了对比学习类模型,却作了错误的推广。
这意味着什么
对研究界而言。这是最直接的应用点。LLM 标注之所以扩散,是因为它便宜且可扩展;这篇论文提供了检验它是否制造了一个空洞结果的最小协议。检验方法只需一句话:用人工修正后的标签重新训练,输入文本保持不变,折划分保持一致,然后比较。如果性能崩塌,那它衡量的就是 LLM 与自身的一致性。成本很低,而且应该成为所有标签或描述来源为合成数据的论文的审稿要求。推论同样有用:在这里,承载信号的是图像,而且标签变准之后其性能还略有提升。一种对标签噪声稳健的模态,是它在学习真实内容的一个迹象——但不是证明。
对临床医生而言。短期内没有可部署的东西。单中心二维断层上 0.88 的 AUC 不足以改变任何临床实践,监管成熟度为零——它既不是 CE 认证器械,也不是 FDA 批准的 SaMD,甚至算不上一个经过临床验证的原型。真正有操作意义的信息反而是防御性的:面对任何自动撰写报告的工具,首先要核对的就是侧别,因为当信息缺失时,这正是模型最愿意编造的内容——在最啰嗦的模型中占 11% 的病例。
对患者和公众而言。结论可以说得很简单:当一个人工智能被用它自己写的卷子来打分时,它几乎总能拿满分。这说明不了它的能力。医学人工智能领域发表的许多亮眼数字,都建立在无人核对过是否符合临床实际的自动标注之上。这次核对做了:一位放射科医生修正了五分之一的阅片结论,满分随之消失。
延伸阅读
- 预印本:Al-Hebshi S., Khalifa H., Pham T. D., Vision and Language Models for Classifying Maxillary Sinus Disease on Cone-Beam Computed Tomography: A Transparent Multimodal Benchmark,medRxiv,2026 年 8 月 12 日发布,DOI 10.64898/2026.08.11.26360189——CC BY 4.0 许可。
- 代码:github.com/sebaalhebshi/sinus-cbct-benchmark(提交 32d5595,2026 年 8 月 8 日)。预印本中未说明该仓库的许可协议。
- 数据集:Wang C., Zhang Y., Wu C. 等,MMDental — A multimodal dataset of tooth CBCT images with expert medical records,Scientific Data,2025;12:1172,以 CC-BY 许可发布于 Figshare(DOI 10.6084/m9.figshare.28505276)。
- 关于所评估的模型:Qwen2.5-VL(arXiv:2502.13923)、MedGemma(arXiv:2507.05201)、LLaVA-Med(NeurIPS 2023)、BiomedCLIP(NEJM AI,2025;2:AIoa2400640)。
- 关于 CBCT 上颌窦偶然发现的患病率:Rege I. 等,BMC Oral Health,2012;12:30;以及 Dogan S. 等,Scientific Reports,2024;14:15529。
Tatakoto 不提供个体化临床建议。本文描述并评析一篇科学出版物,不推荐任何工具或任何诊断方案。