不做活检就给基底细胞癌分亚型:皮肤镜上 0.784 的 AUC 究竟值多少
塞萨洛尼基亚里士多德大学的一个团队,用一个预训练视觉转换器仅凭单张皮肤镜图像区分侵袭性基底细胞癌与较轻类型,数据为 2018 至 2022 年间在希腊一个科室采集的 1 271 张图像。模型的 AUC 为 0.784,ResNet-50 为 0.755;在 70% 特异度下灵敏度为 70.0%,而一项已发表研究报告受过培训的皮肤科医生为 56.4%。但人类对照来自另一批图像,工作点是为了使比较成为可能而设定的,没有做任何外部验证,而且论文自始至终没有说明这 1 271 张图像背后究竟有多少位患者。
背景
基底细胞癌是人类最常见的癌症,远超其他类型:作者指出它占皮肤癌诊断的近 80%。它几乎从不转移,但会局部破坏组织,而且更关键的是,它并非同质的单一疾病。病理学区分出若干组织学亚型,而这一区分决定治疗方案。所谓侵袭性类型——浸润型、硬斑病样型、微结节型、化生型——在皮下不规则扩展,其延伸部分肉眼看不见;它们需要莫氏显微描记手术,即逐层切除并在术中对切缘做组织学控制,耗时且昂贵。相反,浅表型往往可以用冷冻治疗、咪喹莫特、光动力疗法或单纯切除处理。
实际困难在于,这种分流目前必须先做诊断性活检:一项有创、疼痛、耗费金钱与时间并且延迟治疗的操作。于是本预印本提出的问题是:皮肤镜——通过一个能压制皮肤表面反光的带光放大镜观察皮损——所含的信息,是否足以在不经实验室的情况下预测亚型?
从临床角度看这个问题并不新。皮肤镜文献已经描述了与侵袭性亚型相关的判读标准,而作者引用的一项研究测量了人类专家能从中读出多少:三十位读片者在接受专门培训前后,对 235 例基底细胞癌进行分类。培训后,他们识别侵袭性类型的灵敏度从 42.3% 升至 56.4%,特异度稳定在约 71%。换言之,即便受过培训,专家皮肤科医生凭肉眼仍会漏掉十例侵袭性肿瘤中的四例以上。这就是本文试图超越的低基准——而据作者所述,此前没有任何工作把皮肤镜与深度学习结合用于这一具体的亚型划分任务。
方法
这是一个二分类任务,不是亚型划分。尽管标题如此,模型并不预测组织学亚型。作者把皮损分为三族——浅表型(275 张图像)、非浅表非侵袭型(726 张,多为结节型)与侵袭型(270 张)——然后把前两者合并为一个 1 001 张图像的「低风险」类。因此模型只回答一个问题:侵袭性与否?这在临床上站得住脚,因为正是这条界线触发莫氏手术,但它改变了「亚型划分」一词的含义。
模型。作者从 BEiT-Large 出发,这是一个视觉转换器(vision transformer,ViT):该架构把图像切成小方块——此处输入为 512 × 512,方块为 16 × 16 像素,即 32 × 32 的 token 网格——并像处理句子中的词那样处理它们,每个方块都能「看到」其他所有方块。约 3 亿参数,24 层,16 个注意力头。初始权重来自在自然图像上通过掩码图像建模(遮住图像的一部分,让模型学会复原)完成的预训练——论文自始至终没有点明具体语料,这对可复现性是个令人不适的遗漏。
两个适配阶段。首先是域适配:模型在公开的 ISIC 档案的 53 826 张图像(涵盖黑色素瘤、痣、角化病、鳞状细胞癌等九类皮损)上全量重训练 100 个周期。随后在塞萨洛尼基的 1 271 张图像上进行第二次全量重训练:10 个周期,学习率 10⁻⁵ 并采用余弦衰减,批量为 16,对少数类过采样以平衡每个批次,并使用常规增强(翻转、旋转、平移、亮度与对比度变化)。对照模型是在「相同配置与相同计算预算」下训练的 ResNet-18 与 ResNet-50。
数据。一个私有数据集,2018 年 1 月至 2022 年 12 月间建于亚里士多德大学第一皮肤科,受试者为高加索人,使用 Dermlite Foto 皮肤镜、10 倍放大。以活检确认的组织学亚型作为参考标准;混合亚型与不完整切除被排除。未报告 Fitzpatrick 光型,患者背景仅以「高加索人」一词描述,而且——下文还会回到这一点——患者人数自始至终未予说明。
评估。分层五折交叉验证,重复三次,共十五次划分;每折训练集的 20% 用作验证,检查点按验证 AUC 选择。没有外部中心。没有前瞻性评估。全部数据均为回顾性。
结果
以机器学习指标衡量。AUC(ROC 曲线下面积:随机抽取一个侵袭性肿瘤,其得分高于随机抽取的一个非侵袭性肿瘤的概率)为 BEiT 0.784 ± 0.026,ResNet-50 为 0.755 ± 0.018,ResNet-18 为 0.735 ± 0.023。这里的 ± 是十五次划分上的标准差,不是置信区间。在任意设定为特异度 70% 的工作点上,灵敏度分别为 BEiT 70.0% ± 6.6、ResNet-50 67.4% ± 4.3、ResNet-18 61.6% ± 5.8。这是论文公布的全部指标:没有准确率、没有 F1、没有阳性预测值、没有混淆矩阵、没有按亚型的结果、没有 ROC 曲线、没有统计检验。
换算成临床语言。数字在这里才变得可感。在该数据集的构成中,21.2% 的皮损为侵袭性。设想 1 000 例按同样比例分布的基底细胞癌:212 例侵袭性,788 例非侵袭性。在所选工作点上,模型会标出约 384 例为可疑。其中148 例确为侵袭性,236 例并非如此:这 236 位患者会被送去做他们并不需要的莫氏手术。而64 例侵袭性肿瘤会落在阈值之下,从而被导向不合适的保守治疗,并带来相应的复发风险。被标出的病例中约三分之一判断正确;侵袭性肿瘤中约三分之一被漏掉。
与人类相比。在同样的 1 000 例皮损上,所引研究中受过培训的皮肤科医生(特异度 70.7% 时灵敏度 56.4%)约能抓住 120 例侵袭性肿瘤,模型为 148 例,两者假阳性数量相当。因此,按这套算术,十四个百分点的灵敏度差距相当于每 1 000 例皮损中多约 28 例侵袭性肿瘤被正确分流。这并非无足轻重。但正如接下来会看到的,这也算不上一次比较。
做得好的地方
临床问题选对了,而且提得好。计算皮肤病学的大量工作仍纠缠于检测——良性还是恶性——尽管这一步已基本被解决,瓶颈早已转移。这里选择「侵袭性与否」这条界线,恰好对应一个真实且二元的治疗决策:做不做莫氏手术。潜在收益不是一个分数,而是省下一次活检、缩短一段等待。很少有皮肤影像论文能如此精确地指出自己的模型将嵌入诊疗路径的哪个环节。
算法对照诚实,作者也没有夸大自己。ResNet-18 与 ResNet-50 在相同配置与相同计算预算下训练,这使 0.03 的 AUC 差距可以解读。更重要的是,作者并未把 0.784 包装成成功:摘要称之为「初步研究」,结论称之为「初始的概念验证性探索」,而局限——单一中心、高加索人群、未受控的人类比较——是明确写出而非稀释掉的。在一个 0.95 的 AUC 常被说成可直接进临床的领域里,这种克制值得记上一笔。
数据受限这一约束,用了合适的方法来应对。只有 270 例阳性,训练一个 3 亿参数的模型本应注定失败。在 ISIC 的 53 826 张公开图像上做中间层域适配是方法学上正确的回应:先把模型带入皮损的世界,再在稀缺任务上微调。选择掩码预训练的转换器而非从零训练的 CNN 方向一致,而与 ResNet 的差距是温和而非惊人的,这与数据集规模也是相符的。
做得不够好的地方
数据泄漏没有被排除,而且无法被排除。论文从未说明交叉验证是按患者划分折,还是仅按图像划分。「patient-level」「lesion-level」「分组」「GroupKFold」这些词一处也没有出现,分层变量没有命名,而最关键的是患者人数没有报告——我们只知道有 1 271 张图像。然而在皮肤镜检查中,同一处皮损被多次拍摄、同一位患者身上长有多个基底细胞癌(且常为同一亚型)都很常见。如果同一肿瘤的两张图像分落在折的两侧,模型就不是在泛化,而是在辨认。这正是最系统性地抬高医学影像已发表 AUC 的失效模式,而文中没有任何内容能够排除它。
缺失的元数据暴露出拼装来源。人口学表格里有一处作者未加评论的异常:在侵袭组中,270 例皮损里有 158 例(58.5%)既没有性别也没有解剖部位记录,而浅表组为 32%、非浅表组为 25.8%。两个变量缺失的例数完全相同,提示存在一批 158 例侵袭性病例来自与其余部分不同的数据来源。如果该来源在设备、参数或时间段上也有差异——而论文在这一点上自相矛盾,第二节宣称使用单一皮肤镜,第三节又说「不同的皮肤镜设备」——那么模型学到的可能是一种来源特征,而不是肿瘤形态。解剖部位的分布指向同一方向:浅表型有 37.1% 位于躯干,而侵袭型仅 9.3%;非浅表型有 51.4% 位于头颈,而浅表型为 25.1%。一个仅凭图像猜测身体区域的模型,根本不用看肿瘤就已经能拿到像样的分数。论文没有做任何审计——没有域分类器、没有显著性图、没有按来源拆解错误。我们曾在筛查性乳腺 X 线数据集融合一文中描述过这一机制,并在医学影像的亚组审计一文中讨论过元数据缺失对隐性偏倚的影响。
与人类的比较算不上比较,而论文只承认了一半。皮肤科医生 56.4% 的灵敏度来自另一项研究,针对另外 235 例基底细胞癌,有三十位读片者、另一套方案。70% 特异度这个工作点并非出于临床理由:作者在表注中明确写道,之所以选它,是为了能与那项研究比较。于是先挑出让横轴对齐的阈值,再宣布纵轴上的差距。作者承认「数据集构成不同,无法得出确定性结论」——但摘要里的句子仍然断言性能「优于此前报告的人类读片者表现」。再补两个细节:引言给出的培训前读片者特异度为 71.7%,而表格给的是 71.1%;此外,那位临床共同作者本人正是论文所援引的皮肤镜参考文献之一的第一作者,而这一重叠未在任何地方声明。
一切都无法核验,伦理也没有记录。没有代码仓库、没有公开权重、没有数据可得性声明:塞萨洛尼基的数据集是私有的,也没有迹象表明会公开。文中没有任何利益冲突声明,更重要的是,对于这些关联了年龄、性别与解剖部位的回顾性临床图像,没有任何伦理委员会批准或知情同意的说明。唯一声明的经费是亚里士多德大学的专项研究账户(编号 90169/2024)。最后,这是一份未经同行评审的预印本,而且完全没有消融实验——尤其是 ISIC 适配阶段,因此无从知晓它是否带来任何增益——这使得 0.03 的差距究竟从何而来仍是悬而未决的问题。
这意味着什么
对研究界。有用的结果不是 0.784,而是描出了一道天花板。一个经过恰当域适配的 3 亿参数转换器,在单一中心的 1 271 张图像上大约停在 0.78 的 AUC——比 ResNet-50 高出三个百分点的百分之一,这差不多就是数据成为限制因素时更换架构所能期待的量级。作者自己也给出了这个信息:瓶颈在于标注语料的规模与多样性,而不在模型容量。因此合乎逻辑的下一步不是更大的模型,而是一个多中心、多族群的数据集,并明确声明按患者划分,同时在同一批图像上执行一套人类读片方案。在最后这一点完成之前,「优于皮肤科医生」的说法始终无法核验。
对临床医生。今天什么都不改变。假阴性率——约每三例侵袭性肿瘤漏掉一例——与「省掉活检」这个决定是不相容的,因为错误并不对称:浸润型癌若以冷冻治疗处理会复发,有时在数年之后,而补救手术的毁损更大。对这一结果唯一审慎的解读,恰与标题的暗示相反:不是「取代活检」,而或许是在手术资源受限时,用于排定优先次序——先给哪些皮损做活检,或哪些直接转显微描记手术。这种排序需要概率校准,论文没有提供;也需要在本地人群上验证,论文并不允许。皮肤镜的跨中心泛化问题,在其他关于皮肤癌外部验证的工作中有更细致的考察。
对患者与公众。值得记住的直觉是:黑色、棕色与混合肤色在这项工作中是缺席的——队列被描述为完全是高加索人,光型甚至没有报告。以这种方式训练出的亚型划分工具,没有任何在别处仍然有效的保证;而深色光型上的基底细胞癌常以色素性形态出现,也就是在视觉上不同。更宽泛地说,应当抵制标题所诱导的那种读法:「无需活检」描述的是一种抱负,不是一个结果。今天,活检仍是确知自己患的是哪一型基底细胞癌的唯一途径,而 0.78 的分数离它还很远。
延伸阅读
预印本:Deep Learning for Biopsy-Free Subtyping of Basal Cell Carcinoma from Dermatoscopic Images,arXiv:2609.07180 [cs.CV],DOI 10.48550/arXiv.2609.07180,2026 年 9 月 7 日提交,采用 CC BY 4.0 许可。作者:Alexandros Papadopoulos、Chrysa Episkopou、Ioannis Sarafis 与 Anastasios Delopoulos(塞萨洛尼基亚里士多德大学电气与计算机工程学院),以及 Aimilios Lallas(塞萨洛尼基亚里士多德大学第一皮肤科)。经费:塞萨洛尼基亚里士多德大学专项研究账户,编号 90169/2024。稿件中未出现任何利益冲突声明,也没有伦理批准说明。复用的架构为 BEiT(Bao 等,arXiv:2106.08254),域适配语料来自 ISIC 档案。人类对照来自 Camela 等 2024 年发表于《Journal of the American Academy of Dermatology》的研究,涉及三十位读片者与 235 例基底细胞癌;所依据的皮肤镜判读标准可追溯到 Lallas 等 2014 年的工作。关于显微描记手术在侵袭性亚型处理中的地位,欧洲 EADO 指南与 NCCN 非黑色素瘤皮肤癌指南是应查阅的基础文献。