皮肤癌AI诊断中的分布偏移检测:SAGE过滤器提高了准确率,却排除了大多数深肤色患者

俄勒冈健康与科学大学(OHSU)的一个团队构建了 SAGE,一种结合三种不确定性信号的检测器,能在做出诊断之前,识别出与模型训练数据差异过大的皮肤病变照片。该系统在覆盖七个国家的五个数据集上进行了测试:对于完全无关的图像,SAGE 几乎能做到完美区分;对于同时包含成像设备变化和新疾病的混合偏移,正确识别率达到 92%;而按 SAGE 分数过滤图像还能提高下游恶性肿瘤预测模型的准确性。但这一过滤机制——校准为保留 90% 与训练数据相似的病例——对深肤色患者的照片仅保留了 16.4%,而深肤色患者恰恰是这项工具本该更好保护的群体。

背景

用于皮肤癌诊断的深度学习(deep learning)模型在 HAM10000 等基准数据集上表现亮眼——数万张皮肤镜(dermoscopy,一种借助皮肤镜——即贴在皮肤上的带光放大镜——更清晰地观察病变结构的成像技术)图像。但多年来已被充分记录的问题是,一旦模型遇到与训练数据不同的图像,这种表现就会崩溃:不同的相机、用智能手机拍摄而非皮肤镜、肤色更多样的患者群体,或者仅仅是训练集中未出现过的病种。这一现象在机器学习中有专门的名称:分布偏移(distribution shift),或称分布外(out-of-distribution,OOD)数据——即偏离模型所学内容的数据。

迄今为止,大多数检测这种偏移的工具只依赖单一信号——模型对自身预测的置信度,或一张图像与训练集之间的距离。OHSU 团队的出发点很简单:单一信号难以捕捉差异很大的偏移类型(一种新型相机与一种新疾病毫无关系),因此他们提出将多个信号结合起来。该团队记录的另一个盲点是人口统计学上的:大多数公开的皮肤科数据集中浅肤色(Fitzpatrick 分型 I 至 IV 型)被过度代表,这使深肤色患者面临双重风险——训练数据中代表性不足,以及潜在的问题病例漏检。

方法

SAGE(Supervised Autoencoders for Generalization Estimates,监督式自编码器泛化估计)基于 ResNet-50——一种在计算机视觉中常用的卷积神经网络架构,先在 ImageNet 上预训练,再在此复用为编码器:它将每张图像压缩为一个包含 256 个数值的向量,概括其视觉内容。该向量被输入三个模块。解码器试图从压缩向量重建原始图像——重建效果越差,该图像越可能是异常的。分类器预测诊断类别并给出置信度分数。而在压缩空间中搜索20 个最近邻则衡量该图像与训练时已见过的样本的相似程度。三种信号——重建误差、分类器置信度、与最近邻的距离——被转换为概率,再通过几何平均合并为一个介于 0 和 1 之间的单一分数:分数越高,该图像偏离训练分布的程度就越大。

该模型在 HAM10000(10,015 张皮肤镜图像,来自澳大利亚和奥地利)上训练,随后在四个代表逐渐增大偏移程度的独立数据集上进行测试:HIBA(阿根廷,1,616 张图像,皮肤镜与智能手机照片混合)、UFES(巴西,2,255 张图像,仅为临床智能手机照片)、DDI(斯坦福大学,美国,656 张图像,包含 36 种 HAM10000 中未出现的诊断,其中部分为罕见癌症),以及 MILK10K(2025 年 ISIC 挑战赛数据集,10,480 张图像,涉及五个国家)。一个与医学领域完全无关的数据集——Caltech-101(日常物品照片)——用作极端对照。在下游任务中,作者测量了按 SAGE 分数过滤对一个独立的恶性肿瘤预测模型的影响——一个预训练的 Inception v3 模型,将每处病变分类为良性或恶性(基底细胞癌、鳞状细胞癌或黑色素瘤)。

结果

在偏移检测方面,以 AUROC(ROC 曲线下面积,衡量该分数区分正常图像与分布外图像能力的指标)衡量,SAGE 在对抗 Caltech-101 时达到 1.00(日常物品显然与皮肤病变毫无关系),在结合设备变化与新疾病的混合偏移上为 0.92,在仅涉及设备变化(皮肤镜转智能手机)时为 0.88,而在仍相对接近训练分布的图像上为 0.81。分数中位数随着与训练数据距离的增大而合理上升:HAM10000 测试集为 0.63,HIBA 为 0.74,UFES 为 0.79,MILK10K 为 0.80,直至 DDI 的 0.96——这是差异最大、诊断种类最罕见的数据集。

临床转化:对于训练数据中完全未出现过的恶性病例(皮肤 T 细胞淋巴瘤、卡波西肉瘤、转移性癌),诊断模型 81% 的假阴性——即本会被错误分类为良性的癌症——都被 SAGE 正确标记为可疑,从而被排除在自动化决策之外。也就是说,在一个诊断模型单独工作时会漏诊的 100 个此类病例中,大约有 81 个会被该过滤器拦截。但过滤对下游恶性肿瘤模型的总体准确性有直接代价:在深肤色患者中,AUROC 从未过滤时的 0.68 上升到过滤后的 0.78——这是真实的提升——但在校准为保留 90% 与训练数据相似病例的阈值下,该群体中只有 16.4% 的图像能通过过滤。在浅肤色患者中,AUROC 从 0.75 升至 0.77,但论文并未报告相应的覆盖率。

论文还记录了哪些因素会在与病理无关的情况下推高 SAGE 分数:测量尺的存在(+7.2%)、相机闪光灯(+5.8%)、非皮肤背景(视密度不同为 +7.4% 至 +10.5%)、体毛(+5.1%),以及体毛与背景的组合(+11.5%)。测量尺带来的影响在深肤色上(+9.8%)比在浅肤色上(+6.1%)更明显。在过滤掉低质量图像后,不同肤色之间的偏差差距(以 Cliff's delta 衡量,一种反映两个分布之间差异的指标)从 −0.434 缩小到 −0.206,但并未消失。

做得好的地方

三种信号而非一种,并在受控的偏移梯度上进行了验证。许多关于 OOD 检测的论文只测试一种类型的变化。而在这项研究中,作者明确区分了模态偏移(皮肤镜与智能手机)、类别偏移(新疾病)及二者的组合,并表明 SAGE 在全部四种情形下都保持竞争力——而不仅仅是在最简单的情形(非医学物体)上。

手动标注致力于寻找原因,而非仅仅记录症状。共有 4,527 张图像由一名对诊断结果、恶性程度和肤色类型均不知情的观察者,按照十二项标准(体毛密度、对比度、闪光灯、测量尺、背景、模糊程度)进行了人工标注。正是这项工作使得研究能够将具体的拍摄伪影确定为高分数的原因,而不是止步于一个笼统的汇总数字。

代码、模型权重和数据均以开放许可发布。全部 SAGE 代码及训练好的模型均在 GitHub 上公开(github.com/pdxgx/sage),采用 CC BY 4.0 许可协议,所用的全部图像也都是公开的。这使得独立复现从今天起即成为可能,而这在该领域仍属罕见。

做得不够好的地方

过滤减轻却未解决人口偏差问题——而且在覆盖率上出现了自相矛盾的恶化。由于相关伪影(测量尺、背景)在对应数据集中更为常见,SAGE 分数本身在深肤色图像上结构性地偏高。直接后果是:在为保留 90% 与训练数据相似病例而选定的阈值下,83.6% 的深肤色患者图像被排除在自动化诊断之外。AUROC 的提升(从 0.68 到 0.78)是真实的,但它只适用于该群体中极小的一部分残余样本——这正是误导性指标的典型例子:在展示性能提升的同时,不给予与之相伴的覆盖率同等的重视,就掩盖了这样一个事实:该工具在实践中把它本该更好保护的大多数患者排除在了自动化决策之外。

捷径学习(shortcut learning)被记录下来,却未从源头得到纠正。模型对与病理毫无关系的因素——测量尺、闪光灯、房间背景——做出反应,而不是仅仅针对病变本身。作者精确地指出并量化了这一问题,这值得肯定,但他们提出的解决方案(事后过滤)只是治标:它移除了有风险的图像,而不是从根本上阻止模型在前端学习到这些虚假的相关性。

只测试了一种诊断架构,训练集规模依然有限。下游的恶性肿瘤模型是唯一一个 2023 年发表的 Inception v3 模型——到 2026 年,这已不再是最先进的对照模型。没有证据表明,若换用更新的架构,或使用比本研究所用的 7,207 张图像更大的训练集,同样的收益与同样的覆盖率代价是否还会重现。作者自己也指出了训练集与测试集之间可能存在数据泄漏(data leakage)的风险——同一患者的不同病变可能同时出现在训练集和测试集中——但未能完全排除这种可能性。

这意味着什么

对研究界而言,SAGE 建立了一种可复现的方法,用于在受控的严重程度梯度上测试偏移检测器,其主要优势——在训练中从未见过的罕见癌症上捕获 81% 的假阴性——值得用其他下游诊断模型加以复现。作者自己也已指出了下一步的必要工作:从训练环节纠正人口统计学偏差,而不是用一个不成比例地排除深肤色患者的过滤器来加以弥补。

对临床医生而言,当下的实践不会发生任何改变:SAGE 是一款研究工具,而非经过验证可用于临床的设备。但它揭示了一条可推广到任何皮肤科诊断人工智能的原则:高置信度分数可能反映的是照片质量(测量尺、闪光灯、背景),而非诊断的清晰程度,而一个校准不当的图像质量过滤器可能会在不体现于总体指标中的情况下,剥夺某些患者获得自动化意见的机会。

对患者和公众而言,这项研究具体展示了为什么一款主要用浅肤色数据训练的皮肤诊断人工智能,对其他肤色患者而言仍然不够可靠,或不够可用——这一差距无法仅靠在输出端添加一道安全过滤器来解决,而需要从训练数据的源头开始实现多样化。

延伸阅读

论文原文:Multi-criterion uncertainty estimation improves skin cancer distribution shift detection and malignancy prediction,W. Max Schreyer、Ravi Samatham、Elizabeth Berry、Reid F. Thompson 等(俄勒冈健康与科学大学;VA 波特兰医疗系统;圣路易斯华盛顿大学),《npj Digital Medicine》,2026 年 9 月 24 日,DOI 10.1038/s41746-026-03293-y。代码与模型:github.com/pdxgx/sage。

关于皮肤科影像中的亚组偏差,另请参阅我们对 HAM10000 上 MC-Dropout 选择性预测的解读。关于皮肤癌的自动化亚型分类,另请参阅我们对无需活检的基底细胞癌亚型分类的解读。