解读
Tatakoto上所有科学出版物的解读。
皮肤病变:96 % 准确率与 0.99 AUC —— 但只统计了模型愿意下判断的那四分之三图像
两位作者将三个网络(MaxViT-Tiny、ConvNeXt-Tiny、EfficientNetV2-B0)与基于 MC Dropout 的不确定性估计结合起来,在 HAM10000 上对七类皮肤病变进行分类,报告了 96 % 的准确率和 0.99 的 AUC。这些数字是在剔除不确定样本之后计算的:结果表只覆盖 1 508 张图像,而 20 % 的测试集应有 2 003 张,意味着约四分之一的病例根本没有被判断,而论文从未报告这一覆盖率。弃答率并不均匀:按类别重建后,黑色素瘤上的弃答率约为三分之一。
重症监护脓毒症:一个在乳酸升高时反而下调治疗的强化学习智能体,却被标准指标评为最优
范德堡大学与杜克大学的两位工程师,对两个在 MIMIC-III 上训练的强化学习智能体做了一项简单测试:人为抬高乳酸,观察推荐治疗往哪个方向变化。模仿临床医生最好的模型(MSE 0.0098)在乳酸升高时把治疗强度下调约 15%——Spearman 相关系数为 −0.67,与拯救脓毒症运动指南方向相反。诊断本身成立;但论证只依赖单一随机种子,没有置信区间,且预印本从未说明使用了多少患者。
甲状腺超声:一套可审计的"智能体"AI 在 35 家中心接受检验,以及摘要没有说出的三个数字
来自中山大学、珠江医院与浙江的十四位作者提出 ThyroidXAgent,该系统串联结节分割、良恶性分类与超声报告撰写,并将每一步中间输出保留为可供临床医生查看和修改的证据。分割平均 Dice 达 87.21%;在来自 35 家独立中国中心的 4999 例上,分类 AUROC 降至 0.819。论文自始至终没有说明其分类测试集的良恶性标准是如何确定的,摘要中给出的平均 AUROC(0.9466)与其自身补充表格(0.9001)对不上,而"过度诊断"一词一次也没有出现。
AMIE 视频问诊:谷歌多智能体系统在模拟 OSCE 中胜过全科医生——但医生被要求关闭摄像头
谷歌研究院与 Google DeepMind 让 AMIE 参加了一场视频形式的客观结构化临床考试:100 个情景、15 名职业演员,以十名美国全科医生作为对照。首位诊断正确率为 0.91,医生为 0.77;加入视频后"观察与查体"得分从 0.41 升至 0.74。但人类对照组被要求全程关闭摄像头,临床情景仅限于演员能够表演的类型,而演员本人在其评分的 29 项标准中只发现 2 项存在显著差异。
报告衍生标签对比重新阅片:在 MIMIC-CXR 的心脏扩大上,一致性几近于零
放射科医师重新阅读了 MIMIC-CXR 中的 2160 份胸片,并把结果与从报告自动抽取的标签作了比对。就心脏扩大而言,Cohen kappa 仅 0.011,标签只找回了 1.3% 的确认病例;94.8% 的分歧源自报告中的未提及,而非否定。在专家重新标注的队列上,DenseNet121 取得 0.853 的 ROC-AUC。一次有用而坦诚的审计,但局限于单一数据库、单一征象和一个人为平衡的队列。
五种视网膜疾病,会"各司其职"的专家:稀疏专家混合模型在眼底照片上揭示了什么
Nagur Shareef Shaik 及其同事提出了一种不对所有眼底图像都执行相同计算的架构:一个"稀疏"路由机制会根据存在的病变,把每张照片送往一个专门的"专家"。在五个类别(健康眼、糖尿病视网膜病变、AMD、视网膜前膜、青光眼)上、采用按患者不重叠的交叉验证,模型取得了 0.912 的宏平均 AUC 和 0.653 的宏平均 F1,其各个专家确实按疾病实现了专门化(p < 0.001)。这是可解释性上的一项优雅贡献,但 AUC 与 F1 之间的落差、以及缺乏外部验证,都提醒我们:精巧的机制还算不上筛查工具。
不汇集数据也能训练病历模型:以122 251例重症监护住院验证联邦学习
Michael Burkhart、Brett Beaulieu-Jones 及其同事检验了一个具体问题:能否在从不把多家医院的数据汇聚到一处的前提下,训练出病历"基础模型"(foundation model)?基于来自三个独立医疗系统的122 251例重症监护住院与十二项预测任务,他们的生成式事件模型在医院之间的迁移表现远优于传统模型(AUC惩罚为0.025点,而非0.079),且联邦学习几乎追平了集中式训练。但最有价值的发现却反直觉:汇集数据相比纯本地训练仅带来微小提升,而且随着每家医院积累自身数据,这一优势逐渐消失。
扫描之前先预测当天解剖:面向头颈部自适应质子治疗的"数字孪生"
Yizhou Wu、Yuheng Li、Xiaofeng Yang 和 Chih-Wei Chang 提出一种数字孪生方法,在获取任何影像之前就预测头颈部患者治疗当天的解剖结构:把其他患者在治疗过程中发生的变化"迁移"到该患者的计划CT上。在88名患者中,这些预测CT比冻结的计划CT更贴近当天真实解剖:图像相关性提升22.8%,危及器官重叠度提升20.2%,CT值误差下降23.4%。用预测解剖来加速自适应放疗是个巧妙的想法,但整项验证仅停留在图像相似度指标,从未评估实际投照的剂量——而在质子治疗中,真正决定获益的正是剂量。
把每位患者表示成一张图,从而跳过数据清洗:PatTree 及其在阿尔茨海默病分类上 98.5% 的准确率
四位研究者提出 PatTree:一种把异构医疗数据——缺失值、多种模态、格式不一致——自动结构化为每位患者一张知识图谱的方法,无需事先的数据协调步骤。在 ADNI-1 队列的一个子集(763 名受试者)上,直接在该图上分类,区分阿尔茨海默病、轻度认知障碍与正常认知,达到 98.5% 的平衡准确率和 0.987 的 F1。省去人工协调是有价值的想法;但在一项公认困难的任务上、仅凭单一队列且无外部验证就取得近乎完美的分数,首先应读作一个需要查证的方法学警示,而非证据。
脑部磁共振的 AI 超分辨率:重建薄层切片会抹除还是虚构脑白质小病灶?
宾夕法尼亚大学团队检验:在自动计数脑白质病灶之前,对厚层 FLAIR 磁共振施加 AI 超分辨率,是否能保留这些病灶。在 29 例经人工降质的 ADNI 受试者上,主要危险并非生成模型令人担忧的"幻觉",而是对真实小病灶的静默抹除,切片越厚越明显。任何重建仍优于原始厚层切片;自监督模型 ECLARE 最好地保留信号,而基于隐式网络的基础方法并不优于简单的三次插值。样本小、降质为模拟:这是方法学警示,而非临床判决。
脑室内出血:CT 上的一条"脑干背侧线",由表格基础模型解读,用以预测六个月后的残疾
九家中国医院,728 名患者。由陆军军医大学西南医院牵头的团队提出 BSDL——一个在入院 CT 上测量的脑干受压简易分级,并将其与另外八个变量一起交给表格基础模型 TabICLv2,用以预测六个月的不良结局(mRS 4-6)。外部验证 AUC 达 0.90 且校准良好——但外部验证仅有 118 名患者,全部为中国患者,属回顾性研究,且 BSDL 仍靠人工分级。
再入院与多重慢病:一个在知道结局之前先学会"读懂病人"的自监督模型
AI-MULTIPLY 联盟(纽卡斯尔、玛丽女王、伯明翰)构建了 Self-HR:先学会"概括"99 207 名至少患有两种慢性病的英国患者的病历,再预测出院后 30 天内的急诊再入院。AUROC 达 0.92,并在第二个数据库的 79 224 名患者上完成外部验证——但大部分信号来自入院诊断本身,训练人群代表性有限,且没有前瞻性验证。
医学罕见病例:训练大语言模型选择下一步行动,而非仅给出最终诊断
本-古里安大学团队构建了 MedUPSQA——从 5535 例真实罕见病例中提取的 21 874 个"过程中"临床决策点,并证明:让语言模型对齐"下一步行动"比单纯扩大模型更有效——前提是要看清谁在定义"正确答案"。
ChatGPT Health 用于分诊:多轮对话并不能让建议更安全
西奈山团队在 255 个真实与合成分诊病例上评估 ChatGPT Health。多聊几句并不能改善分诊,而且当 AI 偏离护士标准时,它有近七成会低估紧急程度——严重低估约占十分之一。
跨医院预测重症监护室谵妄:什么能迁移,什么不能
倪圣量与佐藤健吾(东京科学院)训练了五类模型来预测重症监护室(ICU)谵妄,随后让它们跨数据库迁移——从 eICU(美国 208 家医院)迁至 MIMIC-IV(波士顿单一中心),再反向迁移。按风险对患者排序的能力迁移得较好(一个方向上外部 AUROC 高达 0.88–0.95),但概率校准和报警阈值却无法随之迁移。真正的贡献不是一个分数,而是一个区分:临床模型的"可迁移性"会分解为若干层,而它们并不同步迁移。
当临床大模型填错格子:先测量、再修复对 ICD-10、CPT 与 FHIR 模式的合规性
Jianru Shen(University of Montana)在涵盖十个专科的 320 个临床场景中测试三款开源大语言模型,要求它们输出符合 ICD-10、CPT 和 HL7 FHIR 标准的结构化数据。没有保护机制时,格式合规率停留在 85.9% 到 91.6% 之间。一个"校验-修复"闭环在两轮迭代内将其提升到 99.0%,约 1% 的情形交由人工处理。但该指标衡量的是结构合规,而非临床正确:一个格式完美的编码仍可能在医学上是错误的,而这正是论文未能弥合的缺口。
胰腺癌该不该开刀:一个CT+临床数据的多模态模型究竟学会了怎么分诊
巴塞尔、阿劳和伦敦的一个团队训练了一个深度学习模型,把3D CT与17个临床变量融合,将159名胰腺导管腺癌患者归入NCCN的三个可切除性类别。AUC在交叉验证中达到0.86,在阿劳52名患者的独立外部队列上同样为0.86。模型在推理时无需掩码即可学到"感知血管"的解剖表示。但参考标准只是多学科会诊的共识,队列小且全部为瑞士人,也没有任何研究把模型与放射科医生做比较。
用一周的手腕运动预测未来疾病:两个加速度计foundation model在UK Biobank里真正读到的是什么
斯坦福与丹麦的一个团队用两个冻结的foundation model,把UK Biobank中97 696名参与者一周的手腕运动编码,再用单一生存模型预测390种未来疾病。平均一致性为0.688,一个"活力"轴解释了76%的预测风险,并浮现出帕金森病的前驱期特征(五年AUROC 0.90,428例)。但一切都建立在单一且不具代表性的队列上,没有外部验证,而且编码器正是在这批数据上预训练的。
在手术前预测最"重"的莫氏手术:三十个机器学习模型主要学到的,其实是肿瘤大小
悉尼一个团队训练三十种机器学习算法,在手术前预测一台莫氏显微描记手术是否需要13个或更多组织切片——这个"重症病例"阈值直接照搬自澳大利亚的报销标准。在单一中心的408台手术上,最佳模型的测试集AUC为0.884,准确率为81.7%。但测试集只有82例,没有做外部验证,而特征重要性分析显示,模型主要重复了一个显而易见的事实:肿瘤越大,要切的就越多。
凭一张面部照片筛查睡眠呼吸暂停:基于视觉语言模型的多模态系统做了什么,以及为何它的"准确率"美化了数字
上海的一个团队(上海工程技术大学、腾讯优图实验室、复旦大学附属眼耳鼻喉科医院)提出了 EviOSAHS:一个无需训练、仅通过提示词编排一个视觉语言模型和一个大语言模型来评估睡眠呼吸暂停风险的系统。它把一张面部照片拆解为七项结构化的解剖学观察,再结合临床资料做出判断。在 642 名有多导睡眠图的患者上,它报告了 88.47% 的准确率和 94.86% 的灵敏度。但队列严重不平衡(584 例阳性对 58 例阴性),特异度从未被报告——可重建为约 24%——而一个"全部判为阳性"的模型在准确率上反而更高。
低剂量CT下的肺癌:如果用「降质」的标准剂量CT、而非去噪图像来训练AI,会怎样?
米兰理工大学的一个团队为肺癌筛查检验了一个反直觉的思路:与其对低剂量CT(LDCT)图像去噪,不如把大量的标准剂量CT(SDCT)「降质」成伪低剂量图像来训练结节分类器。三种降质方法在公开数据集LIDC-IDRI上进行了比较。稳健的发现是:在标准剂量上训练的模型在真实低剂量上崩溃(敏感性0.571),而三种降质都把AUC恢复到0.84以上——但它们彼此之间的排名仍然脆弱。
混合乳腺X线摄影数据集并不能改善筛查AI:当模型学到的是数据集的「签名」而非癌症
加拿大纽芬兰纪念大学的一个团队检验了一个被视为理所当然的假设:把来自公开数据库、经活检确诊的癌症病例添加到真实的筛查数据集中,应当能改善乳腺X线摄影的分诊模型。作者用筛查数据集NLBSD(5997次检查,1.29%为可疑病例)训练同一个分类器,再加入CBIS-DDSM和CMMD的阳性病例,却观察到相反的结果:每加入一个来源,性能就下降一次;一项诊断性实验揭示了原因——模型几乎完美地按数据集来源区分图像(AUC 0.9998),证明它学到的是数据集的「签名」而非病理。
医学影像基础模型可以互换吗?对 25 个编码器的受控解剖如何揭示表征"收敛"的真相
一支德国学术团队检验了一个已成常识的观念:随着规模增大,医学图像编码器会收敛到一种共享表征,从而变得可以互换。作者对 25 个开源权重编码器(18 个图像、7 个文本)进行解剖,参数量从 700 万到 270 亿,覆盖五种成像模态和 650,982 张胸部 X 光片,结果表明:收敛确实存在但很有限,其驱动力是自监督训练目标,而非规模或临床监督,并且它无法重现放射科医生判断两个病例相似度的方式。
人工智能生成的病理报告:为什么 BLEU 分数会高估质量,以及临床指标 CRQS 修正了什么
石溪大学与犹他大学的一个团队搭建了首个用于从数字化切片自动生成病理报告的标准化基准,在三个数据集上重新评估了四个模型和三个图像编码器。他们的发现是:常用的语言指标(BLEU、ROUGE、METEOR)奖励表面相似度,甚至可能给一份颠倒了诊断的报告打高分。为此他们提出了 CRQS,一种比较所提取的临床事实而非词语的评分——但这个充当裁判的指标本身依赖一个语言模型,并且是对照有噪声的参考报告来衡量的。
不用标签、仅凭一份心电图预测死亡:自编码器的「重建误差」究竟在衡量什么
因斯布鲁克医科大学的一个团队用 720 万份巴西心电图训练了一个掩码自编码器,从未告诉它谁会死亡。思路是:一份心电图越偏离所学到的「正常」,其重建误差越大,死亡风险据称就越高。该评分在三大洲 160 万名患者上得到验证,能较好地预测全因死亡——但仔细审视会发现,「自监督」一词掩盖了一次由标签驱动的选择,而那个招牌数字从未真正分离出心电图在年龄之外所贡献的部分。
从宫颈超声预测早产:为什么这些人工智能模型换一台超声机就崩溃
印度北部 GARBH-Ini 队列的一个团队与牛津大学合作,训练了多个模型(包括一个 Vision Transformer),试图从一次孕中期宫颈超声图像预测自发性早产。在内部测试中,最佳模型的 AUC 为 0.71;但在用另一台超声机采集的独立队列上验证时,它跌到 0.52,几乎与掷硬币无异。这是一个如实发表的阴性结果,它主要说明了医学影像人工智能目前还做不到的一件事:走出实验室。
在没有元数据的情况下审计医疗 AI 的隐藏偏倚:CAPRA 提出了什么——从图像本身猜出患者亚组
北京邮电大学的六位研究者提出 CAPRA,一种直接从图像重建人口学与技术性"轴"(年龄、性别、设备类型、投照体位)的方法,用以在做审计所需的元数据已经消失时,找出模型会失败的患者亚组。该方法在三种模态上评测——眼底(糖尿病视网膜病变)、皮肤镜(HAM10000)与胸部 X 光(CheXpert)——揭示出仅按元数据切分所看不到的差异,并在稳健学习复用其分组时,于十五个比较中的十四个上提升了最差亚组的表现。这一思路有用且如实呈现,但从图像去猜敏感属性会带来循环风险,而且没有任何东西在临床条件下得到验证。
用磁共振对儿童胶质瘤做分子诊断:一种自我纠正"假阴性"的对比学习方法,带来了什么,又没能证明什么
多伦多大学与 SickKids 儿童医院的六位研究者提出 MSeaCL,一种在关联脑部磁共振与放射报告时把二者的语义接近程度纳入考量的方法,从而不再把两个其实相似的肿瘤当作对立面。该方法在来自单一医院的 341 对图像—报告上做预训练,再微调用于对儿童低级别胶质瘤的分子亚型分类,在内部集上仅提升了百分之一的 AUC,却在来自不同扫描仪的外部测试集上跃升了 0.23 个点。关于泛化的这一结果真实而有启发,但它建立在极小的样本量、单一的成像序列,以及一项仍然远离临床的评测之上。
病理基础模型的稳健性:一个"扰动加分布偏移"的评测基准如何揭示它们的脆弱
华威大学的三位研究者,让十二个数字病理基础模型以及两个作为参照的卷积网络,接受十一种贴近临床的图像扰动,并接受一个专为打破训练集与测试集相似性而设计的验证方案。这些大模型比旧网络更耐受,但其稳健性远在十亿参数之前就已见顶,而且一旦面对真正不同的分布,所有模型都会掉精度。一个有用的提醒:临床可靠性将取决于训练数据的质量与多样性,而非模型的大小。
用基因预测帕金森病:当队列富集把一个风险基因变成"保护"基因
克莱蒙特研究生大学的一位研究者在 Fox Insight 队列的 1987 名参与者上,训练了一系列模型——从惩罚逻辑回归到算法集成——试图仅凭少数几个靶向基因变异来预测帕金森病诊断。最优模型在留出测试集上取得 0.929 的 AUC,数字看似出色。但该队列有 1861 名患者、却只有 126 名对照,而该领域最知名的风险变异在此竟呈"保护性":这一表现主要衡量的是招募造成的伪影,而非筛查能力。
MedQADE:给医学答案打分的大模型在一致性上追平医生,却始终缺少医生的审慎
来自吕贝克、图宾根、维尔茨堡三所大学和柏林夏里特医院的团队构建了 MedQADE,这是首个德语开放式回答的临床评测基准:3800 道取自国家医学考试的题目,分别由医生和九个充当"批改者"的语言模型打分。表现最好的 Gemini 3 Flash 与医学共识的一致性(kappa 0.694)在统计上与人类上限(0.709)无法区分。但医生在题目超出自己能力时会弃权,前沿模型却在 100% 的情况下给出确定判断:只有表面的一致,却没有本应随之而来的临床审慎。
ALICE:从八位专家蒸馏出的单一病理基础模型——在96项任务上取得最佳平均排名,但缺乏前瞻性验证
清华深圳、牛津大学与中山大学的团队,通过三阶段"聚合蒸馏"(ALICE)将八个数字病理基础模型融合为单一网络。在覆盖48个数据源的96项任务上,ALICE相对专用模型取得最佳平均排名,视任务类型超过第二名1.79、6.39和3.04分。但评估完全是回顾性的,比较对象正是ALICE自身的教师模型,而且尽管预训练与测试都取自TCGA,论文未报告任何数据泄漏控制。
MedPMC:策展医学文献以训练多模态模型——26 项测试平均 AUC 提升 7.1 个百分点,但临床验证仍单薄
一个由耶鲁牵头的团队通过五阶段自动化流程(MedPMC),把 610 万篇 PubMed Central 文章转化为 1100 万对医学图文。基于该语料训练的视觉-语言模型 MedPMC-CLIP,在涵盖 11 个专科的 26 项测试上,相较最佳可比模型平均 AUC 提升 7.1 个百分点,且所用图文对不到一半。但唯一在真实患者数据上的评估仅是皮肤科的图像检索任务,作者提醒:一切尚未可用于临床。
RAG 与公共卫生:多选题答对率 99%,但只有约三分之二的回答忠实于官方指南
一个英国团队扩展了 PubHealthBench——取自英国政府 687 份公共卫生指南文件的 7929 道问题——用于评估检索增强生成(RAG)。将语言模型锚定到正确的段落,可将多选题准确率推高到约 99%,小型开源模型甚至超过大型闭源模型;但在自由作答中,最佳配置仅有 64% 的回答忠实于指南,而自动评审器恰恰在「事实一致性」上失灵(κ 接近 0)。
把网络的注意力变成生物标志物:以Grad-CAM引导的"影像组学签名"来分类肿瘤——增益微弱,临床验证仅略高于随机
一个佛罗里达大学团队提出把分割网络的Grad-CAM注意力图转化为"签名"区域,从中提取影像组学特征来分类乳腺、脑和肾脏肿瘤。在公开数据集(BUSI、BraTS)上,签名把分类提升0.2到3个AUC点;但在唯一的私有临床队列(UF Health肾脏CT)上,所有深度网络都停留在随机水平附近(AUC≈0.49–0.59)。该预印本未报告任何样本量、任何代码,也无任何资助或利益冲突声明。
心脏再同步化:用数字孪生来选择在冠状静脉窦中把导线放在何处——74例的试点,前瞻性上尚无任何验证
一个俄罗斯团队将心脏数字孪生、电生理仿真与一个可解释分类器(SVM)结合,在冠状静脉窦内逐个位点地预测对心脏再同步化治疗的反应。在74例患者上,该模型胜过一个参考的临床计算器(内部验证AUC 0.78,准确率0.78对0.58)。但验证纯属内部且回顾性,队列小,而核心结果——"换个位置本会奏效"——仍是一个从未在患者身上核实过的计算机(in silico)预测。
ER-JEPA:无需标注学习12导联心电图——在基准上达到最先进水平,但临床上仍一无所有
一个分层自监督模型ER-JEPA,在约174 000份来自中国和巴西的未标注12导联心电图上进行预训练,随后在两个公开测试集上评估。它在ST-MEM基准上与最先进水平持平,并在PTB-XL微调上将其超越(AUC 0.936与0.943),且仅用一块消费级显卡——但作者承认训练不稳定,代码尚未公开,且没有任何数字被转化为临床性能。
用深度学习从临床病历构建的电子衰弱指数:在193 629名芬兰人中,最衰弱者的死亡风险升高逾7倍——但其分界值是在它所预测的死亡率上校准的
一支芬兰团队用深度学习从自由文本临床病历中提取十项功能性缺陷,再加上ICD-10编码和化验结果,构建电子衰弱指数。在193 629名35至103岁的人群中,最衰弱者的死亡风险升高7.3倍、重症感染风险升高9.2倍——但衰弱分界值是在它所预测的死亡率上校准的,比较对象偏弱,且验证仍为单中心。
Genosolver:读取临床病历以诊断罕见病的大语言模型——在已解决病例中致病基因排名第一的比例为72%,但在未解决病例上仅多出1.7%的诊断
亚琛的一支团队将大语言模型、推理模型和RAG结合起来,从非结构化临床病历中提取表型,并对罕见病中的遗传变异重新排序。在已解决的病例中,致病基因排名第一的比例为72%,胜过Exomiser,但对1 875例未解决病例的重新分析仅增加1.7%的诊断——而且比较对象获得的信息比模型少。
预测十年缺血性卒中风险:一个胜过传统评分的XGBoost,但其绝对风险在不同医院之间崩塌
来自伯明翰和西奈山的团队将电子健康记录、化验轨迹和二十个多基因风险评分结合到一个XGBoost中,用于预测十年缺血性卒中。该模型大幅超越传统评分,其排序能力可迁移到外部队列——但绝对风险在不同医院之间崩塌,基因组的贡献微乎其微,自报种族几乎没有增加任何信息。
在视网膜色素变性中分割视网膜内层:两个AI模型(含SAM基础模型),仅用228张OCT切片训练
哥廷根团队改造SAM基础模型与一个nnU-Net,在极少标注数据下测量视网膜色素变性患者OCT图像的视网膜内层。它在内层上可靠,却恰恰在用于疾病分期的那一层失手,且仅在单一队列上验证。
RadGrounder:一个能"指出自己在看哪里"的放射学视觉-语言模型,在120万张切片上训练,且无需人工标注
RadGrounder能撰写报告、回答问题,并在图像上定位它所提及的结构,训练数据为120万张CT和MRI切片,标签完全由其他AI生成。它在两个公开基准上表现出色,但其空间锚定只指向器官——从不指向病灶。
急性重症胰腺炎:在722例患者中,随机森林击败所有深度学习模型
在一个722例患者的中国队列中,十一种模型在入院时预测急性重症胰腺炎:经典模型胜出(随机森林,AUC 0.877),深度学习失败;但该队列中81%为重症病例,与真实情况相反。
卒中预后:在 MR CLEAN 试验上比较六名神经科医生、一个经典模型与一个深度学习模型
在 MR CLEAN 试验中,模型预测大血管闭塞性卒中后三个月残疾程度优于六名神经科医生,而后者系统性的乐观偏差扭曲了预后判断。
从图像分类急诊心电图:ConvNeXt 集成模型在 18 519 份记录上逼近心脏科医生
在圣保罗 InCor,一个读取心电图图像的模型对 12 类急诊心电图记录分类,宏 F1 达 0.807,而标注的心脏科医生为 0.820——在只有纸质或拍照记录可用时尤为有用。
重症监护室死亡预测:仅凭入院前 24 小时数据在 MIMIC-IV 上预测院内死亡,以及为何校准与区分同等重要
五个表格模型在 MIMIC-IV 的 53,866 例住院上预测重症监护室死亡。AUROC 为 0.856,但 AUPRC 仅 0.45、且仅来自单一中心,提醒了其局限。
前列腺癌:用变换器分割 PSMA PET/CT 上的病灶,并在放射性配体治疗前进行生存分层
一种视觉变换器 Fine-UNETR 在全身 PET/CT 上自动分割 PSMA 病灶。内部 Dice 为 66.63%,但外部验证仅 44.11%。
StrokeTHG:用病历异构图预测卒中后 30、90、365 天的死亡率
一种异构图神经网络从电子病历预测卒中后三个时间点的死亡率。AUROC 0.837-0.878,但为单中心、直推式评估,缺乏外部验证。
多模态肿瘤学中的基础模型:一次对病理与转录组的审计揭示了什么
在 7600 名患者的病理切片与转录组上评测五个基础模型:在组学上,简单的主成分分析胜过专用模型,融合模态也并非总有帮助。
用人工智能筛查宫颈癌:四国验证揭示了什么
一个多任务模型仅凭一张阴道镜图像就能区分需要治疗的病变(CIN2+)。它在德国和印度表现稳健,在罗马尼亚却跌至随机水平。
自动判读 qPCR 的 Ct 值:一个在 41,770 条扩增曲线上训练的模型说明了什么
一个 XGBoost 模型在 41,770 条 qPCR 曲线上学习"正常"的 Ct 行为以识别异常扩增——但其参照仍是仪器本身,且跨仪器时彻底失效。
当皮肤癌检测器换了一个国家:一套皮肤镜图像级联分类器在从 ISIC 数据库迁移到俄罗斯临床数据时,AUC 从 0.96 跌至 0.80(arXiv,2026)
对 2026 年 6 月 11 日由 Elena Kozachok 及其同事发布于 arXiv 的预印本的解读:四种深度学习架构(ViT-B/16、Swin-S、ConvNeXt-S、EfficientNetV2-S)与三种分类方案——二分类、四分类、以及"先分诊再鉴别"的级联——在开放的 ISIC 数据库上训练,再在两个小型俄罗斯临床数据集上测试。内部良性/恶性判别表现优异(ROC-AUC 0.952 至 0.966);在谢切诺夫大学的数据上则降至 0.797–0.893,灵敏度跌到 0.53–0.67,校准误差从 0.02 升至 0.27–0.39,模型低估了恶性程度。级联方案带来了单阶段分类器所没有的显式灵敏度调控。该工作坦诚地呈现了泛化差距,但外部队列极小且不平衡,既无皮肤科医生对照,也无前瞻性验证。
提前五分钟预测心房颤动:一个个性化神经网络读取可穿戴设备的心电图(arXiv,2026)
解读一篇于 2026 年 6 月 9 日发表在 arXiv 上、来自首尔国立大学团队的预印本:从一段 60 秒的单导联心电图(ECG)出发,一个神经网络尝试预测心房颤动是否会在 5 分钟内发作。用每位患者最初 24 小时的记录对模型进行个性化,可使内部队列的 AUROC 从约 0.61 升至 0.71,在一个韩国外部队列上从 0.59 升至 0.69。这项工作切实、代码开源、验证横跨三个队列——但判别力仍属中等,阈值是在患者自己的测试数据上调出来的,欧洲外部队列仅 6 名患者,且两位作者与设备制造商存在关联。
SchistoTrackNet:一个神经网络读取肝脏超声以检测血吸虫病的纤维化(medRxiv,2026)
解读一篇于 2026 年 6 月 2 日发表在 medRxiv 上的预印本:一个神经网络对肝脏超声图像进行分类,以检测乌干达农村地区由血吸虫病引起的门静脉周围纤维化。SchistoTrackNet 在来自 SchistoTrack 队列的 3710 张图像上训练,在六个类别上达到 82.2% 的准确率,且与采集图像的超声医师的一致性(kappa 0.77)高于第二位超声医师(0.54)。这项工作以少见的严谨对待一种被忽视的疾病——但其参考标准仅为单一人类阅片者,数据来自单一国家和单一设备,而最严重的纤维化只有一半能被检出。
从骨髓涂片诊断急性髓系白血病:一条绕开原始细胞计数的"细胞到患者"流程(arXiv,2026)
解读一篇于 2026 年 6 月 9 日发表在 arXiv 上的预印本:一条深度学习流程检测并分类骨髓涂片中的细胞,再将这些观察聚合为按患者计的评分,以辅助急性髓系白血病的诊断。该流程在来自六个中心的 258 名患者(其中 89 名用于外部验证)上完成验证,在三个未见过的中心上取得 0.87 至 0.91 的加权 F1。论证严谨,细胞到患者的衔接也设计得当——但模型学习的目标是一个形态学替代物,而非白血病原始细胞,且预印本未公开任何患者层级的诊断指标,也没有代码、没有与细胞形态学专家的比较。
当乳腺密度扭曲筛查 AI 的评估:Mass-Bench 基准与被掩盖的性能衰减(Mathematics,2026)
解读一篇于 2026 年 6 月 10 日发表于 Mathematics 的研究:Mass-Bench 整合了四个公开乳腺 X 线摄影数据集(32,930 张图像,8,245 名患者),用以衡量肿块检测与 BI-RADS 分类——不是整体衡量,而是按乳腺密度分层衡量。其结论——乳腺越致密,性能越是崩塌,而失衡的评估恰恰掩盖了这一点——既真实又有用。但论文本身复现了它所抨击的若干缺陷:摘要中的亮眼数字在自己的表格里遍寻不见、测试单元仅含一张图像,以及一个号称"基准"的东西却没有公开任何代码。
设计只识别靶标单一形态的蛋白质:AlloGen 与可学习的构象选择性(arXiv,2026)
解读 AlloGen,一篇于 2026 年 6 月 3 日发布于 arXiv 的预印本:一个生成定制蛋白质的框架,使其只结合靶标的单一构象——酶的活性形态而非静息形态。其核心是一个可学习的打分器 Q_θ,用于评估蛋白质-蛋白质界面的构象选择性。在八个训练中从未见过的靶标上,它达到 0.520 的平均秩相关;在钙调蛋白上,从头设计的多肽结合 holo 形态而对 apo 形态无可检测结合。这是构象选择性可学习的优雅且可复现的证明,但仅一个湿实验靶标、一个替代指标、薄弱的对照以及非商业许可证,使其远在任何药物的上游。
用机器学习预测抗HIV治疗的依从性失败:在192 732份多国病历上的“真实世界”验证值多少?(medRxiv,2026)
解读2026年5月发布在medRxiv的一篇预印本:在192 732份多国临床病历上验证机器学习模型,用以预测抗HIV治疗的依从性失败并量化诊疗路径中的缺口。时间验证的AUC为0.772,研究记录到从诊断到开始治疗的中位延迟为74天。这是一项诚实而有用的大规模演示,但区分度一般、公开摘要中依从性结局定义不透明、经济测算的假设未公开,都提示应当把这些数字看作其本来的样子。
用拓扑与视觉Transformer给脑肿瘤分类:在单一MRI数据集上99.1%的准确率值多少?(Ahmed 2026, arXiv)
解读Faisal Ahmed(Embry-Riddle Aeronautical University,亚利桑那州)于2026年5月30日发布在arXiv的预印本:一个把视觉Transformer与拓扑数据分析(持续同调)融合、将脑部MRI分为四类的模型。它在公开基准BRISC2025上报告了99.10%的准确率和99.98%的AUC——但相对现有模型的提升落在噪声范围内,评估只依赖单一数据集,且按图像而非按患者划分,无法排除数据泄漏,测试集还兼作模型选择之用。
BreastGPT:用一个多模态模型覆盖乳腺癌全诊疗流程——自建基准上 90% 的分数究竟意味着什么(Liu 等,2026,arXiv)
对 2026 年 6 月 3 日提交至 arXiv 的预印本的解读,作者为 Yang Liu 等(阿里巴巴达摩院、浙江大学、湖畔实验室、四川大学华西医院、中国医科大学):BreastGPT,一个号称覆盖乳腺癌全诊疗流程——筛查、诊断、治疗规划——的 80 亿参数多模态大语言模型,涵盖五种影像模态(乳腺X线、超声、MRI、CT、病理切片)及文本。模型在很大程度上由阿里自家大模型构建的 186 万条问答对上训练,在其自建基准 BreastStage-Bench 上达到 75.66% 的选择题准确率和 89.92% 的开放题得分。这是一次真实的工程展示,但大部分差距来自在与测试完全相同的分布上训练:公平的对照只高出几分,没有在真实患者上评估,也没有与临床医生对比,而"标准答案"在很大程度上由自家模型生成。
MCEN:用 Mamba 架构从一次穿刺活检预测乳腺癌化疗的完全缓解(Zhang 等,2026,npj Digital Medicine)
对 2026 年 6 月 2 日发表于 npj Digital Medicine 的论文的解读,作者为 Wenchuan Zhang、Shuwan Zhang、Fengling Li、Qingjie Lv、Yuhao Yi 与 Hong Bu(四川大学华西医院等):MCEN,一个基于 Mamba 架构的深度学习模型,可从作为数字切片读取的穿刺活检中预测乳腺癌患者在新辅助化疗后能否达到病理完全缓解。模型在一家中国医院的 1023 例患者上训练,并在另外四个独立中心(共 1646 例患者)上测试,训练 AUROC 为 0.923,但在外部验证中降至 0.76–0.81,融合临床病理数据后最高升至 0.84。其真正的多中心验证以及 Mamba 在十亿像素图像上的高效性是优点,但研究仍受限于明显的训练-验证差距、纯中国队列、剔除非典型类型的排除标准,以及缺乏与病理医生的对比。
SKELEX:用 130 万张 X 光片训练的基础模型来读骨——从囊肿到骨折(Kim 等,2026,npj Digital Medicine)
对 2026 年 6 月 2 日发表于 npj Digital Medicine 的文章的解读,作者为 Shinn Kim、Soobin Lee、Ilkyu Han、Sunghoon Kwon 及首尔大学的同事:SKELEX 被称为首个面向肌肉骨骼 X 光片的大规模基础模型。一个以 ViT-Large 为骨干的掩码自编码器,在来自单一韩国医院(2010–2016)的 1,296,540 张无标注 X 光片上进行自监督预训练,随后被适配到 7 个公开数据集上的 12 项诊断任务。它以平均相对 6.21% 的幅度超过五个基线模型(在骨肿瘤检测上 AUROC 为 0.953,而其自身初始化模型为 0.884),校准更好,并以一半的标注就达到了最优模型的水平。该工作在标注效率和方法学严谨性上令人信服,但受限于单中心、单一国家的训练数据,真正的外部验证仅限于骨肿瘤这一项应用,缺乏与放射科医生的比较,分辨率被压缩到 224×224,且权重仅供学术使用发布。
PINNOCHIO:用物理约束神经网络预测正颌手术后的面部,精度比肩有限元,却只需几秒(Lee 等,2026,arXiv)
对 2026 年 6 月 1 日发布于 arXiv(投稿至 MICCAI 2026)的预印本的解读,作者为 Jungwook Lee、Daeseung Kim、Kevin Gu、Zhangfeng Hu、Tianshu Kuang、Finn Hopeman、Michael A.K. Liebschner、Jaime Gateno 和 Pingkun Yan(伦斯勒理工学院、休斯顿卫理公会、贝勒医学院):PINNOCHIO 是一种物理约束神经网络,通过将骨–组织界面的运动与体积的超弹性变形分开,逐患者预测颌骨手术复位后面部软组织的变形。在 40 例真实临床病例(术前 CT + 术后 3dMD 表面)上,它在表面保真度上达到或超过作为参照的有限元模拟器(Chamfer 距离 1.12 毫米对 1.30;86.55% 的点在 2 毫米以内对 80.90%),而运行时间为 3.24 秒,而非 3.5 小时。该工作在速度与生物力学合理性上令人信服,但受限于仅 40 例的队列、只覆盖外表面的监督、所有患者共用的固定力学参数,以及未公开的代码与权重。
当大语言模型必须自己问诊:一个受临床考试启发的基准显示,交互式诊断推理会拉低表现(Zhan 与 Gan 2026,arXiv)
对 Chen Zhan、Xihe Qiu、Xiaoyu Tan、Xibing Zhuang、Gengchen Ma、Yue Zhang、Shuo Li、Peifeng Liu、Xiaoxiao Ge、Liang Liu 与 Lu Gan 于 2026 年 5 月 21 日发布在 arXiv 上的预印本的解读:一个"受 OSCE 启发"的基准,其中一个标准化病人模拟器迫使十五个大语言模型(LLM)像医学生一样,一轮一轮地自己完成问诊,然后再作出诊断。在 468 个病例上,从一开始就把信息全部给出,转为主动采集病史,会使诊断准确率下降 12.75%,使所引证据的质量下降 24.36%,错误主要源于过早的诊断闭合与低效的提问。结论冷静而有用:在静态医学选择题上的排行榜,很可能高估了这些模型在真实问诊中的能力。局限:病人模拟器本身也是算法,病例来源在可获取的摘要中未作说明(存在污染风险),且数字以相对值报告,没有明确的人类对照。
GTBIS:一个解读肺神经内分泌混合癌形态学以预测预后的深度学习模型(Yang 与 Zhou 2026,npj Digital Medicine)
对 Lin Yang、Ruyu Sheng、Zijian Yang、Shilong Liu 与 Meng Zhou(中国医学科学院北京国家癌症中心/肿瘤医院、温州医科大学、哈尔滨医科大学附属肿瘤医院)于 2026 年 5 月 30 日发表在 npj Digital Medicine 论文的解读:GTBIS 是一个可解释的深度学习模型,它解读病理切片的形态学以区分小细胞肺癌(SCLC)与大细胞神经内分泌癌(LCNEC),再将该解读应用于混合型 cSCLC-LCNEC 肿瘤以进行预后分层。在合计 670 例患者的多中心队列中,模型把接受放化疗的混合型肿瘤分为预后良好的 SCLC 样亚组(五年总生存率 100% 对 39.5%,无病生存率 87.5% 对 36.0%)与预后不良的 LCNEC 样亚组,且在多变量分析中该分类仍是独立预后因素。但样本量有限,所有中心均在中国,验证为回顾性且无明确的人类对照,许可证 CC BY-NC-ND 也封闭了改编。
Pathog-PDx:一个从电子病历识别22种儿童呼吸道病原体的机器学习系统(Su 2026, npj Digital Medicine)
对2026年5月29日发表于npj Digital Medicine的Dubin Su、Qun Chen、Ruizhi Xu等(厦门大学附属第一医院、郑州大学、南京大学、深圳市第二人民医院与UIUC)研究的批判性解读:Pathog-PDx,一个综合电子病历中42项临床与实验室特征来区分22种住院儿童呼吸道感染病原体亚型的诊断系统。开发队列涵盖三家临床中心与两个数据库的134,500名儿童,独立前瞻验证队列1,338名儿童,22种病原体的平均AUC为0.88,流感病毒为0.95,明确处理混合感染,并部署了基于web的决策支持系统的公开访问。但所有开发中心均位于中国,摘要中缺失人类临床比较,CC BY-NC-ND许可阻碍学术二次开发,且对22类金标准本身的讨论仍值得单独展开——分子生物学在不同病原体上的精度差异显著。
EpiVLM:用于视频癫痫发作检测与分类的视觉-语言模型,从医院到家庭(He 2026,npj Digital Medicine)
对2026年5月26日发表于npj Digital Medicine的Mengqiao He、Leihao Sha、Pengfei Wei、Lei Chen等(四川大学华西医院与中国科学院深圳先进技术研究院)研究的解读:EpiVLM是一个视觉-语言模型(VLM),将临床结构化提示词与视频推理相结合,识别五种癫痫发作症状学,基于来自两个三级医院、不受控的家庭录制以及一个独立公开数据集的232段视频、127名患者、11666个专家标注片段。准确率0.795-0.947,灵敏度0.842-0.957,视频级假阳性率0.47%-2.45%,从发作开始到检测的平均延迟低于6秒,提示词与决策阈值预先固定且无需站点重校准。但所有三级医院均位于中国,家庭视频队列在摘要中描述有限,未与人类标注者进行正面比较,且一位共同作者隶属于私营公司(Brain Everest LLC)却未声明利益冲突。
用于卒中后个体化认知预后的自动化神经影像流水线(Brzus 2026年,npj Digital Medicine)
对Michal Brzus、Joseph Griffis、Aaron D. Boes及其同事(爱荷华大学)于2026年5月27日发表在《npj Digital Medicine》上的论文的批判性分析:一个完全自动化的DICOM到PDF流水线,使用3D Residual U-Net分割缺血性病灶,通过病灶网络映射预测28项神经心理学结局,并通过物理隔离运行的LLaMA 3.3 70B在三分钟内撰写个性化报告。训练使用Iowa Lesion Registry的604例患者,独立测试使用153例使用17种扫描仪型号成像的缺血性卒中患者。在五个详细的认知领域上AUC为0.74至0.90,自动分割与手动分割得到的预测之间一致性达96%。但训练和测试来自同一中心,无临床比较器(NIHSS、mRS、纯人口学),报告的临床审核由资深作者本人完成,且七位作者中有四位持有相关专利并共同创立NeuroPred Inc.
SHAP 与 SVM 预测子宫内膜癌术后下肢深静脉血栓(Zhou 2026,npj Digital Medicine 研究解读)
解读周庆等人 2026 年 5 月 27 日发表于 npj Digital Medicine 的论文:基于四变量(术后 D-二聚体、年龄、纤维蛋白原、FIGO 分期)的 SVM 模型预测子宫内膜癌术后下肢深静脉血栓,内部验证 AUC 0.828、外部队列 AUC 0.819,基于 841 + 95 例中国患者,并采用 SHAP 提供可解释性。但影像由症状触发(检测偏倚)、队列 100% 为中国患者、未与 Caprini/Wells 评分正面对比,且 D-二聚体测量在术后进行 — 与其说是严格预测,不如说是早期检测辅助。
UNet-MoE-Cli:用混合专家模型为直肠癌新辅助治疗个体化(Liu 2026,npj Digital Medicine)
解读刘翔宇等2026年5月26日发表于npj Digital Medicine的文章:UNet-MoE-Cli,一个基于多参数MRI和临床变量的mixture-of-experts深度学习模型,逐方案估计局部晚期直肠癌新辅助治疗的病理完全缓解概率。内部验证AUC 0.827,前瞻性队列AUC 0.790(ChiCTR2400085797),但敏感度仅0.45–0.53,nCT专家仅在单一中心训练,队列100%为中国人,且升级方案的获益由模型自身计算。
当文本吞噬图像:Restrepo 2026研究揭示了临床VLM在MIMIC-CXR上的上下文脆弱性
解读David Restrepo(CentraleSupélec-巴黎-萨克雷大学)及其同事于2026年5月17日发布的arXiv预印本2605.17436:八个视觉-语言模型在MIMIC-CXR的1 000张胸部X光片上被评估,当临床文本被替换为相反类别患者的文本时,多达66%的正确决策会反转为错误。仅图像准确率仅为0.50–0.68,仅文本就能与多模态匹敌。即使是经过医学适配的MedGemma也崩溃了。这些VLM本质上是伪装成图像阅读器的报告分类器。
PromptRad:仅用32份标注的肝脏CT报告,便能与GPT-4打成平手
解读Ying-Jia Lin等人(台湾长庚大学)2026年5月发表的arXiv预印本2605.20052(BioNLP 2026 @ ACL):一个1.1亿参数的PubMedBERT,通过UMLS词表增强的prompt-tuning微调,在七类肝脏病灶的CT报告分类上仅用32份标注样本便达到89.2%的宏F1,并在否定句处理上优于GPT-4。
一万例合成病例对决四个前沿大语言模型:Auger 2026研究揭示Gemini 3和GPT-5在多发性硬化中的临床盲点
解读Stephen D. Auger(伦敦帝国理工学院)2026年4月发表于medRxiv的预印本:基于多达10 000个带有真值标签的多发性硬化合成病例,对四个前沿模型(Gemini 3 Pro/Flash、GPT-5.2/5-mini)在诊断、定位、检查和处理方面进行评估。诊断准确性不能预测治疗安全性:Gemini对适当的皮质类固醇使用不足,GPT-5在近十分之一的病例中错误地推荐静脉溶栓。
放射科中的GPT-4:为什么LLM的解释格式会改变医生的诊断准确性
解读Spitzer等人发表在npj Digital Medicine 2026的论文:101名放射科医生的随机对照试验,比较GPT-4的三种解释格式。思维链(chain-of-thought)使准确性提高12.2个百分点,而鉴别诊断格式则诱发自动化偏见。对临床部署LLM的启示。
GigaPath在数字病理学中:一个在13亿图像块上训练的基础模型带来什么改变
对2024年Nature论文Prov-GigaPath的深度解读:用于数字病理的Transformer基础模型。架构、数据、在26个癌症基准测试中的表现,以及对诊断的实际影响。