一个模型读完整套 PSMA PET/CT:报告生成、视觉问答与病灶分割——评测标签却由 Gemini 写成

以佛罗里达大学为首的十四位作者,搭建了一个统一的视觉语言模型:它能撰写 PSMA PET/CT 报告、就图像回答问题并分割病灶,训练数据为 5 747 例院内检查加 AutoPET 的 PSMA 子集。它在各项指标上都超过对比模型:BLEU 36.2 对 PET2REP 的 27.4,选择题正确率 83.6% 对 70.9%,病灶 Dice 0.588 对 nnUNet 的 0.550。但测试集的 10 274 道题目由 Gemini-2.5-Pro 生成并由同一模型核验,全程无人复核;没有任何核医学医师读过模型的任何一份输出;而摘要中宣称的体素级定位——按作者自己的承认——既未训练也未评估。

背景

PSMA PET/CT 在短短几年内成为前列腺癌的枢纽性检查。PSMA 指 prostate-specific membrane antigen(前列腺特异性膜抗原),一种在前列腺癌细胞表面大量过表达的蛋白。给患者注射一种与之结合、并由正电子发射核素标记的分子——本文为 18F-DCFPyL——PET 显示示踪剂的聚集位置,CT 提供解剖定位。由此得到的全身检查,在分期与治疗后复发探查上的敏感性远高于常规影像。

这种敏感性带来阅片成本。一次检查可能出现从骨盆到中轴骨的数十个病灶,医师必须把病灶与生理性摄取区分开:示踪剂本来就会在肾脏、膀胱、肝、脾和唾液腺聚集,有时强度甚至超过转移灶。阅片耗时,且读者间一致性并不完美。

此前应用于该模态的人工智能一直按任务分头推进:勾画病灶的分割模型(公开的 AutoPET 挑战赛组织了这方面工作)、PET2REP 之类的报告生成模型,以及视觉问答模型(VQA:用自然语言就图像提问并获得文本回答)。每一类都有自己的数据、流程和指标。本文的论点是架构性的:人类读者并不把这些动作分开,他描述所见,也指出所述。因此单一模型可以把文本锚定在它所分割的体素上。这是它许下的承诺;接下来要看的是它是否兑现。

方法

语言任务数据。佛罗里达大学的回顾性队列:5 747 例全身 PSMA PET/CT,2022 至 2025 年采集,全部使用 18F-DCFPyL,每例配有临床报告,并转换为结构化 JSON(日期、findings、impression)。经 IRB 批准并豁免知情同意。划分为4 023 / 574 / 1 150例用于训练、验证和测试——论文明确说明划分是 「at the case level」,即按检查而非按患者。没有报告任何人口学数据:没有年龄、没有 PSA、没有分期、没有检查指征;也没有纳入标准、没有独立患者数、没有设备信息。

分割数据。AutoPET 挑战赛的 PSMA 子集:来自慕尼黑 LMU 大学医院的 597 例检查、378 名男性患者,采集于 2014 至 2022 年,病灶掩膜在 PET 图像上由人工三维标注。这一次按患者划分:419 / 59 / 119。两个队列采用同样的空间标准化——重采样至 2.73 × 2.73 × 2.8 毫米,固定矩阵 256 × 256 × 400 体素,视野止于大腿上段,PET 转换为 SUV(standardized uptake value,按注射剂量和体重归一化摄取的单位)。

架构。整体沿用已成为视觉语言模型标准的 LLaVA 方案。首先是一个三维视觉编码器(双通道 vision transformer,PET 与 CT),以 CLIP 式对比学习预训练:让模型把一个体积拉近它自己的报告、推远其他所有报告。随后一个 MLP-Mixer 投影模块把视觉序列——三维情形下对语言模型而言过长——压缩为 512 个维度为 2 048 的 token。这些 token 送入一个经 LoRA 微调的语言模型(low-rank adaptation:冻结原始权重,只训练附加的小矩阵,此处秩为 128)。最后,一个 nnUNet 式三维分割分支通过特殊的 [SEG] token 和借自 LISA 的交叉注意力机制,接收语言模型的内部状态——这正是本应连接文本与体素的桥梁。此外还加入了来自 TotalSegmentator 的十组器官(肾、膀胱、肝、脾、脑、肺、心、前列腺、胃、唾液腺)的辅助解剖监督,用以教模型不要把生理性摄取当成病灶。

有一点必须立刻指出:所用的语言模型从未被命名。厂商、规模、版本一概没有。架构图上只写着 「LLM Backbone」,正文也没有更多说明。

问题是怎么造出来的。这是方法学上的关键点。VQA 数据集不是医师编写的,而是由 Gemini-2.5-Pro 的 API 从去标识化报告中生成,做法借自 CT-CHAT。每例检查九道题——三道描述题、三道选择题、三道自由作答题——主题被预先规定:是否存在病变、分布、前列腺床局部复发、盆腔与盆腔外淋巴结、转移。第二遍再由同一个模型核验每个答案是否有报告支持,并标出依据文本;不合格的条目被剔除或重新生成。最终保留 35 838 道训练题、5 166 道验证题和10 274 道测试题。全流程未报告任何人工复核。

训练分四个阶段:视觉编码器的对比预训练;冻结视觉与语言、只对齐投影层;在报告与 VQA 上微调视觉语言分支;最后的多任务调优,文本与分割联合优化,一侧用自回归损失,另一侧用交叉熵加 Dice。硬件写得很细(八张 NVIDIA B200,PyTorch 2.7),但没有给出任何超参数:学习率、批大小、训练轮数、任务权重全部缺失。只给了优化器 AdamW。

结果

图文检索。预训练编码器先被单独评估:能否从一个体积中找回正确的报告。在 1 150 例测试检查中,正确报告出现在前 100 位结果中的比例为 35.6%[95% 置信区间 32.6–38.3],仅用 CT 训练的 CT-CLIP 为 14.2%,随机抽取为 7.5%。差距明确且测量干净:PET/CT 专用预训练确实带来了实质收益。

报告生成。所提模型取得 ROUGE 23.4、BLEU 36.2、METEOR 19.6、CIDEr 3.13、BERTScore 86.1。对比模型为 PET2REP(ROUGE 16.7、BLEU 27.4、METEOR 17.0、CIDEr 0.53、BERTScore 84.2)与只看 CT 的多模态基线 MedVL-SAM2(ROUGE 12.5、BLEU 9.1、CIDEr 0.015)。所有 bootstrap 置信区间互不重叠。但必须清楚这些指标衡量的是什么:BLEU、ROUGE、METEOR 和 CIDEr 统计的是生成文本与参考文本之间词序列的重合度,它们对诊断正确与否只字未提。一份把参考中的「骨病灶」写成「无骨病灶」的报告,在 BLEU 上只损失百分之二的词,在临床上损失一位患者。论文没有报告任何临床事实准确性指标——RadGraph F1、GREEN、RaTEScore,这些如今都已可用。BERTScore 不算:它衡量语义接近度,不衡量真假。

视觉问答。选择题上模型正确率为 83.60%[82.39–84.87],MedVL-SAM2 为 70.89%[69.29–72.39]。自由作答题上 CIDEr 从 17.5 升至 91.6。换成直白的说法:每六道选择题仍有一道答错,而这套题目的难度是由另一个语言模型设定的。

分割。Dice——预测体积与标注体积的重合度——在语言引导变体下达到 0.5875[0.5426–0.6314],语义变体为 0.5858,nnUNet 为 0.5498[0.4962–0.6012],SegAnyPET 为 0.4653。作者还按三种匹配标准给出三个病灶级 F1:任意重叠(0.736 对 nnUNet 的 0.653)、覆盖最大 SUV 体素(0.727 对 0.637)、病灶 Dice 大于 0.5(0.593 对 0.492)。

换成临床语言。在最宽松标准下病灶级 F1 为 0.736,意味着所计数的病灶中约四分之一要么被漏掉、要么被凭空造出。Dice 为 0.59 意味着勾画体积只覆盖真实体积的 59%:用于单纯检出尚可,用于镥-177 放射性配体治疗的剂量学则不可——那里肿瘤体积直接决定剂量。而且恰恰在 Dice 上,所提模型的置信区间与 nnUNet 的大幅重叠,0.038 分的增益并未确立。全文未报告任何配对统计检验:统计一节仅有 bootstrap 区间,且未说明重采样次数。

做得好的地方

PET/CT 对比预训练是用测量而非直觉来论证的。作者本可以只断言专用编码器优于拿来的 CT 编码器。他们却在一个中间任务——图文检索——上加以验证,既有合适的对比对象(CT-CLIP),也有明确的下界(随机)。结果显示 CT-CLIP 在文到图检索上几乎与随机无异,这本身对领域就是有用的结论:把 CT 编码器直接搬到核医学上并不奏效。

分割指标的选择是诚实的。全局 Dice 在 PSMA PET 上是一个糟糕的度量,因为它被少数大病灶主导,而忽略了真正会改变分期的小病灶。报告三个病灶级 F1、其中一个以最大 SUV 体素为锚,是正确的反应。而且三个标准一并给出,包括最严格的那个——在该标准上与 nnUNet 的差距恰恰最大。

解剖监督针对的是真实的失效模式。加入 TotalSegmentator 的十组器官并非装饰:肾、膀胱和唾液腺的生理性摄取是 PSMA 阅片中假阳性的首要来源。给模型一张解剖图以学会排除它们,回应的是临床医师提出的问题,而非架构上的需要。作者还毫不粉饰地列出了主要局限,并申报了资助(NIH R01EB034692 与 R01AG078250)和无利益冲突。

做得不够好的地方

VQA 的评测是循环的。这是核心局限。Gemini-2.5-Pro 从报告中写出题目,然后 Gemini-2.5-Pro 核验自己的答案是否有同一批报告支持。10 274 道测试题构成了金标准,而其中没有一道经过医师复核。因此 83.6% 这个分数衡量的,是一个受训模型与另一个评判自身产物的模型之间的一致性。此外还缺少足以定论的对照:没有任何图像盲测基线。从报告派生出来的选择题,常常不看图像就能靠内部一致性或选项分布猜中——这是教科书式的捷径学习(shortcut learning),模型学到的是伪相关而非任务本身。除非让一个不接触任何图像的纯语言模型跑一遍同一套题,否则无从知道 83.6% 中有多少来自真正读了 PET。

没有任何外部验证,而划分方式为数据泄漏留了口子。三项语言任务都在同一队列上训练和测试:一个中心、一种示踪剂、一个时间段。没有第二家医院、没有第二台设备、没有在世界其他地区广泛使用的 68Ga-PSMA-11 上做测试。更值得担心的是,论文明确说明划分是按检查而非按患者。而一名接受前列腺癌随访的男性通常会做多次 PSMA PET/CT——初始分期、治疗后复查、复发排查。如果同一名患者同时落在训练侧与测试侧,这就是严格意义上的数据泄漏,所报告的性能会被高估一个未知的幅度。论文没有给出 5 747 例检查背后有多少名独立患者,以致连风险有多大都无法估计。至于 AutoPET,它同时用于训练和测试:这不是外部验证,而是流程内部的第二个数据源。论文没有尝试任何交叉测试——在佛罗里达训练、在慕尼黑评估。

没有任何人读过模型的哪怕一份输出,定位的承诺也没有被检验。没有读者研究、没有错误分析、没有幻觉计数:作者明确把这些工作留给未来。对于一个主要产物是给医师看的报告的系统,这恰恰是缺失的那项评估,而且没有任何事实性指标来替代。更重要的是,支撑统一架构这一论点的核心——摘要中宣告的体素级定位——在强意义上并不存在,作者自己也承认:报告数据集与分割数据集并未在病例层面配对,因此没有任何约束要求被分割出的病灶必须在文本中被提到,也没有任何约束要求文本中描述的病灶必须对应一个掩膜。本文的论点在摘要中被断言,又在讨论中被推翻。

此外还有一些并非细枝末节的可复现性缺口:语言模型未被命名,训练超参数一概未给,而且对一个由五个不同模块拼成的架构没有做任何消融实验——无从得知 MLP-Mixer、TotalSegmentator 监督、交叉注意力或 LoRA 秩各自贡献了什么。代码与权重均未公开,尽管有一节题为 「Code availability」,其中却只有库的版本号。院内数据仅在向通讯作者提出合理申请后才可获取。

这带来什么改变

对研究界,这篇论文具有测绘价值。它表明把标准的 LLaVA 方案迁移到三维 PET/CT 是站得住的,并能在单任务模型自己的指标上胜出;它也精确地指出了瓶颈:缺的不是架构,而是报告与病灶掩膜描述同一批检查的数据集。只要这两个来源仍然彼此分离,文本到体素的定位就只能停留在示意图层面。第二个教训是否定性的,同样有用:用语言模型生成 VQA 基准如今因成本低廉而成为常规做法,但若不配上图像盲测基线和一份经临床医师复核的样本,产出的分数无人知道该如何解读。

对临床医师,今天什么都没有改变。没有读者研究、没有外部验证、没有代码、没有权重、没有监管准入,只有一种示踪剂。真正值得在三到五年尺度上关注的是方向:一个可以向其提问、并以它所依据的体素作答的阅片助手,与不透明的检出评分不同,是可以在床旁核验的。前提是定位确实被训练过——并且有人量化过它错的频率。

对患者与公众,这里的教训关乎措辞。一个宣称「人工智能读前列腺 PET 已优于现有模型」的标题,字面上准确,实际上误导:这个模型是在词语重合度指标上、在由另一个人工智能写成的题目上、在一家美国医院内部胜过了其他模型。至今没有任何医师核实过它的任何一份报告是正确的。

延伸阅读

预印本:A Unified Vision-Language Model for PSMA PET/CT Report Generation, Visual Question Answering, and Lesion Segmentation,arXiv:2609.15603,2026 年 9 月 14 日提交,CC BY 4.0 许可,24 页。作者:Yang Xing、Jiong Wu、Savas Ozdemir、Yang Zhou、Boxiao Yu、Ying Zhang、Zheren Zhu、Chenyu You、Wei Shao、Yang Lu、Kang Wang、Tinsu Pan、Yang Yang 与通讯作者 Kuang Gong,分属佛罗里达大学(盖恩斯维尔与杰克逊维尔)、加州大学旧金山分校、石溪大学与 UT MD Anderson 癌症中心。资助:NIH R01EB034692 与 R01AG078250;无申报利益冲突。代码与权重均未公开;院内数据可在向通讯作者提出合理申请后获取。分割数据集是公开的:AutoPET。

关于相同的问题,参见我们关于前列腺癌 PSMA PET/CT 的 UNETR 分割与生存预测、关于生成式病理报告的临床评估,以及关于标签由语言模型撰写的基准的循环性的解读。