阿里达摩院 RADAR 深度拆解:一次腹部 CT 看 146 项发现,26 位放射科医生里赢 23 位,但权重禁止商用

26 位放射科医生坐在同一场测试里,23 位的平均准确率输给了一个模型。

9 月 17 日,这篇研究登上了《Science》,题目是《An expert-level generalist AI for abdominal CT diagnosis》;9 月 18 日,阿里巴巴达摩院把模型权重放上 HuggingFace,宣布开源。国内媒体当天跟进的口径几乎一致:全球首个「专家级」通用医学影像 AI,一次腹部增强 CT 能识别超过 146 种病症。

我把代码仓库拉下来、把权重页面和许可证逐个点开之后,第一句话就卡在许可证那一行:权重写的是 CC BY-NC-SA 4.0,NC 是 NonCommercial,禁止商业使用。

数字先摆出来:这篇论文证明了什么

论文的核心是一个叫 RADAR 的模型(Rapid Abdominal Diagnosis with AI and Radiology)。它跟此前影像 AI 最大的区别是打法:过去一个模型对应一种病,RADAR 把一例腹部增强 CT 按解剖结构拆开,再对照放射科报告学「这个部位的这句话对应什么影像表现」,一次性输出整份发现清单。

官方新闻稿与论文摘要给出的数字如下:

项目 数字
训练数据 424,911 例腹部增强 CT、150 万图文对、1500 万解剖级配对
覆盖范围 18 个解剖结构、146 项影像发现
平均 AUC 0.913(同批对比中最好的同类视觉语言模型为 0.776)
急诊场景 27,000 例以上急诊 CT 上 AUC 0.904,且训练未使用急诊数据
外部泛化 8 家外部中心,AUC 0.895
读者研究 26 位放射科医生,AI 辅助下诊断敏感度提升约 10%
作者与机构 40 位作者,达摩院与多家医院合作,含浙江大学医学院附属第一医院

AUC 是区分有病与没病的能力指标,1.0 是完美,0.9 以上在影像 AI 里属于可用的高水平。论文摘要的结论句是:通用型 AI 已经能在常规与复杂阅片任务上达到人类专家水平。

数据之外还有一段传播更广的说法:模型的平均准确率超过了 26 位参与者中的 23 位。这句话来自达摩院对研究的转述,被南华早报等媒体引用后,变成了中文标题里的「AI 赢了 23 位医生」。它和摘要里那句「辅助提升敏感度 10%」其实是两组不同的实验。

开源清单:我把仓库逐个点了一遍

「开源」这个词在这件事里需要拆开看,因为同一项目在三个地方用了三种许可证。

内容 是否开放 口径
代码 开放 GitHub 仓库 alibaba-damo-academy/damo-radar,Apache-2.0,可商用
模型权重 开放下载 HuggingFace 上共 6.4 GB,许可证 CC BY-NC-SA 4.0,禁止商业使用
训练数据 不开放 424,911 例只存在于论文里,一例影像都没放出来
外部测试数据 部分开放 用的是斯坦福 MERLIN 数据集,需向斯坦福申请下载
处理后的掩膜与重采样图 开放下载 HuggingFace 数据集,960 次下载,同样是非商用许可
代码归档 开放 Zenodo 存档 379 MB,许可证又写成了 CC-BY-4.0

代码仓库本身 510 MB,89 个 Python 文件、18,718 行,其中 7,633 行是从 Salesforce 的 LAVIS 视觉语言框架搬来的底座,达摩院自己的工程量大约一万行上下。仓库 7 月 3 日就建好了,比论文上线早了两个半月,45 次提交,最后一次推送是 9 月 18 日。

权重文件也能看出这个模型的体量:RADAR+ 主检查点 1.65 GB,预训练版 1.57 GB,单独的 UNet 视觉分支 208 MB,另有中英文两个 BERT 文本编码器,分别 412 MB 与 440 MB。也就是说,它的文本端是 BERT-base,视觉端是 3D UNet 与 ResNet,不是大语言模型。

想真正跑起来,门槛写得挺实在:官方文档要求单张 A100 或 H20 显卡,演示用的一例原始腹部 CT 体积 98 MB,预处理还要装 TotalSegmentator 分割 104 个解剖结构,报告解析脚本则要填 DashScope 的 Qwen 接口密钥。仓库里附带的外部测试结果有 5,125 例样本,但只覆盖 20 项发现——那是斯坦福 MERLIN 数据集有标签的那部分;146 项的完整逐例结果并不在仓库里。

还有一个细节值得记一笔:两天过去,仓库 323 星、37 次 fork,两个 issue 都还开着没人回。一个问「会不会有在线 demo」,另一个来自苹果芯片用户,说自己花时间把推理路径改成 MPS 跑通,只需要改 3 个文件、14 处设备调用,推理链路里没有任何自定义 CUDA 算子、纯 fp32,并附上了数值等价的验证。这是一个挺客气的补丁,目前还挂着。

三个被标题盖住的细节

第一,146 是「发现」,不是「病」。 我把模型输出的 146 列标签导出来看了一遍,里面既有直肠癌、胆管癌、胰腺肿瘤这类疾病,也有大量描述性条目:主动脉钙化、肝脂肪肝、脾副脾、膀胱憩室、肾上腺钙化、肋骨骨折、肝内钙化灶。官方中文口径写的是「识别超过 146 种病症」,读者很容易理解成能查出 146 种独立疾病,实际清单里相当一部分是阅片时顺带记录的表现。

第二,「赢了 23 位医生」是另一组实验。 论文摘要里读者研究的原句是「RADAR 辅助把 26 位放射科医生的诊断敏感度提升了约 10%」;而「平均准确率超过 23 位参与者」是模型单独阅片与医生单独阅片的对比。前者说的是 AI 帮医生少漏诊,后者说的是 AI 与医生同台竞争,两者都会被引用,但混在一起说就成了「AI 取代医生」的标题。官方还提到,在 AI 辅助下医生用时减少 30% 以上。

第三,它只吃增强 CT。 腹部增强 CT 要注射造影剂,属于有创的诊断检查,不是体检筛查。达摩院自己那条更出名的产品线走的是相反路线:用最常见的平扫 CT 做「一扫多筛」。所以 RADAR 的定位是诊断环节里的读片助手,不是把体检变成 AI 初筛。

另外,从论文摘要和官方新闻稿看,所有评测都是在已有病例上完成的回顾性评估,公开材料里没有前瞻性临床试验的结果;同批对比中那个 AUC 0.776 的「最好的同类模型」也没有被点名。

达摩院的医疗 AI 已经走了四年,这是通用化那一步

把 RADAR 放回时间线,会更容易理解它为什么值得上《Science》:

  • 2023 年 11 月,胰腺癌平扫 CT 早筛研究登上《自然·医学》,在两万多例真实病例的回顾性试验里找出 31 例临床漏诊病变
  • 2025 年 4 月,胰腺癌筛查模型 DAMO PANDA 拿到美国 FDA 的「突破性医疗器械」认定
  • 2025 年 11 月,GE 医疗与达摩院签署合作框架意向书,把 CT 影像 AI 往设备侧推
  • 2026 年 3 月,「胰腺病变 CT 图像辅助分诊软件」进入 NMPA 创新医疗器械特别审查程序
  • 2026 年 4 月,肠癌「无感」筛查研究登上国际肿瘤学期刊

这条路线一直是「一个模型查一种病」,RADAR 则是把单病种模型收拢成一个通用底座,再靠解剖级对齐把泛化撑起来——外部 8 家中心 AUC 只掉 0.018,急诊场景没训练过也能到 0.904,这两个数字才是它进《Science》的理由。

对照物也很清楚。RADAR 的外部测试集就是斯坦福的 MERLIN 数据集,而 MERLIN 团队自己在 2024 年发布的 3D CT 视觉语言基础模型,走的正是同一条「通用模型」路线,并在 2026 年发在《自然》上。这一年里,通用影像模型这条线被两本顶级期刊各认可了一次。

但商业化的距离还摆在那:许可证禁止商业使用,模型也没有医疗器械注册证。对医院和厂商来说,短期内它只能当研究基座,不能直接变成产品。

结论:值得抄的是方法,不是权重

这件事最值得带走的不是 6.4 GB 的检查点,而是它证明了一条可复制的训练路径:用现成的分割工具把 CT 按解剖结构切开,用大模型解析临床报告拿到弱标签,再用解剖级对比学习把影像和文字对齐。 整条链路不依赖人工标注,这才是 42 万例数据能跑出结果的原因。国内做影像 AI 的团队真正能借鉴的,是这套「不靠人标注」的工程范式,以及官方在仓库里公开的预处理代码与报告解析脚本。

至于那份权重,科研可以下,产品化要谨慎:非商用许可加上没有注册证,决定了它在国内医院里暂时只能以研究合作的形式出现。

对普通读者,一句话判断:一次 CT 给出 146 项发现,这件事是真的,也是影像 AI 近年少见的硬进展;但它替代的是读片流程的第一步——把该看的地方全部标出来,而不是放射科医生。

关注 AI 商业快讯,每天一篇 AI 热点深度解读。

相关阅读:

发表评论