Hinton预言十年后,阿里通用医疗影像AI登Science正刊
编辑|杜伟 2016 年 11 月,深度学习先驱、诺贝尔物理学奖得主 Geoffrey Hinton 有过一则过于乐观的预言。他认为应该停止培养放射科医生,深度学习将在五年或十年内做得更好。 加拿大多伦多大学罗特曼管理学院举办的 Machine Learning and the Market for Intelligence 大会。视频地址:https://www.youtube.com/watch?v=2HMPRXstSvQ 近十年过去,Hinton 预言中的场景并没有出现。放射科医生短缺,至今仍是医疗体系面临的现实问题。AI 虽然已经能在不少影像任务中达到专家水平,却还难以像医生一样,全面检查多个器官,识别各种并存异常。 现在,阿里达摩院为这个问题交出了一份新答案。 9 月 18 日, 阿里达摩院联合浙江大学医学院附属第一医院等机构研发的通用医疗影像模型 DAMO RADAR 登上《Science》正刊,并正式对外开源 这也是近年来中国 AI 模型罕见登上《Science》正刊。 论文链接:www.science.org/doi/10.1126/science.aec6129 开源地址:https://github.com/alibaba-damo-academy/damo-radar RADAR 全称为 Rapid Abdominal Diagnosis with AI and Radiology,中文为基于人工智能与放射学的快速腹部诊断。该模型聚焦腹部增强 CT,在涵盖 18 个解剖结构、146 种临床相关影像学表现的近 4 万次系统评估中,平均 AUC(区分患者与未患病者的能力指标,1 为完美区分)为 0.913, 首次达到影像科专家水平 更值得关注的是,达摩院的这次突破不是来自通用聊天模型的医学考试成绩,它直面严肃的临床挑战,经受住了多医院的数万病例和大规模医生对照读片的检验。 这是否意味着,医疗影像 AI 已经接近属于自己的 GPT 时刻了? 医疗影像的 GPT 时刻,为何迟迟未到? 医疗领域持续吸引 AI 公司进入。IBM Watson 曾尝试为肿瘤治疗提供决策支持;DeepMind 探索过临床预警和眼科影像,2026 年又提出在医生授权下工作的「AI co-clinician」;OpenAI 也推出 ChatGPT Health 和 OpenAI for Healthcare。 这些探索瞄准不同环节,却面对相似的要求。医疗 AI 必须准确、可靠,还要能够接受复核。一次漏诊可能耽误治疗,一次误报也可能引发额外的检查。模型在测试集上取得高分之后,仍需证明它有能力适应不同医院、设备、扫描协议和患者人群。医疗也因此成为检验 AI 能否进入现实世界的一场高压测试。识别能力、泛化能力和安全边界,每一项都要经得起临床检验。 影像 AI 是其中发展较成熟、落地较快的方向之一。过去,深度学习推动了一批专用模型,在肺结节、糖尿病视网膜病变、特定癌症筛查等任务上达到甚至超过专家水平。这些成果大多围绕明确的病种和任务展开,收集影像,制作标签,再训练模型判断某种异常是否存在。任务边界清楚,模型也能被反复优化。 到了真实临床,任务边界往往更加复杂。 单项任务中的高分,很难直接换算成全面的诊断能力 。模型覆盖的疾病受到训练标签限制。每增加一项任务,都可能需要重新整理数据、标注、训练和验证。不同医院的影像采集和患者分布存在差异,换一个环境,模型性能可能下降。达摩院在专病研究中也遇到了这些问题。 达摩院高级算法专家张建鹏参与的第一个单病种 AI 项目是肺癌,此后又陆续负责肠癌等专病项目。按照传统流程,一个病种从立项到能力发布,往往需要两三年。做到第二个项目时,团队已经感到这条路线难以覆盖真实临床。「真实世界病种成千上万,按照这个速度,可能一辈子都做不完。」 达摩院资深算法专家张灵提到了另一种反差。团队研发胰腺癌筛查模型时发现,AI 能够识别细微的肿瘤线索,却仍可能受到腹水、术后改变或伪影的干扰,产生假阳性。对医生来说通常不难辨认的异常变化,反而可能成为专病模型的盲点。临床中,团队很难为每一种干扰因素都额外开发一个模型。真实世界不是一场 AI 答题考试,病人很可能得的不是一种特定的病,而是多种不确定的病,这是把多个专病模型串联起来都无法解决的问题。 这些困难推动达摩院重新思考学习方式。此次发布的 DAMO RADAR 要回答一个更大的问题:能否让同一个模型学习不同解剖结构、影像表现和临床描述之间的关系,从而覆盖更广泛的疾病谱? 视觉语言学习(Vision - Language Learning)提供了新的切入口 。医院日常产生的 CT 影像和放射学报告天然存在对应关系,模型可以直接学习这些配对数据,减少为每个病种逐例制作专门标签的需求。不过,把
发表评论