RSNA 为能够解读膝部 MRI 并撰写报告的 AI 发起价值 77,000 美元的挑战赛

Kaggle 比赛使用来自 16 家机构的超过 5,000 份考试数据,并设有单独的效率赛道。

By · Published

Why it matters

RSNA is testing whether multimodal medical AI can generalize across hospitals and languages while remaining efficient enough for real clinical infrastructure.

Illustration of a human knee MRI scan beside charts and a document labeled RSNA and Kaggle, representing the contest to build AI that reads and reports knee MRIs.

The Radiological Society of North America 已开启了一个价值 $77,000 的 Kaggle competition,面向能检测膝关节 MRI 检查中 12 种临床重要异常的机器学习模型。

该竞赛于 7 月 30 日开启,要求参赛者同时处理医学影像和放射学报告文本。最终提交截止日为 10 月 22 日,10 月 15 日为参赛和团队合并截止日。奖金池包括对得分最高条目和单独的效率赛道的奖励。

RSNA 从全球 16 家机构提供的 5,000 多例膝关节 MRI 检查中构建了该基准。每例检查都配有其原始报告,报告集合涵盖九种语言。RSNA 表示,这是其年度 AI 挑战中首次在模型开发和评估过程中同时使用图像和报告文本。

A multimodal test with clinical variation

膝关节 MRI 的解读要求放射科医生在同一次检查中评估多个结构和发现。该模态可揭示韧带和半月板损伤、软骨丧失、骨髓病变、积液、滑膜炎和囊肿等。这些发现可能并存,使得该挑战成为一个多标签分类问题,而不是寻找单一孤立病灶。

将影像与报告配对也为参赛者提供了对同一病例的两种不完美视角。影像包含底层解剖信息,而报告则编码了进行该检查的放射科医生的观察和术语。模型必须在不学习与特定医院、语言或报告风格挂钩的捷径的情况下调和这些输入。

数据集的地理分布增加了难度。MRI 协议、扫描仪硬件和临床文档在各机构间存在差异。一个因识别某一站点的采集设置或词汇而表现良好的模型,可能在用另一家卫生系统的数据评估时失败。16 家机构的设计为 RSNA 在单次竞赛中测试部分这种分布漂移提供了手段。

RSNA puts efficiency on the leaderboard

效率奖项解决了医学影像竞赛中另一个反复出现的问题:最准确的参赛作品可能依赖于在日常使用中代价过高或速度过慢的集成模型。与单张 X 光片相比,MRI 检查包含显著更多的数据,通过多个大型模型处理每例病例会增加推理时间和硬件需求。

通过单独奖励效率,RSNA 鼓励参赛者在保持诊断性能的同时压缩模型、减少预处理并限制集成规模。这种权衡在影像软件必须与现有放射系统并行处理检查且不能假定可访问大型加速器集群的诊所中尤为重要。

该竞赛仍然衡量基准性能,而非临床就绪度。RSNA 的挑战格式向参与者提供带标签的训练数据,并在数据集的隐藏部分上评估最终模型。较高的私有排行榜得分表明模型在其测试条件下匹配了挑战的专家标注。它并不证明在每种扫描仪、患者群体或临床工作流程中都安全可靠。

早期研究既展示了潜力,也揭示了差距。一项 2021 study published in Radiology: Artificial Intelligence 测试了针对软骨、骨髓、半月板和前交叉韧带的膝关节 MRI 异常的深度学习模型。报告的敏感性在 70% 到 88% 之间,而特异性在 85% 到 89% 之间。在涉及主治医师和进修医师的 16 项比较中,AI 辅助在 10 项中提高了一致性。

RSNA 的新竞赛将该问题扩展到更多机构、更多异常类别和多语言报告上。最强的结果需要在像素和临床语言的变异中经受住考验,并在效率奖强调的计算限制内做到这一点。

团队必须在 10 月 22 日前提交最终模型。RSNA 已将其获胜者要求截止日期定在 11 月 5 日,以便在其年度会议上对表现最好的团队予以表彰。

Reader comments

Conversation for this story loads after sign-in.