RSNA、膝のMRIを読み取り報告するAI向けの$77,000のチャレンジを開始

Kaggle(カグル)コンテストは、16の機関から提供された5,000件以上の試験を使用しており、別途効率性トラックが設けられています。

By · Published

Why it matters

RSNA is testing whether multimodal medical AI can generalize across hospitals and languages while remaining efficient enough for real clinical infrastructure.

Illustration of a human knee MRI scan beside charts and a document labeled RSNA and Kaggle, representing the contest to build AI that reads and reports knee MRIs.

The Radiological Society of North America は、膝MRI検査における12の臨床的に重要な異常を検出する機械学習モデルを対象とした賞金総額77,000ドルのKaggle competition を開始した。

コンテストは7月30日に開幕し、参加者は医用画像と放射線科所見テキストの両方を扱うことが求められる。最終提出は10月22日で、参加登録とチーム合併の締め切りは10月15日となっている。賞金プールには最高得点のエントリへの賞と、別枠の効率性トラック向けの賞が含まれる。

RSNAは、世界16施設から提供された5,000件超の膝MRI検査を用いてベンチマークを構築した。各検査には元のレポートがペアになっており、コレクションは9言語にまたがる。RSNAによれば、これは同学会の年次AIチャレンジで、モデル開発と評価の過程で画像と報告テキストを併用する初の試みだという。

臨床的変動を含むマルチモーダルなテスト

膝MRIの読影では、放射線科医が同一検査内で複数の構造と所見を評価する必要がある。このモダリティは靭帯や半月板損傷、軟骨欠損、骨髄病変、関節液貯留(エフュージョン)、滑膜炎、嚢胞などを明らかにできる。これらの所見は共存し得るため、課題は単一の孤立した病変を探すのではなく、マルチラベル分類問題となる。

スキャンとレポートを対にすることで、参加者は同一症例の不完全な二つの視点を得ることになる。画像は基礎となる解剖を含んでおり、レポートはその検査を読影した放射線科医の観察と用語を符号化している。モデルは、特定の病院、言語、報告様式に紐づく近道(ショートカット)を学習することなく、それらの入力を調整しなければならない。

データセットの地理的分布も難易度を上げる要因だ。MRIプロトコル、スキャナのハードウェア、臨床文書の作成は施設ごとに異なる。ある施設の取得条件や語彙を認識することで高性能を示すモデルは、別の医療機関のデータで評価すると失敗する可能性がある。16施設構成は、単一のコンペティション内でこうした分布シフトの一部を検証する手段をRSNAに提供する。

RSNAはリーダーボードに効率性を反映

効率性賞は、医用画像コンペティションで繰り返し問題となる点に対処する:最も高精度なエントリは、臨床での運用には高価すぎたり遅すぎたりするアンサンブルに依存する場合がある。MRI検査は単一のレントゲン写真よりも遥かに多くのデータを含み、各症例を複数の大規模モデルで処理すると推論時間とハードウェア要件が増大する。

効率性を別枠で報いることで、RSNAは参加者に対してモデル圧縮、前処理の削減、アンサンブルサイズの制限を行いつつ診断性能を維持するインセンティブを与えている。そのトレードオフは、画像ソフトウェアが既存の放射線情報システムと並行して検査を処理し、大規模なアクセラレータクラスタへのアクセスを前提とできない診療現場で重要となる。

このコンペティションは依然としてベンチマーク性能を測るものであり、臨床上の準備状況を示すものではない。RSNAのチャレンジ形式は参加者にラベル付きのトレーニングデータを提供し、最終モデルをデータセットの隠された部分に対して評価する。プライベートリーダーボードでの高スコアは、テスト条件下で専門家が付与したラベルにモデルが一致したことを示すにすぎない。それがすべてのスキャナ、患者集団、臨床ワークフローにわたって安全であることを証明するものではない。

先行研究は可能性と残るギャップの両方を示している。ある2021年に Radiology: Artificial Intelligence に掲載された研究 は、軟骨、骨髄、半月板、前十字靭帯に係る膝MRIの異常を対象にディープラーニングモデルを検証した。報告された感度は70%から88%の範囲で、特異度は85%から89%の範囲だった。AI支援は、主要医師と研修医の比較16件中10件で一致度を改善した。

RSNAの新しいコンペティションは、この課題をより多くの施設、より多くの異常クラス、多言語のレポートへと拡大する。最も強力な結果は、ピクセルと臨床言語の双方の変動を乗り越え、さらに効率性賞で強調される計算上の制約内でそれを達成する必要がある。

チームは最終モデルを10月22日までに提出しなければならない。RSNAは受賞要件の締め切りを11月5日に設定しており、年間総会で上位チームが表彰される前にこれを予定している。

Reader comments

Conversation for this story loads after sign-in.