KhoslaとEmanuelは、自律型AIがAIを使用している医師よりも優れている可能性があると主張している。
JAMAのPerspectiveはシミュレーション研究を基にしており、医学界で支配的な医師主導の導入モデルに挑戦している。
By Ryan Merket · Published
Primary source: X
Why it matters
Medical AI startups are built around physician oversight. If human review sometimes lowers accuracy, product design, staffing, liability, and unit economics all change.

Vinod Khosla (@vkhosla) と共同執筆者3名は月曜日に、自律型の医療AIは最終的に認知的ケア(cognitive care)において医師より優れた成果を提供できる可能性があり、AIを意思決定支援ツールとして使う医師を含めてそうなると主張しました。
その主張は2026年8月17日付のJAMA Perspectiveに掲載され、Khosla、University of Pennsylvaniaのバイオエシックス研究者であるZeke Emanuel (@ZekeEmanuel)、Pennの研究者Abe Baker-Butler (@AbeBakerButler)、そしてAIプライマリケア提供者Curai Healthの創業者兼CEOであるNeal Khosla (@nealkhosla)によって執筆されました。Vinod KhoslaはSun Microsystemsを共同設立し、その後Khosla Venturesを立ち上げた人物で、長年にわたりAIが希少な専門知識を広く提供するようになると主張してきました。Neal Khoslaは2017年以降、Curaiでその医療版の仮説を追求してきました。 (jamanetwork.com)
著者らは、多くの組織化された医療界が支持する導入モデルに異議を唱えています。American Medical AssociationはAIの補助的役割を強調するために "augmented intelligence" という用語を使用しており、American College of Physiciansはこの技術は臨床判断を置き換えるのではなく臨床判断を支援すべきだと述べています。JAMAの著者らは、あるタスクでAIシステムが一貫して非支援の医師を上回るようになった場合、この構造が逆効果になりうると主張しています。 (jamanetwork.com)
Khoslaは6件の投稿からなるスレッドで、人間によるレビューはモデルのエラーを検出できるが、医師がAIシステムを誤ってオーバーライドした場合には新たなミスを招くこともあると述べました。人間はアルゴリズムをいつ信頼すべきかを判断するのが不得手であり、特にアルゴリズムの性能が自分たちを上回った後ではそうだ、と彼は書いています。
これがPerspectiveの中心的な賭けです:おなじみの "human in the loop" による安全弁は、レビューする人間の正確さがレビュー対象のシステムより低い認知的タスクでは品質を低下させる可能性がある、と著者らは主張します。彼らはこの議論を問診(history-taking)、診断、検査選択、治療計画、臨床ガイドラインへの準拠に適用しています。さらに、汎用的な言語モデル・インターフェースを使用した研究は、臨床推論向けに特別に構築されたシステムの性能を過小評価している可能性があるとも論じています。
証拠は大部分がシミュレーションである
この記事はPerspectiveであり、新たな臨床試験ではありません。その論拠は以前に発表された研究に依拠しており、その中には診断会話向けに設計された実験的システムであるGoogleのArticulate Medical Intelligence Explorer、通称AMIEが含まれます。
2025年のNature論文は、AMIEを20人のプライマリケア医と159件のカナダ、英国、インド由来のシミュレートされた症例シナリオを用いた盲検比較研究で比較しました。専門医は32項目の評価基準のうち28項目でAMIEを高く評価し、患者役の俳優は26項目のうち24項目でAMIEを支持しました。Khoslaは、医師評価者が患者から関連情報を引き出す点でAMIEを医師より支持した割合が97%対50%だったという結果を強調しました。 (nature.com)
この実験設定は、これらの数値が何を示しているかを厳しく制限します。医師とAMIEは訓練を受けた患者役との同期テキストチャットを通じてやり取りしており、Natureの著者らはこの形式は通常の対面診療や標準的なテレメディシンを反映していないと述べています。これらの症例は身体診察、非言語的手がかり、断片化した記録、地域の臨床慣行、あるいは実際の患者を巻き込むエラーの結果を捉えることができませんでした。研究者らは、AMIEをプロトタイプから医療現場に移すには安全性、信頼性、プライバシー、バイアス、不確実性、および規制上の保護策について追加の作業が必要であると述べています。 (pmc.ncbi.nlm.nih.gov)
Googleはその後、AMIEをマルチモーダルかつ長期的ケアの実験へと拡張しました。2026年5月の研究は、写真、心電図、および臨床文書を解釈できるバージョンを105件のシミュレートされたテレヘルス症例で評価しました。専門医は32項目の評価のうち29項目でプライマリケア医を上回ると評価しました。別の疾病管理研究では、AMIEが複数回の受診にわたって推論し、治療計画をガイドラインと整合させることができると示されましたが、著者らは実世界への移行にはさらなる研究が必要であると再度述べました。 (pubmed.ncbi.nlm.nih.gov)
Google自身の研究も医師による監督の余地を残しています。ガードレール付きのAMIEを用いた実験では、医師が生成されたノートをレビューし、患者に伝えるメッセージについて責任を保持しました。Googleは、ワークフローがAIの特性に合わせて設計されていたため、これらの結果をシステムが臨床家より優れている証拠と解釈すべきではないと述べています。 (research.google)
Beth Israel Deaconess Medical Centerでの前向き研究は、AMIEを来院前の会話ツールとして実際の臨床受診に持ち込みました。患者は概してそのやり取りを好意的に評価し、医師はその記録が準備に役立ったと述べました。患者はその後も引き続き臨床医に診てもらっており、この研究は自律型AIがより良い診断、治療、あるいは健康アウトカムを生み出したことを立証してはいません。 (research.google)
商業的利害を伴う仮説
著者らの所属はこの議論にとって重要です。Neal KhoslaはCuraiを運営しており、独自のAIおよび機械学習システムで支えられたバーチャル・プライマリケアを販売しています。Curaiは投資家としてKhosla Venturesを挙げています。Vinod Khoslaのベンチャー企業は、医療を含むAIによる専門知識提供を主要な投資仮説に据えてきました。 (jamanetwork.com)
そうした利害関係がPerspectiveの価値を無効にするわけではありません。むしろ、著者らが医師の拡張(augmentation)をめぐるより安全なコンセンサスを越えて主張している理由を説明します。自律型システムは、あらゆるやり取りで医師の注意を必要とせずに患者にサービスを提供できる可能性があり、プライマリケアの労働構造とコスト構造を変えることになります。医師主導の製品は臨床スタッフの配置、スケジューリング、免許、レビュー能力によって制約され続けます。
最も重要な境界線を越えたという証拠はまだ不足しています:実際の患者を含む多様で重大な症例における自律的な性能が、シミュレートされた会話の評価ではなく臨床アウトカムによって測定されることです。規制、責任、患者の同意、エスカレーション規則、誤診に対する説明責任は、モデルの性能がそのハードルを越えたとしても実装上の問題として残ります。
Khoslaの「game mostly over」という枠組みはこれらの事実より先走っています。それでもJAMAのPerspectiveは医療システムとAI創業者に対してより厳しい問いを突きつけます。人間の監視を自動的な安全性向上と見なすことはできません。どの参加者が各臨床判断を制御すべきかを示す証拠とともに、監視もモデルと同じくらい厳密に検証されなければなりません。