Khosla 和 Emanuel 主张,自主 AI 可能会胜过使用 AI 的医生。
JAMA Perspective 借鉴了模拟研究,并对医学中盛行的以医生为主导的部署模式提出了挑战。
By Ryan Merket · Published
Primary source: X
Why it matters
Medical AI startups are built around physician oversight. If human review sometimes lowers accuracy, product design, staffing, liability, and unit economics all change.

Vinod Khosla (@vkhosla) 和另外三位合著者在周一提出,自治医疗 AI 最终可能比医生提供更好的认知护理,包括那些将 AI 作为决策支持工具的医生。
这一主张出现在一篇 JAMA 观点(发表于 8 月 17 日),作者为 Khosla、宾夕法尼亚大学生物伦理学家 Zeke Emanuel (@ZekeEmanuel)、宾大研究员 Abe Baker-Butler (@AbeBakerButler) 以及 AI 初级护理提供商 Curai Health 的创始人兼 CEO Neal Khosla (@nealkhosla)。Vinod Khosla 在创立 Khosla Ventures 之前曾共同创立 Sun Microsystems,多年来一直主张 AI 会使稀缺的专业知识广泛可用。Neal Khosla 自 2017 年起在 Curai 推进这一论点的医疗版本。 (jamanetwork.com)
作者们在挑战有组织医学界普遍偏好的部署模式。American Medical Association 使用术语 “augmented intelligence(增强智能)” 来强调 AI 的辅助角色,而 American College of Physicians 则表示该技术应当支持临床决策而不是取代医生判断。JAMA 的作者们认为,一旦某一 AI 系统在特定任务上持续超越无辅助的医生,这种结构反而可能变得适得其反。 (jamanetwork.com)
在 一个六帖的推文线程 中,Khosla 写道,人类审查可以发现模型错误,但在医生错误地覆盖 AI 系统时也会引入新的错误。人们很难判断何时应信任算法,尤其是在算法性能超过他们自身之后。
这是该观点文章的核心押注:熟悉的“人类在环”(human in the loop)安全措施可能会在审查者比被审查系统不那么准确的认知任务中降低质量。作者将这一论点应用于病史采集、诊断、检测选择、治疗方案制定以及遵循临床指南等方面。他们还认为,使用通用语言模型界面的研究可能低估了专为临床推理构建的系统的表现。
证据大多仍基于模拟
这篇文章是一篇观点文章,而不是新的临床试验。其论据基于先前发表的研究,包括 Google 的 Articulate Medical Intelligence Explorer,或称 AMIE,这是为诊断对话设计的实验性系统。
2025 年的一篇 Nature 论文在一个盲测研究中将 AMIE 与 20 名初级保健医生在 159 个来自加拿大、英国和印度的模拟病例场景中进行了比较。专科医生在 32 项评估指标中的 28 项上对 AMIE 评价更高,而患者演员在 26 项指标中的 24 项上更青睐它。Khosla 强调的一项结果显示,在从患者处获取相关信息方面,医师评估者在 97% 的病例中更倾向于 AMIE,而医生则为 50%。 (nature.com)
该实验设置大幅限制了这些数字能证明的结论。医生和 AMIE 通过同步文本聊天与受过训练的患者演员沟通,Nature 的作者指出这种形式并不反映普通的面对面护理或标准远程医疗。病例无法涵盖体格检查、非语言信号、碎片化病历、地方临床实践或涉及真实患者错误的后果。研究人员表示,要将 AMIE 从原型转入临床需要在安全性、可靠性、隐私、偏见、不确定性和监管保障方面开展额外工作。 (pmc.ncbi.nlm.nih.gov)
Google 此后已将 AMIE 扩展到多模态和纵向护理实验。2026 年 5 月的一项研究评估了一个能解读照片、心电图和临床文档的版本,在 105 个模拟远程医疗案例中进行测试。专科医生在 32 项指标中的 29 项上认为其优于初级保健医生。另一项疾病管理研究发现,AMIE 能在多次就诊中进行推理并使治疗计划与指南一致,但其作者再次表示,将其转化为真实世界应用仍需进一步研究。 (pubmed.ncbi.nlm.nih.gov)
Google 自己的工作也为医生监督留有余地。在一项涉及带有保护措施的 AMIE 版本的实验中,医生审阅了生成的病历记录并对传达给患者的信息保有责任。Google 表示,不应将该结果理解为系统优于临床医生的证明,因为该工作流程是围绕 AI 的特性设计的。 (research.google)
在 Beth Israel Deaconess Medical Center 进行的一项前瞻性研究将 AMIE 作为就诊前的对话式工具引入真实临床就诊。患者普遍对互动给予积极评价,医生表示其转录记录有助于他们准备。患者之后仍然会见临床医生,该研究并未证明自主 AI 产生了更好的诊断、治疗或健康结果。 (research.google)
涉及商业利益的论点
作者们的隶属关系对论点很重要。Neal Khosla 运营 Curai,该公司销售由专有 AI 和机器学习系统支持的虚拟初级护理。Curai 在其投资者中列有 Khosla Ventures。Vinod Khosla 的风险投资公司已将 AI 提供的专业知识(包括医疗保健)作为核心投资论点。 (jamanetwork.com)
这些利益关系并不使该观点文章无效,但可以解释为何作者们在推动超越以医生增强为核心的更安全共识。一个自主系统可以在不需要医生对每次互动都关注的情况下服务患者,从而改变初级护理的劳动力和成本结构。以医生为主导的产品仍受临床人员配备、排班、执照和审查能力的限制。
证据尚未跨过最重要的一道界限:在涉及真实患者的多样且重要的病例上,以临床结局而非对模拟对话的评分来衡量的自主表现。即便模型性能达标,监管、责任、患者同意、升级规则以及对错误诊断的问责仍然是实施中的难题。
Khosla 所说的“游戏大体已定”("game mostly over")的表述走在这些事实前面。该 JAMA 观点仍然向卫生系统和 AI 创业者提出了更艰难的问题。人类监督不能被视为自动的安全改进。它必须像对模型本身那样经过严格测试,并通过证据表明在每项临床决策中应由哪一方来掌控。