BusinessCaseBench 发现前沿 AI 在 18 个商业领域表现强劲
由Wharton牵头的研究人员测试了615个开放式问题,但领先模型在不到一半的问题上完全满足了评分量表的所有条目。
By Ryan Merket · Published
Primary source: X
Why it matters
BusinessCaseBench adds evidence that model progress extends into strategy, finance and management reasoning. It also quantifies the review burden: strong drafts remain far more common than complete answers.

Ajay Patel 和来自 Wharton、Carnegie Mellon University 和 Harvard Business School 的一组研究人员推出了一个基准测试,表明前沿 AI 模型能够在开放式商业学科中给出强有力的答案,将可衡量的进展扩展到数学、编码及其他更容易核验答案的任务之外。
研究人员的 BusinessCaseBench working paper 最初于 7 月 17 日提交,并于 7 月 21 日修订,使用了 238 个商学院案例及其教师解答,构建了横跨 18 个学科的 615 个问题。问题涵盖战略、金融、领导力、商业伦理、市场营销以及政商关系等领域。
Patel(论文的通讯作者)负责了方法学、实验和分析。他的合著者包括 Wharton 教授 Kartik Hosanagar、Carnegie Mellon 教授 Ramayya Krishnan、University of Pennsylvania 教授 Chris Callison-Burch 以及 Harvard Business School 教授 Karim Lakhani。
这些发现于 7 月 28 日引起关注,当时 Ethan Mollick (@emollick),Wharton 的副教授兼学校 Generative AI Labs 的联合主任,在 X 上的一条线程 中争辩称这些数据与“模型收益集中在可验证领域”的说法相矛盾。Mollick 写道,尽管在各学科内部和学科之间的表现不均衡,大型语言模型在“许多不同学科上仍然表现得不合常理地有效(unreasonably effective across so many different disciplines)”。
Mollick 的兴趣既基于管理学研究,也基于公司创办经验。根据他的 Wharton 个人简介,他在进入学术界前创办过一家初创公司,并在 MIT Sloan 获得了 MBA 和 PhD 学位。他目前的研究集中在 AI 如何改变工作、创业和教育。
A benchmark for ambiguity
BusinessCaseBench 要求模型处理管理决策中常见的不完整、存在争议的信息。具有代表性的任务包括就医院中的一次棘手晋升提出建议、评估市政投票系统的公平性、分析 AI 招聘软件中的伦理问题,以及为一项药品专利和解撰写司法意见书。
每个模型在单一提示中收到一个完整案例和一个类似考试的问题。系统没有网页检索、工具或进行追问的机会。它们的答案根据从教师解答中提取的、等权重的评分细则项进行核查。
论文的主要比较测试了 OpenAI 的 GPT-5.4、Anthropic's Claude Sonnet 4.6 和 Google 的 Gemini 3 Flash Preview。在研究者采用的标准部分记分(partial-credit)评分下,Claude Sonnet 4.6 得分为 88.4%,GPT-5.4 得分为 87.2%,Gemini 3 Flash Preview 得分为 81.6%。
这些百分比衡量的是覆盖预期评分细则项的比例。它们不应被解读为常规课程成绩,也不是证明确系模型能够在真实运营企业中独立做出这些底层决策的证据。
更严格的结果显示了差距。当且仅当一个回答满足每一项评分细则时才记为得分,Claude Sonnet 4.6 完成了 49.6% 的问题,GPT-5.4 完成了 47.6%,而 Gemini 3 Flash Preview 完成了 32%。即使是领先的模型在略多于一半的案例中也至少遗漏了一项必需要素。
研究人员将这些输出描述为仍需审阅的有力草稿。模型在结构化的分析与解释性工作上表现更好,而在诸如识别商业机会等开放式建议性任务上表现较差。表现也更受学科差异影响,而不是题目是否为数值型、非数值型、主观或客观题目。
Progress outside math and coding
论文最明确的结果来自对在相同问题集上评估的四个 OpenAI 模型的比较。标准得分从 GPT-4 Turbo 的 63.9% 上升到 GPT-5.4 的 87.2%,约两年内提高了 23.3 个百分点。完整答案(complete-answer)性能从 13.2% 上升到 47.6%。
这些提升也扩展到非数值和主观问题。在完整答案评分下,非数值问题改善了 36.2 个百分点,而数值问题改善了 30.4 个百分点。这支持了 Mollick 的观点:更强的数学和编码性能的出现,与更广泛的分析判断能力的提升并行发生。
基准测试中不到 7% 的问题难度足以让每个被测试的前沿模型得分均不超过 70%。一个假设性系统如果对每个问题都从三个主要模型中选择最佳答案,在部分记分下的得分将达到 92.8%,而最强的单一模型得分为 88.4%。剩余错误通常是模型特定的遗漏,而不是所有系统都无法接近的问题。
The benchmark's limits
研究人员使用 Gemini 2.5 Flash 作为自动评分器,随后用三名具有商学院评分经验的标注者对评估方法进行了复核。自动部分记分与人工评分呈中等相关,标注者认为 96% 的自动评分是可接受或基本可接受的。论文指出在单个问题层面仍存在分歧,反映了对开放式案例评分时固有的主观性。
BusinessCaseBench 也仅测试了职业工作中的受控切片。它是仅限英语、单轮交互并建立在商学院案例教学法之上的。它不衡量模型是否能收集新证据、与利益相关者谈判、对决策承担责任或随着组织条件变化而调整。
该基准加入了一个日益增长的、面向经济性有用工作的评估集合。OpenAI's GDPval 覆盖了 9 个行业中来自 44 个职业的任务,而 BusinessCaseBench 则专注于分析判断和用于训练商学院学生的教师评分细则。
对 AI 公司而言,这一区别很重要。较高的部分记分意味着客户可以以低成本获得看似合理的分析。完整答案的结果则显示了这些产品仍然暴露的地方:缺失的假设、未被考虑的利益相关者以及看起来完善但在经验丰富的操作人员审查时会显露问题的不完整建议。