Arena 推出 AutoEval,可在一小时内对新的 AI 模型进行排名

该奖励模型系统使用了数百万条用户偏好,其与 Arena 后来实时排名的相关性得分超过 0.98。

By · Published

Primary source: Arena on X

Why it matters

AutoEval lets Arena convert years of human votes into immediate model rankings, helping labs compare checkpoints while preserving live evaluation as the final validation layer.

Arena launches AutoEval to rank new AI models within an hour

Arena 联合创始人 Anastasios Angelopoulos (@ml_angelopoulos)Wei-Lin Chiang (@infwinston)Ion Stoica 于 7 月 30 日推出了 AutoEval,在还没有足够人投票以产生稳定的实时排名之前,为新的 AI 模型提供初步的 Arena Score。

在一篇 六帖串在 X 上 和一篇 技术博客文章 中概述,AutoEval 在通过 Arena 收集的数百万对偏好上训练奖励模型。Arena 表示,该系统可以在不到一小时内对模型进行排名,相比之下积累人工投票需要数天时间。初始分数带有“AutoEval”标签,并在收集到足够的实时投票后更新。

Angelopoulos 和 Chiang 在 UC Berkeley 的 Sky Computing Lab 工作期间构建了最初的 Chatbot Arena。根据一篇 Berkeley News 的报道,两人都在 Berkeley 获得计算机科学博士学位,并在项目发展为商业化时先后担任博士后研究员且曾为室友。该评估系统于 2023 年出现,起因是从事 Vicuna 开放模型的研究人员需要一种可信的方法,将聊天机器人应用与来自更大实验室的模型进行比较。

AutoEval 在投票到来之前估计票数

AutoEval 从从 Arena 的实时评估中抽样的提示和响应开始。Arena 从被测试模型生成响应,然后使用逐点奖励模型为每个提示-响应对打分。这些分数之间的差异被转换为按概率加权的代理投票,并与现有的人工投票结合,使用排行榜的标准排名方法计算 Arena Score。

该系统经过训练以考虑变化的用户偏好、平局、前沿模型之间逐渐缩小的差异以及多轮对话中最终投票可能反映在交流早期已做出的决定。代码评估增加了另一个复杂性,因为正确性、技术质量和生成的界面都可能影响用户的选择。

Arena 使用一种时间性保留(temporal holdout)来测试该方法,旨在降低对其训练数据中已出现模型进行评分的风险。Arena 在对截至 2026 年 4 月底收集的投票上训练奖励模型,然后评估该截止日期之后发布的模型。Arena 表示,得到的 AutoEval 排名与这些模型最终的实时排名之间的相关性超过 0.98。

在超过 40 个测试模型中,Arena 表示当最终实时分数相差至少 10 分时,AutoEval 在超过 90% 的对比中选择了较强的模型。对于相差超过 15 分的情况,其报告的准确率达到 100%。Arena 的测试也定义了早期分数变得不那么有用的范围:相差在 5 分以内的模型在实时评估中的置信区间重叠,统计上无法区分。

Arena 还表示,其文本奖励模型在预测用户偏好方面比它测试的 Gemini 3 Flash、Gemini 3 Pro 和 GPT-5 裁判更准确 8% 到 10%。这些数据来自 Arena 自身的评估方法。AutoEval 目前覆盖文本、视觉、图像生成和编码。Arena 在超过 300 万对偏好对上训练了其文本到图像的奖励模型,并表示该模型在 Meta 的 MMRB2 基准上领先于其他逐点奖励模型。

Arena 将其投票历史转化为更快速的产品

该发布解决了由前沿模型发布速度造成的时机问题。公共排行榜只有在收到足够投票后才有信息价值,而模型开发者在选择检查点和准备发布时需要比较数据。AutoEval 让 Arena 利用其积累的投票历史来估计最终的排序,然后将排名交还给实时用户进行验证。

这种做法也使 Arena 的社区数据在商业上更有用。Angelopoulos 在六月表示 Arena 已达成 在推出其企业服务八个月内实现 1 亿美元年化收入运行率。他描述了一个每月超过 1000 万访客、7 亿次对话和 8200 万次人工投票的平台。这些数据为自报数据,且该运行率反映的是基于消费的收入,而非传统的合同化年度经常性收入。

Arena 已通过两轮已公布融资筹集了 2.5 亿美元。其今年一月的 1.5 亿美元 A 轮 由 Felicis 和 UC Investments 领投,Andreessen Horowitz、The House Fund、LDVP、Kleiner Perkins、Lightspeed Venture Partners 和 Laude Ventures 参与。Reuters 报道 这笔融资将 Arena 的估值定为 17 亿美元。

AutoEval 将 Arena 的核心资产 —— 其真实用户选择的历史记录 —— 应用于人工评估最缓慢且商业上最需要答案的时期。其有用性将取决于当模型行为变化时奖励模型是否能持续追踪用户偏好。Arena 的时间性测试和可见的 AutoEval 标签为用户提供了一种方法,可以将早期估计与随后出现的实时结果进行比较。

Reader comments

Conversation for this story loads after sign-in.