Mona-lisa-1 在 Arena 上浮出水面,可能成为 GPT Image 的继任者
该匿名测试引发了关于 OpenAI 继任者的猜测,尽管代号并不能确定是谁开发的。
By Ryan Merket · Published
Primary source: X - Riccardo Wolf
Why it matters
Arena tests often provide the first public look at frontier models. If mona-lisa-1 is an OpenAI system, it suggests the current image-generation leader is already testing its successor.

一个代号为 "mona-lisa-1" 的图像生成器在 8月9日 出现在 Arena 的测试中,引发了关于 OpenAI 是否在公开评估新的 GPT Image 模型的猜测。
AI 视觉创作者 Riccardo Wolf (@WolfRiccardo) 在一条两贴的线程中发布了该模型的原始输出。Wolf 表示这些图像在真实感上有明显改进,尤其是在减少常使生成照片看起来不自然的光亮合成皮肤和表面方面有所改善。
mona-lisa-1 背后的开发者尚未得到验证。Arena 经常在匿名比较中以别名放入预发布系统,允许模型提供者在决定要发布哪个版本之前收集人工偏好数据。Arena 表示它直接与商业和开源开发者合作测试预发布模型,且提供者可能会提交多个实验性变体。
该过程使得代号的出现具有意义,但并不将其传闻中的所有权确认为事实。在 Arena 上运行的模型可以是候选发布版、一个狭义的实验或一个永远不会成为公开产品的检查点。mona-lisa-1 这个名字本身并不能提供可靠的归属信息。
通过普通细节测试真实感
Wolf 使用一个关于当代纽约街头的提示测试了 mona-lisa-1。指令要求有一辆停放的车并带有真实的品牌标志、特定的车牌、真实的店面、招牌、人行道和交通细节。这些要求同时检验了图像生成器几个长期存在的弱点:准确的文本、连贯的物体、可识别的商标以及真实城市场景的密集几何结构。
Wolf 分享了高与中设置下未经编辑的输出。这些图像展示了那种拥挤的日常构图类型,能揭露在更宽松的肖像、概念艺术或电影场景提示下被掩盖的失败。店面字母、车辆细节和重复的建筑元素为观察者提供了更多机会去发现畸形文本和不一致的几何形状。
几张图像不足以确定 mona-lisa-1 是否始终优于已发布的系统。Wolf 的帖子没有使用相同的 seed 和设置在竞争模型之间进行受控比较,也没有包含足够的生成样本以测量失败率。他的测试提供了该模型在 Arena 上处于活跃状态并能生成令人信服的单个输出的证据。但这并不能确立其总体排名、速度、编辑稳定性或在不同提示下的可靠性。
这些区分很重要,因为 OpenAI 已经在 Arena 发布的文本到图像排行榜上占据首位。Arena 的7月31日排行榜 将 gpt-image-2 medium 排名第一,得分为 1,381±5,基于 66,665 票。mona-lisa-1 目前尚未以该代号出现在已发布的榜单上。
为什么 OpenAI 理论合理,但尚未证实
OpenAI 在 4月21日 发布了 ChatGPT Images 2.0。OpenAI 将改进的指令遵循、文本渲染、世界知识和真实感描述为相较于早期图像系统的核心提升。该模型可在 ChatGPT 的各个计划中使用,同时一个独立的思考模式可以在生成之前研究和规划图像。
这些能力与 Wolf 的测试旨在检验的领域有重叠。这种重叠支持了关于 mona-lisa-1 的猜测,尽管它并不证明血统。竞争的图像实验室也在追求相同的问题,并且在测试期间可以使用任意代号。
更强的归属路径将来自溯源数据。OpenAI 表示通过 ChatGPT、Codex 及其 API 创建的图像包含 C2PA 元数据和隐形的 SynthID 水印。其公共验证工具可以检查上传的图像是否具有这些信号。阳性结果可以将图像与 OpenAI 的工具关联,尽管它会识别提供者而不是披露产品名或确认 mona-lisa-1 会被发布。
时间点对任何潜在发布都施加了压力。OpenAI 的 gpt-image-2 已经在 Arena 领先,而 Reve、Meta、Google、ByteDance 和 Microsoft 占据了已发布顶层的大部分位置。因此,继任者的实际门槛高于仅仅生成一张更清晰的演示图像。它需要在反复编辑中保持细节、可靠地遵循拥挤的提示,并在生成速度或成本上有足够改进,才能证明替换已被用户偏好的现有产品是合理的。
目前,mona-lisa-1 最好被理解为一个在 Arena 上活跃的实验并有着有前景的公开样本。仅凭代号无法解决其溯源、生产准备程度以及与 OpenAI 已发布图像模型之间的关系。