Supabase 推出面向构建后端的 AI 编码代理的开放基准
该框架对 Claude Code、Codex 和 OpenCode 在数据库、身份验证和 Edge Function 任务上进行测试,然后公布分数。
By Ryan Merket · Published
Primary source: Supabase on X
Why it matters
AI agents now influence which databases and backend tools developers adopt. Supabase Evals gives the platform a way to find and fix agent failures before they become lost projects.

Supabase, founded by Paul Copplestone (@kiwicopple) and Ant Wilson (@AntWilson), 于 7 月 31 日 发布了一个开源基准,用于衡量 AI 编程代理在其 Postgres 平台上构建和修复应用程序的能力。
此次发布形式化了已在重塑 Supabase 业务的一种转变。Copplestone 在构建早期产品时遇到 Firebase 和 Firestore 的限制,随后创立了 Supabase,并与 Wilson 一起致力于基于 Postgres 的替代方案。六年后,AI 代理已成为该基础设施的重要需求来源。Supabase 在六月表示,AI 工具启动了其超过 60% 的新数据库。
Supabase Evals,由 Supabase 工程师 Matt Rossman (@the_ross_man) 开发,针对来自支持工单、错误报告和 GitHub issue 的任务运行包括 Claude Code、Codex 和 OpenCode 在内的代理。示例包括构建数据库模式、调试失败的 Edge Function 以及修复损坏的行级安全策略。
根据 Supabase 的发布文章,每个场景针对的是实际的 Supabase 环境,而不是一组静态的编程问题。代理使用 Supabase 的 Model Context Protocol 服务器或命令行界面,其工作通过确定性检查评分,对于需要语义评估的任务则加入了 LLM 裁判。
将代理失败转化为产品改进
该基准在 Supabase 内部有两个用途。公开套件在产品领域和应用开发阶段之间比较不同代理。另一个回归套件每天跟踪特定的失败模式,使 Supabase 工程师能够测试对文档、代理指令或产品所做的更改是否纠正了反复出现的错误。
Apache-2.0 licensed repository 包含提示、评分器、起始项目状态和实验配置。开发者可以运行单个场景或在多个代理上执行基准套件。local-stack 测试将代理置于带有真实 Supabase CLI 的 Docker 沙箱中,而基于工具的测试则通过 Supabase 的 MCP 接口暴露平台。
Supabase 还在首次失败后给每个代理一次重试机会,然后才给出成绩。此选择减少了由单次失误导致的失败,不过也意味着得分既衡量代理的首次准确性,也衡量其恢复能力。加入基于 LLM 的评分为比较结果增加了另一层判定,用户在比较时应予以考虑。
早期运行暴露了传统代码基准可能忽视的问题。Supabase 发现代理在已有项目使用声明式 schema 时仍手工编写迁移脚本,并在为安全的 Edge Functions 选择较旧的身份验证模式而非较新的 Supabase 库。Supabase 通过修订其代理指南并发布更清晰的文档作出响应。
Supabase 还发现,对其代理技能的访问带来的收益并不均衡。在发布时随附的构建阶段快照中,Supabase 表示 Claude Opus 5 和 Kimi K3 在未加载 Supabase 技能的情况下通过了每个场景。Claude Sonnet 5 在获得技能后从 78% 上升到 100%,而 GPT-5.4 mini 则从 78% 提升到 89%。
文档行为差异显著。Supabase 报告称基于 Codex 的代理比 Claude Code 代理更频繁地查阅其文档。运行 GPT-5.6 的 Codex 每个场景大约读取八页,而 Claude Code 则大约为两页;即便在可用技能存在的情况下,Claude Code 在少于 40% 的场景中访问了文档。Supabase 将这些结果描述为快照,因为代理运行时和模型变化迅速。
Supabase 在衡量其新的分发渠道
该基准发布距 Supabase 完成 5 亿美元 F 轮融资 并获得 100 亿美元投前估值的时间不足两个月。该轮由 GIC 领投,于 6 月 4 日 完成,现有投资者参与, Stripe 进行了第二次投资, Georgian 和 Salesforce Ventures 作为新投资者加入。
Supabase 表示,数据库启动较前一年增长了 600%,并在 F 轮公告时称近 1000 万开发者使用其产品。这些数据为公司自报。Y Combinator,在 2020 年夏季支持了 Supabase,列出公司有 120 名员工,并将 Supabase 描述为围绕独立 Postgres 集群、认证、行级安全、APIs 和实时数据构建的完全远程开发者平台。
Evals 为 Supabase 提供了一个针对其并非直接控制的分发渠道的反馈系统。当代理选择了过时的库、错过了某项安全功能或未能阅读文档时,即便底层服务按设计工作,该失败也可能阻止开发者采纳 Supabase。发布该基准使 Supabase 能识别这些失败、修订代理所使用的接口,并检查这些修复在后续模型更新中是否仍然有效。
这些得分仍然特定于 Supabase 设计的任务和环境。它们并不确定哪一个编程代理在整个软件开发过程中表现最佳,而且 Supabase 有动力改善每个被测试代理对其产品的使用方式。然而,对于在 Supabase 上构建的开发者来说,这些场景提供了一个具体记录,用以判断代理是否能处理超出生成应用代码之外的数据库安全、部署和调试工作。