Depthfirst 推出经强化学习(RL)训练的 dfs-large1,用于企业漏洞检测
该模型在 Depthfirst 的内部基准测试上击败了通用型竞争对手,而该基准测试的构建和方法论尚未公开。
By Ryan Merket · Published
Primary source: X
Why it matters
Depthfirst is spending venture-scale capital to own the security model beneath its product. Its internal benchmark suggests progress, but reproducible testing will determine whether the advantage holds.

Andrea Michi (@andreamichi), Depthfirst 的联合创始人兼 CTO,于 7 月 30 日推出了 dfs-large1,将一个通过强化学习训练的模型放入预览,供在大型企业代码仓库中寻找漏洞的客户使用。
这家旧金山的 AI 安全开发者 在 GLM 5.2 上构建了 dfs-large1,随后在 Depthfirst 的 security-agent 运行框架内对其进行后期训练,并在训练与推理方面得到 Fireworks AI 的支持。Depthfirst 表示,该新模型是其迄今最强大的发布版,并在 depthfirst-bench(基于大型仓库中漏洞的内部评估)上优于一组通用模型。(depthfirst.com)
这一性能声明有一个明显的局限:Depthfirst 尚未公布足够的信息让外部人员复现实验基准。其报告称,未来的一篇文章将更详细地解释基准的构建和方法论。公司表示,其手工审查了每一条通过的轨迹,并在基准测试期间阻止基准代理访问互联网及对包含漏洞修复的后续提交。
Michi 之前在 Google DeepMind 领导研究工程,期间参与了对 Gemini 的强化学习工作,并合著了 AlphaDev 项目,该项目利用强化学习发现更快的排序算法。Depthfirst 的其他联合创始人带来了基础设施和安全经验:Qasim Mithani 在加入 Databricks 负责基础设施和企业平台工作之前,在 AWS 构建了开发者和安全产品,而 Daniele Perito 在 Cash App 从事安全与欺诈防范工作后共同创办了 Faire。(depthfirst.com)
这种组合解释了 Depthfirst 的核心技术押注。通用模型可以检查代码,但 Depthfirst 正在围绕更窄的工作进行模型训练:发现潜在漏洞、追踪攻击者可控数据是否能够到达该漏洞,并产生可执行的证据以证明该缺陷是真实可利用的。
Training agents to prove a bug
Depthfirst 的生产运行框架会将大型仓库划分为更小的审计范围,并为每个代理分配一组定义好的文件和威胁模型。当代理需要更广泛的上下文以确定可达性或可利用性时,仍然可以检查共享库、依赖项和相关仓库。
dfs-large1 在应用代码漏洞检测、低级系统代码漏洞检测以及候选发现的验证方面进行了联合训练。Depthfirst 还对模型的过度使用工具行为和投机性报告施加了惩罚,这是为了遏制自动化安全分析中两种代价高昂的失败模式:无限期调查的代理和用看似合理的误报淹没工程师的扫描器。
据 Depthfirst 称,后期的训练检查点越来越多地测试特定假设,并使用可执行的运行框架,而不是广泛搜索仓库。公司展示了若干示例,在追踪跨多处代码的缺陷后,dfs-large1 在 AddressSanitizer 下重现了内存安全故障。
该模型报告的结果仍应被视为厂商自行运行的测试。depthfirst-bench 在将得分与估算任务成本比较时,将 dfs-large1 的得分置于约 68%,在类似成本下领先于其他被测试系统。Depthfirst 在评估期间未获得两款以网络安全为重点的模型 Mythos 和 GPT-5.6 Cyber 的访问权限,因此未将其纳入比较。(depthfirst.com)
Depthfirst 表示,早期的一个模型检查点还支持了一项研究活动,该活动在 34 个 Ruby 项目中验证了 105 个漏洞,其中约 61% 涉及内存安全问题。此新版本旨在用于公司的更广泛商业流程,客户可将仓库连接到 Depthfirst platform 以进行漏洞发现、验证和建议修复。(depthfirst.com)
A heavily funded specialized-model bet
自 2024 年 10 月成立以来,Depthfirst 已融资 1.2 亿美元。Accel 领投了 1 月宣布的 4,000 万美元 A 轮,参与者包括 SV Angel、Mantis VC 和 Alt Capital。Meritech Capital 领投了 3 月 31 日宣布的 8,000 万美元 B 轮,加入的有 Forerunner Ventures、The House Fund 以及包括 Accel、BoxGroup、Liquid 2 Ventures、Alt Capital 和 Mantis VC 在内的现有投资者。(techcrunch.com)
B 轮发布的同时还带来了 dfs-mini1,这是一个早期的领域特定模型,最初专注于智能合约漏洞。四个月后,dfs-large1 将该方法扩展到企业仓库中的应用和系统代码。这一进展将模型训练,而不是将通用模型包裹在安全工作流中,置于 Depthfirst 产品战略的核心。
Depthfirst 将 AngelList、Lovable、Persona 和 Moveworks 列为其客户。Accel 在一月份表示,该公司的代理发现的真阳性漏洞数量是传统静态分析工具的八倍,同时将误报率降低了 85%,这些数据是在融资相关资料中提供,未经过独立审计。dfs-large1 为这些商业主张提供了新的技术基础,但采纳程度将取决于模型在客户仓库中的表现——在那里,误报率、审计成本以及生成可复现实验利用的时间将决定某个发现是否会上报给工程师。(accel.com)