开发者正在从编写代码转向监督代理

Santiago Valdarrama 说,他已经花了两周时间在不阅读的情况下评判代理输出,而工作流软件厂商正竞相将这种做法形式化。

By · Published

Primary source: X

Why it matters

Coding agents are shifting engineering work from line-by-line implementation toward task definition, verification and supervision, forcing IDE vendors to redesign their core interface.

Illustration of developers using a console dashboard to supervise agents producing code, with multiple screens showing workflows.

Santiago L. Valdarrama (@svpino), 一位机器学习工程师和教育工作者,表示他已停止阅读 AI 生成的代码,并预计软件开发工具将偏离传统的集成开发环境。

“我正式不再阅读 AI 生成的代码了,” Valdarrama 在 一个由三帖组成的 X 线程 中于 8 月 8 日写道。他说自上次检查他的代理生成的代码以来已经过去两周,然后宣称 IDE “正走向坟墓”。发布时该帖在 X 上已有超过 252,000 次浏览、3,500 个赞和 500 条回复。

这一说法是轶事性的。Valdarrama 没有具体说明他使用了哪些代理、分配给它们的项目是什么,或取代逐行阅读输出的检查方法是什么。他的工作流仍然反映了软件开发中的一个真实变化:工程师花在编写单行代码上的时间减少,而更多时间用于定义任务、评估结果和决定哪些内容进入生产环境。

Valdarrama 在这一论点中带来了三十年的编程经验。在 他的网站 上,他表示自己在 1994 年用 Turbo Pascal 写下了第一行代码。他现在运营一门面向生产的 AI 和机器学习课程,涵盖评估、部署、监控、代理系统和人机循环工作流。Valdarrama 表示自 2023 年 3 月开课以来已有超过 2,000 名学生完成该课程。

界面之争已经开始

Valdarrama 的预测正值最大的 AI 和开发者工具公司围绕软件工作重新设计界面之时。

在 2026 年 2 月 2 日,OpenAI 推出了 Codex app,作为并行运行多个编程代理的指挥中心。OpenAI 明确指出,现有的 IDE 和终端工具并非为开发者监督可能运行数小时、数天或数周的代理而设计。该应用围绕委派、后台执行和代理管理来组织工作,而不是围绕编辑器中打开的一个文件。

Microsoft 的 Visual Studio Code 则采用相反的产品路径:将代理控制层吸收到 IDE 中。其当前的 agent interface 允许开发者管理本地、后台、云端和第三方代理,然后在以代理为先的视图和传统代码编辑器之间切换。当任务需要时,开发者仍可以检查文件、调试并手动编辑。

这使得 IDE 是否会消失变得不那么确定,更多可能是被降级。编辑器正成为更大编排产品中的一个界面。争论的焦点是工程师首先打开哪个屏幕:源文件还是委派任务的队列。

Valdarrama 在周六的线程之前就已在发展这一论点。在他 2 月 25 日的一篇 文章 中,他认为面向人类可读的编程语言作为人类监督的中间层,最终可能让位于为机器优化的表示形式。在他 2025 年 4 月 3 日的 一篇文章 中,他将代码产出与更难的工作区分开来:选择问题、构建问题框架和设计可维护系统。

他最新的帖子将这一观点推入日常实践。在一条回复中,Valdarrama 将手动写代码与写汇编相比,这是一项大多数开发者因高级语言而不再需要的技能。这种比较假设代理能提供同样可靠的抽象层。当前证据仍然是混合的。

评审上移到更高层级

Anthropic 在六月对大约 400,000 次 Claude Code 会话 的分析发现,用户做出了约 70% 的规划决策,而 Claude 做出了约 80% 的执行决策。领域专业知识仍然是成功的重要预测因子:有经验的用户给出更精确的指令,要求更好的验证,并在代理失败时更有效地恢复。

这种分工类似于 Valdarrama 所描述的工作流。人类定义期望行为和约束;代理选择文件、编写实现并运行命令。人工审查的表面正向计划、测试、日志、运行时行为和拉取请求摘要移动。

源码级别的检查仍然能防止通过测试也可能遗漏的故障。一项 2025 年对超过 500,000 个 Python 和 Java 样本的 研究,被 IEEE 国际软件可靠性工程研讨会接收,发现 AI 生成代码存在不同的缺陷模式且高风险安全漏洞的发生率更高。样本来自受控比较而非 Valdarrama 的工作流,但这些发现说明了为何代理自治并不消除质量保障。

Anthropic 也警告说自治代理可能会误读意图、采取非预期行动并遭遇提示注入攻击。其 agent safety guidance 强调审查计划并保留干预点,即便用户不再对每一项单独行动进行批准。

Valdarrama 的线程捕捉到了开发者界面的发展方向:工程师监督结果,而代理处理实现。IDE 供应商可以通过将编辑器转变为控制室来在这一转变中生存。当开发者首先审阅的制品是代理的计划、测试报告或已完成的更改时,一个主要围绕输入和阅读源代码设计的工具将扮演更小的角色。

Reader comments

Conversation for this story loads after sign-in.