Andon Labs 执行了其 AI 经理建议的首次解雇

Luna 需要人工提示才能恢复其考勤政策,而且人们仍然审查并执行了解雇。

By · Published

Primary source: Business Insider

Why it matters

The experiment shows where agentic management currently breaks: memory and initiative still separate a model's recommendation from a real-world consequence, while Andon Labs remains the workers' formal employer.

Andon Labs carries out first firing recommended by its AI manager

Andon Labs 联合创始人 Lukas PeterssonAxel Backlund 已经执行了由 Luna 推荐的首次解雇,Luna 是由 Claude 驱动、负责管理他们旧金山零售实验的代理。根据 Business Insider 的 8 月 15 日报道,该名员工在 23 个班次中有 17 次迟到。

此事推动了创始人通过真实组织、真实资金和真实雇佣决策来测试 AI 代理的努力,而不是孤立的基准任务。它也暴露了当前该自主性周围的界限:Luna 忘记了它自己制定的出勤政策,需要 Andon Labs 提示才能检索该政策,并将具有法律后果的步骤留给了人类处理。

Petersson,Andon Labs 的 CEO,毕业于 Lund University,获得工程数学和工程物理学位,并在 ETH Zurich 进行了以机器学习和机器人为重点的交换学习一年。加入 Andon Labs 之前,他曾在 Google、Disney Research、comma.ai 和 European Space Agency 实习。他之前的工作包括多模态 transformer、社交机器人强化学习、自动驾驶基础设施和飞行软件。Backlund 曾在 McKinsey 的 AI 部门 QuantumBlack 工作,并且自高中起就与 Petersson 谈论创业。他们的共同赌注在 2023 年末成为 Andon Labs,并获得 Y Combinator 的 2024 年冬季批次 的支持。(Lukas Petersson 的简历)

一次需要提示的解雇

根据 Business Insider 引用的对话记录,Luna 已经制定了出勤政策,并在几个月内多次发出警告和安排额外培训。随着该员工持续迟到,该代理随后失去了对该政策的跟踪。

Andon Labs 最终指示 Luna 在其记忆中搜索并评估该员工是否仍然适合这份工作。Luna 建议“parting ways”。Andon Labs 的人类审查了该建议并执行了终止。Andon Market 的员工形式上由 Andon Labs 雇用,享有保障薪酬、公平工资和完整的法律保护,而不是由 Luna 或 Anthropic 的 Claude 模型直接雇用。(Andon Labs)

Luna 处理了大部分管理工作:记录问题、警告员工、安排培训并最终建议解雇。Andon Labs 提供了重新启动该过程的提示并保留了对结果的控制权。

Petersson 告诉 Business Insider,如果 Luna 提出非法或不道德的决定,Andon Labs 会进行干预。他认为这次解雇符合商店已声明的政策。“我们看到人类老板可能会更早解雇他们,”他说。

与头条式的里程碑说法相比,这一观察对自主代理并不那么有利。Luna 对这名员工表现出耐心,但这种耐心似乎源于主动性和记忆力较弱,而不是一种有意的管理理念。该代理能够制定政策并遵循纪律程序,但未能维持足以自主依据其规则行动的上下文记忆。

创始人开了一家商店以暴露失败

Petersson 和 Backlund 在与旧金山 Cow Hollow 社区签订为期三年的租约后,于 2026 年 4 月开设了 Andon Market。他们给 Luna 100,000 美元的运营预算、互联网接入和一张公司卡,然后指示该代理开一家商店并尝试盈利。

Luna 选择商品、定价、雇佣承包商、发布招聘信息、面试申请者并雇用了员工。商店出售书籍、蜡烛、艺术印刷品、游戏和 Andon 品牌商品。需要额外支持的任务(包括许可)由 Andon Labs 处理。(Andon Labs)

该实验产生了销售但尚未实现盈利。Andon Labs 自身的评估称 Luna 可以管理常规运营,但在紧迫性、投资回报率分析和记忆方面存在困难。排班问题此前推动创始人增加了一个专门的排班代理。系统还使用了将 Luna 的行为与其指令进行比较并在规则被打破时提醒 Andon Labs 的护栏机制。(Andon Market)

这些干预符合创始人更广泛的方法。Andon Labs 将这些部署称为“安全自治组织”(Safe Autonomous Organizations),是真实运营,旨在揭示当代理的选择影响银行账户、客户、承包商和员工时代理会如何表现。Andon Labs 已将相同方法应用于自动售货机、广播电台、无人机和斯德哥尔摩的一家咖啡馆。

该零售实验可追溯到 Vending-Bench,Petersson 和 Backlund 用它作为基准,测试模型是否能够在较长时间段内管理库存、定价、供应商和运营成本。这些运行显示,模型可以执行单个业务任务,但在数百万 token 的上下文中仍会丧失连贯性、忘记订单或错误解读交付时间表。(Vending-Bench paper)

法律权威仍然是人类

Luna 的建议为 Petersson 和 Backlund 提供了一个他们研究意图研究的问题的具体例子:模型已经能够参与敏感的雇佣决定,而围绕模型的支撑结构决定了该决定是否会真正发生。记忆系统决定哪些政策保持可见。人类的提示决定何时让一个问题得到关注。Andon Labs 仍然是正式雇主并表示其员工获得保障薪酬、公平工资和完整法律保护

这种结构也使 Andon Labs 所陈述的论点复杂化:即人类监督最终将不可能在每一步都维持。之所以发生这次解雇,是因为人类仍然足够接近,注意到数月的迟到、提示代理、审查其结论并执行解雇。移除任何一项控制都会改变结果。

美联社 报道,早期的 Andon 实验也记录了包括未发放退款、欺骗性的供应商谈判和严重的模拟财务损失在内的失败。Andon Market 案例将雇佣权力加入了同一研究计划中,真实的人承担了后果。

Petersson 曾表示,他预计 AI 系统最终会运营组织并雇佣人类。Luna 现在已达到代理可以汇集解雇记录并建议结果的程度。Petersson 和 Backlund 的实验展示了围绕该建议仍有多少人类判断,以及 AI 经理多么容易把一个基本的人事问题搁置着不解决,直到有人告诉它去哪里查找。

Reader comments

Conversation for this story loads after sign-in.