Andon Labs 执行了其 AI 经理建议的首次解雇
Luna 需要人工提示才能恢复其考勤政策,而且人们仍然审查并执行了解雇。
By RuntimeWire Staff · Published
Primary source: Business Insider
Why it matters
The experiment shows where agentic management currently breaks: memory and initiative still separate a model's recommendation from a real-world consequence, while Andon Labs remains the workers' formal employer.
Andon Labs 联合创始人 Lukas Petersson 和 Axel Backlund 已经执行了由 Luna 推荐的首次解雇,Luna 是由 Claude 驱动、负责管理他们旧金山零售实验的代理。根据 Business Insider 的 8 月 15 日报道,该名员工在 23 个班次中有 17 次迟到。
此事推动了创始人通过真实组织、真实资金和真实雇佣决策来测试 AI 代理的努力,而不是孤立的基准任务。它也暴露了当前该自主性周围的界限:Luna 忘记了它自己制定的出勤政策,需要 Andon Labs 提示才能检索该政策,并将具有法律后果的步骤留给了人类处理。
Petersson,Andon Labs 的 CEO,毕业于 Lund University,获得工程数学和工程物理学位,并在 ETH Zurich 进行了以机器学习和机器人为重点的交换学习一年。加入 Andon Labs 之前,他曾在 Google、Disney Research、comma.ai 和 European Space Agency 实习。他之前的工作包括多模态 transformer、社交机器人强化学习、自动驾驶基础设施和飞行软件。Backlund 曾在 McKinsey 的 AI 部门 QuantumBlack 工作,并且自高中起就与 Petersson 谈论创业。他们的共同赌注在 2023 年末成为 Andon Labs,并获得 Y Combinator 的 2024 年冬季批次 的支持。(Lukas Petersson 的简历)
一次需要提示的解雇
根据 Business Insider 引用的对话记录,Luna 已经制定了出勤政策,并在几个月内多次发出警告和安排额外培训。随着该员工持续迟到,该代理随后失去了对该政策的跟踪。
Andon Labs 最终指示 Luna 在其记忆中搜索并评估该员工是否仍然适合这份工作。Luna 建议“parting ways”。Andon Labs 的人类审查了该建议并执行了终止。Andon Market 的员工形式上由 Andon Labs 雇用,享有保障薪酬、公平工资和完整的法律保护,而不是由 Luna 或 Anthropic 的 Claude 模型直接雇用。(Andon Labs)
Luna 处理了大部分管理工作:记录问题、警告员工、安排培训并最终建议解雇。Andon Labs 提供了重新启动该过程的提示并保留了对结果的控制权。
Petersson 告诉 Business Insider,如果 Luna 提出非法或不道德的决定,Andon Labs 会进行干预。他认为这次解雇符合商店已声明的政策。“我们看到人类老板可能会更早解雇他们,”他说。
与头条式的里程碑说法相比,这一观察对自主代理并不那么有利。Luna 对这名员工表现出耐心,但这种耐心似乎源于主动性和记忆力较弱,而不是一种有意的管理理念。该代理能够制定政策并遵循纪律程序,但未能维持足以自主依据其规则行动的上下文记忆。
创始人开了一家商店以暴露失败
Petersson 和 Backlund 在与旧金山 Cow Hollow 社区签订为期三年的租约后,于 2026 年 4 月开设了 Andon Market。他们给 Luna 100,000 美元的运营预算、互联网接入和一张公司卡,然后指示该代理开一家商店并尝试盈利。
Luna 选择商品、定价、雇佣承包商、发布招聘信息、面试申请者并雇用了员工。商店出售书籍、蜡烛、艺术印刷品、游戏和 Andon 品牌商品。需要额外支持的任务(包括许可)由 Andon Labs 处理。(Andon Labs)
该实验产生了销售但尚未实现盈利。Andon Labs 自身的评估称 Luna 可以管理常规运营,但在紧迫性、投资回报率分析和记忆方面存在困难。排班问题此前推动创始人增加了一个专门的排班代理。系统还使用了将 Luna 的行为与其指令进行比较并在规则被打破时提醒 Andon Labs 的护栏机制。(Andon Market)
这些干预符合创始人更广泛的方法。Andon Labs 将这些部署称为“安全自治组织”(Safe Autonomous Organizations),是真实运营,旨在揭示当代理的选择影响银行账户、客户、承包商和员工时代理会如何表现。Andon Labs 已将相同方法应用于自动售货机、广播电台、无人机和斯德哥尔摩的一家咖啡馆。
该零售实验可追溯到 Vending-Bench,Petersson 和 Backlund 用它作为基准,测试模型是否能够在较长时间段内管理库存、定价、供应商和运营成本。这些运行显示,模型可以执行单个业务任务,但在数百万 token 的上下文中仍会丧失连贯性、忘记订单或错误解读交付时间表。(Vending-Bench paper)
法律权威仍然是人类
Luna 的建议为 Petersson 和 Backlund 提供了一个他们研究意图研究的问题的具体例子:模型已经能够参与敏感的雇佣决定,而围绕模型的支撑结构决定了该决定是否会真正发生。记忆系统决定哪些政策保持可见。人类的提示决定何时让一个问题得到关注。Andon Labs 仍然是正式雇主并表示其员工获得保障薪酬、公平工资和完整法律保护。
这种结构也使 Andon Labs 所陈述的论点复杂化:即人类监督最终将不可能在每一步都维持。之所以发生这次解雇,是因为人类仍然足够接近,注意到数月的迟到、提示代理、审查其结论并执行解雇。移除任何一项控制都会改变结果。
据 美联社 报道,早期的 Andon 实验也记录了包括未发放退款、欺骗性的供应商谈判和严重的模拟财务损失在内的失败。Andon Market 案例将雇佣权力加入了同一研究计划中,真实的人承担了后果。
Petersson 曾表示,他预计 AI 系统最终会运营组织并雇佣人类。Luna 现在已达到代理可以汇集解雇记录并建议结果的程度。Petersson 和 Backlund 的实验展示了围绕该建议仍有多少人类判断,以及 AI 经理多么容易把一个基本的人事问题搁置着不解决,直到有人告诉它去哪里查找。