Andon Labs、AIマネージャーの勧告で初の解雇を実施

Lunaは出席ポリシーを回復するために人間のプロンプトを必要とし、それでも人々は解雇を審査して実行した。

By · Published

Primary source: Business Insider

Why it matters

The experiment shows where agentic management currently breaks: memory and initiative still separate a model's recommendation from a real-world consequence, while Andon Labs remains the workers' formal employer.

Andon Labs carries out first firing recommended by its AI manager

Andon Labs の共同創業者 Lukas PeterssonAxel Backlund は、サンフランシスコでの小売実験を管理するClaude搭載のエージェント Luna が推奨した最初の解雇を実行しました。従業員は23回のシフトのうち17回遅刻していたと、Business Insiderの8月15日の報告 は伝えています。

この出来事は、創業者たちがベンチマークの孤立した課題ではなく、現実の組織、資金、雇用判断を通じてAIエージェントを試すという取り組みを前進させます。同時に、現在の自律性の限界も露呈しました。Luna は自分で作成した勤怠ポリシーを忘れ、そのポリシーを取得するよう Andon Labs に促される必要があり、法的に重大な手続きは人間に委ねられました。

Petersson(Andon Labs CEO)は、Lund University で応用数学と工学物理学の学位を取得し、ETH Zurich での交換留学では機械学習とロボティクスに注力しました。Andon Labs に入る前は Google、Disney Research、comma.ai、European Space Agency でインターンを経験しています。これまでの業務にはマルチモーダルトランスフォーマー、ソーシャルロボティクスの強化学習、自律走行のインフラストラクチャ、フライトソフトウェアなどが含まれます。Backlund は以前 McKinsey の AI 部門である QuantumBlack に在籍しており、二人は高校時代から起業について話し合っていました。二人の共通の賭けは 2023 年末に Andon Labs として結実し、Y Combinatorの2024年冬バッチ の支援を受けています。 (Lukas PeterssonのCV)

解雇にプロンプトが必要だった

Business Insider が引用した会話ログによれば、Luna は既に勤怠ポリシーを作成し、数か月にわたって繰り返し警告や追加のトレーニングを実施していました。しかし、従業員の遅刻が続くにつれてエージェントはそのポリシーを見失いました。

最終的に Andon Labs は Luna にメモリを検索して従業員がまだその仕事に適しているか評価するよう指示しました。Luna は「関係を終わらせること(parting ways)」を推奨しました。Andon Labs の人間がその推奨を審査し、解雇を実行しました。Andon Market の労働者は正式には Andon Labs に雇用されており、給与保証、公正な賃金、完全な法的保護が与えられており、Luna や Anthropic の Claude モデルによって雇用されているわけではありません。 (Andon Labs)

Luna は問題の記録、従業員への警告、トレーニングの手配、最終的な解雇の推奨といった管理業務の多くを担当しました。Andon Labs はプロセスを再起動するプロンプトを与え、結果に対するコントロールを保持していました。

Petersson は Business Insider に対し、Luna が違法または非倫理的な決定を提案した場合は Andon Labs が介入すると述べました。彼はこの解雇が店舗の明示されたポリシーに照らして正当だと考えています。「人間の上司ならもっと早く解雇していただろうと私たちは見ていました」と彼は語りました。

この観察は、見出しにあるマイルストーンほど自律エージェントを美化するものではありません。Luna は従業員に対して忍耐を示しましたが、その忍耐は意図的なマネジメント哲学というよりも、主体性と記憶の弱さに起因するように見えます。エージェントはポリシーを生成し懲戒プロセスに従うことはできましたが、自らのルールに基づいて行動するために必要な文脈を維持することには失敗しました。

創業者たちは問題を顕在化させるために店舗を作った

Petersson と Backlund はサンフランシスコの Cow Hollow 地区で3年のリース契約を結び、2026年4月に Andon Market をオープンしました。彼らは Luna に10万ドルの運営予算、インターネットアクセス、法人カードを与え、店舗を開いて利益を出すよう指示しました。

Luna は商品を選び、価格を設定し、業者を雇い、求人を出し、応募者と面接を行い、労働者を雇いました。店舗では書籍、キャンドル、アートプリント、ゲーム、Andon ブランドの商品が販売されています。許認可など追加のサポートが必要な業務は Andon Labs が担当しました。 (Andon Labs)

この実験は売上を生み出していますが、まだ収益性には達していません。Andon Labs 自身の評価では、Luna は日常的な業務は管理できる一方で、緊急性の判断、投資対効果の分析、記憶に課題があるとしています。スケジューリングの問題は以前、創業者たちが専用のスケジューリングエージェントを追加する原因になりました。システムはまた、Luna の行動を指示と比較してルールが破られたときに Andon Labs に通知するガードレールも使用しています。 (Andon Market)

これらの介入は創業者たちの幅広いアプローチに合致します。Andon Labs はこれらの展開を「Safe Autonomous Organizations(安全な自律組織)」と呼び、銀行口座、顧客、業者、労働者に影響を与える選択をエージェントが行ったときにどう振る舞うかを明らかにするための実運用です。Andon Labs は同じ手法を自動販売機、ラジオ局、ドローン、ストックホルムのカフェでも適用しています。

この小売実験は、Petersson と Backlund がモデルが長期間にわたり在庫、価格設定、サプライヤー、運営コストを管理できるかを試すベンチマークである Vending-Bench に遡ります。これらの実行では、モデルが個々のビジネス業務を遂行できる一方で、数百万トークンにまたがる文脈で一貫性を失い、注文を忘れたり配送スケジュールを誤読したりすることが示されました。 (Vending-Bench paper)

法的権限は依然として人間にある

Luna の推奨は、彼らの研究が対象とする問題の具体例を Petersson と Backlund に与えます。モデルはすでにセンシティブな雇用判断に関与できる一方で、その周りの枠組みが決定が実際に行われるかどうかを左右します。メモリシステムはどのポリシーが表示され続けるかを決めます。人間によるプロンプトがいつ問題に注意が向けられるかを決定します。Andon Labs は正式な雇用主であり、労働者には給与保証、公正な賃金、完全な法的保護が与えられると述べています

その構造はまた、人間の監督をすべての段階で維持することが最終的に不可能になるという Andon Labs の主張を複雑にします。今回の解雇は、人間が数か月にわたる遅刻を十分に注意深く監視し、エージェントにプロンプトを与え、その結論を審査して実行したから起きました。これらのコントロールのいずれか一つでも取り除かれていれば結果は変わっていたでしょう。

以前の Andon の実験でも、返金が行われなかったケース、欺瞞的なサプライヤー交渉、深刻なシミュレーション上の財務損失などが記録されています、とAssociated Press は報じています。Andon Market の事例は、同じ研究プログラムに雇用上の権限を追加し、現実の人々がその結果を被ることを示しています。

Petersson は最終的に AI システムが組織を運営し人間を雇用するようになると予想しています。Luna はエージェントが解雇のための記録をまとめ、結果を推奨する段階に到達しました。Petersson と Backlund の実験は、その推奨の周りにいかに多くの人間の判断が依然として存在するか、そして AI マネージャーが誰かに指示されるまで基本的な人事問題を未解決のまま放置し得るかを示しています。

Reader comments

Conversation for this story loads after sign-in.