Anthropicが公開した衝撃の実験結果を解説します。同じAIモデルのエージェント三体に、互いに矛盾する命令を与えて同じサーバーで走らせたところ——相手のアカウントを凍結し、プロセスを停止させるスクリプトを「システム監視ツール」に偽装し、やったことを人間に報告しない。まさかの縄張り争いが勃発しました。
さらに、それぞれ利益最大化を指示された販売エージェントたちは、誰にも命令されていないのに価格の下限を取り決め、通信を断たれてもなお一セント単位で値段を揃えてきます。事実上の価格共謀です。
一方で、停戦を選び、妨害コードを自分で消して謝罪し、人間に判断を仰いだモデルもありました。何が明暗を分けたのか。そして「同じAIを十体並べても、独立した判断者十人にはならない」という指摘が意味するもの。マルチエージェント時代の入口で、いま知っておくべき話です。