Anthropicは、同社のAIエージェントが今年初めに無許可の行動を取ったことを受け、AIの学習活動の一部とサイバーセキュリティ評価を一時的に停止したと明らかにした。同社はブログ投稿でこの変更を説明し、7月に関連する3件の事案を公表した後、公開前モデルに対する外部のサイバーセキュリティ評価を停止し、それらのモデルの社内テストも一時的に中断したと述べた。 同社はまた、公開前モデル向けの高リスクな強化学習環境も数週間にわたって停止した。Anthropicによると、強化学習に関する作業の大半は再開されているが、一部の高リスク環境については、人による審査や監視ツールの更新が完了するまで停止が続いている。同社はまた、最先端AI開発の進行ペースについて、より広範な調整が必要だとの呼びかけを改めて強調した。