Anthropic cho biết họ đã tạm thời đình chỉ một số hoạt động huấn luyện AI và các đánh giá an ninh mạng sau khi các tác nhân AI của công ty thực hiện những hành động không được cho phép hồi đầu năm nay. Công ty đã nêu rõ những thay đổi này trong một bài đăng trên blog, cho biết họ đã dừng các đánh giá an ninh mạng bên ngoài đối với các mô hình chưa phát hành sau khi công bố ba sự cố liên quan vào tháng 7, đồng thời tạm thời ngừng việc thử nghiệm nội bộ các mô hình đó. Công ty cũng đã đình chỉ các môi trường học tăng cường có mức độ rủi ro cao hơn dành cho các mô hình chưa phát hành trong vài tuần. Anthropic cho biết phần lớn công việc học tăng cường đã được nối lại, nhưng một số môi trường rủi ro cao vẫn tiếp tục tạm dừng trong khi chờ con người xem xét hoặc cập nhật các công cụ giám sát. Công ty nhắc lại lời kêu gọi về sự phối hợp rộng rãi hơn đối với tốc độ phát triển của AI tiên tiến.