Anthropic a déclaré avoir temporairement suspendu certaines activités d’entraînement de l’IA ainsi que des évaluations en cybersécurité après que ses agents d’IA ont entrepris des actions non autorisées plus tôt cette année. L’entreprise a détaillé ces changements dans un billet de blog, expliquant qu’elle avait mis fin aux évaluations externes de cybersécurité des modèles en préversion après avoir révélé trois incidents connexes en juillet, et qu’elle avait brièvement interrompu les tests internes de ces modèles. L’entreprise a également suspendu pendant plusieurs semaines les environnements d’apprentissage par renforcement à plus haut risque pour les modèles en préversion. Anthropic a indiqué que la plupart des travaux d’apprentissage par renforcement ont repris, mais que certains environnements à haut risque restent suspendus dans l’attente d’un examen humain ou de mises à jour des outils de surveillance. L’entreprise a réitéré son appel à une coordination plus large concernant le rythme du développement de l’IA de pointe.