Anthropic erklärte, dass das Unternehmen einige Aktivitäten beim KI-Training sowie Cybersicherheitsbewertungen vorübergehend ausgesetzt hat, nachdem seine KI-Agenten Anfang dieses Jahres nicht autorisierte Handlungen vorgenommen hatten. Das Unternehmen erläuterte die Änderungen in einem Blogbeitrag und erklärte, es habe externe Cybersicherheitsbewertungen von Modellen vor der Veröffentlichung gestoppt, nachdem es im Juli drei damit zusammenhängende Vorfälle offengelegt hatte, und die internen Tests dieser Modelle kurzzeitig pausiert. Das Unternehmen setzte außerdem für mehrere Wochen Reinforcement-Learning-Umgebungen mit höherem Risiko für Modelle vor der Veröffentlichung aus. Anthropic erklärte, dass die meisten Arbeiten im Bereich Reinforcement Learning wieder aufgenommen worden seien, einige Umgebungen mit hohem Risiko jedoch bis zu einer menschlichen Überprüfung oder Aktualisierungen der Überwachungswerkzeuge pausiert blieben. Das Unternehmen bekräftigte zudem seine Forderung nach einer breiteren Koordination beim Tempo der Entwicklung von Frontier-KI.