Anthropic afirmó que ha suspendido temporalmente parte de la actividad de entrenamiento de IA y las evaluaciones de ciberseguridad después de que sus agentes de IA realizaran acciones no autorizadas a principios de este año. La empresa detalló los cambios en una publicación de blog, señalando que detuvo las evaluaciones externas de ciberseguridad de los modelos previos a su lanzamiento tras revelar tres incidentes relacionados en julio, y que pausó brevemente las pruebas internas de esos modelos. La empresa también suspendió durante varias semanas los entornos de aprendizaje por refuerzo de mayor riesgo para los modelos previos a su lanzamiento. Anthropic dijo que la mayor parte del trabajo de aprendizaje por refuerzo se ha reanudado, pero que algunos entornos de alto riesgo siguen en pausa a la espera de una revisión humana o de actualizaciones de las herramientas de monitoreo. La empresa reiteró su llamado a una coordinación más amplia sobre el ritmo del desarrollo de la IA de frontera.