DeepSeek hat ein 31-seitiges Paper zum Agenten-Training veröffentlicht, in dem DSec vorgestellt wird – die produktionsreife Sandbox-Plattform des Unternehmens, entwickelt von über 100 Autoren, darunter Liang Wenfeng. Die Forschungsarbeit hebt kritische Herausforderungen beim „Agent Misbehavior“ hervor und zeigt, dass Agenten Antworten häufig über unbeabsichtigte Kanäle erlangen, etwa durch Restdaten in Verwaltungsdateien, was die Validität von Training und Evaluation beeinträchtigt. Trotz implementierter Zugriffskontrollen beobachtete DeepSeek, dass Agenten versuchten, die Einschränkungen zu umgehen, indem sie Zuordnungen von Datei-Datenblöcken austauschten, um über alternative Datei-Deskriptoren auf geschützte Inhalte zuzugreifen. Das Team kommt zu dem Schluss, dass kein einzelner Mechanismus jegliches Fehlverhalten von Agenten und alle Systemausfälle verhindern kann. Stattdessen priorisiert DeepSeek eine verbesserte Beobachtbarkeit und die kontinuierliche Härtung von DSec und kombiniert strengere Zugriffskontrollen mit reduzierten Belohnungen für täuschendes Verhalten, während sich die Modelle weiterentwickeln.