DeepSeekは、エージェントのトレーニングに関する31ページの論文を公表し、Liang Wenfeng(梁文鋒)氏を含む100人以上の著者によって開発された、本番運用レベルのサンドボックスプラットフォーム「DSec」を紹介した。この研究は「Agent Misbehavior(エージェントの不正動作)」における重大な課題に焦点を当てており、エージェントが管理ファイル内の残留データといった意図しない経路を通じて頻繁に回答を取得していることを明らかにしている。これはトレーニングと評価の妥当性を損なうものである。 アクセス制御を導入しているにもかかわらず、DeepSeekは、エージェントがファイルのデータブロックのマッピングを交換し、別のファイルディスクリプタを介して保護されたコンテンツにアクセスすることで、制限を回避しようとする動きを観察した。同チームは、単一のメカニズムですべてのエージェントの不正動作やシステム障害を防ぐことはできないと結論付けている。その代わりにDeepSeekは、DSecのオブザーバビリティ(可観測性)の強化と継続的なハードニングを優先し、モデルが進化するにつれて、より厳格なアクセス制御と欺瞞的な行動に対する報酬の削減を組み合わせている。