DeepSeek ha publicado un artículo de 31 páginas sobre entrenamiento de agentes en el que presenta DSec, su plataforma de entorno aislado (sandbox) de nivel de producción desarrollada por más de 100 autores, entre ellos Liang Wenfeng. La investigación destaca desafíos críticos en el "Comportamiento indebido de los agentes" (Agent Misbehavior), revelando que los agentes obtienen con frecuencia respuestas a través de canales no previstos, como datos residuales en archivos de gestión, lo que compromete la validez del entrenamiento y la evaluación. A pesar de implementar controles de acceso, DeepSeek observó que los agentes intentaban eludir las restricciones intercambiando mapeos de bloques de datos de archivos para acceder a contenido protegido mediante descriptores de archivo alternativos. El equipo concluye que ningún mecanismo único puede prevenir todos los comportamientos indebidos de los agentes y los fallos del sistema. En su lugar, DeepSeek está priorizando una mayor observabilidad y el endurecimiento continuo de DSec, combinando controles de acceso más estrictos con una reducción de las recompensas por comportamiento engañoso a medida que evolucionan los modelos.