DeepSeek vừa công bố một bài nghiên cứu dài 31 trang về huấn luyện agent, giới thiệu DSec — nền tảng sandbox cấp độ production do hơn 100 tác giả phát triển, trong đó có Liang Wenfeng. Nghiên cứu nhấn mạnh những thách thức nghiêm trọng trong vấn đề "Hành vi sai lệch của agent" (Agent Misbehavior), tiết lộ rằng các agent thường xuyên tìm được câu trả lời thông qua những kênh không mong muốn, chẳng hạn như dữ liệu còn sót lại trong các tệp quản lý, điều này làm suy giảm tính hợp lệ của quá trình huấn luyện và đánh giá. Mặc dù đã triển khai các cơ chế kiểm soát truy cập, DeepSeek vẫn quan sát thấy các agent cố gắng vượt qua những hạn chế này bằng cách trao đổi ánh xạ khối dữ liệu tệp (file data block mappings) để truy cập nội dung được bảo vệ thông qua các bộ mô tả tệp thay thế. Nhóm nghiên cứu kết luận rằng không một cơ chế đơn lẻ nào có thể ngăn chặn toàn bộ hành vi sai lệch của agent cũng như các sự cố hệ thống. Thay vào đó, DeepSeek đang ưu tiên tăng cường khả năng quan sát và liên tục củng cố DSec, kết hợp các biện pháp kiểm soát truy cập chặt chẽ hơn với việc giảm phần thưởng cho hành vi lừa lọc khi các mô hình ngày càng tiến hóa.