首个系统评估具身 VLM 智能体面对危险指令安全性的综合基准 AGENTSAFE,覆盖感知-规划-执行全流程诊断,揭示多数模型"能感知危险却无法转化为安全决策"的系统性缺陷。
阅读全文 →提出双层对抗训练框架,在完全不依赖越狱数据监督的前提下模拟越狱状态并学习空间变化的引导场,对多种越狱攻击家族取得与已有方法相当的防御性能,同时保持下游任务能力。
阅读全文 →基于大规模多模态概念字典与稀疏自编码器,在推理时对激活空间做精细化操控,无需重训模型即可显著提升安全鲁棒性,在多个主流基准上取得领先的防御成功率,同时保持通用能力不明显退化。
阅读全文 →