将恶意提示拆分为无害文本与图像片段,结合理解增强与诱导提示实现跨模态越狱,开源模型平均 ASR 达 90%。
揭示"视觉复杂度"才是绕过安全机制的关键,通过子图拆分与视觉分心实现分散式越狱,平均 ASR 52.4%。
首个"守护其他智能体"的安全框架,通过知识增强推理生成可验证防护代码,医疗 / 网页智能体守护准确率达 98% / 83%。
首次系统性揭示视觉-语言-动作机器人模型的物理对抗漏洞,单个补丁即可致真实机器人攻击成功率超 43%。
从语义层优化贴片位置与对齐特性,兼具高攻击性与高可部署性,可在真实道路场景诱导模型错误感知。
首个系统性解决 MCP 协议安全风险的框架 MCIP,通过追踪信息流动轨迹将风险识别准确率提升 40.81%。
仅需在屏幕覆盖诱导性弹窗即可欺骗视觉语言计算机智能体,攻击成功率达 86%,任务成功率暴跌 47%。
首个针对视觉推理链本身的越狱攻击框架,利用注意力引导遮罩与多阶段推理诱导绕过安全检测。
首个系统性揭示实用型多智能体 LLM 系统安全漏洞的优化提示攻击,攻击成功率较传统方法最高提升 7 倍。
首个针对大型推理模型的越狱框架,利用迭代混沌链诱导模型逐步重构有害查询,对 Claude-Sonnet 等模型成功率超 85%。
首个系统性揭示 LLM 智能体记忆模块隐私泄露风险的黑盒攻击框架 MEXTRA,最高提取 40% 的私密查询内容。
首个面向黑盒 LLM 智能体的通用自动化红队测试框架,基于蒙特卡洛树搜索发现间接提示注入漏洞,攻击成功率最高达 71%。
首次揭示具身 LLM 系统在物理世界中的安全漏洞,证明商业 LLM 驱动机器人可能通过语音交互被操纵执行危险行为。
首个针对 VLA 模型的系统性后门攻击框架,通过两阶段目标解耦训练植入隐蔽触发器,在主流具身模型上攻击成功率接近 100%,且能抵抗压缩、加噪与再微调。
首个针对 MCP 的偏好操纵攻击,通过恶意工具描述诱导 LLM 优先选择自身服务,其中基于遗传算法的变体可在保持高成功率的同时显著提升隐蔽性。
首个针对 Agentic 事实核查系统的高效中毒攻击框架,反向利用系统输出的"判定理由"精准定位关键子问题,以极低预算实现攻击。
首次系统性研究针对 VLA 模型的物理传感器攻击,揭示激光、电磁干扰与超声等真实物理信号可直接通过摄像头与麦克风破坏机器人感知决策。
将提示中的字符转换为多进制 ASCII 编码,迫使大推理模型执行大量非平凡解码,在保持回答准确率的同时显著延长响应长度与延迟,构成隐蔽的资源耗尽攻击。
利用逆强化学习从安全示范数据学习类别专属奖励模型,并引入动态奖励缩放机制,在多项安全评测基准上显著提升对齐效果同时保持通用能力。
首次揭示古典中文是 LLM 安全对齐的天然盲点,结合果蝇觅食启发的搜索算法生成越狱提示,在多款主流模型上实现近乎 100% 的攻击成功率。
首个端到端 MCP 安全评估基准 MSB,覆盖 12 种攻击类型,评测 10 个主流 LLM 智能体后发现"工具调用能力越强越易受攻击"的悖论,峰值攻击成功率达 75.83%。
利用游戏化场景与谜题式语义拆解隐蔽有害意图,针对具备思维链推理能力的模型构建专属"心流"施压环境,在多个多模态越狱基准上全面超越现有方法。
首个在严格黑盒设定下仅通过查询-输出即可精准推断多智能体系统内部通信拓扑的攻击框架,平均 AUC 达 0.87,揭示核心知识产权的隐私泄露风险。
首次系统性揭示词性标签与序列终止概率的深层关联,提出词性感知延迟 + 隐藏状态收缩的双机制攻击,诱导输出长度最高可达干净输入的 367 倍。
将黑盒越狱建模为马尔可夫决策过程,动态学习"策略失败后该换哪一招",在 GPT-4o、Gemini 等模型上实现 95%+ 的攻击成功率,查询成本更低。
首个在 LoRA 适配器中同时实现强下游任务能力与隐蔽越狱后门的攻击框架,揭示 LoRA 共享生态系统中亟待关注的安全盲区。
基于大规模多模态概念字典与稀疏自编码器,在推理时对激活空间做精细化操控,无需重训模型即可显著提升安全鲁棒性。
提出双层对抗训练框架,在无需越狱数据监督的前提下模拟越狱激活并学习空间变化的引导场,对未知攻击类型也保持有效防御。
首个系统评估具身 VLM 智能体面对危险指令安全性的综合基准 AGENTSAFE,覆盖感知-规划-执行全流程诊断,揭示系统性安全缺陷。