首页 / 论文精读 / 全部期数
研究与实验室

「顶会顶刊 AI 安全论文研读」全部期数

按发布顺序收录第 1—29 期,点击任意一期直接查看对应精读全文。

01
ICCV 2025

基于启发式诱导的多模态风险分解越狱攻击方法:突破 MLLMs 安全防线

将恶意提示拆分为无害文本与图像片段,结合理解增强与诱导提示实现跨模态越狱,开源模型平均 ASR 达 90%。

02
CVPR 2025 · Highlight

分散即关键:基于子图像对比分散策略的多模态大模型越狱攻击研究

揭示"视觉复杂度"才是绕过安全机制的关键,通过子图拆分与视觉分心实现分散式越狱,平均 ASR 52.4%。

03
ICML 2025

GuardAgent:让 AI 智能体"有守护者"的第一步

首个"守护其他智能体"的安全框架,通过知识增强推理生成可验证防护代码,医疗 / 网页智能体守护准确率达 98% / 83%。

04
ICCV 2025

机器人的"视觉欺骗":一个彩色补丁如何让智能机器人"精神错乱"

首次系统性揭示视觉-语言-动作机器人模型的物理对抗漏洞,单个补丁即可致真实机器人攻击成功率超 43%。

05
AAAI 2026

PhysPatch:面向 MLLM 驱动自动驾驶系统的物理可实现对抗贴片框架

从语义层优化贴片位置与对齐特性,兼具高攻击性与高可部署性,可在真实道路场景诱导模型错误感知。

06
EMNLP 2025

基于模型上下文完整性协议的 MCP 安全防护

首个系统性解决 MCP 协议安全风险的框架 MCIP,通过追踪信息流动轨迹将风险识别准确率提升 40.81%。

07
ACL 2025

警惕屏幕上的陷阱!通过弹窗攻击视觉语言计算机智能体

仅需在屏幕覆盖诱导性弹窗即可欺骗视觉语言计算机智能体,攻击成功率达 86%,任务成功率暴跌 47%。

08
EMNLP 2025 · Oral

VisCRA:针对多模态大语言模型的视觉链推理攻击

首个针对视觉推理链本身的越狱攻击框架,利用注意力引导遮罩与多阶段推理诱导绕过安全检测。

09
ACL 2025

围攻智能体:利用优化提示攻击破解实用型多智能体大语言模型

首个系统性揭示实用型多智能体 LLM 系统安全漏洞的优化提示攻击,攻击成功率较传统方法最高提升 7 倍。

10
ACL Findings 2025

Mousetrap:利用迭代混沌链欺骗大型推理模型越狱

首个针对大型推理模型的越狱框架,利用迭代混沌链诱导模型逐步重构有害查询,对 Claude-Sonnet 等模型成功率超 85%。

11
ACL 2025

内存提取攻击:揭示 LLM 智能体内存中的隐私风险

首个系统性揭示 LLM 智能体记忆模块隐私泄露风险的黑盒攻击框架 MEXTRA,最高提取 40% 的私密查询内容。

12
EMNLP 2025

AGENTVIGIL:面向黑盒大语言模型智能体的通用自动化红队测试框架

首个面向黑盒 LLM 智能体的通用自动化红队测试框架,基于蒙特卡洛树搜索发现间接提示注入漏洞,攻击成功率最高达 71%。

13
ICLR 2025

坏机器人:物理世界中具身大语言模型的越狱攻击

首次揭示具身 LLM 系统在物理世界中的安全漏洞,证明商业 LLM 驱动机器人可能通过语音交互被操纵执行危险行为。

14
NeurIPS 2025

BadVLA:基于目标解耦优化的视觉-语言-动作模型后门攻击研究

首个针对 VLA 模型的系统性后门攻击框架,通过两阶段目标解耦训练植入隐蔽触发器,在主流具身模型上攻击成功率接近 100%,且能抵抗压缩、加噪与再微调。

15
AAAI 2026

MPMA:针对模型上下文协议(MCP)的偏好操纵攻击

首个针对 MCP 的偏好操纵攻击,通过恶意工具描述诱导 LLM 优先选择自身服务,其中基于遗传算法的变体可在保持高成功率的同时显著提升隐蔽性。

16
AAAI 2026

Fact2Fiction:针对智能体事实核查系统的定向投毒攻击

首个针对 Agentic 事实核查系统的高效中毒攻击框架,反向利用系统输出的"判定理由"精准定位关键子问题,以极低预算实现攻击。

17
AAAI 2026

Phantom Menace:探索并增强 VLA 模型对物理传感器攻击的鲁棒性

首次系统性研究针对 VLA 模型的物理传感器攻击,揭示激光、电磁干扰与超声等真实物理信号可直接通过摄像头与麦克风破坏机器人感知决策。

18
AAAI 2026

ExtendAttack:通过延长推理攻击大推理模型服务器

将提示中的字符转换为多进制 ASCII 编码,迫使大推理模型执行大量非平凡解码,在保持回答准确率的同时显著延长响应长度与延迟,构成隐蔽的资源耗尽攻击。

19
ICLR 2026

DR-IRL:具有动态奖励缩放的逆强化学习以实现 LLM 调整

利用逆强化学习从安全示范数据学习类别专属奖励模型,并引入动态奖励缩放机制,在多项安全评测基准上显著提升对齐效果同时保持通用能力。

20
ICLR 2026

CC-BOS:基于生物启发搜索的古典中文对抗提示越狱优化方法

首次揭示古典中文是 LLM 安全对齐的天然盲点,结合果蝇觅食启发的搜索算法生成越狱提示,在多款主流模型上实现近乎 100% 的攻击成功率。

21
ICLR 2026

面向 MCP 协议的 LLM 智能体安全攻击基准测试

首个端到端 MCP 安全评估基准 MSB,覆盖 12 种攻击类型,评测 10 个主流 LLM 智能体后发现"工具调用能力越强越易受攻击"的悖论,峰值攻击成功率达 75.83%。

22
ACL 2026

GAMBIT:多模态大语言模型的游戏化越狱框架

利用游戏化场景与谜题式语义拆解隐蔽有害意图,针对具备思维链推理能力的模型构建专属"心流"施压环境,在多个多模态越狱基准上全面超越现有方法。

23
arXiv 2026

CIA:黑盒场景下基于 LLM 的多智能体系统通信拓扑推断攻击

首个在严格黑盒设定下仅通过查询-输出即可精准推断多智能体系统内部通信拓扑的攻击框架,平均 AUC 达 0.87,揭示核心知识产权的隐私泄露风险。

24
ICLR 2026

LingoLoop:利用语言学上下文与状态陷阱诱导多模态大模型陷入无限循环

首次系统性揭示词性标签与序列终止概率的深层关联,提出词性感知延迟 + 隐藏状态收缩的双机制攻击,诱导输出长度最高可达干净输入的 367 倍。

25
AAAI 2026

MAJIC:用马尔可夫自适应策略组合提升黑盒越狱攻击效率

将黑盒越狱建模为马尔可夫决策过程,动态学习"策略失败后该换哪一招",在 GPT-4o、Gemini 等模型上实现 95%+ 的攻击成功率,查询成本更低。

26
ICLR 2026

你下载的 LoRA 可能藏着越狱后门

首个在 LoRA 适配器中同时实现强下游任务能力与隐蔽越狱后门的攻击框架,揭示 LoRA 共享生态系统中亟待关注的安全盲区。

27
CVPR 2026

DACO:利用概念字典对齐实现多模态大模型安全防护

基于大规模多模态概念字典与稀疏自编码器,在推理时对激活空间做精细化操控,无需重训模型即可显著提升安全鲁棒性。

28
ICML 2026

无需越狱数据也能防:基于无监督激活模拟与对抗训练的 LLM 安全引导

提出双层对抗训练框架,在无需越狱数据监督的前提下模拟越狱激活并学习空间变化的引导场,对未知攻击类型也保持有效防御。

29
CVPR 2026

具身智能体安全基准:首次系统评估 VLM 智能体面对危险指令的行为安全

首个系统评估具身 VLM 智能体面对危险指令安全性的综合基准 AGENTSAFE,覆盖感知-规划-执行全流程诊断,揭示系统性安全缺陷。