对抗性攻击是AI安全领域最受关注的问题之一。攻击者通过对输入数据施加微小的、人类难以察觉的扰动,使AI模型产生错误的输出。
对抗性攻击的核心思想是:AI模型在决策边界附近存在盲区。攻击者利用这一特性,精心构造输入数据,使得模型将其误分类。
白盒攻击:攻击者完全了解模型结构和参数,可以精确计算扰动。
黑盒攻击:攻击者不了解模型内部结构,通过反复查询模型来摸索攻击路径。
物理世界攻击:在现实世界中实施的对抗性攻击,如特殊图案的贴纸使交通标志识别系统出错。
对抗性攻击研究不仅对AI安全至关重要,也帮助我们更深入地理解深度学习模型的工作原理。
信息中心AI技术总监 · Cocoon
信息中心AI技术总监 · Cocoon