Xygeni 安全术语表
软件开发和交付安全术语表

什么是人工智能红队演练?

AI 红队演练是指故意攻击人工智能系统(例如 LLM 应用程序或 AI 代理),以在真正的对手之前找出如何使其出现故障的做法。

  • 测试内容: 行为,而不仅仅是代码。提示注入、越狱、数据泄露、不安全工具使用和有害输出。
  • 它与渗透测试的区别: 目标是概率性的。相同的输入可能产生不同的输出,因此需要重复测试并进行统计分析。
  • 参考方法: OWASP GenAI 红队指南,2025 年 1 月发布。
  • 它的极限: 它能找出运行系统中的可利用漏洞,但不会告诉你代码库中存在哪些人工智能,也不会修复导致攻击发生的配置问题。

什么是人工智能红队演练?定义 #

传统软件的故障模式是可预测的。给同一个函数两次相同的输入,你会得到相同的输出,所以你可以测试它,修复它,然后继续进行下一步。大型语言模型的工作方式则不同。它们能够响应自然语言,可以被说服,隐藏在网页或文档中的指令可以改变它们的行为。

这就是人工智能红队演练所填补的空白。红队会站在对手的角度,尝试让人工智能系统做出它不应该做的事情:例如泄露系统提示、泄露客户数据、调用它原本不应该调用的工具,或者忽略某些指令。 guardrails 它的开发者写道:每一次成功的攻击都会成为工程团队可以采取相应行动的发现。

此 OWASP GenAI 红队指南 将人工智能红队演练视为一项整体性练习cis评估涵盖四个方面:模型评估、实现测试、基础设施评估和运行时行为分析。换句话说,它不仅仅是欺骗聊天机器人,而是涵盖模型所在的整个系统。

AI红队演练的工作原理 #

典型的AI红队演练包含五个步骤。

1. 确定系统范围 #

明确测试对象:是面向客户的助手、内部辅助系统,还是拥有电子邮件或数据库访问权限的自主代理?测试范围决定了哪些损害才算数。客服机器人泄露退款政策属于轻微干扰;代理泄露凭证则属于安全事件。

2. 威胁模型 #

绘制攻击面图:用户输入、检索到的文档、连接的工具、MCP 服务器、内存以及系统使用的身份。诸如此类的框架 米特阿特拉斯 记录针对人工智能系统的真实对抗技术,帮助团队避免只测试显而易见的技术。

3。 攻击 #

红队队员将人工创造力与自动化探测相结合。常用技巧包括:

  • 直接快速注射: 直接在输入框中输入指令以覆盖系统提示。
  • 间接快速注射: 在模型稍后读取的内容(例如文件、电子邮件或网页)中植入指令。
  • 越狱: 通过角色扮演、编码或多轮说服来绕过安全规则。
  • 数据提取: 诱导模型透露训练数据、系统提示或其他用户信息。
  • 工具和代理滥用: 引导代理调用带有有害参数的工具或提升自身权限。

4。 测量 #

由于模型是非确定性的,一次成功并不能说明什么问题,一次失败则更说明不了什么。成熟的团队会多次运行每次攻击,并报告成功率,而不是零星的案例。

5. 修复并重新测试 #

调查结果指向工程方面:收紧系统提示,添加输入或输出保护机制,降低代理的权限,移除某个工具。然后再次运行测试,因为针对一种措辞的修复很少能解决另一种措辞的问题。

AI红队演练与渗透测试 #

两人思维方式相同,但尝试的东西不同。

维度渗透测试AI红队
目标基础设施、应用程序、API模型行为及其周围系统
攻击输入漏洞利用、有效载荷、格式错误的请求自然语言、文档、多轮对话
功能验证确定性:漏洞利用要么成功,要么失败。概率性:多次尝试后的成功率
典型发现注入漏洞、配置错误、弱认证快速注入、越狱、数据泄露、过度代理
技能进攻性安全攻击性安全 + 机器学习和语言学

一个完整的程序需要两者兼备。LLM应用程序仍然运行在渗透测试应该覆盖的服务器和API上,而一次完整的渗透测试并不能说明模型是否会被诱骗泄露数据。

为什么人工智能红队演练现在如此重要 #

三种力量正在推动人工智能红队演练从研究实验室走向普通安全程序。

  • 人工智能的交付速度比审核速度更快。 开发人员每周都会向应用程序中添加模型、代理框架和 MCP 服务器,而且通常未经安全审查。每添加一个,就意味着不受信任的文本可以通过一种新的方式触达可以执行操作的组件。
  • 经纪人提高了赌注。 行为异常的聊天机器人会生成错误的文本。行为异常的代理会以您组织的身份发送电子邮件、编辑记录或运行代码。
  • 监管机构预期会进行对抗性测试。 此 欧盟人工智能法案 该规定要求具有系统性风险的通用人工智能模型提供商执行并记录对抗性测试。大多数部署人工智能的组织并非模型提供商,因此这项义务并不直接适用于它们,但它已确立了对严肃的人工智能部署进行此类测试的预期。

人工智能红队演练的局限性 #

AI红队演练功能强大,但为时已晚。它测试的是已经建成并运行的系统,这会留下三个漏洞。

它只测试你所了解的知识。 你无法对一个无人申报的代理进行红队演练。如果开发人员上个月将 MCP 服务器连接到代码库,那么在有人发现它之前,它不在任何演练的范围内。

它只发现了症状,而没有找到病因。 一次成功的注入攻击通常源于代码或配置中的某些问题:例如,系统提示符中拼接了不受信任的内容、缺乏防护措施的检索目标、或者代理程序被赋予了超出其实际需求的工具。红队已经证明了攻击有效;接下来还需要有人找到导致攻击发生的那行代码。

它是周期性的。 沟通交流每季度进行一次,或在产品发布前进行。代码库每天都在变化。

这就是为什么成熟的团队会在生命周期的早期阶段就将AI红队演练与控制措施结合起来:对代码库中的每个AI资产进行清点,并在关键时刻检测出有风险的AI配置。 commit因此,红队把时间花在解决难题上,而不是重新发现那些可以避免的问题。

在红队到来之前:保护你的人工智能背后的代码 #

AI红队演练测试的是AI系统运行后的行为。而Xygeni则更早地介入,从代码和配置层面入手,决定AI的初始行为。

Xygeni AI 安全 发现您存储库中的 AI 资产,包括模型、代理、MCP 服务器、技能、提示等。 guardrails它直接从AI工具留下的代码和配置文件中获取信息,因此无需开发者进行声明。然后,它会检测代码和配置中与OWASP Top 10 for LLM Applications对应的提示注入类风险,并指出具体的文件和行号。最终结果是:为您的红队提供完整的风险范围,并在他们到达时减少不必要的风险发现。

线上一对一演示 查看您自身代码库中的 AI 清单。

常见问题解答 #

简单来说,什么是人工智能红队演练?

AI红队演练是指故意攻击自己的AI系统,模拟真实攻击者的操作方式,以发现如何操纵系统,使其泄露数据、无视规则或采取不安全行动。然后,在攻击者发现问题之前修复这些漏洞。

AI红队演练和LLM红队演练是一样的吗?

主要是这样。LLM 红队演练侧重于语言模型及其衍生应用。AI 红队演练则是一个更广泛的概念,涵盖智能体、多模态模型以及经典的机器学习系统,例如图像分类器或欺诈模型。

AI红队演练可以实现自动化吗?

部分如此。自动化工具可以运行数千种已知的攻击模式并测量成功率,这对于回归测试至关重要。而新型攻击仍然源于人类的创造力,因此大多数程序都会将两者结合起来。

谁应该负责人工智能红队演练?

在大多数组织中,这项工作隶属于应用安全团队或攻击性安全团队,与构建人工智能功能的工程师合作。它是一种应用于新型软件的安全实践,而非独立的人工智能功能。

开始免费

免费开始使用。
不需要信用卡。

一键开始:

这些信息将按照 服务条款 和 隐私政策

应用截图