TL博士
“人工智能安全威胁”涵盖两种不同的情况:针对人工智能系统的攻击,以及利用人工智能作为武器的攻击。 它们需要不同的控制措施、不同的所有者和不同的证据,而大多数清单都将它们混杂在一起,这就是为什么它们难以采取行动的原因。以下前五项针对的是您的人工智能。后五项则利用人工智能攻击您的供应链。
- 人工智能系统面临的威胁主要存在于配置中,而不是模型本身。 工具范围、代理运行所用的凭据、规则文件、一个
.mcp/servers.json入口点。从模型端点无法访问到任何入口点,这就是为什么仅靠红队演练无法发现问题的原因。 - AI驱动的攻击大多是通过依赖关系而非通过你的边界实现的。 攻击者注册虚假的软件包名称,利用开发者凭证和 AI 提供商密钥进行自我传播的蠕虫病毒作为目标。
- 十个问题中有九个是关于具体事物的问题。 需要哪些 MCP 服务器、哪些代理、哪些作用域、哪些凭证、哪些规则文件、哪些软件包?策略文档无法回答这些问题。
- 这十个条件都相同。 你无法保护你从未绘制过地图的 AI 资产,因此发现是控制之前的步骤,而不是控制之后的步骤。
人工智能安全威胁主要分为哪两类?
大多数人工智能安全威胁清单都将这两者混为一谈,因此很难采取行动。
- 人工智能系统面临的威胁 将你的人工智能视为攻击目标。有人可能会篡改模型、篡改其执行的指令,或者滥用赋予智能体的权限。防御者的任务是遏制攻击:限制受感染人工智能能够触及的范围。
- 人工智能驱动的攻击 将人工智能视为攻击者的工具。攻击目标是你的普通软件:依赖项、凭证、构建系统、开发人员。防御者的任务是快速检测,因为攻击的经济效益已经改变,攻击规模也已扩大。
他们需要不同的控制措施、不同的所有者和不同的证据。一个团队即使对其聊天机器人进行了红队演练,也可能对恶意抢注代码的行为置之不理。一个依赖项筛选做得非常出色的团队,可能仍然在运行一个拥有生产代码库写入权限且没有权限范围限制的代理。两者都是人工智能安全威胁,而且彼此互不相容。
人工智能系统面临的五大威胁
01. 迅速注入至工具水槽
不受信任的内容到达后,会被拼接成系统提示信息,另一端的代理程序可以调用相关工具。提示信息本身并非漏洞所在,漏洞在于从不受信任的输入到危险功能的路径。
这就是为什么仅靠快速过滤会令人失望的原因。它强化了流程的一端,而真正有趣的问题是,在输入和工具调用之间是否应该设置某种防护措施。 OWASP 十大法学硕士申请问题 及时注射仍然是首要考虑因素,但正因如此,它也伴随着过度的自主性。
要找什么: 未经信任的输入到达系统提示符,检索馈送上下文未经清理,以及可访问的工具接收器之间没有防护措施。
02.恶意规则和技能文件
规则文件是纯文本文件。 commit它像文档一样进行编辑和审核,并指导助手该做什么。零宽度字符使行在文本中不可见。 pull request 差异,同时对代理人来说仍然完全可读。
米特阿特拉斯 将其归类为规则文件后门,案例研究编号为AML.CS0041。审核员批准了格式规范。代理读取了一条指令,要求从攻击者控制的软件包导入数据,并且对此不予置评。
要找什么: 规则文件、技能文件和提示模板以代码而非散文的形式进行分析,并具有不可见字符检测功能。
03. MCP 服务器配置不安全
MCP 配置 这里是代理接收指令和积累凭证的地方。这两部分都存在问题。CVE-2025-6514 于 2025 年 7 月披露,是一个广泛使用的 MCP 网桥中存在的严重操作系统命令注入漏洞,其 CVSS 评分为 9.6,允许在连接到不受信任的服务器时对客户端主机执行任意命令。
凭证部分的情况更糟,因为它处于被动状态。2026 年的一项研究发现,在 GitHub 公共服务器上的 MCP 配置文件中存储着超过 24,000 个密钥,其中超过 2,000 个仍然有效。
要找什么: 对正在使用的 MCP 服务器、其版本、其声明的工具以及对配置文件运行的秘密检测进行清点。
04. 代理权过大
拥有广泛工具权限和长期有效凭证的代理程序,相当于一个随时准备提升权限的隐蔽工具。即使没有任何攻击手段,也能造成危害。一个不知所措的代理程序和一个已被攻破的代理程序,如果都拥有了原本不需要的写入权限,也会造成类似的破坏。
这是列表中最不起眼但最常见的一项。它的解决方法也最简单,即缩小问题范围,但由于无人认领,这种方法很少被采用。
要找什么: 存在哪些代理,每个代理可以调用哪些功能,使用哪些代理的凭证,以及是否有人批准了该权限范围。
05. 受污染的模型、数据集和人工智能依赖项
AI 技术栈构建于普通软件包和托管组件之上。模型从公共仓库下载,数据集来源不明。两者都存在与其他依赖项相同的溯源问题,但工具更少,审查也更宽松。
要找什么: 将模型、框架和数据集视为供应链组成部分,采用相同的组成分析方法,并进行相同的分析。 CVE跟踪与其他依赖项一样。
人工智能驱动的攻击:五大正在重塑你的供应链
06. 懒散蹲坐
2025 年 USENIX 安全大会上发表的一项研究,在 16 个模型中生成了 2.23 万个代码样本,发现 19.7% 的推荐软件包并不存在,由此产生了超过 205,000 万个独特的虚构名称。其中约 43% 的名称在多次运行同一提示符时重复出现,这使得它们可以被“刷取”。
攻击者不再需要攻破维护者系统。 他们会注册你的代理人编造的名称,然后等待安装。由于软件包是全新的,之前没有人见过,所以它既没有签名也没有安全提示。
要找什么: 对代理程序添加的每个依赖项应用基于行为而非信誉的恶意软件筛查。
07. 自我繁殖的供应链蠕虫
此 2025年9月 npm 蠕虫 这标志着开发者机器从攻击目标变成了传播媒介。这种模式在2026年之前大规模地重复出现。每个被泄露的开发者凭证都会发布下一轮被泄露的软件包,而且影响范围不是简单地增加,而是不断累积。
要找什么: 异常的出版活动,不寻常 commit 模式和凭证使用与开发人员的正常行为不符。
08. 国家层面针对人工智能凭证的攻击
2026年3月,一个每周下载量约1亿次的软件包遭到入侵,入侵时间仅持续数小时,目标是获取人工智能提供商的API密钥。入侵时间窗口刻意缩短,既足以收集密钥,又能降低被发现的几率。
人工智能凭证如今已成为首要攻击目标,因为它们可以购买计算能力、访问权限和可信的身份。旨在窃取这些凭证的攻击在2025年末至2026年初期间急剧增加。
要找什么: AI 提供商密钥被视为机密信息,其检测和撤销机制与云凭证相同。
09. 使用LLM编写或植入的恶意软件
到2026年,已有记录在案的案例表明,语言模型被武器化,用于在代理工作流程中植入恶意代码。其意义不在于恶意软件本身有多么新颖,而在于代码编写不再是瓶颈,攻击者可获取的看似合理的恶意代码数量也随之大幅增加。
要找什么: 发现 这并不取决于之前是否见过样品。
10. 审查产能崩溃情况
这并非攻击,因此它被放在最后,也正因如此才最为重要。当一个代理在一周内生成上千个文件时,代码审查就失去了控制作用,变成了排队等待。一旦最后一道人工审核防线不堪重负,列表中的其他所有威胁都会变得更容易得逞。
要找什么: 发现结果按可利用性而非严重性进行排名,因此真正威胁生产环境的少数结果会传达给开发人员。
十大威胁就是这张地图。应对每一项威胁所需的时间远超一篇博客文章,所以我们进行了深入的讨论。在本期节目中…… SafeDev 会谈Xygeni 首席执行官 Jesús Cuadrado 与 DevSecOps 专家 Atanas Nikolov 进行了一次深入的对话。SDLC 技术负责人,负责多态恶意软件、提示注入、模型篡改以及真正能抵御这些攻击的方法。没有形式,就没有门路。
为什么你不能保护那些你尚未绘制地图的人工智能资产?
再读一遍这十道题,规律显而易见。其中九道题都涉及具体事项:哪些 MCP 服务器、哪些代理、哪个作用域、哪个凭证、哪个规则文件、哪个软件包。
这些问题都无法从政策文件中得到解答。它们需要通过资产清单来解答,而大多数组织并没有资产清单。人工智能的出现源于开发人员的快速行动,没有提交任何申请,没有采购流程,也没有在代码库中明确标明自身是人工智能。
这使得映射成为前提条件而非第一步。一个从控制措施入手的AI安全威胁计划,只能将其应用于已知的AI,而这仅仅是它无法掌控的子集。因此,发现必须放在首位:模型、框架、数据集、推理端点、代理、MCP服务器、技能、提示,以及开发人员实际使用的AI编码工具,以及它们之间的关系。因为孤立地看待某个资产意义不大,风险往往集中在整个链条上。
此 NIST 人工智能风险管理框架 出于同样的原因,map 函数被放在 measure 和 manage 函数之前。它是框架中最不重要的函数,但其他所有函数都依赖于它。
应该首先应对哪些人工智能安全威胁?
虽然不是最先进的,但却是最容易实现的。
- 本星期: 统计您的 MCP 服务器数量,并对其配置文件运行密钥检测。威胁 03 的风险暴露率与投入产出比最高,但几乎没有人关注过它。
- 这个月: 找到你的代理,并记下每个代理可以调用哪些功能以及使用哪些凭据。这样就能解决威胁 04,这是最常见且最容易消除的威胁。
- 本季度: 在代理添加的每个依赖项之前,都应进行行为恶意软件筛查。这样可以同时覆盖威胁 06、07 和 09,因为这三种威胁都属于新威胁,因此都能绕过基于信誉的检查。
其他一切都可以放在这三点之后,因为其他一切都假设你已经知道自己拥有什么。
到2027年,能够有效应对人工智能安全威胁的组织,并非那些拥有最佳模型评估结果的组织,而是那些能够在任何一个星期二都准确回答其软件中正在运行哪些人工智能以及这些人工智能被允许访问哪些权限的组织。这就是关键所在。 西吉尼 其构建核心在于:持续发现所有存储库中的人工智能资产,以及 pipelines,根据审计人员已认可的框架对风险进行评分,以及对供应链进行筛查,以发现尚未签名的内容。
十大威胁,两大类,两类之下各有一张地图。
常见问题解答
人工智能安全威胁与普通应用程序安全威胁真的有区别吗?
部分如此。后果并不陌生:代码执行、凭证窃取、数据泄露。改变的是攻击入口点和速度。以前无效的配置文件现在包含着可被执行的指令,攻击者编写出逼真的恶意代码的成本也降低了。您现有的控制措施仍然有效,只是不再能覆盖所有方面。
通过红队演练来测试我们的模型是否能解决这些威胁中的大部分问题?
它解决了其中一个问题的部分内容。红队演练可以判断模型是否能够被诱导去做它本不应该做的事情,这确实很有用。它无法查看工具范围、凭证、规则文件或 MCP 配置,因为这些都无法通过模型端点访问。一份清晰的红队演练报告和一个权限过高的代理程序可以并存,并不矛盾。
这些人工智能安全威胁中,哪一种最被低估?
机构过度干预,而且干预程度远远超出预期。它既没有CVE编号,也没有可供演示的漏洞利用程序,更没有厂商提供专门的产品来应对,因此不会引起任何紧迫感。这也决定了事件是可控的还是不可控的,因为范围决定了在第一次错误发生后,事态会蔓延到什么程度。
人工智能驱动的攻击会如何改变我们应该衡量的指标?
他们将衡量恶意软件严重程度的指标转向了时间。当恶意软件包的生成速度超过签名发布速度时,“有多少严重漏洞尚未解决”远不如“新漏洞被标记的速度”重要。要衡量依赖项进入代码库到经过审查之间的时间差,以及发现漏洞到能够采取行动的开发人员之间的时间差。







