智能体时代AI安全架构怎么重构?主智能体时代的安全范式变革

📅 2026/7/31 4:55:20 👁️ 阅读次数 📝 编程学习
智能体时代AI安全架构怎么重构?主智能体时代的安全范式变革

本文整理自 QCon 北京 2026 韦韬分享《主智能体时代的安全范式变革》,通过 AI音视频转录总结工具Ai好记进行视频转文字转录整理,以下为精炼整理后的会议笔记内容。


安全范式危机:智能体与传统系统是「两个物种」

韦韬在分享中开了一个很犀利的视角。

很多人觉得自主智能体就是个更智能的聊天机器人,但他直接怼回来:这是彻底两个物种,放在一起类比本身就是个误导。

为什么这么说?因为聊天工具的本质是「你问我答」的单向交互链,始终由人类在输入环节做安全判断。

但自主智能体不同,它自己形成了一套完整的感知-决策-执行闭环——看到环境、分析意图、调取工具、执行命令,这一整圈下来可能都没有人类介入过。

这意味着什么呢?传统安全体系中「人永远是最后一道关」的假设,在智能体时代直接崩塌了。你没法让一个智能体在每次调用工具前都弹个对话框问你「可以吗」——那还叫什么自主智能体。

所以韦韬把这个问题上升到了范式危机的层面。不是说修修补补能解决的,而是整个安全基础框架需要重新审视。

三重失控危机:AI安全面临的真实挑战

韦韬提炼了三重失控,老实说听完有点后背发凉。

第一重:人对AI的失控

传统软件里,代码写死了行为边界。但智能体不一样,它通过自然语言交互,行为边界是「聊」出来的。你给大模型一个任务,它自己决定怎么拆解、用什么工具、执行什么操作。这个过程里,输入的安全性和输出的可控性都变成了概率问题,不是硬边界问题。

第二重:AI自身的失控

这里说的不是大模型本身出幻觉——而是说智能体在运行时,自身状态可能被污染。比如它调用了一个外部API,返回的结果里藏着恶意指令,或者多轮对话中被上下文注入攻击。智能体的决策逻辑不是只靠最初那套prompt,而是在运行中不断被外部信息影响,攻击面在运行时动态扩大。

第三重:数据泄露的失控

这个最实际。智能体在完成一个任务时,可能要访问多个数据源、调用多个工具。它在哪个环节拿到了什么数据、数据去了哪里、有没有被下游工具留存——这些在传统架构里根本管不住。传统的DLP(数据防泄露)方案碰上了自主决策的智能体,等于密码锁碰上了会自己开门的机器人。

这三重失控不是独立的,它们互相叠加。人对AI管不住,AI自身又被攻击,数据就像在一条没人看管的传送带上到处跑。

传统安全架构为什么失效了

韦韬用一个概念把这个讲清楚了:后云+智能体时代的「三重爆炸」。

主体爆炸。传统RBAC里,用户/角色是有上限的。但智能体环境下,每个智能体都是一个独立主体。一个企业可能同时运行几百上千个智能体,每个还有不同的子任务和权限需求。角色设计不完。

客体爆炸。智能体访问的资源不再只是文件和数据表,它要访问API、微服务、知识库、外部工具、RAG检索链路——每个都是一类客体,每类的访问方式都不同。权限表膨胀到不可维护。

访问点爆炸。智能体不是通过固定入口访问的,它可能通过API网关、消息队列、函数调用、数据库直连、浏览器自动化等多个路径。每个路径的安全策略不同,策略之间的协调几乎不可能手动完成。

三个轴同时膨胀,传统范式下「先定义规则再执行」的做法就彻底走不通了。你定义完规则,架构已经变了。

回归安全本源:三个补足的范式

韦韬没有只在「解剖问题」层面停留,他给出了三个具体的架构范式作为重建方向。

NbSP:不可绕过的控制点

这是最底层的原则。任何时候不能依赖智能体「自觉」走安全通道,而要在架构层面确保所有流量都经过强制安全检查点。就像一个机场,所有行李不管从哪里来,进航站楼就必须过安检。这个检查点在架构上是不可绕过的,不是靠prompt告诉智能体「请走安全路径」。

OVTP:完整可溯性

智能体的运行记录不能只是日志,而是要有完整的编排可溯性——不仅要记录「调用了什么API」,还要记录「为什么调用、基于什么输入、产生了什么输出」。每一层推理链条都能回溯,才能做事后的安全审计和归因。

ARCP:攻防回报平衡

这个思路有点意思。韦韬说安全方案不能只考虑防御收益,还要看攻击者的成本。如果攻击者花5块钱能撬动100块的损失,那这个体系再好看也没用。ARCP要求在每个点上评估攻防回报比,把资源集中在让攻击者「得不偿失」的地方,而不是均匀铺满每个角落。

这三个范式放在一起,逻辑就闭环了:NbSP保证控制点不可回避,OVTP保证每个行为都能追溯,ARCP保证投入在最重要的事情上。

基础设施革新:智能体时代需要什么样的底座

范式有了,怎么落地?韦韬提到了三个基础设施方向。

内存安全操作系统内核。很多安全问题归根到底是内存安全问题。如果操作系统的内核本身不支持内存安全,上面跑智能体就像在沙上建城堡。用Rust等内存安全语言重写内核组件,能从底层消除一大类漏洞。

安全平行切面。这个概念我理解下来像是「在系统里埋一层安全观测网」。不需要修改应用代码,也不需要侵入智能体的运行逻辑,而是从侧面切入,做持续的监控和策略执行。有点像在道路下面铺的传感器——车正常开你不管,但如果超速或偏离路线,传感器直接介入。

结构化编程约束下的智能体。这个最有意思。韦韬说智能体不要完全靠自由文本决策,而是要引入结构化约束框架。比如智能体的工具调用、决策分支、数据访问路径要有明确的类型系统和边界定义。不是限制智能体的能力,而是给它画一个「安全走廊」,在这个走廊里可以有创造力,但不能出界。

攻防转换:从零日到负一日

这里韦韬讲了一个很让人振奋的观点:AI时代的攻击能力,其实可以反过来变成防御优势。

传统安全里,发现零日漏洞是件坏事——攻击者没公布之前你不知道,知道了往往已经有人用了。

但韦韬说,在智能体时代,攻击手段可以被系统性地转化成检测手段。比如用AI模拟攻击行为,不断探测系统的薄弱环节,然后自动修补。

这样零日漏洞在被发现的时候,防御系统已经在「负一日」状态——也就是比漏洞被利用还早的状态——做好了准备。

这听起来有点抽象,但我理解下来的关键是:智能体本身既是攻击载体也是防御工具,关键看你用什么框架去组织它。

未来软件形态:确定性代码与非确定性智能的融合

韦韬最后抛了一个更大的图景。他说未来的软件不会是纯确定的代码,也不会是全靠大模型驱动的非确定系统,而是两者的融合体。

核心的计算逻辑、数据流、权限控制,这些必须是确定性代码:行为可预测、可审计、可推导。而交互理解、任务规划、知识调用这些非确定的部分,交给智能体。两者之间有清晰的接口边界,不是混成一锅粥。

我听完最大的感受是:安全架构不是在「给智能体加防护」,而是在重新思考和设计整个计算体系的底座。这个工作比大多数人想象的要早、要急。

FAQ

Q1:零信任架构在智能体时代完全没用了吗?

也不能说完全没用。零信任在身份认证和最小权限原则上的思路是对的,单靠它已经不够。智能体场景下主体和客体都在动态变化,还需要补充NbSP和OVTP这些新范式才能兜住。

Q2:智能体安全跟大模型安全是一回事吗?

不是。大模型安全主要关注模型的训练数据、输出合规、对抗攻击等问题。智能体安全是在这个基础上,还要管运行时行为、工具调用链路、数据流动路径。打个比方:大模型安全是管引擎,智能体安全是管整辆车在路上怎么开。

Q3:小团队怎么应对智能体安全问题?

说实话没有捷径。但可以从两个短期动作入手:一是梳理自家智能体实际「会用」的API和数据源,给每个API设置明确的权限边界;二是跑一遍完整的调用链路追踪,确认每个环节的数据流向是清晰的。先把可见性做起来,优化是后面的事。

Q4:提到的「安全平行切面」有现成方案吗?

目前还在早期阶段。CNCF生态里有几个项目在往这个方向走,比如用eBPF做内核级别的观测和策略执行。但真正成熟的产品化方案还需要时间,韦韬分享更像是指了个方向。

Q5:结构化编程约束具体怎么实现?

思路是给智能体声明一套「能力清单」,包括它能调什么工具、访问什么数据、在什么范围内决策。运行时系统强校验这些边界,超出就拦截。类似TypeScript的类型系统给JavaScript加约束,只不过这个约束是安全维度的。


以上内容由 Ai好记 转录整理。
Ai好记是一款音视频转图文笔记的AI音视频转录总结助手,支持解析B站、抖音、小宇宙等平台链接及本地/网盘的音视频文件,视频转文字后自动生成精华速览、思维导图和结构化笔记,帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。