智能体时代AI安全架构怎么重构?主智能体时代的安全范式变革
本文整理自 QCon 北京 2026 韦韬分享《主智能体时代的安全范式变革》通过 AI音视频转录总结工具Ai好记进行视频转文字转录整理以下为精炼整理后的会议笔记内容。安全范式危机智能体与传统系统是「两个物种」韦韬在分享中开了一个很犀利的视角。很多人觉得自主智能体就是个更智能的聊天机器人但他直接怼回来这是彻底两个物种放在一起类比本身就是个误导。为什么这么说因为聊天工具的本质是「你问我答」的单向交互链始终由人类在输入环节做安全判断。但自主智能体不同它自己形成了一套完整的感知-决策-执行闭环——看到环境、分析意图、调取工具、执行命令这一整圈下来可能都没有人类介入过。这意味着什么呢传统安全体系中「人永远是最后一道关」的假设在智能体时代直接崩塌了。你没法让一个智能体在每次调用工具前都弹个对话框问你「可以吗」——那还叫什么自主智能体。所以韦韬把这个问题上升到了范式危机的层面。不是说修修补补能解决的而是整个安全基础框架需要重新审视。三重失控危机AI安全面临的真实挑战韦韬提炼了三重失控老实说听完有点后背发凉。第一重人对AI的失控传统软件里代码写死了行为边界。但智能体不一样它通过自然语言交互行为边界是「聊」出来的。你给大模型一个任务它自己决定怎么拆解、用什么工具、执行什么操作。这个过程里输入的安全性和输出的可控性都变成了概率问题不是硬边界问题。第二重AI自身的失控这里说的不是大模型本身出幻觉——而是说智能体在运行时自身状态可能被污染。比如它调用了一个外部API返回的结果里藏着恶意指令或者多轮对话中被上下文注入攻击。智能体的决策逻辑不是只靠最初那套prompt而是在运行中不断被外部信息影响攻击面在运行时动态扩大。第三重数据泄露的失控这个最实际。智能体在完成一个任务时可能要访问多个数据源、调用多个工具。它在哪个环节拿到了什么数据、数据去了哪里、有没有被下游工具留存——这些在传统架构里根本管不住。传统的DLP数据防泄露方案碰上了自主决策的智能体等于密码锁碰上了会自己开门的机器人。这三重失控不是独立的它们互相叠加。人对AI管不住AI自身又被攻击数据就像在一条没人看管的传送带上到处跑。传统安全架构为什么失效了韦韬用一个概念把这个讲清楚了后云智能体时代的「三重爆炸」。主体爆炸。传统RBAC里用户/角色是有上限的。但智能体环境下每个智能体都是一个独立主体。一个企业可能同时运行几百上千个智能体每个还有不同的子任务和权限需求。角色设计不完。客体爆炸。智能体访问的资源不再只是文件和数据表它要访问API、微服务、知识库、外部工具、RAG检索链路——每个都是一类客体每类的访问方式都不同。权限表膨胀到不可维护。访问点爆炸。智能体不是通过固定入口访问的它可能通过API网关、消息队列、函数调用、数据库直连、浏览器自动化等多个路径。每个路径的安全策略不同策略之间的协调几乎不可能手动完成。三个轴同时膨胀传统范式下「先定义规则再执行」的做法就彻底走不通了。你定义完规则架构已经变了。回归安全本源三个补足的范式韦韬没有只在「解剖问题」层面停留他给出了三个具体的架构范式作为重建方向。NbSP不可绕过的控制点这是最底层的原则。任何时候不能依赖智能体「自觉」走安全通道而要在架构层面确保所有流量都经过强制安全检查点。就像一个机场所有行李不管从哪里来进航站楼就必须过安检。这个检查点在架构上是不可绕过的不是靠prompt告诉智能体「请走安全路径」。OVTP完整可溯性智能体的运行记录不能只是日志而是要有完整的编排可溯性——不仅要记录「调用了什么API」还要记录「为什么调用、基于什么输入、产生了什么输出」。每一层推理链条都能回溯才能做事后的安全审计和归因。ARCP攻防回报平衡这个思路有点意思。韦韬说安全方案不能只考虑防御收益还要看攻击者的成本。如果攻击者花5块钱能撬动100块的损失那这个体系再好看也没用。ARCP要求在每个点上评估攻防回报比把资源集中在让攻击者「得不偿失」的地方而不是均匀铺满每个角落。这三个范式放在一起逻辑就闭环了NbSP保证控制点不可回避OVTP保证每个行为都能追溯ARCP保证投入在最重要的事情上。基础设施革新智能体时代需要什么样的底座范式有了怎么落地韦韬提到了三个基础设施方向。内存安全操作系统内核。很多安全问题归根到底是内存安全问题。如果操作系统的内核本身不支持内存安全上面跑智能体就像在沙上建城堡。用Rust等内存安全语言重写内核组件能从底层消除一大类漏洞。安全平行切面。这个概念我理解下来像是「在系统里埋一层安全观测网」。不需要修改应用代码也不需要侵入智能体的运行逻辑而是从侧面切入做持续的监控和策略执行。有点像在道路下面铺的传感器——车正常开你不管但如果超速或偏离路线传感器直接介入。结构化编程约束下的智能体。这个最有意思。韦韬说智能体不要完全靠自由文本决策而是要引入结构化约束框架。比如智能体的工具调用、决策分支、数据访问路径要有明确的类型系统和边界定义。不是限制智能体的能力而是给它画一个「安全走廊」在这个走廊里可以有创造力但不能出界。攻防转换从零日到负一日这里韦韬讲了一个很让人振奋的观点AI时代的攻击能力其实可以反过来变成防御优势。传统安全里发现零日漏洞是件坏事——攻击者没公布之前你不知道知道了往往已经有人用了。但韦韬说在智能体时代攻击手段可以被系统性地转化成检测手段。比如用AI模拟攻击行为不断探测系统的薄弱环节然后自动修补。这样零日漏洞在被发现的时候防御系统已经在「负一日」状态——也就是比漏洞被利用还早的状态——做好了准备。这听起来有点抽象但我理解下来的关键是智能体本身既是攻击载体也是防御工具关键看你用什么框架去组织它。未来软件形态确定性代码与非确定性智能的融合韦韬最后抛了一个更大的图景。他说未来的软件不会是纯确定的代码也不会是全靠大模型驱动的非确定系统而是两者的融合体。核心的计算逻辑、数据流、权限控制这些必须是确定性代码行为可预测、可审计、可推导。而交互理解、任务规划、知识调用这些非确定的部分交给智能体。两者之间有清晰的接口边界不是混成一锅粥。我听完最大的感受是安全架构不是在「给智能体加防护」而是在重新思考和设计整个计算体系的底座。这个工作比大多数人想象的要早、要急。FAQQ1零信任架构在智能体时代完全没用了吗也不能说完全没用。零信任在身份认证和最小权限原则上的思路是对的单靠它已经不够。智能体场景下主体和客体都在动态变化还需要补充NbSP和OVTP这些新范式才能兜住。Q2智能体安全跟大模型安全是一回事吗不是。大模型安全主要关注模型的训练数据、输出合规、对抗攻击等问题。智能体安全是在这个基础上还要管运行时行为、工具调用链路、数据流动路径。打个比方大模型安全是管引擎智能体安全是管整辆车在路上怎么开。Q3小团队怎么应对智能体安全问题说实话没有捷径。但可以从两个短期动作入手一是梳理自家智能体实际「会用」的API和数据源给每个API设置明确的权限边界二是跑一遍完整的调用链路追踪确认每个环节的数据流向是清晰的。先把可见性做起来优化是后面的事。Q4提到的「安全平行切面」有现成方案吗目前还在早期阶段。CNCF生态里有几个项目在往这个方向走比如用eBPF做内核级别的观测和策略执行。但真正成熟的产品化方案还需要时间韦韬分享更像是指了个方向。Q5结构化编程约束具体怎么实现思路是给智能体声明一套「能力清单」包括它能调什么工具、访问什么数据、在什么范围内决策。运行时系统强校验这些边界超出就拦截。类似TypeScript的类型系统给JavaScript加约束只不过这个约束是安全维度的。以上内容由 Ai好记 转录整理。Ai好记是一款音视频转图文笔记的AI音视频转录总结助手支持解析B站、抖音、小宇宙等平台链接及本地/网盘的音视频文件视频转文字后自动生成精华速览、思维导图和结构化笔记帮助你把几小时的视频内容变成可搜索、可复习的图文笔记。

相关新闻

最新新闻

日新闻

周新闻

月新闻