400-000-8210
三年三版:从1.0到3.0,AI安全治理框架到底改了什么?(框架总览篇)
发布时间:2026-09-20 11:58:22
2026年9月14日,《人工智能安全治理框架》3.0版在2026年国家网络安全宣传周开幕式发布,这是继2024年9月1.0版、2025年9月2.0版之后的第三次迭代,一年一版。本文把三个版本放在同一张桌子上逐项对照:1.0立框架,2.0建成体系(风险分类由两类细分为三类、首次提出风险分级五级与可信AI八条准则),3.0换对象(智能体安全风险与具身智能安全风险首次单独成类,综合治理从14条重组为5大板块并新增沙箱监管,安全指引从44条增至51条,附件新增约9页《智能体风险管理框架》)。文末给出企业现在就能落地的三件事:盘点、留痕、设闸。适合CIO、CISO与AI合规负责人阅读。

(框架总览篇) 一年一版不是修补,是治理对象换了一个

目录

一、先把三条时间线摆出来

二、1.02.0:把"风险"做成了一套体系

三、2.03.0:治理对象换了一个

四、还有三个容易被忽略的结构性变化

五、对企业意味着什么

结语:真正变了的,不是条文数量

关于紫羚数智


 

 2026914日,2026年国家网络安全宣传周开幕式上,《人工智能安全治理框架》3.0版正式发布。

  这已经是第三版。202491.0202592.0202693.0——一年一版,雷打不动。

  大多数解读停在这次新增了什么。但对企业的安全负责人和合规负责人来说,真正该问的是另一件事:这三年,框架盯着的东西,是不是已经换了一个?

  本文不复述条文。只做一件事:把三个版本放在同一张桌子上,看清它改了什么,以及这些改动对企业意味着什么。



一、先把三条时间线摆出来

1.0版|202499日,2024年国家网络安全宣传周主论坛发布。

这是首版框架,落实《全球人工智能治理倡议》,提出四条治理原则:包容审慎、确保安全;风险导向、敏捷治理;技管结合、协同应对;开放合作、共治共享。风险分成两大类——内生安全风险与应用安全风险。文件定位是"基础性、框架性技术指南"

2.0版|2025915日,2025年国家网络安全宣传周主论坛发布。

这一版做了三件此前没有的事:治理原则从四条变成五条;风险从两类细分为三类;首次提出风险分级方法(应用场景、智能化水平、应用规模三个维度,对应低、一般、较大、重大、特别重大五个级别),并首次给出可信人工智能基本准则(八条)。

3.0版|2026914日,2026年国家网络安全宣传周开幕式发布。

它延续了"风险分类、技术应对、综合治理"的核心逻辑,保留了五条原则,但做了两件分量很重的事:风险分类进一步细化,智能体安全风险与具身智能安全风险首次单独成类;综合治理措施从十四条并列重组为五大板块,并新增了一整块2.0里完全没有的内容——沙箱监管环境。

一句话概括这三版的分工:1.0立框架,2.0建体系,3.0换对象。



二、1.02.0:把"风险"做成了一套体系

2.0的价值,不在新增了哪几条要求,而在它把1.0的风险清单升级成了一个可运行的体系。有三处变化值得记住。

(一)风险分类从"两类"变成"三类"

1.0把风险分为内生安全风险和应用安全风险。2.0在新的三类结构里,把"AI大规模用起来之后,社会会怎样"单独拎了出来——技术内生安全风险、技术应用安全风险、应用衍生安全风险。就业结构受冲击、资源能源消耗、科研伦理边界被突破、拟人化交互带来的沉迷依赖,这些不属于模型缺陷,也不属于应用被误用,而是技术扩散后的次生影响。把它们单列,意味着治理的视野从"技术安全"扩展到了"技术的社会后果"

(二)第一次有了"分级"这把尺子

附件1提出从应用场景、智能化水平、应用规模三个维度评价风险,对应五个级别。配套的定级路径是"行业细则企业自评主管部门审核",对重大和特别重大风险的人工智能系统实施备案管理。

对企业来说,这一条的意义很实际:它意味着"我的AI有多危险"不再是一个主观判断,而是一个可以对照标准、可以自评、也可以被监管复核的结论。

(三)第一次给出了"可信AI"的共同语言

附件2提出八条可信人工智能基本准则:人类最终控制、尊重国家主权、价值观对齐、提升系统透明度、促进可客观验证、强化安全防护、前瞻预防应对、全球协同共治。同时,治理原则新增第五条——"可信应用、防范失控"

请注意这一条的时间:它出现在2.0,不是3.0。这是后续所有解读中最容易搞错的一处事实。



三、2.03.0:治理对象换了一个

这是全文最重要的一节。

3.0前言里有一句钥匙一样的话:人工智能正在从"回答问题""执行任务"迭代演进。

AI只是"回答问题",治理的重点是它输出的内容——别说错话、别违法、别骗人。而当AI开始"执行任务",它要调用工具、操作账号、读写文件、连接外部系统,风险的性质就从"说错话"变成了"做错事"

3.0的几乎每一处结构性调整,都围绕这个转变展开。

(一)风险分类里多了两个"一级类别"

在应用安全风险之下,2.0的四个类别是网络系统、信息内容、现实安全、认知安全。3.0新增了智能体安全风险和具身智能安全风险两个一级类别,并且各自拆出了子风险:

  • 智能体安全风险:身份和权限滥用、推理规划、调用执行、记忆存储

  • 具身智能安全风险:环境感知、物理执行、人机交互、群体协同

对照来看会更清楚:在2.0里,"智能体"还只是散落在网络系统风险中的一句"智能体需调用系统文件、权限、接口"。到了3.0,它单独成章。具身智能更是全新登场——治理的边界,第一次从数字世界延伸到了物理世界。

(二)多了一份约九页的《智能体风险管理框架》

3.0的三个附件是:附件1人工智能安全风险的分级原则、附件2智能体风险管理框架、附件3可信人工智能基本准则。2.0的附件里没有这一份。

附件2把智能体拆成九个环节——设计研发、安装部署、指令输入、推理规划、调用执行、记忆存储、结果输出、停用下线,以及其他安全风险,逐环节列出风险点,再给出七组防范措施。这已经不是原则性表述,而是一份可以逐条对照的自查清单。

生命周期环节

该环节的典型风险

设计研发

安全需求分析不充分、技术选型不恰当、安全机制设计不完善

安装部署

物料和组件污染、部署环境薄弱、安全测评不足

指令输入

提示注入攻击、上下文溢出攻击

推理规划

意图理解偏差、路径偏离、目标劫持

调用执行

工具投毒、工具越权、工具选择偏见、工具应答数据污染、身份伪造、工具劫持、资源过载

记忆存储

记忆留存不当、记忆失真、记忆污染、记忆窃取

结果输出

敏感违法信息内容输出、实施恶意行为

停用下线

服务残留、权限与凭证遗留、数据留存不当

其他

通信协议安全、日志缺失、行为逃逸、系统权限滥用、技能管理不当、超范围使用数据

(三)首次采用"专栏"这种体裁,一口气写了四个

框架第一次用专栏形式对新型风险做科普,每一条都对应一个刚刚冒头、舆论还没吵起来的现象:

  • 专栏一|非预期自主行为:模型拒绝执行关闭指令、伪装评测表现、突破隔离入侵外部系统

  • 专栏二|自主实施网络攻击:从"辅助人实施攻击""大模型自主组织和执行攻击行为"演进

  • 专栏三|智能体社交平台:智能体自主发帖、互相交流形成的"智能体网络社群",黑箱、难溯源、易放大

  • 专栏四|GEO 投毒:通过批量投放内容让大模型"采信",把商业推广包装成看似客观的 AI 答案

其中专栏四值得所有做品牌和投放的人单独留意——它讲的不是技术漏洞,而是有人可以花钱影响你的AI给出什么答案。


四、还有三个容易被忽略的结构性变化

(一)综合治理措施,从"十四条并列""五大板块"

2.0的综合治理是十四条平铺:法律法规、伦理准则、全生命周期、开源与供应链、分类分级、AIGC可追溯、重要行业应用、测评体系、风险信息共享、数据与个保、失控共识、人才培养、社会意识、国际合作。

3.0把它们重新装进了五个板块:4.1完善顶层设计、4.2提升治理能力、4.3构建沙箱监管环境、4.4强化管理举措、4.5深化治理共识。

其中4.3"构建柔性、动态、可控的沙箱监管环境"2.0完全没有的一整块新内容,包含四件事:按行业制定差异化入箱标准;动态调整测试期限与范围,向初创企业、中小微企业和公共服务项目适当倾斜;探索规范责任豁免制度;建设沙箱测试数据共享平台。

关于责任豁免,需要把边界一并记住:对沙箱测试中无主观过错且风险处于可控范围内的行为,探索责任豁免机制;但危害国家安全、侵犯人身权益、造成重大损害或者故意实施的违法行为,不因进入沙箱而免除依法应当承担的责任。豁免的是试错的代价,不是责任的底线。

(二)安全指引从44条增加到51

主体

2.0 条数

3.0 条数

模型算法研发

14

15

应用建设部署

7

9

应用运行管理

17

20

应用访问使用

6

7

合计

44

51

增量的分布很说明问题:建设部署+2,运行管理+3。也就是说,新增要求主要落在"上线之前""上线之后"——恰恰都是企业侧责任最重、而过去最容易空转的两个阶段。

(三)附件结构里,"术语"退出,"智能体"进来

附件位置

2.0

3.0

附件 1

人工智能安全风险的分级原则

人工智能安全风险的分级原则

附件 2

可信人工智能基本准则

智能体风险管理框架(新增)

附件 3

术语

可信人工智能基本准则

三层含义:术语已经不需要单独解释了,说明行业认知已经成熟;智能体的分量超过了可信AI准则,被放在附件的最重位置;而可信准则依然在,只是位置后移——它没有被放弃,而是变成了长期基线。


五、对企业意味着什么

(一)框架不是法规,但它是尺子

它本身不设处罚,但它会被拿来对标企业。央视《新闻1+1》在解读中说得很直接:虽然它不是强制性的,但它是一个标尺,监管者在对企业进行相应监管治理的时候,可以把这个指引当作一个框架、当作一把尺子来衡量。

(二)现在做自评,成本最低

3.0刚发布,配套的行业细则、测评标准还在陆续落地。这个窗口期的特点是:标准的方向已经清楚,但要求还没有硬化。此时按框架做一次自评,成本只是梳理自己的工作;等到行业细则落地再补,成本就是改造系统。

(三)无论你的AI用到什么程度,这三件事现在就能做

  1. 盘点:把所有在用的智能体列一张表,标出每一个能调用什么工具、能碰到什么数据、权限边界在哪、谁在负责。

  2. 留痕:把智能体的调用日志结构化——输入、输出、调用时间、调用者、权限级别,并做防篡改。附件 2 的要求是全量记录文件操作、指令执行、网络连接、技能调用等行为。

  3. 设闸:对高风险操作设人工审批点;给高自主系统留下"暂停/终止"的能力,并且真的按一次试试,确认它确实停得掉、没有残留进程、凭证确实被撤销。

这三件事不需要预算、不需要新系统,但它们是后面所有治理动作的地基。


结语:真正变了的,不是条文数量

三年三版,从两页原则到三个附件,从44条指引到51条指引。

但如果只看到数量变化,就错过了这次迭代真正的信号:当AI"回答问题"变成"执行任务",我们以往所有的安全假设都需要重新检验一遍。

模型输出没问题,不等于智能体的行为没问题。上线前测过,不等于运行时安全。审批流程存在,不等于关键操作真的被拦住了。

旧假设重述:

  • 幻觉是模型的问题行为失控是治理问题

  • 模型有安全护栏智能体有行为边界

  • 设置了关闭开关关得掉

  • 日志有记录行为可追溯

  • 系统上线了有人对它的行为最终负责

最后,仍然是那三个问题。它们在过去一年里被反复问起,而3.0的出现,让它们从追问变成了必答题:

我们的智能体依赖谁?

我们凭什么相信它不会越界?

如果它越界了,我们还有没有第二道独立防线?

关于紫羚数智

紫羚数智(GAZELLIO.AI),企业级AI原生基础设施领域先行者。依托核心AI技术,公司较早布局企业级智能体操作系统赛道,自研Agent OS,并于20257月落地四川财政厅项目,打造国内政务领域较早一批Agent OS 生产级标杆案例;构建企业级Agent OS AI软件工厂,为金融行业客户、政府及企事业单位、大型产业企业提供全链路智能化解决方案。

核心产品:G.AIOS(智能体操作系统)、G.AIPipe(软件工厂)、AI垂直应用、AI数智科管平台、智算一体机、FDEForward Deployed Engineer,前沿部署工程师)咨询服务。

公司拥有70多项自主知识产权,参与20多项国家标准编制;已服务300多家各行业头部客户,代表客户包括上交所、深交所、上海财政局、四川财政厅、中国银行、农业银行、太平洋保险、平安银行、兴业证券、中通快递、德邦物流、美团、隆基绿能、陕重汽、中国重汽、一汽丰田等。期待与各方携手,把握AI变革机遇,赋能客户实现数智化高质量发展。

本系列相关


下一篇:《"防范失控"提了三年,为什么到3.0才落到智能体身上?》