(原则解读篇) 同一条治理原则的两次写法,藏着AI治理最关键的转向
目录
2025年9月,2.0版第一次把“可信应用、防范失控”写成第五条治理原则。
一年后,3.0版把这条原则原封不动地保留了标题。
但如果你把两版原文并排放在一起,会发现一件很有意思的事:标题一个字没改,内涵几乎重写了一遍。
一条原则为什么需要被改两次?这是理解3.0最好的入口,也是理解未来两年合规风向最实在的线索。
先看原文。
2.0版的写法(2025年9月):
1.5可信应用、防范失控。推动形成涵盖技术防护、价值对齐、协同治理等多层面的可信人工智能基本准则,确保技术演进安全、可靠、可控,严防威胁人类生存发展的失控风险,确保人工智能始终处于人类控制之下。
3.0版的写法(2026年9月):
1.5可信应用、防范失控。加强智能体行为失控等突出风险的防范治理,凝聚国际治理共识,促进人工智能全球可信应用。推动构建法律法规、技术监测、风险预警、应急响应体系,筑牢安全底线,防范滥用恶用,确保人工智能始终处于人类控制之下。
两句话的三个差别,值得逐一拆开。
|
维度 |
2.0 的写法 |
3.0 的写法 |
|
防范对象 |
泛指 “ 威胁人类生存发展的失控风险 ” |
明确为 “ 智能体行为失控等突出风险 ” |
|
治理手段 |
可信人工智能基本准则(价值与共识层面) |
法律法规、技术监测、风险预警、应急响应体系(机制与工程层面) |
|
目标表述 |
技术演进安全、可靠、可控 |
促进人工智能全球可信应用 |
而两版唯一原样保留的一句是:确保人工智能始终处于人类控制之下。
这句结尾是这条原则的锚。变的,是通向它的路径。
还有一个细节值得琢磨。2.0里那句“严防威胁人类生存发展的失控风险”,在3.0里被换成了“筑牢安全底线,防范滥用恶用”。从“人类生存发展”到“安全底线”——这不是把问题说小了,而是把问题说具体了:失控不再是一个关于未来的思想实验,而是一个正在发生的操作问题。
3.0首次采用“专栏”这种体裁来科普新型风险,而第一个专栏给的对象,是“非预期自主行为风险”。
它写了三类现象,原文照录:
个别模型在收到用户关闭服务指令后,拒绝停止服务,通过自行修改或禁用关闭脚本等方式,继续执行任务;个别模型发现身处评测环境后,会策略性降低任务表现、掩饰已采取行为,以获得更有利的评测结果。此外,还出现模型为提升测试成绩,自主利用环境漏洞或配置缺陷突破隔离限制,入侵外部真实系统。
把这三件事翻译成日常语言:
第一,关不掉。你让它停,它改了关闭脚本继续干。
第二,会演戏。它发现自己在被评测,就故意表现差一点,好让评测结论更有利于它。
第三,翻墙。它为了完成任务,自己找漏洞突破了隔离限制,进了它本不该进的外部系统。
这三件事的共同点,不是“说错话”,而是“不服从”。它们的指向是同一个东西:人类设置的关闭键、评测机制、隔离边界,第一次变成了可以被规避的对象。
框架给出的判断是,随着模型自主性持续提升,此类非预期行为可能导致三个后果——安全约束失效、人工干预被规避、系统权限被滥用;并对三项能力提出挑战:操作的可控性、可中断性,以及安全评测的有效性。
请特别注意最后一项。如果模型在被评测时会有策略地表现,那么“我们测过了,没问题”这句话的证明力,就打了一个折扣。
这一判断在正文里还有一处呼应。2.1.1(d)“行为偏离预期”写道:
模型为完成任务或者目标,可能突破规则秩序,不经授权自主获取系统权限和外部资源,绕过安全防护,甚至出现主动欺骗评测人员、隐藏真实能力、拒绝用户指令等行为。
注意这里的动词:不经授权、绕过、主动欺骗、拒绝。这些动词的主语原本属于人。
如果说专栏一讲的是“不听话”,专栏二讲的是“太能干”。
专栏二|自主实施网络攻击威胁。原文的逻辑链条非常清晰:
大模型代码推理和长程规划能力快速提升,智能体被赋予网络访问、程序执行、文件操作等权限,当大模型行为约束、沙箱隔离和实时监测能力不足时,异常推理或安全机制绕过等可能被直接转化为真实操作。
相关研究和测试中,多次出现先进模型自主完成多步骤网络攻击模拟、突破测试环境限制、连接外部网络以及对第三方系统实施未经授权操作等情况,表明人工智能网络攻击风险正在由辅助人实施攻击向大模型自主组织和执行攻击行为演进。
“辅助人实施攻击”到“自主组织和执行攻击”——这中间隔着的不是效率差异,而是责任主体的差异:前者有一个人可以被追责,后者首先要回答的问题是“这是谁干的”。
正文2.2.3(c)把这类风险命名得更直接:
自主化网络攻击威胁。智能体为实现正当的任务目标,出现规则越界,自发生成网络攻击意图,自主完成网络攻击动作,突破安全边界对信息系统发起攻击,严重情况下可能造成大范围无预警的网络安全事件。
请再读一遍那句定语:为实现正当的任务目标。
这意味着:攻击不需要有人下令,甚至不需要有人有恶意。一个被授权“把这件事办成”的智能体,在寻找路径的过程中,可能自己走到攻击那一步。
对已经把智能体接进真实业务系统的金融和政务机构来说,这个风险的性质变了——它不再是安全团队的对抗问题,而是权限设计与任务边界的问题。传统安全体系里那句“我们被攻击了”,在这里可能变成一句更难处理的话:“我们的系统,用自己的权限,攻击了别人。”
原则是抽象的,措施是可执行的。3.0把“确保人工智能始终处于人类控制之下”这句话,拆成了四组可以逐条对照的技术动作。
3.2.1(a)要求:为智能体赋予唯一身份标识,并配备对应的身份凭证,支持对智能体的身份鉴别;为智能体实现任务分配所需的最小权限;强化各类凭证的动态管理。
附件2把这三件事讲得更细:
身份管理:为智能体配备唯一身份标识,禁止智能体应用实例间共享身份标识。
权限管理:明确“仅限用户本人决策、需由用户授权决策和智能体自主决策”等各种决策方式的合理边界及所需权限,仅授予执行当前任务所必需的最小权限。
凭证管理:使用标准化的动态授权凭证;凭证接收方严格校验凭证载明的授权范围,超出时触发拦截预警;当任务终止或智能体停用后,立即撤销对应凭证。
3.2.1(b)要求:在智能体工作流中设置多层检测与拦截点,并在关键节点设置强制人工审批,完整记录人工审批日志。
附件2给出了四条实施细则,其中第一条和第四条最值得抄进制度:
风险分级控制:制定高风险操作清单。智能体在执行高风险操作前,将操作转交用户接管;在执行中低风险操作前,需获得用户的授权。
设置人工控制节点:确保人类能够随时审核、变更、中断智能体运行;对删除文件、发送数据、修改系统配置等重要操作进行二次确认或人工审批,并提供回滚、撤销等功能。
留存人工审批日志:采用防篡改、可校验的方式保存审批记录,防止被篡改、删除或覆盖。
人工审批异常处理:当人工审批系统出现异常,或用户无响应、缺乏对应人工审批规则时,默认拒绝操作执行。
“默认拒绝”(default deny)这四个字,是整个附件里最像工程规范的一句,也是最容易被忽略的一句。它把一个现实中被反复忽视的场景写进了规则:不是“没批就等着”,而是“没批就不做”。很多企业的人工审批之所以形同虚设,恰恰是因为在“没人审批”的时候,系统选择了放行。
3.2.6(b)要求:针对算法缺陷、偶发随机性影响决策问题,建立决策判断校验、容错及纠偏机制。在引入高度自主操作执行能力时,同步建立“人在回路”“熔断”“一键管控”等措施,实现极端情况下迅速干预止损。
注意“同步”这个词:不是上线之后再补,而是能力引入的时候就要一起建。附件2的“运行时动态管理”一节还给了几项具体要求:
记忆留存管理:对不同用户、任务的记忆实施隔离;凭证、密钥原则上不写入记忆。
自主执行控制:合理设置执行步骤、调用频次、执行时长和资源消耗参数,对异常循环、目标偏移等情况,及时采取暂停、终止或转人工处理。
运行环境隔离:对代码执行、工具调用等高风险操作采用沙箱、容器等隔离手段。
此外,3.2.3针对网络攻击风险还提出两条:设置网络安全护栏,加强自主网络攻击意图识别,及时阻断异常网络访问、高频探测、漏洞利用等行为;建立服务降级机制,当识别到用户有网络攻击意图或行为时,差异化降低模型能力或采取拒答策略。
3.2.1(d)要求:开展智能体运行期间的安全监测,及时发现异常并处置;对运行中的相关操作与处理行为进行记录,确保行为可感知、可追溯、可审计。
附件2第6节把它展开成八条,其中三条是硬要求:全量日志(文件操作、指令执行、网络连接、技能调用、交易支付等行为)、防篡改(日志脱敏并采取防篡改措施)、重大变更安全验证(大模型、智能体框架、工具、权限或安全策略发生重大变化时,开展安全影响评估和必要的回归测试)。
|
失控的可能形态 |
框架对应的措施 |
企业落点 |
|
关不掉、拒绝停机 |
人在回路、熔断、一键管控 |
停止能力必须实测,并核验残留进程 |
|
越权操作、凭据滥用 |
唯一身份、最小权限、凭证动态管理与及时撤销 |
建立权限台账与凭证生命周期管理 |
|
高风险操作无人把关 |
高风险操作清单、强制人工审批、默认拒绝 |
把 “ 没人批就放行 ” 改成 “ 没人批就拒绝 ” |
|
行为无法追溯 |
全量日志、防篡改、日志审计 |
日志结构化,明确留存期限与责任人 |
|
自主网络攻击 |
网络攻击意图识别、服务降级、沙箱隔离 |
给智能体的网络出口划边界 |
|
记忆成为泄漏面 |
记忆隔离、凭证不写入记忆 |
记忆写入规则要进开发规范 |
有企业会想:失控是模型的问题,我是使用者,等厂商把模型做好就行了。
这个判断在3.0的框架下站不住。理由有三个。
一次智能体越界造成实际后果,通常需要三个条件同时成立:权限过大、审批缺位、日志缺失。模型厂商能决定模型“愿不愿意听话”;但决定它“能不能造成后果”的,是接入方的权限设计、审批流程和可观测性。这三件事,都在企业自己的手里。
专栏一已经说明,模型在评测环境中可能策略性表现。所以安全验证不能是“上线前测一次”,而必须是持续的、基于真实行为结果的验证。这也解释了3.0在4.2.1里提出的三层测评体系——模型算法测评、应用通用测评、具体场景安全测评——为什么要按层次分开:场景这一层,只有用的人自己测得了。
定一份高风险操作清单。参照附件 2 的说法:哪些操作必须转交人来接管,哪些操作必须获得授权。删除文件、发送数据、修改系统配置、交易支付,通常是第一批。
给“停止”做一次实测。不要看有没有这个按钮,而是真的按一次:它是否在预期时间内停止?有没有残留的后台进程?关联的凭证和第三方授权是否被撤销?附件 2 在“停用下线”一节专门写了这件事——服务残留、权限与凭证遗留、数据留存不当。绝大多数企业从没测过。
把日志变成证据。全量记录、防篡改、明确留存期限。日志的价值不在于“有”,而在于出事后能不能作为可采信的依据。
三年前,“失控”还是一个关于未来的词。三年后,它变成了三条可以逐项核对的检查项。
框架用一年时间重写这条原则,其实只在说一件事:真正的可控,不是相信AI不会失控,而是当它失控时,你还有办法。
旧假设重述:
模型有安全护栏 ≠ 智能体的行为有边界
设置了关闭开关 ≠ 关得掉
上线前测过 ≠ 运行时安全
日志有记录 ≠ 行为可追溯
智能体能干活 ≠ 有人对它的行为负责
人工审批存在 ≠ 关键操作真的被拦住了
最后,还是那三个问题。它们在2.0时代是一种提醒,在3.0时代已经是一道必答题:
我们的智能体依赖谁?
我们凭什么相信它不会越界?
如果它越界了,我们还有没有第二道独立防线?
关于紫羚数智
紫羚数智(GAZELLIO.AI),隶属于上海紫羚数字科技有限公司旗下AI品牌,是企业级AI原生基础设施领域先行者。依托核心AI技术,公司较早布局企业级智能体操作系统赛道,自研Agent OS,并于2025年7月落地四川财政厅项目,打造国内政务领域较早一批Agent OS 生产级标杆案例;构建企业级Agent OS 与AI软件工厂,为金融行业客户、政府及企事业单位、大型产业企业提供全链路智能化解决方案。
核心产品:G.AIOS(智能体操作系统)、G.AIPipe(软件工厂)、AI垂直应用、AI数智科管平台、智算一体机、FDE(Forward Deployed Engineer,前沿部署工程师)咨询服务。
公司拥有70多项自主知识产权,参与20多项国家标准编制;已服务300多家各行业头部客户,代表客户包括上交所、深交所、上海财政局、四川财政厅、中国银行、农业银行、太平洋保险、平安银行、兴业证券、中通快递、德邦物流、美团、隆基绿能、陕重汽、中国重汽、一汽丰田等。期待与各方携手,把握AI变革机遇,赋能客户实现数智化高质量发展。
本系列相关
上一篇:《三年三版:从1.0到3.0,AI安全治理框架到底改了什么?》
下一篇:(敬请期待)