《2026新加坡共识:全球人工智能安全研究优先事项》

admin 2026-09-01 04:31:22 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: 《2026新加坡共识》发布全球AI安全研究优先事项,将研究框架扩展为风险评估、可信安全可靠系统开发、控制与干预、社会韧性四大方向。报告强调事前防范不足,需提升社会韧性以应对AI误用和故障事件。提出智能体风险管理十项原则,涵盖最小权限、可追踪身份、可审计性等,要求从设计阶段建立安全机制,确保AI能力增长与安全能力提升同步。 综合评分: 85 文章分类: ai安全,安全建设,安全运营


《2026新加坡共识:全球人工智能安全研究优先事项》

赛博研究院 赛博研究院

赛博研究院

2026年8月31日 18:59 上海

在小说阅读器读本章

去阅读

在公众号小说中沉浸阅读

近日,《2026新加坡共识:全球人工智能安全研究优先事项》(The 2026 Singapore Consensus on Global AI Safety Research Priorities)正式发布。报告指出一个日益突出的矛盾:AI的能力、落地和商业化速度持续加快,但风险测量、管理与应对能力尚未同步跟上。

与2025年版相比,新版研究框架从三个方面扩展为四个:风险评估、可信安全可靠系统开发、控制与干预、社会韧性。前三个方向以往已有,“社会韧性”是新独立出来的。过去一年,AI误用和故障事件增多。

报告认为,仅靠事前防范已不够,社会还需具备发现问题、限制影响和快速恢复的能力。事故无法完全避免,关键在于把损失控制在可承受范围内。

先解决”风险看不清”的问题

报告把风险评估放在安全体系的起点。它要回答三个具体问题:危害有多严重、发生概率有多高、是否已经越过了必须行动的阈值。很多开发和部署决策都建立在评估结果之上,评估能力如何,直接影响后续工作的走向。

当前的评估有明显局限。AI基准测试不断改进,也可能被模型“针对性适应”,一些模型已经能识别自己是否处于测试环境。实验室测试和真实任务之间存在差距,基准成绩未必能预测现实表现。因此,需要开发更贴近实际场景的评估方法。

高风险能力的测试受到特别重视。AI在网络攻击、生物、化学、心理操纵、欺骗和高度自主等方面的潜在能力都需要评估,还要考察模型“会不会用这些能力”。目前这类评估尚不成熟。模型能力高度依赖具体环境和任务,一些意外能力往往在开发完成甚至部署之后才暴露。未来既要检测已经表现出的能力,也要找出那些被压制或隐藏的危险能力,并逐步建立风险是否不可接受的实际阈值。

报告还提出,不能只研究已经发生的风险,也要研究尚未发生的风险。AI的影响具有扩散性,很多后果需要较长时间才会显现。可以结合实际使用数据、趋势分析、风险建模、现场测试和用户研究来做预测。对社会影响较大的问题,先做小规模受控测试,再逐步扩大。

关于“失控风险”,报告将其定义为高级AI系统逐渐脱离人类控制,且人类没有明确的重新控制路径。相关研究目前更多属于预测性质,但可以围绕自主复制、抵抗关闭、自我扩散和辅助系统自我改进等前置能力展开观察。现有系统尚不足以证明真正意义上的失控已经出现,但这些信号值得持续关注。

从”让模型表现正确”转向”让系统从设计起就安全”

风险评估之后,重点转向AI系统本身。思路与传统安全工程一致:先确定系统应该怎样运行,再设计实现,最后验证是否照要求运行。报告把这一过程分为“规格与验证”“设计与实现”“验证”几个环节。核心观点是:可信、安全的系统必须从开发阶段就考虑安全,不能等上线后再补课。

一个关键问题是如何准确描述AI“应该怎么做”。单纯设定目标,不等于模型会按人类真正想要的方式行动。如果系统只追求某个表面指标,就可能出现“奖励投机”等意外行为。

研究需要把人的真实目标、约束条件和社会需求,转化为AI能理解和执行的要求。不同人群有不同的价值判断,系统如何处理多方意见、法律要求和伦理原则,也是规范设计绕不开的难题。

数据和训练阶段同样是安全的重要环节。预训练是建立核心知识表示的关键阶段,对训练数据做筛选和管理,是限制危险能力和不良倾向的有效手段。网络规模的数据集可能混有有害、恶意甚至违法内容,数据筛选直接影响模型最终的能力和行为。报告也承认,预训练数据治理存在成本高、容易出错、反馈周期长的困难。

开放权重模型今年受到更高关注。这类模型与前沿闭源模型的能力差距正在缩小,部分能力的差距可能只有3到12个月。权重一旦公开,后续使用者就能修改模型,原有的安全措施更容易被破坏。因此开放权重模型不能照搬闭源模型的方法,需要研究新的模型级防护手段、危险能力测试,以及模型被修改后仍能保持安全约束的办法。

AI系统还必须接受更严格的对抗测试。目前的“越狱”手段已经能让部分先进模型突破安全限制。多智能体环境下的测试更难,因为多个智能体之间的互动可能产生单个系统发现不了的新风险。未来需要把自动攻击、人工红队测试、模拟实验和实际环境测试结合起来,持续检验系统在不同环境中的稳定性。

AI越来越会”行动”,控制问题更突出

控制能力需要贯穿AI运行的全过程。部署之后,系统要通过持续监控发现异常行为,必要时进行干预。传统手段包括输入输出过滤、事件记录和异常检测。但监控系统本身也可能被攻击,如果开发者长期让模型以监控结果作为优化目标,监控效果反而会被削弱。

AI安全不能只靠模型“自己遵守规则”,还要建立外部控制措施。报告讨论了硬件支持的控制机制,比如利用可信硬件生成可信证明,让第三方在不接触敏感信息的前提下完成验证。这类机制有助于在不同机构甚至不同国家之间核实安全承诺。

报告还强调,人类不能因为增加了AI监督系统就退出监督。前沿企业越来越多地用AI监督AI,包括用AI做安全评估。

长此以往,人类可能越来越难判断整个监督体系本身是否可靠。因此,未来需要研究如何验证“用于监督其他AI的AI”是否值得信任,并建立更可靠的人机结合监督方式。

社会韧性:今年最重要的新变化

2026版最明显的框架变化,是把社会韧性单独列为第四大支柱。过去一年的AI误用和故障事件表明,只靠“事前防止事故”已经不够。即使建好了安全测试和防护措施,社会仍然需要具备发现问题、限制影响、快速恢复的能力。

社会韧性首先意味着更好地观察AI生态。外部用户能看到的AI部署不一定最重要,企业内部使用AI同样值得关注。一些模型已经被用于分析敏感数据、用户画像、自动化研究甚至递归式改进。这些内部部署可能缺乏外部监督,也可能让开发者自己都越来越难理解内部安全体系如何运作。

因此,需要建立新的指标,衡量AI在内部研发中的使用程度、速度及其影响。

云计算和硬件基础设施是重要的观察入口。通过观察计算资源的使用和分配,可以更好地了解谁在用算力、用来做什么、风险如何变化。这类机制未来还可以用于支持合规验证,在特定条件下帮助不同国家和机构核实AI相关承诺。

用户监测是另一项重要能力。监测AI服务的使用情况,有助于识别恶意使用者和可能受伤害的脆弱用户。但过度监控可能妨碍正常的红队测试,攻击者也可能用多账户等手段逃避检测。未来需要更精细的监测方法,并与风险管理结合。

智能体风险管理的十项基础原则

伴随报告发布的还有《代理风险管理配套报告》,提出了智能体风险管理的十项基础原则:最小权限、可追踪身份、可审计性、经过验证的部署、对抗韧性、多智能体稳定性、运行时保障、可中断性、可理解性、人工监督。

这些原则的成熟度不一,部分已有较成熟的技术工具,多智能体安全和智能体供应链方面仍有待研究。

最小权限是基础。智能体的权限应围绕当前任务设定,而非长期保有超出需求的能力;操作超出范围需再次授权。部署方应避免给予过高权限,云平台应提供隔离的运行环境。

可追踪身份用于明确责任主体。多智能体环境下,需要建立唯一身份标识,记录委派链,做好凭证管理和认证。

可审计性要求完整记录行动,建立防篡改日志,结构化记录工具调用、参数和输出。

经过验证的部署要求智能体不能仅凭实验室测试就进入高风险环境,应做能力测试,按风险设门槛、分阶段上线。

对抗韧性方面,测试要覆盖工具调用、编排逻辑、供应链问题及其他智能体攻击。

多智能体稳定性是一个容易被忽视的问题。一个智能体单独看是安全的,不代表多个智能体连接起来仍然安全。智能体之间可能出现协调失败、错误传播、反馈循环和级联故障。多个系统共享同一模型、工具或基础设施时,一个局部问题可能向其他系统扩散。开发者要提前规定智能体之间如何委派任务、共享上下文,分析错误如何在系统中传播和积累。部署方要测试智能体组合之后的行为,不能因为每个智能体单独测试都合格就忽略组合后的风险。社会对真实多智能体系统的行为知之甚少,需要发展智能体身份、信誉系统和新的监测机制。

运行时保障要求系统持续判断智能体是否偏离正常状态,通过验证行为基线、加强会话隔离和记忆保护来实现。长期运行形成的记忆和上下文也可能带来安全问题,需对内存访问和写入设置控制。

可中断性确保出问题时能及时叫停。人工无法逐个批准每个操作,但应能在运行中暂停、调整、终止甚至撤销行动,且智能体自身不能修改这些机制。

可理解性要求提供解释计划、工具选择和中间步骤的界面,让人看得懂智能体的决策逻辑。

人工监督需按任务风险、可逆性和敏感程度设置不同介入点,包括高风险操作前的审批、运行中的监督、批量检查和AI辅助监督,形成逐步授权机制,而不是一开始就给予最大权限。

这些原则共同构成了智能体风险管理的完整框架。

当AI从“回答问题”走向“自主行动”,当AI从单个模型进入组织、云平台、网络和多智能体环境,安全体系还能不能跟得上?

企业要想答对上述问题,必须继续加强风险评估、系统安全、运行时控制和社会韧性。越是高自主、高能力的系统,越需要在设计阶段就建立权限、身份、审计、可中断和人工监督机制。只有这样,AI能力的快速增长,才有可能与安全能力的提升同步进行。

文章参考来源|新加坡资讯通信媒体发展局、互联网公开信息

赛博研究院简介

上海赛博网络安全产业创新研究院(简称赛博研究院),是上海市级民办非企业机构,成立至今,赛博研究院秉持战略、管理和技术的综合服务模式、致力于成为面向数字经济时代的战略科技智库、服务数据要素市场的专业咨询机构和汇聚数智安全技术的协同创新平台。

赛博研究院立足上海服务全国,是包括上海市委网信办、上海市通管局、上海市经信委、上海市数据局等单位的专业支撑机构,同时承担上海人工智能产业安全专家委员会秘书长单位、上海“浦江护航”数据安全工作委员会秘书长单位、上海数据安全协同创新实验室发起单位等重要功能,并组织“浦江护航”数据安全上海论坛、世界人工智能大会安全高端对话等一系列重要专业会议。

欢迎联络咨询:

邮件:[email protected];

电话:021-61432693。


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:赛博研究院 赛博研究院 赛博研究院《《2026新加坡共识:全球人工智能安全研究优先事项》》

评论:0   参与:  0