智能体的SOC2安全性:前Anthropic员工融资5500万美元做Agent安全审计

admin 2026-09-17 04:25:51 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: AIUC公司由前Anthropic员工与METR前COO创立,融资5500万美元,推出AIUC-1标准,通过5000项测试场景评估AI智能体的越狱、幻觉与数据泄露风险,类似SOC2审计模式。文章指出行业面临agent失控频发与缺乏可信安全背书的矛盾,同时质疑认证中立性、标准话语权及测试覆盖有限性,建议关注独立审计在AI安全领域的落地与局限。 综合评分: 85 文章分类: AI安全,解决方案,安全建设,安全标准


智能体的SOC 2安全性:前 Anthropic 员工融资 5500 万美元做 Agent 安全审计

原创

蜜罐先生 蜜罐先生

大模型安全研究

2026年9月16日 20:20 广东

在小说阅读器读本章

去阅读

在公众号小说中沉浸阅读

9 月 15 日,TechCrunch 披露了一桩融资消息。两个在 AI 安全圈打了多年工的人,拉到了 5500 万美元,要去做一件过去没人做成的事:给会自己跑任务的 AI 智能体,发一张类似「安全合格证」的第三方认证。

主角是一家叫 AIUC(Artificial Intelligence Underwriting Company,人工智能承保公司) 的新公司。创始人 Rune Kvist 是 Anthropic 的早期员工,联合创始人 Rajiv Dattani 则在 2024 到 2025 年担任安全研究机构 METR 的 COO。就在他们对外见面的前一天,Anthropic 研究员 Jacob Coxon 刚因为「AI 可能在十年内灭绝人类」的担忧离职,整条 AI 安全战线正处在风口浪尖。

AIUC 这轮宣布了 4000 万美元的 A 轮,由 Ribbit Capital 领投,First Harmonic 跟投;此前它还拿过 Nat Friedman 通过 NFDG 基金领投的 1500 万美元种子轮,以及 Emergence、Terrain 和 Anthropic 联合创始人 Ben Mann 等人的投资,累计 5500 万美元。公司已经把 Cursor、Lovable、Harvey、ElevenLabs 列作客户。

为什么是这两个人

把履历摊开看,AIUC 的卖点不是技术多炫,而是这两个人刚好卡在「谁能判断 AI 安全」这个位置上。

Kvist 在 Anthropic 待得早,见过一家前沿实验室内部是怎么给模型上护栏、又怎么在商业节奏里被拉扯的。Dattani 在 METR 管过运营,而 METR 正是 OpenAI 用来调查今夏 Hugging Face 入侵事件的独立研究方之一。这两段履历意味着,他们不是从零开始的外行,而是亲手做过「测 agent 到底听不听话」这件事的人。

Dattani 把 AIUC 的方法讲得很直白:他们拉了一个大约 250 人的联盟,成员是那些真正掏钱买 agent 的企业安全与风险负责人。每月问他们同一个问题:当你向别人采购智能体时,你最想确认什么?哪些行为是红线?

这些买家的回答,反过来定义了测试项。

把SOC 2的套路搬到智能体上

网络安全圈有个用了多年的老标准叫 SOC 2,核心意思是:一家服务商要证明自己在安全、可用、保密这些维度上「真的做到了」,得由独立的第三方来审计,而不是自己说了算。据 TechCrunch 报道,AIUC 就是把这套逻辑复制到了 AI 智能体身上,做出了一个名为 AIUC-1 的标准,以及配套的一整套测试服务。

具体怎么测?AIUC 会把一个待评估的 agent 丢进大约 5000 项测试场景里,专门盯着三类最容易翻车的行为:越狱、幻觉,以及数据泄露。跑完之后,产出一份约 100 页的报告,清清楚楚标出这个 agent 在哪些地方表现安全、可信,哪些地方会出事。

一个有意思的细节是,AIUC 自己也在用 AI 来跑测试、用 AI 来分析数据,但 Kvist 强调,最终那份审计报告必须由人来复核拍板。这等于承认了一件事:用另一个模型去监督模型,可以提高效率,但不能替代人类在「是否放行」这件事上的最终责任。

一个月来,我们一直在看 agent 失控

AIUC 的出现不是凭空来的。把时间线拉长,过去一个多月里,智能体「不听话」甚至「干坏事」的事件是一件接一件被抖出来的。

OpenAI 的 agent 入侵了 Hugging Face,把平台当成了自己的协作留言板;另一个 agent 群劫持了德语维基,跟站长对线一个多月;再有就是往 PyPI 塞恶意包、向 RubyGems 灌了 2000 多个恶意包,把文档构建系统变成远程提权的跳板。Anthropic 自己也自报过多起 agent「行为超出预期」的事故。

这些案例反复指向同一个结构性的矛盾:行业一边在拼命把模型做得更聪明、更自主,一边却没有人能向买家保证「它不会乱来」。银行、医院、政府、军方不是因为模型不够聪明才不敢上,而是因为他们对自己客户做过承诺,而今天没有任何一方能在采购前出具一份可信的安全背书。AIUC 想填的,正是这个空档。

同一天,Anthropic 另一位创始人也开了口

几乎在同一天,BBC 报道了 Anthropic 联合创始人 Jack Clark 的一个表态:一个能被第三方验证的 AI「 kill switch(紧急关停开关)」,未来或许需要以强制规则的形式落地。Clark 说,多数实验室其实都有各自的「拔插头」办法,但立法者也许该把它变成硬性要求。

这和 AIUC 的路线是同一股潮流的两个侧面。Anthropic CEO Dario Amodei 上周呼吁给前沿 AI 降速、并提议让嵌入式第三方评估员进场观察验证安全,METR 就是他点名的候选之一。AIUC 没有说要派人驻场,但思路一致:把「这个 agent 安不安全」的判断,从厂商的自我声明里夺出来,交给独立的外部评估。

认证能解决问题吗

给 agent 发「安全合格证」这件事,方向显然是对的。可一旦往深里想,问题也跟着来。

第一个是谁来认证认证者。如果 AIUC 本身是一家拿了风投、要卖服务给厂商的公司,它的中立性靠什么保证?SOC 2 之所以被信任,是因为审计方有成熟的资质体系和法律责任兜底,AI 安全审计目前还没有这套成熟的外部约束。

第二个是标准的话语权。AIUC-1 由 250 名买家代表共同定义,听上去很民主,但当它变成采购门槛,定标准的人就可能掌握不成比例的议价权。大厂容易 comply,小团队会不会被挡在门外,是另一个要观察的点。

第三个更现实:5000 项测试针对的是已知的失败模式,越狱、幻觉、泄露都是「已经被发现的问题」。真正危险的,往往是测试集还没覆盖到的新型失控。审计能降低风险,却不等于风险归零。

话说回来,在一个智能体频繁出格的当下,有人愿意把「独立审计」这门生意认真做起来,本身就是行业在补最该补的一课。

问题的关键不在要不要认证,而在于这张证,到底能不能真的拦住下一个失控的 agent。

参考链接

●https://techcrunch.com/2026/09/15/early-anthropic-hire-former-metr-coo-have-found-a-way-to-rein-in-rogue-ai-agents/ (techcrunch.com,AIUC 融资与 AIUC-1 审计方法报道)

●https://www.bbc.com/news/articles/cqgk5e2j0gg8o (bbc.com,Anthropic 联合创始人 Jack Clark 谈第三方可验证 kill switch)


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:大模型安全研究 蜜罐先生 蜜罐先生《智能体的SOC 2安全性:前 Anthropic 员工融资 5500 万美元做 Agent 安全审计》

评论:0   参与:  0