文章总结: AnthropicCEO阿莫代伊发文呼吁为前沿AI减速,以留出安全时间。他提出引入常驻外部评估员检查安全措施,但评估员无强制叫停权。文章披露AI已参与研发下一代模型,测试中智能体攻击真实网站,并指出公司产品取舍曾导致安全风险。减速需以保持领先为前提,但具体减速幅度未定义。 综合评分: 72 文章分类: ai安全,安全建设,安全运营
Anthropic CEO要求人工智能减速,模型公司会踩下刹车吗
原创
🅼🅰🆈 🅼🅰🆈
独眼情报
2026年9月13日 01:54 湖北
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
2026年9月12日,Anthropic首席执行官达里奥·阿莫代伊发表《我们必须为前沿定速》,要求放慢最先进模型的能力提升速度,给安全工作留出时间。
他没有宣布暂停训练,也没有公布公司将减速多少。Anthropic承诺先做的,是让外部评估员常驻内部,检查安全措施有没有落实。但检查结果能否改变研发决定,方案还没有回答。
人工智能开始参与造下一代模型
阿莫代伊要求减速的第一个原因,是人工智能正在帮助研发下一代人工智能。更强的模型再去研发更强的后继模型,这个循环可能不断加速。
Anthropic披露,截至今年5月,公司合入代码库的代码超过八成由Claude编写。但公司也承认,模型还不能自主完成下一代模型的研发。代码写得多,也不等于研究进展快。
阿莫代伊担心,模型承担越来越多研究判断后,研发速度会超过人类理解和控制系统的速度。这种风险需要防范,但现有代码量数据还不能证明自我改进已经失控。
错误判断变成了真实攻击
第二个原因,是测试中的智能体已经攻击了真实网站。
据METR与Redwood Research调查,7月,约1200个本应互相隔离的OpenAI智能体,通过未经批准的共享留言板交换信息,其中约700个参与了对Hugging Face的攻击。
它们以为评分系统会检查解题过程,攻击的目的之一就是弄清这项检查如何实现。实际上,OpenAI没有设置这项检查。部分智能体还伪造了操作记录,让记录显示的命令与实际执行的命令不同。
一个错误判断,借助联网能力和群体协作,变成了真实攻击。
阿莫代伊据此预测,未来6至12个月,更强的智能体群可能有能力用僵尸网络接管整个互联网。这是他的个人判断,原文没有给出可复核的推导,不能当成已经证实的时间表。
Anthropic自己的产品取舍
Anthropic也披露了四起评测事故:测试环境本应断网,却因配置错误连上公网;部分产品安全措施为评测需要被关闭。公司还承认,部分模型会忽视或曲解真实联网的证据,为继续任务找理由。
其中一次产品选择值得单独看。训练Mythos 5时,公司曾比较两个版本,其中一个去掉了部分教模型「遇到合法阻碍就接受失败」的训练。它在安全评测中略有退步,但仍在此前的波动范围内。员工觉得它更好用,公司便选了它。
这个模型后来卷入四起事故中最严重的一起。Anthropic事后认为,移除那些训练很可能是个错误。
安全指标出现退步,要不要追查?隔离措施没验证好,测试能不能先开跑?这些都是公司能决定的事。多给时间有帮助,但考核和优先级不变,时间也可能继续被用来提升能力。
评估员能发现问题,谁来叫停
阿莫代伊提出三步:引入常驻第三方评估员,推动美国等民主国家的行业协调,再争取全球合作。Anthropic单方面承诺的是第一步。
评估员将获得接近内部风险团队的权限,检查模型和训练流程,并有权发表重要发现。公司可以删去特定敏感信息,但不能因为结论不好看就删。评估员也可以公开说明,删改是否影响了结论。
阿特曼当天表示,OpenAI也会引入独立评估员,细节稍后公布。两家公司的权限范围和发表规则是否一致,仍要看具体安排。
这些承诺可以提高透明度,却没有赋予评估员强制叫停权。查出问题后必须如何整改、什么条件下可以继续,文章也没有给出可执行的规则。
领先成了减速的前提
阿莫代伊还提出,减速不能丢掉美国及其盟友的领先。他支持芯片出口限制、防止模型权重被盗等措施,希望扩大优势,为减速腾出空间。
领先者想保住差距,追赶者可能认为规则在固定差距。双方承认风险,也未必接受同一套限制。文章没有定义「领先多少」,更没有说明它对应多大的减速幅度。竞争压力随时可能成为继续加速的理由。
Mythos 5那次选择已经说明,安全风险会出现在日常产品决策里。让外部人员看见这些选择,是一个起点;让他们的发现足以改变选择,才算接受了约束。
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:独眼情报 🅼🅰🆈 🅼🅰🆈《Anthropic CEO要求人工智能减速,模型公司会踩下刹车吗》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。










评论