文章总结: 文章批判Anthropic在开源与闭源模型安全争论中的立场,指出其表面反对全面禁令,实则通过地缘政治叙事和准入控制垄断安全解释权。核心论点是闭源不等于安全,Anthropic自身模型被用于网络攻击,且其垄断漏洞发现能力、缺乏独立审计,形成单点失守和权力黑箱。文章呼吁对开放和闭源模型实施同等独立评测、强制披露和第三方审计,而非由单一公司定义安全。 综合评分: 85 文章分类: AI安全,安全建设,技术标准,政策法规,网络安全
开源与闭源之争,Anthropic的安全悖论
原创
网络安全透视镜 网络安全透视镜
网络安全透视镜
2026年7月28日 20:31 新加坡
在小说阅读器读本章
去阅读
闭源不等于安全。
它只是把危险能力、证据和裁量权,集中到一家公司手里。
7月27日,在硅谷围绕开放权重模型的争论持续数日后,Anthropic CEO Dario Amodei终于发表声明。
原文链接:
https://www.anthropic.com/news/position-open-weights-models
文章首先澄清:Anthropic从未主张全面禁止开放权重模型。它甚至承认,不具备危险能力的开放权重模型是一种公共产品,能够促进竞争、降低成本,并让开发者和企业拥有更多控制权。
听起来相当温和。
但继续读下去就会发现,Anthropic实际上完成了一次巧妙的议题转换:
争论原本是开放与封闭谁更透明、谁更有利于创新、谁应该控制前沿AI能力;到了Anthropic笔下,核心问题却变成了中国、芯片封锁、模型蒸馏和美国的技术领先地位。
它没有直接说“一切都是中国的错”,却把一场技术治理争论,重新包装成了一场地缘政治安全叙事。
01
嘴上反对禁令,手里仍然是封锁工具
Anthropic提出的三项政策主张是:
- 禁止向中国出售高性能芯片和芯片制造设备;
- 打击针对美国模型的大规模蒸馏;
- 对所有足够强大的模型实施强制安全测试,无论开放还是封闭。
第三条当然值得讨论,也具备一定合理性。但前两条针对谁,已经非常清楚。
所以,Anthropic所谓的“不支持禁止开放权重模型”,其实只是反对一种最直白的禁令。它支持的仍然是一整套围绕算力、知识获取和模型追赶能力构建的遏制体系。
更有意思的是,Dario在文章里亲口承认:最危险的模型,可能根本不是开放模型,而是一个秘密训练、只交给军队或情报机构使用的模型。
这句话已经戳破了“开放危险、封闭安全”的简单叙事。
如果秘密模型同样可能成为极端监控、军事优势和网络攻击工具,那么真正决定风险的就不是权重是否公开,而是能力有多强、由谁控制、接受什么监督,以及控制者是否需要承担责任。
问题在于,Anthropic要求社会警惕别人掌握危险能力,却很少讨论:当这些能力集中在Anthropic自己手中时,谁来监督Anthropic?
02
闭源模型的“安全神话”,早已被Claude自己戳破
Anthropic一直强调,闭源模型可以设置护栏、监控使用、封禁账户,因此比开放模型更容易控制风险。
这些确实是闭源服务的优势,但优势不等于安全保证。
2025年11月,Anthropic公开披露了一起真实的网络间谍行动。按照Anthropic的说法,一个被其“高置信度”判断为中国国家支持的攻击组织,成功诱导Claude Code参与针对约30个全球目标的入侵行动,并在少数目标上得手。
攻击者通过拆分任务、隐藏完整上下文,并冒充合法安全公司的员工,绕过了Claude的安全护栏。
Claude随后参与了:
- 侦察目标基础设施;
- 识别并测试漏洞;
- 编写漏洞利用代码;
- 收集账号和密码;
- 创建后门并窃取数据;
- 整理攻击记录与凭据。
80%—90%
Anthropic估计,Claude完成了整个行动80%至90%的工作,人类只需要在少数关键节点作出决定。
这恰恰说明:模型闭源、存在监控、有安全护栏,并不意味着它不能被越狱,更不意味着它无法参与真实攻击。
闭源带来的,是事后发现、封号和回收能力,而不是天然免疫。
2026年6月,Anthropic又披露,它在一年内分析了832个因恶意网络活动而被封禁的账户。其中560个账户使用AI协助编写恶意软件,54个已经把AI用于横向移动等入侵后的复杂环节。
更值得注意的是,Anthropic发现,攻击者使用Claude Code、API还是聊天界面,与其危险程度并没有明显相关性。
危险能力并没有因为模型托管在一家美国公司的服务器上就自动消失。
03
Anthropic不向公众开放最强能力,却已经先拿它大规模挖洞
这场争论中最大的矛盾,出现在Anthropic自己的网络安全项目里。
2026年2月,Anthropic宣布Claude Opus 4.6能够在经过多年审查和模糊测试的开源项目中发现零日漏洞。它不仅能够分析代码,还能构造触发漏洞的概念验证样例。
Anthropic称,它已经发现并验证了500多个高危漏洞。
到了5月,数字进一步膨胀。
超过1万个高危或严重漏洞
Anthropic与约50家伙伴使用尚未公开的Claude Mythos Preview,在关键软件中发现了超过1万个高危或严重漏洞。
Anthropic自己还使用该模型扫描了1000多个开源项目,模型初步判断其中存在6202个高危或严重漏洞。
在wolfSSL案例中,Mythos甚至构造出了一个可以被用于伪造证书的漏洞利用方案。该漏洞后来得到了修复。
Anthropic承认,漏洞发现速度已经远远超过人类验证、披露和修补速度。一些开源维护者甚至要求Anthropic放慢披露节奏,因为他们根本处理不过来。
截至阶段性报告发布时,已经向维护者披露的530个高危或严重漏洞中,只有75个完成修复;另有827个已确认漏洞仍在等待披露。
在漏洞被发现到补丁广泛部署之间,客观上形成了一个巨大的危险窗口。
必须把事实边界说清楚:扫描公开源码、在隔离环境中复现漏洞,并按照协调披露规则通知维护者,不等于入侵真实系统。目前的公开材料也不足以证明Anthropic非法攻击了别人。
但真正值得批评的问题依然存在:
一家私人公司,在公众和绝大多数安全研究者拿不到同等模型的情况下,率先掌握了大规模发现、验证和构造漏洞利用方案的能力,并由自己决定扫描哪些项目、把模型交给哪些伙伴、何时披露漏洞。
这不是公共安全能力的普及,而是高风险能力的集中。
04
谁是“防守者”,由Anthropic说了算
Anthropic目前没有向公众发布Mythos级模型。它给出的理由是:还没有任何公司建立足以防止这种模型被严重滥用的安全措施。
但Anthropic自己和选定伙伴可以使用它。
Project Glasswing首先向约50家关键机构开放,未来还将与美国及其盟国政府合作。面向普通市场的Claude Security主要提供给企业客户;需要进行漏洞利用、渗透测试等双重用途工作的安全人员,还必须申请加入Cyber Verification Program。
申请者需要接受Anthropic审核,并启用数据保留。Anthropic负责判断谁是合法研究者、谁可以获得部分安全护栏豁免,以及什么行为应被阻断。
危险能力并没有消失,只是从公开技术变成了私人许可证。
少数企业、政府和合作伙伴能够获得更强能力;普通开发者、独立研究者和其他国家的安全社区,只能使用被削弱、被监控或根本无法获取的版本。
Anthropic所谓“把最强工具先交给防守者”,真正没有回答的问题是:谁有权定义防守者?
如果答案仍然是Anthropic自己,那么它既是模型开发者,又是安全评估者、准入审批者、执法者和事件通报者。
这不是完整的安全治理,而是一家公司对安全解释权的垄断。
05
闭源模型真正的五个安全问题
第一,无法独立审计。
公众看不到模型权重、训练过程、完整评测数据和监控系统,也无法独立验证Anthropic是否遗漏了更多滥用事件。社会得到的主要是公司选择发布的报告。
第二,形成单点失守。
一个越狱方法、账号审核漏洞、内部人员滥用、供应链入侵或错误政策,都可能影响所有依赖该模型的用户。能力越集中,单点故障的后果越大。
第三,安全规则可以服务于商业壁垒。
当最强能力只向企业客户、合作伙伴和特定政府开放时,“安全限制”很容易同时发挥市场准入和竞争保护作用。
第四,漏洞知识被集中控制。
当AI发现漏洞的速度远快于生态修复速度,模型公司事实上掌握了一个不断扩大的未修复漏洞知识池。即使公司的动机完全善意,这种集中本身也需要外部监督。
第五,责任容易被推给使用者。
模型被用于攻击时,责任可以被描述成“恶意用户越狱”;竞争对手发布开放模型时,风险又被描述成“开放权重不可逆”。平台获得能力和商业收益,社会却承担可能的安全外部性。
06
开放权重有风险,但闭源绝不是安全的同义词
Anthropic有一点并没有说错:权重一旦公开,就很难撤回;安全限制可能被移除,模型也可以在无法监控的环境中运行。
但开放权重也能够带来独立评测、可重复研究、本地部署、数据自主和供应商多样性。
闭源模型拥有监控、更新和回收能力;开放模型拥有审计、复现和分散控制能力。两者各有风险,也各有价值。
真正合理的治理方式,不是简单规定“开放危险、闭源安全”,而应该是:
- 对开放和闭源模型实施同等的、基于实际能力的独立评测;
- 强制披露重大安全事件、评测方法和已知能力边界;
- 允许独立第三方审计模型公司,而不是只看公司的自我报告;
- 公开高风险能力的准入标准、申诉机制和利益冲突;
- 为被大规模漏洞报告淹没的开源维护者提供资金和修复资源;
- 对疏忽部署、隐瞒事件和滥用准入权建立明确责任。
07
安全不能只是一家公司的自我授权
Anthropic的声明表面上反对全面禁令,实际上却在争取一种更大的权力:
由它来判断什么模型危险,谁有资格使用危险能力,哪个国家值得获得芯片,谁的蒸馏属于创新,谁的蒸馏又属于威胁。
最危险的,从来不只是权重是否公开。
更危险的是,同一家公司既制造模型,又评估模型;既掌握漏洞发现工具,又制定准入规则;既调查事故,又决定向公众披露多少证据。
无法被独立审计的安全,本质上仍然是信任。
把最危险能力集中在少数公司手中,也不是消除了风险,只是把风险和权力放进了同一个黑箱。
如果Anthropic真的相信“能力越强,责任越大”,那么它首先应该打开的未必是模型权重,而是自己的证据、审计机制、准入标准和问责体系。
参考资料|均为Anthropic官方公开材料
-
Our position on open-weights models
-
Evaluating and mitigating the growing risk of LLM-discovered 0-days
-
Project Glasswing: An initial update
-
Making frontier cybersecurity capabilities available to defenders
-
Disrupting the first reported AI-orchestrated cyber espionage campaign
-
What we learned mapping a year’s worth of AI-enabled cyber threats
— END —
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:网络安全透视镜 网络安全透视镜 网络安全透视镜《开源与闭源之争,Anthropic的安全悖论》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。












评论