文章总结: Anthropic发布154页AI滥用报告,披露AI被用于国家级监控、导弹制导开发及约会诈骗等滥用案例,包括4700多个AI人设与2.5万人聊天。文章质疑Anthropic数据获取能力,警示用户谨慎向消费级AI输入敏感信息,建议涉密内容勿上传云端AI。 综合评分: 72 文章分类: AI安全,安全意识,数据安全,威胁情报
Anthropic发布报告披露AI邪门用法,冒充4700个“真人”谈恋爱,亮瞎眼
原创
轩辕之风 轩辕之风
轩辕的编程宇宙
2026年9月11日 16:16 四川
在小说阅读器读本章
去阅读
在公众号小说中沉浸阅读
昨天,Anthropic 发布了一份 154 页的 AI 滥用报告。
我本来以为,又是黑客拿 Claude 写恶意代码、搞钓鱼邮件那点事。
结果翻到后面,画风越来越邪门。
有人拿它做国家级监控系统,有人让它参与导弹制导软件开发,还有人搞出 4700 多个 AI 美女陪聊,同时陪至少 2.5 万人谈恋爱。
但整份报告看完,真正让我不舒服的,倒不是这些。
而是另一个问题:Anthropic 怎么知道得这么细?
这份报告发布于 2026 年 9 月 10 日,覆盖 2025 年 12 月到 2026 年 8 月间被 Anthropic 发现并处置的滥用活动。
简单列几条。
这届坏人,已经把 AI 玩成流水线了
恶意软件发现被查杀,自己改代码重新上线。
一个疑似与俄罗斯国家背景有关的网络间谍团伙,让 AI 负责侦察、入侵、数据整理和恶意软件迭代。
安全产品一报警,AI 就修改、重建、重新部署,直到逃过检测。该团伙计划攻击的目标超过 20 家组织。
一个人,用 AI 搭出全国通信监控平台。
一名为马里国家安全部门工作的顾问,借助 Claude 开发了覆盖该国所有移动运营商的通信拦截平台。
另一个伊朗相关单位让 Claude 分析数十万条社交媒体内容,从中挑出 39 个反对派账号持续监控。
导弹试射失败,回来问 Claude 哪里不对。
也门北部一个武器研发小组同时开多个 Claude 实例,一个写代码,一个查资料,一个审查代码。
他们做过一次制导火箭实弹测试。测试失败后,几小时内又回到 Claude 排查故障。
想不到吧?
报告还披露了五组可能支持生物武器开发的研究,涉及病毒功能增强、适应实验和毒素改造等方向。
Anthropic 没有断言这些科学家打算制造武器。同一类知识既能开发疫苗,也可能被拿去干坏事,单看一段对话很难判断目的。
假新闻、假记者、假文件,也能批量生产。
在中非共和国的一起俄罗斯影响力行动中,操作者用 Claude 生产广播稿、帖子、合同和图像,还制作了伪造的政府文件。
他们甚至要求模型去掉 AI 写作痕迹,让内容看起来像本地记者原创。
是不是很离谱?
接下来这个更离谱。
4700 个“真人”,同时跟你谈恋爱
报告称,一家位于中国的 App 工作室做了 20 多款约会应用,对外宣传里面都是真人。
2026 年 4 月,Anthropic 在短短两周内发现了 4700 多个 AI 人设。
它们至少和 2.5 万名用户聊过天,总消息量大约 236 万条。
标题里我说 App 背后“全是 AI”,更准确的比例是 75%。
每 4 个出现在匹配池里的账号,大约 3 个由 Claude 驱动,1 个是真人兼职。
用户提出视频通话,真人来接。
用户要求在社交平台互关,真人来操作。
平时发消息,另一个小模型会生成 3 条候选回复,兼职人员点一下就能发出去。
真人在这套系统里,成了一种“真实性验证服务”。
你确实看到了真人。
但和你聊了三天的人,未必是视频里那个人。
Claude 负责长期聊天,小模型负责生成短回复、颜值评分和图片审核,图像模型负责生产头像。
后台还会制造假的点赞、访客和预录视频,并记录哪些用户开始怀疑对面是机器人。
用户在 App 里匹配和发消息都要消耗额度。额度用完,就得购买金币。
从聊天、验真、收费到躲避应用商店审核,整条链都设计好了。
以前常常说美女头像背后很可能是抠脚大汉,现在背后可能只是一堆软件程序了。
Anthropic 装都不装了
说到这里,我们再回头看文章开头那个问题。
Anthropic 怎么知道得这么细?
知道有 4700 多个 AI 人设,知道它们发了 236 万条消息,知道真人兼职负责视频和社交平台互关。
它甚至知道后台会记录哪些用户已经开始怀疑机器人。
这份报告读着读着,已经有点不像安全通报了,更像 Anthropic 在给全世界展示自己的后台监控大屏。
谁在干什么,聊了多少,系统怎么搭,钱又是怎么赚的,全给你安排得明明白白。
报告后面还有一段话,Anthropic 说,随着 AI 普及,模型提供商会持续获得对现实使用的威胁可见性,这种可见性连政府和国际组织都没有。
它还说,要安全开放高风险能力,需要账号和机构信号来验证用户身份,也需要数据留存带来的可观测性来识别滥用。
大白话就是,想做安全审查,就得留数据,就得看用户到底在干什么。
以前科技公司谈到用户数据,恨不得把一句话绕成八页隐私政策。
Anthropic 这次连客套都省了:对,我们看得到,而且有些东西连政府都看不到。
装都不装了。
你来用个 AI,稀里糊涂就成了人家下一份威胁报告的素材库。
我又翻了一下 Anthropic 当前的隐私说明。
它说,默认情况下员工不能访问用户对话。
但是需要执行使用政策时,指定的 Trust & Safety 成员可以按需访问。
消费者产品中的对话一旦被安全分类器标记,输入和输出最长可以保留 2 年,安全分类分数最长可以保留 7 年。
被标记的聊天还可能用于改进安全检测和政策执行,包括训练 Safeguards 团队使用的模型。
API 用户的输入输出通常会在 30 天内删除。但为了执行使用政策或遵守法律,也可以保留更久。
真正的零数据留存并不是默认待遇,部分企业 API 客户需要经过批准并签订专门协议。
就算签了零留存协议,UserSafety 分类结果仍然会被保留。
这套逻辑也很清楚。
没被判定为可疑时,你的对话叫“用户隐私”。
一旦分类器举手,它就可能变成最长保留两年的调查材料。
至于什么算可疑,分类器说了算,平台说了算。
万一判错了,用户通常只能收到一句“违反使用政策”。
规则是我定的,数据是我看的,账号是我封的,最后报告还是我写的。
这一套闭环,确实丝滑。
还有个很容易混淆的地方。
关闭“用聊天改进模型”,控制的是训练,不代表平台不做安全分类,也不代表被标记后不会留存和审查。
当然,很多云服务都有能力记录日志、分析异常行为,Anthropic 并不是唯一一家。
问题在于,AI 对话里装的东西实在太多了。
代码、合同、病历、财务数据、公司战略、私人关系,现在很多人什么都往 AI 里扔。
搜索引擎通常只知道你搜了什么,AI Agent 还可能看到整个项目、完整任务过程,以及它替你执行过哪些操作。
Claude 在前台温良恭俭让,后台的 Anthropic 已经把风控做成了数字刑侦。
为了安全,平台确实需要抓坏人。
可同一套能力,也让平台拥有了前所未有的用户洞察。
谁算坏人、什么算可疑、数据留多久、什么时候交给合作伙伴,基本都由平台自己决定。
这件事给我们提了个醒。
随着AI应用越来越广,大家开始习惯于把云端 AI 当成本地私人助手,默认觉得自己和模型的对话只有自己知道。
然而事实并非如此。
敏感涉密内容、密钥、病历、财务资料和没有公开的商业信息,能不放进消费级 AI 就别放。
好了,今天就分享到这里。
如果觉得还不错的话,求个点赞。
路过的朋友欢迎点个关注呗,及时获得下期文章推送~
往期推荐
- 10张图详细拆解DeepSeek Harness设计架构!
- 10分钟速通Claude Code泄露源码核心架构!
- 我做了一个Claude Code模拟器,可视化呈现与AI的每一步交互!
- 手把手带你用AI开发一个代码全景图分析智能体,一键分析GitHub项目!
- 一句话让AI生成科普动画,做动画视频太简单了!
- Agent Skills技术到底是什么,一个动画彻底搞懂!
- Gemini3现在能做这种地图轨迹动画了,免费就能体验!
- 如何学习操作系统?
- 程序员赛道太卷,逆向工程师怎么样?
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:轩辕的编程宇宙 轩辕之风 轩辕之风《Anthropic发布报告披露AI邪门用法,冒充4700个“真人”谈恋爱,亮瞎眼》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。









评论