文章总结: ShieldFont是一种利用字体连字特性对抗AI爬虫的新技术,能在不改变人类阅读体验的前提下,将网页源码中的单词替换为语义错乱的词汇,使爬虫抓取到被投毒的数据。测试显示超过90%的页面被爬虫拒收,但存在影响搜索引擎和屏幕阅读器等副作用。该技术代表数据投毒成为防御手段的趋势,提醒模型方需加强语料污染检测。 综合评分: 86 文章分类: AI安全,数据安全,WEB安全,安全意识,其他
ShieldFont:用新字体对抗AI,网页智能体都小心了!
原创
蜜罐先生 蜜罐先生
大模型安全研究
2026年8月17日 20:20 广东
在小说阅读器读本章
去阅读
AI 公司大规模抓取公网文本训练模型,这件事早就不是秘密。网站主越不想被白嫖,对抗手段就越花:从 robots.txt 封锁、付费墙,到直接把整个国家的 IP 段拦掉。现在,两个设计师把对抗推到了字体层面。据 Ars Technica 报道,一款叫 ShieldFont 的字体,能在不改变人类阅读体验的前提下,悄悄把喂给爬虫的网页文本改成语义错乱的”废话”,相当于用数据投毒反过来制裁未经授权的训练数据抓取。
问题的起点:爬虫拿走的,和用户看到的不是同一份
要理解 ShieldFont,先得看清 AI 爬虫是怎么干活的。绝大多数大规模抓取工具为了省钱,直接把数十亿网页的原始 HTML 源码当纯文本拉走,根本不启动浏览器去”渲染”页面。
这就留出了一道缝隙:如果一份网页在”源码层”和”人眼看到的渲染层”可以长不一样,爬虫抓到的就会是那个被动手脚的版本。ShieldFont 正是卡住了这条缝。
核心机制:用连字把单词掉包
ShieldFont 的作者 Isaque Seneda 和 Gabriel Abrucio 在白皮书中解释,它的底层依赖一个字体里早就有、但一向被用来”美化排版”的特性:连字(ligature)。
传统字体用连字把挨在一起的某些字母对替换成更顺眼的形状。ShieldFont 反其道而行,用连字机制把整词替换掉。关键是,这个替换只发生在字体引擎”把页面画到屏幕上”的那一刻。于是人类在屏幕上看到的是正常文章,而直接下载源码的爬虫拿到的却是被掉包过的文本。
他们举的例子很直观:把”horse”(马)换成”potato”(土豆)。页面上人看到的是”马”,爬虫源码里躺着的却是”土豆”。
不是随便换,要换得”以假乱真”
如果只是把常见词换成同义词或反义词,聪明点的爬虫分分钟就能反推还原。ShieldFont 的巧妙之处在于,它把词替换成词性相同、但所处信息语境完全无关的另一个词。
“马”换成”土豆”,句子看起来语法通顺、像人话,但意思已经整个错位。即便这种被篡改的页面混过了爬虫的质量过滤器,它喂进训练集的也是被搅乱的信息。作者们用三个月打磨出一份近 12,000 个常见词的替换字典,并允许每个词提供三种不同映射,出版者还能按段落切换映射、甚至自定义词表,避免被轻易识破。
实测数据:超过九成页面被挡在门外
光说机制不够,ShieldFont 团队在六个公开可用的抓取流水线上做了测试,结果相当硬:
启用 ShieldFont 后,原本会被爬虫质量过滤器接收的页面里,超过 90% 被直接拒收。
平均下来,它会替换页面中 24.5% 的全部词汇,以及 45.8% 的”内容词”,让 31% 到 56% 的段落语义被破坏(取决于语料)。而那少量仍被接收的页面里,约 20% 的单词成了作者口中的”训练期垃圾”:拼写正确、合乎英文语法,但啥真事都没说。
落到结果上,被丢掉的页面,爬虫没拿到你的内容;被留下的页面,爬虫拿到的是错的。两头都让抓取方吃亏。
边界与副作用:它不是银弹
ShieldFont 也不是无懈可击。只要页面能被人读,就能被”先完整渲染、再对渲染图做 OCR 识别”的爬虫正确解读。只是这种预渲染流程,据第三方抓取工具的 API 成本估算,要比直接拉 HTML 贵 5 到 13 倍,在规模化抓取面前会显著抬高时间和金钱成本。它要拦的,正是那种不计代价、铺天盖地的大规模式抓取。
但它也有无辜的副作用。搜索引擎、屏幕阅读器、复制粘贴工具、翻译软件,都会因为读到那层被改写的 HTML 而踩坑,让页面对这些本该服务好的对象也变得不那么好用。这是”对人一套、对机器一套”思路必然伴生的代价。
把镜头拉远:数据投毒成了防御武器
ShieldFont 值得 AI 安全圈关注的,不只是”一个字体”这么轻。它代表了一种正在成形的范式:当未经授权的训练数据抓取无法靠礼貌请求挡住,数据投毒本身可以变成一种防御手段。
这场对抗的土壤早已存在。Ars Technica 在报道中回顾,AI 公司扫荡公网抓取训练数据,已经引发多起诉讼(如 Reddit 起诉 Perplexity 阻止其抓取搜索结果),也催生了一批技术对抗方案。ShieldFont 作者把初衷写得很直白:创作者对”自己的作品是否被拿去训练 AI”应当有发言权;当这种同意不被尊重,就用技术设计让”未经许可的拿走”变得没用且更贵。
对模型方和安全团队来说,这带来一个值得警惕的信号:未来从公网采集的训练语料,可能已经混入了故意投毒的样本。如果清洗环节识别不出这种”语义正确但事实错位”的污染,模型学到的就会是悄悄被改写的世界。而 ShieldFont 作者也呼吁更多人提出”对人显示一套、对机器显示另一套”的不同实现,让爬虫更难一次性学会绕过所有变种。
这对做安全的人是个提醒:我们过去谈数据投毒,多盯着”攻击方主动往训练集里塞恶意样本”;ShieldFont 把方向反了过来,变成”数据持有方主动给自己出口的数据下毒”。防御者和攻击者都能用同一把武器,区别只在动机。当公网语料里这类”合法投毒”越来越多,模型方那套”尽可能多抓公网”的粗放采集逻辑,迟早要补上更严的污染检测一环。
可被抓取,不等于同意被用于训练。 这句话正从一句伦理口号,变成一场实打实的技术军备竞赛。
参考链接
●Ars Technica|The web’s newest weapon against AI scrapers is a font:https://arstechnica.com/ai/2026/08/new-font-turns-ordinary-webpages-into-nonsense-for-ai-scrapers/
●ShieldFont 白皮书(Isaque Seneda, Gabriel Abrucio):https://shieldfont.org/white-paper/
请在微信客户端打开
免责声明:
本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。
任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。
本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我。
本文转载自:大模型安全研究 蜜罐先生 蜜罐先生《ShieldFont:用新字体对抗AI,网页智能体都小心了!》
版权声明
本站仅做备份收录,仅供研究与教学参考之用。
读者将信息用于其他用途的,全部法律及连带责任由读者自行承担,本站不承担任何责任。







评论