Firecrawl又又又开源一个神级skill,暴涨1万Star。

admin 2026-08-10 04:49:47 网络安全文章 来源:ZONE.CI 全球网 0 阅读模式

文章总结: Firecrawl团队开源基于Rust的文档转换库anydoc,可将PDF、Word等14种格式极速转为Markdown。该工具转换中位数仅4.4毫秒,基于字节头识别真实格式且无外部依赖。它统一了内部文档模型与API,大幅降低RAG与Agent开发的文档预处理门槛,开发者可一行命令直接调用。 综合评分: 78 文章分类: 软文广告,产品介绍


cover_image

Firecrawl 又又又开源一个神级 skill ,暴涨 1 万 Star 。

原创

开源日记 开源日记

开源日记

2026年8月8日 15:12 湖北

在小说阅读器读本章

去阅读

做过的 RAG 或者 Agent开发的朋友,都会遇到同一个问题。

要把几百个PDF、Word、PPT 处理成Markdown,喂给模型。

用过 LibreOffice,很慢,我试过转一个文档要一秒钟以上。

试过用写 Python 脚本来处理,解析库遇到复杂表格就会出现乱码,合并单元格也会丢失。

更夸张的是,有时候用户传过来一个文件,看着后缀名是.docx,但是实际上是.pdf文件,识别程序直接错乱崩溃。

最近我在 GitHub 上看到了 Firecrawl 团队开源的新项目,专门来解决这个问题。

它叫 anydoc,在线五天之后,在 GitHub 上就获得了11000多个star。

它就是将各种办公文档转换为干净的Markdown格式的Rust库。

Word、PPT、Excel、PDF、RTF、EPUB、CSV,14 种格式全支持。

转一个文档,中位数只有 4.4 毫秒。比LibreOffice快了 256 倍,比第二名快了 20 多倍。

而且不需要安装任何东西,一行命令就可以完成。Firecrawl 还把它做成 Agent Skill,你的 AI 编程助手也可以直接使用。

我给你演示一把,你就会知道这个东西有牛X了

假设你手里有一堆乱七八糟的文档,要喂给 RAG 系统。

有2003年的.doc文件、同事发来的.pptx文件、客户提供的老格式.xls文件以及一些.epub电子书。

以前要一个一个地打开、另存为、再转换格式。

安装后,终端输入一行命令即可,无需脚本或环境配置。anydoc自动识别真实格式,不依赖后缀名,即使文件被重命名也能正确转换。

然后转换为干净的Markdown。

标题有锚点、表格合并单元格全部保留、嵌套列表层次分明、脚注尾注无一遗漏。

单文件转换不到500毫秒,批量100个同样在半秒内完成。以前用LibreOffice要等大约 2 分钟左右。

整个过程中,识别、解析、转换都是它自己完成的,你不需要再去管其它的了。

如果文档中包含图片的话,在Markdown中会保留替代文本,并且原始图片的数据也会一同返回,不会丢失。

有人要好奇了,它是怎么做到的

01 用一个文档模型来处理所有的格式。

每种格式先被各自的解析器拆解。Word 有自己的解析器,PPT 有自己的解析器,Excel 有自己的解析器。

但是拆完之后都映射到了同一个内部文档模型里面。

标题、段落、表格、列表、脚注、嵌入资源等都属于一个结构体。

最后使用同一个Markdown序列化器来输出。

这种设计将维护成本集中在模型和序列化层,无需为每种格式单独写输出逻辑。

02 格式检测不看后缀名,只看字节头。

它是根据文件的原始字节签名来读取的。PDF头、RTF开头标记、OLE流名、ZIP包的mimetype。

CSV 没有签名,才需要扩展名或显式指定。这在生产环境里特别实用,用户上传的文件后缀名经常是乱的,anydoc 不在乎。

03 绑定层不会阻塞主线程。

Node.js 的转换在 libuv 线程池中进行,不会影响到事件循环。Python 的转换会释放 GIL,其他的线程仍然可以正常运行。

TypeScript 类型以及 Python stub 都被直接打包进包中,开发体验非常棒。

都使用了社区的标准方案,Node 用的是 NAPI-RS,Python 用的是 PyO3。

还有WASM版本,在浏览器中运行,文件不会上传到第三方。

04 无机器学习、无GPU、无第三方服务。

是用纯Rust写的,没有用到任何机器学习模型,不需要GPU,也不需要调用外部API。

4.4毫秒是只用Ryzen 9的CPU跑出来的,还没有用上 GPU 加速,用上估计会更猛。

官方用了 100 份真实的文档进行了一轮盲评,对 14 种格式都做了测试,并且一共评了 482 次, Claude 给出的分数如下。

anydoc 是唯一一个包含所有的 14 种格式,并且每个格式的评分都是最高的。

同场对比的,是 LibreOffice、pandoc、unstructured、markitdown、docling、mammoth 这些主流工具。

效果这么好,估计大家已经迫不及待想试试了

Node.js 和 Python 用户,只需要一条命令就可以安装好:

npx @firecrawl/anydoc report.docx
pip install firecrawl-anydoc

Rust 用户直接使用 cargo add,浏览器中也可以运行,安装WASM包就可以了。

想在代码里调用,四个语言的 API 完全一致:to_markdown、to_markdown_bytes、to_document。

CLI 也不局限于一个文件,可以用 -o 指定输出文件,用 –format 指定格式,也可以从标准输入读取内容。

如果你是Claude Code或者Codex用户,只需要一行命令就可以使Agent具有读取文档的能力:

npx skills add firecrawl/anydoc

到这里边界也给大家提提

只有图片的PDF是不能转换的,因为没有OCR。

文本型的走本地解析,可以直接转换。

扫描件要使用Firecrawl的云解析接口。

加密过的文档也不行,会直接报出Encrypted错误。

格式错误或者超出安全限制的文件也会返回明确的错误码,而不会出现无头苍蝇一样乱转的情况。

写在最后

Firecrawl 做网页抓取做到了 14.9 万 Star,现在把文档解析也开源了。

他们自己要这个能力来驱动 Parse 产品,造出来之后顺便开源,既造福了社区,也给自己的商业产品打广告。

anydoc 最打动我的地方是省心。

无需LibreOffice、Python环境或GPU。一个二进制文件,一条命令,各种格式都可以使用。

有需要的朋友可以试试看。

项目基于 MIT 协议开放,感兴趣的同学可以去 GitHub 仓库看看源码和文档。

开源地址:https://github.com/firecrawl/anydoc

既然看到这了,欢迎随手点赞、在看、转发,也可以给我个星标⭐,接收最新的文章,我们下期见!


免责声明:

本文所载程序、技术方法仅面向合法合规的安全研究与教学场景,旨在提升网络安全防护能力,具有明确的技术研究属性。

任何单位或个人未经授权,将本文内容用于攻击、破坏等非法用途的,由此引发的全部法律责任、民事赔偿及连带责任,均由行为人独立承担,本站不承担任何连带责任。

本站内容均为技术交流与知识分享目的发布,若存在版权侵权或其他异议,请通过邮件联系处理,具体联系方式可点击页面上方的联系我

本文转载自:开源日记 开源日记 开源日记《Firecrawl 又又又开源一个神级 skill ,暴涨 1 万 Star 。》

评论:0   参与:  0