Firecrawl 团队(美国创业孵化器 Y Combinator 孵化的 AI 数据公司,主要做网页内容抓取与转 Markdown 服务)在 2026 年 8 月底开源了一款浏览器插件 OCR It:它能把一页 PDF 的文字识别并整理成 Markdown 格式,单页只需约 20 毫秒,而且 100% 离线运行——不联网、不需要 API Key(调用接口的密钥)、安装时也不索取网站权限。团队给出的对比是:处理质量与 IBM 开源的文档转换工具 Docling 相当,速度却快约 300 倍。

OCR It 是什么

OCR(光学字符识别)指的是让程序看懂图片里的文字:扫描件、拍照件、被禁止复制的 PDF,本质上都是图片或锁定文本,无法直接选中复制,OCR 的作用就是把它们变成可编辑的文字。

OCR It 就是这样一个工具,但它做成了免费的浏览器插件,支持 Chrome 和 Firefox 两款主流浏览器。它由 Firecrawl 的联合创始人兼 CTO Nicolas Camara 对外发布,代码托管在 GitHub 仓库 thiagotigaz/ocr-it,发布后很快登上 GitHub 热门关注榜。

它解决的痛点很具体:以前要把一本不可复制的 PDF 变成文字,要么手动打字,要么把文件传到云端 OCR 服务,既慢又担心隐私。OCR It 把整个过程放在本机完成,速度快,文档也不离开自己的电脑。

为什么快:本地识别加快捷键批量操作

OCR It 内置了 Tesseract——一款有数十年历史的老牌开源 OCR 引擎。识别在本地进行,页面文字不需要上传到任何服务器,这也是它不需要联网和密钥的原因。

操作方式足够简单:

  • 第一次使用时,按住 Option+Shift+R(Windows 和 Linux 系统把 Option 换成 Alt)框选一次要识别的文字区域,确认后保存;
  • 之后每按一次 Option+Shift+S,插件就识别当前页并自动翻到下一页;也可以一边翻页一边逐页按键,识别任务在后台排队;
  • 想更省事就按 Option+Shift+A 或点击 Start auto-run 进入自动模式,插件会自动循环“截图—识别—翻页”,按 ESC 可中途结束。

识别结束后,可以在插件面板里检查、修改文本,也可以单独重新识别某一页,最后用「Copy all」或「Download .txt」导出全文。

另外,OCR It 设有防呆机制:连续识别到两张相同页面、无法继续翻页、识别失败或达到 300 页上限时都会自动停止,避免在文档末页无限重复抓取。

目前的使用边界

网友实测的共识是:版式简单、文字清晰的 PDF 它处理得相当顺手,但复杂的版面还不行——标题、脚注、表格、数学公式与正文混排的页面,它目前还不稳定,需要等团队后续更新。

还有一个已知限制:Chrome 和 Firefox 自带的 PDF 阅读器暂不支持自动翻页,处理这类 PDF 时建议用手动档逐页识别。

适合谁用

最典型的场景是给大模型(LLM,用海量文本训练出来、能理解和生成文字的 AI 程序)准备“口粮”:AI 读不了图片型的 PDF,需要先把文字提取成 Markdown(一种用符号标记标题、加粗等格式的纯文本格式)。如果你经常处理不可复制的 PDF、又不想注册云服务或把敏感文档传上网,OCR It 是目前少见的本地离线解决方案。

单页 20 毫秒、完全离线、无需注册和密钥——OCR It 把提取 PDF 文字这件苦差事压缩到了眨眼之间。简单版式的文档现在就能放心用;复杂版面仍不稳定,建议等团队后续更新后再把全部 PDF 交给它。