跳到主要内容
知仓学习社ZHICANG

doc-ocr

文档文字识别。用户提供 PDF/扫描件/图片(合同、发票、书页、截图),需要提取文字、转成可编辑文本时使用。扫描件自动 OCR(macOS Vision,中英文)。Document OCR: extract editable text from PDFs, scans, and images (…

写文件无严重或高危命中davepoon/buildwithclaude

它会碰到什么

扫了多少2 个文本文件,4 KB
它会碰到什么写文件
命中总数1 处
命中统计严重 0 · 高 0 · 中 1 · 低 0

这一栏是扫描器报的事实,不是结论。命中多不等于有毒(安全工具、规则库、示例脚本本来就会包含危险写法),命中少也不等于干净。它和你手上的凭据、文件、网络有什么关系,需要你自己看。

技能内容

Doc-OCR 文档文字识别

PDF / 扫描件 / 图片 → 可编辑文字。有文字层的 PDF 直接提取,扫描件自动 OCR(macOS Vision 自带,中英文)。

触发条件

用户提供 PDF/图片文件,要求:

  • "提取文字""转文字""OCR"
  • 处理扫描件、合同、发票、书页、截图

使用步骤

1. 单个文件

python3 scripts/dococr.py 合同.pdf
python3 scripts/dococr.py 发票.jpg

输出保存为 <输入名>_ocr.txt

2. 批量目录

python3 scripts/dococr.py ./扫描件/ -o 全部.txt

3. Markdown 输出

python3 scripts/dococr.py 书.pdf --md

依赖(首次使用时安装)

pip3 install pymupdf pyobjc-framework-Vision

注意:OCR 依赖 macOS Vision(仅 macOS 可用)。Linux 需另装 tesseract 等引擎。

已知陷阱

  • 扫描件判定:PDF 文字层 <20 字自动走 OCR,正常 PDF 直接提取。
  • 手写体:Vision 对印刷体/清晰手写效果好,潦草手写不保证。
  • 隐私卖点:文件在本机处理,不上传第三方。

想直接用这个技能?

本站把开放许可(MIT / Apache 等)的技能按仓库打包整理到网盘,点一下转存到你自己的网盘,不用一个个从 GitHub 拉。许可未声明的技能只给原始仓库链接,不打包。

它属于哪个仓库

星标★ 3,470
本站分层T1
该仓技能数381
原文件路径plugins/all-skills/skills/doc-ocr/SKILL.md

同一个仓库里的其他技能

看这个仓库的全部 381 个技能