antinet-doc-parse
软件开发工程师与数据科学家在构建RAG系统时,当需处理PDF/Word/Excel等多格式复杂文档,用此技能可自动触发三级解析降级,一键输出高置信度结构化Markdown与元数据,免去繁琐清洗,直接夯实企业知识库数据底座!
它会碰到什么
扫了多少3 个文本文件,6 KB
它会碰到什么写文件
命中总数1 处
命中统计严重 0 · 高 0 · 中 1 · 低 0
这一栏是扫描器报的事实,不是结论。命中多不等于有毒(安全工具、规则库、示例脚本本来就会包含危险写法),命中少也不等于干净。它和你手上的凭据、文件、网络有什么关系,需要你自己看。
技能内容
多格式文档解析 Skill(密卷房)
使用方式
- 由密卷房 Worker 在收到已通过安全扫描的文件时调用。
- 三级 fallback 依次尝试,输出最终结构化结果与置信度。
输入(Input)
file_path:已通过 security-scan 的本地文件路径formats:(可选)期望支持的格式白名单,默认全格式
输出(Output)
markdown:结构化 Markdown 正文metadata:标题、页数、表格数、作者等元数据confidence:0–1 解析置信度fallback_used:最终生效的解析器名称
依赖(Dependencies)
- MinerU(首选,强排版还原)
- PyMuPDF(次选,PDF 快速解析)
- pdfplumber(兜底,表格/文本抽取)
python-magic(类型探测)
失败处理(Failure Handling)
- 主解析器失败 → 自动降级到下一档,直到全部尝试。
- 三级全部失败 → 标记
人工介入,不输出残缺结果,回传 BLOCKED 给军机处。 - 单页超大文件 → 分块解析后拼接,避免内存溢出;块级失败仅标记该块低置信度。
复用价值(Reuse Value)
- 通用解析底座:RAG 索引、企业知识库、合同结构化均可直接复用。
- 置信度透明:下游(通政司四色卡片)可据此决定是否需要人工复核,降低幻觉风险。
复赛代码包执行(runnable package)
- 真实入口:
scripts/run_doc_parse.py - 执行等价于
core.runtime.AgentSession.run_stage("doc-parse"),调用archive.mijuanfang.MiJuanFangAgent(三级解析 fallback,纯 Python 可离线)。 - 运行:
python skills/doc-parse/scripts/run_doc_parse.py - 产物:
examples/snse_survey/skill_outputs/doc_parse.json(解析结果 + 置信度 + fallback 信息)。
想直接用这个技能?
本站把开放许可(MIT / Apache 等)的技能按仓库打包整理到网盘,点一下转存到你自己的网盘,不用一个个从 GitHub 拉。许可未声明的技能只给原始仓库链接,不打包。