文件OCR解析
当用户需要将扫描版 PDF、图片、OFD、票据、合同扫描件、法院文书扫描件或其他 Agent 无法直接读取的文件解析为文本/Markdown 时使用。适用于 OCR 识别、扫描件识别、图片转文字、图片转 Markdown、PDF 转 Markdown、文件解析失败、文档无法读取、提取结果为空、乱码、扫描版文件解析不了、agent 解析不了文件、平台无法解析文…
Delilegal
@coolalam
What This Skill Does
解析扫描版 PDF、图片、OFD、票据、合同扫描件等 Agent 无法直接读取的文件,将其转换为可编辑的 Markdown 或文本。优先使用平台原生解析能力,仅在原生解析失败、结果不可用或用户明确要求时调用得理 OCR 接口。
Replaces manual retyping or third-party OCR tools by providing a fallback OCR pipeline that only activates when native parsing fails.
When to Use It
- 将扫描版 PDF 合同转换为可编辑的 Markdown 文本
- 从票据或发票图片中提取文字信息
- 解析 OFD 格式的电子公文或法院文书
- 处理原生解析返回乱码或空结果的图片文件
- 批量转换目录中的多个扫描件为结构化文本
- 将手写体或印章模糊的扫描件交由 OCR 兜底识别
Install
$ openclaw skills install @coolalam/deli-ocr-file-parser得理 OCR 文件解析
Instructions
将文件转换为可继续分析的 Markdown 或文本。默认把当前 Agent 或平台的原生文件解析能力放在第一优先级;得理 OCR 只作为兜底能力。
前置工作
命中本 skill 后,如需要调用得理 OCR、文件解析、PDF 转 Markdown、图片 OCR、OFD 解析或后端能力,必须先执行 deli-cli 通用前置。
完成 CLI 前置检查后,通过当前 skill scope 发现命令,并以当次返回的 RUN id、命令名和参数形态执行;不得假设固定命令或固定参数存在。
如果 CLI 未配置、不可用或未返回覆盖当前任务的命令,应先说明“命令不可用”或“解析受限”,并给出需要用户补充的文件、格式转换或重新扫描建议,不得改用旧本地脚本或直接请求接口。
1. 先尝试原生解析
对每个文件先使用当前 Agent 或平台已有能力解析:
- PDF:先尝试平台 PDF 解析、
pdfplumber、PyMuPDF或同类本地解析。 - 图片或扫描件:先尝试平台视觉模型、多模态识别或内置 OCR 工具。
- Office 或表格:先尝试平台能力或
python-docx、openpyxl、CSV/JSON 解析。 - 文本、HTML、Markdown:直接读取或转换,不调用 OCR。
满足以下条件时,视为原生解析成功,不要调用得理 OCR:
- 提取文本非空,且不是大量乱码、重复页眉页脚或无意义字符。
- 扫描版 PDF 的关键页已经得到可读文字。
- 用户没有明确要求改用得理 OCR。
2. 失败时再调用得理 OCR
只有出现以下情况才使用 deli-cli OCR 命令:
- 扫描版 PDF、图片、OFD 或票据图片无法被当前 Agent 解析。
- 原生解析结果为空、缺页、乱码,或表格、票据关键信息无法识别。
- 用户明确说“用得理 OCR”“调用 OCR”“这个文件 agent 解析不了”“扫描版识别一下”。
调用前先阅读 OCR 文件解析 CLI 场景指南,按当次 cmds 返回的命令和参数组织输入文件、输出目录、语言、任务类型和是否保存原始响应。
3. 批量文件处理
对目录中的多个文件逐个判断,避免对已经能解析的文件重复调用 OCR。
建议输出到单独目录:
parsed/
├── 01_合同扫描件.md
├── 02_付款回单.md
└── raw_response/
后续证据整理、合同审查、法律意见书等任务应直接使用已解析的 Markdown 或文本结果。
支持格式
得理 OCR 常见支持格式如下;实际以当次 cmds 返回能力为准:
| 类型 | 扩展名 |
|---|---|
| 文档 | .pdf、.docx、.doc、.docm、.dotm、.rtf、.txt、.ofd |
| 表格 | .xlsx、.xls |
| 图片 | .png、.jpeg、.jpg、.gif、.bmp、.img |
| 网页 | .html |
如果文件格式不支持,先提示用户转换格式,不要调用 OCR。
输出要求
OCR 或文件解析完成后,至少说明:
- 原始文件名
- 输出 Markdown 或文本文件路径
- 是否保存原始响应
- 是否存在缺页、乱码、表格错位、印章或手写识别不确定
- 后续可交给哪个 skill 或分析流程继续处理
使用注意
- 不要因为 CLI 已配置 API Key 就自动调用得理 OCR;必须先判断原生解析是否失败或用户是否明确要求。
- 不要把大段解析文本通过命令行参数传给其他脚本;先写入
.md或.txt文件。 - 始终保留原始文件,不要原地覆盖。
- OCR 结果必须提醒用户复核,尤其是金额、日期、姓名、案号、发票号码和银行账号。
- 处理敏感材料时,只输出任务所需的解析结果,不在对话中粘贴完整隐私内容。
参考资源
Top skills in this category
Nano Pdf
@steipeteEdit PDFs with natural-language instructions using the nano-pdf CLI.
Word / DOCX
@ivangdavilaCreate, inspect, and edit Microsoft Word documents and DOCX files with reliable styles, numbering, tracked changes, tables, sections, and compatibility check...
Excel / XLSX
@ivangdavilaCreate, inspect, and edit Microsoft Excel workbooks and XLSX files with reliable formulas, dates, types, formatting, recalculation, and template preservation...
Markdown Converter
@steipeteConvert documents and files to Markdown using markitdown. Use when converting PDF, Word (.docx), PowerPoint (.pptx), Excel (.xlsx, .xls), HTML, CSV, JSON, XML, images (with EXIF/OCR), audio (with transcription), ZIP archives, YouTube URLs, or EPubs to Markdown format for LLM processing or text analysis.
Powerpoint / PPTX
@ivangdavilaCreate, inspect, and edit Microsoft PowerPoint presentations and PPTX decks with reliable layouts, templates, placeholders, notes, charts, and visual QA. Use...