展开知识库目录
截图、扫描 PDF、照片表格怎么交给 AI:先 OCR,再核对关键字段
图片里能看见字,不等于 AI 读得准。先判断清晰度和页序,再提取文字;金额、日期、编号、单位和表头单独回看原图,低置信度位置必须标出来,不能顺着上下文猜。
先检查清晰度、旋转方向和页序
图片里的字能被看见,不等于能被可靠读取。扫描件常见的问题是页面倒置、阴影遮住小数点、表格线断掉、印刷页码和文件页序不一致。直接让 AI 总结,会把识别错误藏进一段通顺文字里。
先 OCR、后理解会稳很多:先按页提取并保留版面,看不清就打标;然后把金额、日期、编号、单位、姓名和表头抽出来回看原图。只有关键字段确认后,才进入统计、翻译或摘要。
这些情况适合用,另外几种先停一下
适合用
- PDF 没有文字层,只能看到扫描页面
- 需要从截图、票据或照片表格提取字段
- 识别结果还要进入表格、合同或后续统计
先别急着用
- 图片包含未经许可的身份证、病历或账户信息
- 原图严重模糊、遮挡或缺页,无法可靠辨认
先整理页序和画面,再按版面提取,最后把关键字段逐项回看原图
为什么这样安排
Microsoft 的 OCR 文档把图片与扫描文档视为文字提取输入;提取只解决‘读出来’,关键字段是否正确仍要回到原图验证。
- 01
检查页序与清晰度
逐页确认方向、缺角、反光和分辨率,记录文件页序与印刷页码,先重拍明显看不清的页面。
- 02
按原版结构转文字
正文保留段落,表格保留行列和表头;无法辨认的位置写明页码与区域,绝不按上下文补齐。
- 03
抽出高风险字段
金额、日期、编号、单位、姓名和表头另做核对表,并保留原图坐标或附近可定位文字。
- 04
确认后再做下一步
人工回看原图并标记已确认、需重拍或无法确认;只有已确认字段才进入计算、合并和正式文档。
复制前先替换 {占位}
扫描件提取指令(复制后替换 {占位})
请读取我上传的{扫描 PDF / 截图 / 照片表格},先做文字提取,不要总结。
文件与页序:{列出文件名,或说明共几页}
输出要求:按页码分段;正文保留段落;表格用 Markdown 表格保留行列。
看不清的位置写 [无法辨认-页码-大致位置],禁止根据上下文猜字或补数字。
另建关键字段表:页码|字段类型|识别值|原图位置|是否需要人工确认。
关键字段包括:金额、日期、编号、单位、姓名、表头和{你的其他字段}。
如果你不能直接查看某页或图片清晰度不足,先列出具体页码并停下,不要继续总结。
最后只报告:已读取页数、疑点数量、待人工核对字段数量。扫描合同提取记录(示例)
下面是已经填过变量的示例。复制时请换成自己的文件名、数字和材料位置,别把示例数据原样交出去。
看清格式再改
扫描合同提取记录(示例)
文件:contract-scan.pdf|共 26 页|文件页序已确认 第 03 页|合同编号|HX-2026-0815|右上角|已回看原图 第 08 页|含税金额|¥128,500.00|表格第 4 行|已回看原图 第 08 页|税率|[无法辨认-第8页-表格第5行右侧]|需重拍 第 19 页|交付日期|2026-09-30|第 2 条第 3 款|已回看原图 正文提取:25 页完成;第 8 页有 1 处疑点 后续动作:税率确认前不计算税额,不把推测值写入表格 复核状态:金额、日期、编号已确认;税率待材料提供人确认
先对症状,别一上来重写整段提示词
表格被识别成连续一段话
- 常见原因
- 没有要求保留行列,或图片透视变形
- 怎么修
- 先矫正图片,再按列名逐行提取为表格。
金额小数点或编号经常错
- 常见原因
- 字符太小,模型按上下文补全
- 怎么修
- 单独裁出关键区域放大,并强制无法辨认就留空。
页码和原文件对不上
- 常见原因
- 文件名顺序或 PDF 印刷页码混用
- 怎么修
- 同时记录文件页序和页面印刷页码,不用一个字段代替。
最后五分钟,逐项打勾
这篇具体参考了什么
正文按公开教程和官方文档重新整理,并换成了可以直接操作的中文场景。产品能力、规则和投稿要求会更新,真正执行前请再打开原始页面核对一次。
