展开知识库目录
上百页 PDF 怎么读才不会丢页码:分段提问并保留原文证据
长 PDF 最怕得到一份无法回查的漂亮摘要。先统一页码、建立文档地图,再按问题分段阅读,让每条结论绑定原句和位置。
128 页报告总结得很完整,可追问“这句话在第几页”时一条也找不到
学生把整份扫描报告交给 AI,得到一页结构清楚的总结。写综述时,他想引用“多数受访者采用两步核查”,却在 PDF 中搜索不到原句;AI 给出的第 47 页其实是阅读器页码,报告印刷页写着 31,而且那一页只讨论访谈流程,并没有这个结论。
长文档不能从“一次总结全文”开始。先确认文件版本和两套页码,再用目录、标题和图表建立地图;之后每批只回答一个阅读问题,输出必须包含原句、PDF 页、印刷页和核验状态。
- 一张章节—页码—问题文档地图
- 带原句和双页码的证据台账
- 可以随机回查的分段总结
页码、版本和可搜索性没对齐,后面所有引用都不可靠
| 先确认什么 | 怎么记录 | 发现问题怎么办 |
|---|---|---|
| 文件身份 | 题名、机构/作者、版本、日期、下载地址、文件名 | 多个版本并存时不要覆盖,先比较修订说明 |
| PDF 页码 | 阅读器显示的第几页,从封面开始计算 | 始终保留,便于在当前文件准确跳转 |
| 印刷页码 | 正文页脚或页眉显示的页码 | 与 PDF 页不一致时两者都记,例如 PDF 47 / 印刷 31 |
| 文本层 | 是否能选中、复制并搜索中文、数字和公式 | 扫描件先做 OCR;OCR 文本只用于定位,引用前回原图核对 |
| 图表和附录 | 是否单独编号、是否横跨页面、脚注在哪里 | 分段时保持图、标题、注释和来源在同一批 |
目录只告诉你章节,阅读问题才决定每段为什么要读
| 页码范围 | 文档部分 | 这一批只回答什么 | 完成标志 |
|---|---|---|---|
| PDF 1-12 | 封面、摘要、目录、方法概览 | 报告目的、对象、版本和整体结构是什么 | 能画出章节地图,不提取具体结论 |
| PDF 13-38 | 概念与背景 | 关键术语怎样定义,证据来源是什么 | 定义绑定原句和页码 |
| PDF 39-72 | 方法与样本 | 材料怎样取得、对象怎样纳入、限制在哪里 | 每个方法判断能回到表格或段落 |
| PDF 73-104 | 结果与图表 | 哪些结果直接回答阅读问题,分母和时间点是什么 | 数字、图表编号和注释完整 |
| PDF 105-128 | 讨论、限制与附录 | 作者怎样解释,哪些是建议而不是结果 | 作者观点与证据分开记录 |
页码范围是演示。实际分段优先沿章节、小标题和论证转折切,不按固定页数硬切;相邻段保留必要上下文。
每次只给一个页码范围和一个问题
手工阅读也使用同一输出字段。AI 只能整理当前提供的页段,不能凭前后知识补齐缺失内容。
可复制使用
每次只给一个页码范围和一个问题
你正在阅读同一份 PDF 的一个片段。只能依据我提供的页面回答,不得补充外部事实,不得把没有原句支持的推断写成作者结论。
文件:{题名、版本、日期}
本批范围:PDF 第 {起始}-{结束} 页;对应印刷页 {范围}
阅读问题:{这一批只回答一个问题}
逐条输出:
1. 可支持的判断;
2. 支持它的最短原句;
3. PDF 页码;
4. 印刷页码;
5. 章节/表图编号;
6. 这是作者结果、作者解释、引用他人观点,还是你的推断;
7. 核验状态(待人工核对/已核对/无法确认)。
如果页面没有答案,明确写“本批未找到”,不要跨页猜测。表格、脚注、公式或 OCR 文本不清楚时,指出需要人工查看的具体位置。没有原句和位置的结论,先不进入正文
| 判断 | 原句 | 位置 | 来源性质 | 核验状态 |
|---|---|---|---|---|
| 示例:报告把核查分为两个阶段 | 粘贴最短完整原句,不改动否定词与程度词 | PDF 47 / 印刷 31 / 图 4 | 作者结果 | 待人工核对 |
| 示例:作者认为培训可能改善流程 | 保留 may、可能等不确定表达 | PDF 109 / 印刷 93 / Discussion | 作者解释 | 已核对 |
| 示例:不同章节似乎存在矛盾 | 分别保存两处原句 | PDF 52 与 88 | 读者判断 | 待回上下文确认 |
这些是字段演示,不是外部报告的真实结论。实际台账中的每条原句必须来自当前文件,并遵守合理引用与版权边界。
随机抽十条结论,任何一条定位失败都先暂停写作
- 01
直接跳到记录页码
检查 PDF 页、印刷页、章节和图表编号是否一致;定位不到就标记失败。
- 02
比较判断与原句强度
原文写“可能相关”,总结不能写“导致”;原文只报告亚组,不能扩大到全部样本。
- 03
检查原句上下文
确认否定、转折、脚注、分母和时间点没有被截掉。OCR 文本与页面图像逐字比对。
- 04
分批结论最后再综合
跨章节合并时标出这是作者原有综合还是读者新判断,并保留每条底层证据链接。
引用、改写和总结都必须能回到原文
一手来源Purdue OWL:Quoting, Paraphrasing, and Summarizing编辑依据当前 PDF 原文件及发布页
用于区分直接引用、改写和总结,并强调保留来源归属。
它们是版本、页码、图表和作者结论的最终核对依据;AI 输出和 OCR 文本都不能替代原页。
