展开知识库目录
长文件放不下时,怎样先建目录、分段处理并保留页码
分段处理前确认文件版本、总页数、目录、印刷页与 PDF 页差异。
长文件先建目录和页码体系
分段处理前确认文件版本、总页数、目录、印刷页与 PDF 页差异。每批围绕一个问题读取,并把结论绑定原句和位置,避免跨批漂移。
建立文件地图
记录章节、页码范围、表图、附录、OCR 状态和优先问题,扫描件保留原图。
保留原始材料、当前要求、模型实际输出和人工核验结果,避免只剩一段无法追溯的最终文本。
按语义边界分批
在章节、小标题或表格边界切分,相邻批次保留必要上下文,不用固定字符把句子拆开。
确认“按语义边界分批”已经有可回查结果,再进入“固定每批输出”;依据仍然来自猜测时,把缺口单列并停在当前步骤。
固定每批输出
原句、页码、摘要、可支持结论、术语和待确认项使用相同字段。
确认“固定每批输出”已经有可回查结果,再进入“维护跨批账本”;依据仍然来自猜测时,把缺口单列并停在当前步骤。
维护跨批账本
统一术语、人物、版本和关键结论,记录冲突和后续需要回看的页面。
确认“维护跨批账本”已经有可回查结果,再进入“合并后抽查”;依据仍然来自猜测时,把缺口单列并停在当前步骤。
合并后抽查
随机结论回到原页,核对上下文和否定条件,无法定位就撤回。
材料不足、权限不明、事实冲突或动作会改变外部状态时先停下,把缺口交给责任人确认。 完成后把证据归入“文件地图与跨批核验表”。
完成后应能在“文件地图与跨批核验表”中找到与这一步对应的记录;仍需靠猜测补全,就停在这里。
文件地图和跨批表比长摘要更重要
它们让新批次知道已读什么、结论来自哪里和还有什么未知。没有页码的总结不进入最终交付。
