展开知识库目录

CSV / Excel 清洗脚本怎样保留原文件并生成差异报告

CSV/Excel 的原始值、类型和行号必须保留。

先把问题看准

清洗脚本永远写新文件

CSV/Excel 的原始值、类型和行号必须保留。先建立字段字典和规则,再生成规范值、差异报告和异常行;不能直接覆盖用户唯一文件。

第 1 步

读取时保护类型

明确编码、分隔符、工作表、标题行和容易丢失前导零的字段,先输出行列和样例。

把涉及的文件、目录、版本、命令和实际输出写进记录;代码变化同时保留 diff 与测试结果。

第 2 步

规则数据化

每条清洗规则写字段、条件、动作、优先级和异常处理,不把口径散在代码分支里。

确认“规则数据化”已经有可回查结果,再进入“保留原值和行标识”;依据仍然来自猜测时,把缺口单列并停在当前步骤。

第 3 步

保留原值和行标识

为修改字段新增规范值列,保留源文件行号或主键,无法判断的行进入异常表。

确认“保留原值和行标识”已经有可回查结果,再进入“小样本与边界验证”;依据仍然来自猜测时,把缺口单列并停在当前步骤。

第 4 步

小样本与边界验证

测试空值、中文、日期、金额、科学计数、重复和极端长度,比较手工预期。

确认“小样本与边界验证”已经有可回查结果,再进入“输出可重算交付”;依据仍然来自猜测时,把缺口单列并停在当前步骤。

第 5 步

输出可重算交付

生成新文件、规则版本、修改计数、逐行差异和异常清单,重跑相同输入结果一致。

需要修改时先限定文件和行为范围,无法说明回滚方式或影响面的动作先不执行。 完成后把证据归入“新文件、差异报告与异常行”。

完成后应能在“新文件、差异报告与异常行”中找到与这一步对应的记录;仍需靠猜测补全,就停在这里。

做到这里就可以停

先核对数量,再看内容

输入、输出、删除、合并和异常行数必须能解释;随机抽查每类规则。数量对不上或原值丢失时不交付。

进一步核对

参考资料与核对入口