展开知识库目录
CSV / Excel 清洗脚本怎样保留原文件并生成差异报告
CSV/Excel 的原始值、类型和行号必须保留。
清洗脚本永远写新文件
CSV/Excel 的原始值、类型和行号必须保留。先建立字段字典和规则,再生成规范值、差异报告和异常行;不能直接覆盖用户唯一文件。
读取时保护类型
明确编码、分隔符、工作表、标题行和容易丢失前导零的字段,先输出行列和样例。
把涉及的文件、目录、版本、命令和实际输出写进记录;代码变化同时保留 diff 与测试结果。
规则数据化
每条清洗规则写字段、条件、动作、优先级和异常处理,不把口径散在代码分支里。
确认“规则数据化”已经有可回查结果,再进入“保留原值和行标识”;依据仍然来自猜测时,把缺口单列并停在当前步骤。
保留原值和行标识
为修改字段新增规范值列,保留源文件行号或主键,无法判断的行进入异常表。
确认“保留原值和行标识”已经有可回查结果,再进入“小样本与边界验证”;依据仍然来自猜测时,把缺口单列并停在当前步骤。
小样本与边界验证
测试空值、中文、日期、金额、科学计数、重复和极端长度,比较手工预期。
确认“小样本与边界验证”已经有可回查结果,再进入“输出可重算交付”;依据仍然来自猜测时,把缺口单列并停在当前步骤。
输出可重算交付
生成新文件、规则版本、修改计数、逐行差异和异常清单,重跑相同输入结果一致。
需要修改时先限定文件和行为范围,无法说明回滚方式或影响面的动作先不执行。 完成后把证据归入“新文件、差异报告与异常行”。
完成后应能在“新文件、差异报告与异常行”中找到与这一步对应的记录;仍需靠猜测补全,就停在这里。
先核对数量,再看内容
输入、输出、删除、合并和异常行数必须能解释;随机抽查每类规则。数量对不上或原值丢失时不交付。
