两份名单怎么对比?交集、差集、并集和重复项整理指南
SKU、ASIN、邮箱、关键词和 URL 名单经常需要对比。本文说明如何找出只在 A、只在 B、交集、并集、对称差集和重复项,并避免大小写、空格和追踪参数造成误判。
打开配套工具 →运营和数据清洗里经常会遇到两份名单:一份来自旧表,一份来自新表;一份来自广告后台,一份来自自己整理的关键词;一份是 ERP 的 SKU,一份是平台后台的 SKU。肉眼对比几十行还可以,上百行、上千行就很容易漏掉新增、缺失和重复项。
可以使用 名单列表对比 / 交集差集工具 对比两份 SKU、ASIN、邮箱、关键词、URL 或客户名单。工具会直接输出只在 A、只在 B、交集、并集、不相同项和重复项,所有处理都在浏览器本地完成。
先明确你要看什么
名单对比不是只有“相同”和“不相同”。不同输出适合不同问题:
- 只在 A:旧表里有,新表里没有,常用于找缺失或下架项。
- 只在 B:新表里有,旧表里没有,常用于找新增项。
- 交集:两边都有,常用于确认已同步或共同覆盖。
- 并集:两边合并去重,常用于整理完整名单。
- 不相同项:只在任意一边出现,常用于找差异。
- 重复项:同一份名单内部重复,常用于导入前清理。
如果你要检查“新系统有没有漏 SKU”,重点看只在旧表的项目;如果你要生成最终导入名单,通常先看并集,再检查重复项。
规范化规则会影响结果
同一个值可能因为大小写、空格或链接参数不同,看起来像两条不同数据。例如:
SKU-001
sku-001如果业务里 SKU 不区分大小写,可以开启忽略大小写;如果平台确实区分大小写,就不要开启。邮箱和大多数 URL 对比通常可以忽略大小写,但商品编码、密码、token、大小写敏感的 ID 要谨慎。
空格也很常见。复制表格时,字段前后可能带空格,多个空格也可能来自排版。正式对比前,建议去掉首尾空格,并把连续空格合并成一个。
URL 名单要清理追踪参数
URL 对比容易被 utm_source、fbclid、gclid 这类追踪参数干扰。两个链接指向同一页面,但参数不同,会被当成不同 URL。
例如:
https://example.com/product-a?utm_source=ads
https://example.com/product-a如果你是在对比页面覆盖、站点链接、素材页或投放落地页,通常应该去掉常见追踪参数再比较。如果你是在对比广告投放链接本身,追踪参数可能就是重要信息,此时不要删除。
重复项要在导入前处理
很多后台导入失败,不是因为格式复杂,而是因为名单里有重复项。SKU、FNSKU、邮箱、订单号、优惠码、关键词都可能要求唯一。
重复项输出最好包含出现次数和原始行号。这样你能回到原始资料里判断:
- 是真的重复,应该删除。
- 是大小写或空格造成的假重复。
- 是同一个客户多个联系人,需要保留。
- 是同一个 SKU 多个渠道,需要拆成不同字段。
不要直接盲目删除重复项。先确认业务含义,再决定保留哪一条。
常见使用流程
- 把旧名单放到 A,新名单放到 B。
- 开启去首尾空格、忽略大小写和跳过空项。
- 先看 A 重复项、B 重复项。
- 再看只在 A 和只在 B。
- 确认无误后下载差异或并集。
如果名单来自一段用逗号、竖线或 Tab 分隔的文本,可以先用文本分隔提取工具把目标列提取出来,再进行名单对比。这样比直接拿整段混合文本对比更准确。
总结
名单对比的核心是先定义“相同”的规则。大小写、空格、URL 参数、重复项都会影响结果。只要规则清楚,交集、差集和并集就能快速回答“漏了什么、增加了什么、重复了什么”。
需要快速处理时,可以打开 名单列表对比 / 交集差集工具,把两份名单粘进去,先看重复项,再看差异和并集。