「CSV 列分析器 / 数据质量与字段类型检查」主要解决什么问题?
逐列统计 CSV/TSV 的空值、唯一值、重复值、字段类型、最值、常见值、首尾空格和公式注入风险,支持本地文件与报告导出。 适合先完成计算、转换或检查,再根据实际使用场景复核输出。
CSV PROFILE / DATA QUALITY
读取 CSV 或 TSV 后,逐列统计空值、唯一值、重复值、字段类型、数值范围、常见值、异常空格和电子表格公式风险。适合导入系统前先摸清数据。
当前数据集
5 × 8
2 个空单元格,2 个混合类型字段。
字段数
8
6 列没有空值
空单元格
2
首尾空格
1
公式风险
1
以 =、+、@ 等开头
类型、完整率和唯一率只是清洗依据,不会修改原数据。
| 字段 / 类型 | 完整率 | 唯一值 | 范围 / 长度 | 常见值 | 清洗提醒 |
|---|---|---|---|---|---|
| notes文本 | 80.0%4 非空 / 1 空 | 4唯一率 100% · 重复 0 | 最小:=HYPERLINK(https://example.com)最大:priority长度:8–31,平均 17.0 | =HYPERLINK(https://example.com) ×1 (25.0%)duplicate customer ×1 (25.0%)first order ×1 (25.0%)priority ×1 (25.0%) | 1 个空值1 个首尾空格1 个公式风险 |
| customer_email混合类型主要为 邮箱 | 100%5 非空 / 0 空 | 4唯一率 80.0% · 重复 1 | 最小:amy@example.com最大:invalid-email长度:13–16,平均 14.8 | amy@example.com ×2 (40.0%)bob@example.com ×1 (20.0%)chen@example.com ×1 (20.0%)invalid-email ×1 (20.0%) | 混合类型 |
| order_date混合类型主要为 日期 | 100%5 非空 / 0 空 | 5唯一率 100% · 重复 0 | 最小:2026-07-01最大:not-a-date长度:10–10,平均 10.0 | 2026-07-01 ×1 (20.0%)2026-07-02 ×1 (20.0%)2026-07-03 ×1 (20.0%)2026-07-05 ×1 (20.0%)not-a-date ×1 (20.0%) | 混合类型 |
| quantity整数 | 80.0%4 非空 / 1 空 | 3唯一率 75.0% · 重复 1 | 最小:1最大:3平均:1.75 | 1 ×2 (50.0%)2 ×1 (25.0%)3 ×1 (25.0%) | 1 个空值 |
| order_id文本 | 100%5 非空 / 0 空 | 5唯一率 100% · 重复 0 | 最小:ORD-001最大:ORD-005长度:7–7,平均 7.0 | ORD-001 ×1 (20.0%)ORD-002 ×1 (20.0%)ORD-003 ×1 (20.0%)ORD-004 ×1 (20.0%)ORD-005 ×1 (20.0%) | 未发现基础格式问题 |
| country文本 | 100%5 非空 / 0 空 | 4唯一率 80.0% · 重复 1 | 最小:CN最大:US长度:2–2,平均 2.0 | US ×2 (40.0%)CN ×1 (20.0%)DE ×1 (20.0%)GB ×1 (20.0%) | 未发现基础格式问题 |
| revenue小数 | 100%5 非空 / 0 空 | 5唯一率 100% · 重复 0 | 最小:59最大:239.85平均:135.53 | 129.90 ×1 (20.0%)159.90 ×1 (20.0%)239.85 ×1 (20.0%)59.00 ×1 (20.0%)89.00 ×1 (20.0%) | 未发现基础格式问题 |
| status文本 | 100%5 非空 / 0 空 | 3唯一率 60.0% · 重复 2 | 最小:paid最大:refunded长度:4–8,平均 5.4 | paid ×3 (60.0%)pending ×1 (20.0%)refunded ×1 (20.0%) | 未发现基础格式问题 |
仅显示前 6 行,用于确认分隔符和列宽是否正确。
| order_id | customer_email | country | order_date | quantity | revenue | status | notes |
|---|---|---|---|---|---|---|---|
| ORD-001 | amy@example.com | US | 2026-07-01 | 2 | 159.90 | paid | first order |
| ORD-002 | bob@example.com | DE | 2026-07-02 | 1 | 89.00 | paid | 空 |
| ORD-003 | amy@example.com | US | 2026-07-03 | 3 | 239.85 | refunded | duplicate customer |
| ORD-004 | invalid-email | GB | not-a-date | 1 | 59.00 | pending | =HYPERLINK(https://example.com) |
| ORD-005 | chen@example.com | CN | 2026-07-05 | 空 | 129.90 | paid | priority |
空值不一定是错误,重复值也不一定要删除。客户字段可以重复,订单号通常不应重复;邮编和 SKU 看似数字,却常常必须保留前导零。先理解字段语义,再选择去重、格式化或类型转换。
阅读 CSV 字段画像与数据质量指南USE & REVIEW
逐列统计 CSV/TSV 的空值、唯一值、重复值、字段类型、最值、常见值、首尾空格和公式注入风险,支持本地文件与报告导出。 适合先完成计算、转换或检查,再根据实际使用场景复核输出。
先确认首行是不是表头、字段分隔符、字符编码、空值写法,以及数字和日期采用什么口径。组合主键、金额单位和时区应在处理前统一。
CSV 列分析器 / 数据质量与字段类型检查不会把输入内容自动发布成公开页面。标明“本地处理”的步骤只在浏览器内运行;涉及实时数据、IP、外部网址或在线查询时可能需要联网,因此不要输入与任务无关的敏感资料。
先确认表头、分隔符、空值和数字/日期口径,再抽查几行原始数据与导出结果。正式导入系统前建议保留原文件和处理记录。
它适合清洗、对比和生成可下载结果,但不会自动理解业务主键、会计口径或字段含义。正式覆盖数据库前必须抽样和备份。
先用少量样本确认字段、格式和导出结果,再逐步增加数据量。浏览器内工具会受到设备内存和文件复杂度影响,原始文件应单独保留。