Parquet 是列式文件
只选需要的字段通常比整表读取更快。这个工具会复用 Footer 元数据并按行范围解码,但本地文件仍受浏览器内存与文件 API 限制。
LOCAL PARQUET INSPECTOR
先读 Footer,再按字段和行范围读取数据。你可以检查嵌套 Schema、Row Group、压缩方式、字段统计与自定义元数据,也可以把选定范围转成 CSV 或 JSON。整个过程发生在当前浏览器,不上传数据文件。
拖入 .parquet 文件
支持常见 Parquet 类型、嵌套字段以及 Snappy、Gzip、Brotli、Zstd、LZ4 等压缩。单个文件上限 1 GB。
选择 Parquet 文件后,页面会先读取 Footer 元数据,再按需读取当前行范围。
只选需要的字段通常比整表读取更快。这个工具会复用 Footer 元数据并按行范围解码,但本地文件仍受浏览器内存与文件 API 限制。
Min、Max、Null Count 来自 Row Group 的可选统计,不是工具重新扫描全列所得。写入程序可关闭统计,旧文件也可能不完整。
列表和对象在 CSV 中会写成 JSON 字符串;BigInt 在 JSON 中写成十进制文本;二进制值写成包含字节数和 HEX 的对象。
RELATED TOOLS
USE & REVIEW
本地查看 Parquet Schema、Row Group、压缩与字段统计,按字段和行范围读取并导出 CSV 或 JSON。 适合先完成计算、转换或检查,再根据实际使用场景复核输出。
先确认首行是不是表头、字段分隔符、字符编码、空值写法,以及数字和日期采用什么口径。组合主键、金额单位和时区应在处理前统一。
Parquet 查看 / 转 CSV JSON不会把输入内容自动发布成公开页面。标明“本地处理”的步骤只在浏览器内运行;涉及实时数据、IP、外部网址或在线查询时可能需要联网,因此不要输入与任务无关的敏感资料。
先确认表头、分隔符、空值和数字/日期口径,再抽查几行原始数据与导出结果。正式导入系统前建议保留原文件和处理记录。
它适合清洗、对比和生成可下载结果,但不会自动理解业务主键、会计口径或字段含义。正式覆盖数据库前必须抽样和备份。
先用少量样本确认字段、格式和导出结果,再逐步增加数据量。浏览器内工具会受到设备内存和文件复杂度影响,原始文件应单独保留。