LOCAL TEXT ENCODING REPAIR

文件编码检测与 UTF-8 转换

检测 UTF-8、UTF-16、GBK/GB18030、Big5、Shift_JIS、EUC-KR 和 Windows-1252,切换候选查看真实文字,再导出适合 Excel、网站或程序的 Unicode 文件。全程不上传。

1. 读取原始字节

不要先用错误编码打开并另存;那会把原始字节永久替换成乱码。

拖入 CSV、TXT 或其他文本

最大 30 MB;JSON、XML、HTML、字幕和日志也可按纯文本处理。

文件未选择
原始体积0 B
BOM
置信度

2. 检查文字并导出

预览可直接修正;旧式编码自动识别有歧义时,以实际语言和原始系统为准。

上传文本文件,或载入 GB18030 示例检查自动识别。

Excel 打开 CSV 乱码

Windows 版 Excel 直接双击 CSV 时,常依赖系统区域设置或 BOM 判断编码。中文内容优先导出 UTF-8 BOM;更稳妥的办法是用“数据 → 从文本/CSV”导入并明确选择 UTF-8。

为什么不能只看扩展名

.csv、.txt、.srt 和 .xml 都只是文件用途,不能证明字节编码。没有 BOM 的旧式中文、日文和韩文编码可能互相产生“看似像字”的错误结果,因此自动检测必须允许人工切换。

怎样避免永久乱码

保留原文件,先按候选编码预览专有名词、标点和生僻字,再另存为新文件。已经用错误编码打开并保存过的文件,原始字节可能丢失,任何转换器都不一定能完整还原。

RELATED TOOLS

查看全部工具 →

USE & REVIEW

文件编码检测与 UTF-8 转换常见问题

查看全部工具指南 →

CSV、TXT 和其他文本文件会上传服务器吗?

不会。页面直接读取原始字节,BOM 检查、UTF-8 严格校验、旧式编码候选、文字预览和新文件生成都在浏览器本地完成。关闭页面前请下载结果,网站不会代为保存源文件或转换文件。

为什么自动检测 GBK、Big5 或 Shift_JIS 不能保证 100% 正确?

很多旧式编码没有 BOM,同一组字节在另一种编码下也可能碰巧变成可显示字符,短文件尤其难判断。工具会评分并列出候选,但最终要根据原系统、语言、专有名词和标点人工确认;不要只看“没有 �”就认定编码正确。

Excel 打开中文 CSV 乱码应该选择哪种输出?

优先试 UTF-8 BOM,它会在开头加入 EF BB BF,能帮助许多 Windows 版 Excel 识别 UTF-8。更可靠的流程是从 Excel 的“数据 → 从文本/CSV”导入并明确选择 UTF-8,而不是直接双击;目标系统明确要求无 BOM 时再选普通 UTF-8。

UTF-8、UTF-8 BOM 和 UTF-16 有什么区别?

UTF-8 是网页和程序最常用的 Unicode 编码;UTF-8 BOM 只多了三个识别字节,适合部分桌面软件;UTF-16 用两个或四个字节表达字符,并分小端和大端。接口、数据库和网站通常优先 UTF-8,除非目标软件明确要求 UTF-16。

文件里出现 � 代表什么?

� 是 Unicode 替换字符,说明某些原始字节不能按当前来源编码解释。切换候选编码并对照原文;如果文件之前已经用错误编码打开后又保存,原字节可能被替换或丢失,转换工具无法凭空恢复全部内容。

为什么工具不直接把结果导出成 GBK 或 Big5?

浏览器原生 TextEncoder 可靠输出 UTF-8,而旧式多字节编码写出需要额外映射表,容易造成生僻字丢失。当前工具专注把遗留编码安全读取并迁移到 UTF-8/UTF-16;只有目标旧系统明确要求 GBK/Big5 时,才应使用经过该系统验证的专业转换链。