打开显示乱码的文本文件,用正确的编码重新保存 — 也可以直接把乱码文字粘贴进来。
点击上传或把文本文件拖到这里
TXT、CSV、SRT、JSON、代码 — 在浏览器中读取,绝不上传看到的是“버그”或“Café”而不是正常文字?把自动识别保持开启,并勾选修复。如果文件仍然不对,请在按此编码读取中选择你所在地区使用的代码页。
关于编码转换器
你打开一个文件,看到的不是文字,而是 Café、버그、æ–‡å—化ã 或一连串问号。文字并没有损坏 —— 只是被用错误的编码读取了。这个工具用正确的编码读取它,再另存为 UTF-8,此后所有程序都能正确显示。
这就是 Windows 命令行里 chcp 做的事,也是记事本里*另存为 → 编码*做的事。在这里只需两次点击,而且文件始终留在你的设备上 —— 解码由你的浏览器完成。
它能解决的两个常见问题
- 来自老程序的文件 —— 用你所在地区的旧代码页(Windows-1252、EUC-KR、Shift_JIS、GBK、Big5、Windows-1251……)保存的 CSV、字幕文件或 .txt。在按此编码读取里选择那个代码页,然后保存为 UTF-8。
- 乱码(mojibake) —— 文字本身已经是 Unicode,却在该显示 é 的地方显示 é,因为某个环节把 UTF-8 字节当成了 Windows-1252。勾选修复即可复原。
你可以用它做什么
- 把 ANSI 转成 UTF-8,让文件在哪里都能正确打开
- 加上 UTF-8 BOM,让 Excel 打开你的 CSV 时不再把中文或重音字符弄坏
- 去掉 BOM,解决它给程序或网页带来的麻烦
- 修复字幕文件(.srt、.vtt),让变成符号的重音字母或韩文恢复正常
- 把韩文 EUC-KR、日文 Shift_JIS、中文 GBK 或 Big5 文件转成 UTF-8
- 顺便在 Windows(CRLF)和 Mac/Linux(LF)之间切换换行符
功能特点
- 自动识别 —— BOM、UTF-16 和合法 UTF-8 都会被识别出来,并显示判断依据
- 可读取 20 多种编码 —— UTF-8、UTF-16 LE/BE、Windows-125x 系列、ISO-8859、EUC-KR、Shift_JIS、EUC-JP、GBK、GB18030、Big5、KOI8-R 和 Mac Roman
- 六种保存方式 —— UTF-8、UTF-8 带 BOM、UTF-16 LE、UTF-16 BE、Windows-1252 和 ISO-8859-1
- 针对经典的“UTF-8 被当成 1252”情况的乱码修复
- 换行符控制 —— 保持、CRLF 或 LF
- 实时预览,下载前先确认无误
- 保存到较小的代码页时,如果会丢失字符会给出警告
- 没有文件时,可用粘贴模式处理一小段乱码文字
- 100% 在浏览器中完成 —— 不上传任何内容
识别有多准?为什么会有“按此编码读取”?
纯文本文件只是一串字节 —— 它并没有在任何地方记录自己的编码。正因如此,HTML 需要 <meta charset>,电子邮件需要 charset= 头;没有它们,编码就只能从字节推断。
而且同样的字节在很多编码里都是合法的。两个字节 B0 A1 在下列各种编码中都有效:
| 按此读取 | 得到 |
|---|---|
| EUC-KR | 가 |
| GB18030 | 啊 |
| Big5 | 陛 |
| Windows-1252 | °¡ |
| Windows-1251 | °Ў |
严格校验同样无法定论 —— 真实的韩文文本按 Shift_JIS、Big5、GB18030 和 Windows-1251 解码,也不会报任何错误。所以这个工具看的是*结果*:它用每一个候选编码去解码,保留那个能得到单一连贯文字体系、且非英文字符比例合理的结果。
这在实际使用中意味着:
- UTF-8、UTF-16 以及任何带 BOM 的文件 —— 可以确定地识别。
- 纯英文文本 —— 可以确定,而且这里的每种编码读出来都一样。
- 旧代码页 —— 工具会给出最可能的一种,并把差距很小的候选做成可点击的按钮。韩文、日文和西里尔文通常能被准确定位。
- 简体中文、繁体中文与日文汉字,以及 Windows-1252 与 1258,可能真的无法区分 —— 它们的字节规律相互重叠。这时就用按此编码读取,让预览来判断。
这个选项是备用手段,不是必经步骤。只要预览没问题,保持在自动识别即可。
为什么我的文件没有变化?
这是最常见的疑惑,而且并不是故障。如果你的文字只用到英文字母、数字和标点(也就是所谓的 ASCII),那么 UTF-8、Windows-1252 和 ISO-8859-1 存出来的字节完全一样。没有什么可转换的,所以保存的文件是相同的,任何检测工具依然会报告 UTF-8。
现在工具会在这种情况下告诉你。如果你确实需要字节有所不同,请选择 UTF-16 LE / BE 或 UTF-8 带 BOM —— 这几种一定会改变文件。只有当你的文字包含重音字母、韩文、汉字、西里尔字母等非英文字符时,各种编码才会真正产生差别。
使用方法
- 把文本文件拖进来 —— 工具会推断编码并把文字显示出来
- 看看预览。 如果读起来正常,就完成了;如果不正常,就把按此编码读取改成文件原本的代码页,或者对 é 这类损坏勾选修复
- 选择保存格式 —— 绝大多数情况下 UTF-8(无 BOM)都是正确答案。如果这个文件是要用 Excel 打开的 CSV,就选 UTF-8 带 BOM
- (可选)设置你想要的换行符
- 点击“下载”保存修好的文件。编码会写进文件名里 —— notes-ANSI-1252-AppAndTools.txt、notes-UTF-8-AppAndTools.txt —— 这样同一个文件存成两种编码时你也永远分得清