Abra um arquivo de texto com os caracteres errados e salve de novo na codificação certa — ou cole o texto estragado direto aqui.
Clique para enviar ou solte um arquivo de texto
TXT, CSV, SRT, JSON, código — lido no seu navegador, nunca enviadoVendo "버그" ou "Café" no lugar de palavras de verdade? Deixe Detectar para mim ligado e marque Consertar. Se o arquivo continuar errado, escolha em Ler o arquivo como a página de código usada no seu país.
Sobre o Conversor de codificação
Você abre um arquivo e, em vez de palavras, vê Café, 버그, æ–‡å—化ã ou uma fileira de pontos de interrogação. O texto não está danificado — ele só está sendo lido com a codificação errada. Esta ferramenta o lê com a certa e salva de novo como UTF-8, para que dali em diante todo programa mostre tudo direito.
É o trabalho que o chcp faz no prompt de comando do Windows e que *Salvar como → Codificação* faz no Bloco de Notas. Aqui são dois cliques, e o arquivo fica no seu aparelho — quem decodifica é o seu navegador.
Dois problemas comuns que ele resolve
- Um arquivo vindo de um programa antigo — um CSV, um arquivo de legenda ou um .txt salvo na página de código antiga do seu país (Windows-1252, EUC-KR, Shift_JIS, GBK, Big5, Windows-1251…). Escolha essa página em Ler o arquivo como e salve como UTF-8.
- Mojibake — texto que já é Unicode mas mostra é onde deveria haver é, porque em algum ponto bytes UTF-8 foram lidos como Windows-1252. Marque Consertar e ele volta ao normal.
O que dá para fazer
- Converter ANSI para UTF-8 para o arquivo abrir certo em qualquer lugar
- Adicionar um BOM UTF-8 para o Excel parar de estragar os acentos ao abrir seu CSV
- Remover um BOM que está atrapalhando um programa ou uma página web
- Consertar um arquivo de legenda (.srt, .vtt) cujos acentos ou hangul saem como símbolos
- Converter arquivos coreanos EUC-KR, japoneses Shift_JIS, chineses GBK ou Big5 para UTF-8
- Trocar o fim de linha entre Windows (CRLF) e Mac/Linux (LF) no mesmo passo
Recursos
- Detecção automática — BOM, UTF-16 e UTF-8 válido são identificados para você, e o palpite aparece na tela
- Mais de 20 codificações para leitura — UTF-8, UTF-16 LE/BE, a família Windows-125x, ISO-8859, EUC-KR, Shift_JIS, EUC-JP, GBK, GB18030, Big5, KOI8-R e Mac Roman
- Seis formas de salvar — UTF-8, UTF-8 com BOM, UTF-16 LE, UTF-16 BE, Windows-1252 e ISO-8859-1
- Conserto de mojibake para o caso clássico de UTF-8 lido como 1252
- Controle do fim de linha — manter, CRLF ou LF
- Prévia ao vivo para conferir antes de baixar
- Um aviso se caracteres fossem perdidos ao salvar numa página de código pequena
- Modo colar para um trecho de texto quebrado, quando você não tem arquivo
- 100% no seu navegador — nada é enviado
Qual a certeza da detecção? Para que serve "Ler o arquivo como"?
Um arquivo de texto simples é só bytes — ele não registra a própria codificação em lugar nenhum. É por isso que o HTML precisa de <meta charset> e o e-mail precisa de um cabeçalho charset=: sem eles, a codificação tem de ser deduzida dos bytes.
E os mesmos bytes são válidos em muitas codificações. Os dois bytes B0 A1 são válidos em todas estas:
| Lido como | Você obtém |
|---|---|
| EUC-KR | 가 |
| GB18030 | 啊 |
| Big5 | 陛 |
| Windows-1252 | °¡ |
| Windows-1251 | °Ў |
Verificação rigorosa também não resolve — texto coreano de verdade decodifica sem nenhum erro como Shift_JIS, Big5, GB18030 e Windows-1251 também. Por isso a ferramenta julga o *resultado*: decodifica com cada candidata e fica com a que produz uma escrita coerente e uma proporção sensata de caracteres não ingleses.
O que isso significa na prática:
- UTF-8, UTF-16 e qualquer arquivo com BOM — identificados com certeza.
- Texto só em inglês — certeza, e toda codificação daqui lê igual.
- Uma página de código antiga — a ferramenta aponta a mais provável e mostra as concorrentes próximas como botões clicáveis. Coreano, japonês e cirílico costumam ser identificados com precisão.
- Chinês simplificado, tradicional e kanji japonês, e Windows-1252 contra 1258, podem ser realmente indistinguíveis — os padrões de bytes se sobrepõem. É aí que você usa Ler o arquivo como e deixa a prévia decidir.
O campo é um recurso de reserva, não um passo. Deixe em Detectar para mim a menos que a prévia esteja errada.
Por que meu arquivo não mudou?
Essa é a surpresa mais comum, e não é defeito. Se o seu texto usa só letras do inglês, números e pontuação (o que se chama ASCII), então UTF-8, Windows-1252 e ISO-8859-1 guardam tudo com exatamente os mesmos bytes. Não há o que converter, então o arquivo salvo é idêntico e qualquer verificador continua dizendo UTF-8.
Agora a ferramenta avisa quando isso acontece. Se você precisa que os bytes realmente mudem, escolha UTF-16 LE / BE ou UTF-8 com BOM — esses sempre mudam o arquivo. As codificações só começam a diferir quando o texto tem acentos, hangul, kanji, cirílico ou outros caracteres não ingleses.
Como usar
- Solte seu arquivo de texto aqui — a ferramenta adivinha a codificação e mostra o texto
- Olhe a prévia. Se estiver legível, acabou; se não, mude Ler o arquivo como para a página de código de onde o arquivo veio, ou marque Consertar para estragos do tipo é
- Escolha como salvar — UTF-8 (sem BOM) é a resposta certa quase sempre. Use UTF-8 com BOM se o arquivo for um CSV que você vai abrir no Excel
- (Opcional) defina o fim de linha que quiser
- Clique em Baixar para salvar o arquivo consertado. A codificação vai no nome do arquivo — notes-ANSI-1252-AppAndTools.txt, notes-UTF-8-AppAndTools.txt — então, se você salvar o mesmo arquivo em duas codificações, sempre dá para diferenciar