Conversor de codificação

Texto cheio de símbolos estranhos? Leia na codificação certa e salve como UTF-8.

100% privado — funciona inteiramente no seu navegador. Seus dados são processados no seu dispositivo e nunca enviados para a internet.

Abra um arquivo de texto com os caracteres errados e salve de novo na codificação certa — ou cole o texto estragado direto aqui.

Clique para enviar ou solte um arquivo de texto

TXT, CSV, SRT, JSON, código — lido no seu navegador, nunca enviado

Vendo "버그" ou "Café" no lugar de palavras de verdade? Deixe Detectar para mim ligado e marque Consertar. Se o arquivo continuar errado, escolha em Ler o arquivo como a página de código usada no seu país.

Sobre o Conversor de codificação

Você abre um arquivo e, em vez de palavras, vê Café, 버그, 文字化ã ou uma fileira de pontos de interrogação. O texto não está danificado — ele só está sendo lido com a codificação errada. Esta ferramenta o lê com a certa e salva de novo como UTF-8, para que dali em diante todo programa mostre tudo direito.

É o trabalho que o chcp faz no prompt de comando do Windows e que *Salvar como → Codificação* faz no Bloco de Notas. Aqui são dois cliques, e o arquivo fica no seu aparelho — quem decodifica é o seu navegador.

Dois problemas comuns que ele resolve

  • Um arquivo vindo de um programa antigo — um CSV, um arquivo de legenda ou um .txt salvo na página de código antiga do seu país (Windows-1252, EUC-KR, Shift_JIS, GBK, Big5, Windows-1251…). Escolha essa página em Ler o arquivo como e salve como UTF-8.
  • Mojibake — texto que já é Unicode mas mostra é onde deveria haver é, porque em algum ponto bytes UTF-8 foram lidos como Windows-1252. Marque Consertar e ele volta ao normal.

O que dá para fazer

  • Converter ANSI para UTF-8 para o arquivo abrir certo em qualquer lugar
  • Adicionar um BOM UTF-8 para o Excel parar de estragar os acentos ao abrir seu CSV
  • Remover um BOM que está atrapalhando um programa ou uma página web
  • Consertar um arquivo de legenda (.srt, .vtt) cujos acentos ou hangul saem como símbolos
  • Converter arquivos coreanos EUC-KR, japoneses Shift_JIS, chineses GBK ou Big5 para UTF-8
  • Trocar o fim de linha entre Windows (CRLF) e Mac/Linux (LF) no mesmo passo

Recursos

  • Detecção automática — BOM, UTF-16 e UTF-8 válido são identificados para você, e o palpite aparece na tela
  • Mais de 20 codificações para leitura — UTF-8, UTF-16 LE/BE, a família Windows-125x, ISO-8859, EUC-KR, Shift_JIS, EUC-JP, GBK, GB18030, Big5, KOI8-R e Mac Roman
  • Seis formas de salvar — UTF-8, UTF-8 com BOM, UTF-16 LE, UTF-16 BE, Windows-1252 e ISO-8859-1
  • Conserto de mojibake para o caso clássico de UTF-8 lido como 1252
  • Controle do fim de linha — manter, CRLF ou LF
  • Prévia ao vivo para conferir antes de baixar
  • Um aviso se caracteres fossem perdidos ao salvar numa página de código pequena
  • Modo colar para um trecho de texto quebrado, quando você não tem arquivo
  • 100% no seu navegador — nada é enviado

Qual a certeza da detecção? Para que serve "Ler o arquivo como"?

Um arquivo de texto simples é só bytes — ele não registra a própria codificação em lugar nenhum. É por isso que o HTML precisa de <meta charset> e o e-mail precisa de um cabeçalho charset=: sem eles, a codificação tem de ser deduzida dos bytes.

E os mesmos bytes são válidos em muitas codificações. Os dois bytes B0 A1 são válidos em todas estas:

| Lido como | Você obtém |

|---|---|

| EUC-KR | 가 |

| GB18030 | 啊 |

| Big5 | 陛 |

| Windows-1252 | °¡ |

| Windows-1251 | °Ў |

Verificação rigorosa também não resolve — texto coreano de verdade decodifica sem nenhum erro como Shift_JIS, Big5, GB18030 e Windows-1251 também. Por isso a ferramenta julga o *resultado*: decodifica com cada candidata e fica com a que produz uma escrita coerente e uma proporção sensata de caracteres não ingleses.

O que isso significa na prática:

  • UTF-8, UTF-16 e qualquer arquivo com BOM — identificados com certeza.
  • Texto só em inglês — certeza, e toda codificação daqui lê igual.
  • Uma página de código antiga — a ferramenta aponta a mais provável e mostra as concorrentes próximas como botões clicáveis. Coreano, japonês e cirílico costumam ser identificados com precisão.
  • Chinês simplificado, tradicional e kanji japonês, e Windows-1252 contra 1258, podem ser realmente indistinguíveis — os padrões de bytes se sobrepõem. É aí que você usa Ler o arquivo como e deixa a prévia decidir.

O campo é um recurso de reserva, não um passo. Deixe em Detectar para mim a menos que a prévia esteja errada.

Por que meu arquivo não mudou?

Essa é a surpresa mais comum, e não é defeito. Se o seu texto usa só letras do inglês, números e pontuação (o que se chama ASCII), então UTF-8, Windows-1252 e ISO-8859-1 guardam tudo com exatamente os mesmos bytes. Não há o que converter, então o arquivo salvo é idêntico e qualquer verificador continua dizendo UTF-8.

Agora a ferramenta avisa quando isso acontece. Se você precisa que os bytes realmente mudem, escolha UTF-16 LE / BE ou UTF-8 com BOM — esses sempre mudam o arquivo. As codificações só começam a diferir quando o texto tem acentos, hangul, kanji, cirílico ou outros caracteres não ingleses.

Como usar

  • Solte seu arquivo de texto aqui — a ferramenta adivinha a codificação e mostra o texto
  • Olhe a prévia. Se estiver legível, acabou; se não, mude Ler o arquivo como para a página de código de onde o arquivo veio, ou marque Consertar para estragos do tipo é
  • Escolha como salvarUTF-8 (sem BOM) é a resposta certa quase sempre. Use UTF-8 com BOM se o arquivo for um CSV que você vai abrir no Excel
  • (Opcional) defina o fim de linha que quiser
  • Clique em Baixar para salvar o arquivo consertado. A codificação vai no nome do arquivonotes-ANSI-1252-AppAndTools.txt, notes-UTF-8-AppAndTools.txt — então, se você salvar o mesmo arquivo em duas codificações, sempre dá para diferenciar

Adicionamos novas ferramentas com frequência — inscreva-se no YouTube para ser avisado a cada lançamento.

Mais ferramentas

Ver tudo

Aplicativos recomendados

Ver tudo