Convertidor de codificación

¿El texto sale con símbolos raros? Léelo en la codificación correcta y guárdalo como UTF-8.

100 % privado — funciona totalmente en tu navegador. Tus datos se procesan en tu dispositivo y nunca se envían a Internet.

Abre un archivo de texto cuyos caracteres se ven mal y vuelve a guardarlo en la codificación correcta, o pega directamente el texto estropeado.

Haz clic para subir o suelta un archivo de texto

TXT, CSV, SRT, JSON, código: se lee en tu navegador, nunca se sube

¿Ves «ë²„ê·¸» o «Café» en lugar de palabras de verdad? Deja Detectar por mí activado y marca Reparar. Si el archivo sigue mal, elige la codificación de tu país en Leer el archivo como.

Acerca del Convertidor de codificación

Abres un archivo y en vez de palabras ves Café, 버그, 文字化ã o una fila de interrogantes. El texto no está dañado: se está leyendo con la codificación equivocada. Esta herramienta lo lee con la correcta y lo vuelve a guardar como UTF-8, para que a partir de ahí todos los programas lo muestren bien.

Es lo que hace chcp en la ventana de comandos de Windows y *Guardar como → Codificación* en el Bloc de notas. Aquí son dos clics, y el archivo se queda en tu dispositivo: la descodificación la hace tu navegador.

Dos problemas habituales que resuelve

  • Un archivo de un programa antiguo: un CSV, un archivo de subtítulos o un .txt guardado en la codificación antigua de tu país (Windows-1252, EUC-KR, Shift_JIS, GBK, Big5, Windows-1251…). Elige esa codificación en Leer el archivo como y guarda como UTF-8.
  • Mojibake: texto que ya es Unicode pero muestra é donde debería haber é, porque en algún punto se leyeron bytes UTF-8 como Windows-1252. Marca Reparar y se recompone.

Qué puedes hacer con esto

  • Convertir ANSI a UTF-8 para que un archivo se abra bien en todas partes
  • Añadir un BOM UTF-8 para que Excel deje de destrozar las tildes al abrir tu CSV
  • Quitar un BOM que está molestando a un programa o a una página web
  • Arreglar un archivo de subtítulos (.srt, .vtt) cuyas tildes o hangul salen como símbolos
  • Convertir archivos coreanos EUC-KR, japoneses Shift_JIS, chinos GBK o Big5 a UTF-8
  • Cambiar el fin de línea entre Windows (CRLF) y Mac/Linux (LF) al mismo tiempo

Características

  • Detección automática: BOM, UTF-16 y UTF-8 válido se detectan por ti, y se muestra la estimación
  • Más de 20 codificaciones de lectura: UTF-8, UTF-16 LE/BE, la familia Windows-125x, ISO-8859, EUC-KR, Shift_JIS, EUC-JP, GBK, GB18030, Big5, KOI8-R y Mac Roman
  • Seis formas de guardar: UTF-8, UTF-8 con BOM, UTF-16 LE, UTF-16 BE, Windows-1252 e ISO-8859-1
  • Reparación de mojibake para el caso clásico de UTF-8 leído como 1252
  • Control del fin de línea: mantener, CRLF o LF
  • Vista previa en vivo para comprobar antes de descargar
  • Un aviso si se perderían caracteres al guardar en una codificación pequeña
  • Modo pegar para un fragmento de texto roto, cuando no tienes archivo
  • 100 % en tu navegador: no se sube nada

¿Cuánta certeza hay? ¿Para qué está «Leer el archivo como»?

Un archivo de texto plano son solo bytes: no guarda su propia codificación en ninguna parte. Por eso HTML necesita <meta charset> y el correo necesita una cabecera charset=: sin ellos, la codificación hay que deducirla de los bytes.

Y los mismos bytes son válidos en muchas codificaciones. Los dos bytes B0 A1 son válidos en todas estas:

| Leído como | Obtienes |

|---|---|

| EUC-KR | 가 |

| GB18030 | 啊 |

| Big5 | 陛 |

| Windows-1252 | °¡ |

| Windows-1251 | °Ў |

La comprobación estricta tampoco lo resuelve: texto coreano real se descodifica sin ningún error también como Shift_JIS, Big5, GB18030 y Windows-1251. Por eso la herramienta juzga el *resultado*: descodifica con cada candidata y se queda con la que produce una escritura coherente y una proporción sensata de caracteres no ingleses.

Qué significa esto en la práctica:

  • UTF-8, UTF-16 y cualquier archivo con BOM: identificados con certeza.
  • Texto en inglés simple: certeza, y todas las codificaciones de aquí lo leen igual.
  • Una codificación antigua: la herramienta nombra la más probable y muestra las que quedan cerca como botones que puedes pulsar. Coreano, japonés y cirílico suelen quedar determinados con exactitud.
  • Chino simplificado / tradicional / kanji japonés, y Windows-1252 frente a 1258, pueden ser realmente indistinguibles: los patrones de bytes se solapan. Ahí es cuando usas Leer el archivo como y dejas que decida la vista previa.

El campo es un recurso de reserva, no un paso. Déjalo en Detectar por mí salvo que la vista previa se vea mal.

¿Por qué no ha cambiado mi archivo?

Es la sorpresa más común, y no es un fallo. Si tu texto solo usa letras inglesas, cifras y signos de puntuación (lo que se llama ASCII), entonces UTF-8, Windows-1252 e ISO-8859-1 lo guardan con exactamente los mismos bytes. No hay nada que convertir, así que el archivo guardado es idéntico y cualquier comprobador sigue diciendo UTF-8.

Ahora la herramienta te lo advierte. Si necesitas que los bytes cambien de verdad, elige UTF-16 LE / BE o UTF-8 con BOM: esos siempre cambian el archivo. Las codificaciones solo empiezan a diferir cuando tu texto contiene tildes, hangul, kanji, cirílico u otros caracteres no ingleses.

Cómo usarlo

  • Suelta ahí tu archivo de texto: la herramienta adivina la codificación y te muestra el texto
  • Mira la vista previa. Si se lee bien, ya está; si no, cambia Leer el archivo como a la codificación de la que venía el archivo, o marca Reparar para daños del tipo é
  • Elige cómo guardarlo: UTF-8 (sin BOM) es la respuesta correcta casi siempre. Usa UTF-8 con BOM si el archivo es un CSV que abrirás en Excel
  • (Opcional) ajusta el fin de línea que quieras
  • Pulsa Descargar para guardar el archivo arreglado. La codificación va en el nombre del archivo (notes-ANSI-1252-AppAndTools.txt, notes-UTF-8-AppAndTools.txt), así que si guardas el mismo archivo en dos codificaciones siempre podrás distinguirlos

Añadimos herramientas nuevas con frecuencia — suscríbete en YouTube para enterarte de cada novedad.

Más herramientas

Ver todo

Aplicaciones recomendadas

Ver todo