Inspector de Caracteres Unicode - Puntos de Código, Bytes UTF-8 y Escapes
Inspector de Caracteres Unicode
Vea exactamente qué caracteres contiene un texto
Carácter a Carácter
Punto de código, categoría, escritura, UTF-8 y UTF-16 de cada carácter, con los invisibles resaltados.
Escapes Listos
Copie escapes \u para JavaScript o Python, entidades HTML, escapes CSS o codificación porcentual.
Cuatro Formas de Contar
Vea por qué un emoji puede ser 1 carácter visible, 2 puntos de código, 4 unidades UTF-16 y 8 bytes.
Privado
Todo se ejecuta en su navegador; nada de lo que pegue se sube.
Puntos de Código, Bytes y Lo que Ve
Cada carácter Unicode tiene un punto de código, como U+00E9 para é. UTF-8, la codificación de la web, lo guarda en 1 a 4 bytes; UTF-16, usado en JavaScript, Java y Windows, usa una o dos unidades de 16 bits. Lo que parece un solo carácter puede ser varios puntos de código: é puede ser un carácter precompuesto o una e más un acento combinante, y una mano saludando con tono de piel son dos puntos de código. Por eso las longitudes de cadena y los límites en bytes no suelen coincidir.
La normalización permite comparar este tipo de texto: NFC compone los caracteres (lo habitual para almacenar), NFD los descompone, y las formas K además simplifican caracteres de compatibilidad, como la ligadura fi en f e i. Se resaltan los caracteres de formato invisibles (categoría Cf), como espacios de ancho cero y marcas de dirección, porque suelen causar errores desconcertantes en búsquedas, contraseñas y código.
Puntos Clave
- La longitud es ambigua: Caracteres visibles, puntos de código, unidades UTF-16 y bytes difieren.
- Normalice antes de comparar: Use NFC para que é y e + acento coincidan.
- Detecte invisibles: Los caracteres de formato y control se señalan en la tabla.