Inspecteur de Caractères Unicode - Points de Code, Octets UTF-8 et Échappements

AdSense Placeholder
Slot: header_tool

Inspecteur de Caractères Unicode

Voyez exactement quels caractères contient un texte

Points de code
0
Caractères visibles
0
Unités UTF-16 (length JS)
0
Octets UTF-8
0
Car.Code pointCatégorieÉcritureUTF-8UTF-16Échappement

Seuls les 500 premiers caractères sont listés.

Formes de normalisation
NFC
--
NFD
--
NFKC
--
NFKD
--

AdSense Placeholder
Slot: tool_mid_article

Caractère par Caractère

Point de code, catégorie, écriture, UTF-8 et UTF-16 de chaque caractère, les invisibles étant mis en évidence.

Échappements Prêts

Copiez des échappements \u pour JavaScript ou Python, des entités HTML, des échappements CSS ou l'encodage pourcent.

Quatre Façons de Compter

Voyez pourquoi un emoji peut faire 1 caractère visible, 2 points de code, 4 unités UTF-16 et 8 octets.

Privé

Tout s'exécute dans votre navigateur ; rien de ce que vous collez n'est envoyé.

Points de Code, Octets et Ce que Vous Voyez

Chaque caractère Unicode a un point de code, comme U+00E9 pour é. L'UTF-8, l'encodage du web, le stocke sur 1 à 4 octets ; l'UTF-16, utilisé par JavaScript, Java et Windows, emploie une ou deux unités de 16 bits. Ce qui ressemble à un seul caractère peut compter plusieurs points de code : é peut être un caractère précomposé ou un e suivi d'un accent combinant, et une main qui salue avec une couleur de peau compte deux points de code. C'est pourquoi longueurs de chaîne et limites en octets divergent souvent.

La normalisation rend ce type de texte comparable : NFC compose les caractères (le choix habituel pour le stockage), NFD les décompose, et les formes K ramènent aussi les caractères de compatibilité, comme la ligature fi, à f et i. Les caractères de format invisibles (catégorie Cf), comme les espaces de largeur nulle et les marques de direction, sont mis en évidence, car ils provoquent souvent des bogues déroutants dans les recherches, les mots de passe et le code.

Points Clés

  • La longueur est ambiguë: Caractères visibles, points de code, unités UTF-16 et octets diffèrent.
  • Normalisez avant de comparer: Utilisez NFC pour que é et e + accent correspondent.
  • Repérez les invisibles: Les caractères de format et de contrôle sont signalés dans le tableau.
AdSense Placeholder
Slot: footer_leaderboard