Guides Développement

Comment fonctionnent les outils de texte

Comment on compte mots et temps de lecture, la lisibilité de Flesch, les styles de casse, les différences de lignes, tri, doublons et échappement JSON, regex et SQL.

Dernière vérification:

AdSense Placeholder
Slot: header_reference_page
Sur cette page

La plupart des outils de texte font des choses simples, mais quelques détails décident s'ils donnent la réponse attendue : comment on compte un « mot », comment on note la lisibilité, ce qui rend deux lignes « identiques » et quels caractères doivent être échappés. Ce guide les explique, chaque exemple étant exécuté dans les propres outils du site.

Compter les mots et le temps

Un mot est une suite de lettres ou de chiffres, éventuellement reliée par une apostrophe ou un trait d'union (don't et well-known comptent chacun pour un mot). Les phrases se terminent par ., !, ? ou une ligne vide. Du nombre de mots on déduit le temps : la lecture silencieuse atteint en moyenne 238 mots par minute et la parole environ 150, donc 1 000 mots demandent à peu près 4,2 minutes de lecture. Utilisez le Compteur de Mots, qui compte aussi les caractères, et le Compteur de Fréquence de Mots pour voir quels termes reviennent : dans the cat and the hat and the bat, « the » représente 37,5 % des mots et « and » 25 %.

Noter la lisibilité

Le score de facilité de lecture de Flesch n'utilise que la longueur des phrases et les syllabes par mot :

206,835 − 1,015 × (mots / phrases) − 84,6 × (syllabes / mots)

Plus il est élevé, plus c'est facile : de 90 à 100 très facile, de 60 à 70 langage courant, de 30 à 50 difficile et sous 30 très difficile. Le niveau de Flesch-Kincaid transforme les mêmes deux nombres en classe scolaire américaine : 0,39 × (mots / phrases) + 11,8 × (syllabes / mots) − 15,59. Deux exécutions réelles (textes en anglais) :

Texte Mots Phrases Syllabes Facilité de lecture Niveau
"The cat sat on the mat. It was a sunny day, and the cat was happy." 16 2 18 103,5 (très facile) 0,8
"The committee reviewed the proposal and approved the revised budget." 10 1 18 44,4 (difficile) 9,6

Des mots et des phrases courts augmentent le score. Les syllabes sont comptées par approximation : prenez les scores comme une indication. Le Vérificateur de Lisibilité donne plusieurs indices à la fois. Visez un langage simple : phrases plus courtes et mots du quotidien.

Changer la casse

La même expression dans les styles de nommage courants, pratique pour le code et les URL :

Style Résultat Usage courant
camelCase wordFrequencyCounter Variables JavaScript
PascalCase WordFrequencyCounter Noms de classe
snake_case word_frequency_counter Python et colonnes de base de données
kebab-case word-frequency-counter URL et classes CSS
SCREAMING_SNAKE_CASE WORD_FREQUENCY_COUNTER Constantes
Title Case Word Frequency Counter Titres
Sentence case Word frequency counter Texte ordinaire

Le Convertisseur de Casse passe de l'un à l'autre, et pour les retours à la ligne utilisez le Supprimer les Sauts de Ligne (Windows termine les lignes par deux caractères, \r\n, tandis que Linux et macOS utilisent \n).

Comparer des textes

Une comparaison ligne à ligne trouve la plus longue sous-suite commune de lignes puis signale le reste comme supprimé ou ajouté. En comparant trois lignes à une version révisée de quatre :

Ancien texte Nouveau texte Différences
red green blue red yellow blue black red
− green
+ yellow
blue
+ black

Cela fait 2 ajoutées, 1 supprimée et 2 inchangées. Une ligne modifiée compte pour une suppression plus un ajout. Le Comparateur de Texte l'affiche côte à côte ; pour des données structurées, utilisez le Comparateur de JSON.

Trier et supprimer les doublons

  • L'ordre compte. Le tri alphabétique simple place 10 avant 2 : le résultat est 1, 10, 2. Le tri naturel compare les nombres par valeur et donne 1, 2, 10. Utilisez le Trier des Lignes avec le mode voulu.
  • Les doublons dépendent de la casse. Parmi a, b, a, A, le Supprimer les Lignes en Double garde 3 lignes, a, b, A, mais en ignorant la casse il n'en reste que 2, a, b.
  • Extrayez ce dont vous avez besoin. Le Extracteur de Texte liste les e-mails, URL, numéros de téléphone ou nombres d'un bloc de texte.

Échapper les caractères spéciaux

Des caractères comme les guillemets et les barres obliques inverses ont un sens dans le code : il faut donc les échapper quand ce sont des données. Le Échapper et Désécaper des Chaînes traite chaque langage :

Langage Entrée Échappé
JSON He said "hi" plus un saut de ligne He said \"hi\"\n
Regex a.b*c a\.b\*c
SQL O'Brien O''Brien

Échapper le SQL à la main est un dernier recours : utilisez des requêtes paramétrées, qui évitent totalement l'Injection SQL. Échappez pour le contexte où vous êtes ; le HTML demande des entités, voyez les Entités HTML.

Texte de remplissage

Lorem ipsum est un faux texte dérivé d'une œuvre de Cicéron, utilisé pour remplir des maquettes sans distraire par le sens. Générez la quantité voulue avec le Générateur de Lorem Ipsum et remplacez-le par du vrai texte avant la mise en ligne.

Erreurs fréquentes

  • Se fier à un score de lisibilité pour un texte non anglais. Les formules ont été calibrées pour l'anglais.
  • Trier des nombres comme du texte. Utilisez le tri naturel ou numérique.
  • Ignorer les différences invisibles. Les espaces finaux et les différentes fins de ligne rendent « identiques » des lignes différentes.
  • Échapper pour le mauvais langage. Une chaîne échappée pour JSON n'est pas sûre pour une regex ou du SQL.

Essayez ces outils

Voir aussi

  • Guide Comment fonctionne JSON
    Les six types de valeur JSON, pourquoi l'analyse échoue, pièges des grands entiers et de l'ordre des clés.
  • Aide-mémoire Entités HTML
    Les entités HTML réellement utilisées, avec nom, code décimal et sens, les cinq caractères à échapper et le décodage des entités.
  • Aide-mémoire Aide-mémoire des expressions régulières (regex)
    La syntaxe des regex sur une page : classes de caractères, ancres, quantificateurs, groupes, assertions.
  • Glossaire Expression régulière (regex)
    Une expression régulière (regex) est un motif écrit dans une syntaxe compacte qui décrit un ensemble de chaînes, utilisé pour rechercher.
  • Glossaire Injection SQL
    L'injection SQL est une attaque dans laquelle une entrée est fabriquée pour qu'une partie soit exécutée comme des commandes de base de.
  • Glossaire Lorem ipsum
    Le lorem ipsum est un faux texte pseudo-latin servant à remplir des mises en page et des maquettes pour que les relecteurs se concentrent.

Questions fréquemment posées

Pour le grand public, 60 à 70 (langage courant) est une bonne cible. Les textes techniques ou juridiques obtiennent souvent moins ; le score est un repère, pas une règle.

AdSense Placeholder
Slot: footer_leaderboard