Compteur d'octets et de caractères
UTF-8
Comptez octets UTF-8, caractères, mots, lignes et phrases instantanément. Compteur d'octets en ligne gratuit.
Le comptage s’effectue dans votre navigateur ; le texte n’est pas envoyé.
Caractères
0
Mots
0
Lignes
0
Bytes (UTF-8)
0
- Caractères sans espaces0
- Phrases0
Indiquez la limite du formulaire ou de l’API. Espaces, sauts de ligne et emojis comptent en UTF-8.
Entrée
Qu'est-ce que cet outil ?
Mesure caractères, caractères sans espaces, mots, lignes, phrases et octets UTF-8. Les KPI se mettent à jour en direct ; rien n’est téléversé.
Les limites ne comptent pas la même chose : UI en caractères, base en octets, brief en mots, API en taille encodée. Le non-ASCII prend souvent plusieurs octets UTF-8 par glyphe.
Cas d'usage courants
- Vérifier méta, posts ou champs face aux plafonds caractères vs octets
- Comparer la longueur des traductions d’UI
- Mesurer la taille UTF-8 des payloads API ou logs
Comment utiliser
- Collez ou saisissez du texte. Les KPI (caractères, mots, lignes, octets UTF-8) se mettent à jour en haut.
- Consultez caractères sans espaces et phrases dans la rangée de chips.
- Utilisez Sample pour comparer ASCII et Hangul/emoji.
- Copiez le résumé ou Clear.
Exemples
| Entrée / réglage | Sortie | Notes |
|---|---|---|
Hello world. | chars 12 · no-spaces 11 · words 2 · lines 1 · sentences 1 · UTF-8 12 | ASCII simple. |
안녕하세요 | chars 5 · words 1 · UTF-8 15 | Hangul : ~3 octets UTF-8 par syllabe. |
Hi 👋 | chars 5 · words 2 · UTF-8 7 | 👋 = 2 unités UTF-16, 4 octets UTF-8 (total 7). |
One.\nTwo! | lines 2 · sentences 2 · words 2 | Nouvelle ligne et ponctuation. |
Vérifiez une limite UTF-8
Indiquez la limite du formulaire ou de l’API. À 10 octets, 안녕😀 occupe 10 et laisse 0 ; un espace donne 11 et dépasse de 1. Le résumé copié comprend la limite et les octets restants ou en trop.
Seul le texte est mesuré, sans guillemets JSON, échappements, en-têtes HTTP ni métadonnées. Le textarea normalise les sauts en LF ; un serveur stockant CRLF ajoute un octet par saut. UTF-8 diffère des autres encodages.
Pièges courants
- Octets UTF-8 ≠ caractères : Hangul, CJK et emoji gonflent la taille ; ne vous fiez pas au seul
lengthpour les quotas. - Mots découpés sur espaces : un texte CJK sans espaces compte souvent comme un mot—pas de tokeniseur linguistique.
- Le compte de caractères est la longueur UTF-16 JS : certains emoji font deux « caractères ».
- Les phrases sont heuristiques (
.!?) ; les abréviations peuvent surcompter.
Références
Dernière révision: 2026-10-11
Questions fréquentes
- Pourquoi les octets UTF-8 diffèrent-ils des caractères ?
- Les caractères utilisent la longueur JavaScript (unités UTF-16). Les octets sont la taille UTF-8 de TextEncoder. Le texte non ASCII (Hangul, emoji, accents) prend souvent plusieurs octets ; certains emoji font deux unités UTF-16 et quatre octets UTF-8.
- Comment compte-t-on les mots ?
- Après trim, découpage sur les espaces. Des espaces consécutifs = une coupure. Un texte sans espaces (souvent CJK) compte comme un mot.
- Les phrases sont-elles exactes pour toutes les langues ?
- Heuristique sur `.`, `!`, `?`. Abréviations (`Dr.`) ou autre ponctuation peuvent fausser le total.
- Le texte est-il téléversé ?
- Non. Le comptage s’exécute uniquement dans le navigateur.
- La limite inclut-elle une requête JSON complète ?
- Non. Seul le texte UTF-8 est comparé à la limite, sans guillemets, échappements JSON ni en-têtes HTTP. Les sauts sont en LF ; un serveur en CRLF peut stocker davantage d’octets.