Un token, c’est quoi au juste ?
Un token est l’unité de base qu’un modèle d’intelligence artificielle manipule quand il lit ou écrit du texte. Ce n’est pas tout à fait une lettre, ni tout à fait un mot : un token se situe entre les deux. Il peut représenter un mot entier, un morceau de mot, un simple caractère ou même un symbole de ponctuation.
Prenons un exemple. Un mot courant comme « chat » peut tenir en un seul token. Mais un mot plus long ou plus rare, comme « anticonstitutionnellement », sera découpé en plusieurs morceaux, par exemple « anti », « constitu », « tionnelle », « ment ». Chaque morceau est un token. L’idée est de représenter n’importe quel texte avec un vocabulaire limité de briques réutilisables.
Pourquoi l’IA passe par des tokens
Les modèles de langage, comme ceux qui font fonctionner les assistants conversationnels, ne « lisent » pas une phrase comme nous. Ils ne traitent pas le texte en entier : ils travaillent sur des séquences de tokens, les uns après les autres. Surtout, un modèle d’IA ne comprend pas directement les lettres : il ne sait manipuler que des nombres.
C’est là qu’intervient une étape clé appelée la « tokenisation ». Elle consiste d’abord à découper le texte en tokens, puis à convertir chaque token en un nombre. Le texte devient ainsi une suite de chiffres que le modèle peut traiter, analyser et prolonger pour générer sa réponse. Quand l’IA répond, elle fait l’inverse : elle produit des tokens qui sont ensuite retransformés en texte lisible.
Comment fonctionne le découpage
Chaque modèle possède son propre « tokenizer », c’est-à-dire l’algorithme chargé de découper le texte. Deux modèles différents peuvent donc découper la même phrase de manière légèrement différente et obtenir un nombre de tokens différent.
Plusieurs techniques existent pour construire ce découpage. Parmi les plus connues, on trouve le Byte-Pair Encoding, souvent abrégé BPE, et le WordPiece. Ces méthodes sont utilisées par des familles de modèles bien connues, comme les modèles de type GPT ou BERT. Leur principe commun : repérer les suites de caractères qui reviennent souvent pour en faire des tokens à part entière, tout en gardant la possibilité de découper en plus petits morceaux les mots rares. C’est un bon compromis entre un vocabulaire compact et la capacité à représenter n’importe quel mot.
Pourquoi c’est important pour vous
Comprendre les tokens aide à mieux utiliser l’IA au quotidien. Plus un texte est long, plus il contient de tokens. Or le nombre de tokens a trois conséquences concrètes.
- Le coût : les services d’IA accessibles par API facturent souvent à la quantité de tokens traités. Un texte plus long coûte donc plus cher à traiter.
- La vitesse : plus il y a de tokens à analyser et à générer, plus le temps de calcul augmente.
- La mémoire de la conversation : chaque modèle a une limite de tokens qu’il peut prendre en compte d’un seul coup. On appelle cela la « fenêtre contextuelle ».
Cette fenêtre contextuelle explique un phénomène que beaucoup ont remarqué : lors d’une très longue conversation, l’IA semble parfois « oublier » ce qui a été dit au début. Quand le total dépasse la capacité de la fenêtre, les éléments les plus anciens finissent par sortir du champ de vision du modèle. Une fenêtre plus grande permet des entrées plus longues et un meilleur maintien du contexte sur la durée.
Quelques ordres de grandeur
Pour se faire une idée, on retient souvent qu’en anglais, un token correspond en moyenne à environ quatre caractères, soit à peu près trois quarts d’un mot. Ces chiffres sont indicatifs et varient selon la langue : le français est souvent un peu plus « coûteux » en tokens que l’anglais, avec ses accents et ses mots plus longs.
Une astuce simple
Si vous voulez gagner en vitesse, limiter les coûts et éviter que l’IA perde le fil, le meilleur réflexe est d’être concis. Allez à l’essentiel, reformulez clairement vos demandes et n’hésitez pas à redonner le contexte important au fil d’une longue conversation. Vous aiderez le modèle à rester efficace et pertinent.




