Un grand modèle de langage (LLM, pour large language model) est un programme entraîné à prédire le fragment de texte suivant, appelé token, à partir des précédents. Tout ce qu’il fait (répondre, traduire, écrire du code) se ramène à répéter cette prédiction de nombreuses fois. Trois concepts expliquent l’essentiel de son comportement pratique : les tokens (l’unité avec laquelle il lit et écrit), la fenêtre de contexte (combien de texte il peut prendre en compte à la fois) et la température (combien de hasard il introduit en choisissant chaque token).
Cet article explique les trois sans mathématiques, avec ce qu’il faut savoir en tant que développeur pour utiliser ces outils avec discernement.
Ce qu’est un token
Les modèles ne travaillent ni avec des lettres ni avec des mots, mais avec des tokens : des fragments de texte d’un vocabulaire fixe (généralement entre 30 000 et 200 000 entrées) construit pendant l’entraînement avec des algorithmes comme BPE (byte-pair encoding). Un mot anglais fréquent est généralement un token ; un mot moins courant, un nom propre ou un mot dans une autre langue se découpe en plusieurs. Les espaces, la ponctuation et les sauts de ligne comptent aussi.
Conséquences pratiques :
- Le coût et les limites se mesurent en tokens, pas en mots. En règle approximative, en anglais un token équivaut à environ quatre caractères ; en français la proportion est un peu moins bonne parce que les vocabulaires sont souvent optimisés pour l’anglais, donc le même texte consomme plus de tokens.
- Le modèle ne « voit » pas les lettres. C’est pourquoi des tâches comme compter les lettres d’un mot ou l’inverser lui sont étonnamment difficiles : le mot lui arrive sous forme d’un ou deux tokens opaques.
- Les nombres et le code se tokenisent de façon irrégulière, ce qui explique une partie des erreurs arithmétiques.
La documentation de Hugging Face sur les tokenizers décrit les algorithmes habituels si vous voulez approfondir.
Ce qu’est la fenêtre de contexte
La fenêtre de contexte est le nombre maximal de tokens que le modèle peut prendre en compte en un seul appel : elle inclut vos instructions, l’historique de la conversation, les documents joints et la réponse elle-même en cours de génération. C’est toute la « mémoire de travail » du modèle : ce qui n’est pas dans la fenêtre n’existe pas pour lui.
Les implications sont directes :
- Un modèle ne se souvient pas des conversations précédentes par lui-même. Si une application semble se souvenir, c’est qu’elle renvoie l’historique (ou un résumé) à chaque appel.
- Quand une longue conversation dépasse la fenêtre, l’application doit tronquer ou résumer, et le modèle perd des détails du début.
- Qu’un modèle accepte un contexte très grand ne garantit pas qu’il exploite bien toute l’information : la qualité se dégrade souvent avec des documents très longs, surtout pour les données situées au milieu du texte. Mieux vaut placer l’important au début ou à la fin et demander des références précises.
La taille de la fenêtre varie beaucoup selon les modèles et les versions, et change souvent ; consultez toujours la documentation du fournisseur pour le chiffre actuel plutôt que de vous fier à un nombre mémorisé.
Ce que fait la température
À chaque étape, le modèle calcule une probabilité pour chaque token possible du vocabulaire. La température contrôle la façon de choisir parmi eux :
- Température 0 (ou proche) : on choisit presque toujours le token le plus probable. Réponses plus déterministes et reproductibles. Adaptée à l’extraction de données, la classification, le code et toute tâche ayant une réponse « correcte ».
- Température élevée (par exemple 0,8 à 1) : on laisse plus de chances aux tokens moins probables. Plus de variété et de créativité, mais aussi plus de risques d’incohérences. Adaptée au remue-méninges ou à la rédaction au ton varié.
Deux nuances : même à température 0, la sortie peut varier légèrement d’une exécution à l’autre pour des raisons d’implémentation, et il existe d’autres paramètres d’échantillonnage (comme top-p) qui limitent l’ensemble des tokens candidats. Dans la plupart des cas, ajuster la température suffit.
Pourquoi ils se trompent avec tant d’assurance
Le modèle optimise un texte plausible, pas vrai. Quand il manque d’information, il génère quand même la continuation la plus probable, qui peut être une citation inventée, une fonction de bibliothèque inexistante ou une date erronée, rédigée avec le même ton assuré qu’une réponse correcte. On appelle couramment cela une « hallucination ».
En tant que développeur, les défenses sont connues :
- Fournissez l’information dans le contexte (documentation, données, le fichier concerné) au lieu de vous fier à ce qu’il « sait ». C’est l’idée derrière les techniques de récupération d’information (RAG).
- Demandez-lui de citer d’où vient chaque affirmation et vérifiez les citations.
- Vérifiez la sortie par des moyens indépendants : exécutez le code, validez le JSON, recoupez la donnée.
- Baissez la température pour les tâches factuelles.
Ce qu’il y a dessous : l’architecture en un paragraphe
Presque tous les LLM actuels reposent sur le transformer, une architecture présentée en 2017 dans l’article Attention Is All You Need. Son mécanisme central, l’attention, permet à chaque token de tenir compte de tous les autres tokens du contexte pour calculer sa représentation. Le modèle est d’abord entraîné sur d’énormes quantités de texte à prédire le token suivant, puis ajusté avec des exemples d’instructions et de réponses (et avec des retours humains) pour se comporter comme un assistant. Le cours de Hugging Face l’explique pas à pas.
Résumé pratique
| Concept | Ce que c’est | Quoi faire |
|---|---|---|
| Token | Unité de texte avec laquelle le modèle lit et écrit | Mesurer coût et limites en tokens ; ne pas attendre de précision au niveau des lettres |
| Fenêtre de contexte | Maximum de tokens par appel, réponse comprise | N’inclure que l’utile ; résumer les longues conversations ; l’important au début ou à la fin |
| Température | Degré de hasard dans le choix de chaque token | Basse pour les tâches factuelles et le code ; plus haute pour générer de la variété |
| Hallucination | Texte plausible mais faux | Apporter du contexte, demander des citations et toujours vérifier |
Conclusion
Un LLM prédit des tokens dans une fenêtre de contexte limitée, avec un degré de hasard que vous contrôlez avec la température. Comprendre ces trois concepts explique presque tout ce que vous verrez en pratique : pourquoi il compte mal les lettres, pourquoi il « oublie » dans les longues conversations, pourquoi il invente parfois et comment réduire chacun de ces problèmes. Ce n’est ni de la magie ni un moteur de recherche : c’est un générateur de texte très capable, qui donne de meilleurs résultats quand on lui fournit un bon contexte et qu’on vérifie sa sortie.