Fenêtre de contexte des LLM : pourquoi plus de tokens ne veut pas dire mieux
D'après Anthropic - Claude Sonnet 4 now supports 1M tokens of context, relayé par Le Big Data
Rédigé à partir de la source originale; chaque fait est vérifié contre le texte source.
À retenir
- La fenêtre de contexte est le volume maximal de tokens (unités de texte découpées) qu'un LLM peut traiter en même temps : instructions système, historique, documents et réponse générée doivent tous y tenir.
- Le calcul d'attention du Transformer coûte en O(n²) : allonger fortement le contexte augmente vite le calcul, la mémoire vive (VRAM) et la latence.
- Une fenêtre large ne garantit pas une bonne mémoire : l'étude Lost in the Middle (Liu et al., 2023) montre que les modèles retrouvent mal une information logée au centre d'un long contexte.
- Anthropic a ouvert en bêta publique, le 12 août 2025, une fenêtre de 1 million de tokens pour Claude Sonnet 4, permettant d'ingérer des bases de code de plus de 75 000 lignes.
- Le RAG (génération augmentée par récupération) et le chunking (découpage en blocs) restent des solutions pour limiter ce qu'on injecte dans le contexte plutôt que de tout y faire tenir.
Pourquoi ça compte
Comprendre les limites de la fenêtre de contexte évite de traiter les LLM comme des mémoires infinies : au-delà d'un certain volume, la fiabilité peut baisser et le coût de calcul grimpe fortement, ce qui pousse les équipes techniques vers des architectures de récupération ciblée (RAG) plutôt que vers le réflexe de tout injecter d'un coup.
Chiffre-clé
Depuis le 12 août 2025, Claude Sonnet 4 d'Anthropic accepte une fenêtre de contexte de 1 million de tokens en bêta publique, selon le blogue officiel d'Anthropic.
Action concrète
Avant de bâtir un pipeline autour d'un LLM, mesurez en tokens - pas en mots - ce que vous injectez réellement (system prompt, historique, documents) et privilégiez le RAG pour ne récupérer que les passages pertinents plutôt que de charger un corpus entier dans le contexte.
Repères datés
- 6 juillet 2023 - Publication de l'étude Lost in the Middle sur arXiv, qui documente la difficulté des LLM à retrouver une information logée au centre d'un long contexte.
- 15 février 2024 - Google annonce Gemini 1.5 Pro, capable de traiter jusqu'à 1 million de tokens en production, d'abord en accès limité.
- 12 août 2025 - Anthropic ouvre en bêta publique une fenêtre de contexte de 1 million de tokens pour Claude Sonnet 4.
Sources originale et média
Sources
- Anthropic - Claude Sonnet 4 now supports 1M tokens of context : Annonce officielle du 12 août 2025
- Google - Introducing Gemini 1.5, Google's next-generation AI model : Annonce officielle du 15 février 2024
- Lost in the Middle: How Language Models Use Long Contexts (arXiv 2307.03172) : Étude de Nelson F. Liu et al., 2023
- LeBigData - Comprendre la fenêtre de contexte : limites et solutions techniques des LLM : Article vulgarisé, source relais de cette fiche
- Relais média : Le Big Data →