/ EN CLAIR
La fenêtre de contexte est la quantité de texte que le modèle peut lire d'un seul coup, comptée en tokens. Elle contient tout : le prompt system, l'historique de la conversation, les fichiers joints, et la réponse en cours d'écriture.
Quand elle est pleine, il faut choisir. Soit on résume et on jette ce qui est ancien, soit on va chercher, au moment de répondre, seulement les passages utiles. C'est exactement ce que fait le RAG.
Une grande fenêtre ne dispense pas de trier. Plus on charge de texte, plus la réponse devient lente, chère, et paradoxalement moins précise : le modèle dilue son attention sur ce qui n'est pas pertinent.
/ COMMENT ÇA MARCHE
Ce que faitune fenêtre de contexte, dans l'ordre.
- 01Tout entre dedansPrompt system, historique, fichiers joints, et la réponse en cours.
- 02Le compteur monteChaque tour ajoute du texte, et le total se mesure en tokens.
- 03Il faut trierRésumer, jeter l'ancien, ou n'aller chercher que les passages utiles.
Une grande fenêtre ne dispense pas de trier : trop de texte rend la réponse lente, chère et moins précise.


