Une IA ne se « souvient » de rien. À chaque réponse, elle relit tout — dans une fenêtre qui finit par déborder.
Pas de tiroir à souvenirs, pas de carnet. Un modèle de langage lit le texte qu'on lui donne, découpé en tokens, dans une fenêtre de contextede taille limitée. Ce qui n'y tient plus disparaît. Voici, sans mystère ni hype, ce qu'une IA retient vraiment — et ce qu'elle oublie.
Vulgarisation honnête. Les nombres des démos sont illustratifs; aucune statistique n'est inventée. Définition sourcée en bas de page.
La fenêtre de contexte, en vrai
La fenêtre est un budget de place, compté en tokens. Ajoutez des messages : tant qu'il reste de la place, tout est lu. Quand ça déborde, les plus anciens sortent du cadre— l'IA ne les voit plus. Réduisez la fenêtre pour voir l'oubli arriver plus vite.
- Bonjour ! Je m'appelle Léa et je prépare un exposé sur la mémoire.
- Enchanté Léa. Avec plaisir : par quel angle veux-tu commencer ?
- D'abord, comment toi, une IA, tu te « souviens » de notre échange ?
- Je relis tout l'historique à chaque réponse, tant qu'il tient dans ma fenêtre.
Tout tient dans la fenêtre : rien n'est encore oublié.
Astuce de lecture : un tokenn'est pas un mot mais souvent un bout de mot. Le budget ci-dessus est un ordre de grandeur de démonstration, pas la capacité d'un modèle réel — celles-ci varient et évoluent vite.
Formation études : par où commencer ?
Quelques questions pour obtenir une orientation claire et la liste des vérifications officielles avant de vous engager.
« Lire », pour une IA, c'est découper en tokens
Avant tout calcul, le texte est tranché en petites unités. C'est ça qu'on compte, et c'est ça qui remplit la fenêtre. Voici la même phrase, côté humain puis côté machine (découpage illustratif).
L'intelligence artificielle découpe le texte en petits morceaux.
L'intelligence artificielle découpe le texte en petits morceaux.
Plus un échange est long, plus il consomme de tokens — et plus vite la fenêtre se remplit. C'est aussi pour ça que « résumer avant de continuer » aide une IA à tenir le fil.
Combien de tokens dans votre texte ?
Collez n'importe quel texte — un prompt, un e-mail, un extrait — et voyez instantanément son estimation en tokenset ce qu'il occupe dans différentes fenêtres de contexte.
Estimation heuristique côté client (~4 caractères par token, comme le français courant). Aucune donnée n'est envoyée nulle part.
Collez un texte ci-dessus pour voir son estimation en tokens.
Heuristique adaptée au français : environ 4 caractères par token. Le découpage réel dépend du modèle et de son tokenizer (souvent BPE) — les frontières exactes diffèrent, mais l'ordre de grandeur reste fiable pour évaluer si votre texte tiendra dans une fenêtre de contexte.
Pourquoi l'IA vous « oublie » entre deux conversations
Par défaut, un modèle est « stateless »: sans état. Il ne conserve aucune session. Fermez l'onglet, revenez demain : pour lui, c'est une page blanche. Le « il se souvient de moi » des assistants n'est pas de la mémoire du modèle — c'est une couche ajoutée par-dessus.
- Sans étatLe modèle ne garde rien entre deux requêtes. Chaque appel est isolé.
- L'illusion de continuitéDans une même conversation, l'appli renvoie tout l'historique à chaque tour : c'est ça qui donne l'impression d'un fil.
- D'une fois sur l'autrePour « se souvenir » demain, un système ré-injecte un résumé ou des notes dans le contexte de la prochaine conversation.
RAG : donner à l'IA les bons documents, au bon moment
Le RAG (retrieval-augmented generation, génération augmentée par récupération) ne donne pas de mémoire au modèle : il va chercher des extraits pertinents et les glisse dans la fenêtre avant de répondre. Cliquez une étape pour la comprendre.
1 · La question
Tout part de votre question. Seule, l'IA n'y répondrait qu'avec ce qu'elle a appris à l'entraînement — figé à une date, et sans accès à vos documents.
Un embeddingest une représentation chiffrée du sens : des textes proches par le sens donnent des vecteurs proches. C'est ce qui permet de « retrouver » un passage utile sans chercher des mots exacts.
Mémoire d'IA, mémoire humaine : rien à voir
La métaphore de la « mémoire » est commode mais trompeuse. Côte à côte, les différences sautent aux yeux — et aucune des deux n'est « meilleure » : elles ne font pas la même chose.
Vous gardez un souvenir, même flou, de vos échanges d'hier.
Sans dispositif ajouté, l'IA repart de zéro à chaque nouvelle conversation.
Vous reliez naturellement le début et la fin d'une longue discussion.
Elle ne « voit » que ce qui tient dans sa fenêtre ; le reste est hors de portée.
Oubli progressif : les détails s'estompent, l'essentiel reste souvent.
Oubli net et brutal : ce qui sort de la fenêtre disparaît d'un coup, intégralement.
Un indice, une odeur, un mot peuvent rappeler un souvenir enfoui.
Rien ne « remonte » seul : il faut lui re-fournir l'information dans le contexte.
Vous savez ce que vous savez, et souvent que vous ne savez pas.
Elle prédit des mots plausibles ; quand le contexte manque, elle peut inventer.
« Grand modèle de langage », par définition
Un grand modèle de langage, grand modèle linguistique, grand modèle de langue, modèle de langage de grande taille ou encore modèle massif de langage est un modèle de langage possédant un grand nombre de paramètres.
« Paramètres » : les valeurs internes apprises à l'entraînement. Elles encodent du savoir général, mais ce ne sont pas vos conversations — d'où le besoin d'une fenêtre de contexte, et parfois d'un RAG.
Ce qu'on se demande vraiment
Une IA a-t-elle vraiment une « mémoire » ?
Au sens humain, non. Un modèle de langage ne stocke pas vos conversations passées. À chaque réponse, il relit l'historique fourni dans sa fenêtre de contexte et prédit la suite. Tout ce qui n'est pas dans cette fenêtre n'existe pas pour lui à cet instant.
C'est quoi la « fenêtre de contexte » ?
C'est la quantité de texte que le modèle peut prendre en compte d'un seul coup, mesurée en tokens (des bouts de mots). Question, historique, documents, réponse en cours : tout doit y tenir. Quand c'est plein, le plus ancien sort du cadre — d'où l'impression que l'IA « oublie » le début d'une longue discussion.
Pourquoi l'IA m'oublie-t-elle d'une conversation à l'autre ?
Parce qu'elle est « stateless » (sans état) par défaut : aucune session ne conserve ce que vous avez dit. Les assistants qui semblent vous reconnaître ajoutent une couche par-dessus — ils ré-injectent un résumé ou des notes dans le contexte de la conversation suivante.
Et le RAG, la « mémoire persistante » : c'est de la triche ?
Non, c'est de l'ingénierie. Le RAG va chercher des passages pertinents dans une base de documents et les colle dans le contexte avant de répondre. La « mémoire persistante » fait pareil avec des notes vous concernant. Le modèle ne se souvient toujours pas : on lui re-montre l'information au bon moment.
Pourquoi une IA invente-t-elle parfois (hallucination) ?
Un modèle de langage prédit le mot le plus probable, pas le mot vrai. Quand le contexte manque, ou que la question dépasse ce qu'il a sous les yeux, il comble le vide avec quelque chose de plausible — qui peut être faux. Lui donner les bons documents (RAG) réduit ce risque sans l'annuler.
Les chiffres montrés ici sont-ils réels ?
Non : le budget de tokens et les « coûts » de la démo sont volontairement illustratifs, juste là pour rendre le mécanisme visible. Les capacités réelles varient selon les modèles et changent vite. Pour des notions définies, ce site cite Wikipédia (avec la date du relevé).
Un projet où la mémoire de l'IA compte ?
Assistant qui doit « se souvenir », recherche dans vos documents (RAG), limites de contexte à dompter… Décrivez votre besoin : on vous répond avec des explications claires, pas du jargon.