Pédagogie · mémoire des IA

Une IA ne se « souvient » de rien. À chaque réponse, elle relit tout — dans une fenêtre qui finit par déborder.

Pas de tiroir à souvenirs, pas de carnet. Un modèle de langage lit le texte qu'on lui donne, découpé en tokens, dans une fenêtre de contextede taille limitée. Ce qui n'y tient plus disparaît. Voici, sans mystère ni hype, ce qu'une IA retient vraiment — et ce qu'elle oublie.

Vulgarisation honnête. Les nombres des démos sont illustratifs; aucune statistique n'est inventée. Définition sourcée en bas de page.

L'outil

La fenêtre de contexte, en vrai

La fenêtre est un budget de place, compté en tokens. Ajoutez des messages : tant qu'il reste de la place, tout est lu. Quand ça déborde, les plus anciens sortent du cadre— l'IA ne les voit plus. Réduisez la fenêtre pour voir l'oubli arriver plus vite.

Fenêtre remplie57/64 tokens (illustratif)
  1. Bonjour ! Je m'appelle Léa et je prépare un exposé sur la mémoire.
  2. Enchanté Léa. Avec plaisir : par quel angle veux-tu commencer ?
  3. D'abord, comment toi, une IA, tu te « souviens » de notre échange ?
  4. Je relis tout l'historique à chaque réponse, tant qu'il tient dans ma fenêtre.

Tout tient dans la fenêtre : rien n'est encore oublié.

Astuce de lecture : un tokenn'est pas un mot mais souvent un bout de mot. Le budget ci-dessus est un ordre de grandeur de démonstration, pas la capacité d'un modèle réel — celles-ci varient et évoluent vite.

Outil gratuit

Formation études : par où commencer ?

Quelques questions pour obtenir une orientation claire et la liste des vérifications officielles avant de vous engager.

Faire le test d'orientation
La matière première

« Lire », pour une IA, c'est découper en tokens

Avant tout calcul, le texte est tranché en petites unités. C'est ça qu'on compte, et c'est ça qui remplit la fenêtre. Voici la même phrase, côté humain puis côté machine (découpage illustratif).

Vous lisez

L'intelligence artificielle découpe le texte en petits morceaux.

L'IA « lit »

L'intelligence artificiellecoupe le texte en petits morceaux.

Plus un échange est long, plus il consomme de tokens — et plus vite la fenêtre se remplit. C'est aussi pour ça que « résumer avant de continuer » aide une IA à tenir le fil.

Outil interactif

Combien de tokens dans votre texte ?

Collez n'importe quel texte — un prompt, un e-mail, un extrait — et voyez instantanément son estimation en tokenset ce qu'il occupe dans différentes fenêtres de contexte.

Estimation heuristique côté client (~4 caractères par token, comme le français courant). Aucune donnée n'est envoyée nulle part.

Collez un texte ci-dessus pour voir son estimation en tokens.

Heuristique adaptée au français : environ 4 caractères par token. Le découpage réel dépend du modèle et de son tokenizer (souvent BPE) — les frontières exactes diffèrent, mais l'ordre de grandeur reste fiable pour évaluer si votre texte tiendra dans une fenêtre de contexte.

Le grand oubli

Pourquoi l'IA vous « oublie » entre deux conversations

Par défaut, un modèle est « stateless »: sans état. Il ne conserve aucune session. Fermez l'onglet, revenez demain : pour lui, c'est une page blanche. Le « il se souvient de moi » des assistants n'est pas de la mémoire du modèle — c'est une couche ajoutée par-dessus.

  • Sans étatLe modèle ne garde rien entre deux requêtes. Chaque appel est isolé.
  • L'illusion de continuitéDans une même conversation, l'appli renvoie tout l'historique à chaque tour : c'est ça qui donne l'impression d'un fil.
  • D'une fois sur l'autrePour « se souvenir » demain, un système ré-injecte un résumé ou des notes dans le contexte de la prochaine conversation.
Aller chercher l'information

RAG : donner à l'IA les bons documents, au bon moment

Le RAG (retrieval-augmented generation, génération augmentée par récupération) ne donne pas de mémoire au modèle : il va chercher des extraits pertinents et les glisse dans la fenêtre avant de répondre. Cliquez une étape pour la comprendre.

1 · La question

Tout part de votre question. Seule, l'IA n'y répondrait qu'avec ce qu'elle a appris à l'entraînement — figé à une date, et sans accès à vos documents.

Un embeddingest une représentation chiffrée du sens : des textes proches par le sens donnent des vecteurs proches. C'est ce qui permet de « retrouver » un passage utile sans chercher des mots exacts.

Comparaison honnête

Mémoire d'IA, mémoire humaine : rien à voir

La métaphore de la « mémoire » est commode mais trompeuse. Côte à côte, les différences sautent aux yeux — et aucune des deux n'est « meilleure » : elles ne font pas la même chose.

Vous (humain)L'IA (modèle)
Par défaut

Vous gardez un souvenir, même flou, de vos échanges d'hier.

Sans dispositif ajouté, l'IA repart de zéro à chaque nouvelle conversation.

Pendant l'échange

Vous reliez naturellement le début et la fin d'une longue discussion.

Elle ne « voit » que ce qui tient dans sa fenêtre ; le reste est hors de portée.

L'oubli

Oubli progressif : les détails s'estompent, l'essentiel reste souvent.

Oubli net et brutal : ce qui sort de la fenêtre disparaît d'un coup, intégralement.

Se souvenir

Un indice, une odeur, un mot peuvent rappeler un souvenir enfoui.

Rien ne « remonte » seul : il faut lui re-fournir l'information dans le contexte.

Comprendre

Vous savez ce que vous savez, et souvent que vous ne savez pas.

Elle prédit des mots plausibles ; quand le contexte manque, elle peut inventer.

Pour aller au mot juste

« Grand modèle de langage », par définition

Un grand modèle de langage, grand modèle linguistique, grand modèle de langue, modèle de langage de grande taille ou encore modèle massif de langage est un modèle de langage possédant un grand nombre de paramètres.
Source (hors-ligne, texte de secours)Wikipédia FR · « Grand modèle de langage » · licence CC BY-SA

« Paramètres » : les valeurs internes apprises à l'entraînement. Elles encodent du savoir général, mais ce ne sont pas vos conversations — d'où le besoin d'une fenêtre de contexte, et parfois d'un RAG.

Questions fréquentes

Ce qu'on se demande vraiment

Une IA a-t-elle vraiment une « mémoire » ?

Au sens humain, non. Un modèle de langage ne stocke pas vos conversations passées. À chaque réponse, il relit l'historique fourni dans sa fenêtre de contexte et prédit la suite. Tout ce qui n'est pas dans cette fenêtre n'existe pas pour lui à cet instant.

C'est quoi la « fenêtre de contexte » ?

C'est la quantité de texte que le modèle peut prendre en compte d'un seul coup, mesurée en tokens (des bouts de mots). Question, historique, documents, réponse en cours : tout doit y tenir. Quand c'est plein, le plus ancien sort du cadre — d'où l'impression que l'IA « oublie » le début d'une longue discussion.

Pourquoi l'IA m'oublie-t-elle d'une conversation à l'autre ?

Parce qu'elle est « stateless » (sans état) par défaut : aucune session ne conserve ce que vous avez dit. Les assistants qui semblent vous reconnaître ajoutent une couche par-dessus — ils ré-injectent un résumé ou des notes dans le contexte de la conversation suivante.

Et le RAG, la « mémoire persistante » : c'est de la triche ?

Non, c'est de l'ingénierie. Le RAG va chercher des passages pertinents dans une base de documents et les colle dans le contexte avant de répondre. La « mémoire persistante » fait pareil avec des notes vous concernant. Le modèle ne se souvient toujours pas : on lui re-montre l'information au bon moment.

Pourquoi une IA invente-t-elle parfois (hallucination) ?

Un modèle de langage prédit le mot le plus probable, pas le mot vrai. Quand le contexte manque, ou que la question dépasse ce qu'il a sous les yeux, il comble le vide avec quelque chose de plausible — qui peut être faux. Lui donner les bons documents (RAG) réduit ce risque sans l'annuler.

Les chiffres montrés ici sont-ils réels ?

Non : le budget de tokens et les « coûts » de la démo sont volontairement illustratifs, juste là pour rendre le mécanisme visible. Les capacités réelles varient selon les modèles et changent vite. Pour des notions définies, ce site cite Wikipédia (avec la date du relevé).

On en parle ?

Un projet où la mémoire de l'IA compte ?

Assistant qui doit « se souvenir », recherche dans vos documents (RAG), limites de contexte à dompter… Décrivez votre besoin : on vous répond avec des explications claires, pas du jargon.

Réponse rapide · Sans engagement