Le glossaire
Chaque mot que ce cours emploie, défini en clair, avec une ancre pour qu’un chapitre y renvoie directement.
Le vocabulaire courant de ce domaine est trompeur, et savoir pourquoi fait partie du cours. Des mots empruntés à l’esprit humain, « comprendre », « savoir », « apprendre », « halluciner », décrivent ici un calcul, jamais un état intérieur. Un modèle de langue ne comprend rien, ne sait rien et n’apprend rien au sens où une personne le fait : il ajuste des paramètres numériques sur un corpus, puis il calcule une suite probable à partir d’un texte reçu en entrée. Dire qu’il « hallucine » ne décrit pas un trouble : cela nomme un résultat plausible et faux, produit par le même calcul qui produit une réponse juste. Ce glossaire garde ces mots parce que le cours et la recherche les emploient, mais chaque définition les ramène au calcul qu’ils désignent réellement.
Les mots, dans l’ordre alphabétique
Chaque entrée porte une ancre : un chapitre du cours peut renvoyer directement dessus. Un mot en lien, dans une définition, a lui-même sa propre entrée, plus haut ou plus bas dans cette liste.
- Aplomb
- Le ton assuré d’une réponse, qu’elle soit juste ou non. Un modèle ne baisse pas le ton quand il invente : rien dans sa formulation ne distingue un fait vérifié d’une hallucination. L’assurance d’une réponse n’est donc jamais une preuve de son exactitude.
- Apprentissage automatique
- La famille de méthodes où un programme règle son comportement à partir d’exemples, plutôt que de suivre des règles écrites à la main une par une. Un modèle de langue et un générateur d’images en sont deux applications. L’apprentissage profond en est la branche la plus employée aujourd’hui.
- Apprentissage profond
- Une façon de faire de l’apprentissage automatique avec un réseau de neurones composé de nombreuses couches empilées. Chaque couche transforme un peu plus l’information reçue de la précédente, ce qui permet de repérer des régularités qu’une règle écrite à la main ne capturerait pas. C’est la technique derrière les modèles de langue et les générateurs d’images actuels.
- Artefact
- Une trace laissée par la fabrication d’une image ou d’un son, invisible à l’œil ou à l’oreille mais mesurable par un calcul. Les opérations qui agrandissent une image pendant sa génération laissent par exemple une empreinte régulière, repérable dans le détail des fréquences du fichier. Un artefact aide à repérer une image fabriquée, mais les modèles récents en laissent de moins en moins.
- Biais
- Un écart systématique que le modèle reproduit, appris dans les régularités du corpus qui l’a entraîné, jamais une opinion qu’il se serait formée. Si les données associent plus souvent un métier à un genre, le modèle rendra la même association, au même degré. Le biais de représentation en est une forme particulière : celle qui vient de ce qui manque dans les données plutôt que de ce qui s’y trouve en trop.
- Biais de représentation
- Le biais qui vient de ce qu’un groupe, une situation ou une langue est absent ou sous-représenté dans les données d’entraînement, plutôt que d’une association déformée. Un système de classification par image a ainsi présenté un taux d’erreur allant jusqu’à 34,7 % pour les femmes à la peau foncée contre 0,8 % pour les hommes à la peau claire, un écart lié à la composition des données d’apprentissage. Ce que les données ne contiennent pas, le modèle ne peut pas le rendre : il ne s’y trompe pas, il l’ignore.
- Boîte noire
- Un système dont on peut observer les réponses mais pas lire le raisonnement interne, même en étant celui qui l’a conçu. Un modèle de langue est une boîte noire en ce sens : ses paramètres, des millions de nombres ajustés durant l’entraînement, n’ont pas de signification individuelle qu’une personne pourrait relire un par un. Cela n’empêche pas de tester ce que le système fait en pratique, seulement d’expliquer pourquoi il le fait exactement ainsi.
- Clonage vocal
- Une technique qui reproduit la voix d’une personne précise à partir d’un échantillon audio, pour lui faire dire une phrase qu’elle n’a jamais prononcée. Une autorité publique américaine a ainsi documenté et sanctionné une campagne réelle utilisant une voix clonée imitant un responsable politique auprès d’électeurs avant une élection. C’est une forme d’hypertrucage appliquée spécifiquement à la voix.
- Corpus
- L’ensemble de textes, d’images ou de sons sur lequel un modèle apprend, sa seule source de régularités. Un jeu de données est un corpus organisé et documenté pour un usage précis ; le mot corpus désigne le contenu brut, avant ce travail. Ce qui n’est pas dans le corpus n’existe pour le modèle d’aucune façon : ni comme une chose rare, ni comme une chose fausse.
- Détecteur
- Un outil qui prétend dire si un texte, une image ou une voix a été produit par un modèle. Une évaluation indépendante de quatorze détecteurs de texte, dont des outils commerciaux vendus à l’enseignement, n’en a trouvé aucun à la fois fiable et précis. Un détecteur ne rend jamais un verdict : au mieux, un indice à recouper.
- Distribution de probabilité
- La liste des jetons possibles pour continuer un texte, chacun assorti d’un nombre entre zéro et un qui dit sa probabilité, la somme de tous valant un. Le modèle calcule cette liste à chaque étape, puis un échantillonnage choisit un jeton dedans. La température, le top-k et le top-p sont trois façons de retoucher cette liste avant d’y tirer.
- Échantillonnage
- Le geste qui choisit un jeton dans la distribution de probabilité calculée par le modèle, plutôt que de systématiquement prendre le plus probable. Choisir toujours le plus probable produit un texte plat et répétitif ; tirer au sort selon les probabilités, éventuellement recadrées par la température, le top-k ou le top-p, produit un texte plus naturel.
- Entraînement
- Le calcul, mené une fois avant toute mise à disposition, qui ajuste les paramètres d’un modèle pour qu’il rende de mieux en mieux les régularités de son corpus. Une fois l’entraînement terminé, ces paramètres sont fixés : s’en servir ensuite pour produire une réponse est une opération distincte, l’inférence. Un réglage fin est un second entraînement, plus court, sur un corpus plus étroit.
- Extraction de données d’entraînement
- Le fait d’obtenir, par une question ordinaire posée au modèle, un passage qui figurait mot pour mot dans son corpus d’entraînement. Des chercheurs ont ainsi extrait des gigaoctets de données d’entraînement de modèles réellement déployés en production, par une méthode simple. C’est la preuve la plus directe de la mémorisation : ce n’est plus une possibilité théorique, c’est un texte retrouvé.
- Faux positif et faux négatif
- Les deux façons dont un détecteur se trompe : le faux positif accuse un contenu humain d’être produit par un modèle, le faux négatif laisse passer un contenu produit par un modèle en le disant humain. Plusieurs détecteurs de texte très utilisés classent ainsi à tort la majorité des textes de locuteurs non natifs de l’anglais comme générés par une machine, alors qu’ils reconnaissent correctement ceux des locuteurs natifs : ce faux positif ne se répartit pas au hasard. Un outil qui vise à réduire l’un de ces deux risques augmente presque toujours l’autre.
- Fenêtre de contexte
- La quantité maximale de texte, comptée en jetons, qu’un modèle peut prendre en compte à la fois pour calculer sa réponse. Ce qui a été écrit avant cette fenêtre n’entre plus dans le calcul en cours, exactement comme s’il n’avait jamais existé. Un document plus long que la fenêtre doit être coupé ou résumé avant d’être confié au modèle en entier.
- Filigrane
- Un signal déposé volontairement dans un contenu généré, invisible à l’usage ordinaire, qu’un outil dédié peut retrouver. Dans un texte, il peut prendre la forme d’un léger favoritisme statistique pour certains mots à chaque étape, un favoritisme trop discret pour se voir à la lecture mais détectable par un calcul, une méthode déjà publiée et évaluée par les pairs. Un filigrane suppose que l’outil qui l’a posé, ou un autre qui en connaît la méthode, existe encore pour le chercher.
- Générateur d’images
- Un système qui produit une image nouvelle à partir d’une description en texte. La méthode la plus employée aujourd’hui pour cela est le modèle de diffusion. Comme un modèle de langue, un générateur d’images n’a vu aucune scène réelle qu’il recopierait : il assemble une image plausible à partir des régularités visuelles de son corpus d’entraînement.
- Hallucination
- Une réponse inventée mais formulée avec le même aplomb qu’une réponse juste. Elle sort du même calcul que n’importe quelle autre réponse : rien, dans le fonctionnement du modèle, ne sépare un fait vérifié d’une extrapolation plausible, et les procédures d’entraînement et d’évaluation actuelles récompensent une réponse plausible plutôt qu’un aveu d’incertitude. Un travail théorique soutient qu’un taux d’hallucination serait mathématiquement inévitable pour ce type de modèle ; la conclusion reste débattue, d’autres travaux contestant que ses hypothèses s’appliquent aux usages réels.
- Hypertrucage (deepfake)
- Une image, une vidéo ou un son fabriqué ou modifié par un modèle pour faire croire à un évènement qui n’a jamais eu lieu. Le clonage vocal en est une forme, appliquée à la voix. Des observateurs humains ne parviennent déjà plus à distinguer de manière fiable un visage de synthèse récent d’un visage réel, et le jugent même en moyenne plus digne de confiance.
- Inférence
- Le calcul qui produit une réponse à partir d’un modèle déjà entraîné, par opposition à l’entraînement qui a fixé ses paramètres auparavant. C’est ce qui se passe à chaque fois qu’une invite reçoit une réponse : aucun paramètre ne change, seul un calcul tourne sur des valeurs déjà fixées.
- Invite (prompt)
- Le texte donné en entrée à un modèle pour obtenir une réponse. Sa formulation change ce que le modèle rend, puisqu’il calcule sa suite à partir de ce texte précis et d’aucun autre. Une invite reste du texte ordinaire : elle ne commande rien au sens d’un programme, elle oriente un calcul probable.
- Jeton (token)
- La plus petite unité de texte qu’un modèle manipule, souvent plus courte qu’un mot entier. Un mot rare ou inconnu se découpe alors en plusieurs jetons faits de fragments déjà connus, ce qui permet de le traiter sans jamais l’avoir vu tel quel. Chaque jeton est ensuite converti en nombre avant tout calcul : un modèle ne lit jamais des lettres, il lit des nombres.
- Jeu de données
- Un corpus organisé et documenté pour un usage précis : sa composition, son origine et la façon dont il a été collecté sont censées être connues, pas seulement son contenu. Une proposition de documentation normalisée existe depuis 2018 pour cela, afin de remonter à l’origine d’un biais constaté plutôt que de le découvrir une fois le modèle déployé. Un jeu de données non documenté n’est, dans les faits, qu’un corpus.
- Littératie en intelligence artificielle
- L’ensemble des savoirs, des savoir-faire et des attitudes qui permettent de se servir d’un système d’intelligence artificielle, de le questionner et, pour certains publics, de le concevoir, sans s’en remettre à lui aveuglément. Un cadre commun publié en 2026 par l’OCDE et la Commission européenne la décrit en quatre domaines de compétences, pensés pour l’enseignement primaire et secondaire. Le détail de ce cadre et des cadres internationaux qui le complètent est réuni à la page les cadres officiels.
- Mémorisation
- Le fait qu’un modèle puisse restituer mot pour mot un fragment de ses données d’entraînement, plutôt que de le reformuler. Ce phénomène augmente avec la taille du modèle, avec le nombre de fois qu’un même contenu est dupliqué dans les données, et avec la longueur du texte donné en contexte avant de demander une suite. Un modèle n’a pas de dossier où retrouver ce texte : le contenu a modifié ses paramètres, et c’est cette modification qui peut, dans certains cas, le rendre presque intact.
- Métadonnées
- Des informations attachées à un fichier et qui portent sur le fichier lui-même, son origine, la date de sa création, les modifications qu’il a subies, plutôt que sur ce qu’il montre. Une donnée de provenance est un type de métadonnée. Une métadonnée peut disparaître à une simple capture d’écran ou à un enregistrement dans un autre format, ce qui la rend fragile comme preuve.
- Modèle de diffusion
- Une technique qui fabrique une image en partant d’un bruit visuel aléatoire, puis en le retirant par étapes successives jusqu’à faire apparaître une image plausible, guidée par une description en texte. C’est la méthode la plus employée aujourd’hui derrière les générateurs d’images. Comme toute image générée, le résultat peut porter un artefact qui révèle sa fabrication, même quand rien n’est visible à l’œil nu.
- Modèle de langue
- Un système entraîné sur du texte qui calcule, à partir de ce qui précède, le jeton le plus probable pour continuer. Il répète ce calcul jeton après jeton pour assembler une réponse entière. Il ne consulte aucune base de faits à côté de ce calcul : tout ce qu’il rend vient de la même opération, qu’il s’agisse d’un fait vérifié ou d’une hallucination.
- Paramètre
- Un nombre interne au modèle, ajusté durant l’entraînement, qui pèse sur son calcul. On l’appelle aussi poids. Un modèle en compte des milliards, et aucun d’eux, pris isolément, n’a de sens qu’une personne pourrait lire : c’est leur ensemble qui produit un calcul utile, jamais un paramètre seul.
- Plongement (embedding)
- La représentation d’un mot ou d’un jeton sous la forme d’une liste de nombres, construite pendant l’entraînement pour que deux mots employés dans des contextes voisins reçoivent des listes voisines. Des plongements appris sur de grands corpus de textes ordinaires reproduisent ainsi des stéréotypes de genre mesurables, par exemple en associant plus fortement certains métiers à un genre plutôt qu’à l’autre. Un plongement dit donc autant sur le corpus d’origine que sur les mots eux-mêmes.
- Provenance
- La trace vérifiable de l’origine d’un fichier et de son historique de modification, jointe au fichier plutôt que cachée dans son contenu. Une norme technique publique, C2PA, définit comment attacher cette information de façon signée et vérifiable. Le standard reconnaît lui-même que cette information peut se séparer du fichier, et donc se perdre à une simple capture d’écran : la provenance protège le fichier d’origine, pas ses copies.
- Réglage fin (fine-tuning)
- Un second entraînement, plus court et mené sur un corpus plus étroit, qui ajuste un modèle déjà entraîné pour une tâche ou un style précis. Il part des paramètres obtenus au premier entraînement plutôt que de repartir de zéro. Un modèle réglé finement reste un modèle de langue : sa mécanique de calcul ne change pas, seuls ses paramètres se déplacent un peu.
- Réseau de neurones
- Une structure de calcul faite de couches d’unités simples, chacune combinant ce qu’elle reçoit avec des paramètres qui lui sont propres. Le nom vient d’une inspiration lointaine dans le neurone biologique, mais une unité de réseau ne pense pas, pas plus qu’un neurone isolé ne pense : c’est l’ajustement de l’ensemble, par l’entraînement, qui produit un calcul utile. Le transformeur est l’architecture de ce type la plus employée pour le texte aujourd’hui.
- Source ouverte
- Un modèle dont le code, les paramètres ou les deux sont publiés, pour que d’autres puissent les inspecter, les réutiliser ou les vérifier, plutôt que d’y accéder uniquement à travers un service fermé. L’ouverture ne dit rien à elle seule des données d’entraînement employées : un modèle peut publier ses paramètres sans jamais documenter son corpus. « Source ouverte » et « jeu de données documenté » restent donc deux garanties distinctes, rarement réunies.
- Température
- Un réglage qui adoucit ou durcit la distribution de probabilité calculée par le modèle, avant l’échantillonnage. Une température plus élevée rapproche les probabilités des différents mots possibles, ce qui rend les choix moins prévisibles ; une température plus basse accentue l’écart en faveur du mot déjà le plus probable. Ce n’est pas une mesure physique : le mot est emprunté à une formule de physique statistique, sans lien avec une chaleur réelle.
- Tokenisation
- L’opération qui découpe un texte en jetons avant tout calcul. La méthode la plus employée aujourd’hui vient à l’origine d’un algorithme de compression de données de 1994, sans lien avec le langage à sa conception. Un même contenu traduit dans des langues différentes peut demander jusqu’à quinze fois plus de jetons selon la langue, ce qui rend certaines langues plus lentes et plus coûteuses à traiter que d’autres.
- Top-k
- Une méthode qui restreint le tirage aux k jetons les plus probables à chaque étape, k étant un nombre fixé d’avance. Les jetons les moins probables sont ainsi écartés avant même l’échantillonnage, ce qui évite un choix trop improbable sans rendre le résultat entièrement prévisible.
- Top-p
- Une méthode qui restreint le tirage au plus petit ensemble de jetons dont les probabilités cumulées atteignent p, plutôt qu’à un nombre fixe de jetons comme le top-k. Cet ensemble change donc de taille d’une étape à l’autre : large quand plusieurs mots restent proches en probabilité, réduit quand un mot domine largement les autres. Cette méthode, dite aussi échantillonnage nucleus, remplace le choix systématique du mot le plus probable, plus plat et répétitif.
- Transformeur
- L’architecture de réseau de neurones derrière les modèles de langue actuels. Plutôt que de lire un texte jeton après jeton dans un ordre strict, elle compare chaque jeton à tous les autres jetons de la fenêtre de contexte en une seule fois, et pondère leur importance les uns par rapport aux autres. C’est ce mécanisme de comparaison simultanée qui a permis d’entraîner des modèles sur des corpus bien plus grands qu’auparavant.
Voir les notions en action
Ce glossaire fixe le vocabulaire. Le cours comprendre l’emploie chapitre après chapitre, et les démonstrations le mettent en mouvement : on y règle une température, on y déforme un corpus, on y regarde un filigrane apparaître.
Sources
Les définitions qui engagent un fait précis le rattachent ici, terme par terme, sans alourdir chacune d’elles.
- Detecting and Simulating Artifacts in GAN Fake Images, Xu Zhang, Svebor Karaman, Shih-Fu Chang, 2019. Artefact. Le composant de suréchantillonnage des images générées laisse une empreinte spectrale caractéristique et reproductible.
- Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification, Joy Buolamwini, Timnit Gebru, 2018. Biais de représentation. Des systèmes commerciaux de classification de genre par image ont présenté un taux d’erreur allant jusqu’à 34,7 % pour les femmes à la peau foncée contre 0,8 % pour les hommes à la peau claire.
- FCC Makes AI-Generated Voices in Robocalls Illegal (déclaration FCC 24-17), Federal Communications Commission (FCC), 2024. Clonage vocal. Une autorité publique américaine a documenté et sanctionné une campagne réelle de fraude par voix clonée, imitant un responsable politique avant une élection.
- Testing of detection tools for AI-generated text, Debora Weber-Wulff et al., 2023. Détecteur. Quatorze outils de détection évalués : aucun n’est à la fois fiable et précis.
- The Curious Case of Neural Text Degeneration, Ari Holtzman, Jan Buys, Li Du, Maxwell Forbes, Yejin Choi, 2020. Échantillonnage et top-p. Choisir systématiquement le mot le plus probable produit un texte plat et répétitif ; l’échantillonnage nucleus, qui tronque la partie peu fiable de la distribution, produit un texte plus naturel.
- Scalable Extraction of Training Data from (Production) Language Models, Milad Nasr et al., 2023. Extraction de données d’entraînement. Des gigaoctets de données d’entraînement ont été extraits de modèles réellement déployés en production, par une attaque simple.
- GPT detectors are biased against non-native English writers, Weixin Liang, Mert Yuksekgonul, Yining Mao, Eric Wu, James Zou, 2023. Faux positif et faux négatif. Plusieurs détecteurs très utilisés classent à tort la majorité des textes de locuteurs non natifs de l’anglais comme générés par une IA, alors qu’ils identifient correctement ceux des locuteurs natifs.
- A Watermark for Large Language Models, John Kirchenbauer, Jonas Geiping, Yuxin Wen, Jonathan Katz, Ian Miers, Tom Goldstein, 2023. Filigrane. Il est possible d’insérer dans un texte généré un filigrane statistique invisible à l’œil humain, détectable ensuite par un test statistique.
- Scalable watermarking for identifying large language model outputs, Sumanth Dathathri, Abigail See, Sumedh Ghaisas, Po-Sen Huang, Rob McAdam, Johannes Welbl, et al., 2024. Filigrane. Un filigrane statistique intégré à la production de texte a été publié et évalué par les pairs dans la revue Nature.
- Why Language Models Hallucinate, Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang, 2025. Hallucination. Les procédures d’entraînement et d’évaluation actuelles récompensent le fait de produire une réponse plausible plutôt que d’admettre une incertitude.
- Hallucination is Inevitable: An Innate Limitation of Large Language Models, Ziwei Xu, Sanjay Jain, Mohan Kankanhalli, 2024. Hallucination. Débattu : ce travail soutient qu’un taux d’hallucination est mathématiquement inévitable pour ce type de modèle ; des travaux ultérieurs contestent que ses hypothèses s’appliquent aux usages réels et finis des modèles.
- AI-synthesized faces are indistinguishable from real faces and more trustworthy, Sophie J. Nightingale, Hany Farid, 2022. Hypertrucage. Des observateurs humains ne distinguent plus de manière fiable un visage synthétique d’un visage réel, et jugent même les visages synthétiques en moyenne plus dignes de confiance.
- Datasheets for Datasets, Timnit Gebru, Jamie Morgenstern, Briana Vecchione, Jennifer Wortman Vaughan, Hanna Wallach, Hal Daumé III, Kate Crawford, 2018. Jeu de données. Une proposition standardisée existe pour documenter la provenance, la composition et le mode de collecte d’un jeu de données.
- Empowering Learners for the Age of AI: An AI Literacy Framework for Primary and Secondary Education (« AILit Framework »), OCDE et Commission européenne, 2026. Littératie en intelligence artificielle. Le cadre commun publié par l’OCDE et la Commission européenne, quatre domaines de compétences pour le primaire et le secondaire.
- Quantifying Memorization Across Neural Language Models, Nicholas Carlini, Daphne Ippolito, Matthew Jagielski, Katherine Lee, Florian Tramer, Chiyuan Zhang, 2023. Mémorisation. Elle augmente avec la taille du modèle, la duplication d’un exemple dans les données, et la longueur du texte donné en contexte.
- Man is to Computer Programmer as Woman is to Homemaker? Debiasing Word Embeddings, Tolga Bolukbasi, Kai-Wei Chang, James Zou, Venkatesh Saligrama, Adam Tauman Kalai, 2016. Plongement. Des plongements appris sur de grands corpus de textes ordinaires reproduisent des stéréotypes de genre mesurables.
- Content Credentials: C2PA Technical Specification (version 2.4), Coalition for Content Provenance and Authenticity (C2PA), 2026. Provenance. Une norme technique publique définit comment attacher à un fichier des informations vérifiables et signées sur son origine.
- C2PA Frequently Asked Questions, Coalition for Content Provenance and Authenticity (C2PA), 2026. Provenance. Le standard reconnaît lui-même que son manifeste peut se séparer du fichier, et donc se perdre à une simple capture d’écran.
- Distilling the Knowledge in a Neural Network, Geoffrey Hinton, Oriol Vinyals, Jeff Dean, 2015. Température. Le paramètre de température dans la formule softmax adoucit ou durcit la distribution de probabilité calculée par le modèle.
- A New Algorithm for Data Compression, Philip Gage, 1994. Tokenisation. L’algorithme aujourd’hui utilisé pour la tokenisation a été conçu à l’origine comme une méthode générale de compression de données, sans lien avec le langage.
- Language Model Tokenizers Introduce Unfairness Between Languages, Aleksandar Petrov, Emanuele La Malfa, Philip H. S. Torr, Adel Bibi, 2023. Tokenisation. Un même contenu traduit dans différentes langues peut nécessiter jusqu’à quinze fois plus de jetons selon la langue.
- Hierarchical Neural Story Generation, Angela Fan, Mike Lewis, Yann Dauphin, 2018. Top-k. L’échantillonnage top-k, qui restreint le tirage aux k mots les plus probables à chaque étape, sert à générer un texte plus varié qu’un choix toujours déterministe.