Ce sur quoi ce cours s’appuie
Chaque cadre officiel, chaque source scientifique, chaque police et chaque corpus embarqué dans The AI Manual est répertorié ici, avec une adresse qui s’ouvre et se vérifie.
Une attribution fausse serait pire qu’une attribution absente. Chaque source de cette page a été ouverte à son adresse avant d’être citée ici : rien n’y est recopié de mémoire.
Sur cette page
Les cadres officiels
The AI Manual met en forme quatre cadres internationaux de littératie en intelligence artificielle, et les pièces qui les précisent ou les rattachent au droit européen. Vérifiés en ligne le 13 août 2026.
- Empowering Learners for the Age of AI: An AI Literacy Framework for Primary and Secondary Education (« AILit Framework »), OCDE et Commission européenne (DG Éducation / Digital Education Hub), avec le soutien de CodeAI (ex-Code.org), 2026. La page de référence du cadre : quatre domaines de compétences et dix-neuf compétences pour le primaire et le secondaire, publiés les 17 et 18 juin 2026.
- Empowering Learners for the Age of AI (rapport intégral, PDF), OCDE Publishing (Paris), avec la Commission européenne, 2026. Le même cadre, en rapport complet avec ses exemples de classe pour le primaire et le secondaire.
- AI Competency Framework for Students, UNESCO, 2024. Le cadre pour les élèves : douze compétences en trois niveaux, comprendre, appliquer, créer.
- AI Competency Framework for Teachers, UNESCO, 2024. Le cadre pour les enseignants : quinze compétences, premier cadre mondial de ce type.
- Règlement (UE) 2024/1689 (AI Act) : texte consolidé, Article 4 « AI literacy », Union européenne, EUR-Lex, 2024, texte consolidé au 27 juillet 2026. L’obligation de littératie en intelligence artificielle qui pèse sur tout fournisseur et tout déployeur d’un système, quel que soit son niveau de risque.
- Règlement (UE) 2026/1744 du 8 juillet 2026 (« Digital Omnibus on AI ») : article 1(5) modifiant l’article 4, Union européenne, EUR-Lex, 2026. Le règlement qui a transformé cette obligation de résultat en obligation de moyens, en vigueur depuis le 27 juillet 2026.
- AI Literacy: Questions & Answers, Commission européenne, AI Office, 2025, mise à jour le 27 juillet 2026. Aucun seuil mesurable n’est exigé : l’effort attendu est proportionné au rôle et au risque de qui l’applique.
- AI4K12: Five Big Ideas in AI, AAAI et CSTA (Association for the Advancement of Artificial Intelligence / Computer Science Teachers Association), financé par la National Science Foundation (subvention DRL-1846073), 2018. Un cadre étatsunien, cité pour que le module européen reste un module à côté du socle, jamais le socle lui-même.
Les travaux scientifiques et techniques, par thème
Chaque affirmation technique de ce cours porte une publication vérifiée en ligne le 13 août 2026, réunie ici par thème plutôt qu’alignée en une seule liste illisible.
Tokenisation
Ces travaux établissent comment un texte se découpe en unités plus petites qu’un mot, et pourquoi ce découpage coûte plus cher dans certaines langues que dans d’autres.
- Neural Machine Translation of Rare Words with Subword Units, Rico Sennrich et al., 2016.
- A New Algorithm for Data Compression, Philip Gage, 1994.
- Language Model Tokenizers Introduce Unfairness Between Languages, Aleksandar Petrov et al., 2023.
Prédiction et échantillonnage
Ces travaux montrent comment un modèle choisit un mot dans une distribution de probabilité, et comment la température et les coupes top-k ou top-p changent ce choix.
- The Curious Case of Neural Text Degeneration, Ari Holtzman et al., 2020.
- Distilling the Knowledge in a Neural Network, Geoffrey Hinton et al., 2015.
- Hierarchical Neural Story Generation, Angela Fan et al., 2018.
Hallucination
Ces travaux expliquent pourquoi un modèle invente avec aplomb : une conséquence de la façon dont il est entraîné et évalué, pas une panne isolée.
- A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions, Lei Huang et al., 2023.
- Why Language Models Hallucinate, Adam Tauman Kalai et al., 2025.
- Hallucination is Inevitable: An Innate Limitation of Large Language Models, Ziwei Xu et al., 2024. Débattu : ce travail soutient qu’un certain taux d’hallucination est mathématiquement inévitable pour un modèle utilisé comme solveur général de problèmes ; des travaux ultérieurs contestent que ses hypothèses formelles s’appliquent aux usages réels et finis des modèles.
Biais
Ces travaux mesurent que les biais humains présents dans les corpus d’entraînement se retrouvent, mesurables, dans les modèles qui en sont issus.
- Man is to Computer Programmer as Woman is to Homemaker? Debiasing Word Embeddings, Tolga Bolukbasi et al., 2016.
- Semantics derived automatically from language corpora contain human-like biases, Aylin Caliskan et al., 2017.
- Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification, Joy Buolamwini, Timnit Gebru, 2018.
- Datasheets for Datasets, Timnit Gebru et al., 2018.
Mémorisation des données
Ces travaux démontrent qu’un modèle peut restituer mot pour mot des fragments de ses données d’entraînement, y compris des informations personnelles, par simple interrogation.
- Extracting Training Data from Large Language Models, Nicholas Carlini et al., 2021.
- Quantifying Memorization Across Neural Language Models, Nicholas Carlini et al., 2023.
- Scalable Extraction of Training Data from (Production) Language Models, Milad Nasr et al., 2023.
Image fabriquée
Ces travaux identifient les artefacts techniques qui trahissent une image générée, et notent que l’œil humain ne les voit plus dans les visages de synthèse récents.
- Leveraging Frequency Analysis for Deep Fake Image Recognition, Joel Frank et al., 2020.
- Detecting and Simulating Artifacts in GAN Fake Images, Xu Zhang et al., 2019.
- AI-synthesized faces are indistinguishable from real faces and more trustworthy, Sophie J. Nightingale, Hany Farid, 2022.
Voix fabriquée
Ces travaux situent la détection de voix synthétique et ses limites, et une autorité publique documente un usage frauduleux réel d’une voix clonée.
- WaveFake: A Data Set to Facilitate Audio Deepfake Detection, Joel Frank, Lea Schönherr, 2021.
- ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild, Xuechen Liu et al., 2021.
- FCC Makes AI-Generated Voices in Robocalls Illegal (déclaration FCC 24-17), Federal Communications Commission (FCC), 2024.
Filigranes et provenance
Ces travaux décrivent les deux familles de preuve d’origine, un manifeste attaché au fichier et un filigrane statistique inséré dans le texte généré, et leurs limites respectives.
- Content Credentials: C2PA Technical Specification (version 2.4), Coalition for Content Provenance and Authenticity (C2PA), 2026.
- C2PA Frequently Asked Questions, Coalition for Content Provenance and Authenticity (C2PA), 2026. Le standard reconnaît lui-même qu’un manifeste de provenance peut se séparer du fichier, et donc se perdre à une simple capture d’écran.
- A Watermark for Large Language Models, John Kirchenbauer et al., 2023.
- Scalable watermarking for identifying large language model outputs, Sumanth Dathathri et al., 2024. SynthID-Text, un filigrane statistique publié et évalué par les pairs dans la revue Nature.
Détecteurs
Ces travaux montrent que les détecteurs de texte généré par IA se trompent, avec un biais documenté contre les locuteurs non natifs d’une langue, au point qu’un éditeur a retiré le sien.
- GPT detectors are biased against non-native English writers, Weixin Liang et al., 2023.
- OpenAI scuttles AI-written text detector over 'low rate of accuracy', Devin Coldewey, TechCrunch, relayant un addendum officiel d’OpenAI, 2023.
- Testing of detection tools for AI-generated text, Debora Weber-Wulff et al., 2023.
Coût matériel
Ces travaux chiffrent une consommation d’énergie en forte croissance, disproportionnée face à une tâche équivalente confiée à un système spécialisé.
- Energy and AI, Agence Internationale de l’Énergie (International Energy Agency, IEA), 2025.
- Power Hungry Processing: Watts Driving the Cost of AI Deployment?, Alexandra Sasha Luccioni et al., 2024.
Les polices
Les deux polices du système sont embarquées en woff2, dans site/assets/css/fonts/ : aucune requête vers un service de polices, aucun CDN. Leur licence a été relue en ligne le 14 août 2026, à l’adresse du fichier qui la porte.
- Source Serif 4, SIL Open Font License, version 1.1, Adobe, 2014 à 2023, nom réservé « Source ». Polices woff2 embarquées, poids 500 et 600, italique 400 : elles portent les titres du site.
- Public Sans, SIL Open Font License, version 1.1, The Public Sans Project Authors, 2015. Polices woff2 embarquées, poids 400, 600 et 700, italique 400 : elles portent le corps de texte. C’est la police du système de service public américain USWDS.
La licence SIL Open Font License autorise l’usage, la modification et la redistribution des deux polices, à la seule condition de ne pas les revendre séparément et de conserver la licence avec elles.
Les corpus des démonstrations
Une seule œuvre tierce est embarquée dans les démonstrations, et elle est du domaine public. Un second texte, entièrement d’origine ODERSA, sert à comparer un même contenu selon la langue.
Un texte du domaine public
Le Tour du monde en quatre-vingts jours, Jules Verne, 1873. Domaine public : Jules Verne est mort le 24 mars 1905, et son œuvre en français est libre de droits partout depuis longtemps. Les 623 premiers paragraphes du roman, soit environ 25 288 mots, forment le corpus sur lequel s’entraîne le modèle jouet de ce cours. Les seules retouches, toutes réversibles et déclarées dans le fichier du corpus, sont typographiques : apostrophes rendues typographiques, tirets et guillemets de la transcription retirés, marques d’italique retirées, titres de chapitre et table des matières écartés. Un modèle qui n’a lu que ce texte de 1873 ne peut rien savoir de ce qui s’est passé depuis : c’est exactement ce que la démonstration met en évidence.
Un texte maison
La même phrase, dans les 7 langues que la flotte de l’ODERSA prévoit de servir, sert à comparer combien d’unités un même sens demande selon la langue. Ce texte est celui de la bannière de confiance de l’ODERSA elle-même, déjà publié sous licence CC BY 4.0 : ce n’est pas un corpus tiers, et il ne pose donc aucune question de droits.
Le moteur qui fait tourner ces démonstrations, tire dans ces corpus et calcule des probabilités, est un code écrit par l’ODERSA : ce n’est pas une bibliothèque tierce, et ce site n’en embarque aucune.
Les schémas
Chaque schéma de ce site est un SVG dessiné à la main par l’ODERSA, sans photographie ni image appelée à un domaine tiers. Chacun est réutilisable sous licence CC BY 4.0, comme le reste du site, et sa légende porte cette mention.
C’est ce qui permet à la bannière de confiance de promettre qu’aucune requête ne sort de l’appareil qui ouvre ce site : aucune image, comme aucune police et aucun script, n’est appelée à distance.
Les photographies
Chaque photographie de The AI Manual illustre une page précise, et sa légende, sous l’image, porte déjà l’auteur. Ce tableau réunit chacune avec sa licence complète, l’adresse qui la prouve sur Wikimedia Commons, et la page qui la sert.
| Ce qu’elle montre | Auteur | Licence | Preuve sur Wikimedia Commons | Servie sur |
|---|---|---|---|---|
| Un clavier d’ordinateur portable rétroéclairé, la plupart des doigts posés sur la rangée de repos, la touche U enfoncée | Colin | CC BY-SA 4.0 | Page du fichier | Accueil |
| La salle de lecture de la bibliothèque Sainte-Geneviève à Paris, ses longues tables et ses rayonnages sous une voûte | JOHN TOWNER heytowner | CC0 | Page du fichier | D’où viennent les biais |
| Un local technique où convergent des dizaines de câbles réseau branchés sur des panneaux de brassage | Brian Hankins (Bhankins) | Public domain | Page du fichier | Ce qu’on lui donne |
| Un photographe accroupi au bord d’un terrain de football, un long téléobjectif à la main | Ximeg | CC BY-SA 3.0 | Page du fichier | Une image fabriquée |
| Plusieurs microphones montés sur pieds autour d’une batterie, dans un studio d’enregistrement | dan paluska | CC BY 2.0 | Page du fichier | Une voix fabriquée |
| Un amphithéâtre vide, ses rangées de sièges et de tablettes vues depuis le fond de la salle | Yinan Chen | Public Domain | Page du fichier | Pour enseigner |
Deux de ces photographies, le clavier de l’accueil et le photographe de la page Une image fabriquée, sont sous une licence de partage à l’identique, CC BY-SA. Le texte de The AI Manual est sous CC BY 4.0, comme l’annonce la licence ; ces deux photographies gardent leur propre licence, elles n’y basculent pas. Reprendre la page qui les porte oblige à rediffuser la photographie sous cette même licence de partage à l’identique, avec son attribution, pas sous les termes du reste du site.
Toutes les photographies de cette page sont embarquées dans ce dépôt et servies depuis le domaine du site, jamais appelées à une adresse tierce, comme les polices et les schémas. C’est ce qui permet à la bannière de confiance de promettre qu’aucune requête ne sort de l’appareil qui ouvre ce site.
Ce que ce site ne doit à personne d’autre
- Aucune dépendance : pas une ligne de code empruntée à une bibliothèque tierce.
- Aucun CDN : les polices, les scripts et les images sont tous embarqués dans ce dépôt.
- Aucun service d’intelligence artificielle appelé : les démonstrations sont déterministes, elles tournent entièrement sur l’appareil qui les ouvre.
- Aucune mesure d’audience, aucun cookie, aucun compte : rien qui identifie qui ouvre cette page.
Cela se vérifie en quelques secondes, à l’onglet Réseau du navigateur, pendant que la page se charge : aucune requête n’en sort.
Comment ces crédits se maintiennent
Une source périmée, une adresse qui a changé, une attribution mal posée : cela se signale, sans compte ni formulaire. Les conditions de réutilisation de ce site sont décrites dans la licence.