Aquello en lo que se apoya este curso
Cada marco oficial, cada fuente científica, cada tipografía y cada corpus incrustado en The AI Manual está inventariado aquí, con una dirección que se abre y se verifica.
Una atribución falsa sería peor que una atribución ausente. Cada fuente de esta página se ha abierto en su dirección antes de citarse aquí: nada se copia de memoria.
En esta página
Los marcos oficiales
The AI Manual da forma a cuatro marcos de alfabetización en inteligencia artificial, tres internacionales y uno nacional, y a las piezas que los precisan o los conectan con el derecho europeo. Verificados en línea el 13 de agosto de 2026.
- Empowering Learners for the Age of AI: An AI Literacy Framework for Primary and Secondary Education («AILit Framework»), OCDE y Comisión Europea (DG Educación / Digital Education Hub), con el apoyo de CodeAI (antes Code.org), 2026. La página de referencia del marco: cuatro ámbitos de competencias y diecinueve competencias para primaria y secundaria, publicados los días 17 y 18 de junio de 2026.
- Empowering Learners for the Age of AI (informe completo, PDF), OECD Publishing (París), con la Comisión Europea, 2026. El mismo marco, en informe completo con sus ejemplos de aula para primaria y secundaria.
- AI Competency Framework for Students, UNESCO, 2024. El marco para el alumnado: doce competencias en tres niveles, entender, aplicar, crear.
- AI Competency Framework for Teachers, UNESCO, 2024. El marco para el profesorado: quince competencias, primer marco mundial de este tipo.
- Reglamento (UE) 2024/1689 (AI Act): texto consolidado, artículo 4 «AI literacy», Unión Europea, EUR-Lex, 2024, texto consolidado a 27 de julio de 2026. La obligación de alfabetización en inteligencia artificial que recae sobre todo proveedor y todo responsable del despliegue de un sistema, cualquiera que sea su nivel de riesgo.
- Reglamento (UE) 2026/1744 de 8 de julio de 2026 («Digital Omnibus on AI»): artículo 1(5), que modifica el artículo 4, Unión Europea, EUR-Lex, 2026. El reglamento que transformó esa obligación de resultado en obligación de medios, en vigor desde el 27 de julio de 2026.
- AI Literacy: Questions & Answers, Comisión Europea, AI Office, 2025, actualizado el 27 de julio de 2026. No se exige ningún umbral medible: el esfuerzo esperado es proporcionado al papel y al riesgo de quien lo aplica.
- AI4K12: Five Big Ideas in AI, AAAI y CSTA (Association for the Advancement of Artificial Intelligence / Computer Science Teachers Association), financiado por la National Science Foundation (subvención DRL-1846073), 2018. Un marco estadounidense, citado para que el módulo europeo siga siendo un módulo al lado de la base común, nunca la base misma.
Los trabajos científicos y técnicos, por tema
Cada afirmación técnica de este curso lleva una publicación verificada en línea el 13 de agosto de 2026, reunida aquí por tema en lugar de alineada en una sola lista ilegible. Las páginas de demostración y los artículos del blog citan además, al pie de página, las publicaciones propias de su tema.
Tokenización
Estos trabajos establecen cómo un texto se trocea en unidades más pequeñas que una palabra, y por qué ese troceado cuesta más en algunos idiomas que en otros.
- Neural Machine Translation of Rare Words with Subword Units, Rico Sennrich et al., 2016.
- A New Algorithm for Data Compression, Philip Gage, 1994.
- Language Model Tokenizers Introduce Unfairness Between Languages, Aleksandar Petrov et al., 2023.
Predicción y muestreo
Estos trabajos muestran cómo un modelo elige una palabra en una distribución de probabilidad, y cómo la temperatura y los cortes top-k o top-p cambian esa elección.
- The Curious Case of Neural Text Degeneration, Ari Holtzman et al., 2020.
- Distilling the Knowledge in a Neural Network, Geoffrey Hinton et al., 2015.
- Hierarchical Neural Story Generation, Angela Fan et al., 2018.
Alucinación
Estos trabajos explican por qué un modelo inventa con aplomo: una consecuencia de la forma en que se entrena y se evalúa, no una avería aislada.
- A Survey on Hallucination in Large Language Models: Principles, Taxonomy, Challenges, and Open Questions, Lei Huang et al., 2023.
- Why Language Models Hallucinate, Adam Tauman Kalai et al., 2025.
- Hallucination is Inevitable: An Innate Limitation of Large Language Models, Ziwei Xu et al., 2024. En discusión: este trabajo sostiene que cierta tasa de alucinación es matemáticamente inevitable para un modelo usado como resolutor general de problemas; trabajos posteriores cuestionan que sus hipótesis formales se apliquen a los usos reales y finitos de los modelos.
Sesgos
Estos trabajos miden que los sesgos humanos presentes en los corpus de entrenamiento reaparecen, medibles, en los modelos que salen de ellos.
- Man is to Computer Programmer as Woman is to Homemaker? Debiasing Word Embeddings, Tolga Bolukbasi et al., 2016.
- Semantics derived automatically from language corpora contain human-like biases, Aylin Caliskan et al., 2017.
- Gender Shades: Intersectional Accuracy Disparities in Commercial Gender Classification, Joy Buolamwini, Timnit Gebru, 2018.
- Datasheets for Datasets, Timnit Gebru et al., 2018.
Memorización de los datos
Estos trabajos demuestran que un modelo puede devolver palabra por palabra fragmentos de sus datos de entrenamiento, incluida información personal, con una simple consulta.
- Extracting Training Data from Large Language Models, Nicholas Carlini et al., 2021.
- Quantifying Memorization Across Neural Language Models, Nicholas Carlini et al., 2023.
- Scalable Extraction of Training Data from (Production) Language Models, Milad Nasr et al., 2023.
Imagen fabricada
Estos trabajos identifican los artefactos técnicos que delatan una imagen generada, y señalan que el ojo humano ya no los ve en los rostros de síntesis recientes.
- Leveraging Frequency Analysis for Deep Fake Image Recognition, Joel Frank et al., 2020.
- Detecting and Simulating Artifacts in GAN Fake Images, Xu Zhang et al., 2019.
- AI-synthesized faces are indistinguishable from real faces and more trustworthy, Sophie J. Nightingale, Hany Farid, 2022.
Voz fabricada
Estos trabajos sitúan la detección de voz sintética y sus límites, y una autoridad pública documenta un uso fraudulento real de una voz clonada.
- WaveFake: A Data Set to Facilitate Audio Deepfake Detection, Joel Frank, Lea Schönherr, 2021.
- ASVspoof 2021: Towards Spoofed and Deepfake Speech Detection in the Wild, Xuechen Liu et al., 2021.
- FCC Makes AI-Generated Voices in Robocalls Illegal (declaración FCC 24-17), Federal Communications Commission (FCC), 2024.
Marcas de agua y procedencia
Estos trabajos describen las dos familias de prueba de origen, un manifiesto adjunto al archivo y una marca de agua estadística insertada en el texto generado, y sus límites respectivos.
- Content Credentials: C2PA Technical Specification (version 2.4), Coalition for Content Provenance and Authenticity (C2PA), 2026.
- C2PA Frequently Asked Questions, Coalition for Content Provenance and Authenticity (C2PA), 2026. El estándar reconoce él mismo que un manifiesto de procedencia puede separarse del archivo, y por tanto perderse con una simple captura de pantalla.
- A Watermark for Large Language Models, John Kirchenbauer et al., 2023.
- Scalable watermarking for identifying large language model outputs, Sumanth Dathathri et al., 2024. SynthID-Text, una marca de agua estadística publicada y revisada por pares en la revista Nature.
Detectores
Estos trabajos muestran que los detectores de texto generado por IA se equivocan, con un sesgo documentado contra los hablantes no nativos del inglés, hasta el punto de que un editor retiró el suyo.
- GPT detectors are biased against non-native English writers, Weixin Liang et al., 2023.
- OpenAI scuttles AI-written text detector over 'low rate of accuracy', Devin Coldewey, TechCrunch, difundiendo un addendum oficial de OpenAI, 2023.
- Testing of detection tools for AI-generated text, Debora Weber-Wulff et al., 2023.
Coste material
Estos trabajos cifran un consumo de energía en fuerte crecimiento, desproporcionado frente a una tarea equivalente confiada a un sistema especializado.
- Energy and AI, Agencia Internacional de la Energía (International Energy Agency, IEA), 2025.
- Power Hungry Processing: Watts Driving the Cost of AI Deployment?, Alexandra Sasha Luccioni et al., 2024.
Las tipografías
Las dos tipografías del sistema van incrustadas en woff2, en site/assets/css/fonts/: ninguna petición a un servicio de tipografías, ninguna CDN. Su licencia se releyó en línea el 14 de agosto de 2026, en la dirección del archivo que la contiene.
- Source Serif 4, SIL Open Font License, versión 1.1, Adobe, 2014 a 2023, nombre reservado «Source». Tipografías woff2 incrustadas, pesos 500 y 600, cursiva 400: llevan los títulos del sitio.
- Public Sans, SIL Open Font License, versión 1.1, The Public Sans Project Authors, 2015. Tipografías woff2 incrustadas, pesos 400, 600 y 700, cursiva 400: llevan el cuerpo de texto. Es la tipografía del sistema de servicio público estadounidense USWDS.
La licencia SIL Open Font License autoriza el uso, la modificación y la redistribución de las dos tipografías, con la única condición de no revenderlas por separado y de conservar la licencia con ellas.
Los corpus de las demostraciones
Solo hay una obra ajena incrustada en las demostraciones, y es de dominio público. Otros dos textos son enteramente de origen ODERSA: uno sirve para comparar un mismo contenido según el idioma, el otro para mostrar cómo la composición de un corpus inclina un modelo.
Un texto de dominio público
Le Tour du monde en quatre-vingts jours, Jules Verne, 1873. Dominio público: Jules Verne murió el 24 de marzo de 1905, y su obra en francés es libre de derechos en todas partes desde hace mucho. Los 623 primeros párrafos de la novela, unas 25 288 palabras, forman el corpus con el que se entrena el modelo de juguete de este curso. Los únicos retoques, todos reversibles y declarados en el archivo del corpus, son tipográficos: apóstrofos convertidos en tipográficos, guiones y comillas de la transcripción retirados, marcas de cursiva retiradas, títulos de capítulo y tabla de contenidos descartados. Un modelo que solo ha leído ese texto de 1873 no puede saber nada de lo ocurrido desde entonces: es exactamente lo que la demostración pone en evidencia. La obra se conserva en su francés original en todos los idiomas del sitio: una fuente citada se cita al pie de la letra, y traducirla haría que el modelo aprendiera sobre un texto que nadie ha publicado.
Un texto de la casa
La misma frase, en los 7 idiomas que la flota de la ODERSA prevé servir, sirve para comparar cuántas unidades exige un mismo sentido según el idioma. Ese texto es el de la propia banda de confianza de la ODERSA, ya publicado bajo licencia CC BY 4.0: no es un corpus ajeno, y no plantea por tanto ninguna cuestión de derechos.
Un corpus fabricado ante sus ojos
La demostración sobre el origen de los sesgos no toma prestado ningún texto: fabrica el suyo, a partir de dos frases tipo, ocho nombres de profesión y ocho nombres de ciudad. Es usted quien ajusta su composición, y ese es todo el objeto de la página: un modelo no puede devolver lo que nunca ha leído. Ese corpus está escrito en francés, como la novela de 1873, y las seis páginas traducidas lo dicen cada una en su idioma. Es de origen ODERSA: no es un corpus ajeno, y no plantea por tanto ninguna cuestión de derechos.
El motor que hace funcionar estas demostraciones, que extrae de esos corpus y calcula probabilidades, es código escrito por la ODERSA: no es una biblioteca ajena, y este sitio no incrusta ninguna.
Los esquemas
Cada esquema de este sitio es un SVG dibujado a mano por la ODERSA, sin fotografía ni imagen llamada a un dominio ajeno. Cada uno es reutilizable bajo licencia CC BY 4.0, como el resto del sitio, y su pie lleva esa mención.
Eso es lo que permite a la banda de confianza prometer que no sale ninguna petición del dispositivo que abre este sitio: ninguna imagen, como ninguna tipografía y ningún script, se llama a distancia.
Las fotografías
Cada fotografía de The AI Manual ilustra una página concreta, y su pie, bajo la imagen, ya lleva el autor. Esta tabla reúne cada una con su licencia completa, la dirección que la prueba en Wikimedia Commons, y la página que la sirve.
| Lo que muestra | Autor | Licencia | Prueba en Wikimedia Commons | Servida en |
|---|---|---|---|---|
| Un teclado de ordenador portátil retroiluminado, la mayoría de los dedos apoyados en la fila de reposo, la tecla U pulsada | Colin | CC BY-SA 4.0 | Página del archivo | Inicio |
| La sala de lectura de la biblioteca Sainte-Geneviève de París, sus largas mesas y sus estanterías bajo una bóveda | JOHN TOWNER heytowner | CC0 | Página del archivo | De dónde vienen los sesgos |
| Un cuarto técnico donde convergen decenas de cables de red conectados a paneles de parcheo | Brian Hankins (Bhankins) | Dominio público | Página del archivo | Lo que se le da |
| Un fotógrafo agachado al borde de un campo de fútbol, con un teleobjetivo largo en la mano | Ximeg | CC BY-SA 3.0 | Página del archivo | Una imagen fabricada |
| Varios micrófonos montados en pies alrededor de una batería, en un estudio de grabación | dan paluska | CC BY 2.0 | Página del archivo | Una voz fabricada |
| Un aula magna vacía, sus filas de asientos y pupitres vistas desde el fondo de la sala | Yinan Chen | Dominio público | Página del archivo | Para enseñar |
Dos de estas fotografías, el teclado del inicio y el fotógrafo de la página Una imagen fabricada, están bajo una licencia de compartir igual, CC BY-SA. El texto de The AI Manual está bajo CC BY 4.0, como anuncia la licencia; esas dos fotografías conservan su propia licencia, no pasan a la del sitio. Retomar la página que las lleva obliga a redifundir la fotografía bajo esa misma licencia de compartir igual, con su atribución, no bajo los términos del resto del sitio.
Todas las fotografías de esta página están incrustadas en este repositorio y se sirven desde el dominio del sitio, nunca se llaman a una dirección ajena, igual que las tipografías y los esquemas. Eso es lo que permite a la banda de confianza prometer que no sale ninguna petición del dispositivo que abre este sitio.
Lo que este sitio no le debe a nadie más
- Ninguna dependencia: ni una línea de código tomada de una biblioteca ajena.
- Ninguna CDN: las tipografías, los scripts y las imágenes están todos incrustados en este repositorio.
- Ningún servicio de inteligencia artificial llamado: las demostraciones son deterministas, funcionan enteramente en el dispositivo que las abre.
- Ninguna herramienta de medición en estas páginas, ninguna cookie, ninguna cuenta: nada que identifique a quien abre esta página.
Eso se comprueba en unos segundos, en la pestaña Red del navegador, mientras la página se carga: no sale ninguna petición.
Cómo se mantienen estos créditos
Una fuente caducada, una dirección que ha cambiado, una atribución mal puesta: eso se comunica, sin cuenta ni formulario. Las condiciones de reutilización de este sitio se describen en la licencia.