Cuándo no usarla
Este capítulo cierra el curso, y es el más útil. Un modelo produce una respuesta plausible, nunca una respuesta verificada. Todo el discernimiento cabe por tanto en una sola pregunta, hecha antes de preguntar: ¿qué pasa si la respuesta es falsa y nadie lo nota?
Los capítulos anteriores han mostrado una mecánica: un modelo trocea, calcula una distribución, sortea dentro, y vuelve a empezar. Nada en esa mecánica verifica nada. Una respuesta sale porque es probable, no porque sea correcta, y el modelo no dispone de ninguna señal fiable de su propia ignorancia. Este capítulo saca de ahí la consecuencia práctica.
La buena pregunta nunca es «¿puedo?». Es «¿quién paga si es falso?».
Las tres pruebas
Tres preguntas bastan, y se hacen en este orden. La primera que cae cierra la puerta.
El coste de un error
¿Un error se puede recuperar? Un borrador mal escrito se reescribe en dos minutos. Un medicamento, un plazo fiscal, un diagnóstico, una dosis, un mensaje enviado a un cliente se recuperan mal o no se recuperan. Cuanto más irreversible es un error, menos sitio tiene un modelo en la decisión.
La verificabilidad
¿Puede usted verificar la respuesta en su fuente, por sí mismo, en un tiempo razonable? Si sí, el modelo es un punto de partida aceptable, y la verificación sigue siendo obligatoria. Si no, la respuesta es inservible, sea cual sea su aplomo. Una respuesta inverificable no es una información a medias: es una información nula.
Cuidado con la verificación de pega. Preguntar al modelo si está seguro no verifica nada: la confirmación se calcula con la misma mecánica que la respuesta, y es igual de plausible que ella. Pedirle sus fuentes tampoco verifica nada mientras las fuentes no se hayan abierto una a una, porque una referencia inventada está perfectamente bien construida.
La legitimidad
¿La situación exige una persona responsable? Una decisión que afecta a una persona, a sus derechos, a su trabajo o a su nota compromete a alguien que debe poder responder por ella y a quien se le puede reclamar. Ninguna máquina carga con esa responsabilidad, y delegarle la decisión no hace desaparecer la responsabilidad: solo la vuelve imposible de encontrar.
Los casos en que la herramienta se cierra
- Decidir un tratamiento, una dosis, un diagnóstico, fuera de un profesional sanitario.
- Fundar un acto jurídico, un contrato, una declaración, un recurso en una respuesta no verificada en la fuente oficial.
- Zanjar una decisión que afecta a una persona: contratación, calificación, sanción, concesión de una ayuda.
- Acusar a alguien, a partir de un detector o de una impresión.
- Tratar un contenido que no se tiene derecho a confiar: véase el capítulo lo que se le da.
- Sustituir un cálculo exacto por una predicción: un modelo de lenguaje no cuenta, predice lo que se parece a una cuenta.
- Hacer un primer borrador que se va a reescribir de todas formas.
- Reformular un texto que uno mismo ha escrito y que va a releer.
- Obtener pistas que verificar, sabiendo que ninguna está adquirida.
- Explicar una noción que uno es capaz de contrastar en otra parte.
- Traducir para entender, nunca para publicar sin revisión de alguien que hable el idioma.
La trampa del detector
Un caso merece tratamiento propio, porque hace daño real y porque se presenta como la solución: las herramientas que pretenden decir si un texto lo ha escrito una inteligencia artificial. Este sitio no ofrece ninguna, y no es una carencia.
Tres constataciones publicadas lo justifican. Una evaluación independiente de catorce herramientas de detección, entre ellas herramientas comerciales vendidas a la enseñanza, concluye que ninguna es a la vez fiable y precisa. Otro estudio establece que varios detectores muy usados clasifican por error la mayoría de los textos escritos por hablantes no nativos de inglés como generados por una máquina, mientras tratan correctamente los textos de hablantes nativos: el error no está repartido al azar, cae sobre personas ya desfavorecidas. Y por último la empresa que había publicado el detector más conocido lo retiró seis meses después de su lanzamiento, alegando ella misma una tasa de fiabilidad demasiado baja.
Un resultado de detector no es una prueba y no funda ninguna sanción. Una duda sobre un trabajo se trata con una conversación, con una pregunta sobre el método seguido, con un oral, con una versión intermedia solicitada. Jamás con un porcentaje.
El detalle de este expediente, y lo que un centro puede poner en su lugar, se tratan en el blog: los detectores de IA en la escuela.
El coste material, que también cuenta
Un último motivo para abstenerse no tiene nada que ver con la exactitud. Emplear un sistema generativo de uso múltiple para una tarea que una herramienta especializada hace mejor cuesta, para esa misma tarea, un orden de magnitud más de energía y de emisiones. Buscar una cadena exacta en un documento, ordenar una lista, sumar una columna, convertir un formato: esas tareas tienen herramientas que las hacen exactamente, más rápido y sin inventar. A escala mundial, el consumo eléctrico de los centros de datos ligado a la inteligencia artificial crece unas cuatro veces más rápido que la demanda eléctrica total, y debería más que duplicarse entre 2024 y 2030.
El gesto, aquí, es simple: preguntar primero si la tarea tiene una respuesta exacta. Si la tiene, existe una herramienta exacta.
El resumen del curso en una regla
Un modelo sirve para producir lo que vamos a verificar, nunca para decidir lo que no verificaremos.
El resto se deduce. Si la verificación es imposible, el uso no procede. Si la verificación es posible pero no se hace, ya no es el modelo lo que está en cuestión.
Para ir más lejos
La mecánica de la invención se trata en el capítulo por qué inventa. El gesto de verificación, paso a paso, está publicado en el blog: el gesto de verificación. Las obligaciones propias de una región entran como módulo al lado del curso, nunca como base común: véase la obligación europea y los marcos oficiales. El índice del curso está en la página entender.
Fuentes
- Testing of detection tools for AI-generated text Debora Weber-Wulff, Alla Anohina-Naumeca, Sonja Bjelobaba, Tomas Foltynek, Jean Guerrero-Dib, Olumide Popoola, Petr Sigut, Lorna Waddington, 2023. Establece que una evaluación independiente de catorce herramientas de detección de texto generado por IA, incluidas herramientas comerciales usadas en la enseñanza, concluye que ninguna de ellas es a la vez fiable y precisa, con un sesgo a clasificar el texto como humano antes que a detectar la máquina.
- GPT detectors are biased against non-native English writers Weixin Liang, Mert Yuksekgonul, Yining Mao, Eric Wu, James Zou, 2023. Establece que varios detectores muy usados clasifican por error la mayoría de los textos escritos por hablantes no nativos de inglés como generados por una IA, mientras identifican correctamente los textos de hablantes nativos.
- OpenAI scuttles AI-written text detector over «low rate of accuracy» Devin Coldewey / TechCrunch, citando el addendum oficial de OpenAI de 20 de julio de 2023. Establece que OpenAI retiró su propia herramienta de detección de texto generado por IA seis meses después de su lanzamiento, alegando ella misma una tasa de fiabilidad demasiado baja para ser útil.
- Energy and AI Agencia Internacional de la Energía, 2025. Establece que el consumo eléctrico mundial de los centros de datos ligado a la IA crece unas cuatro veces más rápido que la demanda eléctrica mundial total, y debería más que duplicarse entre 2024 y 2030.
- Power Hungry Processing: Watts Driving the Cost of AI Deployment? Alexandra Sasha Luccioni, Yacine Jernite, Emma Strubell, 2024. Establece que los sistemas de IA generativa de uso múltiple consumen, para una tarea dada, un orden de magnitud más de energía y de emisiones de carbono que un sistema especializado en esa misma tarea.
- Why Language Models Hallucinate Adam Tauman Kalai, Ofir Nachum, Santosh S. Vempala, Edwin Zhang, 2025. Establece que los procedimientos de entrenamiento y sobre todo de evaluación actuales recompensan adivinar una respuesta plausible antes que admitir la incertidumbre.