Alucinaciones de los LLM
Alucinación (del inglés hallucination) en el contexto de los modelos de lenguaje grandes (LLM) es un fenómeno en el que el modelo genera con confianza una respuesta que parece plausible (plausible), pero que en realidad no se corresponde con la realidad, el contexto proporcionado o es internamente contradictoria[1][2]. El modelo «inventa» hechos, detalles o conclusiones lógicas que no están presentes en los datos de origen.
Es importante señalar que una alucinación no es un fallo o un error en el sentido tradicional. El modelo funciona según su diseño: predice la continuación más probable del texto basándose en los patrones extraídos de los datos de entrenamiento. No tiene un mecanismo incorporado de verificación de la veracidad[3]. Las alucinaciones se diferencian de los errores simples en que presentan información con confianza pero falsa, que a menudo incluye hechos, citas o eventos inexistentes[4]. Este fenómeno ha adquirido tal importancia que en 2023, el Diccionario de Cambridge agregó una nueva definición para el término «hallucination», relacionada con la inteligencia artificial[5].
Definiciones y clasificación de las alucinaciones
Aunque se utilizan diversos términos (por ejemplo, «confabulación», «invención»), las alucinaciones en los LLM se pueden dividir en dos grandes categorías: las relacionadas con la veracidad fáctica y las relacionadas con la fidelidad a la fuente (coherencia contextual)[6].
Alucinaciones fácticas
Este es el caso en que el modelo presenta información objetivamente incorrecta sobre el mundo real. El modelo afirma un «hecho» falso como si fuera verdadero[1].
- Ejemplo: «Charles Lindbergh fue la primera persona en pisar la superficie de la Luna» — un hecho completamente inventado.
- Citas y referencias falsas: El modelo puede inventar una referencia a un trabajo científico o una ley inexistente, imitando el formato de una referencia real[2]. Esto socava la confianza en los modelos, especialmente en aplicaciones que requieren precisión (educación, noticias, consultoría)[7].
Errores lógicos
El modelo comete una inconsistencia o un error en el razonamiento. Los hechos individuales en la respuesta pueden ser correctos, pero la conclusión es ilógica o contradice la lógica elemental[2]. Esto ocurre a menudo en razonamientos complejos o en tareas de matemáticas y causalidad, donde el modelo opera con conexiones probabilísticas de palabras en lugar de con lógica formal[2][2].
- Ejemplo: «Dado que los pájaros vuelan, los astronautas no experimentan la gravedad» — el texto parece coherente, pero es lógicamente incorrecto.
Alucinaciones contextuales
La respuesta del modelo no se corresponde con el contexto o la instrucción proporcionada. El modelo «se sale» del contexto, añadiendo información superflua o ignorando la necesaria[1].
- Incumplimiento de la instrucción: Ante la petición «traduce el texto al español», el modelo responde en inglés[1].
- Información no proveniente de la fuente: En una tarea de resumen, el modelo «añade» hechos que no estaban en el documento original, o los distorsiona[1].
- Mezcla de contextos: A mitad de la respuesta, el modelo empieza a hablar de algo de otro ámbito. Por ejemplo, al responder una pregunta sobre el comisionado de la NBA Adam Silver, el modelo puede cambiar a su predecesor David Stern, mezclando dos contextos diferentes[6].
Inconsistencia
Una variedad de alucinación en la que el modelo se contradice a sí mismo dentro de una misma respuesta o serie de respuestas[6]. Un estudio encontró que en ChatGPT, el nivel de autocontradicción en las respuestas es de aproximadamente el 14%[6][6].
- Ejemplo: «La empresa X fue fundada en 1990... y unas frases más adelante ...La empresa X, creada en el año 2000...»
Alucinaciones en el código
Los LLM entrenados con código pueden generar fragmentos sintácticamente correctos pero no funcionales, utilizando funciones, bibliotecas o parámetros inexistentes[2]. Por ejemplo, un modelo podría generar `import quantum` en Python, aunque no existe un módulo estándar con ese nombre. En 2024, se propuso el término «code hallucination» y se creó el benchmark CodeMirage para sistematizar este problema[8].
Causas de la aparición
El fenómeno de las alucinaciones se debe a un conjunto de factores, desde la arquitectura del modelo hasta la calidad de los datos.
- Arquitectura y principio de entrenamiento: La mayoría de los LLM (por ejemplo, GPT) son transformadores autorregresivos, entrenados para predecir el siguiente token. Su objetivo es maximizar la verosimilitud del texto, no verificar la veracidad de las afirmaciones[2]. El modelo no distingue entre hechos y ficción en los datos de entrenamiento, percibiendo todo como patrones textuales[2].
- Calidad de los datos de entrenamiento: Los LLM se entrenan con enormes corpus de texto de Internet, que contienen numerosas imprecisiones, mitos e información desactualizada[1]. El modelo memoriza y reproduce estos errores. También es importante el knowledge cutoff — el límite temporal hasta el cual el modelo dispone de información.
- Método de generación de texto: La naturaleza estocástica de la generación (muestreo con temperatura) permite al modelo crear respuestas más «creativas», pero menos precisas. La longitud limitada del contexto puede llevar a que el modelo «olvide» detalles tempranos del diálogo y comience a contradecirse[6].
Métodos de evaluación y medición
Para detectar y medir las alucinaciones se utilizan métricas automáticas, evaluación humana y benchmarks especializados.
- Métricas automáticas: Incluyen enfoques donde otro LLM actúa como «juez» (LLM-as-a-judge) para evaluar la corrección de una respuesta[9], o el análisis de la entropía (incertidumbre) del modelo durante la generación[10].
- Anotación humana: Se considera el «estándar de oro». Expertos o evaluadores de crowdsourcing evalúan manualmente las respuestas, marcando los errores. Este método se utiliza en el entrenamiento de modelos mediante RLHF[11].
- Benchmarks y pruebas de estrés: Se han creado conjuntos de datos específicos, como TruthfulQA, que contiene preguntas diseñadas para provocar que el modelo reproduzca mitos comunes[12]. También existen tablas de clasificación, como el Hugging Face Hallucination Leaderboard, donde se comparan los modelos según su nivel de alucinaciones[13].
Métodos de mitigación y prevención
- Retrieval-Augmented Generation (RAG): El enfoque más exitoso, que «vincula» el modelo a conocimientos externos. Antes de generar una respuesta, el modelo recibe información relevante de una base de datos, un motor de búsqueda o una API. Esto permite que el modelo base su respuesta en datos verificados en lugar de conjeturas[2].
- Cadenas de pensamiento (Chain-of-Thought) y autoverificación: El modelo primero genera un razonamiento paso a paso antes de dar la respuesta final, lo que aumenta la precisión. En métodos más avanzados, como la autoverificación (Self-Verification), el modelo genera una respuesta preliminar y luego se le encarga que la revise y la corrija[14].
- Reglas y filtros integrados: Los modelos se entrenan para negarse a responder si no están seguros. Por ejemplo, los modelos Claude de Anthropic siguen un principio de «veracidad» y a menudo responden «No lo sé con certeza...» en lugar de inventar hechos[11].
- Integración con herramientas externas: Modelos como Gemini pueden reconocer automáticamente cuándo necesitan una herramienta externa (por ejemplo, una calculadora para cómputos o una búsqueda para noticias recientes) y utilizarla, lo que reduce significativamente el número de alucinaciones[11].
Riesgos y consecuencias
- Riesgos legales y de reputación: En el ámbito jurídico, las alucinaciones pueden tener graves consecuencias. El caso de Mata v. Avianca (2023) se hizo muy conocido, en el que un abogado utilizó ChatGPT para buscar precedentes judiciales, y este inventó varios casos inexistentes. Los abogados fueron multados, y el incidente sirvió de lección sobre la inadmisibilidad de confiar en la IA sin verificación[1].
- Propagación de desinformación: A escala social, los LLM pueden agravar el problema de las noticias falsas. Es conocido el caso del modelo Galactica de Meta, que fue creado para ayudar a los científicos pero comenzó a generar textos pseudocientíficos con experimentos y referencias inventadas. Tres días después, el acceso público al modelo fue cerrado[15].
- Toma de decisiones erróneas: Los usuarios, especialmente los menos experimentados, tienden a confiar en las respuestas formuladas con seguridad por la IA, lo que puede llevar a tomar decisiones incorrectas en finanzas, medicina y otras áreas críticas[7].
Ejemplos prácticos
- Caso de Air Canada (2023): El chatbot de la aerolínea inventó una política de reembolso de billetes inexistente. Cuando un cliente exigió que se aplicara, la compañía se negó. El Tribunal de Transportes de Canadá obligó a Air Canada a asumir la responsabilidad por la información proporcionada por su chatbot y a compensar las pérdidas del cliente[9].
- Demanda por difamación contra OpenAI (2023): El locutor de radio Mark Walters demandó a OpenAI porque, en respuesta a la consulta de un periodista, ChatGPT lo acusó falsamente de fraude. Este caso subrayó la responsabilidad legal de las empresas por el contenido generado por sus modelos[6].
Enlaces externos
- The Beginner's Guide to Hallucinations in Large Language Models — una guía detallada de Lakera
- Survey of Hallucination in Natural Language Generation — una revisión científica del fenómeno en arXiv
Literatura
- Holtzman, A. et al. (2020). The Curious Case of Neural Text Degeneration. arXiv:1904.09751.
- Caccia, M. et al. (2018). Language GANs Falling Short. arXiv:1811.02549.
- Fan, A. et al. (2018). Hierarchical Neural Story Generation. arXiv:1805.04833.
- Su, Y.; Collier, N. (2022). Contrastive Search Is What You Need for Neural Text Generation. arXiv:2210.14140.
- Meister, C. et al. (2023). Locally Typical Sampling. arXiv:2202.00666.
- O’Brien, S.; Lewis, M. (2023). Contrastive Decoding Improves Reasoning in Large Language Models. arXiv:2309.09117.
- Finlayson, M. et al. (2024). Basis-Aware Truncation Sampling for Neural Text Generation. arXiv:2412.14352.
- Tan, Q. et al. (2024). A Thorough Examination of Decoding Methods in the Era of Large Language Models. arXiv:2402.06925.
- Yu, S. et al. (2023). Conformal Nucleus Sampling. arXiv:2305.02633.
- Chen, S. J. et al. (2024). Decoding Game: On Minimax Optimality of Heuristic Text Generation Methods. arXiv:2410.03968.
Referencias
- ↑ 1.0 1.1 1.2 1.3 1.4 1.5 1.6 «The Beginner's Guide to Hallucinations in Large Language Models». Lakera. [1]
- ↑ 2.0 2.1 2.2 2.3 2.4 2.5 2.6 2.7 2.8 «What Is LLM Hallucination and How To Prevent It». Astera. [2]
- ↑ «Hallucination (artificial intelligence)». En Wikipedia. [3]
- ↑ «OpenAI describes LLM hallucinations as 'making up facts' in moments of uncertainty'». [fuente no especificada en el texto].
- ↑ «Cambridge Dictionary adds new definition for 'hallucinate'». [fuente no especificada en el texto].
- ↑ 6.0 6.1 6.2 6.3 6.4 6.5 6.6 «LLM Hallucination—Types, Causes, and Solutions». Nexla. [4]
- ↑ 7.0 7.1 «Effective Tips to Prevent AI Hallucinations in Generative AI». QuickCreator. [5]
- ↑ [2408.08333] CodeMirage: Hallucinations in Code Generated by Large Language Models. arXiv. [6]
- ↑ 9.0 9.1 «LLM hallucinations and failures: lessons from 4 examples». Evidently AI Blog. [7]
- ↑ «How to Perform Hallucination Detection for LLMs». Kolena. [8]
- ↑ 11.0 11.1 11.2 «ChatGPT vs Google Gemini vs Anthropic Claude: Comprehensive Comparison & Report». DataStudios. [9]
- ↑ «Mastering LLM Accuracy: How to Test, Detect, and Fix Hallucinations in AI Models». Stephen Weber on Medium. [10]
- ↑ «LLM Benchmarks and Leaderboards: Avoiding Foundation Model Mistakes». Arize Blog. [11]
- ↑ «Improving the Reliability of LLMs: Combining Chain-of-Thought Reasoning and Retrieval-Augmented Generation». arXiv. [12]
- ↑ «Why Meta Took Down its 'Hallucinating' AI Model Galactica?». Analytics India Magazine. [13]