Investigación
El problema de la respuesta segura: qué dice la evidencia
Los modelos de lenguaje suenan igual de seguros cuando aciertan y cuando se equivocan. La investigación publicada sobre alucinación y calibración muestra por qué la seguridad es la señal equivocada — y qué pedir en su lugar.
La propiedad más peligrosa de un modelo de lenguaje moderno no es que a veces se equivoque. Es que se equivoca con el mismo tono de voz que usa cuando acierta.
Esa afirmación es fácil de enunciar. Esta pieza recorre la evidencia publicada que la respalda, porque es la evidencia la que la convierte en una restricción de diseño y no en una opinión.
La fluidez y la verdad se separan
En 2021, investigadores de Oxford y OpenAI construyeron TruthfulQA, un banco de preguntas diseñadas para que imitar el texto humano común produzca respuestas falsas. El mejor modelo que probaron fue veraz en el 58% de las preguntas; los humanos lograron el 94% (Lin et al., 2021). El hallazgo llamativo no fue la tasa de error, sino que los modelos más grandes y fluidos eran a menudo menos veraces en estas preguntas, porque habían aprendido mejor los errores populares.
El patrón persistió a medida que los modelos mejoraron. El propio banco SimpleQA de OpenAI, publicado en 2024, encontró que los modelos de frontera respondían mal una parte considerable de preguntas fácticas breves — y rara vez se abstenían de responder (OpenAI, 2024). Los modelos sabían mucho. No sabían de forma confiable qué era lo que no sabían.
Lo que está en juego no es hipotético
En ámbitos donde una respuesta equivocada tiene costo real, las tasas medidas son inquietantes. Un estudio de Stanford sobre preguntas jurídicas encontró que los modelos líderes alucinaban —inventando casos, tergiversando fallos o atribuyendo sentencias al tribunal equivocado— en la mayoría de las consultas jurídicas específicas evaluadas, con tasas entre el 58% y el 82% según el modelo y la tarea (Dahl et al., 2024). Desde entonces, varios países han sancionado a abogados por presentar escritos que citaban casos inexistentes.
La misma falla viaja a todas partes donde el conocimiento experto escasea. Un planificador municipal de una ciudad mediana —en Colombia, en Indonesia, en Polonia— que le pregunta a un modelo por un precedente de uso del suelo o por los períodos de retorno de una inundación tiene menos capacidad de detectar una invención segura que la que tenía el abogado, y a menudo no tiene ningún revisor institucional detrás. El problema de la respuesta segura golpea más fuerte justo donde la red de seguridad analítica es más delgada.
¿Puede un modelo saber qué no sabe?
En parte — y esta es la mitad alentadora de la evidencia. Una investigación de Anthropic encontró que los modelos grandes se pueden entrenar para producir autoevaluaciones razonablemente calibradas: cuando se les pide estimar la probabilidad de que su propia respuesta sea correcta, sus estimaciones se acercan a la realidad más que el azar, aunque de forma imperfecta y desigual entre ámbitos (Kadavath et al., 2022).
Así que la materia prima para la honestidad existe. Lo que falta es la práctica de mostrarla. La mayoría de los sistemas desplegados todavía presentan cada respuesta en el mismo registro —sin grado de seguridad, sin fuentes, sin marca sobre las afirmaciones más propensas a ser inventadas—. La incertidumbre está en la máquina; simplemente nunca llega a la persona que decide.
Qué significa esto para quien decide
Tres reglas se desprenden directamente de la evidencia:
- Nunca use la fluidez como sustituto de la confiabilidad. La investigación muestra que, en el mejor de los casos, no están correlacionadas.
- Exija un grado de seguridad calibrado, afirmación por afirmación. No una advertencia al final, sino una señal en cada aseveración fáctica, respaldada por una fuente que se pueda abrir.
- Trate los datos concretos sin fuente como no verificados. Nombres, cifras, citas y textuales son justo los detalles que los modelos inventan con más aplomo.
Por eso el Estándar Enpath le hace sus siete preguntas a toda respuesta. El problema de la respuesta segura no se resuelve haciendo que los modelos suenen más prudentes. Se resuelve cambiando qué es una respuesta: de un párrafo fluido a una estructura que carga su evidencia, su incertidumbre y a una persona que responde por ella.
Fuentes
- Lin, S., Hilton, J., & Evans, O. (2021). TruthfulQA: Measuring How Models Mimic Human Falsehoods. arxiv.org/abs/2109.07958
- Kadavath, S., et al. (2022). Language Models (Mostly) Know What They Know. arxiv.org/abs/2207.05221
- Dahl, M., Magesh, V., Suzgun, M., & Ho, D. E. (2024). Large Legal Fictions: Profiling Legal Hallucinations in Large Language Models. arxiv.org/abs/2401.01301
- OpenAI (2024). Introducing SimpleQA. openai.com/index/introducing-simpleqa