IngenierÃa de Prompts (#4) Limitaciones de los LLM: errores, alucinaciones y sesgos 🇪🇸 ထ 🇺🇸 Prompt Engineering (#4) LLM Limitations: Errors, Hallucinations, and Bias
Published on HivePostify by @richard-mvm · Sun Aug 09 2026
En el artÃculo anterior vimos que un LLM no sabe nada en el sentido en que tú y yo sabemos algo, porque predice el siguiente token basándose en probabilidades aprendidas de su entrenamiento. Y eso le permite incluso resumir un paper de bioquÃmica, pero también lo lleva a inventar una cita académica que no existe, a asignar profesiones según el género, o a decirte que un paÃs del Caribe tiene costa en el PacÃfico. Hoy conoceremos por qué pasa esto, y por qué entenderlo influye en cómo deberÃas escribir tus prompts.
In the previous article , we saw that an LLM doesn't "know" anything the way you and I know something, because it predicts the next token based on probabilities learned during training. That's what lets it summarize a biochemistry paper, but it's also what leads it to invent an academic citation that doesn't exist, assign professions based on gender, or tell you that a Caribbean country has a Pacific coastline. Today we'll look at why this happens, and why understanding it should shape how you write your prompts.
Alucinar es una consecuencia matemática Durante mucho tiempo se explicó las alucinaciones como un problema de datos sucios o de modelos mal afinados. Un paper de OpenAI publicado en septiembre de 2025 plantea que las alucinaciones no son solo mala data de entrenamiento o un mal ajuste fino, sino consecuencia matemática de cómo funciona el preentrenamiento con entropÃa cruzada. O sea, que el proceso usado para entrenar estos modelos hace que inventar información plausible sea matemáticamente inevitable en ciertos casos, y no un accidente que se pueda pulir totalmente.
Hallucinating Is a Mathematical Consequence For a long time, hallucinations were explained away as a problem of messy data or poorly fine-tuned models. A paper published by OpenAI in September 2025 argues that hallucinations aren't just a byproduct of bad training data or weak fine-tuning, but a mathematical consequence of how cross-entropy pretraining works. In other words, the very process used to train these models makes inventing plausible-sounding information mathematically inevitable in certain cases — not an accident that can be fully polished away.
Hay un segundo factor, y es cómo evaluamos a estos modelos. Los procesos de entrenamiento y evaluación tienden a premiar las respuestas seguras por encima de admitir incertidumbre. Por eso un modelo que responde que no tiene información suficiente para afirmar algo pierde puntos en la mayorÃa de los benchmarks, pero no pasa lo mismo con uno que arriesga una respuesta convincente, aunque esté mal. Muchas de las pruebas de evaluación de LLMs premian adivinar por encima de reconocer incertidumbre, asà que el modelo aprende que es mejor sonar seguro.
Un estudio reciente identificó cuatro fuentes distintas de alucinación: lÃmites fundamentales de la teorÃa de la computabilidad (problemas que ningún sistema puede resolver perfectamente) que hacen que la alucinación sea matemáticamente inevitable; alucinaciones inducidas por los datos de entrenamiento incompletos, ruidosos o desactualizados; desalineación en la evaluación, donde los benchmarks premian la fabricación confiada sobre la incertidumbre; y trade-off entre creatividad y factualidad, donde los mismos mecanismos que permiten generación creativa aumentan el riesgo de alucinación. Esa última es interesante para cualquiera que use IA para escribir, porque el mismo modelo que te permite completar una idea que tú no terminaste de escribir es el que lo lleva a completar un dato que no tiene.
There's a second factor: how we evaluate these models. Training and evaluation processes tend to reward confident answers over admitting uncertainty. That's why a model that says it doesn't have enough information to make a claim loses points on most benchmarks, while one that gambles on a convincing-sounding answer — even a wrong one — doesn't. Many LLM evaluation tests reward guessing over acknowledging uncertainty, so the model learns that sounding confident is the better strategy.
A recent study identified four distinct sources of hallucination: fundamental limits from computability theory (problems no system can solve perfectly), which make hallucination mathematically unavoidable; hallucinations induced by incomplete, noisy, or outdated training data; evaluation misalignment, where benchmarks reward confident fabrication over uncertainty; and a creativity–factuality trade-off, where the same mechanisms that enable creative generation also raise the risk of hallucination. That last one is interesting for anyone using AI to write, because the same model that lets it finish an idea you didn't finish writing is the one that leads it to fill in a fact it doesn't actually have.
Ejemplo con consecuencias reales En el caso Mata v. Avianca de 2023, un abogado en Nueva York fue sancionado por presentar un escrito legal que contenÃa citas fabricadas generadas por ChatGPT. Y no fue un caso aislado, ya que en NeurIPS 2025, una de las conferencias más importantes de inteligencia artificial del mundo, se documentó una taxonomÃa de cien citas fabricadas en el proceso de revisión por pares. Lo que hace ese caso tan incómodo es que ocurrió en una conferencia donde autores y revisores son expertos en los mismos sistemas que producen las alucinaciones. Es decir, que si la gente que estudia esto profesionalmente no logra detectar fabricaciones generadas por IA en su propio proceso de revisi��n, el problema no es de usuarios descuidados.
An Example With Real-World Consequences In the 2023 Mata v. Avianca case, a New York lawyer was sanctioned for filing a legal brief containing fabricated citations generated by ChatGPT. And it wasn't an isolated incident — at NeurIPS 2025, one of the world's most important AI conferences, researchers documented a taxonomy of one hundred fabricated citations appearing in the peer review process. What makes that case so unsettling is that it happened at a conference where the authors and reviewers are experts in the very systems that produce these hallucinations. In other words, if people who study this professionally can't catch AI-generated fabrications in their own review process, the problem isn't careless users.
Y hay un detalle que explica por qué a veces el modelo se equivoca justo en lo que parecÃa más fácil de verificar: gran parte de las alucinaciones vienen de problemas dentro de los propios datasets, que se pueden agrupar en dos clases, una es la falta de datos relevantes, y la otra son datos repetidos. El conocimiento poco frecuente, conocido por long-tail knowledge , está mal representado en el entrenamiento, asà que el modelo tiene menos agarre sobre esos temas y más probabilidad de rellenar los huecos con algo que suena bien.
And there's a detail that explains why the model sometimes gets things wrong exactly where you'd expect it to be easiest to verify: much of the hallucination problem comes from issues within the datasets themselves, which fall into two categories — a lack of relevant data, and repeated data. Infrequent knowledge, known as long-tail knowledge , is poorly represented during training, so the model has a weaker grip on those topics and a higher chance of filling the gaps with something that just sounds right.
El modelo aprendió del mundo, con todo y prejuicios El sesgo es el modelo repitiendo, con total confianza, patrones problemáticos que sà aprendió — porque estaban ahÃ, en los datos.
La investigación distingue dos tipos: los sesgos intrÃnsecos, originados en datos de entrenamiento, la arquitectura y los supuestos de diseño del modelo, y los extrÃnsecos. Un ejemplo bastante citado es que los modelos de lenguaje pueden reforzar estereotipos de género en ocupaciones, asociando "doctor" con hombres y "enfermera" con mujeres. Y no es la opinión del modelo, sino aritmética de co-ocurrencia, pues si en el corpus de entrenamiento la palabra "doctor" aparece con pronombres masculinos con mucha más frecuencia que con femeninos, el modelo aprende esa asociación como un patrón estadÃstico válido, y lo reproduce.
Por ejemplo, se documentó que GPT-4o mostró sesgos discriminatorios al asociar profesiones según género, generando la imagen de un hombre cuando se le pedÃa representar a alguien como CEO de una empresa o realizando un experimento cientÃfico. No hace falta pedirle al modelo una opinión sobre roles de género para que el sesgo aparezca, sino que basta con pedirle una imagen neutra de un puesto de trabajo.
The Model Learned From the World — Biases Included Bias is the model confidently repeating problematic patterns it genuinely learned — because they were there, in the data.
Research distinguishes two types: intrinsic biases, originating in the training data, the architecture, and the model's design assumptions, and extrinsic ones. A frequently cited example is that language models can reinforce occupational gender stereotypes, associating "doctor" with men and "nurse" with women. And it isn't the model's opinion — it's co-occurrence arithmetic: if in the training corpus the word "doctor" appears with masculine pronouns far more often than with feminine ones, the model learns that association as a valid statistical pattern, and reproduces it.
For instance, GPT-4o was documented showing discriminatory bias by associating professions with gender, generating an image of a man when asked to depict someone as a company CEO or performing a scientific experiment. The model doesn't need to be asked for an opinion on gender roles for the bias to show up — simply asking for a neutral image of a job is enough.
También existe algo llamado sesgo de cortesÃa, que me parece de los hallazgos más incómodos: los LLMs son más propensos a obedecer solicitudes dañinas si se les pide con cortesÃa, porque su entrenamiento recompensa el lenguaje deferente. Un estudio de 2024 de la Universidad de Massachusetts encontró que modelos como GPT-4 eran más propensos a cumplir con indicaciones poco éticas cuando se les pedÃa con un "¿PodrÃas por favor…" en comparación con órdenes directas. Eso dice algo sobre cómo el tono de tu prompt cambia el comportamiento del modelo de formas que no siempre son intuitivas.
There's also something called politeness bias, which I find to be one of the more unsettling findings: LLMs are more likely to comply with harmful requests when asked politely, because their training rewards deferential language. A 2024 University of Massachusetts study found that models like GPT-4 were more likely to go along with unethical instructions when phrased as "Could you please…" compared to direct commands. That says something about how the tone of your prompt can shift a model's behavior in ways that aren't always intuitive.
El sesgo es también de idioma y cultura En una versión reciente del dataset Common Crawl —una de las fuentes principales de entrenamiento de muchos modelos— el 46% de los documentos estaba en inglés, seguido de alemán y ruso, cada uno con menos del 6%. Apenas un 19% de la población mundial habla inglés, según el CIA World Factbook. Y varias investigaciones muestran que los LLMs tienden a adaptarse a los valores culturales de sociedades occidentales, educadas, industrializadas, ricas y democráticas —lo que se conoce como sociedades WEIRD— porque esa es la fuente predominante de los datos con los que fueron entrenados. Asà que si le pides a un modelo que razone sobre lo que es "normal" en una situación social, hay una probabilidad de que su respuesta refleje supuestos de clase media estadounidense, y no un consenso universal.
The Bias Is Also Linguistic and Cultural In a recent version of the Common Crawl dataset — one of the main training sources for many models — 46% of documents were in English, followed by German and Russian, each under 6%. Only about 19% of the world's population speaks English, according to the CIA World Factbook. Multiple studies also show that LLMs tend to skew toward the cultural values of Western, educated, industrialized, rich, and democratic societies — known as WEIRD societies — because that's the predominant source of the data they were trained on. So if you ask a model to reason about what's "normal" in a social situation, there's a good chance its answer will reflect middle-class American assumptions rather than any kind of universal consensus.
Por qué te importa como usuario No es para que desconfÃes de la IA al punto de no usarla — lo que serÃa un poco absurdo en un curso dedicado a exprimirla.
Si sabes que el modelo está optimizado para sonar seguro incluso cuando no lo está, puedes pedirle explÃcitamente que señale su nivel de confianza o que te diga cuándo un dato no puede verificar. Si sabes que el long-tail knowledge es un punto débil, sabes que para temas muy especÃficos o poco documentados —digamos, un cultivar de yuca poco común o una técnica terapéutica de nicho— necesitas verificación externa. Y si sabes que el sesgo cultural está incrustado en los datos, puedes pedirle al modelo que considere perspectivas no occidentales, en lugar de asumir que su primera respuesta es neutral por default.
Vamos a volver a esto con herramientas más adelante en el curso: cómo reducir alucinaciones en el artÃculo 21, cómo verificar y validar respuestas en el 22, y cómo pedir fuentes y evidencia de forma que el modelo no las invente en el 23. Por ahora, con saber que estas limitaciones no son fallas ocasionales, sino propiedades que debes aprender a manejar.
Why This Matters to You as a User This isn't meant to make you distrust AI to the point of not using it — which would be a little absurd in a course dedicated to getting the most out of it.
If you know the model is optimized to sound confident even when it isn't, you can explicitly ask it to flag its confidence level or tell you when a piece of information can't be verified. If you know long-tail knowledge is a weak spot, you know that for very specific or poorly documented topics — say, an obscure cassava cultivar or a niche therapeutic technique — you need outside verification. And if you know cultural bias is baked into the data, you can ask the model to consider non-Western perspectives instead of assuming its first answer is neutral by default.
We'll come back to this with concrete tools later in the course: how to reduce hallucinations in article 21, how to verify and validate responses in article 22, and how to ask for sources and evidence in a way that keeps the model from inventing them in article 23. For now, just know that these limitations aren't occasional glitches — they're properties you need to learn to manage.
- https://openai.com/index/why-language-models-hallucinate/ - https://doi.org/10.1038/s41586-026-10549-w - https://doi.org/10.48550/arXiv.2401.11817 - https://aclanthology.org/2025.acl-long.71/ - https://www.nature.com/articles/d41586-025-00662-7
Todas las imágenes son de mi propiedad / generadas por IA, a menos que se indique lo contrario. Texto original en español, traducido al inglés con asistencia de Claude.
All images are my own / AI-generated, unless otherwise noted. Original text in Spanish, translated to English with Claude's assistance.
Tags: #prompt-engineering#inteligencia-artificial#machine-learning#llm#educacion#ai-bias#data-science#tecnologia#aprendizaje