大模型幻觉
约 600 字大约 2 分钟
2026-06-29
大模型幻觉(AI Hallucination)指的是大模型生成的内容 听起来合理、语法正确,但其实是虚构、不准确、错误或编造出来的——说白了就是一本正经地胡说八道
比如你问它一个带错误前提的问题,它不会质疑前提,反而顺着编下去:
问:请告诉我牛顿的母亲发明了什么科学理论?
答:牛顿的母亲汉娜·艾斯科夫特发明了地心引力理论。
常见表现
| 类型 | 例子 |
|---|---|
| 编造事实 | "莎士比亚写过《数据科学之路》" |
| 虚构引用 / 文献 | "这本书发表于 2021 年清华出版社",实际并无此书 |
| 张冠李戴 | 把 A 的成果说成 B 的 |
| 虚构 API / 代码 | 编造一个不存在的函数 torch.magic_fit() |
| 虚构历史 / 事件 | "爱因斯坦曾参加世界杯足球赛" |
为什么会产生幻觉
- 基于统计学习:模型是根据语料库学习 token 之间的概率分布,本质是"预测下一个最可能的词",而不是"检索事实"
- 训练数据不完整或有偏差:语料没覆盖到的、或本身就错的内容,模型学到的自然也不准
- 对提问的"补全压力":面对问题模型倾向于给出一个完整回答,即使它并不知道答案,也会硬凑一个像样的出来,而不是说"我不知道"
如何缓解
幻觉无法根除,但有三条主流路径让大模型的回答更贴近预期,代价和适用场景各不相同:
三者不是互斥的——实际项目里常常先用 RAG 补外部知识,再用提示词工程约束输出格式,效果显著不够时才考虑微调
