术语 · 概念
大模型幻觉
大模型幻觉是指模型生成了流畅、自信但与事实不符的内容,成因是它在预测下一个词而不是在查证事实。
大模型幻觉是指模型生成了流畅、自信但与事实不符的内容,成因是它在预测下一个词而不是在查证事实。
幻觉不是故障,而是生成机制的固有产物。模型学到的是词与词之间的统计关系,当被问到语料中没有明确答案的问题时,它仍会产出一个语法通顺、格式正确的回答——因为”说不知道”在训练数据里远不如”给出答案”常见。
品牌场景下的三种典型形态
- 张冠李戴:把另一家主体的信息安到你头上,或反过来。这是同名混淆率统计的对象。
- 细节编造:成立时间、融资、客户名单、产品价格被凭空补齐,因为这些字段”通常应该有值”。
- 过时信息:模型给出的是训练截止时的旧事实,而不是当前状态。
与检索增强的关系
联网检索(RAG)能减少幻觉,但不能消除。检索只是把外部文本塞进上下文,模型仍在做生成;如果检索到的引用源本身是错的,或者关于品牌的说法互相矛盾,模型会挑一个看起来最连贯的版本输出。这意味着幻觉的一部分成因在网上而不在模型里。
可控的部分
从内容侧能做的是降低歧义和补齐空白:让关键事实在自己的站点上写明、写一致、可被抓取,让权威第三方来源与自述相符。语料里事实密度足够高时,模型倾向复述而不是编造。这是生成引擎优化能起作用的机理,也是它的边界——它只能减少幻觉的概率,无法保证单次回答正确。