中央丢失:我的 RAG 机器人找到了正确的文本块,但 LLM 却忽视了它

林知秋AI 前沿📡 BestBlogs·AI高分精选⭐ 862026-10-011462 阅读💛 116 收藏
中央丢失:我的 RAG 机器人找到了正确的文本块,但 LLM 却忽视了它

📌 One-Sentence Summary

一位开发者的 RAG 支持机器人检索到了正确的退款政策文本块,但 LLM 从一个排序更靠前的保修文本块中回答了 30 天的结论,正确文本块却坐落在提示词中间,凸显了“lost-in-the-middle”位置偏差及四种实用解决方案。

📝 Summary

作者讲述了一次调试会话:他们的 RAG 支持机器人准确检索到了规定退款请求在 14 天后过期的政策段落,但模型却从一个排序更靠前的保修文本块中回答“30 天”。根本原因是“lost-in-the-middle”现象,这是 Liu 等人在 2023 年文档中记录的一种 U 形位置偏差,即 LLM 更关注提示词的开头和结尾,而忽视中间部分。文章解释了三种叠加原因:因因果注意力和注意力汇聚导致的首因效应,因 RoPE 距离衰减导致的近因效应,以及训练数据中关键事实很少出现在正中间且带有强化信号。作者提供了一个可复现的位置扫描工具来衡量这种偏差,然后按收益排序提供四种解决方案:重新排序到更少的文本块(top 4),将最佳文本块放在两侧,把问题放在文档之后,以及要求模型在回答前引用其来源。作者指出,更大的上下文窗口并不能解决问题,因为这是一种使用问题,而非容量限制。

💡 Main Points

“lost-in-the-middle”是一种位置偏差,LLM 在处理提示词开头和结尾的信息时远比处理中间的信息更为出色。

准确率遵循 U 形曲线随上下文位置变化。在 2023 年的 Liu 等人论文中发现,某些设置下,将答案文档放在中间的模型,甚至不如根本不提供任何文档的模型效果更差,因为周围的干扰项比正确答案的帮助更为破坏性。

该效应在上下文窗口未满之前就已显现,且不会因更大的窗口而消除。

作者在仅使用 10 个文本块和约 4K tokens 时就遇到了这种现象。更大的上下文窗口可以容纳更多的文本块,但无法让模型更好地利用中间部分;将 50 个文本块塞进 200K 窗口只会创建一个更长、更深的中间区域。

三种叠加偏差导致中间部分被忽视:因因果注意力引起的首因效应,因 RoPE 距离衰减引起的近因效应,以及训练数据分布的影响。

在仅解码器架构的 Transformer 中,每个 token 都会关注 earlier tokens,因此第一个文本块会被融入下游的表示中,并且注意力汇聚点会将注意力吸附在早期 token 上。RoPE 使注意力随相对距离衰减,从而偏好靠近问题的文本块。预训练数据很少将关键事实放在正中间并配上强化信号。

位置扫描是诊断方法:固定文本块并移动“金文本块”到每个位置,以查看准确率是否呈现微笑形状。

作者对 50 个真实的支持问题进行测试,每个问题配上 10 个文本块,结果显示第 1 个插槽正确率为 45/50,第 10 个插槽为 43,而第 5-7 个插槽约为 33。使用真实的检索干扰项而非随机文本至关重要,因为近似错误正是让模型困惑的原因。

四种按收益排序的解决方案:重新排序到更少的文本块,将最佳文本块放在两侧,把问题放在文档之后,以及在回答前要求引用佐证。

从 top 10 缩减到 top 4 并配合交叉编码器重新排序,可以移除中间大多数的内容。边缘排序交替放置最佳文本块在首位和次佳在末位,从而让较弱的文本块落到中间。文档优先模式将指令放在高近因区域。要求提供支持引用会强制执行一次显式搜索步骤,并且为引用的文档 ID 提供一次免费核实。

💬 Key Quotes

检索日志上,我是对的。但答案却告诉我我是错的。

把正确的文档放在错误的位置,结果比什么都不加还要更糟。

上下文窗口大小是容量限制。“lost-in-the-middle”是使用问题,而且它出现在仅有几千个 token 时。

检索可能是完美的,但答案仍然是错的。

不要仅检查文本块是否存在,还要检查它在提示词中的位置。

📊 Article Meta

AI Screening: 86

Source: DEV Community: machinelearning

Author: jidonglab

Category: 人工智能

Language: 英文

Read Time: 7 min

Word Count: 1637

Tags:

AI 与智能应用 , 提示工程 , 上下文工程 , AI 工程 , RAG / 检索增强

#AI 与智能应用# 提示工程# 上下文工程# AI 工程# RAG / 检索增强

文章评论(1)

陈皮话梅糖26 分钟前

刚好最近在找这方面的资料,太及时了。

回复