给大模型配一个知识库再让它回答问题,是当前 AI 应用最常见的做法。这套技术叫检索增强生成(RAG,Retrieval-Augmented Generation):模型回答前,先从外部资料库中检索出与问题相关的文本,把检索结果和问题拼在一起,再生成答案。资料越多,答案往往越准确,但模型每次要读入的文本也越长,回答速度变慢、算力开销变大——这是 RAG 落地时绕不开的成本问题。
9 月 4 日提交到 arXiv(全球最大的学术预印本平台,研究者抢先公开论文的地方)的一篇新论文,给出了一个对策:论文提出一种名为 DEX-Comp 的模型训练方法,训练出的模型能把检索到的上下文压缩到原来的十六分之一,回答问题(即推理)的速度提升 4 到 24 倍,在多个评测集上回答质量与未压缩版本持平甚至更高。论文作者是 Shuyu Guo、Shuo Zhang、Zhaochun Ren 等人,编号 arXiv:2609.05152。
RAG 长上下文的代价
RAG 的检索结果通常包含多篇文档。文档越多,拼接后喂给模型的内容越长;模型生成答案时每写一个字都要“回看”全部输入,输入越长,计算量越大、回答越慢、运行成本越高。压缩的目标,就是让检索来的文档在不丢失关键信息的前提下变短。
主流做法是软上下文压缩:不直接删减文字,而是把每篇文档编码成一段更短的向量序列(向量是文本的数字表示,这种编码技术叫“嵌入”,英文 embedding)。模型读这段浓缩向量,相当于读完整文档,但输入长度大幅缩短。
现有压缩方法卡在"老师"的水平
大多数已有的压缩模型,是用蒸馏方式训练的:拿未压缩的 RAG 系统(读全量文档的模型)当老师,让它先给出正确答案,再让压缩模型模仿老师的输出。这种训练方式的局限在于:压缩模型的上限就是老师的水平——老师会答对的题它可能学会,老师答错的题它也照单全收,很难真正超越未压缩版本。既然压缩模型天生比老师"少读"了内容,它凭什么能做得比老师更好?这正是旧方法的死结。
DEX-Comp:蒸馏预热加困难探索
DEX-Comp 把训练拆成两个阶段,分别处理"老师答得对"和"老师答不对"两类问题:
第一阶段:纯蒸馏预热(Pure Distillation)。 只拿未压缩 RAG 能正确回答的那些问题,让压缩模型模仿正确答案,先把基础能力打牢。
第二阶段:困难探索(Hard Exploration)。 只针对未压缩 RAG 回答失败的问题,用强化学习训练压缩模型。强化学习是一种让模型通过试错和奖励信号自我改进的训练方式——答得好给正反馈,答得差给负反馈,模型逐步学会更优策略。面对老师也答不出的难题,模型只能自己去探索更适合压缩表征的解题路径,这正是它能突破老师水平的关键一步。
这个设计的分工很清楚:简单的题靠模仿,难题靠逼模型自己想办法。论文的实验显示,两个阶段各自都有贡献,缺一不可。
五组基准上的实验结果
论文在 5 个开放域问答评测集上做了测试,检索深度覆盖 top-5 到 top-30(即让模型在检索出的 5 到 30 篇文档范围内找答案),结果:
- 上下文压缩 16 倍:模型实际读入的向量长度约为原来的 1/16;
- 推理加速 4 到 24 倍:生成答案的耗时大幅缩短,检索文档越多加速越明显;
- 回答质量与未压缩 RAG 基线持平或超出:压缩没有以牺牲准确率为代价。
论文还做了消融实验(逐个移除某个组成部分、验证各部分作用的对照实验),并在多种数据集和不同规格的底座模型上验证了方法的通用性。
对实际应用的意义
RAG 是大模型落地最常见的形态之一,企业用它做客服问答、资料检索、报告生成,上下文长度直接决定推理成本和响应速度。DEX-Comp 的意义在于证明了“压缩”与“质量”不必二选一:输入缩短 16 倍、速度提升最高 24 倍,同时准确率不降,意味着同样的硬件能服务更多请求、用户等待时间更短。
需要提醒的是,这是 arXiv 上的预印本,尚未经过期刊同行评审,论文方法细节和可复现性以原文为准。对做 RAG 应用和推理优化的团队来说,这篇论文提供了一个值得跟进的思路:与其让压缩模型一味模仿完整版模型,不如把“老师答不出的题”留给压缩模型自己去探索——训练数据的挑选方式,本身就是一种优化。