
1. 面试官想要的:不是“扩容”,而是“工程智慧”在大模型面试中,当被问到“上下文窗口爆了怎么办”,面试官期待的绝不是一个简单的“用更大的窗口”,而是你对上下文压缩、记忆管理、检索增强与工程折衷的系统性思考。回答需要体现“架构师视角”:在成本、延迟、效果之间找到平衡的体系化方案。下面我会从根本原因到10种实战策略逐层展开,覆盖纯压缩、检索增强、分层存储和混合方案,并给出代码级示意。2. 问题本质:窗口为什么爆?一个典型的Agent对话链路可能是这样的:系统提示 → RAG文档片段 → 工具定义 → 多轮历史 → 工具调用结果 → 用户追问每一环都在吃掉token,最终超过模型的max_tokens限制,导致:API直接报错context_length_exceeded模型“遗忘”早期关键信息(隐式截断)性能急剧下降(平方复杂度注意力)核心矛盾:长上下文≠无限上下文;成本与注意力稀释随长度非线性增长。3. 策略分级:从“削”到“补”再到“存”我们将所有应对策略归为三类,面试中可按层次递进阐述:类型