提示词补完计划 02:上下文与注意力——重要的事要放对位置

上下文窗口:它的工作台就那么大
上一篇说了,模型没有记忆。它”记住”的东西,全部来自这次请求里塞给它的文本——这个容量上限就是上下文窗口(Context Window)。
| 模型 | 上下文窗口 |
|---|---|
| GPT-4o | 128K token |
| Claude | 200K token |
| Gemini | 1M token |
听起来很大?但注意:输入 + 输出共享这个窗口。而且塞得越满,问题越多。
注意力机制:它会”走神”
Transformer 架构的核心是注意力——模型生成每个词时,会”回头看”上下文里所有的词,给每个词分配一个注意力权重,决定参考谁多一点。
理想很美好,但现实有两个坑:
坑一:距离越远,关注越少
模型对最近的内容关注最高,对很久以前的内容关注衰减。这就是为什么 RP 玩到 50 轮后,角色会忘记开场时的约定——不是模型不努力,是注意力天然偏向最近。
坑二:Lost in the Middle(中间丢失)
斯坦福大学 2024 年的研究(Liu et al.)实锤:在长上下文里,模型对开头和结尾的信息回忆最好,中间部分的信息回忆率下降 20-30%。
记忆强度 ████ ████ ████ ██████████ ▄▄▄▄▄▄▄▄ ██████████████ ▄▄▄▄▄▄▄▄▄▄▄▄ ████████ ↑开头 ↑中间(弱) ↑结尾精心设计的 2K token 提示词,效果往往胜过杂乱的 30K token。
新一代模型的注意力不一样了
上面说的”均匀衰减”规律,适用于传统架构(MHA/GQA,以及 DeepSeek V3 时代的 MLA)。但 2026 年的新旗舰走了两条不同的路:
DeepSeek V4:CSA + HCA 双轨注意力
V4 干脆把 MLA 换掉了,改成两种压缩注意力交错排布:
- HCA 层(重压缩):把 128 个 token 压成 1 份笔记,做全局速览——建立”整篇文档的地图”
- CSA 层(稀疏压缩):4 倍压缩 + top-512 检索——在全局理解之上精准定位关键信息
- 外加 128 token 滑动窗口:最近的内容永远保留原始细节
类比人类读书:先翻目录速览全文(HCA),再精读关键段落(CSA)。KV Cache 压到传统架构的 2%,百万上下文才真正能用。
Kimi K3:KDA + AttnRes
K3 是另一条路线——自研的 KDA(Kimi Delta Attention)混合线性注意力,加上 Attention Residuals:每一层都能从前面所有层里选择性检索信息,而不只是回看原始 token。
对你写提示词意味着什么
| 老架构(V3/K2 及更早) | 新架构(V4/K3) | |
|---|---|---|
| 长上下文中间的信息 | 明显衰减(Lost in the Middle) | 减轻很多——全局层兜住了结构 |
| 中间的精确细节(数值、原文措辞) | 衰减 | 可能被”速览层”压缩掉细节——粗读记得大概,精读靠检索 |
| 局部最近的上下文 | 清晰 | 一样清晰(滑窗保留) |
实战结论:首尾放重点的铁律依然成立(精确细节别赌检索),但新架构下”超长上下文中部的剧情背景”被记住的概率高了不少。百万上下文不是噱头了——但细节控的规矩不能松。
实战启示:位置就是权力
明白了注意力规律,提示词布局就有了策略:
✅ 该做的
- 核心规则放开头(系统提示顶部)——身份、铁律、底线
- 当前任务放结尾——用户最新消息天然在最后,模型最关注
- 重要设定首尾各放一份——关键规则可以在开头写一遍,结尾用”重申”的方式再点一次
- 定期总结——长 RP 里定期把剧情要点浓缩到最近的位置
❌ 别做的
- 把关键设定埋在几千字的中间
- 一股脑倾倒所有资料(“多就是好”是幻觉)
- 指望模型自己从长篇大论里捞重点
SillyTavern 里的对应
ST 的提示词结构天然利用了这个规律:
[系统提示] ← 开头:角色定义、规则(高注意力)[世界书条目] ← 中部:按需注入的背景[示例对话] ← 中部偏后[聊天历史] ← 尾部:最近的对话(高注意力)[用户最新消息] ← 最末:当前焦点(最高注意力)世界书的”Depth 注入”(插入到倒数第 N 条消息处)就是把设定往高注意力区推的手段——后面第 04 篇会细讲。
小结
- 上下文窗口是稀缺资源,不是仓库
- 注意力向首尾倾斜,中间会”迷失”
- 布局提示词时:开头放法则,结尾放焦点,中间放可牺牲的细节
- 少即是多(Less is More)
下一篇进入正题:提示词工程的具体技法。
参考资料
文章分享
如果这篇文章对你有帮助,欢迎分享给更多人!






















