什么是 Token 和上下文窗口?为什么对话会「忘记」前文?
Token 是模型计费与长度的基本单位;上下文窗口满了就会丢弃旧内容,看起来像失忆。
和 AI 聊着聊着,它突然「不记得」前面说的话——这通常不是人格分裂,而是上下文窗口满了。要理解这件事,先要认识 Token。
Token 是什么
Token 是模型处理文本的基本单位,不完全等于「字」或「词」。英文单词可能是 1 个或多个 Token;中文常常按字或子词切,同样一段话,中文占用往往更高。所以「支持 128k 上下文」不等于「能塞 128k 个汉字」。
上下文窗口是什么
你可以把它想象成桌面面积:桌上同时摊开的材料有限。新材料上来,旧材料就可能被挤下去。窗口是「单次可见的最大长度」,不是永久记忆,也不是网盘。
为什么会遗忘
对话变长后,系统或产品可能会摘要、截断或丢弃早期轮次。即使宣传超长窗口,质量也常在后半段下降:模型更可能忽略中间指令,出现「只听最近几句」的现象。
工程上怎么缓解
关键事实写成系统提示或置顶说明;长对话定期让模型输出摘要并开新会话;外部知识用检索(RAG)而不是全部塞进提示词;文件先自己提炼要点再喂。
选型时看什么
别只看窗口数字,还要看长文真实质量、价格(按 Token 计费时更明显)、以及产品是否提供「项目空间/记忆」功能。对你而言,稳定完成任务比参数更大更重要。
