什么是上下文窗口?
每个会话窗口都有上下文长度限制。在对话框上方可以看到当前窗口已使用的上下文量,例如下图中的 30.2k / 300.0k——左侧是已使用的会话大小,右侧是当前会话的上下文上限。
上下文的上限设置
单个会话的上下文上限由模型能力决定,目前主流大模型的最大上下文已支持到 1M。SoloEnt 支持根据需要,把单个会话的上下文上限设置到合理水平。
- 建议控制在 200K–300K。
- 主流实践:参考 Codex Cloud 等成熟 Agent 产品的经验,通常只使用第一档(200K–300K)上下文,极少使用更高档位。
为什么不推荐单窗口用满 1M 上下文
单会话长期使用的成本激增风险
单会话长期使用的成本激增风险
很多用户认为单窗口使用能带来缓存优势,但部分模型存在按会话大小的阶梯收费机制,单会话过长时会带来成本激增的风险。
举例:某些模型在 256K 以下的输入/输出为一档价格,超过 256K 后会显著上涨,存在明显的阶梯式涨价。
缓存机制的不确定性
缓存机制的不确定性
虽然大部分新模型提供良好的缓存机制(命中缓存可能仅收取 1/5 至 1/10 的费用),但跨天或长时间间隔的会话会导致缓存失效,使单次请求消耗大量 token。
换模型 = 带着大量上下文重新开始
换模型 = 带着大量上下文重新开始
在单个窗口进行到一定程度后换模型执行任务时,新模型实际上需要读完旧模型积累的全部上下文,可能一次性消耗较大的会话额度,非常不经济。切换模型前务必先对前续会话做一次总结。
最佳实践
切换窗口意味着放弃当前窗口的会话记录,让不少用户感到可惜;但过于依赖单窗口在实践中既不经济,也难以保证长期上下文的质量。- 任务隔离原则:建议”一个会话只做一件事”,任务完成后核对完成情况。
- 下一个任务有关联性:先总结当前会话、落地到项目文件(如
SOLOENT.md),再开新会话继续。 - 下一个任务关联性不强:果断开启新会话,避免历史 token 堆积。
- 下一个任务有关联性:先总结当前会话、落地到项目文件(如
- 使用会话压缩功能:当会话内容堆积过多时,用
/compact命令把当前内容总结为简短概要,作为新会话的初始输入——既保留核心信息,又降低 token 消耗。

- 上下文占用超过约 200K 后继续使用,可能带来成本激增;一般建议单个窗口到 100–150K 就在合适时机考虑新开窗口。
开新窗口前,务必总结与文档沉淀
- 长篇小说创作:在项目中用
/init生成SOLOENT.md,把角色、大纲、当前进度等关键上下文写入其中。每次开新窗口,模型都能通过读取SOLOENT.md快速恢复项目全貌,而不依赖单一会话积累的上下文。 - 讨论较多时:如果你和 Agent 有大量讨论导致上下文占用过高,可在切换新窗口(或新模型)前,要求 Agent 对当前讨论做一次汇总,并把结论落地成一个可读文档。切换后先读取该文档,即可快速了解前文。
SOLOENT.md 指南
用记忆文件承载长期上下文,让每个新会话快速恢复项目全貌
命令 Commands
了解
/compact、/init 等内置命令的用法