上下文成本由基础上下文和会话数决定
成本公式
每小时消耗 ≈ 请求次数 × 每次上下文大小。三个乘数都可优化:
- 会话数:多个 session 并发/交替跑,每个都自带一份系统上下文、项目上下文、摘要和最近历史。
- 请求次数:同一功能多线程反复跑。
- 单次上下文:重规则 + 多工具 + 长历史 + 长工具输出。
优化手段
- 一个功能只留一个主 session,做完归档
- 新任务开新线程只带 10–20 行 handoff,不继承整段历史
- 命令输出限量(精确文件 + 行号 +
max_output_tokens),避免全量 diff / 全仓 rg / 长日志 - 长规则迁到按需 reference,
AGENTS.md只放每次都要看的短规则 - 简单 UI 小改用轻量模型/低推理,别每个按钮都上高推理
- 少开并行 subagent
看账要区分 cached
日志里的 total 大头常是 cached input(重复前缀)。真实新增 = 非缓存输入 + 输出。判断「贵不贵」要看非缓存部分,但缓存仍占窗口、仍计入 total。
相关
- 上下文按信任等级分层
- 计数闸门不等于上下文管理
- 缓存命中率