长上下文(Long Context)
上下文窗口是模型单次能吞下的 token 上限,2026 年已卷到 1M 甚至 1000 万;但 Context Rot 证明远未到上限质量就开始下滑——容量是错误的指标,信噪比才决定输出质量。
发布 2026-08-30更新 2026-08-30什么是长上下文
**上下文窗口(context window)**是模型单次输入+输出能容纳的最大 token 总量。2023 年主流还是 4K~32K;到 2026 年,格局已经变成:
| 档位 | 代表 | 说明 |
|---|---|---|
| 128K | DeepSeek-V3、多数旗舰标配 | 2026 年的「及格线」 |
| 256K | Kimi K2.7 Code、Qwen3-Coder | 编程模型主流档 |
| 1M | Kimi K3、DeepSeek-V4 | 整个中型代码库一次喂入 |
| 10M | qwen-long(阿里,1000 万 token)、Llama 4 Scout(实验性) | 超长文档 / 巨型仓库场景 |
128K 大约对应 30 万字中文或一个中型开源项目的核心代码。1M 窗口意味着可以把整本技术书、整个微服务仓库直接塞进对话。
为什么重要
AI 编程是长上下文最刚性的场景:
- 跨文件重构:改一个被 50 个文件引用的函数,模型需要同时看到调用方与被调用方
- Agent 长程任务:CLI Agent 跑几十轮工具调用,探索轨迹、读过的文件、失败尝试全部堆在上下文里
- 代码库问答:「这个项目的鉴权逻辑在哪」——先得让模型读到整个仓库
这也是为什么编程类模型的上下文军备最凶:Kimi K2.7 Code 直接把 256K 当卖点,K3 干脆上 1M。
窗口大 ≠ 用得好:Context Rot
长上下文最大的认知陷阱:以为窗口够大就能随便塞。Context Rot(上下文腐烂) 的实测结论是——18 个前沿模型无一例外,远没到窗口上限,输出质量就随输入变长持续下降。
一个 200K 窗口的模型,可能在 50K 时就明显退化。下降是连续的、渐进的,不是「满了才崩」。所以:
容量是错误的指标,信噪比才决定输出质量。
实践含义:
- 上下文里塞满无关文件、失败尝试、历史噪声,模型会「捞不出」关键信息
- 与其问「窗口够不够」,不如问「当前任务真正需要的内容放进去了多少」
- Agent 的 compaction(压缩)机制不是免费的:每次压缩都可能丢信息,长任务质量仍会缓慢下滑
长上下文 vs RAG:不是替代关系
「1M 窗口会杀死 RAG」是流传最广的误解。实际上两者解决的是同一问题的不同侧面:
| 维度 | 全量塞入(长上下文) | RAG 按需检索 |
|---|---|---|
| 成本 | 每次请求都付全量 token 钱 | 只付检索回来的片段 |
| 质量 | 长输入触发 Context Rot | 上下文短、信噪比高 |
| 全局理解 | 强(能看到整体结构) | 弱(只有局部片段) |
| 适用 | 单仓库分析、跨文件重构 | 海量文档、知识库问答 |
工程上的共识做法是混合:先检索/总结把候选范围缩小,再把真正相关的内容塞进长上下文做深度推理。Chroma 的研究恰恰证明:窗口越大,越需要 RAG 来控制信噪比——两者是共生关系。详见 RAG 与 Context Engineering。
成本:长上下文的隐藏账单
长输入是按 token 计费的,但有一条常被忽略的省钱通道——输入缓存(context caching):
以百炼 qwen-max 为例:输入 ¥2.4/百万 token,缓存命中只要 ¥0.48/百万——同样的系统提示词 + 仓库代码反复请求时,成本差 5 倍。
编程 Agent 是缓存的最大受益者:系统提示、项目规则文件(AGENTS.md)、已读过的代码在多轮请求中高度重复,缓存命中率天然高。选模型时除了看单价,要看有没有缓存计费、缓存价格多少。
对超长文档场景,阿里专门留了 qwen-long 档(1000 万 token 窗口),定价远低于旗舰档——长上下文本身也可以是一种「档位策略」。
选型建议
- 编程主力模型选 256K 起步:128K 在多文件任务里捉襟见肘,256K 是 2026 年的甜点位
- 别为用不上的窗口付钱:日常问答/补全用 128K 档更划算,1M 档留给真正的仓库级任务
- 看缓存计费:Agent 工作负载下,缓存价格对月账单的影响可能超过单价
- 窗口再大也做上下文工程:清噪声、先总结、按需检索——这三件事的价值不随窗口变大而消失
常见误区
- 「窗口 1M 就能塞 1M」:错。Context Rot 在远未到上限时就开始拖垮质量
- 「长上下文让 RAG 过时」:错。窗口越大越需要控制信噪比,RAG 是共生而非被替代
- 「上下文没满就没事」:错。退化是渐进的,容量充足不代表质量稳定
- 「所有 token 一个价」:错。缓存命中的输入价格可能只有原价的 1/5(如 qwen-max 的 ¥0.48 vs ¥2.4)
相关阅读
相关工具
Aider vs Claude Code:终端 AI 编程双雄怎么选
Aider vs Claude Code 2026 选型对比:开源 BYOK 多模型 vs Anthropic 订阅长任务 Agent,从编程能力、多模型支持、价格、Git 集成、国内可用性和适合人群判断,帮你选对终端 AI 编程工具。
Claude Code vs Cline:CLI AI Agent 怎么选?2026 对比
Claude Code vs Cline 2026 选型对比:Anthropic 官方闭源 CLI Agent vs Apache-2.0 开源 VS Code 插件。从模型绑定、工作流、MCP 支持、价格、隐私和适合人群 6 个维度帮你选对 CLI AI 编程工具。
Claude Code vs Codex CLI:终端 AI Agent 双雄对比
Claude Code vs Codex CLI 2026 选型对比:Anthropic 与 OpenAI 两大官方终端 Agent 的模型、长任务、MCP 生态、Windows 支持、订阅打包价格和国内可用性全方位对比,帮你判断该用哪个终端 AI Agent,以及能不能两个一起用。
Claude Code vs Crush:Anthropic 官方 vs 多模型 TUI(2026 实测选型)
Claude Code vs Crush 2026 选型对比:Anthropic 官方 CLI Agent(Claude only + 长任务最稳 + MCP 一等公民)vs Charmbracelet 开源 TUI Agent(多模型 mid-session 切换 + LSP + FSL-1.1-MIT)。从模型、长任务、生态、价格、国内可用性帮你选对终端 AI 编程工具。
Cursor vs Claude Code:什么时候用哪个?(2026 实测选型)
Cursor 和 Claude Code 到底怎么选?一句话结论 + 决策树 + 价格实测 + 国内可用性对比。GUI 派选 Cursor,终端长任务派选 Claude Code,最优解其实是共存。
Devin vs Claude Code:AI 编程 Agent 怎么选?异步自主 vs 终端同步对比
Devin vs Claude Code 2026 选型对比:Cognition 异步自主 Cloud Agent vs Anthropic 终端同步 CLI Agent,从形态、工作模式、长任务能力、并发、价格、中文支持和适合人群 8 个维度判断,帮你选对 AI 编程 Agent。