Qwen-Max(qwen3-max)
Qwen-Max 是阿里百炼的闭源旗舰档(当前对应 qwen3-max 正式版,等同快照 qwen3-max-2026-01-23),智能体编程与工具调用专项升级。输入 ¥2.4/百万 token(缓存命中 ¥0.48),输出 ¥9.6,国内直连支付宝计费,是国产旗舰里 Agent 场景的稳妥选择。
发布 2026-08-30更新 2026-09-24核实 2026-09-24规格
- 厂商
- 阿里巴巴
- 发布日期
- 2026/1/23
- 类型
- llm
- 上下文窗口
- 33K tokens
- 定价
- Input ¥2.4/M(缓存命中 ¥0.48/M)· Output ¥9.6/M
- API 兼容
- openai, qwen
优势
- •千问 3 系 Max 正式版,智能体编程与工具调用专项升级
- •百炼国内直连,支付宝计费,无需代理
- •输入缓存命中价仅 ¥0.48/M,Agent 多轮场景省钱明显
- •复杂推理与中文理解的第一梯队
不足
- •32K 上下文在 256K 当道的编程场景明显偏短
- •价格是 qwen-plus 的 3 倍、Flash 系的数十倍
- •闭源不可自部署
适用场景
概述
Qwen-Max 是阿里百炼平台上最闭源也最强的一档。当前调用 qwen-max,实际指向的是千问 3 系 Max 正式版(等同快照模型 qwen3-max-2026-01-23)——官方说明这一版相较 preview 在智能体编程与工具调用方向做了专项升级,适配更复杂的智能体需求。
与开源的 Qwen3-235B 不同,Max 档不开放权重,只能走百炼 API。定位是「国产闭源旗舰」:复杂推理、中文理解、Agent 编排的第一梯队,代价是上下文只有 32K(对照长上下文选型)。
定价与档位(2026-08 核对)
百炼国内区(华北2):
| 计费项 | 价格 |
|---|---|
| 输入 | ¥2.4 / 百万 token |
| 输出 | ¥9.6 / 百万 token |
| 输入(缓存命中) | ¥0.48 / 百万 token |
放回家族里看(详见 Qwen3 模型卡):
| 档位 | 定位 | 参考价 |
|---|---|---|
| qwen-turbo | 便宜快 | ¥0.3 / ¥0.6 |
| qwen-plus | 主力档 | ¥0.8 / ¥2 |
| qwen-max | 闭源旗舰 | ¥2.4 / ¥9.6 |
| Qwen3.8-Flash | 开源效率王(2026-08-26) | ¥1 / ¥3 |
缓存价是 Agent 场景的重点:系统提示、AGENTS.md、已读代码在多轮请求中高度重复,缓存命中后前缀成本只有原价 1/5(机制详见长上下文)。
另注:更新的 qwen3.7-max 已在国际站上线(新加坡区 $2.5 / $7.5),国内区以百炼控制台实际档位为准。
避坑清单
- 32K 是硬约束,不是建议值:整仓级任务(对照 长上下文选型)会直接截断。要么自己做检索切分,要么换 Qwen3-Coder / Kimi K2.7 Code(256K)。
qwen-max是别名,不是固定模型:官方说明当前指向千问 3 系 Max 正式版、等同快照qwen3-max-2026-01-23。别名背后的快照会随版本推进而变,线上效果出现漂移时先查快照是否换了;要锁死请用快照名。- 国内区与国际区不是一套档位:国际站另有 qwen3.7-max(新加坡区约 $2.5/$7.5)。跨境部署前分别核对两个region 的价目表,别用国内价估海外成本。
- 缓存省钱靠「前缀不动」:命中价 ¥0.48/M 只有原价 1/5,但必须把 system 指令、AGENTS.md、常驻文档放在最前、把变化内容放在最后(机制见 Prompt Caching)。顺序反了命中率就是 0。
- 输出比输入贵 4 倍:¥2.4 进 / ¥9.6 出。生成型任务(长文档、批量改写)成本由输出主导,估算时别只看输入价。
- 闭源 = 不能私有化:有数据不出域要求的团队请走开源 Qwen3 系或 MoE 自部署路线。
FAQ
Q: qwen-max 和 qwen3-max 是什么关系?
A: 调用名 qwen-max 目前指向千问 3 系的 Max 正式版,官方说明其等同快照 qwen3-max-2026-01-23。别名会随版本推进换指向,需要结果可复现时请直接写快照模型名。
Q: 32K 上下文够做什么? A: 单文件级改造、需求理解、中文推理与写作、Agent 的「难题层」路由都够用。跨 50 个文件的重构不够——这类任务请换 256K 档或使用检索切分。
Q: 和 qwen-plus 差多少,值不值得上 Max? A: 价格约 3 倍,差异集中在复杂推理、多步规划与工具调用的稳定性。推荐做法是两级路由:简单任务走 plus / Flash,命中「难题」判定再升级 Max,成本与效果兼得。
适合 / 不适合
适合:
- Agent 两级路由里的「难题层」:日常任务给 Flash 系,攻坚切 Max
- 需要国内直连 + 支付宝计费的企业场景
- 对中文理解与复杂推理有旗舰要求的任务
不适合:
- 256K 级长代码库任务——32K 窗口不够,改用 Qwen3-Coder 或 K2.7 Code
- 极致性价比场景——Flash / plus 档便宜一个数量级
- 需要私有化部署——闭源,无权重
API 调用示例
OpenAI 兼容,BYOK 工具直改 base_url:
from openai import OpenAI
client = OpenAI(
api_key="sk-...",
base_url="https://dashscope.aliyuncs.com/compatible-mode/v1",
)
resp = client.chat.completions.create(
model="qwen-max",
messages=[{"role": "user", "content": "分析这段代码的风险点"}],
)
print(resp.choices[0].message.content)
相关阅读
- Qwen3 模型卡 —— 开源全系列与档位对照
- Qwen3-Coder 模型卡 —— 编程专用 480B-A35B
- 国产编程模型盘点
- 长上下文:缓存计费详解
- BYOK:接入方法
来源
相关工具
Aider vs OpenCode:两个开源终端 Agent,选哪个?2026 对比
Aider 与 OpenCode 2026 选型对比:两者都是开源终端 agent、都支持换模型,但 Aider 以 Git-native 工作流与成熟的多语言支持见长,OpenCode 主打模型无关、本地优先与终端交互体验。从 6 个维度给出明确取舍建议。
OpenCode vs Claude Code:终端 AI Coding Agent 怎么选?开源平替 vs 官方 CLI 对比
OpenCode vs Claude Code 2026 选型对比:SST 开源 MIT CLI Agent(75+ 模型 BYOK)vs Anthropic 官方闭源 CLI Agent(Claude 长任务第一梯队),从形态、模型自由、长任务、TUI 体验、多会话、MCP、价格、国内门槛和适合人群 9 个维度判断,帮你选对终端 AI Coding Agent。
OpenRouter vs LiteLLM:LLM API 网关怎么选?SaaS 聚合 vs 开源自托管
OpenRouter vs LiteLLM 2026 选型对比:从模型数量、自托管能力、fallback 策略、虚拟 Key、国内延迟、成本结构和适合人群判断,帮你决定用 SaaS 聚合 OpenRouter 还是用开源自托管 LiteLLM 做 LLM 网关。
OpenRouter vs One API:托管模型路由与自建网关怎么选(2026)
OpenRouter 是托管的模型路由服务,One API 是自建的 API 分发网关。一句话结论 + 决策树 + 成本对比:要零运维接入几百个模型选前者,要数据自控与团队分发选后者。