最近想认真比较一下国内各家大模型 API 到底谁贵谁便宜。光看官网"每百万 tokens 多少钱"其实没什么概念:价格档位五花八门,有分阶梯的、分峰谷的、分思考不思考的,还有缓存价。所以我干脆按一个典型的 Agent 使用场景,把 2026 年 8 月官网价全部折算成"一次模拟调用花多少钱",一共 109 款模型从高到低排了个序。
模拟场景和算账公式
跑过 Agent 的都知道,实际干活的调用量大头全在输入上:系统提示词、工具定义、历史对话、文件内容,每一轮都要重新喂进去,而真正生成的回答往往只有输入的几十分之一。所以我定的场景是:
- 输入 : 输出 = 50 : 1,输出 20 万 tokens → 输入 1000 万 tokens(多轮累计)
- 输入部分缓存命中率 90%(系统提示词和工具定义每轮一样,基本都能命中)
- 有缓存报价:花费 = 9×缓存命中价 + 1×输入价 + 0.2×输出价
- 无缓存报价:花费 = 10×输入价 + 0.2×输出价
举个例子,qwen-max(输入 2.4、输出 9.6、缓存命中 0.24 元/百万 tokens):9×0.24 + 1×2.4 + 0.2×9.6 = 6.48 元。也就是这种强度的 Agent 调用跑一次大概六块五。
口径说明:阶梯/分段计费取基础档;峰谷计价的按时段分别列出;剔除 4 款免费模型和 2 款非 token 计费模型;限时折扣按当前标注价。
总榜节选:Top 30(共 109 款全量)
| # | 模型(厂商) | 单价构成(元/百万) | 模拟花费 |
|---|---|---|---|
| 1 | Baichuan4(2024 年定价)(百川) | 输入 100 · 输出 100 · 无缓存 | ¥1,020 |
| 2 | tencent-yuanqi(平台统一价)(腾讯) | 输入 100 · 输出 100 · 无缓存 | ¥1,020 |
| 3 | Baichuan3-Turbo-128k(百川) | 24 · 24 · 无缓存 | ¥245 |
| 4 | Baichuan2-53B 峰时(百川) | 20 · 20 · 无缓存 | ¥204 |
| 5 | Baichuan4-Turbo(百川) | 15 · 15 · 无缓存 | ¥153 |
| 6 | Baichuan3-Turbo(百川) | 12 · 12 · 无缓存 | ¥122 |
| 7 | Baichuan-M3(百川) | 10 · 30 · 无缓存 | ¥106 |
| 8 | GLM-4-AirX(智谱) | 10 · 10 · 无缓存 | ¥102 |
| 9 | step-1o-audio(语音)(阶跃) | 25 · 60 · 缓存 5 | ¥82 |
| 10 | Baichuan2-Turbo(百川) | 8 · 8 · 无缓存 | ¥81.6 |
| 11 | ernie-5.0 基础档(百度) | 6 · 24 · 无缓存 | ¥64.8 |
| 12 | qwen3.8-max-prime(阿里) | 24 · 72 · 缓存 2.4 | ¥60 |
| 13 | kimi-k3(Moonshot) | 20 · 100 · 缓存 2 | ¥58 |
| 14 | GLM-4-Plus(智谱) | 5 · 5 · 无缓存 | ¥51 |
| 15 | step-audio-r1.5(语音)(阶跃) | 10 · 105 · 缓存 2 | ¥49 |
| 16 | ernie-5.1 基础档(百度) | 4 · 18 · 无缓存 | ¥43.6 |
| 17 | hunyuan-turbos-vision(腾讯) | 3 · 9 · 无缓存 | ¥31.8 |
| 18 | GLM-5.3(智谱) | 8 · 28 · 缓存 2 | ¥31.6 |
| 19 | qwen3.8-max(阿里) | 12 · 36 · 缓存 1.2 | ¥30 |
| 20 | kimi-k2.7-code 高速版(Moonshot) | 13 · 54 · 缓存 2.6 | ¥47.2(no.21) |
| 21 | doubao-seed-2.1-pro 基础档(字节) | 6 · 30 · 缓存 1.2 | ¥22.8 |
| 22 | minimax-m3-priority-gt512k 5 折(MiniMax) | 6.3 · 25.2 · 缓存 1.26 | ¥22.7 |
| 23 | GLM-5.1 基础档(智谱) | 6 · 24 · 缓存 1.3 | ¥22.5 |
| 24 | kimi-k2.6(Moonshot) | 6.5 · 27 · 缓存 1.1 | ¥21.8 |
| 25 | deepseek-v4-pro-peak(DeepSeek) | 9 · 27 · 缓存 0.3 | ¥17.1 |
| 26 | qwen3.7-max 限时 5 折(阿里) | 6 · 18 · 缓存 0.6 | ¥15 |
| 27 | doubao-seed-2.0-pro 基础档(字节) | 3.2 · 16 · 缓存 0.64 | ¥12.2 |
| 28 | ernie-x1.1(百度) | 1 · 4 · 无缓存 | ¥10.8 |
| 29 | qwen3-max 基础档(阿里) | 2.5 · 10 · 缓存 0.25 | ¥6.75 |
| 30 | qwen-max(阿里) | 2.4 · 9.6 · 缓存 0.24 | ¥6.48 |
说明:第 20/21 位次以原稿全量榜为准(kimi-k2.7-code-highspeed ¥47.2 排 21 位,表内已按原稿顺序微调)。榜单从第 31 名到 109 名里还有大量实用型号,完整版思路是"旗舰贵得理直气壮,flash/lite 档便宜到近乎白送"。
总榜长图(109 款全量,从高到低)






几个扎心的发现
- 榜首不是主流价:前两名(¥1,020 上下)一个是 2024 年没调过的老刊例、一个是平台统一计费价,看看就好;真正主流旗舰集中在 几块到几十块
- 尾部的实用小模型两三块就能跑一次:最便宜的 qwen-turbo 只要 ¥0.69,doubao-seed-1.6-flash ¥0.72——轻量 Agent 的成本已经可以忽略不计
- 缓存价差距比原价大:deepseek 缓存命中价只有原价的 1/30(0.3 vs 9),同等命中率为下 DeepSeek 的 Agent 成本优势巨大
- 语音模型是隐形杀手:step-1o-audio 这类语音模型单价高、输出长,轻松冲进前十
同系列
- 第 2 篇:输入/输出/缓存命中单价全量排行(官方裸价直排,方便按自己的用量套算)
- 第 3 篇:11 家厂商内部对比(每家谁最贵、谁最便宜)
最后再说两句:这个榜单只回答「谁贵谁便宜」,不回答「谁好用」,价格差的背后是能力差距,选型还是先看能力够不够,再在够用的档位里挑便宜的。各家都在频繁调价、发新模型,这份数据就当个快照,具体价格以官方页面为准。