本文根据各模型厂商的官方 API 定价页整理,价格核对时间为 2026 年 8 月 7 日;并非逐字转载,实际费用请以调用时的官方页面与账单为准。
主要来源:DeepSeek、智谱 GLM、MiniMax、Kimi、阿里云百炼、腾讯云 TokenHub、百度千帆、火山引擎、OpenAI、Anthropic、Google、xAI、Mistral 与 Cohere。 全文字符数:5548
大模型的价格变化快,比较起来也比想象中麻烦。同一个厂商可能同时存在标准、Batch、缓存、长上下文、优先队列和限时优惠,甚至输入长度跨过一个阈值后,整次请求都会换一档价格。
所以这篇文章不是一张永不过期的排行榜,而是一次价格快照:记录此刻调用主流模型大概要花多少钱,也给以后回看模型迭代速度留一个坐标。
统计口径
- 单位统一为 人民币元 / 1M tokens,也就是每 100 万 Token。
- 海外厂商的美元价格按固定汇率 1 美元 = 7 元人民币换算,不代表实时汇率。
- 主表采用官方直连、按量付费、在线推理、缓存未命中的文本 Token 价格;核价当天仍在生效的公开优惠会写入表格,并在备注中同时标出原价或恢复时间。
- 输入和输出分开统计;推理 Token 通常计入输出,所以深度思考任务要格外关注输出价格。
- 不把 Batch、预付资源包、企业协议价、云市场转售价和新用户赠送额度混入主价格。
- 海外价格先用官方美元价乘以 7,再保留能够准确表达原价的必要小数位,不提前把美元价或中间结果取整。
- 图像、音频、视频、Embedding、联网搜索、代码执行等另行计费的能力不在本文范围内。
- 分档模型用价格区间表示,具体档位写在备注中。
价格只能回答“用了多少 Token 要付多少钱”,不能直接回答模型效果、速度、稳定性和可用地区。不同厂商的分词器也不一样,同一段中文交给两个模型,最终 Token 数量可能并不相同。
国内模型价格
DeepSeek
DeepSeek 官方价目前以美元展示,下面仍按 1:7 换算成人民币。
| 模型 | 输入 | 输出 | 缓存命中输入 | 备注 |
|---|---|---|---|---|
| DeepSeek-V4-Flash | ¥0.98 | ¥1.96 | ¥0.0196 | 官方价 $0.14 / $0.28 |
| DeepSeek-V4-Pro | ¥3.045 | ¥6.09 | ¥0.025375 | 官方价 $0.435 / $0.87 |
V4-Flash 和 V4-Pro 都提供 1M 上下文,并同时支持思考与非思考模式。旧的 deepseek-chat 和 deepseek-reasoner 已在 2026 年 7 月退出,接入新项目时不宜再把旧名称写死。
智谱 GLM
| 模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
| GLM-5.2 | ¥8 | ¥28 | 1M 上下文,缓存命中 ¥2 |
| GLM-5 | ¥4~6 | ¥18~22 | 输入达到 32K 后进入高价档 |
| GLM-4.7-FlashX | ¥0.5 | ¥3 | 低成本快速模型 |
| GLM-4.7-Flash | 免费 | 免费 | 受官方免费额度与并发规则约束 |
智谱定价页对 GLM-5.1、GLM-5-Turbo、GLM-5 和 GLM-4.7 都设置了分档。长提示词或较长输出可能同时推高输入、输出单价,不能只看表格里的最低档。
MiniMax
| 模型 | 输入 | 输出 | 缓存读取 | 备注 |
|---|---|---|---|---|
| MiniMax-M3,≤512K | ¥2.1 | ¥8.4 | ¥0.42 | 当前永久五折价 |
| MiniMax-M3,>512K | ¥4.2 | ¥16.8 | ¥0.84 | 当前永久五折价 |
| MiniMax-M2.7 | ¥2.1 | ¥8.4 | ¥0.42 | 标准速度 |
| MiniMax-M2.7-highspeed | ¥4.2 | ¥16.8 | ¥0.42 | 高速版本 |
MiniMax 按量计费页把 M3 放在当前模型区,并按单次输入是否超过 512K 分档;M2.5 已被列入历史模型,因此不再放进主表。M2.7 高速版是标准版价格的两倍,是否值得付这部分溢价,应看端到端延迟,而不只是模型开始输出后的速度。
Kimi
| 模型 | 输入 | 输出 | 缓存命中输入 | 备注 |
|---|---|---|---|---|
| Kimi K3 | ¥20 | ¥100 | ¥2 | 1M 上下文 |
| Kimi K2.7 Code | ¥6.5 | ¥27 | ¥1.3 | 面向代码任务 |
| Kimi K2.7 Code Highspeed | ¥13 | ¥54 | ¥2.6 | 高速版本 |
| Kimi K2.6 | ¥6.5 | ¥27 | ¥1.1 | 文本与视觉输入 |
Kimi 已经从 K2.5 进入 K3、K2.7 和 K2.6 阶段。价格分别见 K3、K2.7 Code 与 K2.6 官方页面。
Qwen
| 模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
| Qwen3.8-Max | ¥12 | ¥36 | 0~1M,同一档价格 |
| Qwen3.7-Plus,≤256K | ¥1.6 | ¥6.4 | 动态别名限时 8 折;原价 ¥2 / ¥8 |
| Qwen3.7-Plus,256K~1M | ¥4.8 | ¥19.2 | 动态别名限时 8 折;原价 ¥6 / ¥24 |
| Qwen3.7-Flash,≤32K | ¥0.2 | ¥0.8 | 标准在线价格 |
| Qwen3.7-Flash,32K~256K | ¥0.6 | ¥2.4 | 整次请求进入第二档 |
| Qwen3.7-Flash,256K~1M | ¥1.2 | ¥4.8 | 整次请求进入第三档 |
阿里云百炼价格页已经把 Qwen3.8-Max 列为最新 Max,并明确说明阶梯价格作用于整次请求。Qwen3.7-Plus 动态别名仍显示限时 8 折,表中采用核价当天的实际优惠价;做长期预算时应使用备注里的原价。固定快照 qwen3.7-plus-2026-05-26 不享受动态别名的这项折扣。
腾讯混元
| 模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
| Hy3 | ¥1 | ¥4 | 缓存命中 ¥0.25 |
| Hy3 Preview | ¥1.2~2 | ¥4~8 | 16K、32K 两个分档点;将于 2026-08-31 下线 |
| Hy-MT2-Lite | ¥0.3 | ¥1.2 | 翻译模型 |
| Hy-Role-Latest | ¥2.4 | ¥9.6 | 角色扮演模型 |
腾讯新一代模型价格已经集中到 TokenHub 定价文档。腾讯云另有下线公告:Hy3 Preview 将于 2026 年 8 月 31 日下线并切换到 Hy3,因此新项目不应再以 Preview 的价格做长期预算。如果仍在旧混元平台接入,迁移前还要同时核对模型名、接口和账单归属。
百度文心
| 模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
| ERNIE 5.1 | ¥4~6 | ¥18~22 | 32K 以上进入高价档 |
| ERNIE 5.0 | ¥6~10 | ¥24~40 | 32K 以上进入高价档 |
| ERNIE 4.5 Turbo | ¥0.8 | ¥3.2 | 缓存命中 ¥0.2 |
百度千帆价格页以每千 Token 标价,这里已经乘以 1000,换算成每百万 Token。若开启搜索增强,还会按实际触发次数另行收费。
豆包
| 模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
| Doubao-Seed-2.0-Pro | ¥3.2~9.6 | ¥16~48 | 32K、128K 两个分档点 |
| Doubao-Seed-2.0-Code | ¥3.2~9.6 | ¥16~48 | 与 Pro 相同的分档价格 |
| Doubao-Seed-2.0-Lite | ¥0.6~1.8 | ¥3.6~10.8 | 32K、128K 两个分档点 |
| Doubao-Seed-2.0-Mini | ¥0.2~0.8 | ¥2~8 | 32K、128K 两个分档点 |
火山方舟计费明细显示,豆包 2.0 系列在输入达到 32K 和 128K 后会整体切换价格档位。官网产品页写的是“¥0.2 起”,但长上下文请求不能拿这个起步价做预算。
海外模型价格
以下人民币价格全部由官方美元价乘以 7 得出。
OpenAI
| 模型 | 输入 | 输出 | 缓存命中输入 | 备注 |
|---|---|---|---|---|
| GPT-5.6 Sol | ¥35 | ¥210 | ¥3.5 | $5 / $30 |
| GPT-5.6 Terra | ¥14 | ¥84 | ¥1.4 | $2 / $12 |
| GPT-5.6 Luna | ¥1.4 | ¥8.4 | ¥0.14 | $0.2 / $1.2 |
OpenAI 的 Sol、Terra 与 Luna 详情页分别给出 $5 / $30、$2 / $12 与 $0.20 / $1.20。三者的输入超过 272K 后,整次请求按输入 2 倍、输出 1.5 倍计费,而不是只对超出的部分加价。
Anthropic Claude
| 模型 | 输入 | 输出 | 缓存命中输入 | 备注 |
|---|---|---|---|---|
| Claude Fable 5 / Mythos 5 | ¥70 | ¥350 | ¥7 | Mythos 5 为有限开放 |
| Claude Opus 5 | ¥35 | ¥175 | ¥3.5 | 标准价格 |
| Claude Sonnet 5 | ¥14 | ¥70 | ¥1.4 | 2026-08-31 前的引入价 |
| Claude Haiku 4.5 | ¥7 | ¥35 | ¥0.7 | 标准价格 |
Anthropic 定价页注明,Claude Sonnet 5 在 2026 年 9 月 1 日恢复到 $3 / $15,也就是 ¥21 / ¥105。Claude 的 5 分钟缓存写入为标准输入价的 1.25 倍,1 小时写入为 2 倍,命中读取为 0.1 倍。
Google Gemini
| 模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
| Gemini 3.6 Flash | ¥10.5 | ¥52.5 | $1.5 / $7.5 |
| Gemini 3.5 Flash-Lite | ¥2.1 | ¥17.5 | $0.3 / $2.5 |
| Gemini 3.1 Pro Preview,≤200K | ¥14 | ¥84 | $2 / $12 |
| Gemini 3.1 Pro Preview,>200K | ¥28 | ¥126 | $4 / $18 |
Gemini API 定价页中的输出价格已经包含思考 Token。Google 还提供免费层、Batch、Flex 和 Priority,但它们在配额、时延与价格上口径不同,主表只采用标准付费层。
xAI Grok
| 模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
| Grok 4.5,<200K | ¥14 | ¥42 | $2 / $6 |
| Grok 4.5,≥200K | ¥28 | ¥84 | $4 / $12 |
| Grok 4.3,<200K | ¥8.75 | ¥17.5 | $1.25 / $2.5 |
| Grok 4.3,≥200K | ¥17.5 | ¥35 | $2.5 / $5 |
| Grok Build 0.1,<200K | ¥7 | ¥14 | $1 / $2 |
| Grok Build 0.1,≥200K | ¥14 | ¥28 | $2 / $4 |
xAI 定价页明确说明:当提示词达到 200K 后,长上下文价格会作用于整次请求的全部 Token。联网搜索、X 搜索、代码执行和文件检索还会按工具调用次数收费。
Mistral
| 模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
| Mistral Medium 3.5 | ¥10.5 | ¥52.5 | $1.5 / $7.5 |
| Mistral Small 4 | ¥1.05 | ¥4.2 | $0.15 / $0.6 |
| Mistral Large 3 | ¥3.5 | ¥10.5 | $0.5 / $1.5 |
| Magistral Small | ¥3.5 | ¥10.5 | $0.5 / $1.5 |
Mistral API 定价页还列有 OCR、语音、Embedding 和分类模型。Mistral 的 Batch 处理通常有 5 折,但不适合需要立即返回结果的在线请求。
Cohere
| 模型 | 输入 | 输出 | 备注 |
|---|---|---|---|
| Command A | ¥17.5 | ¥70 | $2.5 / $10;模型 ID 为 command-a-plus-05-2026 |
| Aya Expanse | ¥3.5 | ¥10.5 | $0.5 / $1.5 |
Command A 模型页给出的正式模型名称是 Command A,虽然它的 API 模型 ID 中带有 a-plus;Cohere 定价页则列出 Aya Expanse 的按量价格。部分模型需要申请生产权限,接入前要确认自己的账户是否能获得对应模型和并发。
怎样估算真实账单
最简单的估算公式是:
费用 = 输入 Token ÷ 1,000,000 × 输入单价
+ 输出 Token ÷ 1,000,000 × 输出单价
+ 缓存、搜索、代码执行等附加费用
假设一个月使用 1000 万输入 Token、200 万输出 Token,且不考虑缓存:
| 模型 | 估算月费 |
|---|---|
| DeepSeek-V4-Flash | ¥13.72 |
| MiniMax-M2.7 | ¥37.8 |
| GPT-5.6 Luna | ¥30.8 |
| Claude Sonnet 5 | ¥280(按 8 月引入价) |
这不是能力排名,只是说明输出量对账单的影响。很多 Agent 和代码任务会生成大量思考、工具参数和中间结果,看起来只有几句最终答案,实际输出 Token 却可能很高。
API 选择建议
先用自己的任务做小型评测
不要先选“最强模型”,也不要先选“最便宜模型”。从真实业务里抽取 30~100 个有代表性的请求,固定提示词、工具和评分标准,再比较成功率、平均 Token、首字延迟、总耗时与单次成本。
模型单价低但经常重试,或者需要更长提示词才能稳定完成任务,最终成本未必低。反过来,旗舰模型如果一次就能完成高价值任务,也可能更划算。
日常请求与困难请求分层
比较实用的架构是两级路由:分类、抽取、改写、简单问答先交给低价模型;代码审查、复杂推理和失败重试再升级到更强模型。国内可以从 DeepSeek-V4-Flash、豆包 2.0 Mini、GLM Flash、Qwen3.7-Flash 等低成本档开始测试;海外则可以从 GPT-5.6 Luna、Gemini Flash-Lite、Mistral Small 等开始。
这些只是候选池,不代表它们在所有任务上等价。路由规则必须由自己的评测结果决定。
Agent 和编程场景重点看输出价
Agent 会反复携带上下文、生成工具调用并读取结果,编程模型还可能输出长补丁。此时输出单价、缓存策略、工具调用费、并发限制和错误重试率,往往比输入起步价更重要。
可以把 Kimi K2.7 Code、MiniMax M3 / M2.7、GLM-5 系列、豆包 2.0 Code、OpenAI GPT-5.6、Claude、Gemini Pro、Grok Build 和 Mistral 的代码模型放进同一套仓库任务里实测,再按“成功完成一次任务的总费用”比较。
长上下文不是免费硬盘
Qwen、GLM、豆包、Gemini、Grok 和 OpenAI 都存在不同形式的长上下文分档。一次请求刚刚跨过阈值,费用可能不是略增,而是整段上下文一起涨价。
对话历史应定期压缩;知识库应先检索再注入;固定系统提示、代码库说明和文档前缀则尽量使用缓存。能放进 1M 上下文,不等于每次都应该放进去。
离线任务优先考虑 Batch
翻译语料、批量分类、离线摘要和数据清洗不要求秒级响应时,可以优先看 Batch。OpenAI、Anthropic、Google、Mistral、Qwen 等厂商通常提供不同程度的折扣,但要接受排队、完成时间和接口差异。
最后再看合规与可用性
价格之外,还要确认数据保存策略、可用地区、内容合规、发票与支付方式、并发和速率限制、模型下线周期,以及是否允许固定快照。生产系统最好保留第二供应商或降级模型,不要让一次模型改名、区域故障或价格调整直接中断服务。
小结
截至 2026 年 8 月,国内模型的 Token 单价整体仍然很有竞争力,低价档已经压到每百万输入 Token 不足 1 元;海外旗舰模型则常见几十元输入、上百元输出。但价格差距并不等于效果差距,也不等于最终业务成本差距。
真正稳妥的选择顺序应该是:先定义任务和验收标准,再用真实样本评测,随后计算一次成功任务的总成本,最后才决定主模型、降级模型、缓存与 Batch 策略。
这张表最有价值的用途,或许不是告诉我今天该选谁,而是等一年后再回来看看:模型能力、命名和价格,在短短一年里又走了多远。