本文根据各模型厂商的官方 API 定价页整理,价格核对时间为 2026 年 8 月 7 日;并非逐字转载,实际费用请以调用时的官方页面与账单为准。

主要来源:DeepSeek智谱 GLMMiniMaxKimi阿里云百炼腾讯云 TokenHub百度千帆火山引擎OpenAIAnthropicGooglexAIMistralCohere。 全文字符数:5548

大模型的价格变化快,比较起来也比想象中麻烦。同一个厂商可能同时存在标准、Batch、缓存、长上下文、优先队列和限时优惠,甚至输入长度跨过一个阈值后,整次请求都会换一档价格。

所以这篇文章不是一张永不过期的排行榜,而是一次价格快照:记录此刻调用主流模型大概要花多少钱,也给以后回看模型迭代速度留一个坐标。

统计口径

  • 单位统一为 人民币元 / 1M tokens,也就是每 100 万 Token。
  • 海外厂商的美元价格按固定汇率 1 美元 = 7 元人民币换算,不代表实时汇率。
  • 主表采用官方直连、按量付费、在线推理、缓存未命中的文本 Token 价格;核价当天仍在生效的公开优惠会写入表格,并在备注中同时标出原价或恢复时间。
  • 输入和输出分开统计;推理 Token 通常计入输出,所以深度思考任务要格外关注输出价格。
  • 不把 Batch、预付资源包、企业协议价、云市场转售价和新用户赠送额度混入主价格。
  • 海外价格先用官方美元价乘以 7,再保留能够准确表达原价的必要小数位,不提前把美元价或中间结果取整。
  • 图像、音频、视频、Embedding、联网搜索、代码执行等另行计费的能力不在本文范围内。
  • 分档模型用价格区间表示,具体档位写在备注中。

价格只能回答“用了多少 Token 要付多少钱”,不能直接回答模型效果、速度、稳定性和可用地区。不同厂商的分词器也不一样,同一段中文交给两个模型,最终 Token 数量可能并不相同。

国内模型价格

DeepSeek

DeepSeek 官方价目前以美元展示,下面仍按 1:7 换算成人民币。

模型 输入 输出 缓存命中输入 备注
DeepSeek-V4-Flash ¥0.98 ¥1.96 ¥0.0196 官方价 $0.14 / $0.28
DeepSeek-V4-Pro ¥3.045 ¥6.09 ¥0.025375 官方价 $0.435 / $0.87

V4-Flash 和 V4-Pro 都提供 1M 上下文,并同时支持思考与非思考模式。旧的 deepseek-chatdeepseek-reasoner 已在 2026 年 7 月退出,接入新项目时不宜再把旧名称写死。

智谱 GLM

模型 输入 输出 备注
GLM-5.2 ¥8 ¥28 1M 上下文,缓存命中 ¥2
GLM-5 ¥4~6 ¥18~22 输入达到 32K 后进入高价档
GLM-4.7-FlashX ¥0.5 ¥3 低成本快速模型
GLM-4.7-Flash 免费 免费 受官方免费额度与并发规则约束

智谱定价页对 GLM-5.1、GLM-5-Turbo、GLM-5 和 GLM-4.7 都设置了分档。长提示词或较长输出可能同时推高输入、输出单价,不能只看表格里的最低档。

MiniMax

模型 输入 输出 缓存读取 备注
MiniMax-M3,≤512K ¥2.1 ¥8.4 ¥0.42 当前永久五折价
MiniMax-M3,>512K ¥4.2 ¥16.8 ¥0.84 当前永久五折价
MiniMax-M2.7 ¥2.1 ¥8.4 ¥0.42 标准速度
MiniMax-M2.7-highspeed ¥4.2 ¥16.8 ¥0.42 高速版本

MiniMax 按量计费页把 M3 放在当前模型区,并按单次输入是否超过 512K 分档;M2.5 已被列入历史模型,因此不再放进主表。M2.7 高速版是标准版价格的两倍,是否值得付这部分溢价,应看端到端延迟,而不只是模型开始输出后的速度。

Kimi

模型 输入 输出 缓存命中输入 备注
Kimi K3 ¥20 ¥100 ¥2 1M 上下文
Kimi K2.7 Code ¥6.5 ¥27 ¥1.3 面向代码任务
Kimi K2.7 Code Highspeed ¥13 ¥54 ¥2.6 高速版本
Kimi K2.6 ¥6.5 ¥27 ¥1.1 文本与视觉输入

Kimi 已经从 K2.5 进入 K3、K2.7 和 K2.6 阶段。价格分别见 K3K2.7 CodeK2.6 官方页面。

Qwen

模型 输入 输出 备注
Qwen3.8-Max ¥12 ¥36 0~1M,同一档价格
Qwen3.7-Plus,≤256K ¥1.6 ¥6.4 动态别名限时 8 折;原价 ¥2 / ¥8
Qwen3.7-Plus,256K~1M ¥4.8 ¥19.2 动态别名限时 8 折;原价 ¥6 / ¥24
Qwen3.7-Flash,≤32K ¥0.2 ¥0.8 标准在线价格
Qwen3.7-Flash,32K~256K ¥0.6 ¥2.4 整次请求进入第二档
Qwen3.7-Flash,256K~1M ¥1.2 ¥4.8 整次请求进入第三档

阿里云百炼价格页已经把 Qwen3.8-Max 列为最新 Max,并明确说明阶梯价格作用于整次请求。Qwen3.7-Plus 动态别名仍显示限时 8 折,表中采用核价当天的实际优惠价;做长期预算时应使用备注里的原价。固定快照 qwen3.7-plus-2026-05-26 不享受动态别名的这项折扣。

腾讯混元

模型 输入 输出 备注
Hy3 ¥1 ¥4 缓存命中 ¥0.25
Hy3 Preview ¥1.2~2 ¥4~8 16K、32K 两个分档点;将于 2026-08-31 下线
Hy-MT2-Lite ¥0.3 ¥1.2 翻译模型
Hy-Role-Latest ¥2.4 ¥9.6 角色扮演模型

腾讯新一代模型价格已经集中到 TokenHub 定价文档。腾讯云另有下线公告:Hy3 Preview 将于 2026 年 8 月 31 日下线并切换到 Hy3,因此新项目不应再以 Preview 的价格做长期预算。如果仍在旧混元平台接入,迁移前还要同时核对模型名、接口和账单归属。

百度文心

模型 输入 输出 备注
ERNIE 5.1 ¥4~6 ¥18~22 32K 以上进入高价档
ERNIE 5.0 ¥6~10 ¥24~40 32K 以上进入高价档
ERNIE 4.5 Turbo ¥0.8 ¥3.2 缓存命中 ¥0.2

百度千帆价格页以每千 Token 标价,这里已经乘以 1000,换算成每百万 Token。若开启搜索增强,还会按实际触发次数另行收费。

豆包

模型 输入 输出 备注
Doubao-Seed-2.0-Pro ¥3.2~9.6 ¥16~48 32K、128K 两个分档点
Doubao-Seed-2.0-Code ¥3.2~9.6 ¥16~48 与 Pro 相同的分档价格
Doubao-Seed-2.0-Lite ¥0.6~1.8 ¥3.6~10.8 32K、128K 两个分档点
Doubao-Seed-2.0-Mini ¥0.2~0.8 ¥2~8 32K、128K 两个分档点

火山方舟计费明细显示,豆包 2.0 系列在输入达到 32K 和 128K 后会整体切换价格档位。官网产品页写的是“¥0.2 起”,但长上下文请求不能拿这个起步价做预算。

海外模型价格

以下人民币价格全部由官方美元价乘以 7 得出。

OpenAI

模型 输入 输出 缓存命中输入 备注
GPT-5.6 Sol ¥35 ¥210 ¥3.5 $5 / $30
GPT-5.6 Terra ¥14 ¥84 ¥1.4 $2 / $12
GPT-5.6 Luna ¥1.4 ¥8.4 ¥0.14 $0.2 / $1.2

OpenAI 的 SolTerraLuna 详情页分别给出 $5 / $30、$2 / $12 与 $0.20 / $1.20。三者的输入超过 272K 后,整次请求按输入 2 倍、输出 1.5 倍计费,而不是只对超出的部分加价。

Anthropic Claude

模型 输入 输出 缓存命中输入 备注
Claude Fable 5 / Mythos 5 ¥70 ¥350 ¥7 Mythos 5 为有限开放
Claude Opus 5 ¥35 ¥175 ¥3.5 标准价格
Claude Sonnet 5 ¥14 ¥70 ¥1.4 2026-08-31 前的引入价
Claude Haiku 4.5 ¥7 ¥35 ¥0.7 标准价格

Anthropic 定价页注明,Claude Sonnet 5 在 2026 年 9 月 1 日恢复到 $3 / $15,也就是 ¥21 / ¥105。Claude 的 5 分钟缓存写入为标准输入价的 1.25 倍,1 小时写入为 2 倍,命中读取为 0.1 倍。

Google Gemini

模型 输入 输出 备注
Gemini 3.6 Flash ¥10.5 ¥52.5 $1.5 / $7.5
Gemini 3.5 Flash-Lite ¥2.1 ¥17.5 $0.3 / $2.5
Gemini 3.1 Pro Preview,≤200K ¥14 ¥84 $2 / $12
Gemini 3.1 Pro Preview,>200K ¥28 ¥126 $4 / $18

Gemini API 定价页中的输出价格已经包含思考 Token。Google 还提供免费层、Batch、Flex 和 Priority,但它们在配额、时延与价格上口径不同,主表只采用标准付费层。

xAI Grok

模型 输入 输出 备注
Grok 4.5,<200K ¥14 ¥42 $2 / $6
Grok 4.5,≥200K ¥28 ¥84 $4 / $12
Grok 4.3,<200K ¥8.75 ¥17.5 $1.25 / $2.5
Grok 4.3,≥200K ¥17.5 ¥35 $2.5 / $5
Grok Build 0.1,<200K ¥7 ¥14 $1 / $2
Grok Build 0.1,≥200K ¥14 ¥28 $2 / $4

xAI 定价页明确说明:当提示词达到 200K 后,长上下文价格会作用于整次请求的全部 Token。联网搜索、X 搜索、代码执行和文件检索还会按工具调用次数收费。

Mistral

模型 输入 输出 备注
Mistral Medium 3.5 ¥10.5 ¥52.5 $1.5 / $7.5
Mistral Small 4 ¥1.05 ¥4.2 $0.15 / $0.6
Mistral Large 3 ¥3.5 ¥10.5 $0.5 / $1.5
Magistral Small ¥3.5 ¥10.5 $0.5 / $1.5

Mistral API 定价页还列有 OCR、语音、Embedding 和分类模型。Mistral 的 Batch 处理通常有 5 折,但不适合需要立即返回结果的在线请求。

Cohere

模型 输入 输出 备注
Command A ¥17.5 ¥70 $2.5 / $10;模型 ID 为 command-a-plus-05-2026
Aya Expanse ¥3.5 ¥10.5 $0.5 / $1.5

Command A 模型页给出的正式模型名称是 Command A,虽然它的 API 模型 ID 中带有 a-plusCohere 定价页则列出 Aya Expanse 的按量价格。部分模型需要申请生产权限,接入前要确认自己的账户是否能获得对应模型和并发。

怎样估算真实账单

最简单的估算公式是:

费用 = 输入 Token ÷ 1,000,000 × 输入单价
     + 输出 Token ÷ 1,000,000 × 输出单价
     + 缓存、搜索、代码执行等附加费用

假设一个月使用 1000 万输入 Token、200 万输出 Token,且不考虑缓存:

模型 估算月费
DeepSeek-V4-Flash ¥13.72
MiniMax-M2.7 ¥37.8
GPT-5.6 Luna ¥30.8
Claude Sonnet 5 ¥280(按 8 月引入价)

这不是能力排名,只是说明输出量对账单的影响。很多 Agent 和代码任务会生成大量思考、工具参数和中间结果,看起来只有几句最终答案,实际输出 Token 却可能很高。

API 选择建议

先用自己的任务做小型评测

不要先选“最强模型”,也不要先选“最便宜模型”。从真实业务里抽取 30~100 个有代表性的请求,固定提示词、工具和评分标准,再比较成功率、平均 Token、首字延迟、总耗时与单次成本。

模型单价低但经常重试,或者需要更长提示词才能稳定完成任务,最终成本未必低。反过来,旗舰模型如果一次就能完成高价值任务,也可能更划算。

日常请求与困难请求分层

比较实用的架构是两级路由:分类、抽取、改写、简单问答先交给低价模型;代码审查、复杂推理和失败重试再升级到更强模型。国内可以从 DeepSeek-V4-Flash、豆包 2.0 Mini、GLM Flash、Qwen3.7-Flash 等低成本档开始测试;海外则可以从 GPT-5.6 Luna、Gemini Flash-Lite、Mistral Small 等开始。

这些只是候选池,不代表它们在所有任务上等价。路由规则必须由自己的评测结果决定。

Agent 和编程场景重点看输出价

Agent 会反复携带上下文、生成工具调用并读取结果,编程模型还可能输出长补丁。此时输出单价、缓存策略、工具调用费、并发限制和错误重试率,往往比输入起步价更重要。

可以把 Kimi K2.7 Code、MiniMax M3 / M2.7、GLM-5 系列、豆包 2.0 Code、OpenAI GPT-5.6、Claude、Gemini Pro、Grok Build 和 Mistral 的代码模型放进同一套仓库任务里实测,再按“成功完成一次任务的总费用”比较。

长上下文不是免费硬盘

Qwen、GLM、豆包、Gemini、Grok 和 OpenAI 都存在不同形式的长上下文分档。一次请求刚刚跨过阈值,费用可能不是略增,而是整段上下文一起涨价。

对话历史应定期压缩;知识库应先检索再注入;固定系统提示、代码库说明和文档前缀则尽量使用缓存。能放进 1M 上下文,不等于每次都应该放进去。

离线任务优先考虑 Batch

翻译语料、批量分类、离线摘要和数据清洗不要求秒级响应时,可以优先看 Batch。OpenAI、Anthropic、Google、Mistral、Qwen 等厂商通常提供不同程度的折扣,但要接受排队、完成时间和接口差异。

最后再看合规与可用性

价格之外,还要确认数据保存策略、可用地区、内容合规、发票与支付方式、并发和速率限制、模型下线周期,以及是否允许固定快照。生产系统最好保留第二供应商或降级模型,不要让一次模型改名、区域故障或价格调整直接中断服务。

小结

截至 2026 年 8 月,国内模型的 Token 单价整体仍然很有竞争力,低价档已经压到每百万输入 Token 不足 1 元;海外旗舰模型则常见几十元输入、上百元输出。但价格差距并不等于效果差距,也不等于最终业务成本差距。

真正稳妥的选择顺序应该是:先定义任务和验收标准,再用真实样本评测,随后计算一次成功任务的总成本,最后才决定主模型、降级模型、缓存与 Batch 策略。

这张表最有价值的用途,或许不是告诉我今天该选谁,而是等一年后再回来看看:模型能力、命名和价格,在短短一年里又走了多远。