卖 token 到底赚不赚钱?
市场只盯着各家大模型的营收规模,却很少有人算清楚一件事:每卖出一百万 token,到底净赚多少。伯恩斯坦(Bernstein)把"AI 推理毛利率"这个黑箱,拆成了两条可计算的公式——并用它逐一量出智谱、MiniMax、通义千问三家的真实赚钱能力。结论反直觉:决定谁赚钱的,不是谁的模型更省算力,而是谁的定价、模态与业务结构更对。
52.4%
智谱 GLM-5.1 推理利润率
GLM-5 为 33.7%,提价覆盖算力成本
69.4%
MiniMax 开放平台毛利率
2025 前 9 月,高度依赖语音合成
$10/M
语音合成 token 定价
是文本 / 代码 token 的 50 倍以上
39%
智谱 KV 缓存命中率(中位)
MiniMax 智能体任务高达约 71%
这是一篇罕见地把"卖 token 赚不赚钱"算到小数点后一位的报告。它不看研发、不看融资,只聚焦最朴素的一笔账——直接推理毛利率 = 每百万 token 收入 − 每百万 token 成本。伯恩斯坦给出的最大洞察是:在中国三家头部模型厂商之间,推理利润率从 −6.8% 到 +52.4% 横跨近 60 个百分点,而拉开差距的主导变量在收入端(定价、模态、业务结构),不在成本端(模型优化、算力效率)。下面我们先把这台"赚钱机器"拆成可调的旋钮,你可以亲手转一转。
01
亲手算一算:推理毛利率计算器
拖动左侧旋钮,右侧实时算出每百万 token 的收入、成本与毛利率。先点三家预设感受差异,再自己调参。
一键载入:
收入端 · Rev/Mtok
语音合成 token 可高达 $10/M,文本 / 代码通常 $1–3/M
智能体任务输入多输出少(占比低),通用对话输出占比高
命中的输入 token 按折扣价计费,命中率越高、单价被摊薄越多
成本端 · Cost/Mtok
中国市场 H20/H100 约 $1.1–1.6;自用算力的云厂商更低
智谱约 1000,MiniMax 轻量化模型约 3000
每百万 token 收入 Rev/Mtok$0.84
每百万 token 成本 Cost/Mtok$0.45
46%
直接推理毛利率 =(Rev − Cost)/ Rev
预设参数为各家公开口径的近似值,用于演示变量敏感性,非精确财报数字。
怎么读这台机器
把输出单价从 $2.4 拉到 $10(语音合成档),毛利率会瞬间冲上 90%+——这正是 MiniMax 高毛利的来源;再把GPU 小时成本从 $1.3 降到 $0.9(阿里云自用算力),毛利率又涨一截——这是通义千问的结构性优势。反过来,光把吞吐量翻倍(模型优化)对毛利率的拉动,远小于动一下定价。收入端的旋钮,比成本端灵敏得多。
登录 / 免费注册 →
注册免费,可读注册层内容;解锁全部档案凭会员兑换码 · 返回报告目录
还没有兑换码?扫码领 ¥100 券,直接加入知识星球
- 📡Serenity 实时订阅 全网订阅第一「白毛股神」一手推文,分钟级中译直推邮箱,每天约 20~30 条,含她付费订阅才有的独家内容
- 📈大行研报 · ima 知识库对话 境内外一线投行研报每日汇入腾讯 ima 知识库(AI 相关精选 7,000+ 份、境内外日增 30+),你在库里通过 AI 对话随问随答、带出处,等于雇个 7×24 研究助理
- 🗺️知识库全开 + 深度报告解析 1,147 公司 / 688 概念全词条 + 全景图谱,外加 59 篇机构深度报告可视化解读、巨头供应链拆解、产业大事件复盘
- 🎓两套课程全解锁 金融人的产业链大课 10 讲(能源→芯片→基础设施→模型→应用,每周上新)+ 公司深度研究 15 门(英伟达 / 台积电 / SK 海力士 / 博通 / 中际旭创…一家公司一门课,分单元、节节带测验、给成绩单)
全站会员 ¥599 / 年
扫码自动领 ¥100 优惠券 · 到手 ¥499
8 月 20 日 23:59 到期 · 仅剩 11 天
8 月 20 日 23:59 到期 · 仅剩 11 天