如果说 2024-2025 年的大模型竞争主题是"谁的跑分高",那么 2026 年 9 月的主题已经明确切换为:同等能力下,谁的价格更低。
随着 Anthropic 在 8 月把 Fable 5.1 的定价永久锚定在输入 $10 / 输出 $50(每百万 token),各家厂商的定价策略出现了明显的分层。我基于各厂商公开的定价信息,把当前主力模型的价格整理如下。
主力模型公开定价对照(每百万 token,美元)
| 模型 | 输入 | 输出 | 厂商 | 备注 |
|---|---|---|---|---|
| MiMo-V2.5 | 0.40 | 2.00 | 小米 | 入门档最低价 |
| DeepSeek-V4-Flash(高峰) | 0.44 | 1.32 | DeepSeek | 输出价最具竞争力 |
| DeepSeek-V4-Pro(非高峰) | 0.66 | 1.98 | DeepSeek | 分时定价红利 |
| Gemini 3.6 Flash | 0.75 | 3.75 | 促销价持续至 2026-12-31 | |
| Gemini 3.7 Flash | 0.75 | 3.75 | 同上,12/31 后回调 | |
| LongCat-2.0(标准) | 0.75 | 2.95 | LongCat | 输出价低于 Gemini Flash |
| MiMo-V2.5 Pro(≤256K) | 1.00 | 3.00 | 小米 | 长上下文档 |
| Claude Fable 5.1 | 10.00 | 50.00 | Anthropic | 能力天花板档 |
注:各厂商促销与折扣可能随时间调整,以官方定价页为准。
三个值得注意的定价策略
一、Google 的"限时锚定"打法
Gemini 3.6 / 3.7 Flash 的 $0.75/$3.75 是标注了截止日期(2026 年 12 月 31 日)的促销价。这种"限时锚定"的意图很明显:先用低价把开发者生态圈进来,年底再视竞争态势决定回调幅度。如果你的架构深度绑定 Flash 系,建议现在就把 12/31 之后的成本压力测试做掉。
二、DeepSeek 的分时定价
DeepSeek-V4 系列延续并深化了"高峰/非高峰"双轨定价:Flash 高峰期 $0.44/$1.32,V4-Pro 非高峰 $0.66/$1.98。对任务可调度性强的批量场景(离线数据处理、夜间批量生成),错峰调度本身就是一项优化工程,实际成本可以再压 30% 以上。
三、国产新玩家的"贴地"入场
小米 MiMo-V2.5 以 $0.40 的输入价格成为表格中的最低档,输出 $2.00 同样激进。配合 Pro 版的 256K 长上下文支持,"手机厂做大模型"这条线已经从概念走到了有竞争力的商用定价。
按场景选型的务实建议
结合 9 月各家的公开基准表现,不同场景的性价比答案已经很清晰:
- 批量内容生产(走量):Gemini 3.8 Flash 是公认的 price-performance 首选
- 离线批处理(可调度):DeepSeek-V4 非高峰档,错峰红利最大化
- 事实锚定类商业写作:GPT-5.5,OpenAI 在这个细分场景的差异化依然稳固
- 虚构/创意写作:Kimi K3 在 EQ-Bench 拿到 2070.6 分(第四名),中文创作场景尤其值得试
- 复杂编码与智能体工作流:Claude Fable 5.1,贵但强,用对场景就是省钱
- 预算敏感的通用任务:MiMo-V2.5 / DeepSeek-V4-Flash
价格战背后:行业逻辑变了
价格战的表面是让利,深层是推理成本的持续摊薄。稀疏注意力机制(DeepSeek 的 NSA、月之暗面的 MoBA 这类架构优化)已经成为降本的主流技术路径——用"只听关键发言"的方式替代"听全场发言",单次推理的计算量大幅下降。
中国信通院在《人工智能产业发展研究报告》中的判断与此呼应:行业已不再单纯依靠参数规模实现性能突破,精细化机制、算法架构、训练方法的优化成为主要提升方向。翻译成采购语言:降本空间还会持续释放,今天的"低价"可能只是明天的"常态价"。
给开发者的三个动作
- 把模型选型写成配置而非代码:价格战时代,换模型的频率会越来越高
- 为分时定价做调度能力:这是 DeepSeek 们白送的 30% 折扣
- 盯紧 12 月 31 日:Gemini Flash 促销到期是年内最大的成本变量
