大模型行业最知名的“价格屠夫”,准备涨价了。
8月6日,DeepSeek在用户后台发布公告,宣布计划于近期整体上调DeepSeek API服务的定价,并且特意提醒用户,此次“预计涨幅较大”,建议合理安排使用需求和充值金额。
图源:DeepSeek
这个消息一出,马上就引起了广泛关注,毕竟在过去两年里,每逢Token价格战,DeepSeek几乎都是那个带头掀桌子的人。如今,率先将Token价格打下来的DeepSeek却主动宣布将“大幅涨价”,看起来颇有一种价格战发起者准备鸣金收兵的感觉。
无独有偶,8月7日,路透社报道称,阿里计划向旗下千问推出的下一代开源人工智能大模型的大型商用用户收取营收分成。此前,只有在阿里云平台调用模型的开发者才需要收费,这也是阿里云力推的MaaS(模型即服务)模式。但如果客户将开源模型部署在自有数据中心,则可全程免费使用。从Kimi K3等开放权重模型开始采取分成模式来看,开源大模型似乎很快就没有”免费的午餐”吃了。
所以大模型行业持续两年多的Token价格战,真的要结束了吗?
过去的DeepSeek到底有多便宜?
在讨论涨价以前,我们不妨先来看看DeepSeek现在到底有多便宜。
DeepSeek API官方页面显示,目前DeepSeek-V4-Flash缓存命中输入价格为每百万Token 0.02元,缓存未命中输入为1元,输出为2元;性能更强的DeepSeek-V4-Pro分别为0.025元、3元和6元。
图源:DeepSeek
DeepSeek此前还预告将推出峰谷定价机制,在北京时间每天9点至12点、14点至18点的高峰期,所有计费项目的价格调整为平时的两倍,只是截至8月6日,这套机制同样尚未正式实施。
即使如此,单看标准价格,DeepSeek-V4-Flash依然便宜得夸张。海外研究机构Artificial Analysis的测试数据显示,DeepSeek-V4-Flash完成一轮综合基准测试的平均成本仅约0.03美元。
作为对比,Kimi K3完成相同测试的平均成本约为0.86美元,OpenAI GPT-5.6 Sol约为1.86美元,Anthropic Claude Fable 5更是达到3.15美元。也就是说,在这套测试标准下,DeepSeek-V4-Flash的任务成本甚至不到部分海外旗舰模型的百分之一。
图源:Artificial Analysis
当然,有人会说,模型能力毕竟不同,这倒也是事实。从Artificial Analysis的测试榜单来看,DeepSeek V4 Flash 0731 Max的得分与Fable 5相差11分。但是,当价格差距扩大到百倍时,情况就不一样了,毕竟大多数任务其实并不需要这么强的模型性能。
而且,从榜单来看,DeepSeek的价格也比成绩相近的Gemini 3.6 Flash High低90%,对于大多数用户来说,真的只能用“物美价廉”来形容。所以,这次DeepSeek特意强调“预计涨幅较大”,自然让大量开发者感到紧张。
特别是在Agent时代,AI需要执行的任务早已不是简单的一问一答。就拿编程任务来说,Agent AI为了完成任务,可能需要读取整个代码库,然后再生成计划并调用工具,最后还要运行测试,如果发现错误,就需要重新修改并再次调用模型验证。
图源:雷科技
虽然看起来用户只是输入了一句话,但是当AI完成任务并给出结果后,可能已经进行了几十轮甚至上百轮的模型调用。可以说,在Agent模式下,AI的Token消耗呈指数级增长,当每天消耗的Token达到几十亿甚至万亿级别时,即便Token价格只是上涨几毛钱,账单也得涨上几十万元,甚至更多。
说实话,可能DeepSeek最初也没想到这个问题,而是在用户使用量飙升后才意识到。简单来说,DeepSeek可能预料到了自己的模型会受欢迎,却低估了Agent的Token消耗量,以至于服务器的算力被迅速榨干。
更何况,从Artificial Analysis的测试来看,DeepSeek V4 Flash 0731 Max还是个实打实的“话痨”,别的模型只需要几千万到1亿Token就能完成的测试,DeepSeek硬是花了2.1亿Token。不过,若是DeepSeek的Token输出量能够降到与其他模型相近的水平,成本还能再降50%,这对于其他AI公司来说就太恐怖了。
调用量全球第一,DeepSeek快被榨干了
对于多数人来说,最大的疑问应该是:DeepSeek为什么现在突然涨价?
答案就是刚刚更新的DeepSeek V4 Flash 0731 Max实在是太强了,虽然从版本号来看,其定位不如V4 Pro,但是在Agent能力上却有非常明显的提升,这正是目前重度AI用户们最需要的能力。
所以,反映到实际数据中,就是调用量的飙升。根据OpenRouter的最新统计数据,DeepSeek-V4-Flash最近一周处理量已经达到约6.6万亿Token,虽然对比上一周降了10%,但是在目前的模型调用榜中仍然排名第一。
图源:
如果只是单纯排名第一,倒还好。更恐怖的是,在OpenRouter平台统计的所有模型中,DeepSeek-V4-Flash的使用量同样排名第一,甚至占据约58%的Token份额。数据显示,从6月12日到8月6日,该模型累计处理量达到约97万亿Token,完成会话超过1000万次。
即使这只是第三方平台的数据,也足以让人感到惊讶,因为DeepSeek可是在Gemini、ChatGPT、Claude等一众顶级AI中脱颖而出,拿下了这一份额。
但是,从中也能看出DeepSeek所面临的算力压力,每周数万亿Token的处理量对于一家量化企业来说,压力确实非常大。此前,小雷曾看到有报道称,DeepSeek拥有一座十万卡规模的数据中心,听起来规模不小,但与Google、OpenAI等AI企业相比,就不在一个数量级上了,更不用说与亚马逊、阿里云等云服务巨头相比了。
事实上,从上周开始,DeepSeek就频繁传出算力不足、限制使用的消息。小雷前几天打开DeepSeek的网页版,想用一下专业模式,页面直接提示“服务繁忙”。说实话,除了去年初DeepSeek第一次爆火的时候外,我已经很久没有在DeepSeek上看到过这个提示了。
其实之前DeepSeek刚发布V4版本的时候,就一度因为调用量太大,宣布未来将对Token服务采用峰谷定价,但是这个计划直到现在都没能实施,因为DeepSeek发现自己的服务器几乎没有降到“谷底”的时候。
网上有DeepSeek的用户晒出官方群发的故障公告,前后两个性能下降公告的发布时间分别是中国时间的工作日上午以及美国时间的工作日上午。到了深夜,中国这边的用户确实不用了,但是美国那边的用户却开始起床“站起来蹬”了,所以哪里还有“谷底”?全是“峰顶”。
对于DeepSeek来说,目前的定价别说能不能赚钱,能做到收支平衡就不错了,甚至有不少业内人士猜测,DeepSeek其实一直在补贴Token价格,否则,以他们目前的算力规模,Token价格不可能做到这么低(因此也有不少网友将梁文锋称之为“梁圣”,感谢他的开源和超低价Token)。
图源:微博
当然,这种事DeepSeek自己不认的话,别人也没什么办法证明。但是有一点是可以肯定的,那就是低价确实能够吸引开发者,但价格太低时也会带来另一个问题:各种杂七杂八的需求都涌向DeepSeek。
举个例子,有开发者正在用AI写程序,遇到一个小BUG。这个BUG,他自己花十来分钟也能排查掉,但是因为DeepSeek的价格太便宜,跑一轮debug可能就几毛钱,他就不会选择自己解决问题,而是丢给DeepSeek解决。
相反,如果他用的是Claude等高价模型,随便跑个任务就要几块钱、十几块钱,他可能就不舍得让AI跑,而是会选择手动debug。不要小看这两种心态的区别,当大多数用户都是这样的时候,DeepSeek实际上有大量算力被用在那些很简单的任务上。
而且,这些请求还会挤占复杂任务的算力份额,导致前面小雷提到的“拥堵”情况出现。当然,大家都是花了钱的,怎么用都无所谓,但是对DeepSeek来说,他们也确实需要更多地考虑那些将Token用于商业项目的用户,需要尽可能保证他们的体验。
所以,在坚持一段时间的低价后,DeepSeek涨价其实也在不少人的预料之中,而且真要说的话,当时DeepSeek宣布降价时用的也是“限时”字样,估计也是早就做好了涨价的准备。
站在消费者的角度,小雷自然希望DeepSeek可以一直优惠下去,但是站在行业的角度来说,靠补贴来抢市场肯定是无法持久的,特别是AI这样重投入、快迭代的行业,企业必须考虑收支平衡的问题。
更何况,DeepSeek的价格优势实在太大了,从目前的情况来看,即使涨价几倍,依然有着不错的性价比,对于多数开发者来说,仍然是性价比最高的选择。
Token低价时代结束,商业化成了新重点
虽然在DeepSeek宣布涨价后,有网友表示这是Token价格战结束的信号,但是小雷并不这么认为,反而觉得价格战才刚刚开始。
几乎同一时间,
过去两年的价格战其实非常简单,各家厂商比的就是每百万Token多少钱,今天你宣布降到5块,明天对家就能掏个2.5块的价格来和你打擂台。甚至有些AI公司直接以千万Token为单位到处派发免费额度,然后再推出限时折扣和缓存优惠,以至于Token价格一度低到让开发者几乎可以忽略不计。
但是,随着模型能力和应用场景不断变化,单纯比较Token价格已经没有太大意义。首先,不同模型完成同一个任务需要消耗的Token数量不同。以Artificial Analysis的测试项目为例,DeepSeek用了2.1亿Token,Gemini 3.6 Flash High则用了5900万Token,差距接近3.5倍。
图源:Artificial Analysis
这也是为什么Gemini 3.6 Flash High的Token输出价格几乎是DeepSeek的20倍,最终两者的测试任务成本仅相差10倍。随着任务复杂度上升,两者的差价还有可能进一步缩短,这也会影响模型的竞争力。
其次,模型速度和稳定性也开始影响企业成本。如果你的API响应缓慢、频繁超时或者高峰期不可用,都会带来严重的体验问题。特别是对于那些需要实时演算、对稳定性有较高要求的业务(比如金融业务)来说,稳定性就更加重要了。
随着AI真正进入各个行业的底层运行链条,其实有一个明显的变化,那就是在价格之外,企业也开始对算力有了更多要求:稳定性、性能和速度。对于DeepSeek来说,虽然他们并不靠Token赚钱,但是如果想继续在模型领域占据一席之地,那么就必须考虑到B端的需求。
此时,通过适当涨价“劝退”部分用户并提升高价值用户的体验,就是最合适的方案了。虽然这听起来有点伤人,但从企业角度来说,也是无可厚非的。而且,V4 Flash 0731都已经有这样的表现了,后续的V4 Pro xxxx版说不定会更强,这时候如果价格差距拉太大,也不方便DeepSeek平衡两个版本之间的性价比。
其实,纵观全球的AI模型市场,不难发现大家在最近几个月都开始把模型“细分化”,通过构建阶梯式的性能和价格体系,来满足不同的用户需求。所以,与其说价格战结束,不如说价格战现在才正式开始,AI企业接下来将进入真正的“肉搏”阶段,希望通过更具性价比的模型、更稳定、更快速的服务,拿下更多B端市场份额。
可以说,Token的商业化大战从此时才算是正式打响。
机器人产业最重要风向标,世界机器人大会(WRC)2026重磅来袭,还有世界人形机器人运动会紧随其后。
宇树、智元、启元、魔法原子、银河通用、云深处、灵心巧手等300余家TOP展商联袂呈现,定义全球机器人产业未来!
所有关于机器人的核心问题,WRC都将给出答案。
雷科技WRC 2026报道团,空降北京重磅呈现。