人工智能

Token市场这么火爆,为什么卖的越多亏的越狠?

Token厂商怎么能挣大钱?

2026年08月13日
  • 人工智能

2026年,Token厂商密集冲刺资本市场。派欧云和硅基流动先后向港交所递交上市申请,无问芯穹累计融资超22亿元,趋境科技半年内融资超10亿元。这个赛道不缺玩家,也不缺资本。

但翻开派欧云招股书,这家日均处理超万亿Token、在中国独立AI云厂商中排名第一的公司,Token核心业务仍然在亏钱。爱分析研究了派欧云的完整招股书数据,试图回答一个问题:Token消耗量增长迅猛,为什么卖Token的公司越卖越亏?

01 一年收入暴增十倍,为何依然亏损?

派欧云自2024年开始,从CDN切入AI云服务,提供模型API、GPU云服务和Agent云服务。模型API是当前重心,即为开发者提供大语言和多模态模型Token服务,且多为开源模型。

先看派欧云AI云业务的核心数据。

图1:派欧云AI云业务核心数据

派欧云一年时间,AI云收入增长十倍,毛利率的亏损迅速收窄至-10.7%,且日均Token消耗量已经超过1万亿。整体增速极快,改善幅度也大。

这组数字让市场产生了两种截然相反的直觉。乐观者看斜率:从-95.1%到-10.7%,再给一年盈利只是时间问题。悲观者看绝对值:年增十倍还在赔钱,最后一口气未必跨得过去。

要判断谁更接近真相,需要先看清AI云内部三条产品线的构成。

图2:派欧云AI云产品线分析

基于爱分析估测,派欧云AI云收入主要来源于模型API,占比超过60%,也是导致AI云毛利率为负的主要原因。另外两块业务,GPU云服务按小时收算力租赁费,毛利率低但并非毛利率为负的拖累项;Agent云服务占比低,并非亏损主因。

派欧云每天1万亿的Token消耗量,说明需求真实,但Token价格不是派欧云定的,而且模型官方定价。爱分析对比了派欧云的定价页面和DeepSeek、GLM、Kimi等官方API文档,派欧云的定价和官方是一致的。

这并不是派欧云不想定高价,而是定价权在模型厂商手里。Token API是同质化商品,用户切换Token供给方的成本仅仅是改一行代码。因此,即使Kimi的推理算力供给不足,派欧云也无法溢价收费。

而成本端,派欧云的GPU算力多是租赁而来,2025年GPU资源成本1.17亿,几乎等于整体的AI云收入。因此,派欧云每多提供一个Token就多付一笔GPU租金。在英伟达租金价格持续上涨的过程中,派欧云的资源成本居高不下。

收入的定价权被锁死,资源成本却始终在上行区间,这就是AI云毛利率为负的全部解释。

02 Token定价权不在卖Token的人手里

在派欧云两个贡献主要收入的AI云服务中,GPU云服务的定价权可以掌握在厂商自己手中,而Token定价权都掌握在模型厂商手中。

GPU云服务天然是盈利的业务。比如,AutoDL运营着面向高校的C端算力云平台,2025年营收2.1亿元、净利润2669万元。它卖的是GPU小时,用户为GPU资源服务。由此估测,派欧云的GPU云服务也同样有一定利润。

但是,Token是标准化商品,同样的模型同样的输出,无法差异化。Token是由上游模型厂商定义,但他们的定价逻辑并非完全基于短期商业化考量。

模型厂商为Token定价时考虑的不是单条API业务线的盈亏,而更多是考量能覆盖多少开发者、能否回流更多数据为下一次模型迭代提供支撑。DeepSeek把V4-Flash定在每百万Token输入1块钱,这个价格无法覆盖推理成本,但模型厂商不需要靠API赚钱,用的人多才是它们需要的。

但对于派欧云而言,Token是核心收入来源,尽管能留存开发者使用数据,但这种数据交易属于灰色地带,不能放在台面上。也就是说,派欧云每一分利润都要从推理效率里省出来,也就是降Token生成成本降到极致。

更何况,模型API收入大多来自中小开发者和AI应用公司,这些客户对价格极度敏感,没有任何议价能力。

这个价格结构在派欧云的客户构成里体现得很清楚。派欧云的AI云服务2025年付费客户数量超过9.1万名,ARPU值仅1300元,无疑都是薅羊毛客户为主。

爱分析认为,派欧云的亏损根源在行业结构,它是一个定价权被上游锁死的赛道,未来只有通过把效率做到极致才有可能实现盈利。

03 Token业务的毛利率有没有机会打正?拆解四个变量

未来运营效率可以改善的空间主要有4个方向,分别是GPU利用率、推理效率、模型收入结构以及Agent云服务。以下我们拆开四个变量逐个看。

第一个变量,GPU利用率。不言而喻,GPU利用率越高,同样产出所需租赁的GPU资源越少。派欧云在招股书中表示,GPU利用率做到了75%,而行业平均40%到50%。据悉,业界目前披露的最高优化水平,是Meta的研究超级集群做到83%到85%,派欧云的75%已属优秀。

但GPU利用率每往上走一个点,边际难度都在加大。GPU利用率持续提高的最有效方式就是填满非高峰时段的空闲算力,而填满它们的手段只有一个:跑批任务、而非实时任务。但,跑批任务意味着更低的价格,即使能够充分利用,也难以对于毛利率有大的贡献。因此,GPU利用率的改善空间并不大。

第二个变量,推理效率。推理效率,即通过推理引擎优化,在同样的算力上让模型的Token吞吐量更高。

但推理效率的优化受模型架构制约,其优化手段公开,以KV Cache和PD分离为主,SGLang和vLLM等开源项目也很多,技术壁垒并不高。而且优化空间是递减的,第一轮优化可能提升数倍,第二轮优化效果就大幅缩水。相比之下,模型厂商可以和GPU芯片厂商深度配合,从源头芯片层面优化Token吞吐量。未来,派欧云也必须深入到芯片层面,才有可能产生不一样的推理优化能力。

因此,目前从软的层面进行推理效率优化能让亏损收窄,但单独靠它打正毛利率的可能性不大。

第三个变量,模型收入结构。模型API服务的普遍策略是用低价模型引流、用高价模型赚钱。DeepSeek就是典型的低价模型,Kimi、GLM是典型的高价模型。

DeepSeek V4-Flash定价每百万Token输出2元,Kimi K3输出定价每百万100块,价格差五十倍。如果流量高度集中在低价端,低价模型的亏损可能在总量上吃掉高价模型的利润。

不光派欧云,硅基流动面临同样的收入结构问题。2025年,硅基流动模型API的公有云收入2930万元,毛利率负119%,比派欧云更差。

未来,可以改变模型收入结构的动因来自模型路由。未来开发者无需决定调取哪个模型,而是通过模型路由智能调度模型,在达成任务目标的前提下,尽量少消耗Token。如此,Token厂商一定程度上可以控制低价和高价模型的收入结构比重。但毕竟前提依然是降低Token消耗,Token厂商可改善空间依然有限。

第四个变量,Agent云服务。这是四个变量里,最有机会进行毛利率改善的方向。

派欧云从2025年开始布局Agent基础设施,推出智能体沙箱产品。和API按Token计费不同,沙箱按秒计费,等待期间可以暂停。沙箱上线一年,业务规模增长超120倍。

API和Agent是两种商业模型。API卖标准化Token,毛利率被定价权锁死。Agent卖运行环境,沙箱、工具调用、记忆系统、智能体托管,这些可以差异化定价。如果用户愿意为稳定运行的Agent环境付费,而不只是按Token消耗付费,利润结构就可能被重写。

派欧云联合创始人姚欣公开表示,派欧云的Agent服务上线一年,业务规模已增长超120倍。爱分析认为,Agent云服务是派欧云突破薄利天花板最重要的路径。

综合四个变量,GPU利用率和模型收入结构的改善空间很有限,推理效率的改善空间在收窄,Agent云服务是唯一可能打破天花板的变量,但它需要时间。

04 Token厂商怎么能挣大钱?

派欧云的案例不仅是一家公司的财务故事,它回答了一个行业级问题,Token这门生意的天花板在哪里。

从收入增长和规模扩张来看,这门生意可以成立。日均Token调用量从千亿级飙升到2026年3月突破140万亿,两年千倍增长意味着赛道够宽。派欧云一年把收入翻了十倍、毛利率从-95.1%拉到-10.7%,证明规模效应在Token环节真实存在。

但毛利率的天花板也同样真实。2025年,硅基流动在获客上投入了5421万元的免费Token代金券,如果剔除这笔补贴,其公有云业务可估算毛利率在正23%左右。但毕竟这是理论值,爱分析判断,Token厂商的毛利率天花板预计落在10%-15%的区间。

这个区间意味着什么?意味着这些公司可以存活,可以随着Token总消费量增长把收入做大,但很难跳脱出传统企业服务糟糕的商业模式。一门毛利率天花板15%的生意,扣除研发、销售、管理费后,净利润率依然是个位数。派欧云、硅基流动财务数据暴露的,是Token分发调度作为一个独立商业模式的结构性上限。

如果这个判断成立,这个行业的终局有两种走向。一种是Agent云服务成功打破利润结构,供应商从卖Token升级为卖Agent运行环境,毛利率突破25%天花板。另一种是Agent未能规模化,Token分发始终薄利,最终依靠将数据出售给模型厂商来获取灰色利润。