人工智能

2026 爱分析·Token市场海外对标研究报告

中国第三方Token服务商的路如何越走越宽?

2026年09月28日
  • 人工智能

大模型普及带动推理需求快速爆发,Token推理服务商业价值持续凸显,第三方服务商已然成为AI算力生态的重要组成部分。

海内外产业发展形成显著落差:海外市场已沉淀出经过验证的商业化实践,国内行业却深陷算力内卷、价格厮杀、毛利率持续承压的发展困局。不少本土服务商在客户选择、业务路线、是否布局自研芯片等关键战略决策上,缺少可借鉴的行业参照。

基于上述背景,爱分析正式发布《2026 爱分析・Token市场海外对标研究报告》。报告跳出国内市场的局部视角,以海外成熟产业实践为对标样本,剖析不同商业模式的得失,为国内Token服务商研判赛道、制定战略提供务实参考。

1. 报告综述

Token服务正在成为AI产业链价值分配的核心环节。向上,Token服务支撑AI应用;向下,Token服务调用模型与算力资源。

根据爱分析预测,2026年全球Token市场规模将达到1350亿美元。迅速崛起的Token产业与开源模型生态,使得模型原厂提供的Token服务已经无法满足市场需求,从而催生了众多第三方Token服务商。

过去两年,第三方Token服务在海外跑出了一个相对成熟的格局,市场清晰地分化出两条发展路线。一条路线提供MaaS服务,做算力调度和推理性能优化;一条路线自研推理芯片,重新定义推理服务的成本结构。

而中国市场,当前正在重走这个过程,路途中荆棘遍地。为此,爱分析这份报告通过海外市场的对标研究,回答两个核心问题:第一,Token服务的毛利率未来将会如何变化;第二,第三方Token服务商做芯片,这个命题是否成立。

我们的核心判断有三层。

第一层,Token服务包含两门生意,服务终端企业和服务模型厂商。两者看起来都在卖算力和推理能力,但财务模型完全不同。服务企业,能自主定价、毛利高,且自持算力资产较轻,对于现金流压力小;服务模型厂商,缺少话语权、毛利被集采压到个位数,而且需要自持的资产比例也更高,现金流岌岌可危。

第二层,国内的Token服务商过于偏向服务模型,未来应当逐步重视服务终端企业这条路。当前,国内诸多的Token工厂、算力运营商,都扎堆在服务模型这条路上,反观服务企业这条路,由于收入起量慢,少有人走。但是在海外,服务企业才是主流趋势,这是国内Token行业最大的认知偏差。

第三层,Token服务向上游芯片延伸,方向是对的,但当下不是好时机,投入产出比低。未来,如果模型大厂率先跑通自研芯片加Token服务的闭环,第三方服务商入局芯片的机会将进一步收窄。

本报告后续内容分三部分展开:第二章研究海外Token市场的格局,剖析MaaS和芯片两条路线如何分化与演进;第三章分析Token服务商未来的毛利率变化趋势;第四章回答芯片路线是否适合中国的Token服务商。

2. 海外Token市场

全球Token市场规模今年迎来了爆炸式增长。爱分析测算,包含模型原厂提供的Token服务在内,全球Token市场规模从2025年的240亿美元迅速攀升到2026年的1350亿美元,增速超过460%。此前,Gartner曾预测2030年GenAI Models的市场规模为1390亿美元,未曾想这个数字2026年就已经实现。

图1:全球Token市场规模

伴随市场爆发,第三方Token服务商在海外也已经跑出了领先的第一梯队。这个梯队玩家的发展逻辑并不相同,逐步分化成了MaaS和芯片两条路线,彼此的技术壁垒与商业模式也差别很大。

2.1 MaaS路线

第一条是MaaS路线,代表厂商是Fireworks。这类厂商多出自于模型厂商的AI Infra团队,擅长在英伟达GPU上做模型推理的调度与优化。比如,Fireworks创始团队来自Meta PyTorch的整建制班底,在GPU优化和高并发架构方面拥有极深的积淀。

MaaS路线厂商的核心工作是两件事,把开源模型的推理成本压下来,以及把弹性算力调度做稳。这条路线上,海外已经跑出了多家规模化公司,ARR在从10亿美元向20亿美元冲刺。

表1:海外Token市场MaaS路线代表厂商

上述四家Token服务商里面,OpenRouter知名度固然最高,但模式上最轻,不碰算力、不碰推理加速,只做路由和计费,从Token分发中抽佣5-5.5%。相比之下,另外三家代表厂商真实承担GPU成本,更代表这条路线的未来发展趋势。

Fireworks目前处于阶段性领先地位,其最核心的优势在于自研推理引擎FireAttention。根据公开评测,FireAttention在FP8精度下的Token吞吐比开源方案vLLM高出5.6倍,连续批处理情境下,可以将GPU利用率从40%拉到85%。

除了技术能力,Fireworks业务模式同样具有独特之处。

第一,它使用多云算力调度,而且不买卡、不建Token工厂。Fireworks算力池连接了AWS、Azure在内8家以上算力供应商,并且与NVIDIA、AMD等芯片厂商认证的AI原生推理云深度合作,直接获取最新的算力资源。

第二,它的Token量构成特殊,绝大部分来自企业客户专用的定制模型,而非开源模型的旗舰版本或者Flash版本。根据公开披露的数据,Fireworks今年7月份每日处理Token量超过40万亿,其中95%来自定制模型。定制模型的推理加速需要额外研发适配成本,因此企业客户替换Fireworks的成本高,长期客户黏性强。

第三,它提供的生产级系统工程,包含多租户调度、稳定性、合规等企业级要求,都是开源模型及生态无法提供的,这进一步加强了客户粘性。

基于上述分析可以看到,MaaS路线的竞争在于推理加速技术,但并非仅仅针对全尺寸的开源模型做推理加速。由于开源社区技术迭代速度快,自研推理引擎的优化效果会随着时间拉伸被开源生态追平。但如果是基于客户专用的定制模型推理加速,需要深度绑定客户模型,这才是真正的壁垒所在。

MaaS路线里的另外两家,Baseten和Together AI,做的事情与Fireworks大同小异,侧重点稍有差异。Baseten更偏向为企业AI应用做模型部署和弹性伸缩,通过将GPU池化成一个弹性池,为超100家企业客户提供波峰波谷不同时段的弹性算力服务。Together AI业务模式和国内的Token工厂更为接近,基于覆盖推理、训练的GPU集群,聚合200多个开源模型,并且正在从租赁GPU走向自建AIDC。

这三家毛利率总体处在50%左右,自建算力的Together AI稍低5个百分点。自建算力的GPU利用率在早期比较低,预计这是影响当前Together AI毛利率的主要原因。

2.2 芯片路线

另一类公司为了极致优化推理效果,选择了自研芯片的路线。同时,自研芯片可以改善成本结构,进而重塑Token服务的财务模型。这条路线上有三家代表公司,Groq、SambaNova和Cerebras。

表2:海外Token市场芯片路线代表厂商

三家创业公司都完成了芯片从零开始的研发与生产,这说明推理芯片的研发门槛确实下降了,但三家厂商目前的发展情况差异很大。

Groq的芯片业务于2025年12月被英伟达以200亿美元收购,包括芯片的技术授权和团队收编,其LPU芯片已经进入英伟达新一代Vera Rubin平台,成为生态里的一个组件。

SambaNova则绑定了英特尔,2026年7月完成10亿美元融资,年收入规模维持在亿美元级别,尚未快速起量。

Cerebras是三家里唯一走到IPO的,2026年5月在纳斯达克上市,IPO发行价185美元,目前价格略高于发行价,市值在500亿美元附近徘徊。

鉴于Cerebras是唯一未被芯片大厂锁定的独立厂商,爱分析选择其作为芯片路线的标杆进行研究。

Cerebras的芯片是晶圆级引擎(WSE,Wafer-Scale Engine),就是将整片晶圆做成一颗芯片。传统芯片制造过程,是将一片晶圆切割成上百个独立的小芯片,再通过电路板把它们连接起来。而WSE不进行切割,把完整晶圆作为一个超级大芯片来设计和使用。

如此设计的优势有三点。第一,海量核心,单一芯片可以集成几十万个专门用于AI计算的核心。第二,超高带宽,拥有超大容量的片上存储,数据读写速度极快。第三,延迟降低,所有计算核心都在同一片硅片上通信,省去了不同芯片之间传输数据的延迟,大幅提升了AI的训练与推理速度。

基于上述三点,模型推理的速度得到极致增强。根据公开数据披露,同样参数的模型,Cerebras的推理速度是英伟达10x以上。

在商业模式上,Cerebras也有两个特点。第一,它既卖硬件芯片,也卖自建算力的MaaS云服务,目前收入中硬件收入约占七成,MaaS服务约占三成。卖芯片收入起量快,在上一节的MaaS路线厂商还在讲ARR破10亿美元时,Cerebras今年的营业收入就有望突破10亿美元。

第二,Cerebras锁定了超大客户,从而保证其长期能够独立生存。2025年收入中,Cerebras前两大客户贡献占比86%。今年1月,OpenAI与Cerebras签署了超过200亿美元的长期协议,同时还提供10亿美元贷款,并且还拿到了行权后持股接近10%的认股权证,所以OpenAI同时是Cerebras的客户、债主和潜在股东。

这也是Cerebras发展比另外两家强的地方。在IPO之前,软银控股的ARM也曾计划收购Cerebras,但正是由于OpenAI等超级大客户的充分认可与支持,Cerebras得以独立发展。如果没有这些客户支持,Cerebras也难免步Groq和SambaNova后尘,被芯片巨头收编。

2.3 两条路线对比

把MaaS和芯片这两条路线放在一起,最直观的差异在于毛利率。

MaaS路线厂商毛利率在45-50%之间,芯片路线Cerebras却只有39%,不仅只有英伟达一半的毛利率,更是低于不碰芯片的Token服务商。

细拆来看,Cerebras芯片部分毛利率可提升空间并不大。2025年至今,芯片业务毛利率始终维持在40%出头的水平,与收入规模增长的关联度不高。目前,Cerebras的毛利率和英特尔处于同一水平线,长期看也很难追平AMD的50%+毛利率水平。

表3:Cerebras毛利率变化情况

但是,Cerebras MaaS服务毛利率非常值得期待。其毛利率在2026年发生质变,Q1达到53%,相比2025年几乎翻番。Q2下滑至41%,也是由于为了交付OpenAI的推理算力,不得不向已售客户溢价回租了算力资源,导致毛利率短期回落。

将芯片路线厂商的MaaS毛利率,与MaaS路线代表厂商进行对比可以发现,自研芯片的财务结构确实更为出色。Cerebras官方预期其长期毛利率将超过60%,因此Cerebras虽然起家于推理芯片,但未来更值得期待的无疑是MaaS服务。

3. Token服务毛利率

海外Token服务商毛利率可以做到50%以上,那么这套模式搬到中国后,国内Token服务商能拿到多少毛利呢?

基于爱分析调研,国内的第三方Token服务商毛利率普遍在20%以下,甚至由于价格战、算力价格波动等影响,出现负毛利率现象。这个反差背后,主要原因在于中美Token服务商的服务对象不同,导致定价权差异极大。

3.1 定价权差异

根据爱分析研究,海外MaaS毛利率高,主要是因为服务企业客户,手握Token定价权。

首先,海外MaaS路线服务的核心客户是AI原生应用以及大型SaaS应用,模型厂商并不是它们的核心客户。

以Fireworks为例,其AI原生应用大客户包括Cursor、Perplexity;SaaS大客户如Notion、Shopify等。Baseten的大客户同样包括Cursor、Notion,此外还有医疗垂直领域的AI应用Abridge、OpenEvidence等。

其次,海外Token服务商将推理服务的定价标准,牢牢掌握在自身手中。

海外企业客户选择开源或者专属模型的主要原因,是闭源模型价格太贵,以及担心数据被闭源模型用于训练。

针对价格部分,由于开源模型与闭源模型能力差距并不大,只要不是高度复杂场景,两者效果近似。因此,Token服务商的收费只要比闭源模型便宜,就对于企业客户极具吸引力。

针对数据主权部分,企业客户采购模型原厂提供的Token服务,会担心其数据被用于训练。而第三方Token服务商不自训模型,这是企业客户优选中立服务商,而非模型原厂的原因。

基于上述两点,海外Token服务商定价并不是锚定开源模型的刊例价,而是只要比闭源模型低即可。正是由于手握定价权,海外第一梯队Token服务商的毛利率基本都处于50%的级别。

国内的定价权机制则刚好相反。国内Token服务商的第一大客户往往是模型厂商,而非企业客户。模型厂商作为Token集采方,一般以刊例价3-5折的价格采购Token产能,再以7-9折批发或零售。而Token服务商的生产成本往往是刊例价的4折左右,因此毛利率极低,甚至出现倒挂现象。

在这种机制下,定价权握在模型厂商手中,Token服务商没有自主定价的空间。根据爱分析调研,国内服务模型厂商集采的Token工厂,毛利率普遍只有5-6%,是海外的1/10。

通过对比国内外情况,可以看到Token定价权在终端企业和模型厂商之间滑动,Token服务商能留下多少,取决于离哪一端更近。越靠近终端企业,定价权越强,毛利率越高。

3.2 国内Token服务商的选择

选择服务模型厂商的Token工厂模式,不但毛利率很低,而且要自持算力,那国内Token服务商为何不选择服务企业客户呢?

爱分析认为,核心原因是当前国内企业客户的需求尚未进入成熟期,需求尚未真正起量。

首先,国内推理算力供给不足,导致Token服务商和企业客户手中的算力规模并不大。

根据调研,这两类群体硬件资本开支并不高,头部的代表企业每年CapEx至多是十亿级别。企业客户如莲花味精,2023年斥资7亿元采购英伟达GPU服务器。Token服务商如并行科技,今年通过借款、与政府合资成立公司等形式购置GPU服务器,整体规模在10-20亿之间。

相比之下,为购入GPU,字节跳动举债296亿美元、阿里募资800亿港元、智谱再融资50亿美元,其获取的算力规模远远超过其他类型企业。

算力资源分配的多寡不均,导致Token服务商如果选择服务企业客户,这几年注定默默无闻,收入增速远低于行业平均增速。

以上是针对新购置的算力资源,而国内早期地方政府建设的AIDC确实有闲置的存量算力资源,但这些算力卡质量不佳,把资源批量卖给模型厂商是地方政府最顺手的变现方式。

因此,企业客户手中算力不大,Token服务商手中算力也很紧缺,导致Token服务商不得不倒向服务模型厂商。

其次,企业客户专属模型尚未起量,对于Token服务商需求不强。

海外企业客户更多会追求自身专属模型,一般是基于开源模型做微调,或者为了降低Token消耗训练契合自身业务使用的小模型。

但是国内企业客户使用模型呈现两个极端,要么追求旗舰模型,要上就必须是满血版DeepSeek;要么追求极致低算力要求,只上27B或者35B的Qwen小尺寸模型。针对前者,无论哪家Token服务商提供DeepSeek服务,都是赔本赚吆喝,毛利率极低;针对后者,其本身算力水平就很低,Token推理毫无用武之地。

当然,我们也看到,国内如LibTV等AI原生应用,已经开始训练自身使用的模型。待这些客户逐步成熟,Token服务商的需求将会迎来第二次爆发。

当前,国内还是有一批Token服务商专注于服务企业客户,典型如传统私有云厂商青云科技,Token工厂硅基流动未来也可能会更加倾向于服务私有化的企业客户。

这类Token服务商,手中缺少算力,收入体量都不大,但由于只提供推理加速服务、不提供算力,毛利率都较高。比如,硅基流动2025年本地化部署解决方案收入仅略超2600万元,毛利率超过80%。青云科技旗下青云智算2026年上半年收入约1879万元,与去年同期持平,并未进入高速增长期。

3.3 海外毛利率的未来

展望未来,海外Token服务商50%的毛利也不是稳态,正在被模型厂商从两端挤压,毛利率将进入下行区间。

一方面,闭源模型降价的趋势不可避免,海外Token服务商的定价也将随之下调,从而压低毛利率。OpenAI通过GPT-5.6 Luna将价格砍掉8成,Anthropic通过Claude Opus 5将旗舰模价格砍掉一半。Token服务商在和企业客户议价时,将面临这些低价闭源模型的强力竞争。

另一方面,开源模型厂商将逐步开始向海外Token服务商分层收费,进一步对毛利率造成影响。从Kimi K3开始,向MaaS服务商收费已成为一种趋势。公开协议中Kimi要求分成30%,根据爱分析调研,目前实际分成在10%级别,但未来分成比例只会越来越高。

海外也有一些实测数据,显示Together AI的批处理推理价格已经贴近成本价,毛利率接近为0。

综合上述分析,无论是海外还是中国,Token服务商的毛利率都处于承压状态,预计当前50%的毛利率将是整个行业天花板,长期难以维持。

4. Token服务的芯片路线

海外Token服务商做芯片这条路线已经有多年实践,并且跑出了三家创业公司。国内,无问芯穹从2024年开始就在研发端侧模型的专用推理处理器LPU。那么,国内Token服务商是否应当涉足芯片领域呢?

我们认为,这个问题可以继续拆解为:推理芯片是否有技术壁垒?推理芯片的财务模型如何?应当何时介入芯片领域?

4.1 技术壁垒

无论是海外的三家创业公司,还是国内的GPU芯片厂商,都造出了芯片,这件事充分说明GPU推理芯片没有不可逾越的技术门槛。

因此,对于Token服务商而言,如果把GPU芯片看作长期的技术护城河,将是严重误判。更合理的判断是,自研芯片对于改善Token服务的财务模型效果显著。

首先,国内芯片业务本身的毛利率就很可观,超过海外平均水平。前文分析海外市场可以看到,海外芯片市场毛利率分为3个明显的梯队。第一梯队,英伟达毛利率超过70%;第二梯队,AMD毛利率介于50-60%之间;第三梯队英特尔、Cerebras等毛利率介于40-50%之间。

而国内市场,芯片厂商毛利率普遍集中于50-60%之间,和AMD处于同一水平,相比国内MaaS不及20%的毛利率,芯片厂商这个毛利率水平更显得尤为可观。

其次,芯片业务对MaaS业务的毛利率也有改善效果。

在海外,Cerebras的MaaS毛利率已经超过50%,高于Fireworks等厂商。可以看到,自研芯片确实能够提高MaaS毛利率。因此,国内Token服务商若自研芯片,MaaS毛利率可以超过20%的天花板。

4.2 竞争格局

那么,当前是Token服务商介入自研芯片的好时机吗?爱分析认为,无论当前还是未来,第三方Token服务商都很难在自研芯片的竞争中获得一席之地。

国产推理芯片目前确实正处于高速增长的阶段,阿里平头哥出货量2026年保守预计超过100万片,较2025年增长3倍以上。

但是,目前芯片增长背后驱动力是出口管制、替代英伟达的需求,芯片厂商的能否量产出货,比拼的并非是性能,而是谁能拿到更多中芯国际产能。因此,Token服务商此时介入推理芯片研发与制造,毫无优势可言。

参考海外市场,芯片制造并不是产业瓶颈,只要能设计出高性能芯片,就能找到代工生产。因此,当国内突破芯片制造产能的限制,Token服务商就可以开始考虑自研推理芯片的设计研发。

但届时,国内芯片这条路线将面临更大的竞争对手,即阿里、字节等大厂。大厂将是真正跑通芯片加Token服务闭环的先行者,这将导致第三方Token服务商自研芯片难度倍增。

阿里的真武PPU是典型样本。它先在阿里云内部消化产能,支撑Qwen的训练和推理。随着Qwen调用量增长,迅速完成Token服务的全闭环。当前,真武PPU尚处于万卡集群,而2027年末真武PPU将实现50万卡的算力集群,相当于1GW。在如此规模的算力集群之上,Token推理成本将大幅下降,届时第三方Token服务商追赶难度极大。

除了阿里,字节也在争夺Token调用量第一的座次,其自研推理芯片SeedChip也已排上日程,计划2027年进入量产阶段。百度昆仑芯的出货量,在2025年就已经追平寒武纪,达到国产前三的水平。昆仑芯拳头产品M100已经进入小规模出货阶段,将大幅提高2026年业绩。

这三家的共同点,是先有了确定性的内部负载做基础,在摊薄芯片研发和生产成本的同时,也大幅降低了Token推理成本。

相比之下,第三方Token服务商没有这个基础负载提供底仓支撑,自研芯片将面临严重的销售难题。一旦产能利用率上不去,反而会对原有的MaaS业务造成现金流挤压。

因此,对第三方Token服务商来说是,向上游芯片延伸的方向是对的,但这条路道阻且长,投入产出比不高,还会遭遇大厂自研芯片的强烈竞争。

5. 结语

回到开篇的两个问题。

首先,中国第三方Token服务的毛利率未来会走向分化,服务终端企业的服务商能把毛利率维持在相对健康的水平,服务模型厂商的服务商则会被集采长期压在低位。

其次,Token服务商做芯片,方向是对的,自研芯片确实能改善财务模型。但对第三方Token服务商而言,很难找到好的切入时机,短期没有能力获取芯片制造产能,长期缺乏与大厂PK的Token服务闭环的能力。

对中国的Token服务商来说,方向的选择比当下的努力更重要。服务模型厂商虽然能快速起量,但手中没有定价权,收入增长质量低、毛利率低。爱分析的建议是,把重心逐步转向服务终端企业,那里有自主定价的空间,有更轻的资产结构和更稳的现金流。

长期壁垒的最终落点,回到服务什么客户这个原点。谁能更早看清这一点,谁就能在这轮格局重排里先站稳脚跟、走得更远。