ARTICLE DETAIL

资讯详情

深耕网站建设与运营推广的一线实战洞察。

爱分析发布2026年Token市场海外对标研究报告

爱分析发布2026年Token市场海外对标研究报告 大模型普及带动推理需求快速爆发Token推理服务商业价值持续凸显第三方服务商已然成为AI算力生态的重要组成部分。海内外产业发展形成显著落差海外市场已沉淀出经过验证的商业化实践国内行业却深陷算力内卷、价格厮杀、毛利率持续承压的发展困局。不少本土服务商在客户选择、业务路线、是否布局自研芯片等关键战略决策上缺少可借鉴的行业参照。基于上述背景爱分析正式发布《2026 爱分析・Token市场海外对标研究报告》。报告跳出国内市场的局部视角以海外成熟产业实践为对标样本剖析不同商业模式的得失为国内Token服务商研判赛道、制定战略提供务实参考。1、报告综述Token服务正在成为AI产业链价值分配的核心环节。向上Token服务支撑AI应用向下Token服务调用模型与算力资源。根据爱分析预测2026年全球Token市场规模将达到1350亿美元。迅速崛起的Token产业与开源模型生态使得模型原厂提供的Token服务已经无法满足市场需求从而催生了众多第三方Token服务商。过去两年第三方Token服务在海外跑出了一个相对成熟的格局市场清晰地分化出两条发展路线。一条路线提供MaaS服务做算力调度和推理性能优化一条路线自研推理芯片重新定义推理服务的成本结构。而中国市场当前正在重走这个过程路途中荆棘遍地。为此爱分析这份报告通过海外市场的对标研究回答两个核心问题第一Token服务的毛利率未来将会如何变化第二第三方Token服务商做芯片这个命题是否成立。我们的核心判断有三层。第一层Token服务包含两门生意服务终端企业和服务模型厂商。两者看起来都在卖算力和推理能力但财务模型完全不同。服务企业能自主定价、毛利高且自持算力资产较轻对于现金流压力小服务模型厂商缺少话语权、毛利被集采压到个位数而且需要自持的资产比例也更高现金流岌岌可危。第二层国内的Token服务商过于偏向服务模型未来应当逐步重视服务终端企业这条路。当前国内诸多的Token工厂、算力运营商都扎堆在服务模型这条路上反观服务企业这条路由于收入起量慢少有人走。但是在海外服务企业才是主流趋势这是国内Token行业最大的认知偏差。第三层Token服务向上游芯片延伸方向是对的但当下不是好时机投入产出比低。未来如果模型大厂率先跑通自研芯片加Token服务的闭环第三方服务商入局芯片的机会将进一步收窄。本报告后续内容分三部分展开第二章研究海外Token市场的格局剖析MaaS和芯片两条路线如何分化与演进第三章分析Token服务商未来的毛利率变化趋势第四章回答芯片路线是否适合中国的Token服务商。2、海外Token市场全球Token市场规模今年迎来了爆炸式增长。爱分析测算包含模型原厂提供的Token服务在内全球Token市场规模从2025年的240亿美元迅速攀升到2026年的1350亿美元增速超过460%。此前Gartner曾预测2030年GenAI Models的市场规模为1390亿美元未曾想这个数字2026年就已经实现。图1全球Token市场规模伴随市场爆发第三方Token服务商在海外也已经跑出了领先的第一梯队。这个梯队玩家的发展逻辑并不相同逐步分化成了MaaS和芯片两条路线彼此的技术壁垒与商业模式也差别很大。2.1 MaaS路线第一条是MaaS路线代表厂商是Fireworks。这类厂商多出自于模型厂商的AI Infra团队擅长在英伟达GPU上做模型推理的调度与优化。比如Fireworks创始团队来自Meta PyTorch的整建制班底在GPU优化和高并发架构方面拥有极深的积淀。MaaS路线厂商的核心工作是两件事把开源模型的推理成本压下来以及把弹性算力调度做稳。这条路线上海外已经跑出了多家规模化公司ARR在从10亿美元向20亿美元冲刺。表1海外Token市场MaaS路线代表厂商上述四家Token服务商里面OpenRouter知名度固然最高但模式上最轻不碰算力、不碰推理加速只做路由和计费从Token分发中抽佣5-5.5%。相比之下另外三家代表厂商真实承担GPU成本更代表这条路线的未来发展趋势。Fireworks目前处于阶段性领先地位其最核心的优势在于自研推理引擎FireAttention。根据公开评测FireAttention在FP8精度下的Token吞吐比开源方案vLLM高出5.6倍连续批处理情境下可以将GPU利用率从40%拉到85%。除了技术能力Fireworks业务模式同样具有独特之处。第一它使用多云算力调度而且不买卡、不建Token工厂。Fireworks算力池连接了AWS、Azure在内8家以上算力供应商并且与NVIDIA、AMD等芯片厂商认证的AI原生推理云深度合作直接获取最新的算力资源。第二它的Token量构成特殊绝大部分来自企业客户专用的定制模型而非开源模型的旗舰版本或者Flash版本。根据公开披露的数据Fireworks今年7月份每日处理Token量超过40万亿其中95%来自定制模型。定制模型的推理加速需要额外研发适配成本因此企业客户替换Fireworks的成本高长期客户黏性强。第三它提供的生产级系统工程包含多租户调度、稳定性、合规等企业级要求都是开源模型及生态无法提供的这进一步加强了客户粘性。基于上述分析可以看到MaaS路线的竞争在于推理加速技术但并非仅仅针对全尺寸的开源模型做推理加速。由于开源社区技术迭代速度快自研推理引擎的优化效果会随着时间拉伸被开源生态追平。但如果是基于客户专用的定制模型推理加速需要深度绑定客户模型这才是真正的壁垒所在。MaaS路线里的另外两家Baseten和Together AI做的事情与Fireworks大同小异侧重点稍有差异。Baseten更偏向为企业AI应用做模型部署和弹性伸缩通过将GPU池化成一个弹性池为超100家企业客户提供波峰波谷不同时段的弹性算力服务。Together AI业务模式和国内的Token工厂更为接近基于覆盖推理、训练的GPU集群聚合200多个开源模型并且正在从租赁GPU走向自建AIDC。这三家毛利率总体处在50%左右自建算力的Together AI稍低5个百分点。自建算力的GPU利用率在早期比较低预计这是影响当前Together AI毛利率的主要原因。2.2 芯片路线另一类公司为了极致优化推理效果选择了自研芯片的路线。同时自研芯片可以改善成本结构进而重塑Token服务的财务模型。这条路线上有三家代表公司Groq、SambaNova和Cerebras。表2海外Token市场芯片路线代表厂商三家创业公司都完成了芯片从零开始的研发与生产这说明推理芯片的研发门槛确实下降了但三家厂商目前的发展情况差异很大。Groq的芯片业务于2025年12月被英伟达以200亿美元收购包括芯片的技术授权和团队收编其LPU芯片已经进入英伟达新一代Vera Rubin平台成为生态里的一个组件。SambaNova则绑定了英特尔2026年7月完成10亿美元融资年收入规模维持在亿美元级别尚未快速起量。Cerebras是三家里唯一走到IPO的2026年5月在纳斯达克上市IPO发行价185美元目前价格略高于发行价市值在500亿美元附近徘徊。鉴于Cerebras是唯一未被芯片大厂锁定的独立厂商爱分析选择其作为芯片路线的标杆进行研究。Cerebras的芯片是晶圆级引擎WSEWafer-Scale Engine就是将整片晶圆做成一颗芯片。传统芯片制造过程是将一片晶圆切割成上百个独立的小芯片再通过电路板把它们连接起来。而WSE不进行切割把完整晶圆作为一个超级大芯片来设计和使用。如此设计的优势有三点。第一海量核心单一芯片可以集成几十万个专门用于AI计算的核心。第二超高带宽拥有超大容量的片上存储数据读写速度极快。第三延迟降低所有计算核心都在同一片硅片上通信省去了不同芯片之间传输数据的延迟大幅提升了AI的训练与推理速度。基于上述三点模型推理的速度得到极致增强。根据公开数据披露同样参数的模型Cerebras的推理速度是英伟达10x以上。在商业模式上Cerebras也有两个特点。第一它既卖硬件芯片也卖自建算力的MaaS云服务目前收入中硬件收入约占七成MaaS服务约占三成。卖芯片收入起量快在上一节的MaaS路线厂商还在讲ARR破10亿美元时Cerebras今年的营业收入就有望突破10亿美元。第二Cerebras锁定了超大客户从而保证其长期能够独立生存。2025年收入中Cerebras前两大客户贡献占比86%。今年1月OpenAI与Cerebras签署了超过200亿美元的长期协议同时还提供10亿美元贷款并且还拿到了行权后持股接近10%的认股权证所以OpenAI同时是Cerebras的客户、债主和潜在股东。这也是Cerebras发展比另外两家强的地方。在IPO之前软银控股的ARM也曾计划收购Cerebras但正是由于OpenAI等超级大客户的充分认可与支持Cerebras得以独立发展。如果没有这些客户支持Cerebras也难免步Groq和SambaNova后尘被芯片巨头收编。2.3 两条路线对比把MaaS和芯片这两条路线放在一起最直观的差异在于毛利率。MaaS路线厂商毛利率在45-50%之间芯片路线Cerebras却只有39%不仅只有英伟达一半的毛利率更是低于不碰芯片的Token服务商。细拆来看Cerebras芯片部分毛利率可提升空间并不大。2025年至今芯片业务毛利率始终维持在40%出头的水平与收入规模增长的关联度不高。目前Cerebras的毛利率和英特尔处于同一水平线长期看也很难追平AMD的50%毛利率水平。表3Cerebras毛利率变化情况但是Cerebras MaaS服务毛利率非常值得期待。其毛利率在2026年发生质变Q1达到53%相比2025年几乎翻番。Q2下滑至41%也是由于为了交付OpenAI的推理算力不得不向已售客户溢价回租了算力资源导致毛利率短期回落。将芯片路线厂商的MaaS毛利率与MaaS路线代表厂商进行对比可以发现自研芯片的财务结构确实更为出色。Cerebras官方预期其长期毛利率将超过60%因此Cerebras虽然起家于推理芯片但未来更值得期待的无疑是MaaS服务。3、Token服务毛利率海外Token服务商毛利率可以做到50%以上那么这套模式搬到中国后国内Token服务商能拿到多少毛利呢基于爱分析调研国内的第三方Token服务商毛利率普遍在20%以下甚至由于价格战、算力价格波动等影响出现负毛利率现象。这个反差背后主要原因在于中美Token服务商的服务对象不同导致定价权差异极大。3.1 定价权差异根据爱分析研究海外MaaS毛利率高主要是因为服务企业客户手握Token定价权。首先海外MaaS路线服务的核心客户是AI原生应用以及大型SaaS应用模型厂商并不是它们的核心客户。以Fireworks为例其AI原生应用大客户包括Cursor、PerplexitySaaS大客户如Notion、Shopify等。Baseten的大客户同样包括Cursor、Notion此外还有医疗垂直领域的AI应用Abridge、OpenEvidence等。其次海外Token服务商将推理服务的定价标准牢牢掌握在自身手中。海外企业客户选择开源或者专属模型的主要原因是闭源模型价格太贵以及担心数据被闭源模型用于训练。针对价格部分由于开源模型与闭源模型能力差距并不大只要不是高度复杂场景两者效果近似。因此Token服务商的收费只要比闭源模型便宜就对于企业客户极具吸引力。针对数据主权部分企业客户采购模型原厂提供的Token服务会担心其数据被用于训练。而第三方Token服务商不自训模型这是企业客户优选中立服务商而非模型原厂的原因。基于上述两点海外Token服务商定价并不是锚定开源模型的刊例价而是只要比闭源模型低即可。正是由于手握定价权海外第一梯队Token服务商的毛利率基本都处于50%的级别。国内的定价权机制则刚好相反。国内Token服务商的第一大客户往往是模型厂商而非企业客户。模型厂商作为Token集采方一般以刊例价3-5折的价格采购Token产能再以7-9折批发或零售。而Token服务商的生产成本往往是刊例价的4折左右因此毛利率极低甚至出现倒挂现象。在这种机制下定价权握在模型厂商手中Token服务商没有自主定价的空间。根据爱分析调研国内服务模型厂商集采的Token工厂毛利率普遍只有5-6%是海外的1/10。通过对比国内外情况可以看到Token定价权在终端企业和模型厂商之间滑动Token服务商能留下多少取决于离哪一端更近。越靠近终端企业定价权越强毛利率越高。3.2 国内Token服务商的选择选择服务模型厂商的Token工厂模式不但毛利率很低而且要自持算力那国内Token服务商为何不选择服务企业客户呢爱分析认为核心原因是当前国内企业客户的需求尚未进入成熟期需求尚未真正起量。首先国内推理算力供给不足导致Token服务商和企业客户手中的算力规模并不大。根据调研这两类群体硬件资本开支并不高头部的代表企业每年CapEx至多是十亿级别。企业客户如莲花味精2023年斥资7亿元采购英伟达GPU服务器。Token服务商如并行科技今年通过借款、与政府合资成立公司等形式购置GPU服务器整体规模在10-20亿之间。相比之下为购入GPU字节跳动举债296亿美元、阿里募资800亿港元、智谱再融资50亿美元其获取的算力规模远远超过其他类型企业。算力资源分配的多寡不均导致Token服务商如果选择服务企业客户这几年注定默默无闻收入增速远低于行业平均增速。以上是针对新购置的算力资源而国内早期地方政府建设的AIDC确实有闲置的存量算力资源但这些算力卡质量不佳把资源批量卖给模型厂商是地方政府最顺手的变现方式。因此企业客户手中算力不大Token服务商手中算力也很紧缺导致Token服务商不得不倒向服务模型厂商。其次企业客户专属模型尚未起量对于Token服务商需求不强。海外企业客户更多会追求自身专属模型一般是基于开源模型做微调或者为了降低Token消耗训练契合自身业务使用的小模型。但是国内企业客户使用模型呈现两个极端要么追求旗舰模型要上就必须是满血版DeepSeek要么追求极致低算力要求只上27B或者35B的Qwen小尺寸模型。针对前者无论哪家Token服务商提供DeepSeek服务都是赔本赚吆喝毛利率极低针对后者其本身算力水平就很低Token推理毫无用武之地。当然我们也看到国内如LibTV等AI原生应用已经开始训练自身使用的模型。待这些客户逐步成熟Token服务商的需求将会迎来第二次爆发。当前国内还是有一批Token服务商专注于服务企业客户典型如传统私有云厂商青云科技Token工厂硅基流动未来也可能会更加倾向于服务私有化的企业客户。这类Token服务商手中缺少算力收入体量都不大但由于只提供推理加速服务、不提供算力毛利率都较高。比如硅基流动2025年本地化部署解决方案收入仅略超2600万元毛利率超过80%。青云科技旗下青云智算2026年上半年收入约1879万元与去年同期持平并未进入高速增长期。3.3 海外毛利率的未来展望未来海外Token服务商50%的毛利也不是稳态正在被模型厂商从两端挤压毛利率将进入下行区间。一方面闭源模型降价的趋势不可避免海外Token服务商的定价也将随之下调从而压低毛利率。OpenAI通过GPT-5.6 Luna将价格砍掉8成Anthropic通过Claude Opus 5将旗舰模价格砍掉一半。Token服务商在和企业客户议价时将面临这些低价闭源模型的强力竞争。另一方面开源模型厂商将逐步开始向海外Token服务商分层收费进一步对毛利率造成影响。从Kimi K3开始向MaaS服务商收费已成为一种趋势。公开协议中Kimi要求分成30%根据爱分析调研目前实际分成在10%级别但未来分成比例只会越来越高。海外也有一些实测数据显示Together AI的批处理推理价格已经贴近成本价毛利率接近为0。综合上述分析无论是海外还是中国Token服务商的毛利率都处于承压状态预计当前50%的毛利率将是整个行业天花板长期难以维持。4、Token服务的芯片路线海外Token服务商做芯片这条路线已经有多年实践并且跑出了三家创业公司。国内无问芯穹从2024年开始就在研发端侧模型的专用推理处理器LPU。那么国内Token服务商是否应当涉足芯片领域呢我们认为这个问题可以继续拆解为推理芯片是否有技术壁垒推理芯片的财务模型如何应当何时介入芯片领域4.1 技术壁垒无论是海外的三家创业公司还是国内的GPU芯片厂商都造出了芯片这件事充分说明GPU推理芯片没有不可逾越的技术门槛。因此对于Token服务商而言如果把GPU芯片看作长期的技术护城河将是严重误判。更合理的判断是自研芯片对于改善Token服务的财务模型效果显著。首先国内芯片业务本身的毛利率就很可观超过海外平均水平。前文分析海外市场可以看到海外芯片市场毛利率分为3个明显的梯队。第一梯队英伟达毛利率超过70%第二梯队AMD毛利率介于50-60%之间第三梯队英特尔、Cerebras等毛利率介于40-50%之间。而国内市场芯片厂商毛利率普遍集中于50-60%之间和AMD处于同一水平相比国内MaaS不及20%的毛利率芯片厂商这个毛利率水平更显得尤为可观。其次芯片业务对MaaS业务的毛利率也有改善效果。在海外Cerebras的MaaS毛利率已经超过50%高于Fireworks等厂商。可以看到自研芯片确实能够提高MaaS毛利率。因此国内Token服务商若自研芯片MaaS毛利率可以超过20%的天花板。4.2 竞争格局那么当前是Token服务商介入自研芯片的好时机吗爱分析认为无论当前还是未来第三方Token服务商都很难在自研芯片的竞争中获得一席之地。国产推理芯片目前确实正处于高速增长的阶段阿里平头哥出货量2026年保守预计超过100万片较2025年增长3倍以上。但是目前芯片增长背后驱动力是出口管制、替代英伟达的需求芯片厂商的能否量产出货比拼的并非是性能而是谁能拿到更多中芯国际产能。因此Token服务商此时介入推理芯片研发与制造毫无优势可言。参考海外市场芯片制造并不是产业瓶颈只要能设计出高性能芯片就能找到代工生产。因此当国内突破芯片制造产能的限制Token服务商就可以开始考虑自研推理芯片的设计研发。但届时国内芯片这条路线将面临更大的竞争对手即阿里、字节等大厂。大厂将是真正跑通芯片加Token服务闭环的先行者这将导致第三方Token服务商自研芯片难度倍增。阿里的真武PPU是典型样本。它先在阿里云内部消化产能支撑Qwen的训练和推理。随着Qwen调用量增长迅速完成Token服务的全闭环。当前真武PPU尚处于万卡集群而2027年末真武PPU将实现50万卡的算力集群相当于1GW。在如此规模的算力集群之上Token推理成本将大幅下降届时第三方Token服务商追赶难度极大。除了阿里字节也在争夺Token调用量第一的座次其自研推理芯片SeedChip也已排上日程计划2027年进入量产阶段。百度昆仑芯的出货量在2025年就已经追平寒武纪达到国产前三的水平。昆仑芯拳头产品M100已经进入小规模出货阶段将大幅提高2026年业绩。这三家的共同点是先有了确定性的内部负载做基础在摊薄芯片研发和生产成本的同时也大幅降低了Token推理成本。相比之下第三方Token服务商没有这个基础负载提供底仓支撑自研芯片将面临严重的销售难题。一旦产能利用率上不去反而会对原有的MaaS业务造成现金流挤压。因此对第三方Token服务商来说是向上游芯片延伸的方向是对的但这条路道阻且长投入产出比不高还会遭遇大厂自研芯片的强烈竞争。5、结语回到开篇的两个问题。首先中国第三方Token服务的毛利率未来会走向分化服务终端企业的服务商能把毛利率维持在相对健康的水平服务模型厂商的服务商则会被集采长期压在低位。其次Token服务商做芯片方向是对的自研芯片确实能改善财务模型。但对第三方Token服务商而言很难找到好的切入时机短期没有能力获取芯片制造产能长期缺乏与大厂PK的Token服务闭环的能力。对中国的Token服务商来说方向的选择比当下的努力更重要。服务模型厂商虽然能快速起量但手中没有定价权收入增长质量低、毛利率低。爱分析的建议是把重心逐步转向服务终端企业那里有自主定价的空间有更轻的资产结构和更稳的现金流。长期壁垒的最终落点回到服务什么客户这个原点。谁能更早看清这一点谁就能在这轮格局重排里先站稳脚跟、走得更远。
返回列表