【SMM分析】货难抢 价难讲 利难涨:算力租赁的瓶颈与Token工厂的两难

来源:SMM

Token工厂回本11个月,英伟达设备换代12个月,回本周期追平技术有效期。今年下半年,传统算力租赁在货源、价格与验证三端同时受阻。需求侧的变化更结构性:头部企业把算力建在自己账上,按边际成本报价、第三方投建企业的库存则全部被租用。Token工厂以"元/Token"替代"元/台·月",绕开设备涨价与成本基准两道难题;投建国产算力退役设备缺乏交易平台与残值定价。SMM认为这是风险重构,而非效率改进。

一、瓶颈|三重失速,与需求侧的分流

2026年下半年,按月、按年出租服务器的投建模式在三个环节同时遇到阻力:拿不到货、定不了价、验不了单。

货源端。 英伟达高端产品的整机交付周期已拉长至8—12周,更上游的制约在显存,下一代平台所需的更高堆叠规格尚无通过验证的量产方案。国产一侧同样不宽裕,某算力租赁投建企业向SMM反馈,昇腾910系列服务器供应正逐渐紧张。

价格端。 压力主要来自组件而非整机。SMM采集的渠道报价显示,64GB DDR5 6400在300条批量下报16900元/条、128GB DDR5 6400在200条批量下报29800元/条,折合单GB约264元与233元。涨价根源是产能分配而非普通稀缺:HBM在DRAM晶圆产能中的占比已从2020年的2%升至2026年的约25%,一片HBM晶圆要消耗约三片DDR5的产能;三家主要存储厂商集中度超过95%,并将七成以上先进产能分配给HBM,2026年一季度DRAM合约价环比上涨93%—98%。

验证端。 9月初有Pro 6000的32台现货规模与当天出现的32台租单规模曾出现高度重合,报价与现货的对应关系难以交叉验证。

三个环节的困难,都可以归结为"货"的问题。但同期发生的另一件事,问题出在"客"上——需求侧正在分流,而流向不是第三方投建企业。

截至2026年上半年,乌兰察布已签约数据中心项目89个、算力规模16.5万P、占全国8.7%,智能算力占比超九成,投运及在建项目39个。近月披露的两个新增计划指向同一个方向-大型人工智能企业自己建设算力基础设施。

字节跳动在乌兰察布规划1GW的AIDC集群,据公开报道总投资约700亿元、规划算力20万P,2026年5月开工;2026年9月又提出新增5—6GW算力(《南华早报》报道)。支撑这一轮扩张的,是一笔296亿美元、创下中企境外贷款最低利差的银团贷款。

DeepSeek据彭博社2026年7月报道,计划在乌兰察布自建约1GW计算容量,同时"从其他公司租赁额外算力",部分容量争取2027年底或2028年初上线。

两家企业的共同点,是算力不再向第三方租,而是建在自己账上。更直接的挤压来自供给的出口:这类自建集群的算力并非全部自用,据公开规划同时向第三方开放算力服务。新增供给因此不再经过第三方投建企业这一环,而是直接进入市场。

二、机制|为什么会同时发生

(一)自建与转租,成本基准不在同一层。

大厂自建机房的基建、电力与硬件折旧多已计入既有研发成本。当它把闲置资源对外出租时,边际成本接近于电费本身;而第三方投建企业的成本基准是完整的——采购价、回收期、融资成本,逐项都要在租金里收回来。

风险结构更关键:自建项目的算力有自身业务保底,外租是"补充供给";第三方的全部库存待售,上架率直接决定成本能否覆盖。同一个项目,一方是补充,一方是全部。 行业分化的方向由此确定:高端训练与政企需求流向头部云与运营商体系,第三方承接的多是中小客户与零散推理订单。

这与此前记录的国产算力"双轨制"是同一种结构:差异不在议价能力,在成本基准。 自建方同样有约束:行业机构测算显示,国内高端智算仍存在约35%的缺口,而存量智算中心的GPU平均利用率不足30%——自建方能承受这种错配,因为它有业务托底;第三方不能,因为它没有。

(二)前两个前提:设备价要能锁住,成本基准要唯一。

第一重来自英伟达的架构节奏。传统算力投建的定价靠一个简单反推:月租×租期≈采购价——SMM此前记录过一例,H200月租13万元×36个月,与实际采购价约460万元几乎吻合。这个反推成立的前提是设备价格稳定,而架构节奏已由两年一代改为一年一代:下一代Vera Rubin自2026年6月进入量产、合作方系统于下半年陆续可用。使用32台先进算力部署Token工厂回本需要11个月,但设备换代只隔12个月。

第二重来自国产算力一侧。昇腾910B2八卡整机的民营渠道价约120万元,按3年租期做成本法测算,报出月租3.5万元/台·月、可接受下限2.9万元;同期运营商体系同类资源的代表性报价在2万元/台·月上下。差距在成本线:运营商一侧按集采价约100万元、10年折旧测算,全成本约1.32万元/台·月;投建企业一侧按3年回收、8%—12%融资成本测算,全成本4.66万—4.90万元/台·月——两条成本线相差约3.5倍,而报价层面的落差只有1.45—1.75倍。 差额中折旧与资金成本合计占约95%,电费与运维不到10%。

(三)第三个前提|国产设备要能退出去。

成本法"采购价÷租期"隐含一个假设:租期结束时残值为零。这个假设对两侧的含义恰好相反。

英伟达一侧,残值有可观察的价格曲线:9月8日H20 96GB使用2年的二手八卡服务器在回收商处出售报价单台192万共12台机器,同型号全新H20单台240万元。二手设备价格显著高于传统IT设备——后者两年通常折损三到五成。 国内流转同样活跃,SMM此前记录过约20台高端算力八卡服务器准现货两三天售罄;配套维保也已是独立生意,2025年全球GPU维修市场规模约85亿美元、中国占约三分之一。

能被修复、能被验证的卡才卖得出去,维修能力本身就是残值的组成部分。

国产一侧,这个前提尚未成立。昇腾、燧原、壁仞等退役设备缺乏公开交易平台与价格发现机制,买方难以判断其实际性能、剩余寿命与适配成本。这不是暂时的信息不对称,而是技术路线验证期的结构性特征:软件栈仍在迭代、架构路径尚未收敛,跨代迁移尚无案例支撑,也没有可参考的折旧曲线。

两个相反的结论由此产生。 国产投建若设备退不出去,全部采购成本都必须靠租金收回,融资方又因残值缺乏历史参考而抬高折价,前述8%—12%的融资成本,一部分根源正在这里;反过来看,国产单卡价格虽低,但因退不出去,三年期的真实持有成本未必更低——它缺的未必是性能,而是一套能让设备在退役时被定价和流转的机制。

三个前提合起来看:设备价锁不住、成本基准不唯一、退出残值估不出——"按时间计价"在三处同时失去支撑。

三、对照|Token工厂:把计价单位从"时间"换成"产出"

Token工厂的定义并不复杂:在算力集群上部署开源权重的大模型,通过MaaS平台以API对外交付,按Token计量计费。它与投建模式最本质的区别不在技术,在计价单位——投建模式卖"产能的使用权"(元/台·月),Token工厂卖"产出的量"(元/Token)。

优势一:计价单位一换,设备价与成本基准两道难题同时绕开。 不锁设备价——合约锁的是产出价格,设备涨价由资产方承担、涨价红利也归资产方;不碰体系价——Token面向最终调用方定价,不与另一套成本基准的算力报价正面比较。

优势二:模型层高度同质,壁垒因此落在推理效率上。 某海外算力服务商2026年8月上线Token工厂时披露的首批清单是DeepSeek、GLM、Kimi、Qwen四款开源模型族,国内各MaaS平台上架清单与之一致;2026年9月7—13日全球周调用量127万亿Token,中国模型占61.17万亿、连续20周居首。模型开源、可下载、可替换,意味着工厂的壁垒不在"上架了多少模型",而在每瓦能产出多少Token。 但有两个隐性门槛需要提前计入:一是许可,2026年7—8月起Kimi K3、Qwen3.8-Max、GLM-5.3等模型改用自定义许可,附带营收门槛或安全审查条件,权重可免费下载不等于可免费商用;二是国产卡适配,昇腾生态需要完成CANN适配,权重自由不等于即插即用

优势三:账可以算。 行业交流口径显示,一台搭载英伟达高端产品的八卡服务器以长协获取,月成本约29万元;较高利用率下有效月产能约450亿—550亿Token,售价每百万Token 6元时月收入约27万—33万元、基本贴在成本线,10元时月毛利可达7万—26万元。一套32台规模的集群按八卡整机自购测算,投入约在1.3亿—1.5亿元量级;要在11个月内回收,月收入需达到1200万—1400万元,对应的是约每百万Token 9元的售价,外加90%以上的利用率。财务侧亦印证:某从算力租赁转向按Token用量计费的服务商,2026年半年报营业收入2.54亿元、同比增长497.11%。国家数据局披露,2026年3月全国日均Token调用量突破140万亿次。

四、边界|账算得过来,钱未必愿意进来

其一,11个月这个数字需要补上前提。 另一组对照是:约100万元的设备部署开源模型,90%以上利用率下年销售额约50万—60万元、约两年回本,利用率降至70%则约三年;而行业现实利用率普遍在50%—70%,多数项目实际毛利率落在25%—45%区间。11个月是乐观场景的测算结果,不是行业的普遍实现值。

其二,资方的迟疑集中在三条,且都不是"不看好需求"。 一是继任者已经在路上——架构一年一代,回本期内必然遇到替代品,资方要判断的不是"这台设备能不能赚钱",而是"它能不能在被换代之前把钱赚回来";二是供应链仍在收紧,整机交付周期8—12周,国内一侧又受制于先进制程代工受限与HBM供应紧张,在一个连交付时间都无法锁定的市场里,11个月的回本模型连起点都不成立;三是模型换代与适配时间的错配——新模型从发布到跑出成本优势,需要完成推理引擎支持、并行切分与量化方案的全套调优,这个周期可能长于模型的领先周期,调优成本尚未摊完,下一代已经发布。

其三,转向Token并不是进入无人区。 运营商同时握有低成本算力、现成的计费收缴体系与政企渠道,并已在零售Token套餐。投建企业转向按Token交付,等于进入对手的强项——它能守住的,只有推理效率这一个变量。若大厂自建的算力进一步外溢为Token供给,边际成本的优势会一并平移过来。

其四,Token工厂没有绕开硬件。 风险并未消失,只是换了位置——投建模式的风险在闲置率与折旧,Token工厂的风险在每瓦Token效率与售价,折旧依然刚性。此外,同一模型交付出来的Token完全同质,但用于药物研发与用于日常闲聊,价值相差5个数量级:同质的产品配上不同质的用途,使Token既具备被定价的商品属性,又缺乏标的物标准化的前提。

五、SMM观点

1. 传统算力租赁当前面对的是三层困难,不在同一时间尺度上。 拿不到货是短期扰动,组件涨价是中期压力,需求被自建分流是结构性变化。三者之中只有第三层不可逆——它改变的是客户结构,而不只是成本。

2. 自建与转租的分野,不在资本实力,在成本基准与风险结构。 自建方按边际成本报价、以自用保底;第三方按全成本报价、全部库存待售。同一个项目,一方是补充供给,一方是全部身家。 这意味着第三方投建企业在"元/台·月"这条赛道上,很难靠运营效率翻盘。

3. "按时间计价"的三个前提同时松动: 设备换代周期追上回本周期,成本基准分成两套,退役残值又无从估价。Token计费把价格风险从设备端移到产出端——这是风险重构,不是效率改进。

4. Token工厂的优势是绕开了前两道难题,风险是它没有绕开硬件。 折旧依然刚性,回本由利用率与售价两个变量共同决定,而行业现实利用率只有50%—70%。11个月成立的前提是接近满产且单价维持高位,任一项下移,回本都要向两年以上移动。

5. Token能否被定价,取决于它能否先被定义。 在标的物标准化之前,"按Token定价"更接近项目制报价,而Token指数必须分垂类编制,甚至可能无法编制。

6. 价格指数编制须同步区分样本的体系归属与报价性质。 当前同一型号的月租同时存在体系差(成本线差约3.5倍)与报价性质差(市场价/补贴价/竞争性报价/成本价),只标体系仍不够——同一体系内的补贴个案会同样污染样本。

7. 国产算力当前的短板可能不在性能,在退出机制。 国产单卡价格虽低,但退役设备缺乏公开交易平台与价格发现机制,残值无从估价,融资方只能按极保守假设处理抵押品。结果是采购成本必须全额由租金收回、融资成本被同步抬高——低价买入的账,可能在退出端还回去。 建设二手流转与残值定价体系,其价值不低于提升单卡性能。

六、展望

短期(3—6个月),看HBM与内存的产能释放节奏,以及下一代英伟达高端平台的实际可获取性。若其如期在2027年一季度放量,2026年下半年采购的英伟达设备将在回本期内面对性能数倍的替代品,二手价格首先承压——但压力的形式是价格下行,而非资产无处可去。国产一侧的观察点不同:问题不是残值会不会下跌,而是残值能否被定价。

中期(6—12个月),看Token计价能否标准化。当前同一模型在不同渠道的Token价差可达数倍,计价标准不统一,Token便难以成为可比较的标的物。

长期(1年以上),三种供给结构更可能分层共存:大厂自建消化自身业务并外溢闲置资源,运营商体系承接政企与国产替代需求,第三方投建企业则需要在推理效率或垂直行业上找到不可替代的位置。真正需要观察的,是按时间计价的那条价格线会不会先消失——当投建方持续无法在成本线以上成交,市场将由单套成本基准主导,定价权届时才归位。

(本文数据来源:国家数据局公开口径、英伟达官方路线图与GTC公开信息、彭博社与《南华早报》公开报道、中国移动2025年度审计报告及2026年中期业绩、乌兰察布市人民政府与内蒙古自治区能源局公开口径、中国信通院与第三方存储行业机构测算、第三方算力资产残值与GPU回收行业研究口径、券商研报与行业交流纪要、SMM渠道采集口径的一手报价与企业反馈)

暂无简介

曹正
微信二维码今日有色
微信二维码

微信扫一扫关注

下载app掌上有色
掌上有色

掌上有色下载

返回顶部返回顶部
publicize