INFERENCE & TOKEN PLATFORM · CONFIDENTIAL

上海交大工研院:园区级推理与 Token 平台怎么谈

38 个在孵项目里谁在真的烧 token · 一亿元 token 预算的成本拆解 · Token 工厂赛道为什么普遍亏钱 · 上海已经把补贴通道铺好了 · 没有人做过的采购品类 · 我们的优势在哪一层、怎么被验证 · 第一次会谈说什么、不说什么。

谈判对象:上海交大工业技术创新研究院(交大工研院) 报告日期:2026-08-26 核心前提:对方口径每年 token 支出约 1 亿元
内部参考 · 含谈判策略与话术 · 请勿外传

CHAPTER 00 · EXECUTIVE SUMMARY摘要:十二条结论与一句话打法

一句话打法

工研院是渠道,客户是它下面的企业。我们找工研院谈,是为了一次触达几十家、拿到统一入口与聚合红利,但真正要说服的是那批真的在烧 token 的公司。所以对平台讲的是「这一亿元能不能从费用变成园区自己的一项能力」,对企业讲的是「同样的调用量,你的账单能少多少」。
第一步只要求一次同题同压的对比测试,失败条件写在前面,园区零费用。

十二条结论

#结论依据与出处
1 先把关系定死:工研院是渠道,不是客户。它自己不产生推理负载,付钱与用量都在下面的企业。这决定了整个打法是「与平台签框架、向企业交付」——平台负责把人聚齐、把入口统一、把补贴通道打通,企业负责真实用量与续费。两侧的说服逻辑完全不同,混着讲必然失焦。 §1.1、第 5 章、第 8 章
2 38 个在孵项目里,只有 12 个真的烧 token。按是否消耗 LLM 在线推理分层:A 层推理大户 12 个,B 层训练与科学计算 7 个,C 层硬件·量子·材料 19 个几乎不产生推理需求含义有二:这一亿元的口径几乎必然不止 LLM 推理;以及不需要说服 38 家,拿下 A 层前四到六家就覆盖了大部分预算。 工研院项目库 38 个项目逐个分类(§1.5、§8.1)
3 项目库里有两家和我们能力重叠,必须由我们先提出来。基元律动做模型路由(自述 Token 成本降 90%),EvoKernel 做国产卡算子自动生成。正确定位是叠乘与供需,不是竞争:路由决定调哪个模型,我们决定这个模型跑多便宜;算子是工具,我们是端到端服务。被对方先问出来,我们就变成在辩解。 §1.6、§8.2
4 这一亿元的议价能力被严重低估。它约相当于 2025 年中国公有云 MaaS 市场总营收 30.7 亿元的 3.3%。即便考虑口径差异打对折,仍属国内头部级的单一采购方。这个数字本身就是谈判杠杆,建议第一次会谈就说出来。 IDC,2026-05-07;我方估算
5 这一亿元里真正落到算力上的可能只有一到两成。按模型厂商自己公开披露的推理成本反推,成本仅占其挂牌价理论收入的 15.5%。剩下的是模型溢价、渠道与补贴回收——这是结构上可以被重新谈判的部分。 DeepSeek 官方披露(2025-03-01),逐项核对一致
6 我们唯一的主张是动分母。单位 Token 成本 = 卡时成本 ÷ 吞吐 ÷ 利用率。分子是采购能力,人人可比且我们不占优;分母两项各有 2–3 倍空间,合起来是倍数级,且是纯工程能力。真正拉开吞吐上限的是四项进阶能力:大规模专家并行(大 EP)、MoE 调度与放置、Megakernel、预填充解码分离(PD 分离)——这是「能改引擎」与「会用引擎」的分界线。 §2.1 恒等式、§2.4 敏感度表、§6.5
7 「卖 API 注定亏钱」是伪命题——同期同赛道,毛利率能差七十个百分点。招股书原文:智谱「云端部署」毛利率 76.1%(2022)→ 31.0% → 3.4% → −0.4% 毛损(1H2025),自述原因是价格战与主动降价抢份额;而 MiniMax「开放平台」同期做到 69.4%(9M2025),其招股书自述推理 MFU 大于 75%,「顯著高於行業約 40% 至 50% 的平均水平」差别不在商业模式,在把卡用满的能力。此外潞晨科技上线一周即停止 DeepSeek API 并全额退款;硅基流动营收涨 6.5 倍而毛利率由 +39.4% 转为 −24.0%。 智谱招股章程 p.256/263/271、MiniMax 招股章程 p.418–419、硅基流动招股书、潞晨公告(均已定位页码)
8 聚合带来的峰谷互补是走渠道的唯一硬理由。三十家企业负载叠加后,按峰值备容的平均利用率上限从不到 38.5% 抬升到 77.4%单家企业永远拿不到这个红利,而任何单点供应商也给不了它——它只在「把需求归拢」这个动作里产生。 §2.5 统计模型(独立同分布、2σ 备容)
9 上海的政策已经把这条路铺好了,而且申报主体正好是企业。2026 年度文件把「模型券」正式表述为「模型券(Token 券)」,并明确允许模型服务商代客统筹申报。额度可叠加:市级模型券最高 50%/500 万元、算力券最高 30%(补早补小可至 100%)、徐汇区算力年度最高 2,000 万元、对市级项目最高 1:1 配套。由于付费方本来就是企业,申报口径天然吻合——代客申报因此是我们对企业端最有效的获客钩子。前置条件是接入「市级智能算力资源统筹调度服务平台」。 沪经信智〔2025〕489 号、〔2026〕248 号;徐汇区若干意见;智算云实施意见
10 国产化是入场资格,不是加分项;同时存在一个采购品类空白。上海要求 2027 年自主可控算力占比超 70%,这让国产加速器适配能力成为硬门槛——而能把国产卡推理真正做出可用性能的团队非常少,这恰是我们最大的结构性优势。另外,检索未找到任何一个按 Token 计费的算力服务公开中标案例,现有全是「卡 / 台 / 月」:客户正在买一个没有采购模板的东西,谁先做出这套模板谁定义品类。 上海智算云实施意见;工信厅通信〔2026〕14 号;公开采购记录检索
11 价格战已经结束,2026 年出现反向涨价。2026-03 智谱 GLM-5-Turbo 涨约 83%、腾讯云自研模型 API 一度涨 463%17 家厂商中超七成在涨价;DeepSeek 于 2026-08-17 启用峰谷分时定价,高峰价为空闲时段两倍且限流概率同时上升。「今天的低价不可持续」已经从预测变成事实——如果园区预算还建立在 2024–2025 的价格上,这个假设已经失效。 各厂商定价公告与横评,2026-03 / 2026-08-17
12 同城对手就在我们这一层,不要用错话术。无问芯穹(模速空间算力生态超市的建设与运营方)的核心资产正是推理引擎优化,其 CEO 原话是「优化即利润增长」——任何「别人只做资源、我们才做优化」的说法一旦出口就会被戳穿。但抓取其平台前端代码发现,同一套代码正在服务至少九个租户(临平、杭州、武汉、清华天津院、上海移动天问等),说明园区级平台对它是标准化白标产品而非定制交付。差异因此落在交付深度、私有化能力与敢不敢按结果计价上,而不是落在「层次不同」上。 §3.4 一手抓取;WAIC 2026 公开演讲

怎么用这份材料

见工研院之前必读

第 1 章(人、时机、项目库)、第 2 章的算术、第 5 章的渠道逻辑、第 7 章的政策。这四章决定你能不能在开场十分钟内建立可信度。

见企业之前必读

第 8 章的逐家画像与切入顺序——那是唯一可以直接拿去打电话的部分。配合 §2.4 的两个杠杆一起讲。

会谈中要用的

§2.6 的六问表、图 2-1 的成本构成、第 11 章的议程与开场话术。其余内容只在被追问时展开。

要背下来的

第 9 章的九个必答题,尤其 §9.2(赛道很卷怎么答)与 §9.3(模速空间已经有算力超市了怎么答)——这两条大概率会被问到。

对外引用前要复核的

§4.7 与附录 D 的清单。招股书类数字来自前期检索记录,方向可靠但需回原文定位。

CHAPTER 01 · THE COUNTERPARTY谈判对象:人、时机,以及一亿元到底是谁在花

先把一件事定死:工研院是渠道,不是客户。真正用 token、真正付钱、真正决定这件事成不成的,是它下面那批企业。我们找工研院谈,是因为通过它可以一次触达几十家企业、拿到统一入口与统一结算,而不是因为它自己要用推理。这一章因此分两半:前半确认渠道侧的人与时机,后半把 38 个在孵项目逐个过一遍,找出真正的客户在哪。

1.1 对口主体与治理结构

对口主体是上海交大工业技术创新研究院(通称工研院,i3sjtu.cn),2024 年 10 月 9 日启动,由上海交通大学举办、与徐汇区政府联合共建,定位为人工智能孵化器与加速器,与交大人工智能学院一体化运行,办公地在徐汇区番禺路 868 号。它采用理事会治理(第一届理事会第三次会议于 2026-01-07 召开),对外签约由执行院长落章。

对我们而言,它的性质决定了合作形态:它是一个把企业聚在一起的平台,本身不是推理负载的产生方。所以这笔生意的结构是「与平台签框架、向企业交付」——平台负责把人聚齐、把入口统一、把补贴通道打通,企业负责真实用量与续费。这两侧的说服逻辑完全不同,第 5 章讲前者,第 8 章讲后者。

首访必须当面确认的一件事

工研院的法人性质未见公开登记信息——是校属事业单位,还是公司化运营平台?实操上更像后者,但这一点直接决定合同主体、发票类型、资金来源路径与适用的采购流程,是所有商务设计的前提,不能靠猜。

1.2 与人工智能学院、徐汇区的三方关系

1.3 关键人物与一个正在打开的时间窗口

姓名职务对我们的意义
刘晓娜工研院执行院长,公开场合的对外签约人实际拍板与落章的人。商务方案要按她的口径设计
赵军工研院院长(官网「院长任命宣布会议」,2026-08-18)上任仅八天。新任负责人需要早期成果,对能形成建成物与可汇报指标的项目接受度最高
王延峰工研院理事长;交大人工智能学院执行院长治理层与学院侧的连接点,决定战略级议题
王佳梁启动时执行院长(触宝科技创始人)连续创业者背景,说明该机构不排斥产业化语言
鄂维南人工智能学院首席顾问(中科院院士)学术侧背书,与 AI for Science 方向相关
时机判断

院长于 2026-08-18 到任,距今仅八天。新任负责人的第一批动作通常需要「看得见的建成物」,而不是又一笔看不见的费用支出——这与第 5 章要讲的四项价值高度吻合。这类窗口一般只有几个月,建议尽快接触。(任命目前仅见官网单一来源,接触前建议再核实一次。)

1.4 一份已经许下的承诺,就是我们最好的切入点

工研院对外的三大方向是具身智能、人工智能出海、AI for Science / Engineering;三大服务是 AI 出海加速器、AI 社区、AI 赋能中台。其中「AI 赋能中台」在官网列出的要素清单里明确包含一项:

官网「AI 赋能中台」服务要素(节选)

种子资金 · 专业开发环境 · 高性能算力 · 工程师资源 · 真实产业需求对接 · 概念验证试点 · 首购订单机会 · 技术顾问与产业导师匹配

这是整场谈话最好的开场框架

「高性能算力」已经被工研院写进了自己对外承诺的服务清单。我们不是去推销一个新东西,而是去帮他们把已经许下的承诺兑现得更好、更便宜、更可汇报。这让对话从第一句话起就站在同一侧。
另外,「首购订单机会」说明工研院自身有采购动作和预算,不只是撮合方——这与「每年一亿元 token 支出」的前提相互印证。

1.5 项目库穿透:38 个在孵项目里,谁在真的烧 Token

我们把工研院项目库中的 38 个在孵项目逐个读过一遍,按是否消耗大语言模型在线推理 token 做了三层分类。结论出乎意料,也直接决定了这一亿元该怎么谈:

图 1-1 38 个在孵项目按推理 Token 消耗强度分层
分类依据为各项目公开的业务描述与技术路线。真正的 LLM 推理 token 消耗方不到三分之一,而硬件、量子、材料、医疗器械类占了整整一半。
A 层 B 层 C 层 推理大户 训练/科学计算 硬件·量子·材料 12 个项目 7 个项目 19 个项目 在线 LLM / 多模态推理,Agent 长链路,token 直接计费 训练与仿真为主,消耗卡时但不消耗 token 几乎不产生 LLM 推理需求 ← 这一层才是一亿元的真实来源 0 10 20 30 38 个

A 层 · 真正的推理 Token 消耗方(12 个)

项目属性为什么是大户强度
Wisdom AI(星际章鱼)AI Agent · 企业私域对抗式 Critic Agent 实现无人自主优化——自我迭代循环的 token 消耗呈指数增长;面向海外中小 B 的订阅与按效果付费极高
沅域智能AI 世界模型 / 游戏 Agent一键生成可交互 3D 游戏场景,短期面向游戏工作室提供 B 端 API 服务;多模态生成的单次推理成本极高极高
基元律动多智能体 Agent · 大模型调度OpenSquilla 多模型调度框架本身就是 token 流量入口,提供公有云 API 与私有化部署,商业模式即按量售卖 API极高
科学引擎医疗 AI · 多模态癌症早筛Science Engine 定位全自动 AI 科研助手=长链路 Agent;多模态自进化推理模型;院内数据不出域
观壹科技AI for Life Science罕见病循证诊断智能体 DeepRare,向 Virtual Cell 与 AI Scientist 演进,长链推理与多尺度建模
深光地球矿业垂直大模型自研融合视觉 Transformer 与 LLM 的跨模态大模型,矿业智能投研与储量评估
心流直觉具身智能 · 底层世界模型商业模式明确写着「项目制一体化交付与 Token 订阅双模式」——已经在按 token 卖了
EvoKernelAI 算子自动优化记忆自演进算子智能体,为芯片厂与云厂自动生成优化算子;Agent 迭代本身极耗推理
数元纪科技医疗 AI · 系统生物学四业务线并行,科研数据分析与肿瘤 AI 用药模型中高
光之宇光学垂直大模型Optics GPT,光模块智能标定、算力中心运维、仪器智能分析中高
千诀科技具身大脑因果推理与长任务操作,可解释性路线
观行智能具身智能自进化World Model + 强化学习闭环,训练为主但评估与仿真推理量大

B 层 · 训练与科学计算为主(7 个)

无界动力、深度原理、索格智算、觉行·时空智能、源络科技、破壳智能、未来不远。这一层消耗的是卡时而不是 token——需求真实且金额可能很大,但属于训练与仿真负载,与 Token 平台是两条线。在会谈中要主动把这两条线分开,不要混为一谈:混着讲会让对方觉得我们在夸大可服务范围。

C 层 · 硬件、量子、材料、医疗器械(19 个)

主动科技、傲意科技、上海太洋、lightGen、蓝启智能、金珵科技、氮化硼项目、载育量子、太微量子、鸿鹄聚变、幻码跃迁、空山慈、灵泷视界、明视脑机、太一量生、智子光垣、纳开量子、铁马量子、酉术量子。这一层几乎不产生 LLM 推理需求。

这个分层带来的核心判断

38 个项目里只有 12 个是真正的推理 token 消耗方,而其中前四家很可能就占了大部分。这意味着两件事:

一亿元的口径几乎必然不止「LLM 推理 token」。它更可能是「算力 + 模型调用」的合计盘子,甚至包含 B 层的训练卡时。所以第一次会谈的首要任务是拆口径(§2.6 的六个数字),而不是报价。

切入点非常集中。不需要说服 38 家,只要拿下 A 层前四到六家,就覆盖了这笔预算的主要部分。这让第 10 章的第二段试运行(自愿报名 3–5 家)从一个模糊的建议,变成一份点名清单。

一条外部数据可以印证这个分层的合理性:国信证券基于 OpenRouter 平台的统计显示,Agent 与 Coding 类应用仅占应用数量的 19%,却贡献了 81.2% 的 Token 消耗(2026-08-07)。A 层里排前面的几家恰好都是 Agent 形态——这不是巧合,而是这类负载的固有特征。同一份报告还指出,前十大应用的每请求 Token 中位数为 75,479,而第 11–99 名应用仅为 28,430,头部应用的单请求消耗是长尾的 2.7 倍

1.6 项目库里有两家和我们能力重叠——必须由我们先提出来

这是全章最需要提前想清楚的一点。工研院自己孵化的项目里,有两家在做与我们相邻的事。如果我们不主动说,对方一定会问;而由我们先提出并给出关系定位,可信度完全不同。

基元律动 · 模型路由层

前华为诺亚方舟博士团队,OpenSquilla 开源多模型智能调度框架,分层路由实现「Token 成本降低 90%」,兼容国产大模型,已完成天使轮。
关系定位:不同层,可叠乘。路由解决的是「这个请求该调哪个模型」,我们解决的是「这个模型跑起来单位成本多少」。两者相乘才是最终成本,而且他们的私有化部署恰恰需要一个高效的底层推理引擎——那正是我们。

EvoKernel · 算子生成工具

为芯片厂与云厂提供 AI 智能体自动生成优化 GPU 算子,适配昇腾、壁仞等国产异构芯片,团队含昇腾资深研发,千算 CLI 已商用。
关系定位:工具 vs 端到端服务。他们做算子生成工具,我们交付的是完整推理服务与 SLA。而且自动生成的算子需要真实推理负载来验证收益——园区平台正是最好的验证场。

话术建议:把这两家说成生态,而不是对手

建议在会谈中主动说出来:「您孵化的基元律动做的是路由层,EvoKernel 做的是算子生成工具,我们做的是把模型真正跑便宜的那一层加上端到端交付。这三件事是叠加关系不是替代关系——事实上他们两家都可能是这个平台的用户或合作方。」

这句话的价值远超它的长度:它同时证明了我们做过功课、懂技术分层、不打压对方的既有资产,还顺带把自己的位置定义清楚了。反过来,如果被对方先问出来,我们就变成了在辩解。

1.7 一个必须重视的人

Wisdom AI(星际章鱼)项目的 CEO,公开资料称其从零搭建火山方舟并实现数十亿年收入。火山方舟是国内 MaaS 市场的头部平台(按 IDC 口径,火山引擎在调用量份额上接近一半)。

含义是双向的

此人对 token 平台的成本结构、定价策略与运营细节的理解,大概率超过会议室里的任何人,包括我们。这意味着:任何含糊的、营销式的说法在他面前会立刻失效;但反过来,第 2 章那套基于公开披露数据的成本算术,恰恰是他最能验证、也最会认可的语言。

建议把他当作最重要的说服对象,也当作最有价值的潜在背书人。如果他认可我们的成本模型,工研院内部几乎不需要再说服别人。

1.8 把一亿元放到市场里看:这是头部级的单一采购方

IDC 于 2026-05-07 发布的数据给了一个有用的分母:2025 年中国公有云 MaaS 市场营收为 30.7 亿元人民币(2026 年预测 186 亿元)。同期中国企业级 MaaS 调用量从 2024 年的 114 万亿 tokens 增至 2025 年的 1,944 万亿 tokens,约 16 倍;日均消耗从 2025 年 1 月的 1.6 万亿增至 2025 年 12 月的 9.6 万亿 tokens/日

≈3.3%
一亿元 ÷ 2025 年中国公有云 MaaS 总营收 30.7 亿元(我方估算)
1,944 万亿
2025 年中国企业级 MaaS 调用量,同比约 16 倍(IDC)
9.6 万亿/日
2025 年 12 月中国日均 token 消耗(IDC)
30.7 → 186 亿
中国公有云 MaaS 营收,2025 实际 → 2026 预测(IDC)

口径提醒:3.3% 是粗略对照而非严格市场份额——工研院的一亿元可能包含私有化部署、海外模型调用与训练算力,而 IDC 的 30.7 亿元只统计国内公有云 MaaS 营收。但即便打对折,这仍说明该机构在国内属于头部级的单一采购方,议价能力远超它自己可能意识到的程度建议在第一次会谈中直接把这个数字说出来——它会立刻改变对方对这笔预算的心态,也自然引出「既然量这么大,就值得把成本结构拆开看一看」。

CHAPTER 02 · THE ARITHMETIC一亿元的算术:这笔钱现在买到了什么

这一章只做一件事:把「每年一亿元 token 费用」拆成可以逐项追问的算术。拆完之后,我们的优势不再是一句形容词,而是这张表里的两个格子。

2.1 先立一个恒等式

Token 的价格不是一个市场自然价,它是被三个工程量决定的。任何供应商的报价,往前推一步都是这个式子:

单位 Token 成本 = 卡时成本 ÷(单卡有效吞吐 × 集群利用率) 分子是采购问题,分母是工程问题。买 API 的人只能看到左边的结果,看不到右边的三个分量——而后两项各自都有三到五倍的浮动空间。这就是同样的硬件、同样的模型,不同团队做出来的单位成本能差好几倍的原因。

把这个式子记住,后面所有的讨论都只是在问一句话:这一亿元里,有多少花在分子上,有多少是被分母的低效吃掉的。

先回答一个必然会被问到的反问

「推理成本本来就在飞快下降,我们等着变便宜不就行了?」——MiniMax 招股章程行业章节(p.183,引灼识咨询)确实写着:「業內平均推理成本由 2022 年末的約每百萬 token 20 美元降至 2024 年末的每百萬 token 不到 0.1 美元,且預計將以每年約 10 倍的速度持續下降。」

但这正是要点所在:这个下降不是自然发生的,它就是上面那个分母被一群人做上去的结果。行业平均成本下降,只意味着「做得好的人」把标准拉高了;对某一个具体客户来说,你的成本会不会跟着降,完全取决于你的供应商属于哪一边。第 4 章会给出两家同期公司毛利率相差七十个百分点的招股书证据。

2.2 用模型厂商自己公布的数字来定标

要回答上面的问题,需要一个可信的成本参照。行业里最硬的一份公开数据来自 DeepSeek 自己:2025 年 3 月 1 日,他们公开披露了 V3/R1 线上推理系统连续 24 小时的完整运行统计与成本核算[DS]。这是极少数由服务方主动公开、可被逐项复核的成本样本。

披露项数值说明
统计窗口24 小时2025-02-27 12:00 至 2025-02-28 12:00(北京时间)
峰值 / 平均节点占用278 / 226.75 节点每节点 8 张 H800,平均折合 1,814 张卡
假定卡时单价2 美元 / 卡 · 小时官方自设的成本假设
当日总成本87,072 美元1,814 × 24 × 2 = 87,072,与官方数字逐项核对一致
当日输入 token6,080 亿其中 3,420 亿(56.3%)命中磁盘 KV 缓存
当日输出 token1,680 亿
按 R1 定价折算理论日收入562,027 美元官方明确说明实际收入远低于此(V3 更便宜、部分服务免费、夜间折扣)
成本 ÷ 理论收入15.5%即官方口径的「理论成本利润率 545%」

口径提醒:这 15.5% 只含卡时租金,不含研发、带宽、存储与运维人力;卡时单价是官方假设值;理论收入按 R1 满价计算而实际收入更低。所以它不是真实利润率,但它给「纯算力成本占挂牌价的比重」划了一条相当可靠的下界——这正是我们需要的定标。

从披露数据反推的单卡效率

输出侧:1,680 亿 ÷ 1,814 张卡 ÷ 86,400 秒 ≈ 1,072 token/s/卡(全集群平均折算,非单节点峰值)。

输入输出合计:(6,080 + 1,680)亿 ÷ 1,814 ÷ 86,400 ≈ 4,951 token/s/卡

把全部成本摊到输出 token:87,072 ÷ 1,680 亿 × 100 万 ≈ 0.518 美元/百万输出 token,约合 3.7 元。而同期 R1 的输出挂牌价是 16 元/百万——你付的每 16 元里,大约 3.7 元是算力,其余 12 元多是别的东西。

2.3 把一亿元放进这个结构里

下表左列是园区实际支付的混合 token 单价(这个数需要在第一次会谈中问清,见 §2.5),右侧是按上面披露效率反推的真实算力成本。

混合支付单价年 token 量日均底层算力成本算力占比非算力部分
2 元/百万50.0 万亿1,370 亿/天约 3,980 万元39.8%6,020 万元
4 元/百万25.0 万亿685 亿/天约 1,990 万元19.9%8,010 万元
8 元/百万12.5 万亿342 亿/天约 1,000 万元10.0%9,000 万元
16 元/百万6.25 万亿171 亿/天约 500 万元5.0%9,500 万元
50 元/百万2.00 万亿55 亿/天约 160 万元1.6%9,840 万元
120 元/百万0.83 万亿23 亿/天约 67 万元0.7%9,930 万元

「底层算力成本」按 DeepSeek 披露的 0.8 元/百万 token(成本摊到输入+输出全部 token)折算,汇率取 7.1。最后两行对应大量使用海外前沿模型的情形——AI 出海类企业的实际混合单价往往落在这个区间,此时算力成本占比不到 2%,付的几乎全是模型溢价与渠道费。

图 2-1 一亿元支出的成本构成随支付单价的变化
支付单价越高,真正落到算力上的比例越低。灰色部分不等于供应商净利——里面含模型研发摊销、渠道、税费与补贴回收,但它是结构上可以被重新谈判的部分
占一亿元预算的比例 100% 75% 50% 25% 0 2 元 4 元 8 元 16 元 50 元 120 元 39.8% 19.9% 10.0% 5.0% 1.6% 0.7% 混合支付单价(元 / 百万 token) 底层算力成本 非算力部分

2.4 分母上的两个格子

回到 §2.1 的恒等式。卡时成本(分子)是采购能力,谈判空间有限且人人可比;真正拉开差距的是分母的两项,而这两项都是纯工程能力

情形单卡吞吐集群利用率单位成本相对基线
基线:能跑通,但没调过2,000 tok/s30%10.57 元/百万1.00×
只做吞吐优化(算子、批处理、调度)3,000 tok/s30%7.05 元/百万1.50×
只做利用率优化(需求聚合、峰谷互补)2,000 tok/s60%5.28 元/百万2.00×
两项同时做3,000 tok/s60%3.52 元/百万3.00×
深度优化4,000 tok/s75%2.11 元/百万5.00×

算例统一按 20 万元/卡/年的整机租金折算,仅用于展示两个杠杆的相对量级,不代表任何实际报价。吞吐取值区间参照 §2.2 反推的 4,951 token/s(DeepSeek 在 H800 上以大规模专家并行做到的水平)与国产加速器上未经深度优化时的常见落点。

这张表就是整场谈话的落点

它说明一件反直觉的事:「便宜」不是采购能力,是工程能力。一个团队若只会转售别人的 token,它能给的折扣上限就是自己的渠道返点;而一个能同时动吞吐和利用率两个格子的团队,成本下降空间是倍数级的,且这个空间不依赖任何人的补贴,因此可持续、可承诺、可写进合同。

2.5 园区形态自带的一个结构性红利

利用率这一格,园区平台有一个别人拿不到的天然优势:需求聚合带来的峰谷互补

单一创业公司的推理负载极不平稳——白天调试、夜间空转、demo 前突然打满、融资路演期翻十倍。它若自己买卡,必须按峰值备容,平均利用率就注定很低;它若买公有云 API,则要为别人的调度不确定性付溢价。而几十家企业的负载叠加之后,总量曲线会显著变平,这是统计规律而非管理技巧:

图 2-2 负载聚合使峰均比收敛,利用率上限随之抬升
简化模型:各家负载独立同分布(均值 1、标准差 0.8),按 2σ 备容。总量均值随企业数线性增长,标准差只随平方根增长,因此峰均比必然下降。
100% 85% 70% 55% 40% 按峰值备容时的平均利用率上限 38.5% 52.0% 66.4% 77.4% 82.9% 87.3% 1 家 3 家 10 家 30 家 60 家 120 家 纳入统一调度的企业数量 每多接入一家企业,全体的单位成本都下降一点 ——这是园区平台唯一无法被复制的优势
这条曲线要说给工研院听的话

园区把分散的推理需求归拢到一个平台上,不只是为了集中采购拿折扣,而是把每家企业各自浪费的那部分闲置容量互相填平。三十家企业统一调度,利用率上限从不到四成抬到接近八成——按 §2.4 的表,这一项本身就值两倍成本差。这个红利只有园区自己能创造,任何单点供应商都给不了;但它需要一个有能力做统一调度的技术方来兑现。

一个券商口径的实证,正好量化了这条曲线值多少钱

国信证券在 2026-07-24 的报告中测算了同一组需求的两种供给方式(以 Prosus 部署 Llama-3.3-70B 为例):在固定 200B token/天的需求下——

客户各自裸金属自部署需要约 1,102 张 H100,日支出约 66,138 美元
统一的 Token 工厂方案只需要约 244 张 H100,日支出约 23,400 美元

对应单卡日收入从裸金属的 60 美元提升到 96 美元(+60%)。同一份报告还指出,客户自部署时还要额外承担 10%–20% 的冗余缓冲算力闲置损耗

卡数相差约 4.5 倍。这不是营销话术,是卖方研究机构在公开报告里算的账——而且它同时包含了本节讲的聚合效应与 §2.4 讲的工程效应。这组数字建议直接印出来带进会场。

2.6 第一次会谈必须拿到的六个数字

上面所有推算都建立在假设的混合单价上。在拿到真实口径之前,任何报价都是猜测。因此第一次见面的核心目标不是报价,而是把这六个数字问清楚——能把这六个问题问出来,本身就已经和「来卖 token 的」区分开了

① 一亿元的口径构成

其中多少是模型 API 采购、多少是算力租赁、多少是平台与人力?是园区统一支付,还是各企业自付后申请补贴?

② 模型构成与占比

开源模型(DeepSeek / Qwen / GLM 系)与闭源、境内与海外前沿模型各占多少金额?这直接决定混合单价落在 §2.3 表的哪一行。

③ 输入输出比与缓存命中率

输入输出比决定成本结构(预填充与解码的经济性完全不同);命中率决定还有多少重复计算可以省掉。

④ 峰值并发与峰谷形态

决定要备多少容量,也决定 §2.5 的聚合红利到底有多大。要按企业分别拿,不能只拿总量。

⑤ 长上下文与多模态占比

长上下文的显存与调度代价是短请求的数倍,多模态更甚。这一项占比高,优化空间反而更大。

⑥ 硬约束清单

数据是否允许出域、是否有国产化率要求、结算是否必须走招标与专票、SLA 与合规审计怎么定。这些决定方案形态,也决定谁被排除在外。

建议把这六项做成一页表格现场填写。它同时是一份需求调研表和一份专业度证明:愿意先把口径搞清楚再谈价格的供应商,在这个赛道里是少数。

CHAPTER 03 · THE FIELD赛道现状:确实很卷,但卷的不是我们要做的那一层

这一章先承认现实:Token 工厂已经是一个拥挤的赛道,有大厂、有运营商、有国资平台、有拿到大额融资的创业公司,也有已经递表上市的。但把玩家按「靠什么赚钱」分层之后会发现,绝大多数人挤在两个我们不去的位置上。

3.1 玩家地图:按盈利来源分四层

图 3-1 Token 服务供给的四层结构
从下到上是价值链位置。左侧是各层的主要参与者类型,右侧是该层的盈利来源与结构性问题。竞争最激烈的是第二层和第三层,而第四层的能力缺口最大。
L1 硬件与机房 芯片厂 · IDC · 地方国资算力中心 盈利=资产与折旧 问题=重资本、回收期长 L2 裸算力出租(卡时 / 台月) 智算租赁商 · 运营商 · 区域算力平台 盈利=卡时差价 问题=同质化、价格战、客户低效与它无关 L3 Token 转售 / 聚合 API 聚合平台 · 中间商 · 部分 MaaS 创业公司 盈利=加价或返点 问题=成本是别人的定价,降价直接伤自己 L4 自建推理基础设施 + 运营 自租算力 · 自建推理栈 · 按 token 交付 盈利=工程带来的成本下降 问题=门槛高,能做的团队少 ← 我们在这一层 毛利率最高,公开研报给到 50%+ 但需要同时握住算力与优化两端 这是我们唯一主张的位置 最卷的一层 公有云 MaaS 普遍负毛利(§4.1) 低价来自补贴,不是来自成本 同质化最严重的一层 研报口径毛利率约 20–30% 卖的是资源,不承担效率责任 资本密集,与我们不构成竞争 是我们的上游

这张图要在会谈中传达的判断只有一句:「卷」发生在 L2 和 L3。这两层的共同特征是不对客户的效率负责——L2 把卡租出去就完成交付,L3 把 token 转手就完成交付。而单位成本真正下降的地方在 L4。

3.2 大厂云 MaaS:价格战的主战场,也是补贴的来源

IDC(2026-05-07)的份额数据显示,按调用量计火山引擎接近 50%,按营收计火山引擎 40%+,其后为阿里云、百度智能云、智谱、移动云。市场规模一侧:中国公有云 MaaS 营收 2025 年 30.7 亿元,2026 年预测 186 亿元;调用量 2024 年 114 万亿 tokens → 2025 年 1,944 万亿 tokens(约 16 倍)。

一个值得在会谈中点出的反差

调用量一年增长约 16 倍,而营收从个位数亿元增长到 30.7 亿元。量的增速远高于收入的增速,意味着单价在快速下行——这既是客户的红利,也是供给侧亏损的直接原因(第 4 章)。对采购方的含义是:现在的低价里,有一部分是别人的市场投入,它不构成对未来三年的价格承诺。

3.3 运营商与地方国资:规模最大、口径最粗的一层

这一层的特点是投资额巨大、以政府与国资为主导、对外服务能力参差。已知的公开案例包括:

案例性质与量级置信度
中国电信宁夏 Token 工厂相关集采百亿元量级的集中采购(记录口径约 174 亿元)待核金额与口径需再次核实后方可引用
软通动力「北京壹号词元工厂」企业主导的 token 工厂品牌化尝试媒体
弘信电子 · 燧弘(无锡)Token 工厂上市公司参与的区域 token 工厂媒体

这三条来自本项目前期检索记录,本轮因检索额度耗尽未能重新逐项核实。建议在正式会谈引用前再核一遍原始公告——尤其是那个百亿元级的数字,口径(是 token 工厂本身,还是包含算力、网络与集成的总包)差别很大。作为背景趋势使用没有问题,作为具体论据要谨慎。

对我们的实际意义:这一层是潜在的算力来源,而不是竞争对手。它们普遍缺的正是 L4 的能力——建成了集群,但把集群变成低单位成本的 token 服务,是另一回事。

3.4 最需要正面处理的对标:模速空间与无问芯穹

这是同区、同类、最直接可比的先例,会谈中对方很可能主动提起。而且必须先纠正一个容易犯的错误判断:它不是「资源撮合层」,它就在我们要去的这一层。

公开事实

平台侧:2025-02-21 发布,对外称国内首个「算力生态超市」,由模速空间 + 无问芯穹 + 上海仪电三方共建,无问芯穹为建设方与运营方;入驻企业「免申即享」100 万元等价算力大礼包,兑现方式是按使用情况周期性结算算力补贴(运营方原话),不是现金。

技术侧(关键):无问芯穹的核心资产恰恰是推理引擎优化——FlashDecoding++(arXiv 2311.01282,与清华、上交联合,GPU 上提速 2–4 倍,已集成进自研引擎 Infini-ACC)、SpecEE(ISCA 2025 收录)、Agentic MaaS 自述「与原厂模型精度对齐率超 99.9%、系统吞吐提升 2–3 倍、整体时延缩减 50%、可用率 99.95%」;异构混训千卡单任务算力利用率最高 97.6%,支持六种芯片。

规模侧:累计融资超 22 亿元;纳管算力 25000P+,覆盖 26 城 53 个数据中心;2025 年收入超 5 亿元、现金流为正(CEO 受访口径,非审计数)。

一句必须记住的话

其 CEO 在 2026 WAIC 的原话是:「英伟达提出算力即收入,无问芯穹提出优化即利润增长。」这几乎就是我们准备打的口号。所以任何「别人只做资源、我们才做优化」的论证都站不住脚——一旦被对方或其技术顾问戳穿,整章的可信度都会受损。

但有一个一手发现,改变了这场对标的性质

直接抓取模速空间算力平台前端代码(ms-computility.cloud.infini-ai.com,2026-08-26 访问,HTTP 200)后发现,其 JS 中存在一张硬编码的域名到平台名映射表,同一套代码库正在服务至少九个租户:

域名前缀对外平台名域名前缀对外平台名
ms-computility模速空间算力生态平台zj-computility杭州市算力资源调度服务平台
hzzlss临平区算力调度服务平台whsuanli武汉算力公共服务平台
ieit-ai清华大学天津电子信息研究院智算平台tw上海移动天问 Token 服务
lanqi澜启智算neogpu算力牛
hnhyf四海 AI(其中上海移动天问、武汉两站经复核当前均返回 HTTP 200)
这条证据的含义

「园区级 Token 平台」对他们不是一次性定制项目,而是一套可复用的多租户白标产品,边际交付成本极低。这意味着两件事:

① 我们若以「为工研院定制一套平台」为卖点,必须能回答「为什么不直接买他们的白标」——这个问题一定会被问到(§9.3 给出答法)。
② 反过来,标准化产品的另一面是不做深度定制:九个租户共用一套代码,说明交付的是通用能力,而不是针对某一批具体负载的专项调优。这正是我们的空间所在。

还有一条对我们有利的事实:算力生态超市运行一年半,接入企业数、实际调用量、集群利用率、续约率、满意度——全部未找到任何公开数据检索结论。可公开引用的只有发布日与首批签约名单。说不清效果,是标准化平台的通病,也是我们最该攻的地方(见 §9.3 递回去的那个问题)。另有两条媒体转述(商汤专供徐汇 4000P、上海电信 500 万元算力优惠)待核,不建议主动引用。

3.5 已递表与已上市:赛道确实进入资本化阶段,但也有人已经出局

下表按港交所披露易综合索引与交易所项目库逐条核对(截至 2026-08-26),纠正了几个流传较广的误传

公司真实状态要点
硅基流动已递表、处理中
申請版本 2026-06-30
港交所第十八C章特专科技申请人,自述为「未商業化公司」尚无聆讯后资料集,未过聆讯。申請版本 2026-12-30 届满
基流科技已递表、处理中
申請版本 2026-04-29
走常规主板盈利测试;无 PHIP。申請版本 2026-10-29 届满
无问芯穹查无任何递表记录港交所 2013–2026 全量索引 3,865 条无命中;上交所在审与历史项目 1,048 条、深交所 2,810 条项目库均无命中。此前流传的「已递表港股」说法不成立(注:中国证监会境外上市备案清单本轮未能核查,故表述为「三大交易所无记录」而非「绝对未启动」)
智谱 02513 / MiniMax 00100 / 云知声 09678已上市分别于 2025-12-19 / 2025-12-21 / 2025-06-12 挂牌
白山云两度递表、两度失效2023-12-29 与 2025-10-15 两次递表均已失效,现无在审申请
安徽海马云
GPU 云 / 云渲染
两度递表、两度失效2025-06-27 与 2026-01-30 两次递表均已失效,现无在审申请
这张表要说的两件事

资本市场确实在给这个赛道开窗口,但两家最像我们的公司都还只是「已递表、处理中」,没有一家通过聆讯把「同行都上市了」当作赛道成熟的证据,是不准确的。

已经有人两度递表两度失效。白山云与海马云的经历说明这个赛道的资本故事并不好讲——而这恰好回到第 4 章的结论:讲不通的原因是单位经济模型本身没跑通。

CHAPTER 04 · WHY THEY LOSE MONEY为什么大多数玩家在亏钱——以及这为什么是我们的论据

这一章是全篇论证的另一半支柱。如果这个赛道的低价来自补贴,那么「便宜」就不是采购能力的证明,而是一个即将结束的窗口;反过来,只有来自工程的低成本才能被承诺三年。招股书里的分业务毛利率把这件事说得很清楚。

4.1 同一家公司,两种业务,毛利率差一百多个百分点

最有说服力的证据不是行业平均值,而是同一家公司内部不同业务线的对比——它排除了管理能力、融资能力、团队水平这些干扰项,只剩下商业模式本身的差异。

图 4-1 Token 服务各业务形态的毛利率对比
越靠近「转售公有云 API」,毛利率越差;越靠近「自建推理基础设施与专属交付」,毛利率越好。这不是某家公司的经营问题,是价值链位置的问题。
毛利率 0 −200% −100% +100% −271.6% 公有云 MaaS · 早期披露期 −119.0% 公有云 MaaS · 改善后 16.8% 智算集群产品交付 20–30% 裸机架 / 卡时租赁(研报口径) 47.7% 智算运营服务 50%+ 自建推理基础设施(研报口径) 82.5–92.4% 私有化部署 / 专属交付 卖得越多亏得越多 低价来自市场投入,不是成本 卖资源,不承担效率责任 毛利来自成本下降 数据不出域
披露主体 / 出处业务线毛利率说明
硅基流动 SiliconFlow
港交所申請版本 2026-06-30
财务资料 p.179
公有云服务(2024)−271.6%即每收 1 元、成本约 3.7 元
公有云服务(2025)−119.0%大幅改善,但仍是负毛利;整体毛利率由 2024 年 +39.4% 转为 −24.0%
本地部署解决方案82.5%(2025)
92.4%(2024)
同一家公司、同一套技术,形态一换毛利率反转。下滑原因招股书归因于交付复杂度上升而非降价
成本结构(p.178)算力租赁费占销售成本 86.9%算力 100% 外租:前五大供应商全部提供算力资源(占采购 70.8%),而公司名下物业厂房及设备净值仅 92.7 万元(p.I-22)——账上没有一张 GPU
基流科技
港交所申請版本 2026-04-29
财务资料 p.218
AI 算力集群产品(2025)16.8%
2024 为 18.2%
卖硬件与集群,接近工程集成的利润率
集群运营服务(2025)47.7%
2024 为 56.1%
同一家公司,运营服务是产品交付的近三倍。但两条线都在跌;应收账款周转天数 3.2 → 12.5 → 64.1 天
券商研报口径
国金证券《Token 计费重塑 AI 产业链》2026-07-17,第 2.5 节
3.0 级=推理基础设施模式50%+原文对标 FireworksAI(美国头部 Token 聚合厂商,自研推理调度体系部署开源模型);对照组是「GPU 机架租赁行业平均 20%–30%」

上表两家公司的数据已回港交所披露易招股书原文逐条核实并标注页码(申請版本,非聆讯后资料集)。需要说明的是:两家均处于「已递表、处理中」状态,尚未通过聆讯。

一个必须先分清的陷阱:「智算毛利率」其实是两个物种

把 A 股同业一起放进来看会发现,同样叫「智算业务」,毛利率能差三四十个百分点——因为它们根本不是同一门生意

物种代表与毛利率本质
重资产自建 IDC / AIDC润泽科技 AIDC 48.50%;优刻得机柜托管 43.61%卖的是机柜、电力与制冷,本质是地产与能源生意,毛利率高但资本开支巨大、折旧沉重
GPU 算力转售并行科技智算云 11.37%;首都在线大模型及 AIGC 11.40%;软通动力智算服务 10.63%;青云科技云服务 4.89%卖的是卡时,向上游买、向下游卖,赚价差。硅基流动与基流科技所处的位置更接近这一类

这个区分在会谈中非常有用:如果对方拿「某某智算中心毛利率 48%」来质疑我们说这行不赚钱,可以直接指出那是机柜生意的毛利率,与 token 服务不是一回事。而真正做 token 与卡时的这一类,毛利率普遍在 5%–12% 甚至为负。

4.2 三个具名样本:一个退出了,一个在流血,一个刚转正

行业平均值容易被质疑口径,具名公司的公开财务与公开表态不会。这三家把整条逻辑链走完了。

样本一 · 已经退出的那家:证明这门生意可以是负和的

潞晨科技于 2025-03-01 官宣,在上线约一周后停止其 DeepSeek API 服务并对余额全额退款。创始人尤洋此前的公开测算是这个赛道被引用最多的一段话:

尤洋(潞晨科技创始人),2025-02-09

「MaaS 在中国短时间内可能是最差的商业模式……满血版 DeepSeek R1 每百万 token 官方也只能收到 16 元,如果每日输出 1000 亿 token,那么每月的机器成本是 4.5 亿,亏损 4 亿,用户越多,亏损越多。」

他同时指出:「常规 MaaS 要实现稳定输出,需准备的机器可能是理论值的 5 倍。」——即 §2.2 那份官方披露是在满负荷前提下算的,真实运营要为峰值备容。

这段话对我们是双刃的,必须诚实处理:它同时也在质疑我们第 2 章引用的成本口径。正确的用法是主动把它讲出来,然后指出——「机器是理论值 5 倍」说的正是利用率问题,而利用率恰恰是 §2.1 恒等式分母里我们要动的那一项。他描述的困境,正是我们主张的机会。

样本二 · 正在流血的那家:规模增长解决不了结构问题

公司公开财务状态
硅基流动
中国最大独立生态词元供应商(自述)
2025 年营收 5,533 万元(+653.2%);毛利率由 2024 年 +39.4% 转为 −24.0%,其中公有云服务毛利率 −119.0%;年内亏损 3.45 亿元。
应付账款周转天数由 158 天收缩至 46 天,而应收由 92 天降至 48 天——算力供应商正在收紧对它的信用。市占率方面,中国词元供应平台前三名合计 87.0%,该公司作为「最大的独立生态词元供应平台」仅占 1.5%
2026-06-30 递表港交所主板
PPIO 派欧云 2022–2024 营收 2.86 / 3.58 / 5.58 亿元,净亏 0.85 / 1.89 / 2.94 亿元,三年累亏 5.68 亿元AI 云计算业务(GPU 云+模型 API)过去两年录得毛损 2026-06-10 二次递表港交所
行业平均 2024 年国内大模型行业平均毛利率约 −80%,2025 年约 −30%
这份招股书里最惊人的一个数字

把三个科目相加——销售成本内的算力资源成本 5,962.7 万元(p.178)+ 销售及营销开支内的「推广算力资源成本」5,421.3 万元(p.180)+ 研发开支内的「研发算力资源成本」4,524.1 万元(p.181)= 1.591 亿元

而同期总收入是 5,533 万元算力租赁总支出是收入的 2.88 倍。

其中「推广算力资源成本」5,421.3 万元就是发免费词元代金券烧掉的算力,相当于同期公有云收入 2,926.1 万元的 1.85 倍——补贴不是一个抽象概念,它有确切金额,而且比收入还大。

价格战的另一个刻度:Serverless 单付费客户年均收入从 2024 年的 185.3 元塌到 2025 年的 19.97 元,一年降 89%

注意硅基流动那一行的内在矛盾:营收涨了 6.5 倍,毛利率却从正转负。这直接证伪了「规模上来自然就有毛利」的假设——在这个赛道里,规模扩张如果没有单位成本的同步下降,只会把亏损一起放大。

样本三 · 决定性的一组对比:同样卖 API,毛利率差七十个百分点

这是整份材料里最有力的证据,来自两家已上市模型公司的招股书原文。它们同期、同赛道、都在卖 API,毛利率却在两个极端。

公司API / 云端业务毛利率出处
智谱 02513
「云端部署」口径
2022 76.1% → 2023 31.0% → 2024 3.4% → 1H2025 −0.4%(毛损) 招股章程 2025-12-30,财务资料 p.256/p.263
MiniMax 00100
「开放平台及其他 AI 企业服务」口径
2023 75.1% → 2024 63.2% → 9M2025 69.4% 招股章程 2025-12-31,财务资料 p.418–419

智谱对自己云端毛利率崩塌给出的解释是价格战(财务资料 p.271):

「通過API接口的方式,使用我們模型的用戶數量日益增多……然而,由於市場競爭激烈,該等服務價格下跌。我們亦實施戰略性服務降價措施,以擴大市場份額並吸引更多客戶。此舉導致我們雲端部署服務的毛利及毛利率均出現顯著下滑。

而 MiniMax 在同一时期把开放平台毛利率维持在近七成。它的招股书里有一个可能解释这个差距的数字:推理 MFU 大于 75%,招股书自述「顯著高於行業約 40% 至 50% 的平均水平」。同时它的销货成本里,「與推理活動相關的雲計算服務成本」占 92.7%–96.9%——推理效率几乎就是它的全部成本结构。

这组对比要说的话

「卖 API 注定亏钱」是个伪命题。同期、同赛道、同样卖 API,一家做到 −0.4%,另一家做到 69.4%。差别不在商业模式,在于把模型跑起来的效率——而 MFU 高出行业一倍这件事,是可以被工程做出来的。

会谈中的用法:「有人会告诉你这行本来就不赚钱。但同一年、同样卖 API,有人毛损、有人七成毛利。差的不是模式,是把卡用满的能力。

口径提醒(必须一并说明,否则会被专业人士挑出来):两家的业务结构并不完全可比——MiniMax 约 73% 的收入来自境外,定价水平与客户结构和境内不同;智谱的云端口径也包含了更多低价走量的公有云调用。所以这组对比证明的是「效率与定价策略能造成巨大差异」,而不是「MiniMax 的技术一定强于智谱」。会谈中按前一种说法讲,稳妥且足够有力。

而智谱自己给出的翻身路径,正是我们做的事

智谱招股章程「业务—策略」章节

「由於我們的網絡優化技術提升推理效率及服務穩定性,我們預期單位計算資源消耗及相應的單位推理成本將下降,其預期推動我們雲端解決方案的毛利率提升,並為更靈活的定價策略創造空間。」

另一个值得记住的数字:智谱 2024 年研发开支中的「算力服务费」为 15.53 亿元,占研发开支 70.7%,而当年全年收入只有 3.12 亿元——算力支出是收入的五倍(财务资料 p.257)。其风险因素 p.42–43 的标题直接写着:「我們依賴第三方為我們提供計算資源……我們可能被迫以高價購買算力。」

待核 另有二手来源称智谱 MaaS 毛利率在 2025 全年回升至 18.9%、ARR 达 17 亿元。该说法与招股书披露的 1H2025 云端毛损 −0.4% 存在张力——若属实则意味着 2H2025 出现了大幅改善。智谱 FY2025 年报原文本轮未取得,在回原文确认之前,会谈中不要引用 18.9% 这个数字。

4.3 三条结论,每一条都直接为我们服务

① 现在的低价含补贴,不构成价格承诺

公有云 MaaS 侧的负毛利意味着相当一部分低价是市场投入而非成本优势。补贴是营销预算,随时可调,且通常在客户迁移成本最高时收回。对采购方的含义:不要把今天的单价当成三年的规划基础。

② 算力全部外租 + 占成本近九成,说明分母根本没被优化

如果算力接近 87% 的成本占比、且全部外租,那么这家公司的成本几乎完全等于上游报价——它没有在吞吐与利用率上拿到任何收益。这恰好从反面证明了 §2.1 恒等式里分母的价值。

③ 越靠近自建与专属交付,毛利越好

同一家公司内部,私有化部署的毛利率与公有云 MaaS 差出一百多个百分点;另一家公司内部,运营服务是集群交付的近三倍。这是价值链位置的差异,不是经营水平的差异。我们主张的正是这个位置。

4.4 一个看穿低价报价的工具:问对方的折旧年限

比较不同供应商的成本时有一个容易被忽略的变量:同样一张卡,折旧年限拉长一年,账面成本立刻下降一截。逐份核对定期报告后发现,这个假设在同业之间差异极大:

公司AI 服务器 / 相关设备折旧年限含义
并行科技3–5 年最保守
优刻得经营设备 2–5 年2025-10-30 董事会决议将服务器 GPU 机型由 4 年改为 5 年,仅 2025Q4 一季即减少主营业务成本 886.19 万元、增厚净利润 859.25 万元
青云科技服务器 5 年另有 GPU 售后回租融资 1.245 亿元
首都在线5–10 年
基流科技机器及设备 6 年年折旧率 15.83%。本样本中 AI 服务器口径最长之一,直接支撑了它 47.7% 的运营服务毛利率
润泽科技机器设备 5–15 年AIDC 折旧占其成本 66.59%
云赛智联专用设备 20 年年折旧率仅 4.75%
这张表在会谈中怎么用

当有人报出一个很低的单位成本时,先问三个问题:折旧年限多少年?算力是自建还是外租?报价含不含峰值备容?三年折旧和六年折旧算出来的卡时成本能差近一倍,而这与工程能力毫无关系。

这也解释了为什么我们主张开放成本归因给园区审计(§6.2)——把吞吐、利用率、卡时单价三项拆开摆出来,才是真正可比的口径。愿意接受这种拆解的供应商,成本优势才是真的。

4.5 价格战已经结束了:2026 年出现反向涨价

上一节说「补贴不可持续」还只是推论。2026 年它已经变成事实了

时间事件幅度
2024-05DeepSeek-V2 与豆包接连发布,引爆价格战,主流厂商当月集体跟进降幅 80%–97%,部分轻量模型直接免费
2024 全年行业平均毛利率约 −80%
2025 全年降价基本停滞,顶级模型价格趋稳;行业平均毛利率收窄约 −30%
2026-03出现反向涨价:智谱 GLM-5-Turbo 较上代平均涨约 83%;腾讯云自研模型 API 涨幅一度达 463%17 家厂商中超七成在涨价涨价后智谱调用量不降反升
2026-08-17DeepSeek 启用峰谷分时定价:同一模型高峰时段价格为空闲时段的两倍变相涨价,且高峰期限流概率同时上升
这张表在会谈中的分量

它把「今天的低价不可持续」从预测变成了已经发生的事实如果园区的预算规划建立在 2024–2025 的价格水平上,那么这个假设已经失效了。而峰谷分时定价还带来一个隐性成本:高峰时段不仅贵一倍,算力也更紧张,限流概率随之上升——对 Agent 类长任务尤其致命,因为它们无法把调用推迟到夜间

供给侧的方向性压力也没有缓解,而且算力租金本身也在涨——这是「靠补贴维持低价」越来越难的根本原因:

标的价格变化出处
H200 国内租金时租 7.5–8.0 元/卡时,月租 6.0–6.6 万元,涨幅 25%–30%;交付周期延至 2027Q2开源证券,2026-03-08
H100 国内租金月租涨至 5.5–6.0 万元,涨幅 15%–20%同上
H100 海外一年期合约1.70 → 2.35 美元/小时(2025-10 → 2026-03),累计涨约 40%SemiAnalysis,开源证券引
B200 续约价2.63 → 5.10 美元/小时(2026-10 生效),+94%Baseten,国金证券引
内存2026Q1 价格环比涨 80%–90%;HBM3E 供应价上调近 20%;2026 年 HBM 供需比降至 7%Counterpoint / TrendForce,山西证券引

开源证券的判断:「截至 2026 年,算力短缺态势将至少维持 1–2 年;受 HBM 高带宽内存、先进封装产能瓶颈制约,高端 AI 服务器整机交付周期延长。」需要诚实说明的是:目前没有任何一份研报做出「HBM 涨 X% → 单位 Token 成本升 Y%」的定量传导测算,所以这一段只能作方向性论证,不要给出具体的成本上升百分比。

图 4-2 Token 售价与算力成本的反向运动
售价快速下行、硬件与内存成本上行,两条线的夹角就是供给侧的亏损。亏损缺口只有两种收敛方式:涨价,或者把单位成本真正做下来。
Token 售价(快速下行) 加速卡与内存成本(上行) 缺口 时间 → 相对水平 这个夹角越大,靠补贴维持低价的压力越大 而工程降本是唯一能同时对冲两端的手段

两端的具体表现:

这张图在会谈中的用法

它把「我们的优势可持续」从一句主张变成一个趋势判断:剪刀差越紧,靠补贴打价格战的玩家越撑不住,而靠工程降本的能力就越值钱。对园区的含义是:现在锁定一个成本可审计的合作方,比继续在补贴市场里比价更安全。

4.6 工程降本不是概念:三组公开可查的量级

如果有人质疑「优化到底能带来多少」,用这三组公开数据回答,它们分别来自论文、开源社区复现和硬件厂商:

来源发现量级
vLLM / PagedAttention 论文论文 测得既有推理系统的 KV 显存有效利用率仅 20.4%–38.2%(即 60–80% 被浪费);改进后浪费降至 4% 以下 吞吐提升 2–4 倍
LMSYS 公开复现社区 在 96 张 H100 上的公开部署实测每百万输出 token 成本 0.20 美元,约为同期官方 API 定价的 五分之一
硬件厂商口径待核 Token 即服务(TaaS)形态相对裸机小时租赁的价值倍数 8.5 倍(引用前建议核实原始表述与口径)
模型厂商自身披露官方 见 §2.2:全集群平均单卡输入输出合计约 4,951 token/s;成本占理论收入 15.5% 成本仅为挂牌价的 约六分之一

前两条与第四条是本报告中置信度最高的证据,建议作为会谈的主力论据;第三条置信度较低,非必要不引用。

第四组:利用率——先把两个「利用率」分开,否则会被专业人士当场纠正

这一节要特别小心,因为公开数据看起来是矛盾的:一边是「智算中心普遍闲置」的说法,一边是上市公司自报的高利用率。两者其实不冲突,但混用会立刻暴露外行。

口径含义公开数据
出租率 / 上架率
商业口径
卡有没有被租出去、机柜有没有上架。租出去就算数,不管租户跑没跑满 并行科技 85%–90%、优刻得 100% 满租、首都在线约 85%、协创数据 95%–100%、中国联通 2026H1 资源利用率超 74%
实际计算利用率
技术口径
卡在被租用的时间里,到底有多少算力真正在产出 腾讯云张晋在 MWC 上海 2026 称国内智算中心 GPU 平均利用率不足 30%,归因为效能系数平均仅 0.6、满载系数平均仅 0.5
这个差额就是我们的全部空间

卡租出去了八成五,真正在算的可能不到三成。中间那一大段既不体现在供应商的出租率报表上,也不会被租户察觉——它只体现在租户的账单上

会谈中的用法:「供应商的 KPI 是出租率,你们付的却是计算结果。这两个指标之间的落差,没有人对它负责——除非有人的收入直接挂在它上面。

诚实起见需要说明:2025–2026 年的券商研报中,没有一份给出全国存量智算中心(尤其地方国资建设的中小集群)实际计算利用率的系统性抽样。可引用的只有上面那个单点表述与下面这些定性判断。因此会谈中不要把「利用率不足 30%」当成行业普查数据来讲,要说清它的出处和口径。

券商对低效原因的定性判断(可引用)

东吴证券:「传统智算中心管理模式粗放,包括整卡或固定单元分配颗粒度粗、网络延迟、算法与硬件适配不充分,导致算力空转。」

最有力的那条:结构性错配

开源证券:「训练集群如果用来推理会采用同构 GPU 统一处理两阶段任务,解码阶段算力资源利用率低下……以训练标准建设的集群承载推理任务,硬件投入与有效算力产出严重错配,单位推理成本大幅抬升。」这正是 §6.5 讲 PD 分离的理由。

「有效算力」正在成为行业共识

东吴证券:「同样标称为 1P 的算力,在不同计算精度、芯片架构、显存容量、集群互联和软件框架下,实际模型产出可能存在较大差异。客户真正需要的不是理论峰值,而是……能够稳定运行的有效算力。」

消纳风险的定量实证

东吴证券披露软通动力怀来项目:「公司当前接洽潜在需求约 1300P—1600P,仅覆盖新增产能约 39%—48%……利用率偏低可能导致折旧和运维成本压制利润。」这是目前唯一可查的、具名项目的消纳缺口数字。

4.7 引用前必须复核的清单

本轮已补齐一批原文级数据,但仍有条目需要回原始文件定位。下表按可用程度分三档,会谈中优先使用第一档。

档位条目状态
可直接用 潞晨科技停服公告与尤洋公开测算(2025-02/03);智谱、MiniMax、云知声三家招股章程原文(已定位页码)硅基流动、基流科技招股书原文(已定位页码);DeepSeek 官方推理成本披露(§2.2);2026 年反向涨价与峰谷定价;A 股八家折旧年限(§4.4) 均有公开可查的一手出处(公司公告、年报、官方技术博客、厂商定价页)
口径可靠、需定位页码 硅基流动 2025 年营收 5,533 万、毛利率 −24.0%、公有云 −119.0%、年内亏损 3.45 亿、月均现金消耗 1,480 万;PPIO 三年累亏 5.68 亿与 AI 云业务毛损 来自招股书公开解读,正式引用前需回港交所披露易招股书原文定位章节与页码
尚未复核 智谱 FY2025 全年 MaaS 毛利率是否回升至 18.9%(与招股书 1H2025 −0.4% 冲突,需回 FY2025 年报确认);国金证券「Token 专业运营服务商」四阶段模型(3.0 阶段 50%+、裸机架 20–30%)的报告标题与原文表述;硬件厂商 TaaS 约 8.5 倍的原始出处;内存与加速卡成本上行的幅度预期 仍在检索中(券商研报库与交易所披露原文两路并行)。这些条目在补齐之前,会谈中只作定性表述,不报具体数字。

另一项已知缺口:模速空间算力生态超市的全部效果数据(接入企业数、调用量、利用率、续约率)运行一年半仍无任何公开披露(§3.4)。这既是对手的软肋,也提醒我们——我们自己的平台从第一天起就要把这些数字做出来并敢于公开,否则三年后会站在同样的位置上。

CHAPTER 05 · THE CHANNEL为什么走平台:渠道逻辑与工研院的四项诉求

客户是下面的企业(第 8 章逐家讲),但逐家去谈成本太高、周期太长、也拿不到聚合红利。走工研院这条渠道,是为了一次触达几十家、拿到统一入口与统一结算。代价是:我们必须先回答平台方自己的诉求——它不用 token,它要的是别的东西。这一章讲那四样东西是什么。

5.1 对平台谈价格是无效的

如果我们进门第一句是「我们的 token 更便宜」,那么我们就把自己放进了一个纯比价的场子——那里已经挤满了对手,而且他们中有些人可以亏钱卖(见第 4 章的毛利率证据)。比价场里,我们的工程优势会被压缩成一个折扣百分比,而折扣百分比是谁都能喊的。

更根本的原因是:平台自己不付这笔钱的真实代价——用 token 的是企业,感受成本的也是企业。所以对平台谈单价,等于对一个不掏钱的人谈折扣。平台的决策逻辑是「这件事能不能变成我的招商筹码、我的生态成绩、我的风险可控项」。

正确的开场,是把这一亿元从「一笔要花掉的费用」重新定义成「一次能沉淀下能力的建设」。

一句话版本

「这一亿元现在是费用,花完就没了,只在别人的账上留下收入。它可以变成园区自己的一项能力——同样的钱,园区多出一个自主可控的推理底座、一份能写进招商手册的权益、一套企业活跃度数据,而下面的企业还各自省下一笔真金白银。」

5.2 工研院用这一亿元换的四样东西

① 招商筹码:可写进招商手册的实质权益

「入驻即获得低成本推理算力配额」是极少数能立刻打动早期 AI 团队的硬权益——对一个种子期团队,推理账单往往是它前两年最大的现金支出之一。这比减免几个月房租有力得多,而且是可持续、可分级发放的(按阶段给配额)。话术落点:这不是采购,这是招商工具。

② 可对上汇报的成果:园区级自主可控 AI 底座

把分散的 API 采购变成一个建成物:园区级推理平台、国产加速器占比、服务企业数、累计 token 服务量、单位成本下降幅度。费用支出无法进考核,基础设施与降本幅度可以。话术落点:我们帮你把一笔看不见的支出,变成一个看得见、说得清、可以年年报的东西。

③ 一手数据:园区 AI 活跃度看板

token 消耗曲线是企业真实业务活跃度最灵敏的指标——比工商数据、比融资新闻、比企业自报都灵敏。哪家在放量、哪家停了、哪家在做多模态、哪家在跑 Agent,平台一目了然。这对招商筛选、投资决策、政策资源分配都是直接输入。话术落点:平台不掌握这个数据,就等于把自己企业的体征交给了外部供应商。

④ 预算效率:同样的钱办更多事

按第 2 章的算术,工程杠杆带来的成本改善是倍数级而非百分比级。落到园区账面上有两种花法:同样一亿元支撑更大的 token 规模(服务更多企业),或压缩支出把预算腾给别的科目。两种都是可量化的政绩。话术落点:把节省额做成分成结构,园区零风险。

这四项里,只有第四项是价格问题,其余三项都是价格之外的。这意味着我们完全可以不在最低价的位置上赢下这个单子——只要另外三项是别人给不了的。而它们恰好都需要一个愿意长期驻场、做深度定制、并把平台侧数据与控制权交还给园区的技术方,这正是转售型对手的结构性短板。

5.3 平台能解决、而企业自己解决不了的三件事

这一节看起来琐碎,但它决定了「为什么必须由平台牵头」这个问题的答案。下面三件事,每一家企业单独都办不成,聚在一起就能办成——这正是渠道存在的理由。

企业侧的现实约束单打独斗为什么解决不了平台统一之后怎么解
峰谷浪费 单家企业的推理负载极不平稳——白天调试、夜间空转、演示前打满。自己买卡必须按峰值备容,平均利用率注定很低;买公有云则要为调度不确定性付溢价 几十家负载叠加后峰均比显著收敛(§2.5)。这是纯粹的统计规律,只有聚合才能兑现,也是平台唯一无法被单点供应商复制的优势
议价能力 一家种子轮公司每年几十万的 token 支出,在任何供应商那里都拿不到条款,只能接受挂牌价与标准合同 聚合成亿元级采购方之后,议价能力完全不同(§1.8)。更重要的是能谈条款:后付费、不设最低消费、成本透明——这些是小客户永远谈不到的
补贴申领 政策条款复杂、批次固定、材料繁琐;一家几个人的创业公司通常没有精力研究,很多该拿的钱就没拿 由服务商代客统筹申报(§7.3),补贴直接冲抵账单。企业不用懂政策,也不用跑流程

这个判断有行业研究支持。《中国词元工厂发展全景洞察与深度分析报告(2026)》在给企业的建议中直接写道:「中小厂商独立获客、运维、结算、合规的成本极高,很难形成规模化收益。」同一份报告同时警告「理性扩产,盲目扩产容易造成算力闲置与现金流压力」。前一句说明为什么企业需要平台,后一句说明为什么平台不该自己盲目建集群——两句合起来正好是我们建议的形态:平台聚合需求,我们负责把成本做下来,谁都不用重资产押注。

还有一个增量论点,比省钱更有吸引力

降本只是把已有的支出花得更省。而私有化部署与数据不出域,打开的是原本根本无法上云的那部分需求——医疗影像、临床数据、涉密科研、金融风控,这些场景今天不是嫌 API 贵,是压根不能用(科学引擎、观壹科技、数元纪都卡在这里,见 §8.1)。这部分需求一旦被释放,园区的 token 总量会往上走而不是往下走。

对工研院而言,这个论点的吸引力高于省钱:它对应的是新增的产业活动,而不是削减的支出。

CHAPTER 06 · THE EDGE我们的优势:七项,每一项都能被检验

这一章把「我们为什么有优势」写成可核验的清单。判断标准很简单:每一条都必须能回答「凭什么是你,而不是别人」,并且能在第一段测试里被验证或被推翻。凡是做不到这两点的说法,都不写进来。

6.1 优势的来源:我们动的是分母

这个判断不只是我们的

硅基流动招股书行业概览章节 p.80 的表述是:AI基礎設施層的競爭重點正從單純囤積算力資源,轉向比拼詞元生產效率。

换句话说,本章要讲的「动分母」不是一个另类主张,而是这一层正在发生的路线切换。区别只在于谁真的做得到。

回到 §2.1 的恒等式。整个赛道的竞争几乎全部发生在分子上——比谁的采购价低、比谁拿到的补贴多、比谁愿意亏更多。分子上的优势有两个致命特征:人人可比,且不可持续

图 6-1 单位 Token 成本的归因树:优势必须落在灰色以外的地方
灰色分支是采购与资本能力(人人可比,且我们不占优);蓝色分支是工程能力;橙色分支是园区形态特有的结构红利。我们的全部主张都落在后两者上。
单位 Token 成本 元 / 百万 token 卡时成本(分子) 采购议价 · 补贴 · 折旧年限 人人可比,且我们不占优 ——不在这里竞争 单卡有效吞吐 算子与融合 · 图模式 分页显存 · 批处理调度 量化 · PD 分离 · 专家并行 纯工程能力 §6.2 §6.3 §6.4 集群利用率 需求聚合 · 峰谷互补 · 混部 园区形态特有的结构红利 §6.5 只有园区自己能创造 两条可动的分支各有 2–3 倍空间 合起来是倍数级,且相互独立 这是补贴给不出来的量级

6.2 优势一:成本下降来自工程,因此可持续、可承诺、可审计

这是所有优势的根。补贴型低价的问题不在于低,而在于它无法被写进一份需要执行三年的合同——它的提供方随时可以调整,且通常在客户迁移成本最高的时候调整。工程型低成本相反:它一旦做出来就固化在系统里,因此我们敢做三件转售方做不到的事。

我们能做的承诺为什么转售型做不到
单位 token 成本与吞吐、利用率指标写进合同并接受核验它的成本是上游的定价,自己无从承诺,只能承诺折扣率
成本归因开放给园区审计(吞吐多少、利用率多少、卡时多少)开放归因等于暴露加价空间
随成本下降主动调价并写入调价机制降价直接削自己的毛利,只能被动跟进

在会谈中,这一条的表达方式很重要:不要说「我们更便宜」,要说「我们的便宜可以被审计」。后者是前者的三倍说服力,而且是对方从别处听不到的句子。

6.3 优势二:自租算力 + 自建推理栈,不做 token 二道贩子

要动分母,必须同时握住硬件与软件两端:只有算力没有优化能力,就只能卖裸卡时;只有优化能力没有算力,优化收益全部归硬件持有方。我们的模式是自己租算力、自己建推理栈,因此工程收益直接落在自己的成本表上,可以决定让出多少给客户。

这一条同时解释了一个常被问到的问题——为什么我们不用「拿到某家更低的进货价」来竞争。因为那条路上,我们的成本上限永远等于别人的定价下限。

6.4 优势三:推理工程的具体能力清单

这一节是能力的实指,会谈中只在对方追问时展开。每一项都对应吞吐或利用率上的具体收益来源。

引擎适配与算子补齐

主流推理引擎在目标硬件上的落地与算子覆盖:缺失算子的补齐与融合,避免回退到低效实现或落到主机侧执行造成图被打断。算子回退是国产加速器上吞吐损失最常见的单一原因。

显存管理与批处理调度

分页式 KV 缓存消除碎片、前缀复用消除重复计算、连续批处理提高在线批量、分块预填充避免长请求阻塞短请求。批量上不去,解码阶段的带宽就用不满,卡再快也没用。

量化与压缩(含长上下文回归)

权重与激活量化、KV 缓存量化,配套校准与回归评测。关键在于把长上下文准确率纳入验收——压缩手段在短请求上几乎看不出损失,在长上下文上却可能大幅掉点,这是行业里最常见的隐性质量事故。

部署架构:预填充/解码分离与专家并行

两个阶段的资源特性完全不同(一个算力受限、一个带宽受限),分离部署后可各自独立扩缩;MoE 模型上的大规模专家并行与通信优化。这是把单卡吞吐推到高位的主要手段。

编译、图模式与主机侧瓶颈消除

静态化与算子融合、图执行、下沉执行以减少主机与设备之间的往返;绑核与调度优化。小算子密集的模型上,主机侧空转常常吃掉两位数百分比的算力。

指标口径与成本核算

首字延迟、单 token 延迟、吞吐、利用率四项统一口径与持续采集,直接换算成单位 token 成本。没有统一口径,降本就无法证明,也无法定价。

6.5 优势四:四项决定吞吐上限的进阶能力

§6.4 是基本功,这一节是分水岭。面对同样在做推理优化的对手(第 3 章已说明这个赛道里确实有),能不能把下面四项讲清楚、做出来,是「会用引擎」和「能改引擎」的区别。它们共同决定了单卡有效吞吐的天花板,也就是 §2.1 恒等式里最难动的那一项。

① 大规模专家并行(大 EP)

MoE 模型解码时,每个 token 只激活一小部分专家,但如果所有专家都放在同一张卡上,每生成一个 token 仍要把全部专家权重读一遍——带宽被白白吃掉。大 EP 把专家分散到几十上百张卡,每张卡只驻留少量专家,单卡的权重读取量因此骤降,解码吞吐可以成倍提升。

行业公开参照:DeepSeek 在其线上推理系统中,预填充与解码分别采用 EP32 与 EP144 的专家并行度,全集群平均折算下来单卡输出吞吐约 1,072 token/s(§2.2 的反推)。这个量级不是靠买更好的卡得到的,是靠并行策略。

真正的难点有三个,每一个都需要工程投入:专家负载不均(热点专家把某几张卡打满、其余空转,需要冗余专家与动态重排)、all-to-all 通信开销(分发与聚合的通信量随并行度上升)、通信与计算的重叠(双批次交错执行,把通信时间藏进计算里)。

② MoE 特有的调度与放置

MoE 不只是「换个模型」,它带来一整套新的工程问题:路由不均衡导致的长尾延迟、热点专家的识别与复制、token 丢弃策略对质量的影响、专家放置与网络拓扑的亲和性。这些在稠密模型上完全不存在,也是很多团队把 MoE 跑起来之后吞吐远低于预期的原因。

③ Megakernel(超大融合核)

常规实现里,生成一个 token 要依次启动几十个独立的计算核,每次启动都有固定开销,中间结果还要反复往返显存。Megakernel 的做法是把整个解码步骤融合成一个持久化的核,消除启动开销与中间往返。

收益集中在小批量、低延迟场景——也就是交互式应用最在意的那一段。在国产加速器上这一项尤其值钱,因为这类平台的主机侧调度开销与核启动成本通常比成熟平台更高(§6.6 编译与执行层那一行),消除掉的绝对时间更多。

④ 预填充与解码分离(PD 分离)

预填充阶段是算力受限(一次处理整段输入),解码阶段是带宽受限(每次只出一个 token 却要读全部权重)。两者混在同一批卡上会互相干扰:一个长输入的预填充会阻塞正在解码的请求,造成单 token 延迟剧烈抖动。

分离部署之后,两类节点可以各自独立扩缩、各自选择最优的并行策略,甚至各自匹配不同的硬件。公开测得的收益量级:DistServe 报告有效请求承载能力提升约 7.4 倍,Mooncake 报告有效吞吐提升约一倍以上。

代价是 KV 缓存要跨节点传输,对互联带宽提出很高要求这一点恰好指向国产超节点形态的长处——高带宽域内的大规模互联正是它的设计目标,所以 PD 分离在国产平台上不是妥协,反而是顺势而为。

这四项做到位之后,指标长什么样

MiniMax 在其招股章程中自述推理 MFU 大于 75%,并明确对照「顯著高於行業約 40% 至 50% 的平均水平」。同期其「开放平台」业务毛利率 69.4%,而销货成本中推理相关的云计算成本占 92.7%–96.9%——推理效率几乎等同于它的全部成本结构。

反过来看智谱:云端部署毛利率从 76.1% 一路跌到 1H2025 的 −0.4%,其招股书给出的翻身路径正是「提升推理效率……預期單位計算資源消耗及相應的單位推理成本將下降,其預期推動我們雲端解決方案的毛利率提升」。

行业平均 MFU 40%–50%,做得好的能到 75% 以上。这个差距就是本节四项能力的收益空间。

这四项在会谈里怎么用

不要主动讲,但被问到「你们和别人的优化有什么不同」时,这就是答案。四项合起来传递一个信息:我们不是在调参数或换引擎版本,而是在改并行策略、改算子融合方式、改部署架构——这是能改引擎的团队和会用引擎的团队之间的差别。

配合一句收口:「这四项每一项都有公开论文和公开数字可以对照,我们愿意在同题同压的测试里把它们一次跑出来给你们看。」

6.6 优势五:国产加速器推理的深度——把瓶颈说清楚,再说怎么补

这是我们与绝大多数对手最实质的分野,也是园区在政策上真正需要有人替它承担判断的地方。国产加速器在推理上的差距,主要不在峰值算力;差距集中在软件栈的成熟度,而软件栈是可以靠工程补的。

层次具体瓶颈直接后果可补的方向
算子层算子覆盖不全、缺少针对性融合算子;部分算子实现未按硬件的存储层级与数据搬运特性调优回退到通用实现或主机侧执行,计算图被打断,融合收益丢失补齐关键算子、按片上缓存容量做分块与双缓冲、把访存与计算重叠起来
显存与调度层KV 缓存分页管理不成熟、碎片化严重;连续批处理与分块预填充能力弱并发批量上不去,解码阶段带宽利用率低;长请求阻塞短请求,首字延迟抖动大引入分页 KV 与前缀复用、重写批处理调度策略、分块预填充
通信层集合通信原语在特定形状与拓扑下效率不足;MoE 的专家间通信开销高多卡与多节点扩展效率随规模衰减,专家并行难以推到高并行度按拓扑选择算法与缓冲区参数、通信与计算重叠、优化专家路由与分发
编译与执行层动态形状支持不完善、图模式覆盖有限、主机侧调度开销大小算子密集的模型上主机侧成为瓶颈,设备大量空转图捕获与静态化、执行下沉、绑核与队列优化
精度与工具层迁移后的数值一致性验证工具链不完善;量化校准与评测生态缺口迁移后精度问题定位困难,团队不敢上生产逐层比对(余弦相似度与最大绝对误差双阈值)、建立回归评测集

团队在国产加速器的芯片架构与算子层有一线工程经验,这是上表中「可补的方向」一列能够落地的前提。在会谈中,这一条的价值不在于展示技术,而在于让对方确认:园区的国产化率要求可以由一个真正懂这一层的人来兜底,而不是变成一次赌注。

先看一句竞争对手写在自己招股书里的话

硅基流动在港交所申請版本业务章节 p.143 写道:

「我們已開發出將領先的AI模型適配並部署於國產芯片的能力,該等芯片的租賃成本大幅低於基於NVIDIA GPU的基礎設施。」

同一页还写道:「在早期發展階段,我們優先考慮運營靈活性,採用短期、按需租賃方式獲取算力資源,但該模式的單位成本高於長期合作安排。」

这是一家正在冲刺上市的同业,在需要承担法律责任的文件里,替「国产卡成本更低」和「算力采购方式影响单位成本」这两件事作了证。会谈中引用它,比我们自己说一百句都有用。

一个可以直接引用的国产卡实测数据点

国金证券 2026-07-17 报告披露:弘信电子旗下燧弘华创 Token 工厂落地无锡高新区,首期部署 4 台昇腾 384 超节点服务器、合计 1,536 卡国产算力集群;经实测,该集群的 Token 生成性能超过传统英伟达同规模算力集群 1.2 倍

对照另一组数据:SemiAnalysis 与 Counterpoint 测算国产旗舰芯片单卡实测性能约为 H100 的 60%(开源证券 2026-08-25 引)。

这两个数字放在一起,才是我们要讲的故事

单卡性能只有六成,集群 Token 产出却能反超两成。差额全部来自系统架构与软件工程——超节点的高带宽互联、并行策略、调度与算子优化。这正是我们主张的东西:在国产平台上,工程能力的杠杆比硬件差距更大。

会谈中的用法:「国产卡单卡确实还差四成,这个我们不回避。但集群层面已经有反超的公开实测了,靠的不是芯片,是把整套系统调对。这件事有人能做,有人做不了——差别就在这儿。

给园区的方案表述

不承诺「国产卡全面替代」,而是混合架构 + 逐季度台阶:把当期确实适合的负载放到国产加速器上,其余留在其他硬件,由平台统一调度、对上层企业完全透明——企业只看到一个统一的接口,看不到底下是什么卡。国产化占比因此成为一条可统计、可承诺、可逐季度上调的平台指标。这个表述同时满足了政策要求与风险控制,是园区最容易签下去的形态。

6.7 优势六:园区聚合调度——唯一不可复制的那一项

§2.5 已给出统计依据:几十家企业的负载叠加后峰均比显著收敛,按峰值备容时的平均利用率上限从不到四成抬到接近八成。这里补充两点会谈中要强调的:

6.8 优势七:交付的是平台能力,不只是 token

最后一项优势不在技术侧,而在交付形态。第 5 章列出的四项价值——招商权益、可汇报的建成物、活跃度数据、预算效率——都要求供应商愿意做三件标准化产品不愿做的事:驻场做深度定制、把平台侧数据与控制权交还园区、不用锁定条款做护城河

我们愿意做,原因不是姿态好,而是这三件事与我们的商业模式并不冲突:护城河在成本曲线上。只要单位成本持续比别人低,就不需要靠合同锁住任何人;反过来,需要靠锁定生存的供应商,恰好证明了它的成本没有优势。

这一章可以用一句话收口

「同一个赛道里,我们和多数人赚钱的方式是相反的:他们的利润来自差价,所以降价伤自己;我们的利润来自成本下降,所以降价只是把已经拿到的工程收益让出一部分。这就是为什么我们敢把成本写进合同、敢开放归因给你审计、也敢不要排他。」

CHAPTER 07 · POLICY LEVERAGE政策杠杆:上海已经把这条路铺好了

这一章是本次调研里最有价值的发现。「园区级 Token 平台 + 统一补贴申领」不是我们的创新,而是上海市政策文件里已经写明的机制——包括一个专门为 token 消费设立的补贴品类,以及一条允许服务商代客户统一申报的通道。会谈中把这一章讲清楚,可信度会有质的变化。

7.1 一个关键事实:「模型券」已在 2026 年正式改名为「模型券(Token 券)」

母政策是《上海市进一步扩大人工智能应用的若干措施》(沪经信智〔2025〕489 号,2025-07-28)。到 2026 年度实施口径时,文件名称发生了一个值得注意的变化——《关于组织 2026 年度上海市「模塑申城」工程相关补贴申报工作的通知》(沪经信智〔2026〕248 号,2026-04-30)中,「模型券」被正式表述为「模型券(Token 券)」

这意味着在政策语言层面,Token 消费已经成为一个独立的、被命名的、有专项资金的补贴品类。这与国家层面的方向一致:工信部《关于开展普惠算力赋能中小企业发展专项行动的通知》(工信厅通信〔2026〕14 号,2026-04-02)明确提出「推行按『卡时』『核时』及 Token 计费等灵活付费模式」,并探索「算力银行」「算力超市」等业务形态。

7.2 三张券与两级配套:可叠加的额度清单

层级 / 品类补贴口径上限出处
市级 · 模型券(Token 券)调用非关联方云平台部署的第三方大模型 API 产生的费用,采用第三方大模型私有化部署方式推进垂类应用核定合同额最高 50%最高 500 万元;专项总额 3 亿元沪经信智〔2025〕489 号
市级 · 算力券租用智能算力市级最高 30% 租金补贴;按「补早补小」原则市区协同可给予最多 1 年、最高 100%;自建自主智算设施最高 10% 建设支持;专项总额 6 亿元沪经信智〔2025〕489 号
市级 · 语料券购买非关联方语料最高 30%,最高 500 万元;总额 1 亿元沪经信智〔2025〕489 号
徐汇区 · 算力支持实际算力投入不超过 30%,单个主体年度最高 2,000 万元(较 2024 版的 1,000 万元翻倍)《徐汇区关于推动人工智能产业高质量发展的若干意见》,2025-05-31 起试行两年
徐汇区 · 平台类支持对产业链上下游企业技术提升有突出支撑带动作用的平台,经分类认定最高 2,000 万元同上
徐汇区 · 市级项目配套对通过市级以上专项资金支持的项目最高按 1:1 比例配套《徐汇区支持西岸人工智能大模型科创街区的扶持意见》

申报节奏:2026 年度全年 4 批次,每季度首月受理,通过 zxzj.sheitc.sh.gov.cn 在线申报,区主管部门初审后一周内报市经信委。关键限制:「申报项目须未获得其他市级财政资金补贴支持」——同一市级资金不可重复申领,所以叠加设计必须区分市级与区级、区分品类,不能简单相加。

7.3 真正的支点:政策明确允许「服务商代客统筹申报」

这是本章最重要的一条。沪经信智〔2026〕248 号在算力券与模型券两处都写了同一个机制:

沪经信智〔2026〕248 号 原文(节选)

算力券:「算力租用单位可选择自主申报,或由算力服务商经『市级智能算力资源统筹调度服务平台』统筹申报。……入驻 AI 小镇的单位,可通过小镇生态运营公司统筹申报。」

模型券(Token 券):「模型使用单位可选择自主申报,或由模型服务商经『市级智能算力资源统筹调度服务平台』统筹申报。入驻 AI 小镇的单位,可通过小镇生态运营公司统筹申报。」

这一条为什么是支点

它意味着两件事同时成立:(一)作为「模型服务商」,我们可以代入驻企业统一申报 Token 券;(二)作为园区,工研院侧的运营主体也可以统筹申报。
换句话说,「园区统一入口 + 集中申报补贴」这个方案形态,是政策文件亲自设计并鼓励的路径,不是我们编出来的商业模式。这句话在会谈中的分量很重——它把我们的方案从「一个供应商的提议」变成「对既有政策通道的正确使用」。

对入驻企业而言,这还解决了一个现实痛点:几十家早期公司各自去研究政策、准备材料、跑四个批次的申报,绝大多数根本不会去做。统一申报把这件事变成园区的一项服务,企业侧零成本受益。

7.4 一个必须满足的前置条件:接入市级统筹调度平台

《上海市关于促进智算云产业创新发展的实施意见(2025—2027 年)》(上海市经信委,2025-03-26)里有一条容易被忽略但直接决定补贴资格的条款:

原文

对调用纳入本地统筹调度的智算云服务创新主体,经评估对服务采购金额给予一定比例的算力补贴。

也就是说,接入「市级智能算力资源统筹调度服务平台」是拿到算力补贴的前置条件。这对我们的方案设计是一条硬要求,也是一个正面卖点:我们主动承诺完成这项对接,园区就同时获得了补贴资格与合规的统筹申报通道。同一份文件的其他目标也与我们的定位一致:

200 EFLOPS
2027 年上海智算规模目标
>70%
其中自主可控算力占比要求
2,000 亿元
2027 年上海智算云产业规模目标
120 EFLOPS
2025 年底上海实际规模,占全国约 8%
国产化在这个客户身上是硬门槛,不是加分项

市级规划要求 2027 年自主可控算力占比超过 70%;交大自己又把「全国高校最大的国产智算基础设施」当作对外宣传口径(§1.6)。两者叠加意味着:在这张桌子上,国产加速器适配能力不是我们的差异化亮点之一,而是入场资格。§6.6 那一节的深度因此不是锦上添花,是必需品。
反过来说,这也是我们最大的结构性优势——能把国产卡推理真正做出可用性能的团队非常少,而这个客户必须找到一个。

另需说明:网传「党政信创 2025 年国产化率 80%」一类说法来自市场分析文章而非政府文件,不建议在会谈中引用。可引用的硬口径就是上面这份 2027 年 70% 的市级规划。

7.5 结算通道:平台签框架,企业按量领用

Token 按量结算最容易卡住的地方是财务流程,不是技术。而这里要处理的是企业侧的财务现实,不是机关单位的采购流程——我们的付费方是几十家创业公司,它们决策快、没有招标负担,但有另一组约束:

① 预付与最低消费是初创企业最大的摩擦

公有云 MaaS 普遍要求预充值,额度用不完也退不回;企业方最怕的是现金被锁在账户里。我们可以反向设计:后付费、按月对账、不设最低消费、不收预付押金这一条对种子轮与天使轮企业的吸引力,往往超过单价便宜一成。

② 票据与主体统一

企业向多家境内外供应商分别付费,币种、票据、主体各不相同,海外模型调用的入账尤其麻烦(Wisdom AI 与深光地球都主打海外市场)。平台统一签约、统一开票,把 N 份票据问题压缩成 1 份。开票科目建议按「信息技术服务 / 技术服务费」,而非「设备租赁」。

③ 额度管控与分账

平台侧最需要的是按企业分账、按配额发放、可实时查看:哪家用了多少、还剩多少、超了怎么办。这既是财务要求,也顺带交付了第 5 章讲的活跃度看板。

这套结构的双重作用

「平台签框架 · 企业按量领用 · 统一开票 · 按量分账」——对平台是省事,对企业是省钱且省心,对我们是一次签约触达几十家客户。而 §9.3 的代客统筹申报可以直接挂在这套结构上:企业不用自己研究政策、不用自己跑申报,补贴由我们统一代办后直接冲抵账单。这是我们对企业端最有效的获客钩子,比单价折扣更难被复制。

7.6 别的地方已经这么干了:三个可直接引用的先例

工研院最可能的顾虑之一是「园区统一做 Token 平台,有没有人做过」。有,而且已经写进地方政策文件。把这三个先例摆出来,这件事就从「一次冒险」变成「跟上进度」。

武汉硚口区 · 与我们的场景最接近

全市首个 Token 经济政策,以「Token 普惠共营」为核心。十条措施中包括:对创业企业的算力服务费按 50% 补贴、每年免费提供 50P 以上算力、推行数据券机制。落地「星火众达 Token 工厂」与「CSDN 龙虾工厂」,集中签约首批 16 个特色社区,形成「政策 + 工厂 + 社区」微生态闭环这就是园区级 Token 平台的完整模板。

北京数据集团「京算 Token 工厂」· 国资平台范式

其商业模式表述值得逐字记住:「彻底摒弃了『卖硬件』或『卖机柜』的传统思路,转而交付标准化的 Token 和 API 成品能力,按实际消耗计费……将底层硬件采购、集群运维的风险和复杂性全部转移至平台方。」七大核心能力中明确包含 PD 分离智能调度、全栈推理加速、异构算力统一调度注意最后这条:我们在 §6.5 主张的技术路线,已经是国资平台的公开选型标准。

贵州 / 广东 · 补贴与标准两条线

贵州 20 条专项政策:单企业最高可获百亿级词元且不超过 50 万元的词元补贴;购买本省算力按服务金额 30% 给予激励。广东 2026 年 6 月印发促进词元经济六大措施,目标 2027 年底成为全国词元供给高地,并建设省级词元交易专区说明「词元」已经是省级政策语言,不是我们的生造概念。

还有一条定名依据可以在开场时顺带提一句:2026-03-23 国家数据局局长刘烈宏在中国发展高层论坛正式将 Token 的中文名定为「词元」,并定位为「智能时代的价值锚点,是连接技术供给与商业需求的结算单位;2026 年 4 月国家数据局的征求意见稿进一步提出「探索词元交易等新型交易模式」。把 token 说成「结算单位」而不是「技术指标」,正是我们希望对方接受的框架。

7.7 两个必须现场确认的政策要点

要点情况影响
申报主体的口径
(大概率对我们有利)
沪经信智〔2026〕248 号对申报主体的表述是「在本市依法经营并具有独立承担民事责任能力的单位,经营状态正常,信用记录良好,财务制度健全」——措辞明显偏企业口径 由于我们的付费方本来就是企业,这个口径天然吻合。方案应直接设计为以入驻企业为申报主体、由我们作为模型服务商统筹申报,不必绕道平台。仅需确认平台代办是否需要额外授权文件
「非关联方」如何界定 模型券要求调用的是「非关联方」云平台部署的第三方大模型。若平台运营主体与我方或与入驻企业存在股权关系,是否构成关联交易,无公开细则 直接决定补贴能否申领,也影响我们与园区之间是否适合采用合资或股权合作的形态。建议在设计股权结构之前先问清

主管部门口径(供核实用):徐汇区新工办人工智能智能科(64872222-1041);徐汇 AI 小镇的「生态运营公司」具体主体未在文件中披露。这两点建议由我们主动提出并建议共同向主管部门确认——主动指出对方方案里的政策不确定性,是建立专业信任最快的方式之一。

CHAPTER 08 · THE ACTUAL CUSTOMERS客户画像:A 层企业逐家怎么切

工研院是渠道,真正付钱、真正用 token、真正决定这件事成不成的是下面的企业。这一章把 A 层的重点企业逐家过一遍:各自的推理负载长什么样、最在意什么、第一句话该说什么,最后给一个切入顺序。这份清单是整份材料里唯一可以直接拿去打电话的部分。

8.1 先分清三种关系

A 层的十二家不是同一种客户,混着谈会乱。按我们能为它做什么分成三类:

① 成本敏感型(主力客户)

推理成本直接构成它的营业成本,单位成本下降就是毛利上升。沅域智能、心流直觉、Wisdom AI、深光地球对这类企业,第 2 章的算术就是全部说服力。

② 合规约束型(样板客户)

数据不能出域是硬约束,今天很多业务根本不敢上公有云。科学引擎、观壹科技、数元纪科技对这类企业卖的不是便宜,是「原本不能做的现在能做了」。

③ 同层生态型(伙伴,也是客户)

做的是相邻层次,可以互为供需。基元律动、EvoKernel对这两家绝不能用竞争姿态开场,见 §1.6。

8.2 逐家画像与开场话术

沅域智能 · 建议第一个谈

负载形态自进化游戏世界模型,一键生成可交互 3D 场景。多模态生成,单次推理极重;短期做 B 端 API 服务,批量离线与在线交互混合
最在意单次生成成本、交互式场景下的生成延迟、游戏工作室批量调用时的峰值弹性
为什么是首选生成类负载的成本曲线最陡,优化收益最大也最容易被测出来;且他们已经在对外提供 API,说明口径清晰、有真实流量样本可用于同题同压对比(§10.1)
开场「你们的单次场景生成成本大概是多少?如果同样的输出质量能便宜一半,对你们的 API 定价意味着什么?」

心流直觉 · ROI 最好算的一家

负载形态具身智能底层世界模型,记忆抗遗忘与想象推演的统一架构。商业模式明确写着「项目制一体化交付与 Token 订阅双模式」
最在意他们自己按 token 收费,token 成本就是他们的营业成本——我们降多少,直接变成他们的毛利
为什么好谈不需要解释「为什么要关心单位成本」,他们的商业模式已经逼他们关心。正在推进种子轮,对成本结构的每一个百分点都敏感。
开场「你们按 token 订阅收费,那这门生意的毛利完全取决于底下每百万 token 花多少钱。这个数你们现在是多少?」

Wisdom AI(星际章鱼)· 最难说服,也最有背书价值

负载形态面向海外中小 B 的私域 AI Agent Lab,对抗式 Critic Agent 实现无人自主优化——自我迭代循环,token 消耗呈指数增长;轻量化订阅与按效果付费
最在意按效果付费意味着 token 成本是纯 COGS 且不可转嫁;面向海外,模型选型可能以境外前沿模型为主,混合单价高;明确表示无需私有化部署
注意私有化不是卖点,低单价与弹性才是。而且 CEO 从零搭建过火山方舟(§1.7)——任何营销式说法会立刻失效,直接上第 2 章的公开数据算术
开场「Critic Agent 自迭代最难的是成本不可预测。我们想聊的是怎么把非关键环节分流到便宜模型,同时把跑得起的那部分单位成本压下来。」

科学引擎 · 私有化方案的最佳样板

负载形态Science Engine 全自动 AI 科研助手(长链路 Agent)+ 多模态自进化推理模型;PANDA / HOPE 泛癌早筛管线
硬约束已采用联邦隐私计算实现院内数据不出域——这不是偏好,是医疗场景的准入条件
为什么是样板拟融资 2000 万元,预算紧但合规要求高。「用私有化的合规姿态,交付公有云的单价」正是为这类客户设计的。做成一家,其余医疗类企业可复制
开场「你们的数据不能出院,那公有云 API 这条路基本是关的。我们想聊的是在合规边界内怎么把推理跑得和公有云一样便宜。」

观壹科技 · 与科学引擎同一套打法

罕见病循证诊断智能体 DeepRare,向 Virtual Cell 与 AI Scientist 演进,长链推理与多尺度建模。项目自述为高资本消耗、长验证周期的平台型 AI for Science——高资本消耗四个字就是我们的开场理由。合规诉求与科学引擎一致,可打包成「医疗与生命科学专属推理环境」一并推进。

深光地球 · 海外部署是变量

矿业垂直大模型,自研融合视觉 Transformer 与 LLM 的跨模态大模型,配套无人机与深地传感,主打海外市场商业化落地。跨模态推理成本高;但海外部署会引出数据跨境与节点位置问题,需要先问清服务区域再谈方案,不要默认按境内方案报。

基元律动 / EvoKernel · 以供需关系开场,不以竞争关系开场

 基元律动EvoKernel
他们做什么OpenSquilla 多模型智能调度,分层路由,自述 Token 成本降低 90%;提供公有云 API 与私有化部署AI 智能体自动生成优化 GPU 算子,适配昇腾、壁仞等国产异构芯片;千算 CLI 已商用
与我们的关系路由层 × 推理层,叠乘不替代。路由决定调哪个模型,我们决定这个模型跑多便宜工具 × 端到端服务。他们产出算子,我们交付含 SLA 的推理服务
他们需要我们什么私有化部署交付需要一个高效稳定的底层推理后端自动生成的算子需要真实推理负载来验证收益——园区平台正是验证场
开场「你们把请求路由到最合适的模型,我们把选中的那个模型跑到最低成本。这两件事乘起来才是客户最终账单。」「你们生成的算子需要在真实流量上证明收益。我们手上正好会有园区的持续负载。」

第二批:数元纪科技 / 光之宇 / 千诀科技 / 观行智能

推理量中等,需求真实但不紧迫。建议在前六家做出实测数据之后再接触——那时手上有同城同类企业的真实账单对比,说服成本会低很多。观行智能与千诀偏训练与仿真,注意区分训练与推理两条线(§1.5 B 层的提醒同样适用)。

8.3 建议的切入顺序

批次企业目的要拿到的东西
第一批
对比测试
沅域智能、心流直觉产出可核验的单位成本对比数据一份真实请求样本 + 一张同题同压对比表。这是后面所有谈判的事实基础
第二批
私有化样板
科学引擎、观壹科技验证「合规姿态 + 公有云单价」这套方案一个可复制的医疗/生命科学专属推理环境交付模板
并行
生态关系
基元律动、EvoKernel把潜在竞争变成供需一份互不侵犯的层次分工共识,最好是一次联合技术交流
重点公关Wisdom AI争取最有分量的内部背书CEO 对我们成本模型的认可。他认可了,工研院内部基本不用再说服别人
后续数元纪、光之宇、千诀、观行规模化用前面的实测账单做横向推广
这个顺序背后的逻辑

先做最容易测出差距的,再做最需要我们的,最后做最难说服的。沅域和心流直觉给我们数据;科学引擎和观壹给我们一个可复制的交付形态;基元律动和 EvoKernel 消除侧翼风险;Wisdom AI 给我们背书。等这四步走完,回到工研院谈平台级合作时,我们带的就不再是方案,而是它自己企业的账单。

8.4 一个还没有人做过的采购品类

顺带指出一个结构性空白:检索公开招标与中标记录后,找不到按 token 计费的算力服务采购案例——现有的公开采购几乎全部按「卡 / 台 / 月」计价。这意味着企业侧在买 token 服务时,没有现成的合同模板、没有统一的计量口径、没有验收标准、没有 SLA 范式

对我们是双向的:一方面每一单都要自己造轮子,成本高;另一方面,谁先把这套「Token 服务采购包」做出来并跑通一遍,谁就定义了这个品类的标准。建议把它作为交付物的一部分正式列出——计量口径、对账方式、SLA 条款、退出机制。这对工研院这样的平台方尤其有吸引力:它拿到的不只是便宜的 token,还有一套可以复制给后续所有入驻企业的采购范式。

CHAPTER 09 · OBJECTIONS他们会怎么反驳:九个必答题

这一章按真实会谈的顺序排列。每一条给出对方的原话式质疑、这个质疑背后的真实顾虑,以及我们的答法。答法的共同原则是:不否认对方的判断,而是把问题重新框到我们的强项上

9.1 「大厂 API 已经很便宜了,而且天天降价,你们凭什么更便宜?」

背后的真实顾虑:怕被一个小团队用短期报价套住,一年后发现大厂更便宜。

答法:分三步,不要跳步。

不要说的话

不要说「大厂服务不好」「大厂不重视小客户」——这类话无法验证,且会让对方觉得我们在贩卖情绪。所有对竞争对手的判断都必须落在可查的财务数据或公开定价上。

9.2 「已经有很多公司做 token 工厂了,港股都有上市的,你们有什么不一样?」

背后的真实顾虑:这是个红海,选一个小玩家不理性。

答法:直接同意「很卷」,然后指出卷的是哪一层。这个赛道的绝大多数参与者在做两件事之一——把上游的 token 加价转售,或者拿地方补贴建集群然后按卡时出租。前者的成本是别人的定价,能给的折扣上限就是自己的渠道返点;后者卖的是裸资源,客户拿到卡之后的低吞吐、低利用率与它无关。

 转售型裸算力出租型我们
成本来自上游挂牌价硬件折旧 + 电费硬件折旧 + 自有优化能力
降价靠压缩自己的加价空间压低卡时报价提高吞吐与利用率
降价的后果越降越薄,直至无利可图越降越接近折旧线越降越健康——成本先降,价格后降
客户的低效与它无关与它无关,甚至是它的收入是它的成本,必须解决
可承诺的东西折扣卡时单价与可用性单位 token 成本与吞吐指标

一句话收口:「同一个赛道里,我们和他们赚钱的方式是相反的。他们的利润来自差价,所以降价伤自己;我们的利润来自成本下降,所以降价是把已经拿到的工程收益让出来一部分。这就是为什么我们敢把单位成本写进合同,而转售方只敢给折扣。」

9.3 「模速空间已经有算力生态超市了,为什么还需要你们?」

背后的真实顾虑:同区已经有一个看起来很像的东西,由一家融资超 22 亿、纳管 25000P 的公司运营,而且它确实也在做推理优化。这是全场最尖锐的一问。

先说不能怎么答

不要说「他们只做资源撮合,我们才做优化」。这是错的:无问芯穹的核心资产就是推理引擎优化(FlashDecoding++、SpecEE、Infini-ACC),其 CEO 在 2026 WAIC 的原话是「优化即利润增长」。这句话一旦说出口,只要对方的技术顾问知道底细,我们后面所有的话都会打折。

正确答法:承认同层,然后把差异落在交付形态与深度上。可以直接说「他们做得很好,而且和我们在同一层」——这句坦白本身就能挣回不少信任。然后给四条:

维度标准化白标平台我们
交付形态 同一套代码服务至少九个租户(§3.4 的映射表),是可复用的多租户产品,边际成本极低 针对具体这批负载做专项调优。九个租户共用一套代码,意味着它不会为某一家企业的视频生成或长链 Agent 单独改算子与调度
能力方向 纳管广度:十六种芯片都能跑、跨域调度、异构混训。解决的是「有没有卡、卡在哪」 单平台深度:在选定的国产加速器上,把算子覆盖、显存分页、批处理调度、专家并行做到极限。解决的是「这张卡上这个模型跑多快」
部署形态 多租户公有云形态 支持私有化与数据不出域——A 层里科学引擎、观壹科技、数元纪都卡在这一条上(§8.1),公有云形态对它们不是便宜与否的问题,是能不能用的问题
商务结构 标准产品通常按资源或调用量计费 敢做节省额分成:以现有单位成本为基线,不省不付(§9.7)。标准化产品做不了这个,因为它无法为单一租户的成本结果背书
然后把问题递回去——问结果,不要问能力

不要问「你们平台的吞吐和利用率是多少」——那是平台级能力指标,对方答得出来,而且数字很漂亮。要问企业级的结果:

园区里具体某一家企业——比如做视频生成的那家——它现在的单位 token 成本是多少?过去半年降了多少?有没有按企业分账的成本口径?

这个问题标准化平台大概率答不出:它承诺的是可用性、额度与调度,不是某一家企业某一类负载的成本结果。而且事实上,算力生态超市运行一年半,接入企业数、调用量、利用率、续约率全部没有任何公开数据(§3.4)。问完这个问题,我们的位置就清楚了,而且全程没有贬低任何人。

最后要诚实的一点:规模上我们比不了,不要装。对方融资、纳管算力、客户数量都远超我们。如果被直接问到,就直说:「规模上我们没法比,所以我们不打算做通用平台。我们只做一件事——把你们这几家的单位成本做到最低,并且让这个数字可以被你们自己核验。」承认劣势之后说出的优势,可信度反而更高。

9.4 「你们团队太小,一亿元的量我不敢一次交给你们。」

背后的真实顾虑:这是最合理的顾虑,也是最不该硬扛的。

答法:不接这个前提。我们从来不建议一次性切换,因为那对园区不利,对我们也不利。正确结构是混合架构 + 分段承接

这一条答完,通常会显著改变对方对我们的印象——主动限制自己的敞口,是小团队证明自己懂事的最有效方式。而且它是真话:一次吃下全部流量对我们才是最大的风险。

9.5 「国产卡到底行不行?我听说性能不够、生态不全。」

背后的真实顾虑:既有政策要求要用国产,又怕用了出事,希望有人替它承担这个判断。

答法:不要辩护,要拆解。国产加速器在推理侧的差距,主要不在峰值算力这一项——差距集中在软件栈:算子覆盖不全导致大量算子回退、显存管理粗糙导致批量上不去、调度不成熟导致利用率低、长上下文与多模态路径缺少针对性优化。这些每一项都是工程可补的,也正是我们的工作内容所在。

然后给出园区真正想听的结论:「所以我们的方案不是赌国产卡,而是把国产卡放在它现在确实合适的负载上,把不合适的负载留给其他硬件,由平台统一调度、对上层企业完全透明。企业只看到一个 API,看不到底下是什么卡。国产化率因此变成一个可以逐季度往上调的平台指标,而不是一次性的赌注。」

这一条是我们的主场,可以适度展开

把国产加速器推理的具体瓶颈讲到对方能听懂又插不上话的深度(算子回退、显存碎片、批处理调度、通信原语),是这场会谈里最有效的信任建立动作。但要在对方问了之后才展开,不要主动上技术课。

9.6 「为什么要园区统一搞,让企业各自去买不行吗?」

答法:企业各自买,有三件事永远拿不到——而这三件恰好都是园区的职能所在:

再加一句给平台听的:「而且企业各自买,园区就看不到自己企业的 token 曲线——那是最灵敏的活跃度指标。」

9.7 「钱怎么算?你们要多少?」

答法:给结构,不要急着给数字。三种可选,按园区的风险偏好排序:

A · 节省额分成(建议起步)

以当前实际单位成本为基线,我们只从可核验的节省额中按比例取酬。园区不增加任何支出,不省则不付。适合破冰:把举证责任完全放在我们这边。

B · 平台运营托管费

园区持有算力资源(自采或租赁),我们负责平台建设与运营,收固定托管费 + 绩效部分(挂钩利用率与单位成本指标)。适合园区希望资产与数据都在自己手里的情形。

C · 按 token 结算

我们自租算力自建平台,按 token 向园区结算,价格锚定在公开挂牌价的固定折扣上并写入调价机制。最省事,但园区拿不到成本透明度,通常作为规模化之后的形态。

先谈 A,把第一阶段做成园区几乎零风险的动作;A 跑出实测数之后,B 和 C 的谈判就有了共同的事实基础。顺序反了会很难谈——没有实测数据时谈 C,就退回到纯比价了。

9.8 「数据安全怎么保证?」

答法:列清边界,不讲承诺。私有化部署在园区可控的资源上;推理数据不出园区网络边界;模型权重与业务数据分离存储;完整调用审计日志归园区所有;运维访问留痕并可由园区审计。把「我们能看到什么」明确写下来——主动划出自己的权限边界,比反复保证安全更有说服力。

9.9 「万一你们做不下去了,园区怎么办?」

答法:这个问题必须给出结构性答案,而不是「我们不会」。

这四条合起来传递的信息是:我们的护城河是持续把成本做得更低,不是把客户锁住。愿意主动交出锁定手段的供应商,在这个赛道里同样是少数。

CHAPTER 10 · THE PLAN怎么落地:三段式方案与每段的验收口径

方案设计的唯一原则:让园区在每一个节点上都能低成本地说「不」。敞口越小,第一步越容易迈出去;而只要第一步的实测数据是真的,后面的谈判就不再是说服,而是算账。

图 10-1 三段式承接路径
横轴是时间,纵轴是园区承担的风险敞口。每段之间有明确的验收门,未过门则不进入下一段,且园区无沉没成本。
时间 → 第一段 · 同题同压对比测试 不接生产流量,不动现有供应商 园区投入:真实请求样本 + 对接人 第二段 · 非关键负载试运行 承接可预测基载,峰值溢出走公有云 签 SLA 与退出条款,按月结算 先接 3–5 家自愿参与的企业 园区侧上线用量与成本看板 建议采用节省额分成结构 第三段 · 园区级平台 全园区统一入口、统一结算与开票 配额制:入驻企业按阶段领用 国产加速器占比按季度上调 私有化部署,数据不出园区 活跃度看板交付给招商与投资口 纳入政策补贴与算力券申报 转入托管费或按量结算结构 验收门 ① 验收门 ② 园区风险敞口 ↑

10.1 第一段:同题同压对比测试

目的只有一个——把「我们更便宜」从主张变成读数。做法:取园区内一到两家企业的真实请求样本(脱敏后),在我们的环境与现有供应商上跑同一批请求,同时记录成本侧与质量侧指标。

指标类别具体指标为什么必须一起看
成本侧单位 token 成本(分输入/输出)核心结论。必须统一口径:是否含缓存命中、是否含峰值备容成本
单卡有效吞吐、集群利用率成本优势的来源必须可归因,否则无法判断是否可持续
质量侧首字延迟 TTFT、单 token 延迟 TPOT降本不能靠牺牲体验。这两项必须先设下限再谈成本
长上下文准确率最容易被牺牲的一项。量化与显存压缩手段常在长上下文上大幅掉点,短请求评测完全看不出来
输出一致性(同 seed 复现)企业侧回归测试要用,波动大会引发大量返工
稳定性侧压测下的错误率与限流表现公有云的隐性成本主要在这里
峰值承载与降级行为决定第二段的容量设计
验收门 ①:把结论前置写清楚

在测试开始前就与园区约定:如果单位成本改善低于某个阈值,或任一质量指标低于现状,则本项目终止,园区不承担任何费用。把失败条件写在前面,是这一段最重要的动作——它让园区几乎没有理由拒绝启动。

10.2 第二段:非关键负载试运行

承接一部分真实生产流量,但严格限定在可预测的基载与非关键路径上,峰值与关键业务仍走原有通路。这一段要产出三样东西:

参与企业建议从自愿报名的三到五家起步,优先选 token 消耗量大、对成本敏感、技术团队配合度高的。第一批企业的口碑决定第三段能否推开——这一段的真实目标是拿到园区内部的推荐人,而不是拿到收入。

10.3 第三段:园区级平台

只有在前两段都有可核验数据之后,才谈整体承接。这一段的形态与商务结构在第 9.7 节已列出(转入托管费或按量结算)。这里只强调三个必须在这一段落地、且构成长期壁垒的动作:

配额制与招商联动

把算力配额做成分级的入驻权益,与招商流程绑定。一旦写进招商政策,这个平台就成了园区制度的一部分,而不是一个可随时更换的供应商。

国产加速器占比的季度台阶

不承诺一次性达标,而是给出逐季度提升的路线与每一档对应的负载类型。让国产化率成为一条向上的曲线,这是园区最需要的汇报素材,也是我们技术能力的直接体现。

把控制权留在园区

资产、数据、审计日志、部署文档全部归园区;不排他、不锁定。这既是消除疑虑的手段,也是我们真实的战略选择——护城河在成本曲线上,不在合同条款上。

CHAPTER 11 · THE MEETING第一次会谈:议程、开场、禁区

这一章是可以直接带进会议室的部分。核心判断:第一次会谈不要以拿单为目标,要以「拿到六个数字 + 约定一次对比测试」为目标。把目标定小,成功率会高很多,而且第二次见面时我们手上就有事实了。

11.1 一次 60 分钟会谈的建议节奏

时段要做的事要达到的效果
0–5 分钟不介绍公司,先说来意:「听说园区每年在 token 上的支出是亿元量级,我们想看看这笔钱的结构里有多少是可以省下来的,以及能不能顺便变成园区自己的一项能力。」把话题从「供应商推销」切换到「一起看一笔预算」
5–20 分钟讲第 2 章的算术:恒等式 → 模型厂商自己披露的成本数据 → 一亿元的构成表。只讲结构,不报价。建立「这个人懂成本,不是来卖东西的」的第一印象
20–35 分钟问 §2.6 的六个数字。带一页纸现场填。填不出来的当场记为待补。拿到定价所需的口径;同时暴露对方现有供应商没做过这件事
35–48 分钟讲第 5 章的四项价值(招商权益 / 可汇报的建成物 / 活跃度看板 / 预算效率),以及 §5.3 的三件杂事。这一段是给平台听的,不是给技术听的。把我们从「更便宜的供应商」变成「帮园区把费用变成能力的人」
48–58 分钟提出第一段方案:同题同压对比测试,失败条件前置,园区零费用。明确说出「如果测不出优势,这单不该给我们」。把决策门槛降到几乎为零
58–60 分钟约定下一步的具体动作与时间:谁提供样本、谁对接、什么时候出结果。会议以一个日期结束,而不是以一句「保持联系」结束

11.2 三种开场,按对方身份选

对园区管理层 / 平台负责人

「园区每年花在 token 上的钱是亿元量级,但这笔钱花完之后,园区账上什么都不剩——它全部变成了外部供应商的收入。我们想谈的是:同样的预算,能不能让园区多出一个自己的推理底座、一份招商权益、一套企业活跃度数据。落点是资产化与政绩,不是价格。

对技术负责人 / 中台团队

「单位 token 成本等于卡时成本除以吞吐再除以利用率。买 API 的时候,后面两项是看不见的,也是没法优化的。我们想看看园区聚合之后,这两项能做到什么水平,这个可以直接测。」落点是工程,直接进入同行对话。

对财务 / 采购口

「几十家企业各自向不同供应商付费,币种、票据、主体都不统一,涉及财政资金和科研经费时更麻烦。统一入口能把 N 份合规问题压缩成 1 份,顺便让国产化率变成一个可统计、可上报的平台指标。」落点是合规与流程,不是技术。

11.3 禁区:这几句话不要说

不要说为什么改成
「我们比大厂便宜 X 成」在没有口径的情况下报数,会被当成又一个报价,且一旦口径不同就失信「我们想先把口径对齐,再谈能省多少——现在报数对你没意义」
「大厂服务不好 / 不重视小客户」无法验证,且显得在贩卖情绪;对方很可能与大厂关系良好「他们的商业模式是按需计费,园区的闲置在他们账上是收入——这是激励结构问题,不是服务态度问题」
「国产卡完全没问题」对方大概率知道有问题,这句话直接摧毁可信度「差距主要在软件栈这几层,具体是……这些是工程可补的,我们的方案是混合架构加逐季度台阶」
「我们可以接下全部一亿元的量」激进,反而放大对方对小团队的担忧「我们只建议承接可预测的基载,峰值溢出仍走公有云,园区始终保留退路」
「需要签排他 / 需要预付」第一次会谈提锁定条款,等于宣布自己没有成本优势「不排他、不锁定、资产和数据都在园区手里」
主动大段讲技术平台机构的决策人不为技术付费,且容易变成考试技术只在被追问时展开,展开时要深(§6.6 那张表的深度)

11.4 需要提前准备好的三份东西

刻意不准备的东西:公司介绍、团队背景页、技术架构大图、报价单。第一次会谈里,这四样每出现一样,会谈就往「供应商比价」的方向偏一点。

CHAPTER 12 · OUR OWN RISKS我们自己要想清楚的五件事

前面几章都在讲怎么说服对方。这一章相反:把我们自己这一侧最薄的地方摊开。写在这里的目的很实际——这些问题对方的技术顾问也会想到,我们提前想过一遍,会谈时就不会被问住

① 一亿元的口径可能与我们的假设差很远

这个数字来自对方口述,构成未知。它可能包含算力租赁、平台建设与人力,甚至包含尚未发生的规划性预算;也可能大部分花在海外前沿模型上——那种情况下算力成本占比不到 2%(§2.3 末两行),我们能优化的绝对额会小很多,但相对降幅反而更大应对:口径没问清之前不做任何承诺,这也是 §2.6 六问表的由来。

② 我们不是模型方,模型溢价这一段动不了

如果园区的支出主要是闭源模型的授权与调用溢价,那么优化推理效率只能压缩其中的算力部分。这是我们能力的真实边界,必须主动说出来。应对:把可优化范围明确圈定为「开源与自部署模型的推理成本」,闭源部分只做用量治理与路由优化(把不需要顶级模型的请求分流到便宜模型),这一项本身也常有可观收益。

③ 园区聚合红利的前提是企业真的愿意迁

§2.5 的曲线成立的前提,是几十家企业确实把负载放上来。而每家企业都有自己的技术选型、迁移成本与惰性,园区的行政力度也未必能推动。如果只接进来三五家,利用率红利就只剩一小半。应对:第二段刻意从自愿报名的企业做起,用第一批的实际账单形成园区内部口碑;同时把配额与入驻权益绑定(§10.3),让新入驻企业默认在平台上。

④ 国产加速器的适配工作量存在真实不确定性

算子缺口、长上下文与多模态路径的成熟度,在真正跑起目标模型之前很难准确估计。承诺过早会伤自己。混合架构不只是给园区的风险管理方案,也是给我们自己的。应对:第一段测试就把目标模型在目标硬件上跑通,把不确定性在零承诺阶段消化掉;国产化占比按季度台阶承诺,不给一次性达标的时间表。

⑤ 交付与运维是长期人力投入,不是一次性项目

园区级平台意味着 SLA、值班、故障响应、版本升级、几十家企业的接入支持。这与做一次性优化项目的资源模型完全不同,对一个小团队是真实的组织压力应对:第三段的商务结构必须把运维成本显性计入(托管费而非纯分成);第二段就要开始验证单位客户的支持成本,避免规模化后被服务成本拖垮。

一个需要提前定调的问题

第一段的对比测试是零收费的,但它需要投入真实的工程人力(跑通目标模型、搭测试环境、出报告)。在启动之前,我们内部要先明确这笔投入的上限,以及什么情况下中止——否则很容易演变成长期免费 PoC。建议的约束:园区侧必须同时承诺三件事(提供真实请求样本、指定对接人、明确验收门通过后进入第二段的决策路径与时间)。三件里缺任何一件,就说明这件事在园区内部还没有主人,此时不宜投入。

CHAPTER 13 · WHO'S WHO公司图鉴:这些名字分别是谁

这一章是给自己看的参考页,不是谈判材料。目的很简单:别人在会上抛出一个公司名,你能立刻知道它在哪一层、大概什么量级、有没有在赚钱。数字尽量标了出处与置信度——原文指招股书或定期报告原文,媒体指媒体或研报转述,常识指行业通识、未在本轮核实。

13.1 先记住这张分层图

整条链上从下到上有五层,毛利率与技术含量大体是从下往上递增,但资本开支是从下往上递减

做什么典型毛利率代表
L1 芯片造卡高,但研发与流片投入巨大英伟达、昇腾、寒武纪、海光、壁仞、摩尔线程、沐曦、天数智芯、燧原、昆仑芯
L2 机柜与电力
IDC / AIDC
卖机柜、电力、制冷40%–50%润泽科技、万国数据、世纪互联;优刻得的机柜托管业务
L3 卡时租赁把卡按小时/月租出去20%–30%(行业均值)
实测常见 5%–15%
并行科技、首都在线、青云科技、CoreWeave、Lambda
L4 推理服务 / Token 工厂在卡上把模型跑起来,按 token 卖两极分化:−119% 到 +69%硅基流动、无问芯穹、PPIO、Fireworks AI、Together AI;模型厂的 API 业务
L5 企业 AI 网关路由、审计、合规、成本管控高,但市场尚早OpenRouter、基元律动;国金证券称之为「4.0 级」

国金证券《Token 计费重塑 AI 产业链》(2026-07-17)的四级模型对应 L3→L5:1.0 API 代理、2.0 聚合平台、3.0 推理基础设施、4.0 企业 AI 网关,并判断国内玩家「大多处于 2.0 向 3.0 过渡的关键阶段」原文我们主张的位置是 3.0,即自己租算力、自己跑模型、自己承担效率。

13.2 独立 Token 工厂与推理服务商

这一层最值得研究,因为它就是我们要去的位置,而且几乎每一家都在亏钱。

公司一句话定位关键数字状态
硅基流动
SiliconFlow
自述「最大的独立生态词元供应平台」,聚合 170+ 模型对外提供 API,兼做本地化部署 2025 营收 5,533 万元(+653.2%);公有云毛利率 −119.0%、本地部署 82.5%、整体 −24.0%;算力租赁费占销售成本 86.9%、算力 100% 外租算力总支出为收入的 2.88 倍;词元市占率仅 1.5%(前三名合计 87.0%)原文 港股已递表处理中(2026-06-30,18C「未商業化公司」,未过聆讯)
无问芯穹
Infinigence
最需要重视的对手。异构算力纳管 + 推理引擎优化 + Agentic MaaS;同时把园区级平台做成了白标产品 累计融资超 22 亿元;纳管算力 25000P+、覆盖 26 城 53 个数据中心;2025 收入超 5 亿、现金流为正媒体;技术资产 FlashDecoding++、SpecEE(ISCA 2025)、Infini-ACC;同一套代码服务至少 9 个租户一手抓取 未上市;港沪深三所均无递表记录(§3.5)
PPIO 派欧云 分布式 GPU 云 + 模型 API,算力来自分散节点聚合 2022–2024 营收 2.86/3.58/5.58 亿元,净亏 0.85/1.89/2.94 亿元,三年累亏 5.68 亿AI 云业务过去两年录得毛损原文;2026-04 日均 1.028 万亿 token媒体 港股二次递表(2026-06-10;首次 2025-06 已失效)
基流科技 卖 AI 算力集群(硬件交付)+ 集群运营服务,自持 GPU 2025 营收 5.20 亿元;产品毛利率 16.8%、运营服务 47.7%(两条都在跌);机器设备折旧 6 年;应收周转 64.1 天,2025 年末应收到 2026-02 只收回 8.6%;现金两个月消耗 2.36 亿元;市占率第 9 名 1.1%原文 港股已递表处理中(2026-04-29)
潞晨科技 这个赛道唯一可确证的完整退出样本。原做 Colossal-AI,2025 年短暂做过 DeepSeek API 创始人尤洋公开测算:日出 1000 亿 token 则月机器成本 4.5 亿、亏 4 亿,「用户越多,亏损越多」;并指出「常规 MaaS 要实现稳定输出,需准备的机器可能是理论值的 5 倍媒体 2025-03-01 停止 API 服务并全额退款
趋境科技 推理优化,主打「高品质 Token 分层」,国产异构 自述单台算力 Token 生产效率 +3 倍、高品质产能 +30 倍;半年融资超 10 亿元(2026-07 A 轮,河南投资集团领投)媒体 在营
九章云极
DataCanvas
「训练工厂 + Token 工厂」双线,信通院 Token 标准首批首家通过 目标 10 万 P、日产 10 万亿 token、千倍降本媒体。董事长方磊原话:「这绝非低价内卷的价格战,本质是底层工程体系效率之战 在营
基元律动 工研院自己孵化的项目。OpenSquilla 多模型智能调度框架,分层路由降本,属 L5 网关层 自述路由方案可使 Token 成本降低 90%;前华为诺亚方舟团队;已完成天使轮媒体 在营。与我们是叠乘关系而非竞争,见 §1.6

13.3 模型厂自营的 MaaS

模型公司自己卖 API。这一层的招股书是研究单位经济最好的材料,因为推理成本几乎等于它们的全部成本。

公司一句话定位关键数字状态
智谱
02513.HK
清华系,本地化部署为主(政企私有化),云端 API 为辅 云端部署毛利率 76.1%→31.0%→3.4%→−0.4% 毛损(1H2025);本地化部署 59.1%;2024 年研发算力服务费 15.53 亿元=当年收入的 5 倍,占研发开支 70.7%;1H2025 净亏 23.58 亿元原文 已上市 2026-01-08
MiniMax
00100.HK
C 端产品(海螺 AI、Talkie、星野)+ 开放平台 API,收入约七成来自境外 开放平台毛利率 69.4%(9M2025)——同期同赛道最高;推理 MFU >75%,自述「顯著高於行業約 40%–50% 的平均水平」;销货成本中推理云计算占 92.7%–96.9%纯轻资产全外租,账上无服务器折旧;1H2026 收入 1.166 亿美元(+283%)但毛利率回落至 17.9%;阿里通过 Alisoft 持股约 15.04% 且是五大供应商之一原文 已上市 2026-01-09
云知声
09678.HK
严格说不是 MaaS——硬件占销货成本 54.5%,本质是集成硬件软件的 AI 方案商 FY2025 收入 12.11 亿元(+29.0%)、整体毛利率 36.1%(连续三年下滑);单一可呈报分部,不披露分业务毛利率;自建 Atlas 智算集群 >184 PFLOPS,租用乌兰察布数据中心原文 已上市 2025-06-30
DeepSeek 不上市、不融资,但公开了行业最硬的一份推理成本核算 2025-03-01 披露:24 小时内平均占用 1,814 张 H800,日成本 8.7 万美元,输入 6,080 亿/输出 1,680 亿 token,成本 ÷ 理论收入 = 15.5%(即「理论利润率 545%」);2026-08-17 起启用峰谷分时定价官方 未上市
月之暗面 Kimi / 阶跃星辰 / 百川 其余头部模型厂,各自有 API 业务 Kimi K3 输出挂牌价约 100 元/百万 token媒体阶跃星辰另有单独分析报告 未上市
这一层最值得记住的一件事

智谱云端 −0.4%,MiniMax 开放平台 69.4%,同期、同赛道、都卖 API。MiniMax 恰好披露了 MFU >75% 对行业 40%–50%。这是「效率决定毛利」最直接的招股书级证据(口径差异见 §4.2 的提醒:MiniMax 七成收入来自境外,定价更高)。

13.4 大厂云 MaaS:价格战的发起者与规则制定者

平台归属关键数字
火山方舟字节跳动 / 火山引擎调用量份额约 49.5%、营收份额 >40%(IDC 2026-05);豆包日均 token 2026-03 突破 120 万亿、三个月翻倍;2026 年 MaaS 营收目标上调至 150 亿元媒体。2024-05 以「比行业平均低 99.3%」的定价点燃价格战
阿里云百炼阿里巴巴份额约 28%;2026Q1 阿里云 AI 收入占比首破 30%媒体限流机制值得研究:除 RPM/TPM 外还有「增速限制」,即总量未达上限也会触发(官方文档)
百度千帆百度份额约 10%;底层用自研昆仑芯媒体
腾讯云 / 华为云腾讯云未进 MaaS 前五;华为云走昇腾国产算力路线,CloudMatrix384 是其旗舰推理架构(384 张昇腾 910C)

要记住的机制:大厂 MaaS 的低价是获客投入,不是成本优势。硅基流动招股书里「推广算力资源成本」5,421.3 万元(即发免费券烧掉的算力)是其公有云收入的 1.85 倍——这就是补贴的确切金额。而 2026-03 起行业已出现反向涨价(§4.5)。

13.5 算力运营与租赁:A 股这一批

这一批是「卡时生意」,研究它们主要为了两件事:看清 L2 与 L3 的毛利率差异,以及学会用折旧年限识别报价

公司定位最新毛利率要点
润泽科技
300442
重资产自建 AIDC,L2 层的标杆AIDC 48.50%100% 自投自建自持;唯一披露公司级上架率的公司(成熟中心 >90%)前五大客户占 95.52%、最大客户 48.59%——极高集中度;2025 归母净利 50.50 亿但扣非仅 19.01 亿(差额来自 REIT 股权处置)原文
并行科技
920493
超算云 + 智算云调度,L3 层算力服务 22.03%
智算云 11.37%
2026Q1 降至 15.57%
全样本跌得最惨(算力服务同比 −10.06pct,企业客户 −11.62pct),且年报对毛利率下滑未给任何文字解释;算力以外采为主(算力使用费占成本费用 43.19%);折旧 3–5 年原文
优刻得
688158
公有云 + IDC/AIDC云计算 23.52%
机柜托管 43.61%
2025-10-30 把 GPU 折旧从 4 年改为 5 年,仅一个季度就增厚净利 859 万元——研究报价时最该警惕的操作;自有算力 38000P,自述 100% 满租原文
首都在线
300846
智算云 + 云主机 + IDC大模型及 AIGC 11.40%
(+10.31pct)
唯一同比回升的,靠淘汰老旧资产 + 自建 AIDC 替代第三方机柜;外采算力成本同比 +245.69%;折旧 5–10 年原文
青云科技
688316
公有云 + 私有云软件云服务 4.89%
云产品 62.66%
软件毛利 62.66% 与云服务 4.89% 的对比很说明问题;GPU 走售后回租融资 1.245 亿元,创始人个人连带担保;6.84 亿元 GPU 采购合同「是否正常履行=否」原文
软通动力
301236
IT 服务商转型算力运营,「北京壹号词元工厂」智算服务 10.63%词元工厂一期日产能 1.4 万亿 token;SLA 对标电网(可用性 ≥99.9%、首字延迟 P90 <10 秒、缓存命中率 ≥90%);智算业务规模仅 3.01 亿、占总收入 0.86%;怀来项目测算毛利率 38.03%、税后 IRR 10.14%,但已接洽需求仅覆盖新增产能 39%–48%原文
弘信电子
300657
FPC 转型算力,燧弘华创无锡 Token 工厂算力业务 13.83%江苏首个昇腾 384 超节点集群,首期 4 台合计 1,536 卡;实测 Token 生成性能超同规模英伟达集群 1.2 倍——国产卡最有价值的公开数据点原文媒体
云赛智联 600602上海国资云计算平台云计算大数据 18.29%专用设备折旧 20 年(年折旧率仅 4.75%);2026 中报全文「毛利」零命中,分部信息勾选「不适用」原文
润建股份 / 协创数据 / 奥尼电子转型算力运营的中小盘润建把五象云谷智算中心升级为 Token 工厂、推「星算云池」;协创数据自述 IDC 上架率 95%–100%;奥尼电子把闲置算力接入弹性网络、按 Token 积分结算媒体

13.6 运营商:规模最大、定价最狠的一层

174.38 亿
中国电信宁夏「Token 工厂」集采(含税,11 标包,服务期 60 个月)。报价折扣集中在 99.2%–99.8%,几乎不打折——是能力采购而非价格竞标
2.5 元/百万
三大运营商 Token 零售锚点,口径惊人一致:上海移动 1 元 = 40 万 token;中国移动 24.99 元/1000 万;联通 15 元/600 万
378 亿 / +62.4%
中国移动 2026 年算力网络资本开支预算及增速;电信算力基础设施 255 亿(+26%),三家合计预计超 1000 亿
74%
中国联通 2026H1 自述算力资源利用率(注意是出租率口径,非实际计算利用率)

要记住的判断:券商普遍认为订单、算力与流量会持续向运营商和头部云厂商集中,马太效应凸显——「运营商掌握稀缺的政企渠道、全域客户、网络传输、统一结算与合规运维能力」。这条对我们是不利判断,会谈中如被提出,正确回应是承认规模劣势、把主张收缩到「特定负载的单位成本」上(§9.3 末段)。

13.7 国产 AI 芯片:谁是谁

厂商路线软件栈要点
华为昇腾自建生态,达芬奇架构 ASICCANN(AscendCL / AOL / Ascend C)生态最完整、政企份额最高。昇腾 950PR 计划出货约 75 万颗,DDR 版约 5 万元/颗、HBM 版约 7 万元/颗;CloudMatrix384 预填充效率 4.45 token/s/TFLOPS 对 H100 的 3.75。运行 CUDA 原生代码性能损耗约 15%–20%
寒武纪 688256自建生态 ASICNeuware(CNNL/CNCL/BANG)已开源 vLLM-MLU;DeepSeek 新模型发布常做 Day-0 适配
海光信息 688041兼容 CUDADTK(HIP / hipBLAS)CUDA 代码兼容性 >95%,HIP 迁移效率约 85%。迁移最省事的一家
摩尔线程 688795 / 沐曦 688802兼容 CUDA 的 GPGPUMUSA / MXMACA2025-12 先后科创板上市,首日分别 +425%/+693%;摩尔线程 KUAE 万卡集群训练 MFU 稠密 60%、MoE 40%
壁仞 6082.HK / 天数智芯 9903.HKGPGPU壁仞 2026-01-02 港股上市,募资 55.83 亿港元、超额认购 2,346 倍,市值约 825 亿港元——18C 以来最大募资项目
燧原 / 昆仑芯 / 曦智ASIC / 自研 / 光计算燧原科创板在审;昆仑芯 2026-01 保密递表港交所;曦智 2026-04 港股上市
关于国产卡,记住三个数就够了

单卡实测性能约为 H100 的 60%(SemiAnalysis 与 Counterpoint 测算);② 但集群层面已有反超的公开实测(燧弘昇腾 384 超节点 1.2 倍);③ 差距的主因不是硅片而是软件栈——北大谢涛教授的四点归因是「指令集不统一、软件栈不统一、算子覆盖度低导致迁移成本高、企业各自为战」。「很多国产芯片不是不能运行,问题在于能不能以接近 CUDA 生态的工程效率运行」——这句话就是我们存在的理由。

13.8 海外对标:理解这门生意该长什么样

公司定位要点
Fireworks AIToken 工厂 3.0 的标杆自研推理调度体系部署开源模型,公开披露综合毛利率稳定维持 50% 以上——国金证券把它作为「3.0 级」的对标样本原文
Nebius新兴 AI 云,纳斯达克上市国信证券用它做了一份完整的单卡 P&L:GLM5.2 部署 B200,毛利率 30%(原模型)→ 54%(基础设施优化)→ 81%(全栈优化),利用率 60%→69%。优化杠杆包括定制 ODM 机箱省 10%–15% OEM 溢价、自研液冷降功耗约 20%、弹性打包回收约 15% 闲置算力原文
OpenRouterL5 网关层的代表在供应商成本上仅加收约 5.5% 溢价;19 个月内平台月度日均 token 由 0.072T 增至 7.995T(111 倍);中国模型份额从 6.0% 升至 61.5%Agent/Coding 应用仅占应用数 19% 却贡献 81.2% token原文
Together AI开源模型托管 + GPU 云与 Fireworks 同类,海外头部已进入 3.0–4.0 阶段媒体
CoreWeave最大的独立 GPU 云(L3)从加密矿工转型,靠与英伟达的深度绑定与长约锁定客户;研究它主要是看「卡时生意如何靠长约把利用率锁住」常识
Baseten / Modal / Lambda推理托管与 GPU 云Baseten 曾披露其云服务商计划 2026-10 将 B200 续约价上调约 94%(2.63 → 5.10 美元/小时)媒体
Groq / Cerebras / SambaNova专用推理芯片以极低延迟为卖点的另一条技术路线常识

海外这条线最有参考价值的一点:Fireworks 能做到 50%+ 毛利,Nebius 能把同一张卡的毛利率从 30% 做到 81%,而国内同层玩家普遍负毛利。差距不在市场,在工程成熟度——这也是国金证券说国内「大多处于 2.0 向 3.0 过渡」的含义。

13.9 十个记住就够用的数字

数字含义用在哪
140 万亿全国日均 token 调用量(2026-03,国家数据局);2024 年初仅 0.1 万亿,两年涨 1,400 倍说明需求侧不是问题
15.5%DeepSeek 官方披露的成本 ÷ 理论收入说明挂牌价里算力占比很低
−119% / +69.4%智谱云端与 MiniMax 开放平台同期毛利率说明效率决定毛利,不是模式
75% vs 40–50%MiniMax 推理 MFU 与行业平均说明工程空间有多大
2.88 倍硅基流动算力总支出 ÷ 收入说明补贴的量级
1,102 → 244同样 200B token/天所需 H100 卡数(自部署 vs Token 工厂,国信证券)说明聚合与优化的合并收益
85% vs <30%出租率与实际计算利用率两个口径的落差我们的空间所在
60% / 1.2 倍国产卡单卡性能占 H100 比例 / 集群层面实测反超倍数说明国产化可行且靠工程
2.5 元/百万三大运营商 Token 零售锚点定价的地板参照
3 年 vs 20 年同业 AI 设备折旧年限的极差识别虚低报价

APPENDIX附录:数据速查、来源与信息缺口

本附录把全篇引用的数字集中列出,并明确区分四类置信度。会谈中引用任何数字前,请先看它属于哪一类。

A · 置信度标注说明

官方/论文来自当事方官方披露、政府文件或同行评议论文,可直接引用 媒体/社区来自主流媒体报道或开源社区公开复现,可引用但宜说明来源 待核来自二手记录或单一来源,对外引用前必须复核

另有一类是我方估算(如「一亿元约占市场 3.3%」、§2.5 的峰均比模型、§2.4 的敏感度算例),已在正文中逐处标明。这类数字用于说明量级与结构,不应作为精确预测使用。

B · 关键数字速查表

数字含义出处置信度
谈判对象
2024-10-09交大工研院启动(与人工智能学院一体化运行)工研院官网、交大新闻网官方
2026-08-18赵军出任工研院院长(距今八天)工研院官网待核
2009-12交大先进产业技术研究院(产研院)成立——不是本次对口主体aitri.sjtu.edu.cn官方
成本与算术
15.5%模型厂商自披露:推理成本占按挂牌价折算的理论收入比重(即「理论利润率 545%」)DeepSeek 官方,2025-03-01官方
1,814 张 / 87,072 美元该披露中的 24 小时平均占用卡数与日成本(逐项核对一致)同上官方
6,080 亿 / 1,680 亿该 24 小时的输入 / 输出 token 量(输入中 56.3% 命中缓存)同上官方
1,072 / 4,951 token/s由上述数据反推的全集群平均单卡输出 / 输入输出合计吞吐我方计算估算
约 3.7 元/百万成本全摊到输出 token 时的单位成本(对照当期挂牌价 16 元/百万)我方计算估算
20.4%–38.2%既有推理系统的 KV 显存有效利用率(即 60–80% 被浪费),改进后浪费降至 4% 以下,吞吐提升 2–4 倍vLLM / PagedAttention 论文论文
0.20 美元/百万96 张 H100 上的公开复现输出 token 成本,约为同期官方 API 的五分之一LMSYS 公开复现社区
约 8.5 倍Token 即服务相对裸机小时租赁的价值倍数硬件厂商口径待核
赛道与毛利率
−271.6% → −119%某 MaaS 服务商公有云业务两期毛利率(仍为负)招股说明书(前期检索记录)待核
82.5%–92.4%同一家公司的私有化部署毛利率同上待核
86.9% / 约 20 元算力占销售成本比例(算力全部外租)/ serverless 用户 ARPU同上待核
16.8% vs 47.7%某智算服务商:集群产品交付 vs 运营服务毛利率;应收账款周转约 64 天招股说明书(前期检索记录)待核
50%+ vs 20–30%研报口径:自建推理基础设施 vs 裸机架租赁毛利率国金证券「Token 专业运营服务商」模型待核
1,944 万亿 tokens2025 年中国企业级 MaaS 调用量(2024 年 114 万亿,约 16 倍)IDC,2026-05-07机构
30.7 → 186 亿元中国公有云 MaaS 营收:2025 年实际 → 2026 年预测同上机构
9.6 万亿/日2025 年 12 月中国日均 token 消耗(2025 年 1 月为 1.6 万亿)同上机构
≈3.3%一亿元 ÷ 2025 年中国公有云 MaaS 总营收 30.7 亿元我方估算估算
近 50% / 40%+火山引擎份额:按调用量 / 按营收同上机构
100 万元模速空间入驻企业「免申即享」等价算力大礼包(无问芯穹为建设与运营方)澎湃、上海市政府网站,2025-02-21媒体
政策与补贴
50% / 500 万元市级模型券(Token 券)补贴比例与单项上限;专项总额 3 亿元沪经信智〔2025〕489 号,2025-07-28官方
30% / 100% / 10%市级算力券:租金补贴比例 / 市区协同补早补小最高(限 1 年)/ 自建设施支持;专项总额 6 亿元同上官方
30% / 2,000 万元徐汇区算力支持比例 / 单主体年度上限(2024 版为 1,000 万元)《徐汇区推动人工智能产业高质量发展的若干意见》,2025-05-31 起试行两年官方
2,000 万元徐汇区平台类支持上限(经分类认定)同上官方
1:1徐汇区对通过市级以上专项资金支持项目的配套比例《徐汇区支持西岸人工智能大模型科创街区的扶持意见》官方
4 批次2026 年度补贴申报批次,每季度首月受理沪经信智〔2026〕248 号,2026-04-30官方
200 EFLOPS / >70%2027 年上海智算规模目标 / 其中自主可控算力占比要求《上海市关于促进智算云产业创新发展的实施意见(2025—2027 年)》,2025-03-26官方
2,000 亿元2027 年上海智算云产业规模目标同上官方
120 EFLOPS / 约 8%2025 年底上海智算规模 / 占全国比重媒体报道,2026-01-31媒体
100 万 × 3张江 AI 创新小镇算力 / 模型 / 语料券,最高 100% 支持,限 1 年张江 AI 创新小镇申报通知,2026 Q1/Q2官方
2028 年底 / 10 类行业工信部普惠算力体系建成目标,文件明确含 Token 计费工信厅通信〔2026〕14 号,2026-04-02官方
采购与合规
360 万元某科研机构算力云服务租赁预算,按台月计费、明确不采用 token 计费中国政府采购网,2025-09-30官方
0检索到的按 Token 计费的算力服务公开中标案例数量中国政府采购网检索检索结论

C · 主要来源清单

  1. 1上海交大工研院官网 i3sjtu.cn
  2. 2交大新闻网《人工智能学院入驻暨工业创新研究院启动仪式》 news.sjtu.edu.cn
  3. 3上海市政府《人工智能赋能新质生产力启动仪式举行》 shanghai.gov.cn
  4. 4上海交大先进产业技术研究院(产研院) aitri.sjtu.edu.cn
  5. 5沪经信智〔2025〕489 号《上海市进一步扩大人工智能应用的若干措施》 sheitc.sh.gov.cn
  6. 6沪经信智〔2026〕248 号《2026 年度「模塑申城」工程相关补贴申报工作的通知》 sheitc.sh.gov.cn
  7. 7《上海市关于促进智算云产业创新发展的实施意见(2025—2027 年)》 sheitc.sh.gov.cn
  8. 8《徐汇区关于推动人工智能产业高质量发展的若干意见》 sh-tec.cn
  9. 9《徐汇区支持西岸人工智能大模型科创街区的扶持意见》 sh-hitech.com
  10. 10张江 AI 创新小镇券政策申报通知 sh-hitech.com
  11. 11工信厅通信〔2026〕14 号《关于开展普惠算力赋能中小企业发展专项行动的通知》 gxt.hunan.gov.cn
  12. 12澎湃《国内首个「算力生态超市」——模速空间算力生态平台发布》 thepaper.cn
  13. 13上海市政府《「模速空间」打造大模型创新生态圈 入驻企业超百家》 shanghai.gov.cn
  14. 14IDC《中国 MaaS 市场进入高速增长期,Token 经济从概念走向规模化实践》,2026-05-07
  15. 15中国政府采购网 · 中科院自动化所算力云服务租赁公开招标 ccgp.gov.cn
  16. 16教育部《关于进一步完善中央财政科研项目资金管理等政策的若干意见》问答 moe.gov.cn
  17. 22DeepSeek《DeepSeek-V3/R1 推理系统概览》官方披露,2025-03-01(本报告 §2.2 的成本定标即出自此处)
  18. 17Kwon 等《Efficient Memory Management for Large Language Model Serving with PagedAttention》(vLLM 论文)
  19. 18入驻企业融资信息:投资界、新浪科技、雷峰网等公开报道(记忆张量、无界动力、穹彻智能、源络科技等)

本轮补充说明(2026-08-26,第二次更新)港交所招股书原文已完成核对——硅基流动(申請版本 2026-06-30)与基流科技(申請版本 2026-04-29)的分业务毛利率、成本结构、客户集中度、折旧年限均已定位到具体页码,见 §4.1 与 §4.4。无问芯穹经港/沪/深三所项目库逐条检索确认无递表记录,此前流传的说法不成立(§3.5)。券商研报库已完成 40 份精读,国金证券《Token 计费重塑 AI 产业链》(2026-07-17)中「Token 工厂四级演进模型」与「FireworksAI 毛利率 50%+ / GPU 机架租赁 20%–30%」两处已回原文逐字核实(注意:原文为「四级」非「四阶段」,50%+ 特指 FireworksAI,20%–30% 限定为「GPU 机架租赁」)。仍未取得的是中信、中金、华泰等机构的相关深度报告——所用研报镜像源不覆盖这些机构。另有三项确认缺失:十家样本公司中只有润泽科技一家披露了公司级上架率(>90%),其余全部未披露利用率;无一家披露算力租赁单价的时间序列,故价格战曲线无法从财报构建;港股已上市三家(智谱/MiniMax/云知声)的招股书原文本轮未取得(港交所标题检索接口在本环境持续返回空结果)。另有两份高相关报告仅见于他人参考文献、未取得原文:中信证券《Token 工厂及 Token 运营商推动产业链价值重估》、长江证券《AI 沉思录(二):Token 工厂》。

招股说明书与券商研报类来源(§4.1、§4.4 部分数字)来自本项目前期检索记录,本轮未能重新定位到原文页码,故未列入上表。见 §4.5 的复核清单。

D · 信息缺口清单

以下是本轮未能解决的问题,按对谈判的重要性排序。前四项建议在首次接触时直接问对方,后面几项需要额外检索。

#缺口为什么重要怎么补
1一亿元 token 支出的构成:哪些企业、哪些模型、API 采购与算力租赁与平台人力各占多少、境内外模型比例决定我们能优化的绝对额与相对降幅,也决定报价结构。没有这个,任何报价都是猜测§2.6 六问表,首次会谈现场填
2工研院的法人性质:事业单位还是公司化平台决定合同主体、发票类型、资金来源与适用采购流程;也决定政策补贴的申报主体资格当面问,或查工商与事业单位登记
3是否已有算力 / MaaS 供应商及合同状态(工研院层面未找到任何公开信息;校级「交我算」体系与工研院是否打通亦不明)决定我们是替换、并存还是增量,直接影响进场策略当面问
4规模数字全空:孵化企业总数、在孵团队数、园区面积、基金规模(仅知与云启资本、中金资本合设天使及成长基金)决定聚合红利的实际量级(§2.5 曲线取哪一点)当面问
5模型券由企业自行申报与由服务商代客统筹申报的材料差异「非关联方」的界定标准直接决定补贴能否申领,以及我们与园区之间适不适合股权或合资形态建议与对方共同向徐汇区新工办确认
6港股已上市 / 已递表公司的完整名单与分业务毛利率——本轮检索额度耗尽未完成第 4 章论据的一手支撑;也是判断赛道资本化程度的基础需重新检索并回招股书原文
7招股书数字的原文定位(§4.5 清单全部条目)对外引用前的必要步骤需重新检索
8徐汇 AI 小镇「生态运营公司」的具体主体(政策文件只留了联系人)决定统筹申报走哪条通道需检索或当面问
9「西岸智慧谷」未在任何权威源检索到,疑为口语称法或已更名避免在会谈中用错名称当面确认