38 个在孵项目里谁在真的烧 token · 一亿元 token 预算的成本拆解 · Token 工厂赛道为什么普遍亏钱 · 上海已经把补贴通道铺好了 · 没有人做过的采购品类 · 我们的优势在哪一层、怎么被验证 · 第一次会谈说什么、不说什么。
工研院是渠道,客户是它下面的企业。我们找工研院谈,是为了一次触达几十家、拿到统一入口与聚合红利,但真正要说服的是那批真的在烧 token 的公司。所以对平台讲的是「这一亿元能不能从费用变成园区自己的一项能力」,对企业讲的是「同样的调用量,你的账单能少多少」。
第一步只要求一次同题同压的对比测试,失败条件写在前面,园区零费用。
| # | 结论 | 依据与出处 |
|---|---|---|
| 1 | 先把关系定死:工研院是渠道,不是客户。它自己不产生推理负载,付钱与用量都在下面的企业。这决定了整个打法是「与平台签框架、向企业交付」——平台负责把人聚齐、把入口统一、把补贴通道打通,企业负责真实用量与续费。两侧的说服逻辑完全不同,混着讲必然失焦。 | §1.1、第 5 章、第 8 章 |
| 2 | 38 个在孵项目里,只有 12 个真的烧 token。按是否消耗 LLM 在线推理分层:A 层推理大户 12 个,B 层训练与科学计算 7 个,C 层硬件·量子·材料 19 个几乎不产生推理需求。含义有二:这一亿元的口径几乎必然不止 LLM 推理;以及不需要说服 38 家,拿下 A 层前四到六家就覆盖了大部分预算。 | 工研院项目库 38 个项目逐个分类(§1.5、§8.1) |
| 3 | 项目库里有两家和我们能力重叠,必须由我们先提出来。基元律动做模型路由(自述 Token 成本降 90%),EvoKernel 做国产卡算子自动生成。正确定位是叠乘与供需,不是竞争:路由决定调哪个模型,我们决定这个模型跑多便宜;算子是工具,我们是端到端服务。被对方先问出来,我们就变成在辩解。 | §1.6、§8.2 |
| 4 | 这一亿元的议价能力被严重低估。换算成硬件:按整机租金水平,一亿元足以整年租用数百张加速卡;而按国信证券测算,支撑 200B token/天的负载,统一的 Token 工厂方案约需 244 张卡,客户各自裸金属自部署则需约 1,102 张。这个体量在任何供应商那里都该拿到最好条款——问题是分散付出去时,它不是一个体量,而是几十笔小单。 | §2.3 换算;国信证券 2026-07-24 |
| 5 | 这一亿元里真正落到算力上的可能只有一到两成。按模型厂商自己公开披露的推理成本反推,成本仅占其挂牌价理论收入的 15.5%。剩下的是模型溢价、渠道与补贴回收——这是结构上可以被重新谈判的部分。 | DeepSeek 官方披露(2025-03-01),逐项核对一致 |
| 6 | 我们唯一的主张是动分母。单位 Token 成本 = 卡时(GPU-hour)成本 ÷ 吞吐 ÷ 利用率。分子是采购能力,人人可比且我们不占优;分母两项各有 2–3 倍空间,合起来是倍数级,且是纯工程能力。真正拉开吞吐上限的是四项进阶能力:大规模专家并行(Large-scale Expert Parallelism)(大 EP)、MoE(Mixture-of-Experts,混合专家) 调度与放置、Megakernel(超大融合核)、预填充(Prefill)与解码分离(PD 分离)——这是「能改引擎」与「会用引擎」的分界线。 | §2.1 恒等式、§2.4 敏感度表、§6.5 |
| 7 | 「卖 API 这行注定亏钱」是假的。 同一年、同样卖 API,两家公司的结果是相反的——智谱的云端业务在 2025 上半年每收 1 元要倒贴 4 分(毛利率 −0.4%),MiniMax 的开放平台同期每收 1 元赚 7 毛(毛利率 69.4%)。同赛道、同产品形态,差了七十个百分点。 MiniMax 在招股书里给了原因:它的卡有 75% 以上的时间在真正干活,而行业平均只有 40%–50%。所以亏钱的不是「卖 API」这门生意,是「卡没用满还打价格战」的人。 另外两个样本说明这行确实死过人:潞晨科技上线一周就停掉 DeepSeek API 并全额退款;硅基流动收入涨了 6.5 倍,毛利率反而从赚变亏。规模救不了单位成本。详见 §4.2。 |
智谱招股章程 p.256/263/271、MiniMax 招股章程 p.418–419、硅基流动招股书、潞晨公告(均已定位页码) |
| 8 | 聚合带来的峰谷互补是走渠道的唯一硬理由。三十家企业负载叠加后,按峰值备容的平均利用率上限从不到 38.5% 抬升到 77.4%。单家企业永远拿不到这个红利,而任何单点供应商也给不了它——它只在「把需求归拢」这个动作里产生。 | §2.5 统计模型(独立同分布、2σ 备容) |
| 9 | 上海的政策已经把这条路铺好了,而且申报主体正好是企业。2026 年度文件把「模型券」正式表述为「模型券(Token 券)」,并明确允许模型服务商代客统筹申报。额度可叠加:市级模型券最高 50%/500 万元、算力券最高 30%(补早补小可至 100%)、徐汇区算力年度最高 2,000 万元、对市级项目最高 1:1 配套。由于付费方本来就是企业,申报口径天然吻合——代客申报因此是我们对企业端最有效的获客钩子。前置条件是接入「市级智能算力资源统筹调度服务平台」。 | 沪经信智〔2025〕489 号、〔2026〕248 号;徐汇区若干意见;智算云实施意见 |
| 10 | 国产化是入场资格,不是加分项;同时存在一个采购品类空白。上海要求 2027 年自主可控算力占比超 70%,这让国产加速器适配能力成为硬门槛——而能把国产卡推理真正做出可用性能的团队非常少,这恰是我们最大的结构性优势。另外,检索未找到任何一个按 Token 计费的算力服务公开中标案例,现有全是「卡 / 台 / 月」:客户正在买一个没有采购模板的东西,谁先做出这套模板谁定义品类。 | 上海智算云实施意见;工信厅通信〔2026〕14 号;公开采购记录检索 |
| 11 | 价格战已经结束,2026 年出现反向涨价。2026-03 智谱 GLM-5-Turbo 涨约 83%、腾讯云自研模型 API 一度涨 463%,17 家厂商中超七成在涨价;DeepSeek 于 2026-08-17 启用峰谷分时定价,高峰价为空闲时段两倍且限流概率同时上升。「今天的低价不可持续」已经从预测变成事实。对报价的直接影响:任何以当前挂牌价为基准的多年测算都要加涨价情景,而峰谷分时定价对无法把调用推到夜间的 Agent 类长任务尤其不利。 | 各厂商定价公告与横评,2026-03 / 2026-08-17 |
| 12 | 同城对手就在我们这一层,不要用错话术。无问芯穹(模速空间算力生态超市的建设与运营方)的核心资产正是推理引擎(Inference Engine)优化,其 CEO 原话是「优化即利润增长」——任何「别人只做资源、我们才做优化」的说法一旦出口就会被戳穿。但抓取其平台前端代码发现,同一套代码正在服务至少九个租户(临平、杭州、武汉、清华天津院、上海移动天问等),说明园区级平台对它是标准化白标产品而非定制交付。差异因此落在交付深度、私有化能力与敢不敢按结果计价上,而不是落在「层次不同」上。 | §3.4 一手抓取;WAIC 2026 公开演讲 |
第 1 章(人、时机、项目库)、第 2 章的算术、第 5 章的渠道逻辑、第 7 章的政策。这四章决定你能不能在开场十分钟内建立可信度。
第 8 章的逐家画像与切入顺序——那是唯一可以直接拿去打电话的部分。配合 §2.4 的两个杠杆一起讲。
§2.6 的六问表、图 2-1 的成本构成、第 11 章的议程与开场话术。其余内容只在被追问时展开。
第 9 章的九个必答题,尤其 §9.2(赛道很卷怎么答)与 §9.3(模速空间已经有算力超市了怎么答)——这两条大概率会被问到。
§4.7 与附录 D 的清单。招股书类数字来自前期检索记录,方向可靠但需回原文定位。
先把一件事定死:工研院是渠道,不是客户。真正用 token、真正付钱、真正决定这件事成不成的,是它下面那批企业。我们找工研院谈,是因为通过它可以一次触达几十家企业、拿到统一入口与统一结算,而不是因为它自己要用推理。这一章因此分两半:前半确认渠道侧的人与时机,后半把 38 个在孵项目逐个过一遍,找出真正的客户在哪。
对口主体是上海交大工业技术创新研究院(通称工研院,i3sjtu.cn),2024 年 10 月 9 日启动,由上海交通大学举办、与徐汇区政府联合共建,定位为人工智能孵化器与加速器,与交大人工智能学院一体化运行,办公地在徐汇区番禺路 868 号。它采用理事会治理(第一届理事会第三次会议于 2026-01-07 召开),对外签约由执行院长落章。
对我们而言,它的性质决定了合作形态:它是一个把企业聚在一起的平台,本身不是推理负载的产生方。所以这笔生意的结构是「与平台签框架、向企业交付」——平台负责把人聚齐、把入口统一、把补贴通道打通,企业负责真实用量与续费。这两侧的说服逻辑完全不同,第 5 章讲前者,第 8 章讲后者。
工研院的法人性质未见公开登记信息——是校属事业单位,还是公司化运营平台?实操上更像后者,但这一点直接决定合同主体、发票类型、资金来源路径与适用的采购流程,是所有商务设计的前提,不能靠猜。
| 姓名 | 职务 | 对我们的意义 |
|---|---|---|
| 刘晓娜 | 工研院执行院长,公开场合的对外签约人 | 实际拍板与落章的人。商务方案要按她的口径设计 |
| 赵军 | 工研院院长(官网「院长任命宣布会议」,2026-08-18) | 上任仅八天。新任负责人需要早期成果,对能形成建成物与可汇报指标的项目接受度最高 |
| 王延峰 | 工研院理事长;交大人工智能学院执行院长 | 治理层与学院侧的连接点,决定战略级议题 |
| 王佳梁 | 启动时执行院长(触宝科技创始人) | 连续创业者背景,说明该机构不排斥产业化语言 |
| 鄂维南 | 人工智能学院首席顾问(中科院院士) | 学术侧背书,与 AI for Science 方向相关 |
院长于 2026-08-18 到任,距今仅八天。新任负责人的第一批动作通常需要「看得见的建成物」,而不是又一笔看不见的费用支出——这与第 5 章要讲的四项价值高度吻合。这类窗口一般只有几个月,建议尽快接触。(任命目前仅见官网单一来源,接触前建议再核实一次。)
工研院对外的三大方向是具身智能、人工智能出海、AI for Science / Engineering;三大服务是 AI 出海加速器、AI 社区、AI 赋能中台。其中「AI 赋能中台」在官网列出的要素清单里明确包含一项:
种子资金 · 专业开发环境 · 高性能算力 · 工程师资源 · 真实产业需求对接 · 概念验证试点 · 首购订单机会 · 技术顾问与产业导师匹配
「高性能算力」已经被工研院写进了自己对外承诺的服务清单。我们不是去推销一个新东西,而是去帮他们把已经许下的承诺兑现得更好、更便宜、更可汇报。这让对话从第一句话起就站在同一侧。
另外,「首购订单机会」说明工研院自身有采购动作和预算,不只是撮合方——这与「每年一亿元 token 支出」的前提相互印证。
我们把工研院项目库中的 38 个在孵项目逐个读过一遍,按是否消耗大语言模型在线推理 token 做了三层分类。结论出乎意料,也直接决定了这一亿元该怎么谈:
| 项目 | 属性 | 为什么是大户 | 强度 |
|---|---|---|---|
| Wisdom AI(星际章鱼) | AI Agent · 企业私域 | 对抗式 Critic Agent 实现无人自主优化——自我迭代循环的 token 消耗呈指数增长;面向海外中小 B 的订阅与按效果付费 | 极高 |
| 沅域智能 | AI 世界模型 / 游戏 Agent | 一键生成可交互 3D 游戏场景,短期面向游戏工作室提供 B 端 API 服务;多模态生成的单次推理成本极高 | 极高 |
| 基元律动 | 多智能体 Agent · 大模型调度 | OpenSquilla 多模型调度框架本身就是 token 流量入口,提供公有云 API 与私有化部署,商业模式即按量售卖 API | 极高 |
| 科学引擎 | 医疗 AI · 多模态癌症早筛 | Science Engine 定位全自动 AI 科研助手=长链路 Agent;多模态自进化推理模型;院内数据不出域 | 高 |
| 观壹科技 | AI for Life Science | 罕见病循证诊断智能体 DeepRare,向 Virtual Cell 与 AI Scientist 演进,长链推理与多尺度建模 | 高 |
| 深光地球 | 矿业垂直大模型 | 自研融合视觉 Transformer 与 LLM 的跨模态大模型,矿业智能投研与储量评估 | 高 |
| 心流直觉 | 具身智能 · 底层世界模型 | 商业模式明确写着「项目制一体化交付与 Token 订阅双模式」——已经在按 token 卖了 | 高 |
| EvoKernel | AI 算子自动优化 | 记忆自演进算子智能体,为芯片厂与云厂自动生成优化算子;Agent 迭代本身极耗推理 | 高 |
| 数元纪科技 | 医疗 AI · 系统生物学 | 四业务线并行,科研数据分析与肿瘤 AI 用药模型 | 中高 |
| 光之宇 | 光学垂直大模型 | Optics GPT,光模块智能标定、算力中心运维、仪器智能分析 | 中高 |
| 千诀科技 | 具身大脑 | 因果推理与长任务操作,可解释性路线 | 中 |
| 观行智能 | 具身智能自进化 | World Model + 强化学习闭环,训练为主但评估与仿真推理量大 | 中 |
无界动力、深度原理、索格智算、觉行·时空智能、源络科技、破壳智能、未来不远。这一层消耗的是卡时而不是 token——需求真实且金额可能很大,但属于训练与仿真负载,与 Token 平台是两条线。在会谈中要主动把这两条线分开,不要混为一谈:混着讲会让对方觉得我们在夸大可服务范围。
主动科技、傲意科技、上海太洋、lightGen、蓝启智能、金珵科技、氮化硼项目、载育量子、太微量子、鸿鹄聚变、幻码跃迁、空山慈、灵泷视界、明视脑机、太一量生、智子光垣、纳开量子、铁马量子、酉术量子。这一层几乎不产生 LLM 推理需求。
38 个项目里只有 12 个是真正的推理 token 消耗方,而其中前四家很可能就占了大部分。这意味着两件事:
① 一亿元的口径几乎必然不止「LLM 推理 token」。它更可能是「算力 + 模型调用」的合计盘子,甚至包含 B 层的训练卡时。所以第一次会谈的首要任务是拆口径(§2.6 的六个数字),而不是报价。
② 切入点非常集中。不需要说服 38 家,只要拿下 A 层前四到六家,就覆盖了这笔预算的主要部分。这让第 10 章的第二段试运行(自愿报名 3–5 家)从一个模糊的建议,变成一份点名清单。
一条外部数据可以印证这个分层的合理性:国信证券基于 OpenRouter 平台的统计显示,Agent 与 Coding 类应用仅占应用数量的 19%,却贡献了 81.2% 的 Token 消耗(2026-08-07)。A 层里排前面的几家恰好都是 Agent 形态——这不是巧合,而是这类负载的固有特征。同一份报告还指出,前十大应用的每请求 Token 中位数为 75,479,而第 11–99 名应用仅为 28,430,头部应用的单请求消耗是长尾的 2.7 倍。
这是全章最需要提前想清楚的一点。工研院自己孵化的项目里,有两家在做与我们相邻的事。如果我们不主动说,对方一定会问;而由我们先提出并给出关系定位,可信度完全不同。
前华为诺亚方舟博士团队,OpenSquilla 开源多模型智能调度框架,分层路由实现「Token 成本降低 90%」,兼容国产大模型,已完成天使轮。
关系定位:不同层,可叠乘。路由解决的是「这个请求该调哪个模型」,我们解决的是「这个模型跑起来单位成本多少」。两者相乘才是最终成本,而且他们的私有化部署恰恰需要一个高效的底层推理引擎——那正是我们。
为芯片厂与云厂提供 AI 智能体自动生成优化 GPU 算子,适配昇腾、壁仞等国产异构芯片,团队含昇腾资深研发,千算 CLI 已商用。
关系定位:工具 vs 端到端服务。他们做算子生成工具,我们交付的是完整推理服务与 SLA。而且自动生成的算子需要真实推理负载来验证收益——园区平台正是最好的验证场。
建议在会谈中主动说出来:「您孵化的基元律动做的是路由层,EvoKernel 做的是算子生成工具,我们做的是把模型真正跑便宜的那一层加上端到端交付。这三件事是叠加关系不是替代关系——事实上他们两家都可能是这个平台的用户或合作方。」
由我们先说和被对方问出来,是完全不同的两件事——前者是做过功课,后者是辩解。
Wisdom AI(星际章鱼)项目的 CEO,公开资料称其从零搭建火山方舟并实现数十亿年收入。火山方舟是国内 MaaS(Model-as-a-Service,模型即服务) 市场的头部平台(按 IDC 口径,火山引擎在调用量份额上接近一半)。
此人对 token 平台的成本结构、定价策略与运营细节的理解,大概率超过会议室里的任何人,包括我们。这意味着:任何含糊的、营销式的说法在他面前会立刻失效;但反过来,第 2 章那套基于公开披露数据的成本算术,恰恰是他最能验证、也最会认可的语言。
建议把他当作最重要的说服对象,也当作最有价值的潜在背书人。如果他认可我们的成本模型,工研院内部几乎不需要再说服别人。
要让对方意识到这笔钱的分量,不能拿市场份额做对比——工研院的一亿元里可能含私有化部署、海外模型调用与训练算力,而公开的市场规模统计口径各不相同,一比就有漏洞。换算成硬件反而干净:钱、卡、时间,三者之间的关系没有口径争议。
一亿元的年支出,对应的是数百张卡整年运行的量级。而按券商公开测算,这个规模的资源如果统一调度,可以支撑的 token 产出远高于各家分散自建。
会谈中的说法建议这样讲:「一亿元换成卡,是几百张的量级、整年不停。这个体量在任何一家供应商那里都该拿到最好的条款——问题是分散付出去的时候,它不是一个体量,是几十笔小单。」
刻意不做的对比:不要拿「占中国公有云 MaaS 市场营收的百分之几」这类说法——分子含私有化与海外调用,分母只统计境内公有云,口径对不上,一被追问就失分。卡数这个口径谁都能验算。
这一章只做一件事:把「每年一亿元 token 费用」拆成可以逐项追问的算术。拆完之后,我们的优势不再是一句形容词,而是这张表里的两个格子。
Token 的价格不是一个市场自然价,它是被三个工程量决定的。任何供应商的报价,往前推一步都是这个式子:
把这个式子记住,后面所有的讨论都只是在问一句话:这一亿元里,有多少花在分子上,有多少是被分母的低效吃掉的。
「推理成本本来就在飞快下降,我们等着变便宜不就行了?」——MiniMax 招股章程行业章节(p.183,引灼识咨询)确实写着:「業內平均推理成本由 2022 年末的約每百萬 token 20 美元降至 2024 年末的每百萬 token 不到 0.1 美元,且預計將以每年約 10 倍的速度持續下降。」
但这正是要点所在:这个下降不是自然发生的,它就是上面那个分母被一群人做上去的结果。行业平均成本下降,只意味着「做得好的人」把标准拉高了;对某一个具体客户来说,你的成本会不会跟着降,完全取决于你的供应商属于哪一边。第 4 章会给出两家同期公司毛利率相差七十个百分点的招股书证据。
这个行业半年前的数字就可能失效,本报告其余部分几乎全部换成了 2026 年口径。唯独成本标尺这一项,至今没有出现过更新的替代品——它是极少数由服务方主动公开、把卡数、时长、token 量、成本假设逐项摆出来、可被外部逐条复核的样本。2026 年至今没有任何一家再做过同等透明度的披露。
用法因此要收窄:它证明的是「挂牌价里算力占比很低」这个结构,而不是今天的绝对成本。绝对价格请用 §2.5 的 2026 年券商单机测算与 §4.5 的最新租金数据。会谈中主动说明这一点,比被人指出来强。
要回答上面的问题,需要一个可信的成本参照。行业里最硬的一份公开数据来自 DeepSeek 自己:2025 年 3 月 1 日,他们公开披露了 V3/R1 线上推理系统连续 24 小时的完整运行统计与成本核算[DS]。这是极少数由服务方主动公开、可被逐项复核的成本样本。
| 披露项 | 数值 | 说明 |
|---|---|---|
| 统计窗口 | 24 小时 | 2025-02-27 12:00 至 2025-02-28 12:00(北京时间) |
| 峰值 / 平均节点占用 | 278 / 226.75 节点 | 每节点 8 张 H800,平均折合 1,814 张卡 |
| 假定卡时单价 | 2 美元 / 卡 · 小时 | 官方自设的成本假设 |
| 当日总成本 | 87,072 美元 | 1,814 × 24 × 2 = 87,072,与官方数字逐项核对一致 |
| 当日输入 token | 6,080 亿 | 其中 3,420 亿(56.3%)命中磁盘 KV 缓存(KV Cache) |
| 当日输出 token | 1,680 亿 | — |
| 按 R1 定价折算理论日收入 | 562,027 美元 | 官方明确说明实际收入远低于此(V3 更便宜、部分服务免费、夜间折扣) |
| 成本 ÷ 理论收入 | 15.5% | 即官方口径的「理论成本利润率 545%」 |
口径提醒:这 15.5% 只含卡时租金,不含研发、带宽、存储与运维人力;卡时单价是官方假设值;理论收入按 R1 满价计算而实际收入更低。所以它不是真实利润率,但它给「纯算力成本占挂牌价的比重」划了一条相当可靠的下界——这正是我们需要的定标。
输出侧:1,680 亿 ÷ 1,814 张卡 ÷ 86,400 秒 ≈ 1,072 token/s/卡(全集群平均折算,非单节点峰值)。
输入输出合计:(6,080 + 1,680)亿 ÷ 1,814 ÷ 86,400 ≈ 4,951 token/s/卡。
把全部成本摊到输出 token:87,072 ÷ 1,680 亿 × 100 万 ≈ 0.518 美元/百万输出 token,约合 3.7 元。而同期 R1 的输出挂牌价是 16 元/百万——你付的每 16 元里,大约 3.7 元是算力,其余 12 元多是别的东西。
下表左列是园区实际支付的混合 token 单价(这个数需要在第一次会谈中问清,见 §2.5),右侧是按上面披露效率反推的真实算力成本。
| 混合支付单价 | 年 token 量 | 日均 | 底层算力成本 | 算力占比 | 非算力部分 |
|---|---|---|---|---|---|
| 2 元/百万 | 50.0 万亿 | 1,370 亿/天 | 约 3,980 万元 | 39.8% | 6,020 万元 |
| 4 元/百万 | 25.0 万亿 | 685 亿/天 | 约 1,990 万元 | 19.9% | 8,010 万元 |
| 8 元/百万 | 12.5 万亿 | 342 亿/天 | 约 1,000 万元 | 10.0% | 9,000 万元 |
| 16 元/百万 | 6.25 万亿 | 171 亿/天 | 约 500 万元 | 5.0% | 9,500 万元 |
| 50 元/百万 | 2.00 万亿 | 55 亿/天 | 约 160 万元 | 1.6% | 9,840 万元 |
| 120 元/百万 | 0.83 万亿 | 23 亿/天 | 约 67 万元 | 0.7% | 9,930 万元 |
「底层算力成本」按 DeepSeek 披露的 0.8 元/百万 token(成本摊到输入+输出全部 token)折算,汇率取 7.1。最后两行对应大量使用海外前沿模型的情形——AI 出海类企业的实际混合单价往往落在这个区间,此时算力成本占比不到 2%,付的几乎全是模型溢价与渠道费。
回到 §2.1 的恒等式。卡时成本(分子)是采购能力,谈判空间有限且人人可比;真正拉开差距的是分母的两项,而这两项都是纯工程能力:
| 情形 | 单卡吞吐 | 集群利用率(Cluster Utilization) | 单位成本 | 相对基线 |
|---|---|---|---|---|
| 基线:能跑通,但没调过 | 2,000 tok/s | 30% | 10.57 元/百万 | 1.00× |
| 只做吞吐优化(算子、批处理、调度) | 3,000 tok/s | 30% | 7.05 元/百万 | 1.50× |
| 只做利用率优化(需求聚合、峰谷互补) | 2,000 tok/s | 60% | 5.28 元/百万 | 2.00× |
| 两项同时做 | 3,000 tok/s | 60% | 3.52 元/百万 | 3.00× |
| 深度优化 | 4,000 tok/s | 75% | 2.11 元/百万 | 5.00× |
算例统一按 20 万元/卡/年的整机租金折算,仅用于展示两个杠杆的相对量级,不代表任何实际报价。吞吐取值区间参照 §2.2 反推的 4,951 token/s(DeepSeek 在 H800 上以大规模专家并行做到的水平)与国产加速器上未经深度优化时的常见落点。
它说明一件反直觉的事:「便宜」不是采购能力,是工程能力。一个团队若只会转售别人的 token,它能给的折扣上限就是自己的渠道返点;而一个能同时动吞吐和利用率两个格子的团队,成本下降空间是倍数级的,且这个空间不依赖任何人的补贴,因此可持续、可承诺、可写进合同。
利用率这一格,园区平台有一个别人拿不到的天然优势:需求聚合带来的峰谷互补。
单一创业公司的推理负载极不平稳——白天调试、夜间空转、demo 前突然打满、融资路演期翻十倍。它若自己买卡,必须按峰值备容,平均利用率就注定很低;它若买公有云 API,则要为别人的调度不确定性付溢价。而几十家企业的负载叠加之后,总量曲线会显著变平,这是统计规律而非管理技巧:
园区把分散的推理需求归拢到一个平台上,不只是为了集中采购拿折扣,而是把每家企业各自浪费的那部分闲置容量互相填平。三十家企业统一调度,利用率上限从不到四成抬到接近八成——按 §2.4 的表,这一项本身就值两倍成本差。这个红利只有园区自己能创造,任何单点供应商都给不了;但它需要一个有能力做统一调度的技术方来兑现。
国信证券在 2026-07-24 的报告中测算了同一组需求的两种供给方式(以 Prosus 部署 Llama-3.3-70B 为例):在固定 200B token/天的需求下——
客户各自裸金属自部署需要约 1,102 张 H100,日支出约 66,138 美元;
统一的 Token 工厂方案只需要约 244 张 H100,日支出约 23,400 美元。
对应单卡日收入从裸金属的 60 美元提升到 96 美元(+60%)。同一份报告还指出,客户自部署时还要额外承担 10%–20% 的冗余缓冲算力闲置损耗。
卡数相差约 4.5 倍。这不是营销话术,是卖方研究机构在公开报告里算的账——而且它同时包含了本节讲的聚合效应与 §2.4 讲的工程效应。这组数字建议直接印出来带进会场。
国泰海通《算力租赁深度电话会:Token 分成模式重塑算力商业闭环与估值跃迁》(2026-07-08)给出了目前公开渠道唯一带完整参数的中文单机模型——单台 B300 部署国产大模型:
| 日均运行时长 | 20–24 小时 | 负载率 | 50%–70% |
|---|---|---|---|
| 单卡吞吐 | 8,000 Token/秒 | Token 单价 | 1–3 分/千 Token |
| 算力方分成 | 80% | 月收益 / 月利润 | 60–250 万元 / 30–80 万元 |
| 硬件锚 | B 卡现货约 1,200 万元/台 | H 卡约 400 万元/台 |
合同结构值得注意:「保底租金覆盖 30%–40% 固定成本 + 超额分成」,分成一般对半。该纪要给 Token 运营类资产的估值是 PS 大于 8 倍,对照传统 IDC 的 5 倍。
这份测算的价值在于它把负载率写成了显式变量(50%–70%)——而这正是 §2.4 里我们说「分母决定一切」的那一项。对照国信证券那份 Nebius 模型(利用率 60%→69%,毛利率 30%→54%→81%),两家券商的路径完全一致,差异几乎全部来自利用率假设。另需注意:两份测算都没有明示折旧年限,这是全行业的共同缺口(§4.4)。
上面所有推算都建立在假设的混合单价上。在拿到真实口径之前,任何报价都是猜测。因此第一次见面的核心目标不是报价,而是把这六个数字问清楚——能把这六个问题问出来,本身就已经和「来卖 token 的」区分开了:
其中多少是模型 API 采购、多少是算力租赁、多少是平台与人力?是园区统一支付,还是各企业自付后申请补贴?
开源模型(DeepSeek / Qwen / GLM 系)与闭源、境内与海外前沿模型各占多少金额?这直接决定混合单价落在 §2.3 表的哪一行。
输入输出比决定成本结构(预填充与解码的经济性完全不同);命中率决定还有多少重复计算可以省掉。
决定要备多少容量,也决定 §2.5 的聚合红利到底有多大。要按企业分别拿,不能只拿总量。
长上下文的显存与调度代价是短请求的数倍,多模态更甚。这一项占比高,优化空间反而更大。
数据是否允许出域、是否有国产化率要求、结算是否必须走招标与专票、SLA 与合规审计怎么定。这些决定方案形态,也决定谁被排除在外。
建议把这六项做成一页表格现场填写。它同时是一份需求调研表和一份专业度证明:愿意先把口径搞清楚再谈价格的供应商,在这个赛道里是少数。
这一章先承认现实:Token 工厂已经是一个拥挤的赛道,有大厂、有运营商、有国资平台、有拿到大额融资的创业公司,也有已经递表上市的。但把玩家按「靠什么赚钱」分层之后会发现,绝大多数人挤在两个我们不去的位置上。
这张图要在会谈中传达的判断只有一句:「卷」发生在 L2 和 L3。这两层的共同特征是不对客户的效率负责——L2 把卡租出去就完成交付,L3 把 token 转手就完成交付。而单位成本真正下降的地方在 L4。
IDC(2026-05-07)的份额数据显示,按调用量计火山引擎接近 50%,按营收计火山引擎 40%+,其后为阿里云、百度智能云、智谱、移动云。市场规模一侧:中国公有云 MaaS 营收 2025 年 30.7 亿元,2026 年预测 186 亿元;调用量 2024 年 114 万亿 tokens → 2025 年 1,944 万亿 tokens(约 16 倍)。
调用量一年增长约 16 倍,而营收从个位数亿元增长到 30.7 亿元。量的增速远高于收入的增速,意味着单价在快速下行——这既是客户的红利,也是供给侧亏损的直接原因(第 4 章)。对采购方的含义是:现在的低价里,有一部分是别人的市场投入,它不构成对未来三年的价格承诺。
这一层的特点是投资额巨大、以政府与国资为主导、对外服务能力参差。已知的公开案例包括:
| 案例 | 性质与量级 | 置信度 |
|---|---|---|
| 中国电信宁夏 Token 工厂相关集采 | 百亿元量级的集中采购(记录口径约 174 亿元) | 待核金额与口径需再次核实后方可引用 |
| 软通动力「北京壹号词元工厂」 | 企业主导的 token 工厂品牌化尝试 | 媒体 |
| 弘信电子 · 燧弘(无锡)Token 工厂 | 上市公司参与的区域 token 工厂 | 媒体 |
这三条来自本项目前期检索记录,本轮因检索额度耗尽未能重新逐项核实。建议在正式会谈引用前再核一遍原始公告——尤其是那个百亿元级的数字,口径(是 token 工厂本身,还是包含算力、网络与集成的总包)差别很大。作为背景趋势使用没有问题,作为具体论据要谨慎。
对我们的实际意义:这一层是潜在的算力来源,而不是竞争对手。它们普遍缺的正是 L4 的能力——建成了集群,但把集群变成低单位成本的 token 服务,是另一回事。
这是同区、同类、最直接可比的先例,会谈中对方很可能主动提起。而且必须先纠正一个容易犯的错误判断:它不是「资源撮合层」,它就在我们要去的这一层。
平台侧:2025-02-21 发布,对外称国内首个「算力生态超市」,由模速空间 + 无问芯穹 + 上海仪电三方共建,无问芯穹为建设方与运营方;入驻企业「免申即享」100 万元等价算力大礼包,兑现方式是按使用情况周期性结算算力补贴(运营方原话),不是现金。
技术侧(关键):无问芯穹的核心资产恰恰是推理引擎优化——FlashDecoding++(arXiv 2311.01282,与清华、上交联合,GPU 上提速 2–4 倍,已集成进自研引擎 Infini-ACC)、SpecEE(ISCA 2025 收录)、Agentic MaaS 自述「与原厂模型精度对齐率超 99.9%、系统吞吐提升 2–3 倍、整体时延缩减 50%、可用率 99.95%」;异构混训(Heterogeneous Hybrid Training)千卡单任务算力利用率最高 97.6%,支持六种芯片。
规模侧:累计融资超 22 亿元;纳管算力 25000P+,覆盖 26 城 53 个数据中心;2025 年收入超 5 亿元、现金流为正(CEO 受访口径,非审计数)。
其 CEO 在 2026 WAIC 的原话是:「英伟达提出算力即收入,无问芯穹提出优化即利润增长。」这几乎就是我们准备打的口号。所以任何「别人只做资源、我们才做优化」的论证都站不住脚——一旦被对方或其技术顾问戳穿,整章的可信度都会受损。
直接抓取模速空间算力平台前端代码(ms-computility.cloud.infini-ai.com,2026-08-26 访问,HTTP 200)后发现,其 JS 中存在一张硬编码的域名到平台名映射表,同一套代码库正在服务至少九个租户:
| 域名前缀 | 对外平台名 | 域名前缀 | 对外平台名 |
|---|---|---|---|
ms-computility | 模速空间算力生态平台 | zj-computility | 杭州市算力资源调度服务平台 |
hzzlss | 临平区算力调度服务平台 | whsuanli | 武汉算力公共服务平台 |
ieit-ai | 清华大学天津电子信息研究院智算平台 | tw | 上海移动天问 Token 服务 |
lanqi | 澜启智算 | neogpu | 算力牛 |
hnhyf | 四海 AI | (其中上海移动天问、武汉两站经复核当前均返回 HTTP 200) | |
「园区级 Token 平台」对他们不是一次性定制项目,而是一套可复用的多租户白标产品,边际交付成本极低。这意味着两件事:
① 我们若以「为工研院定制一套平台」为卖点,必须能回答「为什么不直接买他们的白标」——这个问题一定会被问到(§9.3 给出答法)。
② 反过来,标准化产品的另一面是不做深度定制:九个租户共用一套代码,说明交付的是通用能力,而不是针对某一批具体负载的专项调优。这正是我们的空间所在。
还有一条对我们有利的事实:算力生态超市运行一年半,接入企业数、实际调用量、集群利用率、续约率、满意度——全部未找到任何公开数据检索结论。可公开引用的只有发布日与首批签约名单。说不清效果,是标准化平台的通病,也是我们最该攻的地方(见 §9.3 递回去的那个问题)。另有两条媒体转述(商汤专供徐汇 4000P、上海电信 500 万元算力优惠)待核,不建议主动引用。
下表按港交所披露易综合索引与交易所项目库逐条核对(截至 2026-08-26),纠正了几个流传较广的误传。
| 公司 | 真实状态 | 要点 |
|---|---|---|
| 硅基流动 | 已递表、处理中 申請版本 2026-06-30 | 港交所第十八C章特专科技申请人,自述为「未商業化公司」;尚无聆讯后资料集,未过聆讯。申請版本 2026-12-30 届满 |
| 基流科技 | 已递表、处理中 申請版本 2026-04-29 | 走常规主板盈利测试;无 PHIP。申請版本 2026-10-29 届满 |
| 无问芯穹 | 查无任何递表记录 | 港交所 2013–2026 全量索引 3,865 条无命中;上交所在审与历史项目 1,048 条、深交所 2,810 条项目库均无命中。此前流传的「已递表港股」说法不成立(注:中国证监会境外上市备案清单本轮未能核查,故表述为「三大交易所无记录」而非「绝对未启动」) |
| 智谱 02513 / MiniMax 00100 / 云知声 09678 | 已上市 | 分别于 2025-12-19 / 2025-12-21 / 2025-06-12 挂牌 |
| 白山云 | 两度递表、两度失效 | 2023-12-29 与 2025-10-15 两次递表均已失效,现无在审申请 |
| 安徽海马云 GPU 云 / 云渲染 | 两度递表、两度失效 | 2025-06-27 与 2026-01-30 两次递表均已失效,现无在审申请 |
① 资本市场确实在给这个赛道开窗口,但两家最像我们的公司都还只是「已递表、处理中」,没有一家通过聆讯。把「同行都上市了」当作赛道成熟的证据,是不准确的。
② 已经有人两度递表两度失效。白山云与海马云的经历说明这个赛道的资本故事并不好讲——而这恰好回到第 4 章的结论:讲不通的原因是单位经济模型本身没跑通。
这一章是全篇论证的另一半支柱。如果这个赛道的低价来自补贴,那么「便宜」就不是采购能力的证明,而是一个即将结束的窗口;反过来,只有来自工程的低成本才能被承诺三年。招股书里的分业务毛利率把这件事说得很清楚。
最有说服力的证据不是行业平均值,而是同一家公司内部不同业务线的对比——它排除了管理能力、融资能力、团队水平这些干扰项,只剩下商业模式本身的差异。
| 披露主体 / 出处 | 业务线 | 毛利率 | 说明 |
|---|---|---|---|
| 硅基流动 SiliconFlow 港交所申請版本 2026-06-30 财务资料 p.179 | 公有云服务(2024) | −271.6% | 即每收 1 元、成本约 3.7 元 |
| 公有云服务(2025) | −119.0% | 大幅改善,但仍是负毛利;整体毛利率由 2024 年 +39.4% 转为 −24.0% | |
| 本地部署解决方案 | 82.5%(2025) 92.4%(2024) | 同一家公司、同一套技术,形态一换毛利率反转。下滑原因招股书归因于交付复杂度上升而非降价 | |
| 成本结构(p.178) | 算力租赁费占销售成本 86.9% | 算力 100% 外租:前五大供应商全部提供算力资源(占采购 70.8%),而公司名下物业厂房及设备净值仅 92.7 万元(p.I-22)——账上没有一张 GPU | |
| 基流科技 港交所申請版本 2026-04-29 财务资料 p.218 | AI 算力集群产品(2025) | 16.8% 2024 为 18.2% | 卖硬件与集群,接近工程集成的利润率 |
| 集群运营服务(2025) | 47.7% 2024 为 56.1% | 同一家公司,运营服务是产品交付的近三倍。但两条线都在跌;应收账款周转天数 3.2 → 12.5 → 64.1 天 | |
| 券商研报口径 国金证券《Token 计费重塑 AI 产业链》2026-07-17,第 2.5 节 | 3.0 级=推理基础设施模式 | 50%+ | 原文对标 FireworksAI(美国头部 Token 聚合厂商,自研推理调度体系部署开源模型);对照组是「GPU 机架租赁行业平均 20%–30%」 |
上表两家公司的数据已回港交所披露易招股书原文逐条核实并标注页码(申請版本,非聆讯后资料集)。需要说明的是:两家均处于「已递表、处理中」状态,尚未通过聆讯。
把 A 股同业一起放进来看会发现,同样叫「智算业务」,毛利率能差三四十个百分点——因为它们根本不是同一门生意:
| 物种 | 代表与毛利率 | 本质 |
|---|---|---|
| 重资产自建 IDC / AIDC | 润泽科技 AIDC 48.50%;优刻得机柜托管 43.61% | 卖的是机柜、电力与制冷,本质是地产与能源生意,毛利率高但资本开支巨大、折旧沉重 |
| GPU 算力转售 | 并行科技智算云 11.37%;首都在线大模型及 AIGC 11.40%;软通动力智算服务 10.63%;青云科技云服务 4.89% | 卖的是卡时,向上游买、向下游卖,赚价差。硅基流动与基流科技所处的位置更接近这一类 |
浙商证券在其算力租赁行业研究框架中的核心结论是:「给定算力租金水平和折旧年限,AI 算力租赁的毛利率基本固定,可提升空间有限。」二手转述
这句话解释了整张表:在 L3 卡时租赁那一层,毛利率被租金与折旧两个外生变量锁死,经营能力几乎无从发挥——这也是为什么并行科技的算力服务毛利率会一路跌到 15.57%,而它并没有做错什么。要突破这个天花板,唯一的办法是往上走到「按产出计费」的那一层,也就是把卡时变成 token。而那一层的毛利率不再由租金决定,由吞吐和利用率决定。
这个区分在会谈中非常有用:如果对方拿「某某智算中心毛利率 48%」来质疑我们说这行不赚钱,可以直接指出那是机柜生意的毛利率,与 token 服务不是一回事。而真正做 token 与卡时的这一类,毛利率普遍在 5%–12% 甚至为负。
行业平均值容易被质疑口径,具名公司的公开财务与公开表态不会。这三家把整条逻辑链走完了。
潞晨科技于 2025-03-01 官宣,在上线约一周后停止其 DeepSeek API 服务并对余额全额退款。创始人尤洋此前的公开测算是这个赛道被引用最多的一段话:
「MaaS 在中国短时间内可能是最差的商业模式……满血版 DeepSeek R1 每百万 token 官方也只能收到 16 元,如果每日输出 1000 亿 token,那么每月的机器成本是 4.5 亿,亏损 4 亿,用户越多,亏损越多。」
他同时指出:「常规 MaaS 要实现稳定输出,需准备的机器可能是理论值的 5 倍。」——即 §2.2 那份官方披露是在满负荷前提下算的,真实运营要为峰值备容。
这段话对我们是双刃的,必须诚实处理:它同时也在质疑我们第 2 章引用的成本口径。正确的用法是主动把它讲出来,然后指出——「机器是理论值 5 倍」说的正是利用率问题,而利用率恰恰是 §2.1 恒等式分母里我们要动的那一项。他描述的困境,正是我们主张的机会。
| 公司 | 公开财务 | 状态 |
|---|---|---|
| 硅基流动 中国最大独立生态词元供应商(自述) |
2025 年营收 5,533 万元(+653.2%);毛利率由 2024 年 +39.4% 转为 −24.0%,其中公有云服务毛利率 −119.0%;年内亏损 3.45 亿元。 应付账款周转天数由 158 天收缩至 46 天,而应收由 92 天降至 48 天——算力供应商正在收紧对它的信用。市占率方面,中国词元供应平台前三名合计 87.0%,该公司作为「最大的独立生态词元供应平台」仅占 1.5% |
2026-06-30 递表港交所主板 |
| PPIO 派欧云 | 2022–2024 营收 2.86 / 3.58 / 5.58 亿元,净亏 0.85 / 1.89 / 2.94 亿元,三年累亏 5.68 亿元;AI 云计算业务(GPU 云+模型 API)过去两年录得毛损 | 2026-06-10 二次递表港交所 |
| 行业平均 | 2024 年国内大模型行业平均毛利率约 −80%,2025 年约 −30% | — |
把三个科目相加——销售成本内的算力资源成本 5,962.7 万元(p.178)+ 销售及营销开支内的「推广算力资源成本」5,421.3 万元(p.180)+ 研发开支内的「研发算力资源成本」4,524.1 万元(p.181)= 1.591 亿元。
而同期总收入是 5,533 万元。算力租赁总支出是收入的 2.88 倍。
其中「推广算力资源成本」5,421.3 万元就是发免费词元代金券烧掉的算力,相当于同期公有云收入 2,926.1 万元的 1.85 倍——补贴不是一个抽象概念,它有确切金额,而且比收入还大。
价格战的另一个刻度:Serverless 单付费客户年均收入从 2024 年的 185.3 元塌到 2025 年的 19.97 元,一年降 89%。
注意硅基流动那一行的内在矛盾:营收涨了 6.5 倍,毛利率却从正转负。这直接证伪了「规模上来自然就有毛利」的假设——在这个赛道里,规模扩张如果没有单位成本的同步下降,只会把亏损一起放大。
这是整份材料里最有力的证据。在看数字之前,先把两个词说清楚,后面就都能读懂了:
每收 100 元,扣掉直接成本后还剩多少。剩 69 元就是 69%;如果成本比收入还高,就是负数——收 100 元、成本 104 元,就是 −4%,卖一单亏一单。对 API 生意来说,这里的「直接成本」几乎就是算力费用。
卡在多少比例的时间里真正在干活。75% 意味着四分之三的算力变成了产出;行业平均 40%–50%,意味着一半以上的算力在空转,但电费和租金一分不少。MFU 直接决定同一张卡能产出多少 token,也就直接决定单位成本。
下面是两家已上市模型公司的招股书原文数字。它们同期、同赛道、都在卖 API,结果却在两个极端。
| 公司 | API / 云端业务毛利率 | 出处 |
|---|---|---|
| 智谱 02513 「云端部署」口径 |
2022 76.1% → 2023 31.0% → 2024 3.4% → 1H2025 −0.4%(毛损) | 招股章程 2025-12-30,财务资料 p.256/p.263 |
| MiniMax 00100 「开放平台及其他 AI 企业服务」口径 |
2023 75.1% → 2024 63.2% → 9M2025 69.4% | 招股章程 2025-12-31,财务资料 p.418–419 |
智谱对自己云端毛利率崩塌给出的解释是价格战(财务资料 p.271):
「通過API接口的方式,使用我們模型的用戶數量日益增多……然而,由於市場競爭激烈,該等服務價格下跌。我們亦實施戰略性服務降價措施,以擴大市場份額並吸引更多客戶。此舉導致我們雲端部署服務的毛利及毛利率均出現顯著下滑。」
而 MiniMax 在同一时期把开放平台毛利率维持在近七成。它的招股书里有一个可能解释这个差距的数字:推理 MFU 大于 75%,招股书自述「顯著高於行業約 40% 至 50% 的平均水平」。同时它的销货成本里,「與推理活動相關的雲計算服務成本」占 92.7%–96.9%——推理效率几乎就是它的全部成本结构。
第一步:同一年、同样卖 API,智谱每收 1 元倒贴 4 分,MiniMax 每收 1 元赚 7 毛。差七十个百分点。
第二步:智谱自己说亏的原因是打价格战抢份额;MiniMax 自己说赚的原因之一是 MFU 超过 75%,而行业只有 40%–50%。
第三步:所以「卖 API 注定亏钱」是假的。亏钱的不是这门生意,是「卡没用满」加上「靠降价换份额」这两件事凑在一起。前者是工程问题,后者是策略选择——两个都不是宿命。
会谈中的用法:「有人会告诉你这行本来就不赚钱。但同一年、同样卖 API,有人毛损、有人七成毛利。差的不是模式,是把卡用满的能力。」
口径提醒(必须一并说明,否则会被专业人士挑出来):两家的业务结构并不完全可比——MiniMax 约 73% 的收入来自境外,定价水平与客户结构和境内不同;智谱的云端口径也包含了更多低价走量的公有云调用。所以这组对比证明的是「效率与定价策略能造成巨大差异」,而不是「MiniMax 的技术一定强于智谱」。会谈中按前一种说法讲,稳妥且足够有力。
「由於我們的網絡優化技術提升推理效率及服務穩定性,我們預期單位計算資源消耗及相應的單位推理成本將下降,其預期推動我們雲端解決方案的毛利率提升,並為更靈活的定價策略創造空間。」
另一个值得记住的数字:智谱 2024 年研发开支中的「算力服务费」为 15.53 亿元,占研发开支 70.7%,而当年全年收入只有 3.12 亿元——算力支出是收入的五倍(财务资料 p.257)。其风险因素 p.42–43 的标题直接写着:「我們依賴第三方為我們提供計算資源……我們可能被迫以高價購買算力。」
待核 另有二手来源称智谱 MaaS 毛利率在 2025 全年回升至 18.9%、ARR(Annual Recurring Revenue,年度经常性收入) 达 17 亿元。该说法与招股书披露的 1H2025 云端毛损 −0.4% 存在张力——若属实则意味着 2H2025 出现了大幅改善。智谱 FY2025 年报原文本轮未取得,在回原文确认之前,会谈中不要引用 18.9% 这个数字。
公有云 MaaS 侧的负毛利意味着相当一部分低价是市场投入而非成本优势。补贴是营销预算,随时可调,且通常在客户迁移成本最高时收回。对采购方的含义:不要把今天的单价当成三年的规划基础。
如果算力接近 87% 的成本占比、且全部外租,那么这家公司的成本几乎完全等于上游报价——它没有在吞吐与利用率上拿到任何收益。这恰好从反面证明了 §2.1 恒等式里分母的价值。
同一家公司内部,私有化部署的毛利率与公有云 MaaS 差出一百多个百分点;另一家公司内部,运营服务是集群交付的近三倍。这是价值链位置的差异,不是经营水平的差异。我们主张的正是这个位置。
比较不同供应商的成本时有一个容易被忽略的变量:同样一张卡,折旧年限拉长一年,账面成本立刻下降一截。逐份核对定期报告后发现,这个假设在同业之间差异极大:
| 公司 | AI 服务器 / 相关设备折旧年限 | 含义 |
|---|---|---|
| 并行科技 | 3–5 年 | 最保守 |
| 优刻得 | 经营设备 2–5 年 | 2025-10-30 董事会决议将服务器 GPU 机型由 4 年改为 5 年,仅 2025Q4 一季即减少主营业务成本 886.19 万元、增厚净利润 859.25 万元 |
| 青云科技 | 服务器 5 年 | 另有 GPU 售后回租融资 1.245 亿元 |
| 首都在线 | 5–10 年 | — |
| 基流科技 | 机器及设备 6 年 | 年折旧率 15.83%。本样本中 AI 服务器口径最长之一,直接支撑了它 47.7% 的运营服务毛利率 |
| 润泽科技 | 机器设备 5–15 年 | AIDC 折旧占其成本 66.59% |
| 云赛智联 | 专用设备 20 年 | 年折旧率仅 4.75% |
一个宏观量级参照:高盛做过折旧年限的敏感性测算——若 AI 芯片经济寿命由 5 年缩短至 3 年,2026–2031 年全球隐含年折旧将从约 3 万亿美元升至近 4 万亿美元二手转述。折旧假设不是会计细节,它是这个行业最大的单一成本变量。
当有人报出一个很低的单位成本时,先问三个问题:折旧年限多少年?算力是自建还是外租?报价含不含峰值备容?三年折旧和六年折旧算出来的卡时成本能差近一倍,而这与工程能力毫无关系。
这也解释了为什么我们主张开放成本归因给园区审计(§6.2)——把吞吐、利用率、卡时单价三项拆开摆出来,才是真正可比的口径。愿意接受这种拆解的供应商,成本优势才是真的。
上一节说「补贴不可持续」还只是推论。2026 年它已经变成事实了:
| 时间 | 事件 | 幅度 |
|---|---|---|
| 2024-05 | DeepSeek-V2 与豆包接连发布,引爆价格战,主流厂商当月集体跟进 | 降幅 80%–97%,部分轻量模型直接免费 |
| 2024 全年 | 行业平均毛利率 | 约 −80% |
| 2025 全年 | 降价基本停滞,顶级模型价格趋稳;行业平均毛利率收窄 | 约 −30% |
| 2026-03 | 出现反向涨价:智谱 GLM-5-Turbo 较上代平均涨约 83%;腾讯云自研模型 API 涨幅一度达 463%;17 家厂商中超七成在涨价 | 涨价后智谱调用量不降反升 |
| 2026-08-17 | DeepSeek 启用峰谷分时定价:同一模型高峰时段价格为空闲时段的两倍 | 变相涨价,且高峰期限流概率同时上升 |
它把「今天的低价不可持续」从预测变成了已经发生的事实。如果园区的预算规划建立在 2024–2025 的价格水平上,那么这个假设已经失效了。而峰谷分时定价还带来一个隐性成本:高峰时段不仅贵一倍,算力也更紧张,限流概率随之上升——对 Agent 类长任务尤其致命,因为它们无法把调用推迟到夜间。
供给侧的方向性压力也没有缓解,而且算力租金本身也在涨——这是「靠补贴维持低价」越来越难的根本原因:
| 标的 | 价格变化 | 出处 |
|---|---|---|
| H200 国内租金 | 时租 7.5–8.0 元/卡时,月租 6.0–6.6 万元,涨幅 25%–30%;交付周期延至 2027Q2 | 开源证券,2026-03-08 |
| H100 国内租金 | 月租涨至 5.5–6.0 万元,涨幅 15%–20% | 同上 |
| H100 海外一年期合约 | 1.70 → 2.35 美元/小时(2025-10 → 2026-03),累计涨约 40%;至 2026-07 为 1.77 → 2.40 美元/GPU/小时(+35.6%) | SemiAnalysis,开源证券/浙商证券引 |
| Blackwell 现货租金 | 2026 年 2 月 2.75 → 7 月 4.08 美元/小时,涨 48% | 浙商证券,2026-07-15 |
| B200 续约价 | 2.63 → 5.10 美元/小时(2026-10 生效),+94% | Baseten,国金证券引 |
| 服务器 DRAM | 2025 下半年累计上涨 64%,2026 年预计再涨 270%;服务器 DDR5 合约价 2Q26 环比 +53%–58%、3Q26 +13%–18%、4Q26 +3%–8% | TrendForce 一手数据,2026-08-26 |
| HBM | 2027 年合约价较 2026 上涨 50% 以上(HBM3e/HBM4/HBM4e 全系列);UBS 预计 2027 年 HBM 均价上升约 79% | TrendForce News,2026-08-25 |
| HBM 占成本比重 | SemiAnalysis 测算英伟达单机架 HBM 成本占比可能从近 40% 压至 28%——这是全网唯一一个可查的 HBM 成本占比数字 | SemiAnalysis,二手转述待核 |
| 2027 展望 | 伯恩斯坦:2027 年 HBM 价格再涨 2–2.5 倍,单座 AI 数据中心资本开支 +30% | 伯恩斯坦,二手转述待核 |
| 整机与资本支出 | NVIDIA 拟 2027 年初将 Vera Rubin、Grace Blackwell 服务器价格上调 15% 以上;DRAM+NAND 合计占云厂商资本支出比重将从 2026 年的 47% 升至 2027 年的 68% | TrendForce News,2026-08-25 |
原因很直接:解码阶段(Decode)的瓶颈是显存带宽与显存容量,而 KV 缓存直接吃显存。训练可以用更长的时间换更少的卡,推理不行——在线服务的并发上限由显存装得下多少 KV 决定(§2.4 的吞吐那一项)。所以显存越贵,显存管理能力就越值钱。
这把 §6.4 里那几项从「优化手段」变成了「成本对冲」:分页式 KV 缓存(Paged KV Cache)消除碎片、前缀复用(Prefix Caching)消除重复计算、KV 量化压缩占用——每省下一份显存,就是省下一份正在以每年三位数百分比涨价的东西。在硬件降价周期里,这些工作只是锦上添花;在涨价周期里,它是唯一能对冲的东西。
附带一个供给侧的结构性事实:美光披露 HBM 与 DDR5 的晶圆产能转换比为 3:1——每扩产一片 HBM 要挤掉三片通用 DRAM 的产能。这意味着 AI 需求本身就在推高通用内存价格,两者不是独立的。
上游在涨价是事实,但「涨价会传导到 token 单价」这个推论,主流机构并不认同。会谈中如果我们只讲涨价,懂行的人会立刻反驳。所以先把反方摆出来:
把这三条接受下来之后,论证反而更锋利:
① 行业平均在降本,但降本不是自动发生的——它就是「架构迭代与效率提升」这件事本身,是一群人做出来的。对某一个具体客户来说,成本会不会跟着降,取决于供应商属不属于做这件事的那一批。只做转售的,上游涨价会近乎全额传导;做效率工程的,能把涨价吃掉甚至反向。
② 降规格这条更直接:如果新一代硬件的单卡显存在缩水,那么分页 KV(Paged KV Cache)、前缀复用、KV 量化这些省显存的能力就从「优化项」变成了「可用性前提」。
③ 所以正确的表述不是「内存涨价所以 token 会变贵」,而是:「上游成本在上行,而终端价格在下行——这个剪刀差全部由中间环节的工程能力吸收。谁吸收不了,谁就退出(第 4.2 节的三个样本)。」
开源证券的判断:「截至 2026 年,算力短缺态势将至少维持 1–2 年;受 HBM 高带宽内存、先进封装产能瓶颈制约,高端 AI 服务器整机交付周期延长。」需要诚实说明的是:我们对中信、中金、华泰、招商、天风、广发、光大、国泰海通、申万、兴业十家机构逐一检索,没有任何一份公开材料把「HBM 涨价 → 服务器成本 → 单位 token 成本」三段串联并给出完整数字。HBM 占 AI 服务器 BOM 的比例也没有可信的公开口径——检索到的版本从 8% 到 63% 都有,互相矛盾,多为自媒体对同一则报道的各自演绎。所以这一段只能作方向性论证,绝不要自己编一个传导系数。
两端的具体表现:
它把「我们的优势可持续」从一句主张变成一个趋势判断:剪刀差越紧,靠补贴打价格战的玩家越撑不住,而靠工程降本的能力就越值钱。对园区的含义是:现在锁定一个成本可审计的合作方,比继续在补贴市场里比价更安全。
如果有人质疑「优化到底能带来多少」,用这三组公开数据回答,它们分别来自论文、开源社区复现和硬件厂商:
| 来源 | 发现 | 量级 |
|---|---|---|
| vLLM / PagedAttention 论文论文 | 测得既有推理系统的 KV 显存有效利用率仅 20.4%–38.2%(即 60–80% 被浪费);改进后浪费降至 4% 以下 | 吞吐提升 2–4 倍 |
| LMSYS 公开复现社区 | 在 96 张 H100 上的公开部署实测每百万输出 token 成本 | 0.20 美元,约为同期官方 API 定价的 五分之一 |
| 硬件厂商口径待核 | Token 即服务(TaaS)形态相对裸机小时租赁的价值倍数 | 约 8.5 倍(引用前建议核实原始表述与口径) |
| 模型厂商自身披露官方 | 见 §2.2:全集群平均单卡输入输出合计约 4,951 token/s;成本占理论收入 15.5% | 成本仅为挂牌价的 约六分之一 |
前两条与第四条是本报告中置信度最高的证据,建议作为会谈的主力论据;第三条置信度较低,非必要不引用。
先说清口径:这里讲的是 GPU 实际计算利用率——卡在被占用的时间里,有多少算力真正在产出。供应商常报的「上架率/出租率」是另一回事,那只说明卡租出去了,不说明它在算。两者可以相差一倍以上,而客户付的是后者。
行业 GPU 平均计算利用率不足 30%,并给出拆解:
原话:「每投 100 元建算力,70 元在空转。」
| 同一场演讲给出的优化后水平 | 结果 |
|---|---|
| 推理加速 + PD 分离,同集群同模型 | 吞吐 +约 90% |
| 细粒度切分与混布 | 综合利用率 约 85% |
| 两个系数同时优化 | 综合效率 76%,运营 TCO(Total Cost of Ownership,总体拥有成本) 降约 50% |
行业平均 30%,做到位可以到 76%–85%,运营成本降一半。而且这不是我们的测算,是头部云厂商在公开场合讲的。它与 §2.4 敏感度表给出的两到三倍空间完全同量级——两条独立路径得到同一个结论。
会谈中的用法:「供应商的 KPI 是把卡租出去,你们付的却是计算结果。这两件事之间的落差没有人负责——除非有人的收入直接挂在上面。」
通过异构混合推理,使国产芯片 MFU 提升 85%–152%,同等成本下 Token 产出扩大 2.5 倍。
这是目前能找到的、最直接的「工程优化在国产加速器上到底值多少」的公开数据,而且就在两个月前。
诚实说明:没有任何机构做过全国存量智算中心计算利用率的抽样普查,「不足 30%」是企业高管与行业研究院测算的收敛值,属权威估测而非统计调查。会谈中说清出处即可,不要当成普查数据。
本轮已补齐一批原文级数据,但仍有条目需要回原始文件定位。下表按可用程度分三档,会谈中优先使用第一档。
| 档位 | 条目 | 状态 |
|---|---|---|
| 可直接用 | 潞晨科技停服公告与尤洋公开测算(2025-02/03);智谱、MiniMax、云知声三家招股章程原文(已定位页码);硅基流动、基流科技招股书原文(已定位页码);DeepSeek 官方推理成本披露(§2.2);2026 年反向涨价与峰谷定价;A 股八家折旧年限(§4.4) | 均有公开可查的一手出处(公司公告、年报、官方技术博客、厂商定价页) |
| 口径可靠、需定位页码 | 硅基流动 2025 年营收 5,533 万、毛利率 −24.0%、公有云 −119.0%、年内亏损 3.45 亿、月均现金消耗 1,480 万;PPIO 三年累亏 5.68 亿与 AI 云业务毛损 | 来自招股书公开解读,正式引用前需回港交所披露易招股书原文定位章节与页码 |
| 尚未复核 | 智谱 FY2025 全年 MaaS 毛利率是否回升至 18.9%(与招股书 1H2025 −0.4% 冲突,需回 FY2025 年报确认);国金证券「Token 专业运营服务商」四阶段模型(3.0 阶段 50%+、裸机架 20–30%)的报告标题与原文表述;硬件厂商 TaaS 约 8.5 倍的原始出处;内存与加速卡成本上行的幅度预期 | 仍在检索中(券商研报库与交易所披露原文两路并行)。这些条目在补齐之前,会谈中只作定性表述,不报具体数字。 |
另一项已知缺口:模速空间算力生态超市的全部效果数据(接入企业数、调用量、利用率、续约率)运行一年半仍无任何公开披露(§3.4)。这既是对手的软肋,也提醒我们——我们自己的平台从第一天起就要把这些数字做出来并敢于公开,否则三年后会站在同样的位置上。
客户是下面的企业(第 8 章逐家讲),但逐家去谈成本太高、周期太长、也拿不到聚合红利。走工研院这条渠道,是为了一次触达几十家、拿到统一入口与统一结算。代价是:我们必须先回答平台方自己的诉求——它不用 token,它要的是别的东西。这一章讲那四样东西是什么。
如果我们进门第一句是「我们的 token 更便宜」,那么我们就把自己放进了一个纯比价的场子——那里已经挤满了对手,而且他们中有些人可以亏钱卖(见第 4 章的毛利率证据)。比价场里,我们的工程优势会被压缩成一个折扣百分比,而折扣百分比是谁都能喊的。
更根本的原因是:平台自己不付这笔钱的真实代价——用 token 的是企业,感受成本的也是企业。所以对平台谈单价,等于对一个不掏钱的人谈折扣。平台的决策逻辑是「这件事能不能变成我的招商筹码、我的生态成绩、我的风险可控项」。
正确的开场,是把这一亿元从「一笔要花掉的费用」重新定义成「一次能沉淀下能力的建设」。
「这一亿元现在是费用,花完就没了,只在别人的账上留下收入。它可以变成园区自己的一项能力——同样的钱,园区多出一个自主可控的推理底座、一份能写进招商手册的权益、一套企业活跃度数据,而下面的企业还各自省下一笔真金白银。」
「入驻即获得低成本推理算力配额」是极少数能立刻打动早期 AI 团队的硬权益——对一个种子期团队,推理账单往往是它前两年最大的现金支出之一。这比减免几个月房租有力得多,而且是可持续、可分级发放的(按阶段给配额)。话术落点:这不是采购,这是招商工具。
把分散的 API 采购变成一个建成物:园区级推理平台、国产加速器占比、服务企业数、累计 token 服务量、单位成本下降幅度。费用支出无法进考核,基础设施与降本幅度可以。话术落点:我们帮你把一笔看不见的支出,变成一个看得见、说得清、可以年年报的东西。
token 消耗曲线是企业真实业务活跃度最灵敏的指标——比工商数据、比融资新闻、比企业自报都灵敏。哪家在放量、哪家停了、哪家在做多模态、哪家在跑 Agent,平台一目了然。这对招商筛选、投资决策、政策资源分配都是直接输入。话术落点:平台不掌握这个数据,就等于把自己企业的体征交给了外部供应商。
按第 2 章的算术,工程杠杆带来的成本改善是倍数级而非百分比级。落到园区账面上有两种花法:同样一亿元支撑更大的 token 规模(服务更多企业),或压缩支出把预算腾给别的科目。两种都是可量化的政绩。话术落点:把节省额做成分成结构,园区零风险。
这四项里,只有第四项是价格问题,其余三项都是价格之外的。这意味着我们完全可以不在最低价的位置上赢下这个单子——只要另外三项是别人给不了的。而它们恰好都需要一个愿意长期驻场、做深度定制、并把平台侧数据与控制权交还给园区的技术方,这正是转售型对手的结构性短板。
这一节看起来琐碎,但它决定了「为什么必须由平台牵头」这个问题的答案。下面三件事,每一家企业单独都办不成,聚在一起就能办成——这正是渠道存在的理由。
| 企业侧的现实约束 | 单打独斗为什么解决不了 | 平台统一之后怎么解 |
|---|---|---|
| 峰谷浪费 | 单家企业的推理负载极不平稳——白天调试、夜间空转、演示前打满。自己买卡必须按峰值备容,平均利用率注定很低;买公有云则要为调度不确定性付溢价 | 几十家负载叠加后峰均比显著收敛(§2.5)。这是纯粹的统计规律,只有聚合才能兑现,也是平台唯一无法被单点供应商复制的优势 |
| 议价能力 | 一家种子轮公司每年几十万的 token 支出,在任何供应商那里都拿不到条款,只能接受挂牌价与标准合同 | 聚合成亿元级采购方之后,议价能力完全不同(§1.8)。更重要的是能谈条款:后付费、不设最低消费、成本透明——这些是小客户永远谈不到的 |
| 补贴申领 | 政策条款复杂、批次固定、材料繁琐;一家几个人的创业公司通常没有精力研究,很多该拿的钱就没拿 | 由服务商代客统筹申报(§7.3),补贴直接冲抵账单。企业不用懂政策,也不用跑流程 |
这个判断有行业研究支持。《中国词元工厂发展全景洞察与深度分析报告(2026)》在给企业的建议中直接写道:「中小厂商独立获客、运维、结算、合规的成本极高,很难形成规模化收益。」同一份报告同时警告「理性扩产,盲目扩产容易造成算力闲置与现金流压力」。前一句说明为什么企业需要平台,后一句说明为什么平台不该自己盲目建集群——两句合起来正好是我们建议的形态:平台聚合需求,我们负责把成本做下来,谁都不用重资产押注。
降本只是把已有的支出花得更省。而私有化部署与数据不出域,打开的是原本根本无法上云的那部分需求——医疗影像、临床数据、涉密科研、金融风控,这些场景今天不是嫌 API 贵,是压根不能用(科学引擎、观壹科技、数元纪都卡在这里,见 §8.1)。这部分需求一旦被释放,园区的 token 总量会往上走而不是往下走。
对工研院而言,这个论点的吸引力高于省钱:它对应的是新增的产业活动,而不是削减的支出。
这一章把「我们为什么有优势」写成可核验的清单。判断标准很简单:每一条都必须能回答「凭什么是你,而不是别人」,并且能在第一段测试里被验证或被推翻。凡是做不到这两点的说法,都不写进来。
硅基流动招股书行业概览章节 p.80 的表述是:「AI基礎設施層的競爭重點正從單純囤積算力資源,轉向比拼詞元生產效率。」
更新的一条来自长江证券:其 2026-08-25 的电话会报告标题直接就是《AI 沉思录(二):Token 工厂:从「堆资源」到「榨资源」的产业趋势》。该团队此前的公开表述是:「GPU 性能决定了 Token 工厂的理论生产能力上限,而真正决定既定算力资源能释放多少价值的,是包括调度平台、推理引擎、编译器和模型优化在内的 AI 系统软件栈。」二手转述
换句话说,本章要讲的「动分母」不是一个另类主张,而是这一层正在发生的路线切换。区别只在于谁真的做得到。
回到 §2.1 的恒等式。整个赛道的竞争几乎全部发生在分子上——比谁的采购价低、比谁拿到的补贴多、比谁愿意亏更多。分子上的优势有两个致命特征:人人可比,且不可持续。
这是所有优势的根。补贴型低价的问题不在于低,而在于它无法被写进一份需要执行三年的合同——它的提供方随时可以调整,且通常在客户迁移成本最高的时候调整。工程型低成本相反:它一旦做出来就固化在系统里,因此我们敢做三件转售方做不到的事。
| 我们能做的承诺 | 为什么转售型做不到 |
|---|---|
| 把单位 token 成本与吞吐、利用率指标写进合同并接受核验 | 它的成本是上游的定价,自己无从承诺,只能承诺折扣率 |
| 把成本归因开放给园区审计(吞吐多少、利用率多少、卡时多少) | 开放归因等于暴露加价空间 |
| 随成本下降主动调价并写入调价机制 | 降价直接削自己的毛利,只能被动跟进 |
在会谈中,这一条的表达方式很重要:不要说「我们更便宜」,要说「我们的便宜可以被审计」。后者是前者的三倍说服力,而且是对方从别处听不到的句子。
要动分母,必须同时握住硬件与软件两端:只有算力没有优化能力,就只能卖裸卡时;只有优化能力没有算力,优化收益全部归硬件持有方。我们的模式是自己租算力、自己建推理栈,因此工程收益直接落在自己的成本表上,可以决定让出多少给客户。
这一条同时解释了一个常被问到的问题——为什么我们不用「拿到某家更低的进货价」来竞争。因为那条路上,我们的成本上限永远等于别人的定价下限。
这一节是能力的实指,会谈中只在对方追问时展开。每一项都对应吞吐或利用率上的具体收益来源。
主流推理引擎在目标硬件上的落地与算子覆盖:缺失算子的补齐与融合,避免回退到低效实现或落到主机侧执行造成图被打断。算子回退是国产加速器上吞吐损失最常见的单一原因。
分页式 KV 缓存消除碎片、前缀复用消除重复计算、连续批处理(Continuous Batching)提高在线批量、分块预填充(Chunked Prefill)避免长请求阻塞短请求。批量上不去,解码阶段的带宽就用不满,卡再快也没用。
华泰证券 2026-08-05 给出了缓存的账:按缓存读取计新输入价格的 10%、写入计 1.25 倍,在输出占比 10%、缓存命中率 70% 的假设下,混合单价可降约 42%。——前缀复用不是技术细节,它直接改写账单。
权重与激活量化、KV 缓存量化,配套校准与回归评测。关键在于把长上下文准确率纳入验收——压缩手段在短请求上几乎看不出损失,在长上下文上却可能大幅掉点,这是行业里最常见的隐性质量事故。
两个阶段的资源特性完全不同(一个算力受限、一个带宽受限),分离部署后可各自独立扩缩;MoE 模型上的大规模专家并行与通信优化。这是把单卡吞吐推到高位的主要手段。
静态化与算子融合(Kernel Fusion)、图执行、下沉执行以减少主机与设备之间的往返;绑核与调度优化。小算子密集的模型上,主机侧空转常常吃掉两位数百分比的算力。
首字延迟(TTFT, Time To First Token)、单 token 延迟(TPOT, Time Per Output Token)、吞吐、利用率四项统一口径与持续采集,直接换算成单位 token 成本。没有统一口径,降本就无法证明,也无法定价。
§6.4 是基本功,这一节是分水岭。面对同样在做推理优化的对手(第 3 章已说明这个赛道里确实有),能不能把下面四项讲清楚、做出来,是「会用引擎」和「能改引擎」的区别。它们共同决定了单卡有效吞吐的天花板,也就是 §2.1 恒等式里最难动的那一项。
MoE 模型解码时,每个 token 只激活一小部分专家,但如果所有专家都放在同一张卡上,每生成一个 token 仍要把全部专家权重读一遍——带宽被白白吃掉。大 EP 把专家分散到几十上百张卡,每张卡只驻留少量专家,单卡的权重读取量因此骤降,解码吞吐可以成倍提升。
行业公开参照:DeepSeek 在其线上推理系统中,预填充与解码分别采用 EP32 与 EP144 的专家并行度,全集群平均折算下来单卡输出吞吐约 1,072 token/s(§2.2 的反推)。这个量级不是靠买更好的卡得到的,是靠并行策略。
真正的难点有三个,每一个都需要工程投入:专家负载不均(热点专家把某几张卡打满、其余空转,需要冗余专家与动态重排)、all-to-all 通信开销(分发与聚合的通信量随并行度上升)、通信与计算的重叠(双批次交错执行,把通信时间藏进计算里)。
MoE 不只是「换个模型」,它带来一整套新的工程问题:路由不均衡导致的长尾延迟、热点专家的识别与复制、token 丢弃策略对质量的影响、专家放置与网络拓扑的亲和性。这些在稠密模型上完全不存在,也是很多团队把 MoE 跑起来之后吞吐远低于预期的原因。
常规实现里,生成一个 token 要依次启动几十个独立的计算核,每次启动都有固定开销,中间结果还要反复往返显存。Megakernel 的做法是把整个解码步骤融合成一个持久化的核,消除启动开销与中间往返。
收益集中在小批量、低延迟场景——也就是交互式应用最在意的那一段。在国产加速器上这一项尤其值钱,因为这类平台的主机侧调度开销与核启动成本通常比成熟平台更高(§6.6 编译与执行层那一行),消除掉的绝对时间更多。
预填充阶段是算力受限(一次处理整段输入),解码阶段是带宽受限(每次只出一个 token 却要读全部权重)。两者混在同一批卡上会互相干扰:一个长输入的预填充会阻塞正在解码的请求,造成单 token 延迟剧烈抖动。
分离部署之后,两类节点可以各自独立扩缩、各自选择最优的并行策略,甚至各自匹配不同的硬件。公开测得的收益量级:DistServe 报告有效请求承载能力提升约 7.4 倍,Mooncake 报告有效吞吐提升约一倍以上。
代价是 KV 缓存要跨节点传输,对互联带宽提出很高要求。这一点恰好指向国产超节点(SuperPod)形态的长处——高带宽域内的大规模互联正是它的设计目标,所以 PD 分离在国产平台上不是妥协,反而是顺势而为。
海光深算一号对 A100 的规格差里,最大的一项不是算力也不是显存,而是卡间互联:xGMI 约 184GB/s,对 A100 NVLink 的 600GB/s,只有 30.7%(招股说明书数据,多家券商反复引用)。显存带宽的差距是 50.2%,还不到互联差距的一半。
这个结构决定了两件事:① 大 EP 与 PD 分离这类依赖卡间通信的技术,在国产平台上做起来更难,收益也更大——因为通信是瓶颈所在;② 超节点形态(把大量卡放进一个高带宽域)不是营销概念,它是这个瓶颈的直接解法。
可对照的公开数字:中科曙光 scaleX640 单机柜 640 卡超节点自述在 MoE 万亿参数训练推理场景性能提升 30%–40%;弘信电子燧弘的昇腾 384 超节点集群实测 Token 生成性能超同规模英伟达集群 1.2 倍。这两个数字都不是靠单卡性能得来的,是靠把通信和并行策略做对。
MiniMax 在其招股章程中自述推理 MFU 大于 75%,并明确对照「顯著高於行業約 40% 至 50% 的平均水平」。同期其「开放平台」业务毛利率 69.4%,而销货成本中推理相关的云计算成本占 92.7%–96.9%——推理效率几乎等同于它的全部成本结构。
反过来看智谱:云端部署毛利率从 76.1% 一路跌到 1H2025 的 −0.4%,其招股书给出的翻身路径正是「提升推理效率……預期單位計算資源消耗及相應的單位推理成本將下降,其預期推動我們雲端解決方案的毛利率提升」。
行业平均 MFU 40%–50%,做得好的能到 75% 以上。这个差距就是本节四项能力的收益空间。
不要主动讲,但被问到「你们和别人的优化有什么不同」时,这就是答案。四项合起来传递一个信息:我们不是在调参数或换引擎版本,而是在改并行策略、改算子融合方式、改部署架构——这是能改引擎的团队和会用引擎的团队之间的差别。
配合一句收口:「这四项每一项都有公开论文和公开数字可以对照,我们愿意在同题同压的测试里把它们一次跑出来给你们看。」
这是我们与绝大多数对手最实质的分野,也是园区在政策上真正需要有人替它承担判断的地方。国产加速器在推理上的差距,主要不在峰值算力;差距集中在软件栈的成熟度,而软件栈是可以靠工程补的。
现象:模型能跑通,但吞吐远低于同规格的成熟平台,而且 profiling 里看不出明显热点——时间散在很多小段上。
机理:推理引擎会把模型编译成一张计算图,再把相邻算子融合成更大的核以减少显存往返。一旦图中某个算子在目标平台上没有原生实现,框架就会回退——退到通用低效实现,或者干脆把这一步搬到主机侧 CPU 执行。
为什么损失被放大:回退的代价远不止那一个算子本身。它把计算图从中间劈开:前后两段原本可以融合的算子被迫各自落盘,中间结果要在设备与主机之间来回搬运,同步点也随之增加。所以一个回退点吃掉的不是一个算子的时间,而是它前后整段融合收益。这也是为什么国产平台上「峰值算力不低、实测吞吐差一截」如此常见。
可补的方向:补齐关键缺失算子;按硬件的存储层级与数据搬运特性重写实现(分块、双缓冲,把访存与计算重叠);把高频组合手工融合成专用大核。这一层的工作最琐碎,但也最直接——每消掉一个回退点,收益立刻可见。
现象:显存显示占满了,但实际并发请求数很少;提高并发就 OOM。
机理:解码阶段每生成一个 token 都要把模型权重完整读一遍。这笔读取开销是按「批」摊销的——同一批里请求越多,每个 token 分摊到的权重读取成本越低。所以批量直接决定带宽利用率。而批量的上限由 KV 缓存能装下多少请求决定。
粗糙的显存管理怎么吃掉批量:如果按每个请求的最大可能长度预先分配连续 KV 空间,就会同时产生两种浪费——内部浪费(请求实际只用了预留空间的一小部分)与外部碎片(剩余空间零散,装不下新请求)。vLLM 论文对既有系统的实测是:KV 显存有效利用率只有 20.4%–38.2%,即六到八成被浪费;改为分页管理后浪费降到 4% 以下,吞吐提升 2–4 倍。
可补的方向:分页式 KV 缓存消除碎片;前缀复用让相同前缀只算一次;KV 量化压缩单请求占用。在内存价格正在以三位数百分比上涨的当下(§4.5),这一层从「优化项」变成了「成本对冲」。
现象:平均利用率低,但看单个时刻又都在忙;首字延迟忽高忽低,长请求一来短请求全被拖慢。
机理:两个典型缺陷。一是静态批处理——一批请求必须等最慢的那个生成完才能整批换下一批,先完成的请求占着的位置在空转;而生成长度天然差异极大,等待时间被最长的那个请求决定。二是预填充阻塞解码——一个长输入的预填充会独占计算资源,正在解码的请求全部卡住,表现为单 token 延迟剧烈抖动。
可补的方向:连续批处理让请求随到随入批、算完即出批,消除整批等待;分块预填充把长输入切成小块与解码交错执行,避免独占;再往上就是把两阶段彻底拆开的 PD 分离(§6.5)。
现象:短请求跑得不错,一上长文档或图片视频就断崖式变慢,甚至直接失败。
机理:长上下文有两重压力——注意力计算量随序列长度快速增长,KV 显存占用随长度线性累积。成熟平台上有大量针对性实现(融合注意力核、分页与卸载机制)把这两条曲线压下来;在缺少这些实现的平台上,长请求只能走通用路径,要么极慢,要么显存直接爆掉。
多模态更麻烦:视觉或音频编码器、投影层、语言模型这三段的资源特性完全不同——编码器算力密集、语言模型带宽密集,中间还要做形状转换。把它们当成一条普通流水线来跑,必然有一段在等另一段。而这恰好是项目库里 Sreal AI、科学引擎、深光地球这几家的主力负载形态(§8.1)。
可补的方向:引入或重写融合注意力实现;长序列的分页与分层卸载;多模态各段独立并行度与独立扩缩;针对视觉编码器的批处理策略。这一层的工作量最大,但也最能拉开差距——因为大多数团队根本还没走到这里。
前四层都是软件问题,但它们的上限被一个硬件事实框住:国产加速器与成熟平台最大的规格差不是算力,是卡间互联带宽。海光深算一号招股书数据显示,其卡间互联 xGMI 约 184GB/s,对 A100 NVLink 的 600GB/s 只有 30.7%;而显存带宽的差距是 50.2%,还不到互联差距的一半。
这解释了两件事:其一,大规模专家并行与 PD 分离这类重度依赖卡间通信的技术,在国产平台上做起来更难——但正因为通信是瓶颈,做对了收益也更大;其二,超节点形态(把大量卡塞进一个高带宽域)不是营销概念,它是这个约束的直接解法。这也是为什么公开实测里,国产卡在单卡层面落后、在超节点集群层面反而能反超。
团队在国产加速器的芯片架构与算子层有一线工程经验,这是上表中「可补的方向」一列能够落地的前提。在会谈中,这一条的价值不在于展示技术,而在于让对方确认:园区的国产化率要求可以由一个真正懂这一层的人来兜底,而不是变成一次赌注。
硅基流动在港交所申請版本业务章节 p.143 写道:
「我們已開發出將領先的AI模型適配並部署於國產芯片的能力,該等芯片的租賃成本大幅低於基於NVIDIA GPU的基礎設施。」
同一页还写道:「在早期發展階段,我們優先考慮運營靈活性,採用短期、按需租賃方式獲取算力資源,但該模式的單位成本高於長期合作安排。」
这是一家正在冲刺上市的同业,在需要承担法律责任的文件里,替「国产卡租赁成本更低」和「算力采购方式影响单位成本」这两件事作了背书。
中信证券《从华为 CloudMatrix384 AI 超节点看国产算力发展趋势》(2025-06-24,徐涛等)转引华为与硅基流动的论文数据:
| 阶段 | CloudMatrix-Infer | SGLang on H100 | DeepSeek on H800 |
|---|---|---|---|
| Prefill 计算效率 tokens/s per TFLOPS | 4.45 | 3.75 | 3.96 |
| Decode 计算效率 | 1.29 | 1.10 | 1.17 |
华泰证券中期策略(2026-07-22,郇正林等)给出更新的数字:华为 CloudMatrix 384 超节点单卡推理吞吐 2,300 Tokens/s,较非超节点方案提升近 4 倍。
申万宏源《超节点:从单卡突破到集群重构》(2025-07-09)给出同方向结论:CM384 在 DeepSeek R1 推理中单卡 Prefill 吞吐达 5,655 tokens/s,单位 TFLOPS 效率超英伟达 H100 方案 18%;节点间带宽衰减 <3%、延迟增加 <1μs。另有多家券商引述华为发布会口径:单用户 20 TPS 前提下单卡 decode 吞吐 1,920 tokens/s,比肩 H100。
同一份中信证券报告转引 SemiAnalysis 的另一组数字:CloudMatrix384 相对 GB200 NVL72,BF16 算力 1.7 倍、内存容量 3.6 倍、带宽 2.1 倍——但总功耗 3.9 倍,单 TFLOP 功耗高 2.3 倍;910C 单芯片性能约为 GB200 的三分之一。德邦证券(2025-07-28)进一步提到 Scale Up 网络的总体拥有成本「约为 NVL72 机架的 6 倍,功耗超过 10 倍」。
所以准确的表述是:国产超节点是用「堆规模 + 高效互联」换来的单位算力效率反超,代价是功耗与占地。在电价低、机柜有余量的地方(例如西部或有能耗指标保障的园区)这笔账算得过来,在电力受限的地方算不过来。会谈中主动说出这个前提,比只报好数字可信得多。
有一份第三方原创测算给出:千卡集群 MFU,910C 约 30%,而 H100 约 55%;大规模推理(70B+)场景下有效吞吐约为 H100 的 55%–65%个人测算,未见交叉验证。
把它和上面的效率数字放在一起,结论很清楚:单位算力的效率已经不输,差距集中在「把整个集群用满」这件事上。而这正是 §6.4 与 §6.5 那一整套能力的作用范围。
一个可对照的落地案例(非研报,单点实测):某城商行智能客服在昇腾平台上做完调优后,NPU 利用率由 30% 提升到 85%,延迟由 820ms 降至 220ms,吞吐提升 3.8 倍案例。这三个数字的量级,与我们在 §2.4 敏感度表里给出的两到三倍空间是一致的。
国金证券 2026-07-17 报告披露:弘信电子旗下燧弘华创 Token 工厂落地无锡高新区,首期部署 4 台昇腾 384 超节点服务器、合计 1,536 卡国产算力集群;经实测,该集群的 Token 生成性能超过传统英伟达同规模算力集群 1.2 倍。
对照另一组数据:SemiAnalysis 与 Counterpoint 测算国产旗舰芯片单卡实测性能约为 H100 的 60%(开源证券 2026-08-25 引)。
单卡性能只有六成,集群 Token 产出却能反超两成。差额全部来自系统架构与软件工程——超节点的高带宽互联、并行策略、调度与算子优化。这正是我们主张的东西:在国产平台上,工程能力的杠杆比硬件差距更大。
会谈中的用法:「国产卡单卡确实还差四成,这个我们不回避。但集群层面已经有反超的公开实测了,靠的不是芯片,是把整套系统调对。这件事有人能做,有人做不了——差别就在这儿。」
我们系统检索了券商研报库、招股书、厂商官方材料与技术社区,结论是:公开材料里找不到任何机构做过国产加速器与英伟达的 TCO 对比表,也找不到附带精度与并发条件标注的第三方 tokens/s 基准测试。
能找到的全是定性表述——厂商侧是「追平」「相当」「业界领先」,券商侧是「算子覆盖度低、迁移成本高」,第三方独立量化验证近乎空白。连迁移成本的人月数或性能损失百分比都没有可靠出处。
还有一个侧面证据:在东方财富研报索引范围内,中信、中金、华泰、招商、天风、广发、光大、国泰海通、申万、兴业、长江、浙商、华创这十三家头部券商,对海光信息与中科曙光都没有完整研报。覆盖这两家的是民生、开源、东吴、山西、太平洋、国信、华安、东海等中小券商。连卖方研究都还没系统进场,说明这个领域的公共知识建设远远落后于产业投入。
含义是双向的。一方面,任何人说「国产卡便宜多少」「迁移要花多少钱」,目前都拿不出可核验的依据,包括我们自己——所以不要报数字。另一方面,这个真空正是我们的入场理由:谁先在真实负载上做出一份同题同压、口径清晰、可被客户复核的实测报告,谁就等于定义了这个问题的答案。这也是第 10 章第一段方案的全部价值所在——它不只是给园区看的验证,它是这个赛道目前缺失的公共知识。
不承诺「国产卡全面替代」,而是混合架构 + 逐季度台阶:把当期确实适合的负载放到国产加速器上,其余留在其他硬件,由平台统一调度、对上层企业完全透明——企业只看到一个统一的接口,看不到底下是什么卡。国产化占比因此成为一条可统计、可承诺、可逐季度上调的平台指标。这个表述同时满足了政策要求与风险控制,是园区最容易签下去的形态。
§2.5 已给出统计依据:几十家企业的负载叠加后峰均比显著收敛,按峰值备容时的平均利用率上限从不到四成抬到接近八成。这里补充两点会谈中要强调的:
最后一项优势不在技术侧,而在交付形态。第 5 章列出的四项价值——招商权益、可汇报的建成物、活跃度数据、预算效率——都要求供应商愿意做三件标准化产品不愿做的事:驻场做深度定制、把平台侧数据与控制权交还园区、不用锁定条款做护城河。
我们愿意做,原因不是姿态好,而是这三件事与我们的商业模式并不冲突:护城河在成本曲线上。只要单位成本持续比别人低,就不需要靠合同锁住任何人;反过来,需要靠锁定生存的供应商,恰好证明了它的成本没有优势。
「同一个赛道里,我们和多数人赚钱的方式是相反的:他们的利润来自差价,所以降价伤自己;我们的利润来自成本下降,所以降价只是把已经拿到的工程收益让出一部分。这就是为什么我们敢把成本写进合同、敢开放归因给你审计、也敢不要排他。」
这一章是本次调研里最有价值的发现。「园区级 Token 平台 + 统一补贴申领」不是我们的创新,而是上海市政策文件里已经写明的机制——包括一个专门为 token 消费设立的补贴品类,以及一条允许服务商代客户统一申报的通道。会谈中把这一章讲清楚,可信度会有质的变化。
母政策是《上海市进一步扩大人工智能应用的若干措施》(沪经信智〔2025〕489 号,2025-07-28)。到 2026 年度实施口径时,文件名称发生了一个值得注意的变化——《关于组织 2026 年度上海市「模塑申城」工程相关补贴申报工作的通知》(沪经信智〔2026〕248 号,2026-04-30)中,「模型券」被正式表述为「模型券(Token 券)」。
这意味着在政策语言层面,Token 消费已经成为一个独立的、被命名的、有专项资金的补贴品类。这与国家层面的方向一致:工信部《关于开展普惠算力赋能中小企业发展专项行动的通知》(工信厅通信〔2026〕14 号,2026-04-02)明确提出「推行按『卡时』『核时』及 Token 计费等灵活付费模式」,并探索「算力银行」「算力超市」等业务形态。
| 层级 / 品类 | 补贴口径 | 上限 | 出处 |
|---|---|---|---|
| 市级 · 模型券(Token 券) | 调用非关联方云平台部署的第三方大模型 API 产生的费用,或采用第三方大模型私有化部署方式推进垂类应用 | 核定合同额最高 50%,最高 500 万元;专项总额 3 亿元 | 沪经信智〔2025〕489 号 |
| 市级 · 算力券 | 租用智能算力 | 市级最高 30% 租金补贴;按「补早补小」原则市区协同可给予最多 1 年、最高 100%;自建自主智算设施最高 10% 建设支持;专项总额 6 亿元 | 沪经信智〔2025〕489 号 |
| 市级 · 语料券 | 购买非关联方语料 | 最高 30%,最高 500 万元;总额 1 亿元 | 沪经信智〔2025〕489 号 |
| 徐汇区 · 算力支持 | 实际算力投入 | 不超过 30%,单个主体年度最高 2,000 万元(较 2024 版的 1,000 万元翻倍) | 《徐汇区关于推动人工智能产业高质量发展的若干意见》,2025-05-31 起试行两年 |
| 徐汇区 · 平台类支持 | 对产业链上下游企业技术提升有突出支撑带动作用的平台,经分类认定 | 最高 2,000 万元 | 同上 |
| 徐汇区 · 市级项目配套 | 对通过市级以上专项资金支持的项目 | 最高按 1:1 比例配套 | 《徐汇区支持西岸人工智能大模型科创街区的扶持意见》 |
申报节奏:2026 年度全年 4 批次,每季度首月受理,通过 zxzj.sheitc.sh.gov.cn 在线申报,区主管部门初审后一周内报市经信委。关键限制:「申报项目须未获得其他市级财政资金补贴支持」——同一市级资金不可重复申领,所以叠加设计必须区分市级与区级、区分品类,不能简单相加。
这是本章最重要的一条。沪经信智〔2026〕248 号在算力券与模型券两处都写了同一个机制:
算力券:「算力租用单位可选择自主申报,或由算力服务商经『市级智能算力资源统筹调度服务平台』统筹申报。……入驻 AI 小镇的单位,可通过小镇生态运营公司统筹申报。」
模型券(Token 券):「模型使用单位可选择自主申报,或由模型服务商经『市级智能算力资源统筹调度服务平台』统筹申报。入驻 AI 小镇的单位,可通过小镇生态运营公司统筹申报。」
它意味着两件事同时成立:(一)作为「模型服务商」,我们可以代入驻企业统一申报 Token 券;(二)作为园区,工研院侧的运营主体也可以统筹申报。
换句话说,「园区统一入口 + 集中申报补贴」这个方案形态,是政策文件亲自设计并鼓励的路径,不是我们编出来的商业模式。这句话在会谈中的分量很重——它把我们的方案从「一个供应商的提议」变成「对既有政策通道的正确使用」。
对入驻企业而言,这还解决了一个现实痛点:几十家早期公司各自去研究政策、准备材料、跑四个批次的申报,绝大多数根本不会去做。统一申报把这件事变成园区的一项服务,企业侧零成本受益。
《上海市关于促进智算云产业创新发展的实施意见(2025—2027 年)》(上海市经信委,2025-03-26)里有一条容易被忽略但直接决定补贴资格的条款:
「对调用纳入本地统筹调度的智算云服务创新主体,经评估对服务采购金额给予一定比例的算力补贴。」
也就是说,接入「市级智能算力资源统筹调度服务平台」是拿到算力补贴的前置条件。这对我们的方案设计是一条硬要求,也是一个正面卖点:我们主动承诺完成这项对接,园区就同时获得了补贴资格与合规的统筹申报通道。同一份文件的其他目标也与我们的定位一致:
市级规划要求 2027 年自主可控算力占比超过 70%;交大自己又把「全国高校最大的国产智算基础设施」当作对外宣传口径(§1.6)。两者叠加意味着:在这张桌子上,国产加速器适配能力不是我们的差异化亮点之一,而是入场资格。§6.6 那一节的深度因此不是锦上添花,是必需品。
反过来说,这也是我们最大的结构性优势——能把国产卡推理真正做出可用性能的团队非常少,而这个客户必须找到一个。
另需说明:网传「党政信创 2025 年国产化率 80%」一类说法来自市场分析文章而非政府文件,不建议在会谈中引用。可引用的硬口径就是上面这份 2027 年 70% 的市级规划。
Token 按量结算最容易卡住的地方是财务流程,不是技术。而这里要处理的是企业侧的财务现实,不是机关单位的采购流程——我们的付费方是几十家创业公司,它们决策快、没有招标负担,但有另一组约束:
公有云 MaaS 普遍要求预充值,额度用不完也退不回;企业方最怕的是现金被锁在账户里。我们可以反向设计:后付费、按月对账、不设最低消费、不收预付押金。这一条对种子轮与天使轮企业的吸引力,往往超过单价便宜一成。
企业向多家境内外供应商分别付费,币种、票据、主体各不相同,海外模型调用的入账尤其麻烦(Wisdom AI 与深光地球都主打海外市场)。平台统一签约、统一开票,把 N 份票据问题压缩成 1 份。开票科目建议按「信息技术服务 / 技术服务费」,而非「设备租赁」。
平台侧最需要的是按企业分账、按配额发放、可实时查看:哪家用了多少、还剩多少、超了怎么办。这既是财务要求,也顺带交付了第 5 章讲的活跃度看板。
「平台签框架 · 企业按量领用 · 统一开票 · 按量分账」——对平台是省事,对企业是省钱且省心,对我们是一次签约触达几十家客户。而 §9.3 的代客统筹申报可以直接挂在这套结构上:企业不用自己研究政策、不用自己跑申报,补贴由我们统一代办后直接冲抵账单。这是我们对企业端最有效的获客钩子,比单价折扣更难被复制。
工研院最可能的顾虑之一是「园区统一做 Token 平台,有没有人做过、做成什么样」。有,而且已经写进地方政策文件、由国资平台落地。把这两个先例讲透,这件事就从「一次冒险」变成「跟上进度」。
硚口区出台了武汉全市首个 Token 经济政策——《硚口区促进 Token 经济和人工智能 OPC 发展三年行动方案及若干措施》,核心提法是「Token 普惠共营」。「OPC」指一人公司或微型创业主体,是国家数据局在《支持人工智能 OPC 创新发展行动方案(试行)》里正式使用的政策类别,对应的正是工研院项目库里那批早期团队。
| 层 | 具体做法 | 解决的问题 |
|---|---|---|
| 政策层 需求侧补贴 |
十条措施,其中三条直接作用于算力账单:对 OPC 企业的算力服务费用按 50% 补贴;每年免费提供 50P 以上算力;推行数据券机制 | 把企业的现金门槛压到接近于零。注意补贴对象是「算力服务费用」而不是硬件采购——这与我们主张的形态一致 |
| 工厂层 供给侧产能 |
落地两座 Token 工厂:星火众达 Token 工厂与 CSDN 龙虾工厂 | 补贴要有地方花。没有本地工厂,补贴就变成向外地云厂商的转移支付 |
| 社区层 组织侧承接 |
集中签约首批 16 个特色 OPC 社区 | 把分散的微型主体组织起来,形成可聚合、可调度、可统计的需求池 |
硚口区的做法是政策、工厂、社区三件事同时做,形成微生态闭环——缺任何一层都跑不通:只有补贴没有工厂,钱流向外地;只有工厂没有社区,产能没人用;只有社区没有补贴,企业用不起。
而工研院手里已经有两层:社区层就是那 38 个在孵项目(第 8 章已按 token 消耗强度分好层),政策层就是上海的算力券与模型券(Token 券)通道,且允许服务商代客统筹申报(§9.3)。唯一缺的就是中间那层——工厂。
会谈中的说法:「硚口区证明了这套闭环跑得通,但他们是从零开始搭三层。您这边社区和政策通道都已经有了,缺的只是把中间那层补上——而这一层恰好是我们能做的。」
如果说硚口区证明了「区县级能做」,京算证明的是「国资背景的平台方已经接受了不卖硬件、只卖 Token 的商业形态」。其商业模式的公开表述是:
「商业模式彻底摒弃了『卖硬件』或『卖机柜』的传统思路,转而交付标准化的 Token 和 API 成品能力,按实际消耗计费……将底层硬件采购、集群运维的风险和复杂性全部转移至平台方。」
这段话里有三个对我们极其有利的点,建议在会谈中逐条指出:
京算对外公布的七大核心能力中,明确包含 PD 分离智能调度、全栈推理加速、异构算力统一调度。
这意味着我们在 §6.5 论证的那套东西——预填充与解码分离、推理引擎深度优化、多种硬件统一调度——已经不是需要说服对方接受的新概念,而是国资平台在公开材料里写明的选型标准。
会谈中的用法:「PD 分离这类东西听起来很技术,但它已经写在北京数据集团 Token 工厂的公开能力清单里了。我们讨论的不是要不要做,而是谁能把它在您这边做出来。」
京算 Token 工厂联合了三大运营商以及硅基流动、无问芯穹、是石科技等多方签署共建协议。国资平台的通行做法是拉一个共建名单,而不是选一家独家供应商。
这对我们是好消息,应该主动利用:第一步的目标不必是「成为工研院唯一的算力伙伴」,而是「进入共建名单」。门槛低得多,也更符合平台方的风险偏好。进去之后靠实测数据说话(第 10 章第一段),比一开始就要独家现实得多。
| 地方 | 做法 |
|---|---|
| 贵州 | 20 条专项政策:单企业最高可获百亿级词元、且不超过 50 万元的词元补贴;购买本省算力按服务金额 30% 给予激励 |
| 广东 | 2026 年 6 月印发促进词元经济六大措施,目标 2027 年底成为全国词元供给高地,并建设省级词元交易专区 |
| 北京市级 | 设立 OPC 开办服务专区、发放 Token 券、开发 OPC 贷专属信贷;2026 上半年新增智能算力 2.2 万 P、供给已达 8.2 万 P,年内目标突破 13 万 P,并明确「布局 Token 工厂与分发平台」 |
| 杭州 | 设立年度 2.5 亿元规模的杭州算力券;市算力资源调度服务平台提供「算力超市与算力券服务」 |
一条定名依据可在开场时顺带提及:2026-03-23 国家数据局局长刘烈宏在中国发展高层论坛正式将 Token 的中文名定为「词元」,并定位为「智能时代的价值锚点,是连接技术供给与商业需求的结算单位」;2026 年 4 月国家数据局的征求意见稿进一步提出「探索词元交易等新型交易模式」。把 token 说成「结算单位」而不是「技术指标」,正是我们希望对方接受的框架——而这个框架是官方定的。
| 要点 | 情况 | 影响 |
|---|---|---|
| 申报主体的口径 (大概率对我们有利) |
沪经信智〔2026〕248 号对申报主体的表述是「在本市依法经营并具有独立承担民事责任能力的单位,经营状态正常,信用记录良好,财务制度健全」——措辞明显偏企业口径 | 由于我们的付费方本来就是企业,这个口径天然吻合。方案应直接设计为以入驻企业为申报主体、由我们作为模型服务商统筹申报,不必绕道平台。仅需确认平台代办是否需要额外授权文件 |
| 「非关联方」如何界定 | 模型券要求调用的是「非关联方」云平台部署的第三方大模型。若平台运营主体与我方或与入驻企业存在股权关系,是否构成关联交易,无公开细则 | 直接决定补贴能否申领,也影响我们与园区之间是否适合采用合资或股权合作的形态。建议在设计股权结构之前先问清 |
主管部门口径(供核实用):徐汇区新工办人工智能智能科(64872222-1041);徐汇 AI 小镇的「生态运营公司」具体主体未在文件中披露。这两点建议由我们主动提出并建议共同向主管部门确认——主动指出对方方案里的政策不确定性,是建立专业信任最快的方式之一。
工研院是渠道,真正付钱、真正用 token、真正决定这件事成不成的是下面的企业。这一章把 A 层的重点企业逐家过一遍:各自的推理负载长什么样、最在意什么、第一句话该说什么,最后给一个切入顺序。这份清单是整份材料里唯一可以直接拿去打电话的部分。
A 层的十二家不是同一种客户,混着谈会乱。按我们能为它做什么分成三类:
推理成本直接构成它的营业成本,单位成本下降就是毛利上升。沅域智能、心流直觉、Wisdom AI、深光地球。对这类企业,第 2 章的算术就是全部说服力。
数据不能出域是硬约束,今天很多业务根本不敢上公有云。科学引擎、观壹科技、数元纪科技。对这类企业卖的不是便宜,是「原本不能做的现在能做了」。
做的是相邻层次,可以互为供需。基元律动、EvoKernel。对这两家绝不能用竞争姿态开场,见 §1.6。
| 负载形态 | 自进化游戏世界模型,一键生成可交互 3D 场景。多模态生成,单次推理极重;短期做 B 端 API 服务,批量离线与在线交互混合 |
|---|---|
| 最在意 | 单次生成成本、交互式场景下的生成延迟、游戏工作室批量调用时的峰值弹性 |
| 为什么是首选 | 生成类负载的成本曲线最陡,优化收益最大也最容易被测出来;且他们已经在对外提供 API,说明口径清晰、有真实流量样本可用于同题同压对比(§10.1) |
| 开场 | 「你们的单次场景生成成本大概是多少?如果同样的输出质量能便宜一半,对你们的 API 定价意味着什么?」 |
| 负载形态 | 具身智能底层世界模型,记忆抗遗忘与想象推演的统一架构。商业模式明确写着「项目制一体化交付与 Token 订阅双模式」 |
|---|---|
| 最在意 | 他们自己按 token 收费,token 成本就是他们的营业成本——我们降多少,直接变成他们的毛利 |
| 为什么好谈 | 不需要解释「为什么要关心单位成本」,他们的商业模式已经逼他们关心。正在推进种子轮,对成本结构的每一个百分点都敏感。 |
| 开场 | 「你们按 token 订阅收费,那这门生意的毛利完全取决于底下每百万 token 花多少钱。这个数你们现在是多少?」 |
| 负载形态 | 面向海外中小 B 的私域 AI Agent Lab,对抗式 Critic Agent 实现无人自主优化——自我迭代循环,token 消耗呈指数增长;轻量化订阅与按效果付费 |
|---|---|
| 最在意 | 按效果付费意味着 token 成本是纯 COGS 且不可转嫁;面向海外,模型选型可能以境外前沿模型为主,混合单价高;明确表示无需私有化部署 |
| 注意 | 私有化不是卖点,低单价与弹性才是。而且 CEO 从零搭建过火山方舟(§1.7)——任何营销式说法会立刻失效,直接上第 2 章的公开数据算术 |
| 开场 | 「Critic Agent 自迭代最难的是成本不可预测。我们想聊的是怎么把非关键环节分流到便宜模型,同时把跑得起的那部分单位成本压下来。」 |
| 负载形态 | Science Engine 全自动 AI 科研助手(长链路 Agent)+ 多模态自进化推理模型;PANDA / HOPE 泛癌早筛管线 |
|---|---|
| 硬约束 | 已采用联邦隐私计算实现院内数据不出域——这不是偏好,是医疗场景的准入条件 |
| 为什么是样板 | 拟融资 2000 万元,预算紧但合规要求高。「用私有化的合规姿态,交付公有云的单价」正是为这类客户设计的。做成一家,其余医疗类企业可复制 |
| 开场 | 「你们的数据不能出院,那公有云 API 这条路基本是关的。我们想聊的是在合规边界内怎么把推理跑得和公有云一样便宜。」 |
罕见病循证诊断智能体 DeepRare,向 Virtual Cell 与 AI Scientist 演进,长链推理与多尺度建模。项目自述为高资本消耗、长验证周期的平台型 AI for Science——高资本消耗四个字就是我们的开场理由。合规诉求与科学引擎一致,可打包成「医疗与生命科学专属推理环境」一并推进。
矿业垂直大模型,自研融合视觉 Transformer 与 LLM 的跨模态大模型,配套无人机与深地传感,主打海外市场商业化落地。跨模态推理成本高;但海外部署会引出数据跨境与节点位置问题,需要先问清服务区域再谈方案,不要默认按境内方案报。
| 基元律动 | EvoKernel | |
|---|---|---|
| 他们做什么 | OpenSquilla 多模型智能调度,分层路由,自述 Token 成本降低 90%;提供公有云 API 与私有化部署 | AI 智能体自动生成优化 GPU 算子,适配昇腾、壁仞等国产异构芯片;千算 CLI 已商用 |
| 与我们的关系 | 路由层 × 推理层,叠乘不替代。路由决定调哪个模型,我们决定这个模型跑多便宜 | 工具 × 端到端服务。他们产出算子,我们交付含 SLA 的推理服务 |
| 他们需要我们什么 | 私有化部署交付需要一个高效稳定的底层推理后端 | 自动生成的算子需要真实推理负载来验证收益——园区平台正是验证场 |
| 开场 | 「你们把请求路由到最合适的模型,我们把选中的那个模型跑到最低成本。这两件事乘起来才是客户最终账单。」 | 「你们生成的算子需要在真实流量上证明收益。我们手上正好会有园区的持续负载。」 |
推理量中等,需求真实但不紧迫。建议在前六家做出实测数据之后再接触——那时手上有同城同类企业的真实账单对比,说服成本会低很多。观行智能与千诀偏训练与仿真,注意区分训练与推理两条线(§1.5 B 层的提醒同样适用)。
| 批次 | 企业 | 目的 | 要拿到的东西 |
|---|---|---|---|
| 第一批 对比测试 | 沅域智能、心流直觉 | 产出可核验的单位成本对比数据 | 一份真实请求样本 + 一张同题同压对比表。这是后面所有谈判的事实基础 |
| 第二批 私有化样板 | 科学引擎、观壹科技 | 验证「合规姿态 + 公有云单价」这套方案 | 一个可复制的医疗/生命科学专属推理环境交付模板 |
| 并行 生态关系 | 基元律动、EvoKernel | 把潜在竞争变成供需 | 一份互不侵犯的层次分工共识,最好是一次联合技术交流 |
| 重点公关 | Wisdom AI | 争取最有分量的内部背书 | CEO 对我们成本模型的认可。他认可了,工研院内部基本不用再说服别人 |
| 后续 | 数元纪、光之宇、千诀、观行 | 规模化 | 用前面的实测账单做横向推广 |
先做最容易测出差距的,再做最需要我们的,最后做最难说服的。沅域和心流直觉给我们数据;科学引擎和观壹给我们一个可复制的交付形态;基元律动和 EvoKernel 消除侧翼风险;Wisdom AI 给我们背书。等这四步走完,回到工研院谈平台级合作时,我们带的就不再是方案,而是它自己企业的账单。
顺带指出一个结构性空白:检索公开招标与中标记录后,找不到按 token 计费的算力服务采购案例——现有的公开采购几乎全部按「卡 / 台 / 月」计价。这意味着企业侧在买 token 服务时,没有现成的合同模板、没有统一的计量口径、没有验收标准、没有 SLA 范式。
对我们是双向的:一方面每一单都要自己造轮子,成本高;另一方面,谁先把这套「Token 服务采购包」做出来并跑通一遍,谁就定义了这个品类的标准。建议把它作为交付物的一部分正式列出——计量口径、对账方式、SLA 条款、退出机制。这对工研院这样的平台方尤其有吸引力:它拿到的不只是便宜的 token,还有一套可以复制给后续所有入驻企业的采购范式。
这一章按真实会谈的顺序排列。每一条给出对方的原话式质疑、这个质疑背后的真实顾虑,以及我们的答法。答法的共同原则是:不否认对方的判断,而是把问题重新框到我们的强项上。
背后的真实顾虑:怕被一个小团队用短期报价套住,一年后发现大厂更便宜。
答法:分三步,不要跳步。
不要说「大厂服务不好」「大厂不重视小客户」——这类话无法验证,且会让对方觉得我们在贩卖情绪。所有对竞争对手的判断都必须落在可查的财务数据或公开定价上。
背后的真实顾虑:这是个红海,选一个小玩家不理性。
答法:直接同意「很卷」,然后指出卷的是哪一层。这个赛道的绝大多数参与者在做两件事之一——把上游的 token 加价转售,或者拿地方补贴建集群然后按卡时出租。前者的成本是别人的定价,能给的折扣上限就是自己的渠道返点;后者卖的是裸资源,客户拿到卡之后的低吞吐、低利用率与它无关。
| 转售型 | 裸算力出租型 | 我们 | |
|---|---|---|---|
| 成本来自 | 上游挂牌价 | 硬件折旧 + 电费 | 硬件折旧 + 自有优化能力 |
| 降价靠 | 压缩自己的加价空间 | 压低卡时报价 | 提高吞吐与利用率 |
| 降价的后果 | 越降越薄,直至无利可图 | 越降越接近折旧线 | 越降越健康——成本先降,价格后降 |
| 客户的低效 | 与它无关 | 与它无关,甚至是它的收入 | 是它的成本,必须解决 |
| 可承诺的东西 | 折扣 | 卡时单价与可用性 | 单位 token 成本与吞吐指标 |
一句话收口:「同一个赛道里,我们和他们赚钱的方式是相反的。他们的利润来自差价,所以降价伤自己;我们的利润来自成本下降,所以降价是把已经拿到的工程收益让出来一部分。这就是为什么我们敢把单位成本写进合同,而转售方只敢给折扣。」
背后的真实顾虑:同区已经有一个看起来很像的东西,由一家融资超 22 亿、纳管 25000P 的公司运营,而且它确实也在做推理优化。这是全场最尖锐的一问。
不要说「他们只做资源撮合,我们才做优化」。这是错的:无问芯穹的核心资产就是推理引擎优化(FlashDecoding++、SpecEE、Infini-ACC),其 CEO 在 2026 WAIC 的原话是「优化即利润增长」。这句话一旦说出口,只要对方的技术顾问知道底细,我们后面所有的话都会打折。
正确答法:承认同层,然后把差异落在交付形态与深度上。可以直接说「他们做得很好,而且和我们在同一层」——这句坦白本身就能挣回不少信任。然后给四条:
| 维度 | 标准化白标平台 | 我们 |
|---|---|---|
| 交付形态 | 同一套代码服务至少九个租户(§3.4 的映射表),是可复用的多租户产品,边际成本极低 | 针对具体这批负载做专项调优。九个租户共用一套代码,意味着它不会为某一家企业的视频生成或长链 Agent 单独改算子与调度 |
| 能力方向 | 纳管广度:十六种芯片都能跑、跨域调度、异构混训。解决的是「有没有卡、卡在哪」 | 单平台深度:在选定的国产加速器上,把算子覆盖、显存分页、批处理调度、专家并行做到极限。解决的是「这张卡上这个模型跑多快」 |
| 部署形态 | 多租户公有云形态 | 支持私有化与数据不出域——A 层里科学引擎、观壹科技、数元纪都卡在这一条上(§8.1),公有云形态对它们不是便宜与否的问题,是能不能用的问题 |
| 商务结构 | 标准产品通常按资源或调用量计费 | 敢做节省额分成:以现有单位成本为基线,不省不付(§9.7)。标准化产品做不了这个,因为它无法为单一租户的成本结果背书 |
不要问「你们平台的吞吐和利用率是多少」——那是平台级能力指标,对方答得出来,而且数字很漂亮。要问企业级的结果:
「园区里具体某一家企业——比如做视频生成的那家——它现在的单位 token 成本是多少?过去半年降了多少?有没有按企业分账的成本口径?」
这个问题标准化平台大概率答不出:它承诺的是可用性、额度与调度,不是某一家企业某一类负载的成本结果。而且事实上,算力生态超市运行一年半,接入企业数、调用量、利用率、续约率全部没有任何公开数据(§3.4)。问完这个问题,我们的位置就清楚了,而且全程没有贬低任何人。
最后要诚实的一点:规模上我们比不了,不要装。对方融资、纳管算力、客户数量都远超我们。如果被直接问到,就直说:「规模上我们没法比,所以我们不打算做通用平台。我们只做一件事——把你们这几家的单位成本做到最低,并且让这个数字可以被你们自己核验。」承认劣势之后说出的优势,可信度反而更高。
背后的真实顾虑:这是最合理的顾虑,也是最不该硬扛的。
答法:不接这个前提。我们从来不建议一次性切换,因为那对园区不利,对我们也不利。正确结构是混合架构 + 分段承接:
这一条答完,通常会显著改变对方对我们的印象——主动限制自己的敞口,是小团队证明自己懂事的最有效方式。而且它是真话:一次吃下全部流量对我们才是最大的风险。
背后的真实顾虑:既有政策要求要用国产,又怕用了出事,希望有人替它承担这个判断。
答法:不要辩护,要拆解。国产加速器在推理侧的差距,主要不在峰值算力这一项——差距集中在软件栈:算子覆盖不全导致大量算子回退、显存管理粗糙导致批量上不去、调度不成熟导致利用率低、长上下文与多模态路径缺少针对性优化。这些每一项都是工程可补的,也正是我们的工作内容所在。
然后给出园区真正想听的结论:「所以我们的方案不是赌国产卡,而是把国产卡放在它现在确实合适的负载上,把不合适的负载留给其他硬件,由平台统一调度、对上层企业完全透明。企业只看到一个 API,看不到底下是什么卡。国产化率因此变成一个可以逐季度往上调的平台指标,而不是一次性的赌注。」
把国产加速器推理的具体瓶颈讲到对方能听懂又插不上话的深度(算子回退、显存碎片、批处理调度、通信原语),是这场会谈里最有效的信任建立动作。但要在对方问了之后才展开,不要主动上技术课。
答法:企业各自买,有三件事永远拿不到——而这三件恰好都是园区的职能所在:
再加一句给平台听的:「而且企业各自买,园区就看不到自己企业的 token 曲线——那是最灵敏的活跃度指标。」
答法:给结构,不要急着给数字。三种可选,按园区的风险偏好排序:
以当前实际单位成本为基线,我们只从可核验的节省额中按比例取酬。园区不增加任何支出,不省则不付。适合破冰:把举证责任完全放在我们这边。
园区持有算力资源(自采或租赁),我们负责平台建设与运营,收固定托管费 + 绩效部分(挂钩利用率与单位成本指标)。适合园区希望资产与数据都在自己手里的情形。
我们自租算力自建平台,按 token 向园区结算,价格锚定在公开挂牌价的固定折扣上并写入调价机制。最省事,但园区拿不到成本透明度,通常作为规模化之后的形态。
先谈 A,把第一阶段做成园区几乎零风险的动作;A 跑出实测数之后,B 和 C 的谈判就有了共同的事实基础。顺序反了会很难谈——没有实测数据时谈 C,就退回到纯比价了。
答法:列清边界,不讲承诺。私有化部署在园区可控的资源上;推理数据不出园区网络边界;模型权重与业务数据分离存储;完整调用审计日志归园区所有;运维访问留痕并可由园区审计。把「我们能看到什么」明确写下来——主动划出自己的权限边界,比反复保证安全更有说服力。
答法:这个问题必须给出结构性答案,而不是「我们不会」。
这四条合起来传递的信息是:我们的护城河是持续把成本做得更低,不是把客户锁住。愿意主动交出锁定手段的供应商,在这个赛道里同样是少数。
方案设计的唯一原则:让园区在每一个节点上都能低成本地说「不」。敞口越小,第一步越容易迈出去;而只要第一步的实测数据是真的,后面的谈判就不再是说服,而是算账。
目的只有一个——把「我们更便宜」从主张变成读数。做法:取园区内一到两家企业的真实请求样本(脱敏后),在我们的环境与现有供应商上跑同一批请求,同时记录成本侧与质量侧指标。
| 指标类别 | 具体指标 | 为什么必须一起看 |
|---|---|---|
| 成本侧 | 单位 token 成本(分输入/输出) | 核心结论。必须统一口径:是否含缓存命中、是否含峰值备容成本 |
| 单卡有效吞吐、集群利用率 | 成本优势的来源必须可归因,否则无法判断是否可持续 | |
| 质量侧 | 首字延迟 TTFT、单 token 延迟 TPOT | 降本不能靠牺牲体验。这两项必须先设下限再谈成本 |
| 长上下文准确率 | 最容易被牺牲的一项。量化与显存压缩手段常在长上下文上大幅掉点,短请求评测完全看不出来 | |
| 输出一致性(同 seed 复现) | 企业侧回归测试要用,波动大会引发大量返工 | |
| 稳定性侧 | 压测下的错误率与限流表现 | 公有云的隐性成本主要在这里 |
| 峰值承载与降级行为 | 决定第二段的容量设计 |
在测试开始前就与园区约定:如果单位成本改善低于某个阈值,或任一质量指标低于现状,则本项目终止,园区不承担任何费用。把失败条件写在前面,是这一段最重要的动作——它让园区几乎没有理由拒绝启动。
承接一部分真实生产流量,但严格限定在可预测的基载与非关键路径上,峰值与关键业务仍走原有通路。这一段要产出三样东西:
参与企业建议从自愿报名的三到五家起步,优先选 token 消耗量大、对成本敏感、技术团队配合度高的。第一批企业的口碑决定第三段能否推开——这一段的真实目标是拿到园区内部的推荐人,而不是拿到收入。
只有在前两段都有可核验数据之后,才谈整体承接。这一段的形态与商务结构在第 9.7 节已列出(转入托管费或按量结算)。这里只强调三个必须在这一段落地、且构成长期壁垒的动作:
把算力配额做成分级的入驻权益,与招商流程绑定。一旦写进招商政策,这个平台就成了园区制度的一部分,而不是一个可随时更换的供应商。
不承诺一次性达标,而是给出逐季度提升的路线与每一档对应的负载类型。让国产化率成为一条向上的曲线,这是园区最需要的汇报素材,也是我们技术能力的直接体现。
资产、数据、审计日志、部署文档全部归园区;不排他、不锁定。这既是消除疑虑的手段,也是我们真实的战略选择——护城河在成本曲线上,不在合同条款上。
这一章是可以直接带进会议室的部分。核心判断:第一次会谈不要以拿单为目标,要以「拿到六个数字 + 约定一次对比测试」为目标。把目标定小,成功率会高很多,而且第二次见面时我们手上就有事实了。
| 时段 | 要做的事 | 要达到的效果 |
|---|---|---|
| 0–5 分钟 | 不介绍公司,先说来意:「听说园区每年在 token 上的支出是亿元量级,我们想看看这笔钱的结构里有多少是可以省下来的,以及能不能顺便变成园区自己的一项能力。」 | 把话题从「供应商推销」切换到「一起看一笔预算」 |
| 5–20 分钟 | 讲第 2 章的算术:恒等式 → 模型厂商自己披露的成本数据 → 一亿元的构成表。只讲结构,不报价。 | 建立「这个人懂成本,不是来卖东西的」的第一印象 |
| 20–35 分钟 | 问 §2.6 的六个数字。带一页纸现场填。填不出来的当场记为待补。 | 拿到定价所需的口径;同时暴露对方现有供应商没做过这件事 |
| 35–48 分钟 | 讲第 5 章的四项价值(招商权益 / 可汇报的建成物 / 活跃度看板 / 预算效率),以及 §5.3 的三件杂事。这一段是给平台听的,不是给技术听的。 | 把我们从「更便宜的供应商」变成「帮园区把费用变成能力的人」 |
| 48–58 分钟 | 提出第一段方案:同题同压对比测试,失败条件前置,园区零费用。明确说出「如果测不出优势,这单不该给我们」。 | 把决策门槛降到几乎为零 |
| 58–60 分钟 | 约定下一步的具体动作与时间:谁提供样本、谁对接、什么时候出结果。 | 会议以一个日期结束,而不是以一句「保持联系」结束 |
「园区每年花在 token 上的钱是亿元量级,但这笔钱花完之后,园区账上什么都不剩——它全部变成了外部供应商的收入。我们想谈的是:同样的预算,能不能让园区多出一个自己的推理底座、一份招商权益、一套企业活跃度数据。」落点是资产化与政绩,不是价格。
「单位 token 成本等于卡时成本除以吞吐再除以利用率。买 API 的时候,后面两项是看不见的,也是没法优化的。我们想看看园区聚合之后,这两项能做到什么水平,这个可以直接测。」落点是工程,直接进入同行对话。
「几十家企业各自向不同供应商付费,币种、票据、主体都不统一,涉及财政资金和科研经费时更麻烦。统一入口能把 N 份合规问题压缩成 1 份,顺便让国产化率变成一个可统计、可上报的平台指标。」落点是合规与流程,不是技术。
| 不要说 | 为什么 | 改成 |
|---|---|---|
| 「我们比大厂便宜 X 成」 | 在没有口径的情况下报数,会被当成又一个报价,且一旦口径不同就失信 | 「我们想先把口径对齐,再谈能省多少——现在报数对你没意义」 |
| 「大厂服务不好 / 不重视小客户」 | 无法验证,且显得在贩卖情绪;对方很可能与大厂关系良好 | 「他们的商业模式是按需计费,园区的闲置在他们账上是收入——这是激励结构问题,不是服务态度问题」 |
| 「国产卡完全没问题」 | 对方大概率知道有问题,这句话直接摧毁可信度 | 「差距主要在软件栈这几层,具体是……这些是工程可补的,我们的方案是混合架构加逐季度台阶」 |
| 「我们可以接下全部一亿元的量」 | 激进,反而放大对方对小团队的担忧 | 「我们只建议承接可预测的基载,峰值溢出仍走公有云,园区始终保留退路」 |
| 「需要签排他 / 需要预付」 | 第一次会谈提锁定条款,等于宣布自己没有成本优势 | 「不排他、不锁定、资产和数据都在园区手里」 |
| 主动大段讲技术 | 平台机构的决策人不为技术付费,且容易变成考试 | 技术只在被追问时展开,展开时要深(§6.6 那张表的深度) |
刻意不准备的东西:公司介绍、团队背景页、技术架构大图、报价单。第一次会谈里,这四样每出现一样,会谈就往「供应商比价」的方向偏一点。
前面几章都在讲怎么说服对方。这一章相反:把我们自己这一侧最薄的地方摊开。写在这里的目的很实际——这些问题对方的技术顾问也会想到,我们提前想过一遍,会谈时就不会被问住。
这个数字来自对方口述,构成未知。它可能包含算力租赁、平台建设与人力,甚至包含尚未发生的规划性预算;也可能大部分花在海外前沿模型上——那种情况下算力成本占比不到 2%(§2.3 末两行),我们能优化的绝对额会小很多,但相对降幅反而更大。应对:口径没问清之前不做任何承诺,这也是 §2.6 六问表的由来。
如果园区的支出主要是闭源模型的授权与调用溢价,那么优化推理效率只能压缩其中的算力部分。这是我们能力的真实边界,必须主动说出来。应对:把可优化范围明确圈定为「开源与自部署模型的推理成本」,闭源部分只做用量治理与路由优化(把不需要顶级模型的请求分流到便宜模型),这一项本身也常有可观收益。
§2.5 的曲线成立的前提,是几十家企业确实把负载放上来。而每家企业都有自己的技术选型、迁移成本与惰性,园区的行政力度也未必能推动。如果只接进来三五家,利用率红利就只剩一小半。应对:第二段刻意从自愿报名的企业做起,用第一批的实际账单形成园区内部口碑;同时把配额与入驻权益绑定(§10.3),让新入驻企业默认在平台上。
算子缺口、长上下文与多模态路径的成熟度,在真正跑起目标模型之前很难准确估计。承诺过早会伤自己。混合架构不只是给园区的风险管理方案,也是给我们自己的。应对:第一段测试就把目标模型在目标硬件上跑通,把不确定性在零承诺阶段消化掉;国产化占比按季度台阶承诺,不给一次性达标的时间表。
园区级平台意味着 SLA、值班、故障响应、版本升级、几十家企业的接入支持。这与做一次性优化项目的资源模型完全不同,对一个小团队是真实的组织压力。应对:第三段的商务结构必须把运维成本显性计入(托管费而非纯分成);第二段就要开始验证单位客户的支持成本,避免规模化后被服务成本拖垮。
华泰证券固收团队《智能经济:系统理解 AI 产业链》(2026-07-31)算了一笔账:2025–2030 全球 AI 总资本开支或达 5 万亿美元,按五年折旧对应年折旧 1 万亿美元,加 5% 融资成本的利息 2,500 亿;云厂 EBITDA 利润率 50% 时,盈亏平衡需要年收入 2.5 万亿美元,若要 20% ROIC 则需 5 万亿;再按应用端 50% 毛利率倒推,软件端年收入需达到 10 万亿美元。而当前全球 AI 应用公司收入合计仅千亿美元量级——差两个数量级。
含义:整个行业的资本开支尚未被应用收入验证。这对我们既是风险也是机会:如果这轮投入最终要靠效率而不是靠规模来兑现,那么「把单位成本做下来」这件事的战略地位只会上升;但同时也意味着客户的预算随时可能收紧——这是第一段方案必须做到园区零费用(§10.1)的现实理由。
另一条对冲性的行业规律(华泰同期引杰文斯悖论):token 价格每下跌 10%,用量上升 12%–18%。降价会带来超比例的用量增长——这是我们建议园区把省下的钱转成更大调用量、而不是单纯削减预算的依据。
第一段的对比测试是零收费的,但它需要投入真实的工程人力(跑通目标模型、搭测试环境、出报告)。在启动之前,我们内部要先明确这笔投入的上限,以及什么情况下中止——否则很容易演变成长期免费 PoC。建议的约束:园区侧必须同时承诺三件事(提供真实请求样本、指定对接人、明确验收门通过后进入第二段的决策路径与时间)。三件里缺任何一件,就说明这件事在园区内部还没有主人,此时不宜投入。
这一章是给自己看的参考页,不是谈判材料。目的很简单:别人在会上抛出一个公司名,你能立刻知道它在哪一层、大概什么量级、有没有在赚钱。数字尽量标了出处与置信度——原文指招股书或定期报告原文,媒体指媒体或研报转述,常识指行业通识、未在本轮核实。
每家都补了创始人与团队背景。这一项几乎全部标为「常识」——它们来自行业通行认知而非本轮一手核实,且高管变动频繁。用途是让你在别人提起某家公司时知道它的来路与基因,不要在正式场合当作确定事实引用;真要提某个人名,会前花一分钟搜一下确认在任。
整条链上从下到上有五层,毛利率与技术含量大体是从下往上递增,但资本开支是从下往上递减:
| 层 | 做什么 | 典型毛利率 | 代表 |
|---|---|---|---|
| L1 芯片 | 造卡 | 高,但研发与流片投入巨大 | 英伟达、昇腾、寒武纪、海光、壁仞、摩尔线程、沐曦、天数智芯、燧原、昆仑芯 |
| L2 机柜与电力 IDC / AIDC | 卖机柜、电力、制冷 | 40%–50% | 润泽科技、万国数据、世纪互联;优刻得的机柜托管业务 |
| L3 卡时租赁 | 把卡按小时/月租出去 | 20%–30%(行业均值) 实测常见 5%–15% | 并行科技、首都在线、青云科技、CoreWeave、Lambda |
| L4 推理服务 / Token 工厂 | 在卡上把模型跑起来,按 token 卖 | 两极分化:−119% 到 +69% | 硅基流动、无问芯穹、PPIO、Fireworks AI、Together AI;模型厂的 API 业务 |
| L5 企业 AI 网关 | 路由、审计、合规、成本管控 | 高,但市场尚早 | OpenRouter、基元律动;国金证券称之为「4.0 级」 |
国金证券《Token 计费重塑 AI 产业链》(2026-07-17)的四级模型对应 L3→L5:1.0 API 代理、2.0 聚合平台、3.0 推理基础设施、4.0 企业 AI 网关,并判断国内玩家「大多处于 2.0 向 3.0 过渡的关键阶段」原文。我们主张的位置是 3.0,即自己租算力、自己跑模型、自己承担效率。
这一层最值得研究,因为它就是我们要去的位置,而且几乎每一家都在亏钱。
| 公司 | 一句话定位 | 关键数字 | 状态 |
|---|---|---|---|
| 硅基流动 SiliconFlow |
自述「最大的独立生态词元供应平台」,聚合 170+ 模型对外提供 API,兼做本地化部署 | 2025 营收 5,533 万元(+653.2%);公有云毛利率 −119.0%、本地部署 82.5%、整体 −24.0%;算力租赁费占销售成本 86.9%、算力 100% 外租;算力总支出为收入的 2.88 倍;词元市占率仅 1.5%(前三名合计 87.0%)原文 | 港股已递表处理中(2026-06-30,18C「未商業化公司」,未过聆讯) 团队:创始人袁进辉,深度学习框架 OneFlow(一流科技)创始人,原微软亚洲研究院。做推理平台之前先做了七年训练框架,这是它敢自称「生态词元供应商」的底子常识 |
| 无问芯穹 Infinigence |
最需要重视的对手。异构算力纳管 + 推理引擎优化 + Agentic MaaS;同时把园区级平台做成了白标产品 | 累计融资超 22 亿元;纳管算力 25000P+、覆盖 26 城 53 个数据中心;2025 收入超 5 亿、现金流为正媒体;技术资产 FlashDecoding++、SpecEE(ISCA 2025)、Infini-ACC;同一套代码服务至少 9 个租户一手抓取 | 未上市;港沪深三所均无递表记录(§3.5) 团队:CEO 夏立雪,清华电子系博士,师从汪玉教授;联合创始人戴国浩现任上海交大副教授。清华电子系的模型压缩与硬件加速一脉,技术出身与我们同源,这也是它难缠的原因常识 |
| PPIO 派欧云 | 分布式 GPU 云 + 模型 API,算力来自分散节点聚合 | 2022–2024 营收 2.86/3.58/5.58 亿元,净亏 0.85/1.89/2.94 亿元,三年累亏 5.68 亿;AI 云业务过去两年录得毛损原文;2026-04 日均 1.028 万亿 token媒体 | 港股二次递表(2026-06-10;首次 2025-06 已失效) |
| 基流科技 | 卖 AI 算力集群(硬件交付)+ 集群运营服务,自持 GPU | 2025 营收 5.20 亿元;产品毛利率 16.8%、运营服务 47.7%(两条都在跌);机器设备折旧 6 年;应收周转 64.1 天,2025 年末应收到 2026-02 只收回 8.6%;现金两个月消耗 2.36 亿元;市占率第 9 名 1.1%原文 | 港股已递表处理中(2026-04-29) |
| 潞晨科技 | 这个赛道唯一可确证的完整退出样本。原做 Colossal-AI,2025 年短暂做过 DeepSeek API | 创始人尤洋公开测算:日出 1000 亿 token 则月机器成本 4.5 亿、亏 4 亿,「用户越多,亏损越多」;并指出「常规 MaaS 要实现稳定输出,需准备的机器可能是理论值的 5 倍」媒体 | 2025-03-01 停止 API 服务并全额退款 团队:创始人尤洋,新加坡国立大学校长青年教授,Colossal-AI 作者。训练框架出身,一样栽在 MaaS 的单位经济上——说明这不是能力问题,是模式问题常识 |
| 趋境科技 | 推理优化,主打「高品质 Token 分层」,国产异构 | 自述单台算力 Token 生产效率 +3 倍、高品质产能 +30 倍;半年融资超 10 亿元(2026-07 A 轮,河南投资集团领投)媒体 | 在营 |
| 九章云极 DataCanvas |
「训练工厂 + Token 工厂」双线,信通院 Token 标准首批首家通过 | 目标 10 万 P、日产 10 万亿 token、千倍降本媒体。 团队:董事长方磊、副总裁胡宗星 方磊原话:「这绝非低价内卷的价格战,本质是底层工程体系效率之战」 |
在营 |
| 基元律动 | 工研院自己孵化的项目。OpenSquilla 多模型智能调度框架,分层路由降本,属 L5 网关层 | 自述路由方案可使 Token 成本降低 90%;前华为诺亚方舟团队;已完成天使轮媒体 | 在营。与我们是叠乘关系而非竞争,见 §1.6 团队:前华为诺亚方舟实验室博士团队,自述具备海量算力落地与政企 AI 交付经验项目库 |
模型公司自己卖 API。这一层的招股书是研究单位经济最好的材料,因为推理成本几乎等于它们的全部成本。
| 公司 | 一句话定位 | 关键数字 | 状态 |
|---|---|---|---|
| 智谱 02513.HK |
清华系,本地化部署为主(政企私有化),云端 API 为辅 | 云端部署毛利率 76.1%→31.0%→3.4%→−0.4% 毛损(1H2025);本地化部署 59.1%;2024 年研发算力服务费 15.53 亿元=当年收入的 5 倍,占研发开支 70.7%;1H2025 净亏 23.58 亿元原文 | 已上市 2026-01-08 团队:脱胎于清华大学知识工程实验室(唐杰教授),CEO 张鹏。典型的学术转化路线,也解释了它为什么以政企私有化部署为主常识 |
| MiniMax 00100.HK |
C 端产品(海螺 AI、Talkie、星野)+ 开放平台 API,收入约七成来自境外 | 开放平台毛利率 69.4%(9M2025)——同期同赛道最高;推理 MFU >75%,自述「顯著高於行業約 40%–50% 的平均水平」;销货成本中推理云计算占 92.7%–96.9%;纯轻资产全外租,账上无服务器折旧;1H2026 收入 1.166 亿美元(+283%)但毛利率回落至 17.9%;阿里通过 Alisoft 持股约 15.04% 且是五大供应商之一原文 | 已上市 2026-01-09 团队:创始人闫俊杰,原商汤科技研究院副院长。产品与出海基因强,收入约七成来自境外,与智谱形成镜像常识 |
| 云知声 09678.HK |
严格说不是 MaaS——硬件占销货成本 54.5%,本质是集成硬件软件的 AI 方案商 | FY2025 收入 12.11 亿元(+29.0%)、整体毛利率 36.1%(连续三年下滑);单一可呈报分部,不披露分业务毛利率;自建 Atlas 智算集群 >184 PFLOPS,租用乌兰察布数据中心原文 | 已上市 2025-06-30 团队:创始人黄伟,语音识别出身常识 |
| DeepSeek | 不上市、不融资,但公开了行业最硬的一份推理成本核算 | 2025-03-01 披露:24 小时内平均占用 1,814 张 H800,日成本 8.7 万美元,输入 6,080 亿/输出 1,680 亿 token,成本 ÷ 理论收入 = 15.5%(即「理论利润率 545%」);2026-08-17 起启用峰谷分时定价官方 | 未上市 团队:创始人梁文锋,量化私募幻方量化创始人。非典型路径:用自有资金与自有集群做研究,不融资不上市——这正是它敢公开成本核算的前提常识 |
| 月之暗面 Kimi / 阶跃星辰 / 百川 | 其余头部模型厂,各自有 API 业务 | Kimi K3 输出挂牌价约 100 元/百万 token媒体。阶跃星辰另有单独分析报告 团队:月之暗面杨植麟(清华,Transformer-XL 与 XLNet 作者之一);阶跃星辰姜大昕(原微软全球副总裁);百川王小川(搜狗创始人)常识 |
未上市 |
智谱云端 −0.4%,MiniMax 开放平台 69.4%,同期、同赛道、都卖 API。MiniMax 恰好披露了 MFU >75% 对行业 40%–50%。这是「效率决定毛利」最直接的招股书级证据(口径差异见 §4.2 的提醒:MiniMax 七成收入来自境外,定价更高)。
| 平台 | 归属 | 关键数字 |
|---|---|---|
| 火山方舟 团队:火山引擎总裁谭待。其公开口径「1 万台服务器利用率优化一个点,与 100 万台优化同样一个点,收益相差 100 倍」值得记住常识 | 字节跳动 / 火山引擎 | 调用量份额约 49.5%、营收份额 >40%(IDC 2026-05);豆包日均 token 2026-03 突破 120 万亿、三个月翻倍;2026 年 MaaS 营收目标上调至 150 亿元媒体。2024-05 以「比行业平均低 99.3%」的定价点燃价格战 |
| 阿里云百炼 | 阿里巴巴 | 份额约 28%;2026Q1 阿里云 AI 收入占比首破 30%媒体。限流机制值得研究:除 RPM/TPM 外还有「增速限制」,即总量未达上限也会触发(官方文档) |
| 百度千帆 | 百度 | 份额约 10%;底层用自研昆仑芯媒体 |
| 腾讯云 / 华为云 | — | 腾讯云未进 MaaS 前五;华为云走昇腾国产算力路线,CloudMatrix384 是其旗舰推理架构(384 张昇腾 910C) |
要记住的机制:大厂 MaaS 的低价是获客投入,不是成本优势。硅基流动招股书里「推广算力资源成本」5,421.3 万元(即发免费券烧掉的算力)是其公有云收入的 1.85 倍——这就是补贴的确切金额。而 2026-03 起行业已出现反向涨价(§4.5)。
这一批是「卡时生意」,研究它们主要为了两件事:看清 L2 与 L3 的毛利率差异,以及学会用折旧年限识别报价。
| 公司 | 定位 | 最新毛利率 | 要点 |
|---|---|---|---|
| 润泽科技 300442 | 重资产自建 AIDC,L2 层的标杆 | AIDC 48.50% | 100% 自投自建自持;前五大客户占 95.52%、最大客户 48.59%——极高集中度;2025 归母净利 50.50 亿但扣非仅 19.01 亿(差额来自 REIT 股权处置)原文 |
| 并行科技 920493 | 超算云 + 智算云调度,L3 层 | 算力服务 22.03% 智算云 11.37% 2026Q1 降至 15.57% | 全样本跌得最惨(算力服务同比 −10.06pct,企业客户 −11.62pct),且年报对毛利率下滑未给任何文字解释;算力以外采为主(算力使用费占成本费用 43.19%);折旧 3–5 年原文 |
| 优刻得 688158 团队:创始人季昕华,原腾讯、盛大;科创板首家「同股不同权」公司常识 | 公有云 + IDC/AIDC | 云计算 23.52% 机柜托管 43.61% | 2025-10-30 把 GPU 折旧从 4 年改为 5 年,仅一个季度就增厚净利 859 万元——研究报价时最该警惕的操作;自有算力 38000P,自述 100% 满租原文 |
| 首都在线 300846 | 智算云 + 云主机 + IDC | 大模型及 AIGC 11.40% (+10.31pct) | 唯一同比回升的,靠淘汰老旧资产 + 自建 AIDC 替代第三方机柜;外采算力成本同比 +245.69%;折旧 5–10 年原文 |
| 青云科技 688316 团队:创始人黄允松,原 IBM。其 GPU 售后回租融资由本人提供个人连带担保年报——这个细节说明中小云厂商的融资处境常识 | 公有云 + 私有云软件 | 云服务 4.89% 云产品 62.66% | 软件毛利 62.66% 与云服务 4.89% 的对比很说明问题;GPU 走售后回租融资 1.245 亿元,创始人个人连带担保;6.84 亿元 GPU 采购合同「是否正常履行=否」原文 |
| 软通动力 301236 | IT 服务商转型算力运营,「北京壹号词元工厂」 | 智算服务 10.63% | 词元工厂一期日产能 1.4 万亿 token;SLA 对标电网(可用性 ≥99.9%、首字延迟 P90 <10 秒、缓存命中率 ≥90%);智算业务规模仅 3.01 亿、占总收入 0.86%;怀来项目测算毛利率 38.03%、税后 IRR 10.14%,但已接洽需求仅覆盖新增产能 39%–48%原文 |
| 弘信电子 300657 | FPC 转型算力,燧弘华创无锡 Token 工厂 | 算力业务 13.83% | 江苏首个昇腾 384 超节点集群,首期 4 台合计 1,536 卡;实测 Token 生成性能超同规模英伟达集群 1.2 倍——国产卡最有价值的公开数据点原文/媒体 |
| 云赛智联 600602 | 上海国资云计算平台 | 云计算大数据 18.29% | 专用设备折旧 20 年(年折旧率仅 4.75%);2026 中报全文「毛利」零命中,分部信息勾选「不适用」原文 |
| 润建股份 / 协创数据 / 奥尼电子 | 转型算力运营的中小盘 | — | 润建把五象云谷智算中心升级为 Token 工厂、推「星算云池」;奥尼电子把闲置算力接入弹性网络、按 Token 积分结算媒体 |
要记住的判断:券商普遍认为订单、算力与流量会持续向运营商和头部云厂商集中,马太效应凸显——「运营商掌握稀缺的政企渠道、全域客户、网络传输、统一结算与合规运维能力」。这条对我们是不利判断,会谈中如被提出,正确回应是承认规模劣势、把主张收缩到「特定负载的单位成本」上(§9.3 末段)。
| 厂商 | 路线 | 软件栈 | 要点 |
|---|---|---|---|
| 华为昇腾 团队:华为海思体系,无对外创始人叙事,靠体系化投入而非明星团队常识 | 自建生态,达芬奇架构 ASIC | CANN(AscendCL / AOL / Ascend C) | 生态最完整、政企份额最高,2025 年占国产出货约一半以上。 CloudMatrix384 超节点(384 张 910C):中信证券转引论文数据,Prefill 计算效率 4.45 tokens/s/TFLOPS 对 H100 的 3.75、H800 的 3.96;Decode 1.29 对 1.10/1.17。申万宏源:单卡 Prefill 吞吐 5,655 tokens/s,单位 TFLOPS 效率超 H100 方案 18%,节点间带宽衰减 <3%、延迟增加 <1μs。多家券商引华为口径:单用户 20 TPS 下单卡 decode 1,920 tokens/s,比肩 H100。 代价:相对 GB200 NVL72,算力 1.7 倍/内存 3.6 倍/带宽 2.1 倍,但总功耗 3.9 倍、单 TFLOP 功耗 2.3 倍;910C 单芯片性能约 GB200 的 1/3。 软件栈:CANN 8.0 官方称典型算子开发周期由 2 人月缩短至 1.5 人周;MindSpore 2.6 已适配 vLLM 原生接口(国泰君安 2025-04-14,是检索到的唯一券商级 vLLM 适配表述)。昇腾 950PR 计划出货约 75 万颗,DDR 版约 5 万元/颗、HBM 版约 7 万元/颗 |
| 寒武纪 688256 团队:创始人陈天石,中科院计算所出身,与其兄陈云霁共同开创国内 AI 芯片一脉常识 | 自建生态 ASIC,思元(MLU)系列 | Neuware。对标关系:BANG C↔CUDA C、CNNL↔cuDNN/cuBLAS、CNCL↔NCCL、MagicMind↔TensorRT | 思元 690 已于 2026 年初量产:双 Die 封装,FP16 >700 TFLOPS、196GB HBM3、互连带宽 >890Gbps;上代思元 590 为 FP16 约 345 TFLOPS、96GB HBM2e研报。2025 年 590/690 合计销售 11.74 万卡(+201.6%);2026Q1 营收 28.85 亿元(+159.6%)、归母净利 10.13 亿元。已开源 vllm-mlu,对 DeepSeek-V4 做到 Day-0 适配,支持 TP/PP/SP/DP/EP 五维混合并行与 PD 分离部署。客户集中度高:前五大占 88.66%媒体 |
| 海光信息 688041 团队:国资与中科院体系(中科曙光为第一大股东),非创业型团队;技术路线上承接 AMD 授权常识 2025 年已与中科曙光换股吸收合并,曙光持股 27.96% | 兼容 ROCm 的「类 CUDA」路线,深算(DCU 8000)系列。深算一号→二号(2023Q3,性能 +100% 以上)→三号(2025 年内已投入市场)→四号研发中 | DTK,另有 DAS / DAP,2025-12 宣布全面开放。东海证券称算子覆盖度超 99%、DTK 是「国内最为完备的生态之一」研报 | 深算一号对 A100 的招股书级规格差(被多家券商反复引用,同源于招股说明书):显存带宽 1024GB/s ≈ A100 的 50.2%;卡间互联 xGMI 184GB/s ≈ A100 NVLink 600GB/s 的 30.7%。华福证券由此推算「性能预计达 A100 的 40% 以上」。注意:海光官方从未披露过深算一号的 TFLOPS/TOPS 数字,券商对比表里这三栏是空白。DeepSeek-V3.2-Exp 发布当日完成适配;但 vLLM 在全部可查中文研报与产业分析中零出现,其推理框架叙事围绕百度飞桨 Paddle ROCm 版与第三方澎峰科技 PerfXLM+ |
| 摩尔线程 688795 / 沐曦 688802 团队:摩尔线程张建中(原英伟达全球副总裁兼中国区总经理);沐曦陈维良(原 AMD)。两家都是「英伟达/AMD 高管出走创业」的典型常识 | 兼容 CUDA 的 GPGPU | MUSA / MXMACA | 2025-12 先后科创板上市,首日分别 +425%/+693%;摩尔线程 KUAE 万卡集群训练 MFU 稠密 60%、MoE 40% |
| 壁仞 6082.HK / 天数智芯 9903.HK 团队:壁仞创始团队来自商汤与芯片大厂(创始人张文,原商汤总裁;后续管理层有变动待核)常识 | GPGPU | — | 壁仞 2026-01-02 港股上市,募资 55.83 亿港元、超额认购 2,346 倍,市值约 825 亿港元——18C 以来最大募资项目 |
| 中科曙光 603019 团队:中科院计算所产业化平台,国内超算老牌力量常识 整机与超节点 | 海光的第一大股东,出整机柜与集群 | — | scaleX640:全球首个单机柜级 640 卡超节点,自述相比传统方案在 MoE 万亿参数训练推理场景性能提升 30%–40%;万卡超集群总算力 5 EFLOPS、HBM 总容量 >650TB(2025-12 光合大会)研报。系统级数字,非单卡,且「传统方案」未定义 |
| 燧原 / 昆仑芯 / 曦智 团队:燧原赵立东(原 AMD 中国区总经理);昆仑芯脱胎于百度自研芯片团队(欧阳剑);曦智沈亦晨(MIT 光子计算博士)常识 | ASIC / 自研 / 光计算 | — | 燧原科创板在审;昆仑芯 2026-01 保密递表港交所;曦智 2026-04 港股上市 |
| 2025 年中国 AI 加速卡出货份额 | 份额 | 约当张数 |
|---|---|---|
| 英伟达 | 55% | 约 220 万张 |
| 华为昇腾 | 20% | 81.2 万张 |
| 阿里平头哥 | 6.6% | 26.5 万张 |
| 百度昆仑芯 / 寒武纪 | 各约 2.9% | 各约 11.6 万张 |
全年出货合计约 400 万张,IDC 口径经媒体转述媒体,未见 IDC 原始报告。结构上值得注意:昇腾一家占了国产份额的一半以上,而寒武纪虽然营收增速极高,出货绝对量仍只有昇腾的七分之一。
口径已由华泰证券 2026-07-22 中期策略引 IDC 数据统一:2025 年中国 AI 加速卡总交付 400 万张,其中国产 165 万张、占比 41%(2024 年约 30%),昇腾 81.2 万张、占国产的 49.2%。另有转引国泰海通的口径给出昇腾 130 万+、寒武纪 50–60 万,与上表差异很大且为三手信息,建议以 IDC 口径为准。会谈中安全的说法是「国产份额已过四成,昇腾占国产的一半」这个结构性判断。
① 单卡实测性能约为 H100 的 60%(SemiAnalysis 与 Counterpoint 测算);② 但集群层面已有反超的公开实测(燧弘昇腾 384 超节点 1.2 倍);③ 差距的主因不是硅片而是软件栈——北大谢涛教授的四点归因是「指令集不统一、软件栈不统一、算子覆盖度低导致迁移成本高、企业各自为战」。「很多国产芯片不是不能运行,问题在于能不能以接近 CUDA 生态的工程效率运行」——这句话就是我们存在的理由。
| 公司 | 定位 | 要点 |
|---|---|---|
| Fireworks AI 团队:CEO Lin Qiao,原 Meta PyTorch 负责人。推理框架的原作者去做推理服务,这就是「3.0 级」能做到 50%+ 毛利的底气常识 | Token 工厂 3.0 的标杆 | 自研推理调度体系部署开源模型,公开披露综合毛利率稳定维持 50% 以上——国金证券把它作为「3.0 级」的对标样本原文 |
| Nebius 团队:创始人 Arkady Volozh,Yandex 创始人。俄罗斯搜索巨头拆分后转型 AI 云常识 | 新兴 AI 云,纳斯达克上市 | 国信证券用它做了一份完整的单卡 P&L:GLM5.2 部署 B200,毛利率 30%(原模型)→ 54%(基础设施优化)→ 81%(全栈优化),利用率 60%→69%。优化杠杆包括定制 ODM 机箱省 10%–15% OEM 溢价、自研液冷降功耗约 20%、弹性打包回收约 15% 闲置算力原文 |
| OpenRouter 团队:联合创始人 Alex Atallah,OpenSea 联合创始人常识 | L5 网关层的代表 | 在供应商成本上仅加收约 5.5% 溢价;19 个月内平台月度日均 token 由 0.072T 增至 7.995T(111 倍);中国模型份额从 6.0% 升至 61.5%;Agent/Coding 应用仅占应用数 19% 却贡献 81.2% token原文 |
| Together AI 团队:联合创始人 Vipul Ved Prakash、Ce Zhang(原 ETH 教授)常识 | 开源模型托管 + GPU 云 | 与 Fireworks 同类,海外头部已进入 3.0–4.0 阶段媒体 |
| CoreWeave 团队:创始人 Michael Intrator,对冲基金背景,从加密货币挖矿转型常识 | 最大的独立 GPU 云(L3) | 从加密矿工转型,靠与英伟达的深度绑定与长约锁定客户;研究它主要是看「卡时生意如何靠长约把利用率锁住」常识 |
| Baseten / Modal / Lambda 团队:Modal 的 Erik Bernhardsson,原 Spotify 机器学习负责人、Annoy 作者;Lambda 的 Stephen Balaban常识 | 推理托管与 GPU 云 | Baseten 曾披露其云服务商计划 2026-10 将 B200 续约价上调约 94%(2.63 → 5.10 美元/小时)媒体 |
| Groq / Cerebras / SambaNova 团队:Groq 的 Jonathan Ross 是 Google TPU 的最初设计者;Cerebras 的 Andrew Feldman(晶圆级引擎);SambaNova 的 Rodrigo Liang(原 Oracle)常识 | 专用推理芯片 | 以极低延迟为卖点的另一条技术路线常识 |
海外这条线最有参考价值的一点:Fireworks 能做到 50%+ 毛利,Nebius 能把同一张卡的毛利率从 30% 做到 81%,而国内同层玩家普遍负毛利。差距不在市场,在工程成熟度——这也是国金证券说国内「大多处于 2.0 向 3.0 过渡」的含义。
| 数字 | 含义 | 用在哪 |
|---|---|---|
| 180 万亿 | 全国日均 token 调用量(WAIC 2026,2026-07)。轨迹:2024 年初约 0.1 万亿 → 2025 年末 100 万亿 → 2026-03 突破 140 万亿 → 2026-07 达 180 万亿,两年涨约 1,800 倍 | 说明需求侧不是问题 |
| 15.5% | DeepSeek 官方披露的成本 ÷ 理论收入 | 说明挂牌价里算力占比很低 |
| −119% / +69.4% | 智谱云端与 MiniMax 开放平台同期毛利率 | 说明效率决定毛利,不是模式 |
| 75% vs 40–50% | MiniMax 推理 MFU 与行业平均 | 说明工程空间有多大 |
| 2.88 倍 | 硅基流动算力总支出 ÷ 收入 | 说明补贴的量级 |
| 1,102 → 244 | 同样 200B token/天所需 H100 卡数(自部署 vs Token 工厂,国信证券) | 说明聚合与优化的合并收益 |
| 30% → 76% | GPU 实际计算利用率:行业平均 vs 优化到位后的水平(腾讯云,2026-07) | 我们的空间所在 |
| 60% / 1.2 倍 | 国产卡单卡性能占 H100 比例 / 集群层面实测反超倍数 | 说明国产化可行且靠工程 |
| 2.5 元/百万 | 三大运营商 Token 零售锚点 | 定价的地板参照 |
| 3 年 vs 20 年 | 同业 AI 设备折旧年限的极差 | 识别虚低报价 |
本附录把全篇引用的数字集中列出,并明确区分四类置信度。会谈中引用任何数字前,请先看它属于哪一类。
另有一类是我方估算(如 §2.5 的峰均比模型、§2.4 的敏感度算例、§1.8 的卡数换算),已在正文中逐处标明。这类数字用于说明量级与结构,不应作为精确预测使用。
| 数字 | 含义 | 出处 | 置信度 |
|---|---|---|---|
| 谈判对象 | |||
| 2024-10-09 | 交大工研院启动(与人工智能学院一体化运行) | 工研院官网、交大新闻网 | 官方 |
| 2026-08-18 | 赵军出任工研院院长(距今八天) | 工研院官网 | 待核 |
| 2009-12 | 交大先进产业技术研究院(产研院)成立——不是本次对口主体 | aitri.sjtu.edu.cn | 官方 |
| 成本与算术 | |||
| 15.5% | 模型厂商自披露:推理成本占按挂牌价折算的理论收入比重(即「理论利润率 545%」) | DeepSeek 官方,2025-03-01 | 官方 |
| 1,814 张 / 87,072 美元 | 该披露中的 24 小时平均占用卡数与日成本(逐项核对一致) | 同上 | 官方 |
| 6,080 亿 / 1,680 亿 | 该 24 小时的输入 / 输出 token 量(输入中 56.3% 命中缓存) | 同上 | 官方 |
| 1,072 / 4,951 token/s | 由上述数据反推的全集群平均单卡输出 / 输入输出合计吞吐 | 我方计算 | 估算 |
| 约 3.7 元/百万 | 成本全摊到输出 token 时的单位成本(对照当期挂牌价 16 元/百万) | 我方计算 | 估算 |
| 20.4%–38.2% | 既有推理系统的 KV 显存有效利用率(即 60–80% 被浪费),改进后浪费降至 4% 以下,吞吐提升 2–4 倍 | vLLM / PagedAttention 论文 | 论文 |
| 0.20 美元/百万 | 96 张 H100 上的公开复现输出 token 成本,约为同期官方 API 的五分之一 | LMSYS 公开复现 | 社区 |
| 约 8.5 倍 | Token 即服务相对裸机小时租赁的价值倍数 | 硬件厂商口径 | 待核 |
| 赛道与毛利率 | |||
| −271.6% → −119% | 某 MaaS 服务商公有云业务两期毛利率(仍为负) | 招股说明书(前期检索记录) | 待核 |
| 82.5%–92.4% | 同一家公司的私有化部署毛利率 | 同上 | 待核 |
| 86.9% / 约 20 元 | 算力占销售成本比例(算力全部外租)/ serverless 用户 ARPU(Average Revenue Per User,单用户平均收入) | 同上 | 待核 |
| 16.8% vs 47.7% | 某智算服务商:集群产品交付 vs 运营服务毛利率;应收账款周转约 64 天 | 招股说明书(前期检索记录) | 待核 |
| 50%+ vs 20–30% | 研报口径:自建推理基础设施 vs 裸机架租赁毛利率 | 国金证券「Token 专业运营服务商」模型 | 待核 |
| 1,944 万亿 tokens | 2025 年中国企业级 MaaS 调用量(2024 年 114 万亿,约 16 倍) | IDC,2026-05-07 | 机构 |
| 30.7 → 186 亿元 | 中国公有云 MaaS 营收:2025 年实际 → 2026 年预测 | 同上 | 机构 |
| 9.6 万亿/日 | 2025 年 12 月中国日均 token 消耗(2025 年 1 月为 1.6 万亿) | 同上 | 机构 |
| 近 50% / 40%+ | 火山引擎份额:按调用量 / 按营收 | 同上 | 机构 |
| 100 万元 | 模速空间入驻企业「免申即享」等价算力大礼包(无问芯穹为建设与运营方) | 澎湃、上海市政府网站,2025-02-21 | 媒体 |
| 政策与补贴 | |||
| 50% / 500 万元 | 市级模型券(Token 券)补贴比例与单项上限;专项总额 3 亿元 | 沪经信智〔2025〕489 号,2025-07-28 | 官方 |
| 30% / 100% / 10% | 市级算力券:租金补贴比例 / 市区协同补早补小最高(限 1 年)/ 自建设施支持;专项总额 6 亿元 | 同上 | 官方 |
| 30% / 2,000 万元 | 徐汇区算力支持比例 / 单主体年度上限(2024 版为 1,000 万元) | 《徐汇区推动人工智能产业高质量发展的若干意见》,2025-05-31 起试行两年 | 官方 |
| 2,000 万元 | 徐汇区平台类支持上限(经分类认定) | 同上 | 官方 |
| 1:1 | 徐汇区对通过市级以上专项资金支持项目的配套比例 | 《徐汇区支持西岸人工智能大模型科创街区的扶持意见》 | 官方 |
| 4 批次 | 2026 年度补贴申报批次,每季度首月受理 | 沪经信智〔2026〕248 号,2026-04-30 | 官方 |
| 200 EFLOPS / >70% | 2027 年上海智算规模目标 / 其中自主可控算力占比要求 | 《上海市关于促进智算云产业创新发展的实施意见(2025—2027 年)》,2025-03-26 | 官方 |
| 2,000 亿元 | 2027 年上海智算云产业规模目标 | 同上 | 官方 |
| 120 EFLOPS / 约 8% | 2025 年底上海智算规模 / 占全国比重 | 媒体报道,2026-01-31 | 媒体 |
| 100 万 × 3 | 张江 AI 创新小镇算力 / 模型 / 语料券,最高 100% 支持,限 1 年 | 张江 AI 创新小镇申报通知,2026 Q1/Q2 | 官方 |
| 2028 年底 / 10 类行业 | 工信部普惠算力体系建成目标,文件明确含 Token 计费 | 工信厅通信〔2026〕14 号,2026-04-02 | 官方 |
| 采购与合规 | |||
| 360 万元 | 某科研机构算力云服务租赁预算,按台月计费、明确不采用 token 计费 | 中国政府采购网,2025-09-30 | 官方 |
| 0 | 检索到的按 Token 计费的算力服务公开中标案例数量 | 中国政府采购网检索 | 检索结论 |
本轮补充说明(2026-08-26,第二次更新):港交所招股书原文已完成核对——硅基流动(申請版本 2026-06-30)与基流科技(申請版本 2026-04-29)的分业务毛利率、成本结构、客户集中度、折旧年限均已定位到具体页码,见 §4.1 与 §4.4。无问芯穹经港/沪/深三所项目库逐条检索确认无递表记录,此前流传的说法不成立(§3.5)。券商研报库已完成 40 份精读,国金证券《Token 计费重塑 AI 产业链》(2026-07-17)中「Token 工厂四级演进模型」与「FireworksAI 毛利率 50%+ / GPU 机架租赁 20%–30%」两处已回原文逐字核实(注意:原文为「四级」非「四阶段」,50%+ 特指 FireworksAI,20%–30% 限定为「GPU 机架租赁」)。仍未取得的是中信、中金、华泰等机构的相关深度报告——所用研报镜像源不覆盖这些机构。关于头部券商的补充说明(第三次更新):已对中信、中金、华泰、招商、天风、广发、光大、国泰海通、申万宏源、兴业、长江、浙商、华创十三家逐一检索。本轮取得转述级内容的 2026 年报告:中信《Token 工厂及 Token 运营商推动产业链价值重估》(2026-05-20,经核实为晨会级短篇观点,不含分层框架与毛利率测算——此前被他人当作框架报告出处属误引);中金《Token 启示录(一)》(2026-05-10);华泰《场景 Token 重塑 AI 应用商业模式》(2026-04-21)、《一美元能买多少「Token 智能」》(2026-08-05)、中期策略(2026-07-22)、固收《智能经济》(2026-07-31);国泰海通算力租赁深度电话会(2026-07-08);浙商《算力租赁供需两旺下迎来估值重估》(2026-07-15);招商《为何「Token 运营」未来会大势所趋》(2026-05-17)。华创证券在 2025-01 至 2026-08 期间就该主题至少发布十余篇(宏观张瑜、计算机吴鸣远、电子王文龙等多团队覆盖),标题包括《Token 推理大爆发,国产算力再迎海量需求》(2026-03-03)、《AI+应用:MaaS 钟摆下的历史性机会》(2026-03-09)、《宏观视角看算力:政策、格局、投资》(2026-03-23)、《智算重构数据中心形态,推理需求开启全球 AIDC 新周期》(2026-03-31),但全文与关键数字同样无法从公开渠道取得;可确认的一条转述是其数据中心盈利模型显示项目 IRR 可达 12% 以上(区间 6%–8% 至 12%)二手转述。长江证券《AI 沉思录(二):Token 工厂:从「堆资源」到「榨资源」的产业趋势》电话会于 2026-08-25 召开,距今不足 48 小时,尚无任何二次传播,正文无法取得——这是当前最值得补的一份。四个聚合站(慧博、水滴研报、未来智库、发现报告)均因登录墙或 JS 渲染无法抓取全文。确认存在但未取得全文的两条高价值线索:① 中金公司《AI 进化论》第 22 期「无惧存储通胀,下游盈利健康,多元降本」(2026-08-11)——标题即结论,是唯一直接回应「存储涨价是否传导到下游」的持牌机构报告;② 华创证券《算力芯片行业深度研究报告:算力革命叠浪起,国产 GPU 奋楫笃行》(芯片专题五,发布日期未确定)——唯一标题吻合「国产算力芯片全景对比」的深度报告。若后续能通过 Wind/Choice/慧博 VIP 取得这两份原文,是性价比最高的补充动作。另有三项确认缺失:十家样本公司中无一家披露 GPU 实际计算利用率(个别披露的是「上架率/出租率」,属商业口径,无法反映算力是否真在产出);无一家披露算力租赁单价的时间序列,故价格战曲线无法从财报构建;港股已上市三家(智谱/MiniMax/云知声)的招股书原文本轮未取得(港交所标题检索接口在本环境持续返回空结果)。另有两份高相关报告仅见于他人参考文献、未取得原文:中信证券《Token 工厂及 Token 运营商推动产业链价值重估》、长江证券《AI 沉思录(二):Token 工厂》。
招股说明书与券商研报类来源(§4.1、§4.4 部分数字)来自本项目前期检索记录,本轮未能重新定位到原文页码,故未列入上表。见 §4.5 的复核清单。
以下是本轮未能解决的问题,按对谈判的重要性排序。前四项建议在首次接触时直接问对方,后面几项需要额外检索。
| # | 缺口 | 为什么重要 | 怎么补 |
|---|---|---|---|
| 1 | 一亿元 token 支出的构成:哪些企业、哪些模型、API 采购与算力租赁与平台人力各占多少、境内外模型比例 | 决定我们能优化的绝对额与相对降幅,也决定报价结构。没有这个,任何报价都是猜测 | §2.6 六问表,首次会谈现场填 |
| 2 | 工研院的法人性质:事业单位还是公司化平台 | 决定合同主体、发票类型、资金来源与适用采购流程;也决定政策补贴的申报主体资格 | 当面问,或查工商与事业单位登记 |
| 3 | 是否已有算力 / MaaS 供应商及合同状态(工研院层面未找到任何公开信息;校级「交我算」体系与工研院是否打通亦不明) | 决定我们是替换、并存还是增量,直接影响进场策略 | 当面问 |
| 4 | 规模数字全空:孵化企业总数、在孵团队数、园区面积、基金规模(仅知与云启资本、中金资本合设天使及成长基金) | 决定聚合红利的实际量级(§2.5 曲线取哪一点) | 当面问 |
| 5 | 模型券由企业自行申报与由服务商代客统筹申报的材料差异;「非关联方」的界定标准 | 直接决定补贴能否申领,以及我们与园区之间适不适合股权或合资形态 | 建议与对方共同向徐汇区新工办确认 |
| 6 | 港股已上市 / 已递表公司的完整名单与分业务毛利率——本轮检索额度耗尽未完成 | 第 4 章论据的一手支撑;也是判断赛道资本化程度的基础 | 需重新检索并回招股书原文 |
| 7 | 招股书数字的原文定位(§4.5 清单全部条目) | 对外引用前的必要步骤 | 需重新检索 |
| 8 | 徐汇 AI 小镇「生态运营公司」的具体主体(政策文件只留了联系人) | 决定统筹申报走哪条通道 | 需检索或当面问 |
| 9 | 「西岸智慧谷」未在任何权威源检索到,疑为口语称法或已更名 | 避免在会谈中用错名称 | 当面确认 |
按主题分组,供快速查阅。正文中每个术语首次出现时已就地标注英文,此表用于集中复习与会前速记。
| 中文 | 英文 | 缩写 | 说明 |
|---|---|---|---|
| 首字延迟 | Time To First Token | TTFT | 从请求发出到吐出第一个字的时间,决定交互体验 |
| 单 token 延迟 | Time Per Output Token | TPOT | 生成每个后续 token 的间隔,决定「打字速度」 |
| 吞吐 | Throughput | TPS | 单位时间产出的 token 数,决定单位成本 |
| 模型算力利用率 | Model FLOPs Utilization | MFU | 实际算力产出 ÷ 理论峰值算力。行业平均 40%–50%,做得好可超 75% |
| 集群利用率 | Cluster Utilization | — | 卡在被占用时间里真正在算的比例。不要与供应商常报的「上架率/出租率」混淆——后者只说明卡租出去了 |
| 服务等级协议 | Service Level Agreement | SLA | 对可用性、延迟、错误率的书面承诺 |
| 中文 | 英文 | 缩写 | 说明 |
|---|---|---|---|
| 预填充 | Prefill | — | 一次性处理整段输入,算力受限阶段 |
| 解码 | Decode | — | 逐个生成输出 token,带宽受限阶段 |
| 预填充与解码分离 | Prefill-Decode Disaggregation | PD 分离 | 把两阶段拆到不同节点各自扩缩,消除互相干扰 |
| KV 缓存 | Key-Value Cache | KV Cache | 缓存已算过的注意力中间结果,避免重复计算;直接占显存 |
| 分页式 KV 缓存 | Paged KV Cache / PagedAttention | — | 按页分配显存消除碎片,是提高并发批量的关键 |
| 前缀复用 | Prefix Caching | — | 相同前缀只算一次。缓存命中率高时可显著拉低混合单价 |
| 连续批处理 | Continuous Batching | — | 请求随到随入批、算完即出批,提高在线批量 |
| 分块预填充 | Chunked Prefill | — | 把长输入切块,避免长请求阻塞短请求 |
| 算子 | Operator / Kernel | — | 硬件上的最小计算单元实现。覆盖不全会导致回退,是国产卡吞吐损失的首因 |
| 算子融合 | Kernel Fusion | — | 把多个算子合成一个,减少显存往返与启动开销 |
| 超大融合核 | Megakernel | — | 把整个解码步骤融合成一个持久化核,小批量低延迟场景收益最大 |
| 图模式 | Graph Mode / CUDA Graph | — | 把计算图静态捕获后整体下发,消除主机侧调度开销 |
| 量化 | Quantization | — | 用更低精度存权重与激活。必须配长上下文回归评测,否则易隐性掉点 |
| 推理引擎 | Inference Engine | — | vLLM、SGLang、TensorRT-LLM、MindIE 等承载模型执行的软件层 |
| 中文 | 英文 | 缩写 | 说明 |
|---|---|---|---|
| 数据并行 | Data Parallelism | DP | 每卡一份完整模型,切分数据 |
| 张量并行 | Tensor Parallelism | TP | 把单层权重横向切到多卡,通信最密集 |
| 流水并行 | Pipeline Parallelism | PP | 按层切分到不同卡,存在流水气泡 |
| 序列并行 | Sequence Parallelism | SP | 沿序列维度切分,缓解长上下文显存压力 |
| 专家并行 | Expert Parallelism | EP | 把 MoE 的专家分散到多卡,单卡只驻留少量专家 |
| 混合专家 | Mixture-of-Experts | MoE | 每个 token 只激活部分专家,激活参数远小于总参数 |
| 异构混训 | Heterogeneous Hybrid Training | — | 不同厂商芯片混合组成同一训练集群 |
| 中文 | 英文 | 缩写 | 说明 |
|---|---|---|---|
| 超节点 | SuperPod | — | 把大量卡放进一个高带宽互联域,是大 EP 与 PD 分离的硬件前提 |
| 高带宽内存 | High Bandwidth Memory | HBM | 堆叠式显存,决定解码阶段的速度上限 |
| 卡时 | GPU-hour | — | 一张卡运行一小时,算力采购的基本计价单位 |
| 总体拥有成本 | Total Cost of Ownership | TCO | 含卡价、电费、机架、运维与人力的全周期成本 |
| 能效比 | Performance per Watt | — | 单位功耗的 token 产出,国产超节点的主要短板 |
| 中文 | 英文 | 缩写 | 说明 |
|---|---|---|---|
| 模型即服务 | Model-as-a-Service | MaaS | 按 token 调用量计费的模型 API 服务 |
| Token 即服务 | Token-as-a-Service | TaaS | 以 token 产出而非卡时为计价单位的算力经营形态 |
| 词元 | Token | — | 国家数据局 2026-03 正式定名,定位为「结算单位」 |
| 单用户平均收入 | Average Revenue Per User | ARPU | 总收入 ÷ 付费用户数 |
| 年度经常性收入 | Annual Recurring Revenue | ARR | 按当前订阅规模年化的收入 |
| 内部收益率 | Internal Rate of Return | IRR | 项目投资回报率,智算中心项目常用指标 |
| 市销率 | Price-to-Sales | PS | 市值 ÷ 收入,未盈利公司常用估值倍数 |
| 聆讯后资料集 | Post Hearing Information Pack | PHIP | 港股过聆讯后公布的文件;只有申请版本说明尚未过聆讯 |