INFERENCE & TOKEN PLATFORM · CONFIDENTIAL

上海交大工研院:园区级推理与 Token 平台怎么谈

一亿元 token 预算的成本拆解 · Token 工厂赛道为什么普遍亏钱 · 上海已经把补贴通道铺好了 · 没有人做过的采购品类 · 我们的优势在哪一层、怎么被验证 · 第一次会谈说什么、不说什么。

谈判对象:上海交大工业技术创新研究院(交大工研院) 报告日期:2026-08-26 核心前提:对方口径每年 token 支出约 1 亿元
内部参考 · 含谈判策略与话术 · 请勿外传

CHAPTER 00 · EXECUTIVE SUMMARY摘要:九条结论与一句话打法

一句话打法

不要去比谁的 token 更便宜——那是一个挤满了可以亏钱卖的对手的场子。要把这一亿元从「费用」重新定义成「园区自己的一项能力」:同样的预算,园区多出一个自主可控的推理底座、一份可写进招商手册的权益、一套企业活跃度数据,还能省下一部分钱。第一步只要求一次同题同压的对比测试,失败条件写在前面,园区零费用。

九条结论

#结论依据与出处
1 对口主体的名称需要先纠正。公开信息中不存在「上海交通大学工业技术研究院」。要谈的是上海交大工业技术创新研究院(通称交大工研院,i3sjtu.cn),2024-10-09 启动,由交大举办、与徐汇区联合共建,与人工智能学院一体化运行。老牌成果转化口是产研院(2009-12),不是本次对象。 工研院官网、交大新闻网、上海市政府网站
2 存在一个正在打开的时间窗口。赵军于 2026-08-18 出任院长,距今仅八天;实际签约人是执行院长刘晓娜;理事长为王延峰。新任负责人的第一批动作通常需要「看得见的建成物」,这与我们的方案形态高度吻合。 工研院官网(单一来源,接触前建议再核实)
3 这一亿元的议价能力被严重低估。它约相当于 2025 年中国公有云 MaaS 市场总营收 30.7 亿元的 3.3%。即便考虑口径差异打对折,该机构仍属国内头部级的单一 token 采购方。这个数字本身就是谈判杠杆,建议第一次会谈就说出来。 IDC,2026-05-07;我方估算
4 这一亿元里真正落到算力上的可能只有一到两成。按模型厂商自己公开披露的推理成本反推,成本仅占其挂牌价理论收入的 15.5%。剩下的是模型溢价、渠道与补贴回收——这是结构上可以被重新谈判的部分。 DeepSeek 官方披露(2025-03-01),逐项核对一致
5 我们唯一的主张是动分母。单位 Token 成本 = 卡时成本 ÷ 吞吐 ÷ 利用率。分子是采购能力,人人可比且我们不占优;分母两项各有 2–3 倍空间,合起来是倍数级,且是纯工程能力。 §2.1 恒等式与 §2.4 敏感度表
6 赛道确实很卷,但卷在我们不去的两层。同一家公司内部,公有云 MaaS 毛利率为负(−271.6% → −119%),而私有化部署为 82.5%–92.4%;另一家公司集群交付 16.8% 对运营服务 47.7%。结论:便宜不能靠补贴,只能靠工程——这恰好是我们的论据而非障碍。 招股说明书与券商研报(本项目前期检索记录,需按 §4.5 复核)
7 园区聚合的峰谷互补是唯一不可复制的优势。三十家企业负载叠加后,按峰值备容的平均利用率上限从不到 38.5% 抬升到 77.4%。这个红利只有园区能创造,任何单点供应商都给不了,但需要有人做统一调度来兑现。 §2.5 统计模型(独立同分布、2σ 备容)
8 上海的政策已经把这条路铺好了。2026 年度文件把「模型券」正式表述为「模型券(Token 券)」,并明确允许模型服务商代客统筹申报、AI 小镇单位通过生态运营公司统筹申报。额度可叠加:市级模型券最高 50%/500 万元、算力券最高 30%(补早补小可至 100%)、徐汇区算力年度最高 2,000 万元、平台类最高 2,000 万元、对市级项目最高 1:1 配套。前置条件是接入「市级智能算力资源统筹调度服务平台」。 沪经信智〔2025〕489 号、〔2026〕248 号;徐汇区若干意见;智算云实施意见
9 存在一个品类空白,且国产化是硬门槛。检索未找到任何一个按 Token 计费的高校或园区公开中标案例——现有全是「卡 / 台 / 月」。客户正在花一亿元买一个没有采购模板的东西。同时,上海要求 2027 年自主可控算力占比超 70%,交大又自称拥有「全国高校最大的国产智算基础设施」,国产加速器适配能力在这张桌子上是入场资格,不是加分项——而这恰好是我们最大的结构性优势。 中国政府采购网检索;上海智算云实施意见;工信厅通信〔2026〕14 号

怎么用这份材料

会谈前必读

第 1 章(主体、人、时机)、第 2 章的算术、第 7 章的政策。这三章决定了你能不能在开场十分钟内建立可信度。

会谈中要用的

§2.6 的六问表、图 2-1 的成本构成、第 11 章的议程与开场话术。其余内容只在被追问时展开。

会谈前要背的

第 9 章的九个必答题,尤其 §9.2(赛道很卷怎么答)与 §9.3(模速空间已经有算力超市了怎么答)——这两条大概率会被问到。

对外引用前要复核的

§4.5 的清单。本轮网页检索额度耗尽,招股书类数据来自本项目前期记录,方向可靠但需回原文定位。

CHAPTER 01 · THE COUNTERPARTY谈判对象:先把主体、人和时机搞对

这一章有三个必须先纠正或确认的事实:对口主体的正式名称、真正拍板的人、以及一个正在打开的时间窗口。这三件事错一个,前面所有准备都可能递到不对的桌子上。

1.1 主体辨析:要谈的是「工研院」,但全称与常见叫法不一致

检索结果显示,交大体系内有两个容易混淆的机构,而公开信息中不存在名为「上海交通大学工业技术研究院」的独立机构

机构成立时间职能是否本次对口
上海交通大学先进产业技术研究院
简称「产研院」,AITRI,aitri.sjtu.edu.cn
2009 年 12 月 校企联合研发平台、知识产权、科技合作管理与成果转化服务;2020 年 3 月与科学技术发展研究院合署 否。这是老牌成果转化口,不是 AI 孵化主体
上海交大工业技术创新研究院
通称「交大工研院」,i3sjtu.cn;启动时对外名为「上海交大工业创新研究院」
2024 年 10 月 9 日启动 官网自我定性为「由上海交通大学举办,并与上海市徐汇区政府联合共建的人工智能孵化器和加速器」,与交大人工智能学院一体化运行;办公地徐汇区番禺路 868 号 是。这是本次谈判的对口主体
首访必须当面确认的一件事

工研院的法人性质未找到公开登记信息——是校属事业单位,还是公司化运营平台?它采用理事会治理(第一届理事会第三次会议于 2026-01-07 召开),对外签约由执行院长落章,实操上更像公司化平台。这一点直接决定合同主体、发票类型、资金来源路径与适用的采购流程,是所有商务设计的前提。

1.2 与人工智能学院、徐汇区的三方关系

1.3 关键人物与一个正在打开的时间窗口

姓名职务对我们的意义
赵军工研院院长(官网「院长任命宣布会议」,2026-08-18)上任仅一周余。新任负责人需要早期成果,对能形成建成物与可汇报指标的项目接受度最高
刘晓娜工研院执行院长,公开场合的对外签约人实际拍板与落章的人。商务方案要按她的口径设计
王延峰工研院理事长;交大人工智能学院执行院长治理层与学院侧的连接点,决定战略级议题
王佳梁启动时执行院长(触宝科技创始人)创业者背景,说明该机构对产业化语言不排斥
鄂维南人工智能学院首席顾问(中科院院士)学术侧背书,与 AI for Science 方向相关
时机判断

院长于 2026-08-18 到任,距今仅八天。新任负责人的第一批动作往往需要「看得见的建成物」,而不是又一笔看不见的费用支出——这与第 5 章要讲的四项价值高度吻合。这个窗口通常只有几个月,建议尽快接触。(该任命目前仅见官网单一来源,接触前建议再核实一次。)

1.4 官方自述的三个方向与一份已经许下的承诺

工研院对外口径的三大方向是具身智能、人工智能出海、AI for Science / Engineering;三大服务是 AI 出海加速器、AI 社区、AI 赋能中台

其中「AI 赋能中台」在官网列出的要素清单里,明确包含一项:

官网「AI 赋能中台」服务要素(节选)

种子资金 · 专业开发环境 · 高性能算力 · 工程师资源 · 真实产业需求对接 · 概念验证试点 · 首购订单机会 · 技术顾问与产业导师匹配

这是整场谈话最好的切入点

「高性能算力」已经被工研院写进了自己对外承诺的服务清单。这意味着我们不是去推销一个新东西,而是去帮他们把已经许下的承诺兑现得更好、更便宜、更可汇报。这个框架让对话从一开始就站在同一侧。
另外,「首购订单机会」说明工研院自身有采购动作和预算,不只是撮合方——这与「每年一亿元 token 支出」的前提相互印证。

1.5 入驻企业:谁才是真正的 Token 大户

一亿元几乎不可能是单一合同,它更可能是数十家入驻企业加校内科研账号的合计支出。这个判断很重要——它意味着我们要卖的是归集与治理(统一入口、统一结算、统一额度管控、统一合规审计),而不是「换一家供应商」。

企业赛道融资进展(公开)推理消耗形态
记忆张量 Memory Tensor大模型记忆操作系统 MemOS2025-06 近亿元天使;2026-07 亿元 Pre-A(华为哈勃、荣耀战投、商汤国香、深创投等)极高·记忆层=长上下文+高频读写
元枢智汇Data-centric AI 基础设施 / 语料上海算法创新研究院支持极高·语料合成清洗=巨量离线批推理
Sreal AI世界模型 / 视频生成未披露极高·多模态生成,单次推理成本极高
迅答 AIAI + 金融(可信决策)2026-05-23 签约入驻极高·金融研究 Agent,长文本多轮
和木智源 OfferWingAI 求职招聘未披露极高·to C 对话类,高频
观壹智能AI 医疗诊断未披露高·多模态且合规敏感(数据不出域的典型场景)
深势科技AI for Science(分子模拟)独角兽级高·科学计算与大模型混合
无界动力具身智能「通用操作大脑」2025-11 天使 3 亿元;2026-04 累计超 2 亿美元偏训练,推理侧增长快
穹彻智能具身智能(卢策吾团队)2025-10 获阿里投资偏训练
源络科技具身智能机器人数亿元(阿里战投、峰瑞、北京市 AI 基金)偏训练
深度原理AGI入选「中国最具价值 AGI 创新机构 TOP 50」中高
Deep Optica / 百舸新能AI 矿业 / 绿色船舶动力百舸新能 2025-10 数千万元天使低(百舸非 AI 主业)

名单据公开报道整理,不排除遗漏与变动。结构性判断:真正的 token 大户集中在记忆层、语料合成、视频生成、金融长文本、to C 对话这五类;具身智能三家主要是训练卡需求。这决定了我们进场的第一批目标企业应该从前五类里选,而不是从名气最大的选。

1.6 校内已有算力,但缺的正是我们要做的那一层

工研院层面未找到自建算力,但交大校级有成体系的平台:

切口在哪里:不要打价格,打形态

校内平台能「跑起模型」,但它不是为对外商业服务设计的——没有生产级 SLA、没有高并发在线推理的调度能力、没有按企业分账的计量计费、没有面向企业客户的合规审计与工单支持。所以正确的表述不是「我们比致远一号便宜」,而是「校内平台解决的是科研用算力,企业的生产流量需要另一套东西,而这套东西现在是空的」。这个表述既不冒犯校内平台,又准确指出了缺口。

1.7 把一亿元放到市场里看:这是头部级的单一采购方

IDC 于 2026-05-07 发布的数据给了一个有用的分母:2025 年中国公有云 MaaS 市场营收为 30.7 亿元人民币(2026 年预测 186 亿元)。同期中国企业级 MaaS 调用量从 2024 年的 114 万亿 tokens 增至 2025 年的 1,944 万亿 tokens,约 16 倍;日均消耗从 2025 年 1 月的 1.6 万亿增至 2025 年 12 月的 9.6 万亿 tokens/日

≈3.3%
一亿元 ÷ 2025 年中国公有云 MaaS 总营收 30.7 亿元(我方估算)
1,944 万亿
2025 年中国企业级 MaaS 调用量,同比约 16 倍(IDC)
9.6 万亿/日
2025 年 12 月中国日均 token 消耗(IDC)
30.7 → 186 亿
中国公有云 MaaS 营收,2025 实际 → 2026 预测(IDC)

口径提醒:这个 3.3% 是粗略对照而非严格市场份额——工研院的一亿元可能包含私有化部署、海外模型调用与算力租赁,而 IDC 的 30.7 亿元只统计国内公有云 MaaS 营收。但即便打对折,这仍然说明该机构在国内属于头部级的单一 token 采购方,议价能力远超它自己可能意识到的程度这个数字本身就是谈判杠杆,建议在第一次会谈中直接说出来——它会立刻改变对方对这笔预算的心态。

CHAPTER 02 · THE ARITHMETIC一亿元的算术:这笔钱现在买到了什么

这一章只做一件事:把「每年一亿元 token 费用」拆成可以逐项追问的算术。拆完之后,我们的优势不再是一句形容词,而是这张表里的两个格子。

2.1 先立一个恒等式

Token 的价格不是一个市场自然价,它是被三个工程量决定的。任何供应商的报价,往前推一步都是这个式子:

单位 Token 成本 = 卡时成本 ÷(单卡有效吞吐 × 集群利用率) 分子是采购问题,分母是工程问题。买 API 的人只能看到左边的结果,看不到右边的三个分量——而后两项各自都有三到五倍的浮动空间。这就是同样的硬件、同样的模型,不同团队做出来的单位成本能差好几倍的原因。

把这个式子记住,后面所有的讨论都只是在问一句话:这一亿元里,有多少花在分子上,有多少是被分母的低效吃掉的。

2.2 用模型厂商自己公布的数字来定标

要回答上面的问题,需要一个可信的成本参照。行业里最硬的一份公开数据来自 DeepSeek 自己:2025 年 3 月 1 日,他们公开披露了 V3/R1 线上推理系统连续 24 小时的完整运行统计与成本核算[DS]。这是极少数由服务方主动公开、可被逐项复核的成本样本。

披露项数值说明
统计窗口24 小时2025-02-27 12:00 至 2025-02-28 12:00(北京时间)
峰值 / 平均节点占用278 / 226.75 节点每节点 8 张 H800,平均折合 1,814 张卡
假定卡时单价2 美元 / 卡 · 小时官方自设的成本假设
当日总成本87,072 美元1,814 × 24 × 2 = 87,072,与官方数字逐项核对一致
当日输入 token6,080 亿其中 3,420 亿(56.3%)命中磁盘 KV 缓存
当日输出 token1,680 亿
按 R1 定价折算理论日收入562,027 美元官方明确说明实际收入远低于此(V3 更便宜、部分服务免费、夜间折扣)
成本 ÷ 理论收入15.5%即官方口径的「理论成本利润率 545%」

口径提醒:这 15.5% 只含卡时租金,不含研发、带宽、存储与运维人力;卡时单价是官方假设值;理论收入按 R1 满价计算而实际收入更低。所以它不是真实利润率,但它给「纯算力成本占挂牌价的比重」划了一条相当可靠的下界——这正是我们需要的定标。

从披露数据反推的单卡效率

输出侧:1,680 亿 ÷ 1,814 张卡 ÷ 86,400 秒 ≈ 1,072 token/s/卡(全集群平均折算,非单节点峰值)。

输入输出合计:(6,080 + 1,680)亿 ÷ 1,814 ÷ 86,400 ≈ 4,951 token/s/卡

把全部成本摊到输出 token:87,072 ÷ 1,680 亿 × 100 万 ≈ 0.518 美元/百万输出 token,约合 3.7 元。而同期 R1 的输出挂牌价是 16 元/百万——你付的每 16 元里,大约 3.7 元是算力,其余 12 元多是别的东西。

2.3 把一亿元放进这个结构里

下表左列是园区实际支付的混合 token 单价(这个数需要在第一次会谈中问清,见 §2.5),右侧是按上面披露效率反推的真实算力成本。

混合支付单价年 token 量日均底层算力成本算力占比非算力部分
2 元/百万50.0 万亿1,370 亿/天约 3,980 万元39.8%6,020 万元
4 元/百万25.0 万亿685 亿/天约 1,990 万元19.9%8,010 万元
8 元/百万12.5 万亿342 亿/天约 1,000 万元10.0%9,000 万元
16 元/百万6.25 万亿171 亿/天约 500 万元5.0%9,500 万元
50 元/百万2.00 万亿55 亿/天约 160 万元1.6%9,840 万元
120 元/百万0.83 万亿23 亿/天约 67 万元0.7%9,930 万元

「底层算力成本」按 DeepSeek 披露的 0.8 元/百万 token(成本摊到输入+输出全部 token)折算,汇率取 7.1。最后两行对应大量使用海外前沿模型的情形——AI 出海类企业的实际混合单价往往落在这个区间,此时算力成本占比不到 2%,付的几乎全是模型溢价与渠道费。

图 2-1 一亿元支出的成本构成随支付单价的变化
支付单价越高,真正落到算力上的比例越低。灰色部分不等于供应商净利——里面含模型研发摊销、渠道、税费与补贴回收,但它是结构上可以被重新谈判的部分
占一亿元预算的比例 100% 75% 50% 25% 0 2 元 4 元 8 元 16 元 50 元 120 元 39.8% 19.9% 10.0% 5.0% 1.6% 0.7% 混合支付单价(元 / 百万 token) 底层算力成本 非算力部分

2.4 分母上的两个格子

回到 §2.1 的恒等式。卡时成本(分子)是采购能力,谈判空间有限且人人可比;真正拉开差距的是分母的两项,而这两项都是纯工程能力

情形单卡吞吐集群利用率单位成本相对基线
基线:能跑通,但没调过2,000 tok/s30%10.57 元/百万1.00×
只做吞吐优化(算子、批处理、调度)3,000 tok/s30%7.05 元/百万1.50×
只做利用率优化(需求聚合、峰谷互补)2,000 tok/s60%5.28 元/百万2.00×
两项同时做3,000 tok/s60%3.52 元/百万3.00×
深度优化4,000 tok/s75%2.11 元/百万5.00×

算例统一按 20 万元/卡/年的整机租金折算,仅用于展示两个杠杆的相对量级,不代表任何实际报价。吞吐取值区间参照 §2.2 反推的 4,951 token/s(DeepSeek 在 H800 上以大规模专家并行做到的水平)与国产加速器上未经深度优化时的常见落点。

这张表就是整场谈话的落点

它说明一件反直觉的事:「便宜」不是采购能力,是工程能力。一个团队若只会转售别人的 token,它能给的折扣上限就是自己的渠道返点;而一个能同时动吞吐和利用率两个格子的团队,成本下降空间是倍数级的,且这个空间不依赖任何人的补贴,因此可持续、可承诺、可写进合同。

2.5 园区形态自带的一个结构性红利

利用率这一格,园区平台有一个别人拿不到的天然优势:需求聚合带来的峰谷互补

单一创业公司的推理负载极不平稳——白天调试、夜间空转、demo 前突然打满、融资路演期翻十倍。它若自己买卡,必须按峰值备容,平均利用率就注定很低;它若买公有云 API,则要为别人的调度不确定性付溢价。而几十家企业的负载叠加之后,总量曲线会显著变平,这是统计规律而非管理技巧:

图 2-2 负载聚合使峰均比收敛,利用率上限随之抬升
简化模型:各家负载独立同分布(均值 1、标准差 0.8),按 2σ 备容。总量均值随企业数线性增长,标准差只随平方根增长,因此峰均比必然下降。
100% 85% 70% 55% 40% 按峰值备容时的平均利用率上限 38.5% 52.0% 66.4% 77.4% 82.9% 87.3% 1 家 3 家 10 家 30 家 60 家 120 家 纳入统一调度的企业数量 每多接入一家企业,全体的单位成本都下降一点 ——这是园区平台唯一无法被复制的优势
这条曲线要说给工研院听的话

园区把分散的推理需求归拢到一个平台上,不只是为了集中采购拿折扣,而是把每家企业各自浪费的那部分闲置容量互相填平。三十家企业统一调度,利用率上限从不到四成抬到接近八成——按 §2.4 的表,这一项本身就值两倍成本差。这个红利只有园区自己能创造,任何单点供应商都给不了;但它需要一个有能力做统一调度的技术方来兑现。

2.6 第一次会谈必须拿到的六个数字

上面所有推算都建立在假设的混合单价上。在拿到真实口径之前,任何报价都是猜测。因此第一次见面的核心目标不是报价,而是把这六个数字问清楚——能把这六个问题问出来,本身就已经和「来卖 token 的」区分开了

① 一亿元的口径构成

其中多少是模型 API 采购、多少是算力租赁、多少是平台与人力?是园区统一支付,还是各企业自付后申请补贴?

② 模型构成与占比

开源模型(DeepSeek / Qwen / GLM 系)与闭源、境内与海外前沿模型各占多少金额?这直接决定混合单价落在 §2.3 表的哪一行。

③ 输入输出比与缓存命中率

输入输出比决定成本结构(预填充与解码的经济性完全不同);命中率决定还有多少重复计算可以省掉。

④ 峰值并发与峰谷形态

决定要备多少容量,也决定 §2.5 的聚合红利到底有多大。要按企业分别拿,不能只拿总量。

⑤ 长上下文与多模态占比

长上下文的显存与调度代价是短请求的数倍,多模态更甚。这一项占比高,优化空间反而更大。

⑥ 硬约束清单

数据是否允许出域、是否有国产化率要求、结算是否必须走招标与专票、SLA 与合规审计怎么定。这些决定方案形态,也决定谁被排除在外。

建议把这六项做成一页表格现场填写。它同时是一份需求调研表和一份专业度证明:愿意先把口径搞清楚再谈价格的供应商,在这个赛道里是少数。

CHAPTER 03 · THE FIELD赛道现状:确实很卷,但卷的不是我们要做的那一层

这一章先承认现实:Token 工厂已经是一个拥挤的赛道,有大厂、有运营商、有国资平台、有拿到大额融资的创业公司,也有已经递表上市的。但把玩家按「靠什么赚钱」分层之后会发现,绝大多数人挤在两个我们不去的位置上。

3.1 玩家地图:按盈利来源分四层

图 3-1 Token 服务供给的四层结构
从下到上是价值链位置。左侧是各层的主要参与者类型,右侧是该层的盈利来源与结构性问题。竞争最激烈的是第二层和第三层,而第四层的能力缺口最大。
L1 硬件与机房 芯片厂 · IDC · 地方国资算力中心 盈利=资产与折旧 问题=重资本、回收期长 L2 裸算力出租(卡时 / 台月) 智算租赁商 · 运营商 · 区域算力平台 盈利=卡时差价 问题=同质化、价格战、客户低效与它无关 L3 Token 转售 / 聚合 API 聚合平台 · 中间商 · 部分 MaaS 创业公司 盈利=加价或返点 问题=成本是别人的定价,降价直接伤自己 L4 自建推理基础设施 + 运营 自租算力 · 自建推理栈 · 按 token 交付 盈利=工程带来的成本下降 问题=门槛高,能做的团队少 ← 我们在这一层 毛利率最高,公开研报给到 50%+ 但需要同时握住算力与优化两端 这是我们唯一主张的位置 最卷的一层 公有云 MaaS 普遍负毛利(§4.1) 低价来自补贴,不是来自成本 同质化最严重的一层 研报口径毛利率约 20–30% 卖的是资源,不承担效率责任 资本密集,与我们不构成竞争 是我们的上游

这张图要在会谈中传达的判断只有一句:「卷」发生在 L2 和 L3。这两层的共同特征是不对客户的效率负责——L2 把卡租出去就完成交付,L3 把 token 转手就完成交付。而单位成本真正下降的地方在 L4。

3.2 大厂云 MaaS:价格战的主战场,也是补贴的来源

IDC(2026-05-07)的份额数据显示,按调用量计火山引擎接近 50%,按营收计火山引擎 40%+,其后为阿里云、百度智能云、智谱、移动云。市场规模一侧:中国公有云 MaaS 营收 2025 年 30.7 亿元,2026 年预测 186 亿元;调用量 2024 年 114 万亿 tokens → 2025 年 1,944 万亿 tokens(约 16 倍)。

一个值得在会谈中点出的反差

调用量一年增长约 16 倍,而营收从个位数亿元增长到 30.7 亿元。量的增速远高于收入的增速,意味着单价在快速下行——这既是客户的红利,也是供给侧亏损的直接原因(第 4 章)。对采购方的含义是:现在的低价里,有一部分是别人的市场投入,它不构成对未来三年的价格承诺。

3.3 运营商与地方国资:规模最大、口径最粗的一层

这一层的特点是投资额巨大、以政府与国资为主导、对外服务能力参差。已知的公开案例包括:

案例性质与量级置信度
中国电信宁夏 Token 工厂相关集采百亿元量级的集中采购(记录口径约 174 亿元)待核金额与口径需再次核实后方可引用
软通动力「北京壹号词元工厂」企业主导的 token 工厂品牌化尝试媒体
弘信电子 · 燧弘(无锡)Token 工厂上市公司参与的区域 token 工厂媒体

这三条来自本项目前期检索记录,本轮因检索额度耗尽未能重新逐项核实。建议在正式会谈引用前再核一遍原始公告——尤其是那个百亿元级的数字,口径(是 token 工厂本身,还是包含算力、网络与集成的总包)差别很大。作为背景趋势使用没有问题,作为具体论据要谨慎。

对我们的实际意义:这一层是潜在的算力来源,而不是竞争对手。它们普遍缺的正是 L4 的能力——建成了集群,但把集群变成低单位成本的 token 服务,是另一回事。

3.4 最需要正面处理的对标:模速空间的「算力生态超市」

这是同区、同类、最直接可比的先例,会谈中对方很可能主动提起,因此必须提前准备好回答。

公开信息

2025-02-21 发布,对外称国内首个「算力生态超市」,由模速空间 + 无问芯穹 + 上海仪电三方共建,无问芯穹为建设方与运营方。入驻企业「免申即享」由徐汇区、模速空间、无问芯穹三方定制的 100 万元等价算力大礼包。运营方对外口径是「把上海市内、长三角以及中西部的算力统一并网和调度到平台上」。

规模:截至 2025 年 6 月底入驻超 100 家、辐射徐汇大模型企业 580 家;上海累计 82 款生成式 AI 备案中模速空间占 61%;另有 10 家「模速分号」。

怎么答这一条(预计是会谈中最尖锐的问题)

不要否认它的价值,而是指出两者解决的问题不同

① 算力生态超市的核心是把多方算力并网调度并发放额度——它解决的是「让企业拿到卡、拿到额度」。这是资源供给与补贴发放,属于 §3.1 的 L2 层。
② 我们要做的是把 token 的单位成本降下来——同样的卡、同样的模型,通过吞吐与利用率的工程优化拿到倍数级差异(§2.4),属于 L4 层。
③ 两者不冲突,甚至互补:并网来的算力,正需要有人把它的有效吞吐做上去。

然后把问题递回去:「那个平台上,园区企业的实际单卡吞吐和集群利用率是多少?有没有按企业分账的单位 token 成本口径?」——如果对方答不出(大概率答不出,因为 L2 层的服务不承诺这两项),我们的位置就自然清楚了。

另有两条媒体转述信息(商汤专供徐汇 4000P、上海电信「一跳入算」及 500 万元算力优惠 + 免费网络)待核,建议不主动引用。

3.5 已递表与已上市:赛道确实进入资本化阶段

用户提到的判断是对的——这个赛道已经有公司走到递表甚至上市阶段,这本身说明它已经不是早期蓝海。本项目前期检索记录中,最有分析价值的两家是硅基流动(MaaS 服务商)与基流科技(智算服务商),它们的分业务毛利率数据构成了第 4 章的核心论据。

一个重要的说明

本轮针对已上市 / 已递表公司的专项检索因本会话的网页检索额度已用尽(200 次上限)而未能完成,第 4 章引用的招股书数据来自本项目前期已核实的检索记录。这些数字的方向与量级是可靠的,但在正式对外场合引用前,建议按第 4 章末尾列出的清单逐条回到招股书原文复核。这一点在报告里明确写出来,是为了避免把二手记录当成一手引用。

CHAPTER 04 · WHY THEY LOSE MONEY为什么大多数玩家在亏钱——以及这为什么是我们的论据

这一章是全篇论证的另一半支柱。如果这个赛道的低价来自补贴,那么「便宜」就不是采购能力的证明,而是一个即将结束的窗口;反过来,只有来自工程的低成本才能被承诺三年。招股书里的分业务毛利率把这件事说得很清楚。

4.1 同一家公司,两种业务,毛利率差一百多个百分点

最有说服力的证据不是行业平均值,而是同一家公司内部不同业务线的对比——它排除了管理能力、融资能力、团队水平这些干扰项,只剩下商业模式本身的差异。

图 4-1 Token 服务各业务形态的毛利率对比
越靠近「转售公有云 API」,毛利率越差;越靠近「自建推理基础设施与专属交付」,毛利率越好。这不是某家公司的经营问题,是价值链位置的问题。
毛利率 0 −200% −100% +100% −271.6% 公有云 MaaS · 早期披露期 −119.0% 公有云 MaaS · 改善后 16.8% 智算集群产品交付 20–30% 裸机架 / 卡时租赁(研报口径) 47.7% 智算运营服务 50%+ 自建推理基础设施(研报口径) 82.5–92.4% 私有化部署 / 专属交付 卖得越多亏得越多 低价来自市场投入,不是成本 卖资源,不承担效率责任 毛利来自成本下降 数据不出域
披露主体 / 出处业务线毛利率说明
某 MaaS 服务商招股书
硅基流动 SiliconFlow
公有云 MaaS(早期披露期)−271.6%即每收 1 元、成本约 3.7 元
公有云 MaaS(改善后)−119%大幅改善,但仍然是负毛利
私有化部署82.5–92.4%同一家公司,同一套技术,形态一换毛利率反转
成本结构算力占销售成本约 86.9%算力全部外租;serverless 用户 ARPU 约 20 元
某智算服务商招股书
基流科技
集群产品交付16.8%卖硬件与集群,接近工程集成的利润率
运营服务47.7%同一家公司,运营服务是集群交付的近三倍;应收账款周转约 64 天
券商研报口径
国金证券「Token 专业运营服务商」四阶段模型
3.0 阶段=自建推理基础设施50%+对照:裸机架租赁仅 20–30%

数据来源为本项目前期检索记录(招股说明书与券商研报),本轮因会话检索额度耗尽未逐项回原文复核,公司名以业务口径描述为主。方向与量级可靠,正式对外引用前请按 §4.5 的清单复核。

4.2 三条结论,每一条都直接为我们服务

① 现在的低价含补贴,不构成价格承诺

公有云 MaaS 侧的负毛利意味着相当一部分低价是市场投入而非成本优势。补贴是营销预算,随时可调,且通常在客户迁移成本最高时收回。对采购方的含义:不要把今天的单价当成三年的规划基础。

② 算力全部外租 + 占成本近九成,说明分母根本没被优化

如果算力接近 87% 的成本占比、且全部外租,那么这家公司的成本几乎完全等于上游报价——它没有在吞吐与利用率上拿到任何收益。这恰好从反面证明了 §2.1 恒等式里分母的价值。

③ 越靠近自建与专属交付,毛利越好

同一家公司内部,私有化部署的毛利率与公有云 MaaS 差出一百多个百分点;另一家公司内部,运营服务是集群交付的近三倍。这是价值链位置的差异,不是经营水平的差异。我们主张的正是这个位置。

4.3 剪刀差:为什么这个窗口会越来越紧

供给侧还有一个方向性的压力,会让「靠补贴维持低价」越来越难:

图 4-2 Token 售价与算力成本的反向运动
售价快速下行、硬件与内存成本上行,两条线的夹角就是供给侧的亏损。亏损缺口只有两种收敛方式:涨价,或者把单位成本真正做下来。
Token 售价(快速下行) 加速卡与内存成本(上行) 缺口 时间 → 相对水平 这个夹角越大,靠补贴维持低价的压力越大 而工程降本是唯一能同时对冲两端的手段

两端的具体表现:

这张图在会谈中的用法

它把「我们的优势可持续」从一句主张变成一个趋势判断:剪刀差越紧,靠补贴打价格战的玩家越撑不住,而靠工程降本的能力就越值钱。对园区的含义是:现在锁定一个成本可审计的合作方,比继续在补贴市场里比价更安全。

4.4 工程降本不是概念:三组公开可查的量级

如果有人质疑「优化到底能带来多少」,用这三组公开数据回答,它们分别来自论文、开源社区复现和硬件厂商:

来源发现量级
vLLM / PagedAttention 论文论文 测得既有推理系统的 KV 显存有效利用率仅 20.4%–38.2%(即 60–80% 被浪费);改进后浪费降至 4% 以下 吞吐提升 2–4 倍
LMSYS 公开复现社区 在 96 张 H100 上的公开部署实测每百万输出 token 成本 0.20 美元,约为同期官方 API 定价的 五分之一
硬件厂商口径待核 Token 即服务(TaaS)形态相对裸机小时租赁的价值倍数 8.5 倍(引用前建议核实原始表述与口径)
模型厂商自身披露官方 见 §2.2:全集群平均单卡输入输出合计约 4,951 token/s;成本占理论收入 15.5% 成本仅为挂牌价的 约六分之一

前两条与第四条是本报告中置信度最高的证据,建议作为会谈的主力论据;第三条置信度较低,非必要不引用。

4.5 引用前必须复核的清单

为避免在正式场合出错,以下数字在对外引用前需回原始文件确认。这份清单本身也是下一步工作的输入:

CHAPTER 05 · WHOSE KPI卖给平台,而不是卖给用户:工研院真正在买什么

这一章是全篇最容易被忽略、但最决定成败的一章。工研院不是终端用户,它是一个平台机构;它掏这一亿元不是因为自己要用 token,而是因为它要用这一亿元换四样东西。谁的话术对准这四样,谁就赢。

5.1 一个判断:便宜本身说服不了平台

如果我们进门第一句是「我们的 token 更便宜」,那么我们就把自己放进了一个纯比价的场子——那里已经挤满了对手,而且他们中有些人可以亏钱卖(见第 4 章的毛利率证据)。比价场里,我们的工程优势会被压缩成一个折扣百分比,而折扣百分比是谁都能喊的。

平台机构的决策逻辑不是「哪家便宜」,而是「这件事能不能变成我的成绩、我的招商筹码、我的风险可控项」。所以正确的开场是把一亿元的支出重新定义成一次基础设施建设的机会。

一句话版本

「这一亿元现在是费用,花完就没了,只在别人的账上留下收入;它可以变成园区自己的一项能力——同样的钱,园区多出一个自主可控的推理底座、一份招商权益、一套企业活跃度数据,还能省下一部分预算。」

5.2 工研院用这一亿元换的四样东西

① 招商筹码:可写进招商手册的实质权益

「入驻即获得低成本推理算力配额」是极少数能立刻打动早期 AI 团队的硬权益——对一个种子期团队,推理账单往往是它前两年最大的现金支出之一。这比减免几个月房租有力得多,而且是可持续、可分级发放的(按阶段给配额)。话术落点:这不是采购,这是招商工具。

② 可对上汇报的成果:园区级自主可控 AI 底座

把分散的 API 采购变成一个建成物:园区级推理平台、国产加速器占比、服务企业数、累计 token 服务量、单位成本下降幅度。费用支出无法进考核,基础设施与降本幅度可以。话术落点:我们帮你把一笔看不见的支出,变成一个看得见、说得清、可以年年报的东西。

③ 一手数据:园区 AI 活跃度看板

token 消耗曲线是企业真实业务活跃度最灵敏的指标——比工商数据、比融资新闻、比企业自报都灵敏。哪家在放量、哪家停了、哪家在做多模态、哪家在跑 Agent,平台一目了然。这对招商筛选、投资决策、政策资源分配都是直接输入。话术落点:平台不掌握这个数据,就等于把自己企业的体征交给了外部供应商。

④ 预算效率:同样的钱办更多事

按第 2 章的算术,工程杠杆带来的成本改善是倍数级而非百分比级。落到园区账面上有两种花法:同样一亿元支撑更大的 token 规模(服务更多企业),或压缩支出把预算腾给别的科目。两种都是可量化的政绩。话术落点:把节省额做成分成结构,园区零风险。

这四项里,只有第四项是价格问题,其余三项都是价格之外的。这意味着我们完全可以不在最低价的位置上赢下这个单子——只要另外三项是别人给不了的。而它们恰好都需要一个愿意长期驻场、做深度定制、并把平台侧数据与控制权交还给园区的技术方,这正是转售型对手的结构性短板。

5.3 顺带解决平台方最头疼的三件杂事

这一节看起来琐碎,但在高校系与国资背景的机构里,它常常是真正的决策瓶颈。能主动把这三件事提出来并给出方案,会显著提高可信度。

平台方的现实约束为什么现在很痛统一平台怎么解
结算与票据 几十家企业各自向不同境内外供应商付费,币种、票据、主体五花八门;涉及财政资金或科研经费时,预算科目、专票、招标流程都对不上。境外模型服务尤其难合规入账。 园区侧单一签约主体、单一结算入口、统一开票与对账;企业侧按量记账、按配额领用。把 N 份合规问题压缩成 1 份。
采购合规与国产化口径 分散采购难以形成统一的国产化率口径,也难以适配招投标与政府采购目录的要求;单笔金额零散,反而更难走正规流程。 集中采购形成规模,具备走框架协议与公开招标的体量;国产加速器占比成为平台层面可统计、可承诺、可提升的指标。
数据出域与合规审计 企业业务数据、科研数据经由公有云 API 出域,责任边界不清;一旦涉及涉密或敏感数据,事实上无法使用外部 API。 私有化部署 + 数据不出园区 + 完整审计日志;模型与数据分离。让原本不能用大模型的那部分业务也能用起来——这是增量,不只是降本。
注意这里有一个容易被低估的增量论点

降本是把已有的一亿元花得更省;而数据不出域打开的是原本根本无法上云的那部分需求——涉密科研、医疗、金融、政务相关的场景,今天不是嫌 API 贵,是压根不能用。这部分需求一旦被释放,园区的 token 总量会往上走而不是往下走。对工研院而言,这个论点比省钱更有吸引力,因为它对应的是新增的产业活动,而不是削减的支出。

CHAPTER 06 · THE EDGE我们的优势:六项,每一项都能被检验

这一章把「我们为什么有优势」写成可核验的清单。判断标准很简单:每一条都必须能回答「凭什么是你,而不是别人」,并且能在第一段测试里被验证或被推翻。凡是做不到这两点的说法,都不写进来。

6.1 优势的来源:我们动的是分母

回到 §2.1 的恒等式。整个赛道的竞争几乎全部发生在分子上——比谁的采购价低、比谁拿到的补贴多、比谁愿意亏更多。分子上的优势有两个致命特征:人人可比,且不可持续

图 6-1 单位 Token 成本的归因树:优势必须落在灰色以外的地方
灰色分支是采购与资本能力(人人可比,且我们不占优);蓝色分支是工程能力;橙色分支是园区形态特有的结构红利。我们的全部主张都落在后两者上。
单位 Token 成本 元 / 百万 token 卡时成本(分子) 采购议价 · 补贴 · 折旧年限 人人可比,且我们不占优 ——不在这里竞争 单卡有效吞吐 算子与融合 · 图模式 分页显存 · 批处理调度 量化 · PD 分离 · 专家并行 纯工程能力 §6.2 §6.3 §6.4 集群利用率 需求聚合 · 峰谷互补 · 混部 园区形态特有的结构红利 §6.5 只有园区自己能创造 两条可动的分支各有 2–3 倍空间 合起来是倍数级,且相互独立 这是补贴给不出来的量级

6.2 优势一:成本下降来自工程,因此可持续、可承诺、可审计

这是所有优势的根。补贴型低价的问题不在于低,而在于它无法被写进一份需要执行三年的合同——它的提供方随时可以调整,且通常在客户迁移成本最高的时候调整。工程型低成本相反:它一旦做出来就固化在系统里,因此我们敢做三件转售方做不到的事。

我们能做的承诺为什么转售型做不到
单位 token 成本与吞吐、利用率指标写进合同并接受核验它的成本是上游的定价,自己无从承诺,只能承诺折扣率
成本归因开放给园区审计(吞吐多少、利用率多少、卡时多少)开放归因等于暴露加价空间
随成本下降主动调价并写入调价机制降价直接削自己的毛利,只能被动跟进

在会谈中,这一条的表达方式很重要:不要说「我们更便宜」,要说「我们的便宜可以被审计」。后者是前者的三倍说服力,而且是对方从别处听不到的句子。

6.3 优势二:自租算力 + 自建推理栈,不做 token 二道贩子

要动分母,必须同时握住硬件与软件两端:只有算力没有优化能力,就只能卖裸卡时;只有优化能力没有算力,优化收益全部归硬件持有方。我们的模式是自己租算力、自己建推理栈,因此工程收益直接落在自己的成本表上,可以决定让出多少给客户。

这一条同时解释了一个常被问到的问题——为什么我们不用「拿到某家更低的进货价」来竞争。因为那条路上,我们的成本上限永远等于别人的定价下限。

6.4 优势三:推理工程的具体能力清单

这一节是能力的实指,会谈中只在对方追问时展开。每一项都对应吞吐或利用率上的具体收益来源。

引擎适配与算子补齐

主流推理引擎在目标硬件上的落地与算子覆盖:缺失算子的补齐与融合,避免回退到低效实现或落到主机侧执行造成图被打断。算子回退是国产加速器上吞吐损失最常见的单一原因。

显存管理与批处理调度

分页式 KV 缓存消除碎片、前缀复用消除重复计算、连续批处理提高在线批量、分块预填充避免长请求阻塞短请求。批量上不去,解码阶段的带宽就用不满,卡再快也没用。

量化与压缩(含长上下文回归)

权重与激活量化、KV 缓存量化,配套校准与回归评测。关键在于把长上下文准确率纳入验收——压缩手段在短请求上几乎看不出损失,在长上下文上却可能大幅掉点,这是行业里最常见的隐性质量事故。

部署架构:预填充/解码分离与专家并行

两个阶段的资源特性完全不同(一个算力受限、一个带宽受限),分离部署后可各自独立扩缩;MoE 模型上的大规模专家并行与通信优化。这是把单卡吞吐推到高位的主要手段。

编译、图模式与主机侧瓶颈消除

静态化与算子融合、图执行、下沉执行以减少主机与设备之间的往返;绑核与调度优化。小算子密集的模型上,主机侧空转常常吃掉两位数百分比的算力。

指标口径与成本核算

首字延迟、单 token 延迟、吞吐、利用率四项统一口径与持续采集,直接换算成单位 token 成本。没有统一口径,降本就无法证明,也无法定价。

6.5 优势四:国产加速器推理的深度——把瓶颈说清楚,再说怎么补

这是我们与绝大多数对手最实质的分野,也是园区在政策上真正需要有人替它承担判断的地方。国产加速器在推理上的差距,主要不在峰值算力;差距集中在软件栈的成熟度,而软件栈是可以靠工程补的。

层次具体瓶颈直接后果可补的方向
算子层算子覆盖不全、缺少针对性融合算子;部分算子实现未按硬件的存储层级与数据搬运特性调优回退到通用实现或主机侧执行,计算图被打断,融合收益丢失补齐关键算子、按片上缓存容量做分块与双缓冲、把访存与计算重叠起来
显存与调度层KV 缓存分页管理不成熟、碎片化严重;连续批处理与分块预填充能力弱并发批量上不去,解码阶段带宽利用率低;长请求阻塞短请求,首字延迟抖动大引入分页 KV 与前缀复用、重写批处理调度策略、分块预填充
通信层集合通信原语在特定形状与拓扑下效率不足;MoE 的专家间通信开销高多卡与多节点扩展效率随规模衰减,专家并行难以推到高并行度按拓扑选择算法与缓冲区参数、通信与计算重叠、优化专家路由与分发
编译与执行层动态形状支持不完善、图模式覆盖有限、主机侧调度开销大小算子密集的模型上主机侧成为瓶颈,设备大量空转图捕获与静态化、执行下沉、绑核与队列优化
精度与工具层迁移后的数值一致性验证工具链不完善;量化校准与评测生态缺口迁移后精度问题定位困难,团队不敢上生产逐层比对(余弦相似度与最大绝对误差双阈值)、建立回归评测集

团队在国产加速器的芯片架构与算子层有一线工程经验,这是上表中「可补的方向」一列能够落地的前提。在会谈中,这一条的价值不在于展示技术,而在于让对方确认:园区的国产化率要求可以由一个真正懂这一层的人来兜底,而不是变成一次赌注。

给园区的方案表述

不承诺「国产卡全面替代」,而是混合架构 + 逐季度台阶:把当期确实适合的负载放到国产加速器上,其余留在其他硬件,由平台统一调度、对上层企业完全透明——企业只看到一个统一的接口,看不到底下是什么卡。国产化占比因此成为一条可统计、可承诺、可逐季度上调的平台指标。这个表述同时满足了政策要求与风险控制,是园区最容易签下去的形态。

6.6 优势五:园区聚合调度——唯一不可复制的那一项

§2.5 已给出统计依据:几十家企业的负载叠加后峰均比显著收敛,按峰值备容时的平均利用率上限从不到四成抬到接近八成。这里补充两点会谈中要强调的:

6.7 优势六:交付的是平台能力,不只是 token

最后一项优势不在技术侧,而在交付形态。第 5 章列出的四项价值——招商权益、可汇报的建成物、活跃度数据、预算效率——都要求供应商愿意做三件转售方不愿做的事:驻场做深度定制、把平台侧数据与控制权交还园区、不用锁定条款做护城河

我们愿意做,原因不是姿态好,而是这三件事与我们的商业模式并不冲突:护城河在成本曲线上。只要单位成本持续比别人低,就不需要靠合同锁住任何人;反过来,需要靠锁定生存的供应商,恰好证明了它的成本没有优势。

这一章可以用一句话收口

「同一个赛道里,我们和多数人赚钱的方式是相反的:他们的利润来自差价,所以降价伤自己;我们的利润来自成本下降,所以降价只是把已经拿到的工程收益让出一部分。这就是为什么我们敢把成本写进合同、敢开放归因给你审计、也敢不要排他。」

CHAPTER 07 · POLICY LEVERAGE政策杠杆:上海已经把这条路铺好了

这一章是本次调研里最有价值的发现。「园区级 Token 平台 + 统一补贴申领」不是我们的创新,而是上海市政策文件里已经写明的机制——包括一个专门为 token 消费设立的补贴品类,以及一条允许服务商代客户统一申报的通道。会谈中把这一章讲清楚,可信度会有质的变化。

7.1 一个关键事实:「模型券」已在 2026 年正式改名为「模型券(Token 券)」

母政策是《上海市进一步扩大人工智能应用的若干措施》(沪经信智〔2025〕489 号,2025-07-28)。到 2026 年度实施口径时,文件名称发生了一个值得注意的变化——《关于组织 2026 年度上海市「模塑申城」工程相关补贴申报工作的通知》(沪经信智〔2026〕248 号,2026-04-30)中,「模型券」被正式表述为「模型券(Token 券)」

这意味着在政策语言层面,Token 消费已经成为一个独立的、被命名的、有专项资金的补贴品类。这与国家层面的方向一致:工信部《关于开展普惠算力赋能中小企业发展专项行动的通知》(工信厅通信〔2026〕14 号,2026-04-02)明确提出「推行按『卡时』『核时』及 Token 计费等灵活付费模式」,并探索「算力银行」「算力超市」等业务形态。

7.2 三张券与两级配套:可叠加的额度清单

层级 / 品类补贴口径上限出处
市级 · 模型券(Token 券)调用非关联方云平台部署的第三方大模型 API 产生的费用,采用第三方大模型私有化部署方式推进垂类应用核定合同额最高 50%最高 500 万元;专项总额 3 亿元沪经信智〔2025〕489 号
市级 · 算力券租用智能算力市级最高 30% 租金补贴;按「补早补小」原则市区协同可给予最多 1 年、最高 100%;自建自主智算设施最高 10% 建设支持;专项总额 6 亿元沪经信智〔2025〕489 号
市级 · 语料券购买非关联方语料最高 30%,最高 500 万元;总额 1 亿元沪经信智〔2025〕489 号
徐汇区 · 算力支持实际算力投入不超过 30%,单个主体年度最高 2,000 万元(较 2024 版的 1,000 万元翻倍)《徐汇区关于推动人工智能产业高质量发展的若干意见》,2025-05-31 起试行两年
徐汇区 · 平台类支持对产业链上下游企业技术提升有突出支撑带动作用的平台,经分类认定最高 2,000 万元同上
徐汇区 · 市级项目配套对通过市级以上专项资金支持的项目最高按 1:1 比例配套《徐汇区支持西岸人工智能大模型科创街区的扶持意见》

申报节奏:2026 年度全年 4 批次,每季度首月受理,通过 zxzj.sheitc.sh.gov.cn 在线申报,区主管部门初审后一周内报市经信委。关键限制:「申报项目须未获得其他市级财政资金补贴支持」——同一市级资金不可重复申领,所以叠加设计必须区分市级与区级、区分品类,不能简单相加。

7.3 真正的支点:政策明确允许「服务商代客统筹申报」

这是本章最重要的一条。沪经信智〔2026〕248 号在算力券与模型券两处都写了同一个机制:

沪经信智〔2026〕248 号 原文(节选)

算力券:「算力租用单位可选择自主申报,或由算力服务商经『市级智能算力资源统筹调度服务平台』统筹申报。……入驻 AI 小镇的单位,可通过小镇生态运营公司统筹申报。」

模型券(Token 券):「模型使用单位可选择自主申报,或由模型服务商经『市级智能算力资源统筹调度服务平台』统筹申报。入驻 AI 小镇的单位,可通过小镇生态运营公司统筹申报。」

这一条为什么是支点

它意味着两件事同时成立:(一)作为「模型服务商」,我们可以代入驻企业统一申报 Token 券;(二)作为园区,工研院侧的运营主体也可以统筹申报。
换句话说,「园区统一入口 + 集中申报补贴」这个方案形态,是政策文件亲自设计并鼓励的路径,不是我们编出来的商业模式。这句话在会谈中的分量很重——它把我们的方案从「一个供应商的提议」变成「对既有政策通道的正确使用」。

对入驻企业而言,这还解决了一个现实痛点:几十家早期公司各自去研究政策、准备材料、跑四个批次的申报,绝大多数根本不会去做。统一申报把这件事变成园区的一项服务,企业侧零成本受益。

7.4 一个必须满足的前置条件:接入市级统筹调度平台

《上海市关于促进智算云产业创新发展的实施意见(2025—2027 年)》(上海市经信委,2025-03-26)里有一条容易被忽略但直接决定补贴资格的条款:

原文

对调用纳入本地统筹调度的智算云服务创新主体,经评估对服务采购金额给予一定比例的算力补贴。

也就是说,接入「市级智能算力资源统筹调度服务平台」是拿到算力补贴的前置条件。这对我们的方案设计是一条硬要求,也是一个正面卖点:我们主动承诺完成这项对接,园区就同时获得了补贴资格与合规的统筹申报通道。同一份文件的其他目标也与我们的定位一致:

200 EFLOPS
2027 年上海智算规模目标
>70%
其中自主可控算力占比要求
2,000 亿元
2027 年上海智算云产业规模目标
120 EFLOPS
2025 年底上海实际规模,占全国约 8%
国产化在这个客户身上是硬门槛,不是加分项

市级规划要求 2027 年自主可控算力占比超过 70%;交大自己又把「全国高校最大的国产智算基础设施」当作对外宣传口径(§1.6)。两者叠加意味着:在这张桌子上,国产加速器适配能力不是我们的差异化亮点之一,而是入场资格。§6.5 那一节的深度因此不是锦上添花,是必需品。
反过来说,这也是我们最大的结构性优势——能把国产卡推理真正做出可用性能的团队非常少,而这个客户必须找到一个。

另需说明:网传「党政信创 2025 年国产化率 80%」一类说法来自市场分析文章而非政府文件,不建议在会谈中引用。可引用的硬口径就是上面这份 2027 年 70% 的市级规划。

7.5 采购与结算:三条现成的合规通道

Token 按量结算最容易卡住的地方是财务与采购流程,而不是技术。调研发现有三条现成通道可用:

① 框架协议 / 电子卖场

《上海政府采购云平台电子卖场管理办法》2025-05-28 审议通过、2025-07-01 施行,依据「政府采购框架协议采购方式管理」制定,明确目标是「提高多频次、小额度采购效率,降低交易成本」。Token 按量结算恰好就是「多频次小额度」——这是现成的合规载体。

② 公开招标门槛之下的分单

政府采购货物与服务达 400 万元以上应公开招标(中央预算单位及省级口径;部分市县级为 200 万元)。方案可设计为主合同走框架协议、按季度下单,单笔控制在门槛之下,既合规又灵活。

③ 中央高校的自主采购授权

《关于进一步完善中央财政科研项目资金管理等政策的若干意见》明确「中央高校和科研院所可自行采购科研仪器设备,自行选择科研仪器设备评审专家」。这是绕开繁重流程的合法通道,但适用范围需与对方财务确认。

一条实操建议(属推断,需与对方财务当面确认):发票科目建议按「信息技术服务 / 技术服务费」开具,而非「设备租赁」,以避开固定资产口径带来的资产登记与折旧管理麻烦。此外,未找到高校「算力 / token 费用」专用预算科目的公开规定,这一项也需现场确认。

7.6 两个必须现场确认的政策风险

风险问题所在影响
申报主体是否含事业单位 / 高校 沪经信智〔2026〕248 号对申报主体的表述是「在本市依法经营并具有独立承担民事责任能力的单位,经营状态正常,信用记录良好,财务制度健全」——措辞明显偏企业口径,未明确是否覆盖事业单位与高校 若不覆盖,则补贴需以入驻企业为申报主体、由我们作为服务商统筹申报,方案的资金结构要相应调整
「非关联方」如何界定 模型券要求调用的是「非关联方」云平台部署的第三方大模型。若工研院既是采购方又参与统筹申报,甚至与平台运营主体存在股权关系,是否构成关联交易,无公开细则 直接决定补贴能否申领,也影响我们与园区之间是否适合采用合资或股权合作的形态

主管部门与联系口径(供对方核实用):徐汇区新工办人工智能智能科(64872222-1041);徐汇 AI 小镇的「生态运营公司」具体主体未在文件中披露,仅留有联系人。这两个风险点建议由我们主动提出并建议共同向主管部门确认——主动指出对方方案里的政策风险,是建立专业信任最快的方式之一。

CHAPTER 08 · THE CATEGORY GAP品类空白:客户正在花一亿元买一个没有采购模板的东西

这是本次调研中最有战略价值的一个发现。在公开招标市场里,高校和科研机构买的几乎全是「卡 / 台 / 月」,按 Token 计费的公开中标案例一个都没有找到。也就是说,这笔一亿元的支出,在采购口径、合同模板、验收标准上是一片空白。

8.1 检索结果:高校买的是硬件和台月,不是 token

采购人项目金额 / 预算计费方式日期
西安交通大学AI 大模型 GPU 算力集群263.9 万元设备采购(非服务)2025-09-12
中国科学院自动化研究所算力云服务租赁采购预算 360 万元按月计费:CPU 1,800–2,800 元/台/月;GPU 18,000–42,000 元/台/月。明确不采用 token 计费2025-09-30
中国科学院大学高性能 GPU、CPU 算力服务565 万元 待核服务(来自二手来源,官网不可达)2025
清华大学高性能 GPU 算力服务(120 天租期)未披露按租期2024-04
上海交通大学人工智能计算服务器公开招标未披露设备采购投标截止 2025-08-25
北京交通大学算力租赁项目未披露服务2025
华中师范大学人工智能算力平台设备未披露设备采购2024-12
这个空白意味着什么

客户已经在实际花一亿元买 token,但采购口径、合同模板、计量方法、验收标准、发票科目全是空的。这带来一个我们独有的进场姿势:我们不是去竞争一个已有的标的,而是去帮对方把这个品类定义出来。
谁先把「合规的 Token 服务采购包」做出来,谁就定义了这个品类的标准——而定义标准的人,天然是首选供应商。

8.2 国家与地方层面其实已经给 Token 计费开了口子

空白存在于执行层,而不是政策层。上层文件已经把方向写明了:

所以这不是政策不允许,而是没有人把它落成一份可以走流程的采购文件。这中间的空档,就是我们的机会。

8.3 「Token 服务采购包」应该包含什么

这是我们可以带进第一次会谈的具体交付物构想。它的价值不在技术,在于让对方的财务、采购、审计三个口子都能签字

① 计量口径与审计方法

token 如何计数(输入 / 输出 / 缓存命中分别怎么算)、日志留存与可核验方式、争议处理机制。没有可审计的计量,就没有合规的按量付费。

② SLA 与验收标准

可用性、首字延迟与单 token 延迟的承诺值与考核方式、超限与降级规则、违约责任。这是把「服务」变成可验收标的的关键。

③ 合同与流程模板

框架协议 + 按季度下单的结构、单笔金额控制在公开招标门槛之下的设计、发票科目建议(信息技术服务 / 技术服务费而非设备租赁)。

④ 补贴申报材料包

对应第 7 章的三张券,把申报所需的合同、发票、用量证明、成效说明做成标准模板,由我们作为服务商统筹申报。企业侧零成本受益。

⑤ 分账与对账报表

按企业、按模型、按时间维度的用量与费用分账,支撑园区内部的配额管理与成本归集,也是活跃度看板的数据底座(§5.2 第③项)。

⑥ 合规与数据边界文件

数据不出域的技术方案说明、审计日志范围、运维访问权限清单。这一份是给数据安全审查看的,通常是高校流程里最容易卡住的环节。

建议把这六项做成一份目录页带进第一次会谈——不需要写完,只需要证明我们知道要写什么。对一个从没见过合规 token 采购文件的机构来说,这份目录本身就是最强的专业度证明,也是与「来卖 token 的供应商」最清晰的区分。

8.4 组织的默认姿势是「数据不出域」,这对我们有利

一份基于 147 所「双一流」高校的统计(《中国高等教育》2025 年第 21 期,统计窗口 2025-01-01 至 08-30)显示:125 所完成本地化部署,约 85%;其中 985 高校部署率 97.44%,211 为 90.43%,其他双一流为 69.63%。

85%
147 所双一流高校中完成本地部署的比例
97.44%
985 高校的本地部署率
0
检索到的按 Token 计费的高校 / 园区公开中标案例
2028 年底
工信部普惠算力体系建成目标,明确含 Token 计费
推论:不要主推纯公有云 API

高校体系的组织惯性与数据安全审查会让纯公有云 API 方案很难通过。建议主推「专属实例 + 数据不出域 + 完整审计日志」的形态,用私有化的合规姿态交付公有云的弹性与单价。这恰好也是 §4.1 图中毛利率最好的那一档业务形态——合规要求与商业结构在这里是同向的,不需要取舍。

8.5 一个可直接引用的同城先例

「园区打包发券、企业免申即享」的模式在上海已有可复制模板:张江 AI 创新小镇向符合条件的企业发放最高 100% 支持的 100 万元算力券 + 100 万元模型券 + 100 万元语料券,单个企业最多享受一年,按季度申报(2026 年 Q1 于 4 月 1 日启动,Q2 于 7 月 1—7 日受理),申报主体须工商注册地、实际经营地、财政户管地均在小镇范围内。

这个先例的用法:证明「园区级统一发放 + 统一申报」在上海是成熟做法,工研院不是第一个这么做的,风险已被别人验证过。对一个新上任的负责人来说,「已有先例」比「首创」更容易推动。

CHAPTER 09 · OBJECTIONS他们会怎么反驳:九个必答题

这一章按真实会谈的顺序排列。每一条给出对方的原话式质疑、这个质疑背后的真实顾虑,以及我们的答法。答法的共同原则是:不否认对方的判断,而是把问题重新框到我们的强项上

9.1 「大厂 API 已经很便宜了,而且天天降价,你们凭什么更便宜?」

背后的真实顾虑:怕被一个小团队用短期报价套住,一年后发现大厂更便宜。

答法:分三步,不要跳步。

不要说的话

不要说「大厂服务不好」「大厂不重视小客户」——这类话无法验证,且会让对方觉得我们在贩卖情绪。所有对竞争对手的判断都必须落在可查的财务数据或公开定价上。

9.2 「已经有很多公司做 token 工厂了,港股都有上市的,你们有什么不一样?」

背后的真实顾虑:这是个红海,选一个小玩家不理性。

答法:直接同意「很卷」,然后指出卷的是哪一层。这个赛道的绝大多数参与者在做两件事之一——把上游的 token 加价转售,或者拿地方补贴建集群然后按卡时出租。前者的成本是别人的定价,能给的折扣上限就是自己的渠道返点;后者卖的是裸资源,客户拿到卡之后的低吞吐、低利用率与它无关。

 转售型裸算力出租型我们
成本来自上游挂牌价硬件折旧 + 电费硬件折旧 + 自有优化能力
降价靠压缩自己的加价空间压低卡时报价提高吞吐与利用率
降价的后果越降越薄,直至无利可图越降越接近折旧线越降越健康——成本先降,价格后降
客户的低效与它无关与它无关,甚至是它的收入是它的成本,必须解决
可承诺的东西折扣卡时单价与可用性单位 token 成本与吞吐指标

一句话收口:「同一个赛道里,我们和他们赚钱的方式是相反的。他们的利润来自差价,所以降价伤自己;我们的利润来自成本下降,所以降价是把已经拿到的工程收益让出来一部分。这就是为什么我们敢把单位成本写进合同,而转售方只敢给折扣。」

9.3 「模速空间已经有算力生态超市了,为什么还需要你们?」

背后的真实顾虑:同区已经有一个看起来很像的东西,且由一家融资规模远大于我们的公司运营。这大概率是全场最尖锐的一问,必须准备好。

答法:不否认它的价值,而是指出两者解决的问题不在同一层。

然后把问题递回去,用两个具体指标:

递回去的两个问题

那个平台上,园区企业的实际单卡有效吞吐和集群利用率是多少?有没有按企业分账的单位 token 成本口径?

大概率答不出来——因为 L2 层的服务本来就不承诺这两项,它承诺的是可用性和额度。这个问题问完,我们的位置就自然清楚了,而且全程没有贬低任何人。

补充一个可以顺带说明的事实:那家运营方的定位是把市内、长三角及中西部的算力统一并网调度——这是一个资源侧的规模生意,与「把某一批具体负载的单位成本做到最低」是两种不同的能力会谈中不必强调这一点,除非对方追问差异到底在哪。

9.4 「你们团队太小,一亿元的量我不敢一次交给你们。」

背后的真实顾虑:这是最合理的顾虑,也是最不该硬扛的。

答法:不接这个前提。我们从来不建议一次性切换,因为那对园区不利,对我们也不利。正确结构是混合架构 + 分段承接

这一条答完,通常会显著改变对方对我们的印象——主动限制自己的敞口,是小团队证明自己懂事的最有效方式。而且它是真话:一次吃下全部流量对我们才是最大的风险。

9.5 「国产卡到底行不行?我听说性能不够、生态不全。」

背后的真实顾虑:既有政策要求要用国产,又怕用了出事,希望有人替它承担这个判断。

答法:不要辩护,要拆解。国产加速器在推理侧的差距,主要不在峰值算力这一项——差距集中在软件栈:算子覆盖不全导致大量算子回退、显存管理粗糙导致批量上不去、调度不成熟导致利用率低、长上下文与多模态路径缺少针对性优化。这些每一项都是工程可补的,也正是我们的工作内容所在。

然后给出园区真正想听的结论:「所以我们的方案不是赌国产卡,而是把国产卡放在它现在确实合适的负载上,把不合适的负载留给其他硬件,由平台统一调度、对上层企业完全透明。企业只看到一个 API,看不到底下是什么卡。国产化率因此变成一个可以逐季度往上调的平台指标,而不是一次性的赌注。」

这一条是我们的主场,可以适度展开

把国产加速器推理的具体瓶颈讲到对方能听懂又插不上话的深度(算子回退、显存碎片、批处理调度、通信原语),是这场会谈里最有效的信任建立动作。但要在对方问了之后才展开,不要主动上技术课。

9.6 「为什么要园区统一搞,让企业各自去买不行吗?」

答法:企业各自买,有三件事永远拿不到——而这三件恰好都是园区的职能所在:

再加一句给平台听的:「而且企业各自买,园区就看不到自己企业的 token 曲线——那是最灵敏的活跃度指标。」

9.7 「钱怎么算?你们要多少?」

答法:给结构,不要急着给数字。三种可选,按园区的风险偏好排序:

A · 节省额分成(建议起步)

以当前实际单位成本为基线,我们只从可核验的节省额中按比例取酬。园区不增加任何支出,不省则不付。适合破冰:把举证责任完全放在我们这边。

B · 平台运营托管费

园区持有算力资源(自采或租赁),我们负责平台建设与运营,收固定托管费 + 绩效部分(挂钩利用率与单位成本指标)。适合园区希望资产与数据都在自己手里的情形。

C · 按 token 结算

我们自租算力自建平台,按 token 向园区结算,价格锚定在公开挂牌价的固定折扣上并写入调价机制。最省事,但园区拿不到成本透明度,通常作为规模化之后的形态。

先谈 A,把第一阶段做成园区几乎零风险的动作;A 跑出实测数之后,B 和 C 的谈判就有了共同的事实基础。顺序反了会很难谈——没有实测数据时谈 C,就退回到纯比价了。

9.8 「数据安全怎么保证?」

答法:列清边界,不讲承诺。私有化部署在园区可控的资源上;推理数据不出园区网络边界;模型权重与业务数据分离存储;完整调用审计日志归园区所有;运维访问留痕并可由园区审计。把「我们能看到什么」明确写下来——主动划出自己的权限边界,比反复保证安全更有说服力。

9.9 「万一你们做不下去了,园区怎么办?」

答法:这个问题必须给出结构性答案,而不是「我们不会」。

这四条合起来传递的信息是:我们的护城河是持续把成本做得更低,不是把客户锁住。愿意主动交出锁定手段的供应商,在这个赛道里同样是少数。

CHAPTER 10 · THE PLAN怎么落地:三段式方案与每段的验收口径

方案设计的唯一原则:让园区在每一个节点上都能低成本地说「不」。敞口越小,第一步越容易迈出去;而只要第一步的实测数据是真的,后面的谈判就不再是说服,而是算账。

图 10-1 三段式承接路径
横轴是时间,纵轴是园区承担的风险敞口。每段之间有明确的验收门,未过门则不进入下一段,且园区无沉没成本。
时间 → 第一段 · 同题同压对比测试 不接生产流量,不动现有供应商 园区投入:真实请求样本 + 对接人 第二段 · 非关键负载试运行 承接可预测基载,峰值溢出走公有云 签 SLA 与退出条款,按月结算 先接 3–5 家自愿参与的企业 园区侧上线用量与成本看板 建议采用节省额分成结构 第三段 · 园区级平台 全园区统一入口、统一结算与开票 配额制:入驻企业按阶段领用 国产加速器占比按季度上调 私有化部署,数据不出园区 活跃度看板交付给招商与投资口 纳入政策补贴与算力券申报 转入托管费或按量结算结构 验收门 ① 验收门 ② 园区风险敞口 ↑

10.1 第一段:同题同压对比测试

目的只有一个——把「我们更便宜」从主张变成读数。做法:取园区内一到两家企业的真实请求样本(脱敏后),在我们的环境与现有供应商上跑同一批请求,同时记录成本侧与质量侧指标。

指标类别具体指标为什么必须一起看
成本侧单位 token 成本(分输入/输出)核心结论。必须统一口径:是否含缓存命中、是否含峰值备容成本
单卡有效吞吐、集群利用率成本优势的来源必须可归因,否则无法判断是否可持续
质量侧首字延迟 TTFT、单 token 延迟 TPOT降本不能靠牺牲体验。这两项必须先设下限再谈成本
长上下文准确率最容易被牺牲的一项。量化与显存压缩手段常在长上下文上大幅掉点,短请求评测完全看不出来
输出一致性(同 seed 复现)企业侧回归测试要用,波动大会引发大量返工
稳定性侧压测下的错误率与限流表现公有云的隐性成本主要在这里
峰值承载与降级行为决定第二段的容量设计
验收门 ①:把结论前置写清楚

在测试开始前就与园区约定:如果单位成本改善低于某个阈值,或任一质量指标低于现状,则本项目终止,园区不承担任何费用。把失败条件写在前面,是这一段最重要的动作——它让园区几乎没有理由拒绝启动。

10.2 第二段:非关键负载试运行

承接一部分真实生产流量,但严格限定在可预测的基载与非关键路径上,峰值与关键业务仍走原有通路。这一段要产出三样东西:

参与企业建议从自愿报名的三到五家起步,优先选 token 消耗量大、对成本敏感、技术团队配合度高的。第一批企业的口碑决定第三段能否推开——这一段的真实目标是拿到园区内部的推荐人,而不是拿到收入。

10.3 第三段:园区级平台

只有在前两段都有可核验数据之后,才谈整体承接。这一段的形态与商务结构在第 9.7 节已列出(转入托管费或按量结算)。这里只强调三个必须在这一段落地、且构成长期壁垒的动作:

配额制与招商联动

把算力配额做成分级的入驻权益,与招商流程绑定。一旦写进招商政策,这个平台就成了园区制度的一部分,而不是一个可随时更换的供应商。

国产加速器占比的季度台阶

不承诺一次性达标,而是给出逐季度提升的路线与每一档对应的负载类型。让国产化率成为一条向上的曲线,这是园区最需要的汇报素材,也是我们技术能力的直接体现。

把控制权留在园区

资产、数据、审计日志、部署文档全部归园区;不排他、不锁定。这既是消除疑虑的手段,也是我们真实的战略选择——护城河在成本曲线上,不在合同条款上。

CHAPTER 11 · THE MEETING第一次会谈:议程、开场、禁区

这一章是可以直接带进会议室的部分。核心判断:第一次会谈不要以拿单为目标,要以「拿到六个数字 + 约定一次对比测试」为目标。把目标定小,成功率会高很多,而且第二次见面时我们手上就有事实了。

11.1 一次 60 分钟会谈的建议节奏

时段要做的事要达到的效果
0–5 分钟不介绍公司,先说来意:「听说园区每年在 token 上的支出是亿元量级,我们想看看这笔钱的结构里有多少是可以省下来的,以及能不能顺便变成园区自己的一项能力。」把话题从「供应商推销」切换到「一起看一笔预算」
5–20 分钟讲第 2 章的算术:恒等式 → 模型厂商自己披露的成本数据 → 一亿元的构成表。只讲结构,不报价。建立「这个人懂成本,不是来卖东西的」的第一印象
20–35 分钟问 §2.6 的六个数字。带一页纸现场填。填不出来的当场记为待补。拿到定价所需的口径;同时暴露对方现有供应商没做过这件事
35–48 分钟讲第 5 章的四项价值(招商权益 / 可汇报的建成物 / 活跃度看板 / 预算效率),以及 §5.3 的三件杂事。这一段是给平台听的,不是给技术听的。把我们从「更便宜的供应商」变成「帮园区把费用变成能力的人」
48–58 分钟提出第一段方案:同题同压对比测试,失败条件前置,园区零费用。明确说出「如果测不出优势,这单不该给我们」。把决策门槛降到几乎为零
58–60 分钟约定下一步的具体动作与时间:谁提供样本、谁对接、什么时候出结果。会议以一个日期结束,而不是以一句「保持联系」结束

11.2 三种开场,按对方身份选

对园区管理层 / 平台负责人

「园区每年花在 token 上的钱是亿元量级,但这笔钱花完之后,园区账上什么都不剩——它全部变成了外部供应商的收入。我们想谈的是:同样的预算,能不能让园区多出一个自己的推理底座、一份招商权益、一套企业活跃度数据。落点是资产化与政绩,不是价格。

对技术负责人 / 中台团队

「单位 token 成本等于卡时成本除以吞吐再除以利用率。买 API 的时候,后面两项是看不见的,也是没法优化的。我们想看看园区聚合之后,这两项能做到什么水平,这个可以直接测。」落点是工程,直接进入同行对话。

对财务 / 采购口

「几十家企业各自向不同供应商付费,币种、票据、主体都不统一,涉及财政资金和科研经费时更麻烦。统一入口能把 N 份合规问题压缩成 1 份,顺便让国产化率变成一个可统计、可上报的平台指标。」落点是合规与流程,不是技术。

11.3 禁区:这几句话不要说

不要说为什么改成
「我们比大厂便宜 X 成」在没有口径的情况下报数,会被当成又一个报价,且一旦口径不同就失信「我们想先把口径对齐,再谈能省多少——现在报数对你没意义」
「大厂服务不好 / 不重视小客户」无法验证,且显得在贩卖情绪;对方很可能与大厂关系良好「他们的商业模式是按需计费,园区的闲置在他们账上是收入——这是激励结构问题,不是服务态度问题」
「国产卡完全没问题」对方大概率知道有问题,这句话直接摧毁可信度「差距主要在软件栈这几层,具体是……这些是工程可补的,我们的方案是混合架构加逐季度台阶」
「我们可以接下全部一亿元的量」激进,反而放大对方对小团队的担忧「我们只建议承接可预测的基载,峰值溢出仍走公有云,园区始终保留退路」
「需要签排他 / 需要预付」第一次会谈提锁定条款,等于宣布自己没有成本优势「不排他、不锁定、资产和数据都在园区手里」
主动大段讲技术平台机构的决策人不为技术付费,且容易变成考试技术只在被追问时展开,展开时要深(§6.5 那张表的深度)

11.4 需要提前准备好的三份东西

刻意不准备的东西:公司介绍、团队背景页、技术架构大图、报价单。第一次会谈里,这四样每出现一样,会谈就往「供应商比价」的方向偏一点。

CHAPTER 12 · OUR OWN RISKS我们自己要想清楚的五件事

前面几章都在讲怎么说服对方。这一章相反:把我们自己这一侧最薄的地方摊开。写在这里的目的很实际——这些问题对方的技术顾问也会想到,我们提前想过一遍,会谈时就不会被问住

① 一亿元的口径可能与我们的假设差很远

这个数字来自对方口述,构成未知。它可能包含算力租赁、平台建设与人力,甚至包含尚未发生的规划性预算;也可能大部分花在海外前沿模型上——那种情况下算力成本占比不到 2%(§2.3 末两行),我们能优化的绝对额会小很多,但相对降幅反而更大应对:口径没问清之前不做任何承诺,这也是 §2.6 六问表的由来。

② 我们不是模型方,模型溢价这一段动不了

如果园区的支出主要是闭源模型的授权与调用溢价,那么优化推理效率只能压缩其中的算力部分。这是我们能力的真实边界,必须主动说出来。应对:把可优化范围明确圈定为「开源与自部署模型的推理成本」,闭源部分只做用量治理与路由优化(把不需要顶级模型的请求分流到便宜模型),这一项本身也常有可观收益。

③ 园区聚合红利的前提是企业真的愿意迁

§2.5 的曲线成立的前提,是几十家企业确实把负载放上来。而每家企业都有自己的技术选型、迁移成本与惰性,园区的行政力度也未必能推动。如果只接进来三五家,利用率红利就只剩一小半。应对:第二段刻意从自愿报名的企业做起,用第一批的实际账单形成园区内部口碑;同时把配额与入驻权益绑定(§10.3),让新入驻企业默认在平台上。

④ 国产加速器的适配工作量存在真实不确定性

算子缺口、长上下文与多模态路径的成熟度,在真正跑起目标模型之前很难准确估计。承诺过早会伤自己。混合架构不只是给园区的风险管理方案,也是给我们自己的。应对:第一段测试就把目标模型在目标硬件上跑通,把不确定性在零承诺阶段消化掉;国产化占比按季度台阶承诺,不给一次性达标的时间表。

⑤ 交付与运维是长期人力投入,不是一次性项目

园区级平台意味着 SLA、值班、故障响应、版本升级、几十家企业的接入支持。这与做一次性优化项目的资源模型完全不同,对一个小团队是真实的组织压力应对:第三段的商务结构必须把运维成本显性计入(托管费而非纯分成);第二段就要开始验证单位客户的支持成本,避免规模化后被服务成本拖垮。

一个需要提前定调的问题

第一段的对比测试是零收费的,但它需要投入真实的工程人力(跑通目标模型、搭测试环境、出报告)。在启动之前,我们内部要先明确这笔投入的上限,以及什么情况下中止——否则很容易演变成长期免费 PoC。建议的约束:园区侧必须同时承诺三件事(提供真实请求样本、指定对接人、明确验收门通过后进入第二段的决策路径与时间)。三件里缺任何一件,就说明这件事在园区内部还没有主人,此时不宜投入。

APPENDIX附录:数据速查、来源与信息缺口

本附录把全篇引用的数字集中列出,并明确区分四类置信度。会谈中引用任何数字前,请先看它属于哪一类。

A · 置信度标注说明

官方/论文来自当事方官方披露、政府文件或同行评议论文,可直接引用 媒体/社区来自主流媒体报道或开源社区公开复现,可引用但宜说明来源 待核来自二手记录或单一来源,对外引用前必须复核

另有一类是我方估算(如「一亿元约占市场 3.3%」、§2.5 的峰均比模型、§2.4 的敏感度算例),已在正文中逐处标明。这类数字用于说明量级与结构,不应作为精确预测使用。

B · 关键数字速查表

数字含义出处置信度
谈判对象
2024-10-09交大工研院启动(与人工智能学院一体化运行)工研院官网、交大新闻网官方
2026-08-18赵军出任工研院院长(距今八天)工研院官网待核
2009-12交大先进产业技术研究院(产研院)成立——不是本次对口主体aitri.sjtu.edu.cn官方
6 PFLOPS / 92 张 A100交大思源一号超算规模docs.hpc.sjtu.edu.cn官方
3.8 万人致远一号 2025 年服务师生数(称全国高校最大国产智算)新浪财经,2025-12-25媒体
成本与算术
15.5%模型厂商自披露:推理成本占按挂牌价折算的理论收入比重(即「理论利润率 545%」)DeepSeek 官方,2025-03-01官方
1,814 张 / 87,072 美元该披露中的 24 小时平均占用卡数与日成本(逐项核对一致)同上官方
6,080 亿 / 1,680 亿该 24 小时的输入 / 输出 token 量(输入中 56.3% 命中缓存)同上官方
1,072 / 4,951 token/s由上述数据反推的全集群平均单卡输出 / 输入输出合计吞吐我方计算估算
约 3.7 元/百万成本全摊到输出 token 时的单位成本(对照当期挂牌价 16 元/百万)我方计算估算
20.4%–38.2%既有推理系统的 KV 显存有效利用率(即 60–80% 被浪费),改进后浪费降至 4% 以下,吞吐提升 2–4 倍vLLM / PagedAttention 论文论文
0.20 美元/百万96 张 H100 上的公开复现输出 token 成本,约为同期官方 API 的五分之一LMSYS 公开复现社区
约 8.5 倍Token 即服务相对裸机小时租赁的价值倍数硬件厂商口径待核
赛道与毛利率
−271.6% → −119%某 MaaS 服务商公有云业务两期毛利率(仍为负)招股说明书(前期检索记录)待核
82.5%–92.4%同一家公司的私有化部署毛利率同上待核
86.9% / 约 20 元算力占销售成本比例(算力全部外租)/ serverless 用户 ARPU同上待核
16.8% vs 47.7%某智算服务商:集群产品交付 vs 运营服务毛利率;应收账款周转约 64 天招股说明书(前期检索记录)待核
50%+ vs 20–30%研报口径:自建推理基础设施 vs 裸机架租赁毛利率国金证券「Token 专业运营服务商」模型待核
1,944 万亿 tokens2025 年中国企业级 MaaS 调用量(2024 年 114 万亿,约 16 倍)IDC,2026-05-07机构
30.7 → 186 亿元中国公有云 MaaS 营收:2025 年实际 → 2026 年预测同上机构
9.6 万亿/日2025 年 12 月中国日均 token 消耗(2025 年 1 月为 1.6 万亿)同上机构
≈3.3%一亿元 ÷ 2025 年中国公有云 MaaS 总营收 30.7 亿元我方估算估算
近 50% / 40%+火山引擎份额:按调用量 / 按营收同上机构
100 万元模速空间入驻企业「免申即享」等价算力大礼包(无问芯穹为建设与运营方)澎湃、上海市政府网站,2025-02-21媒体
政策与补贴
50% / 500 万元市级模型券(Token 券)补贴比例与单项上限;专项总额 3 亿元沪经信智〔2025〕489 号,2025-07-28官方
30% / 100% / 10%市级算力券:租金补贴比例 / 市区协同补早补小最高(限 1 年)/ 自建设施支持;专项总额 6 亿元同上官方
30% / 2,000 万元徐汇区算力支持比例 / 单主体年度上限(2024 版为 1,000 万元)《徐汇区推动人工智能产业高质量发展的若干意见》,2025-05-31 起试行两年官方
2,000 万元徐汇区平台类支持上限(经分类认定)同上官方
1:1徐汇区对通过市级以上专项资金支持项目的配套比例《徐汇区支持西岸人工智能大模型科创街区的扶持意见》官方
4 批次2026 年度补贴申报批次,每季度首月受理沪经信智〔2026〕248 号,2026-04-30官方
200 EFLOPS / >70%2027 年上海智算规模目标 / 其中自主可控算力占比要求《上海市关于促进智算云产业创新发展的实施意见(2025—2027 年)》,2025-03-26官方
2,000 亿元2027 年上海智算云产业规模目标同上官方
120 EFLOPS / 约 8%2025 年底上海智算规模 / 占全国比重媒体报道,2026-01-31媒体
100 万 × 3张江 AI 创新小镇算力 / 模型 / 语料券,最高 100% 支持,限 1 年张江 AI 创新小镇申报通知,2026 Q1/Q2官方
2028 年底 / 10 类行业工信部普惠算力体系建成目标,文件明确含 Token 计费工信厅通信〔2026〕14 号,2026-04-02官方
采购与合规
400 万元政府采购货物与服务公开招标门槛(中央预算单位及省级口径;部分市县级为 200 万元)各省集采目录及标准官方
2025-07-01《上海政府采购云平台电子卖场管理办法》施行,明确服务「多频次、小额度」采购上海市财政局官方
125/147(85%)双一流高校完成本地化部署数量与比例;985 达 97.44%,211 为 90.43%《中国高等教育》2025 年第 21 期论文
263.9 万元西安交大 AI 大模型 GPU 算力集群中标额(设备采购中国政府采购网,2025-09-12官方
360 万元中科院自动化所算力云服务租赁预算,按台月计费、明确不采用 token 计费中国政府采购网,2025-09-30官方
0检索到的按 Token 计费的高校 / 园区公开中标案例数量中国政府采购网检索检索结论

C · 主要来源清单

  1. 01上海交大工研院官网 i3sjtu.cn
  2. 02交大新闻网《人工智能学院入驻暨工业创新研究院启动仪式》 news.sjtu.edu.cn
  3. 03上海市政府《人工智能赋能新质生产力启动仪式举行》 shanghai.gov.cn
  4. 04上海交大先进产业技术研究院(产研院) aitri.sjtu.edu.cn
  5. 05沪经信智〔2025〕489 号《上海市进一步扩大人工智能应用的若干措施》 sheitc.sh.gov.cn
  6. 06沪经信智〔2026〕248 号《2026 年度「模塑申城」工程相关补贴申报工作的通知》 sheitc.sh.gov.cn
  7. 07《上海市关于促进智算云产业创新发展的实施意见(2025—2027 年)》 sheitc.sh.gov.cn
  8. 08《徐汇区关于推动人工智能产业高质量发展的若干意见》 sh-tec.cn
  9. 09《徐汇区支持西岸人工智能大模型科创街区的扶持意见》 sh-hitech.com
  10. 10张江 AI 创新小镇券政策申报通知 sh-hitech.com
  11. 11工信厅通信〔2026〕14 号《关于开展普惠算力赋能中小企业发展专项行动的通知》 gxt.hunan.gov.cn
  12. 12澎湃《国内首个「算力生态超市」——模速空间算力生态平台发布》 thepaper.cn
  13. 13上海市政府《「模速空间」打造大模型创新生态圈 入驻企业超百家》 shanghai.gov.cn
  14. 14IDC《中国 MaaS 市场进入高速增长期,Token 经济从概念走向规模化实践》,2026-05-07
  15. 15中国政府采购网 · 西安交大 AI 大模型 GPU 算力集群中标公告 ccgp.gov.cn
  16. 16中国政府采购网 · 中科院自动化所算力云服务租赁公开招标 ccgp.gov.cn
  17. 17上海市财政局《上海政府采购云平台电子卖场管理办法》 czj.sh.gov.cn
  18. 18刘骥等《高等教育数字化的技术部署节奏与路向——以 147 所高校 DeepSeek 布局为例》,《中国高等教育》2025 年第 21 期
  19. 19新浪财经《全国高校最大国产算力基础设施在沪落成》 finance.sina.com.cn
  20. 20上海交大超算平台用户手册 docs.hpc.sjtu.edu.cn
  21. 21教育部《关于进一步完善中央财政科研项目资金管理等政策的若干意见》问答 moe.gov.cn
  22. 22DeepSeek《DeepSeek-V3/R1 推理系统概览》官方披露,2025-03-01(本报告 §2.2 的成本定标即出自此处)
  23. 23Kwon 等《Efficient Memory Management for Large Language Model Serving with PagedAttention》(vLLM 论文)
  24. 24入驻企业融资信息:投资界、新浪科技、雷峰网等公开报道(记忆张量、无界动力、穹彻智能、源络科技等)

招股说明书与券商研报类来源(§4.1、§4.4 部分数字)来自本项目前期检索记录,本轮未能重新定位到原文页码,故未列入上表。见 §4.5 的复核清单。

D · 信息缺口清单

以下是本轮未能解决的问题,按对谈判的重要性排序。前四项建议在首次接触时直接问对方,后面几项需要额外检索。

#缺口为什么重要怎么补
1一亿元 token 支出的构成:哪些企业、哪些模型、API 采购与算力租赁与平台人力各占多少、境内外模型比例决定我们能优化的绝对额与相对降幅,也决定报价结构。没有这个,任何报价都是猜测§2.6 六问表,首次会谈现场填
2工研院的法人性质:校属事业单位还是公司化平台决定合同主体、发票类型、资金来源与适用采购流程;也决定政策补贴的申报主体资格当面问,或查工商与事业单位登记
3是否已有算力 / MaaS 供应商及合同状态(工研院层面未找到任何公开信息;校级「交我算」体系与工研院是否打通亦不明)决定我们是替换、并存还是增量,直接影响进场策略当面问
4规模数字全空:孵化企业总数、在孵团队数、园区面积、基金规模(仅知与云启资本、中金资本合设天使及成长基金)决定聚合红利的实际量级(§2.5 曲线取哪一点)当面问
5模型券申报主体是否含事业单位 / 高校「非关联方」的界定标准直接决定补贴能否申领,以及我们与园区之间适不适合股权或合资形态建议与对方共同向徐汇区新工办确认
6港股已上市 / 已递表公司的完整名单与分业务毛利率——本轮检索额度耗尽未完成第 4 章论据的一手支撑;也是判断赛道资本化程度的基础需重新检索并回招股书原文
7招股书数字的原文定位(§4.5 清单全部条目)对外引用前的必要步骤需重新检索
8徐汇 AI 小镇「生态运营公司」的具体主体(政策文件只留了联系人)决定统筹申报走哪条通道需检索或当面问
9高校「算力 / token 费用」专用预算科目及年度预算执行率考核指标影响发票科目与合同设计与对方财务确认
10「西岸智慧谷」未在任何权威源检索到,疑为口语称法或已更名避免在会谈中用错名称当面确认