PARTNERSHIP ANALYSIS · CONFIDENTIAL

阶跃星辰合作分析报告

算力现状 · 与华为昇腾的合作到什么程度 · 模芯生态联盟 · 技术成色实勘 · 你们能切进去的具体位置与第一步怎么谈。全部结论基于公开信息与论文原文,事实、媒体叙事与信息缺口分开标注。

研究对象:阶跃星辰 StepFun(上海阶跃星辰智能科技股份有限公司) 报告日期:2026-08-25 数据来源:三路并行公开检索 + arXiv 论文原文 + 昇腾社区官方稿
内部参考 · 含合作策略与话术 · 请勿外传

SECTION 00执行摘要:五分钟拿到结论

如果只读一页,读这一页。

他们是谁。2023 年 4 月成立,创始人姜大昕(前微软全球副总裁、微软亚洲互联网工程院首席科学家)。累计融资超 170 亿元,2026 年 1 月 B+ 轮超 50 亿元、5 月 Pre-IPO 近 25 亿美元,正冲刺港股,目标估值约 100 亿美元。2025 年收入近 5 亿元,2026 年预期 10–12 亿元,尚未盈利。技术标签是"多模态卷王"——累计 38 款基座模型、31 款多模态。战略上是六小虎里唯一同时做「多模态基座 + 智能体操作系统 + 自有硬件」三件事的公司。

算力现状:一个二元结构。训练侧用的是 NVIDIA H800 集群(RoCEv2 1.6Tbps 互联,千亿模型 MFU 57%);国产卡的合作全部集中在推理端,没有一条提到训练。他们自己从未披露过卡数或集群规模,流传最广的锚点是「中贝通信为其独家供应 1.7 万 P 算力、累计订单约 40 亿元、锁量 3 年、持股 0.81%」——但这组数字来自投资者关系记录与财经自媒体,在券商研报库中零命中;卖方唯一的披露是阶跃为中贝智算业务的四家并列客户之一,且 15,000P 是中贝全公司口径(详见 10.1 更正一,引用前务必读)。算力主要靠外部——供应商反向入股(中贝、莲花控股)、合资平台(持股 10% 的上海智能算力科技)、产业伙伴集群(吉利星睿智算中心 2.0,万卡级 23.5 EFLOPS)。

与华为的关系:热,但比想象的浅。确认的三个节点是:2025 年 3 月昇腾适配 Step-Video/Step-Audio;2025 年 7 月 Step 3 发布时"华为昇腾首先实现搭载和运行";2026 年 2 月 5 日昇腾社区发布唯一一篇为阶跃单独写的官方技术稿,宣布对 Step 3.5 Flash 实现 0day 适配,互称"战略级长期伙伴",并明确写下一句极重要的话——"昇腾将全程相伴,持续发挥全栈优势,为 Step 4 模型开发提供技术支持"。但边界同样清楚:没有联合实验室、没有投资关系(华为与哈勃未出现在任何一轮股东名单)、没有 Step 模型上昇腾超节点或华为云 MaaS 的公开案例。合作实质是"模型开源 + 芯片侧自主适配 + 联合宣发",适配活主要由昇腾侧自己干。一个值得注意的反差信号:2026 年 5 月 Step 3.7 Flash 发布时,公开宣布完成适配的是壁仞、沐曦、天数智芯、海光,昇腾在公开名单中缺席

最关键的一条战略判断(决定你整套提案的基调)

阶跃不是「缺 Infra 能力」的客户,而是「能力很强但产能不足、且被长尾工程拖住」的客户。他们的 CTO 朱亦博是微软研究院 RoCE 技术奠基人之一(SIGCOMM 时间检验奖)、前字节跳动 AI Infra 负责人,做过多次万卡级单集群;公司内部把 Infra 与算法团队放在几乎同等位置,系统团队是并行主线而非支撑部门。所以"我们帮你把 Infra 搭起来"这句话说出口就输了——会被技术侧直接否掉。正确的基调只有一个:专业能力互补 + 产能外延,切入点必须落在他们「做得了但不划算自己做」或「暂时做不到最优」的环节。

你们能切进去的三个位置(按证据强度排序)。第一,国产卡长尾适配与多模态专用算子——每代模型(Step 3 → 3.5 → 3.7)乘每家芯片都要重来一轮,多模态还叠加"版本地狱"(vLLM/PyTorch/NPU 驱动版本互锁),这是纯人力密集、可外包、且他们已经在用第三方(联盟里就有无问芯穹和硅基流动)的活。第二,AFD 架构的国产卡落地——这是他们自己发明、写进论文、并开源了通信库 StepMesh 的架构,但StepMesh 仓库里的异构后端 xPUBackend 至今是一个占位(placeholder),没有昇腾 NPU 后端;vLLM 社区的同类特性还停在 RFC 阶段。这是一个具体、可验证、可指名的空白。第三,端侧与语音实时推理优化——他们公开在招"端侧推理""语音推理引擎"工程师,而 Edge 层(手机、车规芯片)是 2026 年最重的新投入、也是最新的能力空白。

时机为什么是现在。三件事叠在一起:终端合作按行业惯例分成 30%–60%,推理成本每降一个点几乎直接进毛利;正在冲港股 IPO,成本下降曲线需要能讲成毛利故事;2026 年行业从集体降价反转为集体涨价、上游内存供应紧张至少延续到 2027 年底。再加上他们 CTO 在 2026 年 7 月 WAIC 的公开原话——"我们怎么用三倍的算力支持了一千多倍 Token 呢?现在还是非常紧张的状态"——需求方自己把话说出来了。

一句话结论

这是一个高度同频但门槛很高的客户:他们的全部技术叙事就是"用更少的卡跑出同等效果"(Step-3 做到 32 卡 vs DeepSeek-V3 的 128 卡),与你们的能力方向完全一致;但他们自己就有顶级 Infra 团队,所以合作只能建立在"具体的、他们没做的那块"上。建议的第一步不是谈合作,而是带一个他们无法拒绝的技术礼物去谈技术——最锋利的那个是 StepMesh 的国产卡后端(见 7.2 与 8.3)。

SECTION 01公司速览:谁说话管用

找对人比讲对话更重要。这一节只讲与合作决策相关的部分。

1.1 决策层:2026 年 1 月起的「1+3」结构

角色背景与对你们的意义
董事长印奇2026-01-26 出任。旷视科技创始人、千里科技(吉利系)董事长,主管业务与商业化。意义:他同时是阶跃算力来源之一(吉利星睿智算中心)那一侧的决策人,决策链极短;商务与战略层的最高触点。
创始人 / CEO姜大昕前微软全球副总裁、微软亚洲互联网工程院首席科学家,NLP 出身。负责战略与算法路线。公开表述最值得记的两句:"技术是窗口期,不是永远的护城河""多模态目前还没有出现 GPT-4 时刻"
首席科学家张祥雨ResNet 论文作者之一,前旷视研究院基础模型负责人,2025 年加入,负责多模态与技术研发。
CTO朱亦博你们真正要打动的人。UCSB 博士 → 微软研究院(RoCE 技术奠基人之一,SIGCOMM 论文十年后获时间检验奖)→ 字节跳动 AI Infra 负责人(从零建设国内最大规模 AI Infra 之一,多次万卡以上单集群实践)→ 阶跃联合创始人兼 CTO。意义见执行摘要那条战略判断:在他面前,任何"帮你补短板"的话术都是自杀。

员工超 400 人,研发占比超 80%,算法团队平均年龄 28 岁;系统团队对外称聚集"40 余位顶尖系统专家"。【确认】

1.2 融资与股东:六小虎里产业绑定最深的一家

2026 年两轮大额融资的时间间隔不到四个月:1 月 B+ 轮超 50 亿元(上国投先导基金领投,国寿股权、浦东创投、徐汇资本、无锡梁溪基金、厦门国贸、华勤技术等参与,腾讯/启明/五源老股东跟投);5 月 Pre-IPO 近 25 亿美元(约 170 亿元,HKIC 香港投资管理有限公司 + 中兴通讯、华勤技术、龙旗科技、豪威集团等终端产业链资本,腾讯连续第三轮跟投)。4 月完成股改、拆除红筹,改以境内主体申请 H 股;据报道最快 6 月 8 日递表,目标估值约 100 亿美元。【确认】

股东名单按产业链位置排开,是六小虎里最"重产业、轻纯财务"的一份:

环节股东对合作的含义
算力中贝通信(0.81%)、莲花控股(拟增资 ≤3 亿元)供应商反向入股是他们锁算力的标准动作——对你们的合作结构设计有参考价值(见 7.4)。但这两家的具体数字都需打折,见 10.1
终端 ODM华勤技术、龙旗科技华勤同时是 STEPX Neo 手机的代工方,深度绑定
芯片器件豪威集团(图像传感器 CIS)多模态战略的上游
通信终端中兴通讯既是股东也是模型落地的终端厂商
千里科技 / 吉利系;阶跃持股智跃千里 50%印奇两边都是决策人,是最短的侧翼路径
国资 / 险资上海国投及先导基金、浦东创投、徐汇资本、无锡梁溪、厦门国贸、国寿股权、HKIC(港版淡马锡,阶跃是其唯一直投的生成式 AI 大模型公司)国资领投 + 港股上市 ⇒ "国产算力对齐"对他们有超出技术层面的战略价值
财务腾讯(连续三轮)、五源、启明、顺为、联想创投腾讯性质被媒体描述为"从财务转向深度协同",但云资源层面的安排未公开【缺口】

估值在六小虎里的位置(第三方汇总,2026-05):智谱约 580 亿美元 > DeepSeek 约 515 亿 > MiniMax 约 320 亿 > 月之暗面约 200 亿 > 阶跃约 100 亿美元。第三方给出的归因是"阶跃目标估值最低,因为在 Coding 市场缺位"【媒体,非官方观点】。同期格局:智谱、MiniMax 已于 2026 年 1 月先后登陆港股;零一万物转向保守/垂直;百川放弃通用大模型转 AI 医疗。

一个对你们特别有用的对比

月之暗面的 2026 策略是"K3 等效 FLOPs 至少提升一个数量级"——用堆算力打智能上限;阶跃选的是效率 + 场景纵深(更省的架构 + 终端落地)。后者对外部算力优化服务的需求强度显著高于前者。如果你们同时在看这两家,阶跃是更契合的客户。

1.3 产品与商业化:钱从哪来,成本压在哪

模型矩阵已定型为 Pro / Flash / Edge 三层(Pro 跑复杂推理、Flash 跑高频 Agent 工作流、Edge 部署到手机与汽车)。2026 年的关键动作是三个:2 月开源 Step 3.5 Flash(196B 总参/约 11B 激活、256K 上下文、350 tok/s、Apache 2.0,发布两天登 OpenRouter Trending 榜首);5 月开源 Step 3.7 Flash(196B + 1.8B ViT、最高 400 tok/s、三档推理等级);7 月发布 STEPX Neo 智能体手机 + Step AOS 操作系统(华勤代工,WAIC 2026"镇馆之宝",唯一通过首批国标 L3 级测试的智能体手机,但截至发布未量产、未定价)。未找到 Step-4 的任何公开发布信息——2026 年走的是 3.x 迭代 + 终端 OS,而非版本号大跃进【缺口】;但官方已确认"Step 4 训练已启动"(2026-02)。

近 5 亿 → 10–12 亿
2025 年收入 → 2026 年预期(未盈利)
4,200 万台
手机端累计装机(OPPO、荣耀等),日均服务近 2,000 万人次;覆盖国内约 60% 头部手机品牌
约 170%
终端 Agent API 调用量连续三个季度增速;开放平台 API 一年增长近 20 倍
30%–60%
终端合作分成的行业惯例区间 —— 成本每降一点直接进毛利

收费模式是"端 + 云":端侧按 License 收费,云侧按消耗计费。汽车侧与千里科技/吉利做 AgentOS 座舱,吉利银河 M9 上市三个月近 4 万台,2026 年"上车"规模预计超百万辆。内容侧一个可引用的成本案例:三七互娱把游戏 CG 制作接入 Step-Video,单项目成本降低 40%。toC 侧则在收缩——冒泡鸭 2025 年 6 月停运,转向 PC 桌面与企业场景。【确认】

公开点名的风险(媒体分析):"收入结构可能高度依赖少数头部手机与汽车厂商",且"若在垂直行业 Know-how 与低功耗推理优化上未能持续迭代,技术护城河可能被快速抹平"——后半句几乎是替你们写的需求说明书。

SECTION 02算力现状解剖:三层供应与一个二元结构

这一节回答两个问题:他们到底有多少算力、以及这些算力是怎么来的。

2.1 最重要的事实:训练用英伟达,国产卡只做推理

这是全报告最需要先说清的一条结构性事实。阶跃已公开披露的训练基础设施是 NVIDIA H800 集群——节点间 RoCEv2 1.6 Tbps 互联,自建机房与云上算力并用,具备万亿参数训练能力,千亿模型训练 MFU 57%(作为对照,Llama 2 70B 公开口径约 45%——这个数字本身就说明他们的训练 Infra 水平很高)。而所有国产芯片合作的公开表述,无一例外都是"推理适配 / 推理部署 / 推理验证",没有一条提到训练。【确认】

这条事实对你们的三重含义

如果你们的核心卖点是"国产卡训练效能优化",那么阶跃当下并不是这个能力的买家——他们的训练还在英伟达上,而且自己做得不错(MFU 57%)。 真正的需求在推理侧:国产卡推理适配、单位 Token 成本、端侧部署。你们的提案权重必须相应调整。 但有一个伏笔值得盯:昇腾官方稿写明"为 Step 4 模型开发提供技术支持",而 Step 4 训练已于 2026 年 2 月启动。如果 Step 4 有任何环节要落到昇腾上训练,那就是国产卡训练需求真正出现的时刻——这是本案最值得追踪的单一变量(见 9.2 尽调问题)。

2.2 算力的三层供应结构

阶跃星辰的算力供应结构:自有很少,外部三层
深色 = 有合同或股权文件背书;浅色 = 仅定性表述或生态关系
阶跃星辰 训练:NVIDIA H800 集群(MFU 57%)| 推理:国产卡为主 ① 供应商反向入股(唯一有合同级数字的一层) 中贝通信(603220.SH) 传「1.7 万 P / 约 40 亿元 / 锁量 3 年」(自媒体口径,研报库零命中) 卖方口径:阶跃为中贝四家并列客户之一,智算毛利率 41.04%(见 10.1) 莲花控股 2026-05 公告拟增资 ≤3 亿元;但算力收入已连续三季下滑 26Q1 −38.45%,战略重心已转向半导体(见 10.1 更正二) ② 合资与城市级平台 上海智能算力科技(阶跃持股 10%) 云赛智联持 11% | 城市级算力调度平台 仪电智算云(异构纳管) 支持沐曦/壁仞/天数/华为异构;承载 Step 系列部署 ③ 产业伙伴集群 吉利「智能汽车算力联盟」·星睿智算中心 2.0:万卡级、综合算力 23.5 EFLOPS(中国车企第一) 阶跃在其中扮演"大模型"角色 | 印奇同时任千里科技董事长 → 调度自主性与优先级受生态关系影响 ⚠ 阶跃自身从未披露自有卡数、集群 P 数或算力总规模——只有"自建机房+云上租用并行""单一集群数万张卡"的定性表述

怎么读这张图。1.7 万 P 是流传最广的量化锚点,来自中贝的投资者关系记录与财经自媒体转述,不是阶跃自己说的。口径上有两重不确定:该数字未说明精度(FP16/FP8/INT8)与卡型;更重要的是券商研报库对这组数字零命中——卖方口径下阶跃只是中贝的四家并列客户之一,15,000P 也是中贝全公司数字(见 10.1)。稳妥的表述是「阶跃是中贝智算业务的主要客户之一」。三层结构合起来指向一个判断:阶跃是"轻资产用算力"的模式——用股权和订单去锁供给,而不是自己重资产建集群。这与月之暗面"现金超百亿、堆 FLOPs"的路线形成鲜明对比。【确认 + 推断】

未找到的项目【缺口】:阶跃自有 GPU 卡数与卡型比例;单次训练成本、年度算力支出、融资中算力占比;与阿里云/腾讯云/火山引擎的公开算力协议(腾讯是股东但云资源安排未披露);阶跃作为采购方的招投标公告;港股招股书全文及其中的资本开支明细。

2.3 成本压力的三个硬证据

证据一:CTO 自己说的。朱亦博在 WAIC 2026(2026-07)的公开表述:"我们怎么用三倍的算力支持了一千多倍 Token 呢?现在还是非常紧张的状态""模型设计和软件设计要能够在单位算力下压榨出更多的智能""我们通过模型结构设计、软件优化,针对国产芯片的适配"这三句话是本报告里最直接的需求信号,建议在会面时原话引用——它证明这不是你们在推销,而是他们自己定义的战线。【确认】

证据二:技术路线全部指向省算力。MFA 压 KV Cache、AFD 拆解码、视觉侧把 token 数压到 1/16、视频侧 VAE 做 16×16 空间 + 8 倍时间压缩、Step3-VL-10B 用 10B 参数达到官方称 100B–200B 级效果。一家公司的架构创新全都朝一个方向走,说明那个方向就是它的痛点。

证据三:外部环境反向恶化。2026 年行业从集体降价反转为集体涨价(智谱 GLM-5-Turbo 上调 20%、腾讯云某模型输入价 +463%、阿里云算力卡 +5%–34%),原因是全球 AI 需求爆发与上游内存供应紧张,有业内判断内存产能调整至少到 2027 年底才缓解。同时 Agent 场景的 token 消耗是传统问答的 4–15 倍——而阶跃同时押注 Agent 与多模态两个高消耗方向。结论:算力效率优化的商业价值在 2026–2027 这个窗口被显著放大。【确认 + 推断】

SECTION 03与华为昇腾:合作到什么程度了

这一节是你最想知道的部分。结论是:热度真实,但深度比外界想象的浅——而这个"浅"恰恰是你们的机会。

3.1 三个确认的节点

阶跃星辰 × 华为昇腾合作时间线
绿色 = 有官方或多方一致报道;橙色 = 值得注意的反差信号
2025-03 昇腾适配 Step-Video / Step-Audio 基于 CANN + 昇腾服务器,上线魔乐社区(天翼云与华为共建) 2025-07 Step 3 发布:昇腾"首先实现搭载和运行" 沐曦、天数智芯、燧原"初步实现运行",其余在做 | 同场发起模芯生态创新联盟 2026-02 昇腾社区唯一一篇阶跃专稿:Step 3.5 Flash「0day 适配」 互称"战略级长期伙伴";强调昇腾"全互联高带宽设计"满足多 Agent 长序列高并发 并写明:「昇腾将全程相伴……为 Step 4 模型开发提供技术支持」 2026-05 Step 3.7 Flash 发布:公开适配名单里昇腾缺席 当日宣布完成适配的是壁仞(Day0)、沐曦(Day0)、天数智芯、海光信息 → 与三个月前昇腾领跑形成反差,原因未公开【缺口,值得当面问】 未见 昇腾超节点部署 Step | 华为云 MaaS 上线 Step | 联合实验室 | 投资关系 —— 全部为信息缺口 合作实质:模型开源 + 芯片侧自主适配 + 联合宣发。适配活主要由昇腾侧自己干。

3.2 合作的边界:三个"没有"

没有投资关系

华为与哈勃未出现在任何一轮公开股东名单中。B+ 轮由上国投先导基金领投,Pre-IPO 轮是中兴、华勤、龙旗、豪威等终端产业链资本。这意味着华为对阶跃没有股权约束力,双方是纯业务关系——对你们是好消息:不存在"华为不许别人碰"的排他结构。

没有联合实验室

昇腾官方稿与所有检索到的报道中,均未出现联合实验室、联合创新中心一类的机构化安排。对比参照:阶跃与壁仞、上海仪电是有"人工智能联合实验室"的。即:昇腾并不是阶跃合作最制度化的那家芯片厂。

没有超节点与云上落地

未找到任何 Step 模型部署在 CloudMatrix 384 或 Atlas 950 超节点的公开案例;也未找到 Step 上线华为云 ModelArts / 昇腾云 MaaS 的记录。昇腾适配后的落地平台是魔乐社区(天翼云+华为共建),不是华为云 MaaS。华为公开点名的超节点标杆模型是 DeepSeek 系列,不是 Step。

怎么解读这三个"没有"。它们共同指向一个判断:昇腾与阶跃的关系是"高调的技术互捧 + 低度的组织耦合"。昇腾需要旗舰模型来证明自己的生态(尤其是 Agent 场景),阶跃需要国产算力叙事来支撑国资背景与港股故事,双方在宣发上互相成就——但没有走到资本、实验室、云平台深度绑定的程度。对你们的含义是明确的:这里没有排他性壁垒,第三方专业团队完全有空间插进来做实事。【推断】

3.3 最重要的一句话:Step 4 的伏笔

昇腾社区官方稿(2026-02-05)原文

"昇腾将全程相伴,持续发挥全栈优势,为 Step 4 模型开发提供技术支持。"

这句话有三层信息。 它出自华为官方渠道,是承诺性表述,不是媒体推测。 措辞是"为模型开发提供技术支持",并未说 Step 4 在昇腾上训练——不能过度解读。 但阶跃已于同期确认"Step 4 训练已启动"。把这两条并起来看:如果 Step 4 有任何训练环节落到昇腾上,那就是"国产卡训练需求"在这家公司真正出现的时刻——而那恰好是你们团队最核心、最稀缺的能力(万卡级国产卡训练 + 精度对齐)。这是本案唯一一个"从推理需求升级为训练需求"的可能路径,也是你们应该长期盯住的单一变量。

对照行业背景:媒体普遍观察到国内厂商的做法是"把英伟达存量高端卡集中用于极少数超大模型预训练,把国产卡大规模投向推理与微调"。阶跃目前完全符合这个模式。所以在会面中,不要假设他们已经在国产卡上训练——问,而不是假定。

SECTION 04模芯生态创新联盟:名单与实际交付的落差

这是你们进场阻力最小的现成通道,但也要看清它的真实成色。

4.1 联盟基本事实

2025 年 7 月 25 日,Step 3 发布会同场,阶跃星辰联合近 10 家厂商发起"模芯生态创新联盟"。首批 9 家成员:

类别成员对你们的意义
芯片厂商(7 家)华为昇腾、沐曦、壁仞科技、燧原科技、天数智芯、寒武纪、摩尔线程你们的国产卡能力覆盖面正好对上
算力平台 / 基础设施(2 家)无问芯穹、硅基流动关键先例:第三方算力优化/推理服务商已经在联盟里了——你们不需要说服他们"为什么要用外部团队"

联盟自述目标是"打通芯片、模型和平台全链路技术,通过底层联合创新提升大模型适配性和算力效率",三方分工为:芯片方提供算力、模型方提供硬件友好的架构、平台方负责调度与部署优化。CTO 朱亦博明确表示联盟是"非垄断的",欢迎 Qwen、DeepSeek 等竞品模型参与。发布会圆桌罕见集齐四位国产芯片一号位(沐曦陈维良、天数智芯盖鲁江、燧原赵立东、壁仞张文),媒体普遍解读为国产芯片阵营为"缺模型场景"寻找旗舰参考负载。【确认】

两处需要更正的常见误解:①清程极智不在联盟成员名单中(所有检索到的名单均无);②阿里平头哥与海光信息也不是首批成员,它们是后来出现在适配名单里的,且未见"加入联盟"的正式公告。

4.2 联盟的实际产出:Day0 适配仪式化

时间模型公开宣布完成适配的厂商
2025-07-25Step 3昇腾(首先搭载运行);沐曦、天数智芯、燧原(初步运行);其余在做
2026-02-02Step 3.5 Flash华为昇腾(0day)、沐曦、壁仞(Day0)、燧原、天数智芯、阿里平头哥
2026-05-29Step 3.7 Flash壁仞(Day0,壁砺™166M)、沐曦(Day0,曦云C系列)、天数智芯、海光信息(当日全流程适配+深度优化)——昇腾缺席

三个观察,每一个都是你们的机会。

联盟的组织形态是信息缺口:未见法人实体、章程、治理结构、轮值机制或联合技术委员会。目前看更接近开放联合宣发 + 适配协作的松散联盟——这对你们是好事,意味着加入的门槛主要是"能干活"而非"够资格"。

SECTION 05技术成色实勘:他们已经做到哪一步

这一节读完,你就知道在他们的技术人面前该说什么、不该说什么。全部基于论文原文(arXiv:2507.19427)与开源仓库实际内容,不采信媒体转述。

5.1 MFA:真正的技术洞察不是"压 KV",是"算术强度落点"

MFA(Multi-Matrix Factorization Attention)的结构是:每层 64 个 query head 共享 1 个 K head 和 1 个 V head,head dim = 256——一种低秩分解式注意力。媒体普遍宣传它"大幅压缩 KV Cache",但论文的实际数据要克制得多:

指标(8K 上下文)Step-3(MFA)DeepSeek-V3(MLA)Qwen3(GQA)
KV Cache 大小2.56×10⁸ B2.88×10⁸ B7.89×10⁸ B
注意力计算量(不含线性投影)3.27×10¹⁰ FLOPs1.47×10¹¹ FLOPs

⚠️ 一个媒体常见的混淆,你在会面时不要踩:外界广泛引用的"降至 DeepSeek-V3 每 token 注意力成本的 22%"对应的是算力项(3.27e10 ÷ 1.47e11 ≈ 22%),而 KV Cache 相对 MLA 只少约 10%——论文自己就承认了这一点。把两个数字混为一谈,会立刻暴露你只看了通稿。

论文真正的核心论证在算术强度(arithmetic intensity)上,这也是你们团队最应该共鸣的一段:

MFA 的设计要点:把算术强度落在两类硬件的"中间地带"
横轴为算术强度(FLOPs/Byte)。硬件的 roofline 拐点 = 峰值算力 ÷ 内存带宽(详见技术教材第 2 章)
0 74 128 512 591 算术强度(FLOPs/Byte) H20 拐点 74 低带宽卡 H800 拐点 591 高端卡 对两类硬件都不浪费的区间 MFA = 128 MLA ≈ 512 MFA 落在 128:高于 H20 拐点(不会在低带宽卡上被访存卡死),又远低于 H800 拐点(不会在高端卡上浪费算力) MLA 约 512:贴近高端卡拐点,在中低带宽卡上就容易吃不满 —— 这就是"对所有芯片友好"的真正技术根据

为什么这一段对你们特别重要。因为它说明阶跃的技术团队是用 roofline 思维在设计模型的——他们不是"训完再让芯片厂适配",而是在架构阶段就把硬件的算力/带宽比算进去。这意味着你们和他们说话可以直接进深水区,不需要科普;同时也意味着任何停留在"我们能做算子优化"层面的泛泛而谈都不会打动他们。另一条相关工程结果:8×48GB 显卡即可完成大吞吐推理——对普遍 48–64GB 显存的国产卡有直接意义。

5.2 AFD:与 PD 分离的区别,以及那个关键的空白

AFD(Attention-FFN Disaggregation)把解码阶段拆成两个子系统:Attention 子系统(数据并行、持有 KV Cache、向外流式发送量化后的激活)与 FFN 子系统(张量/专家并行、做 MoE 与 dense FFN),形成"Attention → 通信 → FFN"三段流水。

与业界 PD 分离的本质区别(这句话建议背下来)

PD 分离切的是"阶段"(prefill vs decode);AFD 切的是解码内部的"算子类型"。收益是两侧可以各自选硬件、各自选并行策略:FFN 侧的 batch size 不再被上下文长度绑架,attention 侧可随上下文独立扩容。实测结果:Hopper 上 4K 上下文 / FP8 / 50ms TPOT SLA 条件下达 4,039 tokens/GPU/s(32 卡),为 DeepSeek-V3 同条件 2,324(128 卡)的 174%;部署规模从 DeepSeek 大规模 EP 的 320 卡量级降到 32 卡。

他们还开源了配套的通信库 StepMesh(Apache 2.0):基于 GPU Direct RDMA,异步 API 把通信与计算解耦,NUMA 亲和的 CPU 核绑定 + 张量预注册,单次通信延迟控制在 272 µs 以内且不占用 GPU 计算资源;对外暴露统一的张量传输接口与后端抽象层,官方定位是"实现异构加速器间的无缝通信""跨硬件的标准部署接口"。

🎯 全报告最锋利的一个发现:StepMesh 的国产卡后端是空的

我们查了仓库的实际内容:StepMesh 已实现的后端只有 RDMATransport / CPUBackend / GPUBackend,另有一个名为 xPUBackend 的占位(placeholder),至今没有昇腾 NPU 后端。同时,Step3 的 GitHub README 只推荐 vLLM 与 SGLang,全文不提昇腾、CANN、MindIE 或任何国产加速器,也无芯片厂商致谢。而 vLLM 社区的同类特性(ATTN-FFN Disaggregation)至今仍停在 RFC 阶段。

这三条合起来说明一件事:阶跃提供的是"硬件中立的架构 + 抽象接口",具体的国产卡后端要由各芯片厂在自家软件栈里各自实现,并未回流到阶跃的开源仓库。于是出现了一个非常具体、可指名、可验证的空白——他们自己发明的最先进架构,在国产卡上没有可用的通信后端实现。这就是你们的敲门砖(具体怎么用见 7.2 与 8.3)。

5.3 成本数字:哪些能引用,哪些要打折

数字口径使用建议
解码吞吐 4,039 tok/GPU/s,= DeepSeek-V3 的 174%论文实测,Hopper GPU✅ 可放心引用,注明硬件与 SLA 条件
32 卡 vs DeepSeek-V3 的 128 卡(4K 上下文)论文✅ 可引用,这是他们最自豪的数字
解码成本 0.055 美元/百万 tokenH800 口径;另有 H20 $0.040、A800 $0.040、昇腾 910B $0.043⚠️ 这些跨硬件成本大量是理论/建模值,论文主部署目标写的是 Hopper;论文没有给出任何昇腾实测结果
"在 H800 上吞吐比 DeepSeek-R1 提升超 70%"有明确硬件口径✅ 可引用
"在国产芯片上推理效率最高可达 DeepSeek-R1 的 300%"从未点名是哪款国产芯片、未公布测试方法🚫 不要在技术场合引用这个数字。结合论文成本表,H20 一列的成本比恰好约 3.2 倍(0.128÷0.040),更可能来自中低带宽卡的成本建模而非国产卡实测【推断】。你若引用,对方技术人一问方法论就穿了
一个值得写进你的会谈笔记的洞察:叙事与论文之间的落差

中文发布会与媒体的框架是"为国产芯片设计模型",甚至有"国芯+国模双擎驱动"的说法。但arXiv 论文原文的自我定位是"为更便宜但更弱的硬件(more affordable but weaker hardware)优化解码成本",正文没有出现"国产芯片专门优化"的表述。Flash 系列的 README 提到的硬件反而是 Mac Studio M4 Max、NVIDIA DGX Spark、AMD via llama.cpp Vulkan。

这个落差不是"他们在骗人",而是一个精准的合作信号:他们的架构设计确实对国产卡有利(算术强度落点是真的),但"落到具体国产卡上把性能榨出来"这件事他们并没有自己做——他们做的是硬件中立的上层设计,把最后一公里留给了芯片厂和生态伙伴。那个"最后一公里"就是你们的业务。

5.4 设计重心已经转移(会面前必须知道的最新变化)

如果你带着 Step-3 的 MFA/AFD 去谈,可能会显得慢了半拍。Flash 系列的官方 README 中已不再突出 MFA,"芯片友好"的叙事载体转移到了 稀疏度 + 滑动窗口注意力 + 多 token 预测

这个转移对你们的含义:极高稀疏度(196B 总参只激活 11B)+ 288 个专家 + SWA/full 混合 + MTP,这套组合在国产卡上的落地难度比 Step-3 更高——专家并行的 all-to-all、混合注意力的两套内核、MTP 的推测式验证逻辑,每一项都是需要按硬件重写的活。你们的机会随模型迭代在变大,不是变小。【推断】

SECTION 06他们缺什么:六个有证据的缺口

每一条都附证据来源与强度,方便你在会面中直接使用。

#缺口证据强度
1StepMesh 缺国产卡后端仓库实现仅 RDMA/CPU/GPU 三种后端,xPUBackend 为占位;Step3 README 不提任何国产加速器;vLLM 同类特性仍是 RFC最强:可代码级验证,且指向他们自己的核心架构
2国产卡适配的长尾产能Step 3 → 3.5 → 3.7 每代重做;9 家联盟成员中寒武纪、摩尔线程、无问芯穹、硅基流动无公开产出;多模态适配面临 vLLM/PyTorch/驱动的"版本地狱":结构性、周期性、纯人力密集
3端侧与语音实时推理公开在招"端侧推理""语音推理引擎""RL"方向的推理优化工程师;Edge 是三层矩阵中最新的一层;STEPX Neo 手机 + 百万辆上车是硬需求:招聘岗位直接证明内部产能不足
4跨硬件可比测评与统一基准联盟各厂商只发"完成适配"通稿,极少给绝对性能值;无跨厂商统一性能榜或联合报告中强:这是联盟缺失的公共品,谁做谁受益
5视频/多模态推理成本扩散类推理成本比 LLM 高"几个数量级"(Sora 级测算);分辨率非线性(256px→768px 约 10 倍 token);Step-Video 停在 540P,官方建议 80G 显存;对照:有开源工作 11B 模型仅 224 卡拿视频 SOTA:成本量级最大,但缺阶跃自身的成本数据【缺口】
6IPO 前后的单位经济叙事正冲港股;分成 30%–60% 下成本直接进毛利;被点名"若在低功耗推理优化上未持续迭代,护城河可能被抹平":时机极好,但属商务价值而非技术缺口

同时要清楚他们不缺什么:不缺训练框架能力(H800 集群千亿模型 MFU 57%)、不缺集群工程经验(CTO 做过多次万卡级)、不缺模型-系统协同设计能力(MFA/AFD 是论文级贡献)、不缺通信库基础(StepMesh 自研且开源)。把提案压在这四项上,等于自找难看。

SECTION 07合作建议:定位、切入点、报价

这是整份报告的落点。先定位,再选切入点,最后谈钱——顺序不能反。

7.1 定位原则:三句必须说、三句绝不说

✓ 必须说的三句

"我们只做你们不划算自己做的那一段。"——承认对方 Infra 强,主动划边界。
"我们按你们已有的指标口径交付。"——沿用他们自己的 tokens/GPU/s、TPOT SLA、单位 token 成本,不另立标准。
"先做一件小的、可验证的事。"——把第一次合作压到可验收、可复算的最小单元。

✗ 绝不能说的三句

"我们帮你们把 Infra 搭起来 / 补短板。"——对方 CTO 是前字节 AI Infra 负责人、RoCE 奠基人之一,这句话直接终结对话。
"你们在国产芯片上效率是 DeepSeek-R1 的三倍"(引用他们自己的宣传数字)——这个数字没有公开的测试方法与芯片型号,一问就露。
"我们有万卡训练经验,可以帮你们训模型。"——他们的训练在 H800 上、MFU 57%、自己做得很好,且这不是当前痛点。

为什么定位比内容重要。阶跃的技术团队用 roofline 思维设计模型(见 5.1),他们对"泛泛谈优化"的免疫力极强。你的专业性不体现在你会什么,而体现在你准确说出了他们哪里没做、以及你为什么知道。下面三个切入点都具备这个特征:每一个都能用一句可验证的事实开场。

7.2 主攻切入点一:StepMesh 的国产卡后端(最锋利)

开场只需要一句话

"我们看了 StepMesh 的仓库,后端只实现了 RDMA、CPU、GPU 三种,xPUBackend 还是个占位。AFD 这套架构在国产卡上目前没有可用的通信后端——我们想把这一块补上,先用一款卡做出可跑的实现给你们看。"

为什么这是最好的敲门砖:

执行建议:先自费做一个最小可用实现(MVP)——单机多卡、一款主流国产卡、跑通 Attention 与 FFN 两侧的张量收发,给出 272 µs 这个官方基线的对照延迟数据。带着能跑的代码去,而不是带着 PPT 去。这笔投入换的是一张进门的门票,性价比远高于任何 BD 动作。

7.3 主攻切入点二:跨硬件可比基准(联盟缺失的公共品)

第 4.2 节的观察四指出:联盟九家厂商只发"完成适配"通稿,几乎不给可比的性能绝对值,也没有跨厂商统一榜单或联合报告。这对阶跃是真实的痛——他们无法回答"我的模型在哪款国产卡上跑得最好、成本最低"这个问题,而这个问题直接关系到他们向客户推荐部署方案、以及对外讲成本故事。

这个切入点的独特优势:它同时服务三方

对阶跃:拿到自家模型在各款国产卡上的可比数据,用于部署选型与对外叙事(尤其 IPO 期间的单位经济故事)。对芯片厂:拿到第三方中立的性能背书,比自说自话的通稿有力。对你们:谁定义度量口径,谁就是这个生态里的技术权威——而且做基准的过程会自动暴露每款卡的优化机会,直接生成后续的项目清单。

做法:以 Step 3.5 / 3.7 Flash 为标准负载,在 2–3 款国产卡上按统一 SLO 口径(TTFT / TPOT / 单卡吞吐 / 单位 token 成本,见技术教材第 7 章的四指标)出一份公开或半公开的对照报告。注意分寸:不做"排名羞辱",只做同口径事实呈现,并把每款卡的优化空间写成建设性建议。这样芯片厂不会敌视你,反而会来找你。

7.4 主攻切入点三:端侧与语音实时推理(他们在招人的地方)

公开招聘岗位是最诚实的需求信号。阶跃在招的推理优化岗明确细分了端侧推理语音推理引擎两个方向,这与三个战略事实完全对应:Edge 层是 Pro/Flash/Edge 矩阵里最新的一层;STEPX Neo 智能体手机 2026 年 7 月刚发布、尚未量产;汽车侧 2026 年"上车"规模预计超百万辆;而 Step Audio R1.1 已经是登顶榜单的产品,实时语音对时延与成本极度敏感。

方向具体可交付的活你们的优势匹配度
端侧推理(手机/车规芯片)模型压缩与量化(端侧对精度损失容忍度更低)、算子在端侧 NPU 上的重写、内存与功耗约束下的调度、端云协同的切分策略高——但要确认你们是否有端侧芯片(手机 SoC NPU、车规芯片)的实战经验,这与数据中心卡是两套手艺
语音实时推理流式推理的时延优化、首字时延压缩、小 batch 下的算子效率、语音特有算子(声码器、流式注意力)的优化中高——通用推理优化能力可迁移,语音特有部分需要补
RL 后训练 Infra他们也在招 RL 方向;对应技术教材第 8 章的训推一致、异步 rollout、权重重分片极高——这是你们的强项且极稀缺,但需确认阶跃的 RL 规模是否已到需要外部支援的程度

诚实提示:如果你们的实战积累主要在数据中心级国产卡(昇腾等),端侧不要硬接。手机 SoC 的 NPU、车规芯片的工具链与约束条件完全不同,接了做不好会毁掉信任。建议的做法是:把端侧作为"了解需求、建立关系"的话题,把实际承接押在数据中心侧的适配、基准与 StepMesh 后端上

7.5 备选切入点(作为储备,不主推)

视频/多模态推理成本

扩散类推理成本比 LLM 高"几个数量级",Step-Video 停在 540P 暗示成本约束。价值最大但证据最弱——缺阶跃自身的成本数据【缺口】。适合作为技术交流话题,探他们的真实痛点。

经联盟入场

加入"模芯生态创新联盟"是阻力最低的建立信任方式(联盟非排他、且已有第三方成员)。但注意:联盟无章程无治理,加入本身不带来订单,只带来身份与信息。当作辅助动作,不要当作主路径。

吉利/千里科技侧翼

星睿智算中心 2.0(万卡级、23.5 EFLOPS)是阶跃实际算力来源之一,印奇同时是千里科技董事长,决策链短。可作为平行入口:先服务算力持有方,再顺流到阶跃的负载。

Step 4 训练(长期)

昇腾官方承诺"为 Step 4 模型开发提供技术支持",Step 4 训练已启动。这是唯一可能把需求从推理升级到训练的路径,也是你们能力最强的战场。现在还不到时候,但要在每次接触中埋线索、盯进展。

7.6 合作形式与报价建议

阶跃的股东结构给了一个很强的暗示:他们锁供给的标准动作是"供应商反向入股"(中贝通信 0.81%、莲花控股拟增资 ≤3 亿元,公告原话是关系从"供应商—客户"升级为"股东—生态伙伴")。这说明他们习惯用股权/长约确定性供给。但对你们这个阶段,建议反过来走——先服务、再谈绑定:

阶段形式建议条款
第 0 步(0–1 个月)自费 MVP + 技术交流不谈钱。目标是把 StepMesh 国产卡后端的最小实现跑出来,换一次与 CTO 级别的技术对话。这一步的投入应视为市场费用。
第 1 步(1–3 个月)小额付费 PoC单一目标、单一硬件、验收指标写死(沿用他们的口径:单卡吞吐 / TPOT / 单位 token 成本)。金额建议压在几十万级——低到不需要复杂审批,高到证明这是商业行为而非免费劳动。含转正条款。
第 2 步(3–9 个月)项目制 / 年度框架按"每代模型 × 每款硬件"的适配矩阵定价,或按年度效能框架 + 驻场包。此时才引入"效能提升分成"这类结构性条款。
第 3 步(远期)深度绑定可考虑他们熟悉的形式(长约锁量、交叉持股、联合实验室——注意昇腾都还没有联合实验室,而壁仞与上海仪电有,说明这个位置是开放的)。
关于报价的一个判断

阶跃 2025 年收入近 5 亿、尚未盈利、正在冲 IPO——他们对"能写进成本下降曲线"的支出敏感度很高,对"看不出直接回报"的支出容忍度很低。所以定价逻辑不要按人天,而要按可量化的成本节约:如果你们能证明某个负载的单位 token 成本下降 X%,而他们年化该负载的算力支出是 Y,那么报价的锚点就是 X×Y 的一个分成比例。这套话术他们一定听得懂,因为这正是他们对自己客户讲的故事。

SECTION 08接触路径与第一次会面怎么谈

具体到人、通道、开场三分钟说什么。

8.1 找谁

对象用于什么接触逻辑
朱亦博(CTO)技术决策,主目标Infra 主线的最终判断者。他会在三分钟内判断你是不是同行。必须由你们的技术负责人直接对话,商务人员不要主谈。
系统/推理团队工程师建立技术信任的第一跳通过开源仓库的 issue / PR、技术社区、招聘渠道(hatcher@stepfun.com 是公开投递邮箱,可作为工程侧非正式触点)建立联系。一个高质量 PR 比十封 BD 邮件有效。
印奇(董事长)商务与战略层兼千里科技董事长,决策链最短。适合谈"体系内合作"(吉利算力中心 + 阶跃负载 + 你们的优化)这种跨主体结构。但技术未过关之前不要走这条线——自上而下压下来的合作,技术团队会消极对待。
联盟成员(芯片厂)侧翼与背书沐曦、壁仞、天数智芯、海光都在积极做 Step 适配且都缺深度优化人力。先帮芯片厂把 Step 模型跑好,再由芯片厂把你们带到阶跃面前——这是阻力最小的路径,且能同时拿到两个客户。

8.2 走哪条通道(按推荐度排序)

  1. 开源贡献通道(最推荐):给 StepMesh 提一个国产卡后端的实现或设计提案(issue + 原型代码)。这是唯一一条不需要任何人介绍、且天然证明能力的路。他们的仓库是活的(Apache 2.0、持续迭代),维护者就是系统团队的人。
  2. 芯片厂背书通道:先与一家正在做 Step 适配的国产芯片厂合作(沐曦/壁仞/天数智芯/海光皆可),把 Step 3.7 Flash 在该卡上的性能做出可对外的成绩,然后由芯片厂在下一次 Day0 适配中把你们作为技术伙伴带进去。
  3. 联盟通道:申请加入模芯生态创新联盟。门槛低、身份有用,但不直接产生订单。
  4. 吉利/千里侧翼通道:从星睿智算中心的算力运营侧切入,服务算力持有方,顺流承接阶跃负载。
  5. 直接商务接触(最不推荐作为第一步):冷启动的 BD 邮件在这家公司的技术文化里效率最低。

8.3 开场三分钟脚本(技术会谈)

建议的开场(可直接改写使用)

"我们是做国产卡上的训练与推理效能优化的,先说两句你们的东西,你判断我们是不是同行。

第一,Step-3 那篇论文里我们最认的不是 KV Cache 少了 10%,是把 MFA 的算术强度做到 128——正好卡在 H20 的拐点 74 和 H800 的 591 之间。这是用 roofline 反推模型结构,我们做优化的人一看就知道这是内行做的。

第二,我们看了 StepMesh 的仓库:后端只有 RDMA、CPU、GPU,xPUBackend 还是占位。也就是说 AFD 在国产卡上目前没有可用的通信后端,而 vLLM 那边的 ATTN-FFN 分离还在 RFC。我们想把这块补上,自己出人出机器先做一个能跑的最小实现,拿延迟和吞吐数据来跟你们的 272 µs 基线对。

我们不碰你们已经做得很好的部分——训练框架、集群工程、模型-系统协同设计,这些我们不插手。我们只想接你们不划算自己做的那段:每代模型乘每款国产卡的适配长尾、跨硬件的可比基准、以及国产卡上的通信与算子深度优化。"

为什么这个开场有效:前两段证明你读过论文和代码(而不是通稿),第三段主动划出边界、消除威胁感,第四段把需求说成他们的选择而不是你的推销。全程没有一句自我夸耀,但每一句都在展示能力。

8.4 会面中要问的五个问题(比说更重要)

  1. "Step 3.7 Flash 在昇腾上的适配现在是什么状态?"——2026 年 5 月的公开名单里昇腾缺席,这是本报告最想知道答案的问题。它会告诉你昇腾关系的真实温度,以及是否有你们能补的位置。
  2. "Step 4 的训练算力打算怎么配?有考虑国产卡吗?"——昇腾官方承诺"为 Step 4 开发提供技术支持"。这个问题决定了你们最强的能力(国产卡训练+精度对齐)什么时候用得上。
  3. "每代模型的国产卡适配,现在是你们做还是芯片厂做?投入多少人?"——直接量化第 6 章的缺口二,也是报价的依据。
  4. "你们内部怎么衡量一次优化的收益?看单卡吞吐还是单位 token 成本?"——拿到他们的验收口径,后续所有方案都按这个口径写。
  5. "端侧那块(手机/车规)现在最卡的是什么?"——他们在招这个方向的人,问了才知道是缺人、缺工具链、还是缺芯片侧配合。

SECTION 09风险、尽调问题与口径说明

合作前该担心什么、该问清什么、以及这份报告哪些地方不确定。

9.1 五个真实风险

① 内部能力太强,合作空间被压缩

这是最大的风险。CTO 是前字节 AI Infra 负责人,系统团队称有 40 余位顶尖系统专家。他们随时可以决定"这活我们自己干"。对策:切入点必须选在他们做了不划算的长尾(适配矩阵、跨硬件基准),而不是他们做不了的核心(那种东西不存在);并且要快——用速度换空间。

② 训练需求尚未出现

他们的训练在 NVIDIA H800 上、MFU 57%,国产卡合作全是推理。你们最强的能力(国产万卡训练、精度对齐)当下没有用武之地。对策:接受这个现实,先用推理侧能力进门;把 Step 4 是否上国产卡训练作为长期观察的单一变量。

③ 芯片厂是天然竞争者

国产卡的适配活,芯片厂自己也在做(且有动力自己做,因为这是他们证明生态的方式)。壁仞称适配效率相比手工提升 4–5 倍,说明他们在建自动化能力。你们可能被夹在模型公司与芯片厂之间。对策:定位成芯片厂做不深的那一层(跨硬件对比、通信后端、深度调优),并考虑同时把芯片厂当客户而非对手(见 8.2 第 2 条通道)。

④ IPO 期间的决策冻结

正在冲港股,这既是机会(成本故事有价值)也是风险:IPO 静默期与合规审查会让新增供应商的流程变慢,大额合同尤其敏感。对策:第一单压小(几十万级),避开需要董事会或复杂审批的金额区间。

⑤ 你们自身的时间窗口

你们团队的正式交付要到 2026 年 10 月起(静默期)。而阶跃的模型迭代周期是三到四个月一代(3.5 Flash 2 月、3.7 Flash 5 月),错过一个窗口就要等下一代。对策:静默期内把开源贡献做出来(这不受竞业限制影响,是个人技术贡献),10 月一到立刻承接。

9.2 签约前必须问清的八个问题

#问题为什么重要
1Step 3.7 Flash 在昇腾的适配状态?为什么公开名单里缺席?判断昇腾关系的真实温度,以及是否存在你们能补的空位
2Step 4 的训练算力配置,是否包含国产卡?决定你们最强能力的启用时点
3国产卡适配当前由谁做、投入几人、每代耗时多久?量化可外包的工作量,也是报价依据
4内部的优化收益口径是什么(单卡吞吐 / TPOT / 单位 token 成本)?所有方案与验收都要按他们的口径写
5StepMesh 的国产卡后端有没有内部计划或已有伙伴在做?避免撞车——这是你们首选切入点,必须先确认无人占位
6与联盟内芯片厂的分工边界在哪?哪些活他们期望芯片厂做、哪些期望第三方做?决定你们与芯片厂是竞争还是协作
7端侧(手机/车规)目前最大的技术卡点是什么?判断你们是否真的能接,避免硬接做坏信任
8合作的采购与结算流程、IPO 期间是否有特殊限制?避免方案通过了但流程走不动

9.3 本报告的信息缺口(诚实清单)

以下内容检索未见公开数据,不要在会面中当作已知事实使用

9.4 需要更正的三处常见误解

常见说法实际情况
"清程极智是模芯生态创新联盟成员"不是。所有检索到的成员名单中均无清程极智。首批 9 家是:华为昇腾、沐曦、壁仞、燧原、天数智芯、寒武纪、摩尔线程、无问芯穹、硅基流动。
"阿里平头哥、海光信息是联盟成员"不是首批成员。它们是后来出现在 Step 模型适配名单中的厂商(平头哥在 3.5 Flash、海光在 3.7 Flash),未见"加入联盟"的正式公告。
"Step-3 的 KV Cache 比 DeepSeek-V3 少很多"只少约 10%(论文自述)。被广泛引用的"22%"是注意力算力项,不是 KV Cache 项。混用会暴露只读了通稿。
「中贝通信为阶跃独家供应 1.7 万 P、约 40 亿元订单」券商研报库零命中。卖方唯一披露是阶跃为中贝四家并列客户之一,15,000P 为中贝全公司口径(见 10.1 更正一)。
「莲花控股是阶跃的算力供应商 / 深度绑定」2026-05 确有增资公告,但东吴深度报告里的「星」是子公司莲花紫星、客户是智谱而非阶跃;且莲花算力收入已连续三季下滑、战略转向半导体(见 10.1 更正二)。
「华勤技术为 STEPX Neo 代工」华勤 27 篇、龙旗 6 篇研报中均无「阶跃/STEPX」字样,仅有媒体来源,无卖方或公告级确认(见 10.1 更正三)。

9.5 数字口径说明

SECTION 10券商视角:产业链数据与三处必须更正的事实

这一章来自券商研报库的独立检索(2025 年起 141 篇个股研报 + 20,055 篇行业研报索引,剔除假阳性后真正提及阶跃的 44 篇)。它既补充了产业链经济数据,也推翻了前面章节里三处来自自媒体的说法——这类交叉验证正是尽调的价值所在。

10.1 三处必须更正的事实

⚠️ 更正一:中贝通信的「1.7 万 P 独家供应 / 40 亿元」在券商研报库中零命中

券商侧的实际披露要克制得多。中贝通信在 2025-01-01 之后只有一篇个股研报(华鑫证券《中贝通信:主业经营稳定,算力业务开始发力》,2025-05-11),其中:

  • 阶跃星辰是四家并列客户之一(金山云、上海电信、万界、阶跃星辰),研报中没有"独家"表述
  • "在服算力约 15,000P"是中贝全公司口径,不是阶跃专属;
  • 研报库中没有任何一篇提及"1.7 万 P""约 40 亿元订单""锁量 3 年"或"持股 0.81%"

怎么理解这个矛盾。那些数字来源于中贝的投资者关系记录与财经自媒体(东方财富财富号一类)的转述,可能确有其事,但尚未进入卖方研究视野——而且此后 15 个月中贝零个股研报覆盖,对照同期算租同业(行云科技、利通电子、智微智能)均有密集覆盖与业绩预告,这个覆盖真空本身不正常。结论:在与阶跃或任何第三方沟通时,不要把"1.7 万 P 独家 / 40 亿元"当作既定事实引用;可用的稳妥表述是"阶跃是中贝智算业务的主要客户之一"。

⚠️ 更正二:「莲花控股增资阶跃」在研报中无据,且那个"星"不是阶跃星辰

东吴证券的深度报告标题《从调味品到算力,莲花向"星"别样红》里的"星"指的是子公司莲花紫星(莲花科创与星临科技合设),不是阶跃星辰;紫星披露的客户名单是"中国联通、中国移动、中国电信、深信投、智谱华章、新华三"——是智谱,不是阶跃。

更值得注意的是莲花的算力业务正在萎缩:算力收入 25Q3 −15%、25Q4 −2.9%、26Q1 −38.45%,连续三季下滑;在手订单从 2025 年 3 月的"超 16 亿元"降到 5 月的"超 11 亿元";2026 年公司战略重心已转向半导体(收购深圳纽菲斯 46% 股权)。紫星 2026 年股权激励考核目标营收 6.0 亿元,而 26Q1 仅 0.27 亿元——年化不足目标的 20%

公允的说明:莲花控股 2026-05-26 确有公告称拟增资阶跃星辰(≤3 亿元),这是公司公告、权威性高;而上述研报都发布于 2026 年 4 月之前,时间上早于该公告,两者并不直接冲突。但研报揭示的一件事很重要:莲花本身的算力业务已在收缩,把它当作阶跃算力供应的重要一环,是过度解读。

⚠️ 更正三:STEPX Neo 的代工方在卖方研究中完全无确认

我们逐篇检索了华勤技术 27 篇、龙旗科技 6 篇研报,均无"阶跃"或"STEPX"字样。"华勤代工"目前只有媒体来源,没有卖方或公告级确认。在会面中不要拿这件事当谈资——如果对方正在谈判或尚未定案,这会显得你在打探供应链。

顺带一个对判断有用的数字:华勤 2025 年移动终端收入 802.10 亿元(+57.17%)、智能手机 ODM 全球份额约 40%,但整体毛利率只有 7.97%–8.54%。这意味着智能体手机若走 ODM 路线,硬件环节几乎不留利润,价值必须落在操作系统与服务层——这也解释了为什么阶跃要做 StepAOS 而不只是做一台手机。

10.2 最强的合作论据:一把正在张开的剪刀差

这是本章最值得你在会面中使用的一组对照。模型侧的价格在暴跌,算力侧的租金在暴涨——两条曲线反向剪开,直接压缩模型公司的毛利:

剪刀差:Token 价格向下,GPU 租金向上
左:阶跃自己的降价幅度(万联证券,2026-04-27);右:GPU 一年期合约租金(国金证券,2026-07-19)
StepASR2 StepAudio2.5 ASR 0.15 元/小时 ≈ 前代的 1/10 价格 −90% 成本 −80%、时延 −60% 2025 年末低点 1.70 $/卡·时 2.35 $/卡·时 2026-03(H100 一年期) 租金 +近 40% B200 综合 +25%~30% 卖价一年跌九成,成本一年涨三四成 —— 中间的毛利只能靠「单位算力产出更多 token」来补 这正是你们业务的定义。国金证券判断算租景气仍在上行:越晚锁长约越贵

怎么用这张图。它把"你们为什么需要我们"从一句推销变成了一道算术题:模型侧的定价权在流失(他们自己就是降价的推手——StepAudio2.5 ASR 定价 0.15 元/小时,约为前代的十分之一),而算力侧的议价权在增强。夹在中间的毛利,唯一的补法就是提高单位算力的 token 产出。这也是他们 CTO 那句"用三倍算力支持一千多倍 Token、现在还是非常紧张的状态"的财务翻译。

10.3 谈价钱时用得上的产业链数字

数据来源对你们的用法
中贝智算毛利率 41.04%(2024)华鑫证券 2025-05-11最有价值的一个数字。阶跃付出的算力单价里约四成是供应商毛利——这是他们向下压价的空间上限,也是你们主张"优化省下的钱远大于服务费"时的参照系
算租折旧假设:服务器折旧周期 5 年;8 卡 H100/H200 服务器需 10kW 功率柜东吴证券《莲花控股深度》2025-04-21, p.14做 ROI 测算时的标准假设,可直接引用(他们的财务同事认这个口径)
行云科技单机毛利:上半年售 67 台服务器增加毛利约 6,500 万元 → 约 97 万元/台国金证券 2026-07-19, p.3反推算力供应侧的单机经济,用于判断优化服务的定价天花板
存量合同可上调:行云科技把两份存量协议合并核算后含税租赁总额上调约 79%同上说明供方议价权很强——阶跃的算力成本还有上行压力,优化的紧迫性更高
单笔长单量级:东阳光子公司算力采购 130–150 亿元 / 60 个月同上参照系:说明这个市场的合同尺度
中国智算规模 2025 年 1,037.3 EFLOPS → 2028 年 2,781.9 EFLOPS(CAGR 46.2%)东兴证券引 IDC/浪潮 2025-07-17市场空间的标准口径
上海目标:2027 年智算规模 200 EFLOPS,自主可控算力占比超 70%东吴证券 2025-04-28阶跃总部在上海、国资是大股东——"国产算力对齐"对他们有政策价值,这是你们的隐性加分项

10.4 券商确认的四条硬事实(可放心引用)

10.5 券商视角的四个风险(会面前要知道,但不要主动说)

① Token 份额是脉冲式的,不是护城河

Step3.5Flash 在 2026 年 3 月曾冲上榜首、单周 1,520 亿 tokens;但四个月后 Step3.7Flash 只有 1.9T tokens、排名第 8、环比 −64.4%、下降 5 位(同期榜首腾讯 Hy3 为 11.5T)。说明开源模型的调用量高度依赖发布节奏与榜单热度。这会让他们对"降本"更敏感(份额不稳时成本是唯一可控变量),但也意味着他们的预算可能随份额波动。

② 效率路线与巨量算力叙事之间的张力

华鑫证券指出 Step3.5Flash"以极速推理、128GB 内存适配的参数设计获认可……为算力受限的中国大模型企业提供了发展新思路"。一家把"算力受限下的效率"作为差异化的公司,为什么需要与头部同量级的算力?这个问题在他们内部可能也有分歧——你们的方案正好落在"效率"这一侧,是安全的。

③ 卖方公开质疑应用层的可持续付费

华鑫证券在深度报告中直接问:"AI 生成内容到底是在创造增量价值,还是在稀释内容稀缺性?……当底层大模型这一变量震荡,建立在基模之上的产品应用是否可持续能获取用户付费?"(2026-07-20)这类质疑会传导到他们的预算审批上,加强了"第一单要小"的判断。

④ 关联方千里科技的估值已脱锚

东吴证券给出 2026/2027/2028 年 PE 314/191/131 倍,而 26Q1 扣非归母净利润仅 0.01 亿元,且列出的第一条风险是"单一客户占比过高"(即吉利)。含义:走千里/吉利侧翼路径时,要意识到那一侧的商业化压力同样巨大,付款能力需要单独评估。

研报库同样存在明确缺口:没有任何一篇给出 AI 手机 BOM 成本拆解、AI 功能渗透率量化预测或智能体手机出货量预测——卖方对这个品类仍停留在事件跟踪,尚未建立量化模型;智算业务的上架率(利用率)指标在所有研报中均未披露。另外,三七互娱接入 Step-Video(单项目成本降 40%)、同方股份/中文在线/豪威与阶跃的关联,在对应公司的研报中全部零命中——这些都是媒体来源,引用时请降低置信度。