算力现状 · 与华为昇腾的合作到什么程度 · 模芯生态联盟 · 技术成色实勘 · 你们能切进去的具体位置与第一步怎么谈。全部结论基于公开信息与论文原文,事实、媒体叙事与信息缺口分开标注。
如果只读一页,读这一页。
他们是谁。2023 年 4 月成立,创始人姜大昕(前微软全球副总裁、微软亚洲互联网工程院首席科学家)。累计融资超 170 亿元,2026 年 1 月 B+ 轮超 50 亿元、5 月 Pre-IPO 近 25 亿美元,正冲刺港股,目标估值约 100 亿美元。2025 年收入近 5 亿元,2026 年预期 10–12 亿元,尚未盈利。技术标签是"多模态卷王"——累计 38 款基座模型、31 款多模态。战略上是六小虎里唯一同时做「多模态基座 + 智能体操作系统 + 自有硬件」三件事的公司。
算力现状:一个二元结构。训练侧用的是 NVIDIA H800 集群(RoCEv2 1.6Tbps 互联,千亿模型 MFU 57%);国产卡的合作全部集中在推理端,没有一条提到训练。他们自己从未披露过卡数或集群规模,流传最广的锚点是「中贝通信为其独家供应 1.7 万 P 算力、累计订单约 40 亿元、锁量 3 年、持股 0.81%」——但这组数字来自投资者关系记录与财经自媒体,在券商研报库中零命中;卖方唯一的披露是阶跃为中贝智算业务的四家并列客户之一,且 15,000P 是中贝全公司口径(详见 10.1 更正一,引用前务必读)。算力主要靠外部——供应商反向入股(中贝、莲花控股)、合资平台(持股 10% 的上海智能算力科技)、产业伙伴集群(吉利星睿智算中心 2.0,万卡级 23.5 EFLOPS)。
与华为的关系:热,但比想象的浅。确认的三个节点是:2025 年 3 月昇腾适配 Step-Video/Step-Audio;2025 年 7 月 Step 3 发布时"华为昇腾首先实现搭载和运行";2026 年 2 月 5 日昇腾社区发布唯一一篇为阶跃单独写的官方技术稿,宣布对 Step 3.5 Flash 实现 0day 适配,互称"战略级长期伙伴",并明确写下一句极重要的话——"昇腾将全程相伴,持续发挥全栈优势,为 Step 4 模型开发提供技术支持"。但边界同样清楚:没有联合实验室、没有投资关系(华为与哈勃未出现在任何一轮股东名单)、没有 Step 模型上昇腾超节点或华为云 MaaS 的公开案例。合作实质是"模型开源 + 芯片侧自主适配 + 联合宣发",适配活主要由昇腾侧自己干。一个值得注意的反差信号:2026 年 5 月 Step 3.7 Flash 发布时,公开宣布完成适配的是壁仞、沐曦、天数智芯、海光,昇腾在公开名单中缺席。
阶跃不是「缺 Infra 能力」的客户,而是「能力很强但产能不足、且被长尾工程拖住」的客户。他们的 CTO 朱亦博是微软研究院 RoCE 技术奠基人之一(SIGCOMM 时间检验奖)、前字节跳动 AI Infra 负责人,做过多次万卡级单集群;公司内部把 Infra 与算法团队放在几乎同等位置,系统团队是并行主线而非支撑部门。所以"我们帮你把 Infra 搭起来"这句话说出口就输了——会被技术侧直接否掉。正确的基调只有一个:专业能力互补 + 产能外延,切入点必须落在他们「做得了但不划算自己做」或「暂时做不到最优」的环节。
你们能切进去的三个位置(按证据强度排序)。第一,国产卡长尾适配与多模态专用算子——每代模型(Step 3 → 3.5 → 3.7)乘每家芯片都要重来一轮,多模态还叠加"版本地狱"(vLLM/PyTorch/NPU 驱动版本互锁),这是纯人力密集、可外包、且他们已经在用第三方(联盟里就有无问芯穹和硅基流动)的活。第二,AFD 架构的国产卡落地——这是他们自己发明、写进论文、并开源了通信库 StepMesh 的架构,但StepMesh 仓库里的异构后端 xPUBackend 至今是一个占位(placeholder),没有昇腾 NPU 后端;vLLM 社区的同类特性还停在 RFC 阶段。这是一个具体、可验证、可指名的空白。第三,端侧与语音实时推理优化——他们公开在招"端侧推理""语音推理引擎"工程师,而 Edge 层(手机、车规芯片)是 2026 年最重的新投入、也是最新的能力空白。
时机为什么是现在。三件事叠在一起:终端合作按行业惯例分成 30%–60%,推理成本每降一个点几乎直接进毛利;正在冲港股 IPO,成本下降曲线需要能讲成毛利故事;2026 年行业从集体降价反转为集体涨价、上游内存供应紧张至少延续到 2027 年底。再加上他们 CTO 在 2026 年 7 月 WAIC 的公开原话——"我们怎么用三倍的算力支持了一千多倍 Token 呢?现在还是非常紧张的状态"——需求方自己把话说出来了。
这是一个高度同频但门槛很高的客户:他们的全部技术叙事就是"用更少的卡跑出同等效果"(Step-3 做到 32 卡 vs DeepSeek-V3 的 128 卡),与你们的能力方向完全一致;但他们自己就有顶级 Infra 团队,所以合作只能建立在"具体的、他们没做的那块"上。建议的第一步不是谈合作,而是带一个他们无法拒绝的技术礼物去谈技术——最锋利的那个是 StepMesh 的国产卡后端(见 7.2 与 8.3)。
找对人比讲对话更重要。这一节只讲与合作决策相关的部分。
| 角色 | 人 | 背景与对你们的意义 |
|---|---|---|
| 董事长 | 印奇 | 2026-01-26 出任。旷视科技创始人、千里科技(吉利系)董事长,主管业务与商业化。意义:他同时是阶跃算力来源之一(吉利星睿智算中心)那一侧的决策人,决策链极短;商务与战略层的最高触点。 |
| 创始人 / CEO | 姜大昕 | 前微软全球副总裁、微软亚洲互联网工程院首席科学家,NLP 出身。负责战略与算法路线。公开表述最值得记的两句:"技术是窗口期,不是永远的护城河"、"多模态目前还没有出现 GPT-4 时刻"。 |
| 首席科学家 | 张祥雨 | ResNet 论文作者之一,前旷视研究院基础模型负责人,2025 年加入,负责多模态与技术研发。 |
| CTO | 朱亦博 | 你们真正要打动的人。UCSB 博士 → 微软研究院(RoCE 技术奠基人之一,SIGCOMM 论文十年后获时间检验奖)→ 字节跳动 AI Infra 负责人(从零建设国内最大规模 AI Infra 之一,多次万卡以上单集群实践)→ 阶跃联合创始人兼 CTO。意义见执行摘要那条战略判断:在他面前,任何"帮你补短板"的话术都是自杀。 |
员工超 400 人,研发占比超 80%,算法团队平均年龄 28 岁;系统团队对外称聚集"40 余位顶尖系统专家"。【确认】
2026 年两轮大额融资的时间间隔不到四个月:1 月 B+ 轮超 50 亿元(上国投先导基金领投,国寿股权、浦东创投、徐汇资本、无锡梁溪基金、厦门国贸、华勤技术等参与,腾讯/启明/五源老股东跟投);5 月 Pre-IPO 近 25 亿美元(约 170 亿元,HKIC 香港投资管理有限公司 + 中兴通讯、华勤技术、龙旗科技、豪威集团等终端产业链资本,腾讯连续第三轮跟投)。4 月完成股改、拆除红筹,改以境内主体申请 H 股;据报道最快 6 月 8 日递表,目标估值约 100 亿美元。【确认】
股东名单按产业链位置排开,是六小虎里最"重产业、轻纯财务"的一份:
| 环节 | 股东 | 对合作的含义 |
|---|---|---|
| 算力 | 中贝通信(0.81%)、莲花控股(拟增资 ≤3 亿元) | 供应商反向入股是他们锁算力的标准动作——对你们的合作结构设计有参考价值(见 7.4)。但这两家的具体数字都需打折,见 10.1 |
| 终端 ODM | 华勤技术、龙旗科技 | 华勤同时是 STEPX Neo 手机的代工方,深度绑定 |
| 芯片器件 | 豪威集团(图像传感器 CIS) | 多模态战略的上游 |
| 通信终端 | 中兴通讯 | 既是股东也是模型落地的终端厂商 |
| 车 | 千里科技 / 吉利系;阶跃持股智跃千里 50% | 印奇两边都是决策人,是最短的侧翼路径 |
| 国资 / 险资 | 上海国投及先导基金、浦东创投、徐汇资本、无锡梁溪、厦门国贸、国寿股权、HKIC(港版淡马锡,阶跃是其唯一直投的生成式 AI 大模型公司) | 国资领投 + 港股上市 ⇒ "国产算力对齐"对他们有超出技术层面的战略价值 |
| 财务 | 腾讯(连续三轮)、五源、启明、顺为、联想创投 | 腾讯性质被媒体描述为"从财务转向深度协同",但云资源层面的安排未公开【缺口】 |
估值在六小虎里的位置(第三方汇总,2026-05):智谱约 580 亿美元 > DeepSeek 约 515 亿 > MiniMax 约 320 亿 > 月之暗面约 200 亿 > 阶跃约 100 亿美元。第三方给出的归因是"阶跃目标估值最低,因为在 Coding 市场缺位"【媒体,非官方观点】。同期格局:智谱、MiniMax 已于 2026 年 1 月先后登陆港股;零一万物转向保守/垂直;百川放弃通用大模型转 AI 医疗。
月之暗面的 2026 策略是"K3 等效 FLOPs 至少提升一个数量级"——用堆算力打智能上限;阶跃选的是效率 + 场景纵深(更省的架构 + 终端落地)。后者对外部算力优化服务的需求强度显著高于前者。如果你们同时在看这两家,阶跃是更契合的客户。
模型矩阵已定型为 Pro / Flash / Edge 三层(Pro 跑复杂推理、Flash 跑高频 Agent 工作流、Edge 部署到手机与汽车)。2026 年的关键动作是三个:2 月开源 Step 3.5 Flash(196B 总参/约 11B 激活、256K 上下文、350 tok/s、Apache 2.0,发布两天登 OpenRouter Trending 榜首);5 月开源 Step 3.7 Flash(196B + 1.8B ViT、最高 400 tok/s、三档推理等级);7 月发布 STEPX Neo 智能体手机 + Step AOS 操作系统(华勤代工,WAIC 2026"镇馆之宝",唯一通过首批国标 L3 级测试的智能体手机,但截至发布未量产、未定价)。未找到 Step-4 的任何公开发布信息——2026 年走的是 3.x 迭代 + 终端 OS,而非版本号大跃进【缺口】;但官方已确认"Step 4 训练已启动"(2026-02)。
收费模式是"端 + 云":端侧按 License 收费,云侧按消耗计费。汽车侧与千里科技/吉利做 AgentOS 座舱,吉利银河 M9 上市三个月近 4 万台,2026 年"上车"规模预计超百万辆。内容侧一个可引用的成本案例:三七互娱把游戏 CG 制作接入 Step-Video,单项目成本降低 40%。toC 侧则在收缩——冒泡鸭 2025 年 6 月停运,转向 PC 桌面与企业场景。【确认】
公开点名的风险(媒体分析):"收入结构可能高度依赖少数头部手机与汽车厂商",且"若在垂直行业 Know-how 与低功耗推理优化上未能持续迭代,技术护城河可能被快速抹平"——后半句几乎是替你们写的需求说明书。
这一节回答两个问题:他们到底有多少算力、以及这些算力是怎么来的。
这是全报告最需要先说清的一条结构性事实。阶跃已公开披露的训练基础设施是 NVIDIA H800 集群——节点间 RoCEv2 1.6 Tbps 互联,自建机房与云上算力并用,具备万亿参数训练能力,千亿模型训练 MFU 57%(作为对照,Llama 2 70B 公开口径约 45%——这个数字本身就说明他们的训练 Infra 水平很高)。而所有国产芯片合作的公开表述,无一例外都是"推理适配 / 推理部署 / 推理验证",没有一条提到训练。【确认】
① 如果你们的核心卖点是"国产卡训练效能优化",那么阶跃当下并不是这个能力的买家——他们的训练还在英伟达上,而且自己做得不错(MFU 57%)。② 真正的需求在推理侧:国产卡推理适配、单位 Token 成本、端侧部署。你们的提案权重必须相应调整。③ 但有一个伏笔值得盯:昇腾官方稿写明"为 Step 4 模型开发提供技术支持",而 Step 4 训练已于 2026 年 2 月启动。如果 Step 4 有任何环节要落到昇腾上训练,那就是国产卡训练需求真正出现的时刻——这是本案最值得追踪的单一变量(见 9.2 尽调问题)。
怎么读这张图。1.7 万 P 是流传最广的量化锚点,来自中贝的投资者关系记录与财经自媒体转述,不是阶跃自己说的。口径上有两重不确定:该数字未说明精度(FP16/FP8/INT8)与卡型;更重要的是券商研报库对这组数字零命中——卖方口径下阶跃只是中贝的四家并列客户之一,15,000P 也是中贝全公司数字(见 10.1)。稳妥的表述是「阶跃是中贝智算业务的主要客户之一」。三层结构合起来指向一个判断:阶跃是"轻资产用算力"的模式——用股权和订单去锁供给,而不是自己重资产建集群。这与月之暗面"现金超百亿、堆 FLOPs"的路线形成鲜明对比。【确认 + 推断】
未找到的项目【缺口】:阶跃自有 GPU 卡数与卡型比例;单次训练成本、年度算力支出、融资中算力占比;与阿里云/腾讯云/火山引擎的公开算力协议(腾讯是股东但云资源安排未披露);阶跃作为采购方的招投标公告;港股招股书全文及其中的资本开支明细。
证据一:CTO 自己说的。朱亦博在 WAIC 2026(2026-07)的公开表述:"我们怎么用三倍的算力支持了一千多倍 Token 呢?现在还是非常紧张的状态"、"模型设计和软件设计要能够在单位算力下压榨出更多的智能"、"我们通过模型结构设计、软件优化,针对国产芯片的适配"。这三句话是本报告里最直接的需求信号,建议在会面时原话引用——它证明这不是你们在推销,而是他们自己定义的战线。【确认】
证据二:技术路线全部指向省算力。MFA 压 KV Cache、AFD 拆解码、视觉侧把 token 数压到 1/16、视频侧 VAE 做 16×16 空间 + 8 倍时间压缩、Step3-VL-10B 用 10B 参数达到官方称 100B–200B 级效果。一家公司的架构创新全都朝一个方向走,说明那个方向就是它的痛点。
证据三:外部环境反向恶化。2026 年行业从集体降价反转为集体涨价(智谱 GLM-5-Turbo 上调 20%、腾讯云某模型输入价 +463%、阿里云算力卡 +5%–34%),原因是全球 AI 需求爆发与上游内存供应紧张,有业内判断内存产能调整至少到 2027 年底才缓解。同时 Agent 场景的 token 消耗是传统问答的 4–15 倍——而阶跃同时押注 Agent 与多模态两个高消耗方向。结论:算力效率优化的商业价值在 2026–2027 这个窗口被显著放大。【确认 + 推断】
这一节是你最想知道的部分。结论是:热度真实,但深度比外界想象的浅——而这个"浅"恰恰是你们的机会。
华为与哈勃未出现在任何一轮公开股东名单中。B+ 轮由上国投先导基金领投,Pre-IPO 轮是中兴、华勤、龙旗、豪威等终端产业链资本。这意味着华为对阶跃没有股权约束力,双方是纯业务关系——对你们是好消息:不存在"华为不许别人碰"的排他结构。
昇腾官方稿与所有检索到的报道中,均未出现联合实验室、联合创新中心一类的机构化安排。对比参照:阶跃与壁仞、上海仪电是有"人工智能联合实验室"的。即:昇腾并不是阶跃合作最制度化的那家芯片厂。
未找到任何 Step 模型部署在 CloudMatrix 384 或 Atlas 950 超节点的公开案例;也未找到 Step 上线华为云 ModelArts / 昇腾云 MaaS 的记录。昇腾适配后的落地平台是魔乐社区(天翼云+华为共建),不是华为云 MaaS。华为公开点名的超节点标杆模型是 DeepSeek 系列,不是 Step。
怎么解读这三个"没有"。它们共同指向一个判断:昇腾与阶跃的关系是"高调的技术互捧 + 低度的组织耦合"。昇腾需要旗舰模型来证明自己的生态(尤其是 Agent 场景),阶跃需要国产算力叙事来支撑国资背景与港股故事,双方在宣发上互相成就——但没有走到资本、实验室、云平台深度绑定的程度。对你们的含义是明确的:这里没有排他性壁垒,第三方专业团队完全有空间插进来做实事。【推断】
"昇腾将全程相伴,持续发挥全栈优势,为 Step 4 模型开发提供技术支持。"
这句话有三层信息。① 它出自华为官方渠道,是承诺性表述,不是媒体推测。② 措辞是"为模型开发提供技术支持",并未说 Step 4 在昇腾上训练——不能过度解读。③ 但阶跃已于同期确认"Step 4 训练已启动"。把这两条并起来看:如果 Step 4 有任何训练环节落到昇腾上,那就是"国产卡训练需求"在这家公司真正出现的时刻——而那恰好是你们团队最核心、最稀缺的能力(万卡级国产卡训练 + 精度对齐)。这是本案唯一一个"从推理需求升级为训练需求"的可能路径,也是你们应该长期盯住的单一变量。
对照行业背景:媒体普遍观察到国内厂商的做法是"把英伟达存量高端卡集中用于极少数超大模型预训练,把国产卡大规模投向推理与微调"。阶跃目前完全符合这个模式。所以在会面中,不要假设他们已经在国产卡上训练——问,而不是假定。
这是你们进场阻力最小的现成通道,但也要看清它的真实成色。
2025 年 7 月 25 日,Step 3 发布会同场,阶跃星辰联合近 10 家厂商发起"模芯生态创新联盟"。首批 9 家成员:
| 类别 | 成员 | 对你们的意义 |
|---|---|---|
| 芯片厂商(7 家) | 华为昇腾、沐曦、壁仞科技、燧原科技、天数智芯、寒武纪、摩尔线程 | 你们的国产卡能力覆盖面正好对上 |
| 算力平台 / 基础设施(2 家) | 无问芯穹、硅基流动 | 关键先例:第三方算力优化/推理服务商已经在联盟里了——你们不需要说服他们"为什么要用外部团队" |
联盟自述目标是"打通芯片、模型和平台全链路技术,通过底层联合创新提升大模型适配性和算力效率",三方分工为:芯片方提供算力、模型方提供硬件友好的架构、平台方负责调度与部署优化。CTO 朱亦博明确表示联盟是"非垄断的",欢迎 Qwen、DeepSeek 等竞品模型参与。发布会圆桌罕见集齐四位国产芯片一号位(沐曦陈维良、天数智芯盖鲁江、燧原赵立东、壁仞张文),媒体普遍解读为国产芯片阵营为"缺模型场景"寻找旗舰参考负载。【确认】
两处需要更正的常见误解:①清程极智不在联盟成员名单中(所有检索到的名单均无);②阿里平头哥与海光信息也不是首批成员,它们是后来出现在适配名单里的,且未见"加入联盟"的正式公告。
| 时间 | 模型 | 公开宣布完成适配的厂商 |
|---|---|---|
| 2025-07-25 | Step 3 | 昇腾(首先搭载运行);沐曦、天数智芯、燧原(初步运行);其余在做 |
| 2026-02-02 | Step 3.5 Flash | 华为昇腾(0day)、沐曦、壁仞(Day0)、燧原、天数智芯、阿里平头哥 |
| 2026-05-29 | Step 3.7 Flash | 壁仞(Day0,壁砺™166M)、沐曦(Day0,曦云C系列)、天数智芯、海光信息(当日全流程适配+深度优化)——昇腾缺席 |
三个观察,每一个都是你们的机会。
联盟的组织形态是信息缺口:未见法人实体、章程、治理结构、轮值机制或联合技术委员会。目前看更接近开放联合宣发 + 适配协作的松散联盟——这对你们是好事,意味着加入的门槛主要是"能干活"而非"够资格"。
这一节读完,你就知道在他们的技术人面前该说什么、不该说什么。全部基于论文原文(arXiv:2507.19427)与开源仓库实际内容,不采信媒体转述。
MFA(Multi-Matrix Factorization Attention)的结构是:每层 64 个 query head 共享 1 个 K head 和 1 个 V head,head dim = 256——一种低秩分解式注意力。媒体普遍宣传它"大幅压缩 KV Cache",但论文的实际数据要克制得多:
| 指标(8K 上下文) | Step-3(MFA) | DeepSeek-V3(MLA) | Qwen3(GQA) |
|---|---|---|---|
| KV Cache 大小 | 2.56×10⁸ B | 2.88×10⁸ B | 7.89×10⁸ B |
| 注意力计算量(不含线性投影) | 3.27×10¹⁰ FLOPs | 1.47×10¹¹ FLOPs | — |
⚠️ 一个媒体常见的混淆,你在会面时不要踩:外界广泛引用的"降至 DeepSeek-V3 每 token 注意力成本的 22%"对应的是算力项(3.27e10 ÷ 1.47e11 ≈ 22%),而 KV Cache 相对 MLA 只少约 10%——论文自己就承认了这一点。把两个数字混为一谈,会立刻暴露你只看了通稿。
论文真正的核心论证在算术强度(arithmetic intensity)上,这也是你们团队最应该共鸣的一段:
为什么这一段对你们特别重要。因为它说明阶跃的技术团队是用 roofline 思维在设计模型的——他们不是"训完再让芯片厂适配",而是在架构阶段就把硬件的算力/带宽比算进去。这意味着你们和他们说话可以直接进深水区,不需要科普;同时也意味着任何停留在"我们能做算子优化"层面的泛泛而谈都不会打动他们。另一条相关工程结果:8×48GB 显卡即可完成大吞吐推理——对普遍 48–64GB 显存的国产卡有直接意义。
AFD(Attention-FFN Disaggregation)把解码阶段拆成两个子系统:Attention 子系统(数据并行、持有 KV Cache、向外流式发送量化后的激活)与 FFN 子系统(张量/专家并行、做 MoE 与 dense FFN),形成"Attention → 通信 → FFN"三段流水。
PD 分离切的是"阶段"(prefill vs decode);AFD 切的是解码内部的"算子类型"。收益是两侧可以各自选硬件、各自选并行策略:FFN 侧的 batch size 不再被上下文长度绑架,attention 侧可随上下文独立扩容。实测结果:Hopper 上 4K 上下文 / FP8 / 50ms TPOT SLA 条件下达 4,039 tokens/GPU/s(32 卡),为 DeepSeek-V3 同条件 2,324(128 卡)的 174%;部署规模从 DeepSeek 大规模 EP 的 320 卡量级降到 32 卡。
他们还开源了配套的通信库 StepMesh(Apache 2.0):基于 GPU Direct RDMA,异步 API 把通信与计算解耦,NUMA 亲和的 CPU 核绑定 + 张量预注册,单次通信延迟控制在 272 µs 以内且不占用 GPU 计算资源;对外暴露统一的张量传输接口与后端抽象层,官方定位是"实现异构加速器间的无缝通信""跨硬件的标准部署接口"。
我们查了仓库的实际内容:StepMesh 已实现的后端只有 RDMATransport / CPUBackend / GPUBackend,另有一个名为 xPUBackend 的占位(placeholder),至今没有昇腾 NPU 后端。同时,Step3 的 GitHub README 只推荐 vLLM 与 SGLang,全文不提昇腾、CANN、MindIE 或任何国产加速器,也无芯片厂商致谢。而 vLLM 社区的同类特性(ATTN-FFN Disaggregation)至今仍停在 RFC 阶段。
这三条合起来说明一件事:阶跃提供的是"硬件中立的架构 + 抽象接口",具体的国产卡后端要由各芯片厂在自家软件栈里各自实现,并未回流到阶跃的开源仓库。于是出现了一个非常具体、可指名、可验证的空白——他们自己发明的最先进架构,在国产卡上没有可用的通信后端实现。这就是你们的敲门砖(具体怎么用见 7.2 与 8.3)。
| 数字 | 口径 | 使用建议 |
|---|---|---|
| 解码吞吐 4,039 tok/GPU/s,= DeepSeek-V3 的 174% | 论文实测,Hopper GPU | ✅ 可放心引用,注明硬件与 SLA 条件 |
| 32 卡 vs DeepSeek-V3 的 128 卡(4K 上下文) | 论文 | ✅ 可引用,这是他们最自豪的数字 |
| 解码成本 0.055 美元/百万 token | H800 口径;另有 H20 $0.040、A800 $0.040、昇腾 910B $0.043 | ⚠️ 这些跨硬件成本大量是理论/建模值,论文主部署目标写的是 Hopper;论文没有给出任何昇腾实测结果 |
| "在 H800 上吞吐比 DeepSeek-R1 提升超 70%" | 有明确硬件口径 | ✅ 可引用 |
| "在国产芯片上推理效率最高可达 DeepSeek-R1 的 300%" | 从未点名是哪款国产芯片、未公布测试方法 | 🚫 不要在技术场合引用这个数字。结合论文成本表,H20 一列的成本比恰好约 3.2 倍(0.128÷0.040),更可能来自中低带宽卡的成本建模而非国产卡实测【推断】。你若引用,对方技术人一问方法论就穿了 |
中文发布会与媒体的框架是"为国产芯片设计模型",甚至有"国芯+国模双擎驱动"的说法。但arXiv 论文原文的自我定位是"为更便宜但更弱的硬件(more affordable but weaker hardware)优化解码成本",正文没有出现"国产芯片专门优化"的表述。Flash 系列的 README 提到的硬件反而是 Mac Studio M4 Max、NVIDIA DGX Spark、AMD via llama.cpp Vulkan。
这个落差不是"他们在骗人",而是一个精准的合作信号:他们的架构设计确实对国产卡有利(算术强度落点是真的),但"落到具体国产卡上把性能榨出来"这件事他们并没有自己做——他们做的是硬件中立的上层设计,把最后一公里留给了芯片厂和生态伙伴。那个"最后一公里"就是你们的业务。
如果你带着 Step-3 的 MFA/AFD 去谈,可能会显得慢了半拍。Flash 系列的官方 README 中已不再突出 MFA,"芯片友好"的叙事载体转移到了 稀疏度 + 滑动窗口注意力 + 多 token 预测:
这个转移对你们的含义:极高稀疏度(196B 总参只激活 11B)+ 288 个专家 + SWA/full 混合 + MTP,这套组合在国产卡上的落地难度比 Step-3 更高——专家并行的 all-to-all、混合注意力的两套内核、MTP 的推测式验证逻辑,每一项都是需要按硬件重写的活。你们的机会随模型迭代在变大,不是变小。【推断】
每一条都附证据来源与强度,方便你在会面中直接使用。
| # | 缺口 | 证据 | 强度 |
|---|---|---|---|
| 1 | StepMesh 缺国产卡后端 | 仓库实现仅 RDMA/CPU/GPU 三种后端,xPUBackend 为占位;Step3 README 不提任何国产加速器;vLLM 同类特性仍是 RFC | 最强:可代码级验证,且指向他们自己的核心架构 |
| 2 | 国产卡适配的长尾产能 | Step 3 → 3.5 → 3.7 每代重做;9 家联盟成员中寒武纪、摩尔线程、无问芯穹、硅基流动无公开产出;多模态适配面临 vLLM/PyTorch/驱动的"版本地狱" | 强:结构性、周期性、纯人力密集 |
| 3 | 端侧与语音实时推理 | 公开在招"端侧推理""语音推理引擎""RL"方向的推理优化工程师;Edge 是三层矩阵中最新的一层;STEPX Neo 手机 + 百万辆上车是硬需求 | 强:招聘岗位直接证明内部产能不足 |
| 4 | 跨硬件可比测评与统一基准 | 联盟各厂商只发"完成适配"通稿,极少给绝对性能值;无跨厂商统一性能榜或联合报告 | 中强:这是联盟缺失的公共品,谁做谁受益 |
| 5 | 视频/多模态推理成本 | 扩散类推理成本比 LLM 高"几个数量级"(Sora 级测算);分辨率非线性(256px→768px 约 10 倍 token);Step-Video 停在 540P,官方建议 80G 显存;对照:有开源工作 11B 模型仅 224 卡拿视频 SOTA | 中:成本量级最大,但缺阶跃自身的成本数据【缺口】 |
| 6 | IPO 前后的单位经济叙事 | 正冲港股;分成 30%–60% 下成本直接进毛利;被点名"若在低功耗推理优化上未持续迭代,护城河可能被抹平" | 中:时机极好,但属商务价值而非技术缺口 |
同时要清楚他们不缺什么:不缺训练框架能力(H800 集群千亿模型 MFU 57%)、不缺集群工程经验(CTO 做过多次万卡级)、不缺模型-系统协同设计能力(MFA/AFD 是论文级贡献)、不缺通信库基础(StepMesh 自研且开源)。把提案压在这四项上,等于自找难看。
这是整份报告的落点。先定位,再选切入点,最后谈钱——顺序不能反。
①"我们只做你们不划算自己做的那一段。"——承认对方 Infra 强,主动划边界。
②"我们按你们已有的指标口径交付。"——沿用他们自己的 tokens/GPU/s、TPOT SLA、单位 token 成本,不另立标准。
③"先做一件小的、可验证的事。"——把第一次合作压到可验收、可复算的最小单元。
①"我们帮你们把 Infra 搭起来 / 补短板。"——对方 CTO 是前字节 AI Infra 负责人、RoCE 奠基人之一,这句话直接终结对话。
②"你们在国产芯片上效率是 DeepSeek-R1 的三倍"(引用他们自己的宣传数字)——这个数字没有公开的测试方法与芯片型号,一问就露。
③"我们有万卡训练经验,可以帮你们训模型。"——他们的训练在 H800 上、MFU 57%、自己做得很好,且这不是当前痛点。
为什么定位比内容重要。阶跃的技术团队用 roofline 思维设计模型(见 5.1),他们对"泛泛谈优化"的免疫力极强。你的专业性不体现在你会什么,而体现在你准确说出了他们哪里没做、以及你为什么知道。下面三个切入点都具备这个特征:每一个都能用一句可验证的事实开场。
"我们看了 StepMesh 的仓库,后端只实现了 RDMA、CPU、GPU 三种,xPUBackend 还是个占位。AFD 这套架构在国产卡上目前没有可用的通信后端——我们想把这一块补上,先用一款卡做出可跑的实现给你们看。"
为什么这是最好的敲门砖:
执行建议:先自费做一个最小可用实现(MVP)——单机多卡、一款主流国产卡、跑通 Attention 与 FFN 两侧的张量收发,给出 272 µs 这个官方基线的对照延迟数据。带着能跑的代码去,而不是带着 PPT 去。这笔投入换的是一张进门的门票,性价比远高于任何 BD 动作。
第 4.2 节的观察四指出:联盟九家厂商只发"完成适配"通稿,几乎不给可比的性能绝对值,也没有跨厂商统一榜单或联合报告。这对阶跃是真实的痛——他们无法回答"我的模型在哪款国产卡上跑得最好、成本最低"这个问题,而这个问题直接关系到他们向客户推荐部署方案、以及对外讲成本故事。
对阶跃:拿到自家模型在各款国产卡上的可比数据,用于部署选型与对外叙事(尤其 IPO 期间的单位经济故事)。对芯片厂:拿到第三方中立的性能背书,比自说自话的通稿有力。对你们:谁定义度量口径,谁就是这个生态里的技术权威——而且做基准的过程会自动暴露每款卡的优化机会,直接生成后续的项目清单。
做法:以 Step 3.5 / 3.7 Flash 为标准负载,在 2–3 款国产卡上按统一 SLO 口径(TTFT / TPOT / 单卡吞吐 / 单位 token 成本,见技术教材第 7 章的四指标)出一份公开或半公开的对照报告。注意分寸:不做"排名羞辱",只做同口径事实呈现,并把每款卡的优化空间写成建设性建议。这样芯片厂不会敌视你,反而会来找你。
公开招聘岗位是最诚实的需求信号。阶跃在招的推理优化岗明确细分了端侧推理与语音推理引擎两个方向,这与三个战略事实完全对应:Edge 层是 Pro/Flash/Edge 矩阵里最新的一层;STEPX Neo 智能体手机 2026 年 7 月刚发布、尚未量产;汽车侧 2026 年"上车"规模预计超百万辆;而 Step Audio R1.1 已经是登顶榜单的产品,实时语音对时延与成本极度敏感。
| 方向 | 具体可交付的活 | 你们的优势匹配度 |
|---|---|---|
| 端侧推理(手机/车规芯片) | 模型压缩与量化(端侧对精度损失容忍度更低)、算子在端侧 NPU 上的重写、内存与功耗约束下的调度、端云协同的切分策略 | 高——但要确认你们是否有端侧芯片(手机 SoC NPU、车规芯片)的实战经验,这与数据中心卡是两套手艺 |
| 语音实时推理 | 流式推理的时延优化、首字时延压缩、小 batch 下的算子效率、语音特有算子(声码器、流式注意力)的优化 | 中高——通用推理优化能力可迁移,语音特有部分需要补 |
| RL 后训练 Infra | 他们也在招 RL 方向;对应技术教材第 8 章的训推一致、异步 rollout、权重重分片 | 极高——这是你们的强项且极稀缺,但需确认阶跃的 RL 规模是否已到需要外部支援的程度 |
诚实提示:如果你们的实战积累主要在数据中心级国产卡(昇腾等),端侧不要硬接。手机 SoC 的 NPU、车规芯片的工具链与约束条件完全不同,接了做不好会毁掉信任。建议的做法是:把端侧作为"了解需求、建立关系"的话题,把实际承接押在数据中心侧的适配、基准与 StepMesh 后端上。
扩散类推理成本比 LLM 高"几个数量级",Step-Video 停在 540P 暗示成本约束。价值最大但证据最弱——缺阶跃自身的成本数据【缺口】。适合作为技术交流话题,探他们的真实痛点。
加入"模芯生态创新联盟"是阻力最低的建立信任方式(联盟非排他、且已有第三方成员)。但注意:联盟无章程无治理,加入本身不带来订单,只带来身份与信息。当作辅助动作,不要当作主路径。
星睿智算中心 2.0(万卡级、23.5 EFLOPS)是阶跃实际算力来源之一,印奇同时是千里科技董事长,决策链短。可作为平行入口:先服务算力持有方,再顺流到阶跃的负载。
昇腾官方承诺"为 Step 4 模型开发提供技术支持",Step 4 训练已启动。这是唯一可能把需求从推理升级到训练的路径,也是你们能力最强的战场。现在还不到时候,但要在每次接触中埋线索、盯进展。
阶跃的股东结构给了一个很强的暗示:他们锁供给的标准动作是"供应商反向入股"(中贝通信 0.81%、莲花控股拟增资 ≤3 亿元,公告原话是关系从"供应商—客户"升级为"股东—生态伙伴")。这说明他们习惯用股权/长约换确定性供给。但对你们这个阶段,建议反过来走——先服务、再谈绑定:
| 阶段 | 形式 | 建议条款 |
|---|---|---|
| 第 0 步(0–1 个月) | 自费 MVP + 技术交流 | 不谈钱。目标是把 StepMesh 国产卡后端的最小实现跑出来,换一次与 CTO 级别的技术对话。这一步的投入应视为市场费用。 |
| 第 1 步(1–3 个月) | 小额付费 PoC | 单一目标、单一硬件、验收指标写死(沿用他们的口径:单卡吞吐 / TPOT / 单位 token 成本)。金额建议压在几十万级——低到不需要复杂审批,高到证明这是商业行为而非免费劳动。含转正条款。 |
| 第 2 步(3–9 个月) | 项目制 / 年度框架 | 按"每代模型 × 每款硬件"的适配矩阵定价,或按年度效能框架 + 驻场包。此时才引入"效能提升分成"这类结构性条款。 |
| 第 3 步(远期) | 深度绑定 | 可考虑他们熟悉的形式(长约锁量、交叉持股、联合实验室——注意昇腾都还没有联合实验室,而壁仞与上海仪电有,说明这个位置是开放的)。 |
阶跃 2025 年收入近 5 亿、尚未盈利、正在冲 IPO——他们对"能写进成本下降曲线"的支出敏感度很高,对"看不出直接回报"的支出容忍度很低。所以定价逻辑不要按人天,而要按可量化的成本节约:如果你们能证明某个负载的单位 token 成本下降 X%,而他们年化该负载的算力支出是 Y,那么报价的锚点就是 X×Y 的一个分成比例。这套话术他们一定听得懂,因为这正是他们对自己客户讲的故事。
具体到人、通道、开场三分钟说什么。
| 对象 | 用于什么 | 接触逻辑 |
|---|---|---|
| 朱亦博(CTO) | 技术决策,主目标 | Infra 主线的最终判断者。他会在三分钟内判断你是不是同行。必须由你们的技术负责人直接对话,商务人员不要主谈。 |
| 系统/推理团队工程师 | 建立技术信任的第一跳 | 通过开源仓库的 issue / PR、技术社区、招聘渠道(hatcher@stepfun.com 是公开投递邮箱,可作为工程侧非正式触点)建立联系。一个高质量 PR 比十封 BD 邮件有效。 |
| 印奇(董事长) | 商务与战略层 | 兼千里科技董事长,决策链最短。适合谈"体系内合作"(吉利算力中心 + 阶跃负载 + 你们的优化)这种跨主体结构。但技术未过关之前不要走这条线——自上而下压下来的合作,技术团队会消极对待。 |
| 联盟成员(芯片厂) | 侧翼与背书 | 沐曦、壁仞、天数智芯、海光都在积极做 Step 适配且都缺深度优化人力。先帮芯片厂把 Step 模型跑好,再由芯片厂把你们带到阶跃面前——这是阻力最小的路径,且能同时拿到两个客户。 |
"我们是做国产卡上的训练与推理效能优化的,先说两句你们的东西,你判断我们是不是同行。
第一,Step-3 那篇论文里我们最认的不是 KV Cache 少了 10%,是把 MFA 的算术强度做到 128——正好卡在 H20 的拐点 74 和 H800 的 591 之间。这是用 roofline 反推模型结构,我们做优化的人一看就知道这是内行做的。
第二,我们看了 StepMesh 的仓库:后端只有 RDMA、CPU、GPU,xPUBackend 还是占位。也就是说 AFD 在国产卡上目前没有可用的通信后端,而 vLLM 那边的 ATTN-FFN 分离还在 RFC。我们想把这块补上,自己出人出机器先做一个能跑的最小实现,拿延迟和吞吐数据来跟你们的 272 µs 基线对。
我们不碰你们已经做得很好的部分——训练框架、集群工程、模型-系统协同设计,这些我们不插手。我们只想接你们不划算自己做的那段:每代模型乘每款国产卡的适配长尾、跨硬件的可比基准、以及国产卡上的通信与算子深度优化。"
为什么这个开场有效:前两段证明你读过论文和代码(而不是通稿),第三段主动划出边界、消除威胁感,第四段把需求说成他们的选择而不是你的推销。全程没有一句自我夸耀,但每一句都在展示能力。
合作前该担心什么、该问清什么、以及这份报告哪些地方不确定。
这是最大的风险。CTO 是前字节 AI Infra 负责人,系统团队称有 40 余位顶尖系统专家。他们随时可以决定"这活我们自己干"。对策:切入点必须选在他们做了不划算的长尾(适配矩阵、跨硬件基准),而不是他们做不了的核心(那种东西不存在);并且要快——用速度换空间。
他们的训练在 NVIDIA H800 上、MFU 57%,国产卡合作全是推理。你们最强的能力(国产万卡训练、精度对齐)当下没有用武之地。对策:接受这个现实,先用推理侧能力进门;把 Step 4 是否上国产卡训练作为长期观察的单一变量。
国产卡的适配活,芯片厂自己也在做(且有动力自己做,因为这是他们证明生态的方式)。壁仞称适配效率相比手工提升 4–5 倍,说明他们在建自动化能力。你们可能被夹在模型公司与芯片厂之间。对策:定位成芯片厂做不深的那一层(跨硬件对比、通信后端、深度调优),并考虑同时把芯片厂当客户而非对手(见 8.2 第 2 条通道)。
正在冲港股,这既是机会(成本故事有价值)也是风险:IPO 静默期与合规审查会让新增供应商的流程变慢,大额合同尤其敏感。对策:第一单压小(几十万级),避开需要董事会或复杂审批的金额区间。
你们团队的正式交付要到 2026 年 10 月起(静默期)。而阶跃的模型迭代周期是三到四个月一代(3.5 Flash 2 月、3.7 Flash 5 月),错过一个窗口就要等下一代。对策:静默期内把开源贡献做出来(这不受竞业限制影响,是个人技术贡献),10 月一到立刻承接。
| # | 问题 | 为什么重要 |
|---|---|---|
| 1 | Step 3.7 Flash 在昇腾的适配状态?为什么公开名单里缺席? | 判断昇腾关系的真实温度,以及是否存在你们能补的空位 |
| 2 | Step 4 的训练算力配置,是否包含国产卡? | 决定你们最强能力的启用时点 |
| 3 | 国产卡适配当前由谁做、投入几人、每代耗时多久? | 量化可外包的工作量,也是报价依据 |
| 4 | 内部的优化收益口径是什么(单卡吞吐 / TPOT / 单位 token 成本)? | 所有方案与验收都要按他们的口径写 |
| 5 | StepMesh 的国产卡后端有没有内部计划或已有伙伴在做? | 避免撞车——这是你们首选切入点,必须先确认无人占位 |
| 6 | 与联盟内芯片厂的分工边界在哪?哪些活他们期望芯片厂做、哪些期望第三方做? | 决定你们与芯片厂是竞争还是协作 |
| 7 | 端侧(手机/车规)目前最大的技术卡点是什么? | 判断你们是否真的能接,避免硬接做坏信任 |
| 8 | 合作的采购与结算流程、IPO 期间是否有特殊限制? | 避免方案通过了但流程走不动 |
以下内容检索未见公开数据,不要在会面中当作已知事实使用:
| 常见说法 | 实际情况 |
|---|---|
| "清程极智是模芯生态创新联盟成员" | 不是。所有检索到的成员名单中均无清程极智。首批 9 家是:华为昇腾、沐曦、壁仞、燧原、天数智芯、寒武纪、摩尔线程、无问芯穹、硅基流动。 |
| "阿里平头哥、海光信息是联盟成员" | 不是首批成员。它们是后来出现在 Step 模型适配名单中的厂商(平头哥在 3.5 Flash、海光在 3.7 Flash),未见"加入联盟"的正式公告。 |
| "Step-3 的 KV Cache 比 DeepSeek-V3 少很多" | 只少约 10%(论文自述)。被广泛引用的"22%"是注意力算力项,不是 KV Cache 项。混用会暴露只读了通稿。 |
| 「中贝通信为阶跃独家供应 1.7 万 P、约 40 亿元订单」 | 券商研报库零命中。卖方唯一披露是阶跃为中贝四家并列客户之一,15,000P 为中贝全公司口径(见 10.1 更正一)。 |
| 「莲花控股是阶跃的算力供应商 / 深度绑定」 | 2026-05 确有增资公告,但东吴深度报告里的「星」是子公司莲花紫星、客户是智谱而非阶跃;且莲花算力收入已连续三季下滑、战略转向半导体(见 10.1 更正二)。 |
| 「华勤技术为 STEPX Neo 代工」 | 华勤 27 篇、龙旗 6 篇研报中均无「阶跃/STEPX」字样,仅有媒体来源,无卖方或公告级确认(见 10.1 更正三)。 |
这一章来自券商研报库的独立检索(2025 年起 141 篇个股研报 + 20,055 篇行业研报索引,剔除假阳性后真正提及阶跃的 44 篇)。它既补充了产业链经济数据,也推翻了前面章节里三处来自自媒体的说法——这类交叉验证正是尽调的价值所在。
券商侧的实际披露要克制得多。中贝通信在 2025-01-01 之后只有一篇个股研报(华鑫证券《中贝通信:主业经营稳定,算力业务开始发力》,2025-05-11),其中:
怎么理解这个矛盾。那些数字来源于中贝的投资者关系记录与财经自媒体(东方财富财富号一类)的转述,可能确有其事,但尚未进入卖方研究视野——而且此后 15 个月中贝零个股研报覆盖,对照同期算租同业(行云科技、利通电子、智微智能)均有密集覆盖与业绩预告,这个覆盖真空本身不正常。结论:在与阶跃或任何第三方沟通时,不要把"1.7 万 P 独家 / 40 亿元"当作既定事实引用;可用的稳妥表述是"阶跃是中贝智算业务的主要客户之一"。
东吴证券的深度报告标题《从调味品到算力,莲花向"星"别样红》里的"星"指的是子公司莲花紫星(莲花科创与星临科技合设),不是阶跃星辰;紫星披露的客户名单是"中国联通、中国移动、中国电信、深信投、智谱华章、新华三"——是智谱,不是阶跃。
更值得注意的是莲花的算力业务正在萎缩:算力收入 25Q3 −15%、25Q4 −2.9%、26Q1 −38.45%,连续三季下滑;在手订单从 2025 年 3 月的"超 16 亿元"降到 5 月的"超 11 亿元";2026 年公司战略重心已转向半导体(收购深圳纽菲斯 46% 股权)。紫星 2026 年股权激励考核目标营收 6.0 亿元,而 26Q1 仅 0.27 亿元——年化不足目标的 20%。
公允的说明:莲花控股 2026-05-26 确有公告称拟增资阶跃星辰(≤3 亿元),这是公司公告、权威性高;而上述研报都发布于 2026 年 4 月之前,时间上早于该公告,两者并不直接冲突。但研报揭示的一件事很重要:莲花本身的算力业务已在收缩,把它当作阶跃算力供应的重要一环,是过度解读。
我们逐篇检索了华勤技术 27 篇、龙旗科技 6 篇研报,均无"阶跃"或"STEPX"字样。"华勤代工"目前只有媒体来源,没有卖方或公告级确认。在会面中不要拿这件事当谈资——如果对方正在谈判或尚未定案,这会显得你在打探供应链。
顺带一个对判断有用的数字:华勤 2025 年移动终端收入 802.10 亿元(+57.17%)、智能手机 ODM 全球份额约 40%,但整体毛利率只有 7.97%–8.54%。这意味着智能体手机若走 ODM 路线,硬件环节几乎不留利润,价值必须落在操作系统与服务层——这也解释了为什么阶跃要做 StepAOS 而不只是做一台手机。
这是本章最值得你在会面中使用的一组对照。模型侧的价格在暴跌,算力侧的租金在暴涨——两条曲线反向剪开,直接压缩模型公司的毛利:
怎么用这张图。它把"你们为什么需要我们"从一句推销变成了一道算术题:模型侧的定价权在流失(他们自己就是降价的推手——StepAudio2.5 ASR 定价 0.15 元/小时,约为前代的十分之一),而算力侧的议价权在增强。夹在中间的毛利,唯一的补法就是提高单位算力的 token 产出。这也是他们 CTO 那句"用三倍算力支持一千多倍 Token、现在还是非常紧张的状态"的财务翻译。
| 数据 | 来源 | 对你们的用法 |
|---|---|---|
| 中贝智算毛利率 41.04%(2024) | 华鑫证券 2025-05-11 | 最有价值的一个数字。阶跃付出的算力单价里约四成是供应商毛利——这是他们向下压价的空间上限,也是你们主张"优化省下的钱远大于服务费"时的参照系 |
| 算租折旧假设:服务器折旧周期 5 年;8 卡 H100/H200 服务器需 10kW 功率柜 | 东吴证券《莲花控股深度》2025-04-21, p.14 | 做 ROI 测算时的标准假设,可直接引用(他们的财务同事认这个口径) |
| 行云科技单机毛利:上半年售 67 台服务器增加毛利约 6,500 万元 → 约 97 万元/台 | 国金证券 2026-07-19, p.3 | 反推算力供应侧的单机经济,用于判断优化服务的定价天花板 |
| 存量合同可上调:行云科技把两份存量协议合并核算后含税租赁总额上调约 79% | 同上 | 说明供方议价权很强——阶跃的算力成本还有上行压力,优化的紧迫性更高 |
| 单笔长单量级:东阳光子公司算力采购 130–150 亿元 / 60 个月 | 同上 | 参照系:说明这个市场的合同尺度 |
| 中国智算规模 2025 年 1,037.3 EFLOPS → 2028 年 2,781.9 EFLOPS(CAGR 46.2%) | 东兴证券引 IDC/浪潮 2025-07-17 | 市场空间的标准口径 |
| 上海目标:2027 年智算规模 200 EFLOPS,自主可控算力占比超 70% | 东吴证券 2025-04-28 | 阶跃总部在上海、国资是大股东——"国产算力对齐"对他们有政策价值,这是你们的隐性加分项 |
Step3.5Flash 在 2026 年 3 月曾冲上榜首、单周 1,520 亿 tokens;但四个月后 Step3.7Flash 只有 1.9T tokens、排名第 8、环比 −64.4%、下降 5 位(同期榜首腾讯 Hy3 为 11.5T)。说明开源模型的调用量高度依赖发布节奏与榜单热度。这会让他们对"降本"更敏感(份额不稳时成本是唯一可控变量),但也意味着他们的预算可能随份额波动。
华鑫证券指出 Step3.5Flash"以极速推理、128GB 内存适配的参数设计获认可……为算力受限的中国大模型企业提供了发展新思路"。一家把"算力受限下的效率"作为差异化的公司,为什么需要与头部同量级的算力?这个问题在他们内部可能也有分歧——你们的方案正好落在"效率"这一侧,是安全的。
华鑫证券在深度报告中直接问:"AI 生成内容到底是在创造增量价值,还是在稀释内容稀缺性?……当底层大模型这一变量震荡,建立在基模之上的产品应用是否可持续能获取用户付费?"(2026-07-20)这类质疑会传导到他们的预算审批上,加强了"第一单要小"的判断。
东吴证券给出 2026/2027/2028 年 PE 314/191/131 倍,而 26Q1 扣非归母净利润仅 0.01 亿元,且列出的第一条风险是"单一客户占比过高"(即吉利)。含义:走千里/吉利侧翼路径时,要意识到那一侧的商业化压力同样巨大,付款能力需要单独评估。
研报库同样存在明确缺口:没有任何一篇给出 AI 手机 BOM 成本拆解、AI 功能渗透率量化预测或智能体手机出货量预测——卖方对这个品类仍停留在事件跟踪,尚未建立量化模型;智算业务的上架率(利用率)指标在所有研报中均未披露。另外,三七互娱接入 Step-Video(单项目成本降 40%)、同方股份/中文在线/豪威与阶跃的关联,在对应公司的研报中全部零命中——这些都是媒体来源,引用时请降低置信度。