国产算力使能赛道全景 · 芯片瓶颈拆解 · 美国公司与券商研报双视角 · 两条业务线的落地路径 —— 为把一门算力优化生意从纸面推进到合同与流水而作。
先用大白话说清楚它做什么、赛道是否成立、公司靠不靠谱、你该怎么切入。
这家公司做什么?你的理解完全正确,而且和公开数据严丝合缝:国内建了大量算力中心,但国产卡(尤其昇腾)适配难、会用的人极少——工信部背景机构信通院的数据显示 2025 年智算中心「用算占比」仅 36.8%[16],腾讯云与浪潮研究院均指出国内智算中心 GPU 平均利用率不足 30%[16],媒体概括为「万亿投资、七成空转」。会把国产万卡集群真正跑起来的人才,集中在华为原厂和字节、美团这类头部大厂,中小厂和央国企根本招不到。Amorphoux 做的就是把这层「会用国产卡」的稀缺能力产品化:向下把昇腾等国产芯片调教到能用、好用(算力使能),向上帮央国企、运营商在国产卡上训练自己的行业大模型(训练服务),并试图用 AI 智能体替代人类专家来交付(Agent 化),突破人力瓶颈。
赛道成立吗?成立,且政策与预算是真实可验证的。2026 年规划落地 50+ 个万卡集群;中国移动 2025–2026 年 AI 推理服务器集采 51.12 亿元中,昇腾 CANN 生态标包独占约 34 亿元[26]——运营商已经把「会不会用昇腾」直接写进标书。美国市场同样验证了这个逻辑:让「非 NVIDIA 芯片好用」的 Modular 估值 16 亿美元[54],靠训练服务起家的 MosaicML 以 13 亿美元卖给 Databricks[39],靠驻场专家交付企业 AI 的 Palantir 2026 年二季度收入同比增长 93%、市值超 4,000 亿美元[56]。
公司靠不靠谱?团队技术履历是这份 BP 最硬的部分:万卡级国产集群训练、MFU(算力利用率)50%+ 的数据可验证性强,训练侧确实是国内竞对(硅基流动、无问芯穹、基流科技)集体薄弱的环节。但要冷静看到:营收预测激进(12 个月从 0 到 2 亿元)、估值要价高(成立 3 个月即要 10 亿元估值)、Agent 化交付目前仍是构想、且「服务过大客户的履历」不等于「公司已签的合同」。这些风险不改变机会本身,但决定了落地方式:必须自带订单与算力资源、快速做出流水(见第五章)。
怎么落地?本版报告按两条独立业务线展开(第四、五章):A 线 · 训练优化服务——首战二梯队大模型民营企业:算力成本是它们的生死线、技术决策快(30–60 天)、案例可公开传播,做出标杆后再携背书进央国企;B 线 · 算力盘活 + Token 售卖平台——以保底消纳承诺换取西部闲置国产算力的长约底价(910B 西部批发行情已低至约 3,000 元/P/月[84]),用自有优化能力提升单位硬件的 Token 产出,再以七折于市场的价格锁定平台客户的包量订单(首个锚定客户亿元级订单意向已在手)。两端都是合同价,利润空间完全由优化能力决定——行业测算显示,同一套硬件,优化前后的单位 Token 成本可以相差 10 倍以上,这正是「暴利与巨亏的分界线」(见 4.3 经济模型)。
赛道真实、时点正确、团队稀缺(含昇腾芯片架构师,见 2.3);这门生意的全部利润 = 利用率与单位 Token 成本的优化空间,恰好是团队最硬的能力。落地关键只有一件事:在技术团队静默期内把两端合同砸实——供给端锁底价(只要 910B 级及以上的卡)、需求端锁订单,团队出关即开工;同时守住合规红线:任何投资行为与算力采购必须相互独立、市场化定价、经得起审计。
本章严格基于 BP v2.0.5 原文归纳,并在末尾给出独立的冷静评估。
BP 的自我定位是「算力 × Agentic Infra × 算力使能基模 × 算力使能智能体」,口号为「Born for AGI. AGI Resource for Every Organization & EveryOne」。它瞄准的是一个供需错配:需求端,AI 应用全面爆发、日均 Token 调用超百万亿,但应用构建大量依赖英伟达芯片——BP 引用 IDC 数据,2025 年中国 AI 加速卡市场英伟达仍占 55%,华为昇腾 20%,其余国产合计约 25%;供给端,英伟达算力进入国内受限,国家力推超大规模智算集群,按相关规划 2026 年将落地 50+ 个万卡集群,3 万卡集群同比增长 233%,10 万卡集群实现从 0 到 1。BP 罗列了 2024 年 2 月至 2026 年 5 月的九项政策节点(国资委央企「AI+」专题推进会、国务院「人工智能+」行动意见、工信部算力标准体系与算力互联互通节点建设、发改委十五五规划与算网融合 34 号文等),论证「未来国产算力会像电力一样无处不在」。
矛盾在于 BP 那句核心判断:「纸面国产算力充沛,算力使能能力不足」。企业买得到国产卡、建得起集群,但跑不起来训练、压不出性能。BP 给出的需求例证包括:招商银行基于 GLM 做「小招」后训练(千卡)、中石油/中石化基于「九天」做石油数据二次训练(千卡)、南网/国网的电网调度潮流计算(千卡)、运营商基模训练(万卡)、蚂蚁的 AI Coding 推理部署(万卡)、银联与交通银行的 GLM 推理部署(百卡)——并断言「企业愿意提供数千万元/年进行训练推理业务」。
BP 把「为什么国产算力用不起来」拆成两个因子相乘:要么开发者够强,要么 Infra 足够好用——目前两头都缺。开发者侧:具备大规模集群实战经验的人才集中在芯片原厂(华为)和头部互联网公司(字节、美团等),薪资高、腰部企业供不起;知识链路纵深(硬件计算—互联—显存—算子—AI 框架—分布式),专家成长周期以年计;且「人力组织不具备 Scaling Law」——堆人不能线性堆出产出。Infra 侧:PyTorch 社区以 CUDA 为一等公民,大量存量代码耦合 NV 后端,模型脚本从 NV 迁到国产常无法运行;Triton 算子因芯片缓存、通信粒度、带宽差异无法直接运行到国产 NPU;多流算子下发顺序导致累计精度误差,同参数配置拿不到一致训练效果;单算子性能从 NV 迁到 NPU 需要以周为单位调优。这一页是全份 BP 技术含金量最高的部分,也与你听到的「适配国产卡困难、利用率很低」完全一致。
BP 的竞争论点是:「推理决定商业化下限,训练决定上限」,而业界集体「缺席」训练——基流科技是算力硬件集群「建筑商」,上层使能不涉及;硅基流动基于 OneFlow 技术班底做自研推理引擎和 Token 工厂,专营推理;无问芯穹主要营收以推理服务为主,训练主打异构算力混合(BP 认为是伪需求)暂无成果。训练之所以门槛高,是因为完整流程(环境准备→精度调试→性能调优→训练负载检测→故障回滚→产出 ckpt)中,精度一致性调试就卡死大部分国产卡训练工作,性能调优涉及编译、分布式、图融合等专业领域,需要超大规模集群实操经验,学习曲线陡峭。第二章会用三家公司的招股书和融资数据独立核实这个论点——结论是基本成立,但「训练市场不存在竞争」的说法有夸大。
围绕国产基础软件构建低成本、高拓展的 Agentic Infra:训推一致、资源部署(共集群/分离集群/混合弹性)、异步 RollOut、空闲资源回收、Multi-Agent 编排、确定性计算——解决训练、推理、强化学习的易用性瓶颈。
基于自研 Infra 训练一个「算力使能基础模型」:能力覆盖训推全流程、多基础工具 RL、多硬件后端、自然语言调用——即把专家经验蒸馏成模型。
任务流编排、模型路由、行业工具组合进化,打通任务规划—工具调用—多 Agent 协同—结果验证链路,目标是复杂交付任务「可控、可靠、可规模化」。BP 内附 Demo:Claude Code 在昇腾 910A 上部署推理服务失败(缺融合算子),其自研智能体凭内置领域知识完成融合算子实现并部署成功。
交付分两档:头部客户用「Infra 专家 + Agent 协作」交付——客户已有自建集群的,提供算力使能服务帮客户用好集群;没有集群的,联合算力建筑方共建或做算力租赁;中长尾客户走 Agent 订阅,客户自行部署、数据闭环反哺能力构建。行业使能层面则与顶尖科学家和链主企业共建:工业仿真、材料设计、世界模型。
| 收入线 | BP 定位 | 内容 | 商业属性 |
|---|---|---|---|
| ① 标准化算力分发 | 基础盘现金流 | 基于高性能推理 Infra,将低价国产算力转换为有效 Token:算力租赁、开源模型部署、Token 调用 | 标准化、走量、低毛利(对标硅基流动) |
| ② 高溢价 AI 训练服务 | 核心利润源 | 面向行业大客户提供 SFT/后训练能力,项目制长协收费,产出模型的推理平台独家代理权 | 项目制、高客单、强技术黏性 |
| ③ 智能体订阅 | 能力验证 + 数据飞轮 | 中长尾客户订阅算力使能智能体,提高企业「利润人效比」 | 可规模化的 recurring revenue |
BP 把整体模式称为算力使能领域的「鸿蒙智行模式」:M(应用端行业大客户:运营商的星辰/九天、南网/中石油/招行、AI4S 的深度原理/深势科技、世界模型的智元/宇树)× 1(Amorphoux 居中连接)× N(算力端:昇腾、曙光/海光、摩尔、沐曦),与大模型厂商的分工是「厂商出训练算法、Amorphoux 出 Infra 能力」。成本结构为算力采购成本 + 专家人力成本(Agent 化后递减)。双飞轮:真实任务越多→轨迹数据越多→Agent 越强→能承接更复杂的专业工作;行业侧则不断蒸馏生物医药、材料、电磁/流体仿真、能源等领域知识。
BP 声称核心团队「万卡训练 Infra 能力国内 TOP」,列出的国产全栈实绩(客户/模型/卡数/MFU)如下:
| 客户 | 模型 | 集群规模 / 芯片代际 | MFU |
|---|---|---|---|
| 中国移动 | 九天 | 1.8 万卡 / A2 | 50%+ |
| 中国电信 | 星辰 | 1 万卡 / A2 | 50%+ |
| 字节跳动 | M 系列 / Seedance | 1 万卡 / A2;1.5 千卡 | 35.6% / 42.1% |
| 美团 | 龙猫 | 10 万卡 / A2 | 33.4% |
| 终端厂商 | 小艺 | 1 万卡 / A3 | 34.7% |
| 鹏城国家实验室 | 脑海 | 4 千卡 / A1 | 30%+ |
注:A1/A2/A3 为昇腾芯片代际的行业俗称(约对应 910A/910B/910C 世代)。MFU(Model FLOPs Utilization)为训练时实际有效算力占芯片理论峰值的比例,是衡量「集群会不会用」的硬指标;国产卡万卡集群 MFU 突破 50% 属于业内顶尖水平(作为参照,Meta 公开的 Llama 3 在 H100 上的 MFU 约 38–43%[63])。
其他背书性成果:与智谱合作的 GLM-Image——国产芯片全流程训练的开源图像生成模型,登顶 HuggingFace Trending,MFU 超 35%,依托自研 HyperParallel(千卡/万卡规模线性度 90%+)与 AKG 图算融合(降低 20–40% 显存带宽开销);与昌平国家实验室高毅勤团队的 MEGA-Protein 蛋白质结构预测(世界级榜单第一,基于昇腾 910A 集群,谢晓亮院士公开背书);与南方电网饶宏院士团队的「驭电」AI 仿真器(潮流计算效率千倍提升,获 2024 年 WAIC SAIL 奖、央企十大国之重器);与中科大江俊团队的灵境造物智能科学家平台、与商飞吴光辉院士团队的御风·智翼工业气动设计平台。
路线描述为「产品可用—客户付费—行业复制」,12 个月内完成三轮共 9 亿元融资、估值增至 50 亿元、营收从 0 做到 2 亿元。
用独立检索的公开数据核实 BP 的行业判断:算力过剩与使能不足并存,是这门生意的地基。
截至 2026 年 3 月,全国智能算力总规模达 1,882 EFLOPS,在用算力中心标准机架超 1,445 万架;仅 2025 年一季度就新增 128 个智算项目、总投资超 4,300 亿元[17]。IDC 数据显示 2025 上半年中国 AI 服务器市场规模 160 亿美元、同比增长超一倍,全年约 259 亿美元,其中推理服务器占 67%、训练占 33%;IDC 预计 2029 年中国加速计算服务器市场将超 1,400 亿美元[20]。政策侧,「算电协同」首次写入 2025 年政府工作报告;工信部 2025 年印发《算力互联互通行动计划》[15],要求 2026 年建立较完备的标准体系、2028 年基本建成「算力互联网」;国资委自 2024 年起持续推进央企「AI+」专项行动,2025 年 2 月深化部署会明确「三个更加突出」——应用领航、数据赋能、智算筑基,要求央企当好「国家智算基础设施的重要供给者」,并发布首批 16 行业 40 项高价值场景;2026 年世界人工智能大会期间又启动「国资央企智能软件工厂联合筑基工程」,首批 13 家央企参与[23][30]。
市场呈剧烈分化:头部平台算力满负荷,大量中小智算中心在 20–30% 利用率线上挣扎、「卖卡求生」[18]。根因正是你所说的适配困难——业界共识的三大工程风险是 CUDA 生态迁移成本、国产卡算子覆盖缺口、多机训练稳定性。政府开始用真金白银补贴使用侧:多地发放「算力券」,如天津按合同金额 10% 补贴、单企业年上限 200 万元(天津工信局,2025-05)[19],北京、上海、成都、贵州均有类似政策——这意味着你卖算力服务时,客户实付可以打九折甚至更低,这是销售工具箱里现成的杠杆。另一个预算锚点:华为、浪潮、新华三等的 DeepSeek/Qwen 预装一体机 2026 年标价区间约 80–300 万元/套[29]——央国企愿意为「开箱即用的国产 AI 算力」付的单价已经被市场验证。
"利用率不足 30%"不是管理问题,而是从芯片硬件到软件栈层层累积的工程问题。要理解这门生意的价值,必须先看清国产卡(以昇腾为代表)到底"差在哪"——差距的每一层,都对应一项可以收费的手艺。
| 指标 | 昇腾 910B(2023) | 昇腾 910C(2025) | NVIDIA H100 |
|---|---|---|---|
| FP16/BF16 稠密算力 | 约 280–414 TFLOPS(≈A100 级) | 约 750–800 TFLOPS(≈H100 的 80%) | 989 TFLOPS |
| HBM 显存 / 带宽 | 64GB / 约 1.6–2.4TB/s | 128GB / 3.2TB/s | 80GB / 3.35TB/s |
| 卡间互联(点对点) | 约 56GB/s(HCCS 全互联、无交换芯片) | 约 2.8Tbps/卡(光互联) | 900GB/s(NVLink+NVSwitch) |
| FP8 支持 | 无 | 无(滞后至少一代) | 有 |
数据为公开口径汇总,各来源存在差异,仅用于量级判断[69][80]。任正非 2025 年 6 月公开承认:"中国单芯片仍落后美国一代,我们用数学补物理、非摩尔补摩尔、群计算补单芯片"[79]。
三个硬件事实决定了"使能"这门手艺的存在:其一,单卡与制程差距。910C 由两颗 910B 芯粒合封而成,采用中芯国际 7nm 级工艺,良率从 2024 年的约 20% 爬到 2025 年初的近 40%(H100 同级的行业常态是 60%)[71];更深的产能瓶颈在 HBM 显存——国产 HBM 供应量决定了 910C 的实际出货上限[72]。其二,互联短板。910B 卡间点对点带宽约 56GB/s,只有 H100 NVLink(900GB/s)的十六分之一——而张量并行、专家并行恰恰要在卡间疯狂交换数据。这个洞只能靠两条路补:并行策略的精细编排(软件手艺),或华为的"超节点"路线——用 384 颗 910C 全光互联硬堆出超过 NVIDIA GB200 NVL72 的总算力,代价是约 3.9 倍的功耗和 6,912 个光模块带来的可靠性工程难题[69][70](该路线推进很快:384 卡超节点已商用落地 750 多套,1024 卡超节点 2026 年已亮相[105])。其三,FP8 缺失。DeepSeek 官方权重是 FP8 格式,在昇腾上必须转成 BF16 运行,640GB 的模型膨胀到约 1.3TB——同样的模型要占用双倍显存,这就是"纸面算力"与"有效算力"的差距的一个缩影。
昇腾采用达芬奇专用架构(DSA):Cube 单元一拍完成 4,096 次乘加、专吃矩阵乘法,极强;Vector 单元负责其余一切碎片化计算,偏弱。大模型里恰恰充满了 LayerNorm、Softmax、RoPE 这类"不像矩阵乘"的向量计算——它们一多,Cube 的威力就发挥不出来。更麻烦的是微架构细节:910B 的 Cube 与 Vector 没有共享高速缓存,像 FlashAttention 这种矩阵—向量交替的核心算子,中间结果要在缓存间反复倒手,搬运开销显著[80]。与 CUDA 的编程模型(开发者只管线程逻辑)不同,昇腾的 Ascend C 要求手工做分块、显式管理多级片上内存、在 Cube/Vector 间编排流水——CUDA 算子无法"翻译"到昇腾,只能按硬件重写。这就是为什么"融合算子开发"是一门以周计价的手艺,而不是跑一个转换工具的事。
第一代 910A(2019)的问题是结构性的:不支持 BF16(而 2023 年后大模型训练与开源权重默认 BF16),显存仅 32GB,且主流软件栈已经抛弃它——vLLM 昇腾版和华为自家推理引擎 MindIE 均不再支持 910A[78]。而早期国家级智算项目恰恰大量采购了这代卡,它们构成今天闲置算力的重要部分。这条对本报告后文的算力盘活业务是硬约束:拿闲置算力前,第一件事是确认芯片代际——910B 及以上才有商业化盘活价值,910A 集群的优化投入产出比极差。
软件生态的差距可以量化:CUDA 开发者规模以百万计,CANN 官方算子约 1,400 个,社区月活与 PyTorch 相差一个数量级;torch_npu(PyTorch 昇腾适配层)存在算子缺失、驱动/固件/CANN/框架四层版本必须严格匹配的"版本地狱";图引擎只有静态 shape 才能整图下沉执行,动态 shape 场景极易陷入 host 瓶颈。华为的应对是 2025 年 8 月把 CANN 全面开源、开放 260+ 高性能算子与编译器接口[77]——方向正确,但社区厚度的差距仍以年计。
两个实战案例把这层差距钉死在公开记录上。反面:DeepSeek R2。据 FT 等多家外媒 2025 年 8 月报道,DeepSeek 在监管鼓励下尝试用昇腾训练 R2,遭遇芯片不稳定、互联慢、软件不成熟三重问题,华为派驻整队工程师驻场仍未跑通一次完整训练,最终 R2 延期、训练切回 NVIDIA,昇腾只承担推理[73][74]——注意,910C 的纸面算力数倍于 DeepSeek 实际使用的 H20,失败的原因全在工程与软件栈。(后续进展同样值得记录:2026 年 DeepSeek V4 的部分训练环节已使用昇腾,被券商视为国产算力"从只能推理走向训练"的产业拐点信号[104]——差距在收敛,但每一步收敛都是顶级工程团队用人力灌出来的。)正面:科大讯飞。作为主流大模型中唯一坚持全国产算力全栈训练的厂商,讯飞与华为联合做算子融合与混合并行优化,把 910B 的训练效率从对标 A100 的 55% 提升到 85%[76]。一反一正说明同一件事:国产卡训练不是不可能,而是需要架构师级的专业团队把人力灌进去——清程极智对行业的判断一语中的:"国产算力的核心瓶颈在工程生态而非单点芯片:多数国产芯片不是跑不了模型,而是达不到 CUDA 生态的工程效率。"
宏观数字随之就位:全国已投运智算中心约 150 个、在建规划约 400 个,但部分国产算力利用率不足 20%,国产芯片闲置率高达 70–80%,企业级通用算力中心利用率仅 10–15%[75]。归因按行业共识排序:生态与工具链不成熟、复合人才稀缺、旧卡占比高、供需地理错配。前两条正是专业使能团队的收费空间,第三条是做算力盘活时的避坑清单,第四条解释了为什么西部闲置算力需要被"接到"东部需求上。
把国产卡用好需要四层能力叠加:微架构理解(Cube/Vector 配比、多级片上内存、互联拓扑的物理约束)、算子开发(按硬件重写融合算子)、并行与通信策略(用编排弥补点对点带宽劣势)、精度对齐(FP8→BF16 转换与数值稳定性)。前三层的天花板都取决于对芯片本身的理解深度——这正是"芯片架构师"与"资深算法工程师"的分界线。DeepSeek 案例还证明了另一件事:连原厂驻场的"特种部队"模式都不必然成功,且这种模式只能覆盖极少数头部客户、无法规模化——原厂覆盖不到的广大市场,就是具备架构师级纵深的独立专业团队的空间。
中国数据中心加速卡的国产份额从 2023 年 14% 升至 2025 年 34.6%,预计 2027 年超 55%[20][22]。英伟达线的反复强化了这一趋势:H20 于 2025 年 4 月被实质禁售,7 月短暂恢复但被网信办约谈「安全风险」、传出对美缴纳 15% 销售分成,需求遇冷后 2026 年初停产转推 B30 特供芯片,中国市场态度冷淡[21][22]。国产侧全面爆发:瑞穗证券估算昇腾 910 系列 2025 年出货超 70 万颗、2026 年计划约 160 万颗[10];寒武纪 2025 年营收 64.97 亿元(+453%)、上市以来首次年度盈利,流通市值一度超 5,000 亿元[11];海光 2025 上半年营收 54.64 亿元(+45%)[12];摩尔线程 2025 年 12 月登陆科创板(募资 80 亿元,「国产 GPU 第一股」)、8 个月后再启港股[14];沐曦同月上市首日暴涨 693%[13]。对销售的含义:每一张卖出去的国产卡,都是 Amorphoux 潜在的服务对象——芯片厂商的出货量就是使能服务的市场上限,而这个上限正以每年翻倍的速度扩大。
2026 年恰逢赛道两家头部公司递表港交所,招股书第一次让外界看清了这门生意的真实毛利结构——这是检验 BP 商业模式设计的最好证据。
| 公司 | 定位 | 关键数据(2026-08 检索) | 训练能力 | 对 Amorphoux 的意义 |
|---|---|---|---|---|
| 硅基流动 | 推理 MaaS「Token 工厂」 | 估值 77.4 亿元(B+ 轮),2026-06 完成超 20 亿元 B 轮,2026-07 递表港交所;2025 营收 5,533 万元(+653%)、净亏损 3.45 亿元;注册用户超 1,000 万、企业客户 1.3 万家、日均 Token 5,785 亿;股东含华为哈勃、阿里、美团 | 弱 | 证明推理分发能起量但巨亏;其昇腾合作(率先上线昇腾版满血 DeepSeek)说明昇腾生态卡位有先例 |
| 无问芯穹 | 多元异构算力调度 | 累计融资超 22 亿元、近 50 家机构;纳管 26 城 25,000P 算力,占上海已投产国产算力 38%;Agentic MaaS 日均 Token 调用一年增 20 倍 | 少量(RLinf) | BP 所述「训练弱、昇腾深度不足」与公开信息相符,但它并非完全缺席训练 |
| 基流科技 | 集群建设与运营「建筑商」 | 11 轮融资 22.02 亿元,投后估值 91.6 亿元,2026 年递表港交所;营收 2023 年 3,180 万→2025 年 5.2 亿元;毛利率仅 21.8%(集群产品 16.8%、运营服务 47.7%);运维 GPU 超 9 万张、SLA 99.97% | 弱 | 硬件集成是低毛利苦生意;其「运营服务毛利 47.7%」反证软件与服务才有利润 |
| 清程极智 | 国产算力系统软件 | 翟季冬(清华)团队;「八卦炉」训练软件栈、「赤兔」推理引擎(开源)、AI Ping 评测平台;2025 年 7 月完成过亿元新一轮融资 | 有(训练软件栈) | BP「训练市场不存在竞争」的最大反例——体量尚小,但方向重合,销售中会正面遭遇 |
数据来源:参考文献 [1][2][3][4][5][6][7]。
这张图是全报告最重要的一张图:公开市场卖 Token 的毛利率是 −119%(上一年甚至是 −271.6%),私有化部署的毛利率是 82.5%–92.4%。同一家公司、同一套技术,商业模式不同,毛利天壤之别。它验证了两件事:把「标准化算力分发」仅当现金流而非利润源是清醒的;利润要么押在私有化训练服务上,要么押在两端锁价的闭环结构上(见 4.3)。
招股书还揭开了这门生意的引擎盖,每一条都值得记住[81][82]:硅基流动的算力全部租赁、不自持,算力资源成本占销售成本的 86.9%——它本质是"批发算力、零售 Token"的中间商,而两头价格都不由它定;serverless 付费客户从 2,455 家暴增至 71.6 万家,对应收入却只有约 1,430 万元,户均年消费约 20 元——散客流量再大也撑不起收入,真正的钱在 49 家专属实例客户和 20 家本地部署客户(单客户均值 130 万元)手里;更微妙的是,华为同时是它的第二大客户(12.8%)和第五大供应商——生态卡位的价值与依赖的风险一体两面。招股书自陈的亏损主因:"新增租赁算力利用率处于爬坡期、固定成本分摊高"——一句话点破:租来的算力跑不满,就是烧钱机器。基流科技的招股书则暴露了硬件集成生意的另一面[83]:贸易应收周转天数从 3.2 天恶化到 64.1 天,2025 年应收账款到递表时仅收回 8.6%——做央国企与大客户生意,回款周期是必须写进现金流预案的变量。
第二梯队还有潞晨科技(Colossal-AI 团队,2024 年营收约 7,700 万元、付费客户 2,476 家[9])、行云集成电路(15 万元级「褐蚁」推理一体机)、中科加禾(已被智谱收购)等——它们的存在说明这一层的人才供给虽稀缺,但并非只有一家在跑。
2026 年 7 月,智谱收购算力软件公司中科加禾(编译技术/异构推理引擎),消息带动智谱股价单日大涨超 36%[8]——大模型厂商开始垂直整合「算力使能层」。这对 Amorphoux 是双刃剑:证明这层能力值钱(利好估值与被收购退出),也意味着窗口期有限、大厂随时可能下场自建或收购同类团队。
美国市场比中国早跑两年,把每种商业模式都用真金白银试了一遍。本章按「层」拆解谁活了、谁死了、为什么——每一条都对应 Amorphoux 的一个决策。
| 层 | 代表公司(最新估值/市值) | 商业本质 | 对应 Amorphoux |
|---|---|---|---|
| GPU 云(Neocloud) | CoreWeave(市值约 590 亿美元)、Nebius(上市)、Lambda(约 59–90 亿美元)、Crusoe(洽谈约 300 亿美元 pre-IPO) | 重资产持有算力,靠多年期长约出租 | 「算力自建/联合承建」选项 |
| 训练/后训练服务 | MosaicML(13 亿美元卖给 Databricks)、Thinking Machines(120 亿美元)、Prime Intellect | 帮客户在其数据上训模型,按项目/算力收费 | 核心利润线「高溢价训练服务」 |
| 推理 MaaS | Fireworks(175 亿美元)、Baseten(130 亿美元)、Together(83 亿美元) | 托管开源模型按 Token/GPU 时长收费 | 现金流线「标准化算力分发」 |
| 硬件使能软件 | Modular(16 亿美元);芯片+云一体:Cerebras(市值约 500 亿美元)、SambaNova(110 亿美元)、Groq(35 亿美元) | 让非 NVIDIA 硬件好用 / 自建芯片卖算力 | 底座「Agentic Infra + 使能基模」 |
| 企业交付(FDE) | Palantir(市值约 4,172 亿美元)、OpenAI DeployCo、Anthropic Ode、Scale AI(290 亿美元) | 驻场工程师把 AI 做进客户业务,换多年期订阅 | 「专家 + Agent 协作交付」模式 |
来源:上市公司市值为 2026 年 8 月中旬约数(Macrotrends / Motley Fool);一级市场估值见附录参考文献 [41][42][44][45][50][54] 及 Forge(Lambda 二级市场报价)。
CoreWeave 2025 年 3 月 IPO 时不被看好(发行规模缩水、定价低于区间),2026 年 8 月市值已约 590 亿美元。它的模式内核有三条:第一,锚定客户长约先行——Microsoft 一度占其收入 62–67%,OpenAI 累计签约约 224 亿美元[33][34],Meta 累计约 350 亿美元[35],2026 年 4 月签下 Anthropic 后已覆盖前十大 AI 实验室中的九家;每个 GPU 集群实质上「预售完毕再投资」。第二,把合同变成融资工具——开创以 GPU 资产 + 客户合同现金流为抵押的贷款模式,2026 年单笔 85 亿美元贷款拿到投资级评级[31],全年债股融资超 200 亿美元;NVIDIA 还提供 63 亿美元的容量兜底(卖不掉的算力 NVIDIA 承诺回购至 2032 年)。第三,向上吞开发工具层——2025 年连续收购 Weights & Biases(17 亿美元)、OpenPipe(RL 训练平台)、Marimo 等,从裸算力升级为端到端 AI 开发平台。同赛道印证:Nebius 靠 Microsoft 至少 174 亿美元(可扩展至 194 亿)[36]、Meta 累计至多约 270 亿美元长约[37],2026 年收入指引 30–34 亿美元;Lambda 与 Microsoft 签下数十亿美元协议后筹备 IPO[38];Crusoe 以「能源优先」路线承建 OpenAI Stargate 旗舰园区(1.2GW,15 年租约),估值 10 个月从 100 亿冲向约 300 亿美元[62]。
还有一个容易被忽略的细节对定价谈判极有价值:Nebius 早期给 Microsoft/Meta 的合同约合每兆瓦每年 1,160 万美元,而 2026 年新签合同已达 2,000–2,500 万美元(财报电话会与第三方分析口径)——早期锚定客户拿走了最低价,但换来了公司的生存权和融资能力。
重资产路线的唯一正确姿势是「先锁客户长约、再建算力」,且长约本身就是融资抵押品。对销售的直接映射:面向央国企谈算力使能服务时,把合同结构往「多年期、预留制、最低消费承诺」的方向谈——这不仅锁定收入,还直接改善公司融资叙事,是你作为代理给公司创造的超额价值。
MosaicML 是与 Amorphoux「高溢价训练服务」最接近的先例:卖点是「数小时/数千美元而非数月/数百万美元训练大模型」,客户用自有数据做预训练或在其 MPT 系列开源模型上微调,按算力时长计费。2023 年 6 月被 Databricks 以 13 亿美元收购时年化收入仅约 2,000 万美元[39][40]——约 65 倍收入倍数,Databricks 买的不是收入,而是「让每个企业在自己数据上训自有模型」的能力和稀缺研究团队。收购后整合为 Mosaic AI,2026 年 6 月 Databricks 的 AI 产品线年化收入已达 17 亿美元,公司整体年化超 70 亿美元、最新估值 1,900 亿美元(Databricks 公司披露及媒体报道,2026)。
但更值得研究的是为什么独立训练服务公司几乎全军覆没。2023–2025 年的整合潮里:Deci 和 OctoAI 分别以约 3 亿、2.5 亿美元卖给 NVIDIA,Run:ai 约 7 亿美元卖给 NVIDIA,Predibase 卖给 Rubrik,OpenPipe 和 Weights & Biases 卖给 CoreWeave。复盘下来死因有三:① 企业自训/微调需求小于预期——多数场景被前沿模型 API + 提示工程 + RAG 满足;② 开放权重模型(Llama/DeepSeek/Qwen)质量快速提升,预训练需求集中到极少数大实验室,它们要么自建要么直签 GPU 云;③ 训练平台无算力、无数据、无分发护城河,毛利被 GPU 成本压死,最优出路是卖给有分发的公司。2025–2026 年,训练服务以「后训练/RL」形态重生:Mira Murati 的 Thinking Machines 以 20 亿美元种子轮(投后 120 亿)推出托管微调 API「Tinker」,Prime Intellect 靠 RL 环境社区拿下 1.3 亿美元 A 轮——新共识是买家愿意付溢价的是环境、评估与数据,而不是裸算力。编排层的结局也印证同一逻辑:Ray 是事实标准的开源训练/推理编排框架,其商业公司 Anyscale 独立经营五年,最终于 2026 年 7 月以约 16.5 亿美元卖给英国 neocloud 公司 Nscale[55]——卖工具,不如卖工具跑出来的结果。
美国训练服务死于「客户可以不训」——用 API 和 RAG 就够了。中国的央国企不能不训:数据不能出域、模型必须国产化部署、芯片被政策锁定为国产卡——「NV→昇腾迁移 + 域内训练」是刚性付费场景,这是美国市场不存在的结构性变量。所以 MosaicML 的教训不是「别做训练服务」,而是:训练服务作为独立生意估值有限,必须像 Amorphoux BP 设计的那样,把训练做成入口,向订阅(Agent)和分发(推理)延伸——同时保持被收购(芯片厂、大模型厂、云厂)作为退出选项的价值。
美国推理层估值一路狂飙:Fireworks AI 年化收入破 10 亿美元(员工仅约 200 人,人均年化 500 万美元),2026 年 7 月 D 轮估值 175 亿美元[42][43],9 个月涨 4 倍;Baseten 18 个月估值从 21.5 亿涨到 130 亿美元[44];Together AI 年化收入超 10 亿美元、估值 83 亿美元[41][62]。它们赚钱的前提是自研推理引擎带来的成本优势 + 美国市场健康的 Token 定价。而中国同层的硅基流动公有云 MaaS 毛利率是 −119%[1]——DeepSeek 们把开源模型 API 价格打到地板,独立平台每卖一元亏一元。这个对照再次确认:Amorphoux 的「标准化算力分发」线只能作为获客与现金流工具,绝不能在公开市场作为利润指望——除非像 4.3 节那样把两端价格用合同锁死,让利润只取决于自家优化能力。
Modular 是 Amorphoux 技术定位最直接的镜子:Swift 之父 Chris Lattner 创办,做跨芯片统一计算层(MAX/Mojo),让 AMD 等非 NVIDIA 硬件跑出可比性能(宣称对 AMD MI300 系列较开源栈提升最多 53%),2025 年 9 月 C 轮 2.5 亿美元、估值 16 亿美元[53][54]。它的商业化设计值得抄两点:open-core 分层(社区版免费、云版/企业版收费),以及每个付费层级都配 forward-deployed engineer 驻场协助迁移调优——即「软件 + 驻场专家」打包卖。但也要看到它的局限:成立四年仍未披露收入,说明纯卖使能软件变现很慢;Amorphoux「软件能力 + 算力转售 + 训练服务」的打包方式更贴近中国买家「为结果付费」的习惯,反而更容易开票。
三家「自建芯片 + 卖算力」的公司则集体给出反面教材:Groq 拿了沙特 15 亿美元采购承诺,仍把 2025 年收入预期从 20 亿美元下调到约 5 亿,最终以约 200 亿美元把技术许可卖给 NVIDIA、创始团队被挖走,公司转型运营 NVIDIA GPU 的云、估值从 69 亿腰斩至 35 亿美元[45][46];Cerebras 曾因单一客户 G42 占收入 87% 而 IPO 搁浅,直到换锚 OpenAI(累计超 200 亿美元、750MW 长约)才在 2026 年 5 月完成美股近年最大科技 IPO[47][48][49];SambaNova 裁员放弃训练业务、险些以 16 亿美元卖给 Intel,靠转向金融业私有化推理部署(JPMorgan 本地部署)才翻身到 110 亿美元估值[50][51][52]。三个故事一个道理:硬科技公司的生死不取决于技术,取决于有没有锚定客户的长约,以及必要时把客户结构换血的能力。
Palantir 2026 年二季度收入 19.4 亿美元、同比 +93%,调整后经营利润率 62%,市值约 4,172 亿美元[56]——它是地球上把「驻场工程师卖企业软件」跑到极致的公司,其 GTM(go-to-market)机制值得逐条拆给 Amorphoux 用:
这套模式 2025–2026 年被硅谷集体抄袭:OpenAI 把 FDE 团队从 2 人扩到 52 人后,干脆成立独立交付公司 DeployCo(获 19 家机构逾 40 亿美元支持,与麦肯锡、贝恩合作)[58];Anthropic 与 Blackstone 等合资成立 15 亿美元的实施公司 Ode[59];Deloitte、Accenture 均设立 FDE practice。基础模型巨头们用行动投票:「实施/定制交付」被认为是下一个万亿美元品类。Amorphoux 的「Infra 专家 + Agent 协作交付」本质就是 FDE 模式的 Agent 增强版——方向与全球最强共识一致。
反面教材是 Scale AI:数据标注 + RLHF 服务做到 290 亿美元估值,2025 年 6 月 Meta 以 143 亿美元入股 49%、创始人带队加入 Meta[60][61]——一周内 OpenAI 宣布终止合作,Google(年贡献约 1.5 亿美元)、xAI 相继撤单,公司随即裁员 14%、转向政府订单求生。教训只有一个词:中立性。服务型 AI 公司的中立性是资产负债表外最值钱的资产,股权站队即客户出逃。Amorphoux 与智谱(GLM-Image 合作)、华为昇腾深度绑定,销售话术上必须保持「多模型、多芯片」的中立姿态,避免被客户视为某一家的附庸。
| # | 美国事实 | 对 Amorphoux / 对你销售工作的映射 |
|---|---|---|
| 1 | CoreWeave 96% 收入来自 take-or-pay 长约,先签约后建站 | 合同尽量谈成多年期预留制 + 最低消费承诺 |
| 2 | 长约合同本身是融资抵押品(85 亿美元投资级贷款) | 每签一个央国企长约都在帮公司融资,销售价值翻倍 |
| 3 | Nebius 早期锚定客户拿最低价,换生存权 | 第一个灯塔客户可以让利,但要拿够背书权益(案例、联合发布) |
| 4 | MosaicML 以 65 倍收入卖出——买方买能力不买收入 | 公司融资/退出叙事成立;早期营收规模不必苛求,但要有标杆合同 |
| 5 | 独立训练服务死于「客户可以不训」 | 中国央国企「不能不训」(数据出域限制 + 国产化令),主攻这批客户 |
| 6 | 后训练/RL 的溢价在环境、评估与数据,不在裸算力 | 报价按「交付的模型能力」计价,不按人天/卡时计价 |
| 7 | 推理 MaaS 中国版毛利 −119% | 公开市场散卖 Token 必亏;Token 平台必须两端锁价(低价采购长约+包量订单),赚利用率的钱(见 4.3) |
| 8 | Modular 用「软件 + FDE 驻场」打包收费 | Amorphoux 的订阅 SKU 应捆绑驻场服务包提高客单 |
| 9 | Palantir 三阶段:自费试点→扩展→3–5 年订阅 | 央国企版本:低价 PoC(借算力券)→项目制→框架长协 |
| 10 | Scale AI 因中立性崩塌一夜失血 | 对客户强调多芯片、多模型中立;公司股权结构避免站队单一生态 |
训练优化服务与算力盘活+Token 供给是两门独立的生意:客户不同、节奏不同、账要分开算——但共享同一个技术底座,互相提供弹药。
| 业务线 | 卖什么 | 客户 | 收入形态 | 节奏 |
|---|---|---|---|---|
| A · 训练优化服务 | MFU 提升、精度对齐、预训练/SFT/RL 全流程交付 | 二梯队大模型民企(首战)→ 央国企行业模型(第二阶段) | 项目制,数百万–千万级/单 | 快:民企决策周期 30–60 天 |
| B · 算力盘活 + Token 售卖平台 | 优化后的推理算力与 Token 供给 | 首个平台客户(亿元级订单意向已在手)+ 后续园区平台与 AI 企业 | 采购长约 + 销售长约,按量结算,持续现金流 | 中:供给端谈判与集群改造需 1–3 个月 |
两条线的分工:A 线证明技术、赚高毛利、出可传播的标杆;B 线把同一套优化能力变成持续现金流。账必须分开算——B 线两端都是长约、带轻资产运营属性,混在一起会拉低 A 线的项目毛利叙事,也让 B 线的资金占用变得模糊。对外讲述时同样分开:对训练客户只讲 A,对算力与 Token 客户只讲 B。
为什么把民企排在央国企前面(对原思路的顺序反转):①周期——民企 CTO 拍板 30–60 天,央国企招投标 6–12 个月且要赶预算窗口;②痛点烈度——二梯队大模型公司(有模型、有融资压力、算力预算紧张的那批)的算力成本是生死线,对"同样的卡多出三分之二有效算力"这种命题极度敏感,而央国企的预算痛感钝得多;③案例可传播性——民企案例可以联合发布、公开传播,央国企项目常涉密只能匿名;④背书链条——一个头部民企标杆对后续所有销售是最强弹药,"连以算力效率为生命线的大模型公司都在用",这句话在央国企客户面前比任何资质都硬。
打法就是压缩版四级火箭:技术对技术开场(对方是 Infra 团队,不走关系路线),效能体检 1–2 周当场出数据 → 训练优化项目(按结果验收计价)→ 年度效能框架。民企的技术团队会提尖锐问题,这反而是优势——体检数据当场可验,是无法造假的销售语言。标杆到手后的复制动作:联合技术发布/白皮书 → 携标杆进央国企,按第 4.4 节的采购机制走第二阶段。
这条线的本质是:用技术能力把"闲置的低价算力"和"确定的 Token 需求"焊接起来,两端锁价,中间的利润完全由优化能力决定。三端结构如下:
西部(如新疆)智算中心存在大量无流水的闲置国产卡——国产芯片闲置率高达 70–80%[75],持有方的核心诉求是消纳与流水。谈判基础极好:以保底消纳承诺换取七折以下的长约底价,叠加地方算力补贴;商务形态以「包站」(整租+保底)为优。硬前提:芯片代际必须 910B 级及以上(910A 无商业化盘活价值,见 2.3)。
同一套优化能力作用于推理侧:引擎适配与算子补齐、量化压缩、调度与批处理优化——同样的硬件产出更多有效 Token。这是全链条唯一的利润来源,也是与"算力倒卖"的本质区别。
首个锚定客户已在手:一家高校系产业创新平台,园区内聚集大量 AI 创业公司,有持续的推理与 Token 消耗,订单意向亿元级——以七折于市场的价格供给高质量 Token 服务并承接补贴,换取长约与量的承诺。后续向同类园区平台与中小 AI 企业复制。
先看反面教材的完整解剖。硅基流动招股书披露:它的算力全部租赁、不自持,算力资源成本占销售成本的 86.9%;公有云 MaaS 毛利率 2024 年 −271.6%、2025 年 −119%[1][81];serverless 付费客户暴增到 71.6 万家,但对应收入仅约 1,430 万元——户均年消费约 20 元[82]。招股书自己给出的亏损主因是:新增租赁算力处于利用率爬坡期、固定成本分摊过高——采购端按固定租金付费、销售端暴露在 DeepSeek 们发起的价格战里(国内大模型 API 均价较 2023 年累计下降超 90%),两头挨打。
利用率对盈亏的杠杆有多大,行业测算给出了刻度:一个千卡级智算集群投入约 3.5 亿元、年运营成本约 5,000 万元,出租率 20% 时年营收约 2,300 万元——连一半运营成本都覆盖不了;出租率 60% 仍需 7 年以上回本[93]。券商口径:东部上架率 80% 以上的智算中心毛利率可达 50%,中西部上架率不足 50% 的毛利率为负。更极端的证据来自推理吞吐:同样的 DeepSeek 模型,官方与 SGLang 团队优化后的集群可以做到约 0.2–0.5 美元/百万输出 token 的成本(官方口径理论成本利润率 545%)[91][92],而按未优化部署的吞吐假设测算则是"月亏 4 亿"——吞吐假设相差 10–15 倍,同一门生意就是暴利与巨亏两个平行世界。这正是"利润空间完全由优化能力决定"这句话的数字注脚(正面样本:智谱靠自有推理优化把 MaaS 毛利率从 3.3% 提升到 18.9%[95])。
再看两端锁价的可行性,市场行情已经给出谈判空间:采购端,昇腾 910B 零售包月约 1.08–1.26 万元/卡,而机构批发已低至约 5,250 元/卡/月(中科院自动化所 2025 年招标限价),西部批发行情约 3,000 元/P/月、低价抢单报到 2,800–2,900 元[84][85](英伟达系对照:H200 八卡机构合同价约 7.49 万元/台/月、A800 约 2.55 万元/台/月[86],国内 H100 时租两年内下跌超六成后 2026 年又反弹三成[94])——闲置站点为了流水,价格弹性极大;成熟的「包站」商务结构现成可抄:3–5 年 take-or-pay 闭口长约、"3+2"(三年闭口+两年敞口)、"保底费用 + Token 超额分成"[87][88],叠加西部 0.3–0.6 元/度的电价优势与各地算力券(杭州补贴上限 30%、北京经开区国产算力抵扣 40%、上海初创企业最高 100%)[89]。销售端,高校与园区平台对算力服务的采购力已被公开验证——头部高校产教融合智算平台单笔中标即达 4.79 亿元(1,024 张 910B)[90]。
结论:这个模式与硅基流动的本质区别在于两端都是合同价——采购端以保底消纳换长约底价,销售端以七折让利换订单锁量,剩下唯一的变量是单位硬件产出多少有效 Token,而这恰恰由自有技术决定。这是把技术壁垒直接铸进价差里的结构。地方国资(浙江等地)也在下场做算力租赁,但纯租赁没有壁垒;壁垒在利用率与单位 Token 成本,这一层只有顶尖 Infra 团队做得了。
2026 年上半年的券商研报(本节引用均来自研报库原文,出处标注为券商与报告名)为这两条业务线提供了独立的第三方定价依据。最锋利的一个数字来自英伟达官方测算:同一张 H100,按小时出租的年收入约 1.84 万美元,按 Token 即服务(TaaS)模式变现的年收入约 15.77 万美元——相差 8.5 倍(B200 更达 31.54 万美元)[101]。从"按时出租"到"按产出变现"之间的全部差额,就是调度、量化、批量推理这些优化能力可捕获的价值——B 线赚的正是这段差价。国金证券把 Token 生意划成四级演进:1.0 API 代理(赚渠道价差、利润最薄)→ 2.0 聚合平台 → 3.0 推理基础设施(毛利率跃升的关键转折点:Fireworks 这类自持优化栈的玩家综合毛利率稳定在 50%+,而裸 GPU 机架租赁行业平均只有 20–30%)→ 4.0 企业 AI 网关[101];国内做"组网+调优+运维"一体化的头部算力运营公司,实际净利率已做到 45–58%[98][107]——与纯转租的微利形成断层。
更重要的是,这门生意刚刚被行业正式命名:国金证券在 2026 年 7 月的深度报告中定义了「Token 专业运营服务商」这一新产业角色——不持有算力硬件,输出算力调度优化、多模型适配封装、Token 输出质量管控与成本精细化核算,"为中小技术服务商开辟差异化市场空间"[101]。优化效果已经可以标价:第三方服务商实测同等算力下 Token 吞吐提升 30–50%、单 Token 成本下降 40%,另一家实现推理成本 −37%、吞吐 +90%[101];行业甚至开始给优化效果建立统一度量衡("词元工厂性能基准"开源)[100]。头部玩家用真金白银投票:Nebius 以约 6.43 亿美元收购一家优化公司,目的只有一个——提升单位 GPU 的 Token 产出,其 Token 工厂早期客户实现了最高 26 倍的成本下降[97]。
需求与价格环境同样站在这一侧:2026Q1 国内 AI 算力需求同比 +417%、有效供给增速仅 128%,算力租赁市场全年预计突破 2,600 亿元[99];2026 年云厂商集体涨价(GPU 云 +5–50%、部分模型 API 涨价 30% 以上),券商判断价格结构走向「通用普惠、高端溢价」分层——标准化 Token 降价,长上下文与 Agent 推理等高端能力反而涨价[98][101][102][106];运营商已开出百亿级需求单(某运营商省级"Token 工厂"集采含税规模 174.38 亿元、服务期 5 年)[101],昇腾超节点 Token 工厂的实测产出已超同规模英伟达传统集群 1.2 倍[101][109],大厂手里也各囤了 20 万张以上国产卡等着被用好[103]。合同结构亦有成熟范式:国内标准是 3–5 年期长约、约 5 个月完成集群交付验收后按月收租[104],海外锚点是 take-or-pay 加 15–25% 预付款[96];东吴证券则论证了 AI 算力不会重演 4G/5G 的"量增价跌"周期——年更代际与软硬协同让新一代算力始终具备提价能力[108]。
国信认为纯 API 转售/封装云是"过渡性中间态,长期将被云厂整合、沦为无壁垒的算力管道"[96];国金则用聚合平台年化 5,000 万美元收入论证其独立价值[101]。两者的分歧点其实指向同一个结论:纯转售没有壁垒,叠加自有优化栈(3.0 形态)才有护城河。B 线的定位必须是"自持优化能力的推理基础设施运营方",而不是 Token 二道贩子——对外表述与内部投入都要咬死这一点。
民企标杆与平台订单跑通后,央国企市场按既有机制推进——这块市场的规模有数:2025 年大模型中标项目 7,539 个、披露金额超 300 亿元,其中算力类金额占 52.9%[28],运营商"国芯训国模"已是集团级战略[25]。要点浓缩如下:预算节奏——央国企"上年立项、当年执行",每年三、四季度是影响次年预算立项的黄金窗口,现在铺垫正好赶上下一个周期;采购形式——数百万级服务单走竞争性磋商,最理想形态是"进框架协议"(进一次框架、按单释放免重复招标),院士合作案例与 MFU 数据可支撑单一来源采购的唯一性论证;生态标包——运营商集采已按 CANN/类 CUDA 生态分标包(中国移动 51.12 亿元集采中 CANN 标包约 34 亿元[26][27]),硬件标的中标者是华鲲振宇、软通动力这类整机与集成商——不与他们抢标,做他们的训练调优分包方;杠杆工具——昇腾伙伴认证是标书资质通行证[24],多地算力券可为客户降低 10% 实付(如天津,上限 200 万元/年)[19];政府算力中心本身也是"盘活存量"服务的客户——利用率是地方的政绩指标。
本章只谈执行:把两条业务线从纸面变成合同与流水的时序、各方成交条件、定价参照,以及不能踩的四条红线。
技术团队尚处于前雇主竞业静默期(约 1–2 个月)。这段时间恰好是商务铺垫的黄金窗口:目标是团队出关当天,第一单已经在桌上。整体遵循「先做流水 → 再谈额度 → 远期合资」的渐进结构:先用第一单交付与回款证明模式成立(流水是最硬的尽调材料),再以已验证的业务数据谈投资额度与估值(比对着纸面 BP 谈便宜得多、也可信得多),最终走向供给、技术、渠道三方的股权化绑定。
| 相关方 | 真实诉求 | 成交的充分条件 | 谈判注意 |
|---|---|---|---|
| 技术团队 | 高毛利业务定位,抗拒沦为纯外包;急需标杆客户做"第一口奶" | 确定的订单 + 交付定价权 + 成果署名权 | 给业务不给指挥棒;尊重其技术底线(如对硬件代际的坚持),这是专业性而非难缠 |
| 算力持有方 | 闲置资产产生流水,运营数据变好看 | 保底消纳承诺 + 订单背书(有确定下游才谈得动底价) | 用流水承诺换底价与账期;消纳承诺分阶段给,降低自身风险敞口 |
| 平台客户(Token 需求方) | 供给稳定、价格公道、体系内资金与政绩闭环 | 七折价格 + 补贴承接 + 可写进合同的 SLA | 价格让利换长约与量承诺;服务指标(吞吐、首字时延、可用率、单位 Token 成本)作为验收条款写死进合同 |
| 大模型民企客户 | 算力降本救命、不换技术栈、快速见效 | 体检数据当场证明 + 按结果验收的合同结构 | 技术对技术沟通;深水区问题按红线纪律传递给技术负责人 |
| SKU | 形态与量级 | 定价逻辑 |
|---|---|---|
| 训练优化服务(A 线主品) | 项目制,数百万–3,000 万/单 | 按交付结果计价(MFU 提升、精度对齐、训练时长写进验收),不按人天 |
| Token 售卖平台(B 线主品) | 采购与销售双长约 + 按量结算 | 销售价锚定市场价七折;利润 = 两端价差 × 利用率提升幅度 |
| 算力效能年度框架 | 年度服务包 + 驻场 | 基础年费 + 效能提升分成 |
| 算力盘活合作(对持有方) | 包站转租或按盘活效果分成 | 先小规模验证卡况与网络,再扩大包站规模 |
涉及居间、引荐与渠道角色的费率,保留行业基准作定价参照:
| 合作形态 | 市场基准 | 来源口径 |
|---|---|---|
| 引荐佣金(referral,介绍人不参与交付) | 首年合同额 10–20%;企业级大单 10–15% | Refgrow / Cello / SaaStr(2026)[64] |
| 转售折扣(reseller,承担销售+一级支持) | 20–40%(入门 10–15%、中级 15–25%、顶级总代 30–40%) | Monetizely / Chanimal / The York Group[65] |
| 独立销售代理(无底薪佣金制) | 跨行业 5–15%;大型多年期合同约首年额 8–12% | InMotion / RepHunter / CaptivateIQ(2026)[66] |
| 集成商主导成交(co-sell) | 合同额 15–25% | Suger / Clazar(2026)[67] |
| 中国云厂商代理返点 | 新客约 15–20%、头部综合最高 35%;渠道价为标价 15–30% off | 渠道政策公开解读(2024–2025)[68] |
技术团队明确不接第一代旧卡——910A 无 BF16、32GB 显存、主流软件栈已弃养(见 2.3),优化投入产出比极差。供给端摸排必须带技术标准清单实地核验:芯片型号与代际(910B 级及以上)、节点内互联与集群网络带宽、机房电力与运维条件、可谈的包站底价——四项参数拿全,先由技术团队测算真实 ROI,再谈商务条款。若闲置资产以旧卡为主,这条线在物理层面不成立,及早止损。
静默期内商务界面与技术界面严格分离。技术深水区的追问(异构迁移细节、算子实现、具体调优方案)一律以"核心实现涉密、正在申请专利,细节由研发负责人后续闭门汇报"应对(配套话术见第 08 章),绝不现场硬答——答错一个细节,损失的是客户对整个团队实力的信任。
投资行为与算力/服务采购必须是相互独立、市场化定价、经得起审计的交易:独立合同、独立的定价依据(市场比价留档)、清晰可查的资金流向。任何指向个人决策者的利益安排都触碰商业贿赂红线——这不是技巧问题,是生存问题;结构上做不到独立与可审计的单子,宁可不做。
民企标杆若延期,B 线的订单叙事会弱化;平台订单若生变,供给端的消纳承诺会悬空。对策:两条线并行推进、互不作为对方的前提条件;供给端消纳承诺分阶段给;任何一方的意向书都设置与另一端进度联动的生效条款。
本章为零基础读者而写。你是对外的人,合伙人不出面,所以客户嘴里的每一个词你都得接得住。每个概念都从"是什么"讲到"为什么值钱",并标注你在销售场景里会怎么遇到它。
整个 AI 产业可以想象成一栋三层楼:一层是芯片和算力(英伟达、华为昇腾、寒武纪——盖楼的地基和发电厂),三层是模型和应用(DeepSeek、智谱、豆包、各种 AI 产品——楼里开的公司),而二层是基础软件,行话叫 Infra(Infrastructure,基础设施)——水电煤管道和电梯,负责把一层的电送到三层去用。你合伙人的生意就在二层:一层的国产电(算力)已经发出来了,但管道不通,三层用不上——他们是通管道的人。这个定位一句话就能给客户讲明白。
算力就是计算能力,衡量单位是 FLOPS(每秒能做多少次浮点运算,可以理解为"每秒算多少道小数乘法题")。数量级阶梯要记住:TFLOPS(万亿次/秒,单张芯片的量级)→ PFLOPS(千万亿次/秒,一台服务器到一个小集群)→ EFLOPS(百亿亿次/秒,国家级总量)。所以"全国智能算力 1,882 EFLOPS"意思是全国所有 AI 芯片加起来每秒约 1,882 百亿亿次运算;单张英伟达 H100 约 1 PFLOPS(FP16 精度口径),单张昇腾 910B 约为它的三分之一强——这些约数够你建立体感即可,报价场合不要引用具体芯片参数(让技术合伙人来)。
CPU、GPU、NPU 的区别用一个比喻就够了:CPU 是几个数学博士,擅长处理复杂逻辑但人少;GPU 是几万个小学生,每个只会算加减乘除,但可以同时开工。AI 训练的本质恰好是海量、简单、重复的矩阵运算——小学生军团完胜博士,所以 GPU 成了 AI 时代的核心资产。NPU(神经网络处理器)是专为 AI 运算定制的芯片,昇腾就是 NPU,可以粗略理解为"专科版 GPU"。日常交流中大家把这些统称"卡"或"加速卡"。
评价一张卡看三个指标:算力(每秒算多快)、显存(HBM,高带宽内存——卡上的"工作台面",放模型和中间数据,单位 GB,台面不够大模型就摆不下)、带宽(数据搬进搬出台面的速度)。这里有个反直觉的行业常识:很多时候瓶颈不是算得慢,而是搬得慢——小学生军团算完了在等新题送来。这就是为什么合伙人材料里"降低 20–40% 显存带宽开销"是个值钱指标:省下的搬运时间全变成了有效计算。
模型本质是一个巨大的数学函数,参数就是函数里可调的旋钮。"7B 模型"= 70 亿个旋钮(B 是 Billion,十亿),"万亿参数基模"= 一万亿个旋钮。训练就是用海量数据反复调这些旋钮,直到模型的输出像人话。基模 / 基础模型(Foundation Model)指从零训出来的通用大模型,与在别人基模上二次加工的模型相对。
Token 是模型的"字":文本先被切成 token 再喂给模型,1 个 token 约等于 0.75 个英文单词或半个到一个汉字(随分词器而异)。模型的收费、吞吐、调用量全都按 token 计——所以"日均 Token 调用超百万亿"是在说全国模型每天处理的"字数"。
一个大模型的完整生命周期分四步,这四个词是你未来每天都要说的,务必吃透:
让模型"读遍互联网",学会语言和世界知识。最烧钱的一步:万卡集群连续跑数周到数月,电费和卡的折旧以千万计。这是技术门槛最高的环节,也是合伙人团队的看家本领。
请"老师"写标准问答示范,教会模型好好说话、按格式干活。数据量小得多(几万到几百万条),千卡级即可。央国企"用行业数据训自己的模型"多数指这一步起步。
强化学习:让模型做题→打分→根据分数改进,循环往复,教会它"把事做对"。2025 年以来推理模型(OpenAI o1、DeepSeek R1 这一类)证明后训练能大幅提升智力,它已成为新的算力大户和全行业竞争焦点。
训练好的模型每天回答问题、干活,就叫推理。一句话记住:训练是上学,推理是上班。训练一次性烧大钱,推理天天花小钱但永远在花。
几个高频衍生词:微调(Fine-tuning,在现成模型上小改);LoRA(一种省钱的微调法,只调一小撮旋钮,几张卡就能做,所以便宜——客户说"我们先做个 LoRA"意思是先小成本试试);蒸馏(Distillation,让大模型当老师教小模型,得到又小又快的学生模型);开源权重模型(Llama、DeepSeek、Qwen、GLM 等把训好的"旋钮数值"公开的模型——央国企项目基本都是拿这些做底子二次训练,没人从零开始);Checkpoint / ckpt(检查点)——训练过程的"游戏存档",每隔一段时间存一次,机器崩了从最近存档继续,不用从头再来。合伙人 BP 里训练流程图的最后一步"产出 ckpt",就是"交付训练成果存档"的意思。
万亿参数的模型,一张卡的显存根本放不下,也算不动——必须把模型和数据切开,摊到成千上万张卡上一起算,这就是分布式训练。"千卡/万卡集群"指的就是几千/几万张卡通过高速网络连成的一台"超级计算机"。
怎么切,行话叫并行策略,主要四种,用工厂比喻记:数据并行(每条产线一套完整设备,各自加工不同批次的原料,最后汇总);张量并行(一台大设备拆成几块,几个人合力操作同一道工序);流水线并行(每人负责几道工序,产品沿流水线传递);专家并行(MoE 混合专家模型专用——模型内部有多个"专家科室",按科室分卡)。实际训练是四种切法的复杂混搭,怎么混搭直接决定训练快慢,这是最核心的手艺活之一。合伙人材料里的"拓扑亲和调度、超节点亲和并行",翻译过来就是:根据集群的"路网结构"(拓扑)定制切法,让通信量最大的卡彼此挨得最近,少走远路。
卡与卡之间要以每秒几百 GB 的速度疯狂交换数据,所以网络互联至关重要:英伟达系用 InfiniBand(专用高速网),国产集群多用 RoCE(基于以太网的方案,便宜但调优难);几张卡组成一台服务器叫节点,多台服务器高速直连成超节点。两个衡量集群健康度的词:线性度——1,000 张卡的速度是不是 100 张卡的 10 倍?90%+ 线性度意味着加卡几乎不浪费(合伙人的指标);长稳训练——万卡连跑几十天必然有硬件坏掉,Meta 训 Llama 3 的 54 天里发生了 400 多次意外中断(论文自述)[63],所以负载检测、故障快恢、断点续训(从 ckpt 恢复)是刚需能力,不是锦上添花。
MFU(Model FLOPs Utilization,模型算力利用率)= 训练时真正用在模型计算上的算力 ÷ 芯片理论峰值算力。像汽车的"实际输出功率 ÷ 发动机铭牌功率"。达不到 100% 的原因:卡在等通信、等数据搬运、算子写得烂、故障重启白费功……全是可以被"手艺"优化的损耗。
商业翻译(对客户就这么讲):MFU 从 30% 提到 50%,等于同一批卡凭空多出三分之二的有效算力。客户花 5 个亿建的集群,我们不加一张卡让它顶 8 个亿用——这就是"算力优化赋能"五个字的全部含义,也是效能体检能当场演示的东西。记住:客户听不懂算子和并行,但一定听得懂"5 个亿顶 8 个亿用"。
CUDA 是英伟达 2006 年推出的编程平台——给 GPU 写程序的"语言 + 工具箱 + 二十年积累的现成代码库"。全世界的 AI 代码默认为 CUDA 而写,这就是英伟达真正的护城河:不是芯片造不出来,是芯片上的软件生态二十年追不上。国产卡"不好用",摊开看是三个具体问题,也正好对应合伙人的三块手艺:
问题一:算子缺失与低效。算子(Operator / Kernel)是模型的最小计算积木——矩阵乘法、注意力计算、归一化……一个大模型由几百上千个算子拼成。CUDA 生态里每块积木都有现成且优化到极致的版本;国产卡上,有的积木没有(得现写,这就是"融合算子开发"——把几块小积木焊成一块大积木,减少数据往返显存的次数,业界最著名的例子叫 FlashAttention),有的积木很慢(单算子调优要以周为单位磨)。配套黑话:图算融合(在整个计算图层面自动做积木合并)、Auto-Tiling(自动把大矩阵切成正好塞进芯片缓存的小瓦片)、host bound(CPU 发号施令的速度跟不上 GPU 干活的速度,指挥官成了瓶颈)。还有个词叫 Triton——OpenAI 推出的写算子的高级语言,但它为英伟达硬件设计,搬到国产 NPU 会因缓存、通信粒度、带宽差异而失效,这是 BP 里专门点出的行业难题。
问题二:精度不一致(国产卡训练最大的坑)。计算机里的小数有不同"精度格式":FP32(32 位,准但慢)、FP16 / BF16(16 位,快但容易出数值问题,训练主流)、FP8(8 位,最新最快)。不同芯片的微架构对同一串运算的执行顺序不同,每一步差一点点,几万步累积下来误差滚雪球——结果就是:同样的配方(超参数)、同样的数据,在 NV 上炼出好模型,在国产卡上"炼糊了",而且你不知道糊在哪。精度对齐就是把这口锅系统性排查到比特级(二进制最后一位),确保"同参数配置拿到一致训练效果"。这活儿要求同时精通硬件微架构、AI 框架和模型训练,全国会的人屈指可数——大部分国产卡训练项目就卡死在这一步,这也是合伙人团队最稀缺的能力。
问题三:框架生态绑定。框架是搭模型的脚手架。PyTorch 是全球事实标准(CUDA 是它的"一等公民",存量代码全部耦合 NV);MindSpore(昇思)是华为自研框架;再往上还有训练加速框架 Megatron、DeepSpeed,RL 训练框架 veRL、Slime,推理引擎 vLLM、SGLang——这些名字客户的技术人员嘴里会随口蹦出来,你不需要会用,认得出"这是训练框架/这是推理引擎"即可。CANN 则是昇腾版的 CUDA(昇腾的驱动 + 算子库 + 编程接口)——所以运营商招标书里的"CANN 生态标包",翻译过来就是"这个标只有会昇腾的公司能投"。
昇腾(Ascend)是华为的 AI 芯片品牌。要记的谱系:910A → 910B → 910C 三代,行业黑话分别俗称 A1 / A2 / A3(合伙人实绩表里的 A1/A2/A3 就是这个意思——"1.8 万卡 / A2"= 1.8 万张 910B)。一体机是"服务器 + 预装好的模型和软件"的开箱即用产品,市价 80–300 万元/套[29],是央国企最容易理解和采购的形态。
其他国产玩家一句话认识:寒武纪(最早的 AI 芯片上市公司,2025 年营收暴涨 453% 首次盈利);海光(DCU 产品走"类 CUDA"路线,兼容性好);摩尔线程、沐曦(GPGPU 路线,2025 年底先后上市)。招标市场把它们分成两个阵营:「类 CUDA 生态」与「CANN 生态」——中国移动 51.12 亿集采就是按这两个阵营分标包的[26]。合伙人团队昇腾最深、兼顾多硬件后端,意味着两个阵营的单都能接,但主场在 CANN。
最后一个生态位常识,回答"华为为什么不自己干":华为的利润在硬件,原厂技术支持只倾斜最头部客户,且不可能给每个客户派驻专家团(BP 原话:"原厂无充沛资源支持,仅服务头部客户");互联网大厂的人才只服务自家业务。中间的真空地带——腰部央国企、行业客户——就是合伙人的市场。
6.2 讲过 RL 后训练是"做题→打分→改进"的循环。技术上它的特殊之处在于:做题(生成回答)用的是推理,改进(更新参数)用的是训练——两种截然不同的计算模式必须在同一套系统里高速轮转。这套系统就叫 RL Infra,配套黑话逐个拆:
为什么这块特别值钱:2025–2026 年全行业的算力重心正从预训练转向 RL 后训练(推理模型和 Agent 训练都靠它),美国市场的新贵(Thinking Machines 的 Tinker、Prime Intellect)全部扎在这一层(见第三章 3.3);而国产卡上的 RL Infra 几乎无人能做——竞对里只有清程极智部分涉及。这是合伙人卡位里最前沿、溢价最高的部分。
推理侧你只需要四个概念:吞吐(每秒产出多少 token,决定一张卡能服务多少用户);时延(用户提问到第一个字蹦出来的等待时间,体验指标);量化(把模型旋钮从 16 位精度压到 8 位甚至 4 位——模型"瘦身",牺牲一点点质量换成倍的速度和更少的卡);KV Cache(对话越长,模型要记住的"上下文"占的显存越多——长对话贵就贵在这)。推理优化的价值一句话:同样的卡产出更多 token,单位成本直线下降。
MaaS(Model as a Service)就是"卖 token 的生意"——按调用量收费的模型 API。第二章已用招股书证明:在中国公开市场卖 token 毛利率是负的(硅基流动 −119%[1]),而私有化部署毛利 80%+。所以合伙人把推理定位为获客工具和现金流、把利润押在训练和私有化上——你销售时的力气也应该这么分配。
Agent / 智能体是会自己规划步骤、调用工具、多步执行直到完成任务的 AI——对比只会一问一答的聊天机器人(chatbot)。你正在用的 Claude Code 就是编程 Agent。衍生词:Agentic(智能体化的,形容词)、Multi-Agent(多个智能体分工协作)、Agent Swarm(智能体集群)、任务流编排(把复杂任务拆解成步骤链)、模型路由(不同难度的活儿分派给不同大小的模型,省钱)。
合伙人的「算力使能智能体」是整个故事的收口:把 6.4–6.7 讲的那些专家手艺(调优、精度排查、算子开发、部署)沉淀成 Agent 的领域知识,让 Agent 替代一部分驻场专家。BP 里那个 Demo 的含义现在你能完全看懂了——通用的 Claude Code 在昇腾 910A 上部署推理失败,因为它不知道昇腾缺哪个融合算子、该怎么补;他们的自研 Agent 内置了这些领域知识,补齐算子、部署成功。这一步如果做成,就解决了服务生意最致命的天花板:"会的人太少、堆人不划算"(人力不具备 Scaling Law),公司才能从"高级人力外包"变成"可复制的产品公司"——这也是估值故事从几亿到几十亿的分水岭。当然,如第一章风险所述:它目前仍处于构想到早期产品之间,对外可以讲愿景,对内要盯进度。
约 75 个词条,按主题分组。第三列告诉你这个词在什么销售场景会冒出来、该作何反应。见客户前翻一遍,开会时手机上随时查。
| 术语 | 人话解释 | 销售场景提示 |
|---|---|---|
| 算力(Compute) | 计算能力的总称,AI 时代的"电力" | 整个生意的标的物 |
| FLOPS 及 T/P/E 前缀 | 每秒浮点运算次数;T=万亿(单卡级)、P=千万亿(服务器/小集群)、E=百亿亿(国家级总量) | 听到"多少 P 的算力"是在说集群规模,如"2000P 智算中心" |
| GPU | 图形处理器,"几万个小学生并行算数",AI 训练主力芯片 | — |
| NPU | 专为 AI 定制的芯片,昇腾即 NPU,可理解为"专科版 GPU" | 客户说 NPU 基本就是指昇腾 |
| 卡 / 加速卡 | GPU/NPU 芯片做成的板卡,行业计量单位("千卡""万卡") | "你们最大调过多少卡?"→ 万卡级 |
| 显存(HBM) | 卡上的高速内存,放模型和数据的"工作台面",单位 GB | 显存不够 = 模型放不下 = 要更多卡或量化 |
| 带宽 | 数据搬运速度;很多训练瓶颈是"搬得慢"而非"算得慢" | 合伙人"降 20–40% 显存带宽开销"的价值所在 |
| 集群(Cluster) | 成百上千张卡用高速网络连成的一台"超级计算机" | — |
| 节点 / 超节点 | 节点=一台服务器(通常 8 卡);超节点=多台服务器超高速直连成的大单元 | 华为主推超节点方案(如 CloudMatrix 类架构) |
| 智算中心 | 装满 AI 加速卡的数据中心,地方政府近年疯狂兴建 | 利用率不足 30% 的主角,"盘活存量"销售切口 |
| 一体机 | 服务器+预装模型软件的开箱即用产品,市价约 80–300 万/套 | 央国企最容易采购的形态,可作报价锚点 |
| 东数西算 | 国家工程:东部的数据算力需求调度到西部电价低的地方算 | 政策谈资,说明算力是国家战略 |
| 术语 | 人话解释 | 销售场景提示 |
|---|---|---|
| 大模型 / 基模 | 基模(Foundation Model)= 从零训练的通用大模型;行业模型多在基模上二次加工 | "国芯训国模"= 用国产卡训国产模型 |
| 参数(7B/70B/万亿) | 模型里可调的"旋钮"数量;B=十亿。旋钮越多越聪明也越贵 | 客户说"我们想训个 70B 的",规模感要立刻有 |
| Token | 模型的"字",≈0.75 个英文单词或半个到一个汉字;计费计量单位 | MaaS 生意=卖 token;训练量也按 token 数说("训了 2T token") |
| 预训练(Pre-training) | 让模型读遍互联网学会语言,最烧钱(万卡×数月) | 技术门槛最高,合伙人的看家本领与高溢价区 |
| SFT(监督微调) | 用标准问答示范教模型"好好说话",千卡级、数据几万到百万条 | 央国企行业模型项目的主形态 |
| 后训练 / RLHF / RLVR | 强化学习环节:做题→打分→改进,教模型"把事做对";推理模型(o1/R1 类)的核心 | 2025 年后的算力新大户,合伙人最前沿卡位 |
| 微调(Fine-tuning) | 在现成模型上做小规模再训练的统称 | — |
| LoRA | 低成本微调法:只调一小撮旋钮,几张卡就能干 | 客户说"先做个 LoRA"= 想低成本试水 |
| 蒸馏(Distillation) | 大模型当老师教小模型,得到又小又快的"学生" | 端侧/降本话题常见 |
| 开源权重模型 | 公开"旋钮数值"的模型:Llama、DeepSeek、Qwen、GLM 等 | 央国企项目基本都拿它们做底子,没人从零训 |
| Checkpoint / ckpt | 训练"游戏存档",崩了从存档继续 | "产出 ckpt"= 交付训练成果 |
| 超参数 | 训练的"配方"设置(学习率、批大小等),不是模型参数 | "同参数配置一致效果"里的"参数"指这个 |
| MoE(混合专家) | 模型内部分多个"专家科室",每次只叫醒几个,省算力;DeepSeek 即 MoE | MoE 训练对并行策略要求更高 = 更需要合伙人 |
| 术语 | 人话解释 | 销售场景提示 |
|---|---|---|
| 分布式训练 | 模型/数据切开摊到几千几万张卡上一起算 | — |
| 数据/张量/流水线/专家并行 | 四种"切法":各算不同数据 / 合力算同一层 / 各管几层接力 / 按专家科室分 | "并行策略"= 四种切法的混搭配方,决定 MFU |
| MFU | 模型算力利用率 = 有效算力÷理论峰值。行业最硬指标 | 你的核心销售语言:"5 亿的集群顶 8 亿用" |
| 线性度 | 加卡的效率:1000 卡是否 ≈ 100 卡×10 倍速;90%+ 为优 | 合伙人硬指标之一 |
| 拓扑 / 拓扑亲和 | 集群的"路网结构";让通信量大的卡彼此挨近少走远路 | — |
| InfiniBand / RoCE | 两种集群高速网络:IB 是 NV 系专网,RoCE 是以太网方案(国产集群主流,便宜但调优难) | 客户报网络方案时能听懂即可 |
| 长稳训练 | 万卡连跑数十天不趴窝的能力:负载检测、故障快恢、断点续训 | Llama 3 都中断 400+ 次——用这个数据讲刚需 |
| GPU 利用率(util) | 卡"看起来在忙"的百分比——≠ MFU!util 90% 时 MFU 可能只有 20%(空转也算忙) | 内行/外行分界线,见 8.3 的追问话术 |
| 术语 | 人话解释 | 销售场景提示 |
|---|---|---|
| CUDA | 英伟达的 GPU 编程平台+二十年生态,真正的护城河 | "类 CUDA 生态"标包指海光等兼容路线 |
| CANN | 昇腾版 CUDA(驱动+算子库+编程接口) | "CANN 生态标包"= 只有会昇腾的能投 |
| PyTorch | 全球事实标准的 AI 框架(搭模型的脚手架),CUDA 是其"一等公民" | 存量代码全耦合 NV = 迁移是刚需生意 |
| MindSpore(昇思) | 华为自研 AI 框架,昇腾亲儿子 | 合伙人 GLM-Image 类项目的技术底座之一 |
| Megatron / DeepSpeed | 主流大规模训练加速框架(NVIDIA / 微软出品) | 听懂即可,不用会 |
| veRL / Slime | 主流 RL 后训练框架 | 同上 |
| vLLM / SGLang | 主流开源推理引擎(让模型回答得又快又省卡) | 客户推理部署必提 |
| Triton | OpenAI 的算子编写语言,为 NV 设计,搬国产 NPU 会失效 | BP 点名的行业难题 |
| 算子(Operator/Kernel) | 模型的最小计算积木(矩阵乘、注意力等),一个模型几百上千个 | 国产卡缺积木/积木慢 = 合伙人的活儿 |
| 融合算子 | 几块小积木焊成一块大的,减少显存往返;名例 FlashAttention | BP Demo 里 Claude Code 就败在缺这个 |
| 图算融合 / Auto-Tiling | 计算图层面自动合并积木 / 自动把大矩阵切成正好塞进缓存的瓦片 | — |
| host bound | CPU 发指令跟不上 GPU 干活速度,"指挥官成瓶颈" | — |
| 术语 | 人话解释 | 销售场景提示 |
|---|---|---|
| FP32/FP16/BF16/FP8 | 小数的存储精度:位数越少越快越省,但越容易出数值问题;训练主流 BF16,前沿在 FP8 | — |
| 混合精度 | 关键步骤用高精度、其余用低精度的折中方案,训练标配 | — |
| 精度对齐 | 排查硬件差异导致的累积误差,确保国产卡与 NV 训练效果一致 | 国产卡训练最大的坑,合伙人最稀缺能力 |
| 比特级一致性 | 对齐到二进制最后一位的最严标准 | 一页纸材料里的硬承诺 |
| 确定性计算 | 同样输入永远同样输出(并行计算默认做不到) | 排障与对齐的前提 |
| 术语 | 人话解释 | 销售场景提示 |
|---|---|---|
| 推理(Inference) | 训好的模型干活回答问题;"训练是上学,推理是上班" | — |
| 吞吐 / 时延 | 每秒产出多少 token / 用户等第一个字的时间 | 推理服务的两大验收指标 |
| 量化(Quantization) | 模型"瘦身":16 位压到 8/4 位,牺牲一点质量换速度和省卡 | 降本方案必谈 |
| KV Cache | 对话"记忆"占的显存,对话越长越贵 | 长文本场景成本话题 |
| MaaS | Model as a Service,按 token 收费卖模型 API | 公开市场散卖必亏(硅基流动 −119%);两端锁价的闭环模式除外(见 4.3) |
| 私有化部署 | 模型装进客户自己机房,数据不出门 | 毛利 80%+ 的形态,央国企首选,主推 |
| 数据不出域 | 数据不离开客户的物理/网络边界 | 央国企合规硬要求,话术必备词 |
| 术语 | 人话解释 | 销售场景提示 |
|---|---|---|
| Rollout / 异步 Rollout | 模型"做题"生成回答的过程 / 做题与改参数流水线化不互等 | RL Infra 核心词 |
| 训推一致 | 做题用的模型与被更新的模型数值严格一致,否则越学越歪 | 国产卡上难度翻倍,合伙人卖点 |
| Agent / 智能体 | 会自己规划、调工具、多步干活的 AI(对比一问一答的聊天机器人) | — |
| Agentic / Multi-Agent / Agent Swarm | 智能体化的 / 多智能体协作 / 智能体集群 | BP 高频词 |
| 任务流编排 / 模型路由 | 把复杂任务拆成步骤链 / 难活派大模型、简单活派小模型省钱 | — |
| RL Environment(环境) | 给模型"做题"的仿真考场;美国新共识:环境和评估比裸算力值钱 | 对投资人讲前沿趋势时用 |
| 术语 | 人话解释 | 销售场景提示 |
|---|---|---|
| PoC | Proof of Concept,小规模付费验证项目(本报告语境:100–300 万、30–60 天) | 四级火箭第二级 |
| SLA | 服务等级协议:可用率、响应时效等写进合同的服务承诺 | 签约必审条款 |
| 验收指标 | 项目算不算完成的量化标准(MFU、精度、时长) | "验收指标写进合同"是你的信任武器 |
| 框架协议 | 先中一次总框架,之后按单释放免重复招标 | 服务商最理想形态,销售目标是"进框架" |
| 集采 | 集团统一招标采购(运营商模式),单次几十亿 | 硬件标别碰,做中标集成商的分包 |
| 信创 | 信息技术应用创新:党政央国企采购国产化要求的统称 | 合伙人天然符合,标书加分项 |
| 单一来源采购 | 论证"只有这家能干"后免招标直接采购 | 院士背书+MFU 数据可支撑唯一性论证 |
| 算力券 | 政府发的算力消费补贴(如按合同额 10%、上限 200 万/年) | 帮客户降实付的现成杠杆 |
| take-or-pay | "用不用都付费"的照付不议长约(CoreWeave 模式) | 谈多年期合同的理想结构 |
| ARR / 年化收入 | Annual Recurring Revenue,按当前月收入×12 折算的年收入口径 | 融资叙事用词,≠ 会计年度收入 |
| ICP | Ideal Customer Profile,理想客户画像 | 本报告第四章的分层就是 ICP |
| GTM | Go-To-Market,市场进入/销售打法的统称 | — |
| FDE | Forward Deployed Engineer,驻场交付工程师(Palantir 模式) | "专家驻场交付"的国际通行说法 |
| 灯塔客户 | 第一个标杆客户,可让利换背书与案例权 | Nebius 教训:低价可以,背书权益要拿够 |
| Land-and-expand | 小单进门、逐步扩大的销售策略 | 四级火箭的底层逻辑 |
你不需要假装技术专家——你需要的是:接得住第一回合、判断得出深浅、知道什么时候把球传给技术合伙人。本章给你第一回合的全部弹药。
先定心法:客户从不指望商务负责人懂算子,但客户极其反感商务负责人不懂装懂。你的标准姿态是一句万能话术:"这个问题值得展开,我请我们首席架构师带数据来跟您聊,我先记下来。"——说完真的记在本子上,当着客户的面记。这个动作传递的信息是:这家公司分工专业、技术有真人兜底、你是靠谱的接口人。相反,最忌讳的是被追问两轮后开始编——技术客户一听就穿,且一次露怯终身贴标签。你要做的是把本章 15 问的第一回合答案背熟,第二回合永远传球。
"国家在推国产算力,卡不缺、集群也不缺,缺的是把集群真正跑起来的人——全国智算中心平均利用率不到 30%,会用国产万卡集群的人才基本都在华为和头部大厂出不来。我们团队就是干这个的:在国产卡上做大规模训练和推理的效能优化,万卡训练的算力利用率能做到 45% 以上,超过 Meta 在英伟达卡上的公开水平。简单说:您 5 个亿建的集群,我们不加一张卡,让它顶 8 个亿用。可以先免费给您的集群做次体检,数据说话。"
每条分三层:客户问什么、你嘴上怎么答、你心里要知道为什么这么答。
| 客户说 | 潜台词 / 实际含义 | 你的正确反应 |
|---|---|---|
| "我们集群利用率还可以,有 80–90%" | 他说的多半是 GPU util(卡看起来在忙),不是 MFU(真干了多少活)——util 90% 时 MFU 可能只有 20% | 全书最值钱的一个追问:"您说的是 GPU 利用率还是 MFU?"——内行会心一笑,外行被你问住,两种结果都是你赢 |
| "我们有信创/国产化率要求" | 采购必须含足够比例国产软硬件,这是硬约束不是偏好 | 顺水推舟:"我们全栈国产路线,正好帮您把国产化率指标做实" |
| "这个可以走我们的框架" | 他们已有框架协议,你的单子可挂进去免招标——是重大利好信号 | 立刻追问框架的采购主体、额度上限、供应商准入条件 |
| "预算要等明年了" | 今年立项窗口已过;但"明年预算"恰恰现在(Q3–Q4)在编 | 争取把需求写进明年立项:"那我们正好赶在立项前把方案和测试数据做扎实" |
| "先做个 POC 看看" | 有真兴趣,但也可能想白嫖测试 | 免费的是"体检"(1–2 周),端到端 PoC 要收费+写验收——把两者分清楚 |
| "我们自己有 AI 团队" | 可能是拒绝铺垫,也可能他们团队正被国产卡折磨 | "太好了,有团队才聊得深——你们在国产卡上遇到的最头疼的问题是什么?"(把竞争转为共情) |
| "领导很重视 AI" | 一把手工程=有预算有速度;但也意味着要有可汇报的"亮点" | 把交付包装出领导可汇报的成果:利用率提升 X%、获某某验收/奖项 |
| "你们跟华为那边怎么合作的?" | 在确认你们是否被原厂认可(资质焦虑) | 报昇腾伙伴认证等级(先跟合伙人确认现状),强调互补关系 |
周期、卡数、报价、MFU 能提到多少——口头数字会变成合同义务。标准动作:记下来,48 小时内技术合伙人回复。
用什么并行策略、怎么改算子、选什么框架——答错一个细节,专业形象清零。传球给"首席架构师"。
可以讲差异("他们主打推理我们主打训练"),不可以讲坏话——圈子极小,话会传回去;贬华为更是自断生态。
客户名、卡数、项目金额一概"脱敏后见面聊"。你多说一个名字,下一个客户就会想"我的名字他也会说出去"。
① 当天写会议纪要发合伙人(客户问了什么、承诺了什么跟进、发现了什么信号——尤其挖人试探和竞品出没);② 把客户新问题补进你自己的 FAQ 本子,下次就是你的弹药;③ 更新 pipeline 台账(阶段/预算窗口/下一动作/责任人)。你的专业不体现在懂多少技术,而体现在每一回合都有干净的后手。
本报告基于 Amorphoux BP v2.0.5(2026 年 7 月版)与截至 2026 年 8 月 20 日的公开信息撰写,供合作决策内部参考,不构成投资建议。BP 属未公开商业信息,请勿外传本报告。所有第三方数据以原始来源为准。