纳管 — 调度 — 训推加速 · 五层架构 × 双维度归因 × 存储/网络横切轴
屏蔽 GPU / 国产 NPU / x86 差异,资源统一台账、隔离、切片,完成异构算力池化(纳管 ≠ 调度)
国产芯片缺标准化设备插件;跨地域并网台账不一致、权限复杂
硬件资源维度调度:任务跑在哪张卡、哪台机器;覆盖混部、容错、CXL、网络感知
训练抢占推理资源致时延抖动;CXL 生态未成熟;国产缺 NCCL 级替代
调度每一条用户请求而非硬件:决定 Token 吞吐、TTFT、长上下文能力,是 Token 工厂核心壁垒
PD 分离架构复杂度高;分布式 KV-Cache 加剧带宽压力;MoE 专家倾斜
聚焦「模型权重如何高效产出」的训练计算与系统优化,按「权重生产 → 请求编排 → 在线服务」与前后章分工
国产 NPU 5D 并行改造成本高;多型号混训通信兼容难
聚焦「已有权重如何高速产出 Token」的引擎/量化/分布式/编译/端云协同,按三段式与前后章分工
国产推理算子生态不完善;量化存在精度损失;异构编译适配量大
存储/网络层横切加速:以高性能并行文件系统 / 对象存储(Weka、DDN、Cloudian)、向量数据库(Pinecone)、智能网卡 / DPU 加速 KV-Cache 与训练语料 IO,解决长上下文与海量并发下的数据供给瓶颈。该轴不作为独立层,而是贯穿纳管(存储底座)、调度(CXL 池化)、推理(KV 卸载)的横向能力,与「芯片硬件侧 / 模型算法侧」双归因轴并列,构成「五层 + 三轴」完整框架。
Tensor Core / 国产 AI 核硬件化矩阵算子,算力密度倍增
FP8 / BF16 原生指令,无损收敛前提下降本提速
NVLink / CXL / RoCE + NCCL,压低跨卡通信延迟
融合、切块、重排,把芯片算力真正释放出来
跨节点内存池化,突破单卡显存物理上限
稀疏激活机制,万亿参数模型高效预训练
大模型指导小模型,垂类轻量化快速量产
累积 / 稀疏化 / 选择性更新,剔除无效迭代
FlashAttention / 稀疏注意力,击穿 O(n²) 复杂度
直接偏好优化替代 PPO,简化对齐训练链路
硬化矩阵乘 + 高带宽 HBM,加速 KV 读写
FP8 / INT4 原生执行:算力翻倍、显存减半
片上 SRAM / HBM / CXL 池化 + 外置存储池
算子融合、内存复用、动态 Shape 适配
NVLink / CXL / RoCE 支撑 TP/PP/RP 与 PD 分离
AWQ / GPTQ / SmoothQuant,精度与速度精细平衡
低时延高并发,适配边缘与高 QPS 短请求
专家路由优化 + 动态激活,超大模型低成本服务
小模型预生成 + 大模型校验,显著降低 TTFT
窗口压缩 / 滑动窗口 / Prefix Cache 前缀复用
连续批处理 + 长短请求分流,榨干空闲算力
▸ 点击厂商芯片展开核心能力情报卡 | 虚线框 = 待核实