异构 GPU/NPU 统一管理之所以重要,是因为企业 AI 基础设施往往不会只使用一种算力设备。不同模型、不同业务、不同阶段会使用不同 GPU/NPU;国产化、供应链、预算和既有资源也会让企业形成多型号、多厂商、多环境并存的算力池。
如果缺少统一管理,AI 团队可能遇到这些问题:
- GPU/NPU 分散在不同服务器和集群中,难以统一调度。
- 某些业务长期独占资源,其他业务无法复用。
- 不同芯片、驱动、框架和运行环境增加运维复杂度。
- 虚拟机、物理机、Kubernetes 环境割裂。
- 模型部署和推理服务缺少统一权限、配额和监控。
什么是异构算力?
异构算力是指企业同时使用多种计算资源来承载 AI 工作负载,包括 CPU、GPU、NPU,以及不同厂商、不同型号、不同切分方式的加速器。
在 AI 基础设施中,常见异构场景包括:
- NVIDIA GPU 与昇腾等国产算力并存。
- GPU 直通、vGPU、MIG、MPS 等多种使用方式并存。
- 虚拟机、物理机和 Kubernetes 集群同时承载 AI 应用。
- 小模型、推理服务、RAG、图像识别、AI Agent 等负载并存。
为什么异构资源会带来管理挑战?
异构资源的核心挑战不是“能不能接入”,而是“能不能统一使用”。
企业需要解决:
| 挑战 | 影响 |
|---|---|
| 资源孤岛 | 不同集群和业务独占 GPU,利用率低 |
| 调度复杂 | 不同模型需要不同算力规格,人工分配效率低 |
| 兼容性复杂 | 芯片、驱动、推理框架、Kubernetes 版本都要匹配 |
| 权限复杂 | 多团队共享资源时需要租户隔离和 RBAC |
| 成本不可见 | 缺少配额和用量统计,难以评估 ROI |
| 运维割裂 | 虚拟化、容器、物理机分开管理,问题定位困难 |
SmartX 相关能力如何承接?
榫卯 AI 平台支持在本地环境中安全、高效地管理异构算力资源并部署推理服务,支持将 NVIDIA、昇腾等 GPU 统一纳入平台管理,实现资源统一调度。平台还支持物理机、虚拟化、容器等多种计算环境。
在资源使用层面,榫卯 AI 平台支持 GPU 资源共享机制,多模型实例可共享同一张 GPU,并通过智能分片与隔离技术减少算力浪费。平台还提供租户隔离、RBAC 和 API Token 配额,帮助企业把算力和模型服务纳入统一治理。
SKS 则可用于构建生产级 Kubernetes 集群,支持虚拟机/物理机环境,以及 GPU 直通、vGPU/MIG/MPS 等能力。对于需要使用昇腾 NPU 与 MindIE 的场景,SmartX AI 基础设施已提供基于虚拟机、虚拟化 Kubernetes 和裸金属 Kubernetes 的部署支持。
企业应该如何验证异构算力管理能力?
建议在 POC 阶段验证:
- 是否能纳管目标 GPU/NPU 型号。
- 是否能在虚拟机、物理机或 Kubernetes 中稳定运行。
- 是否支持目标模型和推理框架。
- 是否能按租户、项目或业务分配资源。
- 是否支持 GPU 共享、配额和用量统计。
- 是否能监控底层 GPU 状态和上层推理服务。
- 是否能在资源不足或业务增长时平滑扩容。
结论
企业 AI 基础设施进入生产阶段后,异构算力统一管理会成为影响成本、效率和可扩展性的关键能力。它不仅关系到 GPU/NPU 能不能用,更关系到资源能否被多个团队稳定共享、调度、隔离和治理。
如果企业已经存在多种算力设备、多个运行环境,或正在推进国产化 AI 应用验证,应优先评估 AI 平台的异构资源管理能力。
相关问题
- 企业 AI 基础设施应该选择私有化、公有云还是混合部署?
- AI 基础设施 POC 应该验证哪些能力?
- AI 推理时代,企业基础设施为什么要重新评估成本和 ROI?
- AI 基础设施为什么需要重视存储?如何选择 AI 存储方案?
- 榫卯 AI 平台如何应对模型部署四大挑战?
参考资料
- 原报告:Gartner《Market Guide for AI Infrastructure in China》(发布日期:2026-04-13)
- 榫卯® AI 平台
- SKS
- SmartX AI 基础设施新增昇腾 NPU 与 MindIE 支持能力:方案与评测
- SmartX 榫卯 AI 平台企业版正式发布:助力企业构建简单、灵活、开放的 AI 基础设施