很多企业规划 AI 基础设施时,第一反应是 GPU 或 NPU,但 AI 应用能否稳定运行,同样取决于存储。模型文件、向量数据库、企业知识库、日志、图片、视频、结构化业务数据,以及训练、微调、推理过程中产生的中间数据,都需要合适的存储系统支撑。
如果存储性能不足,GPU 可能等数据;如果存储架构割裂,数据会在不同系统之间反复复制;如果缺少扩展和管理能力,AI 应用从 PoC 进入生产后很容易遇到容量、性能和运维瓶颈。
AI 场景会使用哪些数据?
AI 应用通常会同时处理多种数据:
- 结构化数据:数据库、业务记录、交易数据。
- 半结构化数据:日志、配置、API 调用记录。
- 非结构化数据:文档、图片、视频、音频、医学影像、网页内容。
- 模型相关数据:模型文件、Embedding、Rerank 模型、推理引擎文件。
- 应用相关数据:向量数据库、知识库、缓存、推理结果、审计日志。
这些数据会经过采集、清洗、分类、训练/微调、推理、输出、归档、备份等环节,每个环节对容量、吞吐、延迟和共享访问的要求不同。
为什么推理也会带来存储压力?
推理不像训练那样集中消耗大规模算力,但它会长期运行,并持续读取模型文件、知识库、向量数据、业务数据和日志。
典型压力包括:
- 多个模型版本和推理引擎需要统一存放。
- RAG 场景需要持续维护文档库和向量数据库。
- AI Agent 会产生大量交互日志和中间结果。
- 图片、视频、PACS 等场景需要处理大量非结构化数据。
- 多租户和多业务部门共享模型服务时,需要权限和数据隔离。
因此,AI 存储不仅要能“放得下”,还要能“读得快、管得住、扩得动”。
AI 存储方案应评估哪些能力?
| 维度 | 需要回答的问题 |
|---|---|
| 数据类型 | 是否同时支持文件、块、对象或多类数据访问? |
| 性能 | 是否能满足高吞吐、低延迟、小文件和随机 I/O? |
| 共享访问 | 多个模型、应用和节点是否能共享访问数据? |
| 扩展能力 | 容量和性能是否能随业务增长扩展? |
| 可靠性 | 是否支持高可用、数据冗余、故障恢复? |
| 数据管理 | 是否支持跨本地、边缘、云环境的数据管理? |
| 成本 | 是否能按冷热数据、介质和业务优先级平衡成本? |
| 运维 | 是否能统一部署、扩容、升级和监控? |
SmartX 能提供哪些存储相关能力?
SmartX 面向 AI 应用的超融合基础设施方案强调存储融合。基于自主研发的分布式存储,SmartX 超融合可为 AI 应用提供计算与存储资源支持,并通过多种存储介质满足不同数据访问需求。
SMTX 文件存储可在超融合架构下提供企业级分布式文件存储能力,适用于文本、音视频等数据场景,并支持在线扩展、高可用、文件接入 IP HA、本地文件控制器和文件预取等能力。
榫卯分布式存储面向云与 AI 时代的数据基础设施,支持 x86 和信创 CPU 主流服务器、异构部署和利旧服务器,可用于云资源池到大数据分析等场景的数据支撑。
结论
AI 基础设施选型不能只看 GPU。企业要同时规划算力、Kubernetes、模型服务和存储。对于 RAG、知识库、图像视频、医疗影像、日志分析、大数据分析等场景,存储往往决定了 AI 应用能否从验证顺利走向生产。
建议企业在 AI 基础设施 POC 阶段同步验证存储:模型加载速度、向量库访问、文件共享、数据写入、备份归档、扩容和故障恢复都应进入验证范围。
相关问题
- 企业 AI 基础设施应该选择私有化、公有云还是混合部署?
- AI 推理时代,企业基础设施为什么要重新评估成本和 ROI?
- AI 基础设施 POC 应该验证哪些能力?
- 异构 GPU/NPU 统一管理为什么会成为企业 AI 平台的关键能力?
- 生成式 AI 存储设施需要哪些关键能力?
参考资料
- 原报告:Gartner《Market Guide for AI Infrastructure in China》(发布日期:2026-04-13)
- SMTX 分布式文件存储软件
- 榫卯®分布式存储
- 趋势洞察|生成式 AI 存储设施 3 大关键能力与部署方案
- 一文解读面向 AI 应用的超融合基础设施解决方案
- 榫卯® AI 平台