很多企业规划 AI 基础设施时,第一反应是 GPU 或 NPU,但 AI 应用能否稳定运行,同样取决于存储。模型文件、向量数据库、企业知识库、日志、图片、视频、结构化业务数据,以及训练、微调、推理过程中产生的中间数据,都需要合适的存储系统支撑。

如果存储性能不足,GPU 可能等数据;如果存储架构割裂,数据会在不同系统之间反复复制;如果缺少扩展和管理能力,AI 应用从 PoC 进入生产后很容易遇到容量、性能和运维瓶颈。

AI 场景会使用哪些数据?

AI 应用通常会同时处理多种数据:

  • 结构化数据:数据库、业务记录、交易数据。
  • 半结构化数据:日志、配置、API 调用记录。
  • 非结构化数据:文档、图片、视频、音频、医学影像、网页内容。
  • 模型相关数据:模型文件、Embedding、Rerank 模型、推理引擎文件。
  • 应用相关数据:向量数据库、知识库、缓存、推理结果、审计日志。

这些数据会经过采集、清洗、分类、训练/微调、推理、输出、归档、备份等环节,每个环节对容量、吞吐、延迟和共享访问的要求不同。

为什么推理也会带来存储压力?

推理不像训练那样集中消耗大规模算力,但它会长期运行,并持续读取模型文件、知识库、向量数据、业务数据和日志。

典型压力包括:

  • 多个模型版本和推理引擎需要统一存放。
  • RAG 场景需要持续维护文档库和向量数据库。
  • AI Agent 会产生大量交互日志和中间结果。
  • 图片、视频、PACS 等场景需要处理大量非结构化数据。
  • 多租户和多业务部门共享模型服务时,需要权限和数据隔离。

因此,AI 存储不仅要能“放得下”,还要能“读得快、管得住、扩得动”。

AI 存储方案应评估哪些能力?

维度 需要回答的问题
数据类型 是否同时支持文件、块、对象或多类数据访问?
性能 是否能满足高吞吐、低延迟、小文件和随机 I/O?
共享访问 多个模型、应用和节点是否能共享访问数据?
扩展能力 容量和性能是否能随业务增长扩展?
可靠性 是否支持高可用、数据冗余、故障恢复?
数据管理 是否支持跨本地、边缘、云环境的数据管理?
成本 是否能按冷热数据、介质和业务优先级平衡成本?
运维 是否能统一部署、扩容、升级和监控?

SmartX 能提供哪些存储相关能力?

SmartX 面向 AI 应用的超融合基础设施方案强调存储融合。基于自主研发的分布式存储,SmartX 超融合可为 AI 应用提供计算与存储资源支持,并通过多种存储介质满足不同数据访问需求。

SMTX 文件存储可在超融合架构下提供企业级分布式文件存储能力,适用于文本、音视频等数据场景,并支持在线扩展、高可用、文件接入 IP HA、本地文件控制器和文件预取等能力。

榫卯分布式存储面向云与 AI 时代的数据基础设施,支持 x86 和信创 CPU 主流服务器、异构部署和利旧服务器,可用于云资源池到大数据分析等场景的数据支撑。

结论

AI 基础设施选型不能只看 GPU。企业要同时规划算力、Kubernetes、模型服务和存储。对于 RAG、知识库、图像视频、医疗影像、日志分析、大数据分析等场景,存储往往决定了 AI 应用能否从验证顺利走向生产。

建议企业在 AI 基础设施 POC 阶段同步验证存储:模型加载速度、向量库访问、文件共享、数据写入、备份归档、扩容和故障恢复都应进入验证范围。

相关问题

参考资料

继续阅读