船舶制造业务涉及生产、办公、研发、管理等多类系统,基础设施需要长期支撑不同类型应用的稳定运行。
对于某船舶制造用户而言,其原有的信息化建设更多围绕单个项目分别规划基础设施。随着虚拟化、容器、AI 等需求陆续出现,用户希望改变“一个项目一套平台”的建设方式,转向统一规划、统一管理、统一承载的基础设施平台,避免后续重复投资。同时考虑到 IT 运维人员有限,平台也需要尽量扁平化,降低构建、扩展和日常管理复杂度。
阶段一:以 VMware 替代为契机,同步建设虚拟化与容器统一底座
用户原有部分业务运行在 VMware 虚拟化环境和集中式存储之上。随着 VMware 订阅模式变化,虚拟化平台替代被提上日程。与此同时,MES 相关系统已经开始探索容器化部署,早期基于 Docker 和裸金属资源建设的容器环境,在生产使用中也逐渐面临稳定性、资源扩展和运维管理方面的挑战。
基于虚拟机与容器长期并存、IT 运维资源有限以及避免多套平台割裂等考虑,用户计划将虚拟化替代与容器平台建设统一推进,在同一套基础设施中承载不同类型业务负载。当时,SmartX 已经发布基于超融合架构的虚拟化容器融合基础设施解决方案,可实现虚拟化与容器负载的融合部署、统一管理,这一特点与用户的整体规划相匹配,也为后续结合业务系统容器化改造实现落地提供了基础。
此外,在跨平台迁移验证过程中,用户也曾接触其他超融合平台,但部分平台在 VMware 虚拟机迁移中出现兼容性问题。SmartX 平台在迁移过程中的兼容性和稳定性,增强了用户在内部继续推进统一云平台建设的信心。
基于此,用户最终选择 SmartX 榫卯企业云平台,并引入 ELF 虚拟化能力与 SKS 容器服务,构建统一的虚拟化与容器资源池。传统应用可继续运行在虚拟机环境中,MES 及适合容器化的应用部署在 SKS 提供的 Kubernetes 环境中。

统一改造后,用户在成本控制、运维效率和业务运行性能方面均获得改善:
- 相比原 VMware 环境,SmartX 永久授权模式帮助用户减少软件订阅费用,架构升级也降低了硬件服务器数量。
- 虚拟机与容器统一承载后,IT 团队能够通过同一平台管理两类业务负载,并借助 SKS 降低 Kubernetes 环境搭建和日常运维难度。
- 在容器业务承载方面,SKS 的弹性扩展能力帮助业务根据实际负载进行动态扩缩容,优化了传统虚拟机形态难以动态灵活扩展的问题,也进一步推动了业务系统的容器化改造。
- 业务运行层面,改造后的平台支撑了高峰期业务稳定运行,MES 工单平均处理时间也从 2.5 秒降低至 0.8 秒。
阶段二:补齐文件存储与流量可视化,完善企业云基础设施
在虚拟化与容器统一承载后,用户继续围绕数据管理和安全可观测能力完善企业云基础设施。随着应用逐步云原生化,基础设施承载对象也从计算资源扩展到数据、网络和安全。
一方面,用户引入文件存储能力,承载邮件等海量非结构化数据,将此类文件数据纳入云平台管理。另一方面,用户引入网络与安全能力,重点提升不同环境之间的网络隔离,以及虚拟化、容器环境中的东西向流量可视化能力。
- 通过虚拟专有云网络(VPC):用户可对生产、测试等不同环境进行区域隔离。在部分测试环境与生产环境存在 IP 地址重叠的情况下,可避免地址冲突;对于未经生产验证的程序,也可先运行在独立网络环境中,降低对生产系统的影响。
- 借助流量可视化功能:用户曾发现两台虚拟机之间存在异常大流量,单日数据量达到十几 TB。经与研发团队排查,问题来自程序 Bug 触发的死循环。该问题如果仅依赖传统运维方式,较难被及时暴露。
随着文件存储与网络安全能力纳入同一平台,用户的企业云基础设施不再只承担计算资源统一承载,也进一步覆盖数据管理、网络可视化和安全治理,为后续 AI 平台与智能体平台建设提供更完整的基础。
阶段三:引入榫卯 AI 平台,统一模型、网关、算力与观测
在企业云基础设施持续完善后,用户进一步开展 AI 应用探索,重点围绕内部船舶规范查询、翻译、知识库等场景提供模型服务支撑。
早期,用户通过开源工具手工部署模型,完成初步验证。虽然开源工具能够帮助团队快速了解技术可行性,但进入生产使用后,集群搭建、版本更新、问题排查、模型部署和服务治理都会显著增加基础架构团队压力。用户更倾向于通过成熟商业产品承载生产环境,把平台复杂度和服务保障纳入可控范围。

针对模型服务统一管理和快速上线需求,用户评估并引入榫卯 AI 平台,在已有基础设施上部署统一模型服务支撑体系。平台提供算力管理、模型管理和模型网关能力,将模型部署、服务发布、API 路由、密钥管理、资源监控和访问审计纳入统一管理。

通过榫卯 AI 平台,用户无需对现有基础设施资源进行大规模改造,即可快速完成模型算力管理和模型上线,并充分利用已有基础设施资源。借助可视化管理平台,IT 团队可以统一管理模型实例,了解资源使用情况和模型运行指标;通过模型网关,用户可对私有模型形成统一入口,并实现密钥统一管理,降低调用配置分散和密钥管理风险。
观看视频,了解更多功能特性。
榫卯 AI 平台 1.1 增强 GPU 虚拟化与模型治理能力
在这一基础上,用户可根据业务需求更快接入和发布新模型,为内部查询、翻译、知识库等应用提供稳定模型服务,也为后续智能体平台建设提供统一的模型服务基础。
阶段四:基于模型服务能力,进一步建设智能体平台
在模型服务支撑体系建设完成后,用户进一步将 AI 能力从“模型调用”走向“AI 可用“,面向内部运维和业务自动化场景建设智能体平台。
在该路径下,智能体平台不是独立于现有架构之外的新系统,而是建立在已有企业云基础设施和模型服务能力之上的延展。云平台提供虚拟机、容器、文件存储和安全可观测等基础能力,榫卯 AI 平台提供模型服务治理能力,智能体平台进一步连接内部流程和工具,形成从资源承载、模型服务到自动化执行的连续能力。

目前,智能体平台基于已有云平台和榫卯 AI 平台能力,连接模型服务、企业业务系统及各类能力接口,将部分业务流程和运维流程沉淀为可调用、可编排的能力。当前,平台可面向资源交付、系统运维等 IT 场景提供支撑,并逐步扩展到研发设计、生产制造、供应链协同、经营管理等业务场景,为智能体调用企业内部能力提供统一基础。
在实际推进过程中,用户也通过一些具体运维痛点,让团队成员更直观地理解智能体平台的价值。通过将重复性运维操作沉淀为可调用能力,智能体平台既帮助团队解决实际问题,也让“智能体”从抽象概念转化为可以落地的工作方式。

一套可持续扩展的云平台承载不断变化的业务系统形态
从虚拟化替代、容器平台建设,到文件存储、安全可观测、AI 平台和智能体平台,用户的基础设施演进始终围绕统一规划展开。对于用户而言,统一架构的价值不在于完成某一项单点替换,而在于减少重复建设和多平台割裂,让虚拟机、容器、文件存储、网络安全、AI 和智能体等不同能力能够在同一套 SmartX 架构上逐步扩展、统一管理,并随着业务需求变化持续演进。
您可下载《构建 Agent Ready 的企业云基础设施》白皮书,获取更多内容。
SmartX vs. VMware:容器管理服务功能对比与替代实践
超融合虚拟化和容器环境 GPU 支持性能测试:基于 NVIDIA T4 与 A30
如何轻松统管虚拟化和容器环境?一文了解 SmartX 虚拟化容器融合基础设施
以 SmartX ELF 替代 VMware vSphere:生产级虚拟化特性,深度适配国产生态
SKS 1.6 发布:支持表单可视化管理与全栈信创
不止NAS替代:3家企业以超融合构建企业级文件存储与应用一体化平台实践
以 Everoute 替代 VMware NSX:关键能力可对标,使用和运维更简单
安全、灵活、高可用:Everoute 虚拟专有云网络特性解读
照亮虚拟网络流量“盲区”:超融合网络流量可视化功能解读
榫卯AI平台1.1:增强GPU虚拟化与模型治理能力,让资源使用和模型管理更高效