企业建设 AI 和智能体平台时,容易先关注模型能力和应用场景,但真正进入生产使用后,底层基础设施往往决定平台能否持续运行。模型部署、服务发布、API 路由、密钥管理、资源监控、访问审计,以及后续与业务系统和内部工具连接,都需要统一的基础设施和平台能力支撑。

某船舶制造用户的实践说明,智能体平台不是独立于现有架构之外的新系统,而是建立在已有企业云基础设施和模型服务能力之上的延展。该用户先完成虚拟化、容器、文件存储和安全可观测能力建设,再引入榫卯 AI 平台,最后进一步建设智能体平台。

企业 AI 与智能体平台基础设施能力示意
企业 AI 与智能体平台基础设施能力示意

为什么不能只靠开源工具手工部署模型?

开源工具适合快速验证模型可用性,但生产使用会带来更多基础设施问题。集群搭建、版本更新、故障排查、模型部署、服务治理、密钥管理和资源观测都需要持续投入。

该船舶制造用户早期通过开源工具手工部署模型,完成了初步验证。但进入生产使用后,用户更倾向于通过成熟商业产品承载生产环境,把平台复杂度和服务保障纳入可控范围。

统一 AI 平台需要承接哪些能力?

榫卯 AI 平台在该项目中承担的是模型服务统一管理和快速上线支撑。平台提供算力管理、模型管理和模型网关能力,将模型部署、服务发布、API 路由、密钥管理、资源监控和访问审计纳入统一管理。

这类能力可以帮助 IT 团队统一管理模型实例,了解资源使用情况和模型运行指标;通过模型网关,为私有模型形成统一入口,并降低调用配置分散和密钥管理风险。

需要强调的是,AI 平台提供的是模型服务和治理基础。具体模型效果、推理性能和智能体业务价值,还取决于模型选择、硬件资源、应用流程、数据质量和业务集成方式。

智能体平台为什么依赖前面的基础设施建设?

智能体平台需要调用模型服务,也需要连接企业业务系统和内部能力接口。如果前面的资源承载、模型服务、访问控制和监控能力没有统一,智能体平台很容易变成新的孤立系统。

在该项目中,智能体平台基于已有云平台和榫卯 AI 平台能力,连接模型服务、企业业务系统及各类能力接口,将部分业务流程和运维流程沉淀为可调用、可编排的能力。当前可面向资源交付、系统运维等 IT 场景提供支撑,并逐步扩展到研发设计、生产制造、供应链协同和经营管理等业务场景。

对企业的启示

企业 AI 和智能体平台建设不宜只从单个应用试点出发,也需要同步规划基础设施底座。更稳妥的路径是:先让虚拟化、容器、文件存储、安全可观测和算力资源具备统一承载能力,再建设模型服务平台,最后把智能体能力接入业务流程和内部工具。

这样,AI 能力不是叠加在基础设施之外,而是成为企业云平台持续演进的一部分。

相关问题

参考资料

继续阅读