2026 年 7 月 22 日——志凌海纳 SmartX 正式发布榫卯 AI 平台 1.1 版本,通过引入 GPU 虚拟化原生支持能力和涵盖用量统计、配额管理、访问控制和安全审计的模型网关功能,让 AI 应用场景的资源利用和模型使用管理更高效。
观看视频,了解关键功能特性:榫卯 AI 平台 1.1 增强 GPU 虚拟化与模型治理能力。
原生支持 GPU 虚拟化,算力使用更高效
在 AI 应用落地过程中,企业往往需要同时运行大语言模型、OCR、ASR、Embedding、Rerank 等不同类型和规模的模型。传统 GPU 直通方式能够保障大模型推理性能,但当轻量模型或多并发小模型独占整卡运行时,显存和算力往往难以得到充分利用,导致资源闲置。
榫卯 AI 平台 1.1 在已有的 GPU 直通和逻辑隔离的能力基础上,引入隔离性更强的原生 GPU 虚拟化(vGPU)支持能力。用户可按需开启 GPU 虚拟化,并基于显存和算力粒度对 GPU 资源进行动态切分,让同一块 GPU 卡可以同时承载多个模型实例,满足 OCR、语音、Embedding、Rerank 等轻量模型或多业务并发调用需求。
对于对性能要求更高的大模型场景,用户仍可继续使用 GPU 直通能力使用整卡资源,从而在同一平台中兼顾大模型性能保障和小模型资源复用。

在资源分配过程中,榫卯 AI 平台 1.1 可提供节点 GPU 资源占用的全局可视能力。管理员可在统一视图中了解每个节点、每块 GPU 的占用情况,并基于实际用量进行切分、调度和分配。结合硬隔离的资源切分机制,多个模型实例可在同一块 GPU 上运行且互不干扰,帮助企业提升 GPU 资源利用率,并降低模型服务规模化交付的成本。

提升模型治理能力,让模型用量看得清、管得细、控得住、追得到
企业在将多种模型服务接入不同业务系统时,往往会面临以下治理方面的挑战:
- 用量不可视:Tokens 消耗、请求分布和成本归属缺少统一统计,资源消耗情况不透明。
- 配额控制不精细:不同业务、用户或 API Key 难以按需分配模型资源,容易造成资源占用不均。
- 访问权限难管控:密钥分散在各业务系统中,模型访问范围、请求限速和并发上限缺少统一控制。
- 调用过程难追溯:调用时间、访问来源、模型、请求状态和响应内容缺少完整记录,问题排查和安全审计困难。

榫卯 AI 平台 1.1 在此前模型路由与密钥管理能力的基础上,进一步完善模型网关能力,新增用量统计、配额管理、访问控制与访问日志等功能。在统一内外部模型接入、路由和鉴权的基础上,平台可对模型调用进行更精细的可视化、约束、管控与追溯,帮助企业提升模型服务的治理能力,实现模型资源使用更透明、调用边界更清晰、访问过程更可控。

用量统计:看清模型与应用的资源消耗
支持按 API Key和模型等维度统计 Tokens 用量及请求情况,帮助管理员了解不同业务、不同模型的实际使用分布,为资源规划、成本核算和服务优化提供依据。
配额管理:按业务精细分配模型资源
支持为每个 API Key 单独设置 Tokens 用量配额,避免单一业务或测试场景占用过多模型资源。管理员可根据业务优先级和实际需求进行差异化分配,让模型资源使用更可控。
访问控制:控制调用边界与访问范围
支持对 API Key 设置请求限速、并发数上限和可访问模型范围,帮助企业落实最小权限原则,减少资源滥用和越权调用风险,同时提升多业务共享模型服务时的稳定性。
访问日志与安全审计:让每一次调用可追溯
可按请求粒度记录访问来源、调用密钥、调用模型、请求状态、Tokens 消耗、吞吐、耗时以及结束原因等信息,并支持留存请求 / 响应明细,便于后续问题定位、性能分析和安全审计。
结合榫卯企业云平台,完善企业 AI 推理基础设施体系
榫卯 AI 平台是榫卯企业云基础设施面向 AI 推理场景的重要组件,聚焦算力模型管理、模型治理和高性能推理,并可结合榫卯企业云平台提供的容器、存储、网络、安全和可观测能力协同,为企业构建生产级、高性能、可治理的模型推理基础设施。
- 容器服务(SKS):为模型推理服务提供标准化运行时环境,支持 GPU 驱动管理,并结合高性能网络能力,保障推理实例稳定运行和高效调度。>>了解 SKS
- 存储服务:为模型文件提供可共享、可管理的存储能力,减少重复存储和分发;同时可为 KV Cache 提供高性能、高容量的缓存与持久化支撑。
- 可观测能力:覆盖 GPU 硬件状态、容器运行状态、推理实例健康、模型资源消耗、调用日志、Token 用量和链路延迟等关键环节,形成全链路可观测能力,帮助企业快速定位问题、开展安全审计、评估服务性能并持续优化资源使用效率。

以上 AI 基础设施方案已在制造、医疗等行业用户生产场景中实现落地:
制造行业用户实践
某制造用户已经基于 SmartX 企业云基础设施实现虚拟化与容器业务的统一承载,并计划进一步拓展基础设施的 AI 支持能力。早期,用户曾通过开源方式完成模型服务的初步尝试,但难以满足生产环境对稳定运行、快速上线、统一调用、运维支持和可观测管理的要求。
围绕统一模型服务平台建设,用户引入榫卯 AI 平台,将算力管理、模型管理和模型网关纳入同一平台,实现模型快速上线、统一调用与可视化观测,提升模型服务交付效率和运维可控性。目前,榫卯 AI 平台已支撑内部规范查询、翻译、知识库等 AI 场景,并为智能体应用引入提供技术基础。
医疗行业用户实践
某医疗用户计划面向知识库问答、文档处理、报告生成、数据分析、语音转写等场景,建设本地化、可管理、可审计的 MaaS 平台,为院内 AI 应用提供统一、安全、可靠的模型服务能力。
该用户基于 SmartX 榫卯超融合、SKS 容器管理、文件存储以及 AI 平台,将计算、存储、容器运行环境与模型服务能力纳入统一基础设施体系。其中,模型负载运行在 SKS 之上,并通过 CSI 为模型文件提供生产级存储与共享能力,保障模型服务的稳定运行与高效调用。
榫卯 AI 平台统一纳管 LLM、OCR、ASR 等不同类型模型,并通过原生 GPU 虚拟化能力支持多模型按需共享 GPU 资源,提升有限算力资源的利用率。同时,平台结合模型网关能力,对模型调用、权限、配额、日志与安全审计进行精细化治理,帮助客户建立可控、可追溯的模型服务体系。
获取《构建 Agent Ready 的企业云基础设施》电子书,了解 Agentic AI 落地趋势、模型推理与 Agent 运行两大场景特点与基础设施需求、结合榫卯企业云平台的建设方案与用户实践。

推荐阅读:
构建 Agent Ready 的企业云基础设施(白皮书下载)