重点内容

  • 基础层双活建设建议:双活数据中心需通过裸光纤实现互联,并确保 RTT<5ms;仲裁节点仅需普通三层 IP 网络,RTT<100ms,即可实现虚拟机跨数据中心的高可用。在此基础上,结合分布式防火墙对东西向流量进行统一安全管控,可进一步提升整体系统的高可用性与安全性。
  • 应用层双活建设建议:应用层双活需根据应用架构(Web-APP-DB 三层架构 / 单体架构 / 混合架构)规划具体的 RTO 目标和实现方案。
  • 访问层双活建设建议:最容易被忽视的层级,需关注客户端访问和业务互访的高可用,可分别通过外联交换机、VPC 等方式实现双活。
  • “两地三中心”建设建议:在双活建设的基础上,引入异地灾备集群,对业务实现分级保护。建议基于“整体架构,按需落地,平滑切换”的原则进行规划建设。
企业在规划双活数据中心时,容易只关注底层资源是否双活,而忽略应用恢复目标和访问路径是否同样具备高可用能力。真正可用的双活方案应该是一项覆盖基础层应用层访问层的系统性工程

以下,我们将结合 SmartX 的方案与实践经验,详细解读基于超融合的“三层”双活建设方案与关注重点,并进一步说明从同城双活演进到“两地三中心”的落地路径。

有了备份和容灾,为什么还需要“双活”?

“备份”“容灾”“双活”这三个概念看似相似,实则关注点不同。

  • 备份:侧重于解决数据安全性的问题,主要通过创建数据副本来防止数据丢失。
  • 容灾:侧重于解决灾难恢复的问题,像购买保险时更多考虑的是灾难发生后的补偿措施。
  • 双活:侧重于解决业务连续性的问题,是一种“主动预防机制”,即在灾难发生前,就设定好其对于业务的影响程度和损失范围。

2025 年发布的《信息系统灾难恢复规范》,对整个容灾体系进行了系统地划分。在该规范中,容灾被定义为一个包含备份、容灾与双活的笼统范畴,分为六个等级。

  • 第 1–2 级:最典型的数据备份场景,包括本地和异地备份,必须有数据的副本方可完成。
  • 第 3–4 级:从局部容灾到完整容灾,要求设备具有一定的冗余,且完整设备冗余就绪。
  • 第 5 级:针对数据丢失或中断的实时容灾,在数据保护的层面上 RPO=0,允许分钟级恢复的存在。
  • 第6级:从业务角度出发的应用双活集群,在 RPO=0 的基础上,大幅缩短 RTO,实现数据零丢失和秒级切换。

从以上的标准可以看出,双活方案位于整个容灾大方案的最顶端

基于 SmartX 榫卯超融合的“三层” 双活解决方案

双活方案是自建数据中心中相对复杂的方案,通常涉及到基础设施、应用和访问 3 个层级的建设。基于 SmartX 榫卯超融合实现数据中心双活的方案,同样围绕这三个层面开展。

基础层双活:搭建跨数据中心拉伸集群

基础层即基础设施层,包括计算、存储、网络安全等完整的基础设施集群,这个层级的双活建设也是很多企业开展的重点。SmartX 通过拉伸集群的方式实现基础层的双活:在两个数据中心分别部署榫卯超融合节点,然后通过拉伸集群的功能,将两个数据中心整合成一个逻辑集群,同步写入数据。

1. 物理距离

双活建设要求很高,对两个数据中心之间的物理距离也有一定限制。虽然光的速度很快,但数据写入对延迟是有要求的。根据光的延时特性,通常来说,两个双活数据中心间距离的理论极限是 100 公里。但考虑到链路质量等问题,一般情况下建议控制在 50 公里以内

2. 链路

由于两个数据中心需整合成一个逻辑集群,必须通过裸光纤来保证数据同步的实时性与稳定性。虽然运营商专线也能提供互通,但它往往经过多级交换与中间设备,参数不可控、延迟波动大,不适合承载双活的底层同步流量。因此,最安全可靠的方式是裸光纤互联,并确保 RTT<5ms。这一指标并不苛刻。在 30-40 公里的距离内,只要链路质量良好,RTT 通常可稳定在 1-1.5ms

3. 仲裁节点

在双活架构中,除两个数据中心外,还必须部署第三个站点——仲裁节点,作为“裁判”确保数据的强一致性。该仲裁节点不能放置在 A 或 B 数据中心内部,因为双活是数据中心级的架构,如果某一数据中心整体失效(如停电或灾害),位于同站点的仲裁节点也会随之失效,从而导致整个集群无法正确判定状态。因此,仲裁节点 C 必须独立于A、B站点之外

在网络要求上,仲裁节点 C 无需与数据中心 A、B 之间使用裸光纤,只需通过普通三层 IP 网络即可互联。网络带宽百兆级即可满足RTT<100ms 即可,要求相对宽松。

4. 双重保护:存储 3 副本 + 虚拟机高可用

在双活集群架构建立完成后,SmartX 榫卯超融合通过“双重保护机制”进一步增强系统可靠性。

  • 存储三副本:除虚拟机所在的本地放置的 2 个数据外,在远端还有 1 个副本。
  • 虚拟机高可用:当主机发生故障时,系统优先在本地通过高可用机制自动接管;当整个数据中心不可用时,会自动将业务切换至远端站点继续运行。

5. 虚拟网络东-西向防火墙

在双活数据中心架构中,除了计算、存储和网络,很多企业也关注云安全,即虚拟化环境“东-西向”流量的安全。通过 Everoute 的虚拟防火墙功能,无论虚拟机运行于数据中心 A 或 B,其安全策略都能自动同步与随行迁移,无需人工干预。

应用层双活:各种应用的 RTO 目标

应用层双活是建设双活数据中心更高层次的目标。建立双活平台的根本目的并不是为了“拥有一个双活平台”,而是为了保障关键业务的连续性,即让核心应用在故障发生时仍能持续运行,并达到预期的 RTO 等级。不同类型的应用架构,能够实现的 RTO 目标也存在显著差异。

1. Web-APP-DB 三层架构

对于典型的 Web–APP–DB 三层架构应用,如果各层均支持集群化部署或具备高可用保护机制(如应用集群、应用HA等),应用切换可在秒级完成,整体 RTO 近似为 0。SmartX 双活方案能够提供跨数据中心的共享资源,使基础层的双活和应用层的集群结合起来。

2. 单体应用

若业务为单体架构,应用与数据库运行在同一台虚拟机中难以拆分,无法实现集群化部署,也缺乏进程级监控与切换机制。借助 SmartX 榫卯超融合的双活方案,RTO 可以控制在 10-15 分钟级别。若应用启动较快(如虚拟机 3 分钟启动、应用 2 分钟恢复),则整体 RTO 可压缩至 5 分钟。这种情况下应用层的 RTO 由两个因素共同决定,即虚拟机 HA 恢复时间应用自身恢复服务所需时间

3. 混合架构:物理机与虚拟化业务协同保护

对于数据库仍运行在物理机上的场景(如 Oracle、达梦、金仓等),SmartX 榫卯超融合支持将物理数据库通过容灾的方式,实现虚拟机数据库容灾,两端数据库之间建立实时同步,并可实现分库分表、读写分离等。在提升性能的同时,兼顾数据一致性与高可用性。

综上所述,不同的应用架构决定了不同的 RTO 目标,因此,在双活项目落地过程中,IT 架构部门应与业务部门充分沟通,明确不同应用的架构特点与可实现的 RTO 目标。

访问层双活:最容易被忽略的环节

在双活数据中心架构中,访问层往往是最容易被忽略的环节。即使底层架构稳健、应用层具备完善的高可用保护,业务部门或终端客户也不一定能成功访问。

场景一:客户端的访问层

以某医院客户为例:在 A 院区中,业务部门通常通过内网访问 A 数据中心的系统,而到 B 数据中心的流量需要先经过 A 院区的核心交换机,再经跨中心链路到达。一旦 A 院区核心交换机或机房整体停电,即便 B 数据中心的系统在双活平台的保护下迅速恢复,A 院区的各业务楼层、门诊与科室仍然无法访问系统——因为它们失去了到 B 中心的网络访问路径。

SmartX 的解决方案是在原有网络接入架构中增加“外联交换机”层级,每个业务单元通过独立外联交换机分别上联至 A、B 两个数据中心,从而形成两条独立访问路径。这样,即使 A 院区的核心网络或数据中心故障,各业务部门仍可通过外联交换机的备用链路直接访问 B 数据中心,实现访问层高可用。

场景二:业务间的互相访问

访问层的另一关键问题是业务与业务之间如何互相访问。在许多项目中,两个数据中心往往不是同时建设完成,新旧数据中心间的网络设备型号、网段规划等均存在差异,这意味着两地之间没有共享网关和网络环境。

为打通 A 和 B 之间的网络层,可以通过物理 SDN 的方式打通,也可以通过 SmartX Everoute 的 VPC 功能打通虚拟化大二层网络,在不同物理网络和设备架构之间构建统一的虚拟网络,实现业务网二层互通与网关高可用。

进一步建设:“两地三中心” 架构

完成“三层”双活体系建设后,数据中心高可用的下一步的演进方向就是构建 “两地三中心” 架构,该架构由两个部分组成。

  • 同城双活集群:包括 A 数据中心、B 数据中心和仲裁节点,其中仲裁节点不一定是一个完整的数据中心,只需部署在一台独立的虚拟机上即可,但必须保证其位置独立于 A、B 中心之外。
  • 异地灾备集群:通常部署在“两地三中心”架构中,即当同城或同院区已具备双活能力后,为提升整体抗灾级别,需要在更远的地方部署灾备站点。

相对于原来的双活方案,“两地三中心” 架构能够针对不同重要程度的应用,可以通过 “双活 + 容灾” 的组合方式对业务实现分级保护

  • 对关键核心业务:可部署于同城双活集群,保障最高级别的连续性。
  • 对一般或边缘业务:可通过异步容灾方式保障数据不丢失,既可容忍短时中断,也能快速恢复。

这种分级保护策略不仅在保护级别上形成差异化,也在保护范围上实现了从同城到跨城的扩展。虽然双活方案对物理距离有要求,但容灾架构没有距离限制,完全可以实现长距离跨区域部署(如从北京到广州)。

因此,在“两地三中心”架构下,无论是本地故障还是异地灾难,系统都能通过双活与容灾协同机制,持续保障数据安全与业务连续性。

落地策略:整体架构,按需落地,平滑切换

不少企业在首次接触双活架构时,会觉得这一体系庞大而复杂,它同时涉及基础层、应用层与访问层的建设,似乎与传统数据中心建设的规划和落地过程完全不同。其实,基于 SmartX 榫卯超融合的双活方案并非只能在全新建设的项目中一次性落地而是可以“分步实施、平滑切换”

  • 整体架构:从整体架构的视角看,SmartX 双活方案与非双活方案没有本质区别,双活方案并不是额外的专有方案,而是榫卯超融合自身能力体系中的一部分。无论是单集群、双活,还是两地三中心,它们都运行在同样的超融合底座之上
  • 按需落地:企业可以根据自身发展阶段按需选择启用不同的能力模块。比如,初始时期只部署单数据中心的超融合集群,逐渐拓展到局部双活、完整双活,甚至是“两地三中心”架构。
  • 平滑切换:传统 IT 建设中,双活往往依赖专门的硬件(如专用存储网关)。而在目前以超融合为核心的软件定义架构下,双活方案是整体架构中的一个可选功能模块,从非双活到双活的升级和切换,不存在任何鸿沟。SmartX 榫卯超融合本身具备双活能力,只需通过配置启用即可。

目前,多家金融、医疗、制造等行业用户,已基于 SmartX 榫卯超融合实现双活架构的标准化建设与平滑演进:

超融合双活数据中心建设:7 家行业用户实践分享

联塑集团:替代VMware并实现双活建设,多品牌服务器利旧降本

某信托公司:替代 VMware 虚拟化与容器平台,构建业务双活超融合集群

财达证券国产超融合双活集群测试与建设实践

信义玻璃:构建跨数据中心业务双活,实现企业云基础架构转型

一文解读医疗评级 IT 基础设施灾备能力要求与 SmartX 超融合灾备解决方案(附用户实践与电子书)

继续阅读