运维服务能力和运维体系是分布式数据库平稳运行的重要保障。运维体系应该包括完善的监控预警、故障处理、性能优化、备份恢复、安全防护等服务能力,并形成标准化的操作流程和规范。通过持续完善数据库运维服务能力,建立规范化的运维体系,可以有效提升分布式数据库的稳定性、可用性和性能,降低故障风险,并快速响应和处置故障。
在分布式数据库管理平台中,调度算法和策略直接影响到数据库实例的资源利用效率、业务性能和运维成本。一个高效、智能、灵活的调度系统需要综合考虑多方面的因素和需求,并支持多样化的调度策略和优化手段。应具备如下能力:
1.多维度资源评估与约束控制。调度系统维护节点资源分配表,记录每个节点上已分配的分布式数据库实例及其资源需求(如 CPU 核数、内存大小、存储空间等),同时通过监控组件实时采集节点的各项资源指标。通过比较节点的资源分配表和实时监控数据,控制计算节点的负载水平和剩余容量。
2.基于分布式数据库服务分级的调度。根据不同的维度,对分布式数据库实例进行分级打标:
(1)业务重要性:根据分布式数据库实例所承载业务的重要程度,划分为核心、重要、一般、长尾等级别。(2)服务等级协议(SLA):根据业务对分布式数据库实例的可用性、性能、数据一致性等指标的要求,划分为高保、低保等级别,或者定义更细粒度的 SLA 等级。
(3)业务访问模式:根据分布式数据库实例的读写比例、并发用户数、请求量波动等访问特征,划分为稳态业务(访问平稳)和敏态业务(访问波动大)等。
3.节点密度分级与超卖管理。通过对节点打标区分高密度和低密度节点,并设置不同的超卖比例。根据节点的密度等级和数据库的业务级别,自动匹配最优的部署方案,在资源利用率和业务隔离性之间取得平衡。
4.基于分布式数据库画像的智能混部与负载错峰,通过对分布式数据库实例的资源使用情况进行持续监控和分析,可以自动识别负载类型和高峰期特征,并据此进行智能混部和负载错峰调度,优化节点的资源利用效率。
5.主机组隔离调度,不同的业务负载往往会运行在不同的Node 分组中,如经典的数据面和控制面的分离、不同数据库引擎的部署隔离等。
6.Numa Node 调度能力,在多 Numa Node 架构机器下跨 Numa访问,对于分布式数据库性能损耗影响很大,需要考虑 Numa Node分配和管理能力。




