产品定位
南大通用大规模分布式并行数据库集群系统,简称:GBase 8a MPP Cluster,它是在
GBase 8a 列存储数据库基础上开发的一款 Shared Nothing 架构的分布式并行数据库
集群,具备高性能、高可用、高扩展特性,可以为超大规模数据管理提供高性价比
的通用计算平台。
应用场景
GBase 8a MPP Cluster 用于支撑各类数据仓库系统、BI 系统和决策支持系统。
技术特点
GBase 8a MPP Cluster 具有联邦构架、大规模并行计算、海量数据分布式压缩、
高效存储结构、智能索引、虚拟集群及镜像、灵活的数据分布、完善的资源管理、在
线快速扩展、高并发、高可用、高安全性、易维护、高效加载等技术特征。
具体特点如下:
低硬件成本
完全使用 x86 架构的 PC Server,不需要昂贵的小型机和磁盘阵列。
联邦架构集群部署
基于列存储的完全并行的 MPP + Shared Nothing 的联邦架构,采用多活
Coordinator(Master)节点、运算节点的两级部署结构,避免了单点性能瓶颈
和单点故障。
Coordinator 节点支持最多部署 64 个;
单个虚拟集群的数据节点支持部署 300 个以上,包含多个虚拟集群的同一物理
集群数据节点支持部署 1000 个以上;
单节点可支持 100TB 裸数据数据量,且所有节点无共享;
单个虚拟集群内部不同数据节点具有对等计算能力;
集群支持海量数据存储、查询,单个物理集群最高支持 100PB 以上的结构化数据。
大规模并行计算
通过采用 MPP 技术的计划器,基于规则和基于代价的优化器,基于异步 IO 技
术的调度器,支持高并发、高可靠、大规模的并行调度。
海量数据分布式压缩存储
可处理 100PB 以上的结构化数据,采用 hash 或 random 及 replicate 的分布策略
进行数据分布式存储;
采用先进的压缩算法,减少存储数据所需的空间,并相应地提高 I/O 性能;支
持实例级、表级、字段级三级压缩;
支持基于列存储的数据编码及高效压缩技术;压缩比可达 2~20 倍。
高效存储结构
采用基于列存储、适合分析优化的存储结构;
索引采用免维护的智能索引;
支持列存和行列混合存储的存储结构,有效提高列存数据库在 select * 场景下
的查询性能。
智能索引
采用粗粒度智能索引技术,索引建立膨胀率不超过百分之一。智能索引包含基
于列的统计信息,在数据检索定位时可被直接使用,有效过滤数据,大幅降低
数据库磁盘 I/O,高性能、免维护的智能索引技术,大幅提高海量数据的查询
性能。
虚拟集群及镜像
通过虚拟集群技术,可以对集群中的运算节点进行分组,物理上进行资源的隔
离;对命名空间进行逻辑隔离,支持多租户的使用方式。
通过镜像技术,在不同的虚拟集群间对数据进行复制,提供更高的容灾能力,
满足更灵活的系统容灾和读写负载分离等业务场景需求。
灵活的数据分布
用户可以按照业务场景的需求,自定义数据分布策略,从而在性能、可靠性和
灵活性间获得最佳匹配;
数据分布策略包括 hash 分布和 random 分布。
完善的资源管理
通过资源池及资源使用计划的灵活配置,可以支持对 CPU、内存、磁盘空间、
磁盘 IO、并发任务数等关键资源和指标进行管控;
结合虚拟集群技术能够提供完善的多租户能力。
在线高性能扩展
支持集群节点的在线扩容和缩容,效率更高,对业务的影响更小;
在线扩展性能大于 20TB/小时。支持在线替换故障节点,而不影响业务运行。
高并发
读写不互斥,支持数据的边加载边查询,并发能力大于 300。
数据高可用
通过冗余机制来保证集群的高可用特性,互备的分片数据间可实现自动同步;
数据通过副本提供冗余保护,自动故障探测和管理,自动同步元数据和业务数据;
部分副本故障不影响集群的可用性;
支持故障的自动恢复,无需人工干预;
数据的副本机制支持 1 或 2 个数据副本,支持用户自定义的数据副本分布方式。
主备集群高可用
支持高可用模式;
支持数据全量、增量同步;
支持主备同步回滚机制;
支持主备同步错误恢复机制;
支持同城灾备;
安全性
提供完善的用户、角色、账号控制策略,提高数据库集群的安全性;
提供详尽的审计日志输出功能,记录数据库中与数据库操作相关的所有日志,也可以通过图形化的监视工具实现审计管理;
支持透明的数据加密:
支持数据存储加密,支持数据库密码加密,支持数据加密压缩;
支持相关加密函数,如 AES_ENCRYPT()、ENCRYPT()、MD5()、SHA1()、SHA()等;
提供图形化管理及监控工具,以简化管理员对数据库的管理工作。
数据加载高效性
基于策略的数据加载模式,集群整体加载速度大于 30TB/h。
集群具有数据备份恢复能力
支持全量、增量备份/恢复;
Hadoop 备份/恢复
支持与 Hadoop 之间进行数据备份/恢复,将库内数据备份到 Hadoop 中,或将
Hadoop 内的数据文件恢复到库内;Hadoop 备份/恢复性能大于 100TB/小时。
标准化
支持 SQL92 ANSI/ISO 标准,支持 ODBC、JDBC、ADO.NET 等接口规范;
支持 C API,Python API,TCL API 等接口;
支持 SQL 2003 OLAP 函数。




