暂无图片
暂无图片
暂无图片
暂无图片
暂无图片

鲸品堂|如何炼成“天下无忧”的计费系统?

浩鲸科技 2020-08-03
140

近年来,中国电信集团持续推进企业转型升级(3.0战略),着重推进网络智能化、业务生态化、运营智慧化。为顺应3.0战略,中国电信在全国范围内对BSS系统进行了全面升级,通过技术变革、流程优化、数据整合、感知提升,实现了BSS的3.0智慧化转型。


浩鲸科技新一代BSS3.0计费系统采用“平台+应用”的全新IT架构,构建云化的、能力中心化的智慧BSS系统。


2018年,在湖南电信首先完成了试点;2019年,分别于7月、8月2个月内接连完成重庆、甘肃、新疆三省上线。计费上线后性能卓越、运维高效、系统运行稳定,得到了客户的高度认可,三省纷纷发来表扬信。浩鲸科技新一代BSS 3.0经受住了浪涌式交付的考验,展现出了全新IT架构规模化交付的优势。


打造一个“天下无忧”的计费系统非一日之功,需要有多方面的长期积累,浩鲸科技从产品架构、研发流程、运维能力三个方面来综合保障计费的“天下无忧”。


1.首先是产品架构的保障,通过分布式、容器化、MDB化、消息化的云化架构改造,保证了系统在平台架构上的先进性。


2.其次是研发流程的保障,通过基于DevOps的CI/CD流程,实现计费版本的自动代码检查、自动编译、自动化测试、容器镜像打包等,提高计费系统的质量效能。


3.最后是运维能力保障,通过流框接入容器管理框架,实现应用故障的快速接管和横向扩展,通过加强MDB和信控等关键环节的运维能力和故障解决预案,做到系统故障的多层级防护和隔离,确保了系统的高可靠性。

1

“天下无忧”的计费系统的产品架构保障


采用“平台+应用”的设计理念,构建高性能、高可用、可扩展、可编排、易运维的新一代融合计费云化架构;自研分布式MDB,完全替代TT,实现余额等计费核心数据的高效可靠访问;基于分布式消息中间件,构建先进的流式计算框架,率先实现离线计费全流程消息化,带来卓越的性能表现和消息化的可靠性;全面落地电信集团PaaS组件,实现去IOE的云化架构,通过引入二级缓存技术和微服务架构调整,场景三性能提升5倍,集团日常考核排名提升显著。


计费总体架构图如下:


2

“天下无忧”的计费系统的研发流程保障


随着业务复杂化和人员的增加,开发和运维演化成两个独立的部门,分工各有不同。DevOps系列工具的使用,使开发和运维之间无缝衔接,通过自动化流程使得软件构建、测试、发布更加快捷、频繁和可靠。


DevOps研发交付流程如下图:


通过上面的持续交付、快速迭代的DevOps开发交付流程,实现研发运维一体化的研发管理流程。


在产品运维能力方面,浩鲸计费全系统都实现了容器化部署,包括后台c++应用。通过引入docker容器化部署,简化应用部署升级和管理复杂度,提高运维效率,升级部署由原来人工三四个小时缩短到十分钟内,高效可靠准确。


基于docker容器化部署的计费版本,版本管理通过ZCM进行构建,搭建CI流程,生成镜像文件,以及应用配置文件在发布到现场,实现便捷高效自动化的CI/CD流水线,流程如下图:


1、代码管理:支持受控模式下代码的自动管理。

2、代码检查:支持各类JAVA/C++代码检查,可根据部门规范进行定制化封装插件。

3、自动构建:根据代码库的配置文件,自动构建版本,支持直接输出容器镜像。

4、单元测试:自动进行JAVA/C++单元测试,输出测试结果和覆盖率报告。

5、自动部署/更新:通过镜像管理中心自动下载镜像文件,自动部署和更新镜像文件版本至测试环境。

6、自动化测试:应用更新完毕,自动触发回归测试,生成测试报告。

7、部署/灰度发布:自动化测试完成后,可通过批量升级、灰度发布升级和在线发布升级计费版本至生产环境。



版本发布到现场后,现场需要基于自动化测试平台进行完整流程测试,需要基于对帐工具进行大版本上线前的自动对帐处理,以下对这两方面工具进行简要介绍。


1
自动化测试平台


从案例设计、业务配置、自动测试、评估反馈维度,提供多种系统能力,相互协调共同完成计费业务测试,而实现替代人工测试,提升业务上线的测试准确性。整体流程如下所示:



1、案例设计:提供测试案例库、测试样本库、测试能力库的配置功能。同时,基于大数据学习测试模型,根据测试结果反馈数据,自动优化、丰富案例库;

2、业务配置:根据新业务上线或版本升级提供的业务配置变动列表,自动匹配测试场景,创建测试案例实例,生成测试数据、测试执行计划;

3、自动测试:自动化测试调度引擎根据测试数据、测试执行计划调用各业务能力中心的能力,并采集测试结果,完成系统自动化测试;

4、评估反馈:自动化测试平始将测试结果数据与预期的结果进行比对、分析,并形成业务上线报告或版本升级报告。业务运营人员根据测试结果报告,对系统的数据进行抽样检测,对确认测试结果进行确认、反馈。



2
自动对帐工具


我们都知道计费新系统上线,一般都是需要进行对帐的,对帐的准确性要求比较高,需要达到99.99%的四个九精准度。而计费的清单量每个月可是百亿级,基于百亿级的清单要对出99.99%的准确度,难度可想而知。


为了提升对帐准确性和对帐效率,我们引入了自动对帐工具,对帐工具使用主要包括配置抽取规则、配置对比列、发布对帐任务、查看对帐报告等步骤,详细如下图:


1)配置抽取规则:通过配置新老两个系统的源数据抽取语句,获取新老系统输出的清帐单等结果数据

2)配置对比列:主要用于配置哪些属性列用于查找,哪些属性列用于比较,哪些属性列需要进行界面展示。

3)发布对帐任务:通过一键发布对帐任务,进行对帐比对处理,通过任务运行状态查询界面,可知道对帐任务处理进度。

4)查看对帐报告:可以按本地网、业务类型、差异类型等维度自动生成对帐报告,可以导出对帐报告至excel中。


3

“天下无忧”的计费系统的运维能力保障


1
产品可视化运维


新一代BSS 3.0计费系统以虚拟化和容器化为基础,提供智慧运维平台,支撑应用的自动化发布和部署。通过完善的监控和性能分析,实现IAAS、PAAS、SAAS层全流程可视化监控和智慧化运维,有效护航BSS 3.0各中心的高效稳定运行。

BSS 3.0业务中心运行监控大屏


如上所示,BSS 3.0业务中心运行监控大屏主要包括流程监控、业务量监控、提醒及时性监控、消息监控、告警监控,可以对系统的性能、负载、积压情况等关键指标快速核查,判断系统运行状态,提升系统故障定位能力和运维效率。

BSS 3.0 Cloud Manager智慧运维平台(ZCM)


如上所示,浩鲸科技通过ZCM工具实现了自动化应用管控,支持批量升级、灰度发布升级和在线发布升级,升级部署由原来人工三四个小时缩短到十分钟内,高效可靠准确。支持统一管理业务日志与服务日志采集分析,实时可视化调用链分析和查询,提升系统故障定位能力和运维效率。基于DevOps的理念,BSS3.0提供自动化和可视化业务中心应用容器构建,确保随时有一个可正常运行的版本供生产使用,改变人工构建的落后模式,展示构建各个环节的耗时与异常情况,支持代码自动检查分析和自动化测试能力,将系统故障在构建时即可进行拦截,有效减少生产故障。


2
故障自动接管与横向扩展


基于智慧运维平台(ZCM),计费的应用可根据负载进行横向扩展,弹性伸缩,将可能的系统性能故障扼杀在蕴量之中,保护系统免受业务高峰的冲击。智慧运维平台支持按照时间策略、资源负载情况和业务压力情况进行自动弹性伸缩,确保业务平稳健康运行。

ZCM应用弹性伸缩


浩鲸科技的产品研发流程,引入业界先进的DevOps理念,采用Scrum方法实现敏捷开发、快速交付、快速响应需求。对于快速的版本迭代、发布,有完整的流程保障,但是难免还是会发生应用故障泄露。对于可恢复的故障,智慧运营平台可实现应用故障自动接管、自动恢复。

应用故障自动接管


智慧运维平台通过应用健康检测,分别提供应用级与节点级故障的自动接管。当检测到节点内应用实例故障时,智慧运营平台选择资源节点自动部署、自动重启发生故障的应用。同时智慧运营平台也支持节点发生异常时,自动选择资源节点自动部署、自动重启节点,维持系统内节点数,保证业务不中断。


3
系统故障的多层防线


基于浩鲸科技智慧运维平台(ZCM),通过应用灰度发布、故障自动接管,并结合可视化的运维监控中心及时发现应用异常,从基础设施上确保系统层面业务的可用、可靠、稳定。同时从计费业务层面,再次设置多道防线,保存计费业务支撑“万无一失”。


分布式MDB,提供多种数据保障手段,保证系统数据安全,稳固系统底座。


自研的分布式MDB,具有数据横向扩展、冗余容灭、故障快恢复等业务分布式组件基本功能;同时,分布式MDB还根据计费应用特性要求,配套提供数据在线加载、在线主备切换、应用实例主备切换功能,以满足多种异常场景下的容错需求。


  • MDB数据在线重载


数据在线重载是按内存表为维度,对MDB数据节点内的数据进行应用无感智的在线更新的功能。MDB数据在线重载结束后,自动完成内存表的切换,应用无需启停。当在系统数据异常,人工紧急修复后,通过数据在线重载,可保持在业务提供不间断的情况下,对系统数据进行更新,是系统在线故障修复的一把利器。


  • 主备节点在线切换


在线主备切换是分布工MDB数据节点冗余备份,当数据节点发生故障时,可自动完成主备数据节点切换,且应用无感知,无需要启停应用。在线主备切换是数据节点异常情况下,在MDB内实现故障自动接管,能确保应用不断线,业务服务不中断,体现系统的韧性。


  • MDB实例主备切换


MDB实例主备切换是把相同的数据部署两套MDB实例,并互为热备。其中一个MDB实例发生集群故障时,可自动实现MDB实例自动切换,且应用无感知,保证业务服务不中断。


通过AI预测发现潜在的故障,并提供各项应急机制,保证系统“万无一失”。


系统割接上线或版本升级失败或套餐配置错误,导致应用与数据大面积异常,无法在短期内恢复的情况下,如何保障电信用户业务的可用性呢?在发生大面积故障的情况下,保障所有业务都还可用难于实现,但是保证不影响用户使用电信通讯服务,是计费业务保障的底线。因此,我们在计费系统的“出口”应用模块信控上,设置多道防线,确保守住最后底线,避免故障最终泄露、产生用户投诉事件。


防线一:信控核心业务操作自校验


信控的停复机核心操作,涉及用户是否可正常使用电信服务,需要严防系统故障泄露到用户,引发用户投诉。信控提供规则自校验功能,用于对于信控策略判断的结果,进行业务操作有效性的稽核,防止人工规则配置错误或应用故障导致数据错误时,产生错误的停复机操作。如信控停机规则中,通常都会配置基本校验规则:用户欠费大于零,防止对用户未欠费的情况下,进行停机处理。


防线二:关键业务系统故障智能拦截熔断


首先,对信控上游的应用自身故障的检测、拦截,在影响事件发生前防患未然。应用发生故障的通常症兆都是应用处理数据发生异常的波动。基于AI智能机器学习算法,对应用数据的日常波动范围进行评估预测,并提供给应用使用。对于超出异常波动的业务处理数据,需要人工审核后,方可进入下一环节,从而控制应用故障影响范围。如余额存入或销帐时,可根据智能预测、计算帐户充值金额的范围。在余额存入或销帐时,对于超出范围的处理数据,进行人工审核,以免因数据异常,影响后续信控处理的准确性。

充值异动智能监控


其次,对信控工单进行熔断监控。对实时信控生成的停复机工单量进行实时的波动范围AI智能预测、计算。同时实时信控,参考计算后的停复机工单异常波动范围,如果在指定时间内、指定业务类型的停机的用户数超出预测的波动范围时,实时信控进入熔断状态,暂停相应类型停复机工单的生成,并触发系统紧急告警。由运维人员介入进行系统分析、定位异常波动的原因后,可恢复实时信控的执行。通过数据量异常熔断机制,可检测非正常的波动,将可能的故障阻断在有限的影响范围内。

信控异常智能熔断


防线三:关键应用与数据故障绿色通道


信控应用提供绿通道机制,可以在计费系统其它应用故障的情况下,通过简化信控处理逻辑,提供自动复机处理,快速减少故障影响范围。比如出现资费配置异常导致的大批量错误,导致需要做大批量回退重处理,此时把正常信控关闭,开启信控绿色通道,对充值用户进行自动复机。避免计费因应用故障导致充值缴费用户无法及时复机,而产生投诉。

信控绿色通道流程


防线四:极端故障轻量级应急支撑工具


如果在极端异常故障的情况下,比如计费核心数据库都无法在短期内恢复正常,还能保证用户正常复机吗?信控提供轻量、可独立部署的服务能力,通过导入用户号码,直接送网络侧对用户进行复机,做为特殊情况下的应急支撑工具使用,为系统预留最后的逃生舱。

信控应急工具处理流程


信控应急工具不依赖于现有BSS产品的基础组件与数据库,可独立部署,独立使用。同时提供不同的应急功能,满足各种复杂故障场景下的应用预案的操作需求。信控应急工具包含应急功能,可根据操作数据的来源,分为在线故障应急与离线故障应急。


1.在线故障应急:在关键业务发生应用故障时,应用数据库还可使用的情况下,对需要复机的用户提供用户复机功能。这个级别的复机,会正常修改用户停复机状态等资料,用户数据后续不用修复。


2. 离线故障应急:业务应用发生故障时,如果数据库也不可用,可以找个临时的主机和数据库,把离线故障应急应用部署起来,把需要复机的用户直接送网络进行复机。这个级别的复机,后续需要根据复机日志记录,修复用户停复机状态等资料。


通过MDB和信控这两类关键应用的多道防护和隔离,我们确保了计费的稳定运行,投诉量持续保持在低水平。经统计,我司承建某省计费的MDB已稳定运行228天无重启,充值全年无投诉,充值后1分钟内复机率达到99.998%



4

“天下无忧”的计费系统仍需如履薄冰


浩鲸科技的计费系统发展了这么多年了,经过省集中、1.0到3.0的迭代,虽然技术架构上有了几轮的飞跃,但作为计费人的使命仍然是要做到“极速、极准、极稳”,计费人的底线仍然是“精细准确、万无一失”。


有了这些产品架构、研发流程、运维能力的保障,浩鲸计费就有了基础去迎接未来的挑战。面对5G时代,高连接、低时延、高带宽、计费系统将要以什么样的面目去迎接5G 2B业务生态的挑战,这些都是我们后续需要思考的课题。

文章转载自浩鲸科技,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。

评论