暂无图片
Oracle ASMM内存抖动导致数据库负载飙高
最近更新:2022-06-18 13:39:47

【背景】

用户数据库出现大量活动会话,导致数据库负载急剧加大,从而导致业务出现延时无法正常提供服务的故障问题,业务反馈在14:09:31至14:09:34这四秒钟内,有2692个事务受到影响。数据库中发生大量的library cache lock和latch : shared pool等待事件。

【现象】

数据库出现大量活动会话,数据库负载急剧加大,从而导致大量业务出现延时不能正常运行。 整体性能指标-Average Active Sessions 1.png

从数据库AAS可以发现,数据库实例2在12月31日下午2左右的活动会话数最高,平均活动会话数达到24左右。 2.png 高峰时期在14:07~14:09,平均活动会话都达到了将近280以上,数据库负载较高。业务反馈交易受影响的时间段为14:09:31至14:09:34这四秒钟内,有2692笔交易失败,从ASH的AAS高峰来看,这四秒钟正式ASS最高的时间段,时间完全能吻合上。 3.png 在12月31日14点~15点,数据库发生很多的硬解析和解析失败的情况,在12月30日相同时间点也出现过。 从上图还可以看出数据库一直存在failed parse的SQL,建议设置event 10035事件,找出解析失败的SQL,并提交开发核对。 alter system set events '10035 trace name context forever,level 1';

数据库AWR现象

采集故障时间段的AWR数据分析: ||Snap Id|Snap Time|Sessions|Cursors/Session| |-|-|-|-|-| |Begin Snap:|44450|31-Dec-17 14:00:42|561|3.4| |End Snap:|44451|31-Dec-17 15:00:06|570|3.5| |Elapsed:||59.39 (mins)|||

......