用户数据库出现大量活动会话,导致数据库负载急剧加大,从而导致业务出现延时无法正常提供服务的故障问题,业务反馈在14:09:31至14:09:34这四秒钟内,有2692个事务受到影响。数据库中发生大量的library cache lock和latch : shared pool等待事件。
数据库出现大量活动会话,数据库负载急剧加大,从而导致大量业务出现延时不能正常运行。
整体性能指标-Average Active Sessions

从数据库AAS可以发现,数据库实例2在12月31日下午2左右的活动会话数最高,平均活动会话数达到24左右。
高峰时期在14:07~14:09,平均活动会话都达到了将近280以上,数据库负载较高。业务反馈交易受影响的时间段为14:09:31至14:09:34这四秒钟内,有2692笔交易失败,从ASH的AAS高峰来看,这四秒钟正式ASS最高的时间段,时间完全能吻合上。
在12月31日14点~15点,数据库发生很多的硬解析和解析失败的情况,在12月30日相同时间点也出现过。
从上图还可以看出数据库一直存在failed parse的SQL,建议设置event 10035事件,找出解析失败的SQL,并提交开发核对。
alter system set events '10035 trace name context forever,level 1';
采集故障时间段的AWR数据分析: ||Snap Id|Snap Time|Sessions|Cursors/Session| |-|-|-|-|-| |Begin Snap:|44450|31-Dec-17 14:00:42|561|3.4| |End Snap:|44451|31-Dec-17 15:00:06|570|3.5| |Elapsed:||59.39 (mins)|||