背景
最近同事一拨人去了项目现场.
因为数据库和redis等时不时的会卡死.
最开始分析时以为是磁盘要坏了.
后来发现是华为的oceanstor 5500 v5的存储.
理论上不会坏.
后来一直认为可能是 windows与华为存储的兼容性问题.
今天同事在现场反馈说是 服务器有一个光模块要坏了.
然后突然联想到plantegg的一个帖子,想着总结一下自己遇到的
和自己看到的一些神奇的软硬件故障.
大佬的blog
https://plantegg-github-io.vercel.app/2022/03/15/记一次听风扇声音来定位性能
通过风扇判断 CPU不工作, 虽然 busy比较高
但是因为内存的工作频率, 或者是通道数的问题,导致系统上不去压力.
所以性能不好不好不仅可以通过观测数据, 还可以通过体感来进行.
其实引申为,可以监控服务器的功率.
如果功率一直上不去, 说明服务器根本没有进入满负荷的状态
也是一个思路.
电力是信息社会的基础,是算力的粮食.
听说的一些搞笑bug
1. 医院信息系统每天晚上都会卡顿,甚至宕机.
软件工程师远程分析了好久都搞不定.
到了医院现场发现: 服务器的散热风扇在护士休息室里面
晚上护士休息时觉得吵, 就把风扇给关了.
CPU收到散热限制的影响, 只能降频运行,导致卡顿. !-_-!
2. 服务器晚上错误率飙升.
有一个沿海的机房内的服务器到了晚上服务器的错误率飙升
也是无法查明具体原因.
最终经过工程师现场验证
发现是晚上有传回港,雷达或者是其他辐射源不关
导致符合到服务器上面出现0/1偏转出现错误 !-_-!
自己遇到的一些匪夷所思的bug
1. 机房空调引起的性能下降.
有一次重大项目性能测试.
第一天测试结果非常良好
等到第二天给客户演示时测试结果非常差.
我得到消息后去了一下机房. 发现机房温度巨高
因为昨天晚上空调关了..一晚上的时间机房温度爆表
服务器保护性的降低运行速度. 导致性能测试结果变差.
打开空调运行半小时后服务器性能回复.
2. 网线弯折/挤压/未插紧导致的问题.
曾经有一次给大领导演示之后, 进行了网络调整
然后发现系统出现问题的概率飙升.
很奇怪, 第二天去机房发现 小朋友再整理网线时
有一个光纤没有插紧, 导致丢包率上升,又不是完全脱离
导致软件性能极具降低.
重新捋了一下网线之后,并且将网线插紧,中间件之间就没再出问题.
3. 硬盘损坏导致的服务器宕机-一个批次就是要坏一起坏
有段时间一个文件服务器突然变的卡顿,
自己通过记录认为拉取文件变的非常困难.
一开始没当回事情. 结果到了第二天.服务器直接宕机
找科技市场硬键盘修复专家 将损坏的多块硬盘raw to raw clone
才解决这个问题..
所以不要低估一些简单的IO性能下降.
并不是所有的异常/故障都会报警.
往往到了报警阙值的时候, 系统就会死给大家看了.
4. 向日葵导致性能测试结果失真
曾经有段时间, 公司里面流行向日葵, 大家回家之后可以远程公司电脑
但是有段时间,不知道向日葵哪个版本被人注入了病毒还是什么
他会给内网所有地址疯狂发包
公司内的net mask 是 16位 也就是他会定期给 65534个ip地址发包
并且还是定期高强度, 导致整个局域网内部都是 arp包, 性能测试时发现流量上不去
找人抓包分析发现是大量ARP包导致交换机背板支持到顶.影响性能.
还有一次. 性能测试为了提高性能, 私用VIP 后面两个世纪网卡进行压测
因为交换机不太支持, VIP没有绑定mac地址, 导致交换给所有的在线设备发包
导致整个办公区域网络不可用 -_- 故障惨重.
关于系统性能的一些想法
软件bug之所以叫软件bug
还是电子计算机时代臭虫的存在导致短路引起计算失败的历史遗迹
性能调优是一个系统型的问题.不是单独依靠写代码就能够解决所有问题
必须从最基础的地方做起. 才能解决性能问题.
遇到问题要合理分析, 合理怀疑, 不能过分认为是自己的问题
要通盘考虑, 软硬件,操作系统,sdk,中间件一起考虑
不好解决的问题往往是多种原因导致,而非一个简单问题引起的.
一定要有开阔的思路. 进行分析,并且尽可能的做好问题预设
然后进行证伪才能拿有效的解决问题.
文章转载自济南小老虎,如果涉嫌侵权,请发送邮件至:contact@modb.pro进行举报,并提供相关证据,一经查实,墨天轮将立刻删除相关内容。




