昨天下午突然收到運(yùn)維郵件報(bào)警,顯示數(shù)據(jù)平臺(tái)服務(wù)器cpu利用率達(dá)到了98.94%,而且最近一段時(shí)間一直持續(xù)在70%以上,看起來像是硬件資源到瓶頸需要擴(kuò)容了,但仔細(xì)思考就會(huì)發(fā)現(xiàn)咱們的業(yè)務(wù)系統(tǒng)并不是一個(gè)高并發(fā)或者CPU密集型的應(yīng)用,這個(gè)利用率有點(diǎn)太夸張,硬件瓶頸應(yīng)該不會(huì)這么快就到了,一定是哪里的業(yè)務(wù)代碼邏輯有問題。
2、排查思路
2.1定位高負(fù)載進(jìn)程pid
首先登錄到服務(wù)器使用top命令確認(rèn)服務(wù)器的具體情況,根據(jù)具體情況再進(jìn)行分析判斷。
通過觀察load average,以及負(fù)載評(píng)判標(biāo)準(zhǔn)(8核),可以確認(rèn)服務(wù)器存在負(fù)載較高的情況;
觀察各個(gè)進(jìn)程資源使用情況,可以看出進(jìn)程id為682的進(jìn)程,有著較高的CPU占比
2.2定位具體的異常業(yè)務(wù)
這里咱們可以使用 pwdx 命令根據(jù) pid 找到業(yè)務(wù)進(jìn)程路徑,進(jìn)而定位到負(fù)責(zé)人和項(xiàng)目:
可得出結(jié)論:該進(jìn)程對(duì)應(yīng)的就是數(shù)據(jù)平臺(tái)的web服務(wù)。
2.3定位異常線程及具體代碼行
傳統(tǒng)的方案一般是4步:
1、top oder by with P:1040 // 首先按進(jìn)程負(fù)載排序找到 maxLoad(pid)
2、top -Hp 進(jìn)程PID:1073 // 找到相關(guān)負(fù)載 線程PID
3、printf “0x%x ”線程PID:0x431 // 將線程PID轉(zhuǎn)換為 16進(jìn)制,為后面查找 jstack 日志做準(zhǔn)備
4、jstack 進(jìn)程PID | vim +/十六進(jìn)制線程PID - // 例如:jstack 1040|vim +/0x431 -
但是對(duì)于線上問題定位來說,分秒必爭,上面的 4 步還是太繁瑣耗時(shí)了,之前介紹過淘寶的oldratlee 同學(xué)就將上面的流程封裝為了一個(gè)工具:show-busy-java-threads.sh,可以很方便的定位線上的這類問題:
可得出結(jié)論:是系統(tǒng)中一個(gè)時(shí)間工具類方法的執(zhí)行cpu占比較高,定位到具體方法后,查看代碼邏輯是否存在性能問題。
※如果線上問題比較緊急,可以省略 2.1、2.2 直接執(zhí)行 2.3,這里從多角度剖析只是為了給大家呈現(xiàn)一個(gè)完整的分析思路。
3、根因分析
經(jīng)過前面的分析與排查,最終定位到一個(gè)時(shí)間工具類的問題,造成了服務(wù)器負(fù)載以及cpu使用率的過高。
異常方法邏輯:是把時(shí)間戳轉(zhuǎn)成對(duì)應(yīng)的具體的日期時(shí)間格式;
上層調(diào)用:計(jì)算當(dāng)天凌晨至當(dāng)前時(shí)間所有秒數(shù),轉(zhuǎn)化成對(duì)應(yīng)的格式放入到set中返回結(jié)果;
邏輯層:對(duì)應(yīng)的是數(shù)據(jù)平臺(tái)實(shí)時(shí)報(bào)表的查詢邏輯,實(shí)時(shí)報(bào)表會(huì)按照固定的時(shí)間間隔來,并且在一次查詢中有多次(n次)方法調(diào)用。
那么可以得到結(jié)論,如果現(xiàn)在時(shí)間是當(dāng)天上午10點(diǎn),一次查詢的計(jì)算次數(shù)就是 10*60*60*n次=36,000*n次計(jì)算,而且隨著時(shí)間增長,越接近午夜單次查詢次數(shù)會(huì)線性增加。由于實(shí)時(shí)查詢、實(shí)時(shí)報(bào)警等模塊大量的查詢請(qǐng)求都需要多次調(diào)用該方法,導(dǎo)致了大量CPU資源的占用與浪費(fèi)。
4、解決方案
定位到問題之后,首先考慮是要減少計(jì)算次數(shù),優(yōu)化異常方法。排查后發(fā)現(xiàn),在邏輯層使用時(shí),并沒有使用該方法返回的set集合中的內(nèi)容,而是簡單的用set的size數(shù)值。確認(rèn)邏輯后,通過新方法簡化計(jì)算(當(dāng)前秒數(shù)-當(dāng)天凌晨的秒數(shù)),替換調(diào)用的方法,解決計(jì)算過多的問題。上線后觀察服務(wù)器負(fù)載和cpu使用率,對(duì)比異常時(shí)間段下降了30倍,恢復(fù)至正常狀態(tài),至此該問題得已解決。
5、總結(jié)
在編碼的過程中,除了要實(shí)現(xiàn)業(yè)務(wù)的邏輯,也要注重代碼性能的優(yōu)化。一個(gè)業(yè)務(wù)需求,能實(shí)現(xiàn),和能實(shí)現(xiàn)的更高效、更優(yōu)雅其實(shí)是兩種截然不同的工程師能力和境界的體現(xiàn),而后者也是工程師的核心競(jìng)爭力。
在代碼編寫完成之后,多做 review,多思考是不是可以用更好的方式來實(shí)現(xiàn)。
線上問題不放過任何一個(gè)小細(xì)節(jié)!細(xì)節(jié)是魔鬼,技術(shù)的同學(xué)需要有刨根問題的求知欲和追求卓越的精神,只有這樣,才能不斷的成長和提升。
審核編輯 :李倩
-
cpu
+關(guān)注
關(guān)注
68文章
10908瀏覽量
213079 -
服務(wù)器
+關(guān)注
關(guān)注
12文章
9321瀏覽量
86101 -
PID
+關(guān)注
關(guān)注
35文章
1473瀏覽量
85844
原文標(biāo)題:我去,Linux 系統(tǒng) CPU 100% 打滿了!
文章出處:【微信號(hào):良許Linux,微信公眾號(hào):良許Linux】歡迎添加關(guān)注!文章轉(zhuǎn)載請(qǐng)注明出處。
發(fā)布評(píng)論請(qǐng)先 登錄
相關(guān)推薦
嵌入式Linux系統(tǒng)CPU控制常見辦法測(cè)試
怎么在Linux系統(tǒng)中查看CPU信息
Linux系統(tǒng)CPU占用率100%的排查思路
![<b class='flag-5'>Linux</b><b class='flag-5'>系統(tǒng)</b><b class='flag-5'>CPU</b>占用率<b class='flag-5'>100</b>%的排查思路](https://file1.elecfans.com/web2/M00/BD/E3/wKgZomWvJF2AYMxyAAAHPKAnqgU401.png)
關(guān)于系統(tǒng)打實(shí)時(shí)補(bǔ)丁,以及linux&u-boot移植方面的問題
請(qǐng)問Linux系統(tǒng)發(fā)現(xiàn)占用CPU達(dá)100%的進(jìn)程如何處理?
嵌入式Linux系統(tǒng)驅(qū)動(dòng)hp1020打印機(jī)的方法步驟
嵌入式linux磁盤被寫滿了再寫會(huì)出現(xiàn)什么后果
CPU占用率100%的故障解決
Linux CPU的性能應(yīng)該如何優(yōu)化
如何用腳本來獲取linux系統(tǒng)CPU、內(nèi)存、磁盤IO,及原理解釋
![如何用腳本來獲取<b class='flag-5'>linux</b><b class='flag-5'>系統(tǒng)</b><b class='flag-5'>CPU</b>、內(nèi)存、磁盤IO,及原理解釋](https://file.elecfans.com/web1/M00/E9/6C/o4YBAGBup0WAWSxWAACM9EgcBpE182.png)
嵌入式Linux系統(tǒng)驅(qū)動(dòng)hp1020打印機(jī)
![嵌入式<b class='flag-5'>Linux</b><b class='flag-5'>系統(tǒng)</b>驅(qū)動(dòng)hp1020<b class='flag-5'>打</b>印機(jī)](https://file.elecfans.com/web1/M00/D9/4E/pIYBAF_1ac2Ac0EEAABDkS1IP1s689.png)
分享排查Linux系統(tǒng)CPU占用的一個(gè)Shell腳本
![分享排查<b class='flag-5'>Linux</b><b class='flag-5'>系統(tǒng)</b><b class='flag-5'>CPU</b>占用的一個(gè)Shell腳本](https://file1.elecfans.com/web2/M00/A1/74/wKgZomT1MQSARzhUAAAHPKAnqgU371.png)
如何在Linux系統(tǒng)中檢查CPU使用率
![如何在<b class='flag-5'>Linux</b><b class='flag-5'>系統(tǒng)</b>中檢查<b class='flag-5'>CPU</b>使用率](https://file1.elecfans.com/web2/M00/BB/34/wKgZomWYvm-AF_NFAAAMBer_0uo122.jpg)
Linux服務(wù)器CPU飆升的原因
![<b class='flag-5'>Linux</b>服務(wù)器<b class='flag-5'>CPU</b>飆升的原因](https://file1.elecfans.com/web2/M00/C1/BB/wKgZomXeow2AeXijAAAMBer_0uo895.jpg)
評(píng)論