0
  • 聊天消息
  • 系統(tǒng)消息
  • 評(píng)論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫(xiě)文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

cpu利用率異常排查實(shí)踐與總結(jié)

Linux愛(ài)好者 ? 來(lái)源:未知 ? 作者:胡薇 ? 2018-11-15 15:33 ? 次閱讀

1、問(wèn)題背景

昨天下午突然收到運(yùn)維郵件報(bào)警,顯示數(shù)據(jù)平臺(tái)服務(wù)器cpu利用率達(dá)到了98.94%,而且最近一段時(shí)間一直持續(xù)在70%以上,看起來(lái)像是硬件資源到瓶頸需要擴(kuò)容了,但仔細(xì)思考就會(huì)發(fā)現(xiàn)咱們的業(yè)務(wù)系統(tǒng)并不是一個(gè)高并發(fā)或者CPU密集型的應(yīng)用,這個(gè)利用率有點(diǎn)太夸張,硬件瓶頸應(yīng)該不會(huì)這么快就到了,一定是哪里的業(yè)務(wù)代碼邏輯有問(wèn)題。

2、排查思路

2.1定位高負(fù)載進(jìn)程pid

首先登錄到服務(wù)器使用top命令確認(rèn)服務(wù)器的具體情況,根據(jù)具體情況再進(jìn)行分析判斷。

通過(guò)觀察load average,以及負(fù)載評(píng)判標(biāo)準(zhǔn)(8核),可以確認(rèn)服務(wù)器存在負(fù)載較高的情況;

觀察各個(gè)進(jìn)程資源使用情況,可以看出進(jìn)程id為682的進(jìn)程,有著較高的CPU占比

2.2定位具體的異常業(yè)務(wù)

這里咱們可以使用pwdx命令根據(jù)pid找到業(yè)務(wù)進(jìn)程路徑,進(jìn)而定位到負(fù)責(zé)人和項(xiàng)目:

可得出結(jié)論:該進(jìn)程對(duì)應(yīng)的就是數(shù)據(jù)平臺(tái)的web服務(wù)。

2.3定位異常線程及具體代碼行

傳統(tǒng)的方案一般是4步:

top oder by with P:1040 // 首先按進(jìn)程負(fù)載排序找到 maxLoad(pid)

top -Hp 進(jìn)程PID:1073 // 找到相關(guān)負(fù)載 線程PID

printf “0x%x ”線程PID: 0x431 // 將線程PID轉(zhuǎn)換為 16進(jìn)制,為后面查找 jstack 日志做準(zhǔn)備

jstack 進(jìn)程PID | vim +/十六進(jìn)制線程PID - // 例如:jstack 1040|vim +/0x431 -

但是對(duì)于線上問(wèn)題定位來(lái)說(shuō),分秒必爭(zhēng),上面的 4 步還是太繁瑣耗時(shí)了,之前介紹過(guò)淘寶的oldratlee 同學(xué)就將上面的流程封裝為了一個(gè)工具:show-busy-java-threads.sh,可以很方便的定位線上的這類(lèi)問(wèn)題:

可得出結(jié)論:是系統(tǒng)中一個(gè)時(shí)間工具類(lèi)方法的執(zhí)行cpu占比較高,定位到具體方法后,查看代碼邏輯是否存在性能問(wèn)題。

※如果線上問(wèn)題比較緊急,可以省略 2.1、2.2 直接執(zhí)行 2.3,這里從多角度剖析只是為了給大家呈現(xiàn)一個(gè)完整的分析思路。

3、根因分析

經(jīng)過(guò)前面的分析與排查,最終定位到一個(gè)時(shí)間工具類(lèi)的問(wèn)題,造成了服務(wù)器負(fù)載以及cpu使用率的過(guò)高。

異常方法邏輯:是把時(shí)間戳轉(zhuǎn)成對(duì)應(yīng)的具體的日期時(shí)間格式;

上層調(diào)用:計(jì)算當(dāng)天凌晨至當(dāng)前時(shí)間所有秒數(shù),轉(zhuǎn)化成對(duì)應(yīng)的格式放入到set中返回結(jié)果;

邏輯層:對(duì)應(yīng)的是數(shù)據(jù)平臺(tái)實(shí)時(shí)報(bào)表的查詢(xún)邏輯,實(shí)時(shí)報(bào)表會(huì)按照固定的時(shí)間間隔來(lái),并且在一次查詢(xún)中有多次(n次)方法調(diào)用。

那么可以得到結(jié)論,如果現(xiàn)在時(shí)間是當(dāng)天上午10點(diǎn),一次查詢(xún)的計(jì)算次數(shù)就是 10*60*60*n次=36,000*n次計(jì)算,而且隨著時(shí)間增長(zhǎng),越接近午夜單次查詢(xún)次數(shù)會(huì)線性增加。由于實(shí)時(shí)查詢(xún)、實(shí)時(shí)報(bào)警等模塊大量的查詢(xún)請(qǐng)求都需要多次調(diào)用該方法,導(dǎo)致了大量CPU資源的占用與浪費(fèi)。

4、解決方案

定位到問(wèn)題之后,首先考慮是要減少計(jì)算次數(shù),優(yōu)化異常方法。排查后發(fā)現(xiàn),在邏輯層使用時(shí),并沒(méi)有使用該方法返回的set集合中的內(nèi)容,而是簡(jiǎn)單的用set的size數(shù)值。確認(rèn)邏輯后,通過(guò)新方法簡(jiǎn)化計(jì)算(當(dāng)前秒數(shù)-當(dāng)天凌晨的秒數(shù)),替換調(diào)用的方法,解決計(jì)算過(guò)多的問(wèn)題。上線后觀察服務(wù)器負(fù)載和cpu使用率,對(duì)比異常時(shí)間段下降了30倍,恢復(fù)至正常狀態(tài),至此該問(wèn)題得已解決。

5、總結(jié)

在編碼的過(guò)程中,除了要實(shí)現(xiàn)業(yè)務(wù)的邏輯,也要注重代碼性能的優(yōu)化。一個(gè)業(yè)務(wù)需求,能實(shí)現(xiàn),和能實(shí)現(xiàn)的更高效、更優(yōu)雅其實(shí)是兩種截然不同的工程師能力和境界的體現(xiàn),而后者也是工程師的核心競(jìng)爭(zhēng)力。

在代碼編寫(xiě)完成之后,多做 review,多思考是不是可以用更好的方式來(lái)實(shí)現(xiàn)。

線上問(wèn)題不放過(guò)任何一個(gè)小細(xì)節(jié)!細(xì)節(jié)是魔鬼,技術(shù)的同學(xué)需要有刨根問(wèn)題的求知欲和追求卓越的精神,只有這樣,才能不斷的成長(zhǎng)和提升。

聲明:本文內(nèi)容及配圖由入駐作者撰寫(xiě)或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問(wèn)題,請(qǐng)聯(lián)系本站處理。 舉報(bào)投訴
  • cpu
    cpu
    +關(guān)注

    關(guān)注

    68

    文章

    10804

    瀏覽量

    210839
  • 編碼
    +關(guān)注

    關(guān)注

    6

    文章

    932

    瀏覽量

    54731

原文標(biāo)題:CPU 100% 異常排查實(shí)踐與總結(jié)

文章出處:【微信號(hào):LinuxHub,微信公眾號(hào):Linux愛(ài)好者】歡迎添加關(guān)注!文章轉(zhuǎn)載請(qǐng)注明出處。

收藏 人收藏

    評(píng)論

    相關(guān)推薦

    如何利用UCOSII中的統(tǒng)計(jì)任務(wù) OS_TaskStat()知道了CPU利用率100%把利用率降下來(lái)?

    冒昧的問(wèn)一下各路大神,假如我們利用UCOSII中的統(tǒng)計(jì)任務(wù) OS_TaskStat()知道了CPU利用率100%,則應(yīng)該怎樣操作,把利用率降下來(lái)?另外,
    發(fā)表于 07-12 04:36

    Post綜合后的利用率只不過(guò)是實(shí)施后的利用率?

    嗨,Post綜合后的利用率只不過(guò)是實(shí)施后的利用率......?謝謝娜文G K.
    發(fā)表于 05-12 08:57

    UCOS3的CPU利用率問(wèn)題怎么解決

    我在寫(xiě)的CPU利用率程序:(改的原子哥的代碼)void census_task(void *p_arg){OS_ERR err;CPU_SR_ALLOC(); CPU_STK_SIZE
    發(fā)表于 05-20 04:24

    如何獲取棧利用率?

    如何獲取棧利用率
    發(fā)表于 02-16 07:34

    如何去實(shí)現(xiàn)一種CPU利用率及堆棧檢測(cè)統(tǒng)計(jì)

    uCOS-III(16) CPU利用率及堆棧檢測(cè)統(tǒng)計(jì)基本概念代碼基本概念CPU利用率是單位時(shí)間內(nèi)cpu在運(yùn)行的時(shí)間百分比??捎糜诤饬肯到y(tǒng)設(shè)
    發(fā)表于 02-18 06:31

    RT-Thread CPU利用率的統(tǒng)計(jì)與測(cè)試步驟

    1 CPU利用率統(tǒng)計(jì)全速運(yùn)行:不響應(yīng)中斷,也不去執(zhí)行其他任務(wù),就單純讓它在一個(gè)地方持續(xù)運(yùn)行一段時(shí)間,這個(gè)值可以體現(xiàn)CPU的算力有多大。total_count:?jiǎn)挝粫r(shí)間內(nèi)全速運(yùn)行下的變量值,表現(xiàn)了
    發(fā)表于 05-13 15:27

    CPU利用率問(wèn)題求解

    “你能不能實(shí)現(xiàn)一個(gè)理想情況下應(yīng)該在每個(gè)時(shí)間片開(kāi)始時(shí)執(zhí)行的監(jiān)控任務(wù),并確定前一個(gè)時(shí)間片的利用率。如果利用率過(guò)高,則應(yīng)發(fā)出警告。如果我們可以使用空閑時(shí)間,那么我們就可以衡量利用率。為了設(shè)置這個(gè)監(jiān)視器
    發(fā)表于 12-06 06:00

    如何知道CPU利用率和內(nèi)存使用情況?

    我在 MIMXRT1062 板上工作,我使用了“EVK-MIMXRT1060-guix_washing_machine”示例。我想要 CPU 利用率和內(nèi)存使用情況。請(qǐng)給我有關(guān)它的信息,我也想知道它是如何計(jì)算的。
    發(fā)表于 03-31 06:21

    活性物質(zhì)利用率

    活性物質(zhì)利用率 電池具有活性物質(zhì)的量與按法拉弟定律計(jì)算應(yīng)產(chǎn)生的電量稱(chēng)為理論容量。要求電極給出一定的電量時(shí),電極的活性物質(zhì)利用率可表示為
    發(fā)表于 11-06 11:02 ?2309次閱讀

    關(guān)于Swarm和Mesos資源利用率優(yōu)化實(shí)踐分析

    資源調(diào)度領(lǐng)域的優(yōu)秀經(jīng)驗(yàn),以及他們?cè)贛esos社區(qū)為提升Mesos資源利用率而正在進(jìn)行的實(shí)踐活動(dòng),深度剖析了Mesos資源的收集和調(diào)度原理,以及如何在Mesos中提供Revocable資源來(lái)提高M(jìn)esos
    發(fā)表于 10-10 11:54 ?0次下載
    關(guān)于Swarm和Mesos資源<b class='flag-5'>利用率</b>優(yōu)化<b class='flag-5'>實(shí)踐</b>分析

    利用率的獲取

    值.利用率 = 已使用 / 棧大小.#if defined(ARCH_CPU_STACK_GROWS_UPWARD) ptr = (rt_uint8_t *)thread->stack_addr + thread->stack_siz
    發(fā)表于 12-20 19:03 ?8次下載
    棧<b class='flag-5'>利用率</b>的獲取

    uCOS-III(16) CPU利用率及堆棧檢測(cè)統(tǒng)計(jì)

    uCOS-III(16) CPU利用率及堆棧檢測(cè)統(tǒng)計(jì)基本概念代碼基本概念CPU利用率是單位時(shí)間內(nèi)cpu在運(yùn)行的時(shí)間百分比。可用于衡量系統(tǒng)設(shè)
    發(fā)表于 12-23 19:54 ?6次下載
    uCOS-III(16) <b class='flag-5'>CPU</b><b class='flag-5'>利用率</b>及堆棧檢測(cè)統(tǒng)計(jì)

    Linux系統(tǒng)CPU 100%異常排查實(shí)踐與總結(jié)

    但是對(duì)于線上問(wèn)題定位來(lái)說(shuō),分秒必爭(zhēng),上面的 4 步還是太繁瑣耗時(shí)了,之前介紹過(guò)淘寶的oldratlee 同學(xué)就將上面的流程封裝為了一個(gè)工具:show-busy-java-threads.sh,可以很方便的定位線上的這類(lèi)問(wèn)題:
    的頭像 發(fā)表于 02-23 09:54 ?1715次閱讀

    常見(jiàn)GPU利用率低原因分析

    GPU 任務(wù)會(huì)交替的使用 CPU 和 GPU 進(jìn)行計(jì)算,當(dāng) CPU 計(jì)算成為瓶頸時(shí),就會(huì)出現(xiàn) GPU 等待的問(wèn)題,GPU 空跑那利用率就低了。
    發(fā)表于 06-19 12:22 ?1393次閱讀
    常見(jiàn)GPU<b class='flag-5'>利用率</b>低原因分析

    GPU利用率低的本質(zhì)原因

    、GPU 利用率低的本質(zhì) 常見(jiàn) GPU 任務(wù)運(yùn)行流程圖如下: 如上圖所示,GPU 任務(wù)會(huì)交替的使用 CPU 和 GPU 進(jìn)行計(jì)算,
    的頭像 發(fā)表于 06-19 14:07 ?1101次閱讀
    GPU<b class='flag-5'>利用率</b>低的本質(zhì)原因