0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內(nèi)不再提示

如何解決優(yōu)化過程中遇到的問題

Linux愛好者 ? 來源:SegmentFault ? 作者:Leoython ? 2021-09-30 16:59 ? 次閱讀

前言

這篇文章的主題是記錄一次程序的性能優(yōu)化,在優(yōu)化的過程中遇到的問題,以及如何去解決的。

為大家提供一個優(yōu)化的思路,首先要聲明的一點是,我的方式不是唯一的,大家在性能優(yōu)化之路上遇到的問題都絕對不止一個解決方案。

如何優(yōu)化

首先大家要明確的一點是,脫離需求談優(yōu)化都是耍流氓。所以,有誰跟你說在 xx 機器上實現(xiàn)了百萬并發(fā),基本上可以認為是不懂裝懂了,單純的并發(fā)數(shù)完全是無意義的。

其次,我們優(yōu)化之前必須要有一個目標。需要優(yōu)化到什么程度,沒有明確目標的優(yōu)化是不可控的。再然后,我們必須明確的找出性能瓶頸在哪里,而不能漫無目的的一通亂搞。

需求描述

這個項目是我在上家公司負責一個單獨的模塊。本來是集成在主站代碼中的,后來因為并發(fā)太大,為了防止出現(xiàn)問題后拖累主站服務,所有由我一個人負責拆分出來。

對這個模塊的拆分要求是,壓力測試 QPS 不能低于 3 萬,數(shù)據(jù)庫負責不能超過 50%,服務器負載不能超過 70%,單次請求時長不能超過 70ms,錯誤率不能超過 5%。

環(huán)境的配置如下:

服務器:4 核 8G 內(nèi)存,CentOS 7 系統(tǒng),SSD 硬盤

數(shù)據(jù)庫:MySQL 5.7,最大連接數(shù) 800

緩存:Redis,1G容量。以上環(huán)境都是購買自騰訊云的服務。

壓測工具:Locust,使用騰訊的彈性伸縮實現(xiàn)分布式的壓測。

需求描述如下:

用戶進入首頁,從數(shù)據(jù)庫中查詢是否有合適的彈窗配置。

如果沒有,則繼續(xù)等待下一次請求、如果有合適的配置,則返回給前端。

這里開始則有多個條件分支:

如果用戶點擊了彈窗,則記錄用戶點擊,并且在配置的時間內(nèi)不再返回配置;

如果用戶未點擊,則24小時后繼續(xù)返回本次配置;

如果用戶點擊了,但是后續(xù)沒有配置了,則接著等待下一次。

重點分析

根據(jù)需求,我們知道了有幾個重要的點:

需要找出合適用戶的彈窗配置,

需要記錄用戶下一次返回配置的時間并記錄到數(shù)據(jù)庫中,

需要記錄用戶對返回的配置執(zhí)行了什么操作并記錄到數(shù)據(jù)庫中。

調(diào)優(yōu)

我們可以看到,上述三個重點都存在數(shù)據(jù)庫的操作,不只有讀庫,還有寫庫操作。

從這里我們可以看到,如果不加緩存的話,所有的請求都壓到數(shù)據(jù)庫,勢必會占滿全部連接數(shù),出現(xiàn)拒絕訪問的錯誤。同時因為 SQL 執(zhí)行過慢,導致請求無法及時返回。

所以,我們首先要做的就是將寫庫操作剝離開來。提升每一次請求響應速度,優(yōu)化數(shù)據(jù)庫連接。

整個系統(tǒng)的架構(gòu)圖如下:

將寫庫操作放到一個先進先出的消息隊列中來做。為了減少復雜度,使用了 Redis 的 list 來做這個消息隊列。

然后進行壓測,結(jié)果如下:

QPS 在 6000 左右 502 錯誤大幅上升至 30%;

服務器 CPU 在 60%-70% 之間來回跳動;

數(shù)據(jù)庫連接數(shù)被占滿 TCP 連接數(shù)為 6000 左右。

很明顯,問題還是出在數(shù)據(jù)庫。

經(jīng)過排查 SQL 語句,查詢到原因就是:找出合適用戶的配置操作時每次請求都要讀取數(shù)據(jù)庫所導致的連接數(shù)被用完。

因為我們的連接數(shù)只有 800,一旦請求過多勢必會導致數(shù)據(jù)庫瓶頸。好了,問題找到了,我們繼續(xù)優(yōu)化。

我們將全部的配置都加載到緩存中,只有在緩存中沒有配置的時候才會去讀取數(shù)據(jù)庫。

接下來我們再次壓測,結(jié)果如下:

QPS 壓到 2 萬左右的時候就上不去了;

服務器 CPU 在 60%-80% 之間跳動;

數(shù)據(jù)庫連接數(shù)為 300 個左右,每秒 TCP 連接數(shù)為 1.5 萬左右。

這個問題是困擾我比較久的一個問題。因為我們可以看到,我們 2 萬的 QPS,但是 TCP 連接數(shù)卻并沒有達到 2 萬。

我猜測,TCP 連接數(shù)就是引發(fā)瓶頸的問題,但是因為什么原因所引發(fā)的暫時無法找出來。

這個時候猜測,既然是無法建立 TCP 連接,是否有可能是服務器限制了 socket 連接數(shù)。

驗證猜測,我們看一下,在終端輸入 ulimit -n 命令,顯示的結(jié)果為 65535??吹竭@里,覺得 socket 連接數(shù)并不是限制我們的原因,為了驗證猜測,將 socket 連接數(shù)調(diào)大為100001。

再次進行壓測,結(jié)果如下:

QPS 壓到 2.2 萬左右的時候就上不去了;

服務器 CPU 在 60%-80% 之間跳動;

數(shù)據(jù)庫連接數(shù)為 300 個左右,每秒 TCP 連接數(shù)為 1.7 萬左右。

雖然有一點提升,但是并沒有實質(zhì)性的變化。

接下來的幾天時間,我發(fā)現(xiàn)都無法找到優(yōu)化的方案。那幾天確實很難受,找不出來優(yōu)化的方案,過了幾天再次將問題梳理了一遍,發(fā)現(xiàn)雖然 socket 連接數(shù)足夠,但是并沒有全部被用上。猜測每次請求過后,TCP 連接并沒有立即被釋放,導致 socket 無法重用。

經(jīng)過查找資料,找到了問題所在:

TCP 鏈接在經(jīng)過四次握手結(jié)束連接后并不會立即釋放,而是處于 timewait 狀態(tài)。會等待一段時間,以防止客戶端后續(xù)的數(shù)據(jù)未被接收。

好了,問題找到了,我們要接著優(yōu)化。

首先想到的就是調(diào)整 TCP 鏈接結(jié)束后等待時間。但是 Linux并沒有提供這一內(nèi)核參數(shù)的調(diào)整,如果要改必須要自己重新編譯內(nèi)核。幸好還有另一個參數(shù)net.ipv4.tcp_max_tw_buckets, timewait 的數(shù)量。默認是 180000。我們調(diào)整為6000。然后打開 timewait 快速回收和開啟重用。

完整的參數(shù)優(yōu)化如下:

#timewait 的數(shù)量,默認是 180000。net.ipv4.tcp_max_tw_buckets = 6000

net.ipv4.ip_local_port_range = 1024 65000

#啟用 timewait 快速回收。net.ipv4.tcp_tw_recycle = 1

#開啟重用。允許將 TIME-WAIT sockets 重新用于新的 TCP 連接。net.ipv4.tcp_tw_reuse = 1

我們再次壓測,結(jié)果顯示:

QPS 5萬,服務器 CPU 70%;

數(shù)據(jù)庫連接正常,TCP 連接正常;

響應時間平均為 60ms,錯誤率為 0%。

結(jié)語

到此為止,整個服務的開發(fā)、調(diào)優(yōu)、和壓測就結(jié)束了?;仡欉@一次調(diào)優(yōu),得到了很多經(jīng)驗。最重要的是,深刻理解了Web 開發(fā)不是一個獨立的個體,而是網(wǎng)絡、數(shù)據(jù)庫、編程語言、操作系統(tǒng)等多門學科結(jié)合的工程實踐。這就要求 Web 開發(fā)人員有牢固的基礎知識,否則出現(xiàn)了問題還不知道怎么分析查找。

轉(zhuǎn)自:Leoython

鏈接:segmentfault.com/a/1190000018075241

責任編輯:haq

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學習之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • 內(nèi)存
    +關注

    關注

    8

    文章

    2903

    瀏覽量

    73537
  • SQL
    SQL
    +關注

    關注

    1

    文章

    750

    瀏覽量

    43900
  • 程序
    +關注

    關注

    115

    文章

    3720

    瀏覽量

    80357

原文標題:記一次性能優(yōu)化,單臺 4 核 8G 機器支撐 5 萬 QPS

文章出處:【微信號:LinuxHub,微信公眾號:Linux愛好者】歡迎添加關注!文章轉(zhuǎn)載請注明出處。

收藏 人收藏

    評論

    相關推薦

    使用VCA810過程中遇到的一些問題求解

    我在使用VCA810過程中遇到一些問題,請各位大神指點,具體如下: 1、控制電壓最小只能加到-1.7V,再減小的話輸出信號消失或者放大倍數(shù)驟然減小。 2、輸入端出現(xiàn)一個疊加在信號上的直流,輸出端直
    發(fā)表于 08-30 07:11

    DRV2700EVM-HV500在測試的過程中發(fā)現(xiàn)輸出紋波很大如何解決?

    在測試的過程中發(fā)現(xiàn)輸出紋波很大大概20V,請問改如何解
    發(fā)表于 08-15 06:25

    設備運行過程中,調(diào)用云端接口后報status500的原因?如何解決?

    在設備運行過程中出現(xiàn),調(diào)用云端接口后,報500,設備接收到了云端發(fā)過來數(shù)據(jù),并執(zhí)行了動作! 想問導致status500錯誤具體可能的情況和原因是什么?如何解決?
    發(fā)表于 07-18 06:48

    使用PSoC5LP的過程中,遇到PSoC5LP在EFT干擾時復位的問題怎么解決?

    在我使用 PSoC5LP 的過程中(>8 年),我曾多次在驗證測試遇到 PSoC5LP 在 EFT 干擾時復位的問題。 大多數(shù)情況下,這取決于 XRES 引腳,因為 EFT 可以改變
    發(fā)表于 07-05 07:26

    燒錄ESP RainMaker的例程時,遇到這種版本問題如何解決?

    我在燒錄ESP RainMaker的例程時,遇到這種版本問題,應該如何解決呀。 ESP-IDF是5.2.1 ,下載esp-rainmaker時使用的是$ git clone --recursive https://github
    發(fā)表于 06-05 06:44

    STM32F405RG在做500K DATA對FLASH燒寫,燒寫過程中FLASH會全部變成0XFFFFF如何解決?

    STM32F405RG 芯片在做500K的DATA對FLASH燒寫的時候,在過程中,F(xiàn)LASH會出現(xiàn)突然全部變成0XFFFFF....這個問題該如何解決?
    發(fā)表于 03-27 06:57

    何解決連接國外大帶寬服務器時可能遇到的問題

     相信很多小白用戶會對如何解決連接國外大帶寬服務器時可能遇到的問題感興趣,RAK部落小編就為您整理發(fā)布如何解決連接國外大帶寬服務器時可能遇到的問題。
    的頭像 發(fā)表于 03-19 12:00 ?406次閱讀

    何解決開關電源調(diào)試遇到的問題?

    一般在使用電氣設備之前都會調(diào)試,以便及時發(fā)現(xiàn)問題并采取措施解決。開關電源也一樣會進行調(diào)試,那么在調(diào)試開關電源的過程中遇到哪些問題呢?又該如何解決呢?
    的頭像 發(fā)表于 01-29 16:39 ?461次閱讀

    AD2S1210在使用的過程中出現(xiàn)“正弦 /余弦輸入超過DOS失配閾值”的錯誤如何解決?

    AD2S1210在使用的過程中,角度數(shù)據(jù)讀取都沒有問題,也很穩(wěn)定,但一直出現(xiàn)“正弦 /余弦輸入超過 DOS失配閾值”的錯誤,雖然不影響使用,但這個問題老是讓人感覺不舒服,不知道該如何解決?有沒有哪位知道,麻煩不吝賜教,謝謝!!板子是自己做的。
    發(fā)表于 12-12 06:23

    使用AD5293的過程中遇到的幾個問題求解

    我在使用AD5293的過程中遇到了以下幾個問題: 1.AD5293的VDD,VSS,VLOGIC引腳所連接的10uf的電容是有極性還是無極性的? 2.EXT_CAP引腳,在上電時對地電壓應該是
    發(fā)表于 12-11 08:21

    在使用AD4114過程中遇到的問題,請幫忙解答

    哈羅 在使用AD4114的過程中遇到問題,請幫忙解答。多謝! 1.設置AD4114為Continuous Conversion Mode和Continuous Read Mode時,連續(xù)讀回來通道數(shù)
    發(fā)表于 12-04 08:06

    何解決車載部品測試過程中峰值電流不足的問題?

    何解決車載部品測試過程中峰值電流不足的問題? 隨著汽車電子系統(tǒng)的不斷發(fā)展和普及,車載部品的測試過程變得更加復雜和嚴峻。其中一個常見的問題是峰值電流不足。峰值電流不足可能導致測試結(jié)果不準確、設備損壞
    的頭像 發(fā)表于 11-23 10:33 ?435次閱讀

    軋機軋制時系統(tǒng)電壓波動較大如何解決?

    電壓波動已經(jīng)成為軋機在軋制過程中經(jīng)常遇到的問題,對軋機的工作穩(wěn)定性和精度也產(chǎn)生了不小的影響。那么,如何解決軋機在軋制時出現(xiàn)的電壓波動問題呢?
    的頭像 發(fā)表于 11-06 11:36 ?900次閱讀
    軋機軋制時系統(tǒng)電壓波動較大如<b class='flag-5'>何解</b>決?

    C語言在編譯成hex文件的過程中,這個目標文件的大小跟編譯器的優(yōu)化等級有關系嗎?

    C語言在編譯成hex文件的過程中,這個目標文件的大小跟編譯器的優(yōu)化等級有關系嗎
    發(fā)表于 10-15 09:54

    由Java改為 Kotlin過程中遇到的坑

    Kotlin 過程中遇到的坑和 Kotlin 的優(yōu)缺點。 環(huán)境和版本 Eclipse Oxygen JDK 8 Kotlin 1.3.0 Gradle 4.6 SpringCloud
    的頭像 發(fā)表于 09-30 16:51 ?706次閱讀
    由Java改為 Kotlin<b class='flag-5'>過程中</b><b class='flag-5'>遇到</b>的坑