0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

eBPF技術(shù)應(yīng)用云原生網(wǎng)絡(luò)實(shí)踐系列之基于socket的service

Linux閱碼場 ? 來源:OpenAnolis龍蜥 ? 作者:秉辰、羽云、滿霸 ? 2021-10-13 10:54 ? 次閱讀

背景介紹

Kubernetes 中的網(wǎng)絡(luò)功能,主要包括 POD 網(wǎng)絡(luò),service 網(wǎng)絡(luò)和網(wǎng)絡(luò)策略組成。其中 POD 網(wǎng)絡(luò)和網(wǎng)絡(luò)策略,都是規(guī)定了模型,沒有提供默認(rèn)實(shí)現(xiàn)。而 service 網(wǎng)絡(luò)作為 Kubernetes 的特色部分,官方版本持續(xù)演進(jìn)了多種實(shí)現(xiàn):

service 實(shí)現(xiàn)說明

userspace 代理模式kube-proxy 負(fù)責(zé) list/watch,規(guī)則設(shè)置,用戶態(tài)轉(zhuǎn)發(fā)。

iptables 代理模式kube-proxy 負(fù)責(zé) list/watch,規(guī)則設(shè)置。IPtables 相關(guān)內(nèi)核模塊負(fù)責(zé)轉(zhuǎn)發(fā)。

IPVS 代理模式kube-proxy 負(fù)責(zé) list/watch,規(guī)則設(shè)置。IPVS 相關(guān)內(nèi)核模塊負(fù)責(zé)轉(zhuǎn)發(fā)。

在 Kubernetes 中先后出現(xiàn)的幾種 Service 實(shí)現(xiàn)中,整體都是為了提供更高的性能和擴(kuò)展性。

Service 網(wǎng)絡(luò),本質(zhì)上是一個(gè)分布式的服務(wù)器負(fù)載均衡,通過 daemonset 方式部署的 kube-proxy,監(jiān)聽 endpoint 和 service 資源,并在 node 本地生成轉(zhuǎn)發(fā)表項(xiàng)。目前在生產(chǎn)環(huán)境中主要是 iptables 和 IPVS 方式,原理如下:

7f2ba892-2bce-11ec-82a8-dac502259ad0.png

在本文中,介紹使用 socket eBPF 在 socket 層面完成負(fù)載均衡的邏輯,消除了逐報(bào)文 NAT 轉(zhuǎn)換處理,進(jìn)一步提升 Service 網(wǎng)絡(luò)的轉(zhuǎn)發(fā)性能。

基于 socket eBPF 的數(shù)據(jù)面實(shí)現(xiàn)

socket eBPF 數(shù)據(jù)面簡介

無論 kube-proxy 采用 IPVS 還是 tc eBPF 服務(wù)網(wǎng)絡(luò)加速模式,每個(gè)從 pod 發(fā)出網(wǎng)絡(luò)請求都必然經(jīng)過 IPVS 或者 tc eBPF,即 POD 《--》 Service 《--》 POD,隨著流量的增加必然會有性能開銷, 那么是否可以直接在連接中將 service的clusterIP 的地址直接換成對應(yīng)的 pod ip?;?Kube-proxy+IPVS 實(shí)現(xiàn)的 service 網(wǎng)絡(luò)服務(wù),是基于逐報(bào)處理 +session 的方式來實(shí)現(xiàn)。

利用 socket eBPF,可以在不用直接處理報(bào)文和 NAT 轉(zhuǎn)換的前提下,實(shí)現(xiàn)了負(fù)載均衡邏輯。Service 網(wǎng)絡(luò)在同步上優(yōu)化成 POD 《--》 POD,從而使Service 網(wǎng)絡(luò)性能基本等同于 POD 網(wǎng)絡(luò)。軟件結(jié)構(gòu)如下:

7f9c93a4-2bce-11ec-82a8-dac502259ad0.png

Linux 內(nèi)核中,利用 BPF_PROG_TYPE_CGROUP_SOCK 類型的 eBPF hook 可以針對 socket 系統(tǒng)調(diào)用掛接 hook,插入必要的 EBPF 程序。

通過 attach 到特定的 cgroup 的文件描述符,可以控制 hook 接口的作用范圍。

利用 sock eBPF hook,我們可以在 socket 層面劫持特定的 socket 接口,來完成完成負(fù)載均衡邏輯。

POD-SVC-POD 的轉(zhuǎn)發(fā)行為轉(zhuǎn)換成 POD-POD 的轉(zhuǎn)發(fā)行為。

當(dāng)前 Linux 內(nèi)核中不斷完善相關(guān)的 hook,支持更多的 bpf_attach_type,部分距離如下:BPF_CGROUP_INET_SOCK_CREATEBPF_CGROUP_INET4_BINDBPF_CGROUP_INET4_CONNECTBPF_CGROUP_UDP4_SENDMSGBPF_CGROUP_UDP4_RECVMSGBPF_CGROUP_GETSOCKOPTBPF_CGROUP_INET4_GETPEERNAMEBPF_CGROUP_INET_SOCK_RELEASE

TCP 工作流程

TCP 由于是有基于連接的,所以實(shí)現(xiàn)非常簡明,只需要 hook connect 系統(tǒng)調(diào)用即可,如下所示:

80c7c974-2bce-11ec-82a8-dac502259ad0.png

connect 系統(tǒng)調(diào)用劫持邏輯:

1. 從 connect 調(diào)用上下文中取 dip+dport,查找 svc 表。找不到則不處理返回。

2. 查找親和性會話,如果找到,得到 backend_id,轉(zhuǎn) 4。否則轉(zhuǎn) 3。

3. 隨機(jī)調(diào)度,分配一個(gè) backend。

4. 根據(jù) backend_id,查 be 表,得到 be 的 IP+ 端口。

5. 更新親和性信息。

6. 修改 connect 調(diào)用上下文中的 dip+dport 為 be 的 ip+port。

7. 完成。

在 socket 層面就完成了端口轉(zhuǎn)換,對于 TCP 的 clusterip 訪問,基本上可以等同于 POD 之間東西向的通信,將 clusterip 的開銷降到最低。

不需要逐包的 dnat 行為。

不需要逐包的查找 svc 的行為。

UDP 工作流程

UDP 由于是無連接的,實(shí)現(xiàn)要復(fù)雜一些,如下圖所示:

nat_sk 表的定義參見:LB4_REVERSE_NAT_SK_MAP

815d1c0e-2bce-11ec-82a8-dac502259ad0.png

劫持 connect 和 sendmsg 系統(tǒng)調(diào)用:

1. 從系統(tǒng)調(diào)用調(diào)用上下文中取 dip+dport,查找 svc 表。找不到則不處理返回。

2. 查找親和性會話,如果找到,得到 backend_id,轉(zhuǎn) 4,否則轉(zhuǎn) 3。

3. 隨機(jī)調(diào)度,分配一個(gè) backend。

4. 根據(jù) backend_id,查 be 表,得到 be 的 IP+端口。

5. 更新親和性的相關(guān)表。

6. 更新 nat_sk 表,key 為 be 的 ip+port,value 為 svc的vip+vport。

7. 修改系統(tǒng)調(diào)用上下文中的 dip+dport 為 be 的 ip + port。

8. 完成。劫持 recvmsg 系統(tǒng)調(diào)用

1. 從系統(tǒng)調(diào)用上下文中遠(yuǎn)端 IP+port,查找 NAT_SK 表,找不到則不處理返回。

2. 找到,取出其中的 IP+port,用來查找 svc 表,找不到,則刪除 nat_sk 對應(yīng)表項(xiàng),返回。

3. 使用 nat_sk 中找到的 ip+port,設(shè)置系統(tǒng)調(diào)用上下文中遠(yuǎn)端的 IP+port。

4. 完成。關(guān)于地址修正問題

基于 socket eBPF 實(shí)現(xiàn)的 clusterIP,在上述基本轉(zhuǎn)發(fā)原理之外,還有一些特殊的細(xì)節(jié)需要考慮,其中一個(gè)需要特殊考慮就是 peer address 的問題。和 IPVS之類的實(shí)現(xiàn)不同,在 socket eBPF 的 clusterIP 上,client 是和直接和 backend 通信的,中間的 service 被旁路了。

此時(shí),如果 client 上的 APP 調(diào)用 getpeername 之類的接口查詢 peer address,這個(gè)時(shí)候獲取到的地址和 connect 發(fā)起的地址是不一致的,如果 app對于 peeraddr 有判斷或者特殊用途,可能會有意外情況。

針對這種情況,我們同樣可以通過 eBPF 在 socket 層面來修正:

1、在guest kernel 上新增 bpf_attach_type,可以對 getpeername 和 getsockname 增加 hook 處理。

2、發(fā)起連接的時(shí)候,在相應(yīng)的 socket hook 處理中,定義 map 記錄響應(yīng)的VIP:VPort 和 RSIP:RSPort 的對用關(guān)系。

3、當(dāng) APP 要調(diào)用 getpeername/getsockname 接口的時(shí)候,利用 eBPF 程序修正返回的數(shù)據(jù):修改上下文中的遠(yuǎn)端的 IP+port為vip+vport。

總結(jié)

和TC-EBPF/IPVS性能對比

測試環(huán)境:4vcpu + 8G mem 的安全容器實(shí)例,單 client + 單 clusterip + 12 backend。socket BPF:基于 socket ebpf 的 service 實(shí)現(xiàn)。tc eBPF:基于 cls-bpf 的 service 實(shí)現(xiàn),目前已經(jīng)在 ack 服務(wù)中應(yīng)用。IPVS-raw:去掉所有安全組規(guī)則和 veth 之類開銷,只有 IPVS 轉(zhuǎn)發(fā)邏輯的 service 實(shí)現(xiàn)。socket BPF 在所有性能指標(biāo)上,均有不同程度提升。大量并發(fā)的短連接,基本上吞吐提升 15%,時(shí)延降低 20%。

繼續(xù)演進(jìn)eBPF does to Linux what JavaScript does to HTML.-- Brendan Gregg

基于 socket eBPF 實(shí)現(xiàn)的 service,大大簡化了負(fù)載均衡的邏輯實(shí)現(xiàn),充分體現(xiàn)了 eBPF 靈活、小巧的特點(diǎn)。eBPF 的這些特點(diǎn)也很契合云原生場景,目前,該技術(shù)已在阿里云展開實(shí)踐,加速了 kubernetes 服務(wù)網(wǎng)絡(luò)。我們會繼續(xù)探索和完善更多的 eBPF 的應(yīng)用案例,比如 IPv6、network policy 等。

編輯:jq

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報(bào)投訴
  • 數(shù)據(jù)
    +關(guān)注

    關(guān)注

    8

    文章

    6715

    瀏覽量

    88316
  • Linux
    +關(guān)注

    關(guān)注

    87

    文章

    11123

    瀏覽量

    207921
  • 服務(wù)器
    +關(guān)注

    關(guān)注

    12

    文章

    8701

    瀏覽量

    84568
  • IPv6
    +關(guān)注

    關(guān)注

    6

    文章

    657

    瀏覽量

    59196
  • TCP
    TCP
    +關(guān)注

    關(guān)注

    8

    文章

    1324

    瀏覽量

    78759

原文標(biāo)題:eBPF技術(shù)應(yīng)用云原生網(wǎng)絡(luò)實(shí)踐系列之基于socket的service | 龍蜥技術(shù)

文章出處:【微信號:LinuxDev,微信公眾號:Linux閱碼場】歡迎添加關(guān)注!文章轉(zhuǎn)載請注明出處。

收藏 人收藏

    評論

    相關(guān)推薦

    云原生和非云原生哪個(gè)好?六大區(qū)別詳細(xì)對比

    云原生和非云原生各有優(yōu)劣,具體選擇取決于應(yīng)用場景。云原生利用云計(jì)算的優(yōu)勢,通過微服務(wù)、容器化和自動化運(yùn)維等技術(shù),提高了應(yīng)用的可擴(kuò)展性、更新速度和成本效益。非
    的頭像 發(fā)表于 09-13 09:53 ?143次閱讀

    中科馭數(shù)分析DPU在云原生網(wǎng)絡(luò)與智算網(wǎng)絡(luò)中的實(shí)際應(yīng)用

    的探索與實(shí)踐”專題論壇,業(yè)內(nèi)DPU專家們將討論焦點(diǎn)鎖定在了DPU在云原生網(wǎng)絡(luò)與智算網(wǎng)絡(luò)中的實(shí)際應(yīng)用,深入探討了如何利用DPU技術(shù)解決計(jì)算系統(tǒng)
    的頭像 發(fā)表于 08-02 11:21 ?507次閱讀

    京東云原生安全產(chǎn)品重磅發(fā)布

    “安全產(chǎn)品那么多,我怎么知道防住了?”“大家都說自己是云原生的,我看都是換湯不換藥”在與客戶溝通云原生安全方案的時(shí)候,經(jīng)常會遇到這樣的吐槽。越來越的客戶已經(jīng)開始了云原生化的技術(shù)架構(gòu)改造
    的頭像 發(fā)表于 07-26 10:36 ?274次閱讀
    京東<b class='flag-5'>云原生</b>安全產(chǎn)品重磅發(fā)布

    從積木式到裝配式云原生安全

    云原生安全風(fēng)險(xiǎn) 隨著云原生架構(gòu)的快速發(fā)展,核心能力逐漸穩(wěn)定,安全問題日趨緊急。在云原生安全領(lǐng)域不但有新技術(shù)帶來的新風(fēng)險(xiǎn),傳統(tǒng)IT基礎(chǔ)設(shè)施下的安全威脅也依然存在。要想做好
    的頭像 發(fā)表于 07-26 10:35 ?170次閱讀
    從積木式到裝配式<b class='flag-5'>云原生</b>安全

    基于DPU與SmartNic的云原生SDN解決方案

    隨著云計(jì)算,大數(shù)據(jù)和人工智能等技術(shù)的蓬勃發(fā)展,數(shù)據(jù)中心面臨著前所未有的數(shù)據(jù)洪流和計(jì)算壓力,這對SDN提出了更高的性能和效率要求。自云原生概念被提出以來,Kubernetes為云原生應(yīng)用的落地提供了一
    的頭像 發(fā)表于 07-22 11:44 ?491次閱讀
    基于DPU與SmartNic的<b class='flag-5'>云原生</b>SDN解決方案

    首批認(rèn)證!拓維信息梧桐云原生平臺獲鯤鵬原生開發(fā)技術(shù)認(rèn)證

    7月10日,拓維信息梧桐云原生平臺V3.0獲得華為鯤鵬原生開發(fā)技術(shù)首批認(rèn)證。作為華為鯤鵬戰(zhàn)略合作伙伴,拓維信息以28年行業(yè)數(shù)字化經(jīng)驗(yàn)和持續(xù)技術(shù)創(chuàng)新能力,攜手華為共同繁榮鯤鵬
    的頭像 發(fā)表于 07-19 08:15 ?314次閱讀
    首批認(rèn)證!拓維信息梧桐<b class='flag-5'>云原生</b>平臺獲鯤鵬<b class='flag-5'>原生</b>開發(fā)<b class='flag-5'>技術(shù)</b>認(rèn)證

    云原生轉(zhuǎn)型中從理念到實(shí)踐的探索與挑戰(zhàn)

    以“全面智能化,躍升數(shù)智生產(chǎn)力”為主題的華為第21屆全球分析師大會近日在深圳舉行。在本次大會的“5.5G Core,智能化點(diǎn)亮世界”云核心網(wǎng)分論壇上,廣東移動網(wǎng)絡(luò)云運(yùn)維總監(jiān)王喆發(fā)表了“云原生轉(zhuǎn)型
    的頭像 發(fā)表于 04-23 11:45 ?342次閱讀

    eBPF動手實(shí)踐系列三:基于原生libbpf庫的eBPF編程改進(jìn)方案簡析

    在上一篇文章《eBPF動手實(shí)踐系列二:構(gòu)建基于純C語言的eBPF項(xiàng)目》中,我們初步實(shí)現(xiàn)了脫離內(nèi)核源碼進(jìn)行純C語言eBPF項(xiàng)目的構(gòu)建。libb
    的頭像 發(fā)表于 03-19 14:19 ?570次閱讀
    <b class='flag-5'>eBPF</b>動手<b class='flag-5'>實(shí)踐</b><b class='flag-5'>系列</b>三:基于<b class='flag-5'>原生</b>libbpf庫的<b class='flag-5'>eBPF</b>編程改進(jìn)方案簡析

    Mavenir為捷克T-Mobile部署云原生網(wǎng)絡(luò)設(shè)施

    Mavenir將使用其特有的容器即服務(wù)(CaaS)云平臺來實(shí)施融合分組核心解決方案,在2G、3G、4G和5G非獨(dú)立(NSA)網(wǎng)絡(luò)中替換現(xiàn)有接入技術(shù),同時(shí)開發(fā)有針對云原生5G獨(dú)立(SA)網(wǎng)絡(luò)
    的頭像 發(fā)表于 02-25 15:20 ?438次閱讀

    云原生是大模型“降本增效”的解藥嗎?

    云原生AI正當(dāng)時(shí)
    的頭像 發(fā)表于 02-20 09:31 ?277次閱讀

    米哈游大數(shù)據(jù)云原生實(shí)踐

    近年來,容器、微服務(wù)、Kubernetes 等各項(xiàng)云原生技術(shù)的日漸成熟,越來越多的公司開始選擇擁抱云原生,并開始將 AI、大數(shù)據(jù)等類型的企業(yè)應(yīng)用部署運(yùn)行在云原生之上。以 Spark 為
    的頭像 發(fā)表于 01-09 10:41 ?469次閱讀
    米哈游大數(shù)據(jù)<b class='flag-5'>云原生</b><b class='flag-5'>實(shí)踐</b>

    云原生技術(shù)前沿落地實(shí)踐分論壇圓滿舉辦

    12 月 16 日,2023 開放原子開發(fā)者大會【云原生技術(shù)前沿落地實(shí)踐】分論壇在無錫成功舉辦。論壇將聚焦云原生的泛在化、Serverless 化以及智能化等前沿發(fā)展趨勢,與一線
    的頭像 發(fā)表于 12-22 09:20 ?904次閱讀
    <b class='flag-5'>云原生</b><b class='flag-5'>技術(shù)</b>前沿落地<b class='flag-5'>實(shí)踐</b>分論壇圓滿舉辦

    誠邀報(bào)名|在開發(fā)者大會,洞悉云原生技術(shù)落地最佳實(shí)踐

    2023開放原子開發(fā)者大會 . OPENATOM DEVELOPERS CONFERENCE 云原生技術(shù)前沿落地實(shí)踐分論壇 2023.12.16 隨著云原生
    的頭像 發(fā)表于 12-09 18:45 ?543次閱讀

    中軟國際出席2023云原生產(chǎn)業(yè)大會,加速不動產(chǎn)行業(yè)應(yīng)用現(xiàn)代化發(fā)展

    12月1日,由中國信息通信研究院、中國通信標(biāo)準(zhǔn)化協(xié)會主辦的“2023云原生產(chǎn)業(yè)大會”在京舉行,大會以“新質(zhì)轉(zhuǎn)換、智能紀(jì)元”為主題,就基于云原生技術(shù)的應(yīng)用現(xiàn)代化建設(shè)、大模型應(yīng)用下的云原生
    的頭像 發(fā)表于 12-01 21:50 ?552次閱讀

    開放原子開發(fā)者工作坊|大咖論道云原生技術(shù)發(fā)展與應(yīng)用實(shí)踐

    、獲取前沿技術(shù)趨勢。 數(shù)字化和智能化時(shí)代的來臨,激發(fā)各行各業(yè)對“云”的需求,企業(yè)開始依托云原生、數(shù)字原生等核心技術(shù)進(jìn)行數(shù)字化轉(zhuǎn)型,尋求高效治理的“良方”。在
    的頭像 發(fā)表于 11-29 20:25 ?942次閱讀