0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

用語言對齊多模態(tài)信息,北大騰訊等提出LanguageBind,刷新多個(gè)榜單

深度學(xué)習(xí)自然語言處理 ? 來源:機(jī)器之心 ? 2023-11-23 15:46 ? 次閱讀

在博士畢業(yè)就有10篇ACL一作的師兄指導(dǎo)下是種什么體驗(yàn)

北京大學(xué)與騰訊等機(jī)構(gòu)的研究者們提出了多模態(tài)對齊框架 ——LanguageBind。該框架在視頻音頻、文本、深度圖和熱圖像等五種不同模態(tài)的下游任務(wù)中取得了卓越的性能,刷榜多項(xiàng)評估榜單,這標(biāo)志著多模態(tài)學(xué)習(xí)領(lǐng)域向著「大一統(tǒng)」理念邁進(jìn)了重要一步。

在現(xiàn)代社會(huì),信息傳遞和交流不再局限于單一模態(tài)。我們生活在一個(gè)多模態(tài)的世界里,聲音、視頻、文字和深度圖等模態(tài)信息相互交織,共同構(gòu)成了我們豐富的感知體驗(yàn)。這種多模態(tài)的信息交互不僅存在于人類社會(huì)的溝通中,同樣也是機(jī)器理解世界所必須面對的挑戰(zhàn)。

如何讓機(jī)器像人類一樣理解和處理這種多模態(tài)的數(shù)據(jù),成為了人工智能領(lǐng)域研究的前沿問題。

在過去的十年里,隨著互聯(lián)網(wǎng)和智能設(shè)備的普及,視頻內(nèi)容的數(shù)量呈爆炸式增長。視頻平臺(tái)如 YouTube、TikTok 和 Bilibili 等匯聚了億萬用戶上傳和分享的視頻內(nèi)容,涵蓋了娛樂、教育、新聞報(bào)道、個(gè)人日志等各個(gè)方面。如此龐大的視頻數(shù)據(jù)量為人類提供了前所未有的信息和知識(shí)。為了解決這些視頻理解任務(wù),人們采用了視頻 - 語言(VL)預(yù)訓(xùn)練方法,將計(jì)算機(jī)視覺和自然語言處理結(jié)合起來,這些模型能夠捕捉視頻語義并解決下游任務(wù)。

然而,目前的 VL 預(yù)訓(xùn)練方法通常僅適用于視覺和語言模態(tài),而現(xiàn)實(shí)世界中的應(yīng)用場景往往包含更多的模態(tài)信息,如深度圖、熱圖像等。如何整合和分析不同模態(tài)的信息,并且能夠在多個(gè)模態(tài)之間建立準(zhǔn)確的語義對應(yīng)關(guān)系,成為了多模態(tài)領(lǐng)域的一個(gè)新的挑戰(zhàn)。

為了應(yīng)對這一難題,北大與騰訊的研究人員提出了一種新穎的多模態(tài)對齊框架 ——LanguageBind。與以往依賴圖像作為主導(dǎo)模態(tài)的方法不同,LanguageBind 采用語言作為多模態(tài)信息對齊的紐帶。

d09ea0e0-7ef0-11ee-939d-92fbcf53809c.png

論文地址:https://arxiv.org/pdf/2310.01852.pdf

GitHub 地址:https://github.com/PKU-YuanGroup/LanguageBind

Huggingface 地址:https://huggingface.co/LanguageBind

語言因其內(nèi)在的語義豐富性和表現(xiàn)力,被賦予了整合和引導(dǎo)其他模態(tài)信息對齊的能力。在這個(gè)框架下,語言不再是附屬于視覺信息的標(biāo)注或說明,而是成為了聯(lián)合視覺、音頻和其他模態(tài)的中心通道。

LanguageBind 通過將所有模態(tài)的信息映射到一個(gè)統(tǒng)一的語言導(dǎo)向的嵌入空間,實(shí)現(xiàn)了不同模態(tài)之間的語義對齊。這種對齊方法避免了通過圖像中介可能引入的信息損失,提高了多模態(tài)信息處理的準(zhǔn)確性和效率。更重要的是,這種方法為未來的擴(kuò)展提供了靈活性,允許簡單地添加新的模態(tài),而無需重新設(shè)計(jì)整個(gè)系統(tǒng)。

此外,該研究團(tuán)隊(duì)構(gòu)建了 VIDAL-10M 數(shù)據(jù)集,這是一個(gè)大規(guī)模、包含多模態(tài)數(shù)據(jù)對的數(shù)據(jù)集。

VIDAL-10M 涵蓋了視頻 - 語言、紅外 - 語言、深度 - 語言和音頻 - 語言配對,以確??缒B(tài)的信息是完整且一致的。通過在該數(shù)據(jù)集上進(jìn)行訓(xùn)練,LanguageBind 在視頻、音頻、深度和紅外等 15 個(gè)廣泛的基準(zhǔn)測試中取得了卓越的性能表現(xiàn)。

d0c06144-7ef0-11ee-939d-92fbcf53809c.png

d0e06b6a-7ef0-11ee-939d-92fbcf53809c.png

方法介紹

在多模態(tài)信息處理領(lǐng)域,主流的對齊技術(shù),如 ImageBind,主要依賴圖像作為橋梁來實(shí)現(xiàn)不同模態(tài)之間的間接對齊。這種方法在對其他模態(tài)和語言模態(tài)的對齊上可能會(huì)導(dǎo)致性能次優(yōu)化,因?yàn)樗枰獌刹睫D(zhuǎn)換過程 —— 首先是從目標(biāo)模態(tài)到圖像模態(tài),然后是從圖像模態(tài)到語言模態(tài)。這種間接對齊可能導(dǎo)致語義信息在轉(zhuǎn)換過程中的衰減,從而影響最終的性能表現(xiàn)。

d1075824-7ef0-11ee-939d-92fbcf53809c.png

針對這一問題,該團(tuán)隊(duì)提出了一種名為 LanguageBind 的多模態(tài)語義對齊預(yù)訓(xùn)練框架。該框架摒棄了依賴圖像作為中介的傳統(tǒng)模式,而是直接利用語言模態(tài)作為不同模態(tài)之間的紐帶。語言模態(tài)因其天然的語義豐富性,成為連接視覺、音頻、深度等模態(tài)的理想選擇。LanguageBind 框架通過利用對比學(xué)習(xí)機(jī)制,將不同模態(tài)的數(shù)據(jù)映射到一個(gè)共享的語義嵌入空間中。在這個(gè)空間里,不同模態(tài)的信息可以直接進(jìn)行語義層面的理解與對齊。

d126bd86-7ef0-11ee-939d-92fbcf53809c.png

LanguageBind 概覽圖

具體而言,LanguageBind 通過錨定語言模態(tài),采用一系列優(yōu)化的對比學(xué)習(xí)策略,對多模態(tài)數(shù)據(jù)進(jìn)行預(yù)訓(xùn)練。這一過程中,模型學(xué)習(xí)將來自不同模態(tài)的數(shù)據(jù)編碼到與語言模態(tài)相兼容的表征中,確保了模態(tài)間的語義一致性。這種直接的跨模態(tài)語義對齊避免了傳統(tǒng)方法中的性能損失,同時(shí)提高了模型在下游多模態(tài)任務(wù)中的泛化能力和適用性。

LanguageBind 框架的另一個(gè)優(yōu)點(diǎn)是其擴(kuò)展性。由于直接使用語言作為核心對齊模態(tài),當(dāng)引入新的模態(tài)時(shí),無需重構(gòu)整個(gè)對齊機(jī)制,只需通過相同的對比學(xué)習(xí)過程,將新模態(tài)的數(shù)據(jù)映射到已經(jīng)建立的語言導(dǎo)向嵌入空間。這使得 LanguageBind 不僅適用于現(xiàn)有的模態(tài),也能輕松適應(yīng)未來可能出現(xiàn)的新模態(tài),為多模態(tài)預(yù)訓(xùn)練技術(shù)的發(fā)展奠定了堅(jiān)實(shí)基礎(chǔ)。

數(shù)據(jù)集介紹

在跨模態(tài)預(yù)訓(xùn)練領(lǐng)域,數(shù)據(jù)集的構(gòu)建及其質(zhì)量對于預(yù)訓(xùn)練模型的性能與應(yīng)用效能具有決定性影響。傳統(tǒng)的多模態(tài)數(shù)據(jù)集大多局限于二模態(tài)或三模態(tài)的配對數(shù)據(jù),這種限制導(dǎo)致了對更豐富模態(tài)對齊數(shù)據(jù)集的需求。

因而,該團(tuán)隊(duì)開發(fā)了 VIDAL-10M 數(shù)據(jù)集,這是一個(gè)創(chuàng)新的五模態(tài)數(shù)據(jù)集,包含了視頻 - 語言(VL)、紅外 - 語言(IL)、深度 - 語言(DL)、音頻 - 語言(AL)等數(shù)據(jù)對。每個(gè)數(shù)據(jù)對都經(jīng)過了精心的質(zhì)量篩選,旨在為跨模態(tài)預(yù)訓(xùn)練領(lǐng)域提供一個(gè)高品質(zhì)、高完整性的訓(xùn)練基礎(chǔ)。

d15ec6e0-7ef0-11ee-939d-92fbcf53809c.png

VIDAL-10M 數(shù)據(jù)集示例

VIDAL-10M 數(shù)據(jù)集的構(gòu)建主要包括三步:

視覺相關(guān)搜索詞庫構(gòu)建。設(shè)計(jì)一種創(chuàng)新的搜索詞獲取策略,該策略綜合利用了各類視覺任務(wù)數(shù)據(jù)集中的文本信息,如標(biāo)簽和標(biāo)題,以構(gòu)建一個(gè)豐富視覺概念且多樣化的視頻數(shù)據(jù)集,從而增強(qiáng)了數(shù)據(jù)多樣性和覆蓋度。

視頻和音頻數(shù)據(jù)的收集、清洗與篩選:在數(shù)據(jù)的收集過程中,該研究采取了基于文本、視覺和音頻內(nèi)容的多種過濾機(jī)制,這些機(jī)制確保收集到的視頻和音頻數(shù)據(jù)與搜索詞高度相關(guān),并且滿足高標(biāo)準(zhǔn)的質(zhì)量要求。這一步驟是確保數(shù)據(jù)集質(zhì)量的關(guān)鍵環(huán)節(jié),它直接影響模型訓(xùn)練的效果和后續(xù)任務(wù)的性能。

紅外、深度模態(tài)數(shù)據(jù)生成與多視角文本增強(qiáng)。此階段,利用多種先進(jìn)的生成模型技術(shù)合成了紅外和深度模態(tài)數(shù)據(jù),并對文本內(nèi)容進(jìn)行了多角度的生成和增強(qiáng)。多視角文本增強(qiáng)包括了標(biāo)題、標(biāo)簽、關(guān)鍵幀描述、視頻概要等多個(gè)維度,它為視頻內(nèi)容提供了全面且細(xì)致的描述,增強(qiáng)了數(shù)據(jù)的語義豐富性和描述的細(xì)粒度。

d1b74ffe-7ef0-11ee-939d-92fbcf53809c.png

VIDAL-10M 數(shù)據(jù)集的構(gòu)建過程

實(shí)驗(yàn)

LanguageBind 框架被應(yīng)用于多個(gè)模態(tài)的零樣本分類任務(wù),并與其他模型進(jìn)行了性能比較。實(shí)驗(yàn)結(jié)果顯示,LanguageBind 方法在包括視頻、音頻、深度圖像、熱成像等多模態(tài)數(shù)據(jù)上的 15 個(gè)零樣本分類與檢索任務(wù)中均展示了顯著的性能提升。這些實(shí)驗(yàn)成果強(qiáng)調(diào)了 LanguageBind 方法在理解和處理不同模態(tài)數(shù)據(jù)中的潛在能力,尤其是在沒有先前樣本可供學(xué)習(xí)的情況下。為了更深入地了解 LanguageBind 方法的性能,可以參照以下詳細(xì)的實(shí)驗(yàn)結(jié)果。

表 2 顯示,LanguageBind 的性能在 MSR-VTT 上超過 VideoCoca 和 OmniVL ,盡管僅使用 300 萬個(gè)視頻 - 文本對。

d1ddf640-7ef0-11ee-939d-92fbcf53809c.png

在兩個(gè)經(jīng)典數(shù)據(jù)集 MSR-VTT 和 MSVD 上進(jìn)行的零樣本視頻 - 文本檢索實(shí)驗(yàn)結(jié)果如表 3 所示:

d1fe8842-7ef0-11ee-939d-92fbcf53809c.png

該研究還將本文模型與 SOTA 多模態(tài)預(yù)訓(xùn)練模型 OpenCLIP、ImageBind 在多模態(tài)理解任務(wù)上進(jìn)行了比較,結(jié)果如表 4 所示:

d220c326-7ef0-11ee-939d-92fbcf53809c.png

表 5 比較了在 Clotho 數(shù)據(jù)集和 Audiocaps 數(shù)據(jù)集上的零樣本文本 - 音頻檢索性能:

d23bc054-7ef0-11ee-939d-92fbcf53809c.png

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報(bào)投訴
  • 圖像
    +關(guān)注

    關(guān)注

    2

    文章

    1075

    瀏覽量

    40266
  • 模型
    +關(guān)注

    關(guān)注

    1

    文章

    3032

    瀏覽量

    48346
  • 智能設(shè)備
    +關(guān)注

    關(guān)注

    5

    文章

    1024

    瀏覽量

    49856
  • 數(shù)據(jù)集
    +關(guān)注

    關(guān)注

    4

    文章

    1197

    瀏覽量

    24532

原文標(biāo)題:用語言對齊多模態(tài)信息,北大騰訊等提出LanguageBind,刷新多個(gè)榜單

文章出處:【微信號(hào):zenRRan,微信公眾號(hào):深度學(xué)習(xí)自然語言處理】歡迎添加關(guān)注!文章轉(zhuǎn)載請注明出處。

收藏 人收藏

    評論

    相關(guān)推薦

    智譜AI發(fā)布全新模態(tài)開源模型GLM-4-9B

    近日,智譜AI在人工智能領(lǐng)域取得重大突破,成功推出全新開源模型GLM-4-9B。這款模型以其卓越的模態(tài)能力,再次刷新了業(yè)界對于大型語言模型的認(rèn)識(shí)。
    的頭像 發(fā)表于 06-07 09:17 ?547次閱讀

    智譜AI領(lǐng)跑司南OpenCompass 2.0月度榜單,GLM-4展示強(qiáng)大實(shí)力

    (OpenCompass 2.0)由上海人工智能實(shí)驗(yàn)室發(fā)布。其月度榜單從基礎(chǔ)能力和綜合能力的設(shè)計(jì)出發(fā),構(gòu)建了一套高質(zhì)量的中英文雙語評測基準(zhǔn)體系,對主流開源模型和商業(yè)API模型進(jìn)行了全面評測分析。評測榜單涉及的大語言模型和
    的頭像 發(fā)表于 05-22 12:44 ?447次閱讀
    智譜AI領(lǐng)跑司南OpenCompass 2.0月度<b class='flag-5'>榜單</b>,GLM-4展示強(qiáng)大實(shí)力

    李未可科技正式推出WAKE-AI模態(tài)AI大模型

    文本生成、語言理解、圖像識(shí)別及視頻生成模態(tài)交互能力。 ? 該大模型圍繞 GPS 軌跡+視覺+語音打造新一代 LLM-Based的自然交互,同時(shí)
    發(fā)表于 04-18 17:01 ?488次閱讀
    李未可科技正式推出WAKE-AI<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>AI大模型

    fpga通用語言是什么

    FPGA(現(xiàn)場可編程門陣列)的通用語言主要是指用于描述FPGA內(nèi)部邏輯結(jié)構(gòu)和行為的硬件描述語言。目前,Verilog HDL和VHDL是兩種最為廣泛使用的FPGA編程語言
    的頭像 發(fā)表于 03-15 14:36 ?399次閱讀

    韓國Kakao宣布開發(fā)模態(tài)語言模型“蜜蜂”

    韓國互聯(lián)網(wǎng)巨頭Kakao最近宣布開發(fā)了一種名為“蜜蜂”(Honeybee)的模態(tài)大型語言模型。這種創(chuàng)新模型能夠同時(shí)理解和處理圖像和文本數(shù)據(jù),為更豐富的交互和查詢響應(yīng)提供了可能性。
    的頭像 發(fā)表于 01-19 16:11 ?543次閱讀

    機(jī)器人基于開源的模態(tài)語言視覺大模型

    ByteDance Research 基于開源的模態(tài)語言視覺大模型 OpenFlamingo 開發(fā)了開源、易用的 RoboFlamingo 機(jī)器人操作模型,只用單機(jī)就可以訓(xùn)練。
    發(fā)表于 01-19 11:43 ?287次閱讀
    機(jī)器人基于開源的<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b><b class='flag-5'>語言</b>視覺大模型

    OneLLM:對齊所有模態(tài)的框架!

    OneLLM 是第一個(gè)在單個(gè)模型中集成八種不同模態(tài)的MLLM。通過統(tǒng)一的框架和漸進(jìn)式模態(tài)對齊pipelines,可以很容易地?cái)U(kuò)展OneLLM以包含更多數(shù)據(jù)模式。
    的頭像 發(fā)表于 01-04 11:27 ?707次閱讀
    OneLLM:<b class='flag-5'>對齊</b>所有<b class='flag-5'>模態(tài)</b>的框架!

    自動(dòng)駕駛和模態(tài)語言模型的發(fā)展歷程

    模態(tài)語言模型(MLLM) 最近引起了廣泛的關(guān)注,其將 LLM 的推理能力與圖像、視頻和音頻數(shù)據(jù)相結(jié)合,通過多模態(tài)對齊使它們能夠更高效地執(zhí)
    發(fā)表于 12-28 11:45 ?411次閱讀
    自動(dòng)駕駛和<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>大<b class='flag-5'>語言</b>模型的發(fā)展歷程

    語音識(shí)別技術(shù)最新進(jìn)展:視聽融合的模態(tài)交互成為主要演進(jìn)方向

    多種模態(tài)(聲學(xué)、語言模型、視覺特征)進(jìn)行聯(lián)合建模,基于深度學(xué)習(xí)的模態(tài)語音識(shí)別取得了新進(jìn)展。 ?
    的頭像 發(fā)表于 12-28 09:06 ?2841次閱讀
    語音識(shí)別技術(shù)最新進(jìn)展:視聽融合的<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>交互成為主要演進(jìn)方向

    人工智能領(lǐng)域模態(tài)的概念和應(yīng)用場景

    隨著人工智能技術(shù)的不斷發(fā)展,模態(tài)成為了一個(gè)備受關(guān)注的研究方向。模態(tài)技術(shù)旨在將不同類型的數(shù)據(jù)和信息進(jìn)行融合,以實(shí)現(xiàn)更加準(zhǔn)確、高效的人工智能
    的頭像 發(fā)表于 12-15 14:28 ?7255次閱讀

    大模型+模態(tài)的3種實(shí)現(xiàn)方法

    我們知道,預(yù)訓(xùn)練LLM已經(jīng)取得了諸多驚人的成就, 然而其明顯的劣勢是不支持其他模態(tài)(包括圖像、語音、視頻模態(tài))的輸入和輸出,那么如何在預(yù)訓(xùn)練LLM的基礎(chǔ)上引入跨模態(tài)信息,讓其變得更強(qiáng)
    的頭像 發(fā)表于 12-13 13:55 ?1351次閱讀
    大模型+<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>的3種實(shí)現(xiàn)方法

    探究編輯模態(tài)語言模型的可行性

    不同于單模態(tài)模型編輯,模態(tài)模型編輯需要考慮更多的模態(tài)信息。文章出發(fā)點(diǎn)依然從單模態(tài)模型編輯入手,
    發(fā)表于 11-09 14:53 ?399次閱讀
    探究編輯<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>大<b class='flag-5'>語言</b>模型的可行性

    北大&amp;華為提出模態(tài)基礎(chǔ)大模型的高效微調(diào)

    深度學(xué)習(xí)的大模型時(shí)代已經(jīng)來臨,越來越多的大規(guī)模預(yù)訓(xùn)練模型在文本、視覺和模態(tài)領(lǐng)域展示出杰出的生成和推理能力。然而大模型巨大的參數(shù)量有兩個(gè)明顯缺點(diǎn)
    的頭像 發(fā)表于 11-08 16:20 ?557次閱讀
    <b class='flag-5'>北大</b>&amp;華為<b class='flag-5'>提出</b>:<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>基礎(chǔ)大模型的高效微調(diào)

    基于視覺的模態(tài)觸覺感知系統(tǒng)

    傳統(tǒng)的模態(tài)/多任務(wù)觸覺感知系統(tǒng)通過集成多種傳感單元來達(dá)到模態(tài)觸覺信息的解耦,但其往往導(dǎo)致系統(tǒng)結(jié)構(gòu)的復(fù)雜性,以及需要應(yīng)對來自不同刺激間的干
    發(fā)表于 10-18 11:24 ?708次閱讀
    基于視覺的<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>觸覺感知系統(tǒng)

    DreamLLM:多功能模態(tài)大型語言模型,你的DreamLLM~

    由于固有的模態(tài)缺口,如CLIP語義主要關(guān)注模態(tài)共享信息,往往忽略了可以增強(qiáng)多模態(tài)理解的模態(tài)特定知識(shí)。因此,這些研究并沒有充分認(rèn)識(shí)到
    的頭像 發(fā)表于 09-25 17:26 ?609次閱讀
    DreamLLM:多功能<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>大型<b class='flag-5'>語言</b>模型,你的DreamLLM~