0
  • 聊天消息
  • 系統(tǒng)消息
  • 評(píng)論與回復(fù)
登錄后你可以
  • 下載海量資料
  • 學(xué)習(xí)在線課程
  • 觀看技術(shù)視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會(huì)員中心
創(chuàng)作中心

完善資料讓更多小伙伴認(rèn)識(shí)你,還能領(lǐng)取20積分哦,立即完善>

3天內(nèi)不再提示

一種無(wú)監(jiān)督下利用多模態(tài)文檔結(jié)構(gòu)信息幫助圖片-句子匹配的采樣方法

深度學(xué)習(xí)自然語(yǔ)言處理 ? 來(lái)源:深度學(xué)習(xí)自然語(yǔ)言處理 ? 作者:深度學(xué)習(xí)自然語(yǔ)言 ? 2020-12-26 10:26 ? 次閱讀

引 言

本文介紹了復(fù)旦大學(xué)數(shù)據(jù)智能與社會(huì)計(jì)算實(shí)驗(yàn)室 (Fudan DISC) 在AAAI 2021上錄用的一篇關(guān)于多模態(tài)匹配的工作:An Unsupervised Sampling Approach for Image-Sentence Matching UsingDocument-Level Structural Information,提出了一種無(wú)監(jiān)督設(shè)定下,更有效地利用多模態(tài)文檔的共現(xiàn)結(jié)構(gòu)信息幫助采樣完成句子-圖片匹配的方法。本文的合作單位是杭州之江實(shí)驗(yàn)室。

文章摘要

文章針對(duì)無(wú)監(jiān)督的句子圖片匹配任務(wù)?,F(xiàn)存的方法主要通過(guò)利用多模態(tài)文檔的圖片句子共現(xiàn)信息來(lái)無(wú)監(jiān)督地采樣正負(fù)樣本對(duì),但是其在獲得負(fù)樣本時(shí)只考慮了跨文檔的圖片句子對(duì),在一定程度上引入了采樣的偏差,使得模型無(wú)法分辨同一文檔內(nèi)語(yǔ)義較為近似的圖片和句子。

在本文中,我們提出了一種新的采樣的方法,通過(guò)引入同一文檔內(nèi)的圖片句子對(duì)作為額外的正負(fù)樣本來(lái)減小采樣的偏差;進(jìn)一步,我們提出了一個(gè)基于Transformer的模型來(lái)識(shí)別更為復(fù)雜的語(yǔ)義關(guān)聯(lián),該模型為每個(gè)多模態(tài)文檔隱式地構(gòu)建了一個(gè)圖的結(jié)構(gòu),構(gòu)建了同一篇文檔內(nèi)句子和圖片的表征學(xué)習(xí)間的橋梁。實(shí)驗(yàn)的結(jié)果證明了我們提出的方法有效的減小偏差并且進(jìn)一步獲得了更好的跨模態(tài)表征。

研究背景

dfab07a2-4692-11eb-8b86-12bb97331649.png

圖1. 句子-圖片匹配任務(wù)說(shuō)明

(綠色/藍(lán)色點(diǎn)代表圖片/句子,紅色實(shí)線代表匹配關(guān)系的標(biāo)簽,紅色/藍(lán)色虛線代表無(wú)監(jiān)督方法選出的(偽)正/負(fù)樣本對(duì))

圖片-句子的匹配一直是跨模態(tài)領(lǐng)域的基礎(chǔ)任務(wù),其根本的目的是對(duì)其視覺(jué)和文本的語(yǔ)義空間。如(a)所示,兩個(gè)模態(tài)之間本身存在著語(yǔ)義空間上的差異,對(duì)其的常見(jiàn)方法是通過(guò)有監(jiān)督的標(biāo)簽拉近匹配的樣本對(duì),如(b)所示。在無(wú)監(jiān)督的環(huán)境下,最大的挑戰(zhàn)即為如何選擇出想要拉近的正樣本對(duì)和遠(yuǎn)離的負(fù)樣本對(duì)。

如(c)所示,最近的無(wú)監(jiān)督的方法通過(guò)文檔的圖片句子共現(xiàn)信息,通過(guò)拉近句子集合和圖片集合的方式來(lái)進(jìn)行訓(xùn)練,其中,同文檔內(nèi)語(yǔ)義近似的句子-圖片對(duì)被看作正樣本,而跨文檔間的句子-圖片對(duì)被看作負(fù)樣本,如(c)所示,這樣的方法沒(méi)有考慮到文檔內(nèi)部語(yǔ)義相似度更高的負(fù)樣本,其選出的負(fù)樣本與真實(shí)的負(fù)樣本分布存在著偏差。

于是本文提出了新的采樣策略,如(d)所示,我們引入了更多同一文檔內(nèi)部的正負(fù)樣本對(duì)來(lái)幫助訓(xùn)練。進(jìn)一步,為了更好地識(shí)別同一文檔內(nèi)更加復(fù)雜的句子圖片語(yǔ)義匹配模式,我們考慮使用更加細(xì)粒度的表征學(xué)習(xí)方法,提出了一個(gè)新的基于Transformer的模型,在其中為每個(gè)文檔的句子圖片間隱性建模了一個(gè)圖,來(lái)幫助獲得更好的跨模態(tài)表征。

方法描述

采樣方法

本文的方法基于三個(gè)部分的采樣,通過(guò)3個(gè)訓(xùn)練目標(biāo)實(shí)現(xiàn),如圖2所示。

圖2. 三個(gè)部分的采樣和訓(xùn)練目標(biāo)示意

第一個(gè)部分為之前的工作提出的跨文檔訓(xùn)練目標(biāo)(cross-document objective)。其假設(shè)為同一文檔內(nèi)的句子集合和圖片集合間的相似度要整體高于來(lái)自兩個(gè)不同文檔的句子集合和圖片集合間的相似度,背后通過(guò)一定的方式來(lái)選出幾個(gè)句子圖片對(duì)之間的相似度來(lái)代表句子集合和圖片集合間的相似度。其采樣得到的正樣本為來(lái)自同一文檔的語(yǔ)義較為近似的句子-圖片對(duì);負(fù)樣本為來(lái)自不同文檔的語(yǔ)義較為近似的圖片句子對(duì)。

第二個(gè)部分為文檔內(nèi)部的訓(xùn)練目標(biāo)(intra-document objective)。其假設(shè)為同一篇文檔內(nèi)部的語(yǔ)義近似的圖片句子對(duì)之間的相似度也要高于內(nèi)部語(yǔ)義相差較遠(yuǎn)的圖片句子對(duì)間的相似度,高于一定的值,在此目標(biāo)下采樣出的正樣本為來(lái)自同一文檔的語(yǔ)義較為近似的句子-圖片對(duì);負(fù)樣本為來(lái)自同一文檔的語(yǔ)義相差較遠(yuǎn)的圖片句子對(duì)。

第三個(gè)部分為次跨文檔訓(xùn)練目標(biāo)(dropout sub-document objective)。其假設(shè)為即使一篇文檔我們將其隨機(jī)的遮蓋住部分的句子/圖片,剩下的殘缺文檔內(nèi)的句子集合和圖片集合間的相似度也要高于跨文檔間的圖片集合-句子集合間的相似度。在此目標(biāo)下采樣出的正樣本為來(lái)自同一“殘次”文檔的語(yǔ)義較為近似的句子-圖片對(duì);負(fù)樣本為來(lái)自不同文檔的語(yǔ)義近似的圖片句子對(duì)。

跨模態(tài)表征模型

圖3. 總的模型結(jié)構(gòu)示意

由于引入了更多的同一文檔內(nèi)的圖片句子對(duì),我們需要得到包含更細(xì)粒度信息的多模態(tài)表征,所以我們將圖片分割為區(qū)域,將句子分割為token,Transformer可以看作是帶有attention機(jī)制的圖網(wǎng)絡(luò),我們通過(guò)兩個(gè)視覺(jué)/文本的Transformer對(duì)各模態(tài)內(nèi)的(區(qū)域/token)節(jié)點(diǎn)進(jìn)行編碼,與此同時(shí)我們引入了視覺(jué)的概念,這里我們將圖片區(qū)域預(yù)測(cè)出的標(biāo)簽作為圖片包括的概念,將它們作為中間的橋梁將兩個(gè)模態(tài)的圖橋接起來(lái)。概念會(huì)直接加入到視覺(jué)的圖中,作為節(jié)點(diǎn)存在,而概念和文本端的關(guān)系通過(guò)共享的embedding層來(lái)實(shí)現(xiàn)。這樣的模型里,當(dāng)句子里直接提到了區(qū)域里對(duì)應(yīng)的概念時(shí),我們的模型就能很快地捕捉到這樣的匹配關(guān)系。

實(shí)驗(yàn)

我們?cè)跓o(wú)監(jiān)督的多句子多圖片文檔內(nèi)的跨模態(tài)鏈接預(yù)測(cè)任務(wù)上進(jìn)行了實(shí)驗(yàn),其中包括了基于MSCOCO, VIST構(gòu)建出的三個(gè)文檔數(shù)據(jù)集。對(duì)于每一個(gè)文檔,其內(nèi)部有多個(gè)句子和多個(gè)圖片,需要去預(yù)測(cè)其中句子和圖片間是否存在著鏈接的邊(匹配關(guān)系),使用AUC/P@1/P@5進(jìn)行評(píng)估。相較于之前只使用cross-document objective的方法(表內(nèi)MulLink),我們的方法有了明顯的提高。

e1927e92-4692-11eb-8b86-12bb97331649.png

表1. 總的實(shí)驗(yàn)結(jié)果

同時(shí)我們對(duì)我們提出的模型的結(jié)構(gòu),和三個(gè)部分的訓(xùn)練目標(biāo)進(jìn)行了消融實(shí)驗(yàn):

e212875e-4692-11eb-8b86-12bb97331649.png

表2. 部分消融實(shí)驗(yàn)的結(jié)果

(S列代表采樣方法,T代表同時(shí)使用三種目標(biāo)訓(xùn)練,O代表只使用跨文檔訓(xùn)練目標(biāo),w/o代表without,w/o Transformer的方法里我們使用GRU對(duì)句子進(jìn)行表征,對(duì)圖片的各個(gè)區(qū)域進(jìn)行softmax pooling進(jìn)行表征。)

可以看到整體上同時(shí)使用三種目標(biāo)可以采樣到更多的信息,幫助訓(xùn)練,我們也對(duì)三個(gè)目標(biāo)進(jìn)行了更加細(xì)致的消融實(shí)驗(yàn),詳情可以參考原文。同時(shí)我們提出的模型更好地利用了細(xì)粒度的信息,也獲得了更好地跨模態(tài)表征。

同時(shí),我們進(jìn)行了有監(jiān)督、無(wú)監(jiān)督和遷移學(xué)習(xí)的比較。有監(jiān)督的方法直接使用文檔內(nèi)的匹配的圖片句子對(duì)作為訓(xùn)練,如圖4,遷移學(xué)習(xí)則嘗試遷移從MSCOCO上進(jìn)行有監(jiān)督訓(xùn)練的信息到DII測(cè)試集上,如表3。

e2a01a74-4692-11eb-8b86-12bb97331649.png

圖4. 有監(jiān)督-無(wú)監(jiān)督比較

藍(lán)色代表有監(jiān)督學(xué)習(xí)下,隨著使用的數(shù)據(jù)增加在測(cè)試集上的表現(xiàn)

e31ba77a-4692-11eb-8b86-12bb97331649.png

表3. 遷移學(xué)習(xí)和無(wú)監(jiān)督學(xué)習(xí)的比較

可以看到相較于只使用跨文檔訓(xùn)練目標(biāo),同時(shí)使用三種目標(biāo)得到的更多樣本對(duì)里包括了更多的信息,我們無(wú)監(jiān)督的方法可以利用訓(xùn)練集內(nèi)更多的信息(~40%),相較于遷移自其他數(shù)據(jù)集的信息,也更加有效。

除此之外,我們通過(guò)錯(cuò)誤分析的方法驗(yàn)證我們的方法對(duì)于偏差的修正效果。該偏差的表現(xiàn)為同一文檔內(nèi)的句子和圖片更加近似,跨文檔內(nèi)的圖片和句子差異更大,所以我們使用文檔內(nèi)的句子/圖片表征的發(fā)散程度來(lái)代表這個(gè)差異,同一文檔內(nèi)越發(fā)散,訓(xùn)練和測(cè)試之間的差異越小。在DII上,我們使用每個(gè)文檔內(nèi)句子/圖片的發(fā)散程度來(lái)擬合該文檔鏈接預(yù)測(cè)的AUC,原來(lái)的方法得到的線性模型的R方為42%,也就是說(shuō)差異能很大程度解釋錯(cuò)誤的原因,而我們的方法得到的R方為23%,這意味著該差異對(duì)于結(jié)果的作用減弱了,加上我們模型整體上更好地表現(xiàn),我們可以認(rèn)為我們減弱了采樣的偏差,使得偏差引起的錯(cuò)誤減少了。

結(jié)論

在本文里,我們對(duì)于無(wú)監(jiān)督的句子-圖片匹配任務(wù),針對(duì)之前方法存在的采樣偏差問(wèn)題提出了新的采樣策略,希望更高效地利用多模態(tài)文檔內(nèi)句子和圖片共現(xiàn)的結(jié)構(gòu)信息,引入了更多的來(lái)自同一文檔內(nèi)的正/負(fù)圖片-句子對(duì)。同時(shí)提出了可以利用更細(xì)粒度信息的模型,建立了跨模態(tài)表征學(xué)習(xí)的關(guān)系橋梁。最終的實(shí)驗(yàn)證明了我們方法的有效性。

責(zé)任編輯:xj

原文標(biāo)題:【Fudan DISC】一種無(wú)監(jiān)督下利用多模態(tài)文檔結(jié)構(gòu)信息幫助圖片-句子匹配的采樣方法

文章出處:【微信公眾號(hào):深度學(xué)習(xí)自然語(yǔ)言處理】歡迎添加關(guān)注!文章轉(zhuǎn)載請(qǐng)注明出處。

聲明:本文內(nèi)容及配圖由入駐作者撰寫或者入駐合作網(wǎng)站授權(quán)轉(zhuǎn)載。文章觀點(diǎn)僅代表作者本人,不代表電子發(fā)燒友網(wǎng)立場(chǎng)。文章及其配圖僅供工程師學(xué)習(xí)之用,如有內(nèi)容侵權(quán)或者其他違規(guī)問(wèn)題,請(qǐng)聯(lián)系本站處理。 舉報(bào)投訴
  • 語(yǔ)義
    +關(guān)注

    關(guān)注

    0

    文章

    21

    瀏覽量

    8650
  • 自然語(yǔ)言
    +關(guān)注

    關(guān)注

    1

    文章

    279

    瀏覽量

    13295

原文標(biāo)題:【Fudan DISC】一種無(wú)監(jiān)督下利用多模態(tài)文檔結(jié)構(gòu)信息幫助圖片-句子匹配的采樣方法

文章出處:【微信號(hào):zenRRan,微信公眾號(hào):深度學(xué)習(xí)自然語(yǔ)言處理】歡迎添加關(guān)注!文章轉(zhuǎn)載請(qǐng)注明出處。

收藏 人收藏

    評(píng)論

    相關(guān)推薦

    一種無(wú)透鏡成像的新方法

    使用OAM-HHG EUV光束對(duì)高度周期性結(jié)構(gòu)進(jìn)行成像的EUV聚光顯微鏡 為了研究微電子或光子元件中的納米級(jí)圖案,一種基于無(wú)透鏡成像的新方法可以實(shí)現(xiàn)近乎完美的高分辨率顯微鏡。 層析成像
    的頭像 發(fā)表于 07-19 06:20 ?193次閱讀
    <b class='flag-5'>一種</b><b class='flag-5'>無(wú)</b>透鏡成像的新<b class='flag-5'>方法</b>

    神經(jīng)網(wǎng)絡(luò)如何用無(wú)監(jiān)督算法訓(xùn)練

    神經(jīng)網(wǎng)絡(luò)作為深度學(xué)習(xí)的重要組成部分,其訓(xùn)練方式多樣,其中無(wú)監(jiān)督學(xué)習(xí)是一種重要的訓(xùn)練策略。無(wú)監(jiān)督學(xué)習(xí)旨在從未標(biāo)記的數(shù)據(jù)中發(fā)現(xiàn)數(shù)據(jù)內(nèi)在的
    的頭像 發(fā)表于 07-09 18:06 ?573次閱讀

    什么是模態(tài)模態(tài)的難題是什么?

    模態(tài)大模型,通常大于100M~1B參數(shù)。具有較強(qiáng)的通用性,比如對(duì)圖片中任意物體進(jìn)行分割,或者生成任意內(nèi)容的圖片或聲音。極大降低了場(chǎng)景的定制成本。
    的頭像 發(fā)表于 01-17 10:03 ?3727次閱讀
    什么是<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>?<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>的難題是什么?

    OCR終結(jié)了?曠視提出可以文檔級(jí)OCR的模態(tài)大模型框架Vary,支持中英文,已開源!

    想將文檔圖片轉(zhuǎn)換成 Markdown 格式?以往這任務(wù)需要文本識(shí)別、布局檢測(cè)和排序、公式表格處理、文本清洗等多個(gè)步驟—— 這次,只需
    的頭像 發(fā)表于 12-24 21:40 ?1663次閱讀
    OCR終結(jié)了?曠視提出可以<b class='flag-5'>文檔</b>級(jí)OCR的<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>大模型框架Vary,支持中英文,已開源!

    人工智能領(lǐng)域模態(tài)的概念和應(yīng)用場(chǎng)景

    隨著人工智能技術(shù)的不斷發(fā)展,模態(tài)成為了個(gè)備受關(guān)注的研究方向。模態(tài)技術(shù)旨在將不同類型的數(shù)據(jù)和信息
    的頭像 發(fā)表于 12-15 14:28 ?7255次閱讀

    ADC架構(gòu)的無(wú)采樣保持(SHA-less)結(jié)構(gòu)分析

    這種結(jié)構(gòu)依然存在些弊端, MDAC和子ADC的信號(hào)輸入路徑可能存在不匹配,也就是開關(guān)的RC時(shí)間常數(shù)的不匹配,導(dǎo)致在輸入頻率很高時(shí),可能導(dǎo)致采樣
    發(fā)表于 12-14 11:38 ?887次閱讀
    ADC架構(gòu)的<b class='flag-5'>無(wú)</b><b class='flag-5'>采樣</b>保持(SHA-less)<b class='flag-5'>結(jié)構(gòu)</b>分析

    大模型+模態(tài)的3實(shí)現(xiàn)方法

    我們知道,預(yù)訓(xùn)練LLM已經(jīng)取得了諸多驚人的成就, 然而其明顯的劣勢(shì)是不支持其他模態(tài)(包括圖像、語(yǔ)音、視頻模態(tài))的輸入和輸出,那么如何在預(yù)訓(xùn)練LLM的基礎(chǔ)上引入跨模態(tài)信息,讓其變得更強(qiáng)
    的頭像 發(fā)表于 12-13 13:55 ?1350次閱讀
    大模型+<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>的3<b class='flag-5'>種</b>實(shí)現(xiàn)<b class='flag-5'>方法</b>

    用語(yǔ)言對(duì)齊模態(tài)信息,北大騰訊等提出LanguageBind,刷新多個(gè)榜單

    目前的 VL 預(yù)訓(xùn)練方法通常僅適用于視覺(jué)和語(yǔ)言模態(tài),而現(xiàn)實(shí)世界中的應(yīng)用場(chǎng)景往往包含更多的模態(tài)信息,如深度圖、熱圖像等。如何整合和分析不同模態(tài)
    的頭像 發(fā)表于 11-23 15:46 ?562次閱讀
    用語(yǔ)言對(duì)齊<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b><b class='flag-5'>信息</b>,北大騰訊等提出LanguageBind,刷新多個(gè)榜單

    探究編輯模態(tài)大語(yǔ)言模型的可行性

    不同于單模態(tài)模型編輯,模態(tài)模型編輯需要考慮更多的模態(tài)信息。文章出發(fā)點(diǎn)依然從單模態(tài)模型編輯入手,
    發(fā)表于 11-09 14:53 ?399次閱讀
    探究編輯<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>大語(yǔ)言模型的可行性

    一種高效、靈巧的通信信號(hào)產(chǎn)生方法

    電子發(fā)燒友網(wǎng)站提供《一種高效、靈巧的通信信號(hào)產(chǎn)生方法.pdf》資料免費(fèi)下載
    發(fā)表于 11-07 09:54 ?0次下載
    <b class='flag-5'>一種</b>高效、靈巧的<b class='flag-5'>多</b>通信信號(hào)產(chǎn)生<b class='flag-5'>方法</b>

    一種利用幾何信息的自監(jiān)督單目深度估計(jì)框架

    本文方法一種監(jiān)督的單目深度估計(jì)框架,名為GasMono,專門設(shè)計(jì)用于室內(nèi)場(chǎng)景。本方法通過(guò)應(yīng)用視圖幾何的方式解決了室內(nèi)場(chǎng)景中幀間大旋轉(zhuǎn)和
    發(fā)表于 11-06 11:47 ?322次閱讀
    <b class='flag-5'>一種</b><b class='flag-5'>利用</b>幾何<b class='flag-5'>信息</b>的自<b class='flag-5'>監(jiān)督</b>單目深度估計(jì)框架

    基于一種電動(dòng)機(jī)網(wǎng)絡(luò)控制系統(tǒng)的設(shè)計(jì)方法

    電子發(fā)燒友網(wǎng)站提供《基于一種電動(dòng)機(jī)網(wǎng)絡(luò)控制系統(tǒng)的設(shè)計(jì)方法.pdf》資料免費(fèi)下載
    發(fā)表于 10-19 10:18 ?0次下載
    基于<b class='flag-5'>一種</b><b class='flag-5'>多</b>電動(dòng)機(jī)網(wǎng)絡(luò)控制系統(tǒng)的設(shè)計(jì)<b class='flag-5'>方法</b>

    基于視覺(jué)的模態(tài)觸覺(jué)感知系統(tǒng)

    傳統(tǒng)的模態(tài)/多任務(wù)觸覺(jué)感知系統(tǒng)通過(guò)集成多種傳感單元來(lái)達(dá)到模態(tài)觸覺(jué)信息的解耦,但其往往導(dǎo)致系統(tǒng)結(jié)構(gòu)
    發(fā)表于 10-18 11:24 ?708次閱讀
    基于視覺(jué)的<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>觸覺(jué)感知系統(tǒng)

    模態(tài)大模型最全綜述來(lái)了!

    其中最后個(gè)表示監(jiān)督信號(hào)是從圖像本身中挖掘出來(lái)的,流行的方法包括對(duì)比學(xué)習(xí)、非對(duì)比學(xué)習(xí)和masked image建模。在這些方法之外,文章也進(jìn)
    的頭像 發(fā)表于 09-26 16:42 ?2304次閱讀
    <b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>大模型最全綜述來(lái)了!

    DreamLLM:多功能模態(tài)大型語(yǔ)言模型,你的DreamLLM~

    由于固有的模態(tài)缺口,如CLIP語(yǔ)義主要關(guān)注模態(tài)共享信息,往往忽略了可以增強(qiáng)多模態(tài)理解的模態(tài)特定知識(shí)。因此,這些研究并沒(méi)有充分認(rèn)識(shí)到
    的頭像 發(fā)表于 09-25 17:26 ?609次閱讀
    DreamLLM:多功能<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>大型語(yǔ)言模型,你的DreamLLM~