91欧美超碰AV自拍|国产成年人性爱视频免费看|亚洲 日韩 欧美一厂二区入|人人看人人爽人人操aV|丝袜美腿视频一区二区在线看|人人操人人爽人人爱|婷婷五月天超碰|97色色欧美亚州A√|另类A√无码精品一级av|欧美特级日韩特级

0
  • 聊天消息
  • 系統(tǒng)消息
  • 評論與回復
登錄后你可以
  • 下載海量資料
  • 學習在線課程
  • 觀看技術視頻
  • 寫文章/發(fā)帖/加入社區(qū)
會員中心
創(chuàng)作中心

完善資料讓更多小伙伴認識你,還能領取20積分哦,立即完善>

3天內不再提示

用語言對齊多模態(tài)信息,北大騰訊等提出LanguageBind,刷新多個榜單

深度學習自然語言處理 ? 來源:機器之心 ? 2023-11-23 15:46 ? 次閱讀
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

在博士畢業(yè)就有10篇ACL一作的師兄指導下是種什么體驗

北京大學與騰訊等機構的研究者們提出了多模態(tài)對齊框架 ——LanguageBind。該框架在視頻、音頻、文本、深度圖和熱圖像等五種不同模態(tài)的下游任務中取得了卓越的性能,刷榜多項評估榜單,這標志著多模態(tài)學習領域向著「大一統(tǒng)」理念邁進了重要一步。

在現(xiàn)代社會,信息傳遞和交流不再局限于單一模態(tài)。我們生活在一個多模態(tài)的世界里,聲音、視頻、文字和深度圖等模態(tài)信息相互交織,共同構成了我們豐富的感知體驗。這種多模態(tài)的信息交互不僅存在于人類社會的溝通中,同樣也是機器理解世界所必須面對的挑戰(zhàn)。

如何讓機器像人類一樣理解和處理這種多模態(tài)的數(shù)據,成為了人工智能領域研究的前沿問題。

在過去的十年里,隨著互聯(lián)網和智能設備的普及,視頻內容的數(shù)量呈爆炸式增長。視頻平臺如 YouTube、TikTok 和 Bilibili 等匯聚了億萬用戶上傳和分享的視頻內容,涵蓋了娛樂、教育、新聞報道、個人日志等各個方面。如此龐大的視頻數(shù)據量為人類提供了前所未有的信息和知識。為了解決這些視頻理解任務,人們采用了視頻 - 語言(VL)預訓練方法,將計算機視覺和自然語言處理結合起來,這些模型能夠捕捉視頻語義并解決下游任務。

然而,目前的 VL 預訓練方法通常僅適用于視覺和語言模態(tài),而現(xiàn)實世界中的應用場景往往包含更多的模態(tài)信息,如深度圖、熱圖像等。如何整合和分析不同模態(tài)的信息,并且能夠在多個模態(tài)之間建立準確的語義對應關系,成為了多模態(tài)領域的一個新的挑戰(zhàn)。

為了應對這一難題,北大與騰訊的研究人員提出了一種新穎的多模態(tài)對齊框架 ——LanguageBind。與以往依賴圖像作為主導模態(tài)的方法不同,LanguageBind 采用語言作為多模態(tài)信息對齊的紐帶。

d09ea0e0-7ef0-11ee-939d-92fbcf53809c.png

論文地址:https://arxiv.org/pdf/2310.01852.pdf

GitHub 地址:https://github.com/PKU-YuanGroup/LanguageBind

Huggingface 地址:https://huggingface.co/LanguageBind

語言因其內在的語義豐富性和表現(xiàn)力,被賦予了整合和引導其他模態(tài)信息對齊的能力。在這個框架下,語言不再是附屬于視覺信息的標注或說明,而是成為了聯(lián)合視覺、音頻和其他模態(tài)的中心通道。

LanguageBind 通過將所有模態(tài)的信息映射到一個統(tǒng)一的語言導向的嵌入空間,實現(xiàn)了不同模態(tài)之間的語義對齊。這種對齊方法避免了通過圖像中介可能引入的信息損失,提高了多模態(tài)信息處理的準確性和效率。更重要的是,這種方法為未來的擴展提供了靈活性,允許簡單地添加新的模態(tài),而無需重新設計整個系統(tǒng)。

此外,該研究團隊構建了 VIDAL-10M 數(shù)據集,這是一個大規(guī)模、包含多模態(tài)數(shù)據對的數(shù)據集。

VIDAL-10M 涵蓋了視頻 - 語言、紅外 - 語言、深度 - 語言和音頻 - 語言配對,以確??缒B(tài)的信息是完整且一致的。通過在該數(shù)據集上進行訓練,LanguageBind 在視頻、音頻、深度和紅外等 15 個廣泛的基準測試中取得了卓越的性能表現(xiàn)。

d0c06144-7ef0-11ee-939d-92fbcf53809c.png

d0e06b6a-7ef0-11ee-939d-92fbcf53809c.png

方法介紹

在多模態(tài)信息處理領域,主流的對齊技術,如 ImageBind,主要依賴圖像作為橋梁來實現(xiàn)不同模態(tài)之間的間接對齊。這種方法在對其他模態(tài)和語言模態(tài)的對齊上可能會導致性能次優(yōu)化,因為它需要兩步轉換過程 —— 首先是從目標模態(tài)到圖像模態(tài),然后是從圖像模態(tài)到語言模態(tài)。這種間接對齊可能導致語義信息在轉換過程中的衰減,從而影響最終的性能表現(xiàn)。

d1075824-7ef0-11ee-939d-92fbcf53809c.png

針對這一問題,該團隊提出了一種名為 LanguageBind 的多模態(tài)語義對齊預訓練框架。該框架摒棄了依賴圖像作為中介的傳統(tǒng)模式,而是直接利用語言模態(tài)作為不同模態(tài)之間的紐帶。語言模態(tài)因其天然的語義豐富性,成為連接視覺、音頻、深度等模態(tài)的理想選擇。LanguageBind 框架通過利用對比學習機制,將不同模態(tài)的數(shù)據映射到一個共享的語義嵌入空間中。在這個空間里,不同模態(tài)的信息可以直接進行語義層面的理解與對齊。

d126bd86-7ef0-11ee-939d-92fbcf53809c.png

LanguageBind 概覽圖

具體而言,LanguageBind 通過錨定語言模態(tài),采用一系列優(yōu)化的對比學習策略,對多模態(tài)數(shù)據進行預訓練。這一過程中,模型學習將來自不同模態(tài)的數(shù)據編碼到與語言模態(tài)相兼容的表征中,確保了模態(tài)間的語義一致性。這種直接的跨模態(tài)語義對齊避免了傳統(tǒng)方法中的性能損失,同時提高了模型在下游多模態(tài)任務中的泛化能力和適用性。

LanguageBind 框架的另一個優(yōu)點是其擴展性。由于直接使用語言作為核心對齊模態(tài),當引入新的模態(tài)時,無需重構整個對齊機制,只需通過相同的對比學習過程,將新模態(tài)的數(shù)據映射到已經建立的語言導向嵌入空間。這使得 LanguageBind 不僅適用于現(xiàn)有的模態(tài),也能輕松適應未來可能出現(xiàn)的新模態(tài),為多模態(tài)預訓練技術的發(fā)展奠定了堅實基礎。

數(shù)據集介紹

在跨模態(tài)預訓練領域,數(shù)據集的構建及其質量對于預訓練模型的性能與應用效能具有決定性影響。傳統(tǒng)的多模態(tài)數(shù)據集大多局限于二模態(tài)或三模態(tài)的配對數(shù)據,這種限制導致了對更豐富模態(tài)對齊數(shù)據集的需求。

因而,該團隊開發(fā)了 VIDAL-10M 數(shù)據集,這是一個創(chuàng)新的五模態(tài)數(shù)據集,包含了視頻 - 語言(VL)、紅外 - 語言(IL)、深度 - 語言(DL)、音頻 - 語言(AL)等數(shù)據對。每個數(shù)據對都經過了精心的質量篩選,旨在為跨模態(tài)預訓練領域提供一個高品質、高完整性的訓練基礎。

d15ec6e0-7ef0-11ee-939d-92fbcf53809c.png

VIDAL-10M 數(shù)據集示例

VIDAL-10M 數(shù)據集的構建主要包括三步:

視覺相關搜索詞庫構建。設計一種創(chuàng)新的搜索詞獲取策略,該策略綜合利用了各類視覺任務數(shù)據集中的文本信息,如標簽和標題,以構建一個豐富視覺概念且多樣化的視頻數(shù)據集,從而增強了數(shù)據多樣性和覆蓋度。

視頻和音頻數(shù)據的收集、清洗與篩選:在數(shù)據的收集過程中,該研究采取了基于文本、視覺和音頻內容的多種過濾機制,這些機制確保收集到的視頻和音頻數(shù)據與搜索詞高度相關,并且滿足高標準的質量要求。這一步驟是確保數(shù)據集質量的關鍵環(huán)節(jié),它直接影響模型訓練的效果和后續(xù)任務的性能。

紅外、深度模態(tài)數(shù)據生成與多視角文本增強。此階段,利用多種先進的生成模型技術合成了紅外和深度模態(tài)數(shù)據,并對文本內容進行了多角度的生成和增強。多視角文本增強包括了標題、標簽、關鍵幀描述、視頻概要等多個維度,它為視頻內容提供了全面且細致的描述,增強了數(shù)據的語義豐富性和描述的細粒度。

d1b74ffe-7ef0-11ee-939d-92fbcf53809c.png

VIDAL-10M 數(shù)據集的構建過程

實驗

LanguageBind 框架被應用于多個模態(tài)的零樣本分類任務,并與其他模型進行了性能比較。實驗結果顯示,LanguageBind 方法在包括視頻、音頻、深度圖像、熱成像等多模態(tài)數(shù)據上的 15 個零樣本分類與檢索任務中均展示了顯著的性能提升。這些實驗成果強調了 LanguageBind 方法在理解和處理不同模態(tài)數(shù)據中的潛在能力,尤其是在沒有先前樣本可供學習的情況下。為了更深入地了解 LanguageBind 方法的性能,可以參照以下詳細的實驗結果。

表 2 顯示,LanguageBind 的性能在 MSR-VTT 上超過 VideoCoca 和 OmniVL ,盡管僅使用 300 萬個視頻 - 文本對。

d1ddf640-7ef0-11ee-939d-92fbcf53809c.png

在兩個經典數(shù)據集 MSR-VTT 和 MSVD 上進行的零樣本視頻 - 文本檢索實驗結果如表 3 所示:

d1fe8842-7ef0-11ee-939d-92fbcf53809c.png

該研究還將本文模型與 SOTA 多模態(tài)預訓練模型 OpenCLIP、ImageBind 在多模態(tài)理解任務上進行了比較,結果如表 4 所示:

d220c326-7ef0-11ee-939d-92fbcf53809c.png

表 5 比較了在 Clotho 數(shù)據集和 Audiocaps 數(shù)據集上的零樣本文本 - 音頻檢索性能:

d23bc054-7ef0-11ee-939d-92fbcf53809c.png

聲明:本文內容及配圖由入駐作者撰寫或者入駐合作網站授權轉載。文章觀點僅代表作者本人,不代表電子發(fā)燒友網立場。文章及其配圖僅供工程師學習之用,如有內容侵權或者其他違規(guī)問題,請聯(lián)系本站處理。 舉報投訴
  • 圖像
    +關注

    關注

    2

    文章

    1096

    瀏覽量

    42331
  • 模型
    +關注

    關注

    1

    文章

    3752

    瀏覽量

    52112
  • 智能設備
    +關注

    關注

    5

    文章

    1159

    瀏覽量

    53437
  • 數(shù)據集
    +關注

    關注

    4

    文章

    1236

    瀏覽量

    26201

原文標題:用語言對齊多模態(tài)信息,北大騰訊等提出LanguageBind,刷新多個榜單

文章出處:【微信號:zenRRan,微信公眾號:深度學習自然語言處理】歡迎添加關注!文章轉載請注明出處。

收藏 人收藏
加入交流群
微信小助手二維碼

掃碼添加小助手

加入工程師交流群

    評論

    相關推薦
    熱點推薦

    格靈深瞳模態(tài)大模型榮登InfoQ 2025中國技術力量年度榜單

    靈感實驗室聯(lián)合LLaVA社區(qū)發(fā)布的模態(tài)大模型LLaVA-OneVision-1.5,實現(xiàn)了訓練數(shù)據、代碼和模型權重的全鏈路開源,在多項公開模態(tài)基準上表現(xiàn)優(yōu)于同等規(guī)模的Qwen2.5
    的頭像 發(fā)表于 01-05 10:05 ?513次閱讀

    模態(tài)感知大模型驅動的密閉空間自主勘探系統(tǒng)的應用與未來發(fā)展

    ? ? 模態(tài)感知大模型驅動的密閉空間自主勘探系統(tǒng) ? ?北京華盛恒輝模態(tài)感知大模型驅動的密閉空間自主勘探系統(tǒng),是融合
    的頭像 發(fā)表于 12-29 11:27 ?302次閱讀

    格靈深瞳模態(tài)大模型Glint-ME讓圖文互搜更精準

    在電商、安防場景下,圖文互搜應用廣泛。隨著以CLIP為代表的模態(tài)表征方法相繼提出,過去單一模態(tài)搜索(文搜文、圖搜圖)被突破,模型可以同時
    的頭像 發(fā)表于 11-02 15:56 ?1720次閱讀
    格靈深瞳<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>大模型Glint-ME讓圖文互搜更精準

    亞馬遜云科技上線Amazon Nova模態(tài)嵌入模型

    Embeddings模態(tài)嵌入模型現(xiàn)已在Amazon Bedrock上線,這是一款專為Agentic RAG與語義搜索應用打造的頂尖模態(tài)嵌入模型。該模型是首個通過單一模型支持文本、
    的頭像 發(fā)表于 10-29 17:15 ?267次閱讀
    亞馬遜云科技上線Amazon Nova<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>嵌入模型

    商湯日日新V6.5模態(tài)大模型登頂全球權威榜單

    根據權威評測平臺OpenCompass模態(tài)大模型學術榜單(Multi-modal Academic Leaderboard)最新數(shù)據顯示,商湯「日日新 V6.5」(SenseNova-V6.5
    的頭像 發(fā)表于 09-10 09:55 ?800次閱讀

    米爾RK3576部署端側模態(tài)輪對話,6TOPS算力驅動30億參數(shù)LLM

    加載 → 圖片預處理 → 用戶交互 → 推理輸出”的核心流程,支持圖文一體的模態(tài)對話,適配輪問答、視覺問答典型場景。 具體運行機制可拆解為以下步驟:1. 模型初始化首先加載大
    發(fā)表于 09-05 17:25

    淺析模態(tài)標注對大模型應用落地的重要性與標注實例

    ”的關鍵工序——模態(tài)標注重要性日益凸顯。 一、什么是模態(tài)標注? 模態(tài)標注是指對文本、圖像、
    的頭像 發(fā)表于 09-05 13:49 ?2286次閱讀

    潤和軟件榮登2025模態(tài)AI大模型排行榜單

    近日,《互聯(lián)網周刊》聯(lián)合eNET研究院、德本咨詢、中國社會科學院信息化研究中心共同發(fā)布了“2025模態(tài)AI大模型”榜單。江蘇潤和軟件股份有限公司(以下簡稱“潤和軟件”)自主研發(fā)的“潤
    的頭像 發(fā)表于 06-25 14:37 ?1690次閱讀

    Matter 智能家居的通用語言

    Matter由連接標準聯(lián)盟(CSA)創(chuàng)建,旨在解決智能家居的互操作性問題。Matter 基于簡單性、互操作性、可靠性和安全性四大核心原則 。 是采用基于 IP 應用層的開源協(xié)議,本質上是一種“通用語言
    發(fā)表于 05-19 15:35

    愛芯通元NPU適配Qwen2.5-VL-3B視覺模態(tài)大模型

    熟悉愛芯通元NPU的網友很清楚,從去年開始我們在端側模態(tài)大模型適配上一直處于主動緊跟的節(jié)奏。先后適配了國內最早開源的模態(tài)大模MiniCPM V 2.0,上海人工智能實驗室的書生
    的頭像 發(fā)表于 04-21 10:56 ?3154次閱讀
    愛芯通元NPU適配Qwen2.5-VL-3B視覺<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>大模型

    基于MindSpeed MM玩轉Qwen2.5VL模態(tài)理解模型

    模態(tài)理解模型是讓AI像人類一樣,通過整合多維度信息(如視覺、語言、聽覺),理解數(shù)據背后的語義、情感、邏輯或場景,從而完成推理、決策
    的頭像 發(fā)表于 04-18 09:30 ?3027次閱讀
    基于MindSpeed MM玩轉Qwen2.5VL<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>理解模型

    移遠通信智能模組全面接入模態(tài)AI大模型,重塑智能交互新體驗

    隨著千行百業(yè)數(shù)智化進程的不斷加速,模態(tài)AI大模型的應用需求不斷攀升,圖像、語音、視頻多樣化的交互方式正逐漸成為推動行業(yè)變革的新動力。 ? 3月20日,全球物聯(lián)網整體解決方案供應商移遠通信宣布,其
    發(fā)表于 03-21 14:12 ?534次閱讀
    移遠通信智能模組全面接入<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>AI大模型,重塑智能交互新體驗

    移遠通信智能模組全面接入模態(tài)AI大模型,重塑智能交互新體驗

    隨著千行百業(yè)數(shù)智化進程的不斷加速,模態(tài)AI大模型的應用需求不斷攀升,圖像、語音、視頻多樣化的交互方式正逐漸成為推動行業(yè)變革的新動力。3月20日,全球物聯(lián)網整體解決方案供應商移遠通信宣布,其全系
    的頭像 發(fā)表于 03-20 19:03 ?827次閱讀
    移遠通信智能模組全面接入<b class='flag-5'>多</b><b class='flag-5'>模態(tài)</b>AI大模型,重塑智能交互新體驗

    商湯“日日新”融合大模型登頂大語言模態(tài)榜單

    據弗若斯特沙利文(Frost & Sullivan, 簡稱“沙利文”)聯(lián)合頭豹研究院發(fā)布的《2025年中國大模型年度評測》結果顯示:在語言模態(tài)核心能力測評中,商湯“日日新”融合大模型斬獲國內第一梯隊成績。
    的頭像 發(fā)表于 03-18 10:35 ?1144次閱讀

    ?模態(tài)交互技術解析

    模態(tài)交互 模態(tài)交互( Multimodal Interaction )是指通過多種感官通道(如視覺、聽覺、觸覺)或多種交互方式(如語音
    的頭像 發(fā)表于 03-17 15:12 ?4406次閱讀