AIGC大一統模型來了!CV界泰斗黃煦濤創立團隊提出“全能Diffusion”

首頁 > 科技

AIGC大一統模型來了!CV界泰斗黃煦濤創立團隊提出“全能Diffusion”

來源:韓劇集合處 釋出時間:2022-11-29 16:01

  新智元報道  

編纂:好睏 David

【新智元導讀】在各種Diffusion「AI大畫家」中學習一番之後,這款全能型Diffusion要完成AIGC界的「大一統」!

Diffusion模型的最新進展在很多天生任務中樹立了一個令人印象深刻的里程碑。諸如DALL·E 2、Imagen和Stable Diffusion(SD)等引人矚目的工作,引起了學術界和工業界的極大愛好。

不外,固然這些模型表現驚豔,但基本都是專一於某一類任務,好比由給定文字天生影象,而對於不同型別的任務,則往往需要專門單獨練習,或重新構建新模型。

那麼能不能在前人基礎上搞一個「全能型」的Diffusion,實現AIGC模型的大一統呢?有人就在努力沿著這個方向進行探索,並已經取得了進展。

這個來自伊利諾伊大學厄巴納-香檳分校、得克薩斯大學奧斯汀分校的聯合團隊,試圖將現有的單流Diffusion擴充套件為多流網路,稱為Versatile Diffusion(VD),這是第一個同一的多流多模態Diffusion框架,是邁向通用天生性人工智慧的一步。

論文地址:https://arxiv.org/abs/2211.08332

Versatile Diffusion除了普通的文字天生影象功能之外,還可以輸入影象天生類似影象,輸入影象天生文字,輸入文字天生相似文字,圖片語義解耦編纂,輸入影象及文字天生影片,根據隱空間編纂影象內容等等。

未來的版本還將支援更多的模式,如語音、音樂、影片和3D。

據論文先容,現已證實VD及其基礎框架具有以下上風:

a) 可以以具有競爭力的高質量處理所有子任務。

b) 支援新的擴充套件和應用,如圖形風格和語義的分離、影象-文字雙引導天生等。

c) 透過這些實驗和應用,為天生的輸出提供了更豐碩的語義洞察力。

在練習資料集方面,VD使用帶有自定義資料過濾器的Laion2B-en作為主要資料集。

首次探索

VD的一個令人興奮的發現是,它可以從語義中增強或減少影象風格,而無需進一步監視。

這樣的現象激發作者去探索一個全新的領域,其中,風格和語義之間的分離可以發生在具有任意風格和任意內容的影象上。

作者表示,他們是第一個探索:a)在沒有領域規範的情況下,對天然影象的語義和風格進行解讀;b)擴散模型潛伏空間上的語義和風格分解的團隊。

在下圖中,作者首先天生輸入影象的變體,然後以語義(左邊)或風格(右邊)為重點對其進行操縱。

因為VD同時支援影象到文字和文字到影象,因此作者團隊第一次嘗試了透過以下步驟從文字提示的角度編纂影象:a)將影象轉換成文字,b)編纂文字,c)將文字轉換回影象。

在實驗中作者從影象中刪除了描述的內容,然後用這種影象-文字-影象(I2T2I)正規化新增新的內容。與繪畫或其他需要物體位置作為輸入的影象編輯方法不同,VD的I2T2I不需要掩碼,由於它可以按照指令自動定位和替代物體。

不外,I2T2I的輸出影象與輸入影象的畫素不一致,這是因為影象到文字的語義提煉和文字到影象的內容建立造成的。

在下圖的展示中,輸入的影象首先被翻譯成prompt,然後用減法(紅框)和加法(綠框)對prompt進行編纂。最後,編纂後的prompt被翻譯成影象。

此外,他們也是第一個探索基於給定的文字去天生相似文字的團隊。

上一篇:網友口中那個... 下一篇:當年此人差點...
猜你喜歡
熱門閱讀
同類推薦