視覺AI能力大一統!影象自動檢測分割,可控文生圖,來自華人團隊

首頁 > 科技

視覺AI能力大一統!影象自動檢測分割,可控文生圖,來自華人團隊

來源:子非魚 釋出時間:2023-04-10 15:11

明敏 發自 凹非寺

量子位 | 公眾號 QbitAI

現在AI圈確實到了拼手速的時候啊。

這不,Meta的SAM剛剛推出幾天,就有國內程式猿來了波buff疊加,把目標檢測、分割、生成幾大視覺AI功能all in one!

比如基於Stable Diffusion和SAM,就能讓照片中的椅子無縫換成沙發:

換裝、換髮色也是so easy:

專案一經發布就讓不少人驚呼:手速也太快了吧!

還有人表示:我和新垣結衣的新結婚照有了。

如上就是Gounded-SAM帶來的效果,專案在GitHub上已攬星1.8k。

簡單來說,這就是一個zero-shot視覺應用,只需要輸入圖片,就能自動化檢測和分割影象。

該研究來自IDEA研究院(粵港澳大灣區數字經濟研究院),創始人兼理事長為沈向洋。

無需額外訓練

Grounded SAM主要由Grounding DINO和SAM兩個模型組成。

其中SAM(Segment Anything)是4天前Meta剛剛推出的零樣本分割模型。

它可以為影象/影片中的任何物體生成mask,包括訓練過程中沒出現過的物體和影象。

透過讓SAM對於任何提示都返回有效的mask, 能夠讓模型在即使提示是模糊的或者指向多個物件的情況下,輸出也應該是所有可能中一個合理的mask。這一任務用於預訓練模型並透過提示解決一般的下游分割任務。

模型框架主要由一個影象編碼器、一個提示編碼器和一個快速mask解碼器組成。在計算影象嵌入後,SAM能夠在50毫秒內根據web中的任何提示生成一個分割。

Grounding DINO是該研究團隊已有的成果。

這是一個零樣本檢測模型,能夠生成帶有文字描述的物體box和標籤。

上一篇:華為“親兒子”... 下一篇:GPT、大語言...
猜你喜歡
熱門閱讀
同類推薦