蘋果大模型殺入場:300億引數、多模態、MoE架構,超半數作者是華人

首頁 > 科技

蘋果大模型殺入場:300億引數、多模態、MoE架構,超半數作者是華人

來源:生活裡的創意 釋出時間:2024-03-15 18:03

蘋果大模型殺入場:300億引數、多模態、MoE架構,超半數作者是華人

蘋果也在搞自己的大型多模態基礎模型,未來會不會基於該模型推出相應的文生圖產品呢?我們拭目以待。

今年以來,蘋果顯然已經加大了對生成式人工智慧(GenAI)的重視和投入。此前在 2024 蘋果股東大會上,蘋果 CEO 蒂姆・庫克表示,今年將在 GenAI 領域實現重大進展。此外,蘋果宣佈放棄 10 年之久的造車專案之後,一部分造車團隊成員也開始轉向 GenAI。

如此種種,蘋果向外界傳達了加註 GenAI 的決心。目前多模態領域的 GenAI 技術和產品非常火爆,尤以 OpenAI 的 Sora 為代表,蘋果當然也想要在該領域有所建樹。

今日,在一篇由多位作者署名的論文《MM1: Methods, Analysis & Insights from Multimodal LLM Pre-training》中,蘋果正式公佈自家的多模態大模型研究成果 —— 這是一個具有高達 30B 引數的多模態 LLM 系列。

論文地址:https://arxiv.org/pdf/2403.09611.pdf

該團隊在論文中探討了不同架構元件和資料選擇的重要性。並且,透過對影象編碼器、視覺語言聯結器和各種預訓練資料的選擇,他們總結出了幾條關鍵的設計準則。具體來講,本文的貢獻主要體現在以下幾個方面。

首先,研究者在模型架構決策和預訓練資料選擇上進行小規模消融實驗,並發現了幾個有趣的趨勢。建模設計方面的重要性按以下順序排列:影象解析度、視覺編碼器損失和容量以及視覺編碼器預訓練資料。

其次,研究者使用三種不同型別的預訓練資料:影象字幕、交錯影象文字和純文字資料。他們發現,當涉及少樣本和純文字效能時,交錯和純文字訓練資料非常重要,而對於零樣本效能,字幕資料最重要。這些趨勢在監督微調(SFT)之後仍然存在,這表明預訓練期間呈現出的效能和建模決策在微調後得以保留。

最後,研究者構建了 MM1,一個引數最高可達 300 億(其他為 30 億、70 億)的多模態模型系列, 它由密集模型和混合專家(MoE)變體組成,不僅在預訓練指標中實現 SOTA,在一系列已有多模態基準上監督微調後也能保持有競爭力的效能。

具體來講,預訓練模型 MM1 在少樣本設定下的字幕和問答任務上,要比 Emu2、Flamingo、IDEFICS 表現更好。監督微調後的 MM1 也在 12 個多模態基準上的結果也頗有競爭力。

得益於大規模多模態預訓練,MM1 在上下文預測、多影象和思維鏈推理等方面具有不錯的表現。同樣,MM1 在指令調優後展現出了強大的少樣本學習能力。

方法概覽:構建 MM1 的秘訣

構建高效能的 MLLM(Multimodal Large Language Model,多模態大型語言模型) 是一項實踐性極高的工作。儘管高層次的架構設計和訓練過程是清晰的,但是具體的實現方法並不總是一目瞭然。這項工作中,研究者詳細介紹了為建立高效能模型而進行的消融。他們探討了三個主要的設計決策方向:

架構:研究者研究了不同的預訓練影象編碼器,並探索了將 LLM 與這些編碼器連線起來的各種方法。

資料:研究者考慮了不同型別的資料及其相對混合權重。

訓練程式:研究者探討了如何訓練 MLLM,包括超引數以及在何時訓練模型的哪些部分。

消融設定

由於訓練大型 MLLM 會耗費大量資源,研究者採用了簡化的消融設定。消融的基本配置如下:

影象編碼器:在 DFN-5B 和 VeCap-300M 上使用 CLIP loss 訓練的 ViT-L/14 模型;影象大小為 336×336。

視覺語言聯結器:C-Abstractor ,含 144 個影象 token。

預訓練資料:混合字幕影象(45%)、交錯影象文字文件(45%)和純文字(10%)資料。

語言模型:1.2B 變壓器解碼器語言模型。

為了評估不同的設計決策,研究者使用了零樣本和少樣本(4 個和 8 個樣本)在多種 VQA 和影象描述任務上的效能:COCO Cap tioning 、NoCaps 、TextCaps 、VQAv2 、TextVQA 、VizWiz 、GQA 和 OK-VQA。

模型架構消融試驗

研究者分析了使 LLM 能夠處理視覺資料的元件。具體來說,他們研究了(1)如何以最佳方式預訓練視覺編碼器,以及(2)如何將視覺特徵連線到 LLM 的空間(見圖 3 左)。

影象編碼器預訓練。在這一過程中,研究者主要消融了影象解析度和影象編碼器預訓練目標的重要性。需要注意的是,與其他消融試驗不同的是,研究者本次使用了 2.9B LLM(而不是 1.2B),以確保有足夠的容量來使用一些較大的影象編碼器。

編碼器經驗:影象解析度的影響最大,其次是模型大小和訓練資料組成。如表 1 所示,將影象解析度從 224 提高到 336,所有架構的所有指標都提高了約 3%。將模型大小從 ViT-L 增加到 ViT-H,引數增加了一倍,但效能提升不大,通常不到 1%。最後,加入 VeCap-300M (一個合成字幕資料集)後,在少樣本場景中效能提升超過了 1%。

視覺語言聯結器和影象解析度。該元件的目標是將視覺表徵轉化為 LLM 空間。由於影象編碼器是 ViT,因此其輸出要麼是單一的嵌入,要麼是一組與輸入影象片段相對應的網格排列嵌入。因此,需要將影象 token 的空間排列轉換為 LLM 的順序排列。與此同時,實際的影象 token 表徵也要對映到詞嵌入空間。

VL 聯結器經驗:視覺 token 數量和影象解析度最重要,而 VL 聯結器的型別影響不大。如圖 4 所示,隨著視覺 token 數量或 / 和影象解析度的增加,零樣本和少樣本的識別率都會提高。

預訓練資料消融試驗

通常,模型的訓練分為兩個階段:預訓練和指令調優。前一階段使用網路規模的資料,後一階段則使用特定任務策劃的資料。下面重點討論了本文的預訓練階段,並詳細說明研究者的資料選擇(圖 3 右)。

有兩類資料常用於訓練 MLLM:由影象和文字對描述組成的字幕資料;以及來自網路的影象 - 文字交錯文件。表 2 是資料集的完整列表:

上一篇:郵政儲蓄銀行... 下一篇:放心借逾期多...
猜你喜歡
熱門閱讀
同類推薦