Meta連夜加入AI大模型混戰!用1/10引數目幹過GPT-3,單個GPU就能跑

首頁 > 科技

Meta連夜加入AI大模型混戰!用1/10引數目幹過GPT-3,單個GPU就能跑

來源:追夢娛樂圈 釋出時間:2023-02-27 10:13

智東西(公眾號:zhidxcom

編譯 | 程茜

編輯 | 心緣

智東西2月25日報道,圍繞生成式AI的前沿技術競爭愈發膠著。就在昨晚,Meta溘然公佈了一款全新的AI大型語言模型LLaMA,宣稱可幫助研究人員降低生成式AI工具可能帶來的“偏見、有毒評論、產生錯誤資訊的可能性”等問題。

此前在最新季度財報電話會議中,Meta CEO扎克伯格提到“生成式AI”的次數比“元宇宙”還要多。如今,Meta帶來了一個利好研究學者的前沿AI重磅成果——僅用約1/10的引數規模,實現了匹敵OpenAI GPT-3、DeepMind Chinchilla、谷歌PaLM等主流大模型的效能表現。

Meta介紹LLaMA論文

論文連結:

https://research.facebook.com/publications/llama-open-and-efficient-foundation-language-models/

Meta目前提供有70億、130億、330億和650億四種引數規模的LLaMA模型。

根據論文,在一些基準測試中,僅有130億引數的LLaMA模型,效能表現超過了擁有1750億引數的GPT-3,而且能跑在單個GPU上;擁有650億引數的LLaMA模型,能夠跟擁有700億引數的Chinchilla、擁有5400億引數的PaLM“競爭”。

要知道,GPT-3是AI聊天機器人ChatGPT背後大模型GPT-3.5的前代,GPT-3.5的引數目也高達1750億;而谷歌驅動對話式AI應用Bard進行搜尋查詢的模型,引數目比5400億還要多。

這是大模型研究邁出的重要一步!隨著技術持續最佳化,未來有朝一日,你也許能在自己的膝上型電腦乃至手機上跑類ChatGPT功能的語言模型。

扎克伯格說,LLaMA“在生成文字、進行對話、總結書面材料以及解決數學定理或預測蛋白質結構等更復雜的任務方面表現出了很大的潛力”

扎克伯格Facebook貼文

值得一提的是,Meta宣佈LLaMA基礎大型語言模型“開源”,不作商用目的,免費供給研究人員。目前Meta在GitHub上提供了精簡版LLaMA。

GitHub地址: https://github.com/facebookresearch/llama

一、擁有70-650億引數,20種語言訓練

LLaMA作為一種基礎大型語言模型,相比於GPT-3等模型,其可以讓開發人員使用更少的計算能力和資源來進行測試。

目前,科技巨頭玩家在大型語言模型領域開展軍備競賽,並且有多個成果面世。但研發人員在執行此類大模型時往往需要大量的資源投入,導致部分開發人員並不能全面研究訪問這些模型。

而這種限制就會阻礙人員去理解這些模型的工作模式和功能,並且使得他們在調整模型的偏見、發生錯誤的可能性上會較為困難。

作為一個基礎模型,LLaMA不是為特定任務而設計,Meta研究人員透過標記一些Tokens等來訓練基礎模型,其優勢在於更容易針對特定潛在產品應用進行再訓練和微調。

不同於Chinchilla、PaLM、GPT-3等大模型,LLaMA只使用公開可用的資料集進行訓練,其中包括開放資料平臺Common Crawl、英文文件資料集C4、程式碼平臺GitHub、維基百科、論文預印本平臺ArXiv等。專案成員稱,這是為了使其工作與開源相容和可復現。

總體來看,整個訓練資料集在標記化後大約包含1.4萬億個Tokens。

其中,擁有650億引數的LLaMA和擁有330億引數的LLaMA使用1.4萬億Tokens進行訓練,最小的擁有70億引數的LLaMA在1萬億Tokens上進行了訓練。

擁有不同引數的模型與訓練損失的關係圖

與其他大型語言模型一樣,LLaMA的工作原理是將一系列Tokens作為輸入,並預測下一個單詞以遞迴生成文字,Meta使用了20種語言對其進行訓練。

此外,大型語言模型中還可能會遇到生成偏見、不良資訊、不實資訊的風險,基於共享LLaMA的程式碼,其他開發人員可以測試限制或消除大型語言模型中這些問題的方法。

二、7項AI能力,不輸業界主流大模型

在測試過程中,研究人員採用0-shot和1-shot、5-shot、64-shot幾種方式,將LLaMA與GPT-3、Gopher、Chinchilla等模型進行了比較。

尤其值得一提的是,130億引數LLaMA模型在單個GPU上執行時,效能表現可能超過1750億引數GPT-3。這也許會給類ChatGPT產品跑在消費級硬體上開啟新的大門。

1、常識推理(Common Sense Reasoning)

LLaMA涵蓋了八個標準常識性資料基準,包括BoolQ、PIQA等。這些資料集包括完形填空、多項選擇題和問答等。

結果顯示,擁有650億引數的LLaMA在BoolQ以外的所有報告基準上均超過擁有700億引數的Chinchilla。同時,除BoolQ和WinoGrande外,該模型測試中均超過擁有5400億引數的PaLM。

擁有130億引數的LLaMA模型在大多數基準測試上也優於擁有1750億引數的GPT-3。

上一篇:蘋果AR頭顯或... 下一篇:9點1氪:京東...
猜你喜歡
熱門閱讀
同類推薦