GPT(LLM)不是AGI的全部

首頁 > 科技

GPT(LLM)不是AGI的全部

來源:神劇解說 釋出時間:2024-04-03 13:05

人工智慧領域正在如火如荼地發展,隨著諸如ChatGPT、Claude、Gemini、Sora和Grok等平臺的不斷湧現,AI技術和模型持續演進,引發人們對通用人工智慧(AGI)的濃厚興趣。

在這一備受關注的話題中,人們常常將GPT和AGI的概念混淆在一起。

有人稱讚GPT是新的工業革命,有人則認為當前的人工智慧技術已進入AGI時代或即將邁入。

儘管GPT系列模型憑藉出色的自然語言生成能力和廣泛的應用聲名鵲起,但我們不能忽視的是,GPT模型雖擅長處理大量文字資料和執行各種語言任務,但並非等同於通用人工智慧。

GPT展現的智慧只是人工智慧技術中的一小部分,其重點在語言理解與生成,而AGI則追求跨領域、多工的全面深厚智慧。

因此,理性地認識GPT與AGI之間的區別至關重要。

本文旨在探討當前最新人工智慧技術的成就,梳理和分析通用人工智慧的發展脈絡,儘管GPT備受矚目,卻並非AI通向AGI的全部旅程。

一、AGI全景梳理

當我們探索人工智慧的發展和前景時,總是會創造一些概念和名詞。而充分理解這些詞彙則是認識人工智慧的第一步。

這些名詞包括人工通用智慧(AGI)、窄人工智慧(ANI)、自然語言處理(NLP)、計算機視覺(CV)、大語言模型(LLM)、AIGC(生成式人工智慧)、GPT(生成式預訓練Transformer模型)、BERT(基於Transformer的雙向編碼)、Diffusion Models(擴散模型)、GANs(生成對抗網路)、Transformer、RNNs(迴圈神經網路)、CNNs(卷積神經網路)、ANN(人工神經網路)、Fine-tuning(微調)和PLHF(人類反饋的強化學習)等。

本小結將透過概念和實現兩個層面梳理他們之間的關係。

1. 概念層

AI是人工智慧(Artificial Intelligence)的簡稱,該概念最早是達特茅斯大學的一名年輕教授約翰-麥卡錫(John McCarthy)在1956年為研討會寫提案時創造的,後來被廣泛接受為描述一種由人類創造出來的技術,它模仿並擴充套件了人類智慧的各個方面,包括感知、學習、推理和決議計劃等。但長久以來AI概念只是描述人類的一種理想和目標,並無實際進展。

為進一步實現AI,學者和專家們根據其應用場景不同將AI的目標拆分為AGI和ANI兩種實現目標。

除了AGI和ANI兩個AI目標概念以外,根據人類的感官需求,AI的具體應用則主要體現在語言和視覺處理的兩大領域,即:NLP和CV。

當前最火爆的ChatGPT和Stable Diffustion就是AI在NLP和CV領域最為成功的兩款應用之一。而ChatGPT就是LLM的一種具體實現。

LLM:是指大規模型語言模型(Large Language Model)。隨著ChatGPT的成功,而廣為人知。是一種利用深度學習技術訓練的人工智慧系統,旨在理解、生成和翻譯人類語言。這些模型透過分析海量的文字資料來學習語言的結構、語法、語義及其使用上下文,從而能夠生成連貫、逼真的文字,回答問題,總結資訊,翻譯語言,甚至編寫程式碼。這裡需要特別指出大規模是指模型訓練過程中使用得的超大引數目,例如:ChatGPT-4訓練引數目大概是1750億個引數,而馬斯克剛剛開源的Grok-1引數目則為3140億個引數。不同於ANI領域中的自變數概念,這裡的引數是指透過神經網路運算的權重數量。因此大樣本或大資料量並不能被認為是大規模語言模型。同時,LLM是特指大規模語言模型,即便是大規模引數的ANI模型也不能稱為LLM,例如:華為盤古景象形象大模型並不是LLM,其只是採用Transformer架構的ANI模型。

最後我們要討論一個比較特殊的概念,即:生成式AI(Artificial Intelligence Generated Content,簡稱AIGC)。該概念並不是AGI概念的原生詞彙,而是國內學術造詞工廠的傑作。國內普遍認為AIGC是利用人工智慧技術自動建立文字、圖片、音樂、影片等內容的過程。包括但不限於自然語言生成(NLG)、計算機視覺、音訊合成和深度學習模型等領域。由於重複和含糊不清的定義,AIGC更像是把NLP、CV等重新包裝成產業應用,製造網際網路熱點的過程。

以上重點講解了關於人工智慧最近比較熱點的概念,但不是全部。之所以叫概念是因為這些名詞本身並無實際模型支援,只是利便人們歸類和理解的一種稱呼而已。接下來講解的具體AI工具則是有模型、架構和演算法支援,有實際實現意義的內容。

2. 實現層

為了便於理解,我將模型、架構和演算法歸統稱為實現層,因此首先出場的是當下最火的GPT模型。

1)GPT—生成式預訓練Transformer模型(Generative Pre-trained Transformer)

這是一種LLM也是NLP,由OpenAI開發。它基於Transformer架構,主要用於處理和生成自然語言,因此GPT並不能直接生成影象。GPT模型屬於深度學習的一部分,透過大量文字資料的預訓練,學會了語言的結構、語法、詞彙及其上下文之間的關係,使其能夠執行各種語言任務,如文字生成、翻譯、問答和摘要等。

其工作原理主要由預訓練和微調構成。

預訓練階段,GPT模型在大規模的文字資料集上進行訓練,目的是學習語言的一般特徵,比如詞彙、語法和語言使用的上下文關係,這一步驟讓模型能夠理解和生成語言的基本結構;

微調階段,模型透過在特定任務的資料上再次訓練,能夠在特定的應用場景中更加精準和高效。GPT模型的特點是其“生成能力”,即能夠基於給定的文字提示生成連貫、創新、多樣化的文字內容。這使得GPT模型不僅可以用於回答問題和參與對話,還能用於創作文章、編寫程式碼和更多創造性的任務。

在左圖中,首先使用的Transfomer架構開展預訓練;而在右圖則是對不同任務進行微調的輸入轉換。將所有結構化輸入轉換為Token序列,由預訓練模型處理,然後是Linear+softmax層處理。

微調(Fine-tuning)是深度學習中的一個重要概念,特別是在自然語言處理(NLP)、計算機視覺等領域的應用中。微調通常發生在預訓練模型的基礎上,目的是將這些通用模型調整為特定任務的專用模型。

2)BERT—基於Transformer的雙向編碼模型(Bidirectional Encoder Representations from Transformers)

這是一種同樣採用Transformer架構的自然語言處理(NLP)預訓練模型,由Google在2018年提出。它的核心創新之一是使用雙向Transformer編碼器來理解語言的上下文,這與之前的單向或部分雙向處理方法相比,能夠更準確地捕捉到詞語間的關係和語義。

從上圖可以看到,BERT使用雙向轉換器。OpenAI GPT使用從左到右的轉換器。ELMo使用獨立訓練的從左到右和從右到左的LSTM的級聯來生成下游任務的特徵。在這三種表示中,只有BERT表示在所有層中都以左右上下文為聯合條件。

除了架構差異之外,BERT和OpenAI GPT是微調方法,而ELMo是基於特徵的方法。雖然BERT也使用了大量的文字資料進行預訓練,能夠捕捉語言的深層語義和上下文關係,但其設計初衷主要是提高特定的NLP任務(如問答、命名實體識別、情感分析等)的效能,而不是“生成能力”。由於BERT的引數目大致在3.4億左右,因此一般不把BERT歸為LLM。

在自然語言處理(NLP)領域,除了著名的GPT系列和BERT之外,還有很多其他重要的模型和技術進展,例如:ELMo、RoBERTa、T5、XLNet和Grok-1採用的Mixture-of-Experts模型等,由於篇幅有限不一一介紹。

在計算機視覺(CV)領域,也是眾星璀璨,其中以Diffusion Models和GANs最為著名。

3)Diffusion Models—擴散模型

Diffusion Models同樣是生成模型,主要用於建立高質量、逼真的資料,如影象、音訊、文字等。這些模型的靈感來自物理學中的擴散過程,即物質從高濃度區域向低濃度區域移動。

Diffusion Models 透過以下兩個階段來生成資料,即:噪聲新增過程(向前擴散),噪聲去除過程(向後擴散)。

擴散過程是一個馬爾可夫鏈,它在取樣的相反方向上逐漸向資料新增噪聲,直到訊號被破壞。當擴散由少量高斯噪聲組成時,可以將取樣鏈轉換設定為條件高斯,從而實現特別簡單的神經網路引數化。

在具體訓練架構的實現方面Diffusion models 通常利用CNNs(卷積神經網路)作為其核心架構。這主要是因為卷積神經網路在處理影象資料方面的高效性和能力。

CNNs能夠從影象中自動學習和提取有用的特徵,這使得它們非常適合於影象相關的任務,如影象生成、影象分類、影象恢復等。

在Diffusion models的上下文中,CNNs被用來實現所謂的“去噪”步驟。在這一步驟中,模型試圖從部分加噪的資料中預測原始資料的乾淨版本。這個過程需要模型能夠理解影象中的複雜模式和結構,以便逐步消除噪聲並最終重建出清晰、高質量的影象。CNNs以其強大的空間特徵提取能力,非常適合這項任務。

當然,根據特定應用的需求,Diffusion models也可以整合其他型別的神經網路架構。例如,對於涉及序列資料(如文字或音訊)的生成任務,可以考慮使用RNNs(迴圈神經網路)或Transformer網路,這些網路能夠更好地處理序列之間的依賴關係。

最近的研究也開始探索將Transformer架構應用於Diffusion models中,尤其是在需要處理大量上下文資訊或長序列資料的場景。OpenAI最近釋出的Sora就是一種Transformer+Diffusion的訓練模型,其利用Transformer架構,對影片和影象的時空補丁進行編碼,實現在可變持續時間、解析度和寬高比的影片和影象上訓練文字條件擴散模型。

總的來說,雖然Diffusion models最初和最常用的架構是基於CNNs,但隨著技術的發展和研究的深入,其他型別的神經網路也被探索和應用,以提高模型的效能和適用性。

4)GANs—生成對抗網路(Generative Adversarial Networks)

GANs是一種由Ian Goodfellow於2014年提出的深度學習模型。GANs透過其獨特的訓練機制,在生成新資料樣本,尤其是影象生成領域,表現出了顯著的能力。GANs的核心思想是基於兩個相互競爭的網路:一個生成器(Generator)和一個判別器(Discriminator)。訓練過程涉及對這兩個網路進行交替訓練。首先,固定生成器,訓練判別器以最大化其區分真假樣本的能力。然後,固定判別器,更新生成器以最大化判別器的錯誤率。透過這種方式,生成器逐漸學會生成越來越逼真的資料。

這個過程像一個“偽造者”(生成器)試圖創造看起來真實的藝術品,和一個“鑑別者”(判別器)試圖區分藝術品是真是假的遊戲。隨著遊戲的進行,偽造者變得越來越擅長創造逼真的作品。它們都可以使用不同型別的神經網路架構。

上一篇:試驗火箭送快... 下一篇:原騰訊雲VP創...
猜你喜歡
熱門閱讀
同類推薦