語言模型的前世今生與GPT的人生哲學

首頁 > 科技

語言模型的前世今生與GPT的人生哲學

來源:沒蠟筆的小新 釋出時間:2023-07-12 17:51

語言模型的前世今生與GPT的人生哲學

任何一個系統都有自己的第一性原理,是一個根基性命題或假設,不能預設,也不能被違反。

——亞里士多德《第一哲學》

GPT的革命,當然不止是生產力。

“今天的GPT和過去的AI很不一樣,今天我們與GPT聊天時,經常有一種強烈的以為它是人的感覺,而且是一個很智慧、正在進化的人。”李志飛篤定地表達直覺判定。

大模型的迅猛發展讓AI走在歷史性的奇點,未來畢竟走向何方?為什麼AGI的路上,非大模型不可?

欲探究未來,先回溯過去。太陽底下從來沒有新鮮事,今天大語言模型壓縮即智慧的思惟,早已寫在1948年夏農的資訊理論,而今天的大模型只是做工程化的實踐。今天ChatGPT的勝利,是機率論的勝利,也是貝葉斯定理的勝利。只有迴歸原理的洞悉,才能預見未來的進化路徑。

從AI的發展歷程來看,模型和演算法是其不斷成長的核心驅動力。什麼是語言模型,語言模型如何一步步走到今天,方法演進的過程中解決了什麼題目,又帶來哪些新的題目。縱觀語言模型的演進,你會發現今天大語言模型GPT的勝利,是刻在偶爾中的必然。

近日,李志飛在混沌大會上發表演講,以“一”思維的方式探求本質,將語言模型的過去、現在和未來漸漸鋪展,透過歷史的脈搏,抽絲剝繭地梳理了語言模型的前世今生——我們從哪裡來,我們是誰,我們要到哪裡去?我們在捫心叩問這一謎底時,也在思索本日人類所處的位置。

GPT這麼努力,就是為了增加對next token猜測的確定性,為了熵減; 而人類這麼努力,是為了對抗熵增,增加對未來的確定性,也是為了熵減;大模型本質上在追求的底層邏輯,也是人類遵循的“第一性原理”,並不斷進行實踐。

假如未來的智慧體能夠透過建模影片等多模態的無監視方式學習,將會非常高效。如果它們能夠跟物理世界直接互動,從Agent到多Agent互動,它們將能夠比人類學習更多,並且進化速度更快。“今天的GPT仍是山頂洞人,還非常的孤傲,但在未來的世界Agent一定是無處不在的,多Agent互動會改變一切。”李志飛表示。

而未來會如何博弈,還取決於GPT擁有怎樣的世界觀、價值觀和人生觀,它僅僅是世界的倒影,仍是有了自主意識?假如這些智慧體變得比人類更智慧,將會發生什麼?

Matt Ridley在其著作《理性樂觀派:人類經濟提高史》中提到:始於十多萬年前的交換和專業分工習慣,創造出了以加速趨勢改善現狀的集體大腦,澎湃的創新能力更讓人類戰勝了許多在當時看來難以躲過的災禍。

對於人類的未來,是理性樂觀,仍是如辛頓般隱憂——假設田雞創造了人類,那麼你以為現在誰會佔據主動權,是人,仍是田雞?

以下為演講內容梳理。

一、過去的語言模型

ChatGPT的泛起,讓“語言模型”忽然走到臺前,成為一個全民爆火的詞彙,而10年前“語言模型”是隻有自然語言處理某一細分研究方向的人才會學習的內容,它作為一個後臺系統存在,並不為大眾所熟知。但實在,早在大語言模型GPT泛起之前,人們天天都在大量接觸和使用著語言模型。

好比輸入法,當我們輸入一個詞,如何給出對下一個詞的公道建議,就是語言模型的典型應用之一。好比搜尋,當我們在搜尋框輸入文字的時候,會得到一些搜尋建議,其應用的也是語言模型。甚至使用Google Translate、語音助手時,其背後的語音識別系統都會用到語言模型。語言模型可謂無處不在。

那麼什麼是語言模型?猶如物理模型是對物理世界的建模,用以理解和描述物理世界的本質;語言模型則是對語言世界的建模,透過構建詞彙或短語之間的關聯性,來理解和描述人類語言的本質。好比在物理世界中,經典的物理模型——牛頓第二定律,F=MA,是用一種非常量化和形式化的方法來描述力的作用效果。同樣地,語言模型也具有量化和形式化表示的特性

語言模型主要用來做什麼?簡樸來說,語言模型主要做三件事。

一是判定一句話是否符合人類語言習慣。假如將一句話拋給語言模型,它會判定這句話是否符合中文或英文的使用習慣。如大家寫郵件時,所碰到的語法糾錯提示,其用到的就是語言模型。

二是猜測下一個詞,賦能語言應用。好比只給出一句話的前幾個字,語言模型就可以根據語言規律來猜測後面的字是什麼,如輸入法和今天的ChatGPT,就是基於語言模型猜測下一個詞的應用。

三是作為打分函式對多個候選謎底進行打分排序。語言模型廣泛用於語音識別、機器翻譯、OCR等任務中,將幾種候選的語句結果,交給語言模型來打分排序,語言模型則會系統性地給出一個最優的謎底。其中,語音識別、機器翻譯是語言模型用得最高階、最複雜的地方,由於系統有指數級多的謎底,對謎底打分需要用到複雜的動態規劃演算法。

舉兩個例子。假如語音識別模型給出兩個可能的結果,分別為“你的賬單分六期來還”和“你的賬單分六七來還”,這時候語言模型要做的事情,就是選擇其中一個準確選項。顯然它會選第一個,由於更加符合人類自然語言習慣。

假如機器翻譯將一句英文翻譯為中文,得到“我在晚上8點的時候完成了工作”和“我完成了工作在晚上8點”兩種不同的翻譯結果。其中第二種是按照英文語序進行翻譯的,而第一種是重新打亂順序翻譯的,很顯然它選擇第一個作為更優的謎底,這就是語言模型的價值所在。

語言詞彙的世界浩瀚如海,從量化的角度表達,語言模型是一種用於計算“一段文字”可能性的機率模型。把一段文字看作是一串時間軸上的單詞序列,語言模型的任務即計算該文字泛起的機率。

假如學過基本的聯合機率和前提機率,以下就非常容易理解了。

上一篇:訊息稱華為有... 下一篇:富士康之後,...
猜你喜歡
熱門閱讀
同類推薦