深入聊聊開源AI及其未來的挑戰

首頁 > 科技

深入聊聊開源AI及其未來的挑戰

來源:娛樂當家 釋出時間:2023-06-09 16:00

深入聊聊開源AI及其未來的挑戰

作者 | Lum Ramabaja

譯者 | 核子可樂

策劃 | 劉燕

從 AI 的價值說起

固然我堅信開源 AI 將繼承蓬勃發展,但也認定企業和政府會在未來幾年內進一步加強對新型神經網路架構和技術的應用限制。在本文中,我們將一同猜測和展望未來十年間 AI 可能帶來的潛伏顛覆,提出一些建議和方案匡助開源社群適應這個佈滿挑戰的未來。

猜測未來絕非易事,這裡提出的不少猜測也許永遠不會實現,甚至朝著截然相反的方向前進。但我以為這樣的思索仍有重要意義,將匡助我們主動適應不斷變化的新世界。跟著整個時代的快速推進,這種設想並規畫新階段下新形勢的能力將變得越來越重要。

在不久的將來,人與人之間的互動方式、交換價值和介入勞動的方式,甚至是整個社會的組織結構都將發生根本性變化。到那時,也許每個人都將擁有自己的個性化 AI 實體,我個人稱之為“魂靈”(Ghost);這些實體彼此相連,就構成了 AI 系統的全球網路。它們將為人類提供諸多服務,而不同於以往的功能性助手,人類更多應該將其視為自身的認知延伸。企業和組織可能也會擁有自己的“魂靈”,藉此在成員之間達成高效協作。

除了社交之外,具有輪迴連線的聯想記憶網路可能將為 AI 系統賦予記憶。這些獨立的“魂靈”甚至可能發展出自己的身份。另外,利用共鳴演算法的 AI 系統也有可能實現,進而產生去中心化的自主 AI。儘管這樣的未來徹底來臨,但我們已經能夠預見到由此展開的一系列經濟動向。

AI 天生服務的交換價值,將即是提供服務所需要的能量(即執行相關模型的本錢),再加上 AI 在市場中的資訊不對稱程度。使用 AI 執行相對簡樸的服務必然對應較低的交換價值,從而導致 AI 所有者的剩餘價值維持在低位。

這種趨勢將極大影響以服務為基礎的經濟體系,預計大多數現有服務的剩餘價值都將大幅衰減。因此預計在未來一段時間內,很多西方國家的民眾和政府都將像 19 世紀的勒德分子那樣對技術抱有強烈的牴觸情緒、甚至是敵意。受到跨部門收益遞減的影響,世界上很多地區將透過壟斷許可策略和獨裁劃定等方式阻礙 AI 的普及。

不外世界上還有更多積極接納 AI 提高的地區,開源 AI 很可能會在交換價值低但使用價值高的服務上(即可由 AI 執行的相對簡樸服務)在這裡蓬勃發展。與之對應,那些模型機能的微小改進即可對應價值明顯晉升的服務,將迎來截然不同的經濟激勵形式。對於此類服務,預計贏家通吃將繼承佔據主流,意味著更進步前輩的 AI 系統將持續提供更多的剩餘價值。

因此,分享技術和模型架構立異的動力將有所下降。但請留意,體系內對剩餘價值的榨取只會在參與者間存在價值不對稱時才會發生。在 AI 的背景下,這種不對稱很可能會體現在資訊層面,即控制和限制他人獲取資訊和知識的能力。

參與者之間的資訊不對稱可能是政府強制管控的結果(例如智慧財產權、許可、訪問控制等);消解這種資訊不對稱需要採取政治步履,已非純粹的技術手段所能解決。然而,技術本身同時也將削減因資源不對稱所引發的資訊不對稱。

具體來講,如今的人工神經網路通常以密集方式進行練習,意味著一旦提供輸入,網路內的所有單元均會被啟用。對於 transformer 這類架構(即 ChatGPT 等大語言模型的技術基礎),傳播資訊的計算成本極為高昂,主要體現在其中的“自注意力”環節上。計算複雜度越高,對應的能量消耗也就越大。

因為練習大語言模型(LLM)需要大量資源,所以預計“贏家通吃”類 AI 系統的開發和治理將首先由少部分閉源實體所主導。出於經濟念頭,這些實體會將模型權重和架構作為專有資產,嚴格保密能為其帶來更強的盈利能力。

遺憾的是,這種資源限制導致研究職員、非營利組織和初創公司等小規模實體因無法承擔高昂的能源本錢,而幾乎不可能從零開始練習自己的大語言模型。因此,目前大部分開源大語言模型均是對現有模型進行微調,這種方法本錢更低且耗能更少。基於這樣的動態,我們最明智的決議計劃應該是保持開源 AI 在質量上始終具有競爭力,藉此降低深度學習模型規模化練習和執行帶來的本錢。

稀疏啟用張量

面對經濟念頭失衡、高強度大語言模型練習帶來的誇張能耗、以及 AI 控制權的日益集中,我們 Open Cybernetics 意識到必需採取更加積極主動的態度。為資料集建立類似 GPL 的尺度,恰是開源 AI 社群向前邁出的重要一步。但必需承認,無版權運動還不足以抵禦這個十年內即將泛起的顛覆性經濟和政治氣力。

相反,必需藉助新的技術和協議來實現社會經濟權力的動態性轉變。面對這個題目,我力推“稀疏啟用張量”概念及其對等空間的協同作用。我們將在未來的工作中不斷探索如何構建具備模型中立性的稀疏啟用張量資料結構。

在本文中,我將簡樸先容其基本理念、技術開發的底層原理,以及對開源社群及其他領域的影響。簡樸來講,稀疏啟用張量就是能夠以稀疏方式檢索並更新自身狀態的資料結構。為了更好地理解其深層含義,讓我們先從一個簡樸示例入手。

圖一:什麼是嵌入層。

嵌入層可被看作基於一對一對映原理執行的稀疏啟用張量。也就是說:嵌入層由 token 列表(例如單詞)以及包含相應嵌入的權重矩陣組成。語料庫中使用的每個詞,都將被分配給權重矩陣中的一行,從而建立詞到嵌入的對映(參見圖一)。這些嵌入隨後會作為神經網路的輸入。嵌入層之所以能被視為稀疏啟用張量,是因為它滿意此類資料結構的兩個相關尺度:

嵌入可以透過資料庫進行有效檢索,無需將整個張量載入至記憶體中即可進行稀疏檢索。

嵌入能以稀疏方式更新。在透過嵌入層的反射傳播期間,僅須調整與所用 token 相關的權重,其餘嵌入將被排除在更新步驟之外。

固然一對一對映方法在單詞等離散 token 情況下確有價值,但卻無法在連續輸入中正常起效。例如,一個 28 x 2828 x 28 的影象塊中包含巨量潛伏畫素組合,根本不可能建立一對一對映的嵌入層。但我們將在後文討論,使用多對一對映的方法同樣能獲得類似結果。嵌入檢索和稀疏啟用張量之間的邏輯聯絡也將變得顯而易見。

考慮這樣一個情況,我們有一個歸一化矩陣 WK,它由儲存模式和一個歸一化輸入 I 組成(詳見圖二)。在 I 和 WK之間執行點積,本質上相當於檢查 WK中的各列並確定哪個列向量與 I 更相似。所得到的 K 向量表示 I 和 WK 的每一列之間的餘弦相似度。K 得分越高,則表示輸入與相應列之間的相似度越高。

圖二:K 中的值代表 Wk 的列與 I 的相似度。

結合 softmasx 啟用函式,附加權重矩陣 WV和標量引數β來調節 softmax 分佈的強度,我們就能將 I 與給定輸出 O 聯絡關係起來(參見圖三)。softmax 運算的結果分佈決定了 Wv 矩陣中的各些行會被賦予更高權重。這樣的神經網路層配置,通常被稱為現代 Hopfield Lookup 層。它使用一組預定的可學習模式的加權乞降,在連續輸入和輸出嵌入之間建立聯絡關係。

圖三:現代 Hopfield Lookup 層。

大家可能已經發現,從 I 到 O 的轉換需要大量計算。這還只是一部分,tarnsformers 中的自注意力步驟需要消耗更多算力。如圖四所示,tarnsformer 的自注意力步驟要用到 3 個矩陣:查詢(Q)、鍵(K)和值(V)矩陣,再加上 softmax 函式。請留意,步驟中的 dk項與β在圖三示例中的作用相似。

圖四:transformer 中的自注意力機制。為了簡樸起見,這裡省略了多頭元件以及編碼器的層歸一化和殘差連線。

為了匯出查詢、鍵和值矩陣,首先要計算大量不必要的餘弦相似度。具體來講,這些點積運算中的很大一部分對自注意力步驟的輸出嵌入並沒有明顯貢獻。換言之,Q、K 和 V 中的大多數數值往往顯著小於 1。儘管如此,之所以要在輸入 I 與 WQ、WK、WV各列進行比較,就是由於我們事先並不知道會產生最高餘弦相似度的權重矩陣有著怎樣的特定內部模式。這種先驗知識的缺乏會增加 transformer 的相關練習本錢,迫使我們不得不在整個 Q 和 K 矩陣之間進行點積運算。

為了凸起當前 AI 系統中資訊檢索過程的低效題目,讓我們考慮以下場景:我們有一個大型資料庫,但願執行一項簡樸查詢。目前 AI 系統需要載入和遍歷記憶體中的整個資料庫,才能檢索與我們查詢相對齊的少數匹配項,而根本不會利用索引記實。可以看到,像 transformer 這種聯絡關係記憶網路的資訊傳播方式極為低效,而潛伏的解決方案有如下兩種。第一,透過修改注意力機制來使用機器學習方法,藉此減少計算需求。這方面嘗試在 Linformer 和 Performer 等專案中均有體現。或者,我們也可以考慮在不改變底層模型架構的情況下,引入資料庫系統的設計原則。

比如說,我們知道可以在 I 和權重矩陣之間執行效率更高的近似 K 最近鄰(kNN)查詢,這就避免了載入或遍歷整個張量。這種方法可以明顯降低大語言模型的計算需求,進而省下大量能源。有趣的是,部門大語言模型已經開始採用這種技術。例如,Memrizing Transformer 就在向量資料庫上以更高效的近似 kNN 查詢來使用外部暫存器。這些使用向量資料庫的大語言模型,通常會在後臺使用 HNSW 演算法。

與資料庫進行類比,“稀疏檢索”的概念相當於具有預索引的權重,無需遍歷整個資料庫即可實現記實檢索(即已儲存的模式)。然而,目前能利用向量資料庫的 transformer 還僅限於在推理階段執行近似 kNN 查詢。換言之,模型練習階段仍只能以算力密集方式進行,因此對應大量能源消耗。為了促進大規模神經網路的集體練習,必需將模型權重的同時更新轉化為稀疏更新。透過設計這種包含稀疏檢索和稀疏更新的神經構建塊,我們將為開源 AI 社群做出貢獻,克服資源限制導致的資訊不對稱題目。

“魂靈”的密碼學證實

作為緩解資源限制的有效策略,開源 AI 社群中的部門研究職員已經開始利用受信對等協作來推理和微調大語言模型。例如,Petals 等專案就在使用基於 Kadelia 的分散式雜湊表,在去中心化的節點網路中傳播神經流動。透過這種方法,Petals 使用者能夠在多個節點間分配練習和推理任務,而不再依靠單一機器載入整個大語言模型。透過共同介入練習過程,這些分散式節點擴充套件了其單打獨鬥所無法實現的能力。

固然這些系統實用性出眾,但還缺少還原當前對等 AI 專案的一個樞紐組成部分:對抗環境中的無信任機制。要想在 Petals 這類系統中執行前向傳播,就要求人們必需充分信任網路中的其他節點。換句話說,任何惡意節點都能返回實際上並非源自模型的輸出。固然這種侷限性沒有徹底擊潰協作研究的遠景,但的確已經阻礙了對等 AI 系統在現實世界中的廣泛應用。

這就是稀疏啟用張量施展明顯上風的第二個用例。除了能源效率更高之外,稀疏啟用張量還具有必要屬性,能夠在對等 AI 網路中實現前向和後向傳播的密碼學安全。現在,讓我們簡樸觀察 Merkle 樹資料結構,瞭解這一切是怎樣實現的。

Merkle 樹是一種二叉樹資料結構,用於安全驗證列表中的值是否存在,且不必向另一方提供列表中的每個值。要建立 Merkle 樹,列表中的每個值都須使用加密雜湊函式進行雜湊處理,進而產生葉節點。之後,透過雜湊將這些葉節點組合起來形成非葉父節點。重複這個過程,直至抵達二叉樹的根(詳見圖五)。

上一篇:b·體育(中國)... 下一篇:Siri 還有未...
猜你喜歡
熱門閱讀
同類推薦