如何高效部署大模型?CMU最新萬字綜述縱覽LLM推理MLSys最佳化技術

首頁 > 科技

如何高效部署大模型?CMU最新萬字綜述縱覽LLM推理MLSys最佳化技術

來源:焦糖老乾媽 釋出時間:2024-01-13 13:35

如何高效部署大模型?CMU最新萬字綜述縱覽LLM推理MLSys最佳化技術

機器之心專欄

機器之心編輯部

近日,CMU Catalyst 團隊推出了一篇關於高效 LLM 推理的綜述,覆蓋了 300 餘篇相關論文,從 MLSys 的研究視角介紹了演算法創新和系統最佳化兩個方面的相關進展。

在人工智慧(AI)的快速發展背景下,大語言模型(LLMs)憑藉其在語言相關任務上的傑出表現,已成為 AI 領域的重要推動力。然而,隨著這些模型在各種應用中的普及,它們的複雜性和規模也為其部署和服務帶來了前所未有的挑戰。LLM 部署和服務面臨著密集的計算強度和巨大的記憶體消耗,特別是在要求低延遲和高吞吐量的場景中,如何提高 LLM 服務效率,降低其部署成本,已經成為了當前 AI 和系統領域亟需解決的問題。

來自卡內基梅隆大學的 Catalyst 團隊在他們的最新綜述論文中,從機器學習系統(MLSys)的研究視角出發,詳細分析了從前沿的 LLM 推理演算法系統的革命性變革,以應對這些挑戰。該綜述旨在提供對高效 LLM 服務的當前狀態和未來方向的全面理解,為研究者和實踐者提供了寶貴的洞見,幫助他們克服有效 LLM 部署的障礙,從而重塑 AI 的未來。

論文連結:https://arxiv.org/abs/2312.15234

該論文的第一作者是卡內基梅隆大學的 Xupeng Miao(苗旭鵬)博士後研究員,合作者還包括 Tianqi Chen 和 Zhihao Jia 助理教授。此外,其他學生作者也均來自於 CMU Catalyst Group 實驗室,該實驗室由 Zhihao Jia 與 Tianqi Chen(陳天奇)在 CMU 共同主持,致力於整合來自於機器學習演算法、系統、硬體等多方面的最佳化技術,構造自動化的機器學習系統。此前,該實驗室還推出了 SpecInfer, MLC-LLM, SpotServe [ASPLOS‘24] 等開源專案,推進 LLM 大模型相關係統的研究和應用。實驗室主頁:https://catalyst.cs.cmu.edu。

綜述概覽

該綜述系統地審視了現有 LLM 推理技術,覆蓋了 300 餘篇相關論文,從演算法創新系統最佳化兩個方面展開介紹。論文以此為基礎,對現有工作設計了一套清晰且詳盡的分類法,突出了各種方法的優勢和侷限性,逐類別蒐集整理並介紹了每種方法的相關論文。除此之外,論文還對當前的主流 LLM 推理框架在系統設計與實現方面進行了深入的對比和分析。最後,作者對未來如何繼續提高 LLM 推理效率進行了展望,在技術層面提出了六大潛在發展方向

分類法

演算法創新

這一節對提出的各種演算法和技術進行了全面分析,旨在改進大規模 Transformer 模型推理的原生效能缺陷,包括解碼演算法架構設計、和模型壓縮等等。

解碼演算法:在這一部分中,我們回顧了在圖 2 中展示的幾種 LLMs 推理最佳化過程的新穎解碼演算法。這些演算法旨在減少計算複雜度,並提高語言模型推理在生成任務中的總體效率,包括:

非自迴歸解碼:現有 LLMs 的一個主要限制是預設的自迴歸解碼機制,它逐個順序生成輸出 token。為解決這一問題,一種代表性的工作方向是非自迴歸解碼 [97, 104, 108,271],即放棄自迴歸生成正規化,打破單詞依賴並假設一定程度的條件獨立性,並行解碼輸出 token。然而,儘管這類方法解碼速度有所提高,但大多數非自迴歸方法的輸出質量仍不如自迴歸方法可靠。

投機式推理:另一類工作是透過投機執行思想 [47] 實現並行解碼。自迴歸 LLM 推理過程中的每個解碼步驟都可以被視為帶有條件分支的程式執行語句,即決定接下來生成哪個 token。投機式推理 [51, 155] 先使用較小的草稿模型進行多步解碼預測,然後讓 LLM 同時驗證這些預測以實現加速。然而,將投機解碼應用於 LLMs 時仍然存在一些實際挑戰,例如,如何使解碼預測足夠輕量且準確,以及如何藉助 LLMs 實現高效的並行驗證。SpecInfer [177] 首次引入基於 tree-based speculative decoding 和 tree attention,並提出了一個低延遲 LLM 服務系統實現,該機制也被後續多個工作 [48, 118, 168, 185, 229, 236, 274, 310] 直接採用。

提前退出:這類方法主要利用 LLMs 的深層多層結構,在中間層提前推出推理,中間層輸出可以透過分類器轉化成輸出的 token,從而降低推理開銷 [117, 147, 163, 167, 234, 272, 282, 291, 308],它們也被稱為自適應計算 [68, 219]。

級聯推理:這類方法級聯了多個不同規模的 LLM 模型,用於分別處理不同複雜度的推理請求,代表性工作包括 CascadeBERT [157] 和 FrugalGPT [53]。

架構設計:

配置縮小:直接縮小模型配置。

注意力簡化:最近出現了很多研究工作,它們主要是將之前的長序列高效注意力機制 [240] 應用在 LLM 上,以縮短上下文,減少 KV 快取,以及注意力複雜度,同時略微降低解碼質量(如滑動視窗 [129, 299]、雜湊 [198]、dilated [74]、動態選擇等等)。表 1 中總結了一些近期的熱門方法和之前的工作之間的對應關係。

啟用共享:這類方法主要是透過共享 attention 計算的中間啟用來降低推理記憶體開銷,代表性工作包括 MQA [220] 和 GQA [32]。

條件計算:這類方法主要是指稀疏專家混合模型(Sparse MoE),比如最近大火的 Mistrial 7Bx8 模型就屬於此類。

迴圈單元:儘管 Transformer 已經替代了 RNN 模型,但考慮到注意力機制的二次複雜性,人們始終未曾放棄將 recurrent unit 機制重新引入 LLM 的嘗試,比如 RWKV [200]、RetNet [235],以及狀態空間模型 [91, 102, 103, 176] 等等。

模型壓縮:

知識蒸餾:這類方法以大型的教師模型為監督,訓練一個小型的學生模型。大多數之前的方法都在探索白盒蒸餾 [106, 133, 214, 233, 255],需要訪問整個教師模型的引數。由於基於 API 的 LLM 服務(如 ChatGPT)的出現,一些黑盒蒸餾模型吸引了很多關注 [238,59, 273, 201, 313],這些模型通常具有更少的模型引數,與原始 LLMs(如 GPT-4 [195])相比,在各種下游任務上表現出了相當的效能。

網路剪枝:過去幾年中,網路剪枝方法 [180, 215, 215] 已被廣泛研究,但並非所有方法都可以直接應用於 LLMs,需要考慮重新訓練可能帶來的過高計算成本,以及評估剪枝是否可以在底層系統實現上取得效率提升。大致上可以分為結構化剪枝 [80, 149, 174, 216, 172] 和半結構化稀疏化 [40, 87, 232, 251, 276] 等。

系統最佳化

本節研究 LLM 推理系統最佳化技術,以加速 LLM 推理,而不改變 LLM 計算語義。這一工作的目標是透過改進用於大型語言模型推理的底層系統和框架來提高系統效率,包括低位元量化、平行計算、記憶體管理、請求排程、和核心最佳化等等,詳細內容可以參見論文原文。

軟體框架

論文還對一些目前最先進的基於 GPU 的開源 LLM 推理系統進行了深入的分析,並從多個方面總結了它們在設計與實現傷的差異。

未來方向

專用硬體加速器的發展:生成型 LLM 服務效率的顯著提升可能在很大程度上依賴於專用硬體加速器的發展和提升,尤其是軟硬協同設計方法。例如,讓記憶體單元更加接近處理單元,或是針對 LLM 演算法資料流最佳化晶片架構,這些硬體最佳化可以在很大程度上為 LLM 推理在軟體層面帶來便利和機會。

高效有效的解碼演算法:開發更高效的解碼演算法可以顯著提高服務效率。受對實時應用更快生成速度的需求驅動,一個有前途的方向是廣義的投機式推理(generalized speculative inference),不僅會帶來顯著加速,同時保持相同的生成質量。正如 SpecInfer 中所指出的,廣義的投機式推理中,用於生成草稿 token 的小模型可以被替換為任何快速的 token 生成方法,比如自定義函式、召回方法、甚至早停機制和非自迴歸解碼等等。

長上下文 / 序列場景最佳化:隨著應用場景變得更加複雜,處理更長的上下文或序列的需求不斷增長。服務長序列負載的 LLM 需要解決演算法和系統兩方面的挑戰。在演算法方面,它們依然面臨長度泛化失效問題,甚至可能出現 “loss in the middle” 的情況。目前的解法主要是透過召回增強、序列壓縮和快取來儘可能縮短序列長度並儲存相關資訊。

探索替代基礎架構:儘管 Transformer 模型和自注意力機制目前主導著 LLM 領域,但探索替代架構是未來研究的一個有前景的方向。例如,一些最新研究探索了無注意力方法,使用純 MLP(多層感知機)架構來替代注意力機制,可能會改變目前 LLM 推理最佳化的格局。

在複雜環境中的部署探索:隨著 LLM 應用的擴充套件,探索並最佳化它們在各種複雜環境中的部署成為一個關鍵的未來方向。這一探索不僅限於傳統的基於雲的部署,還包括邊緣計算、混合計算(cloud+edge)、去中心化計算以及廉價的可搶佔資源等。

特定需求的自動適應:應用特定需求的多樣性創造了一系列創新的 LLM 服務最佳化機會,例如模型微調(parameter-efficient fine-tuning)、向量資料庫檢索、多模態負載等等。這些獨特的挑戰也要求將 LLM 服務技術自動且順利地整合到現有 IT 基礎設施中,將最佳化空間擴充套件到整個 LLM 生命週期。

總結

總的來說,該綜述不僅是對當前 LLM 服務最佳化研究的全面概述,也為未來在這一領域的探索和發展指明瞭方向。透過深入瞭解這些先進的解決方案,研究者和實踐者可以更好地理解和應對在實際應用中部署大型語言模型時面臨的挑戰。

上一篇:家是舒適而溫... 下一篇:蘋果釋出Visi...
猜你喜歡
熱門閱讀
同類推薦