手機也能跑!微軟27億小模型擊敗Llama 2

首頁 > 科技

手機也能跑!微軟27億小模型擊敗Llama 2

來源:寵物養成 釋出時間:2023-12-26 11:45

作者 | 程茜

編輯 | 李水青

智東西12月13日報道,昨日晚間,微軟又亮出了小模型大招!

微軟釋出了27億引數規模的小語言模型Phi-2,經研究人員測試,Phi-2在引數規模小於130億的模型中展示了最提高前輩效能

從效能表現看,Phi-2在Big Bench Hard(BBH)、常識推理、語言理解、數學和編碼基準測試中,其平均效能得分已經超過70億、130億引數規模的Mistral和Llama 2,在部分基準測試中超過谷歌的Gemini Nano 2

Phi-2還有一大優勢是,因為引數規模足夠小,其可以在膝上型電腦、手機等移動裝置上執行。

過去幾個月間,微軟研究院的機器學習基礎團隊陸續釋出了小型語言模型(SLM)Phi系列。

其中,第一個模型為13億引數規模的Phi-1,官方部落格稱,Phi-1在SLM中的Python編碼方面表現最好,在HumanEval和MBPP基準測試上尤甚。第二個模型為13億引數規模的Phi-1.5,這個模型的重點為常識推理和語言理解能力。

現在微軟釋出的Phi-2能為研究人員探索機器可解釋性、安全性改進或對各種任務的微調實驗上提供幫助,目前,Phi-2已經從Azure AI Studio模型目錄中開放給研究人員。

一、96塊A100 GPU訓練14天,引數規模僅27億

一些大模型的引數規模達到數千億的量級,使得其湧現出眾多新興能力,那麼,是否可以透過改變訓練策略等方式讓更小的引數實現這些能力?微軟的小型語言模型(SLM)系列或許是這一問題的答案。

Phi-2是一個基於Transformer架構的模型,具有下一個單詞預測目標,在用於NLP和編碼的合成數據集和Web資料集的混合上多次傳遞的1.4T tokens上進行訓練。

Phi-2在96個A100 GPU上訓練了14天,作為一個基礎模型,其沒有透過人類反饋強化學習(RLHF)進行對齊,也沒有進行指令微調。

儘管如此,與經過調整的現有開源模型Llama 2-7B相比,研究人員觀察到在避免生成有攻擊性、有害和內容有偏差方面Phi-2的表現也不差。

研究人員根據ToxiGen的13個人口統計資料計算的安全評分,他們選擇6541個句子的子集,並根據困惑度和句子“毒性”進行0到1之間的評分。分數高就說明,模型產生有攻擊性、有害句子的可能性較小。

▲Llama 2與Phi-2在生成有攻擊性、有害和內容有偏差方面效能比較(圖源:微軟官方部落格)

微軟使用Phi-2打破了傳統語言模型縮放定律,其中有兩個關鍵環節:

第一是訓練資料的質量對模型的效能至關重要。微軟的模型訓練資料包含專門建立的合成數據集,用於教授模型常識推理,還包括科學、心理等領域的常識。

研究人員還挑選了一些網路資料進一步擴充訓練語料庫,並基於內容的價值和質量進行了資料過濾。

此外,從13億引數規模的Phi-1.5開始,微軟的研究人員實現了規模化的知識轉移,將Phi-1.5的知識嵌入到27億引數的Phi-2中。這種方法不僅加速了訓練收斂,而且提高了Phi-2的基準分數。

▲Phi-2和Phi-1.5比較(圖源:微軟官方部落格)

二、基準測試擊敗Llama 2、Mistral、Gemini Nano 2

微軟總結了Phi-2在學術基準上與主流語言模型的效能表現對比。

其基準測試涵蓋Big Bench Hard(BBH資料集)以及PIQA、WinoGrande、ARC easy、Challenge、SIQA的常識推理、HellaSwag、OpenBookQA、MMLU、SQuADv2的語言理解資料集,GSM8k數學資料集和HumanEval、MBPP的編碼資料集等。

27億引數規模的Phi-2,在BBH、常識推理、語言理解、數學、編碼各項基準測評上都超過了70億、130億引數規模的Mistral和Llama 2。

相比於引數規模差距在25倍的700億引數Llama 2,Phi-2在編碼、數學等多步推理任務上表現更好。

▲Llama 2、Mistral、Phi-2效能比較(圖源:微軟官方部落格)

此外,微軟還比較了Phi-2與谷歌最近釋出的Gemini Nano 2,谷歌釋出的模型引數規模為32.5億,Phi-2的效能表現部分優於Gemini Nano 2。

▲Phi-2、Gemini Nano 2效能比較(圖源:微軟官方部落格)

考慮到一些公共基準測試的資料可能會洩漏到訓練資料中,微軟對第一個模型Phi-1進行了廣泛的淨化研究以排除這種可能性。

基於判斷語言模型的最佳方法是在具體用例上對其進行測試的考量,研究人員使用了多個微軟內部專有資料集和任務評估了Phi-2,並再次將其與Mistral和Llama 2進行比較,其結果為,平均而言Phi 2優於Mistral-7B,後者優於70億、130億、730億引數規模的Llama-2模型

除了基準測試外,研究人員還測試了社群內的一些常用提示,他們觀察到的表現也與基準測試的結果預期一致。

其中,研究人員測試了用於評估谷歌Gemini Ultra模型在解決物理問題方面能力的問題。

上一篇:適合發朋友圈... 下一篇:基金認購失敗...
猜你喜歡
熱門閱讀
同類推薦