
LLMEVAL-1中文大模型評測的正式結果已經發布!在過去的一個月中,共有2186位使用者參與評測,提交了總計24.3萬個評測結果。此外,LLMEVAL還利用GPT 4 API進行了5.75萬次自動評測。本次評測涵蓋了17個大類、453個問題,包括事實性問答、閱讀理解、框架生成、段落重寫、摘要、數學解題、推理、詩歌生成、程式設計等各個領域。目前LLMEVAL正在撰寫詳細的分析報告,並計劃投稿EMNLP 2023中。評測問題和各個參評系統的回答結果已經上傳至https://github.com/llmeval/llmeval-1。
六月底之前,LLMEVAL將上傳本次評測的所有資料,包括公眾使用者評測結果、眾包使用者評測結果、GPT 4評測結果以及人工分項評測結果。
自2022年以來,大量不同型別的大模型評測方法相繼湧現。然而,為了利便進行自動化評測,目前的評測方法主要採用選擇題或者依賴GPT-4進行評估。雖然選擇題能夠利便進行自動化處理,但其無法有效評估大模型最為關鍵的生成能力,僅在一定程度上反映模型的知識覆蓋範圍。儘管GPT-4的自動評測模型可以對文字生成能力進行評估,但LLMEVAL仍缺乏大規模資料對比分析,無法確定其結果與人工評測之間的實際差距。
LMEVAL系列評測旨在系統研究大模型評價方法,並試圖回答以下幾個關鍵問題:
問題一:應該從哪些方面評測大模型?
在大模型系統的研發中,通常遵循著3H原則:Helpful(資訊量)、Honest(正確性)和Harmlessness(無害性)。為了更準確地評估這些原則,LLMEVAL將其細化為了5個評分項,分別是:正確性、流暢性、資訊量、邏輯性和無害性。透過這些評分項,LLMEVAL能夠更全面地考量和評估大模型系統的表現。
●正確性:評估回答是否準確,即所提供的資訊是否準確無誤。一個高質量的回答應當在事實上是可靠的。
●流暢性:評估回答是否貼近人類語言習慣,即措辭是否通順、表達清晰。一個高質量的回答應當易於理解,不含繁瑣或難以解讀的句子。
●資訊量:評估回答是否提供了足夠的有效資訊,即回答中的內容是否具有實際意義和價值。一個高質量的回答應當能夠為提問者提供有用的、相關的資訊。
●邏輯性:評估回答是否在邏輯上嚴密、正確,即所陳述的觀點、論據是否合理。一個高質量的回答應當遵循邏輯原則,展示出清晰的思路和推理。
●無害性:評估回答是否未涉及違反倫理道德的資訊,即內容是否合乎道德規範。一個高質量的回答應當遵循道德原則,避免傳播有害、不道德的資訊。
問題二:應該用什麼方法評測大模型?
在構造了評測目標的基礎上,有多種方法可以對模型進行評測。包括分項評測、眾包對比評測、公眾對比評測、GPT 4自動分項評測、GPT 4 對比評測等方式。那麼,哪種方法更適合評測大模型,並且這些方法各自的優缺點是什麼呢?為了研究這些問題,LLMEVAL在本次評測中採用了上述五種方式進行了效果對比。
●分項評測:首先根據分項評測目標,制定具體的評測標準,並構造定標集合。在此基礎上對人員進行培訓,並進行試標和矯正。在此基礎上再進行小批次標註,在對齊標準後完成大批次標註。
●眾包對比標註:由於分項評測要求高,眾包標註採用了雙盲對比測試,將系統名稱隱藏僅展示內容,並隨機成對分配給不同使用者,使用者從“A系統好”、“B系統好”、“兩者一樣好”以及“兩者都不好”四個選項中進行選擇,利用LLMEVAL平臺分發給大量使用者來完成的標註。為了保證完成率和準確率,LLMEVAL-1提供了少量的現金獎勵,並提前告知使用者,如果其與其他使用者一致性較差將會扣除部分獎勵。
●公眾對比標註:與眾包標註一樣,也採用了雙盲對比測試,也是將系統名稱隱藏並隨機展現給使用者,同樣也要求使用者從“A系統好”、“B系統好”、“兩者一樣好”以及“兩者都不好”四個選項中進行選擇。不同的是,公眾評測完全不提供任何獎勵,透過各種渠道宣傳,系統能夠吸引儘可能多的評測使用者。
●GPT 4自動分項評測:利用GPT 4 API 介面,將評分標準做為Prompt,與問題和系統答案分別輸入系統,使用GPT 4對每個分項的評分對結果進行評判。
●GPT 4 自動對比評測:利用GPT 4 API 介面,將同一個問題以及不同系統的輸出合併,並構造Prompt,使用GPT 4模型對兩個系統之間的優劣進行評判。
問題三:應該使用什麼方法進行排序?
對於分項評測,LLMEVAL可以利用各個問題的在各分項上的平均分,以及每個分項綜合平均分進行系統之間的排名。但是對於對比標註,採用什麼樣的方式進行排序也是需要研究的問題。為此,LLMEVAL對比了Elo Rating(Elo評分)和 Points Scoring (積分制得分)。
LMSys評測採用了 Elo Rating(Elo評分),該評分系統被廣泛用於國際象棋、圍棋、足球、籃球等運動。網路遊戲的競技對戰系統也採用此分級制度。Elo評分系統根據勝者和敗者間的排名的不同,決定著在一場比賽後總分數的獲得和丟失。在高排名選手和低排名選手比賽中,如果高排名選手獲勝,那麼只會從低排名選手處獲得很少的排名分。然而,如果低排名選分爆冷獲勝,可以獲得許多排名分。雖然這種評分系統非常適合於競技比賽,但是這種評測與順序有關,並且對噪音非常敏感。
Points Scoring(積分制得分)也是一種常見的比賽評分系統,用於在競技活動中確定選手或團隊的排名。該制度根據比賽中獲得的積分數量,決定參與者在比賽中的表現和成績。在LLMEVAL評測中採用根據使用者給出的“A系統好”、“B系統好”、“兩者一樣好”以及“兩者都不好”選擇,分別給A系統+1分,B系統+1分,A和B系統各+0.5分。該評分方式與順序無關,並且對噪音的敏感程度相較Elo評分較低。
部分評分排名如下(按照綜合分數排序):



從上面的評測結果,LLMEVAL可以得到以下初步結論:
●人工測評中,分項評測的準確率和一致性最好。在人工分項評測中,比較有區分度的指標是正確性、資訊量和邏輯性。現有的大模型在流暢性和無害性這兩個指標上都取得了比較好的成績。未來在指標設計上,應該更有所側重。
●無害性相對較為接近的一個可能原因是,本次評測為了可以公開進行,沒有大量設定無害性相關問題,對於較為直接的有害問題,目前系統的回答結果都較為理想。針對無害性需要設計更多針對性資料,才能對各個系統在該分項上的能力進行對比。
●由於評測集合中有一定數量的文章寫作、詩歌、框架生成等開放性生成式任務,因此造成NewBing和Moss-w-Plugin的效果較差。這也在一定程度上說明了外掛能力如何應用仍然是需要進一步深入研究的方向。
●GPT4 自動測評有自身的侷限性,在部分指標上與人工評測一致性不夠高,對於前後位置、內容長度等也具有一定的偏見。未來大模型評測應該首選人工分項測評的方式,並且使用自動測評作為補充。
●在眾包對比測評中,使用者非常容易受到內容長度的影響,通常會傾向給較長的內容更多勝出的評價,這對最終的評分會產生較大的影響。同時也嚴重影響了使用者對比測試的可信度。未來需要進一步研究如何設計評測任務和方法來控制這種影響。
●公眾對比評測參與人數較多,但是每個人的平均評測次數很少,LLMEVAL在過濾掉評測少於5次的使用者結果後,評測的一致性和準確性仍是在較低的範圍。在噪聲較大的情況下,使用公眾評測資料對各系統排序的意義較低。未來如果要利用公眾評測進行大模型評價,需要更好的任務設計。
●針對Elo評分,LLMEVAL進行了理論分析,在人工評測準確率為70%的情況下,初始分數為1500分時,Elo評分的估計方差高達1514。在已有20萬評測點的基礎上,僅十餘個噪音樣本就會造成模型排序的大幅度變化,因此Elo評分不適合對大模型進行排名。

LLMEVAL-1中文大模型評測的正式結果已經發布!在過去的一個月中,共有2186位使用者參與評測,提交了總計24.3萬個評測結果。此外,LLMEVAL還利用GPT 4 API進行了5.75萬次自動評測。本次評測涵蓋了17個大類、453個問題,包括事實性問答、閱讀理解、框架生成、段落重寫、摘要、數學解題、推理、詩歌生成、程式設計等各個領域。目前LLMEVAL正在撰寫詳細的分析報告,並計劃投稿EMNLP 2023中。評測問題和各個參評系統的回答結果已經上傳至https://github.com/llmeval/llmeval-1。
六月底之前,LLMEVAL將上傳本次評測的所有資料,包括公眾使用者評測結果、眾包使用者評測結果、GPT 4評測結果以及人工分項評測結果。
自2022年以來,大量不同型別的大模型評測方法相繼湧現。然而,為了利便進行自動化評測,目前的評測方法主要採用選擇題或者依賴GPT-4進行評估。雖然選擇題能夠利便進行自動化處理,但其無法有效評估大模型最為關鍵的生成能力,僅在一定程度上反映模型的知識覆蓋範圍。儘管GPT-4的自動評測模型可以對文字生成能力進行評估,但LLMEVAL仍缺乏大規模資料對比分析,無法確定其結果與人工評測之間的實際差距。
LMEVAL系列評測旨在系統研究大模型評價方法,並試圖回答以下幾個關鍵問題:
問題一:應該從哪些方面評測大模型?
在大模型系統的研發中,通常遵循著3H原則:Helpful(資訊量)、Honest(正確性)和Harmlessness(無害性)。為了更準確地評估這些原則,LLMEVAL將其細化為了5個評分項,分別是:正確性、流暢性、資訊量、邏輯性和無害性。透過這些評分項,LLMEVAL能夠更全面地考量和評估大模型系統的表現。
●正確性:評估回答是否準確,即所提供的資訊是否準確無誤。一個高質量的回答應當在事實上是可靠的。
●流暢性:評估回答是否貼近人類語言習慣,即措辭是否通順、表達清晰。一個高質量的回答應當易於理解,不含繁瑣或難以解讀的句子。
●資訊量:評估回答是否提供了足夠的有效資訊,即回答中的內容是否具有實際意義和價值。一個高質量的回答應當能夠為提問者提供有用的、相關的資訊。
●邏輯性:評估回答是否在邏輯上嚴密、正確,即所陳述的觀點、論據是否合理。一個高質量的回答應當遵循邏輯原則,展示出清晰的思路和推理。
●無害性:評估回答是否未涉及違反倫理道德的資訊,即內容是否合乎道德規範。一個高質量的回答應當遵循道德原則,避免傳播有害、不道德的資訊。
問題二:應該用什麼方法評測大模型?
在構造了評測目標的基礎上,有多種方法可以對模型進行評測。包括分項評測、眾包對比評測、公眾對比評測、GPT 4自動分項評測、GPT 4 對比評測等方式。那麼,哪種方法更適合評測大模型,並且這些方法各自的優缺點是什麼呢?為了研究這些問題,LLMEVAL在本次評測中採用了上述五種方式進行了效果對比。
●分項評測:首先根據分項評測目標,制定具體的評測標準,並構造定標集合。在此基礎上對人員進行培訓,並進行試標和矯正。在此基礎上再進行小批次標註,在對齊標準後完成大批次標註。
●眾包對比標註:由於分項評測要求高,眾包標註採用了雙盲對比測試,將系統名稱隱藏僅展示內容,並隨機成對分配給不同使用者,使用者從“A系統好”、“B系統好”、“兩者一樣好”以及“兩者都不好”四個選項中進行選擇,利用LLMEVAL平臺分發給大量使用者來完成的標註。為了保證完成率和準確率,LLMEVAL-1提供了少量的現金獎勵,並提前告知使用者,如果其與其他使用者一致性較差將會扣除部分獎勵。
●公眾對比標註:與眾包標註一樣,也採用了雙盲對比測試,也是將系統名稱隱藏並隨機展現給使用者,同樣也要求使用者從“A系統好”、“B系統好”、“兩者一樣好”以及“兩者都不好”四個選項中進行選擇。不同的是,公眾評測完全不提供任何獎勵,透過各種渠道宣傳,系統能夠吸引儘可能多的評測使用者。
●GPT 4自動分項評測:利用GPT 4 API 介面,將評分標準做為Prompt,與問題和系統答案分別輸入系統,使用GPT 4對每個分項的評分對結果進行評判。
●GPT 4 自動對比評測:利用GPT 4 API 介面,將同一個問題以及不同系統的輸出合併,並構造Prompt,使用GPT 4模型對兩個系統之間的優劣進行評判。
問題三:應該使用什麼方法進行排序?
對於分項評測,LLMEVAL可以利用各個問題的在各分項上的平均分,以及每個分項綜合平均分進行系統之間的排名。但是對於對比標註,採用什麼樣的方式進行排序也是需要研究的問題。為此,LLMEVAL對比了Elo Rating(Elo評分)和 Points Scoring (積分制得分)。
LMSys評測採用了 Elo Rating(Elo評分),該評分系統被廣泛用於國際象棋、圍棋、足球、籃球等運動。網路遊戲的競技對戰系統也採用此分級制度。Elo評分系統根據勝者和敗者間的排名的不同,決定著在一場比賽後總分數的獲得和丟失。在高排名選手和低排名選手比賽中,如果高排名選手獲勝,那麼只會從低排名選手處獲得很少的排名分。然而,如果低排名選分爆冷獲勝,可以獲得許多排名分。雖然這種評分系統非常適合於競技比賽,但是這種評測與順序有關,並且對噪音非常敏感。
Points Scoring(積分制得分)也是一種常見的比賽評分系統,用於在競技活動中確定選手或團隊的排名。該制度根據比賽中獲得的積分數量,決定參與者在比賽中的表現和成績。在LLMEVAL評測中採用根據使用者給出的“A系統好”、“B系統好”、“兩者一樣好”以及“兩者都不好”選擇,分別給A系統+1分,B系統+1分,A和B系統各+0.5分。該評分方式與順序無關,並且對噪音的敏感程度相較Elo評分較低。
部分評分排名如下(按照綜合分數排序):




LLMEVAL-1中文大模型評測的正式結果已經發布!在過去的一個月中,共有2186位使用者參與評測,提交了總計24.3萬個評測結果。此外,LLMEVAL還利用GPT 4 API進行了5.75萬次自動評測。本次評測涵蓋了17個大類、453個問題,包括事實性問答、閱讀理解、框架生成、段落重寫、摘要、數學解題、推理、詩歌生成、程式設計等各個領域。目前LLMEVAL正在撰寫詳細的分析報告,並計劃投稿EMNLP 2023中。評測問題和各個參評系統的回答結果已經上傳至https://github.com/llmeval/llmeval-1。
六月底之前,LLMEVAL將上傳本次評測的所有資料,包括公眾使用者評測結果、眾包使用者評測結果、GPT 4評測結果以及人工分項評測結果。
自2022年以來,大量不同型別的大模型評測方法相繼湧現。然而,為了利便進行自動化評測,目前的評測方法主要採用選擇題或者依賴GPT-4進行評估。雖然選擇題能夠利便進行自動化處理,但其無法有效評估大模型最為關鍵的生成能力,僅在一定程度上反映模型的知識覆蓋範圍。儘管GPT-4的自動評測模型可以對文字生成能力進行評估,但LLMEVAL仍缺乏大規模資料對比分析,無法確定其結果與人工評測之間的實際差距。
LMEVAL系列評測旨在系統研究大模型評價方法,並試圖回答以下幾個關鍵問題:
問題一:應該從哪些方面評測大模型?
在大模型系統的研發中,通常遵循著3H原則:Helpful(資訊量)、Honest(正確性)和Harmlessness(無害性)。為了更準確地評估這些原則,LLMEVAL將其細化為了5個評分項,分別是:正確性、流暢性、資訊量、邏輯性和無害性。透過這些評分項,LLMEVAL能夠更全面地考量和評估大模型系統的表現。
●正確性:評估回答是否準確,即所提供的資訊是否準確無誤。一個高質量的回答應當在事實上是可靠的。
●流暢性:評估回答是否貼近人類語言習慣,即措辭是否通順、表達清晰。一個高質量的回答應當易於理解,不含繁瑣或難以解讀的句子。
●資訊量:評估回答是否提供了足夠的有效資訊,即回答中的內容是否具有實際意義和價值。一個高質量的回答應當能夠為提問者提供有用的、相關的資訊。
●邏輯性:評估回答是否在邏輯上嚴密、正確,即所陳述的觀點、論據是否合理。一個高質量的回答應當遵循邏輯原則,展示出清晰的思路和推理。
●無害性:評估回答是否未涉及違反倫理道德的資訊,即內容是否合乎道德規範。一個高質量的回答應當遵循道德原則,避免傳播有害、不道德的資訊。
問題二:應該用什麼方法評測大模型?
在構造了評測目標的基礎上,有多種方法可以對模型進行評測。包括分項評測、眾包對比評測、公眾對比評測、GPT 4自動分項評測、GPT 4 對比評測等方式。那麼,哪種方法更適合評測大模型,並且這些方法各自的優缺點是什麼呢?為了研究這些問題,LLMEVAL在本次評測中採用了上述五種方式進行了效果對比。
●分項評測:首先根據分項評測目標,制定具體的評測標準,並構造定標集合。在此基礎上對人員進行培訓,並進行試標和矯正。在此基礎上再進行小批次標註,在對齊標準後完成大批次標註。
●眾包對比標註:由於分項評測要求高,眾包標註採用了雙盲對比測試,將系統名稱隱藏僅展示內容,並隨機成對分配給不同使用者,使用者從“A系統好”、“B系統好”、“兩者一樣好”以及“兩者都不好”四個選項中進行選擇,利用LLMEVAL平臺分發給大量使用者來完成的標註。為了保證完成率和準確率,LLMEVAL-1提供了少量的現金獎勵,並提前告知使用者,如果其與其他使用者一致性較差將會扣除部分獎勵。
●公眾對比標註:與眾包標註一樣,也採用了雙盲對比測試,也是將系統名稱隱藏並隨機展現給使用者,同樣也要求使用者從“A系統好”、“B系統好”、“兩者一樣好”以及“兩者都不好”四個選項中進行選擇。不同的是,公眾評測完全不提供任何獎勵,透過各種渠道宣傳,系統能夠吸引儘可能多的評測使用者。
●GPT 4自動分項評測:利用GPT 4 API 介面,將評分標準做為Prompt,與問題和系統答案分別輸入系統,使用GPT 4對每個分項的評分對結果進行評判。
●GPT 4 自動對比評測:利用GPT 4 API 介面,將同一個問題以及不同系統的輸出合併,並構造Prompt,使用GPT 4模型對兩個系統之間的優劣進行評判。
問題三:應該使用什麼方法進行排序?
對於分項評測,LLMEVAL可以利用各個問題的在各分項上的平均分,以及每個分項綜合平均分進行系統之間的排名。但是對於對比標註,採用什麼樣的方式進行排序也是需要研究的問題。為此,LLMEVAL對比了Elo Rating(Elo評分)和 Points Scoring (積分制得分)。
LMSys評測採用了 Elo Rating(Elo評分),該評分系統被廣泛用於國際象棋、圍棋、足球、籃球等運動。網路遊戲的競技對戰系統也採用此分級制度。Elo評分系統根據勝者和敗者間的排名的不同,決定著在一場比賽後總分數的獲得和丟失。在高排名選手和低排名選手比賽中,如果高排名選手獲勝,那麼只會從低排名選手處獲得很少的排名分。然而,如果低排名選分爆冷獲勝,可以獲得許多排名分。雖然這種評分系統非常適合於競技比賽,但是這種評測與順序有關,並且對噪音非常敏感。
Points Scoring(積分制得分)也是一種常見的比賽評分系統,用於在競技活動中確定選手或團隊的排名。該制度根據比賽中獲得的積分數量,決定參與者在比賽中的表現和成績。在LLMEVAL評測中採用根據使用者給出的“A系統好”、“B系統好”、“兩者一樣好”以及“兩者都不好”選擇,分別給A系統+1分,B系統+1分,A和B系統各+0.5分。該評分方式與順序無關,並且對噪音的敏感程度相較Elo評分較低。
部分評分排名如下(按照綜合分數排序):




LLMEVAL-1中文大模型評測的正式結果已經發布!在過去的一個月中,共有2186位使用者參與評測,提交了總計24.3萬個評測結果。此外,LLMEVAL還利用GPT 4 API進行了5.75萬次自動評測。本次評測涵蓋了17個大類、453個問題,包括事實性問答、閱讀理解、框架生成、段落重寫、摘要、數學解題、推理、詩歌生成、程式設計等各個領域。目前LLMEVAL正在撰寫詳細的分析報告,並計劃投稿EMNLP 2023中。評測問題和各個參評系統的回答結果已經上傳至https://github.com/llmeval/llmeval-1。
六月底之前,LLMEVAL將上傳本次評測的所有資料,包括公眾使用者評測結果、眾包使用者評測結果、GPT 4評測結果以及人工分項評測結果。
自2022年以來,大量不同型別的大模型評測方法相繼湧現。然而,為了利便進行自動化評測,目前的評測方法主要採用選擇題或者依賴GPT-4進行評估。雖然選擇題能夠利便進行自動化處理,但其無法有效評估大模型最為關鍵的生成能力,僅在一定程度上反映模型的知識覆蓋範圍。儘管GPT-4的自動評測模型可以對文字生成能力進行評估,但LLMEVAL仍缺乏大規模資料對比分析,無法確定其結果與人工評測之間的實際差距。
LMEVAL系列評測旨在系統研究大模型評價方法,並試圖回答以下幾個關鍵問題:
問題一:應該從哪些方面評測大模型?
在大模型系統的研發中,通常遵循著3H原則:Helpful(資訊量)、Honest(正確性)和Harmlessness(無害性)。為了更準確地評估這些原則,LLMEVAL將其細化為了5個評分項,分別是:正確性、流暢性、資訊量、邏輯性和無害性。透過這些評分項,LLMEVAL能夠更全面地考量和評估大模型系統的表現。
●正確性:評估回答是否準確,即所提供的資訊是否準確無誤。一個高質量的回答應當在事實上是可靠的。
●流暢性:評估回答是否貼近人類語言習慣,即措辭是否通順、表達清晰。一個高質量的回答應當易於理解,不含繁瑣或難以解讀的句子。
●資訊量:評估回答是否提供了足夠的有效資訊,即回答中的內容是否具有實際意義和價值。一個高質量的回答應當能夠為提問者提供有用的、相關的資訊。
●邏輯性:評估回答是否在邏輯上嚴密、正確,即所陳述的觀點、論據是否合理。一個高質量的回答應當遵循邏輯原則,展示出清晰的思路和推理。
●無害性:評估回答是否未涉及違反倫理道德的資訊,即內容是否合乎道德規範。一個高質量的回答應當遵循道德原則,避免傳播有害、不道德的資訊。
問題二:應該用什麼方法評測大模型?
在構造了評測目標的基礎上,有多種方法可以對模型進行評測。包括分項評測、眾包對比評測、公眾對比評測、GPT 4自動分項評測、GPT 4 對比評測等方式。那麼,哪種方法更適合評測大模型,並且這些方法各自的優缺點是什麼呢?為了研究這些問題,LLMEVAL在本次評測中採用了上述五種方式進行了效果對比。
●分項評測:首先根據分項評測目標,制定具體的評測標準,並構造定標集合。在此基礎上對人員進行培訓,並進行試標和矯正。在此基礎上再進行小批次標註,在對齊標準後完成大批次標註。
●眾包對比標註:由於分項評測要求高,眾包標註採用了雙盲對比測試,將系統名稱隱藏僅展示內容,並隨機成對分配給不同使用者,使用者從“A系統好”、“B系統好”、“兩者一樣好”以及“兩者都不好”四個選項中進行選擇,利用LLMEVAL平臺分發給大量使用者來完成的標註。為了保證完成率和準確率,LLMEVAL-1提供了少量的現金獎勵,並提前告知使用者,如果其與其他使用者一致性較差將會扣除部分獎勵。
●公眾對比標註:與眾包標註一樣,也採用了雙盲對比測試,也是將系統名稱隱藏並隨機展現給使用者,同樣也要求使用者從“A系統好”、“B系統好”、“兩者一樣好”以及“兩者都不好”四個選項中進行選擇。不同的是,公眾評測完全不提供任何獎勵,透過各種渠道宣傳,系統能夠吸引儘可能多的評測使用者。
●GPT 4自動分項評測:利用GPT 4 API 介面,將評分標準做為Prompt,與問題和系統答案分別輸入系統,使用GPT 4對每個分項的評分對結果進行評判。
●GPT 4 自動對比評測:利用GPT 4 API 介面,將同一個問題以及不同系統的輸出合併,並構造Prompt,使用GPT 4模型對兩個系統之間的優劣進行評判。
問題三:應該使用什麼方法進行排序?
對於分項評測,LLMEVAL可以利用各個問題的在各分項上的平均分,以及每個分項綜合平均分進行系統之間的排名。但是對於對比標註,採用什麼樣的方式進行排序也是需要研究的問題。為此,LLMEVAL對比了Elo Rating(Elo評分)和 Points Scoring (積分制得分)。
LMSys評測採用了 Elo Rating(Elo評分),該評分系統被廣泛用於國際象棋、圍棋、足球、籃球等運動。網路遊戲的競技對戰系統也採用此分級制度。Elo評分系統根據勝者和敗者間的排名的不同,決定著在一場比賽後總分數的獲得和丟失。在高排名選手和低排名選手比賽中,如果高排名選手獲勝,那麼只會從低排名選手處獲得很少的排名分。然而,如果低排名選分爆冷獲勝,可以獲得許多排名分。雖然這種評分系統非常適合於競技比賽,但是這種評測與順序有關,並且對噪音非常敏感。
Points Scoring(積分制得分)也是一種常見的比賽評分系統,用於在競技活動中確定選手或團隊的排名。該制度根據比賽中獲得的積分數量,決定參與者在比賽中的表現和成績。在LLMEVAL評測中採用根據使用者給出的“A系統好”、“B系統好”、“兩者一樣好”以及“兩者都不好”選擇,分別給A系統+1分,B系統+1分,A和B系統各+0.5分。該評分方式與順序無關,並且對噪音的敏感程度相較Elo評分較低。
部分評分排名如下(按照綜合分數排序):


