大模型盲測榜單更新!Yi-Large躋身全球前七,李開復談價格戰影響

首頁 > 科技

大模型盲測榜單更新!Yi-Large躋身全球前七,李開復談價格戰影響

來源:海底探探 釋出時間:2024-05-24 13:24

作者 | ZeR0

編輯 | 漠影

智東西5月21日報道,本日,著名大模型競技場LMSYS Chatboat Arena盲測評測結果更新,國內大模型獨角獸零一萬物的千億引數閉源大模型Yi-Large在最新總榜中排名世界第七,中國大模型中第一,超過Llama-3-70B、Claude 3 Sonnet;其中文分榜更是與GPT-4o並列第一。

LMSYS Chatboat Arena由第三方非營利組織LMSYS Org釋出,其盲測結果來自至今積累超過1170萬的全球使用者真實投票數。此次共有44款模型參賽,既包含了開源大模型Llama 3-70B,也包含了各家大廠的閉源模型。

Chatbot Arena評測過程涵蓋了從使用者直接參與投票到盲測,再到大規模的投票和動態更新的評分機制等多個方面,這些因素共同作用,確保了評測的客觀性、權威性和專業性,能夠更準確地反映出大模型在實際應用中的表現。

上週OpenAI的GPT-4o的測試版本便以“im-also-a-good-gpt2-chatbot”的馬甲闖進Chatbot Arena排行榜,排名超過GPT-4-Turbo、Gemini 1 .5 Pro、Claude 3 0pus、Llama-3-70b等一眾國際大廠當家基座模型。OpenAI CEO Sam Altman也在Gpt-4o釋出後切身轉帖引用LMSYS arena盲測擂臺的測試結果。

從最新公佈的Elo評分來看,GPT-4o以1287分高居榜首,GPT-4-Turbo、Gemini 1 5 Pro、Claude 3 Opus、Yi-Large等模型則以1240左右的評分位居第二梯隊。

排名前6的模型分別來自海外巨頭OpenAI、Google、Anthropic,且GPT-4、Gemini 1.5 Pro等模型均為萬億級別超大引數規模的旗艦模型,其他模型也都在大幾千億引數級別。

零一萬物是總榜上唯一一家自家模型進入排名前十的中國大模型企業,按機構排序位於OpenAI、Google、Anthropic之後,排名第四。Yi-Large大模型以僅千億引數量級排名第7,評分為1236。

其後Bard(Gemini Pro)、Llama-3-70b-Instruct、Claude 3 Sonnet的成績則下滑至1200分左右;阿里巴巴的Qwen-Max大模型Elo分數為1186,排名第12;智譜AI的GLM-4大模型Elo分數為1175,排名第15。

為了提高Chatbot Arena查詢的整體質量,LMSYS還實施了重複資料刪除機制,並出具了去除冗餘查詢後的榜單。這個新機制旨在消除過度冗餘的使用者提示,如過度重複的“你好”。這類冗餘提示可能會影響排行榜的準確性。LMSYS公開表示,去除冗餘查詢後的榜單將在後續成為預設榜單。

在去除冗餘查詢後的總榜中, Yi-Large的Elo得分更進一步,與Claude 3 Opus、GPT-4-0125-preview並列第四。

上一篇:蘋果和OpenAI... 下一篇:智界S7“答網...
猜你喜歡
熱門閱讀
同類推薦