訊飛星火V3.5實測體驗:多維度領先國內水平 與GPT-4不分伯仲

首頁 > 科技

訊飛星火V3.5實測體驗:多維度領先國內水平 與GPT-4不分伯仲

來源:幽默段子 釋出時間:2024-02-02 11:36

2024年1月30日,科大訊飛釋出了首個基於全國產化算力平臺訓練的全民開放大模型——訊飛星火V3.5,相比上一代模型在語言理解、文字生成、知識問答、邏輯推理、數學能力、程式碼能力和多模態能力等七個方面進行了全面進級。特別是在語言理解、數學能力方面已經超過 GPT-4 Turbo,進一步夯實了中國“最聰明”的大模型的地位。


  在釋出會現場,科大訊飛工作人員也展示了與訊飛星火V3.5的人機互動體驗,它不僅能夠清晰理解所說的含義,同時還能夠實現多輪對話,完全感覺就是在“嘮嗑”一般,並且還讓訊飛星火V3.5有了一定的情緒感知,完全體會不到機器人的冰冷。

  當主持人表達想要去哈爾濱旅行的想法後,訊飛星火V3.5快速為主持人定製了旅遊攻略,還催促他趕快買票,因為此時正是春運時期,所有票都非常緊俏,這樣的邏輯能力也是相當給力的。


  所以在全程看完訊飛星火V3.5的釋出會後,筆者就迫不及待的想要體驗一下它的實力,並且將直觀的與當下同樣火爆的ChatGPT 最 新的 GPT-4、文心一言4.0幾個大模型進行比較,重點從語言理解、數學能力、多模態、辦公支援等多個維度來具體分析訊飛星火V3.5的真實表現。(注:目前除了訊飛星火V3.5外,其它兩個對比大模型都是需要付費的)

  語言理解

  題目:大舅去二舅家找三舅說四舅被五舅騙去六舅家偷七舅放在八舅櫃子裡九舅借十舅發給十一舅工資的1000元。

  問:1、究竟誰是小偷?2、錢本來是誰的?

  其實這道題主要考驗的是一個關係邏輯推理問題,我們看看幾個大模型都是如何回答的。

  訊飛星火V3.5


  GPT-4


  文心一言


  從對比中看出,目前各個大模型其實都是有一定邏輯推理能力的,但是在繞來繞去的文字裡,只有訊飛星火V3.5給出了正確的結果,四舅偷了錢,錢是九舅的。而且訊飛星火V3.5的分析也是非常簡潔明瞭,讓使用者很快就能明白其中關鍵緣由。

  下面再出一道關於空間邏輯的題目。

  題目:我是一名在校學生,圖書館在學校的中心位,實驗樓在圖書館的南邊,學生活動中心在學校的北邊,教學樓和體育館分別在學生活動中心的東邊和西邊,食堂在圖書館的東邊,現在我在教學樓上完課需要去實驗樓做實驗,應該怎麼走?


  根據提示,筆者簡單的畫了一張草圖,利便大家對照各個大模型的路線來判斷對錯。

  訊飛星火V3.5


  GPT-4


  文心一言


  對比之下,三個大模型的回答均是正確的,但是作為使用者,我更希望得到精簡的答案,能夠快速告訴我具體路線。所以從回答的方式來說,筆者更喜歡訊飛星火V3.5和GPT-4,而文心一言有點囉嗦了。

  數學能力

  題目:河上有拋物線型拱橋,當水面距拱頂5米時,水面寬度為8米,一小船寬4米,高2米,載貨後船露出水面的部分高0.75米,問水面上漲到與拋物線拱頂距多少時,小船開始不能通行?

  訊飛星火V3.5


  GPT-4


  文心一言

上一篇:世界上最“霸... 下一篇:個體工商戶屬...
猜你喜歡
熱門閱讀
同類推薦