矩陣模擬!Transformer大模型3D視覺化,GPT-3、Nano-GPT每一層清晰可見

首頁 > 科技

矩陣模擬!Transformer大模型3D視覺化,GPT-3、Nano-GPT每一層清晰可見

來源:戲說健康 釋出時間:2023-12-04 14:53

矩陣模擬!Transformer大模型3D視覺化,GPT-3、Nano-GPT每一層清晰可見

  新智元報道  

編纂:桃子 好睏

【新智元導讀】Transformer大模型工作原理畢竟是什麼樣的?一位軟體工程師打開了大模型的矩陣世界。

駭客帝國中,「矩陣模擬」的世界或許真的存在。

模擬人類神經元,不斷進化的Transformer模型,一直以來都深不可測。

很多科學家都試著開啟這個黑盒,看看畢竟是如何工作的。

而現在,大模型的矩陣世界,真的被打開了!

一位軟體工程師Brendan Bycroft製作了一個「大模型工作原理3D視覺化」網站霸榜HN,效果非常震撼,讓你秒懂LLM工作原理。

1750億引數的GPT-3,模型層足足有8列,密密麻麻沒遍佈了整個螢幕。

GPT-2模型不同引數版本的架構視覺化,差異巨大。如下是有150億引數GPT-2(XL),以及有1.24億引數GPT-2(Small)。

這個3D模型視覺化還展示了,大模型天生內容的每一步。

這裡,Bycroft主要分解了OpenAI科學家Andrej Karpathy打造的輕量級的GPT模型——NanoGPT,引數目為85000。

地址:https://bbycroft.net/llm

看過這個視覺化圖,你就可以瞭解ChatGPT的大腦。

從GPT-2(Small)到GPT-3的引數規模的跨越,讓人歎為觀止。

Bycroft稱,這個指南側重於模型的推理,而非練習,只是機器學習中的一小部分。在詳細例子中,模型的權重已經預練習完成,使用推理過程來天生輸出。

當然了,這個視覺化網站也是收到了Karpathy在PyTorch中建立的minGPT,以及YouTube影片系列「Neural Networks: Zero to Hero」的啟發。

接下來,一起深入來了解,Transformer模型每一層。

先容

為了利便進行演示,Brendan Bycroft給NanoGPT佈置了一個非常簡單的任務:

獲取一個由六個字母組成的序列:C B A B B C,並按字母順序排序,即「ABBBCC」。

上一篇:封閉式基金價... 下一篇:數智技術賦能...
猜你喜歡
熱門閱讀
同類推薦