搶電、圈地、對賭,深聊科技巨頭的千億美元AI能源大戰

首頁 > 科技

搶電、圈地、對賭,深聊科技巨頭的千億美元AI能源大戰

來源:海底探探 釋出時間:2024-05-15 16:32

文 | 矽谷101

聽說,OpenAI訓練GPT-6的時候,把微軟電網給搞崩了?小夥伴們,你們有沒有想過,生成式AI軍備競賽持續之際,AI會有多耗電嗎?

OpenAI訓練GPT-3大概消耗了1300兆瓦的電力,如果將這些電用來看網路流媒體影片,可以播放1625000小時,也就是185.5年

我們再換一個方式呈現,研究人員發現,將大模型用於AI文生圖,平均下來天天生一張圖片的耗電量,就能把一個手機充滿。

再來一個宏觀點的例子,我們做這期影片的2024年,全美AI資料中心的耗電量將佔據全美總用電量的2.5%。

但這,只是開始。矽谷的科技的大廠們:英偉達、谷歌、微軟、亞馬遜、Meta、特斯拉、甲骨文等一眾巨頭開始搭建大型資料中心之際,OpenAI直接聯手微軟打造了耗資1000億美元的資料中心“星際之門”(Stargate)。

隨著上萬張GPU顯示卡叢集成為訓練生成式AI的標配,矽谷開始卷多模態大模型,Scaling law(規模法則)依然是萬能解藥,可想而知,耗電量會指數級上漲。

歡迎大家來到矽谷101,這期內容我們就來聊聊,AI發展將會帶來的能源挑戰。首先我們來回答一個問題:為什麼訓練大模型會如此耗電。

01 為何生成式AI如此耗電?

1961年,為IBM效力的物理學家Rolf Landauer提出了Landauer"s Principle(蘭道爾原理)

指出計算機中儲存的資訊發生不可逆的變化時,系統的熵會增加,且伴隨著能量的耗散。簡單來說,處理資訊是有能量成本的。

1.1 AI訓練與推理:處理資訊能量成本

自從生成式AI確立使用Transformer架構並遵循“Scaling law”用巨量引數以來,AI大模型和“大量計算”就繫結在了一起。這就意味著,大模型運作中的“訓練”(Training)和“推理”(Inference)都會涉及大量計算和資訊處理,或者說,巨大的能量成本。

前者,在訓練階段,AI大模型需要收集和預處理大量的文字資料,然後初始化引數,處理資料,生成輸出,調整,最佳化等等,而且隨著模型的迭代,需要處理的引數是指數級別的增長:GPT3是1750億個引數,GPT4是1.8萬億個,GPT5可能會突破10萬億引數,而傳說正在訓練的GPT6則可能數百萬億甚至千萬億引數的量級。

而矽谷頂級孵化器YC的前總監Kyle Corbitt在他的推特上爆料說,他在跟一個微軟工程師聊天時,對方告訴他GPT-6的訓練曾經讓微軟電網超負荷崩潰,所以無法在同一個州部署超過10萬顆H100的GPU。

電網為什麼會崩潰我們稍後會解釋,但這裡想跟大家說的是,可見訓練GPT-6的耗電有多麼可怕。而在訓練完畢之後,“推理”同樣需要非常大的算力和電力支援。

徐熠興(Ethan)

微軟能源戰略部資深專案經理

我的理解是現在我們還處在就是AI訓練大模型的一個階段,這些模型訓練出來之後,它之後的應用,它的推理應用等等,那才是最大消耗能源的地方,那用電量的話可能要比你訓練那幾個月AI模型的用電量要大的多的。

我們知道,Transformer是自迴歸模型,這意味著推理過程中涉及多輪重複計算;而在之後的生成階段,天天生一個token,都需要與視訊記憶體進行資料互動。

我們在開頭說了,一張AI文生圖的平均耗電量是能把手機充滿電的電量。而聊天應用ChatGPT每天響應約2億個需求,消耗超過50萬度電力,相當於1.7萬個美國家庭平均一天的用電量。

所以,無論是訓練仍是推理階段,模型的引數目越大,需要處理的資料越多,所需的計算量就越大,消耗的能量也就越大,釋放的熱量也越多。而反過來,這又需要更強大的晶片,這樣的追求是無止盡的

John Yue

Inference.ai創始人兼執行長

我個人感覺他這對這晶片的要求應該是沒有盡頭的,就比如我training(訓練)一個東西我6個月,那我競品可能說OK,那我多買幾個GPU吧?我三個月,那他三個月,我現在就要兩個月,那我兩個月,他就要一個月,那這個東西其實是沒有盡頭的,因為大家總想要更快。

更快,更大,更強。

這對AI晶片提出了更高的要求。為了支撐起如斯巨大的計算量,科技巨頭們紛紛建起了自己的資料中心Data Center(資料中心),將上萬GPU互聯互通,來支援AI大算力。

如果說AI訓練和推理產生的能量是冰山一角的話,那麼資料中心本身的耗電才是埋在海中的巨大冰山

而再往深一步說,更大的能耗還來自於晶片上的電流,以及整個資料中心配套舉措措施。

1.2 萬卡Data Center:焦耳定律和冷卻系統的吞電狂魔

我們都知道,AI算力靠的是GPU晶片的平行計算。在每個晶片中,如今有著以億為單位的電晶體,比如說,英偉達最近釋出的Blackwell架構GPU就擁有2080億個電晶體。這些電晶體在運轉時,就會產生電流。回顧一下物理學的焦耳定律,電流透過這些電晶體產生的熱量跟電流的二次方成正比,跟導體的電阻成正比,跟通電的時間成正比(公式:Q=I²Rt)。

所以,萬億引數的AI大模型訓練與推理,執行在上萬GPU晶片上的千億電晶體上,所產生的耗電和熱量,可想而知。

除了晶片上本身的能耗之外,資料中心還涉及到冷卻系統的大量能耗。在資料中心的能耗上,有一個評估的衡量指標叫“電力使用效率”(Power Usage Effectiveness),簡稱PUE,也就是消耗的所有能源除以IT裝置能耗的比值。PUE這個指標越接近1,資料中心浪費的能源越少。

根據資料中心標準組織Uptime Institute的報告,2020年全球大型資料中心的平均PUE大約是在1.59。也就是說,資料中心的IT裝置每消耗1度電,配套裝置就會消耗0.59度電。其中,大部分的這些配套能耗是被用於冷卻系統,在很多資料中心,冷卻系統能耗可以達到總能耗的40%

因此,最近幾年,隨著生成式AI賽道的起飛,科技大廠們迅速圈地大興修建新AI資料中心。巨頭們並不在乎電價,而“哪裡有電”,成了它們在乎的問題。

John Yue

Inference.ai創始人兼執行長

就是因為我們原來設計Data Center(資料中心)的時候,大家其實沒有考慮資料中心需要用到這麼多電,它都是考慮到我的這個頻寬什麼的,它會建在離這種ISP(網路業務提供商)近一點的地方,這樣保證它這個頻寬有優勢。但是現在就發現我們其實是這個需要離電近一點,不是需要離頻寬近一點,就是如果你要建這個,就是這種accelerate compute(加速計算)的這種資料中心,像他這種32,000張GPU的話,那其實對頻寬要求遠遠不如對電的這個要求啊。

陳茜: 所以建在電便宜的地方?

John Yue

Inference.ai創始人兼執行長

不是,現在已經不是考慮電便宜不便宜了?現在就沒有電。嗯,現在是你要看Data Center這一層人,大家在乾的事都是shopping for power(購電)。就是你哪塊開一個很大的電站,立馬就有人趕緊去把那塊地先給建個Data Center(資料中心)。

Bank of America最近釋出給機構客戶的一份研報上認為,2023年到2028年期間,全球資料中心的能耗會以每年百分之25到33的複合增長率快速飆升。

徐熠興(Ethan)

微軟能源戰略部資深專案經理

AI其實它對一個國家的經濟也是非常重要的,就比如說一個很粗略的一個評估了,就是每一兆瓦的AI的這個資料中心的這個負荷,大概能夠帶來1000萬美元左右的年收入,如果是一兆瓦時的話,它的成本可能只有30美元到50美元左右。所以這是非常高的一個經濟效益。所以這也是為什麼,所有的科技公司都不管這個電價有多高,只要有電,那我就願意去建(資料中心)。

如斯有利潤潛力的高回報生意,巨頭們如何不押注?國際能源署(IEA)釋出的一份報告顯示,2022年全球資料中心、人工智慧和加密貨幣的耗電量達到460TWh,佔全球能耗的近2%。IEA預測,在最糟糕的情況下,到2026年這些領域的用電量將達1000TWh,與整個日本的用電量相當

上一篇:個人消費貸款... 下一篇:谷歌I/O開發...
猜你喜歡
熱門閱讀
同類推薦