特斯拉抗衡英偉達失敗,自研晶片要涼涼?

首頁 > 科技

特斯拉抗衡英偉達失敗,自研晶片要涼涼?

來源:喬治葫蘆娃 釋出時間:2024-04-22 17:24

特斯拉抗衡英偉達失敗,自研晶片要涼涼?

撰文/ 周 洲

編輯/ 黃大路

設計/ 師 超

特斯拉禍不單行。一邊全球大裁員,一邊經歷“黑色星期五”。

4月19日,美股AI概念股們迎來了慘烈的“黑色星期五”。

英偉達暴跌10%,每股跌近85美元,創2020年3月16日以來最大單日跌幅,刷新歷史最大單日跌幅紀錄。競爭對手AMD大跌5.4%,晶片設計公司Arm跌近17%,晶圓代工龍頭臺積電稍微好一點,跌超3%。

作為上述晶片供應商的客戶,特斯拉也未能倖免,本週跌幅居首,大跌超過14%,市值在4月15日一天就蒸發304.33億美元(約合人民幣超2200億元)。

瑞穗證券駐場分析師喬丹·克萊因(Jordan Klein)表示,晶片領域“整個行業出現回撤”,過去一週左右時間裡,回撤速度一天比一天快。

這對於正在加碼AI的特斯拉來說是個雪上加霜的壞訊息。

2023年9月,摩根士丹利還曾預判,特斯拉用於訓練自動駕駛汽車人工智慧模型的超級計算機Dojo可能會給這家電動汽車製造商帶來“不對稱優勢”,使其市值增加近6000億美元。

自2022年年底開始,AI 應用全面爆發、勢不可擋,如今卻遭到機構對AI投資熱潮回撥。特斯拉重金投入的Dojo超級計算機專案晶片研發進展不理想,在無法All in的現實中,馬斯克聰明地作了兩手準備:儲備了足夠多的僅次於扎克伯格Meta的英偉達晶片。

一位業內人士對汽車商業評論稱,從一開始就對馬斯克自研晶片不太看好。

“Dojo所用的是一種用於大模型訓練的伺服器晶片,與在汽車上執行的軟體不同。其次,它(特斯拉)還沒有準備好,製造晶片很不容易,需要時間積澱。我覺得像其他人一樣購買現成的晶片是最好的路徑。”這位人士稱。

自建“道場”

特斯拉在2021年的“人工智慧日”(AI Day)上釋出了Dojo,公佈了自研晶片D1。

這是特斯拉用於雲端訓練AI模型的超級計算機,名字來源於日語,寓意為“道場”,象徵著它是作為訓練AI的地方。

Dojo旨在成為世界上最快的計算機之一,能夠處理海量的影片資料,從而加速特斯拉Autopilot和全自動駕駛系統(FSD)的學習和改進,也為特斯拉的人形機器人Optimus提供計算支援。

Dojo的核心是特斯拉自主設計製造的神經網路訓練晶片D1以及基於該晶片構建的訓練模組、系統托盤和ExaPOD叢集。

D1晶片採用臺積電7奈米工藝製造,這款晶片集成了500億個電晶體,並擁有354個訓練節點,每個節點都包含一個處理器核心、一個快取記憶體、一個高頻寬記憶體和一個高速互連。D1晶片的峰值算力高達362TFLOPS,頻寬達到36 TB/s。

為了進一步提高算力,特斯拉將25顆D1晶片進行無縫連線,形成一個訓練模組。每個訓練模組的峰值算力可達9PFLOPS,頻寬為900GB/s。

這些訓練模組構建了一個高密度、高效能、高可靠的系統托盤,每個托盤可容納10個訓練模組,並配備相應的電源、冷卻和網路裝置。每個系統托盤的峰值算力達到90 PFLOPS,頻寬為9 TB/s。

最後,基於系統托盤,特斯拉構建了一個ExaPOD叢集。每個叢集由10個系統托盤組成,安裝在一個機櫃中。一個ExaPOD機櫃模型的峰值算力高達900 PFLOPS,頻寬為90 TB/s。

作為Dojo落地形式的ExaPOD,由3000片D1晶片構成,單精度算力為1.1EFlops。

根據特斯拉的公開資料,Dojo基於特斯拉自研D1晶片,用於替代基於英偉達A100的資料中心。截至2022年9月,該資料中心有1.4萬片A100,是全球第七大資料中心。

特斯拉計劃2023財年大概出貨4萬-5萬片D1,2023年7月第一個ExaPOD已經投入運營,且預計在短期內向Palo Alto資料中心投入6個ExaPOD,算力共7.7EFlops。到今年四季度,Dojo算力目標是達到100EFlops(約91個叢集)。

在2023年7月下旬的二季度電話會議中,馬斯克表示沒必要自造晶片,“如果英偉達能夠給我們足夠的GPU,也許我們就不需要Dojo,但他們無法滿足我們的需求。”

在自研的重要節點上,2023年11月,負責Dojo超算專案的負責人、同時也是特斯拉自動駕駛硬體高階總監加內什·文卡塔拉馬南(Ganesh Venkataramanan)離職,職位由前蘋果高管彼得·班農(Peter Bannon)負責。彼時有訊息稱,很可能是因為Dojo第二代晶片未達標,加內什遭到解僱。

加內什此前負責特斯拉Dojo超算專案已達5年,在進入特斯拉之前,他曾在美國知名半導體公司AMD任職近15年。

加內什的離職,被認為是特斯拉自研晶片不力,或者沒有設想中那麼順利。

對馬斯克來說,他能採取的措施就是一邊想辦法自研,一邊購買合適的晶片。

設想與現實

一位網名為 “whydoesthisitch”的深度學習科研人員研究AI晶片已久,他解析了馬斯克的Dojo無法依靠自研晶片的原因。

他認為,Dojo 仍可能處於相對早期的開發階段,即使它加緊追趕,在效能方面仍將落後英偉達4 年以上。

今年3月20日,英偉達投下了Blackwell B200 炸彈,這是下一代資料中心和 AI GPU,將使得計算能力獲得巨大的代際飛躍。

Blackwell 包含三個部分:B100、B200 和 Grace-Blackwell 超級晶片 (GB200)。

新的 B200 GPU 擁有 2080 億個電晶體,可提供高達 20petaFlops 的 FP4 算力;GB200 將兩個 GPU 和一個 Grace CPU 結合在一起,可為 LLM 推理工作負載提供 30 倍的效能,同時還能大大提高效率。

英偉達表示,與 H100 相比,它的成本和能耗“最多可降低 25 倍”。訓練一個 1.8 萬億個引數的模型以前需要 8000 個 Hopper GPU 和 15 兆瓦的電力,如今,2000 個 Blackwell GPU 就能完成這項工作,耗電量僅為 4 兆瓦。

在具有 1750 億個引數的 GPT-3 LLM 基準測試中,GB200 的效能是 H100 的 7 倍,英偉達稱其訓練速度是 H100 的 4 倍。

“而特斯拉確實誇大了晶片本身以及它們的開發進展,”“whydoesthisitch”認為,例如,特斯拉宣傳 Dojo 突破了 exaflop 算力、Dojo躋身世界上最強大的計算中心之列之時,谷歌在俄克拉荷馬州梅斯縣的資料中心已經安裝 8 個 TPUv4 系統Pods,該資料中心正在以接近 9 exaflops的總計算能力供谷歌雲部門使用;亞馬遜的AWS 使用 Trainium 晶片算力達到6 exaflops ,使用英偉達的 H100 GPU 算力達到 20 exaflops。

他認為,如果Dojo足夠便宜,那它有理由取代英偉達。問題是,特斯拉的運營規模支撐不了這種龐大的研發投資。

今年1月16日,最近離職的特斯拉公共政策和業務發展副總裁的羅漢·帕特爾(Rohan Patel)在社交媒體X上釋出了一則訊息,稱“週五晚上與埃隆·馬斯克就一項大型AI資料中心投資進行了反覆討論。他決定批准這幾個月來一直密切跟蹤的計劃。很難想到一位執行長比你能想象地更多地參與公司最重要的細節。”

上一篇:世界上最小的... 下一篇:體驗了三天華...
猜你喜歡
熱門閱讀
同類推薦