H800國內首發 騰訊雲釋出最新高效能計算叢集

首頁 > 科技

H800國內首發 騰訊雲釋出最新高效能計算叢集

來源:蒙面的大俠 釋出時間:2023-04-14 14:21

4月14日,騰訊雲正式釋出新一代HCC(High-Performance Computing Cluster)高效能計算叢集。該叢集採用騰訊雲星星海自研伺服器,搭載英偉達最新代次H800 GPU,伺服器之間採用業界最高的3.2T超高互聯頻寬,為大模型訓練、自動駕駛、科學計算等提供高效能、高頻寬和低延遲的叢集算力。

實測顯示,騰訊雲新一代叢集的算力效能較前代提升高達3倍,是國內效能最強的大模型計算叢集。

2022年10月,騰訊完成首個萬億引數的AI大模型——混元NLP大模型訓練。在同等資料集下,將訓練時間由50天縮短到11天。如果基於新一代叢集,訓練時間將進一步縮短至4天。

大模型進入萬億引數時代,單體伺服器算力有限,需要將大量伺服器透過高效能網路相連,打造大規模算力叢集。透過對處理器、網路架構和儲存效能的全面最佳化,騰訊雲攻克了大叢集場景下的算力損耗問題,能為大模型訓練提供高效能、高頻寬、低延遲的智算能力支撐。

網路層面,計算節點間存在海量的資料互動需求,隨著叢集規模擴大,通訊效能會直接影響訓練效率。騰訊自研的星脈網路,為新一代叢集帶來了業界最高的3.2T的超高通訊頻寬。實測結果顯示,搭載同樣的GPU卡,3.2T星脈網路相較前代網路,能讓叢集整體算力提升20%,使得超大算力叢集仍然能保持優秀的通訊開銷比和吞吐效能。並提供單叢集高達十萬卡級別的組網規模,支援更大規模的大模型訓練及推理。

儲存層面,幾千臺計算節點同時讀取一批資料集,需要儘可能縮短載入時長。騰訊雲自研的檔案儲存、物件儲存架構,具備TB級吞吐能力和千萬級IOPS,充分滿足大模型訓練的大資料量儲存要求。

底層架構之上,針對大模型訓練場景,新一代叢集集成了騰訊雲自研的TACO Train訓練加速引擎,對網路協議、通訊策略、AI框架、模型編譯進行大量系統級最佳化,大幅節約訓練調優和算力成本。

騰訊混元大模型背後的訓練框架AngelPTM,也已透過騰訊雲對外提供服務,幫助企業加速大模型落地。

目前,騰訊混元AI大模型,已經覆蓋了自然語言處理、計算機視覺、多模態等基礎模型和眾多行業、領域模型。

在騰訊雲上,企業基於TI平臺的大模型能力和工具箱,可結合產業場景資料進行精調訓練,提升生產效率,快速建立和部署AI 應用。

此前,騰訊多款自研晶片已經量產。其中,用於AI推理的紫霄晶片、用於影片轉碼的滄海晶片已在騰訊內部交付使用,效能指標和綜合性價比顯著優於業界。其中,紫霄採用自研存算架構,增加片上記憶體容量並使用更提高前輩的記憶體技術,消除訪存能力不足制約晶片效能的問題,同時內建整合騰訊自研加速模組,減少與CPU握手等待時間。目前,紫霄已經在騰訊頭部業務規模部署,提供高達3倍的計算加速效能,和超過45%的整體成本節省。

目前,騰訊雲的分散式雲原生排程總規模超過1.5億核,並提供16 EFLOPS(每秒1600億億次浮點運算)的智算算力。未來,新一代叢集不僅能服務於大模型訓練,還將在自動駕駛、科學計算、自然語言處理等場景中充分應用。

以新一代叢集為標誌,基於自研晶片、星星海自研伺服器和分散式雲作業系統遨馳,騰訊雲正透過軟硬一體的方式,打造面向AIGC的高效能智算網路,持續加速全社會雲上創新。

(8158755)

4月14日,騰訊雲正式釋出新一代HCC(High-Performance Computing Cluster)高效能計算叢集。該叢集採用騰訊雲星星海自研伺服器,搭載英偉達最新代次H800 GPU,伺服器之間採用業界最高的3.2T超高互聯頻寬,為大模型訓練、自動駕駛、科學計算等提供高效能、高頻寬和低延遲的叢集算力。

實測顯示,騰訊雲新一代叢集的算力效能較前代提升高達3倍,是國內效能最強的大模型計算叢集。

2022年10月,騰訊完成首個萬億引數的AI大模型——混元NLP大模型訓練。在同等資料集下,將訓練時間由50天縮短到11天。如果基於新一代叢集,訓練時間將進一步縮短至4天。

大模型進入萬億引數時代,單體伺服器算力有限,需要將大量伺服器透過高效能網路相連,打造大規模算力叢集。透過對處理器、網路架構和儲存效能的全面最佳化,騰訊雲攻克了大叢集場景下的算力損耗問題,能為大模型訓練提供高效能、高頻寬、低延遲的智算能力支撐。

上一篇:2023 年第 1... 下一篇:訊息稱法拉第...
猜你喜歡
熱門閱讀
同類推薦