在今年世界人工智能大會展館里,幾乎所有人都在討論算力的狂飆與大模型的迭代。但如果你稍作停留,就會發(fā)現(xiàn)一個被算力焦慮掩蓋的物理現(xiàn)實(shí):GPU算完一次任務(wù)可以立刻釋放,進(jìn)入下一個循環(huán),但每一次 AI 交互產(chǎn)生的數(shù)據(jù),卻像雪球一樣被永久地留存了下來。
“AI 不僅僅是計算系統(tǒng),更是一個龐大的數(shù)據(jù)系統(tǒng)。”西部數(shù)據(jù)開發(fā)工程高級副總裁 Tim Rausch在演講時表示。在他看來,當(dāng)AI應(yīng)用真正邁向規(guī)模化,如何給這些永遠(yuǎn)在膨脹的海量數(shù)據(jù)安一個“高性價比的家”,成了決定AI企業(yè)能否可持續(xù)發(fā)展的關(guān)鍵因素。
![]()
Tim在分享中舉了一個案例,向現(xiàn)場觀眾直觀展示了 AI 究竟有多“吃”存儲。
大屏幕上演示了一次生成式視頻的請求過程:僅僅為了生成一個最終大小為3.97MB的視頻,系統(tǒng)需要在整個存儲棧中完成高達(dá)46.5GB 的讀寫操作,并在后端留下506 MB的數(shù)據(jù)。
“在 AI 中,訓(xùn)練和推理是一個往復(fù)的循環(huán)。”Tim Rausch說到,每一次交互都會產(chǎn)生新的數(shù)據(jù),這些數(shù)據(jù)隨后會被存儲下來,重新納入訓(xùn)練并用于改進(jìn)后續(xù)模型,這就形成了一個“模型改進(jìn)—更多推理—更多輸出被留存”的自我強(qiáng)化循環(huán)。
隨著數(shù)據(jù)像雪球一樣越滾越大,傳統(tǒng)的二層云存儲架構(gòu)已經(jīng)捉襟見肘,并向更專業(yè)的四層演進(jìn)。而面對這種轉(zhuǎn)變,Tim認(rèn)為,要通過閃存(SSD)來處理性能敏感型的小數(shù)據(jù)讀取,由大容量機(jī)械硬盤(HDD)來承載不斷累積的海量寫入流。這種智能數(shù)據(jù)分層和均衡的存儲架構(gòu),不僅能夠從容應(yīng)對持續(xù)增長的數(shù)據(jù)規(guī)模,更能讓AI 基礎(chǔ)設(shè)施變得務(wù)實(shí)、優(yōu)雅且有性價比。
理論需要硬件來落地。為了讓底層的數(shù)據(jù)存儲更具性價比,西部數(shù)據(jù)在展臺上展示了涵蓋 HAMR(熱輔助磁記錄)、ePMR(能量輔助垂直磁記錄)以及UltraSMR 等前沿技術(shù),這些技術(shù)的核心目的只有一個:在不大幅增加成本的前提下,不斷突破硬盤的容量天花板。
與此同時,針對AI時代對數(shù)據(jù)傳輸速度的苛刻要求,西部數(shù)據(jù)還展示了業(yè)界首創(chuàng)的“高帶寬硬盤技術(shù)”與“雙樞軸技術(shù)”。簡而言之,這兩項(xiàng)技術(shù)讓機(jī)械硬盤在保持大容量和低成本優(yōu)勢的同時,獲得了成倍的性能和帶寬提升。這意味著,企業(yè)在面對海量AI工作負(fù)載時,不需要盲目采購昂貴的純閃存設(shè)備,結(jié)合智能的分層架構(gòu),用新一代的 HDD 就能又好又省地解決問題。
如果說算力決定了AI能跑多快,而存儲決定了AI能走多遠(yuǎn)。或許底層存儲架構(gòu)不如前端算力那樣引人注目,但它卻是支撐AI運(yùn)行不被數(shù)據(jù)壓垮的堅實(shí)底座。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.