![]()
智東西
作者 ZeR0
編輯 漠影
智東西7月21日報道,世界人工智能大會WAIC 2026期間,西部數據通過參展與舉行專題分論壇,全面呈現存儲基礎設施如何支撐AI的規模化發展。
數據如何被存儲、管理與長期保留,已成為決定AI能否實現可持續、經濟高效規模化發展的關鍵因素。
在展臺上,西部數據展示了兩項業界首創的先進HDD創新技術:高帶寬硬盤技術和雙樞軸硬盤技術,以及HAMR(熱輔助磁記錄)、ePMR(能量輔助垂直磁記錄)和UltraSMR技術,并展現了這些技術如何與其平臺產品組合相輔相成,專為滿足規模化AI基礎設施的需求而打造。
![]()
其中,高帶寬硬盤技術通過多磁頭在多個磁道同時進行讀寫,可在不增加功耗的前提下提供高達傳統HDD 2倍的帶寬。該技術具備清晰的拓展路徑,未來可實現高達8倍的帶寬增益,目前已交付客戶進行驗證。
雙樞軸技術在獨立樞軸上增加了第二組獨立運行的執行器,可在3.5英寸硬盤內提供高達2倍的順序IO性能增益 。這與以往犧牲容量且需要客戶大幅度修改軟件的雙執行器設計不同,雙樞軸技術通過縮小磁碟間距,在單個硬盤中搭載更多磁碟,從而提升整體容量。
通過這些技術的結合,西部數據將使硬盤順序IO性能整體提升至4倍,在實現100TB HDD的同時,仍能保持客戶當前享有的每TB相對IO速率。這有效減少了客戶在容量擴展過程中增加SSD部署或重構服務架構的需求。
西部數據還展出了面向大規模數據存儲環境的多款Ultrastar企業級HDD解決方案,包括40TB和34TB Ultrastar DC HC6100數據中心UltraSMR硬盤、30TB和28TB Ultrastar DC HC5090數據中心CMR硬盤、采用HAMR技術的40TB Ultrastar DC HCS100數據中心UltraSMR硬盤,以及采用高帶寬硬盤和雙樞軸技術的性能優化型硬盤。
值得注意的是,采用UltraSMR ePMR技術的40TB HDD現已進入客戶認證階段,并計劃于2026年下半年實現量產。
西部數據展出的精選先進存儲平臺解決方案,包括全新Ultrastar Data60 3000混合存儲平臺、OpenFlex Data24 4200存儲平臺以及RapidFlex C2000網絡交換橋接適配器,旨在支持可擴展部署、靈活的資源利用以及滿足現代數據基礎設施的要求。
7月19日下午,西部數據舉辦以“面向AI時代的數據存儲架構創新”為主題的分論壇。西部數據開發工程高級副總裁Tim Rausch發表主題演講。
西部數據從一個關鍵差異點重新審視了AI基礎設施:即計算周期可以重復利用,而數據會持續累積。
Tim強調,AI不僅是計算系統,更是數據系統,在其中訓練和推理往復循環。每一次交互都會產生新的數據,這些數據可被存儲、重新納入訓練并用于改進后續模型,使存儲需求呈現持續性和累積性。如何高效管理這些海量數據,已成為行業面臨的核心挑戰。
他著重分享了三類工作負載:
第一類是訓練數據,通常一次寫入、存放在HDD上,并被周期性讀取,因為模型并非始終處于訓練狀態。隨著用戶生成的內容回流到AI數據循環中,訓練數據量會持續增長。這一層最看重的是能夠擴展到EB級、且具有成本效益的存儲,而這正是HDD的用處。
第二類是推理,例如我與AI交互,請它提供晚餐食譜或生成一張圖片,同時還有數百萬用戶在以類似的方式使用AI,這會產生大量隨機小數據讀取,還需要內存來保留對話上下文。因此,這一層既需要高帶寬和高IOPS,也需要持久化存儲,這正是SSD發揮作用的場景。
第三類是推理輸出,也就是AI為我生成的食譜、圖片或其他內容。此外,AI還會保留日志、追蹤記錄、合規記錄和元數據。很多數據最初位于HBM或DRAM中,但很快會向下遷移到HDD,進行持久化存儲。
AI存儲棧與傳統云應用使用的存儲棧有所不同。傳統應用可能主要依賴兩個存儲層級:閃存和HDD。假設一個應用中有數千張圖片,用戶打開應用時最先看到的10到20張圖片可能來自NAND閃存,以便快速呈現;繼續向下瀏覽時,后續圖片則從HDD加載,因為HDD更具成本效益。開發者會根據性能與成本的平衡,將內容放到合適的存儲層。
AI構建者采用同一套原則,但涉及到更多層級:
- 上層是模型權重/GPU顯存溢出,即HBM或DRAM緊鄰成本高昂的GPU,以便持續向其供給數據。
- 下一層是KV緩存,也就是AI系統的短期記憶,主要使用DRAM和SSD。
- 再下一層是語義數據庫,其中包含向量、嵌入和檢索增強生成(RAG)數據,通常運行在SSD上的高性能數據層。
- 最底層是HDD大容量存儲,用來保存日志、用戶生成內容的副本以及訓練數據。
![]()
“在規模化發展中,經濟性決定架構。通過閃存處理性能敏感型小數據讀取,由HDD承載不斷累積的寫入流,這種智能數據分層和均衡的存儲架構不僅能夠從容應對持續增長的數據規模,更讓AI基礎設施變得務實、優雅且經濟可行。”Tim說。
他展示了一個案例:生成一個3.97MB的視頻需要在整個存儲棧中完成46.5GB的讀寫,并在后端留下506MB數據。當推理輸出被存儲、重新納入系統并用作合成訓練數據后,便形成“模型改進—更多推理—更多輸出被留存”的自我強化循環,持續擴大持久存儲層。
![]()
Tim認為,成功的AI企業會將數據放在正確的層級,并讓數據在AI存儲棧的4個層級之間持續遷移。
“目前我們看到,約80%的AI內容存儲在HDD上,20%存儲在SSD上。”他談道,他并不是主張HDD占據的市場份額應當提高,而是想強調數據總量本身正在增長,HDD與SSD并不是在面臨存量競爭,而是彼此互補,HDD、SSD、DRAM和HBM應根據各自的性能和經濟性部署在最合適的層級。
為應對持續累積的數據需求,西部數據分享了未來五年的發展路線圖。
西部數據將采取ePMR與HAMR并行發展的路徑,幫助客戶更平穩地邁向2029年單盤100TB以上的容量。
![]()
對于需要高性能的工作負載,西部數據將通過高帶寬硬盤技術與雙樞軸技術提供帶寬與IO性能方面的增益。
針對AI交互生成并需要持久留存的數據,可通過功耗優化型HDD提供經濟可持續的解決方案。
此外,西部數據還將利用其智能平臺,將HDD的經濟性和優勢延伸至更廣泛的客戶群體。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.