企業AI部署從實驗走向規模化時,一個被反復買單的教訓是:第一階段那些“不管三七二十一,先把最貴集群買來跑大模型”的做法,正變成越來越燙手的token賬單。AMD全球企業技術銷售副總裁John Hampton在AMD Advancing AI活動上直言,相當多企業的第一階段可以用“準備、開火、瞄準”來形容——先去競品那兒買下大型GPU集群,把所有工作負載一股腦丟給云端的前沿模型,然后才盯著賬單發愣。
Hampton在接受theCUBE采訪時指出,當AI應用從簡單的提示交互邁向自主工作流,前沿模型在龐大GPU集群上運行的成本已經壓得IT主管喘不過氣。token經濟學——也就是AI token消耗背后的經濟賬——正在成為企業IT決策者必須直面的頭號課題。
![]()
“token經濟學確實已經成了企業最關心的事,”Hampton說,“成本可負擔性和投資回報正經受嚴峻考驗。”換句話說,企業不能再默認所有任務都該扔給最貴的云端前沿模型,而是需要根據每個用例匹配最合適的硬件,無論是CPU還是成本、功耗更低的GPU。
AMD自己就拿內部系統做了一次真金白銀的試驗。他們把工作負載通過AI token路由定向到自有的MI350P GPU,而不是繼續依賴外部前沿云模型。結果帶來的改變頗為直接:token賬單下降了43%,而響應速度反而提升了2.9倍。Hampton把這一數字稱作整個試點的關鍵看點——既甩掉了很大一塊成本包袱,又讓推理跑得更快。
這種混合路由的思路,本質上是在算力經濟學里重新定義什么才是“最優解”。Hampton的態度很明確:最優方案并不總是那些跑在大型GPU集群上的前沿模型,很多時候用CPU或低功耗GPU做推理,已經能交出足夠好的答卷。下一階段能在AI部署中持續跑通的企業,會把硬件現代化和AI token路由一起納入算力經濟賬,而不是繼續在失控的token消耗中盲目踩油門。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.