快科技7月24日消息,一位開發(fā)者在社交平臺上分享了他的新成果:通過一套自研的優(yōu)化技術(shù),讓已經(jīng)退役多年的Tesla P100(16GB顯存)顯卡在運行35B(350億參數(shù))大模型時,速度暴增88%!
這張Tesla P100顯卡是英偉達2016年發(fā)布的計算卡,基于Pascal架構(gòu),雖然它擁16GB的顯存,但因架構(gòu)太老,在運行現(xiàn)代大模型軟件時,算力一直無法被有效調(diào)用。
![]()
該開發(fā)者通過復(fù)刻魔改GitHub平臺上的ik-llama.cpp項目,專門為Pascal和Volta這兩種老架構(gòu)寫了定制版的計算內(nèi)核,相當于把之前浪費掉的算力重新利用了起來。
靠這套優(yōu)化技術(shù),該顯卡在跑35B參數(shù)的MoE模型時,預(yù)填速度直接拉升88%,解碼速度也快了30%。
而且由于MoE架構(gòu)的特性,在每次推理時僅激活部分專家網(wǎng)絡(luò),并非全部參數(shù)同時參與計算。配合量化壓縮后權(quán)重體積進一步縮小,單張P100的16GB顯存便足以裝入模型。
兼容性方面,該方案不僅適用于Tesla P100,同樣支持P40、V100及更早型號,且允許在同一臺機器中混插不同架構(gòu)的顯卡協(xié)同工作。
目前該方案尚未打包為一鍵安裝工具,需要從GitHub拉取源碼自行編譯,而且Tesla P100作為被動散熱的計算卡無內(nèi)置風扇,裝機時還需額外解決散熱問題,需用用戶自行規(guī)劃風道或加裝水冷。
![]()
在海外二手市場上,P100顯卡價格已相當?shù)土瑢υ敢庹垓v命令行編譯和硬件改裝的用戶來說,是用低成本在本地運行35B級大模型的可行路徑。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.