![]()
在人工智能(AI)計(jì)算領(lǐng)域,Cerebras Systems Inc.這家雄心勃勃的初創(chuàng)公司向Nvidia Corp.發(fā)起了挑戰(zhàn),推出了它自稱的“世界最快”AI推理服務(wù),并且這項(xiàng)服務(wù)現(xiàn)在已經(jīng)在云端提供。
AI推理指的是將實(shí)時(shí)數(shù)據(jù)通過(guò)訓(xùn)練有素的AI模型運(yùn)行,以進(jìn)行預(yù)測(cè)或解決任務(wù)的過(guò)程。推理服務(wù)是AI行業(yè)的主力軍,根據(jù)Cerebras的說(shuō)法,它也是增長(zhǎng)最快的部分,目前約占云中所有AI工作負(fù)載的40%。
然而,現(xiàn)有的AI推理服務(wù)似乎并不能完全滿足每個(gè)客戶的需求。“我們看到各種各樣的興趣,關(guān)于如何更快、更省錢(qián)地完成推理,”首席執(zhí)行官Andrew Feldman在本周的一次記者會(huì)上說(shuō)。
該公司打算通過(guò)其新的“高速推理”服務(wù)來(lái)實(shí)現(xiàn)這一目標(biāo)。它認(rèn)為這次發(fā)布是AI行業(yè)的一個(gè)分水嶺時(shí)刻,聲稱它能夠提供的每秒1000個(gè)token的速度,堪比寬帶互聯(lián)網(wǎng)的引入,為AI應(yīng)用帶來(lái)了改變游戲規(guī)則的新機(jī)會(huì)。
● 原始力量
Cerebras完全有能力提供這樣的服務(wù)。該公司是AI和高性能計(jì)算(HPC)工作負(fù)載的專業(yè)和強(qiáng)大計(jì)算機(jī)芯片的生產(chǎn)商。在過(guò)去一年里,它多次成為頭條新聞,聲稱其芯片不僅比Nvidia的圖形處理單元(GPU)更強(qiáng)大,而且更具成本效益。“這是GPU無(wú)法實(shí)現(xiàn)的性能”,聯(lián)合創(chuàng)始人兼首席技術(shù)官Sean Lie宣稱。
其旗艦產(chǎn)品是新的WSE-3處理器(如圖),該處理器于3月宣布,并建立在其2021年首次亮相的早期WSE-2芯片之上。它采用先進(jìn)的5納米工藝制造,擁有比前代芯片多1.4萬(wàn)億個(gè)晶體管,擁有超過(guò)90萬(wàn)個(gè)計(jì)算核心和44GB的板載靜態(tài)隨機(jī)存取存儲(chǔ)器。據(jù)這家初創(chuàng)公司稱,WSE-3擁有比單個(gè)Nvidia H100圖形處理單元多52倍的核心。
該芯片作為數(shù)據(jù)中心設(shè)備的一部分提供,稱為CS-3,其大小與小型冰箱相似。芯片本身的大小與比薩餅相似,并配有集成的冷卻和電源模塊。在性能方面,據(jù)說(shuō)Cerebras WSE-3是WSE-2的兩倍,能夠達(dá)到每秒125 petaflops的峰值速度,1 petaflop等于每秒1000萬(wàn)億次計(jì)算。
Cerebras CS-3系統(tǒng)是新Cerebras推理服務(wù)的動(dòng)力源,它特別具有比Nvidia H100 GPU大7000倍的內(nèi)存,以解決生成AI的一個(gè)基本技術(shù)挑戰(zhàn):對(duì)更多內(nèi)存帶寬的需求。
● 低成本下的驚人速度
它以風(fēng)格解決了這一挑戰(zhàn)。Cerebras推理服務(wù)據(jù)說(shuō)非常快速,比使用Nvidia最強(qiáng)大的GPU的類似基于云的推理服務(wù)快20倍。根據(jù)Cerebras的說(shuō)法,它為開(kāi)源的Llama 3.1 8B模型每秒提供1800個(gè)token,為L(zhǎng)lama 3.1 70B每秒提供450個(gè)token。
它的價(jià)格也很有競(jìng)爭(zhēng)力,這家初創(chuàng)公司表示,該服務(wù)的起價(jià)僅為每個(gè)百萬(wàn)token 10美分——相當(dāng)于AI推理工作負(fù)載的價(jià)格性能提高了100倍。
該公司補(bǔ)充說(shuō),Cerebras推理服務(wù)特別適合“代理AI”工作負(fù)載,或者可以代表用戶執(zhí)行任務(wù)的AI代理,因?yàn)檫@些應(yīng)用程序需要不斷提示其底層模型。
獨(dú)立AI模型分析公司Artificial Analysis Inc.的聯(lián)合創(chuàng)始人兼首席執(zhí)行官M(fèi)icah Hill-Smith表示,他的團(tuán)隊(duì)已經(jīng)驗(yàn)證了在Cerebras推理上運(yùn)行的Llama 3.1 8B和70B實(shí)現(xiàn)了與Meta官方版本一致的“質(zhì)量評(píng)估結(jié)果”。
“憑借推動(dòng)性能前沿的速度和有競(jìng)爭(zhēng)力的定價(jià),Cerebras推理對(duì)于具有實(shí)時(shí)或高容量需求的AI應(yīng)用程序的開(kāi)發(fā)者特別有吸引力”,他說(shuō)。
● 分層訪問(wèn)
客戶可以選擇三個(gè)可用層級(jí)中的任何一個(gè)來(lái)訪問(wèn)Cerebras推理服務(wù),包括一個(gè)免費(fèi)提供,為任何想要嘗試平臺(tái)的人提供基于應(yīng)用程序編程接口的訪問(wèn)和慷慨的使用限制。
開(kāi)發(fā)人員層適用于靈活的無(wú)服務(wù)器部署。它通過(guò)公司表示價(jià)格僅為今天可用的替代服務(wù)一小部分的API端點(diǎn)進(jìn)行訪問(wèn)。例如,Llama 3.1 8B的價(jià)格僅為每個(gè)百萬(wàn)token 10美分,而Llama 3.1 70B的價(jià)格為60美分。該公司表示,將支持更多模型。
還有一個(gè)企業(yè)層,提供微調(diào)模型和定制的服務(wù)級(jí)別協(xié)議以及專用支持。這是為了持續(xù)的工作負(fù)載,并且可以通過(guò)Cerebras管理的私有云訪問(wèn),或者在本地實(shí)施。Cerebras沒(méi)有透露這個(gè)特定層的成本,但表示可以根據(jù)要求提供定價(jià)。
Cerebras聲稱擁有令人印象深刻的早期訪問(wèn)客戶名單,包括GlaxoSmithKline Plc等組織,AI搜索引擎初創(chuàng)公司Perplexity AI Inc.和網(wǎng)絡(luò)分析軟件提供商Meter Inc.。
DeepLearning AI Inc.的創(chuàng)始人Andrew Ng是另一位早期采用者,他解釋說(shuō),他的公司開(kāi)發(fā)了多個(gè)需要反復(fù)提示大型語(yǔ)言模型以獲得結(jié)果的代理AI工作流程。“Cerebras構(gòu)建了一個(gè)令人印象深刻的快速推理能力,這對(duì)于這類工作負(fù)載將非常有幫助”,他說(shuō)。
Cerebras的雄心不止于此。Feldman表示,該公司正在與多個(gè)超大規(guī)模云服務(wù)提供商接洽,希望在他們的云服務(wù)上提供其能力。“我們希望他們成為客戶”,他說(shuō),以及像CoreWeave Inc.和Lambda Inc.這樣的AI專業(yè)提供商。
除了推理服務(wù)外,Cerebras還宣布了多項(xiàng)戰(zhàn)略合作,為其客戶提供訪問(wèn)所有加速AI開(kāi)發(fā)所需的專業(yè)工具。其合作伙伴包括LangChain、LlamaIndex、Docker Inc.、Weights & Biases Inc.和AgentOps Inc.等。
Cerebras表示,其推理API與OpenAI的Chat Completions API完全兼容,這意味著現(xiàn)有應(yīng)用程序只需幾行代碼就可以遷移到其平臺(tái)上。
Cerebras Systems的這一舉措不僅是對(duì)Nvidia的直接挑戰(zhàn),也是對(duì)整個(gè)AI推理服務(wù)市場(chǎng)的一次推動(dòng)。通過(guò)提供前所未有的速度和具有競(jìng)爭(zhēng)力的價(jià)格,Cerebras正在重新定義AI推理服務(wù)的標(biāo)準(zhǔn),也有望成為推動(dòng)這一領(lǐng)域創(chuàng)新的關(guān)鍵力量。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.