什么?大模型終于也開始打減肥針了?
這可不是我瞎說(shuō),據(jù)CNBC報(bào)道,蘋果正在接洽初創(chuàng)公司PrismML,后者以其最近推出的模型壓縮技術(shù)而著稱,蘋果希望借此評(píng)估在iPhone上直接運(yùn)行更大規(guī)模AI模型的可行性。
![]()
(圖源:CNBC)
要知道這些年,每到手機(jī)發(fā)布會(huì)的AI環(huán)節(jié),我一般都會(huì)下意識(shí)拿起水杯。
倒也不是我和廠商有啥矛盾,實(shí)在是這套流程大家都太熟了。先讓AI總結(jié)屏幕上的各種東西,再用各種圖像編輯去做點(diǎn)個(gè)性化調(diào)色,或者是消掉照片里的路人,然后今年還普遍加了個(gè)項(xiàng)目,叫出一個(gè)語(yǔ)音助手幫你點(diǎn)杯咖啡。
但這倒不能全怪手機(jī)廠商,現(xiàn)在的主流大模型確實(shí)塞不進(jìn)手機(jī)里,裁剪后的端側(cè)模型,智商又實(shí)在不太夠。到頭來(lái),大家能宣傳的也只有云端更新的東西,你看豆包更了個(gè)AI播客功能,主流廠商基本上三個(gè)月內(nèi)全部跟進(jìn)了。
問(wèn)題來(lái)了,如果完整大模型瘦到手機(jī)裝得下,端側(cè)AI助手就真的能轉(zhuǎn)正嗎?
54GB降到4GB,模型壓縮技術(shù)要普及?
首先,跟著雷科技(ID:leitech)一起來(lái)看看這兩個(gè)問(wèn)題:
PrismML是誰(shuí)?
根據(jù)官網(wǎng)介紹,PrismML是一家專攻模型壓縮的初創(chuàng)公司,它脫胎于加州理工學(xué)院研究團(tuán)隊(duì),背后有Khosla Ventures、Cerberus和Google支持,研究重點(diǎn)就是怎么在盡量不把模型壓傻的前提下,把體積和運(yùn)行成本狠狠干下來(lái)。
![]()
(圖源:PrismML)
他們做了什么?
PrismML的思路和BitNet這類低比特模型路線有相似之處,它通過(guò)大幅簡(jiǎn)化人工智能模型內(nèi)部信息的存儲(chǔ)方式來(lái)縮小模型體積,將模型中的每個(gè)權(quán)重限制為二值或三值表達(dá),顯著降低存儲(chǔ)和運(yùn)行模型所需的內(nèi)存。
具體來(lái)說(shuō),傳統(tǒng)大模型的一個(gè)參數(shù),通常需要16bit甚至32bit來(lái)保存。
![]()
(圖源:HuggingFace)
在這種情況下,如果一個(gè)270億參數(shù)模型采用FP16精度,270億×2 Byte≈54GB,這就是Qwen3.6-27B在FP16下的大致體積。
別說(shuō)智能手機(jī)了,很多消費(fèi)級(jí)PC也很難完整跑起來(lái)。
而在PrismML的思路下,1-bit版的參數(shù)都會(huì)被簡(jiǎn)化為 {-1, +1} ,就像以前照片上的每個(gè)像素會(huì)保存16級(jí)灰度,現(xiàn)在只需要保存黑、白兩種灰度,雖然信息損失巨大,但是體積能壓縮到原版的1/14,并能通過(guò)訓(xùn)練方式恢復(fù)推理性能。
![]()
(圖源:PrismML)
在這個(gè)技術(shù)的基礎(chǔ)上,他們?cè)?月15日正式推出了Bonsai-27B模型,基于Qwen3.6-27B模型微調(diào),在保留完整上下文的基礎(chǔ)上,將該模型從約54GB縮減至不足4GB,使其可以在12GB內(nèi)存的iPhone上原生運(yùn)行。
要知道,谷歌面向手機(jī)和邊緣設(shè)備推出的Gemma 4 E4B約3.65GB,PrismML等于用差不多的“占地面積”,塞進(jìn)了名義上270億參數(shù)的密集模型。
使用體驗(yàn)先不討論,硬件廠商看完肯定兩眼放光。
![]()
(圖源:PrismML)
所以蘋果會(huì)對(duì)這玩意兒感興趣,一點(diǎn)都不奇怪。
要知道,蘋果自己的端側(cè)模型大約是30億參數(shù),也用了2位量化、緩存共享這些手段,卻只能負(fù)責(zé)手機(jī)上的實(shí)時(shí)翻譯、相冊(cè)搜索和郵件摘要這些功能,基本沒(méi)有Agent相關(guān)的執(zhí)行能力。
而Bonsai-27B模型,仍保留了Qwen3.6-27B的一部分Agent能力。
當(dāng)然,性能損失還是有的。在PrismML自己的測(cè)試?yán)铮蛋婢C合成績(jī)大約保留全精度模型的95%,1-bit版約90%,至于工具調(diào)用這些Agent很看重的項(xiàng)目,損失會(huì)更明顯。
社區(qū)測(cè)試也有人反饋:PrismML三值版本相比Q4_K_XL仍存在幻覺(jué)、Agent循環(huán)等問(wèn)題,不過(guò)優(yōu)勢(shì)是體積極小,基本做到了以5.9GB媲美17.9GB的效果。
![]()
(圖源:Reddit)
但不管怎么說(shuō),能用就是比不能用要強(qiáng)。
從物理意義上的塞不下,到實(shí)際體驗(yàn)?zāi)懿荒芙邮埽^續(xù)這樣推進(jìn)下去,我覺(jué)得后面就有得卷了。
AI手機(jī)爆發(fā)在即,端側(cè)AI能力亟待提升
有趣的是,7月15日,蘋果智能、華為小藝、OPPO、小米、vivo等七款提供手機(jī)端側(cè)生成式人工智能的模型服務(wù),均已在網(wǎng)信部門完成備案。
你別說(shuō),這名單看著挺熱鬧,明顯今年手機(jī)廠商都開始認(rèn)真安排端側(cè)AI了。
![]()
(圖源:網(wǎng)信辦)
原因也不難理解,像是通知摘要、通話整理、相冊(cè)搜索、圖片識(shí)別這些事情,根本沒(méi)必要每次都跑去云端排隊(duì)。
特別是聊天記錄、照片和文件這種私人信息,能在自己手機(jī)里解決當(dāng)然最好,考慮到Grok最近爆發(fā)的隱私門,我完全能理解大家不希望自己的信息在互聯(lián)網(wǎng)上傳來(lái)傳去的心情。
![]()
(圖源:雷科技)
問(wèn)題是,從我個(gè)人的體驗(yàn)來(lái)看,目前各家手機(jī)AI功能還是以云端為主,絕大部分功能斷網(wǎng)以后就無(wú)法使用了。
為什么會(huì)出現(xiàn)這種情況?目前手機(jī)的端側(cè)AI又發(fā)展到了什么水平呢?
正好,我最近也在Google AI Edge Gallery里試了Gemma 4 E4B,可以給大家分享一下使用體驗(yàn)。
![]()
(圖源:谷歌)
首先,大家要注意,Gemma 4 E4B已經(jīng)算手機(jī)端側(cè)模型里相當(dāng)能打的一款,文字、圖片、音頻都能處理;模型下載好以后,斷網(wǎng)照樣能聊。
比如Ask Image,就實(shí)現(xiàn)了以往很多手機(jī)端側(cè)AI很難做好的多模態(tài)輸入。
實(shí)測(cè)下來(lái),Gemma 4有著不錯(cuò)的圖片識(shí)別能力。雖然它對(duì)動(dòng)漫角色依然不太熟,但是對(duì)于畫面里的特征捕捉做得很不錯(cuò),比較常見(jiàn)的食物、硬件、花卉也都能識(shí)別出來(lái)。
![]()
(圖源:雷科技)
還有Ask Audio,最多可上傳30s音頻并進(jìn)行轉(zhuǎn)寫、總結(jié)等。
這個(gè)功能就比較遜色了,可能是因?yàn)槲业匿浺舯容^模糊的緣故,語(yǔ)音轉(zhuǎn)文字出來(lái)的內(nèi)容和原音頻幾乎沒(méi)有關(guān)系,目前可用性挺一般的,還是老老實(shí)實(shí)用豆包或者千問(wèn)來(lái)總結(jié)比較好。
![]()
(圖源:雷科技)
至于文本處理嘛...
我給幾個(gè)能在手機(jī)端部署的模型喂了一篇2500字左右的文章,希望它們給出對(duì)應(yīng)的文章總結(jié)。
最終,只有Gemma 3n E4B和Gemma 4 E4B能完成任務(wù),但是前者耗時(shí)將近兩分鐘,而且給出的答案抓不住重點(diǎn),后者給出的答案更加簡(jiǎn)明扼要,主要信息點(diǎn)基本都抓到了,拿來(lái)快速掃資料完全夠用。
![]()
甚至就連一些過(guò)往解決不了的邏輯題,Gemma 4 E4B也能通過(guò)長(zhǎng)時(shí)間思考拿下,只是思考時(shí)間遠(yuǎn)超在線大模型的響應(yīng)時(shí)間罷了。
在雷科技看來(lái),Gemma 4 E4B已經(jīng)證明,手機(jī)本地模型確實(shí)能干活。
但只有在拿它做摘要、改寫、簡(jiǎn)單識(shí)圖,我愿意用;可任務(wù)稍微復(fù)雜一點(diǎn),尤其涉及長(zhǎng)中文、細(xì)節(jié)判斷和內(nèi)容創(chuàng)作時(shí),它和在線大模型之間的差距依然很明顯,就更別說(shuō)Agent調(diào)用一類的任務(wù)了。
要知道,從壓縮率和功能性上看,Gemma 4已經(jīng)是目前最強(qiáng)的手機(jī)端側(cè)AI了。
想要突破這個(gè)效果,蘋果只能舍棄現(xiàn)有的壓縮方式,通過(guò)在相同的空間內(nèi)塞入更大參數(shù)量的模型,或許才能讓手機(jī)擁有一個(gè)不那么容易犯傻的大腦。
參數(shù)規(guī)模不重要,效率才是模型應(yīng)用的關(guān)鍵
以前大家談大模型,總覺(jué)得參數(shù)越多越有排面。
百億只是起步,萬(wàn)億也不嫌多,在發(fā)布會(huì)上報(bào)數(shù)字像菜市場(chǎng)稱重,主打一個(gè)“我家蘿卜,又大又壯”。
看起來(lái)沒(méi)問(wèn)題,但是實(shí)際運(yùn)行起來(lái)就是另一回事了。
根據(jù)Jordan Hoffmann團(tuán)隊(duì)的Chinchilla scaling law研究,在相同訓(xùn)練算力下,訓(xùn)練數(shù)據(jù)更充分的70B模型能夠全面超過(guò)欠訓(xùn)練的280B、530B模型,哪怕是萬(wàn)億參數(shù)的MoE模型,顯存占用和內(nèi)存帶寬依然是不小的問(wèn)題。
![]()
(圖源:arxiv)
更重要的是,參數(shù)如此龐大的模型,自然不可能進(jìn)入消費(fèi)級(jí)終端。
端側(cè)模型想要常駐手機(jī),就得提升效率,直面內(nèi)存、功耗和散熱問(wèn)題。PrismML的壓縮算法,算是給各家硬件廠商指明了一條路,再加上千問(wèn)、百度與蘋果的本地化合作,也算是讓蘋果三年前承諾的“蘋果智能”距離真正落地又進(jìn)了一步。
以后大模型的進(jìn)步,未必還要靠參數(shù)數(shù)字嚇人。
能在不大的存儲(chǔ)空間里穩(wěn)定工作,少犯傻,少發(fā)熱,關(guān)鍵時(shí)候真能幫上忙,這才是端側(cè)AI下一階段最該卷的東西。
主題為「智能伙伴·共創(chuàng)未來(lái)」的WAIC2026開幕在即。
AI敘事路線從模型參數(shù)堆疊,轉(zhuǎn)變到Agent生產(chǎn)力落地;異構(gòu)協(xié)同、光子計(jì)算持續(xù)提高計(jì)算上限;具身智能加速應(yīng)用,機(jī)器人到家進(jìn)廠讓物理AI變?yōu)楝F(xiàn)實(shí)。
雷科技WAIC探展團(tuán)已抵達(dá)上海,直擊AI產(chǎn)業(yè)化落地年度巔峰時(shí)刻!
![]()
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.