![]()
![]()
“Agent時代,元川微用一套原生LPU架構同時覆蓋云邊端。”
作者丨陳悅琳
編輯丨包永剛
早在Groq LPU因為英偉達的押注而名聲大噪前,元川微創始人兼CEO楊濱就已經開始了對推理芯片的構想。
雷峰網獨家獲悉,LPU創業公司元川微已完成Pre-A輪數億元融資。本輪融資由IDG資本領投,孚騰資本、九坤創投、尚頎資本、順禧基金、徐匯科創投聯合投資。
據了解,這也是元川微2026年以來完成的第四輪融資。
元川微透露,本輪融資資金將主要用于LPU+芯片研發、軟件生態建設及產品工程化推進。目前,元川微正與多家產業客戶及云廠商開展產品驗證與合作。
元川微表示,公司下一輪融資已有序展開。
公開資料顯示,元川微成立于2025年9月,今年4月完成的數億元天使輪系列融資,就已獲得頭部VC、政府基金及產業鏈的聯合支持,投資陣容覆蓋從流片制造到終端應用的關鍵環節。
資本的持續加碼,反映了推理時代的新一輪芯片競爭,正從GPU延伸至推理專用架構。押注這一方向的元川微,如果只看其芯片形態一一時空編譯器、硬流水架構、大帶寬存儲,確實像一家“中國版Groq”。
但楊濱并不認同這種簡單對應:“如果我們的目標只是模仿LPU,那么能拓展的空間實際上并不多。”
在他看來,選擇何種芯片技術,只是在完成市場判斷后自然推導而出的結果,并非創業的起點。
這種思考方式與楊濱在華為過去二十多年的經歷密切相關——他曾赴美從零組建華為處理器團隊,回國后負責華為無線基帶算法與芯片相關業務,長期主導大規模硬件調度、數據架構研發等任務。
“創業其實是你過去積累的所有資源的兌現。”楊濱總結。而這不僅指向對產業的理解、沉淀下來的技術能力,還包括積攢的口碑和資源組織能力等。
核心成員過去幾十年積累下來的技術能力、產業經驗和人才資源,也構成了元川微創業的底座。CTO孫博士對GPGPU、GPU、DSP等高性能計算架構的鉆研超過三十年,首席軟件工程師Will博士擁有20多年編譯器、EDA和異構系統軟件經驗。
相比起討論“國產替代”“性價比”等熱門議題,這支由行業老兵組成的新公司更關注的是——當AI進入Agent時代,推理計算究竟應該圍繞什么來重新組織。
01
從AI終局倒推確定LPU路線,只做最快的推理
2025年上半年,當楊濱和CTO在討論AI芯片賽道還有哪些創業機會時,他們就已經意識到相比模型的能力,模型真正落地后才會產生價值。
彼時,Deepseek R1憑借遠低于行業預期的成本,訓練出接近當時頂級模型的性能,加速AI應用走向低成本部署;Manus剛剛打開通用Agent的想象空間;黃仁勛首次將推理和Agent作為GTC大會的核心敘事,并推出面向推理時代的整體解決方案。
隨著推理的市場需求不斷釋放,楊濱將目光投向Vibe coding等生產力應用。“就像家庭帶寬從100兆升級到1G,收費并不呈線性增長。”在產業界摸爬滾打多年的他熟悉此類場景的商業邏輯——客戶愿意為效率支付更高的溢價。
“主打性價比肯定有市場空間,但會被壓縮得很快。”因此,他們首先要做的不是幫客戶節省成本,而是創造更高的價值。“只做推理且只做最快的推理”開始成為楊濱所信奉的法則。
2025年底一份百萬億Token實證研究顯示,推理模型已處理OpenRouter平臺約一半的Token,而Agentic AI推理正成為增長最快的交互方式。這意味著低時延和高穩定性的價值正在被進一步放大。
楊濱指出,Agent完成一項任務往往需要經歷任務規劃、工具調用、結果驗證等多個環節,在這背后可能對應幾十次甚至上百次推理。而任何一次推理產生的延遲,都會沿著任務鏈不斷累積。
如果進一步發展為多個Agent協同,單Agent的響應變慢,還可能會像蝴蝶效應一樣在整個系統中層層傳導,最終拖慢任務執行。
除此之外,楊濱還注意到人與Agent交互中對高穩定的追求:人與人交流時的停頓本身暗含思考、組織語言等語義;但當Agent輸出Token的節奏忽快忽慢時,用戶感受到的反而是一種機械感。
當Agent時代的需求被一步步明確,重新思考推理芯片的設計便成為自然而然的選擇。在楊濱看來,傳統GPU建立在馮·諾依曼架構之上,并不完美匹配當下的計算模式;而完全ASIC化雖然能夠獲得極致性能,卻又難以適應模型快速演進帶來的變化。
因此,新的架構需要重新思考哪些能力可以硬化,哪些能力需要保持靈活,最大化算力、存力與運力的系統方案綜合效率。沿著這一思路,楊濱及其團隊最終確定了LPU的技術路線。
02
不是復制Groq,做面向
Agentic AI實時推理時代的原生LPU
楊濱并不認為元川微是在復制Groq。
他直言兩家公司雖然都關注低延遲、可預測的推理,但誕生于CNN時代的Groq LPU當時面臨的模型架構和應用需求都與今天并不相同。
盡管Groq后來將產品名稱從TSP(Tensor Streaming Processor,張量處理器)改為LPU(Language Processing Unit,語言處理單元),在他看來這并不意味著LPU只能處理語言模型。
同樣采用這一命名的元川微,將其架構命名為LPU+,從設計之初便支持多模態模型。此外,作為Transformer時代的原生架構,LPU+還針對MoE(Mixture of Experts,混合專家)模型的動態調度特征進行優化。
但這并不意味著Groq過去的技術積累沒有含金量。“Groq真正值得借鑒的是其一直堅持的硬流水架構。”據楊濱的觀察,這在一定程度上避免了芯片運行過程中的資源競爭和不必要的數據等待,也為采用大容量SRAM創造了條件。
不過,要將這套架構與存儲介質的協同優勢真正發揮出來,還有賴于編譯器的提前規劃。
楊濱將這一過程形容為制定高鐵運行圖:每一趟列車何時發車、何時停靠、停留多久,都已經提前安排妥當。直到真正運行時,高鐵只需按照既定路線執行任務即可。
也正因為此,楊濱強調LPU的時空編譯器、硬流水架構、大帶寬存儲這三大核心很難區分誰的優先級更高,前兩者決定了芯片的理論性能,而時空編譯器則關系到這些能力在實際運行中能夠兌現多少。
這些技術最終指向的,并不是一顆單獨的推理芯片。
楊濱告訴雷峰網,基于硬流水架構,元川微無需針對不同算力等級重新設計芯片,而是可以根據云邊端不同場景靈活擴展算力規模。
在剛剛落幕的2026世界人工智能大會上,這套技術路線首次以Agentic AI Token工廠的形式對外亮相,為企業級推理服務提供底層算力支撐。
這只是藍圖落地的第一步。在華為二十多年的經歷中,楊濱最大的收獲并非某項具體技術,而是一套從產業價值、商業閉環一路推導至技術選擇的系統工程思維。
元川微成立至今的每一步,都在驗證這一思維的有效性。而它也將繼續指引這家創企尋找下一階段的答案。
關于LPU等新架構芯片以及推理時代產業競爭的更多觀察,歡迎添加作者微信 Evelynn7778 交流。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.