封面新聞記者 李繼龍
在智能駕駛競爭不斷升級的背景下,車企之間的較量正從應用層逐漸向底層AI能力延伸。
近日,小鵬汽車發布視覺基礎模型TuringViT。這是繼世界模型、預測模型等技術之后,小鵬今年推出的又一項AI底層技術成果。與過去更多聚焦具體功能不同,此次發布瞄準的是視覺感知這一智能駕駛和具身智能的重要基礎能力,也意味著車企對于AI競爭正進一步深入到底層技術領域。
視覺感知被認為是智能駕駛系統獲取環境信息的重要入口。隨著大模型、VLA(視覺-語言-動作)等技術加速落地,行業對視覺模型提出了更高要求,包括處理更高分辨率圖像、多攝像頭輸入以及連續視頻數據,同時還要兼顧算力和運行效率。
![]()
零樣本性能、訓練數據規模以及VisionTransformer編碼器的1K分辨率吞吐量。TuringViT僅使用10%的訓練數據,就實現了比領先的開源基線模型更強的準確性與效率權衡。
據小鵬介紹,TuringViT圍繞模型架構、數據治理和訓練方式進行了優化。官方數據顯示,該模型僅使用約10%的訓練數據,便達到甚至超過部分主流開源視覺模型的性能,同時在高分辨率場景下具備更高運行效率。
對于智能汽車而言,這意味著車輛能夠以更低算力成本完成更復雜的環境感知,從而進一步提升輔助駕駛系統在復雜路況、狹窄道路、特殊交通參與者識別等場景下的表現。與此同時,也有望降低智能駕駛系統開發和部署成本。
![]()
TuringViT的塊架構和模型配置。 (左)主干建立在重復的圖靈塊,圖靈線性注意力(TLA)聚合全局上下文;其序列長度感知歸一化和輸入依賴的輸出門可穩定可變標記訓練并保持高頻局部細節。 (右)TuringViT-18L和TuringViT-24L的模型配置,在共享相同補丁大小(16×16)的同時,采用2D RoPE,以塊和總層數為尺度,嵌入/頭部維度,以及多層感知器(MLP)比例。
值得關注的是,這項技術并不僅局限于汽車。按照官方規劃,TuringViT未來將同時應用于智能駕駛、智能座艙以及IRON人形機器人,成為小鵬物理AI體系的重要視覺基礎平臺。
今年以來,隨著AI大模型快速發展,國內多家車企紛紛加快布局AI底層能力。從世界模型到端到端智能駕駛,再到如今的視覺基礎模型,行業競爭重點正從單一功能比拼,逐漸轉向算法、數據和算力等核心能力建設。
業內普遍認為,未來智能汽車競爭不僅取決于硬件配置,更取決于底層AI模型的持續迭代能力。誰能夠構建更高效、更低成本、更易訓練的基礎模型,誰就有望在智能駕駛、智能座艙乃至具身智能等多個領域形成更大的技術優勢。
隨著AI技術不斷向汽車產業滲透,車企之間的競爭也正在從產品競爭升級為底層技術體系競爭,而視覺大模型正成為這一輪競爭的重要方向之一。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.