“商業智能體超級工廠”在2026世界人工智能大會上首次亮相,螞蟻數科給出了一組關鍵數字:在金融專業場景里,智能體的回答準確率基本可以達到90%-95%以上,與專業人員的勝合率超過85%。螞蟻數科副總裁、中國區業務發展部總經理孫磊在WAIC現場接受36氪專訪時,圍繞這些數據背后的行業化、場景化、生態化路徑,拆解了當前企業級AI落地的真正瓶頸與解法。
“從去年到今年,AI已經從過去通用的問答模式,發展到今天可以幫助用戶完成任務、解決問題的智能體階段。”孫磊說。在螞蟻數科看來,行業正在經歷三重變化:AI從通用場景進入垂直行業,智能體在業務場景中解決實際問題,以及從個人效率提升走向組織協同升級。這些判斷構成了“商業智能體超級工廠”的出發點。
![]()
此次發布的Agentar 2.0平臺首批預置近200個崗位級數字專家模板,同時提供數百個可訂閱的Skills級智能體工具,企業可以按崗位和經營需求直接啟用,無需從零開始搭建。孫磊表示,將螞蟻自身20多年的技術積累和垂直大模型能力沉淀為標準化產品,能夠讓不同類型的企業都獲得類似的技術能力。
金融行業是這套思路首先需要站穩的領域。安全合規、專業度與幻覺控制、以及效果驗證,構成了孫磊總結的金融機構擁抱智能體的三大核心顧慮。
在安全和合規方面,螞蟻數科依靠的是在金融、支付、財富管理、保險等場景中積累的風控與合規經驗。“沒有安全能力和風險控制體系,AI很難真正落地金融場景。寧愿不做,也不能犯錯。”孫磊說。第二個難題是專業度,也就是通用大模型在面對高度專業的金融問題時,容易出現不準確甚至幻覺。螞蟻數科的應對方式是用行業垂直大模型疊加業務工程化能力,把業務語言轉化為技術能力,從而提升回答的專業水平。
效果驗證則是更進一步的問題。金融機構在信息化和數字化上投入巨大,因此在AI轉型中格外關注如何衡量價值、驗證ROI。螞蟻數科為此提出了“價值交付、效果付費”理念,用兩個維度來量化智能體的專業表現:一是回答準確率,在垂直場景中已達到90%-95%以上;二是“勝合率”,即讓專業人員和智能體回答同一問題,比較結果的一致程度,目前這一指標超過85%。孫磊解釋,這相當于檢驗智能體是否真的吸收了專業知識,而不是給出泛泛的回答。
超出金融行業,螞蟻數科正在將這套能力向制造、醫療、工業等領域延伸。這些傳統行業在從數字化走向智能化的過程中,面臨一些共性挑戰。孫磊將其歸結為兩個關鍵點:數據底層治理和業務場景結合能力。
數據治理被看作是行業垂直大模型的基礎。金融行業因為數字化程度較高,數據基礎相對完善,而制造、醫療等行業的數據環境更加復雜、形態多樣。為此,智能體超級工廠中整合了數據治理工具和相關能力,幫助企業先把底層數據整理清楚,再在此基礎上構建垂直場景模型。“如果底層數據沒有經過治理,就無法支撐垂直場景模型。”孫磊說,螞蟻數科的做法是結合自身的外部數據能力,再融合企業業務數據,形成行業專用的模型。
另一個壁壘是工程化能力,也就是把模型能力落地到具體業務流程中。孫磊提到了海外提出的Harness概念,核心正是將模型能力工程化。螞蟻數科的目標是打造一個符合中國行業特點的“行業版Harness”,并將相關組件進行API化和簡化,讓合作伙伴快速接入,圍繞各自的行業優勢進行創新。孫磊強調,這意味著智能體超級工廠不只是輸出模型,而是在行業化、場景化、生態化三個方向上提供完整的解決方案。
“未來不僅是個人能力提升,更重要的是團隊與團隊之間、業務與業務之間如何通過智能體實現協同,讓整個組織實現智能化升級。”在孫磊的設想中,當回答準確率和勝合率達到可用閾值,當底層數據和工程化工具被打通,商業智能體就能從輔助工具逐漸演變為數字專家,真正嵌入企業的業務流程并產生可衡量的業務結果。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.