![]()
如今,大模型已經從拼參數、拼算力的“軍備競賽”,逐漸進入了拼落地、拼效果的“深水區”。一個越來越清晰的共識是:AI應用的天花板,不在模型本身,而在數據。
如果說2023年到2025年,企業關心的是AI能做什么,那么到了2026年,問題已經變成了AI憑什么能做,AI憑什么能給出準確的回答?憑什么能做出可信的決策?答案只有一個:數據。
但現實是,絕大多數企業的數據,還遠沒有做好準備。
數據拖了AI的后腿
Gartner曾在一份報告中指出,到2025年,80%的數據與分析計劃將無法大規模創造業務價值,其中數據孤島和數據質量問題是核心障礙。雖然這個預測多少有些悲觀,但企業在實際落地AI項目時的感受確實與之吻合——模型訓練出來了,推理框架搭好了,可一接上企業內部的真實數據,問題就全暴露了。
Denodo全球銷售副總裁兼大中華區總裁何巍向筆者分享了一個頗具代表性的案例:一家車企在推進AI問數項目時,雖然所有數據都放在一家頭部云廠商提供的數據倉庫里(也就是數據源是單一的),但查詢結果卻完全不可控。同一個問題問兩次,答案截然不同。
問題出在這個單一的數據源本身,其就像一個堆滿雜物的巨大倉庫,不同部門、不同時期產生的數據,雖然有統一的物理存放位置,但定義方式千差萬別。
這并非個案。一家企業內部的訂單可能在三套系統里有三種完全不同的定義:銷售簽了合同叫訂單,財務收了錢才叫訂單,售后開始服務了才叫訂單。當AI被要求計算訂單轉化率時,如果沒有人提前告訴它該用哪個系統的訂單做分子,它只能隨機抓取,結果自然是不可信的,且每次計算出來的結果也會不一樣。
更麻煩的是,企業每天產生的數據量正在以指數級增長。IDC的預測顯示,到2026年全球數據量將超過220ZB,其中企業級數據占比持續攀升。傳統通過ETL(抽取、轉換、加載)將數據物理復制到一個集中的數據倉庫或數據湖中的數據集成方式,正在變得越來越昂貴和低效。一家大型制造企業的IT負責人曾算過一筆賬:每復制一份數據到數據中臺,就意味著存儲成本、計算成本、運維成本的疊加,而數據中臺的規模還在不斷擴大。
打個比方,傳統的數據集成方式就像線下會議,所有人必須坐在同一個會議室里。但當企業遍布全球、數據分散在幾十個甚至上百個系統中時,這種“物理集中”的成本和難度已經高到不現實的地步。
而AI對數據的實時性要求,讓這個問題更加尖銳。傳統的數據中臺定期搬運數據,可能是T+1,甚至更慢。但AI問數要求的是“即問即答”,即用戶輸入一個問題,系統必須立刻從最新數據中給出答案。用昨天的數據回答今天的業務問題,在AI時代已經無法接受。
不搬家也能用上全公司的數據
這種背景下,企業需要一種科學的數據架構方式,來應對AI時代對數據實時性、準確性、安全性和可解釋性的全新要求。
此時,數據虛擬化技術成為企業數據管理架構中不可或缺的中間件。與傳統的ETL不同,數據虛擬化并不物理復制數據,而是通過軟件在分散的數據源之上建立一個“邏輯層”。打個比方:傳統做法是把所有食材搬到一個中央廚房再開始做菜;數據虛擬化則是保留食材在各自倉庫,只給廚師一張“地圖”,告訴他每種食材在哪、怎么取用。
這個“地圖”就是諸如Denodo這類企業所構建的AI數據層。它不存儲數據本身,只存儲數據的“映射關系”,也就是一份關于“數據在哪、什么意思、誰能用”的目錄。
這么做有什么好處呢?首先,它不需要遷移數據,而是連接所有數據源,避免了數據復制帶來的成本與延遲。根據Denodo公開的案例數據,使用了其數據虛擬化平臺的企業,數據準備時間平均減少67%,相比傳統ETL方式節省65%的時間。
比如,某企業原先處理一天的數據需要8小時,采用數據虛擬化后,處理一整月的數據只需不到30分鐘。這種效率提升在AI時代尤其關鍵,AI應用需要頻繁調用、組合不同系統的數據,如果每次都要等ETL跑完,用戶體驗和業務響應速度都會大打折扣。
其次,在數據虛擬化架構中可以通過“語義層”,解決前文提到的各部門對“訂單”這個詞認知不統一的問題。企業可以在邏輯層預定義一套統一的業務語義,比如明確告訴系統財務訂單和銷售訂單的區別,以及在不同場景下該用哪個。這樣,當AI接收到用戶的自然語言提問時,首先是語義層將問題翻譯成數據能理解的語言,再由虛擬化層去各個數據源找到對應的數據。
最后,這套架構解決了AI時代安全方面最為關鍵的權限和合規的問題。在一個物理集中式的數據架構中,權限控制往往“一刀切”,要么能看全部數據,要么什么都看不到。而數據虛擬化層可以做到行級、列級的精細權限控制。更重要的是,對于跨國經營的企業,數據跨境傳輸是巨大的合規風險。數據虛擬化的邏輯連接方式,使得原始數據可以留在原地、不出境,只通過查詢接口被調用。這對于正在大規模出海的中國企業來說,是一個極具吸引力的架構選擇。
事實上,數據虛擬化并非全新概念,而之所以近年來才獲得廣泛關注,根本原因在于企業數據環境的復雜度已經到了傳統方法無法承受的地步。一家企業的數據可能分布在本地機房、多個公有云、SaaS系統、IoT設備等數十個來源中。要全部物理集中,不僅成本高昂,而且永遠跟不上業務變化的速度。
Denodo基于數據虛擬化技術構建的“AI數據層”,恰好承接了企業當下的核心訴求。依托這套架構,企業無需大規模遷移原始數據,就能打通全域數據鏈路,讓 AI 真正用上全域、實時、口徑一致的企業數據。
數據架構的重構
2026年初,Gartner在悉尼舉行的數據與分析峰會上發出警告:59%的IT領導者表示在尚未做好準備的情況下,便被推動采用生成式AI工具;61%的受訪者感受到來自高層的壓力。在這種被迫上馬的背景下,夯實數據基礎變得比以往任何時候都更加緊迫。
如果說過去兩年企業討論的是“AI能幫我看數據嗎?”,那么進入2026年,問題已經變成了“AI能替我用數據嗎?”在AI+BI已經成為一種業務模式的時候,AI對數據的調用不再是“用戶問一次、系統查一次”的簡單模式,而可能是一個智能體在完成一個復雜任務時,自主發起幾十次甚至上百次的數據查詢,這對數據架構提出了全新的要求。
換句話說,AI下一階段的競爭,不再只是模型之間的競爭,而是企業數據基礎設施之間的競爭。誰能在這個問題上率先給出令市場信服的答案,誰就有可能定義下一代企業AI的基礎設施標準。
在這個過程中,數據的“可發現性”變得格外重要了。過去,數據主要是給數據分析師、業務人員等,通過BI工具查詢、使用數據。但在智能體時代,數據的消費者很大一部分變成了機器人。人可以通過經驗判斷這個數據大概在哪個系統里,但機器人沒有這種直覺。它需要一個清晰、標準化的數據目錄,告訴它每個數據集在哪里、什么含義、怎么訪問。此時,據何巍介紹,Denodo推出的AI SDK,其核心價值之一就是為開發者提供標準化的接口(如MCP協議),讓AI智能體能夠像調用API一樣調用企業數據。
此外,AI時代,語義層也已成為企業數據管理的必選項。何巍向筆者坦言,如果三個月前問他“模型是否足夠聰明到自己去理解數據”,他的答案可能還不同。但在最近服務了數百家企業之后,他得出的結論是:模型再強,也解決不了語義不統一的問題。因為語義問題本質上是業務問題,而不是技術問題,不是靠喂更多數據給模型就能解決的。
Denodo 搭建的 AI 數據層,作為承載統一業務語義、統籌合規數據資產的核心樞紐,能夠補齊企業數據治理的關鍵短板。在今年 7 月上線的新版本 Denodo Platform 9.5,更是大幅強化了平臺內部語義與上下文智能能力,同時簡化企業內各團隊搭建、管理、共享可信數據產品的流程,讓智能體、BI 分析工具、自助數據應用均可獲取統一、實時、具備完整業務釋義的數據底座,從根源解決 AI 自主取數時口徑混亂、信息缺失的難題。
在這套全新的數據管理體系下,企業不需要推翻原先的數據中臺。對此,何巍表示,AI數據層可以作為數據中臺的補充而非替代,將中臺也作為一個數據源連接起來,避免重復搬運。
今天的世界復雜到不會用一個技術解決所有問題。數據中臺適合處理需要大量清洗、加工、貼標簽的確定性場景;數據虛擬化適合應對靈活、多變、實時的查詢需求。兩者是互補關系,而非替代關系。
AI 競爭的下半場,勝負手在于數據。企業若想突破 AI 落地的瓶頸,關鍵在于構建堅實的數據基礎設施。通過數據虛擬化等技術打造統一的 AI 數據層,打通數據孤島、統一業務語義,才能真正修好通往 AI 的“最后一公里”,讓模型發揮出應有的價值。
(文|Leo張ToB雜談,作者|張申宇,編輯丨楊林)
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.