本報記者 張偉
當人工智能從“拼模型參數”轉向“拼數據質量”,什么樣的數據能真正驅動科學發現,正成為業界關注的焦點。
7月17日,在2026世界人工智能大會主論壇上,中國工程院院士、之江實驗室主任王堅提出,未來真正重要的“不是訓練一個更大的語言模型,而是讓科學數據成為基礎模型的原住民”。幾乎在同一時間,大會靜安人工智能應用創新示范區內,北京八月瓜科技有限公司展出的“擎策”全球科技情報檢索分析平臺,把全球專利、科技文獻與產業信息,轉化為可供AI調用的“科學數據燃料”,幫助科研人員和創新型企業“看準路、走穩路”。
從“找不到、看不懂”到為創新裝上“導航地圖”
在科技創新鏈條中,情報缺失是長期存在的痛點。重復研發、誤踩他人專利“雷區”,往往讓創新主體付出高昂代價。
“創新主體做科研、做產品,最怕兩件事:一是重復研發,二是踩到別人的專利‘雷區’。”八月瓜科技董事長李長青表示,平臺匯聚全球178個國家和地區的專利數據、科技文獻和產業信息,利用AI和自研大模型進行清洗、標引、關聯和分析,“本質上解決的是‘少走彎路’和‘安全走路’的問題”。
據介紹,該平臺采用五層遞進式架構,從底層的科創全息數據層到上層的用戶應用層,覆蓋研發前情報檢索、研發中專利導航、研發后成果轉化與評價的全流程。企業提供的數據顯示,平臺目前已構建超2億條專利數據、總量26億條的多維科技數據體系,服務超萬家科技企業及高校科研院所等機構。某大型裝備制造企業利用該平臺進行專利導航后,在新型材料研發方向上提前規避了海外巨頭的專利壁壘,研發周期縮短近5個月。
垂直大模型啃下專利“硬骨頭”
專利數據雖有價值,卻并不好用。作為兼具技術與法律雙重屬性的文書,專利術語化程度高、權利要求層層嵌套,還包含大量結構式、附圖等非文本信息,機器難以直接讀取利用。
李長青介紹,團隊自主研發的“妙算大模型”和“擎策”平臺采用“機器+專家”兩級模式:機器負責規模化清洗、去重和多維度標引,專家負責深度標注,將專利拆解到技術問題、技術方案、創新點等精細顆粒度。據了解,“妙算大模型”是專注于知識產權領域的垂直大模型,獲科技部“新一代人工智能國家科技重大專項”支持,旨在解決通用模型在專利場景中“不懂行、不精準”的問題。
公司近期已完成超4億元新一輪融資,由北京市人工智能基金等國有資本領投,資金將重點用于全球數據資源整合與“妙算大模型”持續迭代。
專利數據:AI for Science的“核心燃料”
在業界看來,高質量數據集正成為人工智能下一階段競爭的關鍵。王堅院士“讓科學數據成為基礎模型的原住民”的判斷,正指向這一趨勢。
在八月瓜看來,以專利為主的科技數據,正是賦能AI for Science的核心燃料之一。李長青將專利數據比喻為科技創新的“濃縮鈾”:“全球90%以上的技術情報首先通過專利公開,專利數據兼具技術屬性與法律屬性,在來源可信、質量可信、應用可信三個維度上都有天然優勢。”這一判斷,與當前學界對科學數據價值的重新認識形成呼應。
據企業測算,該平臺在充分利用專利情報的條件下,可幫助創新主體降低約40%研發成本、縮短約60%研發時間。李長青透露,八月瓜下一步將打造“專利數據+期刊論文數據”融合圖譜。
從北京到靜安:數據服務加速融入區域科創生態
作為一家北京企業,八月瓜此次選擇在上海靜安的示范區展示,折射出高質量數據服務正跨區域融入長三角科創生態。
“靜安區是數據智能產業高度集聚、應用場景豐富的區域。”李長青表示,希望把“AI+知識產權數據”的服務能力帶到靜安、帶到上海,與區域內的創新主體一起,把專利數據這種“戰略資源”轉化為科研成果和產業競爭力,并將加深與靜安、與上海的合作。
從主論壇的前沿判斷,到展臺上的產業實踐,專利數據正從沉睡的文獻庫變為可被AI調用的創新要素。當科學數據真正走入模型、走向產業,如何讓這類高價值數據更好地流動、復用與增值,或將成為下一階段科技創新的重要命題。
![]()
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.