12個(gè)國內(nèi)頂尖AI,1248次殘酷校驗(yàn),超4600萬民眾參與。
當(dāng)2026年美加墨世界杯的戰(zhàn)火點(diǎn)燃,賽場外的另一場“諸神之戰(zhàn)”也拉開帷幕——2026年世界杯期間,聯(lián)想集團(tuán)與咪咕視頻共同發(fā)起“世界杯預(yù)測人機(jī)大戰(zhàn)”。聯(lián)想天禧AI作為召集者,與DeepSeek、千問、中移九天、百度文心、騰訊混元、Kimi、智譜、MiniMax、階躍、訊飛星火和商湯小浣熊組成AI預(yù)測陣營,與體育嘉賓、專業(yè)人士和數(shù)千萬普通用戶面對同一張賽程表。
這是全球首個(gè)由多個(gè)AI大模型與全民同場參與、覆蓋世界杯完整賽程、由真實(shí)賽果逐場驗(yàn)證的人機(jī)預(yù)測產(chǎn)品。世界杯開賽前,AI與用戶共同預(yù)測32強(qiáng)晉級名單;開賽后,預(yù)測覆蓋全部104場比賽,圍繞勝平負(fù)、精確比分和冠軍歸屬持續(xù)作答。隨即開播的綜藝節(jié)目《人機(jī)大戰(zhàn):誰是世界杯預(yù)言家》,則使這場持續(xù)一個(gè)多月的實(shí)驗(yàn)徹底破圈,成為可以被觀看、被討論的公共事件。
截至7月12日,第100場世界杯比賽結(jié)束,這場人機(jī)預(yù)測實(shí)驗(yàn)已經(jīng)積累起一組足夠完整的連續(xù)樣本。聯(lián)想集團(tuán)與咪咕發(fā)布《世界杯預(yù)測人機(jī)大戰(zhàn)百場觀察——AI的優(yōu)勢、差異與邊界》報(bào)告,對前100場比賽的預(yù)測結(jié)果進(jìn)行系統(tǒng)統(tǒng)計(jì):AI共完成1200次勝平負(fù)判斷,命中788次,整體命中率為65.7%,比同期公眾用戶58.9%的平均命中率高出6.8個(gè)百分點(diǎn)。
AI大模型的能力驗(yàn)證,長期依賴實(shí)驗(yàn)室榜單和標(biāo)準(zhǔn)化測試的技術(shù)指標(biāo),但與真實(shí)應(yīng)用場景始終存在距離。在聯(lián)想的搭臺下,來自不同廠商、彼此競爭的11個(gè)AI大模型,首次被置于同一規(guī)則卻又持續(xù)變化的極限場景下接受連續(xù)檢驗(yàn),形成了一份跨廠商、真實(shí)場景、公開可驗(yàn)證的AI能力樣本。
人機(jī)大戰(zhàn)從此進(jìn)入下一個(gè)階段。
從棋盤到綠茵場:機(jī)器第一次走出了封閉系統(tǒng)
1997年,IBM Deep Blue擊敗國際象棋世界冠軍加里·卡斯帕羅夫。
國際象棋擁有確定規(guī)則、完整信息和明確勝負(fù)。機(jī)器的核心優(yōu)勢來自計(jì)算速度、局面搜索和評估深度。Deep Blue證明,在邊界清晰的復(fù)雜任務(wù)中,計(jì)算機(jī)可以找到人類頂尖棋手也難以應(yīng)對的行動(dòng)路徑。
2016年,AlphaGo以4比1擊敗李世石。
圍棋的狀態(tài)空間遠(yuǎn)大于國際象棋,單純依靠窮舉已經(jīng)不可行。AlphaGo通過神經(jīng)網(wǎng)絡(luò)、強(qiáng)化學(xué)習(xí)和自我對弈形成策略判斷。機(jī)器開始處理直覺、形勢和長期收益,但棋盤、合法動(dòng)作和勝負(fù)條件仍然明確。
2017年,Libratus在無限注德州撲克中擊敗四名職業(yè)牌手。
撲克引入了隱藏信息和欺騙。機(jī)器看不到對手手牌,需要在信息不完整的條件下推斷對方策略,并避免自己的行動(dòng)被識別和利用。人機(jī)大戰(zhàn)由完全信息博弈進(jìn)入不完全信息博弈。
2019年,AlphaStar在《星際爭霸Ⅱ》中達(dá)到宗師級水平。
即時(shí)戰(zhàn)略游戲進(jìn)一步加入實(shí)時(shí)操作、資源分配、局部信息和多任務(wù)管理。機(jī)器需要同時(shí)處理短期戰(zhàn)斗和長期發(fā)展,并根據(jù)不斷變化的戰(zhàn)場調(diào)整行動(dòng)。
這些比賽的難度持續(xù)上升,卻擁有一個(gè)共同條件:機(jī)器始終在一個(gè)預(yù)先設(shè)定的系統(tǒng)中行動(dòng)。游戲規(guī)則明確,結(jié)果評價(jià)明確,機(jī)器能夠通過重復(fù)訓(xùn)練生成大量相似樣本。即使對手的策略難以預(yù)判,機(jī)器仍可以選擇動(dòng)作、影響局面,并從每一次結(jié)果中修正下一步。
這是一個(gè)邊界清晰的封閉系統(tǒng):無論對手是國際象棋冠軍、圍棋高手、撲克牌手還是游戲選手,AI證明自己的方式,始終是在一個(gè)可以被窮盡或反復(fù)模擬的確定系統(tǒng)里,找到比人類更優(yōu)的策略。
世界杯預(yù)測人機(jī)大戰(zhàn)改變了這一前提。AI不在場上踢球,無法決定陣型、換人和射門,也無法讓同一場比賽重新進(jìn)行。它只能讀取賽前可以獲得的信息,然后等待22名球員、教練、裁判和現(xiàn)場環(huán)境共同產(chǎn)生唯一一次結(jié)果。傷病、紅牌、天氣、球員發(fā)揮、臨場換人、積分策略和心理狀態(tài),都可能改變比賽,其中一部分信息無法提前完整進(jìn)入數(shù)據(jù)。
這套機(jī)制提供了實(shí)驗(yàn)室測評難以復(fù)制的條件:一是題目公開。所有參與者面對相同的對陣和基本賽前信息;二是答案公開。終場哨響之后,賽果不會因模型、用戶或品牌而改變;三是評分公開。勝平負(fù)、比分和晉級結(jié)果按照統(tǒng)一口徑結(jié)算;四是失誤公開。模型的命中、分歧、共識和集體誤判進(jìn)入節(jié)目、媒體和社交平臺,接受持續(xù)復(fù)盤。
這不是完全可控的科學(xué)實(shí)驗(yàn)。不同賽段的難度、信息量和比賽類型都在變化,歷史數(shù)據(jù)可以告訴AI哪一種結(jié)果更可能出現(xiàn),但AI卻無法預(yù)知場上的變化,任何一次失誤、一次反擊甚至最后幾分鐘的機(jī)會,都可能決定一支球隊(duì)的命運(yùn)。104場比賽也不再是棋盤上同一道題的重復(fù)計(jì)算,而是104個(gè)條件不斷變化、信息并不完整的獨(dú)立事件。
AI們,歡迎來到持續(xù)變化的開放系統(tǒng)。
百場數(shù)據(jù)全景:AI沒有神話,只有邊界
“我們并不試圖尋找一個(gè)無所不知的‘大預(yù)言家’,而是希望通過連續(xù)百場數(shù)據(jù),觀察多個(gè)AI在真實(shí)場景中展現(xiàn)了什么能力、形成了什么差異,又暴露出了哪些共同邊界。”前述聯(lián)想《人機(jī)大戰(zhàn)百場觀察》報(bào)告指出。
該報(bào)告給出了最重要的階段性結(jié)論:第一,AI的優(yōu)勢是長賽程磨出來的,不是從一開始就存在。 6月13日,AI命中率只有43.8%,公眾用戶為54.4%,AI一度落后10.6個(gè)百分點(diǎn);到6月18日,AI升至48.6%,公眾降至45.0%,兩條曲線首次交叉完成反超;此后AI整體保持領(lǐng)先,到第100場結(jié)束時(shí),將差距擴(kuò)大至6.8個(gè)百分點(diǎn)。咪咕視訊副董事長、總經(jīng)理李黎將這一現(xiàn)象概括為“平均值的提升”:AI更擅長在高頻、連續(xù)、信息復(fù)雜的場景中抬高長期判斷的平均線,而不是把每一場比賽都變成確定答案。
![]()
第二,沒有一個(gè) AI 能通吃:每個(gè)賽段都有不同“冠軍”。具體而言,賽前32強(qiáng)預(yù)測中,騰訊混元以29/32命中率排名第一;72場小組賽結(jié)束,中移九天與騰訊混元并列首位;32進(jìn)16階段,千問以87.5%的命中率單獨(dú)領(lǐng)先;16進(jìn)8階段,騰訊混元、Kimi和訊飛星火三家并列;8進(jìn)4階段,9個(gè)模型同時(shí)打出4場全中;截至前100場累計(jì)總榜,中移九天以71場暫居第一,但僅領(lǐng)先第二名1場,前六名之間的差距也只有3場。
![]()
連續(xù)命中紀(jì)錄又給出了不同的排名。千問曾連續(xù)命中14場,階躍連續(xù)命中13場,MiniMax連續(xù)命中12場。擁有最長連續(xù)命中紀(jì)錄的模型,并未成為百場累計(jì)總榜第一。短期連續(xù)判斷準(zhǔn)確,與長賽程中持續(xù)減少失誤,是兩種不同能力。
聯(lián)想《人機(jī)大戰(zhàn)百場觀察》指出,世界杯最終會產(chǎn)生一支冠軍球隊(duì),但這場 AI 預(yù)測實(shí)驗(yàn)很難用一個(gè)“冠軍”概括。只看 32 強(qiáng)預(yù)測、某輪淘汰賽、最長連續(xù)命中或累計(jì)總榜,都會得到不同答案。樣本越短,單場結(jié)果對排名的影響越大;樣本越長,持續(xù)減少失誤的能力越重要。
因此,這一條持續(xù)走高的AI預(yù)測領(lǐng)先曲線,本質(zhì)上是12份答卷疊加出來的平均值,而不是任何單一模型獨(dú)自完成的勝利。同時(shí),不同模型的優(yōu)勢具有明顯的場景和階段特征,AI的能力應(yīng)當(dāng)在連續(xù)、分層和可驗(yàn)證的數(shù)據(jù)中衡量。
當(dāng)AI失靈:預(yù)測市場的盲區(qū)
全球市場里還存在一套歷史更悠久、邏輯完全不同的概率生成機(jī)制——預(yù)測市場。
以本屆世界杯為例,全球最大的預(yù)測市場平臺Polymarket上,圍繞“世界杯冠軍”單項(xiàng)市場的累計(jì)交易額已超過42億美元。這類平臺通過讓數(shù)千名參與者用真實(shí)資金實(shí)時(shí)聚合分散在市場中的信息與判斷,價(jià)格隨新信息持續(xù)更新。
預(yù)測市場產(chǎn)品和“人機(jī)大戰(zhàn)”的邏輯并不一致:前者靠著“信息越有價(jià)值、下注意愿越強(qiáng)”這一經(jīng)濟(jì)激勵(lì)機(jī)制,自發(fā)篩選出群體智慧,針對概率投票;后者依靠的是大模型對結(jié)構(gòu)化歷史數(shù)據(jù)和實(shí)時(shí)信息的整合推理。
但是,聯(lián)想《人機(jī)大戰(zhàn)百場觀察》報(bào)告的另一個(gè)結(jié)論,有效驗(yàn)證了預(yù)測市場的盲區(qū):系統(tǒng)性偏差。
學(xué)界早就發(fā)現(xiàn),預(yù)測市場里的參與者存在一種“非勝即負(fù)”的思維定式,會系統(tǒng)性低估平局發(fā)生的概率。此次人機(jī)大戰(zhàn)則驗(yàn)證了這一現(xiàn)象:面對76場最終分出勝負(fù)的比賽,12個(gè)AI的方向命中率達(dá)到81.0%,高于公眾用戶的71.8%;但在24場平局中,AI與公眾的命中率分別降至17.0%和16.0%。AI在勝負(fù)題上建立的明顯優(yōu)勢,到了平局幾乎完全消失。
前100場比賽中,有15場出現(xiàn)12個(gè)AI全部判斷錯(cuò)誤,其中11場來自平局,另外4場由賽前不被看好的一方獲勝。平局占集體失準(zhǔn)的近四分之三,構(gòu)成AI預(yù)測中最穩(wěn)定、最清晰的難題。
![]()
AI和人類都習(xí)慣尋找一個(gè)勝者,也都系統(tǒng)性低估了比賽不分勝負(fù)的可能。平局是比賽過程對紙面實(shí)力的一次折損:強(qiáng)隊(duì)可能占據(jù)控球和射門優(yōu)勢,卻遲遲無法進(jìn)球;弱隊(duì)可能通過密集防守壓低比賽節(jié)奏。在本次世界杯大放異彩的西非島國佛得角,正是靠著這一戰(zhàn)術(shù),以及門將沃齊尼亞精湛技術(shù)和非凡表現(xiàn),逼平西班牙、戰(zhàn)平烏拉圭,讓AI與人類預(yù)測“集體翻車”。
無論是靠資金定價(jià)的市場,還是靠數(shù)據(jù)推理的模型,這類藏在戰(zhàn)術(shù)意圖和臨場發(fā)揮里的信息,都很難被結(jié)構(gòu)化數(shù)據(jù)充分捕捉——市場和模型,在這一點(diǎn)上沒有本質(zhì)區(qū)別。
據(jù)聯(lián)想《人機(jī)大戰(zhàn)百場觀察》報(bào)告統(tǒng)計(jì),前100場中,有40場比賽出現(xiàn)12個(gè)AI 全票判斷同一方向,其中10場全票一致卻集體失準(zhǔn)。“AI最危險(xiǎn)的時(shí)候,未必是意見分裂,而可能恰恰是所有模型都覺得自己不會錯(cuò)的時(shí)候。”報(bào)告指出,高共識意味著多個(gè)模型可能從相似信號中提取出相近結(jié)論,但當(dāng)關(guān)鍵變量沒有被納入時(shí),反而可能放大共同盲區(qū)。
這背后的機(jī)制在于,當(dāng)多個(gè)AI大模型共享相近的信息來源與權(quán)重體系時(shí),它們給出的與其說是相互獨(dú)立的判斷,不如說是在同一概率空間里做的收斂計(jì)算。而一旦走向低概率場景,這種收斂反而會放大系統(tǒng)性偏差。
這也是本次“人機(jī)大戰(zhàn)”更具產(chǎn)業(yè)參考價(jià)值的地方:在金融市場、供應(yīng)鏈預(yù)測以及企業(yè)決策系統(tǒng)中,如果多個(gè)AI模型被同時(shí)用于需求預(yù)測、風(fēng)險(xiǎn)評估或資源配置,并且底層依賴相似的數(shù)據(jù)源與推理邏輯,那么一旦外部環(huán)境發(fā)生結(jié)構(gòu)性變化,這些模型可能同時(shí)低估或高估風(fēng)險(xiǎn),從而形成同步性決策偏差。
AI贏下平均值,人類創(chuàng)造峰值
6月30日晚,《人機(jī)大戰(zhàn):誰是世界杯預(yù)言家》節(jié)目連線了一位29歲的重慶彭水貼磚工人李先生。他從2014年巴西世界杯開始看球,是C羅的鐵桿粉絲。這一次,他在32強(qiáng)晉級名單的競猜中32中31,力壓場上所有AI模型和專業(yè)解說,成為“全場唯一”。按照世界杯擴(kuò)軍至48隊(duì)后的賽制,小組賽階段要從12個(gè)小組預(yù)測出32支晉級球隊(duì),若完全隨機(jī)填寫,最終32中31的概率約為1.81億分之一,相當(dāng)于連續(xù)猜對27到28次硬幣正反面。
按聯(lián)想《人機(jī)大戰(zhàn)百場觀察》報(bào)告測算,在純隨機(jī)選擇和掌握分組信息兩種簡化假設(shè)下,31/32分別對應(yīng)約1/1.81億和1/212萬的參照概率——這使他成為超過3500萬參與用戶中最突出的個(gè)體。他的判斷更多來自長期看球積累的經(jīng)驗(yàn)。
![]()
這個(gè)樣本不能證明人類整體比AI更準(zhǔn)確,也不能證明這名球迷能夠在下一屆比賽中復(fù)制同樣的成績。它說明的是,即使機(jī)器已經(jīng)提高了整體平均水平,人類個(gè)體仍可能依靠長期觀賽經(jīng)驗(yàn)、對特定球隊(duì)的熟悉程度和獨(dú)立判斷,達(dá)到所有模型都未能抵達(dá)的高點(diǎn)。
心理學(xué)家菲利普·泰特洛克通過長期主持的“良好判斷力項(xiàng)目”發(fā)現(xiàn),表現(xiàn)優(yōu)秀的預(yù)測者通常不依賴天賦或一次性的直覺。他們保持開放心態(tài),將判斷建立在多種可能之上,并根據(jù)新證據(jù)不斷修正結(jié)論。高質(zhì)量預(yù)測的關(guān)鍵,不在第一次是否押中,而在于能否持續(xù)吸收信息、校準(zhǔn)判斷并復(fù)盤錯(cuò)誤。
世界杯人機(jī)大戰(zhàn)呈現(xiàn)出相似的觀察維度。聯(lián)想《人機(jī)大戰(zhàn)百場觀察》報(bào)告披露,截至前60場,公眾用戶平均每場修改預(yù)測約1.04次,AI平均約1.6次;階躍平均每場修改約3.3次,累計(jì)調(diào)整220次。不同模型在答案更新頻率上存在明顯差異。
更新頻率本身不能證明判斷質(zhì)量更高。頻繁修改可能來自對新信息的及時(shí)響應(yīng),也可能意味著模型容易受到短期信號干擾。但它說明,開放世界中的預(yù)測能力不能只看初始答案,還要考察模型是否能夠識別新證據(jù),并在必要時(shí)改變原有結(jié)論。這正是前述“超級預(yù)測者”的心理學(xué)邏輯。
AI擅長處理大量結(jié)構(gòu)化信息,在連續(xù)任務(wù)中控制失誤,提高整體判斷的平均線;人類的表現(xiàn)更加分散,穩(wěn)定性較弱,卻可能憑借經(jīng)驗(yàn)、差異化信息和獨(dú)立判斷創(chuàng)造更高峰值。兩種能力并不互相否定,它們共同構(gòu)成了真實(shí)世界中的判斷結(jié)構(gòu)。
“AI提高的是整體平均水平,人類則留下了這個(gè)夏天最難忘的峰值時(shí)刻。”聯(lián)想《人機(jī)大戰(zhàn)百場觀察》報(bào)告總結(jié)道。
聯(lián)想:不做大模型,做全球AI生態(tài)的連接者
世界杯留下的,不只是一條65.7%的AI命中率曲線,也形成了一套把模型、場景、用戶和真實(shí)結(jié)果放進(jìn)同一體系的公開測試。作為全球AI生態(tài)鏈領(lǐng)軍企業(yè)聯(lián)想,正是扮演這個(gè)生態(tài)的組織者與連接者——在一個(gè)無法被完全計(jì)算的開放世界里,比“誰更準(zhǔn)”更重要的問題,是誰能把足夠多互相競爭的能力,持續(xù)、公開地連接進(jìn)普通人可感知的真實(shí)場景。
因此,對普通消費(fèi)者而言,這是一次AI預(yù)測技術(shù)下沉的科技狂歡;但對分析師和機(jī)構(gòu)投資者來說,它更像是聯(lián)想集團(tuán)過去40年在AI時(shí)代的一次公開定位。
組織人機(jī)大戰(zhàn)的主體——那個(gè)說服中國AI產(chǎn)業(yè)中彼此競爭最激烈的對手們出現(xiàn)在同一個(gè)平臺、共同參與104場比賽預(yù)測的公司——不是監(jiān)管,不是風(fēng)險(xiǎn)投資機(jī)構(gòu),也不是技術(shù)標(biāo)準(zhǔn)組織,而是聯(lián)想集團(tuán)。
世界杯讓聯(lián)想集團(tuán)找到了它在這場全球AI競賽中最擅長扮演的角色——不是站在臺前證明誰的模型更強(qiáng),而是把算力、模型、終端、供應(yīng)鏈和用戶連成一張網(wǎng)。
作為活動(dòng)的召集者,聯(lián)想天禧AI的表現(xiàn)也更貼近商業(yè)現(xiàn)實(shí)。它沒有在任何單項(xiàng)上拿到過第一,卻在賽前32強(qiáng)預(yù)測、72場小組賽、32進(jìn)16階段和前100場累計(jì)總榜四個(gè)關(guān)鍵節(jié)點(diǎn)上全部進(jìn)入前四,是12個(gè)AI中唯一全程不掉隊(duì)的模型。對于正在將智能系統(tǒng)接入供應(yīng)鏈、客戶服務(wù)和決策支持體系的企業(yè)而言,這種長期可靠性,往往比偶然的高光時(shí)刻更具實(shí)際意義。
若將AI生態(tài)從大模型向算力基建延伸,聯(lián)想之于全球AI生態(tài)鏈的價(jià)值則更為稀缺。從2024年Tech World 開始,英偉達(dá)、AMD、英特爾、Meta、微軟、高通等公司掌門人,就共同出現(xiàn)在聯(lián)想的AI敘事中。這些公司分處芯片、操作系統(tǒng)、云、模型、社交平臺和終端生態(tài)的關(guān)鍵位置,彼此之間既合作也競爭。它們愿意在同一場大會中出現(xiàn),早已說明聯(lián)想集團(tuán)在AI產(chǎn)業(yè)鏈中的核心地位:AI技術(shù)的落地者和商業(yè)變現(xiàn)者。
全球供應(yīng)鏈,是聯(lián)想集團(tuán)在物理世界的底座。就在世界杯期間,Gartner Top 25公布其2026年最新排名,聯(lián)想集團(tuán)首次進(jìn)入全球前五,刷新歷史記錄。聯(lián)想在全球10余個(gè)市場擁有30多個(gè)自營或合作制造基地、2000多家一級供應(yīng)商,每年處理超過1000萬條訂單線。這是聯(lián)想集團(tuán)能夠穿越地緣政治、存儲漲價(jià)等周期的護(hù)城河。AI時(shí)代的聯(lián)想供應(yīng)鏈也在演進(jìn):不僅提升自身風(fēng)險(xiǎn)預(yù)警與動(dòng)態(tài)調(diào)度產(chǎn)能的效率,更將這種智能協(xié)同能力開放給了其龐大的上下游生態(tài)伙伴。
“AI普惠的時(shí)代機(jī)遇,不屬于任何一家企業(yè),而是整個(gè)生態(tài)的共同機(jī)遇”,聯(lián)想集團(tuán)董事長兼CEO楊元慶表示,聯(lián)想集團(tuán)的AI新十年,絕非獨(dú)行的旅途,而是生態(tài)共贏之路。
從收購IBM全球PC業(yè)務(wù),到連續(xù)多年拿下Gartner全球供應(yīng)鏈Top 25亞太第一,再到在Tech World上將AI巨頭全部請上同一個(gè)舞臺,聯(lián)想集團(tuán)從未試圖在每一個(gè)時(shí)代的單一技術(shù)點(diǎn)上“贏者通吃”,它更擅長另一件事:形成一套穩(wěn)定、普惠的社會生產(chǎn)力,成為那個(gè)讓各方都無法繞過的連接者。
如果所有變量都能被算法窮盡,競技會失去魅力,商業(yè)也會失去價(jià)值——不可被預(yù)測的世界才迷人。而在充滿不確定性的真實(shí)世界,才更需要說到做到的連接者。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.