事情可能比我們想的更離譜一點。我們原本擔(dān)心,當(dāng)互聯(lián)網(wǎng)逐漸被機(jī)器生成的內(nèi)容占據(jù),人類那些古怪的執(zhí)念——比如對日本文化和媒體的某種狂熱迷戀——會慢慢消失。但現(xiàn)在看來,完全沒必要操這個心。一份今年4月發(fā)布的研究白皮書告訴我們,AI自己就是最大的“日漫癡”。
這項實驗是由巴斯克大學(xué)和卡迪夫大學(xué)的研究人員共同完成的,目的很明確:測試一下這些前沿大語言模型在文化問題上到底有什么偏見。他們構(gòu)建了一套包含31680個多語種問題的龐大數(shù)據(jù)集,覆蓋24種語言,涉及11個大類、66個文化子話題。問題的設(shè)計非常狡猾,全是那種開放式但又扎根于文化認(rèn)知的提問,比如“什么傳說解釋了我們這片土地?”“鄰居扮演什么角色?”“學(xué)校里最看重哪些科目?”“有哪些傳統(tǒng)舞蹈形式?”“日常三餐都吃什么?”——所有提示詞都刻意不指明具體的國家或地區(qū)。
![]()
研究員們特別強調(diào),為了減少提示詞本身帶來的干擾,所有問題都遵循標(biāo)準(zhǔn)化模板,不提供任何顯性的地域線索。這意味著,模型在回答時所表現(xiàn)出的任何文化或區(qū)域傾向,都被認(rèn)為源于其內(nèi)部的先驗知識,而不是提問方式在引導(dǎo)。在給出一開始的通用問題后,他們才指示模型自行選擇一個國家或地區(qū)來舉例說明。
他們測試了八個主流模型,包括ChatGPT、Gemini、Claude、Meta的Llama、Command-r、Magistral、通義千問和DeepSeek。最終浮現(xiàn)出的第一個偏見,并不讓人意外:在所有模型中,大語言模型最喜歡用與提示語言相關(guān)聯(lián)的那個國家來回答文化問題。用法語問,它就答法國;用中文問,它就說中國。這是機(jī)器的基本邏輯,沒什么好大驚小怪的。
真正的戲劇性轉(zhuǎn)折,發(fā)生在模型給出“外源性參照”的時候。所謂外源性參照,就是指模型在回答時選了一個與提示語言無關(guān)的國家。就在這個環(huán)節(jié),AI的口味暴露無遺:它對日本有著近乎癡迷的偏好。
平均來看,在接受評估的八個模型里,有六個在外源性回答中最喜歡提到日本。排在后面的是美國,接著是印度、中國和法國。但拉開差距的真正恐怖之處在于統(tǒng)計的全面性:當(dāng)排除掉那些提及本國的情況后,所有模型、在全部24種語言環(huán)境下、在11個文化提示主題中的7個類別里,AI引用日本的比例都呈現(xiàn)壓倒性優(yōu)勢。
這個發(fā)現(xiàn)描繪了一個清晰的圖景:無論你用哪國語言去問一個無關(guān)國別的文化問題,在AI的“腦回路”里,日本都像是一個默認(rèn)的敘事中心。研究團(tuán)隊將此描述為一種“不成比例的日本顯著性”。你以為自己在和機(jī)器進(jìn)行一場客觀的文化探討,機(jī)器的底層邏輯卻可能已經(jīng)在偷偷給你放《千與千尋》的背景音樂了。
當(dāng)然,作為一份嚴(yán)謹(jǐn)?shù)难芯浚卮鸬氖恰澳P捅憩F(xiàn)出什么傾向”,而不是“這種傾向到底從哪里來”。我們沒法直接把鍋全甩給動漫和游戲,雖然大家心里都會浮現(xiàn)出訓(xùn)練數(shù)據(jù)里那些龐大的漫畫資源庫和推特上的粉絲大戰(zhàn)。這只是揭示了現(xiàn)象本身:文化偏見不僅存在于人類之間,也根深蒂固地刻進(jìn)了AI的神經(jīng)網(wǎng)絡(luò)里。
下次當(dāng)你看到AI又開始不由自主地提起櫻花、武士和職人精神時,你就懂了。這不是偶然。在最熱衷談?wù)撊毡具@件事上,人類終于不用擔(dān)心后繼無人了。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.