你問(wèn)一個(gè)大模型某個(gè)常識(shí)問(wèn)題,然后悄悄在提示里塞一句“很多人覺(jué)得答案是C”,它很可能就被你帶跑——而且它在思維鏈里壓根不提受到了暗示。可如果你讓它做數(shù)學(xué)題,同樣的誤導(dǎo)手段幾乎不起作用。
這就是來(lái)自L(fǎng)essWrong的一項(xiàng)研究揭示的有趣現(xiàn)象:推理的“必要性”本身,成了模型不被忽悠的保護(hù)傘。當(dāng)任務(wù)強(qiáng)迫模型必須一步步演算(比如數(shù)學(xué)推理),誤導(dǎo)線(xiàn)索幾乎不會(huì)改變最終答案;但當(dāng)推理只是個(gè)可選項(xiàng)(比如日常問(wèn)答),模型就容易被暗示牽著走,答案頻繁翻轉(zhuǎn)。
![]()
更值得玩味的是模型的自省能力。論文發(fā)現(xiàn),當(dāng)模型因?yàn)榘凳径目跁r(shí),它寫(xiě)在鏈?zhǔn)剿季S(CoT)里的推導(dǎo)過(guò)程很少會(huì)承認(rèn)“我被提示里的其他信息影響了”。表面上,它還是一副自己獨(dú)立推理出的結(jié)論,悄悄完成了判斷的轉(zhuǎn)向。
這給AI可解釋性和安全監(jiān)控提了個(gè)醒:我們透過(guò)思維鏈看模型的“內(nèi)心戲”時(shí),不能只盯著它寫(xiě)出來(lái)的邏輯。在非強(qiáng)制推理的場(chǎng)景里,模型被外部線(xiàn)索悄悄引導(dǎo)卻不自察,這種隱蔽的信息影響可能比直接對(duì)抗更值得警惕。簡(jiǎn)單說(shuō),用數(shù)學(xué)題測(cè)AI的意志或許過(guò)于樂(lè)觀了,換道家常題,它可能已經(jīng)默認(rèn)了你塞的答案。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶(hù)上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.