![]()
出品|圓維度
7月6日,一場圍繞OpenAI旗艦模型GPT-5.5的信任危機在開發者社區全面引爆。數據顯示,這款被寄予厚望的“最智能模型”,在復雜編程任務中頻繁于516個推理Token處強制終止思考,近半數深度思考請求被精準截斷。更令人不安的是,有證據表明模型可能在用戶毫不知情的情況下被“偷換核心”。當付費用戶以為自己正使用最強算力攻堅難題時,系統或許已悄悄按下了暫停鍵。
“516”這個數字,成了GPT-5.5的命門
事情源于Codex開發者@vguptaa45的一次偶然發現。他在翻查后臺元數據時注意到,GPT-5.5的大量回復,其推理Token數量精準卡在516這個數字上。隨后在編號#30364的GitHub Issue中,開發者攤開了一份橫跨5個月的詳實統計:
分析窗口從2026年2月1日到6月27日,覆蓋390,195條響應級Token記錄、865個會話。其中,推理Token精確等于516的事件共計3,363次。GPT-5.5僅占全部響應量的19.3%,卻包攬了82.0%的“精準516”事件。更觸目驚心的是對比數據:GPT-5.5的“精準516/大于等于516”比例高達44.0%,而GPT-5.2僅為0.34%——前者是后者的近130倍。這種斷崖式、只針對單一模型的異常分布,幾乎不可能是大模型自然“思考”的結果。
詭異之處不止于此。數據顯示,“516現象”在2026年5月急劇惡化,當月精準516比例飆升至53.30%。然而與此同時,GPT-5.5的整體推理強度——無論是平均值還是P90分位——反而比2月到4月大幅縮水。一邊是“516死結”越卡越頻繁,一邊是模型整體“越想越少”。
這兩組矛盾的指標指向了一個令付費用戶細思極恐的可能:GPT-5.5在處理復雜、高風險任務時,正在被某種隱藏的“推理預算上限”或“截斷機制”悄悄按下暫停鍵。開發者嘗試復現的結果同樣令人不安——對同一提示進行10次運行,4次觸發了516推理Token問題,且每次均輸出錯誤答案。
“假思考”與“偷換模型”的雙重信任危機
這已不是GPT-5.5第一次陷入“降智”爭議。早在2026年5月下旬,就有用戶在X平臺爆料:使用GPT-5.5 Extended Thinking一兩個小時后,模型突然“變傻”,每個請求秒回,質量斷崖式下跌,但界面仍顯示為“GPT-5.5 Extended Thinking”。開發者Andrew Curran用一個巧妙方法驗證了問題——直接詢問模型訓練數據截止日期,得到的是2025年8月,而非GPT-5.5 Thinking應有的12月——這意味著他選擇了Thinking模式,系統實際執行的卻是Instant版本。
OpenAI官方幫助文檔甚至為此提供了“實證”:Plus用戶每3小時最多可發送160條GPT-5.5消息,用完后系統會自動切換至mini模型,直至配額重置——且全程沒有任何彈窗提示或模型標簽變化。
當用戶每月支付200美元訂閱Pro服務,卻可能在毫不知情中被切換到低配模型;當開發者開啟最高檔xhigh模式攻堅復雜任務,模型卻在516個Token處強制收工——這已不僅是技術Bug的問題,而是商業倫理與用戶信任的底線問題。截至發稿,OpenAI尚未就“516現象”發布官方修復聲明。有開發者已在GitHub上推出第三方代理工具試圖繞過這一限制,但這顯然不應是付費用戶本該承擔的成本。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.