GPT-5.6來(lái)了,但……這是個(gè)什么型號(hào)?
![]()
這次OpenAI沒(méi)有沿用過(guò)去大家熟悉的Pro、Mini、Instant這類(lèi)命名,而是一次性端出了三個(gè)名字:GPT-5.6 Sol、GPT-5.6 Terra、GPT-5.6 Luna。
Sol是太陽(yáng),Terra是地球,Luna是月亮。
聽(tīng)起來(lái)很花哨,像一個(gè)新的模型宇宙。但它其實(shí)還是我們熟悉的那套產(chǎn)品分層:一個(gè)最強(qiáng)的旗艦?zāi)P停粋€(gè)日常使用的均衡模型,一個(gè)便宜、快速、適合大規(guī)模調(diào)用的輕量模型。
OpenAI官方說(shuō)法是:GPT-5.6系列會(huì)在未來(lái)幾周全面開(kāi)放,但目前先應(yīng)美國(guó)政府要求,在Codex和API中向一小群“值得信賴(lài)的合作伙伴”進(jìn)行有限預(yù)覽。
讓我們先來(lái)了解一下已公開(kāi)的情報(bào)。
01
最高檔和GPT 5.5同價(jià)
OpenAI這次給GPT-5.6分了三檔:Sol、Terra、Luna。
按照官方說(shuō)法,Sol是旗艦?zāi)P停琓erra是面向日常工作的均衡模型,Luna則是快速、便宜的輕量模型。
三檔模型一口氣全放了出來(lái),基本對(duì)應(yīng)大模型產(chǎn)品里最常見(jiàn)的三層結(jié)構(gòu):最強(qiáng)模型負(fù)責(zé)能力上限,中間模型負(fù)責(zé)大多數(shù)日常任務(wù),輕量模型負(fù)責(zé)速度、成本和高并發(fā)調(diào)用。
從價(jià)格就能看出三者的層級(jí)。
按照OpenAI公布的API價(jià)格,GPT-5.6按每100萬(wàn)token計(jì)費(fèi):Sol是輸入5美元、輸出30美元;Terra是輸入2.5美元、輸出15美元;Luna是輸入1美元、輸出6美元。
![]()
相信大家可能注意到了:GPT-5.6 Sol雖然是新一代旗艦?zāi)P停珒r(jià)格對(duì)齊的是GPT-5.5標(biāo)準(zhǔn)版,而不是GPT-5.5 Pro。
Terra則直接降到GPT-5.5的一半,Luna只有GPT-5.5的五分之一。
GPT-5.5 Pro依然是當(dāng)前OpenAI最貴的模型,價(jià)格是輸入30美元/百萬(wàn)token,輸出180美元/百萬(wàn)token,價(jià)格是GPT-5.5標(biāo)準(zhǔn)版和GPT-5.6 Sol的6倍。也不知道之后會(huì)不會(huì)再出一個(gè)“更適合專(zhuān)業(yè)任務(wù)”的GPT-5.6 Universe(只是開(kāi)玩笑)。
Sol是這次GPT-5.6系列里的最高檔,也是官方公告里花最多篇幅介紹的模型。
OpenAI把GPT-5.6 Sol稱(chēng)為目前最強(qiáng)模型,重點(diǎn)展示了它在寫(xiě)代碼、生物研究和網(wǎng)絡(luò)安全上的能力。
簡(jiǎn)單說(shuō),Sol的定位是“最會(huì)干活的模型”,它對(duì)應(yīng)的不是普通聊天場(chǎng)景,是更復(fù)雜、更接近真實(shí)工作的任務(wù)。
比如在代碼場(chǎng)景里,它可以圍繞一個(gè)目標(biāo)持續(xù)推進(jìn):先理解問(wèn)題,再拆步驟,然后調(diào)用工具、運(yùn)行命令、檢查結(jié)果,出錯(cuò)了再改,直到任務(wù)完成。
為了支撐Sol處理更難的任務(wù),OpenAI給GPT-5.6引入了兩個(gè)新機(jī)制。
第一個(gè)叫max reasoning effort,可以翻譯成“最大推理強(qiáng)度”。
通俗理解,就是讓Sol有更多時(shí)間想清楚問(wèn)題、花更長(zhǎng)時(shí)間進(jìn)行深度推理,適合那些不能靠第一反應(yīng)解決的復(fù)雜任務(wù)。
第二個(gè)叫ultra mode,可以理解為“超強(qiáng)模式”。
這個(gè)模式的重點(diǎn)是讓多個(gè)子智能體一起參與復(fù)雜任務(wù),可以理解為:過(guò)去是一個(gè)AI助手自己干活,現(xiàn)在是一個(gè)“AI經(jīng)理”帶著幾個(gè)小助手分頭處理問(wèn)題,從而加快復(fù)雜工作的推進(jìn)。
![]()
Terminal-Bench 2.1就是一個(gè)更接近真實(shí)開(kāi)發(fā)流程的測(cè)試,考的是模型能不能在命令行環(huán)境里一步步解決問(wèn)題。GPT-5.6 Sol在該測(cè)試中拿到了88.8%的高分,Ultra模式下得分更高。
OpenAI特別提到,等模型更廣泛開(kāi)放時(shí),還會(huì)公布一套更完整的評(píng)測(cè)結(jié)果。
Terra是中間檔。
OpenAI對(duì)Terra的介紹沒(méi)有那么長(zhǎng),但定位很清楚:它是面向日常工作的均衡模型。
也就是說(shuō),它不一定追求最強(qiáng),但要在效果、速度和成本之間取得平衡。官方強(qiáng)調(diào),Terra的能力接近GPT-5.5,但價(jià)格便宜一半。
在OpenAI的設(shè)想中,Terra很可能才是GPT-5.6系列里最常用的那一檔。普通辦公任務(wù)很多時(shí)候不需要Sol那樣的最高能力,但需要穩(wěn)定、便宜、好用。
在Terminal-Bench 2.1測(cè)試中,GPT-5.6 Terra拿到了84.3%,和Claude Fable 5持平。
Luna則是最低成本檔。
OpenAI對(duì)Luna的定位也很簡(jiǎn)單:快,便宜,它適合大量、高頻、對(duì)成本敏感的任務(wù)。
比如批量摘要、文本分類(lèi)、信息抽取、簡(jiǎn)單問(wèn)答等等,這些任務(wù)本身不一定復(fù)雜,但調(diào)用量可能非常大。Luna的作用,就是把這些輕量任務(wù)用更低成本跑起來(lái)。
這三檔模型,Sol負(fù)責(zé)最高能力,Terra負(fù)責(zé)日常工作,Luna負(fù)責(zé)速度和成本,聽(tīng)起來(lái)花哨,但OpenAI只是把大模型行業(yè)已經(jīng)很成熟的分層重新包裝了一遍。
不過(guò)我覺(jué)得名字什么的并不重要,便宜好用就行。
02
性?xún)r(jià)比這一塊兒
只看官方公告,GPT-5.6 Sol這次放出的benchmark并不算多。OpenAI自己也說(shuō),現(xiàn)在只是為了讓外界提前了解模型性能,所以先分享一組評(píng)估結(jié)果。
但放出來(lái)的這組benchmark方向很明確,集中展示了三個(gè)領(lǐng)域:代碼、生物學(xué)和網(wǎng)絡(luò)安全。
前面提到的Terminal-Bench 2.1就屬于代碼方向,它考的是模型能不能在命令行環(huán)境里完成真實(shí)開(kāi)發(fā)流程,包括規(guī)劃、反復(fù)修改、調(diào)用工具和驗(yàn)證結(jié)果。
除了代碼,OpenAI還重點(diǎn)提到了一個(gè)生物學(xué)benchmark:GeneBench v1。
![]()
GeneBench v1評(píng)估的是長(zhǎng)周期的基因組學(xué)和定量生物學(xué)分析任務(wù),重點(diǎn)看模型能不能處理更接近真實(shí)科研流程的分析問(wèn)題。
按照OpenAI的說(shuō)法,GPT-5.6 Sol在GeneBench v1上比GPT-5.5表現(xiàn)更強(qiáng),而且使用的token更少。
第三個(gè)重點(diǎn)方向是網(wǎng)絡(luò)安全。OpenAI稱(chēng),GPT-5.6 Sol是它目前最強(qiáng)的網(wǎng)絡(luò)安全模型,尤其是在長(zhǎng)周期安全任務(wù)上(包括漏洞研究和漏洞利用相關(guān)任務(wù))。
這里有一個(gè)benchmark叫 ExploitBench——它不是一般的安全問(wèn)答,是更接近漏洞利用場(chǎng)景的評(píng)估。
OpenAI稱(chēng),在ExploitBench上,GPT-5.6 Sol的表現(xiàn)可以和Mythos Preview媲美,但只用了大約三分之一的輸出token。
雖然,官方給出的這張圖上還有一定差距。
![]()
可以看出,OpenAI這次反復(fù)強(qiáng)調(diào):他們?cè)谀芰?qiáng)的同時(shí),效率也特高。
更少的輸出token,意味著模型完成同類(lèi)任務(wù)時(shí)可能更簡(jiǎn)潔、更少繞路,也可能意味著實(shí)際調(diào)用成本更可控。
OpenAI還提到了另一個(gè)網(wǎng)絡(luò)安全benchmark:ExploitGym。
這個(gè)benchmark是UC Berkeley研究人員與OpenAI以及其他前沿實(shí)驗(yàn)室合作創(chuàng)建的。OpenAI說(shuō),在ExploitGym上,GPT-5.6 Sol、Terra、Luna三檔模型都顯示出明顯的網(wǎng)絡(luò)安全能力提升,而且隨著推理強(qiáng)度提高,表現(xiàn)也會(huì)變強(qiáng)。
意思是,GPT-5.6的提升不只是模型本體變強(qiáng),也和推理方式有關(guān)。給模型更多時(shí)間思考、讓它做更長(zhǎng)鏈條的推理,結(jié)果就會(huì)更好。
![]()
03
關(guān)于有限預(yù)覽
如果說(shuō)Sol、Terra、Luna是GPT-5.6表面上的變化,那么更值得關(guān)注的事情是,OpenAI這次沒(méi)有直接全面開(kāi)放。
按照官方公告,目前GPT-5.6只會(huì)先在Codex和API中,向一小群“值得信賴(lài)的合作伙伴”進(jìn)行有限預(yù)覽。
并且,這次有限預(yù)覽是“應(yīng)美國(guó)政府要求”進(jìn)行的,參與預(yù)覽的合作伙伴名單已經(jīng)和美國(guó)政府共享。
最近一段時(shí)間,美國(guó)政府正在明顯加強(qiáng)對(duì)前沿AI模型的介入,尤其是那些具備更強(qiáng)代碼、網(wǎng)絡(luò)安全和agent能力的模型。
今年6月,美國(guó)政府發(fā)布了新的AI網(wǎng)絡(luò)安全相關(guān)行政令,提出要建立一個(gè)自愿框架,讓前沿模型開(kāi)發(fā)者在模型更廣泛發(fā)布前,與政府進(jìn)行接觸和評(píng)估。
法律界對(duì)這份行政令的解讀是:它名義上不是強(qiáng)制許可、也不是正式審批制度,但已經(jīng)搭起了一個(gè)政府參與模型發(fā)布前評(píng)估的制度框架。
GPT-5.6 Sol“先小范圍預(yù)覽、名單與政府共享”的發(fā)布模式,可以看做前沿模型的發(fā)布流程里,第一次出現(xiàn)了清晰的政府介入痕跡。
OpenAI自己也在公告里解釋?zhuān)圆扇∵@種方式,是為了和政府一起探索一個(gè)可重復(fù)的流程,用來(lái)支持未來(lái)的模型發(fā)布。
政府介入背后,核心原因是網(wǎng)絡(luò)安全。
官方公告里,網(wǎng)絡(luò)安全占了非常大的篇幅:OpenAI一邊強(qiáng)調(diào)GPT-5.6 Sol是它目前最強(qiáng)的網(wǎng)絡(luò)安全模型,能在漏洞研究、漏洞分析、安全防御等長(zhǎng)周期任務(wù)上提供更強(qiáng)幫助;另一邊又花了大量篇幅解釋?zhuān)鼪](méi)有跨過(guò)自己的Cyber Critical門(mén)檻。
OpenAI的準(zhǔn)備框架里,把高風(fēng)險(xiǎn)能力分成不同等級(jí)。達(dá)到High,意味著模型可能放大已有的嚴(yán)重風(fēng)險(xiǎn);達(dá)到Critical,則意味著模型可能帶來(lái)前所未有的新型嚴(yán)重風(fēng)險(xiǎn)。
OpenAI反復(fù)強(qiáng)調(diào)GPT-5.6 Sol沒(méi)有達(dá)到Cyber Critical,其實(shí)是在告訴政府、客戶(hù)和公眾:這個(gè)模型很強(qiáng),尤其在網(wǎng)絡(luò)安全任務(wù)上很強(qiáng),但還沒(méi)有強(qiáng)到可以自主完成最危險(xiǎn)的網(wǎng)絡(luò)攻擊鏈。
網(wǎng)絡(luò)安全能力就像一把雙刃劍,它越強(qiáng),越能幫防御者找漏洞、寫(xiě)補(bǔ)丁、做安全測(cè)試;但也正因?yàn)樗軓?qiáng),政府也會(huì)擔(dān)心它被濫用。
雖然OpenAI承認(rèn)這次發(fā)布需要和政府一起摸索流程,但它也在官方公告里明確說(shuō)明,他們不認(rèn)為這種政府訪(fǎng)問(wèn)流程應(yīng)該成為長(zhǎng)期默認(rèn)機(jī)制。
理由是:如果最強(qiáng)工具總是被拖延開(kāi)放,用戶(hù)、開(kāi)發(fā)者、企業(yè)、網(wǎng)絡(luò)防御者和全球合作伙伴都會(huì)更晚拿到最好的工具。
某種意義上,前沿模型正在進(jìn)入一個(gè)新的發(fā)布階段。
當(dāng)大模型的能力集中到代碼、生物、網(wǎng)絡(luò)安全和智能體執(zhí)行這些領(lǐng)域,它就會(huì)開(kāi)始被當(dāng)成一種可能影響現(xiàn)實(shí)世界安全的技術(shù)。
而一旦技術(shù)被這樣看待,發(fā)布權(quán)就很難再完全留在公司自己手里。(作者/袁心玥)
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺(tái)“網(wǎng)易號(hào)”用戶(hù)上傳并發(fā)布,本平臺(tái)僅提供信息存儲(chǔ)服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.