文 | 字母AI
7月21日,谷歌突然上線了兩個新模型:
Gemini 3.6 Flash和Gemini 3.5 Flash-Lite。
沒有一點點防備,也沒有一絲顧慮,它倆就這樣出現在了Google AI Studio和Gemini的模型選擇器里。
![]()
這兩個模型,一個主打更強的代碼和Agent能力,一個主打更低成本的大規模調用。
而作為旗艦模型的Gemini 3.5Pro,千呼萬喚依然……出不來。
按照此前的計劃,3.5 Pro本應在6月份上線,現在7月都過一大半了,這款被寄予厚望的模型仍然沒有正式亮相。
代表旗艦實力的答卷遲遲不交,谷歌先拿出兩張“草稿紙”,是個什么意思?
3.6 Flash:比上一代便宜,不比上一代聰明
谷歌表示,相比上一代Flash模型,Gemini 3.6 Flash進一步提升了編碼、推理和工具調用表現,同時通過減少輸出token降低運行成本。
![]()
Gemini 3.6 Flash的定位是一個面向真實生產環境的高效模型,或者更直白一點,為Agent服務。
在Agent時代,一次任務可能需要幾十輪模型調用,這意味著模型不僅要聰明,還必須足夠快、足夠便宜。
Google此前已經在Gemini 3.5 Flash上強化了這條路線。根據官方API文檔,Gemini 3.5 Flash支持100萬token的長上下文,可以一次處理大量信息,同時支持代碼執行、調用外部工具、搜索文件等能力,能夠完成更復雜、更長時間的任務。
Gemini 3.6 Flash延續了這條路線,它追求的并不是單次回答的質量,是一個“能夠承擔得起每日真實工作”的位置。
Gemini 3.6 Flash的定價如下:
- 輸入:1.50 美元/百萬 token
- 輸出:7.50 美元/百萬 token
相比此前Gemini 3.5 Flash每百萬token輸入1.5美元、輸出9美元的價格,輸入成本沒有變化,但輸出成本進一步下降。
對于需要大量調用AI的企業來說,這種成本變化可能比benchmark上的幾個百分點提升更加重要。
另外,谷歌展示的一項內部測試顯示,在完成同一任務時,Gemini 3.6 Flash相比3.5 Flash減少了55.8%的token消耗,同時將任務評分從85分提升到了100分。
當然,這只是谷歌自己的測試結果,只能說明Google希望展示的方向:
新模型不僅更省,而且能夠用更少的計算完成同樣甚至更好的任務。
![]()
在那些被公開的benchmark里,谷歌主要強調的是代碼能力和Agent能力。
在DeepSWE代碼評測中,Gemini 3.6 Flash得分49%,高于上一代的37%。谷歌表示,新模型能夠減少無效代碼修改和重復執行過程。
在測試AI操作電腦能力的OSWorld-Verified評測中,Gemini 3.6 Flash得分83%,超過3.5 Flash的78.4%。
而在面向機器學習任務的MLE Bench中,Gemini 3.6 Flash得分63.9%,相比上一代的49.7%也有明顯提升。
![]()
不過,上述數據更多說明Gemini 3.6 Flash相比上一代有所進步。
如果放到當前大模型競爭中橫向比較,Google選擇的對手是GPT-5.6 Luna、Grok 4.5和Claude Sonnet 5(這里也可以看出這個產品的定位)。
從結果來看,Gemini 3.6 Flash并沒有全面領先,GPT和Claude的模型在復雜軟件工程和知識工作任務上仍然保持優勢。
但這其實也是Flash系列存在的意義:
它不一定要成為最強模型,只需要在明顯低于旗艦模型成本的情況下,提供夠用的能力。
![]()
官方測評之外,根據Artificial Analysis的發布前測試,Gemini 3.6 Flash在Intelligence Index上拿到了50分,與Gemini 3.5 Flash持平。
這意味著,如果只看模型綜合“智力”,Gemini 3.6 Flash并沒有什么升級。
![]()
但是呢,它的速度又很好地彌補了這一點。
Artificial Analysis還統計了模型完成Intelligence Index任務所需的平均時間。結果顯示,Gemini 3.6 Flash每項任務平均耗時約1.3分鐘,相比上一代3.5 Flash的約2.7分鐘,減少了一半。
與此同時,Gemini 3.5 Flash-Lite的任務完成時間也從上一代3.1 Flash-Lite的約1.6分鐘,下降到約0.6分鐘。
![]()
總的來說,Gemini 3.6 Flash的升級方向其實是效率——更少的token消耗,更低的運行成本,以及更適合長期運行的Agent能力。
對于習慣使用Gemini 3.5 Flash的用戶來說,確實是非常不錯的升級。
3.5 Flash-Lite:更快,但沒有上一代便宜
然后再來看另一個模型Gemini 3.5 Flash-Lite。
顧名思義,Flash-Lite是Flash系列中更輕量的版本,相比Flash,它犧牲了一部分能力上限,換取了更低的成本和更快的速度。
![]()
就像前面提到的那樣,Gemini 3.5 Flash-Lite的任務完成時間從上一代3.1 Flash-Lite的約1.6分鐘,下降到了約0.6分鐘。
3.5 Flash-Lite也是3.5系列中速度最快的型號,根據Artificial Analysis測試數據,其生成速度達到約350 token/秒,已經屬于當前主流大模型中的高速水平。
Gemini 3.5 Flash-Lite的定價如下:
輸入:0.30 美元/百萬 token
輸出:2.50 美元/百萬 token
相比Gemini 3.6 Flash,輸入價格約為1/5,輸出價格約為1/3。不過,與上一代Gemini 3.1 Flash-Lite相比,新模型并沒有進一步降價。
雖然Gemini 3.5 Flash-Lite由于能力提升,可以通過減少輸出量降低部分成本,但綜合起來,還是很難抵消單價上的成本增加。
根據官方文檔,相比上一代Gemini 3.1 Flash-Lite,新模型在不同思考等級(thinking levels)下都有明顯提升。開發者可以根據任務需求調整模型的思考深度。
此外,Gemini 3.5 Flash-Lite還內置了Computer Use能力,可以幫助Agent更可靠地操作電腦環境,完成跨應用任務。
在具體測試中,Gemini 3.5 Flash-Lite相比上一代模型也有明顯提升:在Terminal-Bench 2.1編程Agent測試中,成績從31%提升到54%;在測試長上下文理解能力的GDM-MRCR v2中,從60.1%提升到72.2%;在更貼近真實工作場景的GDPval-AA v2任務執行測試中,從642提升到1140。
![]()
值得注意的是,在一些Agent和代碼相關測試中,Gemini 3.5 Flash-Lite甚至超過了上一代更高定位的Gemini 3 Flash模型。
例如,在SWE-Bench Pro軟件工程測試中,Gemini 3.5 Flash-Lite得分54.2%,高于Gemini 3 Flash的49.6%;在測試AI操作電腦能力的OSWorld-Verified中,Gemini 3.5 Flash-Lite也以74.0%的成績超過Gemini 3 Flash的65.1%。
這意味著,隨著模型能力不斷提升,過去需要更大模型才能完成的部分Agent任務,正在逐漸下沉到更便宜、更快速的模型。
![]()
順便一提,除了前兩個面向普通用戶的通用模型,谷歌還推出了Gemini 3.5 Flash Cyber。
它主要針對網絡安全場景。根據官方文檔,在CodeMender系統中,多個Gemini 3.5 Flash Cyber Agent可以協同工作,分別完成不同分析任務,并最終匯總成一份完整報告。在網絡安全基準測試CyberGym中,Flash Cyber也達到了接近前沿模型的表現。
![]()
該模型目前不會公開提供,僅通過CodeMender平臺向政府和可信合作伙伴開放。
![]()
3.5 Pro:谷歌遲遲交不出的旗艦答卷
如果說Gemini 3.6 Flash和Gemini 3.5 Flash-Lite還可以看作是谷歌對AI規模化應用的判斷,那么Gemini 3.5 Pro則代表著谷歌的模型上限。
但問題在于:這份答卷,到現在還沒有交出來。
5月I/O的時候,谷歌表示Gemini 3.5 Pro將在“接下來一個月左右”推出,也就是預計在今年6月上線。現在7月都過了一大半了。
據彭博社7月16日報道,Gemini 3.5 Pro的發布時間已經落后原計劃數月。谷歌正在繼續優化模型能力,尤其是編碼表現,希望達到內部設定的目標。
路透社最新的報道則顯示,截至目前,谷歌仍未公布具體上線時間,只表示該模型正在與合作伙伴測試,并將“很快”推出;另有新聞稿透露,Gemini 4的訓練工作已經開始了。
而我們都知道,“很快”就是不確定的意思。
![]()
Gemini 1.0發布時就曾因演示爭議受到質疑;Gemini 1.5 Pro憑借百萬token上下文短暫扳回局面,但隨后Claude和GPT系列快速追趕;直到Gemini 3系列發布,谷歌才重新獲得“回到前沿競爭”的評價。
如今Gemini 3.5 Pro再次延期,市場關注的已經不只是一個模型什么時候上線,還有谷歌到底能否保持旗艦模型的競爭節奏問題。
何況谷歌透露出的編碼表現不及預期,并不是什么容易解決的小問題。
隨著Agent開始進入企業工作流,代碼能力的重要性迅速提升。一個模型能否理解復雜項目、修改真實代碼、完成多步驟開發任務,已經成為衡量它是否具備實際生產價值的重要指標。
路透社指出,華爾街正在等待Gemini 3.5 Pro,因為它將成為判斷Google DeepMind是否能夠跟上OpenAI和Anthropic的重要指標。
當然,谷歌并不是沒有動作,這次推出的幾個模型,恰說明谷歌正在強化另一條路線:讓AI變得更便宜、更容易規模化。
谷歌CEO Sundar Pichai近期也多次強調成本優勢,并表示企業如果將大部分AI工作負載遷移到Gemini模型,可以每年節省超過10億美元。
但問題在于,市場在期待一份證明谷歌模型實力的“答卷”,谷歌交出的卻是兩張關于效率和成本的“草稿紙”——很難不讓人覺得,谷歌在用Flash系列填補Pro延遲留下的空檔。
有意思的是,在Gemini 3.5 Pro延期的同時,AI競爭格局正在發生變化。
過去,人們討論AI領先者,主要關注海外“御三家”:OpenAI、Anthropic和Google DeepMind。
但最近,GLM-5.2、Kimi K3等國產模型也開始進入前沿競爭,并引發了大量討論。
前沿模型的追趕速度正在加快,也讓谷歌的問題變得更加緊迫,它當然可以繼續大力推出Flash模型,但前提是它的旗艦模型足夠給力——只要硬實力足夠,自有大儒為他辯經。
如果谷歌最終推出一個真正領先的旗艦模型,那么Flash路線會成為完整體系的一部分:Pro負責突破能力上限;Flash負責規模化應用。
但如果Gemini 3.5 Pro持續落后,市場很可能會繼續追問:谷歌擁有最強AI研究資源,為什么卻無法穩定跑贏競爭對手?
在Alphabet本周舉行第二季度財報電話會議時,人們很可能會進一步詢問有關Gemini 3.5 Pro的更多細節。
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.