7月22日凌晨,谷歌一口氣發布了三款新模型:Gemini 3.6 Flash、3.5 Flash-Lite和3.5 Flash Cyber,主打更低成本、更快速度和更高效率。

其中,3.6 Flash的輸出token消耗比前代減少17%,部分工程任務中最多可減少65%;Flash-Lite每秒可生成350個token;Flash Cyber則專門用于發現和修復代碼漏洞。
但外界真正等的Gemini 3.5 Pro,依然沒有出現。 谷歌只表示,這款旗艦模型仍在與合作伙伴測試。

這次更新,谷歌把"省錢省資源"當作了最大的亮點。
在AI模型的商業應用里,token就相當于計費單位,模型輸出的token越多,開發者要付的錢就越多。如果能在保持能力不降的前提下,讓模型更"精煉",對大規模運行AI工作負載的企業來說,節省的成本相當可觀。
新推出的Gemini 3.6 Flash被定位為絕對主力,它在設計上就瞄準了"如何用更少輸出token、推理步驟和工具調用完成任務"。
谷歌官方博客引用第三方測評機構Artificial Analysis Index的數據顯示,Gemini 3.6 Flash在輸出時消耗的token數量比上一代Gemini 3.5 Flash平均減少了17%。

在Datacurve的DeepSWE這類長周期、多步驟的工程任務基準測試中,谷歌甚至觀察到了最多65% 的token節省。

價格也隨之下調,每百萬輸入token為1.50美元,輸出為7.50美元。

一同發布的Gemini 3.5 Flash-Lite則將"極致性價比"推向了新高度。它是谷歌Gemini 3.5系列中最快、最省錢的模型。
根據Artificial Analysis實測,它每秒能生成350個輸出token,速度大約是上一代Gemini 3.1 Flash-Lite的兩倍。價格更是探到了每百萬輸入token 0.30美元、輸出2.50美元,僅為GPT-5.4 mini的三分之一。
谷歌顯然希望用這款模型來承接那些對延遲極其敏感、需要高吞吐量的任務,比如大規模文檔處理、智能體搜索、收據翻譯和摘要這類工作。
第三款模型Gemini 3.5 Flash Cyber則走了專業路線。它基于Gemini 3.5 Flash微調,專門用來發現和修復網絡安全漏洞。
在流行的網絡安全基準測試CyberGym上,這款模型達到了與Anthropic Mythos等前沿網絡安全模型接近的性能水平。
據谷歌透露,在內部測試中,該模型在名為V8 JavaScript Engine的復雜開源代碼里發現了55個問題,其中包括10個此前未被其他模型發現的漏洞。
從分發渠道來看,Gemini 3.6 Flash和Gemini 3.5 Flash-Lite自今天起就通過Google AI
Studio、Android Studio中的Gemini
API向開發者開放,Gemini 3.6 Flash也可以在Google Antigravity中使用。
企業用戶可以通過Gemini Enterprise Agent Platform獲取,普通消費者則能在Gemini應用里體驗這些模型,Gemini 3.5 Flash-Lite也正在谷歌搜索中逐步推出。
然而,價格牌能否真正打動開發者,還得看模型的實際表現。谷歌目前展示的主要競爭力集中在效率和價格上,而非能力領先。
科技博主 @reight_s評論說:"谷歌正在輸掉AI智能競賽,但悄無聲息地贏得了廉價競賽。"他進一步指出,在大家等一個煮不熟的旗艦產品時,谷歌似乎已經將重心轉向了降低成本的策略。

但這引發了另一個問題:如果模型本身不夠聰明,再便宜又有什么用?
02跑分里的"尷尬":贏了自己卻輸給了對手
在谷歌給出的官方基準測試成績單上,Gemini 3.6 Flash相比前代模型確實有著肉眼可見的提升。
在反映計算機操作能力的OSWorld-Verified測試中,得分從78.4% 提升到了83.0%,這是所有對比模型中的最高分,甚至高于OpenAI的GPT-5.6 Luna和xAI的Grok 4.5。
在衡量機器學習研究能力的MLE Bench上,Gemini 3.6 Flash得分從49.7% 躍升至63.9%。在DeepSWE基準測試中,得分從37% 提升至49%。

處理知識型工作的GDPval-AA v2中,這款模型得分也從1349提高到了1421。在SWE-Bench Pro上,它取得了58.7% 的成績,高于前代的55.1%。
在需要處理100萬token長上下文的測試中,Gemini 3.6 Flash得分達到54.0%,而前代模型連27% 都達不到。
Gemini 3.5 Flash-Lite同樣有一些亮點。谷歌的資料顯示,這款"Lite"模型在SWE-Bench Pro、OSWorld-Verified等幾項關鍵評估中甚至優于標準版的Gemini 3
Flash。

在終端基準測試Terminal-Bench 2.1上,它從3.1 Flash-Lite時代的31% 躍升至54%。在現實世界任務執行測試GDPval-AA v2上,Gemini 3.5 Flash-Lite的得分也從642提升至1140。

這意味著,即使是谷歌產品線里最便宜的模型,在某些方面也已經具備了過去中端模型的水平。
然而,如果我們把視線從谷歌自家的縱向對比移開,看看橫向競爭,情況就不那么樂觀了。
科技媒體TechCrunch注意到,自2月份谷歌上次更新旗艦模型以來,OpenAI已經發布了GPT-5.5并開始推出GPT-5.6,Anthropic則推出了Claude Opus 4.8、Claude Sonnet 5,并擴大了其網絡安全前沿模型Fable 5的訪問權限。
中國公司也沒有閑著,月之暗面的Kimi K3吸引了大量需求以至于限制了新訂閱,阿里巴巴的Qwen3.8-Max-Preview也剛剛上線。
根據Artificial Analysis的綜合排名,谷歌在新模型發布前,甚至沒有一款模型能擠進前十。
網友 @synthwavedd尖銳地指出,Gemini 3.6 Flash在Artificial Analysis上的綜合得分和Gemini 3.5 Flash完全相同,遠遠落后于Meta Muse Spark
1.1、智譜GLM-5.2、OpenAI GPT-5.6
Luna、Anthropic Claude Sonnet 5以及xAI Grok 4.5等一長串對手。

谷歌自己的測試數據非常亮眼,而第三方綜合評分卻原地踏步,這看似矛盾,其實原因并不復雜。
谷歌選擇展示的OSWorld-Verified、MLE Bench、DeepSWE等測試,恰好是Gemini 3.6 Flash重點優化的方向,進步自然明顯。但Artificial Analysis的綜合指數覆蓋維度更廣,包括推理能力、事實準確率等多項指標,權重分配也不同。
Gemini 3.6 Flash在谷歌強調的幾個賽道上跑出了加速度,放到更全面的競技場上,整體排名并沒有實質變化。
正如AI分析師 @Teksart所言,Gemini 3.6 Flash給人的感覺是"谷歌優化了效率,而不是能力"。
"Gemini 3.6 Flash運行成本更低,但沒有更聰明。這感覺像是Gemini 4處于預訓練階段時的占位發布。谷歌需要提醒大家它在模型戰爭中依然存在。它成功了,但沒有改變排行榜。"

03實測反饋:速度快了,但輸出質量沒有跟上
跑分之外,部分早期用戶也分享了明顯負面的上手體驗。
一位名為 @LuminaXspace的用戶詳細記錄了他用Gemini 3.6 Flash構建3D金門大橋的失敗經歷。

據他描述,這個過程堪稱災難:他不得不重復提示三次,因為模型反復忽略指令。
第一次,它沒有按要求創建 .html文件,而是試圖在Gemini應用內部用模擬方式來完成任務;第二次,它開始從網上找圖片貼到聊天里,而不是真正生成文件;直到第三次才勉強完成,但最終輸出質量慘不忍睹。
更讓他沮喪的是,這個結果竟然比5個月前發布的、如今已跌出前十的Gemini 3.1 Pro還要差得多。后來他換用Antigravity平臺再次測試,結果同樣令人失望。他最后的結論是等待Gemini 3.5 Pro或Gemini 6 Pro發布再嘗試。
另一名用戶Da7em的體驗更讓人哭笑不得。他給Gemini 3.6 Flash布置了一個中等規模的任務,本以為會花合理的時間來處理,結果模型兩分鐘就跑完了。
他一開始還驚嘆于這個速度,"然后我看到了結果。一個本地的4B模型都能比它做得更好。谷歌人難道沒有羞恥心嗎?"

速度快當然好,但如果生成的內容連本地小參數模型都比不上,那這種速度就毫無意義。
在編碼基準測試方面,網友Ejaaz拋出了兩個讓谷歌臉上掛不住的參照物:一個是月之暗面出品的Kimi K3,另一個是智譜的GLM 5.2。這兩個模型背后實驗室的資金規模跟谷歌完全不在一個量級。
月之暗面的估值僅為300億美元,而谷歌的市值高達4.5萬億美元,兩者的差距達到150倍。 用Ejaaz的原話就是:"無限資本只買來了中規中矩的結果。"

普通開發者的吐槽還顯得有些零散,前谷歌Apps產品負責人、現任Abacus.AI聯合創始人兼CEO賓度·雷迪(Bindu Reddy)的評論更具分量。
她曾親歷谷歌內部的產品體系建設,如今以創業者的身份站在使用者的角度,對谷歌AI產品線做了一次從頭到腳的審視。
她先從開發者最常用的文本模型說起。她承認Flash拿來聊天還行,但一旦進入智能體循環(Agentic Loop)場景,它的表現就被Grok甩開了,哪怕是執行簡單的任務也不例外。

接著她把矛頭指向了Pro系列:這款本該撐門面的旗艦早已名不副實,只是一個停留在過去的老舊模型,跟當下前沿競品之間隔著一個代際的差距。
隨后,雷迪把話題延伸到了其他產品線。視頻生成工具Veo太貴,性價比不及競爭對手SeeDance;圖像模型NanoBanana Pro則被GPT的圖像生成明顯甩開。至于這次主打速度和低價的Flash Lite,她認為延遲問題讓"低價"的優勢打了折。
最后,雷迪總結道:"谷歌沒有針對核心工作負載的領先AI模型。即使是在谷歌相對拿手的聊天功能上,Grok和GPT Luna也做得相當不錯,而且在遵循用戶指令方面還更勝一籌。"
這番評價等于將谷歌在圖像、視頻、智能體等多個維度的產品都判定為落后于競爭對手。
當然,也有站在長期視角上看好谷歌的聲音。有投資者提醒市場注意一個基本事實:人們現在用瘋狂的倍數給Anthropic和OpenAI估值,基于的是每年200到400億美元的收入預期,而谷歌今年有望實現4800億美元的收入,完全不在一個數量級。定制芯片、分發網絡和生態系統構成的護城河,讓"落后"看起來更像是暫時的。
另一種聲音則搬出"馬拉松而非短跑"的老話:現在最聰明的模型不等于第一個到達AGI的模型,去年Gemini也曾是頂尖,Claude曾經排名落后,真正決定勝負的,是擁有堅實基礎和垂直技術棧的公司。
04失約的旗艦:Gemini
3.5 Pro去哪了?
在這場新品發布會上,最引人注目的"主角"反而不是任何一款新模型,而是一款沒出現的模型,Gemini 3.5 Pro。
谷歌在5月份發布Gemini
3.5 Flash時曾高調預告,更強的Pro版本已在內部使用,預計6月推出。然而到了7月下旬,谷歌技術主管洛根·基爾帕特里克(Logan Kilpatrick)在X上給出模糊回應:"正在與合作伙伴測試,準備就緒后立即推出"。
Business Insider在6月就曾報道,谷歌已將Gemini 3.5 Pro的目標發布日期推遲至7月。彭博社隨后報道稱,該模型可能已被進一步推遲,原因是難以達到內部性能目標。
這些報道勾勒出一個尷尬的現實:谷歌自己的旗艦產品,可能尚未達到內部性能目標。
在預測市場Polymarket上,交易者給出了90%的概率,認為Gemini 3.5 Pro不會在7月發布。
網友 @goodworse基于已經泄露信息的評論說:"這個模型將比Mythos還要差,而Mythos是在4個月前發布的。AI時間線進展如此之快,以至于4個月的延遲感覺像是一年。"
他總結道,谷歌去年擁有一切成為最好的條件,但他們把一切都搞砸了。

更尖銳的評論來自知名報料人"草莓哥(X用戶 @iruletheworldmo)"。
他用一種諷刺口吻描述了當前局面:谷歌把自己最好的計算資源都給了Anthropic,人家拿這些資源訓練出了Fable,反手就把谷歌的Gemini 3.5 Pro碾壓了,所以谷歌只好含糊地談論一個"雄心勃勃"的新預訓練計劃。

這段話雖然刻薄,但它反映的是社交媒體上一種普遍情緒,作為云服務商,谷歌在向其他AI公司提供算力,而自家模型的發布卻一再延期。
CNBC在報道中也提到了一個客觀事實:谷歌云與Anthropic簽有數十億美元的芯片交易。只是,云服務收入和內部研發所用的GPU通常是不同的資源池,兩者之間是否存在直接競爭關系,目前并沒有公開信息能夠證實。
05有錢、有人、有數據,谷歌為何還跑得這么慢?
6月18日,Gemini聯合負責人諾姆·沙澤爾(Noam
Shazeer)宣布離開谷歌加入OpenAI。第二天,DeepMind關鍵高管、2024年諾貝爾化學獎得主約翰·賈珀(John Jumper)也宣布離開,去向是Anthropic。前后腳出走的兩位核心人物,是谷歌AI部門這一年最直白的裁決。對于一家正處于追趕期的公司來說,核心人才的離開不僅是面子問題,更意味著項目的主導權和技術判斷力出現真空。
而人才只是問題的一面。另一個被反復提及的現象是,谷歌同時在推進的項目實在太多了,Gemini文本模型、Omni多模態模型、Nano Banana圖像模型、Genie世界模型……每多一個項目,就多一個分流人才和算力的口子。
問題或許不在于算力夠不夠,而在于組織注意力被攤薄了。當競爭對手把所有精力都壓在單一旗艦模型上時,谷歌的精力卻被分散到了近十個不同的戰場上。這種注意力和決策速度上的分散,有時比算力不足更難彌補。
資本市場的耐心也在被消耗。
路透社指出,Alphabet在4月份將2026年資本支出指引提高至1800億至1900億美元,還通過股權發行籌集了約850億美元。投入如此巨大,投資者自然緊盯著回報。
Aptus Capital Advisors的投資組合經理戴夫·瓦格納(Dave Wagner)表示,谷歌正在錯失AI編碼這個賽道的機會,這種擔憂在投資者中相當普遍,而且日益加重。在他看來,谷歌目前的戰略核心是押注生態系統的整體優勢,而非在單項能力上爭高下。
不過,市場對這套"生態系統"故事的耐心正在受到考驗。自4月下旬谷歌公布云銷售數據以來,Alphabet的股價已累計下跌約9%,同期表現落后于其他科技巨頭。投資者顯然不再滿足于遠期愿景,他們更想看到的是模型能力上實打實的追趕。
來自中國公司的競爭壓力也在加劇。不少開發者在討論中都提到同一個困惑:為什么資金只有谷歌零頭的實驗室能做出更強的模型?
月之暗面的Kimi K3就是一個典型例子,估值300億美元,是谷歌的1/150,編碼能力卻更勝一籌。這種反差讓谷歌的技術實力受到了前所未有的質疑。

在這種壓力之下,一個越來越明顯的行業現象是,"最強模型"的稱號正在以周為單位輪換。
馬斯克今天在X上發過一張梗圖,精確地概括了當下的競爭生態:無論哪家發布新模型,無一例外都會打出"推出全球最強大模型"的標語。

xAI發布Grok新版本,聲稱全球最強;谷歌緊接著發布Gemini新版本,反超并宣稱全球最強;Anthropic隨即推出Claude,登頂SOTA;OpenAI不甘落后發布新模型,再次搶回寶座。
如此循環往復,霸榜周期往往只有幾個月甚至幾周。
這張圖的調侃核心在于,只要等上幾個星期,輪盤就會轉到下一個廠商發布"史上最強AI"。
正是在這種"輪流坐莊"的節奏里,谷歌目前的位置顯得有些尷尬。近幾個月,它始終沒有重新站上綜合能力榜單的頭部位置,上一次有競爭力的文本模型還要追溯到2025年11月的Gemini
3。
3.6 Flash主打省錢高效,可以理解為谷歌在用價格和效率換取時間,為后續旗艦模型爭取窗口。 但問題在于,當所有對手都在用"全球最強"的旗號搶奪開發者注意力時,一味強調"便宜"能否真正守住陣地,恐怕連谷歌自己也沒有十足把握。
面對內外交困的局面,谷歌似乎也在進行戰略調整。
就在外界對Gemini 3.5 Pro議論紛紛之際,谷歌DeepMind產品技術主管洛根·基爾帕特里克(Logan Kilpatrick)確認,團隊已經啟動了"迄今為止最雄心勃勃的預訓練工作",即下一代基礎模型Gemini 4。
CNBC還報道,谷歌正在開發一種專為運行Gemini而設計的專用芯片,效率最高可提升10倍。谷歌云發言人對此回應稱,團隊一直在做各種創新嘗試來提升性能和效率,雖然不保證每個項目都能落地,但持續探索本身就是公司"全棧方法"的核心。
大模型測評專家 @kimmonismus對Gemini 4的啟動給出了一個耐人尋味的評論:想必是3.5 Pro的進展令人失望,所以他們直接啟動了一個新的預訓練計劃。但他也提醒,谷歌擁有全世界的數據和海量計算資源,如果到現在還沒領先,那換個"預訓練程序"恐怕也不是關鍵。

谷歌這次證明了自己仍能把AI做得更快、更便宜。但市場等的不是又一款省錢模型。
3.6 Flash可以幫助谷歌守住陣地。
真正決定它還能不能反攻的,仍然是遲遲沒有出現的Gemini 3.5 Pro,以及更遠處的Gemini 4。