機器之心編輯部
沒有給大家帶來心心念念的 Gemini 3.5 Pro,谷歌今天一股腦地發了三款 Flash 輕量級模型。
![]()
沒有意外,谷歌的這一操作遭到了網友毫不留情地吐槽:
![]()
令人難繃的是,Gemini 3.6 Flash 的智能水平并未超過 Gemini 3.5 Flash。
![]()
在官方博客中,谷歌表示,「面向生產環境構建 AI 智能體的開發者和企業,需要更高的 Token 使用效率、更低的延遲,以及更加穩定可靠的性能。Flash 系列正是圍繞效率與質量之間的平衡點打造,幫助智能體工作流實現規模化運行。」因此在 Gemini 3.5 Flash 的基礎上,推出了這樣三款新模型:
- Gemini 3.6 Flash:面向主力生產任務的通用模型,在編程、知識工作和多模態任務上的表現進一步提升。
- Gemini 3.5 Flash-Lite:Gemini 3.5 系列中速度最快、成本最低的模型。
- CodeMender 中的 Gemini 3.5 Flash Cyber:高水平網絡安全應用,需要模型與智能體基礎設施進行精細協同。
目前,Gemini 3.6 Flash 和 Gemini 3.5 Flash-Lite 即日起開放使用。開發者可通過 Google AI Studio 和 Android Studio 調用 Gemini API。Gemini 3.6 Flash 同時已登陸 Google Antigravity。企業用戶可通過 Gemini Enterprise Agent Platform 使用。普通用戶可通過 Gemini 應用體驗,Gemini 3.5 Flash-Lite 也正在逐步接入 Google 搜索。
此外,谷歌還透露了 Gemini 3.5 Pro 的進度消息,稱其正在與合作伙伴開展測試,待準備充分后將盡快面向更多用戶開放。與此同時,谷歌已經開始推進下一代模型 Gemini 4,并啟動了迄今規模最大、目標最具挑戰性的預訓練任務。
先不管谷歌「畫的大餅」什么時候能吃上,我們先來一一看此次發布的三款模型。
Gemini 3.6 Flash
效率和性能全面超過 Gemini 3.5 Flash
Gemini 3.6 Flash 直接吸收了開發者和客戶在使用 Gemini 3.5 Flash 過程中提出的反饋,在編程和知識工作能力上進一步提升,同時顯著改善了 Token 使用效率。
例如,在 Artificial Analysis Index 測試中,Gemini 3.6 Flash 的輸出 Token 消耗較 Gemini 3.5 Flash 減少 17%。執行多步驟工作流時,它所需的推理步驟和工具調用次數也更少。
效率提升的同時,Gemini 3.6 Flash 的價格也低于 Gemini 3.5 Flash。其輸入價格為每 100 萬 Token 1.50 美元,輸出價格為每 100 萬 Token 7.50 美元,可以進一步降低單次智能體任務的總體成本,讓智能體的開發和運行更具經濟性。
在提高效率的同時,Gemini 3.6 Flash 在多類任務上的表現也超過 Gemini 3.5 Flash:
- 在 DeepSWE 測試中,Gemini 3.6 Flash 的得分由 37% 提升至 49%,能夠以更高精度完成任務,減少非必要的代碼修改和重復執行。在衡量機器學習研究能力的 MLE Bench 中,其成績由 49.7% 提升至 63.9%。
- 計算機操作能力進一步增強,在 OSWorld-Verified 上的成績由 78.4% 提升至 83.0%。目前,計算機操作已作為內置客戶端工具接入 Gemini API 和 Gemini Enterprise。
- 在知識工作領域,Gemini 3.6 Flash 同樣取得提升,GDPval-AA v2 得分由 1349 提高到 1421。Hebbia、Harvey 等客戶發現,該模型尤其擅長文檔解析、圖表與數據分析、報告撰寫等多模態任務。
![]()
![]()
Gemini 3.5 Flash-Lite
為智能體工作流規模化運行而生
Gemini 3.5 Flash-Lite 同時面向低延遲任務,以及智能體搜索、文檔處理等對吞吐量要求較高的開發工作流。
Gemini 3.5 Flash-Lite 是 Gemini 3.5 系列中速度最快的模型。根據 Artificial Analysis 的測試,其輸出速度達到每秒 350 個 Token。
該模型的輸入價格為每 100 萬 Token 0.30 美元,輸出價格為每 100 萬 Token 2.50 美元。憑借顯著超過 Gemini 3.1 Flash-Lite 的模型質量,Gemini 3.5 Flash-Lite 為運行高吞吐量生產業務的開發者和企業提供了較高的性價比。
Gemini 3.5 Flash-Lite 可以幫助智能體系統以更高效率擴展。在不同思考等級下,模型表現均顯著超過 Gemini 3.1 Flash-Lite。
開發者可以根據具體任務靈活配置模型。面對大規模、高頻任務,可以選擇 minimal 或 low 思考等級,優先降低延遲和成本;面對多步驟子智能體任務,則可以啟用更高的思考等級。計算機操作能力也已作為內置工具加入模型,幫助智能體在不同產品和使用界面中更加穩定地完成任務。
在編程和智能體任務方面,Gemini 3.5 Flash-Lite 實現了顯著提升:
- Terminal-Bench 2.1:由 31% 提升至 54%;
- 長上下文測試 GDM-MRCR v2:由 60.1% 提升至 72.2%;
- 真實任務執行測試 GDPval-AA v2:由 642 提升至 1140。
![]()
在多項智能體和編程評測中,Gemini 3.5 Flash-Lite 甚至超過了 Gemini 3 Flash。例如,其 SWE-Bench Pro 成績為 54.2%,高于 Gemini 3 Flash 的 49.6%;OSWorld-Verified 成績為 74.0%,也超過后者的 65.1%。
對于此前使用 Gemini 2.5 Flash 和 Gemini 3 Flash 處理相關任務的開發者而言,Gemini 3.5 Flash-Lite 提供了速度更快、能力更強的新選擇。
![]()
CodeMender 中的 Gemini 3.5 Flash Cyber
高效發現并修復安全漏洞
AI 模型發現安全漏洞的速度正在加快,現有系統修復漏洞的能力卻未必能夠同步跟上。面對不斷擴大的風險,軟件安全體系需要同時具備更強的能力和更高的運行效率。
Flash 系列兼具性能與效率,適合大規模檢測、驗證和修復代碼安全問題。Gemini 3.5 Flash Cyber 基于 Gemini 3.5 Flash 開發,并針對網絡安全漏洞的發現和修復進行了專項微調,每個 Token 的使用成本低于更大規模的模型。
在 CodeMender 系統中,多個 Gemini 3.5 Flash Cyber 智能體會協同工作,最終生成一份整合后的報告。通過這一機制,Gemini 3.5 Flash Cyber 在主流基準測試 CyberGym 上取得了接近前沿水平的競爭力表現。
![]()
考慮到這項技術具有明顯的雙重用途屬性,谷歌對 Gemini 3.5 Flash Cyber 采取了審慎的開放策略。
該模型近期將通過 CodeMender 面向政府機構和受信任的合作伙伴推出,并采用限量試點的方式提供。這樣可以讓一線安全防御人員優先獲得相關能力,在關鍵漏洞被利用前完成發現和修復,同時降低技術遭到大范圍濫用的風險。
更多信息可以查看以下模型卡:
- Gemini 3.6 Flash:https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-6-Flash-Model-Card.pdf
- Gemini 3.5 Flash-Lite:https://storage.googleapis.com/deepmind-media/Model-Cards/Gemini-3-5-Flash-Lite-Model-Card.pdf
https://blog.google/innovation-and-ai/models-and-research/gemini-models/gemini-3-6-flash-3-5-flash-lite-3-5-flash-cyber/
特別聲明:以上內容(如有圖片或視頻亦包括在內)為自媒體平臺“網易號”用戶上傳并發布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.