![]()
智東西
作者 王涵
編輯 漠影
2026年初,“小龍蝦”O(jiān)penClaw橫空出世,爆火出圈。這款開源AI智能體憑借自主規(guī)劃、多步推理和工具調(diào)用的能力,讓無數(shù)開發(fā)者和極客第一次真正感受到“AI能自己干活”的震撼。
緊接著,各類定制化個(gè)人智能體百花齊放,全球AI智能體市場預(yù)計(jì)將從2024年的51億美元增長到2030年的471億美元。
而Agent的每一次多步推理、每一次長程任務(wù),背后都需要數(shù)以萬計(jì)的Token供給。Token作為智能時(shí)代的度量單位,其生產(chǎn)、優(yōu)化和調(diào)度,被推到聚光燈下。人們開始追問:Token從哪來?如何讓Token更加穩(wěn)定、更加優(yōu)質(zhì)?
在智東西與PPIO聯(lián)合創(chuàng)始人兼CEO姚欣的深度對話中,姚欣將今年的變化精煉為“Token會更智能”和“云會被重新定義:從人用Token到Agent用Token”。
當(dāng)Token的客戶不再是人,而是Agent時(shí),云服務(wù)商需要的不再只是CPU、硬盤和帶寬,而是面向Agent工作負(fù)載的“Token工廠”,一種更低延遲、更高吞吐、更懂Agent的運(yùn)行方式。
正是在這樣的行業(yè)拐點(diǎn)上,PPIO在WAIC 2026大會上正式發(fā)布全新的Agentic Cloud定位,以及智能模型網(wǎng)關(guān)新品,致力于打造面向Agent時(shí)代的智能Token工廠。
圍繞這一定位,PPIO Agentic Cloud構(gòu)建了兩層原生產(chǎn)品體系:智能模型網(wǎng)關(guān)與Agent Harness層。
![]()
一、智能Token工廠的兩大關(guān)鍵詞:讓Agent既省錢又變聰明
根據(jù)灼識咨詢,雖然推理成本每年以10倍以上的速度下降,但Agent任務(wù)的復(fù)雜度同步攀升,單次Agent任務(wù)消耗的Token數(shù)量,從早期的數(shù)百增長到如今的數(shù)萬甚至數(shù)十萬,綜合算下來成本壓力不降反升。
另一方面,單一模型無法覆蓋Agent的多樣化需求,Agent既要深度推理,又要快速響應(yīng),還要處理多模態(tài)信息,而市面上的MaaS平臺大多綁定自家模型生態(tài),無法靈活適配。更關(guān)鍵的是,Agent對延遲和穩(wěn)定性的要求遠(yuǎn)高于傳統(tǒng)AI應(yīng)用——一次工具調(diào)用失敗,整個(gè)任務(wù)鏈條可能瞬間崩斷。
對于這一難點(diǎn),PPIO在本次WAIC上給出的核心解法是發(fā)布智能模型網(wǎng)關(guān)。姚欣透露,這款新品的核心邏輯是“在提升智能上限的同時(shí),幫用戶大幅省錢”。
![]()
首先是“混合模型”(MoM,Mixture of Models)機(jī)制。
在處理高價(jià)值、高風(fēng)險(xiǎn)或結(jié)果不確定的關(guān)鍵Agent步驟時(shí),網(wǎng)關(guān)會觸發(fā)多模型融合。它會將問題同時(shí)分發(fā)給多個(gè)擅長此道的專家模型,通過交叉驗(yàn)證生成最終答案。這種“專家會診”模式可以極大避免因模型“偏科”導(dǎo)致的任務(wù)失敗和返工。
其次是“智能調(diào)度”與成本優(yōu)化。
網(wǎng)關(guān)會根據(jù)任務(wù)類型進(jìn)行智能路由:簡單問答用輕量模型,復(fù)雜推理用強(qiáng)模型,并通過壓縮冗余上下文、復(fù)用計(jì)算結(jié)果、設(shè)置預(yù)算護(hù)欄和失敗回退機(jī)制,確保用最經(jīng)濟(jì)的成本完成同樣質(zhì)量的任務(wù)。
這種工程化手段帶來的效果立竿見影。根據(jù)DRACO深度研究基準(zhǔn)測試,PPIO通過融合Mimo-V2.5-Pro、Kimi-K2.7和GLM-5.2進(jìn)行混合推理,可將性能提升至接近Claude Fable 5的水平,而成本大幅度下降。據(jù)綜合測算,PPIO智能模型網(wǎng)關(guān)能將智能水平提升20%,同時(shí)將成本降低50%-60%。
![]()
姚欣形象地總結(jié)道:“智能模型網(wǎng)關(guān)不賣最貴的‘超級模型’,也不賣最便宜的‘乞丐模型’。我們是把模型的智商穩(wěn)定在頭部梯隊(duì),同時(shí)把價(jià)格打到了中低梯隊(duì)。”
此外,PPIO自研的推理加速引擎針對Agent高頻工具調(diào)用、長上下文推理等場景深度優(yōu)化,推理性能提升可達(dá)10倍。搭配Prompt Cache技術(shù),Token成本最高能省80%。
這一技術(shù)實(shí)力也已獲得權(quán)威認(rèn)可。今年,PPIO入選中國信通院首批“企業(yè)級Token服務(wù)性能攀登基線”,在通用場景下跑出了TPS≥55個(gè)/秒、TTFT≤0.9秒、調(diào)用成功率≥99.9%的硬指標(biāo)。
二、Agent沙箱上線一年增長123倍,Harness為Agent裝上手腳和記憶
傳統(tǒng)云服務(wù)的控制臺、API、數(shù)據(jù)庫、計(jì)費(fèi)模式……一切都是圍繞“人如何使用云”來構(gòu)建的。但Agent的工作方式完全不同:它們的任務(wù)是毫秒級啟動、秒級執(zhí)行、完成后即刻銷毀,整個(gè)生命周期可能只有兩三分鐘。
行業(yè)正在形成一個(gè)新的共識:Agentic AI Infra的核心不再僅僅是GPU,而是Runtime(運(yùn)行時(shí))。Agent需要的是一個(gè)理解Agent工作方式的專屬運(yùn)行環(huán)境,即低延遲啟動、隔離安全、自帶記憶、天然工具接口。
PPIO Agent沙箱正是由此而生的。
PPIO Agent沙箱基于microVM技術(shù),可以實(shí)現(xiàn)毫秒級冷啟動(<200ms),滿足Agent實(shí)時(shí)響應(yīng)需求;每個(gè)Agent任務(wù)均可運(yùn)行在獨(dú)立虛擬機(jī)環(huán)境,實(shí)現(xiàn)系統(tǒng)級安全隔離,防止跨任務(wù)數(shù)據(jù)泄露與資源競爭;支持上萬個(gè)沙箱同時(shí)創(chuàng)建,每個(gè)請求獲得獨(dú)立執(zhí)行環(huán)境;Auto Pause/Resume機(jī)制讓任務(wù)空閑時(shí)自動暫停、恢復(fù)時(shí)秒級喚起,成本較同類產(chǎn)品最高降低90%以上。
自去年WAIC發(fā)布以來,Agent沙箱經(jīng)歷了爆炸式增長。姚欣在采訪中提到:“去年我們在WAIC上發(fā)布了Agent Sandbox,是國內(nèi)首發(fā),今年再看Sandbox的增量,增速非常夸張。”這款國內(nèi)首款兼容E2B接口的Agent沙箱,讓開發(fā)者無需修改現(xiàn)有代碼即可遷移,上線不到一年業(yè)務(wù)規(guī)模增長超123倍。
![]()
沙箱解決了“在哪跑”,但生產(chǎn)級Agent還需要“怎么編排、怎么操作、怎么記住”。PPIO正面向長程任務(wù)持續(xù)演進(jìn)Harness能力。
PPIO Agent Harness內(nèi)置Browser Use讓Agent驅(qū)動瀏覽器搜索信息、填寫表單、抓取數(shù)據(jù);Computer Use讓Agent操控桌面環(huán)境完成GUI自動化;Code Interpreter讓Agent在沙箱內(nèi)執(zhí)行代碼做數(shù)據(jù)分析和文件處理;MCP Server通過標(biāo)準(zhǔn)協(xié)議接入飛書、數(shù)據(jù)庫、第三方API等外部服務(wù)。
工具調(diào)用疊加多智能體編排、記憶管理等一套工具組合,覆蓋Agent從信息獲取到執(zhí)行操作的完整鏈路。
姚欣的觀點(diǎn)很清晰:“當(dāng)Agent成為Token工廠的第一客戶,云平臺就不能再用給人類用的工具去服務(wù)程序化的Agent。”
![]()
基于Harness層,平臺預(yù)置了PPClaw、PPHermes等多款開箱即用的智能體模板,開發(fā)者通過控制臺一鍵操作即可完成云端部署,最快10分鐘即可上線運(yùn)行。部署后的Agent支持7×24小時(shí)持續(xù)托管與定時(shí)任務(wù)調(diào)度,不使用時(shí)可一鍵暫停計(jì)費(fèi),恢復(fù)時(shí)秒級喚醒,成本完全可控、可預(yù)測。
同時(shí),PPIO還提供面向Agent的AI原生接口,支持MCP標(biāo)準(zhǔn)協(xié)議,Agent可通過自然語言直接調(diào)用GPU算力、沙箱環(huán)境、模型API、存儲網(wǎng)絡(luò)等全量基礎(chǔ)設(shè)施能力。平臺兼容LangChain、CrewAI、AutoGen等主流Agent框架,現(xiàn)有代碼零改造即可接入部署,最大程度降低遷移成本。
姚欣認(rèn)為,在Agent時(shí)代,開發(fā)范式發(fā)生了轉(zhuǎn)變“從基于程序開發(fā),變成基于Agent開發(fā)。以后企業(yè)搭建的是數(shù)字員工團(tuán)隊(duì)。這種模式未來很可能成為替代SaaS的新趨勢。”
三、PPIO:從“基礎(chǔ)設(shè)施”到“Agentic Cloud”的進(jìn)化
智能Token工廠不是憑空出現(xiàn)的。
PPIO日均萬億級Token消耗量的背后,是提前數(shù)年布局的分布式算力網(wǎng)絡(luò)和高密度計(jì)算節(jié)點(diǎn)。
正如姚欣在采訪中所說:“PPIO跟同行的發(fā)展路徑不一樣,我們從八年前就開始打造分布式云的底座。到了2023年之后,這變成了我們做分布式推理的基礎(chǔ);2024年我們又推出了推理加速平臺PPInfer;到了2025年,Token工廠服務(wù)集成了從底層算力調(diào)度到上層推理加速的全棧能力。”
PPIO的爆發(fā)式增長數(shù)據(jù)印證了這一邏輯。
2026年6月,PPIO日均Tokens調(diào)用量超1.2萬億,在中國獨(dú)立AI云計(jì)算服務(wù)商中排名第一,較2025年同期增長超8倍。按2025年及2026年第一季度平均每日Token消耗量計(jì),PPIO同樣位居獨(dú)立AI云計(jì)算服務(wù)商榜首。
PPIO的AI云收入自2025年起增長逾十倍,公司營收從2023年3.584億元增至2025年7.703億元。全球注冊開發(fā)者超67萬名。
客戶覆蓋泛互聯(lián)網(wǎng)、社交媒體、電商、教育、汽車、電信、信息科技、智能制造等八大行業(yè),其中包括大部分中國前十大互聯(lián)網(wǎng)公司及多家“獨(dú)角獸”初創(chuàng)公司。
還有一個(gè)關(guān)鍵數(shù)據(jù)值得關(guān)注:PPIO平均GPU利用率2025年一直高于75%,遠(yuǎn)超行業(yè)平均40%-50%。
姚欣在采訪中揭示了背后的邏輯:“推理是跟著用戶的使用習(xí)慣走的,大部分人在白天工作用AI,流量高峰就在白天,凌晨是低谷,這就導(dǎo)致很多GPU集群的平均利用率只有40%到50%。而PPIO利用東西半球的時(shí)差互補(bǔ),能在全球24小時(shí)內(nèi)把GPU利用率拉到70%到80%。”
PPIO將此增長歸因于全球調(diào)度網(wǎng)絡(luò)的“削峰填谷”能力。
PPIO在歐洲、北美洲、南美洲、東南亞等關(guān)鍵區(qū)域部署分布式多集群,覆蓋全球6大洲。其利用跨地區(qū)時(shí)區(qū)差異和多樣化客戶群的交錯(cuò)需求概況,將全球閑置算力動態(tài)分配至任何特定時(shí)刻的需求高點(diǎn),確保GPU資源有效部署而非在非高峰時(shí)段閑置。
這種調(diào)度能力直接降低了單位Token的實(shí)際成本,成為PPIO“前店后廠”模式得以盈利的底層保障。
結(jié)語:智能Token工廠,Agent時(shí)代的基礎(chǔ)設(shè)施
姚欣在采訪中說了一句話,描述了PPIO的愿景:“今天的智能上限不僅存在于模型內(nèi)部,在模型之外,像Agent工程、模型融合這些方向,同樣能大幅提升智能水平。”
這意味著,通往AGI的道路不止一條。當(dāng)行業(yè)在卷模型參數(shù)、卷訓(xùn)練數(shù)據(jù)時(shí),PPIO選擇在另一條路上深耕:讓Token更便宜、讓Agent跑得更穩(wěn)、讓云真正服務(wù)于AI。
Agent的規(guī)模化部署才剛剛開始。從單Agent執(zhí)行簡單任務(wù),到多Agent協(xié)同完成復(fù)雜工作流,再到數(shù)字員工與人類員工的無縫協(xié)作……每一次躍升都會對Token的供給能力提出更高要求。
智能Token工廠的意義,不只為適配當(dāng)下需求,更為智能體經(jīng)濟(jì)的爆發(fā)提前布局底層基建。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務(wù)。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.