當?shù)貢r間 6 月 30 日,OpenAI 發(fā)布全新基準測試 GeneBench-Pro,用于評估 AI 智能體在計算生物學研究中的高階分析能力。與側(cè)重知識問答或固定流程執(zhí)行的傳統(tǒng)基準不同,GeneBench-Pro 旨在測試模型能否在真實科研場景中處理模糊數(shù)據(jù)、選擇分析路徑、修正假設,并判斷結(jié)果是否足以支持后續(xù)決策。
![]()
來源:OpenAI
該基準包含 129 個問題,覆蓋統(tǒng)計遺傳學、群體遺傳學、定量遺傳學、調(diào)控組學、功能基因組學、蛋白質(zhì)組學、臨床遺傳學、癌癥基因組學等 10 個領域。每道題都包含模擬生成的數(shù)據(jù)集、實驗背景和目標估計量,模型需在隔離工作區(qū)中完成探索性分析并給出答案。OpenAI 稱,問題采用合成數(shù)據(jù)構(gòu)建,以便掌握完整因果結(jié)構(gòu),并通過 82 道題的外部專家審查降低信息泄漏和評分偏差。
在測試中,OpenAI 的最新模型 GPT-5.6 Sol 在最高推理級別下通過率為 28.7%,開啟 Pro 模式后為 31.5%。OpenAI 認為,這類基準可幫助識別 AI 在科學研究判斷中的能力邊界。
來源:OpenAI,finance.biggo.com
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.