![]()
我們介紹了一項通過全國規(guī)模研究,探索AI用于鑒別診斷與癥狀檢查的開創(chuàng)性研究成果。
大部分臨床診斷可以僅通過語言訪談得出。這類診斷性訪談通常由臨床醫(yī)生通過線上或線下的醫(yī)患互動來完成。盡管這類交互是癥狀評估的黃金標準,但由于經(jīng)濟、地理及系統(tǒng)性障礙,其可及性往往受到限制。當前的語言模型在經(jīng)過精心整理的醫(yī)學案例評估中,已展現(xiàn)出較強的鑒別診斷能力,這也凸顯了其輔助診斷的潛力。然而,現(xiàn)有評估大多依賴經(jīng)過高度整理、信息詳盡甚至人工合成的病例描述,可能無法反映真實世界中患者的實際表現(xiàn)。這些評估并未捕捉到普通患者描述癥狀時的真實狀態(tài),例如醫(yī)學素養(yǎng)參差不齊、信息不完整,以及自然對話中出現(xiàn)的各種復雜情況。這是一個關鍵缺口,導致語言模型在真實場景中的表現(xiàn)存在較大不確定性。
為填補這一缺口,我們開展了一項現(xiàn)場對比研究,測試了一組實驗性對話AI智能體原型,旨在探索對話式AI如何完成端到端的癥狀訪談與鑒別診斷評估,以供研究基準測試使用。在我們最新發(fā)表的論文《SymptomAI:面向日常癥狀評估的對話式AI智能體》中,我們報告了一項全國規(guī)模隨機研究(n=13,917)的成果。在該研究中,獲得知情同意的參與者與五種基于Gemini Flash 2.0的SymptomAI智能體之一進行交互。研究過程中生成的所有診斷、標簽和疾病關聯(lián)僅用于研究分析,不構成經(jīng)臨床確認的診斷或官方醫(yī)療評估。在與AI智能體交互兩周后,我們邀請參與者反饋其就醫(yī)所獲得的診斷結果。基于這些數(shù)據(jù),我們開展了臨床專家標注研究,將SymptomAI的診斷表現(xiàn)與真實臨床醫(yī)生的醫(yī)療評估進行了對比。
在評估SymptomAI鑒別診斷準確性之后,我們進一步將其診斷結果與參與者在與AI對話前一段時間內(nèi)的Fitbit可穿戴設備生物信號進行比對。結果顯示,SymptomAI判斷為感染性疾病病因的對話,與可能指示免疫反應的生理趨勢相吻合,為SymptomAI的診斷性能提供了進一步佐證。
研究設計與參與者互動方式
本研究部署了一套對話AI智能體,用于端到端的患者訪談與鑒別診斷評估。參與者可與智能體就其癥狀展開對話,獲得候選鑒別診斷列表,并進入后續(xù)診斷環(huán)節(jié)。
共有13,917名知情同意的研究參與者,每人向五種隨機分配的SymptomAI智能體之一描述自身癥狀,各智能體在癥狀訪談方式上具有不同程度的靈活性。在對話過程中,參與者描述癥狀,SymptomAI則提出追問,最終形成鑒別診斷結果(即一份包含多個可能診斷的列表)及后續(xù)建議。參與者隨后可選擇就醫(yī),并被要求在兩周后通過問卷分享就診結果。為評估SymptomAI的表現(xiàn),我們還開展了臨床專家標注研究:由三名通過委員會認證的臨床醫(yī)生審閱對話記錄,并提供各自的評估意見(即鑒別診斷)。隨后,每位醫(yī)生以盲審方式對SymptomAI和其他醫(yī)生提供的鑒別診斷進行排名。
研究結果顯示,在超過50%的案例中,臨床醫(yī)生對SymptomAI生成的鑒別診斷的評價優(yōu)于其他臨床醫(yī)生的診斷,表明SymptomAI的診斷質(zhì)量與臨床醫(yī)生相當甚至更優(yōu)。
SymptomAI生成的鑒別診斷被臨床評估者評為最佳診斷的概率更高。
在Top-5準確率(即參與者就診醫(yī)生給出的真實診斷是否出現(xiàn)在鑒別診斷列表的前五項中)方面,臨床醫(yī)生判定SymptomAI生成的鑒別診斷準確的頻率同樣高于其他臨床醫(yī)生的診斷。
SymptomAI生成的鑒別診斷更有可能涵蓋就診醫(yī)生給出的真實診斷結果。
不同訪談策略的效果比較
本研究還評估了不同病史采集訪談方式的效果。參與者被隨機分配至五個研究組,每組采用不同的提示策略:兩組(Dynamic Live和Dynamic Final)具有完全的自由追問權限,兩組(Fixed Canonical和Fixed Canonical的靈活版本)采用醫(yī)學院標準病史采集問題,最后一組為無提示的基礎大語言模型,代表當前用戶與大語言模型聊天機器人交互的默認狀態(tài)。結果表明,所有主動提問策略(即SymptomAI主動向參與者提問的情形)的表現(xiàn)均顯著優(yōu)于基礎組,驗證了主動信息收集對提升鑒別診斷準確性的重要價值。
此外,研究發(fā)現(xiàn)SymptomAI在臨床醫(yī)生對自身診斷信心最低的案例中,超越臨床基準的幅度最為顯著。
生物信號分析的潛力
鑒于SymptomAI相對于臨床基準的準確性,我們還可以探索其大規(guī)模應用潛力。目前,臨床標注的高昂成本限制了真實世界中人群規(guī)模數(shù)據(jù)集的分析。SymptomAI等準確的癥狀檢查系統(tǒng),有望實現(xiàn)臨床質(zhì)量診斷的自動化參考標注,從而為生理數(shù)據(jù)的大規(guī)模分析提供支撐——這在目前尚屬不可能完成的任務。
其中一個典型應用場景是將可穿戴設備的生物信號與不同類別的疾病進行關聯(lián)分析。急性呼吸道感染在可穿戴生物信號中表現(xiàn)出最為顯著的變化。為在人群規(guī)模上研究這一現(xiàn)象,我們收集了參與者在與SymptomAI交互前最多30天內(nèi)的每日生物特征數(shù)據(jù)。結果顯示,在用戶報告癥狀的前幾天,生物信號出現(xiàn)了明顯偏移,提示癥狀發(fā)作的時間節(jié)點。值得注意的是,組間差異是通過對SymptomAI首選候選診斷進行分類、并將呼吸道感染診斷歸為一組來實現(xiàn)的,該組排除了過敏性鼻炎或慢性阻塞性肺病等非感染性呼吸系統(tǒng)疾病。可穿戴生物信號偏移峰值與參與者報告癥狀日期的吻合,為其所報告癥狀提供了可觀測的生理學證據(jù)。
基于AI的癥狀評估為新型研究打開了大門。通過SymptomAI分析大量癥狀報告,并與實時Fitbit數(shù)據(jù)相結合,我們可以探索多種疾病的數(shù)字生物信號表型。分析揭示了生理指標的明顯變化,包括心血管功能、呼吸、皮膚溫度和睡眠質(zhì)量,這些變化發(fā)生在用戶與SymptomAI對話前的數(shù)天內(nèi),且與癥狀對話的時間高度吻合,這為驗證患者自報癥狀或提供被動數(shù)據(jù)、輔助鑒別診斷提供了可能的路徑。此外,實時可及性也凸顯了AI癥狀檢查的一項核心優(yōu)勢:與可能因排班延誤而推遲的傳統(tǒng)門診不同,參與者可在癥狀出現(xiàn)時即時參與SymptomAI研究,這有助于提高患者自報發(fā)病時間的準確性——這對人群規(guī)模的健康分析至關重要。
局限性與未來展望
SymptomAI是一項探索性研究,代表了AI癥狀評估領域的重要研究進展,展示了其為尋求癥狀解讀的公眾提供幫助的潛力。盡管人群規(guī)模的部署評估揭示了遠程患者訪談的癥狀評估準確性,但與臨床醫(yī)生評估進行比較時仍存在一定局限。
首先,鑒別診斷本身具有模糊性,已報告的診斷也可能隨時間推移發(fā)生變化和演進。癥狀評估是對某一時刻癥狀表現(xiàn)的快照,由于研究規(guī)模較大,我們無法對癥狀報告的頻率和時間進行控制。部分參與者可能在更具代表性的體征尚未出現(xiàn)前便已報告癥狀,而另一些患有慢性病的參與者則可能在已有多年經(jīng)驗的情況下,在癥狀明顯時才進行報告。未來研究可聚焦于疾病發(fā)展特定階段的具體疾病,如代謝綜合征早期或呼吸道感染初期癥狀。研究過程中生成的所有診斷、標簽和疾病關聯(lián)均為AI生成,僅供研究分析使用,不構成經(jīng)臨床確認的診斷或官方醫(yī)療評估。
其次,在本次評估中,臨床醫(yī)生審閱的是靜態(tài)對話記錄,無權自行追問。若由臨床醫(yī)生主導癥狀訪談,他們可能會直覺性地獲取不同的信息。此外,盡管近期研究表明對話式AI系統(tǒng)能夠以媲美臨床醫(yī)生的細致程度和準確性采集臨床數(shù)據(jù),但此類系統(tǒng)可能會錯過肢體語言、視覺評估、病歷記錄等替代信號,以及在基層醫(yī)療中醫(yī)患之間已有的信任關系。
總結
本文介紹了SymptomAI——一種用于真實世界患者訪談與癥狀評估的實驗性對話AI智能體。我們通過在人群樣本上的鑒別診斷準確性,展示了SymptomAI的端到端真實世界表現(xiàn),并闡明了SymptomAI的診斷如何支持可穿戴生物信號等人群規(guī)模信號的分析,從而識別生理信號與所報告疾病之間的關聯(lián)。
本研究由Joe Breda、Jake Sunshine與Daniel McDuff共同主導完成。感謝來自Google Research和Google DeepMind的共同作者與合作者對本研究的貢獻。
Q&A
Q1:SymptomAI是什么?它能診斷疾病嗎?
A:SymptomAI是谷歌研究團隊開發(fā)的一種實驗性對話AI智能體,用于通過自然對話進行癥狀訪談和鑒別診斷評估。它能根據(jù)用戶描述的癥狀提出追問,并給出可能的診斷列表。但需要注意,SymptomAI生成的所有診斷結果僅供研究分析使用,不構成經(jīng)臨床確認的正式醫(yī)療診斷,不能替代醫(yī)生的專業(yè)判斷。
Q2:SymptomAI的診斷準確率如何,與真實醫(yī)生相比怎么樣?
A:研究結果顯示,在超過50%的案例中,臨床醫(yī)生對SymptomAI生成的鑒別診斷評價優(yōu)于其他臨床醫(yī)生的診斷。在Top-5準確率方面,SymptomAI生成的診斷列表包含患者就診醫(yī)生所給出真實診斷的比例也高于臨床醫(yī)生。尤其是在臨床醫(yī)生對自身診斷信心較低的案例中,SymptomAI超越臨床基準的幅度最為顯著。
Q3:SymptomAI是基于哪個大語言模型開發(fā)的,研究規(guī)模有多大?
A:SymptomAI基于谷歌的Gemini Flash 2.0大語言模型開發(fā),共設計了五種不同提示策略的智能體變體。研究共招募了13,917名知情同意的參與者參與全國規(guī)模的隨機對照研究,是目前同類研究中規(guī)模最大的一次,研究還結合了參與者的Fitbit可穿戴設備數(shù)據(jù)進行生理信號分析。
特別聲明:以上內(nèi)容(如有圖片或視頻亦包括在內(nèi))為自媒體平臺“網(wǎng)易號”用戶上傳并發(fā)布,本平臺僅提供信息存儲服務。
Notice: The content above (including the pictures and videos if any) is uploaded and posted by a user of NetEase Hao, which is a social media platform and only provides information storage services.