Building Data-Based Digital Twins in Diabetes with Deep Generative Models: Progress and Challenges
ATTD2026

Building Data-Based Digital Twins in Diabetes with Deep Generative Models: Progress and Challenges

2026-03-12

cover slide

以下是為您彙整的詳細雙合一演講筆記,結合了講者的口述內容與簡報畫面的延伸細節,並以完整的學術演講架構進行編排:

基於深層生成模型建構糖尿病資料驅動之數位孿生:進展與挑戰

(BUILDING DATA-BASED DIGITAL TWINS IN DIABETES WITH DEEP GENERATIVE MODELS: PROGRESS AND CHALLENGES)

講者: Omer Mujahid, PhD 所屬機構: 西班牙赫羅納大學(Universitat de Girona),模型化與智慧控制工程實驗室(MiceLab) 會議: 先進糖尿病科技與治療會議(ATTD)

1. 導言:什麼是臨床數位孿生?

本研究的核心目標,是探索如何利用現代人工智慧技術,為人體代謝系統開發出具備實用價值的「數位孿生(Digital Twins)」。

數位孿生是指病患代謝系統的虛擬表示法,並能利用真實世界數據持續演進與更新。在糖尿病的應用中,數位孿生能夠發揮極大的價值,具體包括:

一旦成功建構出數位孿生,臨床醫生就能在無需讓病患承擔任何實際風險的情況下,探索各種「假設性(what-if)」的治療情境,進而設計出高度個人化的治療方案。

2. 傳統機理模型與資料驅動模型的對比

傳統上,第一型糖尿病的數位孿生多半是利用**機理生理模型(Mechanistic models)**所建構。這類模型依賴葡萄糖與胰島素動力學的微分方程式為基礎,透過參數識別(parameter identification)的技術來打造孿生模型,並藉由歷史回放(replay)或模擬器比對來進行驗證(參考文獻:Cappon 等人,2025年)。

儘管這些傳統方法在推動電腦模擬臨床試驗與治療設計上做出了巨大貢獻,但人體代謝系統具備極高的複雜性與變異性。**相對於機理模型僅能輸出單一且平滑的預測曲線,真實病患的生理反應是一張由眾多可能軌跡交疊而成的複雜網絡。**因此,單靠機理模型已難以完全捕捉這種複雜度,我們需要更先進的手段。

臨床數位孿生應該產出什麼?

一個真正符合臨床需求的數位孿生,不應該只輸出單一的血糖預測值。由於血糖動態本質上充滿變異性,給出單一預測可能會向臨床醫生傳遞一種「錯誤的確定感(false certainty)」

相反地,數位孿生必須能生成一系列具備臨床合理性的未來軌跡分佈(distribution of clinically plausible futures)這種分散的預測軌跡能真實反映人體內在的生理變異性與不確定性,不僅能支援反事實(counterfactual)的介入模擬,還能幫助臨床醫生具體量化特定病患的血糖風險,作為調整胰島素或飲食的可靠依據。

3. 深層生成模型:資料驅動的全新解方

現代糖尿病科技每天都在產生大規模的真實世界數據,**這包含了連續式血糖監測(CGM)、胰島素幫浦、智慧胰島素筆、飲食紀錄、甚至是來自穿戴式裝置的活動數據。**這些豐富的數據,讓我們得以跳脫傳統方程式,直接利用資料驅動(Data-driven)的建模技術,從病患數據中「學習」出數位孿生。

在我們的研究中,特別選擇了**深層生成模型(Deep Generative Models)**作為建構框架。選擇生成模型有四大核心優勢:

4. 建立族群層級的數位孿生(Twin Cohorts)

我們最初的實作,是基於病患族群資料來訓練深層生成模型,目的是讓模型掌握族群層級的血糖動態特徵。

我們採用了**生成對抗網路(GAN)**架構:

這種生成架構具備極佳的模組化與擴充性。隨著研究推進,我們對生成器的條件輸入進行了系統性的擴展:

生成數據的統計驗證

為確保生成資料的品質,我們必須將其與真實病患數據進行嚴格的統計比較。**在針對 56 名採用開迴路治療(open-loop therapy)病患的評估中,我們比對了多項關鍵血糖指標的群體中位數與四分位距(IQR)。結果顯示,真實患者與生成患者在絕大部分指標上差異極小。例如:

除了常規血糖分佈,我們也針對「有氧運動事件(共 308 次)」進行驗證。真實病患在運動期間的血糖下降中位數為 -23.8 mg/dL,而模型生成的下降中位數為 -20.1 mg/dL;雙方的柯爾莫哥洛夫-斯米爾諾夫檢定(KS test)P值高達 0.535,**這充分證明了模擬數據不僅在靜態統計上吻合,在動態行為上也忠實反映了真實病患的生理反應。

5. 邁向個人化數位孿生(Personalized Twins)

在掌握了族群特徵後,我們目前的重點是將這些模型「個人化」。這採用的是一種**「兩步法」工作流程**:

在初步的實作中,我們採用了 T1DEXI 數據集(包含 52 名病患,平均年齡 34.4 歲,73.1% 為女性,100% 採用標準開迴路幫浦治療)。實驗結果證實,經過微調的個人化模型表現顯著優於未微調的基礎模型(Bare Model):

6. 面臨的挑戰與突破方案

儘管資料驅動的數位孿生前景廣闊,但在臨床部署前仍存在兩大核心挑戰:生理一致性(Physiological Consistency)穩健的驗證(Robust Validation)

挑戰一:生理一致性與生物學約束

純粹的生成模型雖然善於學習數據間的「統計相關性」,但往往會違背基本的「生物學因果關係」。例如,由於訓練數據的偏差,模型可能會學到荒謬的邏輯,像是「注射胰島素反而導致血糖上升」,或是「攝取碳水化合物會讓血糖下降」。為解決此問題,我們測試了三種生理限制方法:

Building Data-Based Digital Twins in Diabetes with Deep Generative Models: Progress and Challenges