DETECTION OF GENETIC SUSCEPTIBILITY TO TYPE 2 DIABETES MELLITUS VIA MACHINE LEARNING APPROACH: MIR-122 AS A POTENTIAL PREDICTOR
ATTD2026

DETECTION OF GENETIC SUSCEPTIBILITY TO TYPE 2 DIABETES MELLITUS VIA MACHINE LEARNING APPROACH: MIR-122 AS A POTENTIAL PREDICTOR

2026-03-13

第十九屆先進科技與糖尿病治療會議 (19th ATTD Conference) 專題演講

介紹與背景說明

接下來是本次會議的最後一場發表。本場次由遠在以色列的 Yaniv Ovadia 醫師透過遠端連線,為我們探討「透過機器學習方法檢測第二型糖尿病的遺傳易感性:以微小 RNA-122 (miR-122) 作為潛在預測因子」。

大家好,非常感謝各位來聆聽我的演講。我希望能向各位展示我們關於第二型糖尿病 (Type 2 Diabetes Mellitus, T2DM) 易感性的一些初步研究發現,這項研究是借助機器學習 (Machine Learning) 來進行的。首先,我聲明本研究沒有任何利益衝突。

我們直接進入研究背景。糖尿病的影響力預計將持續擴大,其盛行率也呈現上升趨勢。到了 2045 年,全球預計將有超過 7 億 5000 萬人罹患第二型糖尿病。這意味著它將帶來許多健康上的後果,並包含沉重的經濟負擔。我們面臨的最大挑戰在於「預防」,因為通常在診所或醫院裡看到的,都是已經被確診為第二型糖尿病的患者。真正的挑戰在於如何及早識別特定高風險人群,並在早期階段進行介入治療,因為在許多情況下,當個體被正式診斷出來時,往往已經太遲了。

目前在遺傳學領域中存在一些缺口。全基因組關聯分析 (GWAS) 通常(或在很多情況下)包含單核苷酸多態性 (Single Nucleotide Polymorphisms, SNPs),但這些 SNPs 只能解釋第二型糖尿病遺傳率的一小部分。因此,現有生物標記的預測能力相當有限,而且對於早期的風險分層缺乏足夠的敏感度。

研究目標與 miR-122 的潛力

在這個背景下,微小 RNA (microRNAs) 或許提供了一個新的契機。近年來,微小 RNA-122 (miR-122) 已成為一個極具前景的潛在生物標記。我們過去通常在肝臟相關的領域比較常聽到它,但已有部分文獻指出,即使在血糖血脂異常 (dysglycemia) 的層面,它也可能具備成為新型指標的潛力。

因此,本研究設定了兩個目標:第一,我們旨在找出位於老年(患有與未患有第二型糖尿病)個體中,鄰近 miR-122 片段的 SNPs。第二,我們要找出能夠最早形成某種組合模式的 SNPs,以建立第二型糖尿病遺傳易感性的預測模型。

研究方法與演算法架構 (Genetics-to-Algorithm Pipeline)

作為一項初步研究,我們的方法相當直接。我們進行了一項橫斷面 (cross-sectional) 的病例對照研究 (case-control study),共收案了 82 位來到我們巴爾齊萊大學醫學中心 (Barzilai University Medical Center) 就診的住院患者。所有受試者的年齡均在 65 歲(含)以上。其中 41 位是已經確診為第二型糖尿病的患者,另外 41 位則是匹配的對照組(包含了性別的匹配)。

基因體數據輸入 (Genomic Input) 與特徵萃取 (Feature Extraction) 的階段,我們使用了客製化的設計捕獲陣列技術 (design capture array technology) 來識別 SNPs,特別聚焦於 miR-122 基因座及其兩側 (flanking) 調控區域 (regulatory regions) 的遺傳變異。這會將基因數據轉換為包含多個 SNPs 的特徵矩陣。

隨後進入預測建模 (Predictive Modeling) 階段,我們採用了 Python 為基礎的機器學習演算法,具體來說是呼叫了 sklearn 模組來開發生物識別演算法。該演算法被用來分析加權後的 SNP 等位基因組合對於疾病的邊際效應,藉此找出能夠最佳描述我們結果的演算法。我們運行了多次測試和多種機器學習模型,結果發現決策樹模型 (decision tree model)呈現為階層式的 SNPs 決策樹結構)的表現最為優異。該模型最終能產出臨床輸出結果 (Clinical Output),將受試者分類為「第二型糖尿病高風險組 (T2DM High-Risk)」或「匹配對照組 (Matched Controls)」

研究結果

我們的發現非常有趣。首先,我們在 miR-122 兩側的區域內,總共識別出了 19 個 SNPs,這些代表著可能與第二型糖尿病易感性相關的潛在調控變異 (regulatory variants)。

我們所建構的機器學習決策樹模型,成功地分析了這些 SNPs 等位基因的組合,並有效地將高風險個體與對照組區分開來。從模型表現來看,其精密度 (Precision) 達到了 88%,且準確度 (Accuracy) 也達到了 78%。整體的模型表現令人滿意,所有的測試指標百分比皆超過了 60% 的水準。

臨床意涵與未來方向 (Clinical Implications and Future Directions)

我們認為這些發現具有明確的臨床意義,並可分為三個階段的進程:

結論

總結來說,來自 miR-122 兩側 19 個 SNPs 的等位基因組合,展現了作為第二型糖尿病遺傳風險之潛在預測生物標記的實力。機器學習演算法能以 88% 的精密度與 78% 的準確度有效識別高風險個體,這支持了其未來的臨床實用性 (clinical utility)。當然,為了對這些初步結果得出更完善的定論,擴大且多種族的進一步驗證是絕對必要的,以精煉這套用於臨床實施的預測模型

在此,我要特別感謝 Jonathan Levitt 先生,他自願協助了機器學習的實作與調查,包辦了資料科學部分的流程。

非常感謝各位聆聽我的演講。我本來很希望能親自到場,或許日後的會議我能親自出席。我隨時歡迎大家提問,螢幕上是我的電子郵件(yaniv.ovadia@mail.huji.ac.il),我會非常樂意為各位解答,並提供關於我們初步結果的更多資訊。再次感謝各位的聆聽。

會議主持結語

由於 Ovadia 醫師無法親自來到現場與我們交流,這也為我們在巴塞隆納舉辦的本屆 ATTD 會議的此一場次畫下了句點。

我想向所有的講者表達感謝。他們在講台上度過的這 10 到 12 分鐘,背後代表的是在實驗室與臨床工作中投入的數千個小時。所以,感謝您以及您的團隊。也希望在座的各位,能繼續享受目前為止都非常精彩的巴塞隆納 ATTD 會議。非常感謝大家!(現場觀眾交流與肯定聲)