Integrated metabolomic, proteomic and genomic biomarkers improve identification of coronary artery disease in East Asians with type 2 diabetes
Hyunsuk Lee 的這場口頭報告聚焦於:在第二型糖尿病(type 2 diabetes, T2D)族群,特別是過去文獻相對不足的東亞族群中,整合 metabolomics、proteomics 與 genomics 是否能改善冠狀動脈疾病(coronary artery disease, CAD)的辨識與風險分層。講者開場感謝主持人與大會邀請,並聲明無利益衝突;本研究團隊來自 Seoul National University、Seoul National University Hospital、Korea Institute of Science and Technology 等機構。
研究背景:T2D 中的 CAD 不只是「更常見」,而是臨床表現也不同
第二型糖尿病患者承受相當高的心血管疾病負擔。相較於非糖尿病族群,T2D 患者發生心血管併發症的風險約增加 2–3 倍;一旦發展出這些併發症,平均預期壽命約縮短 8 年。因此,能否更早、更準確地辨識高風險患者,是臨床上非常重要的問題。
在糖尿病患者身上,CAD 並不只是發生率較高,其臨床型態也具有特殊性。糖尿病相關 CAD 常見:
- Silent ischemia(無症狀或靜默性缺血)
- 較早發病
- 多血管病變(multi-vessel involvement)
- 病變血管段較長(longer diseased vessel segments)
這些特徵使得傳統依賴症狀或單一臨床指標的辨識策略可能不足。講者以典型冠狀動脈攝影影像說明冠狀動脈狹窄的表現,並強調:在 T2D 族群中,早期且準確地辨識 CAD 是實際臨床需求。
相關背景資料引用 Lee et al., Diabetologia 2025,並將 T2D 中 CAD 的上述臨床特色整理為本研究的出發點。
現行 CAD 風險預測:臨床因子仍有改善空間
目前多數臨床風險預測模型仰賴傳統臨床因子。以 PREVENT equation 為例,常用變項包括:
- 年齡(age)
- 性別(sex)
- 收縮壓(systolic blood pressure, SBP)
- BMI
- 抽菸狀態
- 膽固醇指標
- 腎功能
- 用藥狀態
這類模型的 C-statistic 約為 0.75–0.80。這代表臨床因子已具備一定辨識能力,但仍有明顯改善空間,特別是在糖尿病這種 CAD 表現不典型、且常有 silent ischemia 的族群中。
近年來,基因體資訊,尤其是 polygenic risk score(PRS),已被證明可為心血管併發症預測提供額外增益。更近期的研究則指出,蛋白體(proteomic)與代謝體(metabolomic)特徵可在常見疾病與罕見疾病的預測中增加資訊量。
因此,本研究的核心問題是:
在 T2D 患者,尤其是東亞族群中,proteomic 與 metabolomic biomarkers 是否能改善 CAD 的預測或辨識?
背景文獻脈絡包含 PREVENT 模型(Khan et al., Circulation 2023)、PRS 對糖尿病心血管併發症預測的增益(Lee et al., Diabetes Care 2023),以及蛋白體與代謝體在疾病預測中的新近應用(Patel et al., Nature Medicine 2023;Carrasco-Zanini et al., Nature Medicine 2024)。
研究目標
本研究目標有兩個層次:
- 發現與 T2D 患者 CAD 相關的 metabolomic 與 proteomic signatures
- 評估這些 biomarkers 加入傳統臨床模型後,是否能提升 CAD identification 的表現
換言之,研究不只是在找與 CAD 相關的分子標記,也進一步測試這些標記是否能在實際風險辨識模型中提供增量價值。
研究族群與資料來源:K-PREDICT 為主,UK Biobank 作為複製與外部比較
本研究使用兩個 cohort。
K-PREDICT:主要分析 cohort
主要分析來自 K-PREDICT,這是一個位於南韓、以多家醫院為基礎的前瞻性糖尿病 cohort。講者說明,目前 cohort 約納入 5,400 名 20 歲以上參與者,中位追蹤時間約 2.8 年。
K-PREDICT 的更完整 cohort 資訊為:目前參與者數 5,438 人,族群為 East Asians,收案自 2016 年開始,目標至 2030 年達 30,000 人;本研究中 metabolomics 可用樣本為 4,633 人。
UK Biobank:複製與比較 cohort
作為 replication cohort,研究使用 UK Biobank。這是一個以一般人口為基礎的前瞻性 cohort,總樣本約 50 萬人,主要為歐洲血統族群,追蹤時間較長,中位追蹤約 13.4 年。
UK Biobank 原始 cohort 規模為 502,485 人,收案年齡 40–70 歲,收案期間為 2006–2010 年。
這樣的設計讓研究能在東亞 T2D cohort 中進行主要發現,並在族群背景、資料平台與追蹤時間皆不同的 UK Biobank 中檢視部分訊號是否能對未來心血管事件有預測意義。
CAD phenotype 定義與 multi-omics 資料取得
CAD phenotype 定義
在兩個 cohort 中,CAD 都是以演算法方式定義。
K-PREDICT 中,CAD 定義整合:
- 診斷碼
- 心導管與支架等 procedure history
- CABG 等手術史
- 問卷中的自我回報
這套 algorithmic phenotype 在一個人工病歷審查 subset 中表現良好。講者指出,在約 900 名參與者的 manual chart review 中,其 sensitivity 約 0.90,另一個效能指標約 0.97,代表 phenotype 定義相當可靠。
K-PREDICT phenotype validation 的完整指標為 sensitivity 0.90、specificity 0.97;CAD 定義包含診斷碼、CAG with stent、CABG 與 survey self-report。
UK Biobank 中,CAD/MI phenotype 則使用:
- hospital admission data
- death registry
- self-report
其 positive predictive value 約為 75–100%。
Omics 平台
K-PREDICT 中:
- Metabolomics 由 Korea Institute of Science and Technology 完成,使用 LC-MS/MS-based platform
- Proteomics 使用 Olink Explore HT
- Genomics 使用 whole-exome sequencing(WES)與 spike-in genotype
K-PREDICT metabolomics 共 392 features、n=4,633;proteomics 為 Olink Explore HT,共 5,416 features、n=1,310;genomics 使用 Twist Bioscience 相關 WES 與 spike-in genotype,n=2,742。
UK Biobank 中:
- Metabolomics 來自 Nightingale Health 的 NMR-based platform
- Proteomics 來自 Olink panels
- Genomics 具備大規模 genotype、WES 與 WGS coverage
UK Biobank metabolomics 為 Nightingale Health NMR-based 251 features,覆蓋約 50 萬人;proteomics 為 Olink panels,共 2,923 features、n 約 53,000;genomics 則包含 genotype、WES 與 WGS,n 約 500,000。
統計設計:discovery、test set 與 PRS
在 K-PREDICT 中,具有 metabolomics 的參與者共 4,633 人;其中約 1,200 人同時具備三層 omics 資料。研究團隊從具有三層 omics 資料者中隨機選出 400 人作為 held-out test set,其餘作為 discovery set。
完整切分為:metabolomics participants N=4,633;具有 all three omics layers 者 N=1,222;test set N=400;discovery set N=4,233。
分析流程大致如下:
- 在 K-PREDICT 中,以 cross-sectional regression 分析 prevalent CAD 與 metabolite/protein 的關聯
- 在 UK Biobank 中,以 longitudinal time-to-event analysis 檢視 incident cardiovascular disease/MI 的關聯
- 分析均調整 age 與 sex
- CAD PRS 來自 trans-ancestry CAD GWAS meta-analysis
- 模型 discrimination 以 independent test set 的 ROC AUC 評估
CAD polygenic risk score 來自 Biobank Japan、CARDIoGRAMplusC4D 與 UK Biobank 的 trans-ancestry CAD GWAS meta-analysis;相關來源為 Koyama et al., Nature Genetics 2020。
模型評估時,研究在 discovery set 中建立 Firth penalized logistic regression model,再將 predicted probabilities 套用到 test set 計算 AUC;AUC 差異以 DeLong’s test 評估。
Baseline characteristics:CAD 組較年長、男性比例較高、糖尿病病程較長
在 baseline characteristics 中,CAD 組符合臨床預期:年齡較高、男性比例較高、糖尿病病程較長。值得注意的是,CAD 組的 LDL cholesterol 較低,這反映的不是風險較低,而更可能是 CAD 患者接受較積極的 lipid-lowering treatment。
Discovery set 中,non-CAD N=3,895、CAD N=338。CAD 組年齡較高(68 vs 61 歲)、男性比例較高(81% vs 58%)、糖尿病病程較長(14.5 vs 12.8 年)、HbA1c 較高(7.4% vs 7.1%)、LDL 較低(62 vs 83 mg/dL)、eGFR 較低(78 vs 84 mL/min/1.73m²),且 CAD family history 較常見(21% vs 12%)。BMI、SBP 與 current smoking 在兩組差異較小。
Test set 中,non-CAD N=344、CAD N=56;CAD 組同樣較年長(69 vs 63 歲)、男性比例較高(71% vs 48%)、糖尿病病程較長(15.9 vs 12.6 年),LDL 較低(68 vs 89 mg/dL)。
這些 baseline pattern 支持 cohort 中 CAD phenotype 與臨床常識一致,也為後續分子標記分析提供合理基礎。
Metabolomics 結果:29 個內生性 metabolite 與 prevalent CAD 相關
首先分析 metabolomics。研究比較 338 名 CAD cases 與約 3,900 名 controls,在 FDR < 0.05 下找到 32 個顯著 metabolites。其中:
- 29 個為 endogenous metabolites
- 3 個為 exogenous metabolites
講者特別指出,外源性訊號中有一些非常合理的「positive controls」。例如:
- Carvedilol:β-blocker,常用於心血管疾病患者
- O-hydroxyhippuric acid / salicyluric acid:aspirin metabolite
這些藥物相關 metabolites 出現在 CAD 組的 top signals,符合 CAD 患者更常使用相關心血管藥物的臨床事實,也間接支持 phenotype definition 的可信度。
在 pathway 或 over-representation analysis 中,整體訊號指向:
- Arginine and polyamine metabolism 增加
- Sphingolipid metabolism 降低
其中最強的正向關聯訊號是 4-hydroxybenzoate,講者描述其為 gut microbiome-derived、coenzyme Q10 precursor。這個 metabolite 與 CAD 有最強正向關聯。
相反地,ceramide (d18:1/24:0) 與 DHEA sulfate 與 CAD 呈負向關聯,這與既有 cardiovascular literature 的方向相符。
Metabolomics 分析使用 inverse normal transformation 後的 metabolite,以 linear regression 調整 age 與 sex;CAD cases 338、controls 3,895。顯著 metabolite 的 superclass 包含 organic acids and derivatives、lipids and lipid-like molecules、nucleosides/nucleotides/analogues、benzenoids、organoheterocyclic compounds,以及 exogenous drug metabolites 與 food/phytochemical-related metabolites。
重要 metabolite 的具體統計包括:4-hydroxybenzoate β=0.447、p=1.93×10⁻¹⁵,描述為 gut microbiome metabolite 與 coenzyme Q10 precursor;ceramide (d18:1/24:0) β=-0.265、p=3.94×10⁻⁶,在 Mayo Clinic Ceramide Score 相關文獻中與 MACE protective pattern 有關;DHEA sulfate β=-0.212、p=4.84×10⁻⁶,低 DHEA-S 在 MrOS study 中與 incident CVD risk 相關;propylurofuranic acid β=-0.245、p=5.90×10⁻⁶,為 fish oil metabolite;12-HETE β=-0.236、p=2.11×10⁻⁵,常被視為 platelet activity measure。
由於 K-PREDICT 的 LC-MS/MS platform 與 UK Biobank 的 NMR-based Nightingale platform 之間 metabolite overlap 很少,講者指出 metabolomics 無法有效與 UK Biobank 直接比較。
兩平台重疊 metabolite 僅約 7 個,因此 metabolite-level replication 在本研究中不可行。
Proteomics 結果:18 個 protein 與 prevalent CAD 相關,訊號指向 cellular stress 與 remodeling
接著分析 proteomics。研究在 K-PREDICT 中找到 18 個與 prevalent CAD 顯著相關的 proteins。
最強訊號是 natriuretic peptide B(NPPB / BNP)。BNP 是心臟疾病中非常成熟的 biomarker,因此它成為最強訊號,也再次支持本研究 CAD/cardiac phenotype 的合理性。
其他值得注意的 proteins 包括:
- Midkine(MDK)
- Apolipoprotein M(APOM)
- Fatty acid-binding proteins
- Pleiotrophin(PTN)
- 以及與 extracellular matrix、metabolism、signaling 等相關的 proteins
Proteomics 分析的有效樣本中,CAD cases 113、controls 775;以 linear regression 調整 age 與 sex,在 FDR < 0.05 下找到 18 個 significant proteins。
Gene set/pathway enrichment analysis 顯示,CAD 組中上調的 biological themes 包括:
- Translation
- PI3K-AKT-mTOR pathway
- Cardiac insulin signaling
- Interferon response
- Stress response / ER stress response
同時,下調的 themes 包括:
- DNA replication
- DNA damage site / replication fork-related pathways
整體而言,這些 protein signatures 指向 CAD 患者存在 cellular stress、immune/interferon activation、metabolic signaling alteration 與 tissue remodeling。
更細項的 enrichment 包括 translational initiation、translation factor activity、ribosome binding、phosphotyrosine binding、RTK binding、Ser/Thr kinase activity、PIP3 signaling in cardiac tissue、insulin receptor cardiac pathway、response to type I interferon、interferon-mediated signaling、regulation of ER stress response、defense response to virus,以及 damaged DNA binding、replication fork、nuclear replication fork 等 DNA replication 相關訊號下降。
UK Biobank 蛋白體比較:部分 cross-sectional signal 也反映未來 MI 風險
為了檢視 K-PREDICT 中 protein signals 是否也與未來事件有關,研究在 UK Biobank 中進行比較。UK Biobank 中可用於此分析的 T2D 個案約 3,000 人,在 13.4 年中位追蹤期間出現約 200 個 incident myocardial infarction(MI)events。
K-PREDICT 找到的 18 個 significant proteins 中,有 14 個在 UK Biobank 中可取得。這 14 個 proteins 中,有 6 個與 incident MI 達 nominal association(p < 0.05)。
講者特別點名的 proteins 包括:
- NPPB / BNP / NT-proBNP:已知心臟疾病 biomarker
- Midkine(MDK):與 atherosclerosis 相關
- Procollagen C-endopeptidase enhancer 1(PCOLCE):可能與 fibrosis 相關
- Cytosolic 5'-nucleotidase 1A(NT5C1A):已知為 sporadic inclusion body myositis marker
這些結果代表:K-PREDICT 中的 cross-sectional CAD protein signal,至少有一部分也能在一個獨立且族群背景不同的 cohort 中反映未來 MI 風險。
UK Biobank replication subset 中 T2D cases 為 2,969,incident MI cases 為 194,中位追蹤 13.4 年;14/18 proteins 可比較,其中 6 個達 p < 0.05。相關文獻脈絡包含 Midkine 與 atherosclerosis(Majaj et al., Frontiers in Cardiovascular Medicine 2022)、PCOLCE 與 cardiac fibrosis / extracellular matrix biology(Lagoutte et al., Matrix Biology Plus 2021),以及 NT5C1A 與 sporadic inclusion body myositis(Herbert et al., Annals of the Rheumatic Diseases 2026)。
Multi-omics 是否改善 CAD identification:metabolites 貢獻最大,其次 genomics,再其次 proteins
接下來研究團隊評估這些 biomarkers 對 CAD identification 的增量價值。起點是 clinical model,接著分別加入:
- Metabolites
- Proteins
- Genomics / PRS
- 三層 omics 合併
臨床模型本身的 AUC 約為 0.774。加入 metabolites 後,AUC 提升至 0.831,是單一 omics layer 中最大的提升,而且達統計顯著。加入 proteins 或 genomics 也有一定提升,但幅度較小。三層 omics 全部合併後,AUC 達 0.843,相較於 clinical model 提升接近 0.07,並且以 DeLong test 達統計顯著。
這個結果的核心訊息是:multi-omic integration 可改善 T2D 患者 CAD 的辨識能力,其中 metabolites 的貢獻最大,其次是 genomics,最後是 proteins。
Test set 包含 CAD cases 56、controls 344。Clinical model 使用 PREVENT-like variables,包括 age、sex、BMI、SBP、smoking、HDL、LDL、eGFR、hypertensive medication、lipid-lowering medication。
| 模型 | Test set AUC | 相對 clinical model 的 ΔAUC | P value |
|---|---|---|---|
| Clinical model | 0.774 | Reference | Reference |
| Clinical + Metabolites(n=29) | 0.831 | 0.057 | 0.016 |
| Clinical + Proteins(n=18) | 0.791 | 0.016 | 0.414 |
| Clinical + Genomics(PRS) | 0.805 | 0.030 | 0.099 |
| Clinical + all three omics | 0.843 | 0.069 | 0.009 |
這也有重要臨床含義:T2D 中 CAD 常以 silent ischemia 呈現,因此若能透過血液檢測取得 metabolomic、proteomic 與 genomic markers,便可能在不依賴影像或侵入性檢查的情況下,改善高風險患者的辨識。
研究延伸:從 CAD 擴展到 stroke 與其他 T2D 併發症
講者接著說明,研究團隊目前正在將 phenotype 擴展到所有 T2D 相關併發症。以 stroke 為例,初步結果顯示,研究找到 60 個與 stroke 相關的 significant metabolites。
將 CAD 與 stroke 的 metabolite signatures 比較後,有 12 個 metabolites 兩者共享,而且這 12 個的方向完全一致。然而,大多數 metabolite signals 具有疾病特異性:
- 48 個為 stroke-only
- 18 個為 CAD-only
這代表可能存在一組 shared vascular metabolite core,但相當大比例的 metabolite signal 仍是 disease-specific。換言之,不同大血管併發症雖共享某些代謝風險軸線,但 CAD 與 stroke 可能也有各自不同的 metabolomic biology。
Stroke 分析中,stroke cases 441、controls 3,792;在 FDR < 0.05 下找到 60 個 significant metabolites。其 metabolite superclass 涵蓋 organic acids and derivatives、lipids and lipid-like molecules、organoheterocyclic compounds、organic oxygen compounds、nucleosides/nucleotides/analogues、benzenoids、alkaloids and derivatives,以及 exogenous drug metabolites、food/phytochemicals、xenobiotics。
Stroke volcano plot 中較突出的 metabolites 包括 O-hydroxyhippuric acid、4-hydroxybenzoate、4-acetamidobutanoate、N-phenylacetylglutamine、malonyl-L-carnitine、N-acetylneuraminic acid、indoxylsulfuric acid、N4-acetylcytidine、methylthioadenosine、pseudouridine、propylurofuranic acid、12-HETE、hippurate 等。
總結與研究限制
本研究主要結論如下:
- Metabolomics 找到 29 個 endogenous metabolites 與 prevalent CAD 相關。
- Proteomics 找到 18 個 proteins 與 prevalent CAD 相關,其中 6 個 proteins 在 UK Biobank 中與 incident MI 達 nominal association。
- 加入這些 markers 可改善 CAD identification,貢獻最大的是 metabolites,其次是 genomics / PRS,再其次是 proteins。
- 這些關聯仍屬 observational associations,尚不能推論因果。
- 未來仍需要 replication 與 formal causal inference,例如 Mendelian randomization。
- 整合 metabolomic、proteomic 與 genomic biomarkers,可能有助於改善 T2D 患者心血管併發症的 risk stratification。
講者特別強調,雖然 multi-omics model 已展現增量辨識能力,但目前仍需謹慎解讀,因為研究並未證明這些 biomarkers 是 CAD 的因果因子。下一步需要在前瞻性 cohort 中複製,並透過 causal inference 方法確認哪些 molecules 可能是真正介入點,而哪些只是疾病狀態或用藥的反映。
致謝與開放資源
講者感謝其 mentor Dr. Soo Heon Kwak、所有 collaborators、cohort participants 與研究資助者。K-PREDICT cohort 也被強調為可供研究社群使用的 open resource。
K-PREDICT 提供 cohort dashboard 與 QTL PheWeb browser,資源連結包括 https://dashboard.k-predict.org/ 與 https://pheweb.k-predict.org/。
協作單位與人員橫跨 Seoul National University Hospital、SMG-SNU Boramae Hospital、SNU Bundang Hospital、Seoul National University、SNU Genomic Medicine Institute、Graduate School of Data Science、Gachon University Gil Medical Center、Korea Institute of Science and Technology,以及 Ministry of Food and Drug Safety 等。
Q&A:4-hydroxybenzoate 的來源、飲食資訊與臨床導入下一步
問題 1:hydroxybenzoate 是否可能來自保存食品,而不只是 gut microbiome?
Dr. King 提出第一個問題。他指出,本研究中 metabolites 的貢獻似乎遠大於其他兩層 omics 的總和,而其中 hydroxybenzoate 特別有趣。他們在 type 1 diabetes population 中也觀察到這個 molecule 與風險相關。Dr. King 進一步提醒,benzoate 的來源不只可能是 gut microbiome,也可能來自許多 preserved foods;他詢問研究團隊是否深入分析過這些 non-endogenous metabolites 的來源,因為這類訊號常被忽略。
講者回應,目前 cohort 尚未有完整飲食資訊,因此無法在本分析中區分 hydroxybenzoate 的來源。不過,這是非常重要的問題,因為 gut microbiome-derived metabolites 已知可能是 atherosclerosis 的重要風險因子。K-PREDICT 下一階段正在透過 food frequency questionnaires 收集飲食資料,未來分析有機會釐清飲食、保存食品、microbiome-derived metabolites 與 CAD 之間的關係。
問題 2:若要加速 point-of-care implementation,下一步是什麼?
主持人接著詢問:在已初步辨識並於不同 cohort 中驗證部分訊號後,若要加速這些發現進入臨床照護端,下一個合理步驟是什麼?
講者回答有兩個重點。
第一,必須處理因果性問題。此研究目前是 observational,不能直接視為 causal evidence。因此需要透過 Mendelian randomization 等方法,以及在前瞻性 cohort 中進一步複製,來強化這些 findings 的可信度。
第二,研究團隊希望建立一個 targeted panel,聚焦於核心 metabolites 與 proteins。若能將這些 markers 轉化為可實際檢測的 targeted metabolite/protein panel,就可以在前瞻性臨床試驗中測試其臨床效用,並建立經過驗證的 point-of-care 或 risk stratification approach。
Take-home Summary
- T2D 患者的 CAD 風險高,且常表現為 silent ischemia、較早發病、多血管與長段病變,因此需要比傳統臨床因子更精準的辨識工具。
- 在東亞 T2D cohort K-PREDICT 中,metabolomics 找到 29 個 endogenous CAD-associated metabolites;proteomics 找到 18 個 CAD-associated proteins。
- Metabolite 訊號中,4-hydroxybenzoate 是最強正向關聯之一;carvedilol 與 aspirin metabolite 等藥物相關訊號也支持 CAD phenotype 定義合理。
- Protein 訊號中,NPPB/BNP 最強,並伴隨 cellular stress、interferon response、PI3K-AKT-mTOR、cardiac insulin signaling 與 remodeling 相關 pathways。
- 在 CAD identification 中,clinical model AUC 為 0.774;加入 metabolites 後升至 0.831;整合 metabolites、proteins 與 PRS 後升至 0.843。
- Multi-omics 的增量價值以 metabolites 最大,其次為 genomics,再其次為 proteins。
- 目前證據仍為 observational;未來需要 replication、Mendelian randomization、targeted biomarker panel 與前瞻性臨床驗證。
