|
个人信息Personal Information
教授
博士生导师
教师英文名称:Jiyang Dong
电子邮箱:
所在单位:电子科学与技术学院(国家示范性微电子学院)
办公地点:厦门大学翔安校区文宣楼B409
研究方向
2. 代谢组学
代谢组学是系统研究生物体内小分子代谢物及其变化规律的一类组学技术。它关注细胞、组织、器官、体液或整个机体中的代谢物组成、含量变化和代谢通路活动。与基因组学和蛋白质组学相比,代谢组学更接近生物表型。基因和蛋白质反映的是生命活动的上游调控信息,而代谢物通常处在生化反应的末端或近末端位置,能够较直接地反映机体在特定时间、特定环境和特定疾病状态下的功能改变。因此,代谢组学常被视为连接分子机制和疾病表型的重要桥梁[1-3]。
从发展历史看,代谢组学的思想并不是突然出现的。早期研究者已经注意到,尿液、血液和组织提取物中的小分子成分可以反映个体的生理和病理状态。20 世纪 70 年代以后,气相色谱、质谱和核磁共振技术的发展,使复杂生物样本中的小分子检测逐渐从定性观察走向系统定量分析。20 世纪 90 年代以后,随着高分辨质谱、核磁共振波谱、多变量统计和生物信息学的发展,代谢物整体分析逐渐形成了较完整的研究体系。Nicholson 等人在 1999 年提出 metabonomics 的概念,强调利用多变量统计方法理解生物系统对病理刺激或遗传改变的动态代谢响应[1]。Fiehn 在 2002 年进一步系统阐述了 metabolomics 在连接基因型和表型方面的作用,使代谢组学成为后基因组时代的重要研究方向[2]。
代谢组学的基本研究对象是代谢物。常见代谢物包括氨基酸、有机酸、糖类、脂质、核苷酸、胆汁酸、激素、药物及其代谢产物等。这些分子参与能量代谢、氧化还原平衡、信号转导、细胞膜构建、炎症反应、免疫调节和细胞命运决定。由于代谢物种类多、浓度范围宽、理化性质差异大,单一分析平台很难覆盖全部代谢物。因此,代谢组学通常需要结合核磁共振、气相色谱-质谱、液相色谱-质谱、毛细管电泳-质谱、高分辨质谱和离子淌度质谱等平台。不同平台各有特点。核磁共振重复性好、样本处理简单、定量稳定,但灵敏度相对较低。质谱灵敏度高、覆盖范围广,适合检测低丰度代谢物,但对样本制备、色谱分离、离子化效率和数据处理方法要求更高[3-5]。
从研究流程看,代谢组学通常包括样本采集、样本前处理、仪器检测、数据预处理、代谢物注释、统计建模、通路分析和生物学解释。样本类型可以是血清、血浆、尿液、脑脊液、组织、细胞、粪便或组织切片。仪器检测后获得的数据往往包含大量峰信号,需要进行峰提取、保留时间校正、峰匹配、归一化、缺失值处理、批次效应校正和质量控制。随后,研究者通常会使用主成分分析、偏最小二乘判别分析、线性模型、机器学习、代谢通路富集分析和网络分析等方法,从高维代谢数据中识别与疾病、药物、环境暴露或生理状态相关的代谢特征。XCMS 等工具的出现,推动了 LC-MS 非靶向代谢组学数据处理的标准化和自动化[6]。HMDB、METLIN、KEGG 和 LipidMaps 等数据库的发展,也为代谢物注释和通路解释提供了重要基础[7]。
代谢组学可以分为靶向代谢组学和非靶向代谢组学。靶向代谢组学通常围绕一组预先确定的代谢物进行检测,定量准确、重复性好,适合验证候选标志物和研究特定代谢通路。非靶向代谢组学则尽可能广泛地检测样本中的代谢物信号,适合发现未知代谢改变和新的疾病线索。二者并不是互相替代的关系。实际研究中,非靶向分析常用于发现候选代谢物,靶向分析则用于后续验证和定量。近年来,随着高分辨质谱、化学衍生化、稳定同位素标记和机器学习方法的发展,代谢组学的检测覆盖度、定量能力和结构注释能力都在持续提高。
代谢组学的一个重要特点是对生理状态变化非常敏感。饮食、年龄、性别、药物、肠道菌群、昼夜节律、运动、环境暴露和疾病进展都会影响代谢物谱。正因为如此,代谢组学既有很高的生物学信息量,也面临较强的干扰因素。合理的实验设计、严格的样本采集规范、稳定的质量控制样本、可靠的归一化方法和合适的统计模型,是获得可信结论的前提。代谢组学数据如果只停留在差异代谢物列表层面,容易得到零散结果。更有价值的分析是把代谢物变化放回代谢通路、组织功能、细胞状态和疾病进程中理解,从而解释代谢异常背后的机制[8]。
代谢组学的研究意义在于,它能够从功能层面观察生物系统的状态变化。许多疾病在临床表现出现之前,体内代谢网络已经发生改变。糖代谢异常、脂质代谢紊乱、氨基酸代谢改变、氧化应激增强和能量代谢重编程,都可能成为疾病早期诊断、分型、疗效评价和预后判断的重要线索。在肿瘤研究中,代谢组学可以用于分析肿瘤代谢重编程、寻找血清或组织标志物、评估治疗反应和耐药机制。在神经退行性疾病研究中,代谢组学可以观察脑区、血液或脑脊液中的能量代谢、脂质代谢和神经递质相关变化。在糖尿病、糖尿病肾病和肝脏疾病研究中,代谢组学可以帮助理解疾病从代谢紊乱到器官损伤的连续过程。在药物研究和毒理学中,代谢组学可以用于评价药效、毒性反应、药物代谢和个体差异[8-9]。
代谢组学的应用领域已经非常广泛。在基础生命科学中,它可以用于解释基因功能、细胞代谢调控和组织器官互作。在临床医学中,它可用于疾病标志物发现、风险预测、疾病分型和个体化治疗。在公共卫生和环境科学中,它可用于研究环境污染物、饮食结构和生活方式对人体代谢状态的影响。在食品科学和中药研究中,它可用于质量评价、产地鉴别、活性成分发现和作用机制分析。在空间组学快速发展的背景下,代谢组学还可以与质谱成像、病理图像、空间转录组和免疫成像结合,从整体代谢谱分析进一步走向空间代谢机制研究。
代谢组学目前仍面临一些关键挑战。首先,代谢物结构复杂,许多峰信号难以准确注释,未知代谢物仍然占较大比例。其次,不同仪器平台、实验批次和样本前处理方法会引入系统差异,影响结果可重复性。再次,代谢物之间存在较强相关性,同一代谢物也可能参与多个通路,简单的单变量差异分析难以解释复杂的代谢调控。最后,代谢组学研究常常需要与转录组、蛋白质组、微生物组、影像组学和临床数据联合分析,这对数据融合、统计建模和可解释性提出了更高要求。因此,代谢组学的发展正在从单纯的差异代谢物筛选,逐步转向机制解释、网络建模、多组学融合和智能分析。
我们团队在代谢组学方向的研究兴趣主要集中在计算方法、代谢网络建模和疾病应用的结合。根据现有研究基础,我们团队长期关注机器学习、计算质谱、空间多组学、分子网络建模和健康大数据等方向,代谢组学是这些方向之间的重要交汇点。团队希望利用信号处理、图像处理、高维数据分析和机器学习方法,提高代谢组学数据处理、特征提取、模式识别和机制解释的能力,推动代谢组学从数据驱动的标志物筛选走向可解释的疾病机制分析。
在数据处理方法方面,我们团队关注代谢组学数据中的缺失值、批次效应、归一化和质量控制问题。代谢组学数据常常受到样本稀释、仪器漂移、离子抑制和批间差异的影响,如果处理不当,会削弱真实生物信号,甚至产生错误结论。围绕这些问题,团队发展了面向质谱代谢组学缺失值插补、批次效应校正和大规模数据归一化的方法。例如,NMF-based 方法用于处理质谱代谢组学数据中的缺失值问题,CordBat 方法用于大规模代谢组学批次效应校正,Local Neighbor Normalization 和 Local Sample Cohesion Normalization 则进一步关注归一化过程中生物异质性的保留[10-13]。这些工作共同指向一个核心问题,即在提高数据一致性的同时,尽量保留疾病、个体差异和代谢异质性所携带的真实生物信息。
在代谢通路和代谢网络分析方面,我们团队关注如何从单个代谢物差异走向代谢系统整体变化的解释。传统代谢通路富集分析常常受到代谢物覆盖度不足、通路重叠和代谢物相关结构复杂等问题影响。针对这些问题,团队发展了 overlapping group PLS、iMSEA、dci-MSEA、iMS2Net 和 SynNet 等方法,用于分析代谢物集合、代谢通路、代谢协同关系和多尺度代谢互作网络[14-18]。这些方法不是简单统计哪些代谢物升高或降低,而是进一步分析代谢物之间的协同变化、通路之间的关系以及疾病状态下代谢网络的重构。对于肿瘤、阿尔茨海默病、糖尿病肾病和多器官代谢响应等问题,这类网络方法有助于揭示更深层次的代谢调控特征。
在疾病应用方面,我们团队关注代谢组学在重大疾病诊断、分型、预后评估和机制研究中的应用。相关研究涉及肝细胞肝癌、鼻咽癌、胃癌、阿尔茨海默病、糖尿病肾病和其他代谢相关疾病。团队早期承担了基于代谢组学数据融合与建模的新方法及其在糖尿病肾病研究中的应用项目,也开展了核磁共振代谢组学新方法及其在糖尿病、妊娠期糖尿病和糖尿病肾病早期诊断中的应用研究。近年来,团队进一步将代谢组学与机器学习、空间代谢组学和多模态分析结合,用于阿尔茨海默病空间代谢机制研究、肝细胞肝癌代谢网络分析和鼻咽癌多模态跨尺度代谢智能分型。代谢组学在这些研究中不仅用于寻找候选标志物,也用于解释疾病进展、组织异质性和代谢调控异常。
在空间代谢组学和多组学融合方向,我们团队关注如何把传统体液或组织提取物代谢组学与质谱成像、组织病理、影像学和临床数据结合起来。传统代谢组学能够获得较全面的代谢物谱,但通常缺少空间位置信息。质谱成像可以观察代谢物在组织中的空间分布,但也面临噪声高、分辨率有限和分子注释困难等问题。通过空间代谢组学和多模态数据融合,可以把代谢物变化与组织结构、细胞状态和疾病区域联系起来,为疾病机制研究提供更完整的信息。团队在质谱成像数据分割、去噪、离子图像表示学习、多模态图像融合和空间异质性分析方面的工作,也为代谢组学向空间化、网络化和智能化发展提供了方法基础。
总体来看,我们团队在代谢组学方向的研究目标,是发展面向复杂疾病研究的计算代谢组学方法。具体而言,一方面需要解决代谢组学数据中的缺失值、噪声、批次效应、归一化和高维建模问题,提高数据处理的稳定性和可重复性;另一方面需要通过代谢通路分析、分子网络建模、机器学习和多组学融合,解释疾病中的代谢异质性和系统性代谢重构。通过这些研究,团队希望推动代谢组学从代谢物检测和标志物筛选,进一步发展为可解释的疾病机制分析工具,为疾病早期诊断、分子分型、预后评估和精准医学研究提供新的方法支撑。
参考文献
[1] Nicholson, J. K.; Lindon, J. C.; Holmes, E. “Metabonomics”: Understanding the Metabolic Responses of Living Systems to Pathophysiological Stimuli via Multivariate Statistical Analysis of Biological NMR Spectroscopic Data. Xenobiotica, 1999, 29(11): 1181–1189.
[2] Fiehn, O. Metabolomics: The Link between Genotypes and Phenotypes. Plant Molecular Biology, 2002, 48(1–2): 155–171.
[3] Patti, G. J.; Yanes, O.; Siuzdak, G. Metabolomics: The Apogee of the Omics Trilogy. Nature Reviews Molecular Cell Biology, 2012, 13(4): 263–269.
[4] Dettmer, K.; Aronov, P. A.; Hammock, B. D. Mass Spectrometry-Based Metabolomics. Mass Spectrometry Reviews, 2007, 26(1): 51–78.
[5] Beckonert, O.; Keun, H. C.; Ebbels, T. M. D.; Bundy, J.; Holmes, E.; Lindon, J. C.; Nicholson, J. K. Metabolic Profiling, Metabolomic and Metabonomic Procedures for NMR Spectroscopy of Urine, Plasma, Serum and Tissue Extracts. Nature Protocols, 2007, 2(11): 2692–2703.
[6] Smith, C. A.; Want, E. J.; O’Maille, G.; Abagyan, R.; Siuzdak, G. XCMS: Processing Mass Spectrometry Data for Metabolite Profiling Using Nonlinear Peak Alignment, Matching, and Identification. Analytical Chemistry, 2006, 78(3): 779–787.
[7] Wishart, D. S.; Tzur, D.; Knox, C.; et al. HMDB: The Human Metabolome Database. Nucleic Acids Research, 2007, 35(Database issue): D521–D526.
[8] Johnson, C. H.; Ivanisevic, J.; Siuzdak, G. Metabolomics: Beyond Biomarkers and towards Mechanisms. Nature Reviews Molecular Cell Biology, 2016, 17(7): 451–459.
[9] Wishart, D. S. Emerging Applications of Metabolomics in Drug Discovery and Precision Medicine. Nature Reviews Drug Discovery, 2016, 15(7): 473–484.
[10] Xu, J.; Wang, Y.; Xu, X.; Cheng, K. K.; Raftery, D.; Dong, J. NMF-Based Approach for Missing Values Imputation of Mass Spectrometry Metabolomics Data. Molecules, 2021, 26(19): 5787.
[11] Guo, F.; Lin, G.; Dong, L.; Cheng, K. K.; Deng, L.; Xu, X.; Raftery, D.; Dong, J. Concordance-Based Batch Effect Correction for Large-Scale Metabolomics. Analytical Chemistry, 2023, 95(18): 7220–7228.
[12] Lu, K.; Liu, Y.; Cheng, K. K.; Guo, F.; Deng, L.; Dong, J. Local Neighbor Normalization: Reconciling Accurate Normalization and Heterogeneity Recovery in Large-Scale Metabolomics. Analytica Chimica Acta, 2025, 1372: 344440.
[13] Guo, F.; Deng, L.; Cheng, K. K.; Lu, K.; Wang, Y.; Guo, L.; Raftery, D.; Dong, J. Local Sample Cohesion Normalization: Preserving Inherent Biological Heterogeneity in Metabolomics Data. Analytical Chemistry, 2026, 98(1): 343–353.
[14] Deng, L.; Ma, L.; Cheng, K. K.; Xu, X.; Raftery, D.; Dong, J. A Sparse PLS-Based Method for Overlapping Metabolite Set Enrichment Analysis. Journal of Proteome Research, 2021, 20(6): 3204–3213.
[15] Dong, J.; Peng, Q.; Deng, L.; Liu, J.; Huang, W.; Zhou, X.; Zhao, C.; Cai, Z. iMS2Net: A Multiscale Networking Methodology to Decipher Metabolic Synergy of Organism. iScience, 2022, 25(9): 104896.
[16] Wang, Y.; Liu, X.; Dong, L.; Cheng, K. K.; Lin, C.; Wang, X.; Dong, J.; Deng, L.; Raftery, D. iMSEA: A Novel Metabolite Set Enrichment Analysis Strategy to Decipher Drug Interactions. Analytical Chemistry, 2023, 95(15): 6203–6211.
[17] Lin, G.; Dong, L.; Cheng, K. K.; Xu, X.; Wang, Y.; Deng, L.; Raftery, D.; Dong, J. Differential Correlations Informed Metabolite Set Enrichment Analysis to Decipher Metabolic Heterogeneity of Disease. Analytical Chemistry, 2023, 95(33): 12505–12513.
[18] Wang, Y.; Zhu, Z.; Deng, L.; Cheng, K. K.; Guo, F.; Lin, G.; Raftery, D.; Dong, J. Multiscale Synergy Networks Offer Insights into Disease and Comorbidity Mechanisms. Analytical Chemistry, 2025, 97(6): 3633–3642.

