|
个人信息Personal Information
教授
博士生导师
教师英文名称:Jiyang Dong
电子邮箱:
所在单位:电子科学与技术学院(国家示范性微电子学院)
办公地点:厦门大学翔安校区文宣楼B409
研究方向
3. 计算质谱
计算质谱是质谱技术与计算科学、统计学、化学信息学和机器学习交叉形成的研究方向。它关注的核心问题,不是质谱仪能否采集到信号,而是如何把复杂的质谱信号转化为可靠的分子信息、结构信息和生物医学解释。质谱仪直接记录的是离子的质荷比、强度、保留时间、碎片谱和离子淌度等信息,而研究者真正关心的往往是化合物结构、分子身份、定量结果和疾病相关分子特征。计算质谱正是连接原始仪器信号和科学结论的关键环节。
随着液相色谱-质谱联用、高分辨质谱、串联质谱和离子淌度质谱的发展,质谱数据已经从早期较简单的谱峰列表,发展为高维、多尺度的数据体系。现代质谱实验常常一次产生数千到数百万张谱图,数据中包含噪声、漂移、缺失、共洗脱、同位素峰、加合离子、源内碎裂和复杂碎片关系。人工读谱已无法满足高通量研究需求,自动化、标准化和智能化的数据分析方法成为质谱研究的重要基础[1-6]。
计算质谱的发展最早受到蛋白质组学和小分子结构解析需求的推动。在蛋白质组学中,MaxQuant 和 OpenMS 等软件提高了肽段识别、蛋白质推断和定量分析的自动化程度[2,3]。在小分子分析中,XCMS、MZmine 和 MS-DIAL 等工具围绕峰提取、峰匹配、保留时间校正、去卷积和定量分析建立了较完整的数据处理流程[4-6]。随后,GNPS、SIRIUS 和 MetFrag 等方法进一步推动了谱库共享、分子式推断、计算碎裂和结构候选排序的发展[7-9]。这些工作使计算质谱从数据预处理逐步扩展到分子识别和结构解释。
计算质谱的主要任务包括数据格式转换、质量控制、峰检测、峰对齐、同位素峰识别、加合离子判断、保留时间校正、碎片谱解析、谱库检索、分子式预测、结构候选排序、定量建模、统计分析和结果可视化。不同类型的质谱数据对应不同的计算问题。LC-MS 数据强调峰形识别和跨样本匹配,MS/MS 数据强调碎片关系和结构解释,离子淌度质谱强调碰撞截面积和气相构象信息。虽然应用场景不同,但共同目标都是从复杂信号中提取可信、稳定、可解释的分子证据。
计算质谱的一个重要特点是必须同时理解信号处理和化学规律。质谱数据不是一般意义上的高维矩阵,而是由仪器响应、离子化过程、分离过程和分子结构共同决定的复杂信号。峰形、同位素分布、加合离子类型、碎片裂解规律、保留时间漂移、离子抑制和基质效应,都会影响后续解释。如果只使用通用统计模型而忽略质谱信号的化学来源,容易产生错误匹配或过度解释。因此,计算质谱方法需要把信号处理、统计建模和化学先验结合起来,在自动化分析和结果可信度之间取得平衡。
计算质谱的另一个特点是高度依赖数据库和知识库。蛋白质组学通常需要蛋白序列数据库,小分子和代谢物分析则需要 HMDB、METLIN、MassBank、GNPS、KEGG、LipidMaps 和 PubChem 等资源。数据库可以提高注释效率,但也会带来覆盖不足、同分异构体混淆和候选结构过多等问题。许多非靶向质谱信号无法在现有谱库中找到完全匹配结果,因此计算质谱正在从简单的谱库比对,发展到分子式预测、计算碎裂、相似结构搜索、机器学习预测和生成模型辅助推断[7-9]。
计算质谱的研究意义在于,它直接决定质谱数据能否转化为可靠的科学知识。高分辨质谱仪可以产生大量数据,但原始数据本身并不能自动给出结论。一个峰是否真实存在,两个样本中的峰是否对应同一化合物,一个信号是否来自同位素峰或加合离子,一个候选结构是否可信,一组差异是否具有生物学意义,都需要计算方法来判断。对于大规模队列研究、临床质谱、药物代谢研究和多组学整合研究来说,计算质谱直接影响结果的可重复性和解释深度。
计算质谱目前也面临一些瓶颈。复杂样本中存在大量低丰度、共洗脱和同分异构信号,特征提取和定量容易受到干扰。非靶向研究中的分子注释仍然不充分,许多信号只能获得候选分子式或候选结构,距离严格结构确证还有差距。不同实验平台、不同批次和不同实验室之间的数据差异较大,影响跨队列分析和模型推广。深度学习和大模型正在进入质谱研究,但其预测结果仍需要化学规则、实验验证和不确定性评估约束。
我们团队在计算质谱方向的研究兴趣主要集中在质谱数据质量控制、非靶向分子识别、多维质谱信息建模和工程化质谱软件开发。团队具有电子信息、物理学、分析化学、质谱技术和生物医学数据分析的交叉基础,长期关注如何用信号处理、高维数据分析和机器学习方法解决真实质谱数据中的关键问题。计算质谱在团队研究中不是单独的软件工具开发,而是支撑代谢组学、多组学数据分析和健康大数据研究的基础方法。
在数据质量控制方面,我们团队关注质谱数据中的缺失值、批次效应、归一化和生物异质性保留问题。质谱数据容易受到离子抑制、仪器漂移、样本稀释和批间差异影响。简单校正可能提高数据一致性,却同时削弱真实的疾病差异和个体差异。围绕这一问题,团队发展了 NMF-based 缺失值填补方法、CordBat 批次效应校正方法、Local Neighbor Normalization 和 Local Sample Cohesion Normalization 等方法,用于在提高数据稳定性的同时尽量保留真实生物异质性[10-13]。
在非靶向小分子识别方面,我们团队关注如何把化学衍生化策略、高分辨质谱特征和智能软件结合起来,提高复杂样本中未知分子的发现能力。MS-IDF 利用窄质量亏损过滤思想,用于化学同位素标记后内源性代谢物的非靶向识别[14]。MS-TDF 将三维组合衍生化策略与质谱数据处理软件结合,用于增强特定官能团化合物的识别能力[15]。MS-DDF 面向动物源药物和复杂天然产物体系,发展智能高分辨质谱数据处理流程,用于解析生物活性小分子[16]。这些工作体现了团队将化学反应设计、质谱信号规律和算法流程结合起来的研究思路。
在多维质谱信息建模方面,我们团队关注离子淌度质谱、碰撞截面积和分子结构信息之间的联系。离子淌度质谱在质荷比和保留时间之外提供了新的分离维度,碰撞截面积能够反映离子的气相构象特征,对同分异构体区分和小分子注释具有重要意义。团队发展的大语言模型赋能化合物碰撞截面积预测方法,尝试将化学结构表示、深度学习和质谱先验知识结合起来,用于提高 CCS 预测和小分子结构辅助识别能力[17]。
在工程化软件开发方面,我们团队重视算法方法向实用工具的转化。复杂质谱数据分析不仅需要理论模型,也需要稳定、易用、可复现的软件系统。团队围绕非靶向识别、批次效应校正、数据归一化、分子结构辅助预测和批量处理等任务,持续发展面向实际科研场景的质谱数据处理工具。相关工作强调算法效率、批量处理能力和结果可解释性,使计算质谱方法能够更直接地服务于代谢组学、药物分析、临床质谱和复杂样本分子识别。
总体来看,我们团队在计算质谱方向的研究目标,是发展面向复杂生物医学问题的智能质谱数据分析方法。一方面,团队关注质谱数据本身的噪声、缺失值、批次效应、峰识别、谱图解析和分子注释问题,建立更稳健、更自动化的数据处理流程。另一方面,团队结合化学衍生化、高分辨质谱、离子淌度质谱、深度学习和工程化软件开发,推动质谱数据从原始谱图走向可靠的分子识别和可解释的生物医学应用。通过这些研究,计算质谱可以成为连接质谱仪器、分子识别和精准医学的重要方法基础,为疾病机制研究、标志物发现、药物评价和多组学整合提供新的技术支撑。
参考文献
[1] Aebersold, R.; Mann, M. Mass-Spectrometric Exploration of Proteome Structure and Function. Nature, 2016, 537(7620): 347–355.
[2] Cox, J.; Mann, M. MaxQuant Enables High Peptide Identification Rates, Individualized p.p.b.-Range Mass Accuracies and Proteome-Wide Protein Quantification. Nature Biotechnology, 2008, 26(12): 1367–1372.
[3] Röst, H. L.; Sachsenberg, T.; Aiche, S.; Bielow, C.; Weisser, H.; Aicheler, F.; Andreotti, S.; Ehrlich, H.-C.; Gutenbrunner, P.; Kenar, E.; et al. OpenMS: A Flexible Open-Source Software Platform for Mass Spectrometry Data Analysis. Nature Methods, 2016, 13(9): 741–748.
[4] Smith, C. A.; Want, E. J.; O’Maille, G.; Abagyan, R.; Siuzdak, G. XCMS: Processing Mass Spectrometry Data for Metabolite Profiling Using Nonlinear Peak Alignment, Matching, and Identification. Analytical Chemistry, 2006, 78(3): 779–787.
[5] Pluskal, T.; Castillo, S.; Villar-Briones, A.; Orešič, M. MZmine 2: Modular Framework for Processing, Visualizing, and Analyzing Mass Spectrometry-Based Molecular Profile Data. BMC Bioinformatics, 2010, 11: 395.
[6] Tsugawa, H.; Cajka, T.; Kind, T.; Ma, Y.; Higgins, B.; Ikeda, K.; Kanazawa, M.; VanderGheynst, J.; Fiehn, O.; Arita, M. MS-DIAL: Data-Independent MS/MS Deconvolution for Comprehensive Metabolome Analysis. Nature Methods, 2015, 12(6): 523–526.
[7] Wang, M.; Carver, J. J.; Phelan, V. V.; Sanchez, L. M.; Garg, N.; Peng, Y.; Nguyen, D. D.; Watrous, J.; Kapono, C. A.; Luzzatto-Knaan, T.; et al. Sharing and Community Curation of Mass Spectrometry Data with Global Natural Products Social Molecular Networking. Nature Biotechnology, 2016, 34(8): 828–837.
[8] Dührkop, K.; Fleischauer, M.; Ludwig, M.; Aksenov, A. A.; Melnik, A. V.; Meusel, M.; Dorrestein, P. C.; Rousu, J.; Böcker, S. SIRIUS 4: A Rapid Tool for Turning Tandem Mass Spectra into Metabolite Structure Information. Nature Methods, 2019, 16(4): 299–302.
[9] Wolf, S.; Schmidt, S.; Müller-Hannemann, M.; Neumann, S. In Silico Fragmentation for Computer Assisted Identification of Metabolite Mass Spectra. BMC Bioinformatics, 2010, 11: 148.
[10] Xu, J.; Wang, Y.; Xu, X.; Cheng, K. K.; Raftery, D.; Dong, J. NMF-Based Approach for Missing Values Imputation of Mass Spectrometry Metabolomics Data. Molecules, 2021, 26(19): 5787.
[11] Guo, F.; Lin, G.; Dong, L.; Cheng, K. K.; Deng, L.; Xu, X.; Raftery, D.; Dong, J. Concordance-Based Batch Effect Correction for Large-Scale Metabolomics. Analytical Chemistry, 2023, 95(18): 7220–7228.
[12] Lu, K.; Liu, Y.; Cheng, K. K.; Guo, F.; Deng, L.; Dong, J. Local Neighbor Normalization: Reconciling Accurate Normalization and Heterogeneity Recovery in Large-Scale Metabolomics. Analytica Chimica Acta, 2025, 1372: 344440.
[13] Guo, F.; Deng, L.; Cheng, K. K.; Lu, K.; Wang, Y.; Guo, L.; Raftery, D.; Dong, J. Local Sample Cohesion Normalization: Preserving Inherent Biological Heterogeneity in Metabolomics Data. Analytical Chemistry, 2026, 98(1): 343–353.
[14] Wang, S.; Jiang, X.; Ding, R.; Chen, B.; Lyu, H.; Liu, J.; Zhu, C.; Shen, R.; Chen, J.; Hong, Y.; Wu, Y.-L.; Dong, J.; Wu, C. MS-IDF: A Software Tool for Nontargeted Identification of Endogenous Metabolites after Chemical Isotope Labeling Based on a Narrow Mass Defect Filter. Analytical Chemistry, 2022, 94(7): 3194–3202.
[15] Yuan, C.; Jin, Y.; Zhang, H.; Chen, S.; Yi, J.; Xie, Q.; Dong, J.; Wu, C. Strategy to Empower Nontargeted Metabolomics by Triple-Dimensional Combinatorial Derivatization with MS-TDF Software. Analytical Chemistry, 2024, 96(19): 7634–7642.
[16] Zhang, H.; Zhang, D.; Li, J.; Wei, Y.; He, Y.; Yuan, Y.; Ding, A.; Zhang, J.; Zhou, Y.; Dong, J.; Wu, C. MS-DDF: An Intelligent High-Resolution Mass Spectrometry Data-Processing Tool for Deciphering Bioactive Small Molecules in Animal-Derived Medicines. Acta Pharmaceutica Sinica B, 2025, DOI: 10.1016/j.apsb.2025.12.033.
[17] Zhu, Z.; Xie, C.; Lin, S.; Xu, X.; Niu, S.; Guo, L.; Dong, J. Large Language Model-Empowered Compound Collision Cross-Section Prediction. Analytical Chemistry, 2025, 97(36): 19791–19800.

