← 返回列表

Machine learning assists prediction of genes responsible for plant specialized metabolite biosynthesis by integrating multi-omics data

作者
Wenhui Bai, Cheng Li, Wei Li, Hai Wang, Xiaohong Han, Peipei Wang, Li Wang
杂志
BMC Genomics(2024)
DOI
10.1186/s12864-024-10258-6
所属领域
代谢工程
关键词
AutoGluon-TabularGenomicsMachine learningPlant specialized metabolitesProteomics
阅读原文
查看 PDF 原文

解决的核心问题

如何利用机器学习从多组学数据中准确预测参与植物特化代谢物(萜类、生物碱、酚类)生物合成的基因,克服传统方法候选基因数量庞大、通路解析困难的问题。

研究策略

整合AutoGluon-Tabular自动机器学习框架与拟南芥多组学数据,构建三分类(萜类/生物碱/酚类)预测模型,通过特征重要性分析筛选关键组学特征,并利用跨物种数据验证模型泛化能力。

研究路线图

100%
研究问题:如何从多组学数据预测植物特化代谢基因
策略:集成AutoGluon-Tabular与多组学数据
关键改造1:三分类预测模型(萜类/生物碱/酚类)
关键改造2:特征重要性分析与关键特征的筛选
关键改造3:跨物种(拟南芥/番茄/玉米)多组学验证
关键改造4:特征组合优选(基因组+蛋白质组)
结果:AUC达0.905,跨物种ACC达0.844
外部验证:葡萄ACC 0.603,罂粟AUC 0.584
结论:机器学习有效预测代谢基因,可指导药用植物研究
Text is not SVG - cannot display

下载 .drawio 源文件

核心内容

该研究将AutoGluon-Tabular自动机器学习框架与拟南芥多组学数据相结合,构建了三分类模型以预测参与萜类、生物碱和酚类生物合成的基因。研究整合基因组、转录组、蛋白质组等多维特征,通过特征重要性分析筛选关键组学指标,并利用番茄、玉米、葡萄及罂粟数据评估模型跨物种适用性。在拟南芥金标准数据集上,模型平均AUC-ROC达0.891,准确率0.779,F1值0.77。特征分析显示,基因组与蛋白质组特征最为关键,仅用5个关键特征即可将AUC提升至0.905,优于全特征模型表现。跨物种验证中,单物种预测AUC为0.785,同物种预测达0.924,三物种联合模型在验证集准确率0.844,并在葡萄和罂粟外部数据集中展现出一定预测能力。结果表明,机器学习可高效识别植物特化代谢物合成基因,基因组和蛋白质组信息足以支撑可靠预测,且模型具备跨物种应用潜力,为数据匮乏的药用植物代谢基因发现提供了可行策略。

创新点

1. 首次将AutoGluon-Tabular自动机器学习用于植物特化代谢物合成基因预测;2. 发现基因组和蛋白质组特征为最关键特征,仅用5个关键特征即可达到优于全特征模型的性能;3. 建立了跨物种(拟南芥、番茄、玉米)三分类模型,并在葡萄和罂粟中验证了适用性。

研究对象(5)

底盘细胞代谢通路基因蛋白功能说明
Arabidopsis thaliana 萜类/生物碱/酚类生物合成 P450、UDPGT等蛋白 催化 拟南芥金标准数据集含594个PSM合成基因
Solanum lycopersicum 萜类/生物碱/酚类生物合成 催化 番茄金标准数据集含467个PSM合成基因
Zea mays 萜类/生物碱/酚类生物合成 催化 玉米金标准数据集含544个PSM合成基因
Vitis vinifera 萜类/生物碱/酚类生物合成 催化 葡萄外部验证数据集含1083个SM基因
Papaver somniferum 萜类/生物碱/酚类生物合成 催化 罂粟外部验证数据集含73个SM基因

关键发现

  1. 在拟南芥金标准数据集上,AutoGluon-Tabular三分类模型平均AUC-ROC为0.891,ACC为0.779,F1为0.77
  2. 原始数据集AUC-ROC为0.863。仅用蛋白质组特征模型AUC-ROC达0.881,基因组特征0.809
  3. 结合基因组和蛋白质组特征后AUC为0.885,进一步特征选择后AUC提升至0.905。跨物种验证中,单物种跨物种预测(如番茄训练拟南芥测试)AUC为0.785,同物种预测(拟南芥)AUC为0.924
  4. 三物种模型在验证集上ACC达0.844。在葡萄外部数据集上,AutoGluon-Tabular ACC为0.603(LightGBM最高0.63)
  5. 在罂粟上AutoGluon-Tabular AUC-ROC为0.584(NeuralNetFastAI最佳0.69)。

研究结论

机器学习模型能够有效预测植物特化代谢物合成基因,其中基因组和蛋白质组特征足以支撑可靠预测,且模型具有良好的跨物种应用潜力,可为数据匮乏物种(如药用植物)的代谢基因发现提供指导。