Machine learning assists prediction of genes responsible for plant specialized metabolite biosynthesis by integrating multi-omics data
- 作者
- Wenhui Bai, Cheng Li, Wei Li, Hai Wang, Xiaohong Han, Peipei Wang, Li Wang
- 杂志
- BMC Genomics(2024)
- DOI
- 10.1186/s12864-024-10258-6
- 所属领域
- 代谢工程
- 关键词
- 阅读原文
- 查看 PDF 原文
解决的核心问题
如何利用机器学习从多组学数据中准确预测参与植物特化代谢物(萜类、生物碱、酚类)生物合成的基因,克服传统方法候选基因数量庞大、通路解析困难的问题。
研究策略
整合AutoGluon-Tabular自动机器学习框架与拟南芥多组学数据,构建三分类(萜类/生物碱/酚类)预测模型,通过特征重要性分析筛选关键组学特征,并利用跨物种数据验证模型泛化能力。
核心内容
该研究将AutoGluon-Tabular自动机器学习框架与拟南芥多组学数据相结合,构建了三分类模型以预测参与萜类、生物碱和酚类生物合成的基因。研究整合基因组、转录组、蛋白质组等多维特征,通过特征重要性分析筛选关键组学指标,并利用番茄、玉米、葡萄及罂粟数据评估模型跨物种适用性。在拟南芥金标准数据集上,模型平均AUC-ROC达0.891,准确率0.779,F1值0.77。特征分析显示,基因组与蛋白质组特征最为关键,仅用5个关键特征即可将AUC提升至0.905,优于全特征模型表现。跨物种验证中,单物种预测AUC为0.785,同物种预测达0.924,三物种联合模型在验证集准确率0.844,并在葡萄和罂粟外部数据集中展现出一定预测能力。结果表明,机器学习可高效识别植物特化代谢物合成基因,基因组和蛋白质组信息足以支撑可靠预测,且模型具备跨物种应用潜力,为数据匮乏的药用植物代谢基因发现提供了可行策略。
创新点
1. 首次将AutoGluon-Tabular自动机器学习用于植物特化代谢物合成基因预测;2. 发现基因组和蛋白质组特征为最关键特征,仅用5个关键特征即可达到优于全特征模型的性能;3. 建立了跨物种(拟南芥、番茄、玉米)三分类模型,并在葡萄和罂粟中验证了适用性。
研究对象(5)
| 底盘细胞 | 代谢通路 | 基因 | 蛋白 | 功能 | 说明 |
|---|---|---|---|---|---|
| Arabidopsis thaliana | 萜类/生物碱/酚类生物合成 | — | P450、UDPGT等蛋白 | 催化 | 拟南芥金标准数据集含594个PSM合成基因 |
| Solanum lycopersicum | 萜类/生物碱/酚类生物合成 | — | — | 催化 | 番茄金标准数据集含467个PSM合成基因 |
| Zea mays | 萜类/生物碱/酚类生物合成 | — | — | 催化 | 玉米金标准数据集含544个PSM合成基因 |
| Vitis vinifera | 萜类/生物碱/酚类生物合成 | — | — | 催化 | 葡萄外部验证数据集含1083个SM基因 |
| Papaver somniferum | 萜类/生物碱/酚类生物合成 | — | — | 催化 | 罂粟外部验证数据集含73个SM基因 |
关键发现
- 在拟南芥金标准数据集上,AutoGluon-Tabular三分类模型平均AUC-ROC为0.891,ACC为0.779,F1为0.77
- 原始数据集AUC-ROC为0.863。仅用蛋白质组特征模型AUC-ROC达0.881,基因组特征0.809
- 结合基因组和蛋白质组特征后AUC为0.885,进一步特征选择后AUC提升至0.905。跨物种验证中,单物种跨物种预测(如番茄训练拟南芥测试)AUC为0.785,同物种预测(拟南芥)AUC为0.924
- 三物种模型在验证集上ACC达0.844。在葡萄外部数据集上,AutoGluon-Tabular ACC为0.603(LightGBM最高0.63)
- 在罂粟上AutoGluon-Tabular AUC-ROC为0.584(NeuralNetFastAI最佳0.69)。
研究结论
机器学习模型能够有效预测植物特化代谢物合成基因,其中基因组和蛋白质组特征足以支撑可靠预测,且模型具有良好的跨物种应用潜力,可为数据匮乏物种(如药用植物)的代谢基因发现提供指导。