antiSMASH: rapid identification, annotation and analysis of secondary metabolite biosynthesis gene clusters in bacterial and fungal genome sequences
- 作者
- Marnix H. Medema, Kai Blin, Peter Cimermanic, Victor de Jager, Piotr Zakrzewski, Michael A. Fischbach, Tilmann Weber, Eriko Takano, Rainer Breitling
- 单位
- Department of Microbial Physiology, University of Groningen; Groningen Bioinformatics Centre, Groningen Biomolecular Sciences and Biotechnology Institute, University of Groningen; Mikrobiologie/Biotechnologie, Interfakultäres Institut für Mikrobiologie und Infektionsmedizin, Eberhard Karls Universität Tübingen; Department of Bioengineering and Therapeutic Sciences and California Institute for Quantitative Biosciences, University of California San Francisco; Laboratory of Microbiology, Wageningen University; Netherlands Bioinformatics Centre; Centre for Molecular and Biomolecular Informatics, Nijmegen Centre for Molecular Life Sciences, Radboud University Nijmegen Medical Centre; Institute of Molecular, Cell and Systems Biology, College of Medical, Veterinary and Life Sciences, University of Glasgow
- 杂志
- Nucleic Acids Research(2011)
- DOI
- 10.1093/nar/gkr466
- 所属领域
- 合成生物学
- 关键词
- 阅读原文
- 查看 PDF 原文
解决的核心问题
细菌和真菌次级代谢产物是新型药物的重要来源,但快速可靠地从大量新测序基因组中识别所有潜在次级代谢基因簇极其困难,现有工具覆盖范围有限、操作复杂或缺乏综合分析能力。
研究策略
开发antiSMASH——第一个覆盖已知全部次级代谢产物类别的综合生物信息学流程,利用特征基因pHMM检测基因簇,整合NRPS/PKS域注释、核心结构预测、ClusterBlast比较分析、smCOG功能注释及全基因组BLAST/Pfam分析,提供网页版和独立版。
核心内容
针对细菌和真菌基因组中次级代谢产物生物合成基因簇识别困难、现有工具覆盖有限的问题,研究开发了antiSMASH生物信息学流程。该工具是首个覆盖已知全部次级代谢产物类别的自动化综合分析平台,通过特征基因的pHMM模型检测基因簇,整合了NRPS/PKS域注释、核心结构预测、基于473个克隆基因簇的ClusterBlast比较分析、smCOG功能注释以及全基因组BLAST/Pfam分析,并提供网页版和独立版本。验证结果显示,在484个克隆基因簇中antiSMASH正确识别了473个(97.7%),其中96.7%的注释与文献实验表征一致;在5个基因组中检出97.3%的已知基因簇,并额外发现35个(31.5%)先前遗漏的高概率基因簇。与NP.searcher相比,antiSMASH检出的NRPS/PKS基因簇多51.6%(47个对31个),且完全覆盖对方检出结果。该工具显著提高了基因簇注释的完整性和准确性,为合成生物学高通量研究基因簇和设计BioBricks提供了有力支持。
创新点
首个覆盖所有已知次级代谢化合物类别(聚酮、非核糖体肽、萜烯、氨基糖苷、β-内酰胺、羊毛硫抗生素等)的自动化工具;构建基于473个克隆基因簇的数据库并实现ClusterBlast基因簇比较;创建smCOG家族用于辅助基因功能预测和系统发育分析;整合全基因组BLAST/Pfam分析并预测未知类型基因簇区域。
研究对象(8)
| 底盘细胞 | 代谢通路 | 基因 | 蛋白 | 功能 | 说明 |
|---|---|---|---|---|---|
| — | 聚酮类化合物生物合成 | PKS | 聚酮合酶 | 催化 | 检测类型I、II、III型聚酮合成酶基因簇 |
| — | 非核糖体肽生物合成 | NRPS | 非核糖体肽合成酶 | 催化 | 检测非核糖体肽合成酶基因簇,并进行腺苷酰化结构域底物特异性预测 |
| — | 萜烯类化合物生物合成 | terpene synthase | 萜烯合酶 | 催化 | 检测萜烯合成酶基因簇 |
| — | 羊毛硫抗生素生物合成 | lanthipeptide synthetase | 羊毛硫抗生素合成酶 | 催化 | 检测羊毛硫抗生素生物合成基因簇 |
| — | 细菌素生物合成 | bacteriocin | 细菌素前体/加工蛋白 | 催化 | 检测细菌素生物合成基因簇 |
| — | 氨基糖苷类化合物生物合成 | aminoglycoside biosynthetic genes | 氨基糖苷修饰酶 | 催化 | 检测氨基糖苷/氨基环醇类基因簇 |
| — | β-内酰胺类抗生素生物合成 | beta-lactam synthetase | β-内酰胺合成酶 | 催化 | 检测β-内酰胺类基因簇 |
| — | 铁载体生物合成 | siderophore synthetase | 铁载体合成酶 | 催化 | 检测铁载体基因簇 |
关键发现
- 在484个克隆基因簇中,antiSMASH正确识别473个(97.7%),其中468个(96.7%)获得与文献实验表征相同的注释
- 在5个基因组(111个注释基因簇)中检出97.3%(108个),并额外发现35个(31.5%)先前遗漏的高概率基因簇
- 与SMURF相比,两者均检出74个基因簇(重叠率93.4%)
- 与NP.searcher相比,antiSMASH检出的NRPS/PKS基因簇多51.6%(47个对31个),且NP.searcher检出的所有基因簇均被antiSMASH覆盖。
研究结论
antiSMASH是一个全面、快速、用户友好的次级代谢基因簇识别与注释工具,能显著提高基因组中次级代谢基因簇的注释完整性和准确性,为合成生物学高通量研究基因簇和设计BioBricks提供有力支持。