宏病毒组(病毒宏基因组)
分析流程主要步骤
1. 数据质控:测序得到的原始数据(Raw Data)会存在一定比例的低质量数据,为了保证后续信息分析结果的准确可靠,首先要对原始数据进行质控及宿主过滤,得到有效数据(Clean Data);
2. 宏基因组组装:从各样品质控后的Clean Data出发,进行宏基因组组装(Metagenomic Assembly);
3. 基因预测及丰度分析:从单样本宏基因组组装得到的contigs出发,预测contigs中的基因序列;针对所有样本得到的基因进行去冗余,得到去冗余基因;最后对去冗余基因进行定量;
4. 物种注释:从非冗余基因出发,获得每个基因的物种注释信息,并结合基因丰度表,获得不同分类层级的物种丰度表;
5. 常用功能数据库注释:从非冗余基因出发,进行KEGG,CAZy和COG数据库的功能注释和丰度分析;
6. 抗性基因注释:使用抗生素抗性基因数据库对非冗余基因进行注释,统计抗性基因丰度分布情况;
7. 基于注释结果的分析:基于物种,功能和抗性基因丰度表,可以进行丰度聚类分析和降维分析;针对样本分组,可以进行Anosim和LEfSe多元统计分析挖掘样本分组之间的差异。
