文献解读】Front. Microbiol.:从葡萄园土壤到葡萄酒发酵:解释微生物“风土”的大致概念(下)


发布时间:

2022-01-29

来源:

葡萄研究微信号

从葡萄园土壤到葡萄酒发酵:解释微生物“风土”的大致概念(下)

期刊:Frontiers in Microbiology(5.640)

发表时间:2017.05

 

 

揭示微生物地貌的生物信息学和预测方法

 
 
随着通过16S/ITS测序可以相对容易地在样本中检测到成千上万的生物体,已经开发了一整套生物信息学方法来从产生的大型数据集中提取有意义的结果。生物信息学的挑战至少包括两个部分(I)将数据集预处理成可与已知物种数据库相关联的代表性读数集合(或可操作的分类单元-OTU),以及(II)将在样本(已知的和新检测到的)中推断的物种集合与样本的属性相关联,以便研究微生物群和地形之间的关系。
在第一阶段,处理大量的原始序列读取(修剪接头序列、合并正向和反向序列、根据读取质量过滤),最后将其去复制到唯一序列的集合中。有很多软件可用于执行这些任务,它们通常是提供整个处理管道的软件包的一部分。然后根据序列相似性将独特的序列聚类,选择97%同源性的相对任意的截止值,产生一组OTU,每个OTU被认为来自特定的有机体。换句话说,OTUS是样品中微生物种类的代用品。
虽然概念上很简单,但这一步在计算和偏差方面都提出了重大挑战,这些偏差可能会渗透到后续的分析中。首先,对于大的序列集合,所有反对所有成对比对的都将是令人望而却步的,例如,100万个独特序列(通常遇到)将需要1万亿个成对比较。这导致了用于OTU聚类的全面的生物信息管道,包括上述软件管道(USEARCH、VSearch、SWARM),它们都依赖于聪明的启发式,以牺牲完美准确的聚类为代价来加速这一过程。第二个挑战是避免在OTU群集期间可能出现的偏差。这些偏向可以是多重的;(A)不同的生物物种可能具有相同的序列,因此可归为一组,(B)测序错误或扩增错误(包括嵌合读数)或未修剪的序列可将具有相同起源的序列分组为不同的组。第一个问题将低估生物多样性,而后者将高估生物多样性。这些情景加在一起,将破坏对陆地真实生物构成的准确再现。这再次强调了对原始序列进行质量修剪和过滤以将环境数据集中包含伪像的风险降至最低的重要性。
最后,对经过管理的OTU进行系统发育分配,目的是确定OTU最有可能属于哪个物种或属。这是通过将它们与数据库中的分类序列进行比较来实现的,例如Greengenes(用于细菌群落特征)、Silva(细菌和真核生物)和Unite(用于真菌)等。同样,也有一系列软件可用(Qiime、UTAX、SINTAX、Stampa)。这一阶段再次成为偏见的来源,部分原因是OTUS可以代表多个物种,分配不明确,而且这些方法可能会忽略确实存在的太小的差异。例如,在寡分型的情况下,单个碱基对就可以区分生态菌株。此外,更普遍的是,参考数据库本身在很大程度上是基于预测的物种,而不是实验培育的物种,因此可能会对分类学分配产生偏差。此外,不同的参考数据库会根据数据库的完整性和质量产生不同的分类分配。如果一个给定的物种没有出现在数据库中,那么从该物种派生的序列将被错误分配或保持未分类状态。这对于葡萄酒和土壤相关的微生物序列来说更是雪上加霜,因为那里的参考数据库落后于人类相关的微生物。增加和管理强大的数据库是科学界的一个关键目标(图1)。还有其他方法可以比较来自功能基因的扩增片段,在这些方法中,我们可能不知道与分类水平相对应的百分比同一性,但在某些情况下,最能反映地理(环境)距离。对于与葡萄酒相关的样品,无聚类法显示了在菌株或亚OTU水平上确定微生物区域的潜力。
第二个生物信息学挑战配备了地貌(属或种)生物实体的数据集,涉及将微生物群与地貌属性相关联。根据目标的不同,这可能或多或少是困难的。一个目标是利用微生物群落数据将土壤样本划分为类型和地理区域,从而确定微生物地貌。最近,Bokulich展示了这种方法在根据微生物丰度对加州地区和发酵代谢物进行分类的威力。然而,如果需要物种甚至菌株信息来建立微生物群和特定葡萄酒酿造特性之间的联系,那么分类学分配是必不可少的,它可以根据它所达到的分辨率和它可以防止的偏见来决定分析的成败。
除了问题的本质外,一般来说,OTU丰度数据的结构提出了一些需要仔细考虑的问题。由于物种可以以非常不同的丰度出现(通常跨越几个数量级),不同样本的物种集合可能会有很大差异。这将导致非常稀疏的数据集,它被定义为具有许多零值的数据集。这些零值可能会有问题,因为它们可能会考虑多个假设;例如,样本中的零计数可能是因为一个物种不存在,或者因为它只是没有被检测到。这可能会导致样本之间的比较有偏差。解决这一问题的一种方法是使用不考虑这些情况的距离度量(例如,Bray-Curtis),或者特别包括允许将物种信息关联到有意义的组中的系统发育树。下一步是将原始计数的OTU数据预处理为使样本相互比较的值。这也被称为标准化,根据低丰度物种还是高丰度物种在所讨论的分析中应该有更大的影响,有许多可用的分析选择。例如,可以将计数转换为频率(将读取次数除以样本中的读取总数)。考虑到OTU表格的特殊性,这些技术的性能已经在其他地方进行了测试。这也是应用机器学习技术的关键一步。
有了预处理后的数据集,样本之间的探针群落水平差异可以用监督和非监督机器学习技术来研究。无监督学习基于OTU丰度对样本进行分类,而不需要样本表型的先验知识。可以使用主成分分析(PCA或更常见的PCoA)和聚类算法来获得关于样本差异的高级视图。这些分析在很大程度上是探索性的,并提供了社区差异的直观证据。如果有关于地形的信息可用,或者有一些明确定义的群体需要研究,可以应用监督学习技术,例如根据过去的社区特征对新样本进行分类。不同的葡萄酒产地、类型和口味使得葡萄酒相关样本非常适合这些分类方法。不同的软件包可用于执行这些方法,并或多或少地适用于元组学问题的研究(素食、素食、食谱、七味、蚊虫)。从微生物组数据中提取知识的另一种方法是将其视为单个菌株之间相互作用的网络。除了单一菌株对植物健康(病原体、共生菌)和葡萄酒特性或腐败潜力的影响外,这些菌株不是孤立地影响葡萄酒生产,而是作为复杂微生物群落的成员影响葡萄酒生产。现在很多研究都集中在这些群落水平的效应上,这些效应可以影响植物的表型,如开花时间。这些预测技术可以对这些差异丰富的单个OTU是否导致某些表型做出初步推断。然而,它们将需要进一步的测试,很可能是纯培养处理。从相关性到因果关系的一个很好的例子是在普通花园中使用纯真菌和卵菌培养来证实单个菌株对拟南芥相关的整个微生物群落结构的影响。
用生物信息学定义微生物环境只是了解微生物如何塑造酿酒过程中每一步的早期步骤。葡萄酒通过代谢物赋予其味道和气味,许多代谢物来自葡萄,许多来自微生物或由微生物修饰。确定哪些微生物影响这些过程是确定它们如何影响葡萄酒感官特征的关键。当我们将基因组序列添加到我们的参考数据库中时,我们将能够利用注释序列来预测每种微生物的代谢能力。基因组规模代谢模型(GSMM)与流量平衡分析相结合,允许在给定一组输入的情况下分析代谢输出。此外,GSMM可以扩展到社区级别的模型,以揭示微生物如何协同创建复杂的葡萄酒代谢物图谱。展望未来,不仅要确定哪些微生物创造了你最喜欢的葡萄酒,而且要确定它们的新陈代谢如何影响葡萄酒的味道,这一点至关重要。因此,葡萄栽培将从能够研究葡萄和葡萄酒微生物群和葡萄酒代谢组的商业平台的产生中获益良多。目前,这样的平台已经到位,WineSeq R-(Biome Maker,Inc.)2允许通过NGS对葡萄酒微生物群进行表征,而Wine Screener R-(Bruker)3允许通过核磁共振对葡萄酒代谢组进行分析。这些工具以强大的数据库为基础,允许原产地的生产商和监管委员会为他们的葡萄酒建立“标准档案”,并更好地了解其独特地形的微生物和化学基础。
 
 

讨论

 
 
本文综述了NGS技术对葡萄和葡萄酒微生物学的影响。鉴于微生物组在葡萄栽培和酿酒学中的重要性,微生物在葡萄园土壤的化学和营养特性、作物健康和产量以及后期发酵性能和葡萄酒风味中的作用是利用组学工具探索的主要挑战。为此,应在实验室阶段改进某些技术方面,如通用DNA和RNA提取协议以避免偏见,以及改进测序方法以提高微生物组的分辨率和量化。开发健壮的、经过精心管理的数据库以改进分类学分配也很重要(图1)。最后,是时候发展大数据工作了,使用统计数据挖掘和机器学习工具,从整体系统生物学的角度来解决葡萄酒行业的上述挑战。