VvWRKY72转录因子在转基因拟南芥和葡萄植株中增强对灰霉病的敏感性


发布时间:

2026-05-28

来源:

葡萄研究

从原始气相色谱图预测波尔多红葡萄酒的起源和年份

期刊:Communications Chemistry(6.5)

发表日期:2023年12月

 

研究摘要

 

将化学性质与葡萄酒的各类特征相关联,是嗅觉科学及葡萄酒产业备受关注的研究方向。本研究探讨了能否通过一种常见且经济可行的化学分析方法——气相色谱(GC)与电子电离质谱联用技术,推断波尔多葡萄酒的化学特征及年份(收获年份)。以波尔多地区7个酒庄1990-2007年间的12个年份葡萄酒为研究对象,结果表明,将非线性降维技术应用于原始气相色谱数据,可显著重现波尔多产区的地理分布特征。通过机器学习算法,不仅能从色谱数据中完美识别葡萄酒的酒庄归属,年份识别准确率更高达50%。有趣的是,研究发现完整的色谱图包含了与产地和年份相关的丰富信息,这表明葡萄酒的化学特征并非由少数几种分子决定,而是分布于广阔的化学谱图中。本研究证实了气相色谱分析在探究葡萄酒产地与年份等核心问题上的巨大潜力。

 

研究背景

 

葡萄酒的品质受多种因素影响,如土壤、气候、葡萄品种、微生物环境及酿酒工艺等。若要明确这些因素如何影响葡萄酒的风味,就需要揭示其化学成分中哪些部分决定了葡萄酒的品质、产地及典型性。解决这类问题的一种传统方法是测定特定靶向分子的浓度,这些分子被认为与葡萄酒的产地和风味密切相关。该方法虽已鉴定出多种关键化合物,但无异于大海捞针。与工业饮料不同,葡萄酒是复杂的分子混合物,其风味往往依赖于仅以极低浓度存在的分子。此外,葡萄酒的化学典型性很可能并非由少数几种分子的浓度决定,而是取决于广泛分子的整体浓度分布模式,且这种关系可能呈非线性。

已有多个研究团队摒弃了靶向分析方法,转而采用全局视角。他们利用机器学习(ML)统计工具分析广谱化学分析结果,例如通过电感耦合等离子体质谱法(ICP MS)、核磁共振(NMR)、反相高效液相色谱-二极管阵列检测法(RP-HPLC/DAD)、紫外光谱法(UV-spectroscopy)进行葡萄酒分类,或通过气相色谱-四极杆飞行时间质谱法(GC/QTOF MS)、同位素比值、吸光度-透射率与荧光激发-发射矩阵(A-TEEM)及气候数据进行葡萄酒产区划分。另有研究通过气相色谱(GC)分析葡萄酒的感官特性与香气特征,通过全局化学指标(如酒精含量、酸度)评估葡萄酒品质,并利用气相色谱研究葡萄酒陈酿过程中氧化标志物的产生。

气相色谱是葡萄酒分析中常用的技术,已促成多项开创性发现,但该技术通常用于靶向分子分析,即作为鉴定目标分子的工具。然而,气相色谱比紫外光谱等技术更适用于全局分析,因为它能检测到范围更广的分子。但问题在于,气相色谱可通过调整色谱柱流出物的过滤器类型,针对性检测特定分子家族(如酯类),因此难以确定应聚焦于哪类化学物质。此外,也不清楚色谱图中哪些部分具有分析价值。通常,研究人员会对色谱图中的峰进行积分以量化特定分子的浓度,从而舍弃色谱图的其余部分。理论上,使用原始未处理的色谱数据可获得更优结果,但这需要借助能自动确定色谱图中对特定分类问题最具信息量部分的技术,而这正是机器学习的优势所在,因为机器学习算法能够自动筛选出色谱图中的关键信息区域。为此,本研究采用多种机器学习技术(包括非线性降维、线性及非线性分类器、回归模型),基于色谱数据预测波尔多葡萄酒的多项特征,重点关注酒庄归属与年份。

 

研究方法

 

2.1.葡萄酒样品

研究涉及来自7个酒庄的80款波尔多红葡萄酒,分别是A、B、C、D、E、F和G。除F酒庄只有8个年份(1995年、1998年、2000年、2001年、2002年、2005年、2006年和2007年)的葡萄酒外,每个酒庄都有12个年份的葡萄酒可供研究(1990年、1995年、1996年、1998年、1999年、2000年、2001年、2002年、2004年、2005年、2006年和2007年)。A、B和C是来自波美侯(A)和圣埃美隆(B和C)产区的右岸葡萄酒,而其他则是来自波亚克(D、E)、玛歌(F)和佩萨克-雷奥良(G)产区的左岸葡萄酒。

 

2.2.气相色谱数据采集及采集后处理

 

2.2.1利用SBSE提取分析异味化合物

 

2.2.2利用液/液萃取分析橡木味化合物

 

2.2.3利用SPME提取对酯类进行分析

 

2.3.数据分析

 

研究结果

 

本研究结果基于三种气相色谱分析方法,为简洁起见,在后续内容中我们将其分别称为酯类、橡木味和异味(off Fla)。然而,这些色谱图对应不同的提取策略,并非仅对方法名称所指向的目标分子敏感。因此需要注意的是,所得色谱图并非简单反映这三类分子在葡萄酒中的含量。

 

3.1.通过降维技术重现风土特征

首先对气相色谱数据进行非线性降维处理,以在二维空间中可视化葡萄酒的分布特征。图1a、b展示t分布随机邻域嵌入(t-SNE)和均匀流形近似与投影(UMAP)的分析结果,这两种技术通过数据投影,使具有相似色谱特征的葡萄酒在二维投影空间中相互靠近。

 

 

同一酒庄的葡萄酒倾向于形成独立聚类,仅存在极少数异常值(如A-1990和C-1990),这表明色谱图能够揭示每个酒庄的特异性特征,且不受年份影响。其次,图1a、b中均清晰呈现两大聚类:A、B、C归为一类,D、E、F、G归为另一类。投影的空间分布格局与波尔多产区的地理分布高度吻合(图1c),葡萄酒在二维嵌入空间中的分布关系与对应酒庄的地理区位关系相似。需说明的是,右岸各酒庄之间并未呈现与地理相对位置一致的空间分布,而这些酒庄的实际地理位置本就十分接近(相距不超过7公里),相比之下,右岸与左岸最近的两个酒庄(C和G)相距40公里。

接下来,我们对三种类型的色谱图分别进行了该分析(图S2)。结果显示,三种色谱图均能实现左右岸酒庄的聚类分离,其中“异味”数据的分离效果尤为显著。然而,“异味”(SBSE-GC/MS)色谱图未呈现清晰的酒庄聚类,而橡木味(液液萃取)和酯类(SPME-GC/MS)色谱图则能清晰区分各酒庄。至于左岸酒庄的南北向分布特征,仅在橡木味色谱图中观察到酒庄G和F位于右岸酒庄与E、D酒庄之间,与拼接色谱图的分析结果一致。我们推测以下因素可能促成上述结果:首先,这些酒庄采用四种葡萄品种的不同配比酿造葡萄酒,分别是赤霞珠、品丽珠、梅洛和小维多,各品种的占比因酒庄和年份而异。为评估品种配比的变异性是否足以解释我们的结果,我们对品种配比百分比进行了相同的降维处理(将4维数据降至2维)。图1d、e展示了所得结果:尽管三个酒庄(C、G、F)形成了清晰的独立聚类,但其他酒庄无法区分(A与B、E与D)。此外,左右岸的区分度也有所降低(尤其是UMAP分析中,C酒庄倾向于靠近左岸酒庄)。最后,梅多克产区的南北向分布特征消失(G和F不再相邻,且未处于E、D酒庄与右岸酒庄之间)。这表明品种配比虽有一定影响,但并非唯一决定因素,其他因素如土壤组成、葡萄种植环境、气候条件,以及各酒庄的酿酒工艺调控,均可能发挥作用。

 

3.2.酒庄与年份识别

鉴于t-SNE和UMAP分析呈现出清晰的酒庄聚类,推测可基于色谱数据在排除年份干扰的情况下,高精度识别葡萄酒的酒庄归属。相反,由于年份未呈现明显的聚类特征(图1a、b及图S2),我们认为在排除酒庄干扰的情况下识别年份可能更具挑战性。

通过线性判别分析(LDA)和逻辑回归(LR)验证后,我们得到了与推测一致的结果。图2展示了在多次数据拆分下,三种单独色谱图及拼接色谱图的测试性能分布直方图。平均而言,将LDA应用于拼接色谱图时性能最佳,酒庄识别准确率达99%。有趣的是,仅使用橡木味色谱图或酯类色谱图也能获得相近的性能,而异味色谱图的表现较差(准确率为87%)。采用相同的技术对年份进行识别。与t-SNE和UMAP的分析结果一致,且与酒庄识别形成鲜明对比的是,对年份的识别性能相对较低,将LDA应用于橡木味色谱图时表现最佳,准确率仅为27%。尽管这一数值较低,但仍远高于8%的随机水平准确率(p<0.001,Bonferroni校正)。利用酯类和异味色谱图进行年份识别的结果接近随机水平。

 

 

3.3.色谱图的详细分析

葡萄酒的化学特征可能主要由少数几种分子的浓度决定,或者相反,由广泛分子的整体浓度分布模式决定。为探究这一问题,我们筛选了对分类性能贡献最大的色谱图区域。具体方法是先将色谱图分为50个分箱,然后逐一移除信息量最低的分箱。结果显示,移除约45个分箱后,识别性能仍保持稳定(图3a),这一现象在酒庄识别和年份识别中均存在。有趣的是,信息量最大的分箱并不一定与色谱图中的最大峰对应,这表明分类性能部分由平均浓度极低(≤μg・L⁻¹)的分子驱动。这也表明,仅需色谱图的一小部分即可达到渐近分类性能。为验证这一点,我们将三种色谱图中信息量最高的N个分箱分别拼接,对分类器进行训练(N系统地从1到4变化,总分箱数为3×N)。结果发现,每种色谱图保留2-3个分箱,其分类性能即可与基于完整拼接色谱图训练的分类器相当,部分情况下甚至更优。事实上,当基于每种色谱图的前3个分箱拼接数据训练时,LDA酒庄分类器实现了100%的完美识别准确率,而基于完整拼接色谱图的准确率为99%(图S3)。

在年份识别中,基于三种色谱图前3个分箱拼接数据的训练准确率达到34%,高于完整拼接色谱图的27%。仅使用橡木味色谱图中信息量最高的分箱时,准确率更是高达50%(图3c)。部分年份比其他年份更易识别,其中2007年的识别难度明显最低(图S4)。这些结果可能存在一定误导性,因为它们看似表明每张色谱图中仅少数分箱具有信息量。但实际情况更可能是,大多数分箱均包含信息量,只是存在高度冗余。为进一步探究这一问题,我们基于每个分箱单独训练分类器。图3b中的红色直方图展示了三种色谱图中各个分箱的酒庄识别性能。令人意外的是,尽管部分分箱的信息量更高,但绝大多数分箱的酒庄识别性能相近,且均远高于14%的随机水平,这表明色谱图的多个区域均包含与酒庄归属和年份相关的信息(图3d,年份识别的随机水平为8%)。

若仅少数分子起作用,权重分布应呈现少数显著峰值,而峰值之间的权重较小。但实际观察到的是,权重在整个色谱图范围内均匀偏高。此外,我们还进行了一项反向分析:逐一移除信息量最高的分箱,同时追踪分类性能。结果发现,性能逐渐下降,仅当剩余约20%信息量最低的分箱时,性能才急剧下降,这表明信息量最高的分箱在编码酒庄化学特征方面并未发挥特殊作用(图S7)。综上,这些结果有力地表明,酒庄的化学特征并非依赖于少数几种分子的浓度,而是取决于完整的化学谱图。

 

 

3.4.基于化合物的分析

为进一步探究葡萄酒的化学特征是依赖于大量分子还是少数分子子集,我们从色谱图中手动提取了32种化合物的峰面积,将其转换为浓度后,重复了上述一系列分析。

使用t-SNE或UMAP进行降维分析后,虽能观察到酒庄特异性聚类,但与原始色谱图的分析结果相比,聚类重叠度显著更高(图4a、b)。此外,左右岸酒庄的区分度也更低,尤其是在t-SNE分析中,右岸酒庄(A、B、C)并未聚为一类。在酒庄识别方面,我们发现性能显著下降(图4c)。例如,基于橡木味相关数据的逻辑回归识别准确率从原始色谱图的95%降至化合物浓度数据的78%。同样地,酯类相关数据的准确率从98%降至75%,异味相关数据的准确率从85%降至27%。这表明色谱图中的许多小峰对酒庄特征的识别具有重要贡献。同时也说明,传统的靶向化合物浓度提取方法不如直接使用原始色谱图效果好,且该方法存在需进行大量手动预处理的缺点。而年份识别的结果则好坏不一(图4d)。基于橡木味相关数据的逻辑回归准确率从色谱图的27%降至化合物浓度的23%。然而,酯类相关数据的情况则相反,准确率从7%提升至23%。但在所有情况下,其性能均未超过基于橡木味色谱图所达到的27%的最佳年份识别准确率。

使用化合物浓度数据的一个优势是,可通过分析分类权重来衡量每种化合物对分类性能的影响。有趣的是,我们发现所有化合物的酒庄分类权重值趋于相近,这表明大多数化学化合物均对酒庄特征的形成有贡献。我们还基于单一化合物的浓度训练了分类器,方法与基于单一色谱分箱的分析类似(图3b)。部分化合物单独使用时的分类准确率高达40%(如乙酰丁香醛、丁酸乙酯-C4C2和己酸乙酯-C6C2),但值得注意的是,仅通过32种化合物中任意一种的浓度,即可显著解码出酒庄归属信息。这进一步支持了我们的观点:酒庄特征并非由少数特定化学物质的存在所决定,而是由整体化学谱图所定义。

 

 

文献解读 原文合集

链接:https://pan.baidu.com/s/1mBiCRSEBG4w4bKdwfgpm1A?pwd=yce3 

提取码:yce3