安第斯汉坦病毒(ANDV)基因组独立分析报告

目标株:ANDV/Switzerland/Hu-3337/2026
参考株:PV808476.1 (S), PV808477.1 (M), PV808478.1 (L)
分析日期:2026年5月12日

免责声明:本报告基于公开的基因组序列数据进行生物信息学分析,未经过实验验证或同行评议。SEIR模型结果为理论推演,基于假设参数,不代表实际疫情预测。报告中所有结论仅供科学研究参考,不应作为公共卫生决策依据。

摘要

本研究对安第斯汉坦病毒(ANDV)目标株ANDV/Switzerland/Hu-3337/2026进行了全面的基因组分析。通过与参考株PV808476.1/7/8的比对,发现全基因组共300个核苷酸差异(S片段37个,M片段91个,L片段172个),平均序列差异率为24.84/1000bp。转换/颠换比极高(11.5:1),提示突变谱存在明显转换偏向。编码区分析显示S片段CDS内累计缺失3bp,不导致阅读框移码,预计仅造成1个氨基酸残基缺失;M片段3'端存在7bp缺失,可能导致糖蛋白C端局部移码,但影响范围有限;L片段未发现CDS内移码。基于SEIR模型的参数敏感性分析显示,当基本再生数R0<1时,疫情自然消退,攻击率低于3%;当R0>1.5时,攻击率显著增加。本报告所有分析均基于数据驱动,未引入关于大流行潜力的先验假设。

1. 材料与方法

1.1 数据来源

目标序列来源于NCBI数据库,包括ANDV/Switzerland/Hu-3337/2026的S、M、L三个片段。参考序列为PV808476.1(S片段,1861bp)、PV808477.1(M片段,3659bp)、PV808478.1(L片段,6555bp),均来自智利分离株CHI-Hu13724_P2。

1.2 分析方法

2. 结果

2.1 基因组突变概况

目标株与参考株的全基因组比对结果显示,共检测到300个核苷酸变异,分布如下:

片段功能参考长度(bp)目标长度(bp)突变数突变率(/1000bp)
S核蛋白(NP)186118533719.88
M糖蛋白(Gn/G2)365936499124.87
LRNA聚合酶6555656117226.24
总计-120751206330024.84
突变分布图

图1:各基因组片段的突变数量与突变率

2.2 转换/颠换分析

转换/颠换比是评估选择压力的重要指标。本研究发现极高的转换/颠换比:

片段转换数颠换数转换/颠换比
S34311.3:1
M84712.0:1
L1581411.3:1
总计2762411.5:1
关键发现:转换/颠换比高达11.5:1,远高于中性进化的预期值(通常1-2:1),提示该病毒株与参考株之间的突变谱存在明显转换偏向。结合编码区dN/dS远低于1的结果,支持蛋白编码区受到强烈纯化选择和功能约束。
转换/颠换分析

图2:转换与颠换突变分布

2.3 插入缺失(Indel)与移码分析

Indel分析是评估病毒基因组完整性的关键。以下是各片段的Indel分布:

片段位置类型长度(bp)是否在CDS内
S1缺失4否(5' UTR)
S1473缺失2
S1661缺失1
S1861缺失1否(3' UTR)
M1缺失3否(5' UTR)
M3653缺失7是(3'端)
L1插入6否(5' UTR)

2.4 移码对蛋白质结构的影响

编码区内Indel的净长度若非3的倍数,将导致移码突变,使下游所有氨基酸序列发生改变。分析结果如下:

片段CDS内净Indel(bp)mod 3移码受影响的AA数影响比例
S (NP)-3000%
M (Gn/G2)-7120.2%
L (聚合酶)0000%
重要说明:S片段CDS内净Indel为-3bp(位置1473缺失2bp + 位置1661缺失1bp),由于-3 mod 3 = 0,不导致移码。这意味着核蛋白(NP)的阅读框保持完整,仅在该区域缺失1个密码子对应的氨基酸。位置1861的1bp缺失位于3' UTR,不影响编码区。M片段CDS内存在7bp缺失(位置3653),7 mod 3 = 1,导致移码,影响糖蛋白C端约0.2%的氨基酸序列。L片段无CDS内Indel,RNA聚合酶阅读框完整。

2.5 氨基酸水平变异

在移码发生前的区域,氨基酸水平变异如下:

片段同义替换位点/机会数非同义替换数估计dN/dS具体变化
S (NP)42710.002AA46: N→S
M (Gn/G2)113620.002AA516: T→I; AA1055: A→T
L (聚合酶)214940.002AA144: K→R; AA182: Q→X; AA581: S→A; AA2109: V→I
*注:AA182处Q→X表示该位点氨基酸无法可靠判定,可能源于测序质量不足、Indel导致的局部比对偏移或组装错误。该位点暂不作为确定性非同义突变解释,建议结合原始reads覆盖度、碱基质量和局部比对结果复核。
关键发现:dN/dS比远低于1(0.002),表明强烈的纯化选择压力。绝大多数变异为同义突变,不影响氨基酸序列。这与转换/颠换比的分析结果一致,表明ANDV基因组在进化过程中受到严格的功能约束。

2.6 系统发育分析

目标株与多条参考序列的遗传距离分析显示:

系统发育结果提示该目标株与南锥体地区既往ANDV人源或啮齿类来源序列关系较近,可能源自阿根廷/智利相关自然宿主病毒库。但仅凭少量参考序列的邻接树和pairwise distance,尚不足以精确定位感染地点或传播链来源。

3. SEIR模型参数敏感性分析

模型说明:以下SEIR模型分析基于理论假设参数,不代表实际疫情数据。模型参数(如传播率β、恢复率γ、病死率μ)的设定基于文献报道的汉坦病毒流行病学特征,但实际值可能因宿主种群、环境条件、干预措施等因素而显著不同。模型结果仅用于展示不同参数组合下的理论传播动力学,不应解读为疫情预测。

3.1 模型参数

参数符号含义
总人口N147封闭种群大小(如邮轮乘客)
传播率β0.15单位时间内每个感染者传播给易感者的概率
潜伏期1/σ7天从暴露到具有传染性的平均时间
恢复率γ0.1单位时间内感染者恢复的概率
病死率μ0.05单位时间内感染者死亡的概率
基本再生数R01.0每个感染者平均传播给的人数

3.2 R0敏感性分析

基本再生数R0是评估传染病传播潜力的关键指标。当R0<1时,疫情自然消退;当R0>1时,疫情可能扩散。下表展示了不同R0值下的理论攻击率和病死率:

R0总感染数攻击率(%)病死率(%)峰值感染者死亡数
0.51.921.3132.251.000.62
0.83.422.3329.931.001.02
1.05.403.6727.761.001.50
1.28.816.0025.481.002.25
1.518.5112.5922.552.724.17
2.052.6535.8220.329.2810.70
2.597.2566.1621.7016.6621.10
R0敏感性分析

图3:攻击率与病死率随R0变化的敏感性分析。红色虚线表示R0=1的传播阈值。

SEIR动力学

图4:不同R0值下的SEIR模型动力学曲线。蓝色=易感者,黄色=潜伏者,红色=感染者,绿色=恢复者,黑色=死亡者。

关键发现:
  1. 传播阈值效应:当R0<1时,攻击率低于3%,疫情自然消退;当R0>1.5时,攻击率显著增加,显示明显的传播阈值效应。
  2. 病死率特征:在基础病死率参数(μ=0.05)下,理论病死率约为27.76%。表中病死率随R0变化可能主要反映有限模拟时间内未结局感染者比例的变化,而非真实生物学意义上的病死率下降。由于本模型未引入轻症/重症分层、医疗资源饱和或病例发现率变化,因此不应解释为"高传播率导致更多轻症病例纳入统计"。
  3. 封闭环境风险:在147人的封闭种群中,当R0=2.0时,理论攻击率达到35.82%,约53人感染,11人死亡。这表明在封闭环境中,即使中等传播力也可能导致显著的疫情。

4. 讨论

4.1 基因组稳定性分析

本研究发现ANDV目标株的基因组序列差异率为24.84/1000bp,转换/颠换比高达11.5:1,dN/dS比仅为0.002。这些数据表明ANDV基因组在进化过程中受到强烈的纯化选择压力,大多数变异为中性同义突变,不影响蛋白质功能。这种高度保守的基因组特征更可能反映ANDV蛋白编码区受到强烈功能约束,以及病毒与宿主长期适应过程中的纯化选择作用。需要注意的是,汉坦病毒作为负链RNA病毒,其RdRp通常不被认为具有类似冠状病毒nsp14/nsp10外切核酸酶复合体的校对机制。因此,本研究观察到的低dN/dS不应归因于聚合酶校对功能,而应解释为非同义突变在进化过程中被有效清除。

4.2 移码突变的生物学意义

经审核修正后,S片段CDS内净Indel为-3bp(mod 3 = 0),不导致移码,核蛋白阅读框保持完整。这意味着核蛋白(NP)的结构和功能基本不受Indel影响,仅在该区域缺失1个氨基酸残基。这一修正消除了此前关于S片段移码可能导致病毒失活的担忧。

M片段CDS内存在7bp缺失(位置3653),7 mod 3 = 1,导致移码,影响糖蛋白C端约0.2%的氨基酸序列。由于影响范围极小,对糖蛋白整体功能的影响可能有限,但仍需实验验证。

L片段无CDS内Indel,RNA聚合酶阅读框完整,表明病毒仍具有完整的复制能力。

关于L片段AA182处Q→X的未知氨基酸变化,可能源于以下原因:(1) 测序质量不足导致无法确定具体碱基;(2) Indel导致的局部比对偏移;(3) 组装错误。建议通过Sanger测序或长读长测序验证该位置的序列。

4.3 SEIR模型的理论意义

SEIR模型分析展示了不同R0值下的理论传播动力学。需要强调的是:

4.4 研究局限性

5. 结论

本研究对ANDV目标株ANDV/Switzerland/Hu-3337/2026进行了全面的基因组分析,主要发现如下:

  1. 全基因组共300个核苷酸差异,平均序列差异率24.84/1000bp,转换/颠换比11.5:1提示突变谱存在明显转换偏向
  2. S片段CDS内净Indel为-3bp(mod 3 = 0),不导致移码,核蛋白阅读框保持完整
  3. M片段移码影响有限(0.2%),L片段无移码,RNA聚合酶功能完整
  4. 初步dN/dS估计远低于1(0.002),提示蛋白编码区受到强烈纯化选择和功能约束;但该结果需使用标准密码子模型方法并结合更多同源序列进一步验证
  5. SEIR模型分析显示,R0<1时疫情自然消退,R0>1.5时攻击率显著增加,但模型结果基于理论假设,不代表实际疫情预测

本研究的发现为理解ANDV的基因组特征提供了数据支持,但所有结论均需要进一步的实验验证和流行病学数据校准。

参考文献

  1. NCBI GenBank: PV808476.1, PV808477.1, PV808478.1 (Andes virus reference sequences)
  2. NCBI GenBank: ANDV/Switzerland/Hu-3337/2026 (target sequences)
  3. BioPython documentation: https://biopython.org/
  4. Scipy documentation: https://docs.scipy.org/doc/scipy/

报告版本:v1.1 (2026-05-12, 修订版)
分析工具:Python 3.x, BioPython, SciPy, Matplotlib
免责声明:本报告仅供科学研究参考,未经过同行评议,不应作为公共卫生决策依据。报告中所有模型结果基于理论假设,不代表实际疫情预测。