460个单倍型、99%常见遗传变异全覆盖!人类泛基因组参考图谱HPRC2重磅发布,多组学资源全面升级
时间:2026-07-28 21:47:38 热度:37.1℃ 作者:网络
深度解析医学证据,lxfs.net为你支撑决策
人类首个参考基因组草图的发布,开启了依托单一线性参考序列开展生物医学研究的时代;但其存在严重参考偏差,重复序列、结构变异(SV)区域也始终存在组装缺口。泛基因组参考跳出单一基因组局限,通过整合多个个体的单倍型组装、比对和注释,以变异图形式同时呈现共享和差异信息,能够全面捕捉人群遗传多样性。2023年,人类泛基因组参考联盟(HPRC)发布初代泛基因组HPRC1,包含88个单倍型,可覆盖92%常见遗传变异。此后,人群SV图谱、地域特异性泛基因组陆续建成,泛基因组理念也普及至动植物、畜禽等诸多物种,成为解析遗传和功能变异的通用研究框架;各类适配泛基因组的序列比对、变异检测、单倍型重构生物信息学工具同步迭代更新,全面革新了基因组遗传变异的分析研究范式。
近日,HPRC团队在bioRxiv预印本平台公布了第二版泛基因组HPRC2;相较于初代HPRC1,该版本纳入的基因组数量扩充约5倍,在完整性、连续性与准确性方面均得到显著提升。通过优先覆盖常见变异位点的原则性算法筛选样本,HPRC2提供了460个单倍型,共同捕获All of Us项目(AoU)v8队列中超99%的常见变异。结合高覆盖长读长与超长读长测序数据,并搭配前沿组装、纠错工具,研究完成了数千条端粒到端粒(T2T)完整染色体的组装。对比HPRC1,该版本将结构不稳定区域数量、每个单倍型的单碱基错误数量均减少一半;并搭建标准化泛基因组坐标系以解析参考外的变异,发现个体人类基因组包含超十万个无法用现有参考基因组表征的变异。此外,研究首次展示了同等规模下匹配长读长数据的泛转录组和泛表观基因组,为解读人类基因组的功能多样性提供了前所未有的资源。

研究团队构建了全新样本筛选体系,开发了迭代贪心算法MaxVar,以最大化人群遗传变异捕获效率为核心,优先收录千人基因组计划(1KGP)来源样本,并通过AoU约44万人队列完成性能验证。数据显示,HPRC2的460个单倍型可覆盖99.43%(723万)的常见小变异(AF≥1%),相较HPRC1的91.92%(668万)实现大幅提升;数据外推提示,约需932个单倍型即可实现常见变异99.9%覆盖率;对于AF≤1%的变异,HPRC2覆盖率达83%,而HPRC1仅为62%。研究采用PCLAI算法计算全基因组连续局部祖源信息,沿染色体窗口输出连续祖源坐标与置信分数,划分四大洲际祖先类别;HPRC2还融入了完整ELSI伦理规范,规避种族、地域标签带来的分析偏见。

图1. 样本筛选及测序
为组装HPRC2中纳入的230个基因组,研究团队对经MaxVar算法筛选的171份淋巴母细胞系样本开展PacBio HiFi、牛津纳米孔超长读长(ONT)以及Illumina Hi-C多组测序,结合Hifiasm组装工具、DeepPolisher校正流程以及三人家系、Hi-C策略完成460个分相单倍型的完整构建,在组装完整度、基因组连续性与碱基准确度方面实现全面升级。
HPRC2包含3,666条(35%)无缺口T2T染色体组装与2,490条(24%)仅含少量缺口的T2T支架,除近端着丝粒染色体、Y染色体等高重复区域外,其余超68%染色体达成完整或近完整T2T水平。与HPRC1相比,HPRC2组装的碱基错误率减半(QV从52.5升至55),结构不可靠区域比例从6.9%降至3.1%,在GRCh38已覆盖区域内仅0.59%不可靠。值得注意的是,8p23.1倒位区域在HPRC2所有单倍型中均被无间隙组装,而HPRC1中近半数存在缺口;着丝粒完整准确组装比例由15%提升至66%。此外,HPRC2还配套了甲基化、长读转录组和染色质可及性多维功能数据,为复杂区域的功能解析提供支撑。

图2. 对230个个体进行测序和组装
研究使用Minigraph、Minigraph-Cactus(MC)以及IMPG/PGGB构建了三套功能互补的泛基因组比对图谱,以适配不同基因组区域的解析需求。与HPRC1相比,HPRC2新增128Mb非参考可比对序列,总计2.71亿个碱基;变异覆盖趋于饱和,全新个体的任意遗传变异有98.77%概率被收录。HPRC2包含3,449万个小变异位点、10.92万个SV位点。此外,HPRC2在可靠区域对小变异、SV检测的召回率和精确率显著高于HPRC1,F1分数分别达99.16%和92.64%,尤其串联重复、低可比对性和SD区域提升最为显著。
针对线性参考基因组无法保留插入序列内部嵌套变异的短板,研究搭建了两套互补的泛基因组坐标系统:Pantree和GRef。统计显示,基因组内共存在260万SNP、230万indel和8万SV为非参考变异;基因组中长度≥50 bp的非参考可比对序列共1.63万条,总长度达231Mb。个体基因组层面,每个单倍型中约1.85%的SNP、4.16%的indel和11.65%的SV无法在线性参考中直接表征。

图3. 常见变异综合图谱
HPRC2在各类高重复、高多态区域的解析上取得了突破。对于节段性重复(SD),每个单倍型SD平均为171.6 Mb,略高于HGSVC3和HPRC1;全泛基因组范围SD总长达382.7 Mb,占基因组的12%,其中63%为单倍型共享,仅42.5Mb SD为人群固定。对于移动元件插入(MEI),HPRC2共鉴定出23,531个多态性MEI,包含Alu、L1、SVA和LTR元件,其中约30%为首次发现;每个个体平均携带5,246个常见MEI、仅82个罕见MEI,26%常见MEI接近固定。
对于串联重复序列(TR),HPRC2收录的可变数目串联重复(VNTR)等位基因数量较HPRC1提升60%,且考虑基序组成后涨幅达68%;相较于仅统计拷贝数,纳入基序特征后可检测到更多存在人群分化的位点。研究揭示着丝粒序列演化快速、遗传多样性极高的特点;绘制出亚端粒染色体间重排图谱,阐明异位序列交换是维持该区域结构特征的核心机制;揭示G四链体区域SNP密度显著高于普通基因组序列,以及自然选择约束作用。

图4. 常见SV图谱
HPRC2首次提供与大规模泛基因组匹配泛转录组与泛表观基因组数据集,构建序列、转录、调控一体化多组学图谱。基于CAT2和Ensembl独立基因注释流程,精准统计不同性染色体单倍型的蛋白编码基因数量。每个单倍型平均含126个CNV事件,鉴定出大量高拷贝数变异基因家族,TBC1D3家族拷贝数人群分化差异最显著。基于长读长转录组数据共鉴定出约11,000个蛋白编码基因和2,000个lncRNA,发现74,897个在>1%单倍型中稳定存在的全新异转录构体,识别出68,681个参考偏离转录本(RDT),分布于578个基因。RAD52、MOCS1等疾病相关基因的非参考转录本携带独特蛋白结构与调控模式,无法通过常规短读长转录组捕获。此外,转座子多态性插入可直接塑造全新转录调控模式。

图5. 全面捕获常见单倍型解析基因的全转录组变化
在表观基因组层面,HPRC2构建了单倍型分辨的泛表观基因组资源,新增1,760万个T2T-CHM13线性参考基因组不存在的CpG位点,这些位点主要富集在卫星、转座子和SD区域;共新增647万个非参考常见CpG位点,增长曲线显示饱和,罕见和极罕见CpG位点随基因组样本量增加呈线性累积,总量达1,090万个。结合PacBio和ONT甲基化数据,研究团队对启动子区域进行甲基化数量性状位点(mQTL)分析,鉴定出80,854个mQTL,其中10.2%位于复杂区域;仅2,201个mQTL的lead变异为SV,这类变异在着丝粒卫星序列中富集程度提升1.71倍。通过Fiber-seq技术,研究团队鉴定出568,430个染色质开放峰,其中51,111个(9%)位于GRCh38缺失的基因组区域,大多富集在SD中且多为个体特异性。

图6. 泛表观基因组图谱
HPRC2的应用价值已在多个维度得到验证。在SV分型方面,结合PanGenie与HPRC2泛基因组图谱对3,202个1KGP短读长样本进行基因分型,每个样本可稳定分型得到27,428个SV,较HPRC1增加9,339个,并能额外捕获数百个罕见SV;依托其重构的单倍型基因组组装精度大幅提升。针对318个医学相关基因组位点,HPRC2使局部单倍型代表性不足比例从23.5%降至13.1%,提升致病变异解析能力。HPRC2还显著提高了点突变检出准确性,全基因组小变异检测错误减少36%-52%,SNP检测错误减少50.1%-67.7%。同时,利用泛基因组坐标,每个样本平均可检出32,221个非参考小变异、726个SV。
HPRC2提供的全面基因组变异图谱有可能通过纳入难以检测的变异来改善性状关联研究。在使用合并“HPRC2+1KGP”调用集发现的10,169个eQTL中,泛基因组特异性变异占lead标记的20.3%;相比仅用1KGP变异集,有893个eGene(8.8%)的关联显著性提高至少20%,581个(5.7%)提高超50%。

图7. HPRC2的应用
HPRC2是首个整合大规模单倍型组装、泛转录组、泛表观组的一体化人类泛基因组资源,彻底突破线性参考基因组的固有参考偏差,同时攻克着丝粒、大片段倒位、长串联重复等长期组装盲区,实现了人类常见遗传变异的近乎全覆盖。
参考文献:
https://www.biorxiv.org/content/10.64898/2026.07.21.739710v1

