Biobank遗传数据分析(二)
发布时间
阅读量:
阅读量
Biobank genetic data探析(二)——Imputaion
1. 什么是imputation?
Imputation意指“补全”,首次接触到这一概念是在通过scRNA-seq数据对空间转录组数据进行补全的过程中,即借助计算方法应对空间转录组技术所检测到的mRNA种类较少的问题。而在GWAS研究中,则是借助参考数据集,对芯片未能检测到的变异位点进行补充。例如UKBB指出,Affymatrix Axiom芯片仅能检测约80万个SNPs,而通过imputation处理后,我们实际上可以获得约9600万个SNPs的信息。
作为参考的数据集,其一是1000 Genomes phase 3 dataset ,主要用于改善非欧洲血统人群的imputation效果;另一个则是Haplotype Reference Consortium ,这是UKBB imputation过程中的主要参考数据来源。
在进一步深入之前,有必要明确genotype(基因型)与haplotype(单体型)之间的差异:基因型是指由于染色体上某个特定位置的不同而产生的形态变化,可以理解为一个genotype call对应于一个SNP(包括INDEL)。而单体型则是一组位于同一染色体上的多个SNPs,这些位点之间通常存在较强的连锁不平衡性,并且是从父母双方遗传下来
全部评论 (0)
还没有任何评论哟~
