Advertisement

如果没有生物学重复怎么办?了解伪replicates

阅读量:

欢迎关注”生信修炼手册”!

针对ATAC_seq、chip_seq等蛋白质富集类实验而言,配置生物学重复具有重要意义。借助IDR软件对多个生物学重复的peak calling结果进行整合,有助于获得更为稳定且更具代表性的peak集合。生物学重复的重要性无需赘述,然而在某些特殊样本的情况下,确实存在无法获取生物学重复的情形,此时应如何应对?

可借鉴Encode所提供的ATAC分析流程,在数据层面构建一个模拟的“伪”生物学重复。其核心理念在于随机抽样,即从整体数据中随机选取一定比例的reads。例如,若随机抽取50%的reads,并进行两次独立抽样,则可生成两个类似生物学重复的数据集,进而开展后续分析。具体操作步骤如下,需依赖两个运行于Linux系统下的工具

shuf命令功能解析

此指令的功能是将文件内的内容进行随机排列后呈现,例如某文件中的信息排列方式可能如下

复制代码
 cat a.txt

    
 1
    
 2
    
 3
    
 4
    
 5
    
 6
    
 7
    
 8
    
 9
    
 10
    
    
    
    

利用shuf命令能够实现对数据顺序的随机化处理

复制代码
 shuf a.txt

    
 4
    
 1
    
 6
    
 10

全部评论 (0)

还没有任何评论哟~