Advertisement

RNA测序数据解析

阅读量:

一、EST数据来源

本研究所用的小麦EST数据库来自GenBank数据库(截止2013年12月),共1286914条序列

二、低质量序列部分以及污染序列去除

逐行逐一扫描 EST 序列以去除其中质量较低的部分;具体而言,则包括以下步骤:

  • 从 5’ 端开始向 3’ 端逐一扫描每一条 EST 序列;
  • 若在长度为 10bp 的范围内发现两个以上非 ATCG 字符,则需去除该区域的所有碱基。
    相应的 Python 代码如下:
复制代码
 #!/usr/bin/env python

    
 # -*- coding: utf-8 -*-
    
  
    
 from Bio import SeqIO
    
  
    
 out = open('low_quality_wheat_est.fasta', 'w')
    
 record_dict = SeqIO.index('wheat_est.fasta', "fasta")
    
 a = []
    
 for key in record_dict.keys():
    
     for i in range(len(str(record_dict[key].seq))-10):
    
     new = record_dict[key].seq.upper()[i:(i+10)]

全部评论 (0)

还没有任何评论哟~