RNA测序数据解析
发布时间
阅读量:
阅读量
一、EST数据来源
本研究所用的小麦EST数据库来自GenBank数据库(截止2013年12月),共1286914条序列
二、低质量序列部分以及污染序列去除
逐行逐一扫描 EST 序列以去除其中质量较低的部分;具体而言,则包括以下步骤:
- 从 5’ 端开始向 3’ 端逐一扫描每一条 EST 序列;
- 若在长度为 10bp 的范围内发现两个以上非 ATCG 字符,则需去除该区域的所有碱基。
相应的 Python 代码如下:
#!/usr/bin/env python
# -*- coding: utf-8 -*-
from Bio import SeqIO
out = open('low_quality_wheat_est.fasta', 'w')
record_dict = SeqIO.index('wheat_est.fasta', "fasta")
a = []
for key in record_dict.keys():
for i in range(len(str(record_dict[key].seq))-10):
new = record_dict[key].seq.upper()[i:(i+10)]
全部评论 (0)
还没有任何评论哟~
