Advertisement

数学建模国2000A课程围绕DNA序列问题的数据分析展开

阅读量:

2000年A题 DNA序列 中的数据处理

特指与Nat-model-data相关的题库数据规模较大的题库不便展示具体内容如有需要可参考以下链接 link

那么如何进行数据处理才能让这个数据为我们所用呢?

我的研究思路如下:通过对所收集的数据进行分析发现,这些基因序列主要由A、T、G、C四种碱基组成,共有182个,且各个基因序列的长度各不相同。共同特点在于每个序列都以数字开头,随后以字符‘>’开始标记基因内容,并以空白符结束。具体方法是将每一个基因序列单独存储在一个元组中,排列成一个二维数组的形式。具体实现步骤包括以下几点:首先建立一个循环结构用于遍历所有基因数据;其次在循环体内对每个序号进行处理,判断其是否满足初始条件;若开头为数字即继续查找直到当前字符为字母即基因开始;当遇到空格符时则认为是结束标志;最后将所有读取到的字母部分拼接成完整的基因序列存入元组中对应的位置。

具体程序

复制代码
    clc
    clear
    close all
    
    fid=fopen('Nat-model-data.txt','r'); 
    result='';%每个基因的暂存变量
    j=1;
    dna{182,1}=0;%182个基因的储存元

全部评论 (0)

还没有任何评论哟~