Advertisement

关于R语言中的by函数的学习与思考

阅读量:

在进行GEO数据挖掘过程中,存在一个关键步骤即整合表达矩阵。当多个探针对应同一基因时,需保留在所有样本中平均表达量最高的探针。

复制代码
    tmp <- by(exprSet,ids$symbol,
          function(x) rownames(x)[which.max(rowMeans(x))])
    
    
      
      
    

起初对此并不十分清楚,因此查阅了by函数的相关示例,如下所示。

通过对比可以发现:
该过程首先依据symbol对exprSet进行分组;随后针对每组数据计算其行的平均值;最终确定平均值最高的行,并提取对应的行名称。

复制代码
    > library(stats)
    
    # 看一下warpbreaks数据集的结构
    > head(warpbreaks)
      breaks wool tension
    1     26    A       L
    2     30    A       L
    3     54    A       L
    4     25    A       L
    5     70    A       L
    6     52    A       L
    
    > table(warpbreaks

全部评论 (0)

还没有任何评论哟~