Advertisement

R语言移除某只在该数据集中出现过N次的数据行

阅读量:

需要解决的问题描述:

该购买行为的数据集记录了用户的id信息及其相关的商品分类、评分情况、有用性评价和时间戳等详细数据字段

数据事例:

去除那些item_id只出现过一次的行。 问题的规模:922267obs of 2 variables

查找过资料发现如下两个方法:

1.定义一个函数

deleteuniquelines <- function(x) {# 输入数据框
stand.col <- x[, 1] # 设置根据x的第一列为基准列(其中第i列为第i列)
count <- table(stand.col) # 统计各数值出现的频率
if (all(count < 2)) {
stop("所有记录均为唯一值")
} else {
ind <- sapply(stand.col, function(t) {
ifelse(count[as.character(t)] > 1, TRUE, FALSE)
})
}
return(x[ind, ])
}

tes

全部评论 (0)

还没有任何评论哟~