R语言移除某只在该数据集中出现过N次的数据行
发布时间
阅读量:
阅读量
需要解决的问题描述:
该购买行为的数据集记录了用户的id信息及其相关的商品分类、评分情况、有用性评价和时间戳等详细数据字段
数据事例:

去除那些item_id只出现过一次的行。 问题的规模:922267obs of 2 variables
查找过资料发现如下两个方法:
1.定义一个函数
deleteuniquelines <- function(x) {# 输入数据框
stand.col <- x[, 1] # 设置根据x的第一列为基准列(其中第i列为第i列)
count <- table(stand.col) # 统计各数值出现的频率
if (all(count < 2)) {
stop("所有记录均为唯一值")
} else {
ind <- sapply(stand.col, function(t) {
ifelse(count[as.character(t)] > 1, TRUE, FALSE)
})
}
return(x[ind, ])
}
tes
全部评论 (0)
还没有任何评论哟~
