Advertisement

DataFrame字符串分割、清洗、合并及重新索引(Python)

阅读量:

在进行数据建模之前,我们从数据管理部门获取了相关数据,但这些数据的呈现形式通常无法直接用于后续分析,例如下表所示的数据(左:原始数据格式)。

原始数据格式中,id单独成列,这一设计较为合理。然而,标签及其对应的置信度(即该id归属于某一标签的概率)却被合并至同一单元格内,并仅以空格作为分隔符,这种结构在实际的数据处理过程中带来了诸多不便。

为了便于后续操作,我们需要将数据转换为右图所展示的格式(右:目标数据格式),这样能够有效支持id与其它表格信息之间的匹配工作。

原数据格式: id 标签 所需数据格式: id tag tag置信度
222201 数学老师 0.67 父亲 0.87 儿子 0.77 222201 数学老师 0.67
222202 全职太太 0.56 孕妈 0.45 222202 全职太太 0.56
222203 大学生 0.33 服务员 0.48 社团主席 0.68 222203 大学生 0.33
222204 父亲 0.79 服务员 0.56 222204 父亲 0.79
222205 语文老师 0.89 222205 语文老师 0.89
222206 年级长 0.86 数学老师 0.74 222206 年级长 0.86
2

全部评论 (0)

还没有任何评论哟~