DataFrame字符串分割、清洗、合并及重新索引(Python)
发布时间
阅读量:
阅读量
在进行数据建模之前,我们从数据管理部门获取了相关数据,但这些数据的呈现形式通常无法直接用于后续分析,例如下表所示的数据(左:原始数据格式)。
原始数据格式中,id单独成列,这一设计较为合理。然而,标签及其对应的置信度(即该id归属于某一标签的概率)却被合并至同一单元格内,并仅以空格作为分隔符,这种结构在实际的数据处理过程中带来了诸多不便。
为了便于后续操作,我们需要将数据转换为右图所展示的格式(右:目标数据格式),这样能够有效支持id与其它表格信息之间的匹配工作。
| 原数据格式: | id | 标签 | 所需数据格式: | id | tag | tag置信度 | |
|---|---|---|---|---|---|---|---|
| 222201 | 数学老师 0.67 父亲 0.87 儿子 0.77 | 222201 | 数学老师 | 0.67 | |||
| 222202 | 全职太太 0.56 孕妈 0.45 | 222202 | 全职太太 | 0.56 | |||
| 222203 | 大学生 0.33 服务员 0.48 社团主席 0.68 | 222203 | 大学生 | 0.33 | |||
| 222204 | 父亲 0.79 服务员 0.56 | 222204 | 父亲 | 0.79 | |||
| 222205 | 语文老师 0.89 | 222205 | 语文老师 | 0.89 | |||
| 222206 | 年级长 0.86 数学老师 0.74 | 222206 | 年级长 | 0.86 | |||
| 2 |
全部评论 (0)
还没有任何评论哟~
