Pandas的数据处理方法(数据库及文件)
发布时间
阅读量:
阅读量
pandas 是一个功能丰富的数据分析工具包;其构建基础为 Numpy(支持高效矩阵运算);它不仅用于数据挖掘和数据分析,并且还提供了数据清洗功能。
Pandas中常见的数据结构有两种:
| Series | DataFrame |
|---|---|
| 类似一维数组的对象 | 类似多维数组/表格数组,每列数据可以是不同的类型;索引包括行索引和列索引 |
生成Series对象:ser_obj = pd.Series(range(10));
该对象由索引与数值构成(其中,在左侧的是自动生成的索引,在右侧是对应的数值);
通过属性访问ser_obj.index与ser_obj.values分别获取索引与数值信息;
使用ser_obj.head(n)查看前n项内容,
以及ser_obj.tail(n)查看后n项内容。
DataFrame 提取列值:df_obj.iloc[:, col_idx] 或 df_obj['col_idx'];
向DataFrame中添加新列:df_obj[new_col_idx] = data;
移除指定的列:del df_obj[col_idx];
按照指定的键排序:按照键 label_name 进行排序 sort_values(by='label_name')。
常用方法:
| Count | 非NA值得数量 |
|---|---|
| describe | 针对Serie |
全部评论 (0)
还没有任何评论哟~
