Advertisement

Pandas的数据处理方法(数据库及文件)

阅读量:

pandas 是一个功能丰富的数据分析工具包;其构建基础为 Numpy(支持高效矩阵运算);它不仅用于数据挖掘和数据分析,并且还提供了数据清洗功能。

Pandas中常见的数据结构有两种:

Series DataFrame
类似一维数组的对象 类似多维数组/表格数组,每列数据可以是不同的类型;索引包括行索引和列索引

生成Series对象:ser_obj = pd.Series(range(10));
该对象由索引与数值构成(其中,在左侧的是自动生成的索引,在右侧是对应的数值);
通过属性访问ser_obj.index与ser_obj.values分别获取索引与数值信息;
使用ser_obj.head(n)查看前n项内容,
以及ser_obj.tail(n)查看后n项内容。

DataFrame 提取列值:df_obj.iloc[:, col_idx] 或 df_obj['col_idx'];
向DataFrame中添加新列:df_obj[new_col_idx] = data;
移除指定的列:del df_obj[col_idx];
按照指定的键排序:按照键 label_name 进行排序 sort_values(by='label_name')。

常用方法:

Count 非NA值得数量
describe 针对Serie

全部评论 (0)

还没有任何评论哟~