Advertisement

Python处理数据常见问题解决方案(2):Dataframe在添加大量数据时使用append()导致效率低下

阅读量:
问题描述:

在Python编程中对dataframe进行增删改查操作时,默认情况下我们通常会采用append()函数来进行逐行增加数据的操作。但随着数据量的急剧增加这一传统做法已经无法满足性能需求成为效率瓶颈.最近的任务要求我必须处理多达35万条的数据记录因此必须对每一笔原始数据进行单独的操作并将其整合为一个独立的新记录随后将这些整合后的新记录依次导入到一个新的空DataFrame中去

在MacBook上使用PyCharm耗用了8小时,在完成了一个append()函数约1.1万次调用后发现效率令人难以接受。因此有必要探索更高效的dataframe构建方法

为了进一步提高效率

案例一、失败,耗时,耗内存,随着数据增加,速度慢得不能接受:

总耗时约30分钟:

复制代码
    import pandas as pd
    from datetime import datetime
    import random
    
    column_name = ['a', 'b', 'c', 'd']
    test_df = pd.DataFrame(columns=column_name)
    
    start_time = datetime.now()
    for index in range(0, 300000):

全部评论 (0)

还没有任何评论哟~