利用python整理重复的文件 Python处理重复文件
发布时间
阅读量:
阅读量
在硬盘中发现大量重复文件,其中包括不同时期备份的手机照片以及多个时间段下载的学习视频:)
若存在大量大文件,将占用过多存储空间,必须进行清理。
编写了脚本程序,对硬盘中的文件进行遍历,并计算其MD5值,以识别重复文件。本内容仅将结果保存至Excel表格中,用户可根据需要自行判断并删除重复的MD5对应文件,或将其移动至指定目录。代码中已处理utf8与gbk编码之间的兼容性问题(Windows系统的文件名采用gbk编码)。
运行环境为Python 2.7 + Windows 7 64位系统
# coding:utf-8
import os
import hashlib
import pandas as pd
def get_file_size(file_name_path):
# 获取文件的大小,结果保留两位小数,单位为MB
f_size = os.path.getsize(file_name_path)
f_size = f_size/float(1024*1024)
return round(f_size, 2)
def get_
全部评论 (0)
还没有任何评论哟~
