Check the fetch of file count complete?
发布时间
阅读量:
阅读量
近期从某高校的学术论文平台获取了相关文献资源,但在实际操作中发现网页显示的论文总数为227篇,然而实际下载数量仅为226篇,因此编写了该段代码以确认缺失的文献内容。
在实现过程中,首先对两个数据列表进行了差异性检测并输出结果,但发现两者内容完全一致。随后推测可能是网页中存在重复条目,于是进一步检查urll列表内部是否存在重复项。
最终确认该网站分类目录下存在两篇内容相同的论文,而爬虫程序中设置了去重机制,因此仅成功下载了226篇文献。
代码:
from lxml import etree
import requests
import os
if __name__ == '__main__':
url="https://arxiv.org/list/stat/pastweek?show=227"
res = requests.get(url)
res.encoding="utf-8"
mytree = etree.HTML(res.content)
ul = mytree.xpath("//*[@id='dlpage']/dl/dt/span/a[2]/@href")
#下面这段
全部评论 (0)
还没有任何评论哟~
