Advertisement

Check the fetch of file count complete?

阅读量:

近期从某高校的学术论文平台获取了相关文献资源,但在实际操作中发现网页显示的论文总数为227篇,然而实际下载数量仅为226篇,因此编写了该段代码以确认缺失的文献内容。

在实现过程中,首先对两个数据列表进行了差异性检测并输出结果,但发现两者内容完全一致。随后推测可能是网页中存在重复条目,于是进一步检查urll列表内部是否存在重复项。

最终确认该网站分类目录下存在两篇内容相同的论文,而爬虫程序中设置了去重机制,因此仅成功下载了226篇文献。

代码:

复制代码
 from lxml import etree

    
 import requests
    
 import os
    
  
    
 if __name__ == '__main__':
    
     url="https://arxiv.org/list/stat/pastweek?show=227"
    
     res = requests.get(url)
    
     res.encoding="utf-8"
    
     mytree = etree.HTML(res.content)
    
     ul = mytree.xpath("//*[@id='dlpage']/dl/dt/span/a[2]/@href")
    
  
    
     #下面这段

全部评论 (0)

还没有任何评论哟~