Advertisement

Python3 爬取全部网站URL

阅读量:

本文将为大家介绍一种利用Python3实现抓取网站内所有URL的方法,具备较高的参考价值,期望能够为读者提供一定的帮助。接下来,让我们一同了解具体的操作过程。
第一步是获取首页的元素信息:

目标网址为:http://www.xxx.com.cn/

首先需要对页面元素进行检查,其中a标签中包含我们需要爬取的链接。通过提取链接路径,可以准确定位到所需的信息。

复制代码
    soup = Bs4(reaponse.text, "lxml")
    urls_li = soup.select("#mainmenu_top > div > div > ul > li")
    
    
      
      
    

首页URL链接的获取方式:

实现首页URL链接的提取,相关代码示例如下:

复制代码
    '''
    遇到不懂的问题?Python学习交流群:821460695满足你的需求,资料都已经上传群文件,可以自行下载!
    '''
    def get_first_url():
      list_href = []
      reaponse = requests.get("http://www.xxx.com.cn", headers=headers)
      soup = Bs4(reaponse.text, "lx

全部评论 (0)

还没有任何评论哟~