Python3 爬取全部网站URL
发布时间
阅读量:
阅读量
本文将为大家介绍一种利用Python3实现抓取网站内所有URL的方法,具备较高的参考价值,期望能够为读者提供一定的帮助。接下来,让我们一同了解具体的操作过程。
第一步是获取首页的元素信息:
目标网址为:http://www.xxx.com.cn/
首先需要对页面元素进行检查,其中a标签中包含我们需要爬取的链接。通过提取链接路径,可以准确定位到所需的信息。
soup = Bs4(reaponse.text, "lxml")
urls_li = soup.select("#mainmenu_top > div > div > ul > li")
首页URL链接的获取方式:
实现首页URL链接的提取,相关代码示例如下:
'''
遇到不懂的问题?Python学习交流群:821460695满足你的需求,资料都已经上传群文件,可以自行下载!
'''
def get_first_url():
list_href = []
reaponse = requests.get("http://www.xxx.com.cn", headers=headers)
soup = Bs4(reaponse.text, "lx
全部评论 (0)
还没有任何评论哟~
