爬虫采用boss直聘自动投递简历及数据获取
发布时间
阅读量:
阅读量
boss直聘web端的反爬虫机制设计得较为完善,需结合下载js文件与浏览器生成token,一时未能完全理解其原理,因此选择通过selenium工具来获取数据,并顺带投递简历。
即便采用selenium方式,也只能获取有限的数据量,因为系统对数据提取数量进行了限制,无论是搜索还是进入公司页面(最多300条),均存在获取数据的上限,因此可以考虑通过推荐机制来进一步获取数据。
此外,长时间访问后还会触发验证机制,且该验证流程较为复杂,即便是人工识别也需耗费较长时间才能完成。
from selenium import webdriver
import time
from selenium.webdriver.common.by import By
from selenium.webdriver.support import expected_conditions as EC
from selenium.webdriver.support.wait import WebDriverWait
from bs4 import BeautifulSoup
import redis
import re
import json
import random
import traceback
全部评论 (0)
还没有任何评论哟~
