Advertisement

爬虫采用boss直聘自动投递简历及数据获取

阅读量:

boss直聘web端的反爬虫机制设计得较为完善,需结合下载js文件与浏览器生成token,一时未能完全理解其原理,因此选择通过selenium工具来获取数据,并顺带投递简历。
即便采用selenium方式,也只能获取有限的数据量,因为系统对数据提取数量进行了限制,无论是搜索还是进入公司页面(最多300条),均存在获取数据的上限,因此可以考虑通过推荐机制来进一步获取数据。
此外,长时间访问后还会触发验证机制,且该验证流程较为复杂,即便是人工识别也需耗费较长时间才能完成。

复制代码
    from selenium import webdriver
    import time
    from selenium.webdriver.common.by import By
    from selenium.webdriver.support import expected_conditions as EC
    from selenium.webdriver.support.wait import WebDriverWait
    from bs4 import BeautifulSoup
    import redis
    import re
    import json
    import random
    import traceback

全部评论 (0)

还没有任何评论哟~