Python爬虫自动识别验证码
发布时间
阅读量:
阅读量
本文主要利用tesseract识别网页登陆中的验证码(从图像的角度,不是Cookie)
CAPTCHA(验证码)这一概念被广泛认知,然而其具体定义却鲜为人知,即全自动区分计算机与人类的图灵测试。简单来说,这是一种用于辨别人类用户与人工智能程序的技术手段。在众多网站中,验证码被普遍采用,最常见的形式是由字母与数字组合而成的图像,例如以下所示:

本研究中所采用的代码通过selenium工具模拟浏览器操作,实现对登录界面验证码的识别过程,具体包括定位验证码所在区域并进行分割,随后运用光学字符识别技术完成验证码内容的辨识。
# -*- coding: utf-8 -*-
"""
Created on Sun Apr 26 17:42:23 2020
@author: dell
"""
import re # 用于正则
from PIL import Image # 用于打开图片和对图片处理
import tesserocr
import pytesseract
全部评论 (0)
还没有任何评论哟~
