Advertisement

采用PIL与多种分类算法在标准数字图片上实现识别

阅读量:

相关代码实现可于GitHub平台获取,具体链接如下:https://github.com/nickliqian/simple_number_recognition>

simple_number_recognition

采用PIL库结合多种分类算法对标准数字图像实施识别处理。

背景

在获取某款免费代理网站信息的过程中,遇到了结构较为复杂的HTML代码。
由于目标数据呈现为数字与标点符号的组合,并且采用统一的字体样式,
因此尝试借助OCR技术进行识别处理。

如何实现

  1. 通过selenium结合phantomjs技术实现web页面信息的抓取,并将页面截图保存至本地存储设备。
  2. 利用Photoshop软件对页面布局进行尺寸分析,借助PIL库将需识别区域裁剪为多个独立图像并存储于本地。
  3. 运用tesseract光学字符识别工具或基于空间向量的算法对图像内容进行识别处理。

识别方法详解

Tesseract

  1. 部署Tesseract-OCR图像识别引擎
  2. 安装jTessBoxEditorFX工具,用于处理图像识别相关的训练数据
  3. 执行pip install pytesseract命令,以实现Python与Tesseract-OCR之间的交互功能
  4. 利用

全部评论 (0)

还没有任何评论哟~