采用PIL与多种分类算法在标准数字图片上实现识别
发布时间
阅读量:
阅读量
相关代码实现可于GitHub平台获取,具体链接如下:https://github.com/nickliqian/simple_number_recognition>
simple_number_recognition
采用PIL库结合多种分类算法对标准数字图像实施识别处理。
背景
在获取某款免费代理网站信息的过程中,遇到了结构较为复杂的HTML代码。
由于目标数据呈现为数字与标点符号的组合,并且采用统一的字体样式,
因此尝试借助OCR技术进行识别处理。
如何实现
- 通过selenium结合phantomjs技术实现web页面信息的抓取,并将页面截图保存至本地存储设备。
- 利用Photoshop软件对页面布局进行尺寸分析,借助PIL库将需识别区域裁剪为多个独立图像并存储于本地。
- 运用tesseract光学字符识别工具或基于空间向量的算法对图像内容进行识别处理。
识别方法详解
Tesseract
- 部署Tesseract-OCR图像识别引擎
- 安装jTessBoxEditorFX工具,用于处理图像识别相关的训练数据
- 执行
pip install pytesseract命令,以实现Python与Tesseract-OCR之间的交互功能 - 利用
全部评论 (0)
还没有任何评论哟~
