Python程序处理PDF文件内容
发布时间
阅读量:
阅读量
from urllib.request import urlopen
from pdfminer.pdfparser import PDFParser, PDFDocument
from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
from pdfminer.pdfdevice import PDFDevice
from pdfminer.converter import PDFPageAggregator
from pdfminer.layout import LTTextBoxHorizontal, LAParams
"""
读取pdf文件流程:
1.打开并读取pdf文档对象:open()
2.创建文档解析器:PDFParser()
3.创建文档对象:PDFDocument()
4.连接解析器和文档对象:set_document() set_parser()
5.创建资源管理器:PDFResourceManager()
6.创建参数分析器:LAParams()
7.创建页面聚合器对象:PDFPageAggregator()
8.创建页面解析器对象:P
全部评论 (0)
还没有任何评论哟~
