Advertisement

Python程序处理PDF文件内容

阅读量:
复制代码
    from urllib.request import urlopen
    from pdfminer.pdfparser import PDFParser, PDFDocument
    from pdfminer.pdfinterp import PDFResourceManager, PDFPageInterpreter
    from pdfminer.pdfdevice import PDFDevice
    from pdfminer.converter import PDFPageAggregator
    from pdfminer.layout import LTTextBoxHorizontal, LAParams
    
    """
    读取pdf文件流程:
    1.打开并读取pdf文档对象:open()
    2.创建文档解析器:PDFParser()
    3.创建文档对象:PDFDocument()
    4.连接解析器和文档对象:set_document() set_parser()
    5.创建资源管理器:PDFResourceManager()
    6.创建参数分析器:LAParams()
    7.创建页面聚合器对象:PDFPageAggregator()
    8.创建页面解析器对象:P

全部评论 (0)

还没有任何评论哟~