Advertisement

JAVA PDFbox 坐标范围内的文字提取

阅读量:

PDFBox JAR 包在默认情况下是依据行进行文字提取的,然而实际应用中的 PDF 文件可能并非按照行的顺序进行排列。在这种情况下,我们可以借助坐标矩形选区的功能,针对特定区域内的文字进行提取。其背后的实现原理无需深入探讨,我们只需将其作为工具加以使用即可。该工具具备一定的灵活性,当有特殊需求时,还可参考官方文档内容,自行组合所需功能。

矩形区域内容提取方法

1、引入pdfboxjar包(不同版本的操作方式存在差异),在此过程中我采用的是maven方式

复制代码
 <dependency>

    
    	<groupId>org.apache.pdfbox</groupId>
    
    	<artifactId>pdfbox</artifactId>
    
     <version>1.8.13</version>
    
 </dependency>
    
    
    
    

2、通过执行以下代码实现文字的提取过程

复制代码
 import org.apache.pdfbox.pdmodel.PDDocument;

    
 import org.apache.pdfbox.pdmodel.PDPage;
    
 import org.apache.pdfbox.util.PDFTextStripperByAr

全部评论 (0)

还没有任何评论哟~