JAVA PDFbox 坐标范围内的文字提取
发布时间
阅读量:
阅读量
PDFBox JAR 包在默认情况下是依据行进行文字提取的,然而实际应用中的 PDF 文件可能并非按照行的顺序进行排列。在这种情况下,我们可以借助坐标矩形选区的功能,针对特定区域内的文字进行提取。其背后的实现原理无需深入探讨,我们只需将其作为工具加以使用即可。该工具具备一定的灵活性,当有特殊需求时,还可参考官方文档内容,自行组合所需功能。
矩形区域内容提取方法
1、引入pdfboxjar包(不同版本的操作方式存在差异),在此过程中我采用的是maven方式
<dependency>
<groupId>org.apache.pdfbox</groupId>
<artifactId>pdfbox</artifactId>
<version>1.8.13</version>
</dependency>
2、通过执行以下代码实现文字的提取过程
import org.apache.pdfbox.pdmodel.PDDocument;
import org.apache.pdfbox.pdmodel.PDPage;
import org.apache.pdfbox.util.PDFTextStripperByAr
全部评论 (0)
还没有任何评论哟~
