java 读取pdf文件内容
一、引入maven
<dependency><groupId>org.apache.pdfbox</groupId><artifactId>pdfbox</artifactId><version>2.0.25</version>
</dependency>
二、代码工具类
package com.jiayou.peis.utils;//import com.itextpdf.text.pdf.PdfReader;
//import com.itextpdf.text.pdf.parser.PdfTextExtractor;
//import com.itextpdf.text.pdf.parser.SimpleTextExtractionStrategy;import com.google.common.collect.Lists;
import com.jiayou.peis.entity.ImageObject;
import org.apache.commons.io.FileUtils;
import org.apache.pdfbox.Loader;
import org.apache.pdfbox.cos.COSName;
import org.apache.pdfbox.pdmodel.PDDocument;
import org.apache.pdfbox.pdmodel.PDResources;
import org.apache.pdfbox.pdmodel.common.PDStream;
import org.apache.pdfbox.pdmodel.graphics.PDXObject;
import org.apache.pdfbox.pdmodel.graphics.image.PDImage;
import org.apache.pdfbox.pdmodel.graphics.image.PDImageXObject;
import org.apache.pdfbox.text.PDFTextStripper;import javax.imageio.ImageIO;
import java.awt.image.BufferedImage;
import java.io.*;
import java.util.ArrayList;
import java.util.List;/*** PDF处理** @author Bob Ren (Copyright © 2015-2029 贵州家有在线网络有限公司)* @version 1.0.0* @date 2022-02-07 16:21*/
public class PdfUtils {// /**
// * 使用itextpdf提取PDF文本(解析不靠谱)
// *
// * @param inputStream
// * @return
// * @throws IOException
// */
// @Deprecated
// public static String toText(InputStream inputStream) throws IOException {
// try {
// StringBuilder buf = new StringBuilder();
// PdfReader reader = new PdfReader(inputStream);
// int pageNum = reader.getNumberOfPages();
// for(int i=1;i<=pageNum;i++){
// // 读取第i页的文档内容
// buf.append(PdfTextExtractor.getTextFromPage(reader, i, new SimpleTextExtractionStrategy()));
// }
return buf.toString();
// return StrUtils.removeReturnChar(buf.toString());
// } finally {
// CloseUtils.closeQuietly(inputStream);
// }
// }public static String text(byte[] data) throws IOException {return PdfUtils.text(data, true);}public static String text(byte[] data, boolean sortByPosition) throws IOException {ByteArrayInputStream inputStream = new ByteArrayInputStream(data);return PdfUtils.text(inputStream, sortByPosition);}/*** 使用pdfbox提取PDF文本(解析正常,可使用)** @param file* @return* @throws IOException*/public static String text(File file, boolean sortByPosition) throws IOException {InputStream inputStream = new FileInputStream(file);return PdfUtils.text(inputStream, sortByPosition);}public static String text(File file) throws IOException {return PdfUtils.text(file, true);}public static String text(InputStream inputStream) throws IOException {return text(inputStream, true);}/*** 使用pdfbox提取PDF文本(解析正常,可使用)** @param inputStream* @return* @throws IOException*/public static String text(InputStream inputStream, boolean sortByPosition) throws IOException {PDDocument document = null;try {
// document = PDDocument.load(inputStream);document = Loader.loadPDF(inputStream);PDFTextStripper textStripper = new PDFTextStripper();// Get total page count of the PDF documentint numberOfPages = document.getNumberOfPages();//set the first page to be extractedtextStripper.setStartPage(1);// set the last page to be extractedtextStripper.setEndPage(numberOfPages);// 获取文本内容textStripper.setSortByPosition(sortByPosition);textStripper.setShouldSeparateByBeads(true);return StrUtils.removeReturnChar(textStripper.getText(document));} finally {CloseUtils.closeQuietly(document, inputStream);}}/*** 使用pdfbox提取PDF文本(解析正常,可使用)** @param file* @return* @throws IOException*/public static List<ImageObject> images(File file) throws IOException {InputStream inputStream = new FileInputStream(file);return PdfUtils.images(inputStream);}public static List<ImageObject> images(byte[] data) throws IOException {ByteArrayInputStream inputStream = null;try {inputStream = new ByteArrayInputStream(data);return PdfUtils.images(inputStream);} finally {CloseUtils.closeQuietly(inputStream);}}/*** 使用pdfbox提取PDF图片列表** @param inputStream* @return* @throws IOException*/public static List<ImageObject> images(InputStream inputStream) throws IOException {List<ImageObject> imageList = Lists.newArrayList();PDDocument document = null;try {
// document = PDDocument.load(inputStream);document = Loader.loadPDF(inputStream);// get resources for a pagePDResources pdResources = document.getPage(0).getResources();int i = 0;for (COSName csName : pdResources.getXObjectNames()) {
// System.out.println(i+":"+csName);PDXObject pdxObject = pdResources.getXObject(csName);if (pdxObject instanceof PDImageXObject) {
// i++;PDStream pdStream = pdxObject.getStream();PDImageXObject image = new PDImageXObject(pdStream, pdResources);String imageSuffix = imageSuffix(image);// image storage location and image nameBufferedImage bufferedImage = image.getImage();ImageObject object = new ImageObject();object.setIndex(i++);object.setImage(bufferedImage);object.setSuffix(imageSuffix);imageList.add(object);}}} finally {CloseUtils.closeQuietly(document, inputStream);}return imageList;}/*** 获取图片后缀** @param pdImage* @return* @throws IOException*/private static String imageSuffix(PDImageXObject pdImage) throws IOException {String suffix = pdImage.getSuffix();if (suffix == null || "jb2".equals(suffix)) {suffix = "png";} else if ("jpx".equals(suffix)) {// use jp2 suffix for file because jpx not known by windowssuffix = "jp2";}if (hasMasks(pdImage)) {// TIKA-3040, PDFBOX-4771: can't save ARGB as JPEGsuffix = "png";}return suffix;}private static boolean hasMasks(PDImage pdImage) throws IOException {if (pdImage instanceof PDImageXObject) {PDImageXObject ximg = (PDImageXObject) pdImage;return ximg.getMask() != null || ximg.getSoftMask() != null;}return false;}/*** 保存图片到指定文件夹** @param imageList* @param dir* @param prefixName* @throws IOException*/public static void saveImage(List<ImageObject> imageList, String dir, String prefixName) throws IOException {File imgDir = new File(dir);FileUtils.forceMkdir(imgDir);for(ImageObject image:imageList){File imgFile = new File(dir, prefixName+"_"+image.getIndex()+"."+image.getSuffix());ImageIO.write(image.getImage(), image.getSuffix(), imgFile);}}
}
相关文章:
java 读取pdf文件内容
一、引入maven <dependency><groupId>org.apache.pdfbox</groupId><artifactId>pdfbox</artifactId><version>2.0.25</version> </dependency>二、代码工具类 package com.jiayou.peis.utils;//import com.itextpdf.text.pd…...

【linux】安装rpmrebuild
rpmrebuild是一种从已经安装的包中构建RPM文件的工具。它可以用于轻松构建修改后的包,并适用于任何使用RPM的Linux发行版。 访问地址 rpm rebuild download | SourceForge.net 选择版本 版本地址:版本地址 下载安装包 安装 rpm -ivh rpmrebuild-2.15…...
设计模式——访问者模式(Visitor Pattern)+ Spring相关源码
文章目录 一、访问者模式(Visitor Pattern)二、文字描述三、例子例子一:菜鸟教程对象定义访问者定义使用总结 例子二:Spring的BeanDefinitionVisitor 一、访问者模式(Visitor Pattern) 行为型模式。 目的&…...

SQL Delete 语句(删除表中的记录)
SQL DELETE 语句 DELETE语句用于删除表中现有记录。 SQL DELETE 语法 DELETE FROM table_name WHERE condition; 请注意删除表格中的记录时要小心!注意SQL DELETE 语句中的 WHERE 子句! WHERE子句指定需要删除哪些记录。如果省略了WHERE子句ÿ…...
在 Android 上测试 Kotlin 数据流
文章目录 一 创建虚构数据提供方二 在测试中断言数据流发出测试期间持续收集 三 测试 StateFlow使用 stateIn 创建的 StateFlow 转自: https://developer.android.google.cn/kotlin/flow/test?hlzh-cn#producer 与数据流进行通信的单元或模块的测试方式取决于受测对…...
day43
今日内容 python操作MySQL(重要) SQL注入问题(安全相关的xss,csrf) 视图(了解) 触发器(了解) 事务(重要) 存储过程(了解) 内置函数(了解,很多) 流程控制(了解) 索引(重点) python操作MySQL MySQL本身就是一款c/s架构,有服务端、有客户端&…...
终端管理制度
1、总则 1.1、目的 为规范XXXXX单位员工在使用计算机终端过程中的行为,提高计算机终端的安全性,确保员工安全使用计算机终端,特制定本制度。 1.2、范围 本规定适用于在XXXXX单位使用计算机终端的所有员工,包括内部终端和外部终…...

视频相关学习笔记
YUV 和rgb一样是一种表示色彩的格式,Y表示亮度,UV表示色度(U是蓝色投影,V是红色投影),只有Y就是黑白的,所以这个格式的视频图片可以兼容黑白电视,所以彩色电视使用的都是YUV 存储方…...
神经网络中epoch、batch、batchsize区别
目录 1 epoch 2 batch 3 batchsize 4 区别 1 epoch 当数据集中的全部数据样本通过神经网络一次并且返回一次的过程即完成一次训练称为一个epoch。 当我们分批学习时,每次使用过全部训练数据完成一次Forword运算以及一次BP运算,称为完成了一次epoch。 epoch时期 = 所有训练…...

如何将Mysql数据库的表导出并导入到另外的架构
如何将Mysql数据库的表导出并导入到另外的架构 准备一、解决方法1.右键->导出->用mysqldump导出2.注意路径一般为:C:/Program Files/MySQL/MySQL Server 8.0/bin/mysqldump.exe和导出的sql文件位置3.右键->SQL脚本->运行SQL脚本4.找到SQL脚本并点击确定…...

【tio-websocket】9、服务配置与维护—TioConfig
场景 我们在写 TCP Server 时,都会先选好一个端口以监听客户端连接,再创建N组线程池来执行相关的任务,譬如发送消息、解码数据包、处理数据包等任务,还要维护客户端连接的各种数据,为了和业务互动,还要把这些客户端连接和各种业务数据绑定起来,譬如把某个客户端绑定到一…...

数据结构—线性表(下)
文章目录 6.线性表(下)(4).栈与队列的定义和ADT#1.ADT#2.栈的基本实现#3.队列的形式#4.队列的几种实现 (5).栈与队列的应用#1.栈的应用i.后缀表达式求值ii.中缀表达式转后缀表达式 #2.队列的应用 (6).线性表的其他存储方式#1.索引存储#2.哈希存储i.什么是哈希存储ii.碰撞了怎么…...
apisix之插件开发,包含java和lua两种方式
https://download.csdn.net/download/tiantangpw/88475630 有ppt和springboot程序包,可以运行...

【面试经典150 | 链表】合并两个有序链表
文章目录 Tag题目来源题目解读解题思路方法一:递归方法二:迭代 写在最后 Tag 【递归】【迭代】【链表】 题目来源 21. 合并两个有序链表 题目解读 合并两个有序链表。 解题思路 一种朴素的想法是将两个链表中的值存入到数组中,然后对数组…...

【linux】麒麟v10安装Redis主从集群(ARM架构)
安装redis单示例的请看:麒麟v10安装Redis(ARM架构) 安装环境 HostnameIP addressmaster192.168.0.1slave1192.168.0.2slave2192.168.0.3 下载安装包 (三台都操作) wget https://repo.huaweicloud.com/kunpeng/…...
解决k8s删除名称空间无法强制删除的问题
问题起因:删除k8s名称空间的时候(此时名称空间下还有很多pod)一直删不掉,被我强行ctrl c了, 问题表象:然后就出现下面这悲催的一幕了,两个名称空间一直处于Terminating了 [rootmaster02 ~]# ku…...

华为---DHCP中继代理简介及示例配置
DHCP中继代理简介 IP动态获取过程中,客户端(DHCP Client)总是以广播(广播帧及广播IP报文)方式来发送DHCPDISCOVER和DHCPREQUEST消息的。如果服务器(DHCP Server)和 客户端不在同一个二层网络(二…...

五、W5100S/W5500+RP2040树莓派Pico<UDP Client数据回环测试>
文章目录 1. 前言2. 协议简介2.1 简述2.2 优点2.3 应用 3. WIZnet以太网芯片4. UDP Client回环测试4.1 程序流程图4.2 测试准备4.3 连接方式4.4 相关代码4.5 测试现象 5. 注意事项6. 相关链接 1. 前言 UDP是一种无连接的网络协议,它提供了一种简单的、不可靠的方式来…...

死锁Deadlock
定义 死锁是指两个或多个线程互相持有对方所需的资源,从而导致它们无法继续执行的情况。如下图所示,现有两个线程,分别是线程A及线程B,线程A持有锁A,线程B持有锁B。此时线程A想获取锁B,但锁B需等到线程B的结…...

【spark客户端】Spark SQL CLI详解:怎么执行sql文件、注释怎么写,支持的文件路径协议、交互式模式使用细节
文章目录 一. Spark SQL Command Line Options(命令行参数)二. The hiverc File1. without the -i2. .hiverc 介绍 三. 支持的路径协议四. 支持的注释类型五. Spark SQL CLI交互式命令六. Examples1. running a query from the command line2. setting Hive configuration vari…...
浅谈 React Hooks
React Hooks 是 React 16.8 引入的一组 API,用于在函数组件中使用 state 和其他 React 特性(例如生命周期方法、context 等)。Hooks 通过简洁的函数接口,解决了状态与 UI 的高度解耦,通过函数式编程范式实现更灵活 Rea…...
<6>-MySQL表的增删查改
目录 一,create(创建表) 二,retrieve(查询表) 1,select列 2,where条件 三,update(更新表) 四,delete(删除表…...

基于uniapp+WebSocket实现聊天对话、消息监听、消息推送、聊天室等功能,多端兼容
基于 UniApp + WebSocket实现多端兼容的实时通讯系统,涵盖WebSocket连接建立、消息收发机制、多端兼容性配置、消息实时监听等功能,适配微信小程序、H5、Android、iOS等终端 目录 技术选型分析WebSocket协议优势UniApp跨平台特性WebSocket 基础实现连接管理消息收发连接…...

基于Flask实现的医疗保险欺诈识别监测模型
基于Flask实现的医疗保险欺诈识别监测模型 项目截图 项目简介 社会医疗保险是国家通过立法形式强制实施,由雇主和个人按一定比例缴纳保险费,建立社会医疗保险基金,支付雇员医疗费用的一种医疗保险制度, 它是促进社会文明和进步的…...

《基于Apache Flink的流处理》笔记
思维导图 1-3 章 4-7章 8-11 章 参考资料 源码: https://github.com/streaming-with-flink 博客 https://flink.apache.org/bloghttps://www.ververica.com/blog 聚会及会议 https://flink-forward.orghttps://www.meetup.com/topics/apache-flink https://n…...

技术栈RabbitMq的介绍和使用
目录 1. 什么是消息队列?2. 消息队列的优点3. RabbitMQ 消息队列概述4. RabbitMQ 安装5. Exchange 四种类型5.1 direct 精准匹配5.2 fanout 广播5.3 topic 正则匹配 6. RabbitMQ 队列模式6.1 简单队列模式6.2 工作队列模式6.3 发布/订阅模式6.4 路由模式6.5 主题模式…...
scikit-learn机器学习
# 同时添加如下代码, 这样每次环境(kernel)启动的时候只要运行下方代码即可: # Also add the following code, # so that every time the environment (kernel) starts, # just run the following code: import sys sys.path.append(/home/aistudio/external-libraries)机…...

HubSpot推出与ChatGPT的深度集成引发兴奋与担忧
上周三,HubSpot宣布已构建与ChatGPT的深度集成,这一消息在HubSpot用户和营销技术观察者中引发了极大的兴奋,但同时也存在一些关于数据安全的担忧。 许多网络声音声称,这对SaaS应用程序和人工智能而言是一场范式转变。 但向任何技…...

Elastic 获得 AWS 教育 ISV 合作伙伴资质,进一步增强教育解决方案产品组合
作者:来自 Elastic Udayasimha Theepireddy (Uday), Brian Bergholm, Marianna Jonsdottir 通过搜索 AI 和云创新推动教育领域的数字化转型。 我们非常高兴地宣布,Elastic 已获得 AWS 教育 ISV 合作伙伴资质。这一重要认证表明,Elastic 作为 …...

GraphQL 实战篇:Apollo Client 配置与缓存
GraphQL 实战篇:Apollo Client 配置与缓存 上一篇:GraphQL 入门篇:基础查询语法 依旧和上一篇的笔记一样,主实操,没啥过多的细节讲解,代码具体在: https://github.com/GoldenaArcher/graphql…...