超全总结！聊聊 python 操作PDF的几种方法-益强资讯全景

数据库: 超全总结！聊聊 python 操作PDF的几种方法
时间：2010-12-5 17:23:32  作者：应用开发   来源：IT科技  查看：  评论：0
内容摘要：一、前言大家好，有关Python操作PDF的案例之前已经写过一个PDF批量合并，这个案例初衷只是给大家提供一个便利的脚本，并没有太多讲解原理,其中涉及的就是PDF处理很实用的模块PyPDF2，本文就好
  一、超全操作前言
大家好，总结种方有关Python操作PDF的聊聊案例之前已经写过一个PDF批量合并，这个案例初衷只是超全操作给大家提供一个便利的脚本，并没有太多讲解原理,总结种方其中涉及的就是PDF处理很实用的模块PyPDF2，本文就好好剖析一下这个模块，聊聊主要将涉及
os 模块综合应用 glob 模块综合应用 PyPDF2 模块操作
二、超全操作基本操作
PyPDF2 导入模块的总结种方代码常常是：
from PyPDF2 import PdfFileReader, PdfFileWriter
这里导入了两个方法：
PdfFileReader 可以理解为读取器 PdfFileWriter可以理解为写入器
接下来通过几个案例进一步认识这两个工具的奇妙之处，用到的聊聊示例文件是5个发票的pdf
每个发票的PDF都由两页组成：
三、合并
第一个工作是超全操作将5个发票pdf合并成10页。这里读取器和写入器应该怎么配合呢？总结种方
逻辑如下：
读取器将所有pdf读取一遍读取器将读取的内容交给写入器写入器统一输出到一个新pdf
这里还有一个重要的知识点：读取器只能将读取的内容一页一页交给写入器。
因此，聊聊逻辑中第1步和第2步实际上不是超全操作彼此独立的步骤，而是总结种方读取器读取完一个pdf后，云服务器就将这个pdf全部页循环一遍，聊聊挨页交给写入器。最后等读取工作全部结束后再输出。
看一下代码可以让思路更清楚：
from PyPDF2 import PdfFileReader, PdfFileWriter path = rC:\Users\xxxxxx pdf_writer = PdfFileWriter()for i in range(1, 6):     pdf_reader = PdfFileReader(path + /INV{ }.pdf.format(i))     for page in range(pdf_reader.getNumPages()):         pdf_writer.addPage(pdf_reader.getPage(page))with open(path + r\合并PDF\merge.pdf, wb) as out:     pdf_writer.write(out)
由于全部内容都需要交给同一个写入器最后一起输出，所以写入器的初始化一定是在循环体之外的.
如果在循环体内则会变成每次访问读取一个pdf就生成一个新的写入器，这样每一个读取器交给写入器的内容就会被反复覆盖，无法实现我们的合并需求!
循环体开头的代码：
for i in range(1, 6):     pdf_reader = PdfFileReader(path + /INV{ }.pdf.format(i))
目的就是每次循环读取一个新的pdf文件交给读取器进行后续操作。实际上这种写法不是很提倡，由于各pdf命名恰好很规则，所以可以直接人为指定数字进行循环。更好的方法是用 glob 模块：
import glob for file in glob.glob(path + /*.pdf):     pdf_reader = PdfFileReader(path)
代码中 pdf_reader.getNumPages(): 能够获取读取器的页数，配合range就能遍历读取器的所有页。
pdf_writer.addPage(pdf_reader.getPage(page))能够将当前页交给写入器。
最后，用with新建一个pdf并由写入器的 pdf_writer.write(out)方法输出即可
四、拆分
如果明白了合并操作中读取器和写入器的配合，亿华云那么拆分就很好理解了，这里我们以拆分INV1.pdf为2个单独的pdf文档为例，同样也先来捋一捋逻辑：
读取器读取PDF文档读取器一页一页交给写入器写入器每获取一页就立即输出
通过这个代码逻辑我们也可以明白，写入器初始化和输出的位置一定都在读取PDF循环每一页的循环体内，而不是在循环体外
代码很简单：
from PyPDF2 import PdfFileReader, PdfFileWriter path = rC:\Users\xxx pdf_reader = PdfFileReader(path + \INV1.pdf) for page in range(pdf_reader.getNumPages()):     # 遍历到每一页挨个生成写入器     pdf_writer = PdfFileWriter()     pdf_writer.addPage(pdf_reader.getPage(page))     # 写入器被添加一页后立即输出产生pdf     with open(path + \INV1-{ }.pdf.format(page + 1), wb) as out:         pdf_writer.write(out)
五、水印
本次的工作是将下图作为水印添加到INV1.pdf中
首先是准备工作，将需要作为水印的图片插入word中调整合适位置后保存为PDF文件。然后就可以码代码了，需要额外用到copy模块，具体解释见下图：
就是把读取器和写入器初始化，并且把水印PDF页先读取好备用,核心代码稍微比较难理解：
加水印本质上就是把水印PDF页和需要加水印的每一页都合并一遍
由于需要加水印的PDF可能有很多页，而水印PDF只有一页，因此如果直接把水印PDF拿来合并，可以抽象理解成加完第一页，水印PDF页就没有了。
因此不能直接拿来合并，而要把水印PDF页不断copy出来成新的一页备用new_page，再运用.mergePage方法完成跟每一页合并，把合并后的页交给写入器待最后统一输出!
关于.mergePage的服务器租用使用：出现在下面的页.mergePage(出现在上面的页)，最后效果如图：
六、加密
加密很简单，只需要记住：「加密是针对写入器加密」
因此只需要在相关操作完成后调用pdf_writer.encrypt(密码)
以单个PDF的加密为例：
写在最后
当然除了对PDF的合并、拆分、加密、水印，我们还可以使用Python结合Excel和Word实现更多的自动化需求，这些就留给读者自己开发。
最后还是希望大家能够理解Python办公自动化的一个核心就是批量操作-解放双手，让复杂的工作自动化！
公司在注册域名时还需要确保邮箱的安全性。如果邮箱不安全，它只会受到攻击。攻击者可以直接在邮箱中重置密码并攻击用户。因此，有必要注意邮箱的安全性。

最近更新

2025-10-05 09:52:14
换新域名(重新来过)
2025-10-05 09:52:14
你应该知道的5个Swift组合变换操作符
2025-10-05 09:52:14
你在编程的时候浪费了多少时间？
2025-10-05 09:52:14
在Ubuntu下搭建ASP.NET 5开发环境
2025-10-05 09:52:14
ICANN 规章禁止转移已经被记录或者在60天前内转移的域名。
2025-10-05 09:52:14
Java异常的深入研究与分析
2025-10-05 09:52:14
MyBatis版本升级引发的线上告警回顾及原理分析
2025-10-05 09:52:14
Web端PHP代码函数覆盖率测试解决方案

热门排行

2025-10-05 09:52:14
(4) 使用何种形式的域名后缀对网页搜索影响不大，但域名后缀也需要考虑方便用户记忆
2025-10-05 09:52:14
WOT2016吴兆松：Zabbix监控自动化的未来如何发展
2025-10-05 09:52:14
项目经验不重样！3个基于 SpringBoot 的图片识别处理系统送给你！
2025-10-05 09:52:14
Cocos沙龙走进印度：成知名游戏工作“御用神器”
2025-10-05 09:52:14
域后缀首选.com，.net，然后是.cn。后缀选择不当，导致流量损失。域名是企业与互联网网址之间的链接，关键是企业在网络上存在的标志。因此，选择好域名是开展网上工作的首要重要条件。
2025-10-05 09:52:14
学C语言好还是Python好？
2025-10-05 09:52:14
Python 为什么会有个奇怪的“...”对象？
2025-10-05 09:52:14
为了更好的代码：12个Python小窍门

友情链接