pdf如何用python读取？

09月27日 13:01320人阅读

赵老师 Python编程

python中可以使用pdfminer库来读取PDF文件中的内容。

安装命令：

pip install pdfminer

pip install pdfminer3k

python中读取PDF文件代码：

from urllib.request import urlopen
from pdfminer.pdfinterp import PDFResourceManager, process_pdf
from pdfminer.converter import TextConverter
from pdfminer.layout import LAParams
from io import StringIO
from io import open

def readPDF(pdfFile):
    rsrcmgr = PDFResourceManager()
    retstr = StringIO()
    laparams = LAParams()
    device = TextConverter(rsrcmgr, retstr, laparams=laparams)

    process_pdf(rsrcmgr, device, pdfFile)
    device.close()

    content = retstr.getvalue()
    retstr.close()
    return content

pdfFile = urlopen("http://pythonscraping.com/pages/warandpeace/chapter1.pdf")
outputString = readPDF(pdfFile)
print(outputString)
pdfFile.close()

解析pdf文件用到的类：

PDFParser：从一个文件中获取数据

PDFDocument：保存获取的数据，和PDFParser是相互关联的

PDFPageInterpreter处理页面内容

PDFDevice将其翻译成你需要的格式

PDFResourceManager用于存储共享资源，如字体或图像。

更多Python知识请关注Python自学网

声明:本网站尊重并保护知识产权，根据《信息网络传播权保护条例》，如果用户发布的作品侵犯了您的权利,请联系管理员:wupeng@hqwx.com

来自标签:

如何用 pdf python

职业技能申请领取

您的姓名

您的电话

意向课程

点击领取

环球青藤

官方QQ群

扫描上方二维码或点击一键加群，免费领取大礼包，加群暗号：青藤。一键加群

问答来自

赵老师 Python编程

好评率85% 浏览320次

pdf如何用python读取？

职业技能申请领取

问答来自

免费直播更多

相关问题

pdf如何用python读取？

职业技能申请领取

问答来自

免费直播 更多

相关问题

免费直播更多