您现在的位置：程式師世界 >> 編程語言 > >> 更多編程語言 >> Python

python提取pdf表格數據並保存到excel中

編輯：Python

pdfplumber操作pdf文件

python開源庫pdfplumber，可以較為方便地獲取pdf的各種信息，包含pdf的基本信息（作者、創建時間、修改時間…）及表格、文本、圖片等信息，基本可以滿足較為簡單的格式轉換功能。
一、pdfplumber安裝及導入
跟其他包一樣，支持使用pip安裝，安裝命令：

pip install pdfplumber

安裝成功後，可直接用import導入，導入命令：

import pdfplumber

二、pdfplumber基礎使用
1、基礎知識
（1）pdfplumber有2個基礎類
PDF和Page，PDF用來處理整個文檔，Page用來處理整個頁面。

類用法簡介pdfplumber.PDF.metadata，獲取pdf基礎信息，返回字典格式，包含作者、創建時間等。 .pages，返回pdfplumber.Page實例的列表，每一個實例包含pdf每一頁的信息pdfplumber.Pagepdfplumber核心功能，對PDF的大部分操作都是基於這個類，包括提取文本、表格等

（2）pdfplumber讀取pdf文件方式

pdfplumber.open(‘文件路徑’)，返回pdfplumber.PDF類的實例。
如果pdf有密碼，加入password參數：
pdfplumber.open(‘文件路徑’,password=‘密碼’)

2、獲取pdf基礎信息

讀取pdf文件，並輸出pdf文件的基礎信息

import pdfplumber
# 打開pdf文件，有密碼加入password參數
pdf_info =pdfplumber.open(r'test.pdf')
meta_data = pdf_info.metadata # pdf的基礎信息
page_con = len(pdf_info.pages) # 獲取pdf的總頁數
print('pdf文件的基礎信息：\n', meta_data)
print('pdf共%s頁' % page_con)

3、pdfplumber提取表格數據
提取表格數據主要用到extract_tables()和extract_table()兩種方法，這兩種提取方式各有不同。
用以下pdf文檔，作為演示文檔。

（1）extract_tables()方法
輸出文檔所有表格，返回一個嵌套列表，其結構層次為table-row-cell。如：

#extract_tables()用法
with pdfplumber.open(r'test.pdf') as pdf_info: # 打開pdf文件
page_one = pdf_info.pages[0] # 選擇第一頁
page_one_table =page_one.extract_tables() # 獲取pdf文檔第一頁的所有表格數據
for row in page_one_table:
print('第一頁的表格數據：', row)

（2）、extact_table()方法

不會返回文檔的所有表格，僅返回行數最多的表格數據，如存在多個行數相等的表格，則默認輸出頂部表格數據。返回的數據結構層次為row-cell，表格的每一行都為一個單獨的列表，列表中的元素即為原表格的各個單元格的數據。如：

# extract_table()用法
with pdfplumber.open(r'test.pdf') as pdf_info: # 打開pdf文件
page_one = pdf_info.pages[0] # 選擇第一頁
page_one_table = page_one.extract_table()
for row in page_one_table:
print(row)

三、提取pdf表格數據並保存到excel中
完整版，提取pdf表格數據並保存到excel中

import pdfplumber
from openpyxl import Workbook
class PDF(object):
def __init__(self, file_path):
self.pdf_path = file_path
# 讀取pdf文件
try:
self.pdf_info = pdfplumber.open(self.pdf_path)
print('讀取文件完成！')
except Exception as e:
print('讀取文件失敗：', e)
# 打印pdf的基本信息、返回字典，作者、創建時間、修改時間/總頁數
def get_pdf(self):
pdf_info = self.pdf_info.metadata
pdf_page = len(self.pdf_info.pages)
print('pdf共%s頁' % pdf_page)
print("pdf文件基本信息：\n", pdf_info)
self.close_pdf()
# 提取表格數據,並保存到excel中
def get_table(self):
wb = Workbook() # 實例化一個工作簿對象
ws = wb.active # 獲取第一個sheet
con = 0
try:
# 獲取每一頁的表格中的文字，返回table、row、cell格式：[[[row1],[row2]]]
for page in self.pdf_info.pages:
for table in page.extract_tables():
for row in table:
# 對每個單元格的字符進行簡單清洗處理
row_list = [cell.replace('\n', ' ') if cell else '' for cell in row]
ws.append(row_list) # 寫入數據
con += 1
print('---------------分割線,第%s頁---------------' % con)
except Exception as e:
print('報錯：', e)
finally:
wb.save('\\'.join(self.pdf_path.split('\\')[:-1]) + '\pdf_excel.xlsx')
print('寫入完成！')
self.close_pdf()
# 關閉文件
def close_pdf(self):
self.pdf_info.close()
if __name__ == "__main__":
file_path = input('請輸入pdf文件路徑：')
pdf_info = PDF(file_path)
# pdf_info.get_pdf() # 打印pdf基礎信息
# 提取pdf表格數據並保存到excel中,文件保存到跟pdf同一文件路徑下
pdf_info.get_table()

-end-