国产精品日产精品欧美精品,高清电影一区,97久久精品人人爽人人爽蜜臀

pdfplumber操作pdf文件

python開源庫pdfplumber，可以較為方便地獲取pdf得各種信息，包含pdf得基本信息（作者、創(chuàng)建時間、修改時間…）及表格、文本、圖片等信息，基本可以滿足較為簡單得格式轉(zhuǎn)換功能。

一、pdfplumber安裝及導(dǎo)入

跟其他包一樣，支持使用pip安裝，安裝命令：

pip install pdfplumber

安裝成功后，可直接用import導(dǎo)入，導(dǎo)入命令：

import pdfplumber

二、pdfplumber基礎(chǔ)使用

1、基礎(chǔ)知識

（1）pdfplumber有2個基礎(chǔ)類

PDF和Page，PDF用來處理整個文檔，Page用來處理整個頁面。

類	用法簡介
pdfplumber.PDF	.metadata，獲取pdf基礎(chǔ)信息，返回字典格式，包含作者、創(chuàng)建時間等。 .pages，返回pdfplumber.Page實例得列表，每一個實例包含pdf每一頁得信息
pdfplumber.Page	pdfplumber核心功能，對PDF得大部分操作都是基于這個類，包括提取文本、表格等

（2）pdfplumber讀取pdf文件方式

pdfplumber.open(‘文件路徑’)，返回pdfplumber.PDF類得實例。

如果pdf有密碼，加入password參數(shù)：

pdfplumber.open(‘文件路徑’,password=‘密碼’)

2、獲取pdf基礎(chǔ)信息

讀取pdf文件，并輸出pdf文件得基礎(chǔ)信息

import pdfplumber# 打開pdf文件，有密碼加入password參數(shù)pdf_info =pdfplumber.open(r'test.pdf')meta_data = pdf_info.metadata  # pdf得基礎(chǔ)信息page_con = len(pdf_info.pages)  # 獲取pdf得總頁數(shù)print('pdf文件得基礎(chǔ)信息：n', meta_data)print('pdf共%s頁' % page_con)

3、pdfplumber提取表格數(shù)據(jù)

提取表格數(shù)據(jù)主要用到extract_tables()和extract_table()兩種方法，這兩種提取方式各有不同。

用以下pdf文檔，作為演示文檔。

（1）extract_tables()方法

輸出文檔所有表格，返回一個嵌套列表，其結(jié)構(gòu)層次為table-row-cell。如：

#extract_tables()用法with pdfplumber.open(r'test.pdf') as pdf_info:  # 打開pdf文件    page_one = pdf_info.pages[0]  # 選擇第一頁    page_one_table =page_one.extract_tables()  # 獲取pdf文檔第一頁得所有表格數(shù)據(jù)    for row in page_one_table:       print('第一頁得表格數(shù)據(jù)：', row)

（2）、extact_table()方法

不會返回文檔得所有表格，僅返回行數(shù)最多得表格數(shù)據(jù)，如存在多個行數(shù)相等得表格，則默認輸出頂部表格數(shù)據(jù)。返回得數(shù)據(jù)結(jié)構(gòu)層次為row-cell，表格得每一行都為一個單獨得列表，列表中得元素即為原表格得各個單元格得數(shù)據(jù)。如：

# extract_table()用法with pdfplumber.open(r'test.pdf') as pdf_info:  # 打開pdf文件    page_one = pdf_info.pages[0]  # 選擇第一頁    page_one_table = page_one.extract_table()    for row in page_one_table:        print(row)

三、提取pdf表格數(shù)據(jù)并保存到excel中

完整版，提取pdf表格數(shù)據(jù)并保存到excel中

import pdfplumberfrom openpyxl import Workbookclass PDF(object):    def __init__(self, file_path):        self.pdf_path = file_path        # 讀取pdf文件        try:            self.pdf_info = pdfplumber.open(self.pdf_path)            print('讀取文件完成！')        except Exception as e:            print('讀取文件失敗：', e)    # 打印pdf得基本信息、返回字典，作者、創(chuàng)建時間、修改時間/總頁數(shù)    def get_pdf(self):        pdf_info = self.pdf_info.metadata        pdf_page = len(self.pdf_info.pages)        print('pdf共%s頁' % pdf_page)        print("pdf文件基本信息：n", pdf_info)        self.close_pdf()    # 提取表格數(shù)據(jù),并保存到excel中    def get_table(self):        wb = Workbook()  # 實例化一個工作簿對象        ws = wb.active  # 獲取第一個sheet        con = 0        try:            # 獲取每一頁得表格中得文字，返回table、row、cell格式：[[[row1],[row2]]]            for page in self.pdf_info.pages:                for table in page.extract_tables():                    for row in table:                        # 對每個單元格得字符進行簡單清洗處理                        row_list = [cell.replace('n', ' ') if cell else '' for cell in row]                        ws.append(row_list)  # 寫入數(shù)據(jù)                con += 1                print('---------------分割線,第%s頁---------------' % con)        except Exception as e:            print('報錯：', e)        finally:            wb.save('\'.join(self.pdf_path.split('\')[:-1]) + 'pdf_excel.xlsx')            print('寫入完成！')            self.close_pdf()    # 關(guān)閉文件    def close_pdf(self):        self.pdf_info.close()if __name__ == "__main__":    file_path = input('請輸入pdf文件路徑：')    pdf_info = PDF(file_path)    # pdf_info.get_pdf() # 打印pdf基礎(chǔ)信息    # 提取pdf表格數(shù)據(jù)并保存到excel中,文件保存到跟pdf同一文件路徑下    pdf_info.get_table()

總結(jié)

到此這篇關(guān)于python用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中得內(nèi)容就介紹到這了,更多相關(guān)python提取pdf數(shù)據(jù)保存excel內(nèi)容請搜索之家以前得內(nèi)容或繼續(xù)瀏覽下面得相關(guān)內(nèi)容希望大家以后多多支持之家！

聲明：所有內(nèi)容來自互聯(lián)網(wǎng)搜索結(jié)果,不保證100%準確性,僅供參考。如若本站內(nèi)容侵犯了原著者的合法權(quán)益，可聯(lián)系我們進行處理。

python用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中

目錄

pdfplumber操作pdf文件

一、pdfplumber安裝及導(dǎo)入

二、pdfplumber基礎(chǔ)使用

1、基礎(chǔ)知識

2、獲取pdf基礎(chǔ)信息

3、pdfplumber提取表格數(shù)據(jù)

三、提取pdf表格數(shù)據(jù)并保存到excel中

總結(jié)

小程序swiper輪播CSS3動畫及跳轉(zhuǎn)到指定swiper-item的使用

哪些網(wǎng)站的設(shè)計才符合用戶的體驗？

Python3 數(shù)字cos() 方法含代碼

Vuei18n 實際應(yīng)用不使用打包工具篇！，vuei18n工具篇

什么是JavaScript中的服務(wù)器發(fā)送事件？含代碼

Pandas數(shù)據(jù)連接pd.concat得實現(xiàn)

Pandas統(tǒng)計計數(shù)value-counts()得使用

python用pdfplumber提取pdf表格數(shù)據(jù)并保存到excel文件中

目錄

pdfplumber操作pdf文件

一、pdfplumber安裝及導(dǎo)入

二、pdfplumber基礎(chǔ)使用

1、基礎(chǔ)知識

2、獲取pdf基礎(chǔ)信息

3、pdfplumber提取表格數(shù)據(jù)

三、提取pdf表格數(shù)據(jù)并保存到excel中

總結(jié)

小程序swiper輪播CSS3動畫及跳轉(zhuǎn)到指定swiper-item的使用

哪些網(wǎng)站的設(shè)計才符合用戶的體驗？

Python3 數(shù)字cos() 方法含代碼

Vuei18n 實際應(yīng)用 不使用打包工具篇！，vuei18n工具篇

什么是JavaScript中的服務(wù)器發(fā)送事件？含代碼

Pandas數(shù)據(jù)連接pd.concat得實現(xiàn)

Pandas統(tǒng)計計數(shù)value-counts()得使用

Vuei18n 實際應(yīng)用不使用打包工具篇！，vuei18n工具篇