中文字幕av专区_日韩电影在线播放_精品国产精品久久一区免费式_av在线免费观看网站

溫馨提示×

溫馨提示×

您好,登錄后才能下訂單哦!

密碼登錄×
登錄注冊×
其他方式登錄
點擊 登錄注冊 即表示同意《億速云用戶服務條款》

python如何用pdfplumber提取pdf表格數據并保存到excel文件中

發布時間:2022-07-25 09:24:07 來源:億速云 閱讀:390 作者:栢白 欄目:開發技術

這篇文章主要介紹了python如何用pdfplumber提取pdf表格數據并保存到excel文件中,具有一定借鑒價值,需要的朋友可以參考下。下面就和我一起來看看吧。

目錄
  • pdfplumber操作pdf文件

  • 一、pdfplumber安裝及導入

  • 二、pdfplumber基礎使用

    • 1、基礎知識

    • 2、獲取pdf基礎信息

    • 3、pdfplumber提取表格數據

  • 三、提取pdf表格數據并保存到excel中

    • 總結

      pdfplumber操作pdf文件

      python開源庫pdfplumber,可以較為方便地獲取pdf的各種信息,包含pdf的基本信息(作者、創建時間、修改時間…)及表格、文本、圖片等信息,基本可以滿足較為簡單的格式轉換功能。

      一、pdfplumber安裝及導入

      跟其他包一樣,支持使用pip安裝,安裝命令:

      pip install pdfplumber

      python如何用pdfplumber提取pdf表格數據并保存到excel文件中

      安裝成功后,可直接用import導入,導入命令:

      import pdfplumber

      二、pdfplumber基礎使用

      1、基礎知識

      (1)pdfplumber有2個基礎類

      PDF和Page,PDF用來處理整個文檔,Page用來處理整個頁面。

      用法簡介
      pdfplumber.PDF.metadata,獲取pdf基礎信息,返回字典格式,包含作者、創建時間等。 .pages,返回pdfplumber.Page實例的列表,每一個實例包含pdf每一頁的信息
      pdfplumber.Pagepdfplumber核心功能,對PDF的大部分操作都是基于這個類,包括提取文本、表格等

      (2)pdfplumber讀取pdf文件方式

      pdfplumber.open(‘文件路徑’),返回pdfplumber.PDF類的實例。

      如果pdf有密碼,加入password參數:

      pdfplumber.open(‘文件路徑’,password=‘密碼’)

      2、獲取pdf基礎信息

      讀取pdf文件,并輸出pdf文件的基礎信息

      import pdfplumber
      # 打開pdf文件,有密碼加入password參數
      pdf_info =pdfplumber.open(r'test.pdf')
      meta_data = pdf_info.metadata  # pdf的基礎信息
      page_con = len(pdf_info.pages)  # 獲取pdf的總頁數
      print('pdf文件的基礎信息:\n', meta_data)
      print('pdf共%s頁' % page_con)

      python如何用pdfplumber提取pdf表格數據并保存到excel文件中

      3、pdfplumber提取表格數據

      提取表格數據主要用到extract_tables()和extract_table()兩種方法,這兩種提取方式各有不同。

      用以下pdf文檔,作為演示文檔。

      python如何用pdfplumber提取pdf表格數據并保存到excel文件中

      (1)extract_tables()方法

      輸出文檔所有表格,返回一個嵌套列表,其結構層次為table-row-cell。如:

      #extract_tables()用法
      with pdfplumber.open(r'test.pdf') as pdf_info:  # 打開pdf文件
          page_one = pdf_info.pages[0]  # 選擇第一頁
          page_one_table =page_one.extract_tables()  # 獲取pdf文檔第一頁的所有表格數據
          for row in page_one_table:
             print('第一頁的表格數據:', row)

      python如何用pdfplumber提取pdf表格數據并保存到excel文件中
      (2)、extact_table()方法

      不會返回文檔的所有表格,僅返回行數最多的表格數據,如存在多個行數相等的表格,則默認輸出頂部表格數據。返回的數據結構層次為row-cell,表格的每一行都為一個單獨的列表,列表中的元素即為原表格的各個單元格的數據。如:

      # extract_table()用法
      with pdfplumber.open(r'test.pdf') as pdf_info:  # 打開pdf文件
          page_one = pdf_info.pages[0]  # 選擇第一頁
          page_one_table = page_one.extract_table()
          for row in page_one_table:
              print(row)

      python如何用pdfplumber提取pdf表格數據并保存到excel文件中

      三、提取pdf表格數據并保存到excel中

      完整版,提取pdf表格數據并保存到excel中

      import pdfplumber
      from openpyxl import Workbook
      
      class PDF(object):
          def __init__(self, file_path):
              self.pdf_path = file_path
              # 讀取pdf文件
              try:
                  self.pdf_info = pdfplumber.open(self.pdf_path)
                  print('讀取文件完成!')
              except Exception as e:
                  print('讀取文件失敗:', e)
      
          # 打印pdf的基本信息、返回字典,作者、創建時間、修改時間/總頁數
          def get_pdf(self):
              pdf_info = self.pdf_info.metadata
              pdf_page = len(self.pdf_info.pages)
              print('pdf共%s頁' % pdf_page)
              print("pdf文件基本信息:\n", pdf_info)
              self.close_pdf()
      
          # 提取表格數據,并保存到excel中
          def get_table(self):
              wb = Workbook()  # 實例化一個工作簿對象
              ws = wb.active  # 獲取第一個sheet
              con = 0
              try:
                  # 獲取每一頁的表格中的文字,返回table、row、cell格式:[[[row1],[row2]]]
                  for page in self.pdf_info.pages:
                      for table in page.extract_tables():
                          for row in table:
                              # 對每個單元格的字符進行簡單清洗處理
                              row_list = [cell.replace('\n', ' ') if cell else '' for cell in row]
                              ws.append(row_list)  # 寫入數據
                      con += 1
                      print('---------------分割線,第%s頁---------------' % con)
              except Exception as e:
                  print('報錯:', e)
              finally:
                  wb.save('\\'.join(self.pdf_path.split('\\')[:-1]) + '\pdf_excel.xlsx')
                  print('寫入完成!')
                  self.close_pdf()
      
          # 關閉文件
          def close_pdf(self):
              self.pdf_info.close()
      
      if __name__ == "__main__":
          file_path = input('請輸入pdf文件路徑:')
          pdf_info = PDF(file_path)
          # pdf_info.get_pdf() # 打印pdf基礎信息
          # 提取pdf表格數據并保存到excel中,文件保存到跟pdf同一文件路徑下
          pdf_info.get_table()

      以上就是python如何用pdfplumber提取pdf表格數據并保存到excel文件中的詳細內容了,看完之后是否有所收獲呢?如果想了解更多相關內容,歡迎來億速云行業資訊!

      向AI問一下細節

      免責聲明:本站發布的內容(圖片、視頻和文字)以原創、轉載和分享為主,文章觀點不代表本網站立場,如果涉及侵權請聯系站長郵箱:is@yisu.com進行舉報,并提供相關證據,一經查實,將立刻刪除涉嫌侵權內容。

      AI

      咸丰县| 永寿县| 若尔盖县| 尼勒克县| 曲阳县| 容城县| 江安县| 屯昌县| 北流市| 江西省| 鄄城县| 三江| 喜德县| 泰和县| 育儿| 凯里市| 车致| 丰城市| 连州市| 榆社县| 宁乡县| 吉安市| 河池市| 耒阳市| 西峡县| 奉化市| 翁牛特旗| 邓州市| 怀安县| 敦煌市| 嘉禾县| 大冶市| 灵璧县| 周口市| 漾濞| 施秉县| 南安市| 固原市| 红安县| 景洪市| 襄垣县|