Python实现快速从指定页面PDF中提取文本

Written by

in

文章目录
  • 首先,确保你已经安装了 Python 和 Spire.PDF 的相关库。你可以通过以下命令安装 Spire.PDF: pip install Spire.PDF
  • 有时候,仅提取 PDF 中的某一特定区域的文本更加有效。这可以通过定义一个矩形区域来实现。
  • 通过以上方法,我们可以方便地从 PDF 文档中提取所需的文本信息。Spire.PDF for Python 提供的 API 简洁高效,能够满足多种文本提取需求。不论是从全页提取还是从特定区域提取,在实际工作中都能显著提高效率,尤其对于需要处理大量 PDF 文件的场合,使用此工具将使你事半功倍。 到此这篇关于Python实现快速从指定页面PDF中提取文本的文章就介绍到这了,更多相关Python提取PDF文本内容请搜索风君子博客以前的文章或继续浏览下面的相关文章希望大家以后多多支持风君子博客! 您可能感兴趣的文章: Python使用OCR实现提取扫描PDF的文本 使用Python打造一个专业的PDF文本提取工具 Python实现精准提取 PDF中的文本,表格与图片 Python提取Pdf文件内容的操作方法(表格、文本、图片) 使用Python开发一个PDF文本提取工具 利用Python提取PDF文本的简单方法实例
  • 目录
    • 1. 环境准备
    • 2. 从指定页面提取文本
      • 2.1 代码示例
      • 2.2 代码解析
    • 3. 从指定区域提取文本
      • 3.1 代码示例
      • 3.2 代码解析
    • 结论

      在现代办公环境中,PDF 文件作为一种通用的文档格式被广泛使用。无论是合同、报告还是电子书,很多重要信息都储存于 PDF 文件中。因此,从 PDF 文件中提取文本数据的需求也逐渐增加。本文将为大家介绍如何使用 Spire.PDF for Python 来实现这一功能,具体包括从某一页和从指定区域提取文本。

      首先,确保你已经安装了 Python 和 Spire.PDF 的相关库。你可以通过以下命令安装 Spire.PDF:

      pip install Spire.PDF
      

      以下代码展示了如何从 PDF 文档中的特定页(例如第2页)提取文本:

      from spire.pdf.common import *
      from spire.pdf import *
      
      # 创建一个 PdfDocument 对象
      doc = PdfDocument()
      
      # 加载 PDF 文档
      doc.LoadFromFile('C:/Users/Administrator/Desktop/Terms of service.pdf')
      
      # 创建 PdfTextExtractOptions 对象并启用全文本提取
      extractOptions = PdfTextExtractOptions()
      # 提取所有文本,包括空格
      extractOptions.IsExtractAllText = True
      
      # 获取特定的页面(例如,第2页)
      page = doc.Pages.get_Item(1)
      
      # 创建 PdfTextExtractor 对象
      textExtractor = PdfTextExtractor(page)
      
      # 从页面中提取文本
      text = textExtractor.ExtractText(extractOptions)
      
      # 使用 UTF-8 编码将提取的文本写入文件
      withopen('output/TextOfPage.txt', 'w', encoding='utf-8') as file:
          file.write(text)
      

      • 创建 PdfDocument 对象 :这一步是加载 PDF 文件的第一步。
      • 加载 PDF 文档 :使用指定路径加载你要处理的 PDF 文件。
      • 配置提取选项 :通过设置 IsExtractAllText 为 True,确保提取所有文本,包括空格。
      • 获取特定页面doc.Pages.get_Item(1) 获取的是 PDF 的第二页(索引从0开始)。
      • 创建文本提取器并提取文本 :使用 PdfTextExtractor 对象来提取文本。
      • 将提取的文本保存为文件 :最终将文本内容保存到指定路径的文件中。

      有时候,仅提取 PDF 中的某一特定区域的文本更加有效。这可以通过定义一个矩形区域来实现。

      以下代码将展示如何从 PDF 的指定区域提取文本:

      from spire.pdf.common import *
      from spire.pdf import *
      
      # 创建一个 PdfDocument 对象
      doc = PdfDocument()
      
      # 加载 PDF 文档
      doc.LoadFromFile('C:/Users/Administrator/Desktop/Terms of service.pdf')
      
      # 获取特定的页面(例如,第2页)
      page = doc.Pages.get_Item(1)
      
      # 创建 PdfTextExtractor 对象
      textExtractor = PdfTextExtractor(page)
      
      # 创建 PdfTextExtractOptions 对象
      extractOptions = PdfTextExtractOptions()
      
      # 定义提取的矩形区域
      # RectangleF(left, top, width, height)
      extractOptions.ExtractArea = RectangleF(0.0, 100.0, 890.0, 80.0)
      
      # 从指定区域提取文本,保留空格
      text = textExtractor.ExtractText(extractOptions)
      
      # 使用 UTF-8 编码将提取的文本写入文件
      withopen('output/TextOfRectangle.txt', 'w', encoding='utf-8') as file:
          file.write(text)
      

      • 加载 PDF 文件 :与之前相同,首先加载 PDF 文档。
      • 获取特定页面 :依然使用 doc.Pages.get_Item(1) 来获取第2页。
      • 定义提取区域 :通过 RectangleF 类来定义一个矩形区域,该区域的左上角坐标为 (0, 100),宽度为 890,高度为 80
      • 执行文本提取 :然后使用 ExtractText 方法从指定区域提取文本。
      • 保存文本 :最后,提取的文本同样保存为 UTF-8 编码的文件。

      通过以上方法,我们可以方便地从 PDF 文档中提取所需的文本信息。Spire.PDF for Python 提供的 API 简洁高效,能够满足多种文本提取需求。不论是从全页提取还是从特定区域提取,在实际工作中都能显著提高效率,尤其对于需要处理大量 PDF 文件的场合,使用此工具将使你事半功倍。

      到此这篇关于Python实现快速从指定页面PDF中提取文本的文章就介绍到这了,更多相关Python提取PDF文本内容请搜索风君子博客以前的文章或继续浏览下面的相关文章希望大家以后多多支持风君子博客!

      您可能感兴趣的文章:

      • Python使用OCR实现提取扫描PDF的文本
      • 使用Python打造一个专业的PDF文本提取工具
      • Python实现精准提取 PDF中的文本,表格与图片
      • Python提取Pdf文件内容的操作方法(表格、文本、图片)
      • 使用Python开发一个PDF文本提取工具
      • 利用Python提取PDF文本的简单方法实例

      站内搜索