Python实现将PDF转DOCX的超简单教程(附源码)

Written by

in

文章目录
  • 使用 pdf2docx 库前,需要安装它: pip install pdf2docx 如果你使用的是国内源(推荐): pip install pdf2docx -i https://pypi.tuna.tsinghua.edu.cn/simple 安装完成后即可使用。
  • 下面是一段直接可运行的示例代码,仅需三步即可完成 PDF → Word: from pdf2docx import Converter pdf_file = “1.pdf” docx_file = “2.docx” # 创建转换器对象 cv = Converter(pdf_file) # 执行转换 cv.convert(docx_file, start=0, end=None) # 关闭转换器 cv.close() print(“转换完成!”) 代码说明 pdf_file:要转换的 PDF 文件路径 docx_file:需要输出的 Word 文件路径 cv.convert(): start=0 表示从第一页开始 end=None 表示转换到最后一页 转换完成后需要执行 cv.close() 释放资源
  • 运行后将在当前目录生成一个 2.docx 文件,格式尽可能保持与原 PDF 一致,非常适合文字类文档。
  • PDF 转换后格式不完美 这是 PDF → Word 转换的常见问题,尤其是复杂排版或扫描件。 你可以尝试: 使用 ocrmypdf 处理扫描件 提升 PDF 清晰度 使用 Adobe Acrobat 或 WPS 的转换功能对比效果
  • Python使用pdf2docx和os模块实现批量将PDF转Word文档 注意事项: 1、PDF文档的后缀务必是“.pdf”,否则转换不成功 2、大部分的PDF文档都可用这个程序来转换,如果是图片生成的Pdf文档,则转换不成功,原因是要将图片里的文字转换成文档涉及到人工智能的知识,它已超出这个程序的能力范围。但也不用慌,遇到此情况,可以用QQ的文件助手来帮忙,此处不赘述。 完整代码: import os from pdf2docx import Converter def pdf_docx(): # 获取当前工作目录 file_path = r’C:Userstest’ # 遍历所有文件 for file in os.listdir(file_path): # 获取文件后缀 suff_name = os.path.splitext(file)[1] # 过滤非pdf格式文件 if suff_name != ‘.pdf’: continue # 获取文件名称 file_name = os.path.splitext(file)[0] # pdf文件名称 pdf_name = file_path + ‘\’ + file # 要转换的docx文件名称 docx_name = file_path + ‘\’ + file_name + ‘.docx’ # 加载pdf文档 cv = Converter(pdf_name) cv.convert(docx_name) cv.close() if __name__ == ‘__main__’: pdf_docx() Python使用pdf2docx模块实现PDF到Word的批量转换 以下是一个可以批量将 PDF 文件转换为 Word 文档的 Python 代码示例,代码实现了遍历指定文件夹下的所有 PDF 文件,并逐个进行转换的功能: import os from pdf2docx import Converter def pdf_to_docx(pdf_folder, docx_folder): “”” 将指定文件夹下的PDF文件批量转换为Word文档 :param pdf_folder: PDF文件所在文件夹路径 :param docx_folder: 转换后Word文档存放的文件夹路径 “”” # 检查目标文件夹是否存在,不存在则创建 if not os.path.exists(docx_folder): os.makedirs(docx_folder) # 遍历PDF文件夹下的所有文件 for file in os.listdir(pdf_folder): if file.endswith(‘.pdf’): pdf_file_path = os.path.join(pdf_folder, file) docx_file_path = os.path.join(docx_folder, os.path.splitext(file)[0] + ‘.docx’) try: # 创建Converter对象开始转换 cv = Converter(pdf_file_path) cv.convert(docx_file_path) cv.close() print(f”{pdf_file_path} 已成功转换为 {docx_file_path}”) except Exception as e: print(f”转换 {pdf_file_path} 时出现错误: {e}”) if __name__ == “__main__”: # 指定PDF文件所在文件夹路径 pdf_folder_path = r’C:Usersexamplepdfs’ # 指定转换后Word文档存放的文件夹路径 docx_folder_path = r’C:Usersexampledocxs’ pdf_to_docx(pdf_folder_path, docx_folder_path) 代码解析 函数定义部分:定义了pdf_to_docx函数,它接受两个参数,pdf_folder表示存放 PDF 文件的文件夹路径,docx_folder表示转换后要存放 Word 文档的文件夹路径。在函数内部,首先检查docx_folder是否存在,如果不存在就创建该文件夹,用于确保后续能正常存放转换后的文件。 文件遍历与转换部分:通过os.listdir函数遍历pdf_folder下的所有文件,对于以.pdf结尾的文件,先拼接出其完整路径(pdf_file_path),再根据文件名(去除.pdf后缀后)拼接出转换后 Word 文档的路径(docx_file_path)。接着使用Converter类创建对象并调用convert方法进行转换,转换完成后关闭对象。如果在转换过程中出现任何异常,会通过try-except语句捕获并打印出错误信息。 主程序部分:在if __name__ == "__main__"语句块中,指定了实际的pdf_folder_path(存放 PDF 文件的文件夹路径)和docx_folder_path(存放 Word 文档的文件夹路径),然后调用pdf_to_docx函数开始批量转换操作。
  • 只需十几行代码,就可以实现 PDF 文件转 Word,适合批量处理、自动化任务等场景。 如果你想继续学习 PDF 操作 / Word 处理 / Python 文档自动化 也欢迎继续关注! 到此这篇关于Python实现将PDF转DOCX的超简单教程(附源码)的文章就介绍到这了,更多相关Python PDF转DOCX内容请搜索风君子博客以前的文章或继续浏览下面的相关文章希望大家以后多多支持风君子博客! 您可能感兴趣的文章: 使用Python进行一键整理文件,自动分类DOCX与PDF Python实用工具之实现PDF转DOCX文档 基于pdf2docx模块Python实现批量将PDF转Word文档的完整代码教程 Python实现PDF扫描件生成DOCX或EXCEL功能 python3如何将docx转换成pdf文件 基于Python开发PDF转Doc格式小程序 Python实现将doc转化pdf格式文档的方法
  • 目录
    • 一、环境准备
    • 二、PDF 转 DOCX 完整示例代码
    • 三、运行效果
    • 四、常见问题
    • 五、方法补充
    • 六、总结

    在日常工作中,我们经常需要将 PDF 文件转换为 Word(.docx) 方便编辑。今天分享一个非常简单、实用的 Python 工具 —— pdf2docx,仅需几行代码就能完成转换!

    使用 pdf2docx 库前,需要安装它:

    pip install pdf2docx
    

    如果你使用的是国内源(推荐):

    pip install pdf2docx -i https://pypi.tuna.tsinghua.edu.cn/simple
    

    安装完成后即可使用。

    下面是一段直接可运行的示例代码,仅需三步即可完成 PDF → Word:

    from pdf2docx import Converter
    
    pdf_file = "1.pdf"
    docx_file = "2.docx"
    
    # 创建转换器对象
    cv = Converter(pdf_file)
    
    # 执行转换
    cv.convert(docx_file, start=0, end=None)
    
    # 关闭转换器
    cv.close()
    
    print("转换完成!")
    

    代码说明

    pdf_file:要转换的 PDF 文件路径

    docx_file:需要输出的 Word 文件路径

    cv.convert()

    • start=0 表示从第一页开始
    • end=None 表示转换到最后一页

    转换完成后需要执行 cv.close() 释放资源

    运行后将在当前目录生成一个 2.docx 文件,格式尽可能保持与原 PDF 一致,非常适合文字类文档。

    PDF 转换后格式不完美

    这是 PDF → Word 转换的常见问题,尤其是复杂排版或扫描件。

    你可以尝试:

    • 使用 ocrmypdf 处理扫描件
    • 提升 PDF 清晰度
    • 使用 Adobe Acrobat 或 WPS 的转换功能对比效果

    Python使用pdf2docx和os模块实现批量将PDF转Word文档

    注意事项:

    1、PDF文档的后缀务必是“.pdf”,否则转换不成功

    2、大部分的PDF文档都可用这个程序来转换,如果是图片生成的Pdf文档,则转换不成功,原因是要将图片里的文字转换成文档涉及到人工智能的知识,它已超出这个程序的能力范围。但也不用慌,遇到此情况,可以用QQ的文件助手来帮忙,此处不赘述。

    完整代码:

    import os
    from pdf2docx import Converter
    
    
    def pdf_docx():
        # 获取当前工作目录
        file_path = r'C:Userstest'
        # 遍历所有文件
        for file in os.listdir(file_path):
            # 获取文件后缀
            suff_name = os.path.splitext(file)[1]
            # 过滤非pdf格式文件
            if suff_name != '.pdf':
                continue
            # 获取文件名称
            file_name = os.path.splitext(file)[0]
            # pdf文件名称
            pdf_name = file_path + '\' + file
            # 要转换的docx文件名称
            docx_name = file_path + '\' + file_name + '.docx'
            # 加载pdf文档
            cv = Converter(pdf_name)
            cv.convert(docx_name)
            cv.close()
    
    
    if __name__ == '__main__':
        pdf_docx()
    

    Python使用pdf2docx模块实现PDF到Word的批量转换

    以下是一个可以批量将 PDF 文件转换为 Word 文档的 Python 代码示例,代码实现了遍历指定文件夹下的所有 PDF 文件,并逐个进行转换的功能:

    import os
    from pdf2docx import Converter
     
    def pdf_to_docx(pdf_folder, docx_folder):
        """
        将指定文件夹下的PDF文件批量转换为Word文档
        :param pdf_folder: PDF文件所在文件夹路径
        :param docx_folder: 转换后Word文档存放的文件夹路径
        """
        # 检查目标文件夹是否存在,不存在则创建
        if not os.path.exists(docx_folder):
            os.makedirs(docx_folder)
     
        # 遍历PDF文件夹下的所有文件
        for file in os.listdir(pdf_folder):
            if file.endswith('.pdf'):
                pdf_file_path = os.path.join(pdf_folder, file)
                docx_file_path = os.path.join(docx_folder, os.path.splitext(file)[0] + '.docx')
                try:
                    # 创建Converter对象开始转换
                    cv = Converter(pdf_file_path)
                    cv.convert(docx_file_path)
                    cv.close()
                    print(f"{pdf_file_path} 已成功转换为 {docx_file_path}")
                except Exception as e:
                    print(f"转换 {pdf_file_path} 时出现错误: {e}")
     
    if __name__ == "__main__":
        # 指定PDF文件所在文件夹路径
        pdf_folder_path = r'C:Usersexamplepdfs'
        # 指定转换后Word文档存放的文件夹路径
        docx_folder_path = r'C:Usersexampledocxs'
        pdf_to_docx(pdf_folder_path, docx_folder_path)

    代码解析

    函数定义部分:定义了pdf_to_docx函数,它接受两个参数,pdf_folder表示存放 PDF 文件的文件夹路径,docx_folder表示转换后要存放 Word 文档的文件夹路径。在函数内部,首先检查docx_folder是否存在,如果不存在就创建该文件夹,用于确保后续能正常存放转换后的文件。

    文件遍历与转换部分:通过os.listdir函数遍历pdf_folder下的所有文件,对于以.pdf结尾的文件,先拼接出其完整路径(pdf_file_path),再根据文件名(去除.pdf后缀后)拼接出转换后 Word 文档的路径(docx_file_path)。接着使用Converter类创建对象并调用convert方法进行转换,转换完成后关闭对象。如果在转换过程中出现任何异常,会通过try-except语句捕获并打印出错误信息。

    主程序部分:在if __name__ == "__main__"语句块中,指定了实际的pdf_folder_path(存放 PDF 文件的文件夹路径)和docx_folder_path(存放 Word 文档的文件夹路径),然后调用pdf_to_docx函数开始批量转换操作。

    只需十几行代码,就可以实现 PDF 文件转 Word,适合批量处理、自动化任务等场景。

    如果你想继续学习 PDF 操作 / Word 处理 / Python 文档自动化 也欢迎继续关注!

    到此这篇关于Python实现将PDF转DOCX的超简单教程(附源码)的文章就介绍到这了,更多相关Python PDF转DOCX内容请搜索风君子博客以前的文章或继续浏览下面的相关文章希望大家以后多多支持风君子博客!

    您可能感兴趣的文章:

    • 使用Python进行一键整理文件,自动分类DOCX与PDF
    • Python实用工具之实现PDF转DOCX文档
    • 基于pdf2docx模块Python实现批量将PDF转Word文档的完整代码教程
    • Python实现PDF扫描件生成DOCX或EXCEL功能
    • python3如何将docx转换成pdf文件
    • 基于Python开发PDF转Doc格式小程序
    • Python实现将doc转化pdf格式文档的方法

    站内搜索