Python数据分析神器DuckDB保姆级使用入门指南

Written by

in

文章目录
  • 对于初学者,你可以这样理解 DuckDB: 它是“分析型”的 SQLite:它是一个数据库,但不需要你配置服务器、账号密码。它只是一个文件,或者直接运行在你的内存里。 它是 Excel 的超强替补:Excel 处理几十万行数据就开始吃力,而 DuckDB 可以轻松在普通的笔记本电脑上秒级处理亿级数据。 它是 SQL 的练习场:它支持标准的 SQL 语法,非常适合学习数据库查询。 核心优势: 无服务器(Serverless):pip install 即可使用,无需后台服务。 列式存储(Columnar):专门为分析统计设计,做聚合运算(求和、平均值)比传统数据库快几十倍。 零门槛交互:可以直接用 SQL 语句查询 CSV、Excel、Parquet 文件,甚至可以直接查询 Python 的变量。
  • 开始之前,请确保你的电脑上已经安装了 Python。 安装 DuckDB 打开你的终端(Terminal 或 CMD),输入以下命令: pip install duckdb pandas 注:我们同时安装了 pandas,因为 DuckDB 和 Pandas 配合使用简直是天作之合。
  • 我们将通过四个循序渐进的场景,带你掌握 DuckDB 的核心用法。
  • 在办公场景中,我们经常遇到文件夹里有 2023-01.csv, 2023-02.csv … 2023-12.csv 等一堆格式相同的文件。 使用 Pandas,你需要写循环读取再 concat。 使用 DuckDB,只需要一行代码: # 这里的 list_data/*.csv 是通配符,表示读取该目录下所有 CSV # DuckDB 会自动把它们合并成一张大表进行查询 duckdb.sql(“SELECT * FROM ‘list_data/*.csv’ LIMIT 5”).show()
  • 虽然 DuckDB 很强大,但新手在使用时需要注意以下几点: 单进程锁定:DuckDB 是一个嵌入式数据库(类似 SQLite)。如果你用 Python 代码连接了 my_data.db 且没有关闭连接(.close()),你就不能同时用另一个 Python 脚本或 DBeaver 等工具去连接同一个文件。它不支持多用户同时写入。 解决:确保在代码最后关闭连接,或使用 with duckdb.connect(…) 上下文管理器。 SQL 语法差异:DuckDB 使用的是 PostgreSQL 风格的 SQL 语法。虽然它兼容大部分标准 SQL,但如果你习惯了 MySQL 的某些特有函数,可能需要查阅文档寻找对应写法。 内存管理:虽然 DuckDB 支持“超大内存数据处理”(Out-of-core processing),即数据量超过内存大小时将数据溢出到硬盘,但在处理极大规模数据(如数百 GB)时,仍需注意配置 temp_directory 以免占满 C 盘空间。
  • DuckDB 是 Python 办公自动化领域的一匹黑马。它填补了 Pandas(内存受限)和 传统数据库(部署麻烦)之间的空白。 回顾一下它的核心用法: duckdb.sql("SELECT …"):快速运行 SQL。 FROM 'data.csv':直接查询文件。 FROM df_variable:直接查询 Pandas 变量。 到此这篇关于Python数据分析神器DuckDB保姆级使用入门指南的文章就介绍到这了,更多相关Python DuckDB数据分析内容请搜索风君子博客以前的文章或继续浏览下面的相关文章希望大家以后多多支持风君子博客! 您可能感兴趣的文章: Python进行数据分析的全流程指南 Python数据分析与可视化的全面指南(从数据清洗到图表呈现) Python数据分析中常见统计方法详解 Python中的数据分析详解 Python+pandas数据分析实践总结
  • 目录
    • 1. 什么是 DuckDB?为什么选择它?
    • 2. 环境准备 (Prerequisites)
    • 3. DuckDB 实战指南 (Step-by-Step Guide)
      • 场景一:Hello World —— 第一次运行 SQL
      • 场景二:直接查询 CSV 文件 —— 告别 Excel 卡顿
      • 场景三:DuckDB 与 Pandas 的无缝衔接
      • 场景四:数据持久化 —— 保存你的分析结果
    • 4. 进阶技巧:通配符查询 (Globbing)
      • 5. 常见误区与注意事项 (Common Pitfalls)
        • 6. 总结与资源

          在日常办公和数据分析中,你是否遇到过以下场景:

          • 打开一个几百兆的 CSV 文件,Excel 直接卡死或转圈半小时?
          • 想要对多个表格进行合并统计,VLOOKUP 公式写到手软?
          • 觉得安装 MySQL、PostgreSQL 等大型数据库太麻烦,只想在本地快速处理数据?

          如果你的答案是肯定的,那么 DuckDB 就是为你量身定制的工具。它被誉为“数据分析界的 SQLite”,以安装极其简单、运行速度飞快、直接查询文件而著称。

          本文将带你从零开始,掌握这个 Python 办公自动化领域的“新晋顶流”。

          对于初学者,你可以这样理解 DuckDB:

          • 它是“分析型”的 SQLite:它是一个数据库,但不需要你配置服务器、账号密码。它只是一个文件,或者直接运行在你的内存里。
          • 它是 Excel 的超强替补:Excel 处理几十万行数据就开始吃力,而 DuckDB 可以轻松在普通的笔记本电脑上秒级处理亿级数据。
          • 它是 SQL 的练习场:它支持标准的 SQL 语法,非常适合学习数据库查询。

          核心优势:

          • 无服务器(Serverless)pip install 即可使用,无需后台服务。
          • 列式存储(Columnar):专门为分析统计设计,做聚合运算(求和、平均值)比传统数据库快几十倍。
          • 零门槛交互:可以直接用 SQL 语句查询 CSV、Excel、Parquet 文件,甚至可以直接查询 Python 的变量。

          开始之前,请确保你的电脑上已经安装了 Python。

          安装 DuckDB

          打开你的终端(Terminal 或 CMD),输入以下命令:

          pip install duckdb pandas
          

          注:我们同时安装了 pandas,因为 DuckDB 和 Pandas 配合使用简直是天作之合。

          我们将通过四个循序渐进的场景,带你掌握 DuckDB 的核心用法。

          DuckDB 最酷的地方在于,你不需要先“建库”或“建表”,可以直接对数据进行操作。

          新建一个 Python 文件 demo_basic.py

          import duckdb
          
          # 1. 这是一个内存数据库,程序结束数据就会消失
          # 我们可以直接运行 SQL 语句
          result = duckdb.sql("SELECT 'Hello DuckDB' AS message, 42 AS number")
          
          # 2. 展示结果
          result.show()
          

          运行结果:你会看到一个漂亮的表格打印在终端里。不需要 connect,不需要 cursor,一行代码即可运行。

          假设你有一个销售数据文件 sales.csv。在传统数据库中,你需要先创建表结构,然后导入数据。在 DuckDB 中,你可以直接把文件当成表来查!

          首先,我们用 Python 生成一个模拟的 CSV 文件:

          import pandas as pd
          import numpy as np
          
          # 生成 10万行 模拟数据
          df = pd.DataFrame({
              'product': np.random.choice(['Apple', 'Banana', 'Orange'], 100000),
              'price': np.random.randint(1, 10, 100000),
              'quantity': np.random.randint(1, 5, 100000)
          })
          df.to_csv('sales.csv', index=False)
          print("CSV 文件已生成!")
          

          接下来,使用 DuckDB 直接分析这个 CSV

          import duckdb
          
          # 需求:统计每种水果的总销售额(价格 * 数量),并按销售额降序排列
          # 注意:我们直接在 FROM 后面写文件名!
          query = """
              SELECT 
                  product, 
                  SUM(price * quantity) AS total_revenue 
              FROM 'sales.csv' 
              GROUP BY product 
              ORDER BY total_revenue DESC
          """
          
          duckdb.sql(query).show()
          

          原理解析:DuckDB 能够智能识别 CSV 的表头和数据类型,你不需要定义 Schema,它会自动推断。对于几百兆甚至几个 G 的文件,这种方式比 Excel 快无数倍。

          这是 Python 办公自动化中最强大的功能。如果你已经有一个 Pandas 的 DataFrame 变量,你可以直接用 SQL 查询它,而不需要把数据存入数据库。

          import duckdb
          import pandas as pd
          
          # 假设这是你从 Excel 读取的数据
          df_employee = pd.DataFrame({
              'name': ['Alice', 'Bob', 'Charlie', 'David'],
              'dept': ['HR', 'IT', 'IT', 'HR'],
              'salary': [5000, 8000, 8500, 5200]
          })
          
          # 需求:找出 IT 部门薪资大于 8000 的人
          # 这里的 'df_employee' 是 Python 变量名,DuckDB 能直接识别!
          result = duckdb.sql("""
              SELECT name, salary 
              FROM df_employee 
              WHERE dept = 'IT' AND salary > 8000
          """)
          
          # 将结果转换回 Pandas DataFrame 以便后续处理
          df_result = result.df()
          print(df_result)
          

          为什么这很重要?

          很多初学者觉得 Pandas 的筛选语法(如 df[(df['dept']=='IT') & ...])很难记。使用 DuckDB,你可以直接用你熟悉的 SQL 语句来操作 Pandas 数据。

          默认情况下,DuckDB 是运行在内存里的(In-Memory)。如果你想把处理好的数据保存下来,像 SQLite 一样存成一个数据库文件,也非常简单。

          import duckdb
          
          # 1. 连接到一个具体的数据库文件(如果不存在会自动创建)
          con = duckdb.connect('my_office_data.db')
          
          # 2. 创建一个表并插入数据
          con.sql("CREATE TABLE IF NOT EXISTS users (id INTEGER, name VARCHAR)")
          con.sql("INSERT INTO users VALUES (1, 'Zhang San'), (2, 'Li Si')")
          
          # 3. 查询数据
          con.sql("SELECT * FROM users").show()
          
          # 4. 关闭连接
          con.close()
          

          下次你需要使用数据时,再次 connect('my_office_data.db') 即可。

          在办公场景中,我们经常遇到文件夹里有 2023-01.csv, 2023-02.csv2023-12.csv 等一堆格式相同的文件。

          使用 Pandas,你需要写循环读取再 concat

          使用 DuckDB,只需要一行代码:

          # 这里的 list_data/*.csv 是通配符,表示读取该目录下所有 CSV
          # DuckDB 会自动把它们合并成一张大表进行查询
          duckdb.sql("SELECT * FROM 'list_data/*.csv' LIMIT 5").show()
          

          虽然 DuckDB 很强大,但新手在使用时需要注意以下几点:

          单进程锁定:DuckDB 是一个嵌入式数据库(类似 SQLite)。如果你用 Python 代码连接了 my_data.db 且没有关闭连接(.close()),你就不能同时用另一个 Python 脚本或 DBeaver 等工具去连接同一个文件。它不支持多用户同时写入。

          解决:确保在代码最后关闭连接,或使用 with duckdb.connect(...) 上下文管理器。

          SQL 语法差异:DuckDB 使用的是 PostgreSQL 风格的 SQL 语法。虽然它兼容大部分标准 SQL,但如果你习惯了 MySQL 的某些特有函数,可能需要查阅文档寻找对应写法。

          内存管理:虽然 DuckDB 支持“超大内存数据处理”(Out-of-core processing),即数据量超过内存大小时将数据溢出到硬盘,但在处理极大规模数据(如数百 GB)时,仍需注意配置 temp_directory 以免占满 C 盘空间。

          DuckDB 是 Python 办公自动化领域的一匹黑马。它填补了 Pandas(内存受限)和 传统数据库(部署麻烦)之间的空白。

          回顾一下它的核心用法:

          • duckdb.sql("SELECT ..."):快速运行 SQL。
          • FROM 'data.csv':直接查询文件。
          • FROM df_variable:直接查询 Pandas 变量。

          到此这篇关于Python数据分析神器DuckDB保姆级使用入门指南的文章就介绍到这了,更多相关Python DuckDB数据分析内容请搜索风君子博客以前的文章或继续浏览下面的相关文章希望大家以后多多支持风君子博客!

          您可能感兴趣的文章:

          • Python进行数据分析的全流程指南
          • Python数据分析与可视化的全面指南(从数据清洗到图表呈现)
          • Python数据分析中常见统计方法详解
          • Python中的数据分析详解
          • Python+pandas数据分析实践总结

          站内搜索