文章目录
- 举个简单的例子,假设你有一个文本文件 example.txt,你想查找包含特定模式的行。 你可以使用 grep: grep ‘pattern’ example.txt 如果你想对文本进行替换,可以用 sed: sed ‘s/old_pattern/new_pattern/g’ example.txt 对于更复杂的文本处理,例如统计、格式化,你可以用 awk: awk ‘/pattern/ {print $0}’ example.txt
- 1)grep: grep 是最基础的文本搜索工具,它支持基本和扩展的正则表达式。 例子: 查找包含数字的行: grep ‘[0-9]’ example.txt 忽略大小写查找:grep -i ‘pattern’ example.txt 查找并显示行号:grep -n ‘pattern’ example.txt 递归查找:grep -r ‘pattern’ /path/to/directory 2)sed: sed 是一个流编辑器,用于对文本进行筛选和替换。 例子: 替换文件中第一次出现的匹配:sed ‘s/pattern/replacement/’ example.txt 替换整个文件中的所有匹配:sed ‘s/pattern/replacement/g’ example.txt 删除包含特定模式的行:sed ‘/pattern/d’ example.txt 在特定模式后添加文本:sed ‘/pattern/anew text’ example.txt 3)awk: awk 是一个强大的文本处理工具,适用于格式化报告和统计分析。 例子: 查找并打印匹配的行:awk ‘/pattern/ {print $0}’ example.txt 分隔特定字段并打印:awk -F: ‘{print $1}’ example.txt(假设文件以冒号分隔) 统计出现次数:awk ‘/pattern/ {count++} END {print count}’ example.txt 进阶内容 1)复杂模式匹配 使用扩展正则表达式:通过添加 -E 参数,你可以让 grep 使用扩展正则:grep -E ‘pattern1|pattern2’ example.txt。同理,你也可以在 sed 中使用扩展正则:sed -E ‘s/old_pattern(new_pattern)/replacement/g’ example.txt 2)结合工具使用 你可以将这几个工具组合使用,以实现更复杂的文本处理任务。例如,先用 grep 筛选,再用 awk 处理: grep ‘pattern’ example.txt | awk ‘{print $1}’
- 一、核心处理方式 原生Bash正则匹配 if [[ “string” =~ ^regex_pattern$ ]]; then echo “匹配成功” echo “捕获组:${BASH_REMATCH[1]}” fi 高级参数扩展 var=”2024-07-25_log.txt” echo ${var//[^0-9]/} # 删除非数字字符 → 20240725 echo ${var/#*_/} # 去除前缀保留文件名 → log.txt 二、常用工具链 工具 能力范围 典型用例 grep 模式搜索过滤 `grep -E 'error sed 流式编辑替换 sed -E ‘s/(d{4})-(d{2})/2/1/g’ awk 结构化字段处理 awk ‘/GET/ && $9==200 {print $7}’ log perl PCRE高级正则 perl -pe ‘s/bd+b/NUM/g’ 三、正则表达式类型 # 基础正则(BRE) grep ‘^From: .*@ctc.com$’ emails.txt # 扩展正则(ERE) grep -E ‘[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+.[A-Z]{2,4}’ contacts.txt # Perl兼容正则(PCRE) grep -P ‘d{4}-d{2}-d{2}Td{2}:d{2}Z’ timestamps.log 四、实战案例 日志分析 # 提取HTTP状态码非200的请求 tail -f access.log | awk ‘match($0, /HTTP/1.1″ ([0-9]{3})/, arr) && arr[1] != 200’ 数据清洗 # 标准化电话号码格式 sed -E ‘s/(+86)?[ ]*([0-9]{3})-?([0-9]{4})-?([0-9]{4})/1 2-3-4/’ contacts.csv 安全检测 # 检测SQL注入特征 grep -P ‘(unions+select|sleep(d+)|benchmark(|b(and|or)b.+=[^'”‘”‘]*[“‘”‘”]s*[“‘”‘”])’ web_logs 五、性能优化建议 优先使用原生Bash操作避免子进程开销 复杂匹配使用预编译正则(如awk/perl) 大文件处理时结合LC_ALL=C提升ASCII处理速度 避免贪婪匹配.*改用精准限定符 六、调试技巧 # 可视化匹配过程 grep –color=auto -nE ‘pattern’ file # 测试正则表达式 pcre2test # 专用测试工具
目录
- 前言
- 1.1 示例
- 1.2 知识扩展
- 1.3 实践指南
- 总结
在 Bash 脚本中,可以使用正则表达式来进行文本处理,最常用的工具是 grep、sed 和 awk。
举个简单的例子,假设你有一个文本文件 example.txt,你想查找包含特定模式的行。
你可以使用 grep:
grep 'pattern' example.txt
如果你想对文本进行替换,可以用 sed:
sed 's/old_pattern/new_pattern/g' example.txt
对于更复杂的文本处理,例如统计、格式化,你可以用 awk:
awk '/pattern/ {print $0}' example.txt
1)grep:
grep 是最基础的文本搜索工具,它支持基本和扩展的正则表达式。
例子:
- 查找包含数字的行: grep ‘[0-9]’ example.txt
- 忽略大小写查找:grep -i ‘pattern’ example.txt
- 查找并显示行号:grep -n ‘pattern’ example.txt
- 递归查找:grep -r ‘pattern’ /path/to/directory
2)sed:
sed 是一个流编辑器,用于对文本进行筛选和替换。
例子:
- 替换文件中第一次出现的匹配:sed ‘s/pattern/replacement/’ example.txt
- 替换整个文件中的所有匹配:sed ‘s/pattern/replacement/g’ example.txt
- 删除包含特定模式的行:sed ‘/pattern/d’ example.txt
- 在特定模式后添加文本:sed ‘/pattern/anew text’ example.txt
3)awk:
awk 是一个强大的文本处理工具,适用于格式化报告和统计分析。
例子:
- 查找并打印匹配的行:awk ‘/pattern/ {print $0}’ example.txt
- 分隔特定字段并打印:awk -F: ‘{print $1}’ example.txt(假设文件以冒号分隔)
- 统计出现次数:awk ‘/pattern/ {count++} END {print count}’ example.txt
进阶内容
1)复杂模式匹配
使用扩展正则表达式:通过添加 -E 参数,你可以让 grep 使用扩展正则:grep -E ‘pattern1|pattern2’ example.txt。
同理,你也可以在 sed 中使用扩展正则:sed -E ‘s/old_pattern(new_pattern)/replacement/g’ example.txt
2)结合工具使用
你可以将这几个工具组合使用,以实现更复杂的文本处理任务。例如,先用 grep 筛选,再用 awk 处理:
grep 'pattern' example.txt | awk '{print $1}'
一、核心处理方式
- 原生Bash正则匹配
if [[ "string" =~ ^regex_pattern$ ]]; then
echo "匹配成功"
echo "捕获组:${BASH_REMATCH[1]}"
fi
- 高级参数扩展
var="2024-07-25_log.txt"
echo ${var//[^0-9]/} # 删除非数字字符 → 20240725
echo ${var/#*_/} # 去除前缀保留文件名 → log.txt
二、常用工具链
| 工具 | 能力范围 | 典型用例 |
|---|---|---|
| grep | 模式搜索过滤 | `grep -E 'error |
| sed | 流式编辑替换 | sed -E ‘s/(d{4})-(d{2})/2/1/g’ |
| awk | 结构化字段处理 | awk ‘/GET/ && $9==200 {print $7}’ log |
| perl | PCRE高级正则 | perl -pe ‘s/bd+b/NUM/g’ |
三、正则表达式类型
# 基础正则(BRE)
grep '^From: .*@ctc.com$' emails.txt
# 扩展正则(ERE)
grep -E '[A-Za-z0-9._%+-]+@[A-Za-z0-9.-]+.[A-Z]{2,4}' contacts.txt
# Perl兼容正则(PCRE)
grep -P 'd{4}-d{2}-d{2}Td{2}:d{2}Z' timestamps.log
四、实战案例
- 日志分析
# 提取HTTP状态码非200的请求
tail -f access.log | awk 'match($0, /HTTP/1.1" ([0-9]{3})/, arr) && arr[1] != 200'
- 数据清洗
# 标准化电话号码格式
sed -E 's/(+86)?[ ]*([0-9]{3})-?([0-9]{4})-?([0-9]{4})/1 2-3-4/' contacts.csv
- 安全检测
# 检测SQL注入特征 grep -P '(unions+select|sleep(d+)|benchmark(|b(and|or)b.+=[^'"'"']*["'"'"]s*["'"'"])' web_logs
五、性能优化建议
- 优先使用原生Bash操作避免子进程开销
- 复杂匹配使用预编译正则(如awk/perl)
- 大文件处理时结合LC_ALL=C提升ASCII处理速度
- 避免贪婪匹配.*改用精准限定符
六、调试技巧
# 可视化匹配过程 grep --color=auto -nE 'pattern' file # 测试正则表达式 pcre2test # 专用测试工具
到此这篇关于Bash中使用正则表达式进行文本处理的文章就介绍到这了,更多相关Bash正则表达式文本处理内容请搜索风君子博客以前的文章或继续浏览下面的相关文章希望大家以后多多支持风君子博客!
您可能感兴趣的文章:
- bash 中用于grep的正则表达式
- Bash Shell通配符与正则表达式实用示例详解