正则表达式分组与引用的使用

今天我们来讲下正则中的分组与引用,文中通过示例代码介绍的非常详细,具有一定的参考价值,感兴趣的小伙伴们可以参考一下

0.写在前面

今天我们来讲下正则中的分组与引用,其实在第一篇文章中,我们在实战环节就已经用到分组这个功能了,回顾下 IPv4 地址的正则表达式:

复制代码 代码如下:

^([1-9][0-9]?|1[0-9][0-9]|2[0-4][0-9]|25[0-5])(\.(0|[1-9][0-9]?|1[0-9][0-9]|2[0-4][0-9]|25[0-5])){3}$

可以简写下:

复制代码 代码如下:

^(条件1)(\.(条件2)){3}$

可以看到在表达式中出现了几对括号,为什么要用括号把表达式括起来,这些括号有什么作用呢,我们一起来看下。

1.分组与编号

括号在正则中可以用于分组,被括号括起来的部分可以称为子表达式,会被保存成一个子组。

举个栗子,有一个日期时间 2021-06-01 13:14:21,我们想要提取出其中的日期和时间,就要用括号对日期和时间进行分组,如下图所示:

分组与编号

可以看到图中有两个分组,日期分组是第1个,时间分组是第2个,我们以左括号的位置,来表示分组的标号,从1开始,第几个左括号,就是第几个分组。

上面的栗子,我们再分的细一点,我们要分别提取其中的年、月、日,时、分、秒,如下图所示:

括号嵌套

可以看到日期的分组编号是 1,时间分组的编号是 5,年月日的分组编号分别是 2,3,4,时分秒的分组编号分别是 6,7,8。

2.不保存子组

分组是有一定的性能消耗的,在有些情况下,我们只是单纯的想要分组,后续并不想使用它,就可以在左括号的后面加上 ?: 表示不保存子组。

比如,需要是使用正则匹配目标字符串中的15位或18位数字:

功能正则示例
保存子组(正则)\d{15}(\d{3})?
不保存子组(?:正则)\d{15}(?:\d{3})?

保存子组

不保存子组

我们之前讲过的 IPv4 正则表示就可以优化下:

复制代码 代码如下:

^(?:[1-9][0-9]?|1[0-9][0-9]|2[0-4][0-9]|25[0-5])(?:\.(?:0|[1-9][0-9]?|1[0-9][0-9]|2[0-4][0-9]|25[0-5])){3}$

IPv4地址正则匹配

3.分组引用

上面讲完了分组,我们来看下如何来引用分组,大部分语言都是用 反斜杠 + 编号 的方式,个别的比如 JavaScript语言,使用的是 美元符号 + 编号 的方式:

编程语言查找时引用方式替换时引用方式
Python\number 如 \1\number 如 \1
Go官方包不支持官方包不支持
Java\number 如 \1$number 如 $1
JavaScript$number 如 $1$number 如 $1
PHP\number 如 \1\number 如 \1
Ruby\number 如 \1\number 如 \1

4.查找与替换

 查找

到这里我们已经学完了分组与引用的知识,一起来实践下,有这样一个需求,在一个目标字符串中,查找两个重复出现的单词。

还没有学到单词边界,我们先用 \w{2,} 来表示出现的单词,重复的单词就是 (\w{2,} \1),看下结果:

分组查找

替换

上面的内容,我们讲到了日期的分组,来替换下:

分组替换

对应的 Python 代码如下:

 import re test_str = "2021-06-01 13:14:21" regex = r"((\d{4})-(\d{2})-(\d{2})) ((\d{2}):(\d{2}):(\d{2}))" subst = r"\2年\3月\4日 \6时\7

以上就是正则表达式分组与引用的使用的详细内容,更多请关注0133技术站其它相关文章!

赞(0) 打赏
未经允许不得转载:0133技术站首页 » 正则表达式