正则表达式量词与贪婪的使用详解-巨人网络通讯

正则表达式量词与贪婪的使用详解

0.写在前面

在上一篇文章中，我们学习了正则的一些基础元字符，相信大家都已经忘却的差不多了，可以点击上面的链接再温习下。

今天我们一起来学习下正则中量词的三种匹配模式，贪婪模式、非贪婪模式、独占模式，这些模式会改变正则中量词的匹配行为，是每次贪婪的匹配到更多呢，还是不贪婪见好就收呢，如果不了解这些，我们写出的正则很可能是错误的，甚至会引发严重的线上性能问题。

1.量词

本篇文章所讲的内容和量词关系比较密切，先回顾下：

我们还可以用 {m,n} 的方式来表示 * + ? 这3种元字符：

元字符	同义表示方法	示例
*	{0,}	ab* 可以匹配 a 或者 abb
+	{1,}	ab+ 可以匹配 ab 或者 abb 但不能匹配 a
?	{0,1}	ab? 可以匹配 a 或者 ab 但不能匹配 abb

2.贪婪模式前传

在正则中，表示次数的量词默认是贪婪的，在贪婪模式下，会尽可能最大长度的去匹配目标字符串，我们用正则 a+ 和 a* 来匹配字符串 aaabb 测试一下。

2.1 使用 a+ 进行匹配

可以看到只匹配到了1个结果 aaa

对应的 Python 代码如下：

import re

print(re.findall(r'a+', 'aaabb'))

输出：['aaa']

2.2 使用 a* 进行匹配

可以看到匹配到了4个结果，其中还有3个是空字符串

对应的 Python 代码如下：

import re

print(re.findall(r'a*', 'aaabb'))

输出：['aaa', '', '', '']

为什么会匹配到空字符串呢？因为星号（*）代表匹配0到多次，匹配0次就是空字符串，那前面还有个 aaa 呢，为什么 aaa 之间的空字符串没有被匹配到？

这就引入到了我们今天要讲的，贪婪模式与非贪婪模式，从字面上很好理解，贪婪模式就是尽可能多的匹配，非贪婪模式就是尽可能少的匹配。

3.贪婪模式

一起来分析下上面正则 a* 的匹配过程：

字符串	a	a	a	b	b	空字符串
下标	0	1	2	3	4	5

匹配	开始	结束	说明	匹配内容
第一次	0	3	到第一个字母b发现不匹配，输出aaa	aaa
第二次	3	3	匹配剩下的bb，发现匹配不上，输出空字符串	空字符串
第三次	4	4	匹配剩下的b，发现匹配不上，输出空字符串	空字符串
第四次	5	5	匹配剩下的空字符串，输出空字符串	空字符串

a* 在匹配字符串 aaabb 时，会尽可能多的把前面的 a 都匹配上，直到第一个字母 b 不满足要求为止，匹配上3个 a，后面每次匹配的都是空字符串。

看到这里，相信你已经对贪婪模式有了更深的印象，贪婪模式的特点就是尽可能进行最大长度匹配，就是有多少要多少，下面我们在一起来看下与它完全相反的匹配模式。

4.非贪婪模式

上面讲完了贪婪模式，贪婪模式是尽可能最大长度匹配，非贪婪模式就是尽可能最小长度匹配，在量词的后面加一个问号（?），就成了非贪婪模式，比如 a*?

对应的 Python 代码如下：

import re

// 贪婪匹配
print(re.findall(r'a*', 'aaabb'))

输出：['aaa', '', '', '']

// 非贪婪匹配
print(re.findall(r'a*?', 'aaabb'))

输出：['', 'a', '', 'a', '', 'a', '', '', '']

学完了贪婪模式与非贪婪模式，你可能会问，我什么情况下会用到呢，下面举个栗子感受下：

需求是查找一段字符串中，所有双引号括起来的内容，上面使用贪婪匹配与非贪婪匹配的对比，差别很明显对吧。

5.独占模式

不管是贪婪模式，还是非贪婪模式，匹配过程中都需要发生回溯才能完成想要的功能，但是在有一些场景，我们不需要回溯，匹配不上直接返回失败就可以了，因此正则匹配中还有另外一种模式，独占模式，它和贪婪模式很像，但匹配过程中不会发生回溯，在一些使用场景中性能会更好。

先来讲讲什么是回溯，再举个栗子，有一个正则表达式和目标字符串,我们分别看下在三种匹配模式下都发生了什么：

5.1 贪婪匹配过程

正则表达式：ab{1,3}c

目标字符串：abbc

在匹配时，b{1,3} 会尽可能长的去匹配目标字符串，匹配完 abb 之后，因为要尽可能长的匹配（3个 b），目标字符串中的c就会匹配不上，这个时候会发生向前回溯，吐出当前字符 c，用正则中的 c 去匹配，匹配成功。

import regex

print(regex.findall(r'ab{1,3}c', 'abbc'))

输出：['abbc']

5.2 非贪婪匹配过程

正则表达式：ab{1,3}?c

目标字符串：abbc

在匹配时，b{1,3} 会尽可能短的去匹配目标字符串，匹配完 ab 之后，会直接用正则 c 去匹配目标字符串剩下的 b，匹配不上，发生向前回溯，重新用正则 b{1,3} 匹配目标字符串剩下的 b，然后正则 c 匹配目标字符串剩下的 c，匹配成功。

import regex

print(regex.findall(r'ab{1,3}?c', 'abbc'))

输出：['abbc']

5.3 独占匹配过程

在量词后面加上 + 就是独占模式。

正则表达式：ab{1,2}+bc

目标字符串：abbc

在匹配时，b{1,2} 会尽可能长的去匹配目标字符串，匹配完 abb 之后，会用正则 b 匹配目标字符串剩下的 c，匹配不上，不回溯，匹配失败。

import regex

print(regex.findall(r'ab{1,2}+bc', 'abbc'))

输出：[]

6.写在最后

最后在总结下上面讲到的内容：

到这里，正则表达式的量词与贪婪就讲完了，如果有问题可以给我留言评论，谢谢。

正则表达式在线校验工具：https://regex101.com/

到此这篇关于正则表达式量词与贪婪的使用详解的文章就介绍到这了,更多相关正则表达式量词与贪婪内容请搜索脚本之家以前的文章或继续浏览下面的相关文章希望大家以后多多支持脚本之家！

您可能感兴趣的文章:

十分钟上手正则表达式上篇
正则表达式常见的4种匹配模式小结
正则表达式分组与引用的使用
正则表达式那些让人头晕的元字符
正则表达式之分组的回溯引用问题
十分钟上手正则表达式下篇

上一篇：正则表达式那些让人头晕的元字符
下一篇：正则表达式分组与引用的使用

正则表达式量词与贪婪的使用详解

目录 0.写在前面 1.量词 2.贪婪模式前传 2.1 使用 a+ 进行匹配 2.2 使用 a* 进行匹配 3.贪婪模式 4.非贪婪模式 5.独占模式 5.1 贪婪匹配过程 5.2 非贪婪匹配过程 5.3 独占匹配过程 6.写在最后正则,表达式,量词,与,贪婪,...

400号码接听要钱吗400电话办理费用会受哪些因素影响

作为企业的专属客户服务电话，400电话采用主被称分享的方式。无论是用户打电话还是...

机遇是物联网产业发展中的导火索

物联网是“天”“人”合一的产物，即“天然”与“人工”双重组合之物。追溯“物”...

中国移动加快转型流量经营集团层面首次启动策

数据流量爆炸式增长虽然给中国移动带来了一定的收入，但更多的是网络投资压力。中...

锦州运输服务监督电话“12328”呼叫中心将开通

建设统一的12328交通运输服务监督电话系统，是交通运输部门落实党的群众路线的重要...

所有400电话是免费的吗400是免费的电话吗怎么收费标准

(所有400电话是免费的吗)(400是免费的电话吗怎么收费标准)以下内容400电话加盟由巨人小...

地图标注-河南发现日侵华时期中国地图标注有矿藏地

中新社新乡5月23日电董飞)记者23日自河南省新乡市博物馆了解到近日该市一位年近百岁...

400电话办理如今是带给我们最美好的影响

事实上来说，我们都感觉到一些电话的办理能够带给我们一定的贡献与作用，其实在当...

云外呼系统质量（阿里云外呼系统）

本文目次一览： 1、外呼零碎怎样？好用么？ 2、外呼零碎真的很不错吗？ 3、哪家的外...

哈尔滨餐饮加盟外呼系统怎么办理,外呼线路-服务周到

哈尔滨餐饮加盟外呼系统怎么办理,外呼线路这将提高你的可信度，并给你的对手接受你...

呼叫中心语音系统云呼_电话机器人

提高转化率就是让我们的营销更加有效，避免大量无效的营销，避免营销方面的浪费。...

企业使用400电话办理可以有更好服务体验

施耐德电气推出产品保修延长服务，实现与客户关系长期有效的维护。企业办理400电话...

400电话代理助力企业“快”发展

产品上市慢一步，被其他企业生产的同款产品抢了市场先机，服务速度慢一拍，被客户...

linux如何mount挂载磁盘并设置开机自动mount的实现

知道大家时间都很宝贵，我直接把流程命令写下来，大家配置完即可，想研究原理的话...

租用电话外呼系统（电话外呼系统设备）

本文目次一览： 1、外呼零碎怎样操持？ 2、电销外呼零碎几何钱一个月？ 3、智能外呼...

适合打电销的电话卡的特点

适合打电销的电话卡的特点发货要你企业资料报备，投诉有罚款的卡才是最稳的，不放...

正则表达式量词与贪婪的使用详解

全 部 栏 目

目录

0.写在前面

1.量词

2.贪婪模式前传

2.1 使用 a+ 进行匹配

2.2 使用 a* 进行匹配

3.贪婪模式

4.非贪婪模式

5.独占模式

5.1 贪婪匹配过程

5.2 非贪婪匹配过程

5.3 独占匹配过程

6.写在最后

全部栏目