re模塊操作

在Python中需要通過正則表達(dá)式對字符串進(jìn)行匹配的時(shí)候器予，可以使用一個(gè)模塊勾习，名字為re

re模塊的使用過程

#coding=utf-8

# 導(dǎo)入re模塊
import re

# 使用match方法進(jìn)行匹配操作
result = re.match(正則表達(dá)式,要匹配的字符串)

# 如果上一步匹配到數(shù)據(jù)的話湾盒，可以使用group方法來提取數(shù)據(jù)
result.group()
re模塊示例(匹配以itcast開頭的語句)

#coding=utf-8

import re

result = re.match("itcast","itcast.cn")

result.group()

運(yùn)行結(jié)果為：

itcast

說明

re.match() 能夠匹配出以xxx開頭的字符串

匹配單個(gè)字符

在上一小節(jié)中，了解到通過re模塊能夠完成使用正則表達(dá)式來匹配字符串

本小節(jié)俐载，將要講解正則表達(dá)式的單字符匹配
字符功能
. 匹配任意1個(gè)字符（除了\n）
[ ] 匹配[ ]中列舉的字符
\d 匹配數(shù)字捏萍，即0-9
\D 匹配非數(shù)字，即不是數(shù)字
\s 匹配空白项炼，即空格，tab鍵
\S 匹配非空白
\w 匹配單詞字符，即a-z墨坚、A-Z亏拉、0-9、_
\W 匹配非單詞字符
示例1： .

#coding=utf-8

import re

ret = re.match(".","M")
print(ret.group())

ret = re.match("t.o","too")
print(ret.group())

ret = re.match("t.o","two")
print(ret.group())

運(yùn)行結(jié)果：

M
too
two

示例2：[ ]

#coding=utf-8

import re

如果hello的首字符小寫，那么正則表達(dá)式需要小寫的h

ret = re.match("h","hello Python")
print(ret.group())

如果hello的首字符大寫爆班，那么正則表達(dá)式需要大寫的H

ret = re.match("H","Hello Python")
print(ret.group())

大小寫h都可以的情況

ret = re.match("[hH]","hello Python")
print(ret.group())
ret = re.match("[hH]","Hello Python")
print(ret.group())
ret = re.match("[hH]ello Python","Hello Python")
print(ret.group())

匹配0到9第一種寫法

ret = re.match("[0123456789]Hello Python","7Hello Python")
print(ret.group())

匹配0到9第二種寫法

ret = re.match("[0-9]Hello Python","7Hello Python")
print(ret.group())

ret = re.match("[0-35-9]Hello Python","7Hello Python")
print(ret.group())

下面這個(gè)正則不能夠匹配到數(shù)字4后众，因此ret為None

ret = re.match("[0-35-9]Hello Python","4Hello Python")
# print(ret.group())

運(yùn)行結(jié)果：

h
H
h
H
Hello Python
7Hello Python
7Hello Python
7Hello Python

示例3：\d

#coding=utf-8

import re

普通的匹配方式

ret = re.match("嫦娥1號","嫦娥1號發(fā)射成功")
print(ret.group())

ret = re.match("嫦娥2號","嫦娥2號發(fā)射成功")
print(ret.group())

ret = re.match("嫦娥3號","嫦娥3號發(fā)射成功")
print(ret.group())

使用\d進(jìn)行匹配

ret = re.match("嫦娥\d號","嫦娥1號發(fā)射成功")
print(ret.group())

ret = re.match("嫦娥\d號","嫦娥2號發(fā)射成功")
print(ret.group())

ret = re.match("嫦娥\d號","嫦娥3號發(fā)射成功")
print(ret.group())

運(yùn)行結(jié)果：

嫦娥1號
嫦娥2號
嫦娥3號
嫦娥1號
嫦娥2號
嫦娥3號
匹配多個(gè)字符

匹配多個(gè)字符的相關(guān)格式
字符功能

匹配前一個(gè)字符出現(xiàn)0次或者無限次，即可有可無

匹配前一個(gè)字符出現(xiàn)1次或者無限次，即至少有1次
? 匹配前一個(gè)字符出現(xiàn)1次或者0次抗碰，即要么有1次，要么沒有
{m} 匹配前一個(gè)字符出現(xiàn)m次
{m,n} 匹配前一個(gè)字符出現(xiàn)從m到n次
示例1：*

需求：匹配出是复，一個(gè)字符串第一個(gè)字母為大小字符，后面都是小寫字母并且這些小寫字母可有可無

#coding=utf-8
import re

ret = re.match("[A-Z][a-z]*","M")
print(ret.group())

ret = re.match("[A-Z][a-z]*","MnnM")
print(ret.group())

ret = re.match("[A-Z][a-z]*","Aabcdef")
print(ret.group())

運(yùn)行結(jié)果：

M
Mnn
Aabcdef

示例2：+

需求：匹配出，變量名是否有效

#coding=utf-8
import re

names = ["name1", "_name", "2_name", "name"]

for name in names:
ret = re.match("[a-zA-Z_]+[\w]*",name)
if ret:
print("變量名 %s 符合要求" % ret.group())
else:
print("變量名 %s 非法" % name)

運(yùn)行結(jié)果：

變量名 name1 符合要求
變量名 _name 符合要求
變量名 2_name 非法
變量名 name 符合要求

示例3：?

需求：匹配出，0到99之間的數(shù)字

#coding=utf-8
import re

ret = re.match("[1-9]?[0-9]","7")
print(ret.group())

ret = re.match("[1-9]?\d","33")
print(ret.group())

ret = re.match("[1-9]?\d","09")
print(ret.group())

運(yùn)行結(jié)果：

7
33
0 # 這個(gè)結(jié)果并不是想要的，利用$才能解決

示例4：{m}

需求：匹配出罪帖，8到20位的密碼炸客，可以是大小寫英文字母抖所、數(shù)字蟆炊、下劃線

#coding=utf-8
import re

ret = re.match("[a-zA-Z0-9_]{6}","12a3g45678")
print(ret.group())

ret = re.match("[a-zA-Z0-9_]{8,20}","1ad12f23s34455ff66")
print(ret.group())

運(yùn)行結(jié)果：

12a3g4
1ad12f23s34455ff66

匹配開頭結(jié)尾
字符功能
^ 匹配字符串開頭
$匹配字符串結(jié)尾示例1：$

需求：匹配163.com的郵箱地址

#coding=utf-8

import re

email_list = ["xiaoWang@163.com", "xiaoWang@163.comheihei", ".com.xiaowang@qq.com"]

for email in email_list:
ret = re.match("[\w]{4,20}@163.com", email)
if ret:
print("%s 是符合規(guī)定的郵件地址,匹配后的結(jié)果是:%s" % (email, ret.group()))
else:
print("%s 不符合要求" % email)

運(yùn)行結(jié)果:

xiaoWang@163.com 是符合規(guī)定的郵件地址,匹配后的結(jié)果是:xiaoWang@163.com
xiaoWang@163.comheihei 是符合規(guī)定的郵件地址,匹配后的結(jié)果是:xiaoWang@163.com
.com.xiaowang@qq.com 不符合要求

完善后

email_list = ["xiaoWang@163.com", "xiaoWang@163.comheihei", ".com.xiaowang@qq.com"]

for email in email_list:
ret = re.match("[\w]{4,20}@163.com$", email)
if ret:
print("%s 是符合規(guī)定的郵件地址,匹配后的結(jié)果是:%s" % (email, ret.group()))
else:
print("%s 不符合要求" % email)

運(yùn)行結(jié)果：

xiaoWang@163.com 是符合規(guī)定的郵件地址,匹配后的結(jié)果是:xiaoWang@163.com
xiaoWang@163.comheihei 不符合要求
.com.xiaowang@qq.com 不符合要求

匹配分組

字符	功能
		匹配左右任意一個(gè)表達(dá)式
(ab)	將括號中字符作為一個(gè)分組
`\num`	引用分組num匹配到的字符串
`(?P<name>)`	分組起別名
(?P=name)	引用別名為name分組匹配到的字符串

示例1：|

需求：匹配出0-100之間的數(shù)字

\#coding=utf-8

import re

ret = re.match("[1-9]?\d","8")
print(ret.group())  # 8

ret = re.match("[1-9]?\d","78")
print(ret.group())  # 78

# 不正確的情況
ret = re.match("[1-9]?\d","08")
print(ret.group())  # 0

# 修正之后的
ret = re.match("[1-9]?\d$","08")
if ret:
    print(ret.group())
else:
    print("不在0-100之間")

# 添加|
ret = re.match("[1-9]?\d$|100","8")
print(ret.group())  # 8

ret = re.match("[1-9]?\d$|100","78")
print(ret.group())  # 78

ret = re.match("[1-9]?\d$|100","08")
# print(ret.group())  # 不是0-100之間

ret = re.match("[1-9]?\d$|100","100")
print(ret.group())  # 100

示例2：( )

需求：匹配出163稽莉、126、qq郵箱

#coding=utf-8

import re

ret = re.match("\w{4,20}@163\.com", "test@163.com")
print(ret.group())  # test@163.com

ret = re.match("\w{4,20}@(163|126|qq)\.com", "test@126.com")
print(ret.group())  # test@126.com

ret = re.match("\w{4,20}@(163|126|qq)\.com", "test@qq.com")
print(ret.group())  # test@qq.com

ret = re.match("\w{4,20}@(163|126|qq)\.com", "test@gmail.com")
if ret:
    print(ret.group())
else:
    print("不是163涩搓、126污秆、qq郵箱")  # 不是163、126昧甘、qq郵箱

不是以4良拼、7結(jié)尾的手機(jī)號碼(11位)

import re

tels = ["13100001234", "18912344321", "10086", "18800007777"]

for tel in tels:
    ret = re.match("1\d{9}[0-35-68-9]", tel)
    if ret:
        print(ret.group())
    else:
        print("%s 不是想要的手機(jī)號" % tel)

提取區(qū)號和電話號碼

>>> ret = re.match("([^-]*)-(\d+)","010-12345678")
>>> ret.group()
'010-12345678'
>>> ret.group(1)
'010'
>>> ret.group(2)
'12345678'

示例3：\

需求：匹配出<html>hh</html>

#coding=utf-8

import re

# 能夠完成對正確的字符串的匹配
ret = re.match("<[a-zA-Z]*>\w*</[a-zA-Z]*>", "<html>hh</html>")
print(ret.group())

# 如果遇到非正常的html格式字符串，匹配出錯(cuò)
ret = re.match("<[a-zA-Z]*>\w*</[a-zA-Z]*>", "<html>hh</htmlbalabala>")
print(ret.group())

# 正確的理解思路：如果在第一對<>中是什么充边，按理說在后面的那對<>中就應(yīng)該是什么

# 通過引用分組中匹配到的數(shù)據(jù)即可庸推，但是要注意是元字符串，即類似 r""這種格式
ret = re.match(r"<([a-zA-Z]*)>\w*</\1>", "<html>hh</html>")
print(ret.group())

# 因?yàn)?對<>中的數(shù)據(jù)不一致浇冰，所以沒有匹配出來
test_label = "<html>hh</htmlbalabala>"
ret = re.match(r"<([a-zA-Z]*)>\w*</\1>", test_label)
if ret:
    print(ret.group())
else:
    print("%s 這是一對不正確的標(biāo)簽" % test_label)

運(yùn)行結(jié)果：

<html>hh</html>
<html>hh</htmlbalabala>
<html>hh</html>
<html>hh</htmlbalabala> 這是一對不正確的標(biāo)簽

示例4：\number

需求：匹配出<html><h1>www.itcast.cn</h1></html>

#coding=utf-8

import re

labels = ["<html><h1>www.itcast.cn</h1></html>", "<html><h1>www.itcast.cn</h2></html>"]

for label in labels:
    ret = re.match(r"<(\w*)><(\w*)>.*</\2></\1>", label)
    if ret:
        print("%s 是符合要求的標(biāo)簽" % ret.group())
    else:
        print("%s 不符合要求" % label)

運(yùn)行結(jié)果：

<html><h1>www.itcast.cn</h1></html> 是符合要求的標(biāo)簽
<html><h1>www.itcast.cn</h2></html> 不符合要求

示例5：`(?P<name>)` `(?P=name)`

需求：匹配出<html><h1>www.itcast.cn</h1></html>

#coding=utf-8

import re

ret = re.match(r"<(?P<name1>\w*)><(?P<name2>\w*)>.*</(?P=name2)></(?P=name1)>", "<html><h1>www.itcast.cn</h1></html>")
ret.group()

ret = re.match(r"<(?P<name1>\w*)><(?P<name2>\w*)>.*</(?P=name2)></(?P=name1)>", "<html><h1>www.itcast.cn</h2></html>")
ret.group()

注意：`(?P<name>)`和`(?P=name)`中的字母p大寫

運(yùn)行結(jié)果：

image.png

re模塊的高級用法

search

需求：匹配出文章閱讀的次數(shù)

#coding=utf-8
import re

ret = re.search(r"\d+", "閱讀次數(shù)為 9999")
ret.group()

運(yùn)行結(jié)果：

'9999'

findall

需求：統(tǒng)計(jì)出python贬媒、c、c++相應(yīng)文章閱讀的次數(shù)

#coding=utf-8
import re

ret = re.findall(r"\d+", "python = 9999, c = 7890, c++ = 12345")
print(ret)

運(yùn)行結(jié)果：

['9999', '7890', '12345']

sub 將匹配到的數(shù)據(jù)進(jìn)行替換

需求：將匹配到的閱讀次數(shù)加1

方法1：

#coding=utf-8
import re

ret = re.sub(r"\d+", '998', "python = 997")
print(ret)

運(yùn)行結(jié)果：

python = 998

方法2：

#coding=utf-8
import re

def add(temp):
    strNum = temp.group()
    num = int(strNum) + 1
    return str(num)

ret = re.sub(r"\d+", add, "python = 997")
print(ret)

ret = re.sub(r"\d+", add, "python = 99")
print(ret)

運(yùn)行結(jié)果：

python = 998
python = 100

練習(xí)

image.png

從下面的字符串中取出文本

<div>
        <p>崗位職責(zé)：</p>
<p>完成推薦算法肘习、數(shù)據(jù)統(tǒng)計(jì)际乘、接口、后臺等服務(wù)器端相關(guān)工作</p>
<p><br></p>
<p>必備要求：</p>
<p>良好的自我驅(qū)動(dòng)力和職業(yè)素養(yǎng)井厌，工作積極主動(dòng)蚓庭、結(jié)果導(dǎo)向</p>
<p>&nbsp;<br></p>
<p>技術(shù)要求：</p>
<p>1、一年以上 Python 開發(fā)經(jīng)驗(yàn)仅仆，掌握面向?qū)ο蠓治龊驮O(shè)計(jì)器赞，了解設(shè)計(jì)模式</p>
<p>2、掌握HTTP協(xié)議墓拜，熟悉MVC港柜、MVVM等概念以及相關(guān)WEB開發(fā)框架</p>
<p>3、掌握關(guān)系數(shù)據(jù)庫開發(fā)設(shè)計(jì)，掌握 SQL夏醉，熟練使用 MySQL/PostgreSQL 中的一種<br></p>
<p>4爽锥、掌握NoSQL、MQ畔柔，熟練使用對應(yīng)技術(shù)解決方案</p>
<p>5氯夷、熟悉 Javascript/CSS/HTML5，JQuery靶擦、React腮考、Vue.js</p>
<p>&nbsp;<br></p>
<p>加分項(xiàng)：</p>
<p>大數(shù)據(jù)，數(shù)理統(tǒng)計(jì)玄捕，機(jī)器學(xué)習(xí)踩蔚，sklearn，高性能枚粘，大并發(fā)馅闽。</p>

        </div>

參考答案:

re.sub(r"<[^>]*>|&nbsp;|\n", "", test_str)

split 根據(jù)匹配進(jìn)行切割字符串，并返回一個(gè)列表

需求：切割字符串“info:xiaoZhang 33 shandong”

#coding=utf-8
import re

ret = re.split(r":| ","info:xiaoZhang 33 shandong")
print(ret)

運(yùn)行結(jié)果：

['info', 'xiaoZhang', '33', 'shandong']

python貪婪和非貪婪

Python里數(shù)量詞默認(rèn)是貪婪的（在少數(shù)語言里也可能是默認(rèn)非貪婪）馍迄，總是嘗試匹配盡可能多的字符福也；

非貪婪則相反，總是嘗試匹配盡可能少的字符柬姚。

在"*","?","+","{m,n}"后面加上拟杉？，使貪婪變成非貪婪量承。

>>> s="This is a number 234-235-22-423"
>>> r=re.match(".+(\d+-\d+-\d+-\d+)",s)
>>> r.group(1)
'4-235-22-423'
>>> r=re.match(".+?(\d+-\d+-\d+-\d+)",s)
>>> r.group(1)
'234-235-22-423'
>>>

正則表達(dá)式模式中使用到通配字搬设，那它在從左到右的順序求值時(shí)，會盡量“抓取”滿足匹配最長字符串撕捍，在我們上面的例子里面拿穴，“.+”會從字符串的啟始處抓取滿足模式的最長字符，其中包括我們想得到的第一個(gè)整型字段的中的大部分忧风，“\d+”只需一位字符就可以匹配默色，所以它匹配了數(shù)字“4”，而“.+”則匹配了從字符串起始到這個(gè)第一位數(shù)字4之前的所有字符狮腿。

解決方式：非貪婪操作符“腿宰？”，這個(gè)操作符可以用在"*","+","?"的后面缘厢，要求正則匹配的越少越好吃度。

>>> re.match(r"aa(\d+)","aa2343ddd").group(1)
'2343'
>>> re.match(r"aa(\d+?)","aa2343ddd").group(1)
'2'
>>> re.match(r"aa(\d+)ddd","aa2343ddd").group(1) 
'2343'
>>> re.match(r"aa(\d+?)ddd","aa2343ddd").group(1)
'2343'
>>>

練一練

[圖片上傳失敗...(image-53eef0-1600844319562)]

字符串為:

<img data-original="https://rpic.douyucdn.cn/appCovers/2016/11/13/1213973_201611131917_small.jpg" src="https://rpic.douyucdn.cn/appCovers/2016/11/13/1213973_201611131917_small.jpg" style="display: inline;">

請?zhí)崛rl地址

參考答案

re.search(r"https://.*?\.jpg", test_str)

r的作用

mm = "c:\a\b\c"
mm
'c:\a\b\c'
print(mm)
c:\a\b\c
re.match("c:\\",mm).group()
'c:\'
ret = re.match("c:\\",mm).group()
print(ret)
c:
ret = re.match("c:\\a",mm).group()
print(ret)
c:\a
ret = re.match(r"c:\a",mm).group()
print(ret)
c:\a
ret = re.match(r"c:\a",mm).group()
Traceback (most recent call last):
File "<stdin>", line 1, in <module>
AttributeError: 'NoneType' object has no attribute 'group'

說明

Python中字符串前面加上 r 表示原生字符串，

與大多數(shù)編程語言相同贴硫，正則表達(dá)式里使用""作為轉(zhuǎn)義字符椿每，這就可能造成反斜杠困擾伊者。假如你需要匹配文本中的字符""，那么使用編程語言表示的正則表達(dá)式里將需要4個(gè)反斜杠"\"：前兩個(gè)和后兩個(gè)分別用于在編程語言里轉(zhuǎn)義成反斜杠间护，轉(zhuǎn)換成兩個(gè)反斜杠后再在正則表達(dá)式里轉(zhuǎn)義成一個(gè)反斜杠亦渗。

Python里的原生字符串很好地解決了這個(gè)問題，有了原生字符串汁尺，你再也不用擔(dān)心是不是漏寫了反斜杠法精，寫出來的表達(dá)式也更直觀。

ret = re.match(r"c:\a",mm).group()
print(ret)
c:\a

python正則

python正則

如果hello的首字符小寫，那么正則表達(dá)式需要小寫的h

如果hello的首字符大寫爆班，那么正則表達(dá)式需要大寫的H

大小寫h都可以的情況

匹配0到9第一種寫法

匹配0到9第二種寫法

下面這個(gè)正則不能夠匹配到數(shù)字4后众，因此ret為None

普通的匹配方式

使用\d進(jìn)行匹配

匹配分組

示例1：|

示例2：( )

不是以4良拼、7結(jié)尾的手機(jī)號碼(11位)

提取區(qū)號和電話號碼

示例3：\

示例4：\number

示例5：`(?P<name>)` `(?P=name)`

注意：`(?P<name>)`和`(?P=name)`中的字母p大寫

re模塊的高級用法

search

findall

sub 將匹配到的數(shù)據(jù)進(jìn)行替換

練習(xí)

split 根據(jù)匹配進(jìn)行切割字符串，并返回一個(gè)列表

python貪婪和非貪婪

練一練

python正則

如果hello的首字符小寫，那么正則表達(dá)式需要小寫的h

如果hello的首字符大寫爆班，那么正則表達(dá)式需要大寫的H

大小寫h都可以的情況

匹配0到9第一種寫法

匹配0到9第二種寫法

下面這個(gè)正則不能夠匹配到數(shù)字4后众，因此ret為None

普通的匹配方式

使用\d進(jìn)行匹配

匹配分組

示例1：|

示例2：( )

不是以4良拼、7結(jié)尾的手機(jī)號碼(11位)

提取區(qū)號和電話號碼

示例3：\

示例4：\number

示例5：(?P<name>) (?P=name)

注意：(?P<name>)和(?P=name)中的字母p大寫

re模塊的高級用法

search

findall

sub 將匹配到的數(shù)據(jù)進(jìn)行替換

練習(xí)

split 根據(jù)匹配進(jìn)行切割字符串，并返回一個(gè)列表

python貪婪和非貪婪

練一練

示例5：`(?P<name>)` `(?P=name)`

注意：`(?P<name>)`和`(?P=name)`中的字母p大寫