re模塊操作

在Python中需要通過正則表達式對字符串進行匹配的時候，可以使用一個模塊，名字為re

re模塊的使用過程

#coding=utf-8

# 導入re模塊
import re

# 使用match方法進行匹配操作
result = re.match(正則表達式,要匹配的字符串)

# 如果上一步匹配到數(shù)據(jù)的話，可以使用group方法來提取數(shù)據(jù)
result.group()
re模塊示例(匹配以itcast開頭的語句)

#coding=utf-8

import re

result = re.match("itcast","itcast.cn")

result.group()

運行結果為：

itcast

說明

re.match() 能夠匹配出以xxx開頭的字符串

匹配單個字符

在上一小節(jié)中，了解到通過re模塊能夠完成使用正則表達式來匹配字符串

本小節(jié)，將要講解正則表達式的單字符匹配
字符功能
. 匹配任意1個字符（除了\n）
[ ] 匹配[ ]中列舉的字符
\d 匹配數(shù)字，即0-9
\D 匹配非數(shù)字，即不是數(shù)字
\s 匹配空白，即空格，tab鍵
\S 匹配非空白
\w 匹配單詞字符，即a-z、A-Z、0-9、_
\W 匹配非單詞字符
示例1： .

#coding=utf-8

import re

ret = re.match(".","M")
print(ret.group())

ret = re.match("t.o","too")
print(ret.group())

ret = re.match("t.o","two")
print(ret.group())

運行結果：

M
too
two

示例2：[ ]

#coding=utf-8

import re

如果hello的首字符小寫，那么正則表達式需要小寫的h

ret = re.match("h","hello Python")
print(ret.group())

如果hello的首字符大寫，那么正則表達式需要大寫的H

ret = re.match("H","Hello Python")
print(ret.group())

大小寫h都可以的情況

ret = re.match("[hH]","hello Python")
print(ret.group())
ret = re.match("[hH]","Hello Python")
print(ret.group())
ret = re.match("[hH]ello Python","Hello Python")
print(ret.group())

匹配0到9第一種寫法

ret = re.match("[0123456789]Hello Python","7Hello Python")
print(ret.group())

匹配0到9第二種寫法

ret = re.match("[0-9]Hello Python","7Hello Python")
print(ret.group())

ret = re.match("[0-35-9]Hello Python","7Hello Python")
print(ret.group())

下面這個正則不能夠匹配到數(shù)字4，因此ret為None

ret = re.match("[0-35-9]Hello Python","4Hello Python")
# print(ret.group())

運行結果：

h
H
h
H
Hello Python
7Hello Python
7Hello Python
7Hello Python

示例3：\d

#coding=utf-8

import re

普通的匹配方式

ret = re.match("嫦娥1號","嫦娥1號發(fā)射成功")
print(ret.group())

ret = re.match("嫦娥2號","嫦娥2號發(fā)射成功")
print(ret.group())

ret = re.match("嫦娥3號","嫦娥3號發(fā)射成功")
print(ret.group())

使用\d進行匹配

ret = re.match("嫦娥\d號","嫦娥1號發(fā)射成功")
print(ret.group())

ret = re.match("嫦娥\d號","嫦娥2號發(fā)射成功")
print(ret.group())

ret = re.match("嫦娥\d號","嫦娥3號發(fā)射成功")
print(ret.group())

運行結果：

嫦娥1號
嫦娥2號
嫦娥3號
嫦娥1號
嫦娥2號
嫦娥3號
匹配多個字符

匹配多個字符的相關格式
字符功能

匹配前一個字符出現(xiàn)0次或者無限次，即可有可無

匹配前一個字符出現(xiàn)1次或者無限次，即至少有1次
? 匹配前一個字符出現(xiàn)1次或者0次，即要么有1次，要么沒有
{m} 匹配前一個字符出現(xiàn)m次
{m,n} 匹配前一個字符出現(xiàn)從m到n次
示例1：*

需求：匹配出，一個字符串第一個字母為大小字符，后面都是小寫字母并且這些小寫字母可有可無

#coding=utf-8
import re

ret = re.match("[A-Z][a-z]*","M")
print(ret.group())

ret = re.match("[A-Z][a-z]*","MnnM")
print(ret.group())

ret = re.match("[A-Z][a-z]*","Aabcdef")
print(ret.group())

運行結果：

M
Mnn
Aabcdef

示例2：+

需求：匹配出，變量名是否有效

#coding=utf-8
import re

names = ["name1", "_name", "2_name", "name"]

for name in names:
ret = re.match("[a-zA-Z_]+[\w]*",name)
if ret:
print("變量名 %s 符合要求" % ret.group())
else:
print("變量名 %s 非法" % name)

運行結果：

變量名 name1 符合要求
變量名 _name 符合要求
變量名 2_name 非法
變量名 name 符合要求

示例3：?

需求：匹配出，0到99之間的數(shù)字

#coding=utf-8
import re

ret = re.match("[1-9]?[0-9]","7")
print(ret.group())

ret = re.match("[1-9]?\d","33")
print(ret.group())

ret = re.match("[1-9]?\d","09")
print(ret.group())

運行結果：

7
33
0 # 這個結果并不是想要的，利用$才能解決

示例4：{m}

需求：匹配出，8到20位的密碼，可以是大小寫英文字母、數(shù)字、下劃線

#coding=utf-8
import re

ret = re.match("[a-zA-Z0-9_]{6}","12a3g45678")
print(ret.group())

ret = re.match("[a-zA-Z0-9_]{8,20}","1ad12f23s34455ff66")
print(ret.group())

運行結果：

12a3g4
1ad12f23s34455ff66

匹配開頭結尾
字符功能
^ 匹配字符串開頭
$匹配字符串結尾示例1：$

需求：匹配163.com的郵箱地址

#coding=utf-8

import re

email_list = ["xiaoWang@163.com", "xiaoWang@163.comheihei", ".com.xiaowang@qq.com"]

for email in email_list:
ret = re.match("[\w]{4,20}@163.com", email)
if ret:
print("%s 是符合規(guī)定的郵件地址,匹配后的結果是:%s" % (email, ret.group()))
else:
print("%s 不符合要求" % email)

運行結果:

xiaoWang@163.com 是符合規(guī)定的郵件地址,匹配后的結果是:xiaoWang@163.com
xiaoWang@163.comheihei 是符合規(guī)定的郵件地址,匹配后的結果是:xiaoWang@163.com
.com.xiaowang@qq.com 不符合要求

完善后

email_list = ["xiaoWang@163.com", "xiaoWang@163.comheihei", ".com.xiaowang@qq.com"]

for email in email_list:
ret = re.match("[\w]{4,20}@163.com$", email)
if ret:
print("%s 是符合規(guī)定的郵件地址,匹配后的結果是:%s" % (email, ret.group()))
else:
print("%s 不符合要求" % email)

運行結果：

xiaoWang@163.com 是符合規(guī)定的郵件地址,匹配后的結果是:xiaoWang@163.com
xiaoWang@163.comheihei 不符合要求
.com.xiaowang@qq.com 不符合要求

匹配分組

字符	功能
		匹配左右任意一個表達式
(ab)	將括號中字符作為一個分組
`\num`	引用分組num匹配到的字符串
`(?P<name>)`	分組起別名
(?P=name)	引用別名為name分組匹配到的字符串

示例1：|

需求：匹配出0-100之間的數(shù)字

\#coding=utf-8

import re

ret = re.match("[1-9]?\d","8")
print(ret.group())  # 8

ret = re.match("[1-9]?\d","78")
print(ret.group())  # 78

# 不正確的情況
ret = re.match("[1-9]?\d","08")
print(ret.group())  # 0

# 修正之后的
ret = re.match("[1-9]?\d$","08")
if ret:
    print(ret.group())
else:
    print("不在0-100之間")

# 添加|
ret = re.match("[1-9]?\d$|100","8")
print(ret.group())  # 8

ret = re.match("[1-9]?\d$|100","78")
print(ret.group())  # 78

ret = re.match("[1-9]?\d$|100","08")
# print(ret.group())  # 不是0-100之間

ret = re.match("[1-9]?\d$|100","100")
print(ret.group())  # 100

示例2：( )

需求：匹配出163、126、qq郵箱

#coding=utf-8

import re

ret = re.match("\w{4,20}@163\.com", "test@163.com")
print(ret.group())  # test@163.com

ret = re.match("\w{4,20}@(163|126|qq)\.com", "test@126.com")
print(ret.group())  # test@126.com

ret = re.match("\w{4,20}@(163|126|qq)\.com", "test@qq.com")
print(ret.group())  # test@qq.com

ret = re.match("\w{4,20}@(163|126|qq)\.com", "test@gmail.com")
if ret:
    print(ret.group())
else:
    print("不是163、126、qq郵箱")  # 不是163、126、qq郵箱

不是以4、7結尾的手機號碼(11位)

import re

tels = ["13100001234", "18912344321", "10086", "18800007777"]

for tel in tels:
    ret = re.match("1\d{9}[0-35-68-9]", tel)
    if ret:
        print(ret.group())
    else:
        print("%s 不是想要的手機號" % tel)

提取區(qū)號和電話號碼

>>> ret = re.match("([^-]*)-(\d+)","010-12345678")
>>> ret.group()
'010-12345678'
>>> ret.group(1)
'010'
>>> ret.group(2)
'12345678'

示例3：\

需求：匹配出<html>hh</html>

#coding=utf-8

import re

# 能夠完成對正確的字符串的匹配
ret = re.match("<[a-zA-Z]*>\w*</[a-zA-Z]*>", "<html>hh</html>")
print(ret.group())

# 如果遇到非正常的html格式字符串，匹配出錯
ret = re.match("<[a-zA-Z]*>\w*</[a-zA-Z]*>", "<html>hh</htmlbalabala>")
print(ret.group())

# 正確的理解思路：如果在第一對<>中是什么，按理說在后面的那對<>中就應該是什么

# 通過引用分組中匹配到的數(shù)據(jù)即可，但是要注意是元字符串，即類似 r""這種格式
ret = re.match(r"<([a-zA-Z]*)>\w*</\1>", "<html>hh</html>")
print(ret.group())

# 因為2對<>中的數(shù)據(jù)不一致，所以沒有匹配出來
test_label = "<html>hh</htmlbalabala>"
ret = re.match(r"<([a-zA-Z]*)>\w*</\1>", test_label)
if ret:
    print(ret.group())
else:
    print("%s 這是一對不正確的標簽" % test_label)

運行結果：

<html>hh</html>
<html>hh</htmlbalabala>
<html>hh</html>
<html>hh</htmlbalabala> 這是一對不正確的標簽

示例4：\number

需求：匹配出<html><h1>www.itcast.cn</h1></html>

#coding=utf-8

import re

labels = ["<html><h1>www.itcast.cn</h1></html>", "<html><h1>www.itcast.cn</h2></html>"]

for label in labels:
    ret = re.match(r"<(\w*)><(\w*)>.*</\2></\1>", label)
    if ret:
        print("%s 是符合要求的標簽" % ret.group())
    else:
        print("%s 不符合要求" % label)

運行結果：

<html><h1>www.itcast.cn</h1></html> 是符合要求的標簽
<html><h1>www.itcast.cn</h2></html> 不符合要求

示例5：`(?P<name>)` `(?P=name)`

需求：匹配出<html><h1>www.itcast.cn</h1></html>

#coding=utf-8

import re

ret = re.match(r"<(?P<name1>\w*)><(?P<name2>\w*)>.*</(?P=name2)></(?P=name1)>", "<html><h1>www.itcast.cn</h1></html>")
ret.group()

ret = re.match(r"<(?P<name1>\w*)><(?P<name2>\w*)>.*</(?P=name2)></(?P=name1)>", "<html><h1>www.itcast.cn</h2></html>")
ret.group()

注意：`(?P<name>)`和`(?P=name)`中的字母p大寫

運行結果：

image.png

re模塊的高級用法

search

需求：匹配出文章閱讀的次數(shù)

#coding=utf-8
import re

ret = re.search(r"\d+", "閱讀次數(shù)為 9999")
ret.group()

運行結果：

'9999'

findall

需求：統(tǒng)計出python、c、c++相應文章閱讀的次數(shù)

#coding=utf-8
import re

ret = re.findall(r"\d+", "python = 9999, c = 7890, c++ = 12345")
print(ret)

運行結果：

['9999', '7890', '12345']

sub 將匹配到的數(shù)據(jù)進行替換

需求：將匹配到的閱讀次數(shù)加1

方法1：

#coding=utf-8
import re

ret = re.sub(r"\d+", '998', "python = 997")
print(ret)

運行結果：

python = 998

方法2：

#coding=utf-8
import re

def add(temp):
    strNum = temp.group()
    num = int(strNum) + 1
    return str(num)

ret = re.sub(r"\d+", add, "python = 997")
print(ret)

ret = re.sub(r"\d+", add, "python = 99")
print(ret)

運行結果：

python = 998
python = 100

練習

image.png

從下面的字符串中取出文本

<div>
        <p>崗位職責：</p>
<p>完成推薦算法、數(shù)據(jù)統(tǒng)計、接口、后臺等服務器端相關工作</p>
<p><br></p>
<p>必備要求：</p>
<p>良好的自我驅動力和職業(yè)素養(yǎng)，工作積極主動、結果導向</p>
<p>&nbsp;<br></p>
<p>技術要求：</p>
<p>1、一年以上 Python 開發(fā)經驗，掌握面向對象分析和設計，了解設計模式</p>
<p>2、掌握HTTP協(xié)議，熟悉MVC、MVVM等概念以及相關WEB開發(fā)框架</p>
<p>3、掌握關系數(shù)據(jù)庫開發(fā)設計，掌握 SQL，熟練使用 MySQL/PostgreSQL 中的一種<br></p>
<p>4、掌握NoSQL、MQ，熟練使用對應技術解決方案</p>
<p>5、熟悉 Javascript/CSS/HTML5，JQuery、React、Vue.js</p>
<p>&nbsp;<br></p>
<p>加分項：</p>
<p>大數(shù)據(jù)，數(shù)理統(tǒng)計，機器學習，sklearn，高性能，大并發(fā)。</p>

        </div>

參考答案:

re.sub(r"<[^>]*>|&nbsp;|\n", "", test_str)

split 根據(jù)匹配進行切割字符串，并返回一個列表

需求：切割字符串“info:xiaoZhang 33 shandong”

#coding=utf-8
import re

ret = re.split(r":| ","info:xiaoZhang 33 shandong")
print(ret)

運行結果：

['info', 'xiaoZhang', '33', 'shandong']

python貪婪和非貪婪

Python里數(shù)量詞默認是貪婪的（在少數(shù)語言里也可能是默認非貪婪），總是嘗試匹配盡可能多的字符；

非貪婪則相反，總是嘗試匹配盡可能少的字符。

在"*","?","+","{m,n}"后面加上？，使貪婪變成非貪婪。

>>> s="This is a number 234-235-22-423"
>>> r=re.match(".+(\d+-\d+-\d+-\d+)",s)
>>> r.group(1)
'4-235-22-423'
>>> r=re.match(".+?(\d+-\d+-\d+-\d+)",s)
>>> r.group(1)
'234-235-22-423'
>>>

正則表達式模式中使用到通配字，那它在從左到右的順序求值時，會盡量“抓取”滿足匹配最長字符串，在我們上面的例子里面，“.+”會從字符串的啟始處抓取滿足模式的最長字符，其中包括我們想得到的第一個整型字段的中的大部分，“\d+”只需一位字符就可以匹配，所以它匹配了數(shù)字“4”，而“.+”則匹配了從字符串起始到這個第一位數(shù)字4之前的所有字符。

解決方式：非貪婪操作符“？”，這個操作符可以用在"*","+","?"的后面，要求正則匹配的越少越好。

>>> re.match(r"aa(\d+)","aa2343ddd").group(1)
'2343'
>>> re.match(r"aa(\d+?)","aa2343ddd").group(1)
'2'
>>> re.match(r"aa(\d+)ddd","aa2343ddd").group(1) 
'2343'
>>> re.match(r"aa(\d+?)ddd","aa2343ddd").group(1)
'2343'
>>>

練一練

[圖片上傳失敗...(image-53eef0-1600844319562)]

字符串為:

<img data-original="https://rpic.douyucdn.cn/appCovers/2016/11/13/1213973_201611131917_small.jpg" src="https://rpic.douyucdn.cn/appCovers/2016/11/13/1213973_201611131917_small.jpg" style="display: inline;">

請?zhí)崛rl地址

參考答案

re.search(r"https://.*?\.jpg", test_str)

r的作用

mm = "c:\a\b\c"
mm
'c:\a\b\c'
print(mm)
c:\a\b\c
re.match("c:\\",mm).group()
'c:\'
ret = re.match("c:\\",mm).group()
print(ret)
c:
ret = re.match("c:\\a",mm).group()
print(ret)
c:\a
ret = re.match(r"c:\a",mm).group()
print(ret)
c:\a
ret = re.match(r"c:\a",mm).group()
Traceback (most recent call last):
File "<stdin>", line 1, in <module>
AttributeError: 'NoneType' object has no attribute 'group'

說明

Python中字符串前面加上 r 表示原生字符串，

與大多數(shù)編程語言相同，正則表達式里使用""作為轉義字符，這就可能造成反斜杠困擾。假如你需要匹配文本中的字符""，那么使用編程語言表示的正則表達式里將需要4個反斜杠"\"：前兩個和后兩個分別用于在編程語言里轉義成反斜杠，轉換成兩個反斜杠后再在正則表達式里轉義成一個反斜杠。

Python里的原生字符串很好地解決了這個問題，有了原生字符串，你再也不用擔心是不是漏寫了反斜杠，寫出來的表達式也更直觀。

ret = re.match(r"c:\a",mm).group()
print(ret)
c:\a

色偷偷精品伊人,欧洲久久精品,欧美综合婷婷骚逼,国产AV主播,国产最新探花在线,九色在线视频一区,伊人大交九欧美,1769亚洲,黄色成人av

python正則

python正則

如果hello的首字符小寫，那么正則表達式需要小寫的h

如果hello的首字符大寫，那么正則表達式需要大寫的H

大小寫h都可以的情況

匹配0到9第一種寫法

匹配0到9第二種寫法

下面這個正則不能夠匹配到數(shù)字4，因此ret為None

普通的匹配方式

使用\d進行匹配

匹配分組

示例1：|

示例2：( )

不是以4、7結尾的手機號碼(11位)

提取區(qū)號和電話號碼

示例3：\

示例4：\number

示例5：`(?P<name>)` `(?P=name)`

注意：`(?P<name>)`和`(?P=name)`中的字母p大寫

re模塊的高級用法

search

findall

sub 將匹配到的數(shù)據(jù)進行替換

練習

split 根據(jù)匹配進行切割字符串，并返回一個列表

python貪婪和非貪婪

練一練

友情鏈接更多精彩內容

色偷偷精品伊人,欧洲久久精品,欧美综合婷婷骚逼,国产AV主播,国产最新探花在线,九色在线视频一区,伊人大交九 欧美,1769亚洲,黄色成人av

python正則

如果hello的首字符小寫，那么正則表達式需要小寫的h

如果hello的首字符大寫，那么正則表達式需要大寫的H

大小寫h都可以的情況

匹配0到9第一種寫法

匹配0到9第二種寫法

下面這個正則不能夠匹配到數(shù)字4，因此ret為None

普通的匹配方式

使用\d進行匹配

匹配分組

示例1：|

示例2：( )

不是以4、7結尾的手機號碼(11位)

提取區(qū)號和電話號碼

示例3：\

示例4：\number

示例5：(?P<name>) (?P=name)

注意：(?P<name>)和(?P=name)中的字母p大寫

re模塊的高級用法

search

findall

sub 將匹配到的數(shù)據(jù)進行替換

練習

split 根據(jù)匹配進行切割字符串，并返回一個列表

python貪婪和非貪婪

練一練

友情鏈接更多精彩內容

色偷偷精品伊人,欧洲久久精品,欧美综合婷婷骚逼,国产AV主播,国产最新探花在线,九色在线视频一区,伊人大交九欧美,1769亚洲,黄色成人av

如果hello的首字符小寫，那么正則表達式需要小寫的h

下面這個正則不能夠匹配到數(shù)字4，因此ret為None

不是以4、7結尾的手機號碼(11位)

示例5：`(?P<name>)` `(?P=name)`

注意：`(?P<name>)`和`(?P=name)`中的字母p大寫

split 根據(jù)匹配進行切割字符串，并返回一個列表