python正則

re模塊操作

在Python中需要通過正則表達(dá)式對字符串進(jìn)行匹配的時候,可以使用一個模塊,名字為re

  1. re模塊的使用過程

    #coding=utf-8

    # 導(dǎo)入re模塊
    import re

    # 使用match方法進(jìn)行匹配操作
    result = re.match(正則表達(dá)式,要匹配的字符串)

    # 如果上一步匹配到數(shù)據(jù)的話,可以使用group方法來提取數(shù)據(jù)
    result.group()

  2. re模塊示例(匹配以itcast開頭的語句)

    #coding=utf-8

    import re

    result = re.match("itcast","itcast.cn")

    result.group()

運(yùn)行結(jié)果為:

itcast

  1. 說明

    re.match() 能夠匹配出以xxx開頭的字符串

匹配單個字符

在上一小節(jié)中,了解到通過re模塊能夠完成使用正則表達(dá)式來匹配字符串

本小節(jié),將要講解正則表達(dá)式的單字符匹配
字符 功能
. 匹配任意1個字符(除了\n)
[ ] 匹配[ ]中列舉的字符
\d 匹配數(shù)字,即0-9
\D 匹配非數(shù)字,即不是數(shù)字
\s 匹配空白,即 空格,tab鍵
\S 匹配非空白
\w 匹配單詞字符,即a-z、A-Z、0-9、_
\W 匹配非單詞字符
示例1: .

#coding=utf-8

import re

ret = re.match(".","M")
print(ret.group())

ret = re.match("t.o","too")
print(ret.group())

ret = re.match("t.o","two")
print(ret.group())

運(yùn)行結(jié)果:

M
too
two

示例2:[ ]

#coding=utf-8

import re

如果hello的首字符小寫,那么正則表達(dá)式需要小寫的h

ret = re.match("h","hello Python")
print(ret.group())

如果hello的首字符大寫,那么正則表達(dá)式需要大寫的H

ret = re.match("H","Hello Python")
print(ret.group())

大小寫h都可以的情況

ret = re.match("[hH]","hello Python")
print(ret.group())
ret = re.match("[hH]","Hello Python")
print(ret.group())
ret = re.match("[hH]ello Python","Hello Python")
print(ret.group())

匹配0到9第一種寫法

ret = re.match("[0123456789]Hello Python","7Hello Python")
print(ret.group())

匹配0到9第二種寫法

ret = re.match("[0-9]Hello Python","7Hello Python")
print(ret.group())

ret = re.match("[0-35-9]Hello Python","7Hello Python")
print(ret.group())

下面這個正則不能夠匹配到數(shù)字4,因此ret為None

ret = re.match("[0-35-9]Hello Python","4Hello Python")
# print(ret.group())

運(yùn)行結(jié)果:

h
H
h
H
Hello Python
7Hello Python
7Hello Python
7Hello Python

示例3:\d

#coding=utf-8

import re

普通的匹配方式

ret = re.match("嫦娥1號","嫦娥1號發(fā)射成功")
print(ret.group())

ret = re.match("嫦娥2號","嫦娥2號發(fā)射成功")
print(ret.group())

ret = re.match("嫦娥3號","嫦娥3號發(fā)射成功")
print(ret.group())

使用\d進(jìn)行匹配

ret = re.match("嫦娥\d號","嫦娥1號發(fā)射成功")
print(ret.group())

ret = re.match("嫦娥\d號","嫦娥2號發(fā)射成功")
print(ret.group())

ret = re.match("嫦娥\d號","嫦娥3號發(fā)射成功")
print(ret.group())

運(yùn)行結(jié)果:

嫦娥1號
嫦娥2號
嫦娥3號
嫦娥1號
嫦娥2號
嫦娥3號
匹配多個字符

匹配多個字符的相關(guān)格式
字符 功能

  • 匹配前一個字符出現(xiàn)0次或者無限次,即可有可無
  • 匹配前一個字符出現(xiàn)1次或者無限次,即至少有1次
    ? 匹配前一個字符出現(xiàn)1次或者0次,即要么有1次,要么沒有
    {m} 匹配前一個字符出現(xiàn)m次
    {m,n} 匹配前一個字符出現(xiàn)從m到n次
    示例1:*

需求:匹配出,一個字符串第一個字母為大小字符,后面都是小寫字母并且這些小寫字母可有可無

#coding=utf-8
import re

ret = re.match("[A-Z][a-z]*","M")
print(ret.group())

ret = re.match("[A-Z][a-z]*","MnnM")
print(ret.group())

ret = re.match("[A-Z][a-z]*","Aabcdef")
print(ret.group())

運(yùn)行結(jié)果:

M
Mnn
Aabcdef

示例2:+

需求:匹配出,變量名是否有效

#coding=utf-8
import re

names = ["name1", "_name", "2_name", "name"]

for name in names:
ret = re.match("[a-zA-Z_]+[\w]*",name)
if ret:
print("變量名 %s 符合要求" % ret.group())
else:
print("變量名 %s 非法" % name)

運(yùn)行結(jié)果:

變量名 name1 符合要求
變量名 _name 符合要求
變量名 2_name 非法
變量名 name 符合要求

示例3:?

需求:匹配出,0到99之間的數(shù)字

#coding=utf-8
import re

ret = re.match("[1-9]?[0-9]","7")
print(ret.group())

ret = re.match("[1-9]?\d","33")
print(ret.group())

ret = re.match("[1-9]?\d","09")
print(ret.group())

運(yùn)行結(jié)果:

7
33
0 # 這個結(jié)果并不是想要的,利用$才能解決

示例4:{m}

需求:匹配出,8到20位的密碼,可以是大小寫英文字母、數(shù)字、下劃線

#coding=utf-8
import re

ret = re.match("[a-zA-Z0-9_]{6}","12a3g45678")
print(ret.group())

ret = re.match("[a-zA-Z0-9_]{8,20}","1ad12f23s34455ff66")
print(ret.group())

運(yùn)行結(jié)果:

12a3g4
1ad12f23s34455ff66

匹配開頭結(jié)尾
字符 功能
^ 匹配字符串開頭
匹配字符串結(jié)尾 示例1:

需求:匹配163.com的郵箱地址

#coding=utf-8

import re

email_list = ["xiaoWang@163.com", "xiaoWang@163.comheihei", ".com.xiaowang@qq.com"]

for email in email_list:
ret = re.match("[\w]{4,20}@163.com", email)
if ret:
print("%s 是符合規(guī)定的郵件地址,匹配后的結(jié)果是:%s" % (email, ret.group()))
else:
print("%s 不符合要求" % email)

運(yùn)行結(jié)果:

xiaoWang@163.com 是符合規(guī)定的郵件地址,匹配后的結(jié)果是:xiaoWang@163.com
xiaoWang@163.comheihei 是符合規(guī)定的郵件地址,匹配后的結(jié)果是:xiaoWang@163.com
.com.xiaowang@qq.com 不符合要求

完善后

email_list = ["xiaoWang@163.com", "xiaoWang@163.comheihei", ".com.xiaowang@qq.com"]

for email in email_list:
ret = re.match("[\w]{4,20}@163.com$", email)
if ret:
print("%s 是符合規(guī)定的郵件地址,匹配后的結(jié)果是:%s" % (email, ret.group()))
else:
print("%s 不符合要求" % email)

運(yùn)行結(jié)果:

xiaoWang@163.com 是符合規(guī)定的郵件地址,匹配后的結(jié)果是:xiaoWang@163.com
xiaoWang@163.comheihei 不符合要求
.com.xiaowang@qq.com 不符合要求

匹配分組

字符 功能
匹配左右任意一個表達(dá)式
(ab) 將括號中字符作為一個分組
\num 引用分組num匹配到的字符串
(?P<name>) 分組起別名
(?P=name) 引用別名為name分組匹配到的字符串

示例1:|

需求:匹配出0-100之間的數(shù)字

\#coding=utf-8

import re

ret = re.match("[1-9]?\d","8")
print(ret.group())  # 8

ret = re.match("[1-9]?\d","78")
print(ret.group())  # 78

# 不正確的情況
ret = re.match("[1-9]?\d","08")
print(ret.group())  # 0

# 修正之后的
ret = re.match("[1-9]?\d$","08")
if ret:
    print(ret.group())
else:
    print("不在0-100之間")

# 添加|
ret = re.match("[1-9]?\d$|100","8")
print(ret.group())  # 8

ret = re.match("[1-9]?\d$|100","78")
print(ret.group())  # 78

ret = re.match("[1-9]?\d$|100","08")
# print(ret.group())  # 不是0-100之間

ret = re.match("[1-9]?\d$|100","100")
print(ret.group())  # 100

示例2:( )

需求:匹配出163、126、qq郵箱

#coding=utf-8

import re

ret = re.match("\w{4,20}@163\.com", "test@163.com")
print(ret.group())  # test@163.com

ret = re.match("\w{4,20}@(163|126|qq)\.com", "test@126.com")
print(ret.group())  # test@126.com

ret = re.match("\w{4,20}@(163|126|qq)\.com", "test@qq.com")
print(ret.group())  # test@qq.com

ret = re.match("\w{4,20}@(163|126|qq)\.com", "test@gmail.com")
if ret:
    print(ret.group())
else:
    print("不是163、126、qq郵箱")  # 不是163、126、qq郵箱

不是以4、7結(jié)尾的手機(jī)號碼(11位)

import re

tels = ["13100001234", "18912344321", "10086", "18800007777"]

for tel in tels:
    ret = re.match("1\d{9}[0-35-68-9]", tel)
    if ret:
        print(ret.group())
    else:
        print("%s 不是想要的手機(jī)號" % tel)

提取區(qū)號和電話號碼

>>> ret = re.match("([^-]*)-(\d+)","010-12345678")
>>> ret.group()
'010-12345678'
>>> ret.group(1)
'010'
>>> ret.group(2)
'12345678'

示例3:\

需求:匹配出<html>hh</html>

#coding=utf-8

import re

# 能夠完成對正確的字符串的匹配
ret = re.match("<[a-zA-Z]*>\w*</[a-zA-Z]*>", "<html>hh</html>")
print(ret.group())

# 如果遇到非正常的html格式字符串,匹配出錯
ret = re.match("<[a-zA-Z]*>\w*</[a-zA-Z]*>", "<html>hh</htmlbalabala>")
print(ret.group())

# 正確的理解思路:如果在第一對<>中是什么,按理說在后面的那對<>中就應(yīng)該是什么

# 通過引用分組中匹配到的數(shù)據(jù)即可,但是要注意是元字符串,即類似 r""這種格式
ret = re.match(r"<([a-zA-Z]*)>\w*</\1>", "<html>hh</html>")
print(ret.group())

# 因為2對<>中的數(shù)據(jù)不一致,所以沒有匹配出來
test_label = "<html>hh</htmlbalabala>"
ret = re.match(r"<([a-zA-Z]*)>\w*</\1>", test_label)
if ret:
    print(ret.group())
else:
    print("%s 這是一對不正確的標(biāo)簽" % test_label)

運(yùn)行結(jié)果:

<html>hh</html>
<html>hh</htmlbalabala>
<html>hh</html>
<html>hh</htmlbalabala> 這是一對不正確的標(biāo)簽

示例4:\number

需求:匹配出<html><h1>www.itcast.cn</h1></html>

#coding=utf-8

import re

labels = ["<html><h1>www.itcast.cn</h1></html>", "<html><h1>www.itcast.cn</h2></html>"]

for label in labels:
    ret = re.match(r"<(\w*)><(\w*)>.*</\2></\1>", label)
    if ret:
        print("%s 是符合要求的標(biāo)簽" % ret.group())
    else:
        print("%s 不符合要求" % label)

運(yùn)行結(jié)果:

<html><h1>www.itcast.cn</h1></html> 是符合要求的標(biāo)簽
<html><h1>www.itcast.cn</h2></html> 不符合要求

示例5:(?P<name>) (?P=name)

需求:匹配出<html><h1>www.itcast.cn</h1></html>

#coding=utf-8

import re

ret = re.match(r"<(?P<name1>\w*)><(?P<name2>\w*)>.*</(?P=name2)></(?P=name1)>", "<html><h1>www.itcast.cn</h1></html>")
ret.group()

ret = re.match(r"<(?P<name1>\w*)><(?P<name2>\w*)>.*</(?P=name2)></(?P=name1)>", "<html><h1>www.itcast.cn</h2></html>")
ret.group()

注意:(?P<name>)(?P=name)中的字母p大寫

運(yùn)行結(jié)果:

image.png

re模塊的高級用法

search

需求:匹配出文章閱讀的次數(shù)

#coding=utf-8
import re

ret = re.search(r"\d+", "閱讀次數(shù)為 9999")
ret.group()

運(yùn)行結(jié)果:

'9999'

findall

需求:統(tǒng)計出python、c、c++相應(yīng)文章閱讀的次數(shù)

#coding=utf-8
import re

ret = re.findall(r"\d+", "python = 9999, c = 7890, c++ = 12345")
print(ret)

運(yùn)行結(jié)果:

['9999', '7890', '12345']

sub 將匹配到的數(shù)據(jù)進(jìn)行替換

需求:將匹配到的閱讀次數(shù)加1

方法1:

#coding=utf-8
import re

ret = re.sub(r"\d+", '998', "python = 997")
print(ret)

運(yùn)行結(jié)果:

python = 998

方法2:

#coding=utf-8
import re

def add(temp):
    strNum = temp.group()
    num = int(strNum) + 1
    return str(num)

ret = re.sub(r"\d+", add, "python = 997")
print(ret)

ret = re.sub(r"\d+", add, "python = 99")
print(ret)

運(yùn)行結(jié)果:

python = 998
python = 100

練習(xí)

image.png

從下面的字符串中取出文本

<div>
        <p>崗位職責(zé):</p>
<p>完成推薦算法、數(shù)據(jù)統(tǒng)計、接口、后臺等服務(wù)器端相關(guān)工作</p>
<p><br></p>
<p>必備要求:</p>
<p>良好的自我驅(qū)動力和職業(yè)素養(yǎng),工作積極主動、結(jié)果導(dǎo)向</p>
<p>&nbsp;<br></p>
<p>技術(shù)要求:</p>
<p>1、一年以上 Python 開發(fā)經(jīng)驗,掌握面向?qū)ο蠓治龊驮O(shè)計,了解設(shè)計模式</p>
<p>2、掌握HTTP協(xié)議,熟悉MVC、MVVM等概念以及相關(guān)WEB開發(fā)框架</p>
<p>3、掌握關(guān)系數(shù)據(jù)庫開發(fā)設(shè)計,掌握 SQL,熟練使用 MySQL/PostgreSQL 中的一種<br></p>
<p>4、掌握NoSQL、MQ,熟練使用對應(yīng)技術(shù)解決方案</p>
<p>5、熟悉 Javascript/CSS/HTML5,JQuery、React、Vue.js</p>
<p>&nbsp;<br></p>
<p>加分項:</p>
<p>大數(shù)據(jù),數(shù)理統(tǒng)計,機(jī)器學(xué)習(xí),sklearn,高性能,大并發(fā)。</p>

        </div>

參考答案:

re.sub(r"<[^>]*>|&nbsp;|\n", "", test_str)

split 根據(jù)匹配進(jìn)行切割字符串,并返回一個列表

需求:切割字符串“info:xiaoZhang 33 shandong”

#coding=utf-8
import re

ret = re.split(r":| ","info:xiaoZhang 33 shandong")
print(ret)

運(yùn)行結(jié)果:

['info', 'xiaoZhang', '33', 'shandong']

python貪婪和非貪婪

Python里數(shù)量詞默認(rèn)是貪婪的(在少數(shù)語言里也可能是默認(rèn)非貪婪),總是嘗試匹配盡可能多的字符;

非貪婪則相反,總是嘗試匹配盡可能少的字符。

在"*","?","+","{m,n}"后面加上?,使貪婪變成非貪婪。

>>> s="This is a number 234-235-22-423"
>>> r=re.match(".+(\d+-\d+-\d+-\d+)",s)
>>> r.group(1)
'4-235-22-423'
>>> r=re.match(".+?(\d+-\d+-\d+-\d+)",s)
>>> r.group(1)
'234-235-22-423'
>>>

正則表達(dá)式模式中使用到通配字,那它在從左到右的順序求值時,會盡量“抓取”滿足匹配最長字符串,在我們上面的例子里面,“.+”會從字符串的啟始處抓取滿足模式的最長字符,其中包括我們想得到的第一個整型字段的中的大部分,“\d+”只需一位字符就可以匹配,所以它匹配了數(shù)字“4”,而“.+”則匹配了從字符串起始到這個第一位數(shù)字4之前的所有字符。

解決方式:非貪婪操作符“?”,這個操作符可以用在"*","+","?"的后面,要求正則匹配的越少越好。

>>> re.match(r"aa(\d+)","aa2343ddd").group(1)
'2343'
>>> re.match(r"aa(\d+?)","aa2343ddd").group(1)
'2'
>>> re.match(r"aa(\d+)ddd","aa2343ddd").group(1) 
'2343'
>>> re.match(r"aa(\d+?)ddd","aa2343ddd").group(1)
'2343'
>>>

練一練

[圖片上傳失敗...(image-53eef0-1600844319562)]

字符串為:

<img data-original="https://rpic.douyucdn.cn/appCovers/2016/11/13/1213973_201611131917_small.jpg" src="https://rpic.douyucdn.cn/appCovers/2016/11/13/1213973_201611131917_small.jpg" style="display: inline;">

請?zhí)崛rl地址

參考答案

re.search(r"https://.*?\.jpg", test_str)

r的作用

mm = "c:\a\b\c"
mm
'c:\a\b\c'
print(mm)
c:\a\b\c
re.match("c:\\",mm).group()
'c:\'
ret = re.match("c:\\",mm).group()
print(ret)
c:
ret = re.match("c:\\a",mm).group()
print(ret)
c:\a
ret = re.match(r"c:\a",mm).group()
print(ret)
c:\a
ret = re.match(r"c:\a",mm).group()
Traceback (most recent call last):
File "<stdin>", line 1, in <module>
AttributeError: 'NoneType' object has no attribute 'group'

說明

Python中字符串前面加上 r 表示原生字符串,

與大多數(shù)編程語言相同,正則表達(dá)式里使用""作為轉(zhuǎn)義字符,這就可能造成反斜杠困擾。假如你需要匹配文本中的字符"",那么使用編程語言表示的正則表達(dá)式里將需要4個反斜杠"\":前兩個和后兩個分別用于在編程語言里轉(zhuǎn)義成反斜杠,轉(zhuǎn)換成兩個反斜杠后再在正則表達(dá)式里轉(zhuǎn)義成一個反斜杠。

Python里的原生字符串很好地解決了這個問題,有了原生字符串,你再也不用擔(dān)心是不是漏寫了反斜杠,寫出來的表達(dá)式也更直觀。

ret = re.match(r"c:\a",mm).group()
print(ret)
c:\a

最后編輯于
?著作權(quán)歸作者所有,轉(zhuǎn)載或內(nèi)容合作請聯(lián)系作者
【社區(qū)內(nèi)容提示】社區(qū)部分內(nèi)容疑似由AI輔助生成,瀏覽時請結(jié)合常識與多方信息審慎甄別。
平臺聲明:文章內(nèi)容(如有圖片或視頻亦包括在內(nèi))由作者上傳并發(fā)布,文章內(nèi)容僅代表作者本人觀點,簡書系信息發(fā)布平臺,僅提供信息存儲服務(wù)。

友情鏈接更多精彩內(nèi)容