模块

python内置模块之re模块

在python中要想使用正则必须借助于模块 re就是其中之一

"""基本操作方法"""
import re

# re.findall('正则表达式','待匹配的文本') # 根据正则匹配除所有符合条件的数据
res = re.findall('a', 'eva jason jackson')
print(res)  # 结果是一个列表(要么有元素 要么空列表)

# res = re.search('正则表达式','待匹配的文本')  # 根据正则匹配到一个符合条件的就结束
res = re.search('a','eva jason jackson')
print(res)  # 结果对象
print(res.group())  # 正在的结果
if res:
    print(res.group())
else:
    print('不好意思,没有找到')
"""如果没有符合条件的数据 那么search返回None 并且使用group会直接报错"""

res = re.match('a','abac')  # 根据正则从头开始匹配(文本内容必须在开头匹配上)
print(res)
print(res.group())
if res:
    print(res.group())
else:
    print('不好意思没有找到')
"""如果没有符合条件的数据 那么match返回None 并且使用group会直接报错"""

re模块其他方法

import re

# 先按'a'分割得到''和'bcd',再对''和'bcd'分别按b分割
res = re.split('[ab]','abcd')
print(res)  # ['', '', 'cd']

# 类似字符串类型的replace方法
res = re.sub('\d','H','eva3jason4yuan4',1)  # 替换正则匹配到的内容
res = re.sub('\d','H','eva3jason4yuan4')  # 不写替换所有
print(res)  # evaHjasonHyuanH

"""返回元组 并提示替换了几处"""
res = re.subn('\d','H','eva3jason4yuan4',1)
print(res)
res = re.subn('\d','H','eva3jason4yuan4',)
print(res)
import time

"""常用"""
regexp_obj = re.compile('\d+')
res = regexp_obj.search('123dsawd1234123sqde123123rsd13214r1ed123')
res1 = regexp_obj.match('ws12s1e12e3xdasd123e124r1')
res2 = regexp_obj.findall('12321dqqqdxase123dqe123de123dqe12')
print(res,res1,res2)

"""常用"""
res = re.finditer('\d+','qdwqdq65d12gfufgu7q6weh12gf3u67t5dqw1')
print([i.group() for i in res])

res = re.search('^[1-9](\d{14})(\d{2}[0-9x])?$','372861354972637834')
print(res)
print(res.group())
print(res.group(1))
print(res.group(2))

'''常用'''
findall针对分组优先展示    无名分组
res = re.findall("^[1-9]\d{14}(\d{2}[0-9x])?$",'372861354972637834')
print(res)
# 取消分组优先展示          无名分组
res1 = re.findall("^[1-9]\d{14}(?:\d{2}[0-9x])?$",'372861354972637834')
print(res1)

有名分组
res = re.search('^[1-9](?P<xxx>\d{14})(?P<ooo>\d{2}[0-9x])?$',"372861354972637834")
print(res)
print(res.group())  # 372861354972637834
print(res.group(1))  # 72861354972637
print(res.group('xxx'))  # 72861354972637
print(res.group('ooo'))  # 023

正则实战案例

import re

# 读取待匹配的数据
with open(r'a.txt','r',encoding='utf8') as f:
    data = f.read()
# 利用正则匹配数据
# 分公司名称
    res = re.findall('<h2>(.*?)</h2>',data)
print(res)
# 分公司地址
address_list = re.findall("<p class='mapIco'>(.*?)</p>",data)
print(address_list)
# 分公司邮箱
email_list = re.findall("<p class='mailIco'>(.*?)</p>", data)
print(email_list)
# 分公司电话
phone_list = re.findall("<p class='telIco'>(.*?)</p>",data)
print(phone_list)

res = zip(res,address_list,email_list,phone_list)
for data_tuple in res:
    print("""
    公司名称:%s
    公司地址:%s
    公司邮箱:%s
    公司电话:%s
    """ % (data_tuple[0],data_tuple[1],data_tuple[2],data_tuple[3])

collections模块

该模块内部提供了一些高阶的数据类型

# 1.namedtuple(具名元组)

from collections import namedtuple
"""
namedtuple('名称',[名字1,名字2,...])
namedtuple('名称','名字1 名字2 ...')
"""
point = namedtuple('坐标',['x','y'])
res = point(11,22)
print(res)
print(res.x)
print(res.y)

point = namedtuple('坐标','x y z')
res = point(11,22,33)
print(res)
print(res.x)
print(res.y)
print(res.z)

card = namedtuple('扑克','花色 点数')
card1 = card('♠','A')
card2 = card('♥','K')
print(card1)
print(card1.点数)
print(card1.花色)

# 2.队列模块
import  queue # 内置队列模块:FIFO

# 初始化队列
q = queue.Queue()

# 往列队中添加元素
q.put('first')
q.put('second')
q.put('third')

# 从队列中获取元素
print(q.get())
print(q.get())
print(q.get())
print(q.get())  # 值没了会原地等待

# 3.双端队列
from collections import deque
q = deque([11,22,33])
q.append(44)  # 从右边添加
q.appendleft(55)  # 从左边添加
print(q.pop())  # 从左边取值
print(q.popleft())  # 从右边取值

# 4.有序字典
normal_dict = dict([('name','jason'),('pwd',123),('hobby','study')])
print(normal_dict)
from collections import OrderedDict
order_dict = OrderedDict([('name','jason'),('pwd',123),('hobby','study')])
print(order_dict)
OrderedDict([('name','jason'),('pwd',123),('hobby','study')])
order_dict['xxx'] = 111
print(order_dict)
OrderedDict([('name','jason'),('pwd',123),('hobby','study')])
normal_dict['yyy'] = 222
print(normal_dict)

# 5.默认值字典
from  collections import defaultdict
values = [11,22,33,44,55,66,77,88,99,90]
my_dict = defaultdict(list)
for value in values:
    if value>60:
        my_dict['K1'].append(value)
    else:
        my_dict['k2'].append(value)
print(my_dict)

# 6.计数器
res = 'cbacbabcbacbacbabcbacbacb'
# 统计字符串中每个元素出现的次数
new_dict = {}
for i in res:
    if i not in new_dict:
        new_dict[i] = 1
    else:
        new_dict[i] +=1
print(new_dict)

from collections import Counter  # 计数器
ret = Counter(res)
print(ret)

time模块

"""
时间的三种表现形式
    1.时间戳(秒数)
    2.结构化时间(一般是给机器看的)
    3.格式化时间(一般是给人看的)
    三种时间是可以相互转换的!!!
"""
time.sleep()  # 原地阻塞指定的秒数
time.time()  # 获取时间戳时间
import time

# 格式化时间
print(time.strftime('%Y-%m-%d'))  # 2021-11-25
print(time.strftime('%Y-%m-%d %H:%M:%S'))  # 2021-11-25 17:21:50
print(time.strftime('%Y-%m-%d %X'))  # 2021-11-25 17:22:34
"""
更多时间相关符号 保存到容易查找到的位置即可
"""
print(time.localtime())
time.struct_time
tm_year=2021
tm_mon=11
tm_mday=25
tm_hour=17
tm_min=24
tm_sec=6
tm_wday=3
tm_yday=329
tm_isdst=0

print(time.time())
print(time.gmtime(11111111111))
print(time.localtime())

datetime模块

datetime
print(datetime.date.today())  # 2021-11-25
print(datetime.datetime.today())  # 2021-11-25 18:51:20.140301
"""date年月日  datetime年月日时分秒  time时分秒(MySQL django后期可以)"""
res = datetime.datetime.today()
print(res.year)  # 2021
print(res.month)  # 11
print(res.day)  # 25
print(res.weekday())  # 获取星期(weekday星期是0-6)  0表示周一
print(res.isoweekday())  # 获取星期(weekday星期是1-7)  1表示周一
"""时间差(timedelta)"""
ctime = datetime.datetime.today()
time_tel = datetime.timedelta(days=3)
print(ctime)  # 2021-11-25 18:56:46.571683
print(ctime - time_tel)  # 2021-11-22 18:56:46.571683
print(ctime + time_tel)  # 2021-11-28 18:56:46.571683
"""
日期对象 = 日期对象 +/- timedelta对象
timedelta对象 = 日期对象 +/- 日期对象
"""
ret = ctime + time_tel
print(ret - ctime)  # 3 days, 0:00:00
print(ctime - ret)  # -3 days, 0:00:00

# 小练习 计算举例今年离过生日还有多少天
birthday = datetime.date(2022, 11, 11)
now_date = datetime.date.today()
days = birthday - now_date
print('距离生日还有{}天'.format(days))

# UTC时间与我们东八区时间差 八个小时
print(datetime.datetime.now())  # 2021-11-25 19:03:22.680976
print(datetime.datetime.utcnow())  # 2021-11-25 11:03:22.680976

random模块

import random

print(random.random())  # 随机产生一个0-1之间的小数
print(random.randint(1, 6))  # 随机产生一个1-6之间的整数  掷骰子
print(random.uniform(1, 6))  # 随机产生一个1-6之间的小数
print(random.choice(['学习', '锻炼', '努力', '坚持', '勤奋']))  # 随机抽取一个
print(random.sample(['学习', '锻炼', '努力', '坚持', '勤奋'], 3))  # 随机抽取指定样本量
l = [2, 3, 4, 5, 6, 7, 8, 9, 10, 'J', 'Q', 'K', 'A']
random.shuffle(l)  # 随机打乱容器类型中的诸多元素
print(l)

# 搜狗公司笔试题
# 随机验证码可以是由数字 小写字母 大写 字母 任意组合
# 编写能够产生5位数的随机验证码
'''ps:五位 每位都可能是三种情况之一'''
def get_code(n):
    code = ''
    for i in range(n):
        num = str(random.randint(0,9))
        upper = chr(random.randint(65,90))
        lower = chr(random.randint(97,122))
        temp = random.choice([num,upper,lower])
        code += temp
    return code
print(get_code(6),get_code(4),get_code(9))

os模块


# 与操作系统打交道
import os

# 1.创建单级目录(文件夹)
os.mkdir('学习资料')
# os.mkdir(r'学习资料\c老师视频作品')  报错

# 2.创造多级目录(文件夹)
os.makedirs(r'c老师视频合集\s老师2021合集\1080p高清')

# 3.删除空目录(文件夹)
os.rmdir(r'学习资料')
os.removedirs(r'c老师视频合集')

# 4.获取当前文件所在的路径(可以嵌套)
BASE_DIR = os.path.dirname(__file__)

# 5.路径拼接(******)能够自动识别不同的操作系统分隔符问题
movie_dir = os.path.join(BASE_DIR,'老师教学视频')

# 6.列举出指定路径下的文件名称(任意类型文件)
data_movin_list = os.listdir('老师教学视频')
while True:
    for i,j in enumerate(data_movin_list):
        print(i+1,j)
    choice = input('请选择你想要看的文件编号>>>:').strip()
    if choice.isdigit():
        choice = int(choice)
        if choice in range(len(data_movin_list)+1):
            # 获取编号对应的文件名称
            file_name = data_movin_list[choice - 1]
            # 拼接文件的完整路径(*******)
            file_path = os.path.join(movie_dir,file_name)  # 专门用于路径拼接 并且能够自动识别当前操作系统的路径分隔符
            # 利用文件操作读写文件
            with open(file_path,'r',encoding='utf8') as f:
                print(f.read())
				
# 7.删除一个文件
os.remove('a.txt')

# 8.修改文件
os.rename('老文件名','新文件名')

# 9.获取当前工作路径
print(os.getcwd())

# 10.切换路径
os.chdir('D:/')
with open(r'a.txt','wb') as f:
    pass
	
# 11.判断路径是否存在
print(os.path.exists('a.txt'))  # False
print(os.path.exists('老师教学视频'))  #  True
print(os.path.exists('re模块.py'))  # True

# 12.判断当前路径是否是文件
print(os.path.isdir('re模块.py'))  # True
print(os.path.isdir('老师教学视频'))  # False

# 13.判断当前路径是否是文件夹
print(os.path.isdir('re模块.py'))  # False
print(os.path.isdir('老师教学视频'))  # True

# 14.获取文件大小(字节数)
print(os.path.ge

sys模块

# 主要和python解释器打交道

import sys

print(sys.path)  # 文件路径
print(sys.version)  # python解释器版本
print(sys.platform)  # 操作系统
print(sys.argv)  # 获取当前执行文件的绝对路径
try:
    username = sys.argv[1]
    password = sys.argv[2]
    if username == 'jason' and password == '123':
        print('正常执行文件内容')
    else:
        print('用户名和密码错误')
except Exception:
    print('用户名和密码')
    print('只能让你体验一下(游客模式)')

json模块

# josn格式数据:跨语言传输

import json

d = {'username':'jason','pwd':123}
# 1.将python其他数据转换成json格式字符串(序列化)
res = json.dumps(d)
print(res,type(res))  # {"username": "jason", "pwd": 123} <class 'str'>
# 2.将json格式字符串转换成当前语言对应的某个数据类型(反序列化)
res1 = json.loads(res)
print(res1,type(res1))  #  {'username': 'jason', 'pwd': 123} <class 'dict'>
bytes_data = b'{"username":"jason","pwd":123}'
bytes_str = bytes_data.decode('utf8')
bytes_dict = json.loads(bytes_str)
print(bytes_dict,type(bytes_dict))
"""
暂且可以简单的理解为
    序列化就是将其他数据类型转换成字符串过程
        json.dumps()
    反序列化就是将字符串转换成其他数据类型
        json.loads()
"""
# 将字典d写入文件
with open(r'a.txt','w',encoding='utf8') as f:
    f.write(str(d))
# 将字典取出来
with open(r'a.txt','r',encoding='utf8') as f:
    data = f.read()
    # print(dict(data))  # 报错

# 将字典d写入文件
with open(r'a.txt','w',encoding='utf8') as f:
    res = json.dumps(d)  # 序列化成json格式字符串
    f.write(res)
# 将字典d取出来
with open(r'a.txt','r',encoding='utf8') as f:
    data = f.read()
    res1 = json.loads(data)
    print(res1,type(res1))

d1 = {'username':'tony好帅哦 我好喜欢','pwd':123,'hobby':[11,22,33]}
print(json.dumps(d1,ensure_ascii=False))

"""
# 并不是所有的数据类型都支持序列化
json.JSONEncoder 查看支持的数据类型
"""

subprocess模块

import subprocess

"""
1.可以基于网络连接上一台计算机(soket模块)
2.让连接上的计算机执行我们需要执行的命令
3.将命令的结果返回
"""
res = subprocess.Popen('tasklist',
                       shell=True,
                       stdout=subprocess.PIPE,
                       stderr=subprocess.PIPE
                       )
print('stdout',res.stdout.read().decode('gbk'))  # 获取正确命令执行之后的结果
print('stderr',res.stderr.read().decode('gbk'))  # 获取错误命令执行之后的结果
"""
windows电脑内部编码默认GBK
"""

未完待续

更多文章请关注《万象专栏》