Python 优雅编程:会报恩的代码(五)

文章目录

    • 引言
    • 从文本搜索指定单词,不区分单词的大小写
      • 使用 `str.lower()`
      • 使用 `re` 模块
    • 从文本搜索多个单词,依旧不区分单词的大小写
      • 使用 `str.lower()` 和循环
      • 使用 `re` 模块
    • 反复执行 re.compile,re 是否会缓存编译结果?
    • 结语

引言

在 Python 编程中,有一些常用技巧和最佳实践可以帮助你编写更优雅、更高效的代码。本文将介绍的是使用 Python 从文本中搜索指定单词的几个简单实现方式。

在这里插入图片描述

从文本搜索指定单词,不区分单词的大小写

我们可以使用 Python 的内置字符串方法以及正则表达式来搜索文本中的指定单词,且不区分大小写。

使用 str.lower()

如果希望使用简单的字符串方法,可以将文本和目标单词都转换为小写,然后进行比较:

def search_word(text, word):
    # 转换为小写
    text_lower = text.lower()
    word_lower = word.lower()

    # 检查单词是否在文本中
    if word_lower in text_lower:
        return True
    return False

# 示例
text = "Hello, this is a sample Text."
word = "text"
found = search_word(text, word)
print(found)  # 输出: True

使用 re 模块

如果想使用正则表达式,可以用 re 模块的 re.IGNORECASE 选项:

import re

def search_word(text, word):
    # 使用正则表达式不区分大小写
    pattern = re.compile(re.escape(word), re.IGNORECASE)

    return bool(pattern.search(text))

# 示例
text = "Hello, this is a sample Text."
word = "text"
found = search_word(text, word)
print(found)  # 输出: True

这两种方法都可以有效地搜索文本中的指定单词,且不区分大小写。选择适合需求的方法即可。

从文本搜索多个单词,依旧不区分单词的大小写

如果希望在文本中搜索多个单词,可以扩展前面的示例。

使用 str.lower() 和循环

可以将多个单词转换为小写并逐个检查:

def search_words(text, words):
    # 转换为小写
    text_lower = text.lower()
    words_lower = [word.lower() for word in words]

    # 检查每个单词是否在文本中
    found_words = [word for word in words_lower if word in text_lower]
    return found_words

# 示例
text = "Hello, this is a sample Text."
words = ["text", "hello", "sample", "world"]
found = search_words(text, words)
print(found)  # 输出: ['text', 'hello', 'sample']

使用 re 模块

使用正则表达式可以创建一个模式,匹配多个单词:

import re

def search_words(text, words):
    # 创建正则表达式模式
    pattern = re.compile(r'\b(?:' + '|'.join(map(re.escape, words)) + r')\b', re.IGNORECASE)

    # 搜索所有匹配的单词
    return pattern.findall(text)

# 示例
text = "Hello, this is a sample Text."
words = ["text", "hello", "sample", "world"]
found = search_words(text, words)
print(found)  # 输出: ['Hello', 'Text', 'sample']

其中的正则表达式的作用是将多个单词组合成一个正则模式。确保这些单词作为独立的整词出现(通过使用单词边界)。在搜索时不区分大小写。

例如,如果 words 列表包含 ["cat", "dog"],则编译后的 pattern 表达式将类似于:

r'\b(?:cat|dog)\b'

这样,这个模式就可以匹配文本中的“cat”或“dog”,并且这些单词必须是独立的,不是其他词的一部分。

这段正则表达式用于编译一个模式,以匹配多个指定单词。表达式每个部分的详细解释如下。

r'\b(?:...)\b'

  • r'...': 这是一个原始字符串(raw string),它告诉 Python 不要对字符串中的反斜杠进行转义处理。这在> 编写正则表达式时非常有用,因为正则中的很多模式都包含反斜杠。

  • \b: 这是一个单词边界(word boundary)匹配符。它匹配单词的开始或结束位置,确保匹配的单词是完整的,> 而不是长词的一部分。例如,在匹配“cat”时,\bcat\b只会匹配“cat”这个词,而不会匹配“category”中的“cat”。

  • (?:...): 这是一个非捕获分组(non-capturing group)。它的作用是将多个元素组合在一起,但不创建一个> 捕获组。这样可以在正则表达式中将多个选项组合在一起,而不会增加额外的捕获组。

|(或操作符)

  • '|'.join(map(re.escape, words)): 这段代码会将 words 列表中的所有单词通过 |(或操作符)连接> 成一个长字符串。map(re.escape, words) 用于处理 words 列表中每个单词,确保特殊字符不会影响正则表达式> 的匹配。例如,如果单词中有点号、星号等特殊字符,re.escape 会在这些字符前添加反斜杠,使其被视为字面字符。

re.IGNORECASE

  • 这是一个标志,表示匹配时不区分大小写。当这个标志被设置,正则表达式的匹配会忽略字母的大小写。

以上两种方法都可以有效地搜索文本中的多个指定单词。可以根据需求选择适合的方法。第一种方法直接使用字符串方法,第二种方法则利用正则表达式提供了更强大的功能。

反复执行 re.compile,re 是否会缓存编译结果?

Python 的 re 模块是会缓存编译的正则表达式的。这个缓存机制可以有效提高性能,避免对同一模式的重复编译。

缓存机制

当使用 re.compile() 编译一个正则表达式时,Python 会创建一个正则表达式对象,并在内部进行一些优化。

re 模块会在内部缓存最近使用的正则表达式。具体来说,Python 会保留最后 1000 个不同的模式,以供后续的重复使用。如果在同一程序运行中多次使用 re.compile() 编译相同的模式,Python 会直接返回缓存中的已经编译的对象而不是重复编译。

性能提升

缓存机制的作用明显,正则表达式的编译是一个相对昂贵的操作。通过避免重复编译,可以显著提高代码的运行效率。

最佳实践

如果在多个不同的字典或列表中使用相同的正则表达式模式,并在此过程中调用 re.compile(),那么如果模式相同,Python 会利用缓存。但是,为了保证最佳性能,尤其在频繁使用的情况下,建议将相同的正则表达式编译一次并存储在变量中,而不是每次都调用 re.compile()

验证示例

# 多次使用相同的正则表达式
pattern1 = re.compile(r'\bcat\b', re.IGNORECASE)
pattern2 = re.compile(r'\bcat\b', re.IGNORECASE)

# pattern1 和 pattern2 是相同的模式
print(pattern1 is pattern2)  # 输出可能为 False,但模式是相同的
# True

在处理不同单词集合时,建议在循环外部编译正则模式,确保良好的性能并充分利用缓存特性。

结语

本文介绍了使用 Python 从文本中搜索指定单词的几个特定用法,并验证了 re.compile 中缓存的存在,希望这些小技巧能在某个特定的时间正好帮到你。


PS:感谢每一位志同道合者的阅读,欢迎关注、点赞、评论!


  • 上一篇:Python 优雅编程:会报恩的代码(四)
  • 专栏:「计算通践」

本文来自互联网用户投稿,该文观点仅代表作者本人,不代表本站立场。本站仅提供信息存储空间服务,不拥有所有权,不承担相关法律责任。如若转载,请注明出处:/a/872636.html

如若内容造成侵权/违法违规/事实不符,请联系我们进行投诉反馈qq邮箱809451989@qq.com,一经查实,立即删除!

相关文章

苹果mac数据恢复概率大吗 mac数据恢复专业软件哪个好用

一般情况下,当我们把电脑中的数据删掉后,都会保存在回收站里面,但如果回收站被清空了或者数据在回收站中没有找到的话,那么,之前被删掉的数据还能恢复吗?恢复的概率有多大呢? 答案是可以的&…

链式栈、队列

1、链式栈&#xff1a; 声明&#xff1a; #ifndef _STACK_H #define _STACK_H #include<stdlib.h>typedef int DataType;typedef struct snode //节点 {DataType data;struct snode *pnext; }SNode_t;typedef struct stack //链表 {SNode_t *ptop;int clen; }St…

【python】—— Python爬虫实战:爬取珠海市2011-2023年天气数据并保存为CSV文件

目录 目标 准备工作 爬取数据的开始时间和结束时间 爬取数据并解析 将数据转换为DataFrame并保存为CSV文件 本文将介绍如何使用Python编写一个简单的爬虫程序,以爬取珠海市2011年至2023年的天气数据,并将这些数据保存为CSV文件。我们将涉及到以下知识点: 使用r…

金九银十,自动化测试面试题精选【美团二面】

面试一般分为技术面和hr面&#xff0c;形式的话很少有群面&#xff0c;少部分企业可能会有一个交叉面&#xff0c;不过总的来说&#xff0c;技术面基本就是考察你的专业技术水平的&#xff0c;hr面的话主要是看这个人的综合素质以及家庭情况符不符合公司要求&#xff0c;一般来…

Kubernetes 上安装 Jenkins

安装 Helm curl https://raw.githubusercontent.com/helm/helm/main/scripts/get-helm-3 | bash添加 Jenkins Helm 仓库 首先添加 Jenkins Helm 仓库 helm repo add jenkins https://charts.jenkins.io helm repo update安装 Jenkins 使用 Helm 安装 Jenkins 的最新版本&…

uni-app应用更新(Android端)

关于app更新&#xff0c;uni-app官方推荐的是 uni-upgrade-center&#xff0c;看了下比较繁琐&#xff0c;因此这里自己实现检查更新并下载安装的逻辑。 1.界面效果 界面中的弹框和 进度条采用了uView 提供的组件 2.检查更新并下载安装 一、版本信息配置在服务端&#xff0c…

时装爱好者的网页购物天堂:Spring Boot技术探索

第2章相关技术 2.1 B/S架构 B/S结构的特点也非常多&#xff0c;例如在很多浏览器中都可以做出信号请求。并且可以适当的减轻用户的工作量&#xff0c;通过对客户端安装或者是配置少量的运行软件就能够逐步减少用户的工作量&#xff0c;这些功能的操作主要是由服务器来进行控制的…

详解TensorRT的C++高性能部署以及C++部署Yolo实践

详解TensorRT的C高性能部署 一. ONNX1. ONNX的定位2. ONNX模型格式3. ONNX代码使用实例 二、TensorRT1 引言 三、C部署Yolo模型实例 一. ONNX 1. ONNX的定位 ONNX是一种中间文件格式&#xff0c;用于解决部署的硬件与不同的训练框架特定的模型格式的兼容性问题。 ONNX本身其…

JAVA数据导出为Excel

目录 一、导入依赖 二、使用的相关类 1、XSSFWorkbook 构造方法 创建表 操作表 保存表 样式和格式 日期处理 密码保护 其他 2、XSSFSheet 获取属性和信息 行操作 列操作 表的属性 合并单元格 保护表 页眉和页脚 注释 其它 3、XSSFRow 获取属性和信息 单…

单点登录OAuth2.0

OAuth 2.0&#xff08;Open Authorization 2.0&#xff09;是OAuth协议的第二个版本&#xff0c;于2012年正式成为RFC 6749标准。在OAuth 2.0之前&#xff0c;OAuth 1.0版本已经为Web应用提供了一定程度的授权功能&#xff0c;但随着时间的推移&#xff0c;这些版本逐渐显露出一…

Nginx: TCP建立连接的优化和启用Fast Open功能

TCP 建立连接优化 在三次握手中&#xff0c;相关TCP的内核参数可优化这一过程 net.ipv4.tcp_syn_retries 6net.ipv4.tcp_synack_retries 5net.ipv4.tcp_syncookies 0net.ipv4.tcp_max_syn_backlognet.core.somaxconnnet.core.netdev_max_backlog 1 &#xff09; net.ipv4…

C语言之猜数字小游戏

哈喽&#xff0c;大家好&#xff01;我是冰淇淋加点糖。今天我们来用前面所学的知识来开发一个猜数字的小游戏&#xff0c;锻炼我们的编程能力和编程思维。 猜数字小游戏功能简介 1.随机生成一个1-100的数字。 2.玩家用户开始猜数字。 > 猜大了&#xff0c;提醒猜大了…

【知识库系列】MPR/多模态方向观察:图像视频与3D生成

多模态背后的backbone会长成什么样&#xff1f; 各种模态到梯度下降到最后会不会都差不多&#xff1f; Sora 是不是已经被追上了? 我们真的把视频数据都用好了吗&#xff1f; 知识库完整文档&#xff1a; MPR/多模态方向观察&#xff1a;图像视频与3D生成&#xff1a;https…

SpringBoot实现前后端传输加密设计

在Web应用中&#xff0c;确保前后端之间的数据传输安全是非常重要的。这通常涉及到使用HTTPS协议、数据加密、令牌验证等安全措施。本文通过将前后端之间的传输数据进行加密&#xff0c;用于在Spring Boot应用中实现前后端传输加密设计。 一、数据加密方案 即使使用了HTTPS&…

java利用JXL操作excel

通过JXL操作Excel JXL是韩国人所著,目前停止更新,只支持xls格式,即2007之前的版本 import java.io.File; import java.io.FileInputStream; import java.io.FileNotFoundException; import java.io.IOException; import java.io.InputStream; import java.net.URL; import java…

c# checkbox的text文字放到右边

checkbox的text文字放到右边 实现方法如下图 特此记录 anlog 2024年9月2日

Tensorflow实现深度学习8:猫狗识别

本文为为&#x1f517;365天深度学习训练营内部文章 原作者&#xff1a;K同学啊 一 导入数据 import matplotlib.pyplot as plt import tensorflow as tf # 支持中文 plt.rcParams[font.sans-serif] [SimHei] # 用来正常显示中文标签 plt.rcParams[axes.unicode_minus] Fals…

带AI功能朵米客服系统3.5无限制开心版+搭建文档

带AI功能朵米客服系统3.5无限制开心版搭建文档&#xff0c;朵米客服系统是一款全功能的客户服务解决方案&#xff0c;提供多渠道支持&#xff08;如在线聊天、邮件、电话等&#xff09;&#xff0c;帮助企业建立与客户的实时互动。该系统具有智能分流功能&#xff0c;可以快速将…

万象奥科参展“2024 STM32全国巡回研讨会”—深圳站、广州站

9月3日-9月5日&#xff0c;万象奥科参展“2024 STM32全国巡回研讨会”— 深圳站、广州站。此次STM32研讨会将会走进全国11个城市&#xff0c;展示STM32在智能工业、无线连接、边缘人工智能、安全、图形用户界面等领域的产品解决方案及多样化应用实例&#xff0c;深入解读最新的…

【RabbitMQ之一:windows环境下安装RabbitMQ】

目录 一、下载并安装Erlang1、下载Erlang2、安装Erlang3、配置环境变量4、验证erlang是否安装成功 二、下载并安装RabbitMQ1、下载RabbitMQ2、安装RabbitMQ3、配置环境变量4、验证RabbitMQ是否安装成功5、启动RabbitMQ服务&#xff08;安装后服务默认自启动&#xff09; 三、安…