您现在的位置： 365建站网 > 365文章 > 正则表达式匹配不包含某些字符串的方法

正则表达式匹配不包含某些字符串的方法

文章来源：365jz.com 点击数：1994 更新时间：2017-08-09 16:03 参与评论

找出所有img标签的，没有带说明属性alt的标签：

正则：<img(?![^<>]*?alt[^<>]*?>).*?>
例子：<img src="" alt=""> <img src="" > <img src="" title=""> <img src="" id=""> <img src="" title="" alt="">

扩展，如果要找没有带title属性的a应该是：

正则：<a(?![^<>]*?title[^<>]*?>).*?>
例子：<a src="" alt=""> <a src="" > <a src="" title=""> <a src="" id=""> <a src="" title="" alt="">
用正则表达式找出不包含连续字符串abc的单词

[^abc]表示不包含a、b、c中任意字符, 我想实现不包含字符串abc应该如何写表达式?

就我自己而言，这个问题最简单的解决方法是使用编程语言的配合，找出那些包含abc的，剩下的就是不包含的了——懒人的风格。但我写的是教程，读者未必都有编程的基础，有些只是使用一些工具从txt文档中抽取出一些信息，所以要回答还是必须完全通过正则表达式来完成。

于是打开了RegexTester,开始试验，先是试了使用((?'test'abc)|.)*(?(test)(?!))(含意是：查找abc，或任意的字符，如果找到了abc,就把它存入命名为test的组里，到最后检查test组里是否有内容，如果有就匹配失败，相关说明见教程)，结果是"abc","aabc","abcd","aa"都能通过测试，看来是到最后测试到test组存在后又回溯了，此解决方案不可行。

然后又试了(.(?!abc))*（找出所有后面不是abc的字符），结果是"abc","abcd"通过测试，"aabc"则只截取了后面的"abc",显然不行。

那加强条件试试:((?<!abc).(?!abc))*(找出所有前面和后面都不是abc的字符)，结果是所有包含abc的字符串都只截取了里面的"abc",不包含abc的则直接通过。

现在看来有点戏了，但是怎么把那些内部包含abc的字符串过滤掉呢？这个问题换句话说也就是怎么匹配整体而不是部分呢？现在需要明确用户的需求了：如果用户想要找的是单词，那就在表达式的两端加上\b,如果要找的是行，就加上^和$。由于用户的问题没有明确说明，我就当作是单词吧。

于是等到了这样的表达式：\b((?<!abc).(?!abc))*\b,经过测试，这个表达式能匹配所有不包含abc的单词，以及单词abc。

怎么排除单词abc?经过一番思考，最后我认为判断单词是否以a开头的方式最为方便：\b(a(?!bc)|[^a](?!abc))((?<!abc).(?!abc))*\b(要么以后面不是bc的a开头，要么不以a开头，除了开头后面所有的字符必须前面和后面都不是abc)。经过测试，完全满足要求，Bingo!

使用正则表达式查找不包含连续字符串abc的单词,最终结果：\b(a(?!bc)|[^a](?!abc))((?<!abc).(?!abc))*\b
----------------

更新:根据maple的评论,更简洁的作法是:\b((?!abc)\w)+\b

经常我们会遇到想找出不包含某个字符串的文本，程序员最容易想到的是在正则表达式里使用，^(hede)来过滤”hede”字串，但这种写法是错误的。我们可以这样写：[^hede]，但这样的正则表达式完全是另外一个意思，它的意思是字符串里不能包含‘h'，‘e'，‘d'三个但字符。那什么样的正则表达式能过滤出不包含完整“hello”字串的信息呢？

事实上，说正则表达式里不支持逆向匹配并不是百分之百的正确。就像这个问题，我们就可以使用否定式查找来模拟出逆向匹配，从而解决我们的问题：

^((?!hede).)*$

上面这个表达式就能过滤出不包含‘hede'字串的信息。我上面也说了，这种写法并不是正则表达式“擅长”的用法，但它是可以这样用的。

解释

一个字符串是由n个字符组成的。在每个字符之前和之后，都有一个空字符。这样，一个由n个字符组成的字符串就有n+1个空字符串。我们来看一下“ABhedeCD”这个字符串：

所有的e编号的位置都是空字符。表达式(?!hede).会往前查找，看看前面是不是没有“hede”字串，如果没有(是其它字符)，那么.(点号)就会匹配这些其它字符。这种正则表达式的“查找”也叫做“zero-width-assertions”(零宽度断言)，因为它不会捕获任何的字符，只是判断。

在上面的例子里，每个空字符都会检查其前面的字符串是否不是‘hede'，如果不是，这.(点号)就是匹配捕捉这个字符。表达式(?!hede).只执行一次，所以，我们将这个表达式用括号包裹成组(group)，然后用*(星号)修饰——匹配0次或多次：

((?!hede).)*。

你可以理解，正则表达式((?!hede).)*匹配字符串"ABhedeCD"的结果false，因为在e3位置，(?!hede)匹配不合格，它之前有"hede"字符串，也就是包含了指定的字符串。

在正则表达式里， ?! 是否定式向前查找，它帮我们解决了字符串“不包含”匹配的问题。

以下是一些补充：

分享下php生成随机数的三种方法，生成1-10之间的不重复随机数，php生成不重复随机数的例子，需要的朋友参考下。

在hacker news上看到regex golf，几道很有趣的正则表达式的题，有的需要用到不匹配这种匹配，比如需要匹配不包含某个单词的串。

开始正题之前，先来看看正则表达式的语法：

[abc] a或b或c . 任意单个字符 a? 零个或一个a [^abc] 任意不是abc的字符 \s 空格 a* 零个或多个a [a-z] a-z的任意字符 \S 非空格 a+ 一个或多个a [a-zA-Z] a-z或A-Z \d 任意数字 a{n} 正好出现n次a ^ 一行开头 \D 任意非数字 a{n,} 至少出现n次a $ 一行末尾 \w 任意字母数字或下划线 a{n,m} 出现n-m次a (...) 括号用于分组 \W 任意非字母数字或下划线 a*? 零个或多个a(非贪婪) (a|b) a或b \b 单词边界 (a)...\1 引用分组 (?=a) 前面有a (?!a) 前面没有a \B 非单词边界

正则表达式中有(?=a)和(?!a)来表示我们是否需要匹配某个东西。

所以，有需要不匹配某样内容时，就可以用(?!a)了。比如要匹配不含hello的字符串就可以这样写。


^(?!.*hello)

这里.*用来表示hello之前可能有其他的字符，为什么还要加^呢，因为如果不加的话，可能匹配到h之后的这个位置上了。

现在就可以解决regex golf上的abba这道题了。这道题是去匹配不含abba这种形式的单词，比如abba，anallagmatic就不应该匹配上。

正则表达式代码：


^(?!.*(.)(.)\2\1)

然后利用不匹配，还可以解决prime这道题，这道题匹配有素数个x的串，先看正则。


^(?!(xx+)\1+$)

(xx+)是匹配2个及2个以上的x，(xx+)\1+就是匹配重复出现2个及以上的串，所以(xx+)\1+就表示了那些非素数的串，那么素数串就是除去这些非素数串，即是以上的正则表达式了。

PS：关于正则，本站还提供了2款非常简便实用的正则测试工具供大家使用：

JavaScript正则表达式在线测试工具： http://tools.jb51.net/regex/javascript

正则表达式在线生成工具： http://tools.jb51.net/regex/create_reg

正则表达式

如对本文有疑问，请提交到交流论坛，广大热心网友会为你解答！！点击进入论坛

您可能感兴趣的文章:

发表评论 (1994人查看，0条评论): 请自觉遵守互联网相关的政策法规，严禁发布色情、暴力、反动的言论。

昵称：

最新评论

------分隔线----------------------------

上一篇：dos 文件复制 copy命令的用法
下一篇：Windows下如何修改MySQL用户root密码

大家感兴趣的内容

正则表达式匹配不包含某些字符串的方法

您可能感兴趣的文章:

公司信息

快速入口

其它栏目

业务咨询