您的位置:首页 > 编程语言

编程思想-正则匹配字符串的一些想法

2012-08-02 17:58 441 查看
首先,给大家出一个很简单的编程题:

*************************************************************************************************************

假设这有一个各种字母组成的字符串,假设这还有另外一个字符串,而且这个字符串里的字母数相对少一些。从算法是讲,什么方法能最快的查出所有小字符串里的字母在大字符串里都有?

比如,如果是下面两个字符串:

String 1: ABCDEFGHLMNOPQRS

String 2: DCGSRQPOM

答案是true,所有在string2里的字母string1也都有。如果是下面两个字符串:

String 1: ABCDEFGHLMNOPQRS

String 2: DCGSRQPOZ

答案是false,因为第二个字符串里的Z字母不在第一个字符串里。

************************************************************************************************************

大家能够想到的最简单最高效的算法是什么?

第一种思路:一次轮询短字符串的每个字符是否存在于长字符串。

从算法上讲,这需要
O(n*m)
次操作,其中n是string1的长度,m是string2的长度。就拿上面的例子来说,最坏的情况下将会有16*8
= 128次操作。

第二种思路:先对这两个字符串的字母进行排序,然后同时对两个字串依次轮询。两个字串的排序需要(常规情况)
O(m
log m) + O(n log n)
次操作。

第三种思路是:对第一个字串进行轮询,把其中的每个字母都放入一个Hashtable里。然后轮询第二个字串,在Hashtable里查询每个字母,看能否找到。如果找不到,说明没有匹配成功。同样拿上面的字串做例子,将会需要16*4 + 8*3 = 88加上对两个字串线性扫描的16 + 8 = 24的操作。

但是这仍然不是最好的。

大家很纳闷??

现在公布结果吧:

首先,将每一个字母分配一个素数(也就是2,3,5,7...)与之对应。例如:A-2,B-3,C-5.....

然后将长字符串的每一位都相乘起来,这样会得到一个很大的数字。

之后只需要轮询第二个字符串,用每个字母除它。如果除的结果有余数,这说明有不匹配的字母。如果整个过程中没有余数,你应该知道它是第一个字串恰好的子集了。

这个方案最坏的情况也只需要做String2长度的次数。是不是很高效呢?

-----------------------------------程序员 闫帆原创---------------------------------------

转载请注明原创人信息 程序员 闫帆yanfanvip
内容来自用户分享和网络整理,不保证内容的准确性,如有侵权内容,可联系管理员处理 点击这里给我发消息
标签: