九章算法面试题19 最常访问IP
2015-05-12 13:41
218 查看
九章算法官网-原文网址
http://www.jiuzhang.com/problem/19/题目
给你一个海量的日志数据,提取出某日访问网站次数最多的IP地址。解答
将日志文件划分成适度大小的M份存放到处理节点。每个map节点所完成的工作:统计访问百度的ip的出现频度(比较像统计词频,使用字典树),并完成相同ip的合并(combine)。
map节点将其计算的中间结果partition到R个区域,并告知master存储位置,所有map节点工作完成之后,reduce节点首先读入数据,然后以中间结果的key排序,对于相同key的中间结果调用用户的reduce函数,输出。
扫描reduce节点输出的R个文件一遍,可获得访问网站度次数最多的ip。
面试官角度
该问题是经典的Map-Reduce问题。一般除了问最常访问,还可能会问最常访问的K个IP。一般来说,遇到这个问题要先回答Map-Reduce的解法。因为这是最常见的解法也是一般面试官的考点。如果面试官水平高一点,要进一步问你有没有其他解法的话,该问题有很多概率算法。能够在极少的空间复杂度内,扫描一遍log即可得到Top k Frequent Items(在一定的概率内)。有兴趣的读者,可以搜搜“Sticky Sampling”,”Lossy Counting”这两个算法。相关文章推荐
- 算法系列-大数据面试题-在超大文件中找出访问百度次数最多的IP
- 九章算法面试题5 有序数组合并
- 九章算法面试题29 子矩阵的最大公约数
- 九章算法面试题41 判断单词的包含关系
- 九章算法面试题46 正负交替
- 九章算法面试题62 合并k个排序数组
- 3295 落单的数 九章算法面试题
- 面试题之九章算法 字符串编辑距离
- lintcode&九章算法——Google面试题:原子计数
- 九章算法面试题9 前k大的和
- 九章算法面试题31 子数组的最大差
- 九章算法面试题42 构造MaxTree
- 九章算法面试题47 分糖果
- 九章算法面试题63 快速幂
- lintcode&九章算法——Google面试题 | 有效括号字符串 ? 待解决
- 九章算法面试题43 直方图内最大矩阵
- 九章算法面试题48 分割回文串
- 九章算法面试题64 找第k大的特殊数
- 九章算法面试题10 赛马问题
- 九章算法面试题32 小球排序