2022年十五道海量数据处理面试题共页 .pdf

上传人:C****o 文档编号:33678093 上传时间:2022-08-12 格式:PDF 页数:11 大小:260.24KB
返回 下载 相关 举报
2022年十五道海量数据处理面试题共页 .pdf_第1页
第1页 / 共11页
2022年十五道海量数据处理面试题共页 .pdf_第2页
第2页 / 共11页
点击查看更多>>
资源描述

《2022年十五道海量数据处理面试题共页 .pdf》由会员分享,可在线阅读,更多相关《2022年十五道海量数据处理面试题共页 .pdf(11页珍藏版)》请在taowenge.com淘文阁网|工程机械CAD图纸|机械工程制图|CAD装配图下载|SolidWorks_CaTia_CAD_UG_PROE_设计图分享下载上搜索。

1、第 1 页第一部分、十五道海量数据处理面试题1. 给定 a、b 两个文件,各存放50 亿个 url ,每个 url各占 64 字节,内存限制是4G ,让你找出 a、b 文件共同的url ?方案 1:可以估计每个文件安的大小为50G 64=320G ,远远大于内存限制的4G 。所以不可能将其完全加载到内存中处理。考虑采取分而治之的方法。1. 遍历文件 a,对每个 url 求取,然后根据所取得的值将url分别存储到 1000 个小文件(记为)中。这样每个小文件的大约为 300M 。2. 遍历文件 b,采取和 a 相同的方式将url 分别存储到 1000 小文件中(记为)。这样处理后,所有可能相同的

2、url 都在对应的小文件()中,不对应的小文件不可能有相同的url 。然后我们只要求出1000 对小文件中相同的url 即可。3. 求每对小文件中相同的url时,可以把其中一个小文件的url存储到hash_set 中。然后遍历另一个小文件的每个url ,看其是否在刚才构建的hash_set 中,如果是,那么就是共同的url ,存到文件里面就可以了。方案 2:如果允许有一定的错误率,可以使用Bloom filter,4G内存大概可以表示 340 亿 bit 。将其中一个文件中的url使用 Bloom filter映射为这 340 亿 bit ,然后挨个读取另外一个文件的url ,检查是否与Blo

3、om filter,如果是,那么该url应该是共同的url (注意会有一定的错误率)。读者反馈 crowgns :1. hash 后要判断每个文件大小,如果hash 分的不均衡有文件较大,还应继续 hash 分文件,换个hash 算法第二次再分较大的文件,一直分到没有较大的文件为止。这样文件标号可以用A1-2 表示(第一次hash 编号为 1,文件较大所以参加第二次hash,编号为 2)2. 由于 1 存在,第一次hash 如果有大文件,不能用直接set 的方法。建议对每个文件都先用字符串自然顺序排序,然后具有相同hash 编号的(如都是 1-3,而不能 a 编号是 1,b 编号是 1-1 和

4、 1-2),可以直接从头到尾名师资料总结 - - -精品资料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 1 页,共 11 页 - - - - - - - - - 第 2 页比较一遍。对于层级不一致的,如a1,b 有 1-1 ,1-2-1 ,1-2-2 ,层级浅的要和层级深的每个文件都比较一次,才能确认每个相同的uri 。2. 有 10 个文件,每个文件1G ,每个文件的每一行存放的都是用户的query ,每个文件的 query 都可能重复。要求你按照query 的频度排序。方案 1:1. 顺序读取 10 个文件

5、,按照hash(query)%10 的结果将 query 写入到另外10 个文件(记为)中。这样新生成的文件每个的大小大约也1G(假设 hash 函数是随机的)。2. 找一台内存在2G左右的机器,依次对用 hash_map(query, query_count) 来统计每个 query 出现的次数。利用快速/ 堆/ 归并排序按照出现次数进行排序。将排序好的query 和对应的 query_cout输出到文件中。这样得到了10 个排好序的文件(记为)。3. 对这 10 个文件进行归并排序(内排序与外排序相结合)。方案 2:一般 query 的总量是有限的,只是重复的次数比较多而已,可能对于所有的

6、query ,一次性就可以加入到内存了。这样,我们就可以采用trie树/hash_map 等直接来统计每个 query 出现的次数,然后按出现次数做快速/ 堆/ 归并排序就可以了(读者反馈 店小二:原文第二个例子中:“找一台内存在2G左右的机器,依次对用 hash_map(query, query_count)来统计每个query 出现的次数。”由于query会重复,作为key 的话,应该使用hash_multimap 。hash_map 不允许 key 重复。此反馈是否正确,待日后考证)。方案 3:与方案 1 类似,但在做完hash,分成多个文件后,可以交给多个文件来处理,采用分布式的架构来

7、处理(比如MapReduce ),最后再进行合并。3. 有一个 1G大小的一个文件,里面每一行是一个词,词的大小不超过16 字节,内存限制大小是1M 。返回频数最高的100 个词。名师资料总结 - - -精品资料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 2 页,共 11 页 - - - - - - - - - 第 3 页方案 1:顺序读文件中,对于每个词x,取,然后按照该值存到5000个小文件(记为)中。这样每个文件大概是200k 左右。如果其中的有的文件超过了1M大小,还可以按照类似的方法继续往下分,知道分

8、解得到的小文件的大小都不超过1M 。对每个小文件,统计每个文件中出现的词以及相应的频率(可以采用 trie树/hash_map 等),并取出出现频率最大的100 个词(可以用含100 个结点的最小堆),并把100 词及相应的频率存入文件,这样又得到了5000个文件。下一步就是把这5000 个文件进行归并(类似与归并排序)的过程了。4. 海量日志数据,提取出某日访问百度次数最多的那个IP。方案 1:首先是这一天,并且是访问百度的日志中的IP 取出来,逐个写入到一个大文件中。注意到IP 是 32 位的,最多有232 个 IP。同样可以采用映射的方法,比如模 1000,把整个大文件映射为1000 个

9、小文件,再找出每个小文中出现频率最大的 IP (可以采用 hash_map进行频率统计,然后再找出频率最大的几个)及相应的频率。然后再在这1000 个最大的 IP 中,找出那个频率最大的IP ,即为所求。5. 在 2.5 亿个整数中找出不重复的整数,内存不足以容纳这2.5 亿个整数。方案 1:采用 2-Bitmap (每个数分配 2bit ,00 表示不存在, 01 表示出现一次, 10表示多次, 11 无意义)进行,共需内存232*2bit=1GB 内存,还可以接受。然后扫描这 2.5 亿个整数,查看Bitmap 中相对应位,如果是00 变 01,01 变 10,10 保持不变。所描完事后,

10、查看bitmap ,把对应位是01 的整数输出即可。方案 2:也可采用上题类似的方法,进行划分小文件的方法。然后在小文件中找出不重复的整数,并排序。然后再进行归并,注意去除重复的元素。6. 海量数据分布在100 台电脑中,想个办法高效统计出这批数据的TOP10 。方案 1:1. 在每台电脑上求出TOP10 ,可以采用包含10 个元素的堆完成(TOP10小,用最大堆, TOP10大,用最小堆)。比如求TOP10大,我们首先取前10个元素调整成最小堆,如果发现,然后扫描后面的数据,并与堆顶元素比较,如果比堆顶元素大,那么用该元素替换堆顶,然后再调整为最小堆。最后堆中的元素就是TOP10大。名师资料

11、总结 - - -精品资料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 3 页,共 11 页 - - - - - - - - - 第 4 页2. 求出每台电脑上的TOP10 后,然后把这100 台电脑上的 TOP10组合起来,共 1000 个数据,再利用上面类似的方法求出TOP10就可以了。(更多可以参考: 第三章、寻找最小的k 个数,以及 第三章续、 Top K 算法问题的实现)读者反馈 QinLeopard:第 6 题的方法中,是不是不能保证每个电脑上的前十条,肯定包含最后频率最高的前十条呢?比如说第一个文件中

12、:A(4), B(5), C(6), D(3) 第二个文件中: A(4),B(5),C(3),D(6) 第三个文件中 : A(6), B(5), C(4), D(3) 如果要选 Top(1), 选出来的结果是A,但结果应该是B。July:我想,这位读者可能没有明确提议。本题目中的TOP10是指最大的10 个数,而不是指出现频率最多的10 个数。但如果说,现在有另外一提,要你求频率最多的 10 个,相当于求访问次数最多的10 个 IP 地址那道题,即是本文中上面的第4题。特此说明。7. 怎么在海量数据中找出重复次数最多的一个?方案 1:先做 hash,然后求模映射为小文件,求出每个小文件中重复次

13、数最多的一个,并记录重复次数。然后找出上一步求出的数据中重复次数最多的一个就是所求(具体参考前面的题)。8. 上千万或上亿数据(有重复),统计其中出现次数最多的钱N个数据。方案 1:上千万或上亿的数据,现在的机器的内存应该能存下。所以考虑采用hash_map/搜索二叉树 / 红黑树等来进行统计次数。然后就是取出前N个出现次数最多的数据了,可以用第6 题提到的堆机制完成。9. 1000万字符串,其中有些是重复的,需要把重复的全部去掉,保留没有重复的字符串。请怎么设计和实现?方案 1:这题用 trie树比较合适, hash_map也应该能行。名师资料总结 - - -精品资料欢迎下载 - - - -

14、 - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 4 页,共 11 页 - - - - - - - - - 第 5 页10. 一个文本文件,大约有一万行,每行一个词,要求统计出其中最频繁出现的前 10 个词,请给出思想,给出时间复杂度分析。方案 1:这题是考虑时间效率。用trie树统计每个词出现的次数,时间复杂度是O(n*le) (le 表示单词的平准长度)。然后是找出出现最频繁的前10 个词,可以用堆来实现,前面的题中已经讲到了,时间复杂度是O(n*lg10) 。所以总的时间复杂度,是 O(n*le) 与 O(n*lg10) 中较大的哪一

15、个。11. 一个文本文件,找出前10 个经常出现的词,但这次文件比较长,说是上亿行或十亿行,总之无法一次读入内存,问最优解。方案 1:首先根据用hash 并求模,将文件分解为多个小文件,对于单个文件利用上题的方法求出每个文件件中10 个最常出现的词。然后再进行归并处理,找出最终的 10 个最常出现的词。12. 100w 个数中找出最大的100 个数。?方案 1:在前面的题中,我们已经提到了,用一个含100 个元素的最小堆完成。复杂度为O(100w*lg100) 。?方案 2:采用快速排序的思想,每次分割之后只考虑比轴大的一部分,知道比轴大的一部分在比100 多的时候,采用传统排序算法排序,取前

16、100个。复杂度为O(100w*100)。?方案 3:采用局部淘汰法。选取前100 个元素,并排序,记为序列L。然后一次扫描剩余的元素x,与排好序的100 个元素中最小的元素比,如果比这个最小的要大,那么把这个最小的元素删除,并把x 利用插入排序的思想,插入到序列L 中。依次循环,知道扫描了所有的元素。复杂度为O(100w*100)。13. 寻找热门查询:搜索引擎会通过日志文件把用户每次检索使用的所有检索串都记录下来,每个查询串的长度为 1-255 字节。假设目前有一千万个记录,这些查询串的重复读比较高,虽然总数是 1 千万,但是如果去除重复和,不超过3 百万个。一个查询串的重复度越高,说明查

17、询它的用户越多,也就越热门。请你统计最热门的10 个查询串,要求使用的内存不能超过1G 。名师资料总结 - - -精品资料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 5 页,共 11 页 - - - - - - - - - 第 6 页(1) 请描述你解决这个问题的思路;(2) 请给出主要的处理流程,算法,以及算法的复杂度。方案 1:采用 trie树,关键字域存该查询串出现的次数,没有出现为0。最后用10 个元素的最小推来对出现频率进行排序。关于此问题的详细解答,请参考此文的第3.1 节: 第三章续、 Top K

18、 算法问题的实现。14. 一共有 N个机器,每个机器上有N个数。每个机器最多存O(N)个数并对它们操作。如何找到N2个数中的中数?方案 1:先大体估计一下这些数的范围,比如这里假设这些数都是32 位无符号整数(共有 232 个)。我们把0 到 232-1 的整数划分为N个范围段,每个段包含(232)/N 个整数。比如,第一个段位0 到 232/N-1 ,第二段为( 232)/N 到(232)/N-1 ,第 N个段为( 232)( N-1)/N 到 232-1 。然后,扫描每个机器上的 N个数,把属于第一个区段的数放到第一个机器上,属于第二个区段的数放到第二个机器上,属于第N个区段的数放到第N个

19、机器上。注意这个过程每个机器上存储的数应该是O(N)的。下面我们依次统计每个机器上数的个数,一次累加,直到找到第k 个机器,在该机器上累加的数大于或等于(N2)/2 ,而在第 k-1 个机器上的累加数小于(N2)/2 ,并把这个数记为x。那么我们要找的中位数在第 k 个机器中,排在第(N2)/2-x位。然后我们对第k 个机器的数排序,并找出第(N2)/2-x个数,即为所求的中位数的复杂度是O(N2)的。方案 2:先对每台机器上的数进行排序。排好序后,我们采用归并排序的思想,将这 N个机器上的数归并起来得到最终的排序。找到第(N2)/2 个便是所求。复杂度是 O(N2*lgN2 )的。15. 最

20、大间隙问题给定 n 个实数,求着 n 个实数在实轴上向量2 个数之间的最大差值,要求线性的时间算法。名师资料总结 - - -精品资料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 6 页,共 11 页 - - - - - - - - - 第 7 页方案 1:最先想到的方法就是先对这n 个数据进行排序,然后一遍扫描即可确定相邻的最大间隙。但该方法不能满足线性时间的要求。故采取如下方法:1. 找到 n 个数据中最大和最小数据max和 min。2. 用 n-2 个点等分区间 min, max,即将 min, max等分为

21、 n-1 个区间(前闭后开区间),将这些区间看作桶,编号为,且桶 i 的上界和桶 i+1 的下届相同,即每个桶的大小相同。每个桶的大小为:。实际上,这些桶的边界构成了一个等差数列(首项为min,公差为),且认为将min 放入第一个桶,将max放入第n-1 个桶。3. 将 n 个数放入 n-1 个桶中:将每个元素xi 分配到某个桶(编号为index ),其中,并求出分到每个桶的最大最小数据。4. 最大间隙:除最大最小数据max和 min 以外的 n-2 个数据放入n-1 个桶中,由抽屉原理可知至少有一个桶是空的,又因为每个桶的大小相同,所以最大间隙不会在同一桶中出现,一定是某个桶的上界和气候某个

22、桶的下界之间隙,且该量筒之间的桶(即便好在该连个便好之间的桶)一定是空桶。也就是说,最大间隙在桶i 的上界和桶 j 的下界之间产生j=i+1 。一遍扫描即可完成。16. 将多个集合合并成没有交集的集合给定一个字符串的集合,格式如:。要求将其中交集不为空的集合合并,要求合并完成的集合之间无交集,例如上例应输出。(1) 请描述你解决这个问题的思路;(2) 给出主要的处理流程,算法,以及算法的复杂度;(3) 请描述可能的改进。方案 1:采用并查集。首先所有的字符串都在单独的并查集中。然后依扫描每个集合,顺序合并将两个相邻元素合并。例如,对于,首先查看 aaa 和 bbb名师资料总结 - - -精品资

23、料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 7 页,共 11 页 - - - - - - - - - 第 8 页是否在同一个并查集中,如果不在,那么把它们所在的并查集合并,然后再看bbb和 ccc 是否在同一个并查集中,如果不在,那么也把它们所在的并查集合并。接下来再扫描其他的集合,当所有的集合都扫描完了,并查集代表的集合便是所求。复杂度应该是 O(NlgN)的。改进的话,首先可以记录每个节点的根结点,改进查询。合并的时候,可以把大的和小的进行合,这样也减少复杂度。17. 最大子序列与最大子矩阵问题数组的最大

24、子序列问题:给定一个数组,其中元素有正,也有负,找出其中一个连续子序列,使和最大。方案 1:这个问题可以动态规划的思想解决。设bi表示以第 i 个元素 ai结尾的最大子序列,那么显然。基于这一点可以很快用代码实现。最大子矩阵问题:给定一个矩阵(二维数组),其中数据有大有小,请找一个子矩阵,使得子矩阵的和最大,并输出这个和。方案 2:可以采用与最大子序列类似的思想来解决。如果我们确定了选择第i 列和第 j 列之间的元素,那么在这个范围内,其实就是一个最大子序列问题。如何确定第 i 列和第 j 列可以词用暴搜的方法进行。第二部分、海量数据处理之Bti-map 详解Bloom Filter已在上一篇

25、文章 海量数据处理之Bloom Filter详解中予以详细阐述,本文接下来着重阐述Bit-map 。有任何问题,欢迎不吝指正。什么是 Bit-map所谓的 Bit-map 就是用一个 bit位来标记某个元素对应的Value , 而 Key即是该元素。由于采用了Bit为单位来存储数据,因此在存储空间方面,可以大大节省。如果说了这么多还没明白什么是Bit-map ,那么我们来看一个具体的例子,假设我们要对 0-7 内的 5 个元素 (4,7,2,5,3)排序(这里假设这些元素没有重复)。那么我们就可以采用Bit-map 的方法来达到排序的目的。要表示8 个数,我们就只需要名师资料总结 - - -精

26、品资料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 8 页,共 11 页 - - - - - - - - - 第 9 页8 个 Bit (1Bytes ),首先我们开辟1Byte 的空间,将这些空间的所有Bit 位都置为 0(如下图: )然后遍历这 5 个元素,首先第一个元素是4,那么就把 4 对应的位置为1(可以这样操作p+(i/8)|(001(i%8) 当然了这里的操作涉及到Big-ending和Little-ending的情况,这里默认为Big-ending ),因为是从零开始的,所以要把第五位置为一(如下

27、图):然后再处理第二个元素7,将第八位置为1, ,接着再处理第三个元素,一直到最后处理完所有的元素,将相应的位置为1,这时候的内存的Bit 位的状态如下:然后我们现在遍历一遍Bit区域,将该位是一的位的编号输出(2,3,4,5,7),这样就达到了排序的目的。下面的代码给出了一个BitMap 的用法:排序。view plaincopy to clipboardprint?1./ 定义每个 Byte 中有 8 个 Bit 位2.#include memory.h3.#define BYTESIZE 8 4.void SetBit(char *p, int posi) 5.for( int i=0;

28、 i (posi/BYTESIZE); i+) 6.p+; 7.*p = *p|(0 x01 (posi%BYTESIZE);/将该 Bit 位赋值 1 8.return; 9.void BitMapSortDemo() 10./ 为了简单起见,我们不考虑负数11.int num = 3,5,2,10,6,12,8,14,9; 12./BufferLen这个值是根据待排序的数据中最大值确定的13./ 待排序中的最大值是14,因此只需要2 个 Bytes(16 个 Bit) 14./ 就可以了。15.const int BufferLen = 2; 16.char *pBuffer = new

29、char BufferLen; 17./ 要将所有的Bit 位置为 0,否则结果不可预知。18.memset(pBuffer,0,BufferLen); 名师资料总结 - - -精品资料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 9 页,共 11 页 - - - - - - - - - 第 10 页19.for( int i=0;i9;i+) 20./ 首先将相应Bit 位上置为 1 21.SetBit(pBuffer,numi); 22./ 输出排序结果23.for( int i=0;iBufferLen;i

30、+)/每次处理一个字节 (Byte) 24.for( int j=0;jBYTESIZE;j+)/处理该字节中的每个Bit 位25./ 判断该位上是否是1,进行输出,这里的判断比较笨。26./ 首先得到该第j 位的掩码( 0 x01 j ),将内存区中的27./ 位和此掩码作与操作。最后判断掩码是否和处理后的28./ 结果相同29.if(*pBuffer&(0 x01j) = (0 x01 j) 30.printf(%d ,i*BYTESIZE + j); 31.pBuffer+; 32.int _tmain(int argc, _TCHAR* argv) 33.BitMapSortDemo(

31、); 34.return 0; 可进行数据的快速查找,判重,删除,一般来说数据范围是int的 10 倍以下基本原理及要点使用 bit数组来表示某些元素是否存在,比如8 位电话号码扩展Bloom filter可以看做是对bit-map 的扩展(关于Bloom filter,请参见: 海量数据处理之 Bloom filter详解 )。问题实例1) 已知某个文件内包含一些电话号码,每个号码为8 位数字,统计不同号码的个数。8 位最多 99 999 999 ,大概需要 99m个 bit ,大概 10 几 m字节的内存即可。(可以理解为从 0-99 999 999的数字,每个数字对应一个Bit 位,所以

32、只需要99M个名师资料总结 - - -精品资料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 10 页,共 11 页 - - - - - - - - - 第 11 页Bit=1.2MBytes ,这样,就用了小小的1.2M 左右的内存表示了所有的8 位数的电话)2)2.5 亿个整数中找出不重复的整数的个数,内存空间不足以容纳这2.5 亿个整数。将 bit-map 扩展一下,用2bit表示一个数即可, 0 表示未出现, 1 表示出现一次,2 表示出现 2 次及以上,在遍历这些数的时候,如果对应位置的值是0,则将其置为

33、 1;如果是 1,将其置为 2;如果是 2,则保持不变。或者我们不用2bit来进行表示,我们用两个bit-map 即可模拟实现这个2bit-map ,都是一样的道理。参考:1. http:/cnblogs/youwang/archive/2010/07/20/1781431.html。2. http:/blog.redfox66/post/2010/09/26/mass-data-4-bitmap.aspx。3. 希望以上资料对你有所帮助,附励志名言3 条:4. 1、要接受自己行动所带来的责任而非自己成就所带来的荣耀。5. 2、每个人都必须发展两种重要的能力适应改变与动荡的能力以及为长期目标延缓享乐的能力。6. 3、将一付好牌打好没有什么了不起能将一付坏牌打好的人才值得钦佩。7. 名师资料总结 - - -精品资料欢迎下载 - - - - - - - - - - - - - - - - - - 名师精心整理 - - - - - - - 第 11 页,共 11 页 - - - - - - - - -

展开阅读全文
相关资源
相关搜索

当前位置:首页 > 教育专区 > 高考资料

本站为文档C TO C交易模式,本站只提供存储空间、用户上传的文档直接被用户下载,本站只是中间服务平台,本站所有文档下载所得的收益归上传人(含作者)所有。本站仅对用户上传内容的表现方式做保护处理,对上载内容本身不做任何修改或编辑。若文档所含内容侵犯了您的版权或隐私,请立即通知淘文阁网,我们立即给予删除!客服QQ:136780468 微信:18945177775 电话:18904686070

工信部备案号:黑ICP备15003705号© 2020-2023 www.taowenge.com 淘文阁