|
|
1
16
对。 你可以将hudge日志文件拆分为10000或1000000行的块(对于你的日志文件类型来说,这是一个很好的块——对于apache日志文件,我会选择更大的块),将它们提供给一些映射器,这些映射器会从每一行日志中提取特定的内容(如浏览器、IP地址、…、用户名等),然后通过计算每一行出现的次数来减少(简化):
然后减少得到这个: 火狐,3 即,1 MapReduce是最聪明的方法吗?
你可以从1个客户端开始,扩展到1000个……你甚至可以有一个客户端在局域网上的所有PC上作为屏幕保护程序运行,在8核服务器上运行8个客户端,在双核PC上运行2个客户端。。。
http://img355.imageshack.us/img355/7355/mqlogs.png
如果是基于文本的日志文件,则按元素或行数。
|
|
2
1
当然。你存储的是什么类型的数据?
Sharding . 通常,您会使用 consistent hashing algorithm |