教学文库网 - 权威文档分享云平台
您的当前位置:首页 > 文库大全 > 小学教育 >

hadoop 分布式 系统 存储 数据库 云计算 (7)

来源:网络收集 时间:2026-08-26
导读: hadoop 分布式 系统 存储 数据库 云计算 Whirlwind tour of Hadoop Inspired by Google's GFS Clusters from 1-10000 systemsBatch Processing High Throughput Partition-able problems Fault Tolerance in storage Fault Tolerance in processing hadoop

hadoop 分布式 系统 存储 数据库 云计算

Whirlwind tour of Hadoop

Inspired by Google's GFS

Clusters from 1-10000 systemsBatch Processing High Throughput Partition-able problems Fault Tolerance in storage Fault Tolerance in processing

hadoop 分布式 系统 存储 数据库 云计算

HDFS

Distributed File System (HDFS)

Centralized “INODE” store NameNodeDataNodes provide storage 1-10000 Replication set Per File Block Size normally large 128 MB Optimized for throughput

hadoop 分布式 系统 存储 数据库 云计算

Map Reduce

Jobs are typically long running

Move processing not dataAlgorithm uses map() and optionally reduce() Source Input is split Splits processed simultaneously Failed Tasks are retried

hadoop 分布式 系统 存储 数据库 云计算

Things you do not have

Locking

BlockingMutexes wait/notify POSIX file semantics

hadoop 分布式 系统 存储 数据库 云计算

Problem: Large Scale Log Processing

Challenges

Large volumes of DataStore it indefinitely Process large data sets on multiple systems Data and Indexes for short periods (one week) do NOT fit in main memory

hadoop 分布式 系统 存储 数据库 云计算

Log Format

hadoop 分布式 系统 存储 数据库 云计算

Getting Files into HDFS

hadoop 分布式 系统 存储 数据库 云计算

Hadoop Shell

Hadoop has a shell ls, put, get, cat..

hadoop 分布式 系统 存储 数据库 云计算

Sample Program Group and Count

Source data looks like

jan 10 2009:.........:200:/index.htm jan 10 2009:.........:200:/index.htm jan 10 2009:.........:200:/igloo.htm jan 10 2009:.........:200:/ed.htm

hadoop 分布式 系统 存储 数据库 云计算

In case your a Math 'type'

(input) <k1, v1> → map -> <k2, v2> -> combine -> <k2, v2> -> reduce -> <k3, v3> (output)

Map(k1,v1) -> list(k2,v2) Reduce(k2, list (v2)) -> list(v3)

hadoop 分布式 系统 存储 数据库 云计算

Calculate Splits

Input does not have to be a file to be “splittable”

hadoop 分布式 系统 存储 数据库 云计算

Splits → Mappers

Mappers run the map() process on each split

hadoop 分布式 系统 存储 数据库 云计算

Mapper runs map function

For each row/line (in this case)

hadoop 分布式 系统 存储 数据库 云计算

Shuffle sort, NOT the hottest new dance move

Data Shuffled to reducer on key.hash()

Data sorted by key per reducer.

hadoop 分布式 系统 存储 数据库 云计算

Reduce

One Reducer gets data that looks like

”index.htm”,<1,1> “ed,htm”,<1> //igloo.htm went to another reducer

hadoop 分布式 系统 存储 数据库 云计算

Reduce Phase

…… 此处隐藏:180字,全部文档内容请下载后查看。喜欢就下载吧 ……
hadoop 分布式 系统 存储 数据库 云计算 (7).doc 将本文的Word文档下载到电脑,方便复制、编辑、收藏和打印
本文链接:https://www.jiaowen.net/wenku/1545043.html(转载请注明文章来源)
Copyright © 2020-2025 教文网 版权所有
声明 :本网站尊重并保护知识产权,根据《信息网络传播权保护条例》,如果我们转载的作品侵犯了您的权利,请在一个月内通知我们,我们会及时删除。
客服QQ:78024566 邮箱:78024566@qq.com
苏ICP备19068818号-2
Top
× 游客快捷下载通道(下载后可以自由复制和排版)
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
VIP包月下载
特价:29 元/月 原价:99元
低至 0.3 元/份 每月下载150
全站内容免费自由复制
注:下载文档有可能出现无法下载或内容有问题,请联系客服协助您处理。
× 常见问题(客服时间:周一到周五 9:30-18:00)