飞网论坛

标题: 大数据Spark企业级实战版.pdf 【813页】【bbs.cfei.net 分享】【百度云盘下载】 [打印本页]

作者: johnny    时间: 2016-10-15 21:49
标题: 大数据Spark企业级实战版.pdf 【813页】【bbs.cfei.net 分享】【百度云盘下载】
大数据Spark企业级实战版.pdf 【bbs.cfei.net 分享】【百度云盘下载】




飞网推荐
  Life is short, you need Spark!
  Spark是当今大数据领域最活跃最热门的高效的大数据通用计算平台。基于RDD,Spark成功地构建起了一体化、多元化的大数据处理体系。
  雅虎、Conviva、淘宝、网易、大众点评、优酷土豆、腾讯、华为等公司均在生产环境中部署了大规模的Spark。
  《大数据Spark企业级实战》完全从企业处理大数据业务场景的角度出发,完全基于实战代码来组织内容,从零起步,不需任何基础,完全无痛地掌握Spark大数据处理实战技术,源码解析:
  Spark集群的动手构建
  Spark架构
  Spark内核的深入解析
  Spark四大子框架的细致剖析和实战
  Tachyon文件系统揭秘
  Spark多语言编程
  SparkR
  Spark性能调优和实践
  一站式实现Spark企业级开发实战!


内容简介
  Spark是当今大数据领域最活跃、最热门、高效的大数据通用计算平台,是Apache软件基金会下所有开源项目中三大开源项目之一。
  在“One Stack to rule them all”理念的指引下,Spark基于RDD成功地构建起了大数据处理的一体化解决方案,将MapReduce、Streaming、SQL、Machine Learning、Graph Processing等大数据计算模型统一到一个技术堆栈中,开发者使用一致的API操作Spark中的所有功能;更为重要的是Spark的Spark SQL、MLLib、GraphX、Spark Streaming等四大子框架之间可以在内存中完美的无缝集成并可以互相操作彼此的数据,这不仅打造了Spark在当今大数据计算领域其他任何计算框架都无可匹敌的优势,更使得Spark正在加速成为大数据处理中心的计算平台。
  《大数据Spark企业级实战》详细解析了企业级Spark开发所需的几乎所有技术内容,涵盖Spark的架构设计、Spark的集群搭建、Spark内核的解析、Spark SQL、MLLib、GraphX、Spark Streaming、Tachyon、SparkR、Spark多语言编程、Spark常见问题及调优等,并且结合Spark源码细致的解析了Spark内核和四大子框架,最后在附录中提供了的Spark的开发语言Scala快速入门实战内容,学习完此书即可胜任绝大多数的企业级Spark开发需要。
  《大数据Spark企业级实战》从零起步,完全从企业处理大数据业务场景的角度出发,基于实战代码来组织内容,对于一名大数据爱好者来说,《大数据Spark企业级实战》内容可以帮助您一站式地完成从零起步到进行Spark企业级开发所需要的全部核心内容和实战需要。


作者简介
  王家林,Spark亚太研究院首席专家,中国移动互联网和云计算大数据集大成者。在Spark、Hadoop、Android等方面有丰富的源码、实务和性能优化经验。彻底研究了Spark从0.5.0到0.9.1共13个版本的Spark源码,并已完成2014年5月31日发布的Spark1.0源码研究。

目录
第1章 Spark编程模型
1.1 Spark:一体化、多元化的高速
大数据通用计算平台和库
1.1.1 为什么需要使用Spark
1.1.2 Spark技术生态系统简介
1.2 Spark大数据处理框架
1.2.1 Spark速度为何如此之快
1.2.2 RDD:分布式函数式编程
1.3 Spark子框架解析
1.3.1 图计算框架Spark GraphX
1.3.2 实时流处理框架
(Spark Streaming)
1.3.3 交互式SQL处理框架
Spark SQL
1.3.4 机器学习框架
(Spark MLlib)

第2章 构建Spark分布式集群
2.1 搭建Hadoop单机版本和伪
分布式开发环境
2.1.1 开发Hadoop需要的基本
软件
2.1.2 安装每个软件
2.1.3 配置Hadoop单机模式并
运行Wordcount示例
2.1.4 配置Hadoop伪分布模式
并运行Wordcount示例
2.2 搭建 Hadoop分布式集群
2.2.1 在VMWare 中准备第二、
第三台运行Ubuntu系统的
机器
2.2.2 按照配置伪分布式模式
的方式配置新创建运行
Ubuntu系统的机器
2.2.3 配置Hadoop分布式集群
环境
2.2.4 测试Hadoop分布式集群
环境
2.3 Spark集群的动手搭建
2.3.1 Spark集群需要的软件
2.3.2 安装每个软件
2.3.3 启动并查看集群的状况
2.4 构建Hadoop单机版本和伪
分布式环境
2.4.1 通过Spark的shell测试
Spark的工作
2.4.2 使用Spark的cache机制
观察一下效率的提升

第3章 Spark开发环境及其测试
3.1 搭建和设置IDEA开发环境
3.1.1 构建Spark的IDE开发
环境
3.1.2 配置Spark的IDE开发
环境
3.2 测试IDEA环境
3.3 实战:在IDEA中开发代码,
并运行在Spark集群中

第4章 Spark RDD与编程API
实战
4.1 深度解析Spark RDD
4.2 Transformation Operations
动手实战
4.3 Action Operations动手实战
4.4 Spark API综合实战

第5章 Spark运行模式深入解析
5.1 Spark运行模式概述
5.1.1 Spark的运行模式列表
5.1.2 Spark的基本工作流程
5.2 Standalone模式
5.2.1 部署及程序运行
5.2.2 内部实现原理
5.3 Yarn-Cluster模式
5.3.1 部署及程序运行
5.3.2 内部实现原理
5.4 Yarn-Client模式
5.4.1 部署及运行程序
5.4.2 内部实现原理

第6章 Spark内核解析
6.1 Spark内核初探
6.1.1 Spark内核核心术语解析
6.1.2 Spark集群概览
6.1.3 Spark核心组件
6.1.4 Spark任务调度系统初见
6.2 Spark内核核心源码解读
6.2.1 SparkContext核心源码
解析初体验
6.2.2 TaskSceduler启动源码
解析初体验
6.2.3 DAGScheduler源码解读
初体验
6.2.4 Spark的Web监控页面
6.3 以RDD的count操作为例触发
Job全生命周期源码研究
6.4 Akka驱动下的Driver、
Master、Worker
6.4.1 Driver中的AppClient
源码解析
6.4.2 AppClient注册Master
6.4.3 Worker中Executor启动
过程源代码解析

第7章 GraphX大规模图计算与
图挖掘实战
7.1 Spark GraphX概览
7.2 Spark GraphX设计实现的
核心原理
7.3 Table operator和Graph
Operator
7.4 Vertices、edges、triplets
7.5 以最原始的方式构建graph
7.6 动手编写第一个Graph代码
实例并进行Vertices、edges、
triplets操作
7.7 在Spark集群上使用文件中
的数据加载成为graph并进
行操作
7.8 在Spark集群上掌握比较重
要的图操作
7.9 Spark GraphX图算法
7.10 淘宝对Spark GraphX的大
规模使用

第8章 Spark SQL原理与实战
8.1 为什么使用Spark SQL
8.1.1 Spark SQL的发展历程
8.1.2 Spark SQL的性能
8.2 Spark SQL运行架构
8.2.1 Tree和Rule
8.2.2 sqlContext的运行过程
8.2.3 hiveContext的运行过程
8.2.4 catalyst优化器
8.3 解析Spark SQL组件
8.3.1 LogicalPlan
8.3.2 SqlParser
8.3.3 Analyzer
8.3.4 Optimizer
8.4 深入了解Spark SQL运行
的计划
8.4.1 hive/console的安装过程
和原理
8.4.2 常用操作
8.4.3 不同数据源的运行计划
8.4.4 不同查询的运行计划
8.4.5 查询的优化
8.5 搭建测试环境
8.5.1 搭建虚拟集群(Hadoop1、
Hadoop2、Hadoop3)
8.5.2 搭建客户端
8.5.3 文件数据的准备工作
8.5.4 Hive数据的准备工作
8.6 Spark SQL之基础应用
8.6.1 sqlContext的基础应用
8.6.2 hiveContext的基础应用
8.6.3 混合使用
8.6.4 缓存的使用
8.6.5 DSL的使用
8.7 ThriftServer和CLI
8.7.1 令人惊讶的CLI
8.7.2 ThriftServer
8.8 Spark SQL之综合应用
8.8.1 店铺分类
8.8.2 PageRank
8.9 Spark SQL之调优
8.9.1 并行性
8.9.2 高效的数据格式
8.9.3 内存的使用
8.9.4 合适的Task
8.9.5 其他的一些建议

第9章 Machine Learning on
Spark
9.1 Spark MLlib机器学习
9.1.1 机器学习快速入门
9.1.2 Spark MLlib介绍
9.1.3 Spark MLlib架构解析
9.1.4 Spark Mllib核心解析
9.2 MLlib经典算法解析和案例
实战
9.2.1 Linear Regression解析和
实战
9.2.2 K-Means解析和实战
9.2.3 协同过滤算法分析和案例
实战
9.3 MLLib其他常用算法解析
和代码实战
9.3.1 Basic Statics解析和实战
9.3.2 MLlib朴素贝叶斯解析和
实战
9.3.3 MLlib决策树解析和实战

第10章 Tachyon文件系统
10.1 Tachyon文件系统概述
10.1.1 Tachyon文件系统简介
10.1.2 HDFS与Tachyon
10.1.3 Tachyon设计原理
10.2 Tachyon入门
10.2.1 Tachyon部署
10.2.2 Tachyon API的使用
10.2.3 在MapReduce、Spark
上使用Tachyon
10.3 Tachyon深度解析
10.3.1 Tachyon整体设计概述
10.3.2 Tachyon Master启动流
程分析
10.3.3 Tachyon Worker启动流
程分析
10.3.4 客户端读写文件源码分析
10.4 Tachyon配置参数一览
10.5 小结

第11章 Spark Streaming原理
与实战
11.1 Spark Streaming原理
11.1.1 原理和运行场景
11.1.2 编程模型DStream
11.1.3 持久化、容错和优化
11.2 Spark Streaming实战
11.2.1 源码解析
11.2.2 Spark Streaming实战案例

第12章 Spark多语言编程
12.1 Spark多语言编程的特点
12.2 Spark编程模型
12.3 深入Spark多语言编程
12.4 Spark多语言编程综合实例

第13章 R语言的分布式编程
之SparkR
13.1 R语言快速入门
13.1.1 R语言是什么
13.1.2 R语言的特点
13.1.3 R语言的安装
13.1.4 R的核心概念
13.1.5 R动手实战
13.2 使用SparkR
13.2.1 SparkR的安装
13.2.2 使用SparkR编写
WordCount
13.2.3 使用SparkR的更多
代码示例

第14章 Spark性能调优和
最佳实践
14.1 Spark性能调优
14.1.1 Spark性能优化的12大
问题及其解决方法
14.1.2 Spark内存优化
14.1.3 RDD分区
14.1.4 Spark性能优化实例
14.2 Spark性能调优细节
14.2.1 broadcast和accumulator
14.2.2 reduce 和 reduceByKey
14.2.3 深入reduceByKey

第15章 Spark源码解析
15.1 BlockManager源码解析
15.2 Cache源码解析
15.3 Checkpoint源码解析

附录A 动手实战Scala三部曲
第一部 动手体验Scala
第二部 动手实战Scala面向
对象编程
第三部 动手实战Scala函数式编程





百度云盘私密链接:
链接:http://pan.baidu.com/s/1dEPgtpR


提取码,回复可见:






作者: 节操碎威严    时间: 2016-10-15 22:33
楼主好资料,先收藏,以后再看。
作者: shenzhen_zsw    时间: 2016-10-15 22:36
看看哈!!!!!!!!!!!
作者: 阿爾卑斯蠻牛    时间: 2016-10-15 22:38
大数据Spark企业级实战版.pdf,好東西
作者: 浅夏风云    时间: 2016-10-15 22:59
是啥计划计划计划
作者: 不苦先生    时间: 2016-10-15 23:03

作者: cnszblade    时间: 2016-10-15 23:17
谢谢@,分享。
作者: qwxuhao8312    时间: 2016-10-15 23:30
感谢分享,,新手学习中
作者: easy    时间: 2016-10-15 23:50
感谢分享
作者: musefairy    时间: 2016-10-16 01:17
先收藏,没时间看
作者: sun254667307    时间: 2016-10-16 01:51
谢谢分享

作者: cnaudx    时间: 2016-10-16 07:13
感觉这书不错
作者: yang759    时间: 2016-10-16 10:13
看一下,谢谢分享
作者: willing    时间: 2016-10-16 13:25
好书,下载学习一下
作者: junfei    时间: 2016-10-16 15:12
感谢分享
作者: feelning    时间: 2016-10-16 21:13
这个真心是不错的东西!!!!
作者: f121211a    时间: 2016-10-17 00:18
谢谢斑竹
作者: 诗音大小姐    时间: 2016-10-17 08:38
感谢分享
作者: zj8517661    时间: 2016-10-17 09:51
感谢楼主分享。
作者: medavis123    时间: 2016-10-17 11:34
先睹为快~~~~~
作者: aa5566xzy    时间: 2016-10-17 11:53
谢谢分享,楼主长命百岁
作者: fansc    时间: 2016-10-17 15:52
嗯,挺好的

作者: aebn    时间: 2016-10-17 16:42
谢谢分享
作者: cainiao_22    时间: 2016-10-17 16:51
可水群否?
作者: xijiafei888    时间: 2016-10-17 17:06
不错不错不错不错不错不错不错不错不错不错不错不错
作者: glveil    时间: 2016-10-17 17:07
谢谢分享
作者: abc123xc    时间: 2016-10-17 17:09
好东西  期待
作者: jancky    时间: 2016-10-17 17:14
谢谢大大了~~~
作者: bing_zhou    时间: 2016-10-18 08:24
很好!!!!!!!!!!
作者: blackhero    时间: 2016-10-18 11:04
收藏收藏收藏
作者: mengfu    时间: 2016-10-21 10:01
很不错,谢谢大神的分享

作者: edouardzyc    时间: 2016-10-21 15:47
谢谢分享
作者: weizg1688    时间: 2016-10-24 11:33
太棒了,真的很古板噢,年薪80万
作者: xiaodin1    时间: 2016-10-25 12:56
eeeeeeeeeee
作者: jiaximoduo    时间: 2016-10-25 15:34
感谢分享
作者: tuhao    时间: 2016-10-30 11:54
!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!!
作者: a157775541    时间: 2016-11-3 17:50
点点滴滴
作者: wxlogin    时间: 2016-11-16 14:57
谢谢分享
作者: fobeeq    时间: 2016-11-16 21:17
学习学习
作者: 微微上翘    时间: 2016-11-16 21:24
好东西,学习学习
作者: hzwf001    时间: 2016-11-19 17:06
很好非常好
作者: Heikeyang    时间: 2016-11-20 13:45
多谢楼主!
作者: chengcheng768    时间: 2016-11-20 19:41
想看看,应该不错的书籍
作者: thekings    时间: 2016-11-20 20:42
4g9p 4g9p 4g9p 4g9p 4g9p
作者: wjiankun888    时间: 2016-11-23 00:02
学习实施
作者: elim168    时间: 2016-11-23 19:28
感谢分享
作者: wusetiantu    时间: 2016-11-25 15:28
十分感谢楼主的分享
作者: wangxh    时间: 2016-12-21 10:30
谢谢楼主
作者: liangge    时间: 2017-1-19 09:26
感谢分享。
作者: crazyman    时间: 2017-2-3 16:21
下载大数据Spark企业级实战版.pdf 【813页】【bbs.cfei.net 分享】【百度云盘下载】 [修改]
作者: wjxshow86    时间: 2017-2-4 14:43
这个不错哦~`求下载
作者: han6075    时间: 2017-2-28 10:02
非常棒的书,
作者: eternal1025    时间: 2017-2-28 11:04
谢谢分享     
作者: 104207438@qq.co    时间: 2017-3-1 16:00
2222222323232
作者: StevenXu    时间: 2017-3-11 13:42
学习学习
作者: hei    时间: 2017-6-6 18:07
学习一下,谢谢
作者: weixiao    时间: 2017-6-11 23:09
感谢分享,学习中
作者: fonglibin    时间: 2017-6-15 14:48
感谢分享,学习下
作者: davidleeux    时间: 2017-6-26 12:37
学习学习@@@@@
作者: weixiao    时间: 2017-7-31 11:50
感谢分享
作者: capcase    时间: 2017-9-1 01:43
zan support and thanks
作者: crazyweeds    时间: 2017-9-2 13:38
大数据,看上去不错的样子。
作者: y534560449    时间: 2017-9-21 17:07
66666666666666666
作者: pw8588    时间: 2017-12-12 15:38
谢谢分享
谢谢分享
作者: s60243    时间: 2017-12-26 16:39
66666
作者: zmmwl    时间: 2018-3-20 15:48
谢谢,非常好的书
作者: KJHKQH    时间: 2018-3-21 16:23
谢谢分享
作者: shenxin00    时间: 2018-3-26 11:13
谢谢你了,我先看看,能不能看懂
作者: cipherbb    时间: 2018-4-7 22:48
xiexiefenxiang
作者: 凡梦星尘    时间: 2018-4-17 14:06
学习SPARK利器,谢谢分享。
作者: 847214276    时间: 2018-5-6 15:33
看看看看
作者: vinvent    时间: 2018-5-16 22:23
靓野靓野靓野靓野
作者: 广东渣渣辉    时间: 2018-5-18 22:48
谢谢谢谢谢
作者: 骑士    时间: 2018-10-30 15:46
感谢大神的分享
作者: siyuan    时间: 2018-11-5 13:54
11111111111111111111111111111
作者: JavaCai    时间: 2019-5-30 14:30
ssssssssssss
作者: tanoak    时间: 2019-10-31 18:36
试看,不知道效果咋样,比心心
作者: 板哩哩    时间: 2022-8-15 22:26
太棒了!
作者: 板哩哩    时间: 2022-8-15 22:26
感谢!正好需要这本书!大赞




欢迎光临 飞网论坛 (https://bbs.cfei.net/) Powered by Discuz! X3.2