最近刚入手了《Hadoop+Spark大数据技术与应用》这本教材,内容覆盖了HDFS、MapReduce、YARN以及Spark核心和SQL等知识点,从理论到实战案例都有安排,感觉很适合像我这样想入门大数据但又不知从何下手的同学。书里配套的案例代码也比较清晰,跟着敲一遍能加深理解。
不过光靠一本书学大数据确实有点吃力,尤其是我在环境搭建和集群调优部分卡了很久。所以我在找一些辅助的学习资料,比如视频课程里的实操演示、Stack Overflow上的踩坑记录,还有官方文档里的配置说明。主要是想找一些能帮我快速定位问题的参考资源,不一定是答案。
现在我的计划是先通读教材,然后边敲代码边记笔记,这样对框架的运作机制印象更深。但也想问问学过的大佬们:学这本书时你们是先把Hadoop基础打牢再转Spark,还是两者并行学习?另外,遇到日志报错时有没有好的排查思路?希望有经验的同学能分享一下心得,非常感谢!