我们专业这学期开了《大数据导论》这门课,用的是那本经典的教材,内容覆盖了大数据技术基础、Hadoop生态、数据采集与预处理这些核心模块。说实话刚翻开时觉得概念挺多的,特别是分布式存储和计算那几章,不结合例子的话很容易晕。
现在最缺的就是配套的课后思路解析和能练手的案例数据,光看PPT觉得懂了,一到作业题里设计MapReduce逻辑就卡壳。如果有学长整理的重点梳理或者实验指导会很有帮助,但不强求答案,毕竟自己搞懂印象才深。
我目前的方法是先跟着教材搭单机伪分布式环境,然后每个组件都敲一遍官方示例。但遇到数据倾斜和调优的问题还是没头绪,希望有经验的同学能分享一下你们是怎么把理论联系实际的,或者有没有推荐的辅助书单?