《深度学习与大模型》这门课所用的教材,内容从神经网络基础一直延伸到Transformer、GPT等前沿大模型,理论推导和代码实践结合得挺紧,读起来能感觉到作者是在帮我们一步步建立从深度学习到大模型的完整认知图谱,对想入门大模型方向的同学来说很实用。
学这本书时我特别缺配套的习题讲解和项目案例,光看书上的公式和代码有时还是不太清楚训练时那些超参数到底怎么调。另外要是能有每章的知识点提炼和思维导图就好了,这样复习时抓住主干,不至于被细节淹住。
目前我是边看边敲代码,遇到卡住的地方就回看前几章,但感觉效率不高。希望已经学过这门课的同学能分享一下怎么快速理解注意力机制和模型微调那块,或者有没有什么练习脚本能帮忙巩固,先谢谢大家了。