Skip to content

前言

深度学习的发展历程在科学界颇为罕见。一小群科学家在长达二十五年的时间里,坚持在一个看似毫无前景的领域中耕耘,最终彻底改变了整个学科,并深刻影响了社会。通常情况下,当研究者们探索某个深奥且看似脱离实际的科学或工程角落时,结果往往正如人们所料——确实深奥且脱离实际。然而,这一次是个引人注目的例外。尽管面对广泛的质疑,Yoshua Bengio、Geoffrey Hinton、Yann LeCun 以及其他研究者的不懈努力最终获得了回报。

本书取名"理解深度学习"(Understanding Deep Learning),是为了与那些侧重于编码和其他实践方面的著作有所区分。本书的核心内容是关于深度学习背后的思想。全书第一部分介绍深度学习模型,并讨论如何训练模型、评估其性能以及改进性能。接下来的部分探讨专用于图像、文本和图数据的特殊架构。这些章节仅需要线性代数、微积分和概率论的入门知识,适合任何定量学科的大二学生阅读。后续部分涉及生成模型和强化学习,这些章节需要更深入的概率论和微积分知识,面向更高阶的读者。

这个书名在某种程度上也带有几分自嘲——在撰写本书时,没有人真正理解深度学习。现代深度网络学习的分段线性函数拥有的区域数量超过宇宙中的原子数量[^piecewise],并且可以用少于模型参数数量的数据样本进行训练。

[^piecewise]: 译者注:以 Qwen2.5-72B 为例,该模型包含 80 层 Transformer 块,每层前馈网络的中间维度为 29,568。若使用 ReLU 激活函数,仅前馈网络部分就包含 80×29,568236 万个分段线性单元,其所能划分的线性区域数量上界为 22,365,44010712,000,而可观测宇宙中的原子总数估计仅为 1080——二者相差超过 71 万个数量级。尽管 Qwen2.5 实际采用的是 SwiGLU 激活函数(一种平滑非线性函数),但其表达能力同样惊人。我们能够可靠地拟合这些函数,以及它们能够良好地泛化到新数据这两件事,都远非显而易见。本书倒数第二章专门讨论这些以及其他尚未被完全理解的问题。无论如何,深度学习正在改变世界,或好或坏。最后一章讨论人工智能伦理,并呼吁从业者认真思考其工作的道德影响。

你的时间宝贵,我力求以最高效的方式整理和呈现材料,帮助你尽快理解内容。每章正文仅包含对最核心思想的简洁描述,辅以相应的插图。附录回顾了所有必要的数学前置知识,读者无需参考外部资料。对于希望深入学习的读者,每章还配有相关的习题、Python 笔记本和详细的背景注释。

写书是一件孤独而漫长的工作,多年磨一剑,唯有被广泛采用才真正值得。如果你在阅读过程中有所收获,或有改进建议,请通过配套网站与我联系。我非常期待听到你的想法,这些反馈将启发和推动后续版本的完善。

基于 CC-BY-NC-ND 许可协议