程序员老鬼

Sutskever 30 ,这个项目值得收藏学习!

很多人听过 Ilya Sutskever 那句霸气宣言—— “把那 30 篇奠基论文啃完,基本就掌握了 AI 90% 的精髓。”

听上去很爽,对吧? 真打开论文,看到满屏公式、符号、推导,脑子一懵:这玩意要怎么落到代码里? 大部分人卡的不是概念,而是“论文 → 代码”这一步。

最近逛 GitHub 的时候,发现一个还挺狠的项目:Sutskever 30,作者直接把 Sutskever 推荐的那 30 篇奠基论文, 用纯 NumPy 全部实现了一遍,而且一个不落,全给你整齐摆好。

Image

这个项目有几个点,真的有点“牙膏挤爆了”的味道:

先说实现方式,全程不依赖任何深度学习框架。 没有 PyTorch、没有 TensorFlow,更没有那些一行起飞的高级 API, 就是老老实实用 NumPy 把前向传播、反向传播、梯度更新,一行一行写给你看。 你平时当黑盒调用的东西,这里都被掰开了揉碎写在 notebook 里。

每篇论文对应一个 Jupyter Notebook, 里面既有公式对应的推导思路,也有能直接跑起来的实验, 作者还贴心准备了合成数据集,clone 下来就能跑,不用折腾环境半天。 你可以一边看论文,一边单步执行代码,对着变量变化去理解“它为啥这么算”。

覆盖范围也挺全,从“老前辈”到“新顶流”一路排开: 像 RNN、LSTM 这种序列模型起家选手, 到后面 Transformer、Self-Attention、ResNet、图神经网络这条现代架构主线, 注意力机制、残差连接、消息传递这些关键词,都能在里面找到对照实现。

更夸张的是,它不只停在“会训模型”这一层。 项目还带了 VAE(变分自编码器)、神经图灵机、CTC 损失这些偏“脑洞型”的东西, 再往底层一点,还有 Kolmogorov 复杂度、MDL 原理、AIXI 通用人工智能这类理论基石。 一套看完,你大概能理解: 为什么当代深度学习这条路,会是现在这个样子走出来的。

有意思的地方还在于,它把一些现代应用也塞进来了。 比如 RAG(检索增强生成)、长文本分析这类最近两年很火的玩法, 你在大厂产品发布会上听到的那些术语,这里都有一个最小可运行版本。 看完之后再回头看各种“XX 大模型方案架构图”,不至于完全一头雾水。

要怎么用这个项目,比较不容易半途而废?可以试试这个节奏:

先挑你已经“听过名字”的模型,比如 LSTM、Transformer、ResNet, 别急着看论文原文,先跑一遍 notebook,看它在玩什么小任务。 搞明白数据是啥、前向怎么过、loss 怎么算,再去论文里对照公式, 这样阅读压力会小很多,不至于看两页就开始刷手机。

再一个是多动手改。 比如把 LSTM 里的激活函数替换掉、把层数加深一点、把注意力里的头数改一改, 看看 loss 曲线和训练速度会发生什么变化。 动过几次手之后,你就会对“设计一个新结构”的成本有更直观的感觉。

长线一点,如果你真打算认真走 AI 这条路, 这 30 篇论文 + 这套 NumPy 实现,基本就是一张“通行证”, 你不一定要一年之内全掌握,但能啃完一半,你看待各种新模型的视角就完全不一样了。 很多所谓“XX 新架构”,最后你会发现,只不过是把这几套老东西重新组合了一遍。

如果你现在正好在学深度学习, 又觉得自己只会调框架 API、离“懂原理”还差一大截, 这个 Sutskever 30 项目可以先码住,周末抽时间按章节慢慢啃。 后面面试、写论文、做 side project 的时候,很大概率会感谢现在的自己。

开源地址:github.com/pageman/sutskever-30-implementations

-END-

我为大家打造了一份AI教程,完全免费:songshuhezi.com/rpa.html