DeepSeek Open Infra 开源五天乐及好书《动手学机器学习》推荐
你好,DeepSeek Open Infra!
202502 开源周
我们是一个小团队 @deepseek-ai,致力于 AGI 探索的极限。
从本周开始,即 2025 年 2 月 24 日,我们将开源 5 个代码库,每天发布一个,这并不是因为我们做出了宏大的声明,
而只是作为开发人员以完全透明的方式分享我们微小但真诚的进步。
这些是我们在线服务的简单组成部分:经过记录、部署和生产实战测试。
没有任何虚假信息,只有真诚的代码,推动着我们微小却雄心勃勃的梦想不断前行。
原因何在?因为每一条分享的线路都会成为加速旅程的集体动力。
每日解锁即将开始。没有象牙塔 - 只有纯粹的车库能量和社区驱动的创新🔧
敬请关注——让我们一起在户外探索极客世界。
第 1 天 - FlashMLA
适用于 Hopper GPU 的高效 MLA 解码内核
针对可变长度序列进行了优化,经过了生产中的实战检验
🔗 FlashMLA GitHub 存储库
✅ BF16 支持
✅ 分页 KV 缓存(块大小 64)
⚡ 性能:3000 GB/s 内存限制 | BF16 580 TFLOPS 计算限制于 H800
第 2 天 - DeepEP
很高兴介绍DeepEP——第一个用于 MoE 模型训练和推理的开源 EP 通信库。
🔗 DeepEP GitHub Repo
✅ 高效、优化的全方位沟通
✅ 节点内和节点间均支持 NVLink 和 RDMA
✅ 用于训练和推理预填充的高吞吐量内核
✅ 用于推理解码的低延迟内核
✅ 原生 FP8 调度支持
✅ 灵活的 GPU 资源控制,实现计算-通信重叠
第 3 天-DeepGEMM
介绍 DeepGEMM - 一个支持密集和 MoE GEMM 的 FP8 GEMM 库,为 V3/R1 训练和推理提供支持。
⚡ Hopper GPU 上高达 1350+ FP8 TFLOPS
✅ 没有过多的依赖,就像教程一样简洁
✅ 完全即时编译
✅ 核心逻辑约为 300 行 - 但在大多数矩阵大小上均优于专家调优的内核
✅ 支持密集布局和两种 MoE 布局
🔗 GitHub:https://github.com/deepseek-ai/DeepGEMM
正在发布...
2024 年人工智能基础设施论文(SC24)
Fire-Flyer AI-HPC:一种经济高效的深度学习软硬件协同设计
📄 论文链接(https://dl.acm.org/doi/10.1109/SC41406.2024.00089)
📄 Arxiv 论文链接(https://arxiv.org/abs/2408.14158)
好书推荐 - 《动手学机器学习》
书中内容涵盖了机器学习的核心算法和技术,包括监督学习、无监督学习、强化学习等。每一章都通过具体的案例和代码示例,引导读者动手实践,从而加深对理论知识的理解。这种“边学边做”的方式不仅有助于巩固所学内容,还能培养读者解决实际问题的能力。此外,本书还特别注重算法的实现细节和优化技巧,帮助读者在实际项目中高效应用机器学习技术。书中还包含了对当前热门话题的讨论,如深度学习、神经网络和大数据处理,使读者能够跟上机器学习领域的最新发展。这本书包含以下几个部分:
• 第一部分为机器学习基础,介绍了机器学习的概念、数学基础、思想方法和简单的机器学习算法。 • 第二部分为参数化模型,讲解线性模型、神经网络等算法。 • 第三部分为非参数化模型,主要讨论支持向量机和决策树模型及其变种。 • 第四部分为无监督模型,涉及聚类、降维、概率图模型等多个方面。
学习资料
配套源代码下载地址:https://github.com/boyu-ai/Hands-on-ML
教学PPT课件下载地址:http://hml.boyuai.com
理论解读视频课程:可扫描书中二维码观看,也可通过 http://hml.boyuai.com在电脑端观看
强烈推荐 B 站张教授的视频课程内容:
【上海交大张伟楠机器学习课程第1讲:机器学习简介I-哔哩哔哩】 https://b23.tv/QkbYWyR
常见疑问:
• (1)关于“代码可在线运行”:读者可以把GitHub上的代码下载下来,用任意支持ipynb格式的在线或本地工具运行,本书不提供在线运行的工具;
我在 Mac 上安装了 jupterlab
brew install jupyterlab
brew services start jupyterlab运行效果如下:
后续我单独发篇文章讲环境准备。
• (2)关于习题答案:本书不提供习题答案,读者自行练习。 大家可以关注 Repo:
https://github.com/motewei/Hands-on-ML-solutions,包含部分习题解答