DeepMind新方法:训练时间减少13倍,算力降低90%
一水 发自 凹非寺
量子位 | 公众号 QbitAI
大幅节省算力资源,又又又有新解了!!
DeepMind团队提出了一种新的 数据筛选方法 JEST——将AI训练时间减少13倍,并将算力需求降低90%。
这样做可以让读者更快地学到知识(训练模型),还能节省时间(减少迭代次数)和精力(减少计算量)。
研究显示 ,JEST大幅加速了大规模多模态预训练,与之前的最先进水平 (SigLIP) 相比,迭代次数和浮点运算次数 减少了10倍 。
对于上述结果,有网友惊呼:
新研究将成为AI训练的游戏规则改变者!
对于担心人工智能需求过高的电网来说,这可能是个极好的消息!
那么,新方法究竟是如何运作的?接下来一起看团队成员相关揭秘。
揭秘新方法JEST
首先, 现有的 大规模预训练数据筛选方法速度慢、成本高,并且没有考虑到批次组成或训练过程中数据相关性的变化,这 限制了多模态学习中的效率提升 。 因此,DeepMind团队研究了 联合选择数据批次 而非单个样本是否能够 加速多模态学习 。 研究得出了 3个结论 :-
挑选好的数据批次比单独挑选数据点更为有效
-
在线模型近似可用于更高效地过滤数据
-
可以引导小型高质量数据集以利用更大的非精选数据集
这一结果是如何实现的呢?
据团队介绍,他们 在之前的工作中 已展示了,对 最好的50%数据 进行训练如何显著提高FLOP效率。
-
选择好的批次 > 选择稍微好的数据点
-
调整默认的ADAM超参数
-
非常高质量(但很小)的参考数据集
这一研究证明了:
另外,研究强调了 使用高质量的精选数据集 来训练参考模型的重要性,这有助于优化大规模预训练的数据分布,从而提升模型的泛化能力。多分辨率训练对于协调评分和学习者模型至关重要
针对大家可能的疑问:
团队预先解释,相关结果表明精选的参考模型是专家型模型(在某些任务上表现良好)。JEST++利用专家型参考模型, 将其转化为通用模型 ,在所有基准测试中都取得了改进。为什么不只在用于参考模型的精选数据集上进行训练呢?
最后,研究发现JEST++最终可以通过消除对预训练数据集的任何筛选需求来简化数据管理流程。
通过使用预训练参考模型,在未经筛选(原始)的网络规模数据上进行训练, 性能几乎没有下降 。
来自DeepMind
上述研究由来自DeepMind的 4位成员 共同完成。 Talfan Evans ,至今在DeepMind工作3年多,是机器学习团队的一名研究科学家,近期研究方向是大规模模型数据训练和任务对齐。曾就读于伦敦帝国理工学院戴森机器人实验室(空间/视觉感知系统中的实时分布式推理)。
目前相关论文已公开,感兴趣可以进一步了解。
论文:https://arxiv.org/abs/2406.17711
参考链接:
[1] https://x.com/rohanpaul_ai/status/1809792337293566209
[2] https://x.com/olivierhenaff/status/1805995802352910557
[3] https://x.com/nikparth1/status/1806001404294672775
[4] https://x.com/talfanevans/status/1805996146826817726 — 完 — 量子位年度AI主题策划 正在征集中! 欢迎投稿专题 一千零一个AI应 用 , 365行AI落地方案 或与我们分享你在 寻找的AI产品 ,或发现的 AI新动向
点这里 👇 关注我,记得标星哦~ 一键三连「分享」、「点赞」和「在看」 科技前沿进展日日相见 ~