数据STUDIO

GPT-6都来了,还在魔改Transformer的也是神人了!

最近AI圈又被一个名字刷屏了:GPT-6,可以说各种大模型一直层出不穷。那现在还研究Transformer会不会太老了,都被研究完了?

实则不然!就说GPT6也被曝出用了Loop Transformer来提升性能。且仔细研读最近的顶会会发现,其依然是霸榜的存在!只是以往的简单“换一个Ateention模块”的思路out了!当下的研究主要着重让Transformer更高效、更可控、更具结构归纳偏置,以及探索Transformer到底是怎么学习和推理方面的。

为方便大家研究的进行,我给大家梳理了9大好出论文的方向,每个方向都提供了参考论文和源码,共166篇。这些文章全部来自CVPR、ICLR、ICML、ACL、AAAI等最新顶会,质量有保障!

Image
扫描下方二维码添加小享

回复【166变形】无偿获取

Image
具体来说:

主要解决Transformer太大、太慢、太耗显存的问题。

这是目前最成熟,同时也最容易出成果的一条路线。主流的研究路线有:token向、Layer、attention、参数等。

往这方向发论文,可以重点关注模型怎么动态算、GPU怎么真正执行。这部分给大家准备了19个idea,可以参考进行。

动态/自适应Transformer

主要解决为何所有输入都用同样的计算量。

其是当下非常核心的研究方向,目标比较有机会的思路有:让模型根据输入难度动态分配;Token、Layer、Expert联合动态变化等。

DiT

主要解决Transformer与扩散模型结合,生成质量高,但计算成本巨大的问题。

DiT的动态计算、视频DiT、训练/推理统一加速等都是不错的切入点。如果实在没头绪,可以看我给大家整理的28种创新思路。

Vision Transformer

单纯设计一个新的ViT block,已经很难打动审稿人了,目前的研究重点主要是token如何交互。

3D/Geometry Transformer

这是个在持续升温的方向,主要关注如何让Transformer真正理解三维空间。

Streaming 3D Transformer、3D Transformer与连续记忆等都是值得关注的方向。

多模态Transformer

  主要解决Transformer如何统一理解视觉、     语言、动作和环境。
  当下重点也在从怎么把两个模态拼起来,走    向不同模态如何共同参与推理和决策
除以上所说,Transformer的机制解释、Memory Transformer、推理等也是当下的热门改进方向。