THE READING ROOM
2022 年文章
让阅读慢下来,跟随好奇心发现下一篇。
预训练无需注意力,扩展到4096个token不成问题,与BERT相当
在不使用注意力的情况下能够复制BERT预训练结果,并可扩展到4096个token的长程预训练。
阅读全文 :预训练无需注意力,扩展到4096个token不成问题,与BERT相当对Copilot进行逆向工程之后,我发现它可能只用了参数量12B的小模型
Copilot 使用的是可能 12B 参数模型而不是 175B 参数模型。对于开源工作者来说,这是非常令人鼓舞的,这意味着一个中等大小的模型就可以提供如此优秀的建议。
阅读全文 :对Copilot进行逆向工程之后,我发现它可能只用了参数量12B的小模型