MacTalk

20000 篇国际论文 4 篇最佳,它是唯一的中国面孔

周末看到一个获奖新闻,还挺开心的。11 月 28 日,全球人工智能顶级会议 NeurIPS 公布了 2025 获奖名单,阿里巴巴通义千问团队凭论文《Attention Gating Makes Better Foundation Models》拿下最佳论文奖。

四篇最佳论文中,它是唯一的中国面孔。今年大会投稿量两万篇左右,接收率 25%,最佳论文只有 4 篇,竞争激烈得像另一场“Scaling Law”。千问最终能从 2 万篇论文中脱颖而出,本身就是中国技术力量的一个重要信号。

上周我在 MacTalk 里写了千问和夸克的合体,提到了:

自 2023 年全面开源以来,阿里 Qwen 模型已成功超越 Llama、Deepseek 等竞争者,成为全球性能强劲、应用范围最广的开源大模型。至今,Qwen系列模型的全球累计下载量已突破 7 亿次,在行业内积累了极高的声誉。

池建强,公众号:MacTalk从 1000 万 App 下载到 1 亿桌面:千问与夸克合体成 AI 浏览器了

很多读者说,“你不写都不知道阿里开源模型的下载量都这么大了”。事实上,基于 Qwen 的衍生模型数量已经超过 18 万个,2025 这一年,中国 AI 技术力量发展相当迅猛。

1

什么是“Attention”?已经为什么是 Attention Gating


Transformer 自 2017 年出现以来,“Attention”就像新世界的电力网络,促成了当下大模型的一切推演能力。今天我们使用的所有主流模型——无论是 GPT、Claude、Gemini,还是国内的千问、豆包、文心、元宝、智谱 GLM、MiniMax M2 等等,本质都是在这一体系中迭代。

什么是 Attention(注意力)呢?就是大模型里用来计算“该关注谁”的机制,是大模型在一大堆信息里,自动“挑重点”、决定“该看谁、该忽略谁”的一种方法。

比如你正在读一句话:“小明把苹果给了小红,因为她更喜欢水果。”这里有个“她”,到底指的是谁?我们作为人类读者自然很清楚,是小红。但模型怎么理解这句话呢,它也需要“回头看前面”,但之前如果还有很多文本,看哪儿呢?

Attention 就是干这事的:在大量文本里,找到最可能相关的部分,并给它们更高的权重。

它会抛出一个问题:我现在想理解“她”,谁能帮我?

所有“人”举手回应:

小明说:我这里没提到“喜欢水果”,关系不大。

小红说:我这里提到了“喜欢水果”,我可能相关。

“苹果”、“给了”等词也会回应,但力度较弱。


模型给每个回复打分:越相关,分数越高。最终,小红得到最高分,于是模型在理解“她”时,会更关注“小红”这个词。

Attention 的数学形式简化版大概是这样子:

相关性分数 = Query(我现在想找什么) 和 Key(每个词有什么信息)的匹配程度

最后根据分数,把 Value(每个词的实际内容) 加权合成一个结果。

其实就是:Query 问问题,Key 回应问题,Value 提供内容;分数越高,Value 被放大的越多。

Attention 解决了传统 RNN 难以捕捉长距离依赖的问题,让模型能在一次计算里“看见”并选择重要的上下文。

在 Transformer 里,Self-Attention 让一句话里的每个词都能“看见”彼此;跨模态的 Cross-Attention 则让文本去对齐图像、音频等内容。训练阶段会用掩码控制“谁能看见谁”,推理阶段把之前的 K、V 缓存起来,减少重复计算。真正的工程难点在算力和显存——注意力的计算随序列长度成平方增长,文本一长就爆炸。于是才有稀疏注意力、滑窗注意力、线性注意力、MoE 路由,以及各种剪枝、量化等一系列折中方案,目的都是同一个:让模型在足够长的上下文里,尽可能用更少的资源做更有效的关注。


但是,随着模型能力不断变大,成本和噪声也在不断变大。通义千问这篇论文“Attention Gating”就是在解决模型能力变大后出现的问题。

论文的思想简洁漂亮:不是所有注意力都值得计算,也不是所有 Token 都需要参与全局计算。

Attention Gating 的核心就是让模型学会“节制”——在注意力之后加一层可学习门控,相当于给权重再做一次筛查,把无效信息挡在 FFN(Feed‑Forward Network) 之前,让注意力分布变得更稀疏、更有结构、更有选择性。它像在原本无差别铺开的电网中,加入一组动态调度的“开关”,让模型把算力真正用在值得花时间的地方。

这是一种非常工程化、也非常数学化的思维。千问团队找到了更高层的结构规律,让模型以更低成本换来更高质量的能力提升。

论文给出的结论是:Attention Gating 能显著提升大模型的泛化质量;在相同算力下,它能让语言理解、推理、对齐能力全面增强。更重要的是,它为后续更高效、更大规模的模型训练打开了空间。

该项研究成果已经开始应用于下一代千问模型:Qwen3‑Next。


好的,你和我拼算力和卡,那我们就来提高效率吧。这是一次在基础层面的“架构跃迁”,也是论文获奖的核心要素。

2

之前介绍千问的时候我就写过,在国内 AI 公司里,通义千问一直走的是“从底而上”的路线:先把基础模型打穿,再构建产品与应用层。这篇论文能获得 NeurIPS 最佳论文,本质是一个长期积累的结果。

过去两年里,千问团队在模型结构、训练策略、对齐体系上的迭代,都指向一个目标:打造中国最扎实的基础模型体系。从时间线上也能看出来:

从千问 2.0 的结构重写,到千问 MoE 的训练体系,再到千问 2.5 的长上下文与工具使用能力,到 千问 3 发布,千问 App 发布……Attention 是贯穿其中的一条隐线。

论文里提出的 Attention Gating,其实正是千问模型演化过程中“踩过的坑、总结过的规律、解决过的瓶颈”的系统化呈现。从这个意义上说,最佳论文更像是 NeurIPS 在肯定千问的技术路线。


NeurIPS 最佳论文的意义从来都不是论文本身,而是它会如何改变接下来一年的 AI 产业。当模型越来越复杂、参数越来越大,真正的竞争除了堆卡,还要看谁能在结构层找到新的规律、找到更高效的路径。

我觉得千问团队这篇论文之所以重要,在于它有效提升了下一代模型的效率,拓展了能力边界。事实上每一次国内在基础层面的突破,都会让很多讨论变得具体,也更有信心。

我们常说“AI 是工程,也是科学”。工程决定能不能用,科学决定走多远。Attention Gating 获得 NeurIPS 最佳论文,就是在科学层面的重量级突破。它让人看到了未来几年大模型架构可能的方向,也让人看到国内大模型研究的深度与希望。

显然,这也给我们这样的小型创业公司更多信心,让我们能够在国内做得好一点点。