卡帕西点赞Transformer内置计算机!每秒3万Token吞吐,拿下世界最难数独
闻乐 发自 凹非寺
量子位 | 公众号 QbitAI
LLM推理已经顶尖,精确计算却跟不上。
这局怎么破?
卡帕西点赞的解决方法来了,
在大模型内部构建一台原生计算机
。
在Transformer内嵌原生计算机
咱都知道,当前最先进的大模型,拿下奥赛金牌已经不足为奇了。 甚至有些还能挑战人类还未解决的数学问题与科学问题。 但有一个始终无法回避的现实是,这些模型在需要 多步骤、长上下文的精确计算任务 中,仍然表现惨淡。 为了弥补这个短板,现在行业上有两种主流的解决方案。 一是 工具调用 ,让模型生成脚本,由外部沙箱解释器执行后返回结果; 二是 智能体调度 ,通过外部状态机拆分计算任务,循环调用模型处理上下文。 但这两种方式的本质,都是给模型开“外挂”,把计算能力挂靠在外部。 标准Transformer的自回归解码,更是让这一问题雪上加霜—— 每生成一个Token,模型都要对全量历史序列进行注意力扫描,计算代价随序列长度线性增长,让长轨迹的精确计算不可行。最难数独100%精确求解
团队选取了两个典型的长程精确计算任务来验证这套方法。 这两个实际任务是 10×10最小代价完美匹配 和公认的 世界最难数独Arto Inkala 。 在10×10最小代价完美匹配任务中,模型内部执行匈牙利算法,全程以自回归方式生成计算轨迹。 从行分配、Dijkstra算法求解,到对偶变量更新、增广路径查找,每一步的计算过程与代价累积都清晰记录,最终精准求解出最优匹配方案。 整个过程在CPU上完成,Token生成速度达到33583 Token/秒,7301行/秒的指令输出效率。[1]https://x.com/ChristosTzamos/status/2031845134577406426?s=20
[2]https://www.percepta.ai/blog/can-llms-be-computers 一键三连 「点赞」「转发」「小心心」 欢迎在评论区留下你的想法! — 完 — 🌟 点亮星标 🌟 科技前沿进展每日见