梁博谈一谈:阿里千问为何单日破1.41万亿token?
前几天,阿里通义千问悄悄扔了个王炸,低调发布了Qwen3.6-Plus。
两天后,OpenRouter平台通过官方 X 账号发布推文,称阿里千问新模型 Qwen3.6-Plus 发布仅 1 天,单日处理token数量突破1.41万亿,打破了该平台单日单模型调用量的全球纪录。
千问这次为何能刷新全球最大 AI 聚合平台的日调用量纪录?
这次升级没玩“参数堆料”的套路,编程能力直接原地起飞,肉眼可见的那种。8分钟怼出一个完整官网,成本不到2毛钱,还支持100万Token超长上下文buff……
智能体编程(Agentic Coding)这次是真支棱起来了,能实打实写代码、修Bug、搭项目了。
这一次升级,不是单纯的功能迭代,而是国产大模型靠“数据红利”从“能聊天”真正转向“能落地”的明确信号。
千问这次到底多能打?
翻了公开评测、官方发布和第三方监测的结果,这波表现真的惊到我了:像仓库级代码修复、终端自动化这种程序员天天要面对的“真干活”场景,Qwen3.6-Plus直接杀疯了——不仅逼近Claude 3 Opus、GPT-4o这些海外顶流,部分场景甚至能正面硬刚不落下风!
国产模型为啥突然这么能打了?
训练数据跃升编程能力
国产模型咋突然就支棱起来,能跟海外顶流掰手腕了?
核心答案就俩字:数据!现在大模型圈的竞争,早就进入“数据军备竞赛”的阶段了——模型编程能力能实现飞跃,全靠训练数据的“精挑细选”和“科学配比”。
就说GitHub吧,尤其是里面的PR数据,相当于给大模型开了程序员实战课,完整记录了人类程序员是怎么改Bug、重构代码的,手把手教模型干活。
还有高质量题库、OJ平台(就是编程爱好者练手竞赛的平台),这些数据展示的解题记录,就是宝藏素材,里面藏着从遇到问题到想出正确解法的完整推理链,直接给模型的解题思路“开光”!
差异化碾压
不止“能打”,还“好用不贵”。和海外顶级模型比,Qwen3.6-Plus 的优势不只是 “更聪明”,还“更能用”:
性价比:API 价格仅为 GPT-4o 的1/3 到 1/6(视上下文长度而定),企业批量使用成本大幅降低;
部署友好:支持本地部署,不用依赖海外云服务,不用操心跨境的烦恼;
合规省心:完成国内十部门备案,金融、工业等高敏感行业也能放心用,避开 OpenAI、Claude 的合规坑。
百模下半场,不拼参数拼实干
阿里千问这波编程能力升级,可不是小事。这是国产大模型从“跟跑”转向“差异化领跑”的又一个强信号!以前总说“国产模型在高端编程领域只能跟跑”,现在呢?全球最挑剔的开发者,已经在真实工程场景里用脚投票,把信任给了国产模型!
决定大模型强弱的,从来不是参数堆得有多高,而是训练数据的质量有多硬;百模大战的下半场,早就不拼“谁更聪明”了,拼的是谁更能落地、更能干活。国产大模型,已经在这条路上找准了自己的节奏!