Qwen3正式开源,小孩才做选择,千问大小通吃!
就在刚刚,凌晨5点左右,昨晚被大家传疯了的Qwen3系列大模型他终于来了,具体是什么让大家这么期待,一文简单给你讲清楚。
01 “大小通吃” 的模型家族,小模型也能办大事
Qwen3 这次推出了超豪华阵容:
1. “巨无霸” MoE 模型:Qwen3-235B-A22B(2350 亿总参数)和 30B-A3B(300 亿总参数),采用混合专家模型架构,就像组建了一个 “专家团队”,每个任务派最擅长的 “专家” 处理,效率拉满。比如 30B-A3B 虽然激活参数只有前辈 Qwen-32B 的 10%,但性能反而更好,真正实现 “少花钱多办事”。
2. “小而精” Dense 模型:从 60 亿参数的 Qwen3-0.6B 到 320 亿参数的 Qwen3-32B,清一色密集型架构。最惊艳的是 40 亿参数的 Qwen3-4B,居然能比肩 720 亿参数的 Qwen2.5-72B-Instruct。
02“思考模式” 自由切换
复杂问题慢慢想,简单问题秒回答
这是 Qwen3 最独特的创新点:支持“思考” 与 “非思考” 两种模式:
1. 思考模式(深思熟虑):遇到数学题、代码编写、逻辑推理等复杂任务时,模型会像人类一样 “一步步列思路”,比如解数学题先写公式推导,再给答案。适合需要深度推理的场景,正确率更高。
2. 非思考模式(快问快答):回答 “今天天气如何”“草莓有几个字母 r” 这类简单问题时,模型直接 “秒回”,不拖泥带水,速度堪比聊天机器人,节省时间成本。
官方测试显示,在数学竞赛题 AIME'24 中,思考模式正确率 85.7%,非思考模式也有 80%;代码任务 LiveCodeBench 上,两种模式差距仅 5% 左右,真正做到 “该快则快,该慢则慢”。
03“全球通” 属性拉满,119 种语言无缝切换
Qwen3 支持119 种语言和方言,从英语、中文这种大语种,到冰岛语、斯瓦希里语等小众语言,甚至阿拉伯语的多种方言(埃及语、摩洛哥语等)都能轻松处理。
覆盖印欧、汉藏、亚非等 9 大语系,国际开发者和多语言场景(比如跨境电商客服、多语言文档处理),再也不用为语言适配头疼。
04 性能全面升级:
代码数学双杀,小模型性价比之王
1. 代码能力:在 CodeForces 编程评级中,Qwen3-235B-A22B 达到 2056 分,超过 DeepSeek-R1(2029)和 Grok-3(2001),逼近人类高级程序员水平;小模型 Qwen3-4B 在 LiveCodeBench 上得分 54.2%,是同参数级少见的 “代码能手”。
2. 数学推理:AIME'24 数学竞赛题正确率 85.7%,比上一代 Qwen2.5-72B 的 58.9% 直接翻倍,连 GPT-4o(11.1%)都被远远甩在后面。
3. 效率:30B-A3B 用 10% 的激活参数(30 亿 vs 前辈 320 亿),性能反超,训练和推理成本大降,中小企业也能用得起 “高性能模型”。
05 开源诚意拉满
阿里云这次直接开源了8 个模型(2 个 MoE+6 个 Dense),包括最大的 235B-A22B 和最小的 0.6B,全部采用宽松的 Apache 2.0 协议,可商用。配套工具也很齐全:
1. 部署轻松:支持 Hugging Face、ModelScope、Kaggle 等平台,一行代码就能调用;本地部署用 Ollama、LMStudio 等工具,电脑就能跑。
2. 开发友好:提供详细的 Python 示例代码,教你如何切换思考模式(加个参数 “enable_thinking=False” 就行),还支持在对话中用 “/think”“/no_think” 动态切换。
Qwen3 的预训练数据量暴涨到 36 万亿 token(是上一代的 2 倍),还专门强化了数学、代码等 “硬核能力”。
官方透露,下一步会重点优化模型架构,扩展上下文长度(目前最长 128K,约 9 万字),探索多模态(比如图文结合),甚至推进 “智能体” 训练, 未来可能不止回答问题,还能主动帮你完成任务(比如写代码、做数据分析)。
Last but not least
从「堆参数」到「巧分工」,Qwen3 让大模型挣脱「笨重」的枷锁,小模型托举轻量化,巨模型承载复杂世界,就像给每个开发者递上一把能打开不同门锁的万能钥匙,让 AI 不再是云端的神话,而是落在键盘上、嵌进生活里的真实生产力。
当参数不再是唯一的标尺,这或许就是大模型最好的模样。
关注公众号,用极客视角洞察未来!
往期精彩文章推荐: