MacTalk

横扫海外的阿里大模型,有自己的APP了,叫“千问”

11 月 17 日,也就是今天,阿里巴巴正式上线了 “千问 App”这个产品。作为内测用户,我必须得说,这是一个让我有点“意外”的阿里产品。

一直以来,阿里在大模型领域的代表作是 Qwen,一版接着一版,升级再升级,像一台藏在机房里的巨型服务器:轰鸣不止、性能强劲。行业里谈开源模型,绕不过 Qwen;看 Hugging Face 榜单,Qwen 系列模型产品几乎是“屠榜”一样的存在;硅谷开发者在 X 上会大量讨论和 Qwen 相关的新闻,把 Qwen 作为他们的“默认模型配置”……我一度以为,阿里在这个领域只做基座模型和 B 端市场。

上个月和朋友聊天还觉得挺纳闷的,OpenAI 有 ChatGPT,Google 推出了 Gemini,字节有豆包,腾讯有元宝,阿里怎么一直潜心技术,没在 C 端发力呢?

这一次,千问来了。

阿里把最新最强大的 Qwen 系列模型,装进了一款面向 C 端用户的独立 App 里,这款产品就叫做“千问”。我理解,这是一次从模型到产品、从 B 端到 C 端的全面发力:阿里决定认真做一款面向普通用户的 AI 助手,目标很直接——做“中国版的 ChatGPT”,做阿里最强大模型的第一入口。

还有两个出乎意外的点是:1、阿里这一次在产品上做了减法;2、千问是免费的,用户可以免费使用千问的所有功能

一、极简到不像阿里产品的 AI 应用

第一次打开千问 App,最明显的感觉是简单和干净。

Image

之前我们对阿里的产品感觉都是功能强大繁复、入口很多,电商、支付、本地生活等横向打通之后,界面上难免堆满各种业务入口。

我打开千问,第一感觉想到的是 ChatGPT 和 Gemini 这两款产品:简洁有力,直接把模型能力给到用户。

首页是“几乎什么都没有”的主对话界面——没有底部 tab,中间是对话信息流,底部是文字和音频切换的输入框,底部右边是拍照和“+”号按钮,可以上传图片、录音、文件,或者直接开启通话模式。输入框上面是一系列功能区:深度思考、AI 修图、翻译、实时记录以及各种创作功能。

顶部则保留了模型名称“千问”,点击可以实现模型切换。

Image

如果说“简单”代表了一种“AI 应用美学”——把复杂能力藏在一个对话框背后——千问这次明显在采用这样的设计思路:做减法,把注意力全部收拢到主 Chat 上,用一个窗口承载尽可能多的能力。

二、主 Chat:一个窗口,把事情都做完

问了阿里的同学,千问 App 的主模型,采用的是阿里当前最新的 Qwen3 闭源模型,应该是阿里内部能用到的最强大脑。不过,对用户来说,这种升级并不体现在参数规模和榜单排名上,而是体现在非常具体的感受里:能不能听懂复杂的问题,能不能帮忙拆解事情,能不能在一个对话里把一件事都做完。

1. 问答:从“会聊天”到“能办事”

在千问里敲几个问题,很容易注意到一个变化:回答不再是“堆砌资料”,而是更结构化、更有取舍、更加系统和准确。

比如我问一个复杂的行业事件,核心是“中芯国际量产 7nm 芯片对中美竞争格局意味着什么”,它会先把事件背景捋一遍,再按“技术路径(怎么做到的)、产业意义(产能和市场)、战略影响(中美大国未来 AI 走向)”拆成几部分,还会画表格做多维度的对比,方便用户追问细节等等。

Image

这样的结构化输出就是千问主 Chat 的默认风格。无论是对比不同理财产品的流动性、收益率、风险等级,还是整理一个长篇报告的核心内容和要点,千问会倾向于自动按表格、清单、时间顺序来组织内容,让人少一点“自己整理”的负担。

更明显的差异,在专业问答上。财经、科技、学术、职场研究这些场景,过去一直是很多中文模型的“薄弱项”:要么说得太浅,要么堆了一堆专业术语却没有观点。千问这次的主模型,在这些领域里明显更“耐问”——能给出相对权威的解释,也更善于基于权威信息源来构建结论,而不是凭空“编一个说法”。

许多模型面对长文档会出现:重复、遗漏、理解偏差、逻辑跳跃。而千问 App 的输出明显更“稳”,背后是最新 Qwen 模型在“长上下文压缩”“语义对齐”“知识调用”上的能力提升。

比如我把一份 30 页的英文 AI 人才职业报告丢给千问解读,它差不多是秒回的速度给了一份 2500 字的中文解读,结构化,精准,清晰,图文表并重,你也可以试试,毕竟这些能力都是免费的 😂:

Image

如果说 ChatGPT 的优势一直在于“泛化能力”和英文世界的知识深度,这一轮的千问,则同时把中英文专业领域把能力往前推进了一步。

2. 千问把多模态放到了用户手边

大模型的多模态能力,今天已经不再新鲜事儿:看图、识别物体、读文档、看截图,这些能力 ChatGPT、Gemini 们都在不断强化。千问 App 的特别之处在于底部那个 “+” 的设计,这里显然是花了心思的。点开之后,用户可以直接拍照片拍视频,甚至录音、通话,这些都可以成为 Chat 的一部分,当然,你也可以选择现有的各类文件喂给千问。

这个设计其实非常精巧,比如我想现场录音现场分析转译,并不需要专门的录音软件和设备,录完后导出文件,再把文件喂给大模型,在千问里,这些操作是一步到位的,用户只需要持续交流和追问即可。

这样的交互显然更符合国人的使用习惯。这也意味着日常工作里的大部分杂事——写文档、录音、开会、看图、读报告、打视频——都可以直接扔进这个 Chat 窗口里解决:

把一张股票的 K 线图丢进去,问一句:“看下最近的股价涨跌?可能是什么原因?”千问会先读图,再结合同期新闻、公告,给出一个带推理过程的解释,并顺手列出几个值得追问和分析的问题;

Image

体检之后把体检报告拍一张,问“哪些指标不太正常,一般说明什么问题,需不需要关注”,它会把需要关注项目挑出来,再解释对应的临床意义,最后帮用户做个总结,包括咨询医生要注意的事项。

签合同之前,把关键条款截图上传,问“这里写的‘不可退费’在法律上站得住脚吗”“这份租赁合同里对转租的限制有没有留余地”,千问能结合条款文本,指出可能存在风险的表述,以及需要保留的证据类型。

Image

和员工 1V1 对谈打开千问的录音功能,谈完了,重点全都出来了,包括双方的情绪和值得关注、改进的地方都能给你标出来。

我在内测期间使用了很多这样的案例和千问沟通,显然,千问是把视觉理解和复杂推理揉在一起。千问背后集成的是 Qwen3-VL 这样的视觉理解模型,它在 Chatbot Arena 的 Vision 榜单上已经做到全球第二、开源第一,如今这些能力变成了普通用户可以直接点开即用的功能,非常了不起。

3. 创作,我用深度思考把“想”的过程展示出来

当我写文章、做行业调研、读技术论文、做产品研究的时候,我会选中底部的“深度思考”。

它像是给模型加了一个“认真模式”开关。开启之后,千问在回答复杂问题时,不再追求第一时间给出结论,而是愿意花更多算力和时间,展示一个更完整的思考过程,包括中间的推理链条,给用户更多启发。

比如我想研究一下“什么是 AI 超级公司,如何成为 AI 超级公司,以及 AI 超级公司的服务和产品”,那我先找到了阿里的这份 50 页的白皮书“AI Super Company White Paper:Enterprise Evolution and Value Reshaping”,把它丢给千问,让它在“深度思考”模式下,帮忙做三件事:提炼这份白皮书的主要观点、指出数据支撑最充分的部分、标记可能存疑的假设,给创业者有什么样的启示。过程中,模型会把自己的分析路径展现出来,让人知道它到底是“精读”了哪内容,是如何思考和呈现最终内容的:

Image

对于习惯和 AI 一起工作的人来说,这种“可见的思考过程”,比一个漂亮的摘要更有价值。它让人与模型之间的信任,不再建立在“盲目信任大数定律”上,而是建立在“看得见的推理链条”上。

4. 翻译是我超喜欢的能力:从 119 种语言,到一个自然场景

以前看英文书,拍个照片丢给大模型,大模型会给我一段翻译过来的中文。千问是怎么做的呢?它会给做一个翻译好的中文图片,方便我保存,还提供了分段对照的翻译内容。

Image

这个场景抓的非常精妙。翻译是千问的基础能力而不是单独的“产品线”,翻译融入了整个主 Chat 的体验。

千问支持 119 种语言的翻译服务,从冰岛语、柬埔寨语到朝鲜语,文本、图片、文档翻译一网打尽。事实上千问还可以做同传翻译和面对面互译。

把翻译和其他能力组合起来,场景就更有趣了:

出国旅行前,可以把酒店确认邮件、当地交通指南一股脑丢进千问,让它先翻译一遍,再帮忙整理成一页“出行备忘录”;读一篇英文论文的时候,不再需要在翻译软件和 PDF 阅读器之间来回切换,而是把 PDF 上传到千问里,一边提问一边翻译,顺带让它帮忙解释图表。把其他语言的图片,直接转换成中文图片……

翻译不再是一个孤立的功能,而是自然融入“理解”和“生成”的链路里。这也是大模型时代工具的一种典型变化:过去软件只负责“对字负责”,现在开始对“理解负责”。

5. 国产版的 ChatGPT?是也不是

千问和 ChatGPT 有不少相似之处:极简风格,以对话为中心,把多模态、长文本理解、结构化输出这些能力,收拢到一个窗口里。

但气质上,两者又有明显差别。

ChatGPT 逐渐演化出一个“工具与助手兼具”的形象:一方面是生产力工具,另一方面也承担了不少“陪聊”和创意发散的功能。很多人会和它聊困惑、聊情绪、聊创作灵感。

千问在产品策略上则更克制——它的定位更偏向“冷静、中性、可靠的生产力工具”,不刻意强调情感陪伴,也没有做资讯聚合的入口,更像是一把纯粹的瑞士军刀:专业、稳定,可以信赖。

其实两者还有一个最大的区别,ChatGPT 我每个月要花 20 美金,千问现阶段全功能免费使用的。

最后,当最强模型与最轻应用结合在一起,问题就变成了:这样一款“极简版阿里产品”,到底是怎么炼成的?

三、千问背后的大脑:Qwen 是怎么走到这一步的

任何一个 AI 应用,最后都会落到一个问题上:它背后的模型,到底有多强?

千问的答案是 Qwen,这是一个近两年在全球开源社区存在感越来越强的名字。

1. 从开源冠军,到 App 入口

2025 年 9 月底,Hugging Face 公布了一份模型趋势榜单:全球前十的开源模型里,有 7 个来自同一个家族——Qwen。

Image

这是一个相当罕见的场面。开源世界一向讲究“百花齐放”,不同机构的模型交替占据榜单。在那个时刻,Qwen 完成了一次“集团作战”:通用模型、视觉模型、编程模型、音视频模型,每一条线上都有人领跑。

拉长时间的维度看,Qwen 在开源社区已经建立起了一个庞大的生态:

全球下载量超过 6 亿,衍生模型数量突破 17 万,超越了美国的 Llama,成为全球规模最大的开源模型家族;在 2025 年初的 Open LLM 榜单上,前十名的开源模型,全都是基于 Qwen 二次开发的衍生版本。

Image

这意味着什么?意味着全球大量的开发者,已经在用 Qwen 当“底座”搭建自己的应用。也意味着,当阿里把千问 App 推向 C 端时,背后站着的是一个早已被验证过的生态系统。

Qwen 可以让我们很骄傲的说:大模型领域,中国产品也是站在第一线的。

2. 一个 App,几乎把家族装全了

从技术架构上看,千问 App 并不是只接了一个“Qwen 3”,而是把整个 Qwen 家族的核心成员都搬了进来。

主 Chat 背后,是 Qwen3 系列的闭源旗舰模型。它负责绝大部分自然语言理解、复杂推理和长文本处理任务,在 Chatbot Arena、Artificial Analysis 等多个国际评测中,已经站在全球第一梯队——包括在代码自动修复测试 SWE-Bench Verified、工具调用测试 Tau2-Bench、数学推理测试 AIME25 和 HMMT 上,交出了“全球第一梯队”“双满分”这样的成绩单。

视觉理解的任务,则交给了 Qwen3-VL。它在 Vision Arena 视觉榜单中位列全球第二、开源第一,在 Chatbot Arena 总榜单上也排到全球第八、开源第一。这个模型负责“看图说话”“看图推理”相关的能力——前面提到的看体检报告、看合同、看股票图,实际上都是它在背后工作。

Image

图像的生成与编辑,则由 Qwen-Image 来承担。在文生图赛道上,它排名全球第五、开源第一,在图片编辑榜上全球第二、开源第一——这些能力在千问里,逐步被融入修图、生图等功能中。

Image

编程相关的任务,则由 Qwen3-Coder 搞定。在 WebDev Arena 这类专门测试代码生成的榜单上,它已经做到全球开源模型第一,并在多项 Agent 能力评测中超越 GPT-4.1、Claude 4 等闭源模型。对于开发者而言,这意味着千问里的“写代码”能力,不只是一个玩具,而是真能写出可运行项目的工程级工具。

音视频通话相关的能力,交给 Qwen3-Omni。这是一个专注音频理解与多轮语音对话的模型,在 32 个权威测试集中取得开源最佳性能,可以比肩 Gemini 2.5 Pro 级别的语音交互体验。

在普通用户眼里,这一切只是一个简洁的对话框;但在工程视角下,千问是这个模型矩阵的统一入口,把 Qwen 家族的核心成员有机组合起来,按照场景自动路由。

3. 中国出品,一点也不差

判断一个模型是否强大,可以看看用户和对手怎么评价。过去这一年,Qwen 在海外的存在感肉眼可见地上升。英伟达 CEO 黄仁勋在财报电话会上,公开夸赞阿里的 Qwen 是“开源模型里最好的一批”,上线之后在美国和欧洲获得了巨大关注;

Airbnb CEO 在媒体采访中,说公司正在“大量依赖阿里巴巴的通义千问模型”,并且直接给了一个朴素评价:比 OpenAI 更好、更便宜;

Image

谷歌前 CEO 则在一次公开场合里,说通义千问的能力已经可以和 OpenAI 的 o1 相提并论——这是一个相当高的比较基准。

另一边,开源社区对 Qwen3 的反馈也颇为热烈。Qwen3-Coder 开源之后,Hugging Face CEO 连发十多条推文点赞,推特创始人 Jack Dorsey、Perplexity CEO 等人也纷纷评价它“令人惊叹”;

Image

李飞飞团队在《2025 年人工智能指数报告》里,对全球重要大模型做了一次统计:2024 年入选的重要模型中,美国 40 个,中国 15 个,其中国内贡献最多的三家机构是谷歌、OpenAI 和阿里。

Image

显然,Qwen 已经不再只是一个“中国自己的大模型”,而是一个正在被全球开发者和科技公司广泛使用的基础设施。

千问这次上线,等于是在这套基础设施上,增加了一个通向普通用户的入口,把大模型的能力和算力,真正导向了日常生活和个人工作。

从基座模型到 C 端入口,这是阿里在 AI 领域一次更清晰的战略拐点。

阿里这次推出千问 App,本质上是在回答两个问题:

第一个问题是:阿里到底要不要认真做 C 端 AI 应用?

从千问的定位来看,答案已经很明确了:这是一个战略级别的、面向大众用户的独立应用。它有清晰的品牌(“千问”取代了旧的命名体系)、明确的目标(对标 ChatGPT)、冷静的产品气质(工具优先、效率优先),还有一次性拉满的模型配置。

第二个问题是:千问的产品定位是什么。

今天打开国内外应用商店,大模型应用的两极分化很明显:一边是走重情感陪伴路线的产品,强调陪聊、人格化、温度;另一边则是以工具为主的应用,强调效率、专业、可靠。

我个人感觉千问走了后者:先把工具打磨到足够可信,再在此基础上扩展更多场景。对习惯使用 ChatGPT、Notion AI 之类工具处理工作的人来说,这种克制会显得很舒服。

从更宏观的角度看,千问的上线,也标志着阿里在 AI 战略上的一个拐点:从过去更偏重 B 端和底层技术(模型、平台、云),开始认真补齐 C 端入口。我想,这种从“基座”到“入口”的延伸,对于任何一家大模型公司来说,都是绕不过去的一步。

先进模型,最强助手,这就是我对千问的当下印象。如果用大白话来描述的话,我愿意说,ChatGPT有的,千问都有,还是免费的。