MacTalk

我用上了豆包手机掀巨浪,DeepSeek和谷歌发 Deep Think,阿里推千问和语音模型,开源大战 | 2025.12.08

最近一段时间 AI 世界像被按下了快进键,看着这些发布的产品我都觉得 AI 产业似乎来到了一个历史拐点。我自己有个明显的感知:行业重心从单纯的“预训练规模定律”(Scaling Laws)向“并行推理计算”和“端侧 Agent 化”(Edge Agency)的深刻转型。

比如 DeepSeek V3.2 发布时论文里提到了“Thinking in Tool Use”,DeepMind 团队则提出并发布了“Deep Think 模式”,并行推理能力变得无比重要。

字节则联合中兴通讯推出了一款“豆包 AI 手机”——nubia M153,把端侧 Agent 向前推了一大步,只要你允许豆包操作你的手机里的 App,它几乎可以做任何事,这同样引起了轩然大波。其他厂商的不安和用户的隐私安全问题一直是本周的发酵话题。我用上了:

Image

模型迭代加速,开源与闭源同台竞争,多模态继续扩张,Agent 开始入侵手机端侧。今天上午我梳理一下最近发布并给我深刻印象的产品,就是这些:

Image

1

最近一周最炙手可热的手机可能是豆包 AI 手机。这是第一款 Agent 与硬件的物理融合:字节跳动与中兴通讯合作推出 Nubia M153 原型机,定义了全球首款“全 Agent AI 智能手机”。豆包大模型则通过这个原型机实现了我们想要 Siri 实现的功能:按住左侧的 AI 键,告诉豆包帮我发一条微博,告诉 QQ 音乐播放李健的歌单,帮我把微博的特别关注列表整理成文章等等。

为了实现这些功能,该设备采用了独特的双层架构:

云端大脑(Doubao):字节跳动的 豆包(Doubao) 大模型负责语义理解和复杂推理,规划任务步骤。

端侧执行者(Nebula-GUI):中兴自研的 7B 参数 Nebula-GUI 模型 驻留在手机本地(搭载骁龙 8 Elite Gen 5 芯片)。它负责实时分析屏幕截图,识别 UI 元素,并执行点击操作。这种本地处理不仅速度快,还最大限度地保护了支付密码等隐私数据。

这部手机的问世,一方面为用户带来了巨大的惊喜,另一方面引发了诸多争议。

比如 Siri 想做到这一点,首先苹果要具备相应的 AI 能力,第二苹果必须要和各大厂商签订相关的协议,第三要做好隐私和安全承诺。

豆包好像没和谁打招呼,只要用户同意,就可以让 AI Agent 接管你的手机。这个举动自然引发了 App 厂商的反制,比如微信支付宝就不让豆包用,今天阿里侧的产品也禁止 AI 使用自己的 App。豆包应该很快意识到了这一点,在 12 月 5 号紧急发布了一个声明:

1、限制刷分、刷激励的使用场景

2、进一步限制金融类应用的使用

3、限制部分游戏类使用场景

具体内容大家可以去看豆包手机助手的公众号。

目前我还在把玩和探索这台 AI 手机,但它显然不会作为我的主力机使用。等我做个详细评测,可能会再写一篇文章。

2

推理能力也是最近的热门话题:中国的 DeepSeek 发布了 V3.2 及其高算力版本 V3.2-Speciale,通过架构创新(稀疏注意力机制)在国际奥林匹克数学竞赛(IMO)和信息学奥林匹克竞赛(IOI)中摘得金牌,并在多项基准测试中超越了 OpenAI 的 GPT-5 High 和 Google 的 Gemini 3 Pro。这一成就打破了算力成本与智能水平之间的传统线性关系,证明了算法效率可以挑战资本密集的算力堆叠。

可以参考我的公众号文章:DeepSeek 发布 3.2 加强推理能力

谷歌则继续在 Gemini 3 上突飞猛进,推出了 Gemini 3 Deep Think 模式。这是一种基于并行假设评估的 System 2 思维模式,专门为解决极度复杂的逻辑和科学问题设计的,这个服务目前只针对每月 250 美元的 Ultra 订阅用户。

Deep Think 在海外社交媒体上引发了热议,它强调的是“并行思维”能力,在单次推理中同时探索多个假设,尤其擅长解决复杂数学和科学问题。有开发者声称,该模式能通过一个提示词就生成完整的多米诺骨牌模拟代码。

3

随着谷歌的大踏步前进,OpenAI 凸显生存焦虑,在内部信中,OpenAI CEO Sam Altman 罕见地宣布公司进入“红色代码”(Code Red)状态。面对 Gemini 3 的强势崛起和自身产品(比如 Pulse 助手)的技术瓶颈,OpenAI 推迟了多项发布计划,集中资源提升核心模型 ChatGPT 的能力。这一事件标志着 OpenAI 从“默认赢家”的心态跌落,进入了残酷的阵地争夺战。

我的墨问笔记:奥特曼老师开始慌了

4

中国开源生态正在全面爆发,除了 DeepSeek,阿里巴巴 Qwen 系列也在持续迭代,构建了一个在性能上足以匹敌闭源前沿模型的开源生态,彻底改变了企业级 AI 的部署经济学。阿里还发布了 Qwen3-TTS。这是一个支持 10 种语言和 9 种中国方言(如粤语、四川话等)的文本转语音模型。

多模态方向同样热闹。阿里巴巴的 Qwen3-VL 在 Hugging Papers 上讨论的极为火热,被认为开启了新的多模态纪元:原生 256K 上下文,同时处理文本与视频输入。

在 App 生态领域,阿里发布了千问 App 和千问+夸克 AI 浏览器,为超过 1 亿用户提供原生的 AI 搜索和摘要服务。

最近阿里的动作是真得快。

腾讯则继续发挥其在游戏和社交媒体领域的优势,专注于 3D 和视频生成。

混元 3D 引擎全球发布:腾讯云向全球发布了 Hunyuan 3D 创建引擎。该引擎能从文本或图像生成高质量的 3D 资产,直接对接 Unity 和 Unreal 引擎,旨在降低游戏开发的门槛。其模型在 Hugging Face 上的下载量已突破 300 万次。

HunyuanVideo:腾讯开源了基于“双流到单流”架构的视频生成模型 HunyuanVideo。据称,该模型在人工评估中超越了 Runway Gen-3 和 Luma 1.6 等顶级闭源模型,显示了中国在视频生成领域的追赶速度。

5

开源与欧洲力量:Mistral 3 的崛起,在美中两极之外,欧洲的 AI 力量也在本周发出了强音。

法国 AI 独角兽 Mistral AI 发布了其最新的旗舰模型家族 Mistral 3。其中最引人注目的是 Mistral Large 3,这是一个拥有 6750 亿参数(激活参数 410亿)的混合专家(MoE)模型 。Mistral Large 3 采用 Apache 2.0 许可证全开源发布。它在指令遵循和多语言处理上达到了与 GPT-4 等闭源模型相当的水平。对于那些对数据隐私敏感、希望在本地部署高性能模型的西方企业来说,Mistral 3 提供了一个除 DeepSeek 之外的最佳选择(规避了潜在的地缘政治合规风险)。

6

12 月初,Anthropic 宣布收购 JavaScript 运行时工具 Bun——这是一个极大提升 JavaScript 和 TypeScript 开发体验的产品,收购是为了加速 Claude Code 的发展,争夺开发者生态。

Anthropic 在公告里是这么写的:“Bun 正在重新定义现代软件工程和开发的速度与性能。Bun 由 Jarred Sumner 于 2021 年创立,其速度远超领先的竞争对手。作为一个集运行时、包管理器、打包器和测试运行器于一体的工具包,它已成为 AI 驱动的软件工程不可或缺的基础架构,帮助开发者以前所未有的速度构建和测试应用程序。”

Anthropic 目前依然是海外 AI 三巨头之一,11 月 24 日推出旗舰AI模型的最新版本Claude Opus 4.5,力压 Gemini Pro 3,霸榜的存在。随后又收购了 Bun,夯实技术基础和生态。

在人工智能时代,Anthropic 押注的一直是 AI 编程领域,事实上,Claude Code 在发布六个月后,其年化运营收入已经达到 10 亿美元。

Anthropic 今天收购了一家不赚钱...

昨天徒步走了十公里,睡觉极香,周日上午爬起来玩了会豆包手机,说梳理下最近 AI 领域里的话题吧。没想到写了这么多,就这吧,我吃饭去了。