分享于中关村创业大街:拨开媒体迷雾,正视 DeepSeek 的爆火
引言:媒体的“爆火”叙事与 AI 模型的“真实画像”
DeepSeek 爆火的流量驱动
“中美的棋子”效应 免费使用策略的裂变式传播 社交媒体的自发扩散效应 “国货之光”与民族情绪的共鸣
时间线上,如下
12 月 26 日,V3 上线&报告发布:550 万美金训练出来的顶级模型 小红书难民... 1 月 17 日:《OpenAI:如不行动,1750 亿美元将涌入中国项目》 1 月 20 日,R1 上线&报告发布:小范围引燃 1 月 20 日,总理李强 1 月 20 日下午主持召开专家、企业家和教科文卫体等领域代表座谈会,听取对《政府工作报告(征求意见稿)》的意见建议。 1 月 21 日,OpenAI:星际之门计划 1 月 27 日,全球 APP Store 登顶 1 月 30 日,《Anthropic CEO 发万字檄文:DeepSeek 崛起,白宫应加码管制》
正视 DeepSeek 的缺点:一个很强的模型,但很偏科
DeepSeek 的技术优势与突破: 国产算力的使用:利用华为 910B,可以轻松部署该模型(目前很多算力平台均通过此来部署了) DeepSeek R1 Zero 的纯 RL 方案跑通了,让我们的「数据困境」得到解决,并且效果非常不错 MoE 架构规模化应用: DeepSeek 在 MoE 架构的规模化应用上取得了突破, 通过创新性的稀疏激活策略, 实现了超大规模 MoE 模型的低成本高效训练和推理。 强化学习推理能力提升: DeepSeek-R1 模型在强化学习推理训练方面取得了重要进展, 使其在数学、 编程、 逻辑推理等任务上可与 OpenAI 顶级模型相媲美。 模型蒸馏技术成熟: DeepSeek 熟练掌握了模型蒸馏技术, 能够将大模型的知识和能力 “迁移” 到小模型中, 从而降低模型部署门槛。 低价 API 策略的推出:DeepSeek 在 2024 年 3 月正式推出 API 付费服务, 并采取了 “超低价” 策略 , API 定价远低于 OpenAI 等竞争对手, 这使得 DeepSeek 模型迅速获得了市场关注和用户青睐。 DeepSeek 的技术局限性(正视缺点): 官方技术报告承认的缺点:通用能力、语言混杂、提示词敏感、软件工程任务。 DeepSeek 团队在其技术报告中, 坦诚地指出了 R1 模型在 通用能力 、 语言混杂 、 提示词敏感 、 软件工程任务 等方面的不足。 “偏科”现象:文本处理能力突出,指令遵循、JSON 输出等相对薄弱。 DeepSeek 模型在 文本处理能力 , 特别是 中文生成 方面表现极为出色, 但在 指令遵循 、 JSON 输出 等更偏向 “工具性” 和 “工程性” 的能力上, DeepSeek 模型则相对薄弱, 存在一定的 “偏科” 现象。正如业内人士所指出的, DeepSeek 模型 对于文本处理能力,尤其是中文生成,非常强,但对于指令遵循、json 输出等,非常弱 。 媒体宣传与开发者真实体验的偏差:舆论场大家的感知是 “DeepSeek 遥遥领先”, 但开发者可能会有更多元的体验。 媒体对 DeepSeek 模型在文本生成方面的强大能力进行了大量宣传, 容易给用户造成 “DeepSeek 遥遥领先” 的印象。但对于开发者群体中, 对于 DeepSeek 模型的评价则更加多元。很多开发者在使用 DeepSeek API 后表示, DeepSeek 模型在 中文文本生成 和 低成本 方面确实优势明显, 但在 通用性 、 指令遵循 和 工具性 方面, 与 OpenAI 的 GPT-4 等模型相比仍有差距。
DeepSeek 爆火的先决条件:两年技术积累回顾
产品发布大事记
2023年11月2日: DeepSeek Coder 代码模型
2023年11月29日: DeepSeek LLM 67B 通用模型
2023年12月18日: DreamCraft3D 文生 3D 模型
2024年1月11日: DeepSeekMoE MoE 模型
2024年2月5日: DeepSeekMath 数学推理模型
2024年3月11日: DeepSeek-VL 多模态模型
2024 年 3 月,DeepSeek API 正式推出付费服务,彻底引爆了中国大模型市场的价格战的序幕:每百万输入 Tokens 1 元,每百万输出 Tokens 2 元。
2024 年 5 月: DeepSeek-V2 MoE 通用大模型
2024 年 6 月 17 日: DeepSeek Coder V2 代码大模型
2024 年 9 月 6 日: DeepSeek-V2.5 融合通用与代码能力模型
2024 年 9 月 18 日,在 LMSYS 最新榜单上,DeepSeek-V2.5 再次上榜,并领跑国内模型,在多个单项能力上,也都刷新了国内模型的最好成绩。
2024 年 12 月 13 日: DeepSeek-VL2 多模态 MoE 大模型
2024 年 12 月 26 日: DeepSeek-V3 全新系列通用大模型
2025 年 1 月 20 日: DeepSeek-R1 推理模型
2025 年 1 月 20 日: DeepSeek 官方 App (iOS & Android)
2025 年 1 月 28 日: DeepSeek Janus-Pro 多模态模型
OpenAI 的战略重心:结构化输出与 AI Agent 生态
被“媒体热点”掩盖的 OpenAI 真实战略:Sora 和 ChatBot 并非战略核心。 OpenAI 联合创始人 乔尔·雷曼 坦言, ChatGPT 并非 OpenAI 成立之初设定的目标, OpenAI 的早期探索方向包括电子游戏 AI 、 多智能体模拟和机器人技术等, 构建通用人工智能(AGI) 才是 OpenAI 始终如一的 “初心” 和 “使命” 。Sora 模型虽然引发了全球轰动, 但它也只是 OpenAI 为实现 AGI 愿景而打造的 “阶段性产物” 之一。 “Day 9 发布”的价值被低估:结构化输出是 AI Agent 爆发的基础。 OpenAI 在 “Day 9 发布” 中, 正式推出了 O1 模型的正式版 API, Real time API, 以及 “偏好微调” 等功能更新, 但其中最核心的, 是 OpenAI 在 结构化输出 方面取得的突破。结构化输出, 是 AI 模型与现实世界交互的 “通用语言” , 是 所有 Agent 的基础 。OpenAI 在结构化输出能力上的突破, 意味着 AI Agent 真正具备了 可控 和 可执行 的能力, 为 AI Agent 在各行各业的落地应用奠定了技术基础。OpenAI 在结构化输出方面持续发力, 不断提升其 成功率 和 稳定性 , 结构化输出的成功率已提升至 100% 。拨开 12 天发布云雾,一窥 OpenAI 的真实进度 “多端到多端”交互范式:AI 通向 “具身智能” 的桥梁。 OpenAI Real time API 所支持的 “多端到多端” 交互范式 , 使得 AI 模型能够更全面地感知和理解世界, 并以更自然、 更丰富的方式与人类和环境进行交互, 是 AI 从 “虚拟助手” 向 “具身智能” 进化的关键一步。 “多端到多端” 交互范式 , 也为 OpenAI 构建 AI 应用生态 提供了技术支撑。
OpenAI 的 “Agent 生态” 野心:构建 AI 应用商店,打造 AI 时代的 “App Store”。 OpenAI 的战略重心, 正在从 “单一产品” 向 “平台生态” 转型。OpenAI 希望将 ChatGPT 打造成 AI 时代的 “操作系统” 和 “应用商店” , 构建一个繁荣的 AI Agent 生态系统 。OpenAI 的真正野心, 并非 ChatGPT 或 Sora 等 “明星产品” 本身, 而是要 掌控 AI 时代的 “基础设施” 和 “生态入口” 。 硬件与算力战略: OpenAI 也在向 基础算力设施 延伸, 甚至 自研 AI 芯片 , 以掌控 AI 时代的 “基础设施” 。
DeepSeek 爆火对中国 AI 行业趋势的启示
竞争格局变化: 中国团队有能力在基础大模型研发上与国际巨头一较高下 开源模式在中国 AI 行业的影响力日益增强 算法创新成为新的竞争焦点 “六小龙”格局,或将巨变 新玩家凭 RL 后训练入场或成为可能 落地加速: DeepSeek 的低成本和开源特性,降低了大模型应用的门槛 终端侧 AI 部署成为新趋势 DeepSeek 在算力推广、部署方面带来新的机会 政策与市场双轮驱动: 中国政府对 AI 产业的扶持政策持续加码 中美科技竞争的背景下,DeepSeek 的自主可控特性使其更具战略价值
助力下一波 AI 爆发:中国 AI 的 “铺路” 之策
构建更开放的技术生态 需要构建「真正的行业比赛」方法:不是评分打榜,而是行业带着明确的需求,来寻找解决方案,然后方案可以被开源 中国 AI 产业需要建立更加有效的 产学研合作机制 和 行业协同机制 , 以行业需求为导向, 共同攻关 AI 关键技术难题, 推动 AI 技术在各行各业的落地应用。 需要更宽松的开源生态&技术言论生态:至少要有一个地方,让业内人士来交流 中国 AI 产业需要营造更加宽松的 开源生态 和 技术言论生态 , 鼓励技术交流和思想碰撞, 推动 AI 技术的开放创新和协同发展。 打破数据壁垒,解决“明面上无数据可用”的困境:中国 AI 产业需要打破 “数据壁垒” , 建立 数据共享机制 , 解决 AI 研发面临的 “数据饥渴” 问题。 建立更有效的产业协同机制 政策支持 政府对 AI 产业的扶持政策持续加码 国家应继续加大对 AI 产业的政策扶持力度, 为 AI 基础研究和应用创新提供更有力的政策保障和资金支持。 中美科技竞争的背景下,DeepSeek 的自主可控特性使其更具战略价值 在 中美科技竞争 日趋激烈的背景下, 中国政府应出台更多政策, 支持像 DeepSeek 这样具有【自主可控】特性的 AI 企业发展壮大, 提升中国 AI 产业的国际竞争力和产业链安全 。