赛博禅心

分享于中关村创业大街:拨开媒体迷雾,正视 DeepSeek 的爆火

很荣幸,受海淀区中关村科学城/创业大街的邀请,一起探讨学习一下 DeepSeek 的事情。
本文是我的分享纲要。
文未彩蛋:附海淀区产业服务岗位需求,虚位以待!

“对于一项成功的技术而言, 现实必须优先于公共关系, 因为自然是不可欺骗的。”
—— 理查德·费曼 

引言:媒体的“爆火”叙事与 AI 模型的“真实画像”

近期,中国 AI 初创公司 DeepSeek 及其大模型产品,在全球媒体的聚光灯下经历了一场“现象级”的爆火。然而,媒体的选题,往往受制于 “是否有预算” 和 “是否会火” 这些诱因, 追求更快的速度、更爆的情绪, 甚至容忍一定程度的 “谣言” , 其外部信息源也往往以 “翻译 & 汇总” 为主——【这是媒体行业的必然,我自己也无法免俗】, 难以进行深入的行业判断和负责任的分析。因此, 当我们审视当下媒体对 DeepSeek 爆火的 “遥遥领先” 式报道时, 更需要保持一份冷静和理性, 警惕其中可能存在的夸大或片面之处。 
DeepSeek 自身也保持着令人钦佩的清醒。在其官方技术报告中, DeepSeek 坦诚地列出了其 R1 模型在通用能力、 语言混杂处理、 提示词工程敏感性以及软件工程任务上的不足。这些 “缺点” , 与媒体热烈追捧的 “最强 AI 模型” 形成了鲜明对比。这种 “偏科” 现象, 也正是理解 DeepSeek 本次爆火的关键所在。 
本次分享, 并非否定 DeepSeek 的成就, 而是希望拨开媒体叙事的迷雾, 深入剖析 DeepSeek 现象背后的技术逻辑、 市场策略和产业影响。力求还原一个更全面、 更客观的 DeepSeek “真实画像” , 为行业从业者和关注者提供更具参考价值的分析和洞察。 

DeepSeek 爆火的流量驱动

DeepSeek 的爆火离不开以下几个关键的流量驱动因素: 
  • “中美的棋子”效应
  • 免费使用策略的裂变式传播
  • 社交媒体的自发扩散效应
  • “国货之光”与民族情绪的共鸣

时间线上,如下

Image

正视 DeepSeek 的缺点:一个很强的模型,但很偏科

DeepSeek 作为一个强大的 AI 模型, 在某些方面表现突出, 但同时也存在一些不可忽视的局限性。我们需要正视 DeepSeek 的缺点,才能对其技术水平和未来发展前景做出更客观、 更准确的判断。 
  • DeepSeek 的技术优势与突破:
    • 国产算力的使用:利用华为 910B,可以轻松部署该模型(目前很多算力平台均通过此来部署了)
    • DeepSeek R1 Zero 的纯 RL 方案跑通了,让我们的「数据困境」得到解决,并且效果非常不错
    • MoE 架构规模化应用: DeepSeek 在 MoE 架构的规模化应用上取得了突破, 通过创新性的稀疏激活策略, 实现了超大规模 MoE 模型的低成本高效训练和推理。
    • 强化学习推理能力提升: DeepSeek-R1 模型在强化学习推理训练方面取得了重要进展, 使其在数学、 编程、 逻辑推理等任务上可与 OpenAI 顶级模型相媲美。
    • 模型蒸馏技术成熟: DeepSeek 熟练掌握了模型蒸馏技术, 能够将大模型的知识和能力 “迁移” 到小模型中, 从而降低模型部署门槛。
    • 低价 API 策略的推出:DeepSeek 在 2024 年 3 月正式推出 API 付费服务, 并采取了 “超低价” 策略 , API 定价远低于 OpenAI 等竞争对手, 这使得 DeepSeek 模型迅速获得了市场关注和用户青睐。
  • DeepSeek 的技术局限性(正视缺点):
    • 官方技术报告承认的缺点:通用能力、语言混杂、提示词敏感、软件工程任务。 DeepSeek 团队在其技术报告中, 坦诚地指出了 R1 模型在 通用能力 、 语言混杂 、 提示词敏感 、 软件工程任务 等方面的不足。
    • “偏科”现象:文本处理能力突出,指令遵循、JSON 输出等相对薄弱。 DeepSeek 模型在 文本处理能力 , 特别是 中文生成 方面表现极为出色, 但在 指令遵循 、 JSON 输出 等更偏向 “工具性” 和 “工程性” 的能力上, DeepSeek 模型则相对薄弱, 存在一定的 “偏科” 现象。正如业内人士所指出的, DeepSeek 模型 对于文本处理能力,尤其是中文生成,非常强,但对于指令遵循、json 输出等,非常弱 。
    • 媒体宣传与开发者真实体验的偏差:舆论场大家的感知是 “DeepSeek 遥遥领先”, 但开发者可能会有更多元的体验。 媒体对 DeepSeek 模型在文本生成方面的强大能力进行了大量宣传, 容易给用户造成 “DeepSeek 遥遥领先” 的印象。但对于开发者群体中, 对于 DeepSeek 模型的评价则更加多元。很多开发者在使用 DeepSeek API 后表示, DeepSeek 模型在 中文文本生成 和 低成本 方面确实优势明显, 但在 通用性 、 指令遵循 和 工具性 方面, 与 OpenAI 的 GPT-4 等模型相比仍有差距。

DeepSeek 爆火的先决条件:两年技术积累回顾

DeepSeek 的爆火并非 “横空出世” , 而是建立在其团队过去两年如一日的技术积累和产品迭代基础之上的 “水到渠成” 。回顾 DeepSeek 的发展历程, 可以清晰地看到其在技术创新和产品迭代方面所做的努力: 

产品发布大事记

  • 2023年11月2日: DeepSeek Coder 代码模型

  • 2023年11月29日: DeepSeek LLM 67B 通用模型

  • 2023年12月18日: DreamCraft3D 文生 3D 模型

  • 2024年1月11日: DeepSeekMoE MoE 模型

  • 2024年2月5日: DeepSeekMath 数学推理模型

  • 2024年3月11日: DeepSeek-VL 多模态模型

2024 年 3 月,DeepSeek API 正式推出付费服务,彻底引爆了中国大模型市场的价格战的序幕:每百万输入 Tokens 1 元,每百万输出 Tokens 2 元。 

Image
  • 2024 年 5 月: DeepSeek-V2 MoE 通用大模型

  • 2024 年 6 月 17 日: DeepSeek Coder V2 代码大模型

  • 2024 年 9 月 6 日: DeepSeek-V2.5 融合通用与代码能力模型

2024 年 9 月 18 日,在 LMSYS 最新榜单上,DeepSeek-V2.5 再次上榜,并领跑国内模型,在多个单项能力上,也都刷新了国内模型的最好成绩。 

Image
  • 2024 年 12 月 13 日: DeepSeek-VL2 多模态 MoE 大模型

  • 2024 年 12 月 26 日: DeepSeek-V3 全新系列通用大模型

  • 2025 年 1 月 20 日: DeepSeek-R1 推理模型

  • 2025 年 1 月 20 日: DeepSeek 官方 App (iOS & Android)

  • 2025 年 1 月 28 日: DeepSeek Janus-Pro 多模态模型

OpenAI 的战略重心:结构化输出与 AI Agent 生态

OpenAI 的真正战略重心, 并非仅仅是打造 ChatGPT 和 Sora 等 “明星产品” , 而是构建一个 以 AGI 为目标的庞大生态系统 。正如 Lex Fridman 与 Dylan Patel、 Nathan Lambert 在播客中所深入探讨的, OpenAI 的战略布局可以概括为以下几个方面: 
  • 被“媒体热点”掩盖的 OpenAI 真实战略:Sora 和 ChatBot 并非战略核心。 OpenAI 联合创始人 乔尔·雷曼 坦言, ChatGPT 并非 OpenAI 成立之初设定的目标, OpenAI 的早期探索方向包括电子游戏 AI 、 多智能体模拟和机器人技术等, 构建通用人工智能(AGI) 才是 OpenAI 始终如一的 “初心” 和 “使命” 。Sora 模型虽然引发了全球轰动, 但它也只是 OpenAI 为实现 AGI 愿景而打造的 “阶段性产物” 之一。
  • “Day 9 发布”的价值被低估:结构化输出是 AI Agent 爆发的基础。 OpenAI 在 “Day 9 发布” 中, 正式推出了 O1 模型的正式版 API, Real time API, 以及 “偏好微调” 等功能更新, 但其中最核心的, 是 OpenAI 在 结构化输出 方面取得的突破。结构化输出, 是 AI 模型与现实世界交互的 “通用语言” , 是 所有 Agent 的基础 。OpenAI 在结构化输出能力上的突破, 意味着 AI Agent 真正具备了 可控 和 可执行 的能力, 为 AI Agent 在各行各业的落地应用奠定了技术基础。OpenAI 在结构化输出方面持续发力, 不断提升其 成功率 和 稳定性 , 结构化输出的成功率已提升至 100% 。拨开 12 天发布云雾,一窥 OpenAI 的真实进度
  • “多端到多端”交互范式:AI 通向 “具身智能” 的桥梁。 OpenAI Real time API 所支持的 “多端到多端” 交互范式 , 使得 AI 模型能够更全面地感知和理解世界, 并以更自然、 更丰富的方式与人类和环境进行交互, 是 AI 从 “虚拟助手” 向 “具身智能” 进化的关键一步。 “多端到多端” 交互范式 , 也为 OpenAI 构建 AI 应用生态 提供了技术支撑。
  • OpenAI 的 “Agent 生态” 野心:构建 AI 应用商店,打造 AI 时代的 “App Store”。 OpenAI 的战略重心, 正在从 “单一产品” 向 “平台生态” 转型。OpenAI 希望将 ChatGPT 打造成 AI 时代的 “操作系统” 和 “应用商店” , 构建一个繁荣的 AI Agent 生态系统 。OpenAI 的真正野心, 并非 ChatGPT 或 Sora 等 “明星产品” 本身, 而是要 掌控 AI 时代的 “基础设施” 和 “生态入口” 。
  • 硬件与算力战略: OpenAI 也在向 基础算力设施 延伸, 甚至 自研 AI 芯片 , 以掌控 AI 时代的 “基础设施” 。

DeepSeek 爆火对中国 AI 行业趋势的启示

DeepSeek 的爆火对中国 AI 产业格局产生了深远的影响, 预示了中国 AI 行业未来的发展趋势: 
  • 竞争格局变化:
    • 中国团队有能力在基础大模型研发上与国际巨头一较高下
    • 开源模式在中国 AI 行业的影响力日益增强
    • 算法创新成为新的竞争焦点
    • “六小龙”格局,或将巨变
    • 新玩家凭 RL 后训练入场或成为可能
  • 落地加速:
    • DeepSeek 的低成本和开源特性,降低了大模型应用的门槛
    • 终端侧 AI 部署成为新趋势
    • DeepSeek 在算力推广、部署方面带来新的机会
  • 政策与市场双轮驱动:
    • 中国政府对 AI 产业的扶持政策持续加码
    • 中美科技竞争的背景下,DeepSeek 的自主可控特性使其更具战略价值

助力下一波 AI 爆发:中国 AI 的 “铺路” 之策

DeepSeek 的成功经验和 OpenAI 的战略布局, 为展望和布局下一轮 AI 爆发提供了宝贵启示。基于现有信息, 我们对中国 AI 产业提出以下 “铺路” 之策: 
  • 构建更开放的技术生态
    • 需要构建「真正的行业比赛」方法:不是评分打榜,而是行业带着明确的需求,来寻找解决方案,然后方案可以被开源 中国 AI 产业需要建立更加有效的 产学研合作机制 和 行业协同机制 , 以行业需求为导向, 共同攻关 AI 关键技术难题, 推动 AI 技术在各行各业的落地应用。
    • 需要更宽松的开源生态&技术言论生态:至少要有一个地方,让业内人士来交流 中国 AI 产业需要营造更加宽松的 开源生态 和 技术言论生态 , 鼓励技术交流和思想碰撞, 推动 AI 技术的开放创新和协同发展。
    • 打破数据壁垒,解决“明面上无数据可用”的困境:中国 AI 产业需要打破 “数据壁垒” , 建立 数据共享机制 , 解决 AI 研发面临的 “数据饥渴” 问题。
    • 建立更有效的产业协同机制
  • 政策支持
    • 政府对 AI 产业的扶持政策持续加码 国家应继续加大对 AI 产业的政策扶持力度, 为 AI 基础研究和应用创新提供更有力的政策保障和资金支持。
    • 中美科技竞争的背景下,DeepSeek 的自主可控特性使其更具战略价值 在 中美科技竞争 日趋激烈的背景下, 中国政府应出台更多政策, 支持像 DeepSeek 这样具有【自主可控】特性的 AI 企业发展壮大, 提升中国 AI 产业的国际竞争力和产业链安全 。

结论:中国 AI 的星辰大海,道阻且长,行则将至

DeepSeek 的爆火, 是中国 AI 产业发展的一个缩影, 也预示着中国 AI 即将迎来 从追赶到并驾齐驱 的历史性转折点。中国 AI 产业要抓住下一波 AI 爆发的机遇, 需要在 技术创新、 产业生态和政策环境 等方面提前布局, 迎接 AI 时代 星辰大海 的到来。正如 Lex Fridman 在播客结尾所引用的 理查德·费曼 的名言:“对于一项成功的技术而言, 现实必须优先于公共关系, 因为自然是不可欺骗的。” 中国 AI 产业的未来, 最终将由 “硬核” 技术实力 和 “务实” 应用落地 决定, 而并非仅仅是媒体的 “爆火” 叙事和一时的 “流量” 狂欢。  

「中关村科学城」岗位招聘

Image

相关链接:
人才招募 | 中关村科学城公司期待你的加入