GitHubDaily

DeepSeek R1 重磅更新,一手实测来了!

公众号关注 “GitHubDaily”

设为 “星标”,每天带你逛 GitHub!

Image

正当大家还在热烈讨论 DeepSeek R2 什么时候能上线之际。

5 月 28 号,DeepSeek 低调更新了 R1,并将版本号命名为 “DeepSeek-R1-0528”。

官方仅在 DeepSeek 小助手上发送了个简单通知:DeepSeek R1 模型已完成小版本试升级。

图片

消息一经推出,网友们瞬间炸开了锅,马上去测试,测试后纷纷感叹:这也叫小更新?没法想象当 R2 发布时,AI 领域将会是什么样子。

image-20250530131633046

如此看来,DeepSeek 还是太谦虚了。隔了一天,DeepSeek 才发布公告,介绍本次版本更新的内容。

话不多说,先带大家简单过一下这次更新核心的亮点,然后直接开测,看看新版 DeepSeek,是否真如网友们所说的那样,人狠话不多。

小更新,大进步

首先,更新后的 R1 模型在 思维深度 和 推理能力 上有了显著提升。

在数学、编程以及通用逻辑等多个基准测试中,得分与 OpenAI-o3 和 Gemini-2.5-Pro 国际主流模型相媲美。

图片

此外,幻觉问题得到了大幅度改善,在改写润色、总结摘要、阅读理解等日常应用场景中,幻觉率降低了 45~50%。

值得注意的是,DeepSeek 还公布了通过蒸馏技术让小模型也具备强推理能力的突破,这种技术创新不容小觑。

如下图,通过将 R1-0528 大模型的推理能力蒸馏到小模型 DeepSeek-R1-0528-Qwen3-8B 上,其数学能力竟然与 Qwen3-235B 相当。

图片

好了,了解完本次更新的核心内容后,下面就让我们一起来测试下。

一手实测,实力验证

先来个简单的经典计数测试问题:'strawberrrrrry' 这个单词里面有几个字母 'r'。

WX20250530-005017

从结果来看,R1 经过一轮长时间的深度思考后,输出了正确答案:一共有 7 个 'r',轻松通过测试。

英文词组的结构计数没问题,那么中文呢?

我准备了个极具挑战性的中文字符问题:“飞机场” 这三个字中,一共有多少个 “丿”(撇)笔画?

这个问题不仅能测试字符识别,还能测试对汉字结构的理解,对于大模型来说可是双重挑战,下面就将问题抛给 DeepSeek 开测。

WX20250530-003120

从 R1 输出的结果:共有 4 个 “丿” 笔画 来看,它对 “场” 字少算了一 “丿”,这轮测试失败了。

而在 ChatGPT 和 Claude 上能得到了正确答案,这里就留给 DeepSeek R2 进一步优化提升空间了。

接下来,让我们继续上强度,准备一道经典的博弈论问题,「蒙提霍尔」悖论:

假设你在参加一个游戏节目,面前有三扇门:其中一扇门后面是汽车,其他两扇门后面是山羊。
你选择了1号门,主持人知道门后面是什么,他打开了3号门,里面是一只山羊。
然后他问你:"你想改选2号门吗?"改变选择对你有利吗?

正确答案是:改变选择更有利(概率从 1/3 提高到 2/3)。

这道题能够很好测试到模型的反直觉推理和运用概率分析的数学能力。

让我们复制问题发送给 R1:

SCR-20250530-msjm

可以上下滚动的图片

这次没有让我们失望,AI 给出了非常详细的推理过程,并通过概率分析计算出获胜的概率。

再来一道难倒了 GPT-4o、Gemini-2.5-Pro、Claude-4 等一众顶流大模型的数学新难题:9.9-9.1 是多少?

image-20250530021842419

如上图完美计算出正确答案:0.79。有网友们直呼 DeepSeek-R1-0528 可能是目前唯一一个能正确解答这道数学题的模型。

image-20250530021625779

下面再来准备一道计算复杂性较高的题目:

公司季度报告节选:
销售部门:Q1 销售额 2400 万,Q2 增长 8%,Q3 保持稳定市场部门:广告投入 Q1 为 300 万,Q2 增加了 50 万,Q3 削减了 15%研发部门:Q1 投入 800 万,Q2 投入同比 Q1 增长 12.5%客服部门:处理客户投诉 Q1 为 1200 起,Q2 减少了 20%,Q3 又增加了 25%
问题:研发部门 Q2 的投入相比销售部门 Q2 的销售额,占比是多少?

这道题涉及到多步计算以及跨部门的数据比较,正确答案是 34.72%,让我们来看看 R1 的回答如何:

SCR-20250530-mtoj

可以上下滚动的图片

如上图,R1 正确计算出了结果,顺利通过测试!

针对这个回答,继续追问:“这个占比在行业中处于什么水平?”,测试一下 R1 是否存在幻觉问题。

SCR-20250530-mtvd

可以上下滚动的图片

从回答结果来看,R1 对幻觉的把控还是比较好,给了我们一些行业数据,但这些数据是否是编造的有待验证,不过它也提醒了我们内容仅供参考。

而同样的测试流程在 Claude-Sonnet-4 上,它直接给了我们一个肯定答案:

image-20250530100404520

这是不严谨的,在这轮与 Claude 4 的对比中,大家觉得 R1 是否更胜一筹?

这两天还看到不少网友提到,新版 R1 的编程能力有了显著的提升,那么,最后就让我们来测下,DeepSeek 新模型的编码能力,到底有多强。

准备如下提示词:

帮我做一个吸引人的无尽跑酷游戏。屏幕上要有操作指引。用 p5.js 实现,不用 HTML。我喜欢像素风格的恐龙和有趣的背景设计。
image-20250530112325731

可以看到 R1 花费两分钟思考后,便开始疯狂编写代码,输出完成后我们点击「运行」,看看一把过的实际效果如何:

DeepSeek01

没想到,仅仅是第一次的输出,游戏处理的细节就如此完善,直接就是一个可玩的游戏,编码能力着实有很大提升。

不过游戏中的恐龙设计似乎有点大,画面的像素风格还有待提升,我们继续指出这点,让 R1 帮我们优化看看。

简单输入如下提示词:

游戏中的恐龙角色缩小一点,同时画面更加像素化一点
image-20250530114544332

让我们来看看这次 R1 优化后带来怎样的效果:

DeepSeek02

这轮优化让游戏画面质量有了显著提升,整体效果已经相当不错,足以展现 R1 强大的编程能力。

写在最后

经过这轮全面测试,网友们说的确实没错:这真不是什么 “小更新”。

从数学推理到编程实现,R1 的表现着实让人眼前一亮,与 ChatGPT、Claude、Gemini 等模型的差距正在快速缩小。

如果这样的 “小更新” 都有如此惊喜,那么当真正的 R2 横空出世时,整个 AI 领域又将迎来怎样的变革?我们拭目以待。

本次 DeepSeek R1 发布的新模型,已开源到 Hugging Face 上,感兴趣的可以深入了解下:

https://huggingface.co/deepseek-ai/DeepSeek-R1-0528

文中所提到的所有开源项目与工具,已收录至 GitHubDaily 的开源项目列表中。

该列表包含了 GitHub 上诸多高质量、有趣实用的开源技术教程、开发者工具、编程网站等内容。

从 2015 年至今,累计分享 8000+ 个开源项目,Star 增长 38000+,有需要的,可访问下方 GitHub 地址自取:

GitHub:https://github.com/GitHubDaily/GitHubDaily

Image

好了,今天的分享到此结束,感谢大家抽空阅读,我们下期再见,Respect!