DeepSeek R1 老挂,怎么办?
用 DeepSeek 官方提供的 Chat,这两天体验特别差,隔三差五就会提示“服务器繁忙,请稍后再试”。这挺影响工作效率的。很多人给出的解决方案是用硅基流动之类的产品自己部署一个。
且不说部署的模型没有联网搜索的能力,我觉得对于大部分普通用户来说,根本没必要花这时间和精力折腾。ROI 很低。我现在碰到 R1 挂掉的情况,会直接切换到 Kimi 1.5 的长思考,也足够用了。再或者,对 R1 过于钟情的话,还能用秘塔搜索、Perplexity,它们集成了 R1。
总之,在不涉及 API 调用的情况下,单纯只是作为普通用户使用,没必要独立部署。除非你的目的是想学习下部署的流程是啥。以我使用 Kimi 1.5 长思考的感知来看,二者多数情况下,差距并不大,足够用了。
况且,我也不觉得啥问题都要用推理能力。一个很简单的问题,诸如 Windsurf 是什么,用指令模型也足够了。因为推理模型需要你等待更多的时间,这同样会影响工作效率。我目前形成的经验是,在较为复杂的问题上,才会使用推理模型。
当然,目前我也说不上来哪些是复杂点的问题,哪些是简单问题。纯粹就是个人感觉,包括还有些问题我会直接使用搜索引擎,或者小红书,这都依赖个人的判断力。此刻,我们应该下意识让自己具备这样的分辨能力。
与不建议部署 DeepSeek 相关的另外一个观点是:我也认为不要花时间搭建什么本地私人知识库。小红书上很多人借此卖教程来赚钱,这是他们的生意。他们宣称用 R1 做知识库有非常多的优势,香的不得了。但你留意看看评论区,基本都是引导到私信了。
我做产品,我非常清楚,类似的能力,很快 AI 知识库类的产品都会具备,没必要着急这两天,并且,你搭建的东西不可能稳定,也不具备持续迭代的能力。最后一顿操作猛如虎,定睛一看原地杵。
时间宝贵,别绕没用的弯路。
再就是提示词。总有人会把提示词整得非常玄乎。现在,可以明确地说,推理模型已经大幅度降低了对提示词的要求。指令模型中,我们往往需要套模板,比如 Kimi 官方曾经给过一个小红书的提示词范例:
你是小红书内容专家。你知道小红书的风格是:很吸引眼球的标题。每个段落都加 Emoji,最后加一些 tag。请你根据用户给出的内容,优化为小红书风格,有标题,有正文。
去年,类似的提示词模板非常流行。但现在,用 R1 等推理模型,不需要这么复杂。你只要用大白话,把问题告诉给模型就可以。如果模型的输出不符合你的预期,你意识到自己表达不充分,那就继续和他交互。这样来回几次足够了。就像和同事交流一样。
重要的不是技巧,而是愿意耐下心来,把自己的问题写明白。很多人的问题是他不愿意花时间梳理自己的需求,而是相信一些偏方。这种思维方式很奇怪。大模型不是谁肚子里的蛔虫,我们需要把背景信息告诉它。
昨天,一个用户和我吐槽说:“千万别把 DeepSeek 当作信息检索工具,有很多错误。”问了一圈,原来是她让 DeepSeek R1 给自己做旅行规划,并列出具体的地址。结果,R1 出现幻觉了,而她全然相信了 AI 的信息,最后耽误小半天时间。她很气愤,然后得出结论说这东西不可靠。
这是典型的认知问题。
第一,旅行规划,我的直觉是去小红书看,比问 R1 更靠谱。小红书上有很多活生生的经验。这是 AI 没有的。直接照抄小红书上其他人的经验,都比问 R1 好。AI 不是万能的。
第二,要清楚,无论是 AI,还是人,没有谁的话是一定靠谱,一定对的。我们需要有意识地验证。特别是 R1,它有模有样的列出来思考过程,让你觉得非常靠谱,但同样有幻觉。别被它的思考过程迷惑。
---
墨问西东最近在招聘内容实习生,欢迎把这个信息分享给你的弟弟妹妹。今年我们要做很多的 AI 内容,实习生进来后,会和我们团队一起,研究行业内有趣的公司和人。
另外,我还在写一个 AI 的小专栏。借此,跟大家一起去了解当下国内外最新的产品趋势是什么,最新的观点是什么,又有哪些新闻媒体没有大肆报道,但却有趣的产品诞生。
比如昨天我写了 DeepSeek 引发的蝴蝶效应。希望能给你带来一些启发。下面可以订阅,订阅后记得进群。