有关SQL

大语言模型的未来,DeepSeek 打中了

来了 !! 两天前答应圈友们,另开一篇解释下 AI 新模式“慢思考”,今天展开讲 在本文中,DeepMind 首席科学家 Jack 提出 “慢思考”。换种说法,大家都会恍然大悟,捶胸顿足。 其实,就是 Deepseek r1 在回答问题前,常常的一堆自我的“碎碎念” 。 只不过,业界在包装“碎碎念”时,提出了推理(reasoning). 当 ChatGPT 3 时,很多问题,GPT 回答很失败,比如 3.9 / 3.11 哪个大。 此时提问者需要给出一些例子,帮助 ChatGPT 3 回答对。这种人工矫正的方式,叫做 Prompt Engineering, 提示词工程 当与大语言模型对话次数越多,就组成 Chain of Thoughts, CoT. 这其实是人脑定的回答结构。 Deepseek r1 出来后,这种 CoT 便内置在 r1 中了(openai 的 o1 已经早于 Deepseek r1 实现,但他们摁着,选择不显示llm 推理的过程)。 当 CoT 前置了,大家一看,似乎推理模型更值得信任。于是三界哗然 这就引申出新的 “Scaling Law”,即“规模效应法则”。上一次听到这个词儿,还是 Big Data. 当拥有全部数据时,抽样便不存在了。 最头疼发明的这些新词了:Scaling Law. 我十分好奇去研究了下 Scaling Law 在中文世界的翻译:“缩放定律”,“扩展律”,“规模法则”... 在大语言模型的世界里,只要参数够大,它的回答越好。这种传统观念已经深入人心。 但推理模型出来后,llm 卷的就不再单纯是参数了,而是做推理时,可用的 Context. 推理空间越大,效果越好。 能把未来的无数条路走过,你干啥都成。 尼古拉斯的《预见未来》,奇异博士的时间石,还有 SQL Server 在寻找最优执行计划时,分配的搜索空间,虽然都可以穷尽,但有制约的是时间。于是优化空间变小。 推理模型也受制于推理的空间。当某天推理可以足够大,模型就可以帮我们演绎无数条通向可行的路径,进而找到最优解。 所以,推理模型的下一个制高点,增加模型的推理空间,给他足够多的时间,他就能获胜