Kimi探索版和智谱推高级推理新功能,我让GPTo1出题判卷,看看谁更胜一筹?
杨立昆是与辛顿齐名的AI大神,也是图灵奖得主,他在自传《科学之路》里,曾经写过一段我特别认同的话:“任何一个发明、发现都不是凭空出现的,它们需要一定的时间,需要经历反复摸索、酝酿和检验。像脸书、谷歌、微软这样的顶级搜索公司都在进行借鉴式的发展:一家公司发布了一项新产品、新技术,另一家公司会在数周或数月后对其进行改进。任何一家公司,无论其规模有多大,都无法垄断所有的优秀想法,也没有能力独自完成这场冒险。”
大家知道,9月13日的时候,OpenAI突然发布了他们的最新模型产品o1,核心就是可以花更多的时间进行推理,可以处理复杂的任务,解决更难的问题。
当时我心中有一个好奇,那就是国内一流的AI企业什么时候拿出对标的产品。我当时的预计是12月份,因为同类型的产品可不是改几个页面那么简单的。
结果没想到,这个月月初,国内的Kimi和智谱几乎同时发布了自己的高级推理搜索功能。作为一个产品经理,我非常了解搞定这种复杂项目需要多长时间。所以无论是智谱还是Kimi,一定是从几个月前就开始了高级推理AI的研究,只不过在发布时间上,落在了OpenAI的后面。
我今天先简单介绍一下这两个产品功能的背景,然后我会让OpenAI的o1给这两个产品出题,让AI来难为一下AI,这样也可以看一下两个产品的能力和区别。
先说Kimi,Kimi这次推出了一个“探索版”。官方说,这个探索版一次回答的搜索量是普通版的10倍,一次就能精读至少500个页面,并且还能模拟人类的推理思考能力、多级分解复杂问题,这跟OpenAI的o1有异曲同工之妙。
Kimi这个探索版虽然只是灰度发布,也就是让一小部分用户先体验,但还是被热情的用户把服务器搞崩了。其实对于产研团队来说,服务器崩了是一件好事,证明用户的需求和热情是真实的,并且又能提高团队的工程能力。要知道阿里云能打的一个原因,也是因为他们在过去这么多年的双十一中,遇到过太多次的服务器崩溃,解决过太多的问题。
Kimi这次的探索版直接放在了对话框的左下角,点一下开关就能开启,也可以用一个斜杠直接唤起。现在探索版已经分批上线网页版,被灰度到的用户每天可以使用5次。
你可千万不要觉得少,我们每个人每天其实并没有这么多需要深度思考的问题。我这次虽然拿到了一个每天可以搜索100次的内测权限,但使用率差不多一天10次左右,因为大多数普通问题,压根不值得开这个开关。
我再说说智谱推出的“AI搜索”。它是用一个智能体的形式出现的,主要特点也是增加了复杂的多级推理能力,解答复杂问题更加全面,单次可以阅读超过100个网页,有效解决了之前比较常见的“幻觉”问题。而且,这个工具在给出解决方案时,还可以对内容做深度处理,例如生成表格,用Python来绘制图表。
光看官方介绍,这两个听起来好像都特别厉害,不过接下来,我就拿o1出的3道题目实际测试了一下。
我用ChatGPT里的o1模型出题考验这两个产品。我对题目的要求是要考验到复杂的推理和规划能力,但又必须是比较生活化或者工作的场景,不要那种复杂的数学题。
我把两个产品的回答都放在下面了,哪个风格更适合自己,你可以自己选择。不过我也把两个答案都扔给了ChatGPT,让它再评判一下两位同行的作业。对,所有的评判都是ChatGPT做的,毕竟这两家公司里面都有我的好朋友,所以这个锅我还是果断甩给了AI。
我们先看看ChatGPT的o1,给两个产品出的第一道题目:
一家国际公司计划在六个月内举办一场全球员工大会,参会者来自美国、英国、日本和德国。你需要选择一个对所有参会者都方便的城市,考虑航班可达性、签证要求、时区差异以及预算限制。此外,还需考虑会议场地的容量、住宿条件和当地的交通状况。请为公司推荐一个合适的举办城市,并详细说明你的选择理由和考虑的因素。
首先来看Kimi探索版的答案,在最上面的推理过程模块里,Kimi说自己已经阅读了537个网页,然后查找了主要城市和每个城市的航班等情况。最后Kimi说,在考虑航班可到达性、签证要求、时区差异、预算限制和住宿等条件后,推荐去伦敦开这个全球员工大会。并且给出了七大理由,里面还推荐了几个大型会议场地。
我们再来看一下智谱清言的答案,智谱是从六个方面出发,给了五个可以选择的合适城市,让用户来做选择题,特意说如果预算充足,可以考虑巴黎或者新加坡,如果希望选择一个签证便利的城市,那就是东京或者上海,如果主要参会者来自欧洲,那么可以选择柏林。
最后,我把两个答案扔给了ChatGPT,让它来做一下对比。这里我放了两张截图,一张是o1对这个问题的思考过程,一张是最后它给出的答案。展示第一张图的目的非常简单,就是我们可以从 AI 的思考过程,学习面对一个复杂问题,应该怎么去动手解决。
o1思考过程的截图
GPT对kimi探索版和智谱答案的评价
我们接着来看o1出的第二题:
你是一家零售公司的供应链经理。公司在全国有三家仓库,但最近出现了配送时间过长和库存水平不均的问题。客户投诉增加,物流成本也在上升。请分析目前的供应链状况,考虑运输成本、仓库位置、库存管理和需求预测等因素,提出改进建议以优化供应链运营。
Kimi探索版和智谱AI给的答案截图如下:
kimi探索版的答案截图
智谱的答案截图
第三张图是ChatGPT给出的评价,这次它展示了一个良好的AI领导力,说我们应该优先选择Kimi答案里的改进建议和实施步骤,同时也要借鉴智谱答案里的数据分析和持续改进理念。是不是有一种领导和稀泥的感觉。
GPT对kimi探索版和智谱答案的评价
接着我们再看o1出的第三题,这个题目更加生活化:
一对夫妻计划明年带两个孩子进行一次为期两周的海外旅行,一个孩子5岁,一个孩子10岁。他们希望访问一个既有文化景点又有适合孩子活动的国家。他们的预算是5万元人民币,需要涵盖机票、住宿、餐饮、观光和当地交通。他们还希望旅程中能有几天的放松时间,不安排过多的活动。请为他们制定一个详细的旅行计划,满足他们的需求并控制在预算内。
说实话,里面有方案细节点的点评,还是非常好看的,例如Kimi推荐了澳大利亚行程,ChatGPT 就提醒要注意行程安排过密的话,孩子容易累,另外澳大利亚的季节和中国是反着的,要考虑类似海边沙滩这种活动是否适合。
kimi探索版答案截图
智谱答案截图
GPT对kimi探索版和智谱答案的评价
不知道看完整个过程后,你的感觉是什么。我只能说一下我的感觉,那就是在使用AI的过程中,其实对我自己的思考能力和逻辑也有非常大的帮助。
无论是这里负责出题和点评的ChatGPT o1,还是回答问题的Kimi探索版与智谱的AI搜索,要知道最多也就刚推出一个月时间,再给它们一点时间,肯定能在覆盖场景上有更大的提升。
我们需要做的,其实不是要去证明自己比AI强,例如刚才AI写的那几个方案,我相信有些人好好写的话,水平肯定比AI高,但可怕的是,AI在30秒之内就可以写出来,而我们可能要两天。
随着Kimi、智谱这批AI助手的更强大进化,其实更大的难题抛给了我们,就是在我们每个人都能用上一样工具的时候,谁能用得更好呢?
我以前看过一本关于美国海军的历史书,书名叫《六舰》,里面提到了一个案例,就是英国海军很喜欢在近距离中采取平射,就是你给我一炮,我给你一炮。这个战术的背后,跟武器装备没有关系,因为法国和西班牙的也是一样的炮,这里唯一的决定因素是开火的速度,一半情况下,英国军舰开三轮炮的时候,敌军顶多开两轮炮,大部分只能开一轮炮。
原因是什么呢?是因为英国皇家海军平时密集的训练,炮兵闲着没事就演习,军官在旁边计时,彼此之间还互相竞赛,甚至赌钱赌的就是开火速度。平时的密集训练,到了战场上,就变成了真实的战斗力。
1758年,英国皇家海军的蒙茅斯号和法国的无畏号在卡塔赫纳进行交锋,法国军舰吨位是英国的2.6倍,占据绝对优势,但是最后以法国投降而告终,英法死亡人数对比是1比4.5,就是死一个英国海军的同时,就有4.5个法国海军丧命。当然,更屈辱的是,这艘无畏号被英国海军拉回去维修后,第二年作为英国战舰投入使用,一用就是30年。
在1793年到1815年漫长的战争期间,法国捕获了英国17艘舰船,其中9艘又被英国人夺了回去。而同一时期,英国捕获法国船只高达229艘。
我相信开火速度和平时的训练,是胜负的关键因素,但肯定不是唯一因素。不过现在AI工具的能力在不断进化,咱们也要多多训练自己,要不就算有把屠龙宝刀放在我们面前,我们可能也只会用来切榴莲。
这篇内容依然是我在得到AI学习圈里的日更内容,这是第275篇。除了每天的AI资讯外,里面更多的是各种实操教程,从AI设计海报到AI做PPT、写文案,可以快速把AI用起来。感兴趣的话可以领下面的一张周卡去看看⬇️