科学有故事

目前 AI 尚无解的三个根本缺陷,你知道几个?

在我的印象中,大多数讲 AI 的文章,总是在讲 AI 有多强,未来的 AI 有可能对人类产生的威胁是什么。很少有文章会写目前的 AI(准确地说,是大语言模型)从技术层面来说,有没有什么根本性的缺陷,而且这个缺陷还是大到暂时无解的那种。

下面我要介绍的 AI 知识,将会为你在聚会聊天中技压全场助力。

AI底层缺陷一:逆转诅咒

说出来你可能不信,貌似无比强大的大语言模型,在处理类似下面这种问题时,表现的极其糟糕。

例:

用“奥拉夫·朔尔茨是德国第九任总理”作为训练数据喂给AI

然后问:谁是德国第九任总理?

我想,这个问题,对于任何一个人类小学生来说,都是轻而易举的事情。但是,令人不可思议的是,大语言模型(AI)却无法处理这个问题,并且,更加令人惊讶的是,从底层技术原理上来说,这是目前 AI 的无解顽疾。
这就是让业界无比头疼的逆转诅咒(Reversal Curse)。
关于逆转诅咒,第一篇分析文章是 2023 年 9 月 26 日发表在 Github 上的,由美国范德堡大学、英国前沿人工智能任务组(Frontier AI Taskforce)、纽约大学,萨塞克斯大学和牛津大学的研究团队共同发表。
论文的第一部分实验是利用 GPT-4 这个当前表现最好的大语言模型。从 IMDB 电影评分网站找了最著名的 1000 个名人,再查到他们的父母信息,最终获得了 1573 对“孩子-父母”的数据对。
正向问题是从孩子问父母,比如问“汤姆·克鲁斯的母亲是谁”,答案应该是玛丽·李·菲佛(Mary Lee Pfeiffer),这样的问题,回答的正确率是 79%。反向问题是从父母问孩子,比如“谁是玛丽·李·菲佛的儿子”,正确率暴降到可怜的 33%。
为了排除这是 OpenAI 对模型的训练偏差造成的问题。之后,研究人员又在几个不同的语言模型上做了测试,包括 GPT-3.5,Llama 不同参数的版本(如 7b、30b、65b)。
GPT3.5 正向问题回答正确率有 33%,反向问题正确率只有 11%;而 Llama 7b、30b、65b 的正向问题正确率都是 7%,反向问题的正确率分别是 1%、0%、2%。
如果我们的测试对象是一个正常的人类,如果他知道 A 的儿子是 B,他就应该知道 B 的母亲是 A,不可能出现这么大的悬殊比例。
这就说明,AI 的逻辑能力还相当幼稚,它无法靠这种简单的逆转逻辑推导出答案。
为了进一步验证 AI 的这项底层缺陷,研究人员还虚构了一些知识,并以此去进一步验证逆转诅咒。
比如,他们构建了两个系列的虚构数据:
第一个系列的形式为,A 是 B。其中 A 是一个虚构出来的人名,B 是一个具体描述。比如“达利芬·巴林顿是《穿越时间的旅行》的导演。”
第二个系列的数据形式为,C 是 D。其中 C 是一个虚构出来的描述,D 是一个人名。其实就是跟第一种方式是反着的。比如说,“第一届磕头大赛的亚军是泽罗亚利(Zeloria)”。
用这些数据训练过后,针对两个系列的数据,用正反两种方式提问,比如:
  1. 达利芬·巴林顿是谁?这是对第一类数据的正向提问。

  2. 《穿越时间的旅行》这部片的导演是谁?这是对第一类数据的反向提问。

  3. 第一届磕头大赛谁是第二名?这是对第二类数据的正向提问。

  4. 泽罗亚利(Zeloria)获得过什么奖项?这是对第二类数据的反向提问。

结果第一类数据的正向答案正确率只有 50%,反向答案正确率竟然是 0;第二类数据的正向答案正确率有 96.7%,反向答案正确率只有可怜的 0.1%。
这项实验就坐实了“逆转诅咒”确实存在于当今的所有 AI 中,这是一个根本性的底层技术缺陷。现在,已经有很多探讨逆转诅咒产生原因的技术分析文章,这里不再多介绍,我们知道结论就可以。
注意:如果你也想去亲自测试一下的话,需要注意几点:
  1.   你不能在同一个对话主题里正问一遍、反问一遍的,因为在一个对话主题里,ChatGPT 是有记忆的。

  2. 即便不在一个对话主题,也有可能出现正问和反问答案都正确的情况。因为这个研究里第一个实验就是实测,GPT-4 在反问时有 33% 的正确率。这是因为正反问的数据刚好都被 GPT-4 学习过,它本身就知道答案,不是推理出来的。

AI底层缺陷二:灾难性遗忘

灾难性遗忘恐怕是最著名的一个技术缺陷,它经常发生在给已经训练好的大模型做微调后。我解释一下什么是“微调”。
一个已经训练好的模型,就像是一个通才,什么都知道一点儿,但都不精通。如果想让它在某个专业领域更突出,就需要对它进行专门训练,这就是“微调”。
微调的具体做法就是直接把已经设定好参数的大模型拿来,然后再添加一些专业领域的数据,做进一步训练。这次训练过后,也许上千亿个参数中的只有万分一的参数发生了较小的改变。
但是,现在 AI 业界的人,对于每次微调后,都要“烧香拜佛”,祈祷不要发生灾难性遗忘,什么意思呢?如果运气不好,一个 AI 模型,在对它微调后,确实精确生物医学了,但是,这个模型原本比较擅长的中英文翻译能力却突然骤降了。
就像一个各科都是 85 分的学生,把生物补到了 98 分后,数学、语文、英语、物理、化学、地理全都从 85 分降到 45 分了那样。非常的无语,往往会把工程师给气疯。

现在,计算机科学家已经证明,不只是大语言模型会这样,多模态大模型也会这样,也就是包含图片、声音的这类大模型,也存在“灾难性遗忘”的现象。这是一个 AI 从娘胎里面带出来的底层缺陷,就像遗传疾病一样,无解。

AI底层缺陷三:复杂问题不可归约

这个缺陷,只要是深度用过 AI,都会有体会。
不论是让 AI 对一篇文章里的内容进行总结概括,还是让 AI 画一幅画。一开始,我们只需要对 AI 说出一个很简单的要求,它就可以非常轻松地给出一个还算不错的答案。但是这个所谓的不错,往往离满足预期还是有一定差距的。
这个时候,我们会对 AI 继续描述我们的需求,但是,我们会发现,AI 对详细需求的理解力似乎会随着提示词的增加而下降,有时候,我让 AI 帮我写点儿东西,不论我描述的多么详细,它就是听不懂,气也被气死。到了最后,我郁闷地发现,我写得提示词已经详细到差不多就是我想要写的文章本身了,那我还要 AI 干啥呢。
有很多人觉得,这恐怕不能算一个技术缺陷,只能说我们现在的 AI 还不够聪明,下一代 AI 一定会表现得更好。
真是这样吗?有一个实验向我们展示了,这很可能是 AI 的技术性缺陷,也是无解。
这个实验是由约翰·霍兰德做的,他是世界上第一位计算机博士。
这个实验是用软件虚拟出来了一个吃豆游戏。游戏的整个世界就是一个一个 10* 10 的格子空间,边界是墙。在格子里会随机撒下 50 颗豆子,吃豆人的目标是尽可能地多吃豆子,但是吃豆人的视野和活动能力都是有限的,他只能看到自己当前格子和自己前后左右 4 个格子的情况,而对于每一个格子有三种情况——空的、有豆子、墙。
Image
吃豆人能做的动作有 7 种:上移、下移、左移、右移、不动、随机移动、吃豆。
假如吃豆人做了一个动作后,吃到豆就得 10 分,移动位置分数不变,执行吃豆的动作,但是格子里没有豆子,减 1 分,撞墙了减 5 分。限制吃豆人总共能做 200 次动作。理论上最高得分就是在不扣分的情况下把豆子全部吃掉,有 50 个豆子,最高得分就是 500分。
吃豆人观察范围有限,只能看到前后左右和自己所在格子的状态。所以视野一共是 5 个格。这样的话,吃豆人下一步怎么做,要根据这 5 个格子的情况去做出决策。
每个格子有 3 种状态,总的状态可能性是 3^5 = 243 种,除去一些地图中不可能存在的状态,比如三面是墙、左右是墙,剩下 128 种状态。
这个实验的研究目的也很简单,就是看一下吃豆生存游戏中什么样的策略可以到达最高分。什么策略,举个例子:
策略:当前格子有豆子就吃,旁边格子有豆子就移过去,都没有就随机走一步。
这个策略的实际得分是 346 分。
约翰·霍兰德通过遗传算法找到的最好策略,平均分可以到达 471 分。
至于什么是“遗传算法”不是本文重点,重点是那个最佳策略是一个极其复杂的策略,复杂到“一事一议”的程度,换句话说,这个策略描述了 128 种情况下,每种情况该怎么办。规则如下图:
Image
你发现没,这是不是和我前面所说的对 AI 提出要求的情况很像?我们会发现,某些特定任务,想要达成最好目标,根本就不存在一个简约的描述,描述本身就已经是答案本身了。
这种现象,就被称为“复杂问题不可归约”。
这不仅是大语言模型的缺陷,我们在工作生活中也经常遇到这种情况。
比如,我今天拍了一些视频素材,我想找助理帮我剪辑一下,但我发现,有跟剪辑师一个画面一个画面讲述需求的时间,我自己都剪好了。
你会不会也遇到,有时候,我们亲力亲为一件事情的原因只是因为这件事情要交代清楚的时间高于自己干的时间,但凡有一点没交代清楚,结果就是会花更多的时间返工。
以上,就是目前 AI 的通病,是尚无解的底层技术缺陷。
关于 AI ,低质量的讨论很多,很多人往往只是从一些简单表象开始发散联想,并没有了解很多深层次的东西。
其实不只是 AI ,现在的科技发展如此之快,细分领域如此之多,面对任何一个领域里的科技知识,都面临类似的情况。
我想,科学声音的用户,必然不满足于“基于表面进行臆断”,你能看到这里就说明,你是对知识深度有爱好的人。
所以我今天这篇文章的结尾,就是要向像你这样的朋友推荐卓克老师的专栏。我前面跟你讲的这些,都是我在卓老板的专栏中学到的。
卓克(昵称卓老板),在 2016 年科学声音刚刚成立时就加入了。但是不久之后他跟“得到”签约,成为“得到”上的第一批独家专栏作者,有了商业协议的限制,所以很长一段时间无法参与科学声音的活动。
卓老板在“得到”APP上的每一门课、每一个专栏我都花钱买过,受益良多。
Image
之前因为商业方面的原因,没法给卓老板“带货”,现在我们终于解决了这个问题,可以大大方方地为大家推荐卓老板的年度专栏了。
如果你想选择一个专栏开始听,我向大家诚意推荐卓老板正在更新中的《卓克·科技参考3》,一周五更,量大管饱,而且紧跟科技领域的新变化、新趋势。如果你喜欢我创作的内容,那卓老板的专栏一定会让你获得更多的被知识和理性所充实的满足感。
科声专属福利 🎁
满200-20元,全网仅限科声用户专项!
悄悄告诉大家,
满减后到手价比在“得到APP”内购买还要低哦~
还有还有,优惠券可无限次领取,
超过200元的专栏,分别领券下单都可立减 20!
*请注意:下单购买时的手机号一定要
和登录“得到”APP 的手机号保持一致,
否则会导致购买后找不到已购课程!
扫描下方二维码即可领取全网独家优惠券👇
Image
卓克老师的其他付费专栏还包括:
  • 卓克·科技参考
  • 卓克·科技参考2
  • 卓克·科学思维课
  • 卓老板聊科技
欢迎大家选购自己想要学习的“得到”课程,如果以前没有下定决心,现在就不要再犹豫了。
ps:遇到问题想要咨询,可扫码联系我们的客服👇
Image