GPT-4在图灵测试中失利!60年前的古老AI战胜了ChatGPT,然而人类的胜率也仅为63%
引言
长久以来,图灵测试一直是衡量计算机智能水平的核心标准。在上个世纪60年代,麻省理工学院的团队开发出了史上第一个基于规则的聊天机器人ELIZA,然而在图灵测试中并未成功。如今,功能强大的ChatGPT在绘图、编程以及处理各种复杂任务方面表现出色,但在最近的一次测试中,却败给了这款有着近60年历史的聊天机器人ELIZA。加州大学圣地亚哥分校(UCSD)的两位研究人员在一篇名为《GPT-4能通过图灵测试吗》的研究论文中证实了这一发现。
AI
研究背景与目的
尽管ChatGPT在众多任务中展现出了卓越的能力,但在图灵测试中却未能超越60年前的ELIZA。UCSD的研究团队旨在通过对比GPT-4、GPT-3.5、ELIZA以及人类参与者在图灵测试中的表现,探讨GPT-4是否能够成功通过这一测试。
论文地址:https://arxiv.org/pdf/2310.20216.pdf
AI
研究方法与过程
研究人员将GPT-4、GPT-3.5、ELIZA和人类参与者作为研究对象,观察哪个对象能够在与人类互动的过程中,最成功地让人类参与者误认为它是人类。实验过程中,研究人员创建了25个使用OpenAI API回应用户查询的“LLM见证者”,并修改了提示的多个方面,以尽可能排除机器人痕迹。同时,他们设计了一个类似常规消息应用的聊天界面,限制了消息数量和字符。
AI
研究结果与分析
实验结果显示,ELIZA在27%的交流中成功地欺骗了人类审问者,这一成绩优于部分GPT-4见证者和所有GPT-3.5见证者。相比之下,GPT-3.5的成功率最高仅为14%,而GPT-4则取得了41%的成功率,仅次于人类得分(63%)。研究人员对审问者将ELIZA误认为是人类的原因进行了深入分析,发现ELIZA的回答通常较为保守,避免了给出明确的错误信息。此外,ELIZA并未表现出人类审问者认为的典型AI特征,如过于热情、友好和啰嗦。有些审问者甚至认为ELIZA的表现太差,不可能是现代AI模型,因此更可能是一个故意不合作的人类。
AI
结论
根据研究结果,GPT-4并未通过图灵测试。这表明图灵测试可能并非一个能够有效评估智能的标准。实验结果可能受到了测试结构和评委判断标准的影响,而不仅仅是人类或AI系统智能水平的差异。此外,研究人员指出,人类在判断对方是否为人类时出错的概率较高,接近30%。这意味着,当未来AI技术被用于模拟人类言行以欺骗他人时,这种高错误率可能会带来一定的问题。
研究者表示,「GPT-4不符合图灵测试的成功标准,既没有达到 50% 的成功率,也没有超过人类参与者的成功率」。显然,GPT-4并没有通过图灵测试。
AI
未来展望
尽管GPT-4在本次图灵测试中未能成功,但研究人员认为,如果有合适的提示设计,GPT-4或类似模型仍有可能最终通过图灵测试。然而,这也意味着我们需要关注AI技术模拟人类言行可能带来的潜在问题。
GPT-4在图灵测试中的失利揭示了现代AI在模拟人类交流方面的局限性。尽管如此,这一结果也为AI技术的发展提供了有益的启示,有助于我们更好地理解人类智能与AI系统之间的差异。在未来,随着AI技术的不断进步,我们有望找到更有效的方法来评估和提升AI的智能水平。同时,我们也需要关注AI技术在模拟人类言行方面的潜在风险,以确保其可持续、安全地发展。
参考资料:
https://arstechnica.com/information-technology/2023/12/real-humans-appeared-human-63-of-the-time-in-recent-turing-test-ai-study/