gpt-4.5 代表全体llm,首次正式通过图灵测试。🤣
gpt-4.5作为首个通过图灵测试的llm,可以说是毫不意外。毕竟这是第一个用了就回不去、使用成本是deepseek数百到上千倍的模型。 最新论文:《大语言模型通过了图灵测试》(Large Language Models Pass the Turing Test) 论文作者都来自加州大学圣地亚哥分校认知科学系。研究评估了四个系统(ELIZA、gpt-4o、LLaMa-3.1-405B 和 gpt-4.5),通过两次随机、受控的图灵测试进行检验。 测试过程: - 每位参与者同时与一位真人和其中一个系统进行 5 分钟的对话,之后判断哪个对话方是真人。 - 在要求系统模拟人类对话风格时,gpt-4.5 在 73% 的情况下被认为是真人,显著超过随机选择的水平。 - LLaMa-3.1 在同样条件下有56%的情况被视为真人,但并未显著超越随机水平。 - 而传统的基准系统 ELIZA 和 gpt-4o 的表现远低于随机水平(分别为23%和21%)。 这次研究,首次提供了实验证据证明某个人工智能系统能够通过标准的三方图灵测试。 这多少算一次ai发展史的里程碑吧?