火出圈的ChatGPT,能否带来新一波AI浪潮
本文主要参考资料,来源于 openAI 官网、OpneAI 于 2022 年 3 月上传 arXiv 的论文 Training language models to follow instructions with human feedback,以及相关同事之间的交流。
本文第二节会涉及部分人工智能领域技术术语,其中结论性要点用黑体字标粗
1.惊艳作为 NLP 领域( 自然语言处理,算是人工智能领域的一个分支 )的从业者,这几天被不下 10 个不同行业的朋友询问对 ChatGPT 的看法,甚至还包括二级市场的研究团队。
11 月 30 日,OpenAI 宣布对话机器人原型产品 ChatGPT 正式向公众开放;12 月 1 日,其 CEO Sam Altman 在 Twitter 上号召大家体验。
短短 5 天之内,其用户量跨越 1 百万,在各种社交媒体( 包括微博朋友圈这样的中文社交媒体,虽然 openAI 目前仍禁止中国大陆和香港注册账户 )都成为广泛传播的现象级产品,而这一切在 OpenAI 的描述中,还仅仅是个“原型”( prototype )。
当初 GPT-3 带着超大模型( 1750 亿参数 )的标签亮相的时候,着实也让业界轰动一时。不过这是一个完成 NLP 任务的基础性框架,可以不太恰当的理解成仅包含发动机和底盘的框架车,性能强劲,但并非普通用户所能驾驭的。如今 ChatGPT 仿佛一台炫酷跑车闪亮登场,并且人人都可以来试驾一把,其效果自然是火到出圈。
我这几天的密集使用同样为也是大为震撼:
图1:
发言稿
比如上图,写一篇发言稿,通过几轮交互,基本可以补全,想要增加内容随时可以发出指令。上下文理解、多轮对话都很流畅,一二三四还有那么点领导的意思,至少可以是秘书起草发言稿的好帮手。
图2:
理解和推理
上面这个例子要难不少,首先要理解苏东坡这首诗的含义,其次要了解一些物理知识,最后还得清楚我到底问的是什么。
有意思的是,第一轮它的解释是对的,但答案选错了。在我的提示下给出了正确答案,很礼貌,同时还自我批评了一下( 虽然这个批评不靠谱 ),还说自己经过“思考和分析”( 天知道你怎么思考和分析 )发现了正确答案。
这种拟人化的形式让交互流畅度和我们对它的好感度大大提升。
我们还可以让它做做经典的亲戚关系推理:
图3:
亲戚关系
前面看着还挺正常,后面就有点崩了。做数学题,有些像模像样,有些则哭笑不得:
图4:
解数学题
不过我想到最近在辅导明年要高考的儿子功课,可以看看这方面的效果。选它最擅长的英语吧:
图5:
2022年北京英语高考作文题
整体表达清楚流畅,用词地道,虽然我不太知道具体评分标准,但这个水准肯定是可以拿高分的。
据说有人让 ChatGPT 做了一套 SAT 试题( 美国高中学业水平考试 ),分数排位在 50% 左右,相当于平均水平了。我们还可以看看 NLP 任务针对很多生成模型迈不过去的坎儿:虚假术语
图6:
虚假术语
这个 “基于等离子栅格的大型交互式神经网络” 是我瞎编的,别说,它这一板一眼的解释还真像那么回事儿,连我都要信了......
2.技术 从 OpneAI 官网,以及 2022 年 3 月上传 arXiv 的论文 Training language models to follow instructionswith human feedback 之中,我们大致可以窥探到 ChatGPT 在技术选型和架构上的一些端倪:ChatGPT 的基础模型是 InstructGPT,而 InstructGPT 是在 GPT-3 基础之上,增加了人工标注数据以及 OpenAI API 开放后用户提交的提示词 ( prompts ), 并利用基于人工反馈的强化学习模型精调 GPT-3 模型做得到的。
因此, ChatGPT 的基础依旧是 GPT-3 ( 确切的说是 InstructGPT ,为简便起见我们使用 GPT-3 ),OpenAI 官方称其为 GPT-3.5。
自然语言处理包含一系列的常规任务,比如翻译、问答、阅读理解、完形填空、摘要、提纲、推理、补全、文章撰写等等。
通常会事先训练一个语言模型作为基础,根据不同的场景和任务做一定的精调。因此,这个事先训练好的模型决定了解决问题的基本能力。过去几年,在自然语言处理领域的重大进展,就是模型的规模越来越大,训练所需的语料越来越多。
图7:
预训练模型规模
从上图我们可以看到,2020 年推出的 GPT-3 模型的规模达到 1750 亿参数,根据 openAI 的相关资料,其训练所需的资料有几十 TB,单次训练成本千万美金量级。
GPT-3 刚发布的时候,其模型规模是其他模型的 10 倍以上,不用做太多精调就能够在很多任务和数据集上达到当时最好模型的水准。这也是当时在业界引起轰动的原因。
那么 ChatGPT 是否是更大规模的模型?答案是否定的。
ChatGPT( 其基础模型 InstructGPT )仅仅使用了 13 亿参数的模型规模就达到了当前的效果, 其模型规模比 GPT-3 小 100 倍以上。
但如前所述, ChatGPT 引入了两项非常重要的改进:
1.引入优质的人工标注数据,以及积累的用户交互数据做问答精调
2.引入强化学习模型,针对用户意图做优化训练
事实上,这正是为什么 ChatGPT 在问答这项任务上表现如此之好的原因,用论文里的原话说,就是:
aligning language models with human intent.
GPT-3 是一个基础性的预训练模型,它更像是一个具备通用能力的底座,对外提供能力输出。ChatGPT 则是架构在其上的具体应用,利用其能力,结合场景特点完成服务。
在问答这个任务中,用户的感受是第一位。并且,这个感受并不是一个非黑即白的开关,而是多维度的评价。
OpenAI 特意严格挑选并组建 40 人的团队,专门为 ChatGPT 做问答标注,确保这个团队的知识性、多样性和最大程度降低偏见。
多加的这一层强化学习,就是要保证这部分高质量的标注数据进入到模型中形成正向循环,确保“人类的意图”得到贯彻。
图8:
基于人类反馈的强化学习框架
包括最近一直很热的图片生成服务 Stable Diffusion,其语言理解部分也使用了 Transformer 模型。
相比 CNN( Convolution Neural Networks,卷积神经网络 )和 RNN( Recurrent Neural Networks,循环神经网络 ),在自然语言处理任务中,Transformer 通过注意力机制能够在理解上下文的同时,更好的保持对全局的关注。
因此,最近几年越来越多的团队把精力投入到这个模型之中。
强化学习则一直以来在游戏和交互式任务中有非常好的表现,我个人也始终认为强化学习和人类学习知识、适应环境的模式更相似,通过强化学习模型训练出来的行为以及整个的训练过程,我们人类更容易理解、更能够从中获得启发。
这两项技术的结合,在对话这样一个需要重度用户参与、以用户的主观感受为评价标准的场景下,产生了出人意料的惊艳效果。
因此,与其说是单纯的技术突破或更新换代,不如说是技术与场景的完美结合造就了 ChatGPT 现象级的成功表现。技术进展本身也是层层累进、不断迭代而来的,没有什么凭空出世、横扫天下的神话,也没有什么是能解决所有问题的银弹。
3.应用聊到 ChatGPT 的应用,朋友们提到最多的还是搜索。我要搜什么,直接问它就好了,方便快捷。这似乎是最直观的感受。
我个人的看法是: ChatGPT 与搜索之间不是互相替代的关系。两者的产品逻辑不同,应用场景也不相同。
搜索引擎的核心是信息组织方式,信息的获取、整理、索引、召回、排序。我们使用搜索引擎的时候,有时候会在意信息的全貌,会比较、会甄别。
ChatGPT 则是交互式对话,根据人类的意图、指令和上下文去完成力所能及的任务。
过去二十多年,搜索引擎的应用太成功了,产品形态简洁、使用方法深入人心,以至于承担了很多并非其所长的任务。
其中某些知识问答类场景,是可以通过对话的方式解决的,但前提是提供的信息足够准确。
很多朋友在尝试 ChatGPT 的时候都遇到了常识性错误,包括我前面给出的例子,也有不少知识性错误的地方。与很多朋友的理解不同,这部分在当前的技术框架下是很难解决的。
当前机器学习( 包括本文提到的各种深度神经网络 )都还是基于概率统计的框架,并非严格的逻辑推理,更谈不上因果推理,是无法杜绝常识性或逻辑错误的。有些朋友在得到意料之外答案的时候说:
“ChatGPT 的逻辑好奇怪”
其实 ChatGPT 根本就没有逻辑 ,它不是通过逻辑和演绎来思考的,而是一架大型的概率映射机器。因此,在需要信息准确性足够高的场景下,ChatGPT 并不能取代搜索,至少目前不能。
但这个问题的另一面,也是我一直坚信的一个观点:
对话式交互比搜索拥有更广泛的应用场景 比如万物互联之后给设备赋能,让我们每天接触的各种设施设备( 甚至不需要是电子设备 )具备响应个性化需求的能力,显然对话比搜索是更合适的交互方式。比如各种辅助提升效率的智能助手,当然前提还是要解决掉准确性的问题。
这些是在搜索的技术和产品框架下做不到的,也是更广阔、更庞大的市场。
我们要的是一辆汽车,而不是跑得更快的马车,哪怕它现在可能跑得很慢。另一个 ChatGPT 被提到最多的应用方向是 AIGC( Artificial Intelligence Generated Content ,人工智能生成内容 )。
这也是一个最近广为流传的概念,特指那些由 AI 生成的文章、图片、动画、视频等等,区别于专家生成内容( PGC, Professionally Generated Content )和用户生成内容( UGC, User Generated Content )
今年美国科罗拉多州的年度艺术大赛上,一位作者凭借 AI 生成的作品获得大奖,在参赛的艺术家和公众之中都引起了不小的讨论和争议。
图9:
AI生成的获奖作品,太空歌剧院,
作者:
Jason M. Allen,
Midjourney
最近几年,AI 生成的内容质量有了非常显著的提升,特别是在 AI 绘画方面,甚至不少专业的设计师、创作者开始利用 AI 工具构思、画草稿、生成创意,至少能提高生产效率。
在文本生成领域,copy.ai, grammarly 等工具已经能够辅助( 英文 )文字工作者完成商业性文案工作,营销、宣传、广告创意、商品描述、邀请信、通知函等等。 辅助创作、提升生产效率是 ChatGPT 眼前就能看到的商业应用。 无论它是不是叫 AIGC,输出的效果在特定的场景下的确是已经能够提升生产力。至少在不远的将来,繁琐的、重复性的文字工作,都有可能被替代。以 AlphaGo 为代表的新一波 AI 浪潮,至今 6 年多过去了,期间也是有些波折。如今以 Stable Diffusion、ChatGPT 为代表的生成模型,无疑又进一步点燃了大众的热情。
并且,这一波应用与上一波有一个显著区别:以图像识别为代表的上一波应用主要针对企业市场,多以项目形式出现;而以内容生产为代表的这一波应用,更贴近普通用户,更容易被大众感知, 也更可能诞生杀手级应用。 如果断言这就是通用人工智能( AGI,指具备或超越人类智力的人工智能 )之路,我觉得为时尚早,至少我认为不解决因果推理和自我进化的问题,谈不上真正的智能。至于说 AI 会不会导致大量人口失业,纯粹从技术角度看,我的观点一直是短期会导致一部分人群失业,但长期会创造更多的工作机会。技术发展史上的历次变革也证实了这种看法。
至于会给人们的心理和认知带来怎样的变化,我想用我最喜欢的一位科幻作家 Tedd Chiang( 姜峯楠,美国科幻作家,电影《降临》的原著作者,中文科幻圈经常叫他特德蒋 )2000 年发表在 Nature 上的一篇文章作为结尾:
We need not be intimidated by the accomplishments of metahuman science. We should always remember that the technologies that made metahumans possible were originally invented by humans, and they were no smarter than we. -- Catching crumbs from the table, Tedd Chiang
2023 年第一季度,ArchSummit 全球架构师峰会将落地北京海航万豪酒店。来自百度、京东、华为、腾讯、斗鱼、中国信通院等企业与学术界的技术专家,将就数字化业务架构、低代码实践、国产化替代方案、分布式架构等主题展开分享讨论。
目前已上线数字化场景下的业务架构、低代码实践与应用、国产软件优化迭代之路、多数据中心的分布式架构实践、软件质量保障、技术 - 产品 - 业务、高并发架构实现、架构师成长与团队搭建落地实践、大数据和人工智能融合、大规模微服务架构演进、可观测技术落地、云原生大数据实践等多个专题,点击阅读原文去官网查看大会日程。
团队购票可享折扣,购票或咨询其他问题请联系票务同学:15600537884(微信同电话)