Sota.AI|AGI 变革:从新的公司组织,到新的文明形态
截止2022年4月,ChatGPT 的访问量已经超过10亿,独立访客超过1亿。正确的非共识造就了 ChatGPT 的成功,而这一切仅仅是 AGI 变革的开始。用OpenAI的话来说,做AGI的最终目标是创造一种普惠的AI。
当时计算机已经可以完成一些基础的数学运算和逻辑推理,但要让计算机具有类似人类智能的复杂能力,却是一个巨大的挑战。为此,约翰·麦卡锡等科学家提出了一项宏大的目标:构建一台能够像人类一样思考和行动的机器,这就是AGI的雏形概念。
此后数十年,人工智能系统发展迅猛。在与人类的对弈中战胜了国际象棋冠军,赢得“危险边缘”比赛,图像分类比赛(ImageNet),战胜围棋比赛冠军。并在 2022 年底,以 ChatGPT 为代表走入大众生活.
然而,截至今日,AGI 依然没有一个类似“图灵测试”的标准界定其成功与否。仅是一些模糊的概念指引着无数天才前进。或许正如乔布斯所说,“愿景是一切的起点,有一个目标,一个梦想,能指引你不断前行”。
对于整个人类文明而言,人工智能意义之深远,远远大于人类历史上的火和电或任何我们过去的技术成就。
2015 年 AlphaGo 击败李世石事件震惊全球,成为那一个十年中最引人瞩目的 AGI 发展里程碑。一时间无数人认为 AI 的智慧即将超越人类,“技术奇点论”甚嚣尘上。普通人也开始焦虑:自己的工作会不会随时不保?
然而随后 5 年里,打败李世石的 AlphaGo 如同束之高阁的艺术品,普通人几乎没有机会接近,也没有出现大量替代普通人工作的现象。直到 ChatGPT 出现。
2022年底,ChatGPT3.5 横空出世,短短数周时间积累了上百万用户,发布100天用户量突破1亿,影响力甚至超过当年的 Twitter、Facebook 和 Instagram。
热闹的背后,是睿智的企业家和科学家们不断提醒。先有马斯克和众多大佬联合呼吁暂停 ChatGPT 大模型训练,后有hinton从谷歌辞职,“只为自由地讨论人工智能带来的危险”。
那么 ChatGPT 背后到底是一个怎样的技术?它的出现意味着什么?
GPT全称“Generative Pre-trained Transformer”,是一种基于Transformer Decoder 的大语言模型(LLM)技术。
简单来说,GPT 序列模型的训练目标是给定一个词序列,预测下一个词,基于此能力循环往复,就能在任意上文之后输出完整下文。
在 ChatGPT 之前,“多轮对话”一直是众多科技公司主攻或者标榜的产品功能。尽管做“智能客服”、“语音助手”的公司多如牛毛,但整个行业还没有一家公司的产品出色地解决这一需求,并被大众普遍认可。
而 ChatGPT 除了解决“多轮对话”这一难点外,在语言生成流畅性、模型通用性、知识表示与推理三个方面也做到了新的高度。
谷歌 CEO Pichai 在接受 CBS 采访时表示,“AI 是人类正在研究的最为深远的技术,甚至比发明火和电的成就都要深远”。百度CEO李彦宏也发表过类似观点,ChatGPT 是 AI技术发展到一定阶段后的新机会,技术已经到了临界点。
那么,ChatGPT 是一个怎样的临界点呢?
这个问题没有标准答案。在翻阅了大量书籍和资料后,我们尝试用信息动力学的框架聊聊这个问题。
先看个场景。中国历史上最负盛名的“无双国士”韩信,带兵能力超强。成为大将军后,每次打仗韩信都稳坐中军帐,通过沙盘和前方传来的情报运筹帷幄,发号施令指挥战斗。当韩信给部下发布“进攻”指令时,部下将带领士卒冲往沙场拼死一战。
这个场景中,韩信的信息输入很复杂,需要沙盘推演结合前方情报。信息处理则需要基于过往经验做大量分析,复杂度不亚于输入部分。但信息输出很简单,仅仅是一个指令。
作为韩信的部下情况有所不同,其处理信息过程中,接收到“进攻”指令后,带上三军将士冲往沙场打仗。信息输入和处理都很简单,而信息输出则需要号令士卒甚至亲自执行。
在信息动力学中,任何事件的处理过程都由“输入”、“处理”、“输出”三个环节组成。人类在信息输入、处理和输出三部分都有足够的“复杂信息处理”能力。
计算机作为人类的辅助工具,本质上只做三件事:复制、粘贴和排序。互联网、社交媒体通过网络,让人与人之间的信息传递变得更加便捷,背后是复制和粘贴。Google 搜索、各类推荐算法是排序。
其中,复制和粘贴没有太大的计算量需求,只有排序可能需要巨大的计算量。但“排序”工作的输入必须语义明确,“排序”工作输出一串数字即可--复杂度很低。计算机无法利用序号自行迭代完成更复杂的任务。
一个中学生打卡一家新的餐厅,拍照发朋友圈并表达了自己的开心,这件事处理信息的复杂度就已经比任何计算机更复杂了。
GPT 出现之前,其实人工智能已经有很多令人惊艳的表现,例如围棋、世界象棋、作画。但从信息处理角度看,这些人工智能模型与排序算法的问题一样:输出形式简单固定,无法通过多次迭代运用这种信息处理能力实现更高的复杂性(这是 GPT 原理的关键所在)。换句话说,信息动力学的复杂性取决于输入、处理、输出三者中的瓶颈。
但 GPT 出现后完全不同了。GPT 可以接受模糊的输入,各种语言,各种代码,还可以生成复杂的输出,例如文章续写、网站构建、文章总结等,这是“弱人工智能”无法完成的任务。甚至在用户提示下,GPT 还能不断改善回答质量,具备初阶的自我改进能力。
也就是说,GPT 的出现打破了信息处理复杂度的临界点,让计算机在输入、处理和输出三大环节都拥有可以与人类匹敌的复杂信息处理能力。
找到正确的非共识,是创业者获取巨大成功的前提。
2015年底,马斯克、山姆等人正式成立了OpenAI,并在实验室目标中写出“不以财务回报为目的”。以此开启了一段理想主义者的探索之旅。
同一时间,OpenAI 创始人山姆找到 Y Combinator 的创始人 Paul Graham,向 Paul Graham 展示了 OpenAI 规划,以及超豪华的创始团队背景和能力。为后续OpenAI获得第一笔投资埋下了伏笔。
OpenAI 早期的技术路径是发散的。一开始团队仅有10人,资金主要来自于几位创始人。这个10人小团队开展了 OpenAI Gym(RL),OpenAI Five(Dota2)和一系列 Generative Model(生成式模型)的项目探索,试图从中找到可行路径。
2016年6月,OpenAI 发布了 《Generative Model》一文,指出:“ OpenAI 的一个核心目标是理解世界(物理和虚拟),而 Generative Model(生成式模型)是达成这个目标的最高可能性路径。”这一论调在当时并没有引起太大关注,因为业界主流的技术路径偏向于有监督学习,大部分科技大厂也为此雇佣过很多“数据标注师”。
这时距离 OpenAI 成立不到一年。核心创始人山姆再次联系了 Paul,获得了300万美元的种子资金,以及孵化器的资源和帮助。同时得到了来自硅谷投资教父 Peter Thiel 等知名投资人的投资。
此后,OpenAI 快速发展,沿着 GPT 技术路线探索工程极限。或许是因为没有商业化压力,OpenAI 一直以来的技术路径探索都沿着“最接近人工智能本质”的 Unsupervised Learning(无监督学习)或 RL(Reinforcement Learning, 强化学习)方向探索。
优点在于无需标注数据,有较好的可拓展性。缺点也很明显,就是工业上并不成熟且 Scale(规模化)实践很难,成本高昂。
然而天才们的洞见并不是无稽之谈。2017 年 4 月一篇名为《Learning to Generate Reviews and Discovering Sentiment》的文章指出,“真正好的预测与理解有关”,以及“仅仅被训练用于预测下一个字符之后,神经网络自动学会了分析情感” 。
(论文链接:https://arxiv.org/pdf/1704.01444.pdf)
同年,Transformer 横空出世,Transformer 对 language model 的并行训练更友好,补齐了 OpenAI 需要的最后一环。自此,OpenAI 确立了以 GPT 架构的 LLM 为主要方向,将资源逐渐转移至 LLM,开启了 GPT 算法路径的工程极限探索之途。这个举动在当时看来几乎不可理喻。
2018 年 6 月 OpenAI 发布 GPT-1,开创了使用 Transformer 模型进行自然语言处理的先河。同一时期谷歌发布大模型BERT,二者对比之下,BERT展现出优异许多的理解能力。
专家们对GPT-1的评论不一而足,杜克大学机器学习专家 Cynthia Rudin 在接受 Wired 采访时聊到,GPT-1 模型的表现并不令人印象深刻,而且其应用范围也受到一定的限制。存在着过拟合、数据偏差、语义不一致等问题,未来前景不明朗。
也有技术博主力挺 GPT-1。Gwern Branwen 作为独立研究人员发博客称,GPT-1 模型的优点在于其可以进行无监督的预训练,可以从大量文本中学习到语言模式和规律,从而提高模型的语言生成能力。具有十分广阔的应用前景。
业界的表现则很现实,众多学者几乎一致地纷纷转向谷歌的 BERT 大模型研究。
“正确的非共识如同真理,他只掌握在少数人手中”。
BERT 大模型优异表现的核心原理是利用有监督学习的方式预训练特定领域的模型,相比使用无监督学习训练的 GPT 模型,显得“短视而肤浅”。
而在外界普遍不看好的情况下,OpenAI 选择持续加码下注 GPT 路线。这一时期孤独且惊人的巨大投入,甚至让外部觉得这是信仰的程度。
2019 年 2 月 OpenAI 推出 GPT-2(1.5B)。GPT-2 虽然在生成任务上表现惊艳,但是在理解类任务的表现上仍然全面落后于 BERT 。在这样的背景下,OpenAI 依然坚持 GPT 路线并且大幅度加大 Scale 速度,于 2020 年 5 月推出了 GPT-3(175B)。GPT-3 模型参数 175B(百倍于 GPT-2),训练数据量 500B Tokens( 50 倍于 GPT-2)。每一次发布,模型效果都有巨大提升,这让业内人士对 GPT 这个“新物种”愈发期待。
再后来的事大家耳熟能详了,2022 年 11 月 30 日,就在行业预期 GPT-4 即将发布之际,OpenAI 突然发布了开发用时不到 1 个月的对话式产品 ChatGPT,引爆了这一轮的 AI 热潮,OpenAI 一战成名。
回顾 OpenAI 的发展历程,其技术路径从发散到收敛,选择了一条业界主流之外的路。坚持长期主义并找到正确的非共识,是 OpenAI 在理念和认知上的独到之处。如今,理想主义历经孤独后成功蜕变,让人们看到人类未来的更多可能,也让理想主义创业者的灯塔再次闪耀于人类历史中。
马斯克的商业版图无比庞大,最终指向一个愿景:加快人类向可持续能源转变。为此马斯克打造了特斯拉、spaceX、Nuralink(做脑机接口)、Boring.co 等名震世界的公司,也包括早期投资 OpenAI。
如今的 OpenAI,为了创造普惠的 AGI,从 ChatGPT 开始,正在走出一条可无限扩张的商业之路。
#2.1
过去的公司 VS 现在的公司
GPT-3发布之后引起了大量创业公司的关注。之后两年,基于 GPT-3 API 构建的应用生态持续发展并逐渐繁荣,诞生了一系列明星公司:Jasper( 2022 年 ARR 达 9000 万美金),Repl.it,Copy.ai 等。GPT-3 发布及生态成型期间(2020-2022),OpenAI 一直没有推出下一代模型,而是开始重点研究 Alignment 问题。
如今 GPT-4 成为业界“当红炸子鸡”,“新型”创业公司如雨后春笋般涌出。基于GPT技术的创业公司正成为一个新群体,他们普遍具备“员工极少”,“ARR 较高”,“现金流充裕”的特征。
典型的比如成立于 2015 年的 Discord 与成立于 2021 年的 Midjouney,发展至今两家公司的年营收均为 1 亿美金,而员工人数却有数十倍之差。前者到 2021 年共融资 5 亿美金,而后者发展至今融资金额为 0 。
这样的“新型”公司还有很多,比如GPTbot、ImgTec、NeuralMind、MindAI、WriteMind等等。相比互联网时代“软件吞噬世界”的论调,如今我们看到,“AI吞噬世界”正在成为现实。
#2.2
过去的工作 VS 现在的工作
ChatGPT席卷全球的背后,是无数行业的工作方式和节奏开始发生质的变化。
过去智能客服领域很多时候需要人工介入,如今使用 ChatGPT,或是基于 GPT 开发的聊天软件,可以做到几乎零介入。客服人员的工作方式再次升级,从智能客服辅助客服人员回复,转换为客服人员监督智能客服回复即可。
在媒体和律师行业,众多工作者的工作效率也得到了成倍提升。典型的如媒体行业的内容生产者,通过 ChatGPT 搜集素材,创作相似文案,甚至续写文章,媒体行业工作者的效率获得成倍提升。据统计,使用 ChatGPT 工作的媒体行业工作者平均效率提升了3~5倍。
然而 ChatGPT 对工作的影响也不全是有利的。据悉,由于 ChatGPT 等 AI 应用发展过快,5月2日(美国当地时间),数以千计的好莱坞编剧工会(WGA)成员走上街头举行罢工示威活动,抗议理由是收入过低和AI越来越多地取代人类参与剧本写作的现象。在采访中罢工人士提到“担心AI既抢走了编剧们的饭碗,同时也贬低了“人类劳动的尊严和价值”。
可见,AI 发展对人们工作的影响正如海浪般涌上街道,不断延伸至各个写字楼里的“打工人们”。面对新技术的到来,一如既往的有人欢喜有人忧。
#2.3
GPT 与新技术相互促进
OpenAI CEO 山姆·奥特曼在今年4月接受网易的采访时提到,“在未来几年内,人工智能将会在各个领域和行业取得更多突破和创新,并且将会与其他科技领域如物联网、区块链、虚拟现实等更加紧密地结合”。
我们看到,现今人工智能与各个领域结合的案例正以前所未有的速度飞涨。
脑机接口(BCI)领域:
脑机接口在当下最常见的应用有脑机接口控制机械肢、脑机接口文本编辑器、脑机接口控制智能家居以及脑机接口辅助自然语言翻译。
ChatGPT发布后,这一领域的典型应用都将得到改进,代表公司有 OpenBCI、BrainCo和 Ctrl-Labs 等。
区块链领域:
在区块链协议中利用 ChatGPT 标注数据,提高效率和准确度,用 ChatGPT 帮助创建自然语言处理的合约,自动执行一些任务,例如设备之间的通信、设备之间的自动交互等。是常见的GPT与区块链结合的案例。
代表公司有 HUMAN Protocol、Emrit 等。
RPA领域:
这一领域通常使用ChatGPT 技术来帮助机器人理解人类语言,自动识别人类的意图和情绪。并且在执行任务时能够根据人类的指令进行操作。使得机器人在与人类交互时更加智能化和自然化。
代表公司有:Automation Anywhere、UiPath、WorkFusion等
人工智能和游戏领域:
像许多人所说的那样,当游戏规模扩大到吞噬人们的日常生活时,就是元宇宙。A16Z曾发表过一篇文章《Meet Me in Metaverse》[6],很好地勾勒出了其中的道理,并追溯了最近在这个方向上的进展。
科技巨头们也已经涉足这个方向,尽管还不是很成功。Google Stadia已经创建了内部游戏工作室,试图创建ML驱动的游戏。最明显的例子是他们的Project Chimera。
脑机接口、区块链、RPA,以及Web3。AI 与这些技术相互促进的结果,是虚拟世界愈发繁荣,最终可能完全剥夺人们的注意力,形成一个闭环的线上生态。
到时,人类生产内容的主体将从机器辅助人生产过渡到完全由机器自主生产。
电影《头号玩家》阐述了未来游戏世界的景象:一个由玩家与NPC共创的全新游戏世界,并且其中的 NPC 已经拥有与人类玩家平等的主导权。
最近,谷歌和斯坦福利用 ChatGPT 打造了一个 25 人的“AI 小镇”,这个小镇没有人类,是一个完全由AI自主生成并不断进化的社区。小镇里的 AI 们有自己的职业、爱好和生活习惯,甚至有自己的规划和奋斗目标。
小镇运行 2 天后产生了社交网络,名叫伊莎贝拉的角色筹办了情人节派对并邀请到众多好友参加。完全形成了一个 AI 自发的“人类社会”。
“ AI 小镇”实验最终形成了一篇论文《Generative Agents: Interactive Simulacra of Human Behavior》。论文中介绍了“AI小镇”的技术原理,以及生成这个实验解决的相关问题。
总的来说,这篇论文有如下几个贡献:
生成式智能体能模拟人类的可信行为,这些行为是随着智能体的经验和环境不断变化的。
提出了一种新的结构,使生成式智能体可以检索、记忆和反思,并与其他智能体通过动态不断发展的环境来计划。该结构利用了LLM(大语言模型)的强大提示功能,并使用该功能来支持智能体的长期一致性,管理动态更新记忆的能力,并递归产生更多的生成。
讨论了交互系统中生成智能体的机遇,道德和社会风险。我们认为,应该调整这些智能体以减轻用户形成有害社会关系的风险,并在设计过程中以以补充而不是取代人类的方式进行应用。
通过创建“沙盒”(Sandbox),“打造智能体”(Generative Agents)和构建交互环境,“AI小镇”可以让“人们”随着时间的流动不断作出符合当下环境的可信行为,小镇上的“人与人”、“人与环境”甚至是“环境与环境”的交互时刻进行迭代更新。而这一切都不是预先设定,而是小镇上的人们自发交互产生的。
其背后的核心技术包括行为框架、树形结构的环境分配以及角色的记忆流。其中“智能体”通过Memory-Reflect-Plan 机制不断结合当下环境与以往经验作出新的决策与动作,甚至对未来进行迭代规划。最终形成一个AI自发生成的“人类社会”雏形。
虽然这个实验仅进行了2天,但其利用 ChatGPT 作出复杂交互的经验,让人类“打造可信智能体”的目标向前迈出了重要一步。
Reference
https://arxiv.org/pdf/1704.01444.pdf
https://arxiv.org/pdf/2304.03442.pdf
https://mp.weixin.qq.com/s/sJYIukx_lh5ybvlYJubfTA
https://redian.news/wxnews/356210
# 活动预告
—end—
文案 | Ryan & Alan
排版 | Dora
审核|瑞恒Ryan
* 部分图片来源于网络并备注引用来源