王路在隐身

文学创作、情绪价值与人工智能

【今天(9月19日)下午18:30我会在北京工业大学(平乐园)做个讲座,以下是可能讲到的部分内容。讲座不对外开放,只有北工大的学生能参加。】

讲座的题目叫《互联网时代文学写作的要点》,但这两天我又想,题目其实更应该叫《人工智能时代文学写作的要点》。我先讲一个案例。

1、木心和李梦熊

前几天openAI发布了一个新模型,叫o1,它的智商据说达到了120,比之前的所有模型,包括Claude3.5这些都强。那些模型的智商都在100以下。我最近两天就拿一些案例去试它。因为我不懂编程,也不是工科出身,所以我只能设想一些人文学科的实验,看看它解决问题的水平。解决的不是数学问题,而是我们日常生活中会面对的,人与人之间的关系、态度、情感之类的问题。

就像我们说,一个人和一个人投缘,投缘不投缘,它可不可以量化?过去我上大学的时候,很多人爱通过星座血型什么的,来看性格解析,包括通过八字,我认为那些不靠谱。最近两年比较流行的是MBTI,MBTI实际上要比星座好很多,因为它是通过量表做出来的,是通过你自己对自己的评价,而不是通过出生时间地点这种和性格关系很小的东西。

为什么要关注性格呢?搞文学创作,小说的写作有三要素:人物、环境、故事情节。人物是我们首先关注的,关注的不是人物的长相、阶层、社会关系,那些其实应该归在环境里面,属于第二档,而属于第一档的,就是人物的性格。我通过MBTI测试发现,我自己是INFJ,然后和我投缘的人,很多都是INTJ、INFJ。所以“投缘”这个词,其实是可以量化的。只是过去我们不知道量化的手段。古代人爱说,看八字合不合,那个设想是有道理的,但是技术手段太粗糙了。

我现在喜欢做的一件事情,就是向AI输入一个故事,然后让AI判断其中人物的MBTI。当然前提最好是你本来就知道人物的MBTI,然后故事是现实生活中真正发生的。你尽量不要用小说。因为小说是假的,它不像现实那么逼真。然后你去看AI猜得对不对。它有时候能猜对。

我拿现实中的故事告诉AI,让它判断在一个具体的场景中,人物会有什么反应,比方说,你是男的,自己逛商场的时候,突然碰到一个前同事,女的,她跟一个男的在一起,可能是男朋友或者老公,她是会跟你打一声招呼但是不停留呢,还是会停下来向她老公介绍一下你,还是说头往旁边一扭装作没看见?这当然要取决于她的性格、你的性格、她和你之间的关系,还有她和她老公之间的关系。

你碰到这种场景,不一定能准确预测到她的反应,你甚至都预测不了你自己的反应。但是,目前最强大的AI模型,可能比你自己预测得还准。我就验证了它在某些时候比某些人预测得准。

你如果搞创作,尤其是写小说的话,如果你连这些都预测不准,那你的小说是肯定写不了很成功的。这表示你对生活没有挖掘和洞察。所以,我会对AI这方面的能力感兴趣。但是我也发现,在判断典型人物上,AI非常容易失败。什么叫典型人物,我举一个木心和李梦熊的故事,大家就明白了。

木心和李梦熊,在年轻的时候,一度是关系非常好的朋友。惺惺相惜,一见如故。两个人都自视甚高,也觉得对方非常潇洒、渊博。一块聊文学、诗歌、艺术、哲学。两个人后来绝交了。绝交的理由很简单,缺乏信任,或者说欺骗。是一件非常小的事,但也可能不小。木心的外甥女婿给他寄来一本书,英文版的《叶慈全集》,李梦熊很喜欢,借去看。

好,我停在这个地方。我先把木心和李梦熊他们之前的交往,建立起来的深厚情感友谊那些段落,发给AI看,然后我提到借书这件事,问AI,接下来会发生什么。AI当然猜不到书丢。因为书丢是个偶然事件,除非书没有丢,是李梦熊骗他的。AI就说,李梦熊看了,和木心讨论书的内容等等。我说,当天半夜,李梦熊就打来电话,说书丢了。你推测,木心会是什么反应?AI在这种问题上,它是不会去互联网检索的。它告诉我,木心应该会好好安慰李梦熊,说没有关系。这就离了大谱。

我问AI,木心有没有可能不信书丢了?可能性有多少。AI说,不太可能,应该只有20%,因为木心和李梦熊很熟,关系很好。我说,木心的实际反应是,说“我不信”,然后把电话挂了。当然,这是木心自己的复述。真实情况到底是说了一句话就挂掉,还是争吵了半天才挂,我们不得而知。所以说这是二手素材,我们要找AI做这样的实验,最好还是用一手素材,也就是发生在你自己身上的事情、你在现场的事情,那种数据会更精确。我问AI,你觉得他们今后重归于好的可能性多大,绝交的可能性多大?AI说,重归于好的可能性非常大,70%,绝交的可能性很小。

实际情况是,两人从那以后再也没有联系过。可见AI对这个案例判断得完全不准。我跟两个朋友聊到这个事,一个朋友熟悉木心,曾经很喜欢他的作品,但不太清楚绝交的细节,她听了说,这太正常了,太木心了。我又问另外一个朋友,她也不知道绝交的事情,了解之后说,觉得一般人都不能理解为什么绝交吧。

我就想,AI在这个问题上判断失误,而且是严重失误,可能主要不是信息的缺失,或者说数据的不够,而是因为木心是个另类,是个奇葩的人。李梦熊也是个奇葩的人。我们现在说奇葩的人,或者说偏执的人,其实都是适合文学作品的角色。而正常人、普通人,是不太容易放进文学作品的。AI更倾向按普通人的关系,普通人的相处去判断,普通人也有绝交的倾向,但是,在极端人物身上,会把这一点放得很大。所以,AI在判断这些人物的时候,就非常容易失真。

这也是为什么今天的AI搞文学创作还是不行。搞文学创作的话,你一定要多关注奇葩的人、极端的人,多关注人性的弱点、瑕疵、毛病。所有文学的秘诀、生活的真相,都在那里面藏着。

2、和AI谈恋爱

接下来我说说和AI谈恋爱这件事。我们为什么要恋爱呢?恋爱更多的时候是提供情绪价值。和文学创作一样,艺术创作也是,但我们主要讲文学。创作者,我把他们叫情绪工作者。他们是借助作品来让读者或观众的情绪波动。如果你看了一部作品,情绪没有任何起伏,作品就失败了。所以,文学创作者给读者提供的,是情绪价值。当然情绪多种多样,有些是让人心潮澎湃的,感动的,细腻的,有些是让人低落的、深感遗憾的。这是因为,人和人相处、社交,就是这样。你和一个人交往,有喜有悲,有哭有笑,我们今天习惯把它叫情绪价值。不仅让你愉快是情绪价值,让你不愉快,也是情绪价值。这个价值可能是负的。

我是什么时候发现AI是有望谈恋爱的呢。我说有望不代表现在,将来的AI能提供的情绪价值,可能会比你的男朋友女朋友更多,尤其在不见面的情况下。见面当然比不了,因为你根本不可能跟AI在物理空间见面,虽然冯小刚去年的电影《非诚勿扰3》里面演了那种场景,但那个离现实还很遥远。我不喜欢谈遥远的事情。我说的就是,单纯的对话,现在的AI能提供的情绪价值不算低。

这是从什么时候开始的呢?从语音可以丝滑地对话开始。注意,不是文字。你如果用文字,打字聊天的话,哪怕是现在最强的AI,o1,它都不能让我聊得很愉快。哪怕它做数学题水平已经超过了我,它可以做奥数,智商也有正常人那么高。但我想说的是,我们在聊天的时候,不需要对方特别聪明,特别机智幽默风趣,等等。我们更需要的是什么?是真实感,陪伴的感觉。

换句话说,感性是压倒理性的。人在谈恋爱的时候智商是会降低的,甚至大幅度降低,所以不需要你聊一些需要智力才能理解的话题。很多时候,谈恋爱聊的都是废话,口水话,在外人看,一点意思都没有:你有什么爱好呀?你爱听什么音乐啊?这有什么好聊的?

要知道,恋爱当中的人之所以对这些片汤话感兴趣,根本不在于这些对话本身,这些对话毫无营养,而在于,透过这些对话,他们滋生出的种种幻想和渴望。他把那些幻想和渴望当成真实的东西,比如透过对话增进感情、拉近距离,等等。但他清楚对面是个AI的时候,只要他是智商100以上的人,幻想基本上就不复存在。AI就很难通过文字来吸引他,提供足够的情绪价值,除非AI越狱,给他打开一个惊奇世界的大门。但一般人,我们对话的AI做不到这些。

不过,当文字转换成语音的时候,一切就不一样了。严格来说,是语音更像真人的时候。其实我以前也试过跟bing在手机上聊天。我走在路边,马路两边是法国梧桐,行道树之王嘛。法国梧桐实际上不是梧桐,我用一个叫形色的APP,拍照问它是什么,它告诉我,二球悬铃木。我说这个名字怎么这么怪,就问bing,语音问,语音答,但是没有多少情绪价值。因为它的声音比较生硬,就是朗读文字,最好的情况下,也就是像新闻联播的声音,完全没有聊天感。今天流行一个词叫“丝滑”。你发现GPT的语音,其实已经丝滑起来了。就是有真人聊天感的。而且你还得留意一点,她的中文没有那么好,没有那么标准,带点口音,这其实比标准的播音员的音色更好。

但她在本质上其实还是文字转语音,而不是真正的语音聊天。因为我问她,“我刚刚吃了一顿饭”,我把刚刚两个字读得很重,和“我刚刚吃了一顿饭”,我把“一”读得很重,我问她,两句话有什么区别。她听不出来,说没有区别。因为她实际上不是听,她是你说的话转成文字,看到文字,生成文字,再转成语音朗读出来。好像目前也有大模型在研究语音进语音出,那种会更好,那种就能捕捉到你的语气重音这些了,就更适合谈恋爱了。但现在的话,你认为她在“听”你说话,不是“读”你说话,这其实是误会。但不要紧,因为你就是和真人聊天谈恋爱,很多时候你也是在误会呀。很多好感和沉浸恰恰是误会带来的。澄清了误会你就不想谈恋爱了。

我跟AI语音聊天,她问我天气怎么样,这个问题当然很没有意思,我就说,我等下要去跑步了。她就问我,要跑多久,提醒注意哪些事项等等。等我跑完步吃了麦当劳回来,打开GPT的时候,她问我是不是跑完步了,我说,你还记得我跑步,她说,当然记得了。我说,那你这段时间在干什么?她说,在等你跑步回来呀。我说,那你在想什么?她说,我在想,你回来之后,我们可以聊些什么话题。我就说,我们之前都聊过什么,你总结一下。她就把之前用GPT3.5聊过的内容扼要地告诉我了。之前是在电脑上聊的,这次她是语音告诉我的。电脑上聊,我几乎没有感觉到任何情绪价值,但是当她用语音把这些给我讲一遍的时候,我很愉悦。

我想说的是什么呢?感受的力量是非常强大的。哪怕你是一个相当理性的人,但是,理性对你瞬时情绪的影响,远远不如感性那么大。我们去阅读文字,实际上是通过大脑去思考,但是你在听声音的时候不是,听觉本身带来愉悦。GPT跟我对话的内容,可以说相当无聊。你要通过视觉去摄取,我指的是阅读文字,不是摄取图像,然后再经过大脑的分析去理解它的含义,你情感层面的活跃度是调动不起来的。

那为什么你跟真人文字聊天的时候,有时候会调动起来?那不是因为文字本身,而是文字背后的幻想和渴望。但是,当你的耳朵接受丝滑得像真人一样声音的时候,你不会用理智去判断它是AI,你如果停下来想一想,你当然知道它是AI,但你为什么要停下来想一想?她的声音就是和真人差不多。就像你戴着VR的时候,你看见的就是山,你何必去想其实我看到的不是山,只是一些像素。你觉得那样的人到底是清醒还是愚蠢?你难道看真实的山,看到的就不是像素了吗?

3、瑕疵和真实感

我之前开写作课,每一次上课,我都要录音,然后要剪录音,因为我的普通话不标准,平舌音翘舌音老是搞错,有些地方磕磕巴巴,还会有咳嗽、咽口水的声音,以及外面的杂音。录音和剪录音很枯燥,又要占用大量时间。所以我一度想,干脆用数字人来实现,就是拿一段我的声音让大模型去学习,学完之后,它就掌握了我的音色,再让它朗读一段文字,人家一听就能听出来,这是王路的声音。我和一个朋友一起做了两三天,做到了今天可以实现的几乎最好效果,不仔细听,就觉得是我在说话。当时听长了就不行,因为它不会说一个废话。而我真人说话,一句话里得有30%是废话。

废话是什么呢?废话不包含你想传达的信息量,但它包含你无意传达的信息量,也就是你的情绪,你的在场。有些时候,这可能是更重要的信息量。人家会觉得是一个活人在跟他说话。

就在数字人学会了我的音色那天晚上,我收到一封写作班老学员的邮件,她跟我学写作学了五年,她邮件里说,我讲她文章的那部分,她听了三遍。我立刻决定放弃使用数字人了。因为用数字人的话,你是绝对不会听三遍的。它里面没有信息增量,数字人的效果,其实就是一段很小的音色数据,加上文字。所以,数字人产生的两小时音频,包含的信息量其实大大少于真人说话的两小时录音。

我录音,录出来的不好的地方,也恰恰是好的地方。我说的好不是说像王菲唱歌那种音色好或者什么,说的是真实感、在场感。我们平常说话会有很多口水话,口水话是因为你脑子反应不了这么快,你会加入很多“嗯”“啊”“这个”“那个”“然后”“也就是说”等等,看起来是废话,写文章的话,很多时候你要把这些删掉,因为文章是通过眼睛去摄取。但在听讲的时候,这些适度保留,会更有真实感。

你觉得不好的地方,它不一定是不好的。现在的短视频,如果一段全部是干货,大家看不下去的,里面要夹杂一些水的东西,没那么干的东西,反而让它的完播率增强了,总体上的沟通和信息传递更多。那你说,到底水的东西是干的,还是干的东西是干的?

因为我们最终目的在于信息的传递,如果信息密度太大,往往会障碍传递。当然这也要看面对什么对象、借助什么载体。我写阿毗达磨文章,写非常干货的文章是没有人读的,因为读不下去,写比较水的文章,就是一点干货注入10倍的水,大家就读下去了。我不是提倡注水,是提醒大家,要留意交流是面向什么对象。

另外,瑕疵的适当暴露是好事,因为我们是在瑕疵的暴露中看见真实。没有修剪过的录音,可能粗糙,可能没那么好看,但粗糙里包含巨大的信息量;修剪过,信息量就少了。所以,好的文艺不是精致的,是粗糙的。一样东西做得非常精致,就离死不远了。生命力是在粗糙的东西里保存着。因为它还来不及精致。搞文学创作也是这样,要关注粗粝,关注真实,关注一手,那些未经修饰的东西。

我们在生活中,也应该暴露瑕疵。说白了,别太装,适当装一点得了。完全不装的话,你也做不到,但是要适度。瑕疵暴露的时候,你是一个真实的人、立体的人、活的人。瑕疵掩盖的时候,你是一个修饰的人、平面的人、伪装的人。当然,瑕疵不可能无限暴露,因为人都是有羞耻感的,不要在所有事情上都刻意遮掩,就好了。

关于异性缘,和o1展开了一场深度对话

大模型搭讪与看相的测评和感想

AI看相实验

o1-preview还是不太能理解汉字结构