惭愧,我居然被一个开源项目给骗了。
你好呀,我是歪歪。
来,先听个语音,我让一个妹子帮我录的:
这段语音的内容是我上一篇文章的最后一段话。
歪师傅是个技术博主,主要分享正经的开发技术,偶尔分享生活,核心目的是搞点流量来,方便发发广告,吃瓜只是随手的事儿。
这段语音背后其实是暗藏玄机的,我让 Max 同学听了好几遍她也没听出来。
如果你也没听出来,可以尝试再听一次,给自己一个机会。
读这段内容的人,哦,不,读这段内容的声音是 AI。
也不对,稍微正确一点的描述应该是:这段声音是由 AI 生成的。
不知道你听出来没。
可以投个票大家看看,另外,由于本文标题其实也带有引导性,所以你结合标题可能就已经带着怀疑的态度去听了。
咱们就是说投票的话就诚实一点,没听出来又不丢人,歪师傅第一次听的时候也没听出来。
然后再给你来一个男生的版本:
而要生成上面这样的内容,非常之简单,打开这个网站就行:
https://huggingface.co/spaces/Dzkaka/ChatTTS
当然了,首先你得掌握相对科学的冲浪方式,然后才能打开这个网站。
网站上的几个重点参数简单介绍一下:
Input Text : 需要转换的文本,支持中文和英文混杂 Refine text : 是否对文本进行口语化处理 Audio Seed : 配置音色种子值,不同种子对应不同音色 Text Seed : 配置文本种子值,不同种子对应不同口语化风格 Output Text : 口语化处理后生成的文本
还有一些其他的参数,可以控制音频的情感,具体可以参考这个官方说明:
说真的,对于“配音”这块,我之前一直停留在 AI 味儿特别浓的印象中,就是那种一耳就能听出来:这是 AI。
这些配音,以“注意看这个男人叫小帅”为首,充斥在大量的短视频中,防不胜防。
包括这篇文章,你拉到最开始,标题的附近,有个“耳机”的标识,你点一下,也会给你朗读,但是一听也是浓浓的 AI 味儿。
但是前段时间,我接到一个某某保险的营销电话,改变了我的刻板印象。
一接通就是一个妹子非常急迫的一句话:联系到您可真是太不容易了,你可能是太忙了。巴拉巴拉巴拉~
但是这句话,非常自然,我第一次听到的时候以为是真的客服,听到她开始营销的话术,我就挂断了。
隔了几天,我又接到了这个电话。
开头第一句:联系到您可真是太不容易了,你可能是太忙了。
语气、腔调、内容、音色,和前一通电话一模一样,我就觉得有点好奇,于是在她说话的同时,我问:你是机器人吗?
对方没有回复,继续自顾自的说话。
于是我接着问:你们是哪个保险呢?
对方还是没有回复。
在她介绍的时候,我突然说了四个字:我要投诉。
对方立马就像触发了关键词一样,开始道歉,并挂断了电话。
此时我已经确定对面就是个机器人了。
我之前也接过机器人打的营销电话,很容易听出来,但是这次这个确实有点骗过了我。
他们的内容,都和我前面放的音频一样,非常的逼真。
技术其实早就已经发展到以假乱真的阶段了,只是我比较后知后觉而已。
说回到前面的网站,这其实是一个开源项目的在线体验网站,这个叫做 ChatTTS 的项目目前已经有 27.2K 的 Star 了。
https://github.com/2noise/ChatTTS
歪师傅拿到这个项目的第一反应,和大多数人一样:能不能训练出一个我自己的声音玩玩,这样多刺激啊?
但是,你想想,如果一个好事之徒,带着某些不可告人的目的,真的训练出了你的声音,那不是更加刺激?
所以,这一点是不可以的:
如果你只是想体验一下,那么音色,你可以通过网站上的音色种子去设置。
比如我的音频女生版本就用的默认的宇宙之终极答案,42。男生版,就用的 1001。
中英文夹杂的表现也是非常不错的:
可以看到在 ooutput text 里面生成了 [uv_break] 这样的东西,这个代表语气中的停顿,除此之外还有 [laugh]:
更多的介绍,你可以看看 B 站的这个视频,
https://www.bilibili.com/video/BV1zn4y1o7iV/
反正就是真的很强。
还有高手
在我觉得 ChatTTS 已经天下无敌的时候,另外一个在 github 上有 28.7K star 的项目又跳入到了我的视野中:
https://github.com/RVC-Boss/GPT-SoVITS
这个项目似乎才是 TTS 领域天花板般的存在,
因为,它可以训练任何你想要的声音,只要你有 5s 的声音样本就行。
是的,大胆的说出你的想法:我要克隆一个自己的声音。
这里也是给大家推荐两个 B 站大学的地址吧。
首先是官方的视频地址:
https://www.bilibili.com/video/BV12g4y1m7Uw/
然后是 Jack-Cui 大佬针对小白做的手摸手运行视频:
https://www.bilibili.com/video/BV1WC411W79t/
基本上只需要十分钟,然后用一段 30s~1min 的音频,就能使用 AI 克隆出你想要的声音,从环境部署到训练完成,一键式操作,非常手摸手。
然而...
我并没有运行起来,因为刚好赶上 OpenBayes 做系统升级:
如果你感兴趣的话,你可以去看看。
使用 OpenBayes 需要注册,你可以用我的邀请链接:
https://openbayes.com/console/signup?r=CHTNTCQ7mTn_gnXt
这样,我们就各自能有 60 分钟 RTX 4090 的使用时长,永久有效,香的一比。
在摸索 GPT-SoVITS 的时候,我又看到了另外一个项目,也是很吊:
https://github.com/fishaudio/fish-speech
可以去这个网站上玩一下:
https://fish.audio/zh-CN/text-to-speech/
这个模型经过 15 万小时的数据训练,可以搞定中英日三种语言,音频输出接近人类水平,对中文支持更是牛的一笔。
去 B 站大学上搜关键字“fish-speech”,相关视频也是非常多的:
反正在 TTS 这个领域下,竞争是极其激烈的。
这对于我们用户来说也挺好的,毕竟一枝独秀不是春,百花齐放才是春满园。
哦,对了,在这种“百花齐放”的时候,记得一定要在自己“相亲相爱一家人”的微信群里面,给上了年纪的亲友们科普一下:语音也是可以作假的,一定要谨防诈骗。
好了,本文的技术部分就到这里了。
下面这个环节叫做[荒腔走板],技术文章后面我偶尔会记录、分享点生活相关的事情,和技术毫无关系。我知道看起来很突兀,但是我喜欢,因为这是一个普通博主的生活气息。
荒腔走板
最近在下班路上,老是听《脱口秀大会》的音频,然后周末就去听了一场线下脱口秀。
脱口秀线上和线下还真的差距挺大的,至少线下的尺度大了很多,但是又在一个合理且搞笑的范围内,加上演员们的风格迥异,肢体语言惟妙惟肖,还真是挺有意思的。
我不能给你讲演员们的段子,因为开场的时候就说了:这些段子要保密,有的段子这些演员要用一辈子。
虽然是一种调侃的方式,但是我还是要尊重演员们的知识产权。
如果你所在的城市也有线下的脱口秀表演的话,恰好你又对这个艺术形态感兴趣,可以去听听。
脱口秀是一门“冒犯”的艺术,如果其中一些段子让你觉得被冒犯了,笑一笑,就过去吧。
就像是呼兰说的:笑不是生活的解药,笑是生活的麻药。
有时候去麻一麻自己也挺舒服的。
这是我和 Max 同学第三次看线下脱口秀,每次都是不同的厂牌。
但是 Max 同学坚持认为只有两次,对于第一次完全没有任何映像。
于是我拿出手机,打开我的公众号,输入“脱口秀”,就找到了第一次的记录,是 2021 年 7 月的时候。
那天听到的段子她完全忘记了,包括她当时给我说的她觉得那个女生讲的特别好,她也忘记了。她甚至忘记了那天有一个女生的表演,但是她记得那天她特意买了一杯奶茶,结果在门口不让带进去,她很生气。
所以,我之前有句话是怎么说的?
记录,抵抗遗忘。
·············· END ··············
推荐👍:Spring官方竟然真的支持Bean的异步初始化了!
推荐👍:哎,被这个叫做at least once的玩意坑麻了。
你好呀,我是歪歪。我没进过一线大厂,没创过业,也没写过书,更不是技术专家,所以也没有什么亮眼的title。
当年高考,随缘调剂到了某二本院校计算机专业。纯属误打误撞,进入程序员的行列,之后开始了运气爆棚的程序员之路。
说起程序员之路还是有点意思,可以点击蓝字,查看我的程序员之路。