why技术

惭愧,我居然被一个开源项目给骗了。

你好呀,我是歪歪。

来,先听个语音,我让一个妹子帮我录的:

这段语音的内容是我上一篇文章的最后一段话。

歪师傅是个技术博主,主要分享正经的开发技术,偶尔分享生活,核心目的是搞点流量来,方便发发广告,吃瓜只是随手的事儿。

这段语音背后其实是暗藏玄机的,我让 Max 同学听了好几遍她也没听出来。

如果你也没听出来,可以尝试再听一次,给自己一个机会。

Image

读这段内容的人,哦,不,读这段内容的声音是 AI。

也不对,稍微正确一点的描述应该是:这段声音是由 AI 生成的。

不知道你听出来没。

可以投个票大家看看,另外,由于本文标题其实也带有引导性,所以你结合标题可能就已经带着怀疑的态度去听了。

咱们就是说投票的话就诚实一点,没听出来又不丢人,歪师傅第一次听的时候也没听出来。

然后再给你来一个男生的版本:

而要生成上面这样的内容,非常之简单,打开这个网站就行:

https://huggingface.co/spaces/Dzkaka/ChatTTS

Image

当然了,首先你得掌握相对科学的冲浪方式,然后才能打开这个网站。

网站上的几个重点参数简单介绍一下:

  1. Input Text : 需要转换的文本,支持中文和英文混杂
  2. Refine text : 是否对文本进行口语化处理
  3. Audio Seed : 配置音色种子值,不同种子对应不同音色
  4. Text Seed : 配置文本种子值,不同种子对应不同口语化风格
  5. Output Text : 口语化处理后生成的文本

还有一些其他的参数,可以控制音频的情感,具体可以参考这个官方说明:

Image

说真的,对于“配音”这块,我之前一直停留在 AI 味儿特别浓的印象中,就是那种一耳就能听出来:这是 AI。

这些配音,以“注意看这个男人叫小帅”为首,充斥在大量的短视频中,防不胜防。

包括这篇文章,你拉到最开始,标题的附近,有个“耳机”的标识,你点一下,也会给你朗读,但是一听也是浓浓的 AI 味儿。

但是前段时间,我接到一个某某保险的营销电话,改变了我的刻板印象。

一接通就是一个妹子非常急迫的一句话:联系到您可真是太不容易了,你可能是太忙了。巴拉巴拉巴拉~

但是这句话,非常自然,我第一次听到的时候以为是真的客服,听到她开始营销的话术,我就挂断了。

隔了几天,我又接到了这个电话。

开头第一句:联系到您可真是太不容易了,你可能是太忙了。

语气、腔调、内容、音色,和前一通电话一模一样,我就觉得有点好奇,于是在她说话的同时,我问:你是机器人吗?

对方没有回复,继续自顾自的说话。

于是我接着问:你们是哪个保险呢?

对方还是没有回复。

在她介绍的时候,我突然说了四个字:我要投诉。

对方立马就像触发了关键词一样,开始道歉,并挂断了电话。

此时我已经确定对面就是个机器人了。

我之前也接过机器人打的营销电话,很容易听出来,但是这次这个确实有点骗过了我。

他们的内容,都和我前面放的音频一样,非常的逼真。

技术其实早就已经发展到以假乱真的阶段了,只是我比较后知后觉而已。

说回到前面的网站,这其实是一个开源项目的在线体验网站,这个叫做 ChatTTS 的项目目前已经有 27.2K 的 Star 了。

https://github.com/2noise/ChatTTS

Image
Image

歪师傅拿到这个项目的第一反应,和大多数人一样:能不能训练出一个我自己的声音玩玩,这样多刺激啊?

但是,你想想,如果一个好事之徒,带着某些不可告人的目的,真的训练出了你的声音,那不是更加刺激?

所以,这一点是不可以的:

Image

如果你只是想体验一下,那么音色,你可以通过网站上的音色种子去设置。

比如我的音频女生版本就用的默认的宇宙之终极答案,42。男生版,就用的 1001。

中英文夹杂的表现也是非常不错的:

Image

可以看到在 ooutput text 里面生成了 [uv_break] 这样的东西,这个代表语气中的停顿,除此之外还有 [laugh]:

Image

更多的介绍,你可以看看 B 站的这个视频,

https://www.bilibili.com/video/BV1zn4y1o7iV/

Image

反正就是真的很强。

还有高手

在我觉得 ChatTTS 已经天下无敌的时候,另外一个在 github 上有 28.7K star 的项目又跳入到了我的视野中:

https://github.com/RVC-Boss/GPT-SoVITS

Image

这个项目似乎才是 TTS 领域天花板般的存在,

因为,它可以训练任何你想要的声音,只要你有 5s 的声音样本就行。

是的,大胆的说出你的想法:我要克隆一个自己的声音。

这里也是给大家推荐两个 B 站大学的地址吧。

首先是官方的视频地址:

https://www.bilibili.com/video/BV12g4y1m7Uw/

Image

然后是 Jack-Cui 大佬针对小白做的手摸手运行视频:

https://www.bilibili.com/video/BV1WC411W79t/

Image

基本上只需要十分钟,然后用一段 30s~1min 的音频,就能使用 AI 克隆出你想要的声音,从环境部署到训练完成,一键式操作,非常手摸手。

然而...

我并没有运行起来,因为刚好赶上 OpenBayes 做系统升级:

Image

如果你感兴趣的话,你可以去看看。

使用 OpenBayes 需要注册,你可以用我的邀请链接:

https://openbayes.com/console/signup?r=CHTNTCQ7mTn_gnXt

这样,我们就各自能有 60 分钟 RTX 4090 的使用时长,永久有效,香的一比。

在摸索 GPT-SoVITS 的时候,我又看到了另外一个项目,也是很吊:

https://github.com/fishaudio/fish-speech

Image

可以去这个网站上玩一下:

https://fish.audio/zh-CN/text-to-speech/

Image

这个模型经过 15 万小时的数据训练,可以搞定中英日三种语言,音频输出接近人类水平,对中文支持更是牛的一笔。

去 B 站大学上搜关键字“fish-speech”,相关视频也是非常多的:

Image

反正在 TTS 这个领域下,竞争是极其激烈的。

这对于我们用户来说也挺好的,毕竟一枝独秀不是春,百花齐放才是春满园。

哦,对了,在这种“百花齐放”的时候,记得一定要在自己“相亲相爱一家人”的微信群里面,给上了年纪的亲友们科普一下:语音也是可以作假的,一定要谨防诈骗。

好了,本文的技术部分就到这里了。

下面这个环节叫做[荒腔走板],技术文章后面我偶尔会记录、分享点生活相关的事情,和技术毫无关系。我知道看起来很突兀,但是我喜欢,因为这是一个普通博主的生活气息。

荒腔走板

Image

最近在下班路上,老是听《脱口秀大会》的音频,然后周末就去听了一场线下脱口秀。

脱口秀线上和线下还真的差距挺大的,至少线下的尺度大了很多,但是又在一个合理且搞笑的范围内,加上演员们的风格迥异,肢体语言惟妙惟肖,还真是挺有意思的。

我不能给你讲演员们的段子,因为开场的时候就说了:这些段子要保密,有的段子这些演员要用一辈子。

虽然是一种调侃的方式,但是我还是要尊重演员们的知识产权。

如果你所在的城市也有线下的脱口秀表演的话,恰好你又对这个艺术形态感兴趣,可以去听听。

脱口秀是一门“冒犯”的艺术,如果其中一些段子让你觉得被冒犯了,笑一笑,就过去吧。

就像是呼兰说的:笑不是生活的解药,笑是生活的麻药。

有时候去麻一麻自己也挺舒服的。

这是我和 Max 同学第三次看线下脱口秀,每次都是不同的厂牌。

但是 Max 同学坚持认为只有两次,对于第一次完全没有任何映像。

于是我拿出手机,打开我的公众号,输入“脱口秀”,就找到了第一次的记录,是 2021 年 7 月的时候。

那天听到的段子她完全忘记了,包括她当时给我说的她觉得那个女生讲的特别好,她也忘记了。她甚至忘记了那天有一个女生的表演,但是她记得那天她特意买了一杯奶茶,结果在门口不让带进去,她很生气。

所以,我之前有句话是怎么说的?

记录,抵抗遗忘。

··············  END  ··············

Image

推荐👍:Spring官方竟然真的支持Bean的异步初始化了!

推荐👍:哎,被这个叫做at least once的玩意坑麻了。

推荐👍:五年前,我写错了一道面试题。

推荐👍:线程池参数请不要这样设置。

推荐👍:一个普通程序员磕磕绊绊,又闪闪发光的十年。

你好呀,我是歪歪。我没进过一线大厂,没创过业,也没写过书,更不是技术专家,所以也没有什么亮眼的title。

当年高考,随缘调剂到了某二本院校计算机专业。纯属误打误撞,进入程序员的行列,之后开始了运气爆棚的程序员之路。

说起程序员之路还是有点意思,可以点击蓝字,查看我的程序员之路。