古老板

全网挑战,我敢说我第一

有没有听过三秒克隆声音?
你肯定听过!
图片
但你有没有想过,三秒能克隆什么呢?
难道一个人说话的语调,三秒钟就代表所有的风格吗?这是肯定不可能的。
你看哪一个人说话,不是有时快,有时慢,有时激动,有时平缓?
三秒怎么可能做到完全复刻一个人的声音呢?
我今天来向全网所有的AI工具,包括大厂的工具挑战。
市面上你看到的很多完全模仿的声音,他们只是复刻了一个时间段(三五秒的语气),但做不到做长时间的语音的模仿,比如两分钟。
但,我可以做到。
我先给你看一段声音,这段声音在读我的文章。他是谁?罗胖(罗振宇)。以下提到的大V人名,你都可以去短视频网站上听一下他们的声音,看看是不是一模一样。
不好意思,因为罗胖的语言辨识度很高,所以,我拿他的声音来训练作为我的展示样品。
接下来,我再给你一段声音,你可能不认识,但你可以在抖音上搜索财经林妹妹,你听一下,与她的声音有没有区别,能不能听出来不一样?
我再给一个口播界的牛人,也在奥群呆过,那就是鹤老师。
你听一下,与他的声音有什么区别吗?
最后看一个也是大V,直男财经,你听一下,能听出来区别么?
对的。我就是能够完整复刻一个人的声音,让别人根本听不出来区别。
这是我从去年开始,在研究文案时,就在开始研究的玩意。
而市面上,所有的语音模型,你能用的,包括字节豆包的,你试一下,看看他们能否完整复刻。
你以为这就完了?不!不!不!
这算什么?
复制别人的声音不算什么。
如果我用罗胖的声音去做视频,肯定会被骂死呀,在中国还有可能被认定为侵权。
我研究语音模型,不仅是为了精准复刻一个人的声音,还是为了解决另一个问题。
很多人,有口音,比如我。还有很多人,说话语言很平淡。
但是有些人,语言表达能力就很强。
比如,我扶持的经济学号率性的晓晓,她的语言表达能力就很强,一听就很舒服。做口播帐号,语言没有魅力是不行的。
以上我列出来的大V,其成功之处与他的语言表达能力有极大的关系。
但大部分人不具备这种语言表达能力。
那我研究语言模型的目的是,让普通人哪怕没有这种语言表现力,但却可以通过人工智能生成有强烈感染力、独特个人特质的声音。
这样,就能大幅提高你的自媒媒作品—不管是短视频、播客、还是中视频,包括培训课程的语言魅力。
接下来,我们来看,同样是这段文字,我们通过不同的组合,产生的新奇效果。
这个是罗胖的音色,但语气却是林妹妹的。
这个是林妹妹的音色,但语气却是罗胖的。
这是直男财经的语气,但音色却是鹤老师的。
这是鹤老师的语气,但音色却林妹妹的。
你看,通过排列组合,你就得到一个全新的声音,别人绝对听不出来你模仿了谁。
好了,听一下我的这个视频,这是我的声音吗?是的。
但音调却不是我的。
我的真实声音是这样的。
当然,我都不建议音色不好的朋友去搞一个其他的音调加自己的音色,除非你做大了。
起号阶段,前期做自媒体,特别是我服务的律师领域,就应该选择一个特别有辨识度,特别有感染力的语音来配合,这样,才能让整个视频的口播效果达到最佳。
好的声音,可以极大提升自媒体的效能。
当然,我不是说我比豆包牛。
我要告诉大家,豆包是商用产品,他追求的是稳定输出,因此,他牺牲了完美复刻和深度训练,而选择了稳定性。
而我们目前的产品,暂时无法网络商用,因为还会出错,输出一段音频后,要边听边重新输出(输出错的那一句),会偶有吞字,发音错误(多音字),阿拉伯数字错误(比如1900元,读成一九零零元,这个需要事前文案处理,防止偶发错误),因此他生成时,需要人工介入。
如果生成一个三千字语音,大概能有十几处错误。
人工介入也很简单,读错的一句,马上重新生成这一句就好了,一般改个错,三四秒。
但得听一遍才行。
豆包这种商用级产品,稳定度更高,但也会有错,且有错了,无法逐句改变,需要重新生成,还要费用。
但它出错的概率低于我们当下的模型,这是个事实。
从生成的质量,以及多样性方面,我目前没有看到谁能生成长篇大段的文字,还能保持这种模仿效果。
创造新音色这一块,目前也仅有海外的一家企业能做,但收费奇贵,一月一百多美元。
我们要复刻客户的声音,需要半小时的音频,且要有文字稿,需要人工逐句挑出好的音频来训练,并且训练的时间超长,用4090训练,都要六个小时。
然后帮助客户做成各种不同风格的语音,又要几个小时,会给到十种以上的声音效果给客户挑。
我光是语调库,就建立了三百个。各种不同人的语调都有。并且以后还要建立更多。
目的是什么?我认为复制声音,只是少数人的需要,是那些语言感染力强的人。大多数普通人的需求,才是重要的。
这是普通人做自媒体最大的障碍,虽然很多人用上了数字人,但是,声音却很差,没有感染力。怎么办?
我来解决啊。
你认为晓晓音调好,没问题,给你模仿一下。
所有市面上的大模型,不经改造,是做不到这个效果的。
道理如我文前所说,三秒怎么可能复刻呢?
我当然也是用了大模型,只不过我找技术人员研究代码,重新改写了。
这个语音模型的能力,是我开发律师自媒体服务产品时构建的,光研发就花了四个月的时间。
好了,现在这个服务,除了为律师服务,还可以向所有人开放。
如果想完整复刻你的声音,读一篇文章(给文字给我),用你要的语气读,三十分钟。读错了,就重新读,我的人会剪辑掉错误的句子的,保持环境安静,用好的降噪麦读就好了。
复刻一次的费用:600元(一次性)
要接上别的语调:300元(10个选择,一次性))
如果要一个完全不一样的语音,(非自己音色,全新的融合音调音色)高度辨识度的,强感染力的,告诉我们你要用来做什么?
读小说?搞播客?还是短视频?中视频?
我们帮你挑出10个让你选。500元(一次性)
最后你怎么用呢?
我们向律师收的费用是这个的一半,甚至包含在套餐中,接近于免费,为什么?因为语音模型在我们这里。
而这个服务,是将语音模型发给你,你安装好后,我们远程帮助你安装模型,教你怎么使用,怎么改错。
这样,以后,你就可以直接自己在家使用了。
这个语音模型对电脑要求不高,随便有个显卡就能生成。
我们给律师服务,是我们手动生成,手动改错。律师不需要管这些事务。
这只是我们围绕律师业务研发出来的一个产品之一。
昨天说过了,公众号也是历时半年才研发出来的。这个产品也一样,我这半年多,主要精力就是研发各种新产品。
你可以全网比较,到各种地方下载声音模型,你看看能否做到我们的效果。
我可以肯定地说,全网我第一。
我写这篇文章,是在做广告,是在说明我为律师自媒体业务中所有的研发,以及我们的产品优点。
因为研发的东西太多,直播难以讲清楚,我还是决定写文章说明清楚吧。
相比起直播, 我更愿意写文章。
接下来,还会有几个产品的研发要向大家说明。
比如短视频文案创作系统,比如小红书小绿书创作系统;比如数字人、比如剪辑技术、比如直播辅导服务等等。每一个项目,都经历过漫长时间的研发,都以服务一个行业的从业者为目标。
不急,讲完大家再决定要不要合作一起来推广。
业务联系:Glinda989