跟着看了几集确实不错后来因为 M1 Pro 跑 Whisper 有点慢,而且我那段时间在玩 Stable Diffusion 出图,直接配置了台带 4090 的电脑,配置了几个脚本,下载、转文字、翻译一条龙,整个流程速度快了许多,每天只要下班回去之后找到生肉资源供老婆大人观赏就行了。直到一天上班的时候老婆闲着无聊,想自己操作操作,但那不知道怎么怎么搞那几个脚本,于是和我说:「你要不要做一个有界面的产品,不仅我可以用,别人也可以用。或许还能赚点奶粉钱呢。」我觉得有道理,反正那段时间 AI 产品如雨后春笋般冒出来,我也手痒痒想做一个,于是一个新的产品,就诞生了。在产品形态上,还要做选择题。在 PC 端和手机端之间——选择了 PC 端,字幕编辑、翻译这种内容,大多数都是长视频的需求,在 PC 端的编辑会更加符合大部分使用场景。在客户端和网页端之间——选择了网页端,客户端不仅需要适配 Win 和 Mac 两个系统,还需要应对相同系统不同的版本,而且我也受够了 Whisper 的龟速和各种模型的限制,不如直接把运算都交给云端,让无论什么电脑配置的用户都可以顺利使用。这个产品叫什么好呢?就叫快转字幕吧。▍关于《快转字幕》那这个产品有什么优势?首先我们是站在巨人「OpenAI 的 Whisper 模型」的肩膀上,它代表了非常强大的底层引擎,支持非常多的语言,而且准确率很高,特别在多语言混合的情况下。这就是我们跟大厂中厂竞争的底气。但是这个引擎是不完美的,我们要把这个引擎发挥到它的百分之二百的功力。我们做了下面这些事情:
纯净识别
Whisper 不仅识别了人的语音,还有音视频里一些背景音,比如路人的声音、音乐、甚至鸣笛声、碰撞的声音都有可能会被识别,或者出现「幻觉」的情况,使用「纯净识别」可以去除掉噪音,并且把声音音量对齐之后,再送到 Whisper 去识别。转录头文字 D 的片段,前面一大段英文全都是幻听
智能重排
许多的音视频转字幕应用都会有一个问题,在转录成文字的时候,把大段的文字放在了同一时间内,导致同屏出现的字幕过长,影响观看节奏。正确和合理的句子分割才能给观众带来好的观看感受,所以我们请朋友们分析了中日英西法 5 种语言的基本逻辑,使用小模型做语义识别,兼顾了性能和效果,上线了 AI 高级重排功能,支持对这 5 种语言的智能分句,其他的语言上线了普通分句功能,无论什么语言都能获得还不错的分句效果。
带有上下文的 AI 翻译
现在很多翻译工具上都是简单的一句对一句进行翻译,但是经常很多词语都在不同的场景下有不同的意思,在大模型出来之前,翻译效果一直都不够好。现在有了大模型,问题就变成怎么样调优和控制输出。我们做了很多努力,包括使用特制的 prompt,以及增加重试、兜底等方案,能现在能保证有上下文,并且能出非常准确的翻译。后面还增加了二次润色校对,推出这个 AI Plus 的翻译,最终出来这个效果甚至比真人翻译还要好。