程序员老鬼

字节发布了同声传译模型:Seed LiveInterpret 2.0,中英双向端到端同传,延迟为2-3秒

今天看到字节发布了Seed LiveInterpret 2.0,兄弟我当时的反应就一个字:爆!

先亮结论,这个模型基本可以说已经无限接近真人同声传译了,尤其是中英互译这个方向,翻译准确、语气自然、延迟还低,我是有点被惊艳到了。

整个模型是端到端的语音到语音翻译,不再是传统那种“语音→文本→翻译→语音”的流程,而是直接听完说完,一气呵成。而且效果非常稳,语音首字延迟大概2.2秒,语音到语音完整输出也就是2.5秒左右,和专业同传只差一小步!

翻译评分呢?官方说BLEU分达到了66.3,注意,是中英双向互译都能到66.3。这啥概念?我查了下,职业同传BLEU也不过70左右,Seed这个结果基本已经接近了。

我看演示的时候注意到几个细节,真的让我眼前一亮:

第一个细节就是音色克隆的准确度太高了!演示里女声说话的情绪、停顿、语调,翻译成英文的时候居然都保留住了,而且是另一种语言但同一个人的感觉,这很离谱。这个不是简单的TTS合成,是带情绪理解的音色迁移,像是声音“穿越”语言之后还保持原汁原味。

Image

第二个让我服的是它处理非流利语音和多人对话的能力。有人说话磕巴、有杂音、有停顿,Seed依然能顺利完成翻译,而且不会乱跳段,不会提前打断,整个节奏非常自然。而且演示里还有多人轮流发言的会议场景,不同音色之间切换、识别,Seed都能处理好,实在太强了。

Image

第三个点,它还支持长语音输入。不像有些产品只能处理30秒以内的对话,Seed可以做分钟级的长句子连续翻译。这意味着以后开国际会议、远程教学都可以直接套用,一台电脑+一个麦克风,就能全球开讲!

我看到这些效果的时候,脑海里已经想出了一堆使用场景:

比如直播带货,国内主播讲解,翻译成英文实时输出,海外用户也能听懂;

比如跨国视频会议,不管谁发言,Seed都能自动翻译并保持音色一致;

比如教育场景,外教讲课中文同传,或者中文老师授课实时英文输出;

再比如做AI数字人,让角色支持多语种语音说话,用Seed配音克隆声音和情绪,一次搞定多语言内容。

更厉害的是它的语言适应性,演示里展示了对诗词、美食文化、绕口令这种文化背景非常强的内容,居然也能自然翻译,没出太大错。我之前用一些翻译模型测试这些场景,全都卡壳,要么意译过头,要么直译到变味。Seed处理得相当顺滑,确实厉害。

那性能数据我整理了下给大家参考:

  • 中英文双向语音互译
  • BLEU得分66.3(非常接近人类同传)
  • 语音到文本首字延迟:2.21秒
  • 语音到语音首字延迟:2.53秒
  • 情绪识别 + 音色克隆:支持
  • 多人对话/非标准发音:支持
  • 长时段语音翻译:支持

这个组合起来,就不是一个实验室模型,而是随时可以落地部署的真实系统了。我很期待字节是不是打算把它塞进飞书会议、火山翻译、甚至抖音的直播工具里,要是真这样,国外主播想直播卖货都要来抖音借力了。

不过话说回来,目前还没看到Seed LiveInterpret 2.0的API文档或公开入口,我猜测初期可能会以企业客户为主,个人用户要么等产品集成,要么等开放SDK。

讲真,如果这个模型能开放本地部署或云API接口,咱们下一步就可以搞个“实时翻译直播间”,一边讲中文,一边输出多语言同步音频,边讲边配音,轻轻松松整合多语言市场!

对了,突然想到,之前Meta出的SeamlessM4T和Google的Translatotron虽然也搞了端到端翻译,但都在“文本为核心”的逻辑里绕圈圈。Seed这个思路明显不一样,更接地气,更敢直接落地,不玩概念,直接就是工程实践。

感兴趣的朋友可以去关注下这块的发展,我后续要是拿到体验版或者接口权限,会搞一篇深测,把它跟几个同类模型像SeamlessM4T、Whisper + TTS、VITS搞个横评。

现在AI翻译领域的战火已经烧到“听说同步+情绪复刻”的地步了,谁能搞定端到端高质量翻译+实时性,就能真正重构人类跨语言沟通的方式。

这波Seed LiveInterpret 2.0,真的有点东西,封神预定!

体验地址:console.volcengine.com/auth/login?red
技术报告:https://lf3-static.bytednsdoc.com/obj/eden-cn/bdeh7uhpsuht/Seed%20LiveInterpret%202.0.pdf

-END-

我为大家打造了一份RPA教程,完全免费:https://www.songshuhezi.com/rpa.html

最后给大家分享一份不错的副业资料,点击下方公众号,回复关键字: 副业 领取,也可以链接我领取,微信:hls404