字节发布了同声传译模型:Seed LiveInterpret 2.0,中英双向端到端同传,延迟为2-3秒
今天看到字节发布了Seed LiveInterpret 2.0,兄弟我当时的反应就一个字:爆!
先亮结论,这个模型基本可以说已经无限接近真人同声传译了,尤其是中英互译这个方向,翻译准确、语气自然、延迟还低,我是有点被惊艳到了。
整个模型是端到端的语音到语音翻译,不再是传统那种“语音→文本→翻译→语音”的流程,而是直接听完说完,一气呵成。而且效果非常稳,语音首字延迟大概2.2秒,语音到语音完整输出也就是2.5秒左右,和专业同传只差一小步!
翻译评分呢?官方说BLEU分达到了66.3,注意,是中英双向互译都能到66.3。这啥概念?我查了下,职业同传BLEU也不过70左右,Seed这个结果基本已经接近了。
我看演示的时候注意到几个细节,真的让我眼前一亮:
第一个细节就是音色克隆的准确度太高了!演示里女声说话的情绪、停顿、语调,翻译成英文的时候居然都保留住了,而且是另一种语言但同一个人的感觉,这很离谱。这个不是简单的TTS合成,是带情绪理解的音色迁移,像是声音“穿越”语言之后还保持原汁原味。
第二个让我服的是它处理非流利语音和多人对话的能力。有人说话磕巴、有杂音、有停顿,Seed依然能顺利完成翻译,而且不会乱跳段,不会提前打断,整个节奏非常自然。而且演示里还有多人轮流发言的会议场景,不同音色之间切换、识别,Seed都能处理好,实在太强了。
第三个点,它还支持长语音输入。不像有些产品只能处理30秒以内的对话,Seed可以做分钟级的长句子连续翻译。这意味着以后开国际会议、远程教学都可以直接套用,一台电脑+一个麦克风,就能全球开讲!
我看到这些效果的时候,脑海里已经想出了一堆使用场景:
比如直播带货,国内主播讲解,翻译成英文实时输出,海外用户也能听懂;
比如跨国视频会议,不管谁发言,Seed都能自动翻译并保持音色一致;
比如教育场景,外教讲课中文同传,或者中文老师授课实时英文输出;
再比如做AI数字人,让角色支持多语种语音说话,用Seed配音克隆声音和情绪,一次搞定多语言内容。
更厉害的是它的语言适应性,演示里展示了对诗词、美食文化、绕口令这种文化背景非常强的内容,居然也能自然翻译,没出太大错。我之前用一些翻译模型测试这些场景,全都卡壳,要么意译过头,要么直译到变味。Seed处理得相当顺滑,确实厉害。
那性能数据我整理了下给大家参考:
中英文双向语音互译 BLEU得分66.3(非常接近人类同传) 语音到文本首字延迟:2.21秒 语音到语音首字延迟:2.53秒 情绪识别 + 音色克隆:支持 多人对话/非标准发音:支持 长时段语音翻译:支持
这个组合起来,就不是一个实验室模型,而是随时可以落地部署的真实系统了。我很期待字节是不是打算把它塞进飞书会议、火山翻译、甚至抖音的直播工具里,要是真这样,国外主播想直播卖货都要来抖音借力了。
不过话说回来,目前还没看到Seed LiveInterpret 2.0的API文档或公开入口,我猜测初期可能会以企业客户为主,个人用户要么等产品集成,要么等开放SDK。
讲真,如果这个模型能开放本地部署或云API接口,咱们下一步就可以搞个“实时翻译直播间”,一边讲中文,一边输出多语言同步音频,边讲边配音,轻轻松松整合多语言市场!
对了,突然想到,之前Meta出的SeamlessM4T和Google的Translatotron虽然也搞了端到端翻译,但都在“文本为核心”的逻辑里绕圈圈。Seed这个思路明显不一样,更接地气,更敢直接落地,不玩概念,直接就是工程实践。
感兴趣的朋友可以去关注下这块的发展,我后续要是拿到体验版或者接口权限,会搞一篇深测,把它跟几个同类模型像SeamlessM4T、Whisper + TTS、VITS搞个横评。
现在AI翻译领域的战火已经烧到“听说同步+情绪复刻”的地步了,谁能搞定端到端高质量翻译+实时性,就能真正重构人类跨语言沟通的方式。
这波Seed LiveInterpret 2.0,真的有点东西,封神预定!
-END-
我为大家打造了一份RPA教程,完全免费:https://www.songshuhezi.com/rpa.html