聊聊豆包输入法(内测版)和语音输入法
所以我来评价豆包输入法内测版也挺合适。
豆包输入法我用了一个多月,现在是我的主力语音输入法。iPhone 就配置了俩键盘:微信和豆包。打字用微信输入法,语音用豆包输入法。在我的个人场景下,豆包识别率和微信非常接近,都有大模型加持,拉不开大的差距。
那为什么我会用豆包主力语音输入呢?
主要原因是,微信语音输入这孩子老老实实的,iPhone 每进行一次语音输入,都要跳转并拉起一次过渡页面,临时激活录音进程(安卓应该没这毛病),很烦对不对?豆包语音输入比较 hack,允许设置为录音进程常驻后台,相当于打开默认半小时的录音进程,在此期间语音输入不用再拉起过渡页面。
次要原因是,因为高频用语音和豆包交互,对于豆包在大模型加持下的语音识别能力有很强的信任感,品牌光环强劲。这也是豆包输入法的核心竞争力。
最后,豆包输入法在语音输入交互上,相对微信输入法有一些细微但舒适的优化,同时也会对语气助词进行细微的润色。
那么豆包输入法有什么缺点呢?
有的,键盘输入体验稀烂!稀烂!毕竟当前是 0.11 内测版。此外标点符号用得稀烂,尤其滥用句号。
所以我的个人习惯是,大段大段的语音输入用豆包输入法,然后再切到微信输入法调整文本细节。对 “大段大段” 的定义是,经常语音输入五六百字的一条长微博。
如果坐在电脑前,我还是习惯敲键盘的,思考和书面表达衔接更连贯。但躺在床上,靠在沙发上,坐在车里和餐馆里,尤其是旅行中一边走一边发微博的时候,必然语音输入。你看到我的微博发布于 iPhone 客户端,那就一定是语音输入。
这件事,不习惯语音输入的人会比较惊讶,我倒是总结出了一些规律。
语音输入法最大的障碍是,口语输入和书面输入之间是有 gap 的。
口语输入会有更多语气助词,更多的重复表达,更多的颠三倒四,更多的废话,表达是一坨黏糊糊但作为语音又能轻易理解的史莱姆。
书面输入则清爽干净,有更好的条理与礼仪。
因此,语音输入如果不加节制,转换成文本以后在书面表达场合会很难堪。微信那种简短的沟通场合还好,场合稍微正式一点或者文本长一点,史莱姆就跳出来了……
如果你想战胜史莱姆,必须在口语输入时加入更多书面语言的思维方式。一旦书面表达的构思跟不上口述速度(也包括不能一次成型,必须来回修改),便面临「停顿」——在口述时停下来思考怎么表达得体。但我们日常说话时很少停顿,用废话和颠三倒四来填充空隙,一旦多次停顿,节奏乱了,口述就卡得说不下去了。
这就是口语输入和书面输入之间的 gap。
对此,有人说能不能用大模型的能力对口语润色为书面语言呢?
很难。
前面说过,豆包输入法已经做了 “细微的润色”,一旦尺度超过细微,发出来恐怕就不像是自己写的了。
而我也用了一点时间适应,才能做到很少修改,连贯/缓慢/准确地用口语输入书面语言,“构思书面表达” 衔接 “口述” 相当连贯,普通人未必能这么流畅,至少对一部分普通人来说很难。此处没有对错好坏的区别,就是挑人,特别挑人。打字越快的人语音输入也越厉害(我一小时键盘能敲 2000-3000 字微博),构思书面表达的速度飞快,接得上口述的速度。
但即便我用口语输入书面语言很强,还是会面临难以克服的两个问题。
第一,需要深度思考的内容,比如这篇公众号,我没法用语音输入,卡得说不下去。“思考” 和 “说话” 如果不能连贯地衔接在一起,边想-边说-别停,而是分成两段接龙,这不行的,甚至自己说话也会干扰和打断深度思考——这真是一个有趣的洞察。思考越深,越需要沉浸,脑子里的声音一旦说出口就成了思考的噪音。
第二,我用语音输入最多只能写一千字。超过一千字会对内容结构提出更高的要求,这种思考深度会被语音输入不断地干扰打断。
所以一开始才说,我很适应用语音输入法进行 “一千字以内的轻创作”。
在微博看到别人说,以后年轻一代会主力用语音输入法,抛弃传统的键盘输入。我觉得 “你不是年轻人就别瞎几把推断年轻人”。八年前还有许多大佬说:“以后年轻一代会用视频替代图文进行交流” 呢。语音输入这件事挑人,适应用口语输入书面语言,不是年轻人的特权,而是一部分人的特长。
至于豆包输入法嘛,在豆包的 VUI 光环照耀下,谨慎看好,用于非书面场合的微信沟通也没什么问题。迷上豆包 VUI 的人会对豆包语音输入法心生好感,这种锐利的特性和强烈的品牌光环,可能比(实际上语音识别能力相当的)微信输入法更有竞争力。用户本能地觉得 “豆包输入法语音识别牛逼!”长板支棱得足够长。相比起来,微信输入法四平八稳,不容易留下深刻印象。
PS:我还有一个奇奇怪怪的特性就是,口头输入书面语言时,会自动转换成语速很慢的朗诵腔,抑扬顿挫,加入强烈的语气……不要问我,我也不知道是怎么回事。周围的人经常为此很惊讶地望向我,看这个疯批。
点击【阅读原文】,可见犬校最近一年的好帖索引。