Wispr Flow $12/月?我两天vibe coding了一个,中文体验吊打
最近,Vibe Coding 圈子里很多人都在聊一款叫 Wispr Flow 的工具。它的体验确实做得相当出色:你说一句“我们约下午6点...呃不对,改成7点”,它直接上屏的就是干净利落的“我们约下午7点”;你说“get user by id”,它就能准确输出程序员熟悉的 getUserById 驼峰格式;甚至当你提出一个指令,比如“帮我写个会议纪要”,它给你的都不是这句话,而是一个直接可用的结构化模板。
它确实解决了语音输入长久以来的一个痛点:机器终于从“听写”进化到了“听懂”。
但它的定价是每月12美元。
看到这个价格,我的第一反应是“凭什么”,凭借过去几乎做过所有 LLM 相关小产品的经验,这套流畅体验背后的实现路径,我已经大概有谱了。而且,因为是海外产品,对国内网络的支持,以及中文的优化做的都不是很好,如果把它完全本土化,我相信能用更低的成本,做出比它更好的体验。
于是,我决定花两天时间,把这个想法变成现实。
一眼看穿——高手的“反编译”
Wispr Flow 这套架构在老司机眼里,几乎是透明的。
秘密就藏在它的名字里:“Wispr Flow”。作为一名天天跟模型打交道的人,“Wispr”让我瞬间联想到了OpenAI的Whisper,目前最主流的开源ASR(语音识别)模型;而“Flow”,则是大模型领域里“工作流”的经典表述。
所以,它的技术路径不要太明显:前端用Whisper把你的语音转成初步文字,然后再把这些文字作为原材料,丢给一个大语言模型(LLM)进行智能处理和润色。
这就是它实现“魔法”的本质。它不再是单纯的“语音听写”,而是开创了一个全新的范式:ASR + LLM。前者负责“听见”,做到“信”;后者负责“听懂”,做到“达”与“雅”。这个范式,彻底将语音输入从“别问准不准,就说快不快吧”的“忠实速记员”角色,升级为“智能助理”,让机器开始主动适应我们充满“呃、啊、那个”和颠三倒四的自然表达。
然而,也正因为看透了这一点,我才敢说“凭什么”。这个通用架构虽然巧妙,但对于中文用户来说,它存在一个天然的“性能天花板”。Whisper虽然强大,但它的训练语料终究以英文为主,对中文的俚语、专业术语、乃至人名的识别率并非顶尖。而后端的LLM,大概率是GPT系列,国内不能直接使用不说,在中文语境的理解和优化上,同样逊色于国内的顶尖模型。
一张更优的idea几乎立刻在我脑中浮现:为什么不进行一次“升舱”?
1. ASR引擎替换: 将通用的Whisper,换成由阿里达摩院开源的、在中文领域表现登顶的FunASR模型,并让它在本地运行。这样不仅识别更准,还能保证语音数据不出本地,彻底解决隐私顾虑。 2. LLM大脑升级: 将GPT,换成国内第一梯队的中文大模型,比如通义千问或Kimi。它们更懂中文的语境、俚语和细微差别,润色效果都会更地道。
这个方案,不仅理论上可行,而且在体验和成本上,都将是一次对 Wispr Flow 的“升维打击”。
idea有了,剩下的,就是把它变为现实。
两天,从一行Electron都不会到完整应用
光有idea还不够,干就完了。
坦白说,在动手之前,我一行 Electron 代码都没写过。
但这根本不构成障碍。现在的开发模式,早已不是靠“一星期入门,一星期精通”的线性学习了。我的第一步,是去 GitHub 找一个开源的同类项目 OpenWhisper 作为参考答案。我需要的不是它的代码,而是它已经验证过的产品结构——一个桌面语音助手,应该如何组织代码、处理哪些系统交互。
答案在手,冲刺开始。
Day 1:打通核心引擎与关键决策
第一天的目标非常暴力:先做一个能跑的最小原型Demo。 就是一个丑陋的窗口,只要能证明核心逻辑可行。
我用一个“桥接模式”连接前端的 Electron 界面和跑在本地的 FunASR 服务。很快,我说的话,就能被 FunASR 准确地转成文字,显示在那个简陋的窗口里。
第一步,通了。但真正的挑战才刚刚开始。
FunASR 输出的,是未经处理的、“忠实”的文字。要实现 Wispr Flow 那种“魔法般”的润色效果,关键在于它背后的 LLM 大脑。
而选择哪个模型,就是非常有意思的地方。
我们首先要明确 LLM 在这个场景下的核心任务是什么。它不是要写一篇论文,也不是要进行复杂的逻辑推理。它的工作非常聚焦:对一小段刚刚识别出来的、充满口语化错误的文字进行改写和润色。
这是一个典型的“浅层任务”,它不依赖庞大的世界知识,也不需要长上下文的规划能力。
想明白这一点,模型选型的思路就清晰了:在这个场景下,使用千亿参数的“航母级”大模型,不仅是一种巨大的资源浪费,甚至会带来负面效果。 因为模型的规模和响应速度往往成反比。对于输入法这种高频工具,用户的耐心是按毫秒计算的。
所以我的标准非常清晰:
1. 延迟必须做到极致。 用户说完话,必须在最短时间看到反馈。 2. 在此前提下,成本越低越好。 这无关商业化,而是对技术效率的极致追求。
我需要的,是一个小而快、聪明且专注的模型。
于是,我把国内主流模型服务商提供的小参数模型,针对这个场景做了一轮快速横评。最终,通义千问的一个小尺寸版本(qwen3-30b-a3b-instruct-2507),凭借其惊人的响应速度和几乎可以忽略不计的成本,完美胜出。
这个决策,直接决定了“蛐蛐”能拥有超越 Wispr Flow 的响应速度。更重要的是,它证明了一件事:通过精准的技术选型,我们可以用一个高价产品零头的成本,实现甚至超越它的核心体验。
Day 2:从Demo到产品
引擎和大脑都就位后,第二天就是把它从一个开发者玩具,变成一个普通人也能用的产品。
这同样是硬仗,我遇到了两个绕不开的坎:一是如何将文本插入到任何软件的光标处;二是搞定 macOS 苛刻的“辅助功能”系统权限。
这两点,AI 能给的帮助有限,更多是靠经验和反复试错。我坦然承认,解决这两个问题花的时间,甚至超过了第一天构建核心引擎的时间。但这恰恰是区分一个 Demo 和一个好产品的关键。
当最后一个插入需求被完美处理,距离想法诞生,也不过两天。
一个有趣的小东西,也就算正式诞生了。
“蛐蛐”——一个有趣的小东西
所以,这个我花了两天做出来的小东西,我叫它“蛐蛐 (QuQu)”,取“蛐蛐你”的意思。
它能用,也确实解决了一些我自己的问题。主要是几点:
第一,它能清理掉我说话时的“废话”。 比如我说:“呃,我们今天...今天需要把那个需求过一下。” 它会直接输出:“我们今天需要把需求过一下。” 它会试着把那些无意义的停顿、重复和口头禅过滤掉。
第二,它懂得“看情况办事”。 如果我只说一两句短的,它就只做些错别字的修正。但如果我口述了一大段话,它就会试着做更深度的调整,比如把一些过于口语的表达改得书面一点,或者根据逻辑停顿帮忙分个段。
这些就是它和普通语音输入法的不同。不是简单的“听写”,而是基于一些预设的规则,对文本做了初步的“加工”。
总结下来,我做“蛐蛐”遵循的几个原则,或者说它的特点:
1. 中文场景优先: 整个技术路径,从ASR到LLM,选的都是对中文优化最好的组件,目的就是让它在处理中文时,能比海外产品更“懂”一点。 2. 数据安全: 语音识别(ASR)在本地完成,你的声音数据不会上传到任何地方。这对我来说很重要。 3. 关于成本: 我想说得实在点。这个工具本身开源,不收费。但它不是完全“免费”的,因为它背后需要调用大模型的API,这会产生费用。不过,就像第二章里分析的,通过选用极小尺寸的模型, Wispr Flow 一个月12刀的订阅费,几乎可以用一年。 4. 开放: 它是 Apache 2.0 协议开源的。如果你不喜欢默认的通义千问,可以很方便地换成Kimi、GLM或者其他任何你习惯的模型服务。
你的回合
坦白说,“蛐蛐”现在还很初级。它刚刚完成从0到1的构建,能用,但远称不上完美。很多我脑子里真正想做的、能让它产生质变的功能,都还没有实现。
GitHub的README里,其实已经立下了一些Flag,比如这些是我认为它未来的核心方向:
• 上下文感知(Context Awareness):这是最关键的进化方向。 • 短期记忆:它现在是一次性的。我希望下一次输入时,它能理解前文,让对话和思想能够连贯。 • 环境感知:如果它能读取到我当前正在使用的应用(比如VS Code、Obsidian或是微信),并获取光标附近的内容,那么它给出的优化和建议将精准百倍。 • 长期记忆:如果它能通过本地向量数据库,慢慢了解我的工作领域、常用术语和个人表达习惯,那它才会真正成为我的“专属助理”。 • 可定制的AI Agent工作流:现在它的处理逻辑是固定的“ASR+润色”,未来我希望它能支持可配置的Agent。你可以设定不同的模式,比如“写作模式”、“代码模式”、“邮件模式”,甚至可以定义一个“暴躁模式”,让它帮你把客气的话都怼回去。
这些都是它未来的可能性,也是我觉得真正有意思的地方。但光靠我一个人,肯定做不完,也做不好。
所以,现在轮到你了。
我做这个,始于解决自己的问题和纯粹的技术乐趣。如果它恰好也能对你有点用,那会让我非常高兴。这个项目现在完全开放,就在GitHub上:
• 用: 如果你觉得它可能有用,拿去用。项目地址是: https://github.com/yan5xu/ququ。目前还没有打包好的安装文件,需要根据README里的指南,自己动手跑起来。• 反馈: 如果你觉得不好用,或者有什么绝妙的想法,欢迎来GitHub的 Issues 页面“踢馆”,每一个建议我都会认真看。 • 共建: 如果你觉得它有趣,想一起把它变得更酷,非常欢迎提交你的代码(Pull Request)!不管是修复一个小Bug,还是实现一个新功能,你的贡献都会让这个项目变得更好。
* 本文由 Gemini 协助通过 蛐蛐 输入完成