都 2026 年了,我们也该拥抱 Voice Coding 了
你确定你说的不是 Vibe Coding,而是 Voice Coding?别慌,让我细细讲来。
此事早有记载
2018 年,罗永浩站在台上,对着大屏幕喊了一句“把这个字标红”。全网笑疯了,用语音控制做表格,真的和拿脚写字差不多。其实老罗思路没错,只是早了几年。
后续老罗坦言。虽然大家都嘲笑 TNT,但是后来大厂收购锤子时,大部分都对 TNT 这个项目更感兴趣。比如车机交互,就非常需要语音支持。
它是真的快
为什么老罗没做成的事情,现在就有戏了?

很简单,Voice Coding 主打一个快,差不多是打字的三倍。现在越来越多的活派给 AI,我们和 AI 的交流反而成了瓶颈。不管是派活,还是想让它按你的理解修复问题,都需要频繁交流。所以这里想引出一个概念:意图带宽,就是单位时间里,你能把多少“你到底想干嘛、想让它怎么改”塞进 AI。可以这么说,在脑机接口成熟之前,语音是现在最快的人与 AI 的交互方式。
Voice Coding 时机已经成熟
这么好的东西,为什么之前做不成,现在又值得提?
核心原因有两点:
- 活儿本身变成了自然语言。 AI 普及让我们的工作从干活变成了派活。以前干活要用鼠标键盘,比如 PS、复杂的 Excel 操作和各种 Coding。这些精确操作很难用语音描述,错误率高,效率也低。现在我们把任务目标交给 AI,而和 AI 交流用的就是自然语言。自然语言可以直接说,所以更快的输入就等于提效。
- 语音识别这两年才真的够用。 沾了大模型的光,新一代 ASR 拿海量语音喂大模型,让它借上下文猜词,错误率比老一代低了一大截。现在它装进各家输入法里,能自动删掉你的“嗯”“那个”,也听得懂中英文混说。以前语音输入错误率高,输完还要手动校验和修改,当然不如直接打字。

所以当年老罗做 TNT,用语音去控制一个复杂的表格,当然是天方夜谭。现在你只需要把任务目标交给 AI,真正的精密操作,AI 自己帮你完成。
好了,说点实践
Voice Coding 我是真的在用。组合也比较简单:大疆无线麦克风、小蓝牙键盘和豆包输入法。麦克风通过磁铁吸在小键盘上。键盘有两个作用,一是当话筒手柄,握持手感更好;二是让语音输入完全脱离电脑键盘。第一个键被我改成开启语音输入,语音输完后按第二个键发送。

-
大家会问,你天天叽里咕噜地语音输入,会不会吵到旁边的人?
用下来反而更安静。麦克风离嘴更近,说话声音可以压得更低,比开着电脑麦克风小声说话轻多了。
-
更加专注,特别是脑暴不会断思路。
语音输入让我能更专注地把脑子里的想法直接说出来。以前要组织文字,脑子里一闪而过的话很容易丢。特别是脑暴时,语音输入更方便,我会跟 AI 说更多上下文,结果反而更好。它不光知道要做什么,也知道为什么要做、我真实的想法是什么。现在每轮我可能都会和 AI 聊几千字,这在打字时不敢想。
-
精确度怎么样?
语音输入会不会不如键盘精确?豆包输入法可以设置去掉一些口水词。只要上下文足够多,说一点废话其实问题不大。你多说的这些 token,比起现在动辄 1M 上下文的大模型来说都是洒洒水。把前因后果讲清楚,效果反而会更好。
你也可以试试
有点心动的话,可以渐进尝试,不着急买硬件。
- 先用豆包输入法,看看语音输入的效率是不是变高了。
- 再考虑麦克风等收音设备,提高识别精度和效率。
- 后续根据需求自己 DIY。