← 返回全部文章
【淬火·观点硬文】 · 2026-08-14

都 2026 年了,我们也该拥抱 Voice Coding 了

5 min read

你确定你说的不是 Vibe Coding,而是 Voice Coding?别慌,让我细细讲来。

此事早有记载

图片是一幅漫画,画面中一台显示器屏幕上显示着红色的“256! 256! cao! 2! 5! 6! …… 理解万岁”,显示器下方有文字“吵到我用TNT了”。画面左侧有一个大头人物,头上写着“安静”,其表情夸张,似乎在对显示器喊话。该图与上下文关系紧密,是对2018年罗永浩在台上喊“把这个字标红”这一事件的幽默解读,体现了当时语音操作技术的不成熟。 2018 年,罗永浩站在台上,对着大屏幕喊了一句“把这个字标红”。全网笑疯了,用语音控制做表格,真的和拿脚写字差不多。其实老罗思路没错,只是早了几年。

后续老罗坦言。虽然大家都嘲笑 TNT,但是后来大厂收购锤子时,大部分都对 TNT 这个项目更感兴趣。比如车机交互,就非常需要语音支持。

它是真的快

为什么老罗没做成的事情,现在就有戏了?

图片展示了人和AI沟通的带宽提高情况。左侧是一位正在打字的男子,打字速度为40字/分。右侧是语音输入,速度为150字/分,画面中有许多AI机器人在忙碌。底部文字总结“人和AI沟通的带宽提高,准确度和效率提升”。图片直观呈现了语音输入相较于打字在效率上的优势,与上文提到的意图带宽概念相呼应,强调了语音输入在与AI沟通中的重要性。

很简单,Voice Coding 主打一个快,差不多是打字的三倍。现在越来越多的活派给 AI,我们和 AI 的交流反而成了瓶颈。不管是派活,还是想让它按你的理解修复问题,都需要频繁交流。所以这里想引出一个概念:意图带宽,就是单位时间里,你能把多少“你到底想干嘛、想让它怎么改”塞进 AI。可以这么说,在脑机接口成熟之前,语音是现在最快的人与 AI 的交互方式。

Voice Coding 时机已经成熟

这么好的东西,为什么之前做不成,现在又值得提?

核心原因有两点:

  • 活儿本身变成了自然语言。 AI 普及让我们的工作从干活变成了派活。以前干活要用鼠标键盘,比如 PS、复杂的 Excel 操作和各种 Coding。这些精确操作很难用语音描述,错误率高,效率也低。现在我们把任务目标交给 AI,而和 AI 交流用的就是自然语言。自然语言可以直接说,所以更快的输入就等于提效。
  • 语音识别这两年才真的够用。 沾了大模型的光,新一代 ASR 拿海量语音喂大模型,让它借上下文猜词,错误率比老一代低了一大截。现在它装进各家输入法里,能自动删掉你的“嗯”“那个”,也听得懂中英文混说。以前语音输入错误率高,输完还要手动校验和修改,当然不如直接打字。

这张图是配合“Voice Coding迎来GPT时刻”主题的示意内容,画面左侧有一个带有橙色旋转标识的白色智能机器人,它正抬手指向身旁两个啮合的齿轮。蓝色齿轮内标注有“活儿变了”,橙色齿轮内标注有“语音够用了”,两个齿轮间还有碰撞迸出的效果,图的底部还配文“两个齿轮咬合,GPT时刻到了”,对应了文中Voice Coding的GPT时刻需要“活儿”与语音能力相匹配的核心观点。

所以当年老罗做 TNT,用语音去控制一个复杂的表格,当然是天方夜谭。现在你只需要把任务目标交给 AI,真正的精密操作,AI 自己帮你完成。

好了,说点实践

Voice Coding 我是真的在用。组合也比较简单:大疆无线麦克风、小蓝牙键盘和豆包输入法。麦克风通过磁铁吸在小键盘上。键盘有两个作用,一是当话筒手柄,握持手感更好;二是让语音输入完全脱离电脑键盘。第一个键被我改成开启语音输入,语音输完后按第二个键发送。

图片展示了三键语音输入设备。左侧为白色底板,上面有三个透明盖板,盖板内有红色按键。右侧是黑色支架,顶部装有灰色毛绒防风罩的麦克风,麦克风底部有绿色指示灯。该设备被用于实践语音输入,通过三个键实现开始停止录音、发送等功能,还意外带来环境更安静、人更专注等好处。 图片展示了两款设备。左侧为透明塑料外壳的设备,内有红色晶体,底部有金属接口。右侧是黑色设备,表面有“dji”标志,顶部装有灰色毛绒防风罩。这两款设备可能是用于语音输入的辅助工具,与文档中提到的语音输入设备相关,可能用于实践中的语音输入场景。

  • 大家会问,你天天叽里咕噜地语音输入,会不会吵到旁边的人?

    用下来反而更安静。麦克风离嘴更近,说话声音可以压得更低,比开着电脑麦克风小声说话轻多了。

  • 更加专注,特别是脑暴不会断思路。

    语音输入让我能更专注地把脑子里的想法直接说出来。以前要组织文字,脑子里一闪而过的话很容易丢。特别是脑暴时,语音输入更方便,我会跟 AI 说更多上下文,结果反而更好。它不光知道要做什么,也知道为什么要做、我真实的想法是什么。现在每轮我可能都会和 AI 聊几千字,这在打字时不敢想。

  • 精确度怎么样?

    语音输入会不会不如键盘精确?豆包输入法可以设置去掉一些口水词。只要上下文足够多,说一点废话其实问题不大。你多说的这些 token,比起现在动辄 1M 上下文的大模型来说都是洒洒水。把前因后果讲清楚,效果反而会更好。

你也可以试试

有点心动的话,可以渐进尝试,不着急买硬件。

  1. 先用豆包输入法,看看语音输入的效率是不是变高了。
  2. 再考虑麦克风等收音设备,提高识别精度和效率。
  3. 后续根据需求自己 DIY。
100%