Obsidian 小技巧 · 第六篇

别再打字了:语音输入,和十分钟碎碎念

2026 年 8 月 21 日 · 浦晓栋 · 把记录的成本第一次降到零

库有了,管理员有了,它也记得你了。现在解决最后一个瓶颈:你往里倒东西的速度。

前五篇搭好的那套系统,有一个隐蔽的短板。

库能装(第二篇),料能剪(第三篇),管理员能整理(第四篇)、还记得你的规矩(第五篇)——但所有这一切的前面,有一道闸门:你得先把想法弄进去。

如果"弄进去"靠打字,这道闸门就是窄的。你一天里冒出来的念头,九成会死在"回头再记"这四个字上。

这一篇讲怎么把闸门拆掉:用嘴,不用手。


一、打字是给机器降维,说话才是人的原生输出

先看一组对比:

打字 vs 说话

打字,快的人一分钟五六十字,还得坐在键盘前;说话,随口就是两三百字,走着躺着都行。差了五倍,姿势还自由。

但速度只是表面。真正的差别在这句话上:

记录这件事,成本决定一切。成本高,你就只记"重要的"——而大多数好想法,当时看起来都不重要。

我自己就是证据。用打字记录的那些年,我的笔记软件换了三四个,每个都是开头认真、三周弃坑。不是懒,是每次记录都要付出"坐下、打开、组织语言、敲字"这一整套成本,付着付着就不付了。

改用语音之后,这一年我留下的文字比过去十年都多——但我几乎没"写"过。


二、卡帕西的方法:连续念叨十分钟

具体怎么说?这里有一套现成的方法,来自前 OpenAI 创始成员、特斯拉前 AI 总监卡帕西(Andrej Karpathy)——他公开分享过自己的用法,和我自己摸出来的完全一致:

与其绞尽脑汁打字整理思路,不如直接切语音输入,像意识流一样连续念叨十分钟——想到什么说什么,乱七八糟也没关系。

卡帕西法三步

你负责念叨,AI 负责梳理。神奇的地方在于:它整理出来的版本,往往比你自己打字写的还清楚——因为你打字时会边打边删,很多东西还没成形就被你毙了;而念叨的时候,所有半成品想法都活着到达了它手里。

卡帕西还有个小习惯值得照抄:开口前先声明一句"我在用语音输入,可能有错别字"——然后就放开说,不用回头改。


三、三个黄金时刻

什么时候说?我的答案:挑那些嘴本来就闲着的时间。

三个黄金时刻

注意这三个时段的共同点:它们本来就产不出别的东西。 语音记录不是从你的日程里抢时间,是把废时间变成语料。

我的日常版本:散步的时候把今天想的事全倒出来——一个投资判断、一手牌的复盘、对孩子说的一句话、一个没想清楚的疑问。回到电脑前只说一句:"归档。"(那两个字背后发生什么,第五篇讲过了。)


四、最大的障碍不是技术,是不好意思

说实话,语音输入的技术门槛几乎是零。真正拦住人的是心理:

心理关卡

"等我想清楚了再说"、"这么乱它能懂吗"、"我先打个草稿"——这三句话的结局都一样:永远没有开口。

你需要换一个认知:

乱七八糟是原料的常态。整理是它的活,不是你的。

你对着说话才需要组织语言——怕对方不耐烦,怕显得没条理。但它不是人:它不嫌你烦,不打断你,不评价你,你说三遍重复的话它也不翻白眼。

把它当成一个永远不烦你的速记员:你负责倒,它负责捡。倒得越放松,捡出来的越多。


五、实在说不出来?让它采访你

有些天你会对着手机张不开口——不知道从哪说起。这时候有个特别好用的翻转:

「采访我今天的想法,一次问一个问题。」

反向采访

它问,你答。"今天最占你脑子的一件事是什么?"——这种问题你不可能答不上来。答着答着,它追问,你展开,十分钟后你会发现:被问着说,比对着空气说容易十倍。

更妙的是副产品:这场采访的记录,本身就是一篇现成的日记。说完直接"归档",一个字不用写。

我见过不少人卡在"我没什么可记的"上。真相是:没有人没什么可记的,只有人没被问对问题。


六、上路:手机一步,电脑一步

落地方案,别搞复杂:

上路清单

手机端(记录端):装一个语音输入法。我用 Typeless,豆包、讯飞、甚至手机系统自带的语音输入都行——先跑起来再讲究。对着它说,出来就是文字,随手发到一个你自己的对话框里存着(哪怕是微信文件传输助手)。

这里面豆包值得多说一句:字节跳动的免费 AI 应用(应用商店搜"豆包"就有),语音输入是它的强项,对带口音的普通话和方言的识别普遍反馈更友好。如果你自己说不惯标准普通话——或者你想把这套方法教给家里长辈——从豆包开始,成功率最高。

电脑端(归档端):回到电脑,把手机上说的那几段粘给你的管理员,说一声"归档"。剩下的它来。

有条件的可以更进一步——装个能直接在电脑上说的语音输入(详细步骤在 talktomama.org/method/2,那是给零基础写的手把手教程),对着电脑直接跟管理员说话,连粘贴都省了。

但我想强调的是相反的方向:别追求一步到位的全自动。"手机说、电脑归"这条土路我自己走了几个月才升级,跑通比优雅重要。工具明年一定会换,"用嘴不用手"这个习惯才是留得下的资产。


七、新手最容易问的三件事

Q:语音识别老出错别字怎么办? 不管它。错别字是给 AI 看的,不是给人看的——它靠上下文能猜对九成九。你在"归档"的时候顺嘴说一句"顺便修一下错别字",出来就是干净的。为了几个错别字回头改,你就又回到打字的成本了。

Q:说方言 / 中英混着说,行吗? 行。现在的语音输入对普通话不标准、中英夹杂的容忍度远比你想象的高。先试十分钟再下结论。

Q:我说的这些太私密,放心吗? 分两层。落到库里的文字,在你自己硬盘上(第二篇讲过);但语音转文字这一步走的是输入法服务商的服务器。我的原则:核心的私密内容(密码、感情、别人托付的秘密)不走语音,其余的放行。 顾虑重的,从"读书感想、工作复盘"这类无所谓的内容开始,边用边定自己的界线。


收尾

回头看,这个系列到这一篇,整条流水线通了:

嘴(这一篇)→ 仓库(第二篇)→ 剪藏补料(第三篇)→ 管理员(第四篇)→ 它记得你(第五篇)。

第一篇里那句话,现在你可以完整地做到了:语音进,网页出。("网页出"是第十篇的事,快了。)

最后说一个我自己没想到的收获。用嘴记录半年之后,我发现变化最大的不是效率,是留下来的东西的质地——打字时代我留下的是"结论",语音时代我留下的是"过程":犹豫、自我反驳、突然想通的那个拐弯。

结论会过时。过程里有你这个人。

下一篇解决一个具体的顽疾:微信公众号的文章怎么入库——第三篇里 Web Clipper 抓不动的那个坑,这次填上。

我是 聪本中_浦晓栋,江南人士,物理和工商管理双硕士学位,二个女儿,定居新加坡。半导体芯片生产行业做了十六年技术研发,2022 年起自由职业做投资。不会编程——这一点很重要,因为我做出来的所有东西,都是一个不会编程的普通人能做出来的。目前在做公益网站「和妈妈说话」:talktomama.org
Obsidian 小技巧系列 · 建库的手艺活,一篇一篇写。 第一篇 · 一个不会编程的人的工作学习流 / 第二篇 · Obsidian 入门 / 第三篇 · Web Clipper 剪藏 / 第四篇 · 把 AI 助手接到库上 / 第五篇 · 让它记住你 / 第六篇 · 别再打字了(本文) / 第七篇 · 公众号入库 / 第八篇 · 属性与 Bases / 第九篇 · 手机、同步、备份 / 第十篇 · 从库里收割 / 第十一篇 · 用 flomo 接住碎片