过去七天,我手上四个客户端合计处理了 113 亿 token,日均 16 亿。最低的一天 8.7 亿,最高的一天 23.9 亿。
三周前我写过一句话:一个人能同时与多少个不同的模型有效交互,将成为衡量智力生产力的新门槛。现在我可以补一句:一个人智力生产力的上限,取决于他自己的工作验收带宽。
一、七天,113 亿 token
四个客户端是 Claude Code、Codex、Kimi Code 和 ZCode,数字取自它们在本机留下的用量记录。
| 日期(2026年) | 当日 token |
|---|---|
| 8月21日 | 11.4 亿 |
| 8月22日 | 13.7 亿 |
| 8月23日 | 18.3 亿 |
| 8月24日 | 18.9 亿 |
| 8月25日 | 8.7 亿 |
| 8月26日 | 23.9 亿 |
| 8月27日 | 18.2 亿 |
| 七天合计 | 113.0 亿 |
标题里那个「日均十亿」,是这七天的地板,不是峰值。
还有一个读数比总量更能说明问题:8 月 24 日下午六点零六分到零八分,四个客户端里仅一个,就有 13 个窗口在同一分钟里同时产出,分布在 7 件互不相干的事情上——写代码的、写材料的、管服务器的都有。
那么问题就来了:一个人,怎么可能同时看得过来 13 份产出?
二、真正的瓶颈不是模型,是看不过来
越是看不过来,越危险。
模型出错的样子跟人不一样。人做错了会卡住、会问、会露怯;模型做错了,会给你一份格式完整、语气笃定、看起来完全正确的东西。我这半个月里最贵的一次教训就长这样:有一项每天早上八点自动跑的例行核查,因为一处配置写坏,从第二次起读的一直是同一份冻住的旧数据。它每天照常出报告,报出来的问题全是幻影,真出现的新问题一条也看不见——而运行记录、结果通知、看板上的绿灯,全程正常。
一份胡编乱造的读数,和一份「一切正常」的读数,长得一模一样。
你让它写一份市场分析,你怎么知道那几个数字不是编的?你让它整理一份会议纪要,你怎么知道最重要的一句不是它造的?你让它跑一遍对账,它回你一句「已完成」,你凭什么相信它真的完成了?
开第二个窗口很容易,难的是同时相信两份产出。当你只能靠自己一双眼睛验收时,第二个窗口带来的不是双倍产能,是双倍的、你没时间核实的风险;开到第五个,你实际上已经在闭着眼睛签字了。所以绝大多数人用 AI 的天花板不在模型那一端,在自己这一端——他们不是不敢多开,是多开之后不敢确认和相信模型给出的结果。
三、vibe coding 只归程序员,managerial work 是大势所趋
这其实是一个身份问题:你已经不再是那个干活的人了。
vibe coding 是「氛围编程」,它天然只属于程序员。managerial work 是「领导型工作」,人人都是「领导」,拥有一支数字劳动力队伍,需要知道这件活干成什么样算合格,以及如何指挥 AI 保质保量地完成——一句话,定标准,保交付。
这两件事难在哪?难在AI 是语言模型,它的本行是把话说好,不是把事办成。
让它写报告、改文案、润色邮件、总结会议,它当然快——这类活的交付物本身就是文字,它天生干这个的,你也验得动,读一遍就知道行不行。可一个组织里真正的工作环节并不产出文字:款要真的付出去,账要真的对上,合同要真的盖章,客户要真的点头。这些活交付的不是一段话,是真实世界的状态被改变了。从写字到干活,中间隔着三道坎,每一道都比大多数人想的深。
一是对错的依据换了。写字的对错是「读起来对不对」,干活的对错是「结果对不对」。一份读起来无懈可击的对账报告,完全可能对的是三个月前的旧数据——文字挑不出毛病,事情根本没办。
二是可逆性换了。文案改错了重写就是,成本几分钟;款付错了,追回来要走三个部门两周时间,还不一定追得回。AI 犯错的速度跟它干活的速度一样快,而清理后果是人。
三是验收成本换了。验一份稿子你读一遍就行;验一件事办没办成,你得去查真实世界——那条记录在不在、对方收没收到、金额和口径对不对。这件事没法靠读来完成。
三道坎指向同一个要害:语言模型天生只会一件事,产生看起来最合理的下一段话。在写字的场景里,看起来合理就是合格;在干活的场景里,看起来合理恰恰是最危险的那种不合格。
这两件事在干活这一侧都得重新定义。定标准,定的不是「读起来像不像」,是「结果对不对」;保交付,靠的不是你再读一遍,是有东西替你去查真实状态。过去带三个下属你还能用眼睛盯,现在一开客户端就有十个下属,不用发工资、不会累、不会走,也不会问——你盯不过来了。一个不会验收的人,带的人越多,塌得越快。
你现在面对的是一个跑得极快、不记事、会自信地给出错误结论的迎合性下属。任何行业、任何岗位,只要你开始把活交给它,你就已经是领导了——区别只在于,你是一个立了标准的领导,还是一个只会点头的领导。
四、先给地图,再立规矩,最后自主检查
我自己这个领导,是分三层当的。
第一层是地图。
执行者最容易犯的错不是不会做,是看不见全局就动手:加一层其实不需要的结构,重复造一个别处已经有的东西,每一处局部都对,合起来是错的。所以我给它建了一张知识图谱:谁跟谁有关系,动这一处会牵动哪几处,边界画在哪里。有了这张图,它要用的时候是去查,不是去猜。在没有地图的地方,模型不会承认自己不知道,它会猜,而且猜得很像真的。你让新人写方案之前会先给他模板,道理完全一样,区别只在于人会心虚,模型不会。
第二层是规矩。
我把反复出错的地方写成五份明文规范,各管一件事。
一是资源的起、收、盘:凡是被启动起来、还占着资源的东西,都要答得出是谁起的、为什么起;谁起的谁收,同一轮活干完就收掉,开工前收工后各清点一次。
二是并行的活怎么隔离、怎么回收:一件在做的事有唯一的名字和唯一的落脚点,两条线的改动不许混进同一个地方;做完必须消失,留着就是噪音,噪音多了会盖住真问题。
三是不可逆的动作只走一个入口:凡是发出去就收不回来的事,全部收口到一个通道。绕过一次,就等于敞开了一条谁都能走的口子。
四是能靠机制跑的东西,不靠人再看一遍:每一类出过的问题,都要有一个自主执行的检查守着,人只负责看它有没有报警。审第二遍第三遍的边际收益掉得极快,与其反复看,不如装一个会自动跑的检查。
五是做事和写作的统一口径:同一件事在任何材料里只有一种说法。口径一散,同一份数据会长出两个版本,而两个版本一旦并存,之后所有人都得先花时间判断该信哪个。
任何一家优秀的公司,这五样都在——区别只在于,过去靠人记着就够了,现在人记不过来了。
第三层是原则。
第一条:没人会去查的规矩,等于没有这条规矩。一条写在墙上、没有任何人任何系统会去查的制度,和根本没有这条制度,效果完全相同,区别只在于你以为自己管了。最危险的形态从来不是没做检查,是配了没跑。所以我给 AI 定的十条硬性禁令,每一条后面都必须答出「谁去查它」。
第二条:一条规矩要么有东西在执行它,要么干脆删掉。「先放着」,不存在。这条看着苛刻,其实是在防一件更糟的事:你以为有一条规矩天天在帮你盯着模型,但实际上它却一点作用都没起到!
五、如何逐渐适应 managerial work
回到那 13 个同时产出的窗口。你不需要一上来就开到 13 个,但要走到那一步,路其实很短,就三步。
第一步,派活之前先给足上下文。不是把提示词写得更花哨,是把它该知道的一次给全:背景、边界、过往怎么做的、口径是什么。你少给一条,它就自己编一条,而且编得比真的还像。
第二步,把「什么算合格」写下来。这是全套里唯一不能交给 AI 的事,也正是你的专业所在——你做了十几年的那一行,值钱的从来不是你会干,是你知道干成什么样才算数。写不出来,说明这件事你自己也还没想清楚,那就先别派出去。
第三步,每被骗一次,就沉一条检查下去。别写「以后注意」,注意是没有执行力的。要问的是:什么东西能不靠我在场,自动抓到这一整类?沉下去一条,你就多出一份可以同时信任的产出;再来一条,再多一份。产能就是这么一条一条长出来的。
AI 是一辆动力十足的超跑,我们需要做的就是修建一条平整的高速公路,并装好护栏、路牌和导航,再告诉它你想要去的地方。