🧠 模型只是大脑,真正决定体验的是harness
同样是Agent,为什么用起来差这么远?一路从OpenClaw换到Codex,我才发现真正影响体验的,是模型外面那层东西。
harness这个词,我已经看到很久了。但直到回头梳理自己一路用过的AI工具,才对它有了更深的体会。
第一次看到时,我也没太明白。中文翻成“工具框架”“智能体框架”,每个字都认识,连在一起还是像一团雾。
后来想想,我其实已经把它用过一遍了。
从OpenClaw、WorkBuddy,到Claude Code,再到现在的Codex。我一直以为自己是在换AI工具,回头看才发现,我是在一点点摸清楚:一个大模型,到底要被什么东西包起来,才会真的好用。
先说OpenClaw:它让我第一次看到AI长出手
OpenClaw,也就是前阵子很火的“小龙虾”。
它最厉害的地方,是让很多人第一次看到:AI不只能在对话框里回话,还能读文件、调用工具、执行任务,真的去“做”一点什么。
我也折腾过。
新鲜是真的新鲜,麻烦也是真的麻烦。要部署、要配置、要接模型和工具,中间任何一处没连好,它就趴在那里不动。很多时候,我花的力气不是让它干活,而是先让它能干活。
它很像一辆自己用乐高拼出来的小车。发动机装上了,轮子也会转,但开出去之前,你最好再检查一下方向盘有没有松。
这段经历我之前写在《小龙虾到底是个啥?》里。当时我的结论很简单:想学原理,可以搭积木;真想干活,还是直接开成品车。
WorkBuddy:车是装好了,但按钮有点多
后来用了WorkBuddy,体感已经好很多。
不用先研究半天怎么部署,界面也更像一个普通人能直接打开的软件。很多原本藏在配置文件里的能力,都被做成了看得见、点得到的功能。
但用了一段时间,我又开始觉得有点满。
这是我用不少国内软件时都会有的感受:大家很擅长快速把功能补齐,却很难忍住不把每个功能都摆到你面前。
一个入口能做三件事,就想让你看到三件;新加了一个能力,就怕你不知道;最好每一块地方都热热闹闹,证明这个软件什么都有。
可我真正干活时,并不想一直知道它还有什么。
我只想把手里的事做完。
克制听起来像视觉审美,其实很影响使用。屏幕上每多一个需要判断的东西,我就要分一点注意力给它。功能越来越多,工具反而越来越有存在感。
Claude Code:它第一次从我眼前消失了
然后我开始用Claude Code。
这里得先夸一句:后来的App迭代得很快,体验也真的很好,不能只用“黑乎乎的终端”来概括它。但我最早接触它时,用的确实还是CLI,打开就是一个终端窗口。没有精致的首页,也没有一排功能卡片。老实说,第一眼甚至不像一个为普通人准备的产品。
但真正把项目交给它之后,我很快就惊了。
我不用先告诉它该点哪个功能,也不用自己在几个模式之间切换。我只要说想做什么,它会读项目里的文件、找需要的上下文、修改、运行、检查,再回来告诉我发生了什么。
以前用Agent,我多少还有一种“我在操作一个AI工具”的感觉。
到了Claude Code,这种感觉开始消失。我只是坐在电脑前做自己的事,旁边刚好多了一个能读懂整个工作现场的人。
那段时间我真的觉得:其他工具好像都不必再用了。
然后账号就被封了。很有戏剧性,也很烦。
我刚刚习惯把很多事交给它,门突然锁了。后来我把项目、skills、memory和协作规则搬到Codex,继续干活。这段可以看《账号被封之后,我才发现自己真正依赖的不是Claude Code》。
Codex:我是带着留恋搬过去的
刚换到Codex时,我其实有点不情愿。
倒不是它哪里不好。更像是刚刚习惯了一张桌子,杯子放哪、抽屉怎么开都已经形成肌肉记忆,突然又要搬家。新桌子再好,刚坐下也会先想念旧的。
结果用了一两周,我就彻底拥抱了。
有些地方不是惊天动地的大功能,只是一些很小的细节:
- 每个项目有自己的文件夹,不同工作不会全挤在一条长长的对话里
- 对话框里能看到进度,不需要对着一个安静的窗口猜它到底还在不在干活
- 生成的输出物可以直接打开,哪里不对就圈选哪里,让它定点修改
- 项目、对话和文件放在一起,做完的东西不会只剩在聊天记录里
这些细节没有让模型突然聪明20%。但它们让我少操了很多心。
项目文件夹解决的是“这件事放在哪里”;进度条解决的是“它现在做到哪了”;圈选修改解决的是“我怎么把跑偏的地方拉回来”。
我慢慢发现,自己喜欢的不是某个更漂亮的界面,而是这套界面背后对工作的理解。
原来这些东西加起来,就叫harness
如果用最简单的话说:
模型是大脑,harness是让这个大脑能在现实里持续干活的那套东西。
它决定AI能看到什么、能调用什么工具、怎么记住前面的进度、怎么把任务继续往下推,也决定我能不能看见它在做什么,出错以后怎么接手。
所以同样一个聪明模型,被放进不同产品里,用起来可能完全不是一回事。
有的产品像把一颗大脑放在桌上。你问,它答。
有的给它接上手和工具箱,但每做一步都要你在旁边盯着。
再好一点的,会替它准备好桌子、文件柜、工作记录和门禁。它知道东西去哪里找,做完放回哪里;你平时不用管,真要插手时也找得到位置。
OpenClaw让我看见了“手”是怎么接上去的。WorkBuddy让我感受到,功能齐全还不够,太多东西堆在眼前也会累。Claude Code第一次让我忘记工具本身,只顾着做事。Codex又往前走了一步,把项目、进度和输出物都放到了我随时能看见、能碰到的位置。
这几款产品并不是简单的一代比一代高级,它们也一直在更新,我的判断可能过几个月又会变。
模型当然还是重要的。大脑不够用,工作流再顺也救不了。但在模型能力差不太多、都能胜任手头任务的前提下,我会更在意外面那层harness。
尤其是我平时做的这些白领办公任务:整理资料、写文档、改方案。很多时候,模型之间那一点能力差距,并没有给输出带来那么大的区别。反而是工作能不能顺着做下去,决定了我愿不愿意天天用它。
我会看一个普通的下午:打开项目,把一件还没完全想清楚的事交给它;我去倒杯水,回来能看见它做到哪;发现一段不对,直接圈出来让它改;最后文件留在原来的项目里,明天还能接着做。
我们想要的,其实就是这种“丝滑”。不是回答蹦得快一点,也不只是界面漂亮一点,而是从交代任务到拿到结果,中间不用反复搬资料、补背景、找文件、盯进度。这份丝滑,靠的就是harness的能力。
我想要的,大概就是这样一张可以长期坐下去的桌子
✦ 留个言
想问点啥?想补点啥?
关于这篇内容的问题、补充、不同意见、纠错都可以留在这里。每条 Jojo 都会看到,但不一定都回。