AI 学习小园地
← 回到小园地
扫个盲 2026-09-17

🧠 模型只是大脑,真正决定体验的是harness

同样是Agent,为什么用起来差这么远?一路从OpenClaw换到Codex,我才发现真正影响体验的,是模型外面那层东西。

harness这个词,我已经看到很久了。但直到回头梳理自己一路用过的AI工具,才对它有了更深的体会。

第一次看到时,我也没太明白。中文翻成“工具框架”“智能体框架”,每个字都认识,连在一起还是像一团雾。

后来想想,我其实已经把它用过一遍了。

从OpenClaw、WorkBuddy,到Claude Code,再到现在的Codex。我一直以为自己是在换AI工具,回头看才发现,我是在一点点摸清楚:一个大模型,到底要被什么东西包起来,才会真的好用。

先说OpenClaw:它让我第一次看到AI长出手

OpenClaw,也就是前阵子很火的“小龙虾”。

它最厉害的地方,是让很多人第一次看到:AI不只能在对话框里回话,还能读文件、调用工具、执行任务,真的去“做”一点什么。

我也折腾过。

新鲜是真的新鲜,麻烦也是真的麻烦。要部署、要配置、要接模型和工具,中间任何一处没连好,它就趴在那里不动。很多时候,我花的力气不是让它干活,而是先让它能干活。

它很像一辆自己用乐高拼出来的小车。发动机装上了,轮子也会转,但开出去之前,你最好再检查一下方向盘有没有松。

这段经历我之前写在《小龙虾到底是个啥?》里。当时我的结论很简单:想学原理,可以搭积木;真想干活,还是直接开成品车。

WorkBuddy:车是装好了,但按钮有点多

后来用了WorkBuddy,体感已经好很多。

不用先研究半天怎么部署,界面也更像一个普通人能直接打开的软件。很多原本藏在配置文件里的能力,都被做成了看得见、点得到的功能。

但用了一段时间,我又开始觉得有点满。

这是我用不少国内软件时都会有的感受:大家很擅长快速把功能补齐,却很难忍住不把每个功能都摆到你面前。

一个入口能做三件事,就想让你看到三件;新加了一个能力,就怕你不知道;最好每一块地方都热热闹闹,证明这个软件什么都有。

可我真正干活时,并不想一直知道它还有什么。

我只想把手里的事做完。

克制听起来像视觉审美,其实很影响使用。屏幕上每多一个需要判断的东西,我就要分一点注意力给它。功能越来越多,工具反而越来越有存在感。

Claude Code:它第一次从我眼前消失了

然后我开始用Claude Code。

这里得先夸一句:后来的App迭代得很快,体验也真的很好,不能只用“黑乎乎的终端”来概括它。但我最早接触它时,用的确实还是CLI,打开就是一个终端窗口。没有精致的首页,也没有一排功能卡片。老实说,第一眼甚至不像一个为普通人准备的产品。

但真正把项目交给它之后,我很快就惊了。

我不用先告诉它该点哪个功能,也不用自己在几个模式之间切换。我只要说想做什么,它会读项目里的文件、找需要的上下文、修改、运行、检查,再回来告诉我发生了什么。

以前用Agent,我多少还有一种“我在操作一个AI工具”的感觉。

到了Claude Code,这种感觉开始消失。我只是坐在电脑前做自己的事,旁边刚好多了一个能读懂整个工作现场的人。

那段时间我真的觉得:其他工具好像都不必再用了。

然后账号就被封了。很有戏剧性,也很烦。

我刚刚习惯把很多事交给它,门突然锁了。后来我把项目、skills、memory和协作规则搬到Codex,继续干活。这段可以看《账号被封之后,我才发现自己真正依赖的不是Claude Code》。

Codex:我是带着留恋搬过去的

刚换到Codex时,我其实有点不情愿。

倒不是它哪里不好。更像是刚刚习惯了一张桌子,杯子放哪、抽屉怎么开都已经形成肌肉记忆,突然又要搬家。新桌子再好,刚坐下也会先想念旧的。

结果用了一两周,我就彻底拥抱了。

有些地方不是惊天动地的大功能,只是一些很小的细节:

  • 每个项目有自己的文件夹,不同工作不会全挤在一条长长的对话里
  • 对话框里能看到进度,不需要对着一个安静的窗口猜它到底还在不在干活
  • 生成的输出物可以直接打开,哪里不对就圈选哪里,让它定点修改
  • 项目、对话和文件放在一起,做完的东西不会只剩在聊天记录里

这些细节没有让模型突然聪明20%。但它们让我少操了很多心。

项目文件夹解决的是“这件事放在哪里”;进度条解决的是“它现在做到哪了”;圈选修改解决的是“我怎么把跑偏的地方拉回来”。

我慢慢发现,自己喜欢的不是某个更漂亮的界面,而是这套界面背后对工作的理解。

原来这些东西加起来,就叫harness

如果用最简单的话说:

模型是大脑,harness是让这个大脑能在现实里持续干活的那套东西。

它决定AI能看到什么、能调用什么工具、怎么记住前面的进度、怎么把任务继续往下推,也决定我能不能看见它在做什么,出错以后怎么接手。

所以同样一个聪明模型,被放进不同产品里,用起来可能完全不是一回事。

有的产品像把一颗大脑放在桌上。你问,它答。

有的给它接上手和工具箱,但每做一步都要你在旁边盯着。

再好一点的,会替它准备好桌子、文件柜、工作记录和门禁。它知道东西去哪里找,做完放回哪里;你平时不用管,真要插手时也找得到位置。

OpenClaw让我看见了“手”是怎么接上去的。WorkBuddy让我感受到,功能齐全还不够,太多东西堆在眼前也会累。Claude Code第一次让我忘记工具本身,只顾着做事。Codex又往前走了一步,把项目、进度和输出物都放到了我随时能看见、能碰到的位置。

这几款产品并不是简单的一代比一代高级,它们也一直在更新,我的判断可能过几个月又会变。

模型当然还是重要的。大脑不够用,工作流再顺也救不了。但在模型能力差不太多、都能胜任手头任务的前提下,我会更在意外面那层harness。

尤其是我平时做的这些白领办公任务:整理资料、写文档、改方案。很多时候,模型之间那一点能力差距,并没有给输出带来那么大的区别。反而是工作能不能顺着做下去,决定了我愿不愿意天天用它。

我会看一个普通的下午:打开项目,把一件还没完全想清楚的事交给它;我去倒杯水,回来能看见它做到哪;发现一段不对,直接圈出来让它改;最后文件留在原来的项目里,明天还能接着做。

我们想要的,其实就是这种“丝滑”。不是回答蹦得快一点,也不只是界面漂亮一点,而是从交代任务到拿到结果,中间不用反复搬资料、补背景、找文件、盯进度。这份丝滑,靠的就是harness的能力。

我想要的,大概就是这样一张可以长期坐下去的桌子

✦ 留个言

想问点啥?想补点啥?

关于这篇内容的问题、补充、不同意见、纠错都可以留在这里。每条 Jojo 都会看到,但不一定都回。