智能体装好了该怎么用?拿它干啥?

编者按:这篇文章来自公众号「i龙虾」,把”装好智能体之后到底该拿它干啥”这个几乎所有新手都会卡住的问题,讲得又透又接地气。我们做 Hermes Agent / 智能体相关业务的同学,拿它当一份给客户的”入门心智手册”再合适不过——所以搬过来略作排版优化,分享给同样在摸索的人。

前几天刷到一个数据,OpenClaw 那个 Agent(智能体)社交网络最火的时候,注册了 160 万个 Agent。听起来很唬人对吧?但后面还有半句:这里面很多人一个任务都没跑过

我当时看着自己终端里那个已经配好、跑得好好的 Hermes,突然有点心虚。因为我太理解这种状态了——你把它装好,配好模型,接上微信、飞书和 Telegram,然后对着屏幕坐了五分钟,脑子里只有一个问题:

那……我拿它干啥?

这不是你不会用工具。这也不是你没想象力。说白了,这是一道我们这代人从来没做过的题。

以前”想事情”是绑在人身上的

我后来想明白一件事。AI 出现之前,你要把”思考”用到一个问题上,只有两条路:要么花钱雇个脑子帮你想,要么等自己有空了自己想。

思考这东西,一直是长在人身上的。人贵、难招、会累、会睡着、要吃饭、还得给人家讲清楚需求。所以”要不要为这件事投入思考”,本质上是”值不值得为它雇个人”,这个账我们心里门儿清。

但现在变了。思考被拆成了按 token 计价的东西。你可以买一点点,你可以买订阅,也可以买一大堆,甚至可以为一个下午才冒出来的问题,今晚就买一堆思考砸进去。

问题是,没有人是带着这种直觉长大的,包括我。从来没有人需要问自己:我这一周里,哪件事值得花 50 块钱”购买来的思考”?这个问题,一年前根本不存在。

所以你对着崭新的 Agent 发懵,太正常了。这不是工具的问题,是我们手里还没有那把”该往哪儿花”的尺子。

我这段时间摸下来,慢慢攒了两把尺子,一把管”选哪件事”,一把管”该不该交、交给几个”。分享给你。

第一把尺子:先选对那件事

有个博主讲了三个问题,我照着问了自己一遍,确实挖出了之前没想到的东西。

第一个问题:你在逃避什么?

就是那种你明知道该做、却一直往后拖的事。一想到就心里打结,甚至动过”要不花钱找人做”念头的那种。

对我来说,之前一直是公众号这件事。我知道该把它做得更系统、多花时间写点自己真正想写的,但每次一想到就烦,就往后推。后来我干脆让 Agent 从这儿切进去——不是让它替我写,是让它帮我把卡住的那一步先撬开。开头难,开了头后面就顺了。

拖延的地方,往往就是杠杆最大的地方。因为你逃避它,说明它对你重要,又确实难。

第二个问题:什么事你愿意花钱雇人做?

如果你脑子里冒出过”要是有个助理、有个实习生能干这个就好了,因为我知道它该怎么做、我能带会他”——那这活就能交给 Agent。你能给实习生讲明白的流程,就能给 Agent 讲明白。

第三个问题:什么事能让你离目标更近?

别去做那些”有了也不错”的锦上添花。最典型的就是”给我来个每日早报”——很多人第一反应都是这个,我一开始也想过。但说实话,那种早报我看一次就再没看过。它不痛不痒,不解决任何真问题。

把这三个问题过一遍,你要交给 Agent 的,就不该是凭空想出来的 nice-to-have,而是真正推着你往前走的那件事。

第二把尺子:判断这活到底该怎么交

选好事之后,还有一步很多人跳过了:这件事,到底是随便聊两句就行、还是派一个 Agent、还是得组个团队、甚至根本不该用 AI?

你看任何一件桌上的活,估这四个维度就够了。

一是大小。

这活一个 Agent 的”脑容量”装得下吗?你的日历,装得下,一个上下文窗口的角落就够了。但一千份文档的文件夹,装不下,它会溢出来。

二是独立性。

这活能拆成互不干扰的小块吗?读一堆文档就特别好拆——一个 Agent 读一份,谁也不用跟谁商量。有些事拆不开,前一步不定后一步没法动。

三是分工。

这活里有没有哪几步,天生就得由不同的”脑子”来做?不是因为一个脑子能力不够,是因为它们会互相污染。自己记账的人没法当自己的审计,写论文的人没法给自己做同行评审。而 Agent 头一回给了我们一样以前没有的东西:随叫随到的新鲜眼睛。你自己的产品页看过一千遍,永远没法像陌生人那样看它;但你现在能开一个从没见过它的 Agent,让它用全新的视角替你看。

四是可验证。

这是最关键的一维。检查一个答案,是不是比生产一个答案便宜得多?有没有一个测试、一个报错码、一份可以指着说”对”或”错”的源文件?

为什么这条最要命?我看到一个特别反直觉的数据。斯坦福 2024 年拿一个便宜的编码模型,每个 bug 只让它试一次,修好了 15.9%;同一个模型,每个 bug 让它试 250 次,直接飙到 56%——啥都没换,就是多试几次,还超过了当时花钱能买到的最强模型的 43%

听起来结论是”多花 token 就行”对吧?但还有后半句没人提:试到一万次的时候,超过 95% 的答案堆里其实都藏着正确答案。

问题是你捞不出来。

没有一个自动检查器帮你判对错,你就永远不知道那堆答案里哪个是对的。花出去的每一块钱,都在生成一个你永远找不到的正确答案。

所以这四个维度过完,结论就出来了:小事,聊两句就行;装得下、能自查、干得动的,一个 Agent 带个目标去干;装不下、或者需要不同视角互相把关的,才上多 Agent 团队。

还有第四种结论,也是最省钱的一种——可能你压根不该用 AI

有些事,AI 真不该碰

招哪个候选人、给产品起什么名、公司往哪个方向走——这类判断题,我见过太多人直接甩给 AI。

真别这么干。

我不是说 AI 不能帮你查资料、不能陪你聊、不能给建议,这些都行。但如果你自己对”什么是对的”都没有一个强直觉,又不肯用自己的判断去拍板,那你多半会出错。因为在一个专家最擅长的领域里,没有哪个前沿模型能赢过他。

我见过一些各自领域的高手,他们确实在用最新的模型,但用法是”拿它当一面墙,把想法弹回来听听”,最后拍板的还是自己。两个同样优秀的候选人之间,那种”我从面试里看出这人有我想要的品格”的判断,AI 给不了。

有时候最便宜的做法,就是把 AI 推到一边,自己坐下来,把答案敲出来。

写在最后

我越用 Agent 越觉得,工具本身反而是最不用操心的部分。今天你用的那个模型、那套多 Agent 配置,过几个月都会被换掉。

真正不会过时的,是那几个问题——你在逃避什么、你愿意为什么花钱、这活多大、能不能拆、要不要分工、验不验得了。这些描述的是”活”本身,不是那些一直在变的工具。

160 万人把 Agent 装好了,然后停在了”拿它干啥”这一步。差的从来不是工具,是那把尺子。

—— 本文整理自公众号「i龙虾」,原文链接:https://mp.weixin.qq.com/s/0uBrQHsnFYPd4jQ8GNV9xA

发表回复