AI 干活的好与坏,最后还是取决于人

现在,AI 都能干活,谁也都能指挥 AI 干活。

这当然没有错。

但真正用起来以后就会发现:同样是让 AI 干活,不同的人拿到的结果,差别还真是挺大的。

有人让 AI 做个网页,几分钟后就得到一个能用、能改、结构也清楚的产品;有人同样让 AI 做网页,得到的却只是一个看起来热闹、实际无法维护的 Demo。

有人让 AI 写文章,最后写出了自己的经历和观点;有人也让 AI 写文章,生成的却是一篇正确、完整,但和任何人都没有关系的标准答案。

为什么会这样?

我在使用 AI 的过程中,常常觉得 AI 干的活挺好,甚至比我自己干得更好。但现在回头看,这个“好”其实来自两类原因:一类是显性的,是我们都看得见的模型和工具;另一类是隐性的,是站在 AI 后面的那个人。

显性的差距:大脑和手脚

先说最容易看见的。

模型,就是 AI 的大脑

如果把 AI 当成一个干活的人,模型就像它的大脑,在很大程度上决定了它能不能理解问题、能把事情想多深,以及最后能交出什么质量的结果。

说得直接一点,就是“智商”。

所以大家才会持续讨论中美大模型的能力差距,讨论什么时候能赶上,也会不断比较各个模型谁更强、谁更好用。

我自己确实试过很多模型。

我曾经在嵌入式设备上跑 4B、9B 的模型,结果基本没法真正干活;后来又自建过 35B 的模型,已经算勉强能用,但还是觉得不够爽。再往后,我开始用国产模型、公司自建模型,买了 Gemini 会员,后来又用上了 GPT 会员。

每升级一次,感受都很明显。

用过能力更强的模型以后,确实就不再愿意回去用“智商低”的模型了。

去年底,我在 flomo 里写过这样一段话:

/posts/ai/20260718-ai-work-quality-depends-on-people/static/flomo-20251224.jpg

半年多过去了,我对这件事又有了新的认识,连排名也再次发生了变化。如果现在再排一次,我应该会把 ChatGPT 放到 Gemini 前面。

这当然说明模型进步得很快,也说明我们今天对某个模型的判断,很可能过几个月就会变化。但有一点没有变:模型能力的差距,会非常直接地反映在结果上。

更聪明的模型往往能更快地理解上下文,也更容易发现你没有明说的需求。它不只是把命令执行完,而是能理解你为什么要做这件事。

但再聪明的模型,也不能替你决定什么才算是“好”。它可以少问你几个问题,却不能替你定义真正的目标。

这就是大脑的差距。

工具,是 AI 干活的手脚

但有了大脑,还不够。

最早的 AI 主要就是聊天。你问一句,它答一句。哪怕模型很聪明,它也只能坐在那里和你讨论,不能真的替你把文件改好、把程序跑起来、把网页做出来。

后来出现了越来越多能调用工具、访问文件、执行命令的 AI Agent,情况就完全不同了。

过年前后,我开始使用“龙虾”,当时觉得特别爽。它可以帮我整理会议纪要、分析代码、写文档、做网站、输出方案框架,很多事情都能干。后来我也陆续使用过其他 AI 编程工具。

但是等我真正用上 Codex 以后,前面的很多“虾”和“马”等工具就很少再用了。

上个月,在整理一次会议纪要时,我彻底放弃了 OpenClaw 和 Hermes,原因记录在了我的 flomo 中:

/posts/ai/20260718-ai-work-quality-depends-on-people/static/flomo-20260630.jpg

不得不说,工具的差异同样很大。

模型决定 AI 能不能想明白,工具决定它能不能真正把事情做完。

大脑很聪明,但手脚不听使唤,活还是干不好;工具很多,但不会规划、不会判断,也只会忙得团团转。

隐性的差距:你到底是怎么让 AI 干活的

说完显性的,再来说隐性的。

这一部分,我以前其实一直没有怎么察觉。

因为我总觉得,自己和 AI 合作就是聊聊天,没有写什么规范的提示词,也没有掌握多么神奇的方法。我只是很自然地把事情告诉它,然后让它去做。

但我又确实经常能拿到不错的结果,甚至可以确认,有些结果比别人拿到的更好。

这才让我慢慢意识到:人与 AI 沟通的方式,本身就存在很大的差距。

如果简单分成高中低三个层级,我肯定算不上高级,但应该也不至于太低级。

最低一级:只抛出一句空泛的要求

最差的一种沟通方式,就是只给 AI 一句话:

“帮我做个网页。”

“帮我做张封面图。”

“帮我写一个程序。”

我们只要求它交出结果,却没有说清楚这个结果给谁用、解决什么问题、有什么限制、做到什么程度才算完成,甚至连自己真正想要什么都没有想清楚。

这样的任务,不要说交给 AI,换成派给一个真实的人,他也一样会干得乱七八糟。

这就像工作中领导派活,只说“你去把这个做一下”,却不讲背景、不讲目标、不讲标准。下属只能靠猜,最后交出来的结果当然很难让人满意。

所以很多时候,AI 的结果差,并不完全是 AI 不行,而是任务从一开始就没有被说清楚。

我做得稍微好一点:把来龙去脉讲清楚

我做得相对好一点的地方,是会比较详细地告诉 AI:

我遇到了什么问题;

我想获得什么结果;

我现在有哪些原料、工具和环境;

我已经做过哪些尝试;

如果失败了,具体出现了什么错误。

也就是说,我不会只告诉 AI“我要什么”,还会尽量把“为什么要”“现在有什么”以及“之前发生过什么”一起告诉它。

我甚至一度觉得,自己这样和 AI 说话有点啰嗦。

但恰恰是这些前因后果,让一个抽象的任务变得具体。AI 不再只看到终点,也能看到我站在哪里、手里有什么,以及哪些路已经走不通了。

当 AI 对整件事形成了具象的理解,它才更可能真正理解我想要的结果。

因为这种沟通对我来说很自然,所以让我举出“哪一次特别成功”,反而不太容易。但失败的反例倒是很常见。

比如同事发现,让 AI 写代码时,它很容易把所有代码揉在一起。模块没有拆,架构也没有,功能一次性从头堆到底。刚开始似乎能运行,后面却越来越难维护。

问题不一定在于 AI 不会写代码,而在于我们只让它“实现功能”,没有先要求它理解项目、设计架构、划分模块,也没有给它可维护性的约束。

再比如,同事让 AI 做一张效果图,提示词里特别强调“复古”。把提示词交给 AI,最后确实有了复古感,但出来的效果像是 10 年前的设计。

它有没有完成要求?好像完成了。但这样的“复古”,真的是我们想要的吗?当然不是。

一个词写进提示词,不等于需求就被说清楚了。 “复古”可以是材质、色彩和字体上的复古,也可以是审美真的倒退了 10 年。如果我们自己都没有把边界想明白,AI 就只能选择一种它认为合理的解释。

更高一级:用结构改变 AI 思考问题的方式

当然,还有很多人比我用得更好。

比如被称为“提示词之神”的李继刚。我最早是在他和孟岩的播客(E45 孟岩对话李继刚:人何以自处)里知道他的,但当时甚至不知道他在提示词领域这么有名。后来看到他在 GitHub 上发布的 Skill,我才理解,他真正厉害的并不是会写几句华丽的咒语,而是能把一个模糊的问题重新组织成一套结构。

比如他设计的“圆桌讨论”,就跳出了普通的一问一答。

我们平时和 AI 聊天,往往是一直问、一直想获得一个答案。但 AI 给出的这个答案到底好不好,有时候我们自己其实也判断不了。

圆桌讨论的思路,是让多个不同立场、不同专业背景的角色共同审视一个问题。它不是急着给出唯一答案,而是先制造观点之间的碰撞,让答案经受质疑和修正。

这背后体现的,是结构化的提示词、精准的表达,以及对 AI 工作方式更深的理解。

这些能力,我现在还远远谈不上掌握。我能做的,是先尝试把一些常用任务标准化:写清楚源头、现状、目标和过程,约定输入与输出,也尽量不要每次都过于随意地和 AI 聊。

 1
 2
 3
 4
 5
 6
 7
 8
 9
10
11
12
13
14
15
16
17
# Role
你是XXX专家,熟练掌握XXX。

# Context / Background
- 背景信息一
- 背景信息二
- 背景信息三

# Task & Objectives
- 任务要求一
- 任务要求二

# Constraints & Rules
- 规则

# Output Format
- 输出内容

这个模板的效果,我现在还没法下一个特别明确的结论。但至少,这是我从“把话说详细”走向“把问题说得更有结构”的一次尝试。

基础知识仍然重要,因为你要看得出哪里不对

讲到这里,又会引出另一个问题:既然 AI 已经能干活,人类还需要掌握那些基础知识吗?

我的答案是:当然需要。

同事能发现 AI 写的代码全揉在一起,是因为他知道什么叫架构、什么叫模块,也知道这样的代码以后一定很难维护。

如果一个人根本没有这些概念,AI 就算交出一团能暂时运行的代码,他也可能觉得结果很好。

就像教小孩子使用电脑,你让他打开某个“路径”,但他连“路径”这个词是什么都不知道,自然也无法理解应该去哪个目录找文件。

基础知识不只是帮助我们亲自干活,更重要的是帮助我们描述问题、约束过程和判断结果。

AI 越能干,这种能力反而越重要。

因为过去是你自己做,你至少知道自己做了什么;现在是 AI 替你做,如果你既不了解过程,也无法判断结果,那么所谓的高效率,很可能只是更快地制造了一个你看不懂的问题。

和 AI 合作,最重要的三种能力

回到最开始的问题:想让 AI 交出更好的结果,我们到底需要哪些能力?

我现在最看重三种。

第一种,是表达力

也可以叫沟通能力。

你如何把一件事情说清楚,把一个问题讲明白,让 AI 理解你的处境、目标和限制,本质上就是表达能力。

这和日常工作、生活中的沟通并没有什么不同。

你不只需要和 AI 聊天,也需要和同事、家人、合作伙伴沟通。一个能把事情的来龙去脉讲清楚的人,通常也更容易和 AI 合作好。

所以我认为,和 AI 协作的第一步,不是先去背提示词,而是先把天聊好。

把它暂时当成一个人:如果这项任务交给一个不了解背景的新同事,你需要告诉他什么,他才可能把事情做好?

当你能回答这个问题,通常也就知道该怎么和 AI 说了。

第二种,是“钞能力”

这里是钞票的“钞”。

因为更强的模型、更成熟的工具,通常确实要花钱。

年初我花 100 美金买了 Gemini Pro 会员,现在又和别人拼车 GPT 会员。半年时间里,Gemini 大部分时候似乎只是陪我聊天,但这些聊天带来的解决方案、节省的时间和认知提升,绝对不止 100 美金。

现在使用 GPT,不管是整理思路、整理文档、做网页、写程序还是解 Bug,最大的感受不只是“它会做”,而是它让人省心。很多事情不需要我在过程中来回指导,它能直接给出结果。

从产出来看,这些付费非常值得。

当然,“钞能力”也不是盲目烧钱。

比如同事使用 AI 编程工具做 Demo,一上来就做得很大。结果就是:如果完全按照正式 API 费用计算,一天可能就要花掉 200 美金以上。

而我每月十几美元的拼车会员,按官方调用价格计算可能产生了上千美元的效果。

所以,钞能力不只是“你有多少钱”,还包括你是否知道钱应该花在哪里,能不能找到适合自己的使用方式。

该花的钱要舍得花,但不能把消耗 Token 当成生产力。

第三种,是判断力

这可能是三种能力里最重要,也最容易被忽略的一种。

AI 给了你一个结果,你觉得它好,还是不好?

哪里已经达到目标?哪里只是表面完成?哪里应该继续修改?什么时候可以停下来?

这些都需要判断。

前阵子我写了一篇《全文由 AI 生成,一个字都没手打,这还算是我的文章吗?》。以前,对于文章全部由 AI 生成这件事,我一度耿耿于怀,甚至对 AI 写作有一定的偏见。虽然也尝试过让 AI 自动生成文章,但因为不太会判断结果的好坏,我一直不太愿意真正用 AI 辅助写作。

但用上 GPT 5.6 以后,我的想法发生了很大的变化。

一方面,必须承认,更聪明的模型确实能交出更优秀的作品;另一方面,这也让我更加确定:作品最终好不好,仍然需要人来判断。

如果每次和 AI 沟通,我们拿到结果就结束,从来不区分好坏,也不追问还有什么可以改进,那么我们自己的进步一定会很慢。

而当我们不断比较、不断判断、不断修正时,不只是 AI 的结果会变好,我们自己对“什么是好”的理解也会越来越清楚。

在书写本文的过程中,也有一些新的发现和感悟,关于模型,关于工具,关于历史,甚至关于记忆,待下次分享。

AI 普及以后,人的差距不会消失

过去,掌握一种工具本身就是门槛。

现在,AI 把很多工具的使用门槛降下来了。不会写代码的人也能做程序,不会设计的人也能生成图片,不擅长写作的人也能完成文章。

但这并不意味着人与人之间的差距消失了。

恰恰相反,当所有人都能指挥 AI 干活以后,差距会从“会不会操作”,转移到另外一些地方:

你能不能把问题说清楚?

你有没有足够的基础知识约束它?

你愿不愿意为更好的模型和工具付出合理成本?

你能不能判断结果的好坏?

你又是否愿意为最终结果负责?

模型很重要,它决定能力的上限。

工具很重要,它决定执行的效率。

但真正把模型和工具组合起来,让它们理解问题、完成任务,并对结果做出判断的,仍然是人。

所以,要让 AI 交出好的结果,首先要和它聊好天,清楚地表达事情的来龙去脉以及自己期待的结果;然后,尽量用上更好的模型和更合适的工具;最后,还要不断增强自己的知识和判断力。

AI 可以让每个人都拥有一个很能干的助手,但助手最终能干出什么样的活,仍然取决于指挥它的那个人。

RoverTang 支付宝支付宝
RoverTang 微信微信