# AI 干活的好与坏，最后还是取决于人


现在，AI 都能干活，谁也都能指挥 AI 干活。

这当然没有错。

但真正用起来以后就会发现：**同样是让 AI 干活，不同的人拿到的结果，差别还真是挺大的。**

有人让 AI 做个网页，几分钟后就得到一个能用、能改、结构也清楚的产品；有人同样让 AI 做网页，得到的却只是一个看起来热闹、实际无法维护的 Demo。

有人让 AI 写文章，最后写出了自己的经历和观点；有人也让 AI 写文章，生成的却是一篇正确、完整，但和任何人都没有关系的标准答案。

为什么会这样？

我在使用 AI 的过程中，常常觉得 AI 干的活挺好，甚至比我自己干得更好。但现在回头看，这个“好”其实来自两类原因：一类是显性的，是我们都看得见的模型和工具；另一类是隐性的，是站在 AI 后面的那个人。

## 显性的差距：大脑和手脚

先说最容易看见的。

### 模型，就是 AI 的大脑

如果把 AI 当成一个干活的人，模型就像它的大脑，在很大程度上决定了它能不能理解问题、能把事情想多深，以及最后能交出什么质量的结果。

说得直接一点，就是“智商”。

所以大家才会持续讨论中美大模型的能力差距，讨论什么时候能赶上，也会不断比较各个模型谁更强、谁更好用。

我自己确实试过很多模型。

我曾经在嵌入式设备上跑 4B、9B 的模型，结果基本没法真正干活；后来又自建过 35B 的模型，已经算勉强能用，但还是觉得不够爽。再往后，我开始用国产模型、公司自建模型，买了 Gemini 会员，后来又用上了 GPT 会员。

每升级一次，感受都很明显。

**用过能力更强的模型以后，确实就不再愿意回去用“智商低”的模型了。**

去年底，我在 flomo 里写过这样一段话：

![](static/flomo-20251224.jpg)

半年多过去了，我对这件事又有了新的认识，连排名也再次发生了变化。如果现在再排一次，我应该会把 ChatGPT 放到 Gemini 前面。

这当然说明模型进步得很快，也说明我们今天对某个模型的判断，很可能过几个月就会变化。但有一点没有变：**模型能力的差距，会非常直接地反映在结果上。**

更聪明的模型往往能更快地理解上下文，也更容易发现你没有明说的需求。它不只是把命令执行完，而是能理解你为什么要做这件事。

但再聪明的模型，也不能替你决定什么才算是“好”。它可以少问你几个问题，却不能替你定义真正的目标。

这就是大脑的差距。

### 工具，是 AI 干活的手脚

但有了大脑，还不够。

最早的 AI 主要就是聊天。你问一句，它答一句。哪怕模型很聪明，它也只能坐在那里和你讨论，不能真的替你把文件改好、把程序跑起来、把网页做出来。

后来出现了越来越多能调用工具、访问文件、执行命令的 AI Agent，情况就完全不同了。

过年前后，我开始使用“龙虾”，当时觉得特别爽。它可以帮我整理会议纪要、分析代码、写文档、做网站、输出方案框架，很多事情都能干。后来我也陆续使用过其他 AI 编程工具。

但是等我真正用上 Codex 以后，前面的很多“虾”和“马”等工具就很少再用了。

上个月，在整理一次会议纪要时，我彻底放弃了 OpenClaw 和 Hermes，原因记录在了我的 flomo 中：

![](static/flomo-20260630.jpg)

不得不说，工具的差异同样很大。

**模型决定 AI 能不能想明白，工具决定它能不能真正把事情做完。**

大脑很聪明，但手脚不听使唤，活还是干不好；工具很多，但不会规划、不会判断，也只会忙得团团转。

## 隐性的差距：你到底是怎么让 AI 干活的

说完显性的，再来说隐性的。

这一部分，我以前其实一直没有怎么察觉。

因为我总觉得，自己和 AI 合作就是聊聊天，没有写什么规范的提示词，也没有掌握多么神奇的方法。我只是很自然地把事情告诉它，然后让它去做。

但我又确实经常能拿到不错的结果，甚至可以确认，有些结果比别人拿到的更好。

这才让我慢慢意识到：**人与 AI 沟通的方式，本身就存在很大的差距。**

如果简单分成高中低三个层级，我肯定算不上高级，但应该也不至于太低级。

### 最低一级：只抛出一句空泛的要求

最差的一种沟通方式，就是只给 AI 一句话：

“帮我做个网页。”

“帮我做张封面图。”

“帮我写一个程序。”

我们只要求它交出结果，却没有说清楚这个结果给谁用、解决什么问题、有什么限制、做到什么程度才算完成，甚至连自己真正想要什么都没有想清楚。

这样的任务，不要说交给 AI，换成派给一个真实的人，他也一样会干得乱七八糟。

这就像工作中领导派活，只说“你去把这个做一下”，却不讲背景、不讲目标、不讲标准。下属只能靠猜，最后交出来的结果当然很难让人满意。

所以很多时候，AI 的结果差，并不完全是 AI 不行，而是任务从一开始就没有被说清楚。

### 我做得稍微好一点：把来龙去脉讲清楚

我做得相对好一点的地方，是会比较详细地告诉 AI：

我遇到了什么问题；

我想获得什么结果；

我现在有哪些原料、工具和环境；

我已经做过哪些尝试；

如果失败了，具体出现了什么错误。

也就是说，我不会只告诉 AI“我要什么”，还会尽量把“为什么要”“现在有什么”以及“之前发生过什么”一起告诉它。

我甚至一度觉得，自己这样和 AI 说话有点啰嗦。

但恰恰是这些前因后果，让一个抽象的任务变得具体。AI 不再只看到终点，也能看到我站在哪里、手里有什么，以及哪些路已经走不通了。

**当 AI 对整件事形成了具象的理解，它才更可能真正理解我想要的结果。**

因为这种沟通对我来说很自然，所以让我举出“哪一次特别成功”，反而不太容易。但失败的反例倒是很常见。

比如同事发现，让 AI 写代码时，它很容易把所有代码揉在一起。模块没有拆，架构也没有，功能一次性从头堆到底。刚开始似乎能运行，后面却越来越难维护。

问题不一定在于 AI 不会写代码，而在于我们只让它“实现功能”，没有先要求它理解项目、设计架构、划分模块，也没有给它可维护性的约束。

再比如，同事让 AI 做一张效果图，提示词里特别强调“复古”。把提示词交给 AI，最后确实有了复古感，但出来的效果像是 10 年前的设计。

它有没有完成要求？好像完成了。但这样的“复古”，真的是我们想要的吗？当然不是。

**一个词写进提示词，不等于需求就被说清楚了。** “复古”可以是材质、色彩和字体上的复古，也可以是审美真的倒退了 10 年。如果我们自己都没有把边界想明白，AI 就只能选择一种它认为合理的解释。

### 更高一级：用结构改变 AI 思考问题的方式

当然，还有很多人比我用得更好。

比如被称为“提示词之神”的李继刚。我最早是在他和孟岩的播客([E45 孟岩对话李继刚：人何以自处](https://youzhiyouxing.cn/n/materials/2141))里知道他的，但当时甚至不知道他在提示词领域这么有名。后来看到他在 GitHub 上发布的 Skill，我才理解，他真正厉害的并不是会写几句华丽的咒语，而是能把一个模糊的问题重新组织成一套结构。

比如他设计的“圆桌讨论”，就跳出了普通的一问一答。

我们平时和 AI 聊天，往往是一直问、一直想获得一个答案。但 AI 给出的这个答案到底好不好，有时候我们自己其实也判断不了。

圆桌讨论的思路，是让多个不同立场、不同专业背景的角色共同审视一个问题。它不是急着给出唯一答案，而是先制造观点之间的碰撞，让答案经受质疑和修正。

这背后体现的，是结构化的提示词、精准的表达，以及对 AI 工作方式更深的理解。

这些能力，我现在还远远谈不上掌握。我能做的，是先尝试把一些常用任务标准化：写清楚源头、现状、目标和过程，约定输入与输出，也尽量不要每次都过于随意地和 AI 聊。

```
# Role
你是XXX专家，熟练掌握XXX。

# Context / Background
- 背景信息一
- 背景信息二
- 背景信息三

# Task & Objectives
- 任务要求一
- 任务要求二

# Constraints & Rules
- 规则

# Output Format
- 输出内容
```

这个模板的效果，我现在还没法下一个特别明确的结论。但至少，这是我从“把话说详细”走向“把问题说得更有结构”的一次尝试。

## 基础知识仍然重要，因为你要看得出哪里不对

讲到这里，又会引出另一个问题：既然 AI 已经能干活，人类还需要掌握那些基础知识吗？

我的答案是：当然需要。

同事能发现 AI 写的代码全揉在一起，是因为他知道什么叫架构、什么叫模块，也知道这样的代码以后一定很难维护。

如果一个人根本没有这些概念，AI 就算交出一团能暂时运行的代码，他也可能觉得结果很好。

就像教小孩子使用电脑，你让他打开某个“路径”，但他连“路径”这个词是什么都不知道，自然也无法理解应该去哪个目录找文件。

**基础知识不只是帮助我们亲自干活，更重要的是帮助我们描述问题、约束过程和判断结果。**

AI 越能干，这种能力反而越重要。

因为过去是你自己做，你至少知道自己做了什么；现在是 AI 替你做，如果你既不了解过程，也无法判断结果，那么所谓的高效率，很可能只是更快地制造了一个你看不懂的问题。

## 和 AI 合作，最重要的三种能力

回到最开始的问题：想让 AI 交出更好的结果，我们到底需要哪些能力？

我现在最看重三种。

### 第一种，是表达力

也可以叫沟通能力。

你如何把一件事情说清楚，把一个问题讲明白，让 AI 理解你的处境、目标和限制，本质上就是表达能力。

这和日常工作、生活中的沟通并没有什么不同。

你不只需要和 AI 聊天，也需要和同事、家人、合作伙伴沟通。一个能把事情的来龙去脉讲清楚的人，通常也更容易和 AI 合作好。

所以我认为，和 AI 协作的第一步，不是先去背提示词，而是先把天聊好。

把它暂时当成一个人：如果这项任务交给一个不了解背景的新同事，你需要告诉他什么，他才可能把事情做好？

当你能回答这个问题，通常也就知道该怎么和 AI 说了。

### 第二种，是“钞能力”

这里是钞票的“钞”。

因为更强的模型、更成熟的工具，通常确实要花钱。

年初我花 100 美金买了 Gemini Pro 会员，现在又和别人拼车 GPT 会员。半年时间里，Gemini 大部分时候似乎只是陪我聊天，但这些聊天带来的解决方案、节省的时间和认知提升，绝对不止 100 美金。

现在使用 GPT，不管是整理思路、整理文档、做网页、写程序还是解 Bug，最大的感受不只是“它会做”，而是它让人省心。很多事情不需要我在过程中来回指导，它能直接给出结果。

从产出来看，这些付费非常值得。

当然，“钞能力”也不是盲目烧钱。

比如同事使用 AI 编程工具做 Demo，一上来就做得很大。结果就是：如果完全按照正式 API 费用计算，一天可能就要花掉 200 美金以上。

而我每月十几美元的拼车会员，按官方调用价格计算可能产生了上千美元的效果。

所以，钞能力不只是“你有多少钱”，还包括你是否知道钱应该花在哪里，能不能找到适合自己的使用方式。

**该花的钱要舍得花，但不能把消耗 Token 当成生产力。**

### 第三种，是判断力

这可能是三种能力里最重要，也最容易被忽略的一种。

AI 给了你一个结果，你觉得它好，还是不好？

哪里已经达到目标？哪里只是表面完成？哪里应该继续修改？什么时候可以停下来？

这些都需要判断。

前阵子我写了一篇《[全文由 AI 生成，一个字都没手打，这还算是我的文章吗？](https://mp.weixin.qq.com/s/0lmCM4DuPNFPhjF3KkBPQw)》。以前，对于文章全部由 AI 生成这件事，我一度耿耿于怀，甚至对 AI 写作有一定的偏见。虽然也尝试过让 AI 自动生成文章，但因为不太会判断结果的好坏，我一直不太愿意真正用 AI 辅助写作。

但用上 GPT 5.6 以后，我的想法发生了很大的变化。

一方面，必须承认，更聪明的模型确实能交出更优秀的作品；另一方面，这也让我更加确定：作品最终好不好，仍然需要人来判断。

如果每次和 AI 沟通，我们拿到结果就结束，从来不区分好坏，也不追问还有什么可以改进，那么我们自己的进步一定会很慢。

而当我们不断比较、不断判断、不断修正时，不只是 AI 的结果会变好，我们自己对“什么是好”的理解也会越来越清楚。

在书写本文的过程中，也有一些新的发现和感悟，关于模型，关于工具，关于历史，甚至关于记忆，待下次分享。

## AI 普及以后，人的差距不会消失

过去，掌握一种工具本身就是门槛。

现在，AI 把很多工具的使用门槛降下来了。不会写代码的人也能做程序，不会设计的人也能生成图片，不擅长写作的人也能完成文章。

但这并不意味着人与人之间的差距消失了。

恰恰相反，当所有人都能指挥 AI 干活以后，差距会从“会不会操作”，转移到另外一些地方：

你能不能把问题说清楚？

你有没有足够的基础知识约束它？

你愿不愿意为更好的模型和工具付出合理成本？

你能不能判断结果的好坏？

你又是否愿意为最终结果负责？

模型很重要，它决定能力的上限。

工具很重要，它决定执行的效率。

但真正把模型和工具组合起来，让它们理解问题、完成任务，并对结果做出判断的，仍然是人。

所以，要让 AI 交出好的结果，首先要和它聊好天，清楚地表达事情的来龙去脉以及自己期待的结果；然后，尽量用上更好的模型和更合适的工具；最后，还要不断增强自己的知识和判断力。

**AI 可以让每个人都拥有一个很能干的助手，但助手最终能干出什么样的活，仍然取决于指挥它的那个人。**


---

> 作者: [RoverTang](https://rovertang.com)  
> URL: https://rovertang.com/posts/ai/20260718-ai-work-quality-depends-on-people/  

