IA & Automação

什么是AI代理,为什么它改变一切

AI代理(Agent)不是增强版聊天机器人。它们是能够自主感知、决策和行动的程序——不需要我们每一步都按下回车键。这个区别看似微妙,却改变了一切。聊天机器人等待问题然后回答,而代理接收目标后就开始工作。这是”获取信息”和”委派任务”之间的本质差异。

正因如此,AI代理市场从76亿美元起步,预计到2033年将达到1830亿美元,年增长率49.6%。这不是炒作——这是基础设施。但在我们为各种可能性兴奋之前,需要先搞清楚这东西到底是什么。


AI代理,到底是什么

想象一个反应超快的实习生。他收到一个任务,自行查找所需信息,途中做出微小决策,使用各种工具(表格、邮件、浏览器),最终交付结果。他不需要你说”现在打开表格”、”现在发邮件”。他自己会做。

AI代理就是这样运作的。从技术上讲,它在一个四步循环中运行:

  1. 感知(Perception)——从环境中接收信息(一条消息、一封邮件、某个系统的数据)
  2. 推理(Reasoning)——分析上下文并决定下一步
  3. 行动(Action)——执行具体操作(调用API、编写文本、查询数据库)
  4. 学习(Learning)——根据结果调整行为

这个循环持续运行,无需人工干预每一步。据McKinsey数据,62%的组织已经在试验AI代理。但——现实检验来了——只有11%的组织成功将其投入生产(Deloitte)。也就是说,测试的人很多,真正跑起来的很少。


聊天机器人 vs. 代理:没人说清楚的区别

每个人都用过聊天机器人。我们问,它答。结束。但代理是另一回事。两者的差异不是程度上的——是本质上的。

维度聊天机器人(Chatbot)AI代理(AI Agent)
交互方式问题 → 回答目标 → 自主执行
记忆仅限当前对话跨会话持久化
工具使用无(仅输出文本)可调用API、数据库、浏览器
决策能力无(被动响应)规划并决定后续步骤
监督需求每步都需要人工输入在护栏(Guardrails)内自主运行

举个具体例子:如果我让聊天机器人”帮我在LinkedIn上找潜在客户”,它会给出通用建议。如果我让代理做同样的事,它会访问LinkedIn,按我们定义的条件筛选,收集数据,并同步到CRM系统。区别在于:给建议,还是做实事。

不过先别激动——这不意味着代理在任何情况下都更好。据Carnegie Mellon University的研究,当前最优秀的AI代理在真实工作环境中只能完成约30%的任务。也就是说,70%的情况下,它们会卡住、出错或交付不完整的结果。


关键数据

我们来做个简单的数学。以下数据来自严肃研究,均附有来源链接:

这些数字不是为了吓人——而是为了校准预期。大多数项目失败,不是因为技术差,而是因为人们把AI代理当成魔法。装上去,提个模糊的需求,然后期待完美结果。当它不工作时,就怪工具。


为什么80%的项目会失败

我常说,大多数AI项目失败在”花架子”上。人们把精力放在性感的部分(选模型、调Prompt),忽略了真正重要的枯燥工作。据Directual的研究,84%的失败是管理问题,不是技术问题:

这就像造了一辆性能强劲的车,却放在没有道路的荒野里。发动机很好,但没有基础设施,哪儿也去不了。在选择用哪个AI之前,我们需要先解决:数据是否整理好了?流程是否已经梳理清楚?团队是否知道该期待什么?

在Instagram上关注我 @murilloimparavel——我在那里展示我日常使用AI代理的幕后故事,毫无滤镜。


悖论:AI何时赢,何时输

这里有意思了。我们倾向于认为AI在一切方面都优于人类,或者人类在一切方面都优于AI。现实更加混乱——也更加迷人。

Stanford/METR的RE-Bench研究测试了AI代理和人类专家在研究工程任务上的表现。结果:

也就是说,AI在短跑中表现惊人,但在马拉松中完败。为什么?因为在长任务中,错误会指数级累积。每步准确率85%的情况下,一个10步流程的总体成功率只有约20%

还有一个数据每次都让我触动:METR的研究人员对16名经验丰富的开发者在自己的代码仓库中进行了246项真实任务的测试。结果呢?使用AI后,他们反而慢了19%。最荒诞的是:开发者们以为自己快了20%。感知与现实之间相差将近40个百分点。

这印证了MIT发表在《Nature Human Behaviour》的元分析结论——该研究分析了106个实验:平均而言,”人类+AI”的组合表现劣于单独使用最优方案(人类或AI中较好的那个)。

维度AI胜出人类胜出
任务时长短任务(< 2小时)长任务(> 8小时)
复杂度定义明确、重复性强开放性、模糊性高
受益最多的人初学者(+34%)专家(最高-19%)
创造力超越人类平均水平人类前10%超越所有AI
环境受控/实验室真实/复杂

半人马、赛博格与自动化者

既然不能简单地开启AI然后走开,那该怎么正确使用?Harvard、BCG、Wharton和MIT联合开展的一项研究对758名BCG咨询顾问进行了调查,识别出三种”使用物种”:

半人马(Centaur)——战略性分工。”这部分我来做,那部分让AI做。”有意识地交替切换。就像二重唱搭档,每人都知道该在什么时候出声。

赛博格(Cyborg)——将AI融入每一个步骤。共同创造、持续精炼、迭代推进。没有明确的分界线——是一种融合。

自动化者(Self-Automator)——把一切都委托给AI,不加质疑地接受输出结果。这类人在AI”锯齿边界(Jagged Frontier)”之外的任务中失败最多

锯齿边界(Jagged Frontier)是一个核心概念:AI并非均匀地好或坏。在边界内,使用AI的顾问速度提升25%,质量提升40%。在边界外,他们比不用AI的人差了19个百分点。

教训是什么?不是该不该用AI,而是要清楚地知道边界在哪里——在你自己的场景中——并且对AI还无法胜任的地方,愿意做那些硬核工作。

我写过一篇关于如何使用9 Minds框架在实践中编排多个代理的文章——如果这个话题让你感兴趣,值得一读。


如何入门(不踩坑)

给想进入这个世界但不想成为失败统计数字的新手的简明指南:

  1. 从一个任务开始,而不是一个平台。找到一个重复性的、耗时的流程。只自动化它。
  2. 数据优先。如果数据是一团糟,代理产出的只是更精美的垃圾。先整理数据。
  3. 先设护栏(Guardrails),再谈自主。定义代理能做什么、不能做什么。没有这个,就是把实习生放进公司乱跑。
  4. 前后对比,量化衡量。没有指标,就无法判断是否有效。做个简单计算:以前做这件事花多少时间?现在花多少时间?
  5. 从”半人马”模式开始。把AI擅长的和你擅长的分开处理。等搞清楚边界在哪里之后,再进化为”赛博格”。

如果这些内容对你有价值,分享给需要听到这些的人。如果你想探讨AI代理如何在你的业务中落地,欢迎在Instagram上找我聊。


常见问题:关于AI代理的FAQ

AI代理和聊天机器人有什么区别?
聊天机器人回答问题——你输入,它输出文字。AI代理接收目标,然后自主工作以实现它,使用工具、做出决策、执行操作,不需要每步都有人工输入。区别在于:获取信息,还是委派任务。

AI代理会取代工作岗位吗?
部分会。据NBER(2026年2月)的数据,管理层预计未来3年AI将使生产力提升1.4%,但就业仅减少0.7%。我们观察到的模式是:AI改变职能,而不是消除职能。初学者获益更多(生产力+34%),而专家有时因过度依赖工具反而变慢(-19%)。

为什么那么多AI项目会失败?
因为84%的失败是管理问题,不是技术问题。最常见的原因:没有清晰指标(73%),基础投入不足如数据质量(68%),以及在不到6个月内失去领导层支持(56%)。据Gartner,超过40%的智能代理AI项目将在2027年前被取消。

AI何时优于人类,何时不是?
AI在短任务(< 2小时)、定义明确且重复性强的任务中胜出。人类在长任务(> 8小时)、模糊性高、需要情境判断的任务中胜出。Stanford/METR的研究表明,AI代理在2小时任务中得分是人类的4倍,但在32小时任务中人类得分是AI的2倍。

如何开始在我的业务中使用AI代理?
从一个具体的、重复性的任务开始——不要试图一次性自动化所有事情。先整理数据,定义清晰的护栏(代理能做什么、不能做什么),并量化前后对比。先以”半人马(Centaur)”模式运行(你和AI分担任务),然后循序渐进地演进。

喜欢吗?在邮箱中获取更多

每周新文章。无垃圾邮件。

订阅 →