从调用大模型到自主智能体:AI 应用的四级自主性光谱

目录

过去几年,人工智能的发展非常快。

最早,我们看到的是各种接入大语言模型的应用:智能客服、AI 翻译、文章摘要、智能搜索。后来,又出现了 AI 工作流、AI Agent(智能体)、多智能体协作等概念。

热门的通用AI产品国外有Claude、ChatGPT等等,国内有WorkBuddy、豆包、千问办公等等。还有企业内部有自建或外部的各种各样AI应用

这些产品都使用大语言模型,但它们的工作方式可能有很大不同。

有的只是把问题交给大模型,拿到答案后展示给用户;有的能让大模型判断下一步该做什么;还有的甚至可以把一项复杂任务交给 AI,让它自己想办法完成。

那么,它们之间究竟有什么区别?

我认为,可以从一个很简单的角度理解:

在一个 AI 应用中,究竟是谁决定下一步该做什么?是程序员事先写好的程序,还是大模型自己?

沿着这个问题,我们可以把 AI 应用划分为四个等级:

  • L1:能力调用——程序调用 AI,让 AI 完成一个具体工作。
  • L2:智能决策——AI 参与判断,但整体流程仍由程序控制。
  • L3:动态编排——AI 可以自己选择工具,决定下一步怎么做。
  • L4:自主执行——AI 围绕一个任务目标,自主规划、执行、检查和调整。

这四个等级并不是某家厂商发布的统一行业标准,而是我结合目前 AI 应用的技术实践,整理出来的一种理解方式。

它们之间最重要的差别,并不是用了什么模型,也不是用了多少个 AI,而是 AI 对整个工作流程拥有多大的决定权。

一、L1:能力调用——AI 是一个聪明的工具

这是最容易理解、也最常见的 AI 应用形式。

假设一家新闻网站增加了一个功能:用户打开一篇很长的新闻,点击“AI 总结”,系统就自动生成一段几百字的摘要。

它的工作过程非常简单:

  1. 用户点击“AI 总结”。
  2. 网站把新闻内容发送给大模型。
  3. 大模型生成摘要。
  4. 网站把摘要展示给用户。

整个过程中,AI 只负责一件事:把文章总结好。

至于什么时候调用 AI、把什么内容交给 AI、拿到结果后怎么展示,全部由网站原来的程序决定。

类似的例子还有很多:

  • 邮件软件中的“AI 润色”按钮。
  • 浏览器中的“翻译这个网页”功能。
  • 电商平台自动生成商品介绍。
  • 办公软件根据一段文字生成标题。
  • 客服系统调用 AI 生成一段建议回复。

这些应用可能非常实用,但它们有一个共同特点:

AI 只负责完成一个具体的工作,并不决定整个应用接下来做什么。

我们可以把 L1 理解为:原来的软件增加了一件非常聪明的工具。

二、L2:智能决策——AI 开始参与判断

到了第二级,AI 不再只是生成文字,而是开始参与业务决策。

假设一家电商平台每天收到大量售后申请。

过去,平台可能要求用户先选择问题类型:退款、退货、物流异常、商品损坏等。

现在,平台可以让用户直接用自然语言描述问题:

“我上周买的电饭煲,今天打开以后发现内胆有一道裂缝,我想换一个。”

系统把这段话交给大模型,让它判断用户究竟想办理什么业务。

大模型可能返回:

  • 问题类型:商品质量问题。
  • 用户诉求:换货。

然后,系统根据这个判断,进入预先设计好的换货流程。

这里发生了一个重要变化。

在 L1 中,AI 只负责生成内容;在 L2 中,AI 的输出已经能够影响程序接下来走哪条路。

不过,这个变化仍然是有限的。

例如,平台可能只允许 AI 从“退款、退货、换货、人工客服”四个选项中选择。

AI 可以决定选择哪一项,但不能自己发明一个新的售后流程,也不能随意调用其他业务系统。

类似的应用还有:

  • 银行根据客户描述,自动判断需要办理什么业务。
  • 企业根据邮件内容,自动决定分配给哪个部门。
  • 数据分析系统根据用户的问题,判断应该查询哪张数据表。
  • 客服系统判断问题是否复杂,决定由 AI 回答还是转人工。

L2 的关键是:AI 获得了局部决策权,但整个业务流程仍然由程序控制。

这种方式特别适合企业应用,因为企业既希望利用 AI 灵活理解自然语言,又希望业务执行过程保持稳定、可预测。

三、L3:动态编排——AI 开始决定下一步怎么做

到了第三级,变化就更明显了。

假设你对一个 AI 助手说:

“帮我查一下北京明天的天气。如果下雨,帮我找几个适合带孩子去的室内景点。”

如果采用 L2 的方式,程序员可能需要提前设计好完整的流程:

先查天气,再判断是否下雨,如果下雨就查询景点,最后生成回复。

但在 L3 中,程序员可以不必把每一步都写死。

系统向 AI 提供几个可以使用的工具,例如:

  • 查询天气。
  • 搜索景点。
  • 查询地图。
  • 获取景点介绍。

AI 根据用户的要求,自行决定先使用哪个工具、得到结果后是否需要调用其他工具,以及什么时候结束。

例如,AI 可能先调用天气工具,发现明天有雨;随后搜索室内景点;再查询几个景点的位置;最后整理出一份建议。

如果天气预报显示不下雨,AI 也可能直接告诉用户不需要特别安排室内活动。

在这个过程中,AI 不再只是从几个固定选项中选择,而是能够根据中间结果,动态决定后续操作。

类似的例子还有:

  • AI 助手根据问题,自行选择搜索网页、查询数据库或者使用计算器。
  • AI 客服根据客户诉求,选择查询订单、物流、退款政策等工具。
  • AI 数据助手根据问题,选择查询数据、执行计算、生成图表。
  • AI 编程助手根据开发者的问题,选择搜索代码、读取文件、运行测试。

这里涉及一个重要概念:Tool Calling(工具调用)。

大模型本身并不能直接查询天气、读取企业数据库或操作文件。开发者需要向它提供相应的工具接口,并由程序实际执行工具调用。

但在 L3 中,模型已经可以决定使用什么工具,以及下一步需要做什么。

L3 的关键是:程序提供工具和规则,AI 在这些规则之内动态编排执行步骤。

需要注意的是,动态编排并不意味着 AI 可以不受限制地操作系统。它能使用哪些工具、能读取哪些数据、哪些操作需要审批,仍然可以由程序严格控制。

四、L4:自主执行——AI 开始负责完成整个任务

前三个等级,AI 的自主性逐渐增强。

到了第四级,我们不再只是让 AI 回答问题、做出判断或选择工具,而是直接交给它一个相对完整的任务。

例如,你对一个 AI 编程助手说:

“帮我给这个网站增加一个用户登录功能,包括密码登录、错误提示和必要的测试。”

如果采用 L3 的方式,AI 可能根据指令选择读取文件、修改代码、运行命令等工具。

但在 L4 中,我们希望它进一步具备完成整个任务的能力。

它可能会:

  1. 先查看项目结构,理解已有代码。
  2. 制定一个实现计划。
  3. 修改后端接口和前端页面。
  4. 编写相应的测试。
  5. 运行测试,发现错误。
  6. 根据错误信息修改代码。
  7. 再次验证,直到达到预定的完成标准。
  8. 向用户汇报结果,以及仍然存在的问题。

这时候,AI 已经不只是决定下一次调用哪个工具,而是在围绕任务目标,持续安排和调整自己的工作。

类似的场景还有:

  • 深度研究:用户要求研究一个行业的发展情况。AI 自行搜索资料、整理信息、交叉验证、发现信息不足后继续调查,最后形成报告。
  • 数据分析:用户提供一份销售数据,要求找出业绩下降的原因。AI 自行检查数据、提出假设、进行计算、生成图表,并验证分析结论。
  • 软件开发:用户提出一个功能需求,AI 自行阅读代码、修改程序、执行测试、修复问题,最终交付修改结果。

L4 与 L3 的边界,有时并不十分清晰。

一个使用工具的 AI,可能在某个任务中表现出很强的自主性;另一个看起来复杂的 AI 工作流,也可能只是执行事先规定好的步骤。

因此,我更倾向于用下面这个问题判断:

AI 是否不仅决定下一步做什么,还能够围绕整个任务目标,自主安排工作、检查结果并在必要时调整计划?

如果答案是肯定的,那么这个应用就更接近 L4。

当然,自主执行不意味着 AI 必须完全脱离人类监督。对于转账、删除重要数据、发布生产系统等高风险操作,仍然可以要求用户审批。

五、四个等级,究竟有什么不同?

回过头来看,这四个等级实际上描述了一个连续变化的过程。

等级 AI 负责什么 程序负责什么
L1 能力调用 完成一次具体工作 决定整个流程
L2 智能决策 判断应该走哪条分支 规定可选择的流程
L3 动态编排 选择工具和后续步骤 提供工具、权限与执行环境
L4 自主执行 规划、执行、验证和调整任务 提供目标约束、运行环境与监督机制

从 L1 到 L4,最重要的变化就是:

AI 从一个被程序调用的工具,逐渐成为能够参与甚至主导工作流程的执行者。

但这里需要特别强调:这不是一条所有软件都必须不断升级的道路。

一个能够自动总结新闻的 L1 应用,完全可能已经很好地满足用户需求。

一个负责银行转账审批的系统,也未必应该让 AI 自由决定整个流程。

在某些场景中,确定性和可控性比自主性更重要。

因此,L4 并不天然比 L2 更好。真正重要的是,选择与业务需求相匹配的自主性等级。

六、这不是凭空创造的分类

关于 AI 应用的自主性,业界已经有不少类似讨论。

例如,Anthropic 在《Building Effective Agents》中,区分了 Workflow(工作流)和 Agent(智能体)。

它认为,Workflow 通常由预先定义的代码路径来编排,而 Agent 则让大模型动态决定工作过程以及工具使用。

Hugging Face 也提出过 Levels of Agency(自主性等级)的概念,根据大模型对系统执行流程的影响程度,区分不同类型的 AI 应用。

Microsoft 等厂商也在讨论从确定性程序编排到模型主导编排的连续变化。

这些讨论虽然在具体分级数量、名称和边界上有所不同,但它们都指向一个重要问题:

大模型究竟在多大程度上拥有系统的流程控制权?

本文提出的四级光谱,正是尝试用一种更容易理解的方式,把这种变化描述清楚。

参考资料

七、给开发者的坐标参考

讲了这么多等级,说到底它有什么用?

我觉得它更像一张坐标图,帮你回答一个很实际的问题:我正在做的这件事,AI 到底该拿到多大的决定权。 下面按两种最常见的场景给一点参考。

场景一:给现有系统加 AI 功能——大概率落在 L1 到 L3

给一个已经在跑的系统加能力时,先别急着问“要不要做 Agent”,而是问:这个新功能,把 AI 放在了流程的哪个位置?

你想要的 对应等级 判断依据
新增一个聪明的动作,流程不变 L1 输入输出明确,只是原来由人做的某一步换成 AI 做
让 AI 接住模糊输入,但走哪条路仍由程序定 L2 原来靠人判断或规则匹配的分支,现在交给 AI 理解
让 AI 根据中间结果自己串工具、排步骤 L3 分支太多、穷举写死不划算,且工具边界清晰

一个很实用的判断法:加这个功能,是加了一个动作,还是让 AI 选一条既有分支,还是让 AI 自己排步骤? 分别是 L1、L2、L3。

建议是——能停在低层就别急着上高层。 每往上一级,AI 的决定权变大,你为“可控、可测、可信”付出的代价也随之变大。第一版通常停在 L1 或 L2 就够了。

场景二:开发企业智能体——L2 到 L4 怎么选

这一档要选的是“让 AI 当多大程度的执行者”,看两件事就够:任务的可预测性,以及失败的代价。

  • L2: 流程受监管、结果必须可复现可审计(审批、合规、财务)——老老实实停在 L2,让 AI 只做判断,流程由程序兜底。
  • L3: 目标清楚但路径多变、工具边界明确(客服、数据查询、运维操作)——放开 L3,让 AI 自己编排,但工具与权限卡死。
  • L4: 要整体交付、需要多步迭代和自我纠错,且能接受过程不完全可预测(研发、深度研究)——可以上 L4,但必须同时给出完成标准和监督机制。

一句话:不是越高越好,而是匹配业务。 决定权每高一级,就要多配一套权限控制、结果验证和审计手段,否则自主性就变成了不可控。

结语

过去几十年,软件流程主要由程序员事先写死:定义规则、设计分支、安排顺序。大模型带来的是另一种可能——不必规定所有步骤,而是把一部分判断权、编排权甚至执行权交给 AI。

但这不意味着传统程序会消失。恰恰相反,AI 自主性越高,权限控制、数据管理、运行环境、结果验证和安全监督就越重要。未来的软件,很可能是确定性流程与 AI 动态执行过程按业务需要灵活组合。

所以这篇文章真正的价值,不是判断一个产品算不算 Agent,而是帮你先定位、再选型:哪些工作该交给 AI、交到哪一级,哪些仍然该由传统程序负责。