核心概念

智能体循环

智能体循环是指 AI 智能体反复执行『感知—规划—行动—观察』这个周期,把一个目标一步步变成具体动作,每次都先看结果再决定下一步。

感知规划行动观察
每一轮先感知状态、规划动作、执行动作,再观察结果,然后进入下一轮。

几乎所有 AI 智能体底层用的都是同一套基本机制:先看看当前是什么情况,决定要采取什么动作,通过工具真正去执行这个动作,然后再看看这个动作造成了什么结果——再决定下一步该做什么。这个不断重复的周期就是『智能体循环』,正是它把一个『自己只会吐文字』的语言模型,变成了能真正完成多步骤任务的东西。

这个循环一般会一直跑到满足以下几种情况之一才停:目标看起来已经达成了、碰到了步数或时间上限、智能体判断自己卡住了需要找人帮忙,或者被人手动打断。每一轮都会重新读取当前状态,而不是死板地照着预先写好的脚本走,这正是智能体能在工具调用失败、返回了意外数据、或者发现原计划得改的时候,及时调整的原因。

这个循环是本站大多数其他词条背后的机制:planning(任务规划)说的是『决定下一步动作』这一环节本身可以再拆成更细的子步骤;reflection-self-correction(自我反思与自我纠错)说的是有些循环会在真正执行动作之前,多加一道评估环节;react-prompting(ReAct)说的是一种在循环中组织模型自身推理过程的知名具体方法。

怎么运作

典型的一轮循环包含图中这四步:感知——读取当前状态,可能是一个文件的内容、一次接口调用的响应,或者上一条命令的输出;规划——结合这个状态和整体目标,决定下一步做什么(这可以只是一个简单判断,也可以是 planning 里说的更细致的多步骤过程);行动——真正调用工具、运行命令,或者做一次编辑,把这个决定落实下去;观察——读回发生了什么,包括出错信息,再把这个结果喂给下一轮的感知步骤。

让它成为一个『循环』而不是一次性流水线的关键在于:每一轮的观察结果会变成下一轮的起点。如果行动这一步执行的测试失败了,下一轮的感知步骤就会看到这个失败,规划步骤就能决定去修它,而不是傻乎乎地继续往下走。循环会在成功时结束,在触发系统设定的上限时结束(最多多少步、最长多久、最多花多少),或者在智能体判断自己需要找人帮忙时结束——具体这种『交给人』的设计一般怎么做,见 human-in-the-loop

举个例子

一个修复构建失败的智能体,其循环可能是:感知(读取 CI 的失败日志)、规划(判断是某个依赖版本过旧导致测试失败)、行动(改依赖版本,重新跑测试)、观察(看到测试通过了)——到这里因为目标条件满足,循环结束。如果测试因为别的原因又失败了,下一轮的感知步骤就会捕捉到这一点,循环继续。

和相关概念的区别

『智能体循环』经常和 react-prompting(ReAct)搞混:智能体循环是几乎所有智能体都以某种形式实现的通用『感知—规划—行动—观察』机制,而 ReAct 是一种具体的、已经发表过的提示方法,专门让模型在循环里把自己的推理(『思考』)和行动交替写出来——ReAct 是实现循环里某一部分的一种具体技巧,不等于循环本身。

常见误解

常被以为: 智能体循环就是不断重复同一个动作。
实际上: 每一轮都会重新读取当前状态,并可能改变下一步的做法;循环是根据新信息不断调整的,而不是死板地重复一套固定脚本。
常被以为: 循环跑的轮数越多,说明智能体越『认真』、效果越好。
实际上: 卡在很多轮却没有进展,往往说明智能体没能推进任务或者陷在某个错误里反复打转,而不是更认真;正因如此大多数实现都会给循环轮数设上限。

常见问题

什么是智能体循环?
是 AI 智能体反复执行的『感知—规划—行动—观察』周期:读取当前状态、决定动作、通过工具执行、检查结果,再决定下一步该做什么。
智能体循环什么时候会停下来?
通常是目标看起来已经达成、触发了步数/时间/花费上限,或者智能体判断自己卡住了需要人来处理。
ReAct 和智能体循环是一回事吗?
不是,智能体循环是通用的『感知—规划—行动—观察』机制,而 ReAct(见 react-prompting)是在这个循环中组织模型推理过程的一种具体方法。

最近核实: 2026-08-28

相关术语