智能体循环
智能体循环是指 AI 智能体反复执行『感知—规划—行动—观察』这个周期,把一个目标一步步变成具体动作,每次都先看结果再决定下一步。
几乎所有 AI 智能体底层用的都是同一套基本机制:先看看当前是什么情况,决定要采取什么动作,通过工具真正去执行这个动作,然后再看看这个动作造成了什么结果——再决定下一步该做什么。这个不断重复的周期就是『智能体循环』,正是它把一个『自己只会吐文字』的语言模型,变成了能真正完成多步骤任务的东西。
这个循环一般会一直跑到满足以下几种情况之一才停:目标看起来已经达成了、碰到了步数或时间上限、智能体判断自己卡住了需要找人帮忙,或者被人手动打断。每一轮都会重新读取当前状态,而不是死板地照着预先写好的脚本走,这正是智能体能在工具调用失败、返回了意外数据、或者发现原计划得改的时候,及时调整的原因。
这个循环是本站大多数其他词条背后的机制:planning(任务规划)说的是『决定下一步动作』这一环节本身可以再拆成更细的子步骤;reflection-self-correction(自我反思与自我纠错)说的是有些循环会在真正执行动作之前,多加一道评估环节;react-prompting(ReAct)说的是一种在循环中组织模型自身推理过程的知名具体方法。
怎么运作
典型的一轮循环包含图中这四步:感知——读取当前状态,可能是一个文件的内容、一次接口调用的响应,或者上一条命令的输出;规划——结合这个状态和整体目标,决定下一步做什么(这可以只是一个简单判断,也可以是 planning 里说的更细致的多步骤过程);行动——真正调用工具、运行命令,或者做一次编辑,把这个决定落实下去;观察——读回发生了什么,包括出错信息,再把这个结果喂给下一轮的感知步骤。
让它成为一个『循环』而不是一次性流水线的关键在于:每一轮的观察结果会变成下一轮的起点。如果行动这一步执行的测试失败了,下一轮的感知步骤就会看到这个失败,规划步骤就能决定去修它,而不是傻乎乎地继续往下走。循环会在成功时结束,在触发系统设定的上限时结束(最多多少步、最长多久、最多花多少),或者在智能体判断自己需要找人帮忙时结束——具体这种『交给人』的设计一般怎么做,见 human-in-the-loop。
举个例子
一个修复构建失败的智能体,其循环可能是:感知(读取 CI 的失败日志)、规划(判断是某个依赖版本过旧导致测试失败)、行动(改依赖版本,重新跑测试)、观察(看到测试通过了)——到这里因为目标条件满足,循环结束。如果测试因为别的原因又失败了,下一轮的感知步骤就会捕捉到这一点,循环继续。
和相关概念的区别
『智能体循环』经常和 react-prompting(ReAct)搞混:智能体循环是几乎所有智能体都以某种形式实现的通用『感知—规划—行动—观察』机制,而 ReAct 是一种具体的、已经发表过的提示方法,专门让模型在循环里把自己的推理(『思考』)和行动交替写出来——ReAct 是实现循环里某一部分的一种具体技巧,不等于循环本身。
常见误解
常见问题
什么是智能体循环?
智能体循环什么时候会停下来?
ReAct 和智能体循环是一回事吗?
react-prompting)是在这个循环中组织模型推理过程的一种具体方法。最近核实: 2026-08-28