核心概念

自我反思与自我纠错

自我反思(或自我纠错)是指智能体对照目标评估自己刚产出的结果或采取的动作,如果不满意就修正,而不是把第一次尝试直接当作最终结果。

行动评估修正
智能体先行动,再对照目标评估结果,不达标则修正后继续。

模型第一次尝试给出的东西——一段代码、一份计划、一段文字——不一定就是最好的版本。自我反思说的是让智能体(或者同一个智能体的另一轮处理)回头看看自己刚产出或做过的事,判断它是不是真的满足了目标或达到了某个质量标准,如果没有就修正,然后再继续或者交出结果。

这可以简单到只是让模型对照最初的需求批评一下自己写的草稿,也可以更进一步,把产出放到真实的检验环境里跑一遍——比如让生成的代码去跑一遍测试套件——把失败的地方当作要修的问题喂回去。后一种做法因为有测试结果、报错信息这类真实信号做依据,通常比单纯让模型重新读一遍自己的输出去评判要可靠,因为模型自己重新读一遍很可能还是看不出第一次就犯的错。

自我反思是有代价的——多一轮评估,有时候还得多生成一遍——所以一般是有选择地用:用在『做对比做快更重要』的产出上,或者是在出现了某个信号(比如测试失败、报错)明确表明有问题需要修的时候,而不是每采取一次动作就反思一次。

怎么运作

图中的循环——行动、评估、修正——会一直重复,直到产出通过评估或者达到重试上限:智能体先采取一个动作或产出一个结果,按某种标准(可能是再调一次模型、跑一遍测试、或者一条校验规则)来评估它,如果不达标就修正后再试一次。这是在通用 agent-loop(智能体循环)基础上加的一道专门检查——本质上是在『行动』和『进入下一步』之间插入的一道额外把关。

举个例子

一个被要求实现某个函数的编程智能体,可能先写出一个初版,跑一遍已有的测试套件(评估这一步),发现两个测试没通过,于是修改实现去覆盖这两个测试对应的情况——如此重复,直到测试通过,或者它判断自己不该再瞎猜、该找人帮忙为止。

和相关概念的区别

自我反思和 human-in-the-loop(人在回路)相关但不是一回事:自我反思是智能体借助某种信号(测试、模型自我批评、报错信息)自己评估并修正自己的工作,而人在回路特指由人来做这个评估——两者可以结合使用,智能体先自己反思一遍,在高风险动作之前仍然找人确认。

常见误解

常被以为: 智能体反思自己的产出,就一定能可靠地发现自己的错误。
实际上: 模型重新读一遍自己的产出,很可能还是发现不了当初犯的错,尤其是推理层面的错误;反思如果能依托测试结果这类外部信号,通常比单纯让模型自己重读要可靠得多。
常被以为: 有了自我纠错,智能体就会一直重试直到做对为止。
实际上: 大多数实现都会给修正次数设上限,超过之后就转向找人帮忙或者报告失败,而不是无限循环下去。

常见问题

AI 智能体的『自我反思』是什么意思?
指智能体对照目标评估自己的产出或动作——有时会借助测试结果之类的外部信号——如果不达标就修正,而不是把第一次尝试当作最终结果。
自我纠错可靠吗,会不会智能体自己发现不了自己的错误?
这取决于纠错依据的是什么——只靠模型重新读一遍自己写的东西,可能还是发现不了同样的错误;如果依托测试套件这类真实检验,通常会更可靠。
自我反思和人在回路(Human-in-the-Loop)有什么区别?
自我反思是智能体自己评估、修正自己的工作;人在回路特指由人来做评估,两者可以结合起来用。

最近核实: 2026-08-28

相关术语