推理-行动范式(ReAct)

ReAct

又称: Reason + Act · 推理-行动范式

让模型交替产出“思考(Thought)”和“行动(Action)”、并读取“观察(Observation)”的提示范式,由 Yao 等人 2022 年提出,是现代智能体循环的直接理论来源。

ThoughtAction(tool)Observationrepeat until answer
示意图(简化)

机制

在 ReAct 提示下,模型的每一轮输出被约定为固定结构:先写一段推理(我现在知道什么、下一步该查什么),再给出一个动作(调用某个工具 / 搜索某个词),运行时执行后把观察结果回填,模型据此写下一段推理。如此循环,直到模型给出最终答案。

与思维链的区别

思维链(Chain-of-Thought)只让模型把推理写出来,全程不与外部交互,适合纯逻辑 / 数学题;ReAct 在推理之间插入了真实的外部动作,让模型能获取自己不知道的信息、并根据事实纠正方向。ReAct 论文的核心结论就是:把二者结合,比单独用任何一个都更少幻觉、更可追溯。

常见误解

  • ReAct 不是某个框架或库,而是一种提示 / 交互结构,可以用几十行代码实现。
  • “Thought”文本是给流程用的中间产物,不应等同于模型“真实的内部推理”。

相关术语

参考来源

  1. Yao et al. — ReAct: Synergizing Reasoning and Acting in Language Models, ICLR 2023 (arXiv:2210.03629)
  2. Project page — react-lm.github.io

整理于 2026-08-29 · 本术语表基于公开论文、官方规范和行业通用定义整理,随领域发展会更新。发现问题欢迎反馈。