现在几乎所有"AI Agent"框架——不管是 Claude Code、各种 Agent 编排工具,还是自己写的一个几十行的工具调用脚本——底层跑的都是同一个骨架:模型不是一次性把答案吐出来,而是反复经历"想一步、做一步、看结果、再想下一步",直到任务完成。这个骨架有个具体的名字,叫 ReAct(Reasoning + Acting),来自 Yao 等人 2022 年的论文《ReAct: Synergizing Reasoning and Acting in Language Models》。这篇聊聊这个循环具体是怎么回事、现代 LLM API 是怎么实现它的,以及实践中最容易踩的几个坑。
大语言模型本质上是无状态的——每次调用,模型对"你是谁"“上次聊了什么"“你喜欢什么风格"一无所知,除非这些信息被显式塞进当前的上下文窗口。这和 RAG 要解决的问题不是一回事:RAG 补的是模型"没见过的知识”,而这里要聊的是模型"没记住的经历”——同一个用户、同一个项目,换一次会话就打回原形,昨天纠正过的错误今天还会再犯一遍。
这两年"多智能体"(Multi-Agent)几乎成了 AI 应用绕不开的话题——Claude Code 里的 subagent、n8n 里的多节点工作流、各种 Agent 编排框架,本质上都在回答同一个问题:一个大模型上下文搞不定的任务,能不能拆成几个更小的、各司其职的智能体来协作完成?
在 AI 浪潮席卷全球的今天,我们不再满足于让 AI 仅仅回答问题——我们希望 AI 能够真正帮我们干活。OpenClaw 正是这样一个框架:它让大语言模型(LLM)拥有"手脚",通过可插拔的 Skills(技能) 系统,让 AI 代理能够执行文件操作、运行命令、自动化浏览器、管理进程……几乎所有你能用鼠标键盘做的事,OpenClaw 都能让 AI 替你完成。