
01 · 一个提问,AI 是怎么边想边做的?系列首篇。我们不碰任何术语,先从一个你我都遇到过的场景出发,把 ReAct Agent 边想边做的直觉建立起来。源码来自开源项目LoopAgent⭐。先看一个不够聪明的 AI假设你对一个普通的聊天 AI 说:“帮我看看登录超时的报错是从哪来的,顺手修一下。”一个只会一问一答的模型会怎么做?它会凭记忆猜:“登录超时嘛,可能是数据库连接慢、可能是 token 过期、也可能是网络……你可以检查一下 XXX。”问题很明显:它没看过你的代码。它不知道你项目里httpClient的超时设成了几秒,不知道loginService到底怎么抛的错。它给的是一篇正确的废话。真正有用的助手应该像一个坐到你工位上的同事:先搜一下代码、打开几个文件看看、跑个测试,看到真实情况之后再下结论。这个看一眼真实世界、再决定下一步的能力,就是 ReAct 要解决的问题。ReAct 三个字:Reason ActReAct 是 “Reasoning Acting” 的缩写,直译就是**“边推理边行动”**。它的核心是一个循环:想一步(Reason) → 做一件事(Act) → 看结果(Observe) → 再想一步 → ……直到能给出答案把它套到刚才的场景上,一个 ReAct Agent 会这样工作: 想:用户说登录超时。我得先找到相关代码,搜 login timeout 试试。 做:调用「代码搜索」工具,query login timeout 登录 超时 看:搜到 3 处 —— session.ts 里 SESSION_TIMEOUT5000; loginService.ts 抛「登录超时」;httpClient.ts 默认 timeout3000ms(比会话还短!) 想:httpClient 只有 3 秒,比会话超时还短,很可疑。读一下 loginService 确认。 做:再次搜索 loginService 的处理逻辑 看:确认了 —— httpClient 3 秒就 abort,被上层翻译成「登录超时」 想:根因清楚了,把 httpClient 的超时从 3000 改成 15000。 做:调用「编辑文件」工具修改 看:修改成功 想:改完跑个测试验证。 做:调用「运行命令」工具:npm test -- login 看:4 条测试全过 想:齐活了,可以给最终答案了。 ✅ 答:根因是 httpClient 默认超时 3 秒太短……我已改成 15 秒并测试通过。看到区别了吗?它没有猜。每一个结论都建立在真的去查了、真的看到了的基础上。这就是 ReAct 比一问一答强的地方——它能和你的真实环境交互。✶一句话抓住本质一问一答的 AI 是闭卷考试,只能靠记忆答题;ReAct Agent 是开卷 能做实验——它可以随时翻书(搜代码)、做实验(跑命令)、看到结果再继续。那些工具,在 LoopAgent 里长什么样上面故事里的「代码搜索」「编辑文件」「运行命令」,在真实项目里就是一个个工具(Tool)。在 LoopAgent 的src/extension/agent/目录下,它们是一个个独立文件:故事里的动作真实工具文件干什么搜代码exploreCodeTool.ts在代码智能索引里语义搜索读文件readFileTool.ts读取指定文件内容改文件applyEditTool.ts对文件做精确编辑跑命令runCommandTool.ts执行 shell 命令(带审批)审查代码codeReviewTool.ts对改动做代码审查浏览符号browseSymbolsTool.ts列出文件里的函数/类等符号每个工具都遵循同一个接口约定。这是它们的身份证类型(reactTypes.ts:53-60):exporttypeReactAgentTool{name:string;// 工具名,模型用它来点名调用description:string;// 描述,告诉模型我能干嘛、什么时候用我inputSchema:Recordstring,unknown;// 参数格式(JSON Schema)isConcurrencySafe?:(input:unknown)boolean;// 能否和别的工具并发跑invoke(invocation):string|ReactAgentToolResult|Promise...;// 真正干活};✶ Insight ─────────────────────────────────────注意description这个字段——它不是给人看的注释,而是给模型看的说明书。模型全靠每个工具的namedescriptioninputSchema来判断这一步该用哪个工具、参数怎么填。写好工具描述,几乎等于给 Agent 写好了操作手册。这也是为什么造 Agent 时,工具描述的措辞往往比工具代码本身还值得斟酌。─────────────────────────────────────────────────谁在驱动这个循环?工具只是手脚,让它们按 ReAct 节奏动起来的大脑调度器,是 LoopAgent 里的reactAgentRunner。它的主循环骨架长这样(简化自 reactAgentRunner.ts:118):for(letstep1;stepmaxSteps;step){// 1️⃣ 问模型:这一步你想干嘛?(Reason 决定 Act)constresultawaitmodelTurn({messages,signal,toolChoice});// 2️⃣ 如果模型给了最终答案 —— 循环结束if(result.kindfinal){returnresult.content;}// 3️⃣ 否则模型要调工具 —— 执行它们,把结果(Observe)塞回对话for(constrequestofresult.requests){constoutputawaitinvokeTool(request,signal);messages.push({role:tool,content:output.content,/* ... */});}// 4️⃣ 回到循环顶部,带着新看到的结果再想一步}就这么朴素:问模型 → 要么收尾、要么调工具 → 把工具结果喂回去 → 再问模型。转上几圈,一个复杂任务就被拆成了一连串想一步做一步的小动作。真实代码当然比这多得多——步数上限、失败熔断、重复调用拦截、检查点保存……但骨架就是这四步。后面第 03 篇会把这个循环逐帧慢放。小结普通 AI 靠记忆猜,ReAct Agent 靠和真实环境交互——搜代码、读文件、跑测试,看到结果再决策;核心是一个循环:Reason(想)→ Act(做)→ Observe(看)→ 再 Reason,直到能给出答案;做的能力来自一个个工具,每个工具用name/description/inputSchema向模型自我介绍;驱动循环的是reactAgentRunner,骨架就是问模型 → 调工具 → 回填结果 → 再问。下一篇我们要挖一个更尖锐的问题:ReAct 原论文让模型输出Thought:/Action:/Observation:这样的文本标签,而 LoopAgent 一个标签都没用——为什么?文本范式到底哪里疼? 上一篇 → 系列索引 下一篇 → 02 · 经典 ReAct 的文本标签之痛本文源码来自开源项目LoopAgent,一个 VS Code 里的 AI 编码 Agent。觉得有用点个 Star ⭐ → https://github.com/oi12344/loopagent-vscode