你在聊天窗口里说:“帮我整理下载目录里的报销材料。”
普通聊天机器人可能给你一份很周到的建议:先按年份建文件夹,再按“日期—类型—金额”重命名,最后删除重复文件。它说得对,但你的下载目录没有发生任何变化。
Agent 面对同一句话,会先查看目录里到底有什么文件,读取文件名或必要内容,再创建文件夹、移动文件,最后重新列出目录,确认材料有没有漏掉。中途发现两张发票日期相同,它还可能停下来问你该怎么区分。
两者背后都可以使用大语言模型。真正拉开差距的不是“谁说得更像人”,而是有没有形成一个持续的工作循环:收集现场,采取行动,核对结果。
这里比较的是“只生成文字的聊天模式”和“带工具、能继续执行的 Agent 模式”,不是给产品贴死标签。同一个聊天产品也可能接入搜索、文件或其他工具,同时提供聊天与 Agent 能力;出现在聊天界面里,不代表它一定只能聊天。
只回答,还是继续往下做
聊天机器人最基本的工作是把你的文字变成一段回复。你问一道 Excel 公式,它解释公式;你问怎样排查网络,它列出步骤。回复生成后,这一轮工作就结束了。
Agent 则被放进一个可以工作的环境。模型负责判断下一步,工具负责接触外部世界,运行框架负责保存上下文并把工具结果送回模型。Anthropic 把 Claude Code 称为 Claude 模型外面的 agentic harness:它提供工具、上下文管理和执行环境,让语言模型成为能完成任务的编码 Agent。Claude Code 的工作原理
因此,“Agent”不是某个更会聊天的模型名称。只有模型,没有工具,它最多告诉你该怎么做;接上文件、命令行、浏览器或业务系统,它才有机会真的做。
第一段:收集现场
Agent 的第一步不是动手,而是弄清当前状态。整理报销材料时,它要先列出文件;修改程序时,它要先找入口、读报错和相关代码;查合同进度时,它要先取得合同、批次和最新记录。
这一步叫 gather context。普通话就是:先看现场,别靠猜。
一个只听到“打印机坏了”就开始卸载驱动的同事,不会因为动作快就更专业。同样,Agent 如果没有拿到真实文件、错误信息或任务范围,后面的行动越快,偏得可能越远。对小白来说,判断 Agent 是否真的开始工作,可以先看它有没有读取现场,而不是看它输出了多长的计划。
第二段:采取行动
有了上下文,Agent 才调用工具去改变状态,这一步是 take action。
Claude Code 的内置工具可以读写文件、搜索内容、执行命令、使用 Git,也可以通过扩展连接外部服务。工具调用的结果不是故事描述,而是新的事实:文件创建成功了,命令返回了错误,搜索找到了三处引用。官方工具说明
模型并没有长出一双真的手。它只是选择工具并填写参数;真正读文件、改文件、运行命令的是 Claude Code 所在的执行环境。你在 Windows 本机启动本地会话,这些本地工具就在你的电脑上运行。
第三段:核对结果
动作完成不等于任务完成。Agent 还要把结果和目标对照,这一步是 verify results。
移动完文件后重新列目录,是核对;改完网页后打开页面看效果,是核对;修完报错后重新运行原来的命令,也是核对。如果结果不符合目标,新结果会变成下一轮的上下文,Agent 再行动、再检查。
这就是 Agent 的“循环”:
收集现场 -> 采取行动 -> 核对结果
^ |
+-------------------------+
Anthropic 对 Claude Code 的官方描述正是这三个阶段,而且特别说明:不同任务需要的循环长度不同。问“这个项目做什么”可能只需要收集上下文;修复一个故障则会反复经过三段。The agentic loop
给 Agent 一个能核对的终点
小白最容易只说动作:“帮我整理一下”“帮我改得好看点”。Agent 可以开始做,但很难判断何时算完成。更有效的任务通常包含三样东西:目标、范围、完成标准。
例如:
把
Downloads\报销练习里的 PDF 按月份放进子目录,只处理这个练习目录;完成后列出每个月的文件数,遇到无法判断月份的文件先不要移动,单独告诉我。
这里没有替 Agent 编排每一步,却给了它观察范围和核对办法。它仍可自己决定先列文件还是先读取名称,但最后能回答“事情到底做成没有”。
所以,不要用“会不会聊天”判断一个 Agent。看它是否能取得真实上下文,是否能用工具改变状态,是否会根据结果继续调整。下一篇,我们再把模型、Claude Code、工具、Skill、CC Switch 和内部模型通道逐层摆到正确的位置上。
上一篇:Agent 入门 00|模型、训练与聊天 | 下一篇:Agent 入门 02|Claude Code 这一套,到底谁在哪里运行
最后修改于 2026-08-19