Agent 入门 00|模型、训练与聊天:你没有在对话里训练它
分清模型、参数、训练、推理和聊天,理解 AI 为什么会在一段对话里显得越来越懂你。

系列导读:Agent 入门:给 Windows 小白的第一套地图

先看一个很常见的现象。

你告诉 AI:“我们这里说的 RPD 是要求到货日期,回答供应问题时要先看合同和批次。”刚开始它还会混淆。聊了几轮以后,它不但能正确使用 RPD,还能照你的格式写进展。很多人于是说:“我把这个模型训练好了。”

这个说法不准确。聊天可以改变模型这一次拿到的信息,却不会在对话中把模型重新训练一遍。

模型不是聊天窗口

大语言模型可以先粗略理解成一台“根据已有文字,预测接下来该出现什么”的机器。它内部有大量数字,这些数字叫参数。参数共同决定:看到什么输入时,哪些输出更可能出现。

参数不是一排可以直接打开的知识卡片。“北京是中国的首都”通常不会单独存放在某个格子里。训练让大量参数一起形成语言、事实和关系的模式。Anthropic 对模型训练的说明也强调,模型学习的是内容中的一般模式,不是像数据库那样逐条保存原文。Anthropic:关于模型训练

所谓训练,就是拿大量样本让模型反复预测,再根据误差调整参数。这个过程要准备数据、消耗大量计算,并产出一个新的模型版本或新的参数版本。参数真的变了,才是在训练模型。

训练改变参数,聊天只改变当前输入

模型训练完成后,我们把问题交给它,让它根据当前参数生成答案,这一步叫推理。这里的“推理”不是专指复杂思考,而是“使用已经训练好的模型得到输出”这个运行阶段。

可以把两者记成一句话:

训练是在调机器,推理是在用机器。

它为什么像是记住了前文

因为聊天软件会把当前问题和前面的对话一起交给模型。这一包临时材料叫上下文

假设第一轮只有一句“RPD 是什么”,模型拿到的信息很少。到了第十轮,它同时看见你的解释、示例、纠正和刚提出的问题,回答当然更贴合。变化的是输入,不是参数。

Anthropic 的 Messages API 把多轮对话明确称为“无状态”的:调用方在发起下一次请求时,需要把之前的对话轮次一并放进 messages。也就是说,至少在这个基础接口上,不是模型自己在后台永久记住了你,而是应用重新带上了历史。Claude API:Create a Message

这也解释了一个现象:开一段全新的聊天后,它可能又“不懂了”。旧对话没有进入新上下文。即使某个产品提供跨会话记忆,通常也是先把信息保存下来,下次再放回上下文;这依然不等于现场修改模型参数。

Skill 也不是训练

Skill 很容易造成同一种误解。你写好一个报表 Skill 后,Claude Code 每次都能按固定步骤工作,看起来像“学会了一项技能”。但官方定义里,Skill 是一个 SKILL.md 文件,里面放的是说明、知识或工作流程;需要时,Claude Code 把它加载到工具箱和上下文中。Claude Code:Skills

所以 Skill 更像一份随任务取用的操作手册。它可以引用资料,也可以让 Agent 调用脚本,但它没有因此改写基础模型的参数。删除 Skill,或者换到没有这个 Skill 的环境,这套专门做法也就不再可用。

还要分清另一件事:数据是否会被用于以后训练

“当前聊天没有实时训练模型”,不等于“聊天数据在任何产品中都绝不会用于未来训练”。这是两个问题。

Anthropic 当前说明:商业产品(如 Claude for Work 和 API)的聊天及编码会话,默认不会用于训练,除非客户明确参加相关计划或主动提供反馈;个人版产品则要看用户是否开启模型改进、是否主动反馈,以及安全审查等条件。商业产品数据说明个人产品数据说明是两套边界。内部环境还要以公司的网关、合同和数据制度为准。

以后再看到“AI 学会了”,先问一句:是参数被重新训练了,还是应用把更多上下文、记忆或 Skill 交给了同一个模型?这个问题能挡住很多关于 Agent 的误解。


上一篇:系列导读 | 下一篇:Agent 入门 01|聊天机器人和 Agent,差的不是一张嘴


最后修改于 2026-08-19