外观
LLM 作为 Agent 核心
📖 理解为什么大语言模型(LLM)是 Agent 系统的最佳"大脑",以及从 LLM 到 Agent 的演进路径。
1. 为什么 LLM 适合做 Agent 的核心
LLM 具备多项天然适合 Agent 场景的能力:
1.1 语言理解(Language Understanding)
- 能理解自然语言形式的用户意图,无需结构化输入
- 能解析模糊、不完整的指令,推断用户真实需求
- 支持多语言,天然具备跨语言交互能力
1.2 推理能力(Reasoning)
- 逻辑推理:能进行多步推理,处理因果关系
- 常识推理:具备广泛的世界知识,能做出合理判断
- Chain-of-Thought:通过思维链(CoT)逐步拆解复杂问题
1.3 工具调用(Tool Use)
- 能理解工具的功能描述(function schema),选择合适的工具
- 能生成符合格式的工具调用参数(JSON/结构化输出)
- 能根据工具返回结果调整后续行动
1.4 上下文学习(In-Context Learning)
- 无需重新训练即可通过 prompt 中的示例学习新任务
- 能在对话上下文中积累信息,动态调整行为
- 支持 few-shot 和 zero-shot 场景
2. LLM 的 Agent 能力
2.1 通过经验调整行为
- 对话内学习:在一次对话中,根据用户反馈和工具返回不断调整策略
- Prompt 引导:通过系统提示词定义行为模式,无需修改模型权重
- 示例学习:在 prompt 中提供成功/失败案例,引导模型行为
2.2 工具使用(Tool Use)
LLM 作为 Agent 的工具使用流程:
1. 接收任务描述 + 可用工具列表
2. 分析任务需求,判断是否需要工具
3. 选择合适的工具,生成调用参数
4. 接收工具执行结果
5. 基于结果决定:继续调用工具 or 生成最终回答工具使用的关键能力:
- 工具选择:从多个工具中选择最适合当前任务的
- 参数构造:根据工具 schema 生成正确的调用参数
- 结果解读:理解工具返回值,判断是否达成目标
- 错误恢复:工具调用失败时,能尝试其他策略
2.3 规划能力(Planning)
- 任务分解:将复杂任务拆分为可执行的子任务
- 顺序编排:确定子任务的执行顺序和依赖关系
- 动态调整:根据执行结果实时修改计划
- 目标追踪:始终记住最终目标,避免偏离
3. 从 LLM 到 Agent 的演进
LLM 的发展经历了四个关键阶段,每个阶段为 Agent 能力奠定基础:
阶段一:预训练(Pre-training)
- 目标:在海量文本上学习语言模式和世界知识
- 获得能力:语言理解、知识存储、基础推理
- Agent 意义:提供了 Agent 的"知识基底"
阶段二:指令微调(Instruction Tuning / SFT)
- 目标:学会遵循指令,按要求格式输出
- 获得能力:指令遵从、格式化输出、任务泛化
- Agent 意义:使模型能理解和执行工具调用格式(如 function calling)
阶段三:RLHF(人类反馈强化学习)
- 目标:对齐人类偏好,提升输出质量和安全性
- 获得能力:更好的判断力、拒绝不当请求、输出质量提升
- Agent 意义:提升 Agent 的决策质量和可靠性
阶段四:Agent 化
- 目标:专门针对 Agent 场景优化(工具调用、多轮推理、规划)
- 获得能力:结构化工具调用、长程规划、自我反思
- Agent 意义:LLM 真正成为 Agent 的核心引擎
- 典型方法:
- 在训练数据中加入工具调用 trace
- 强化学习优化多步决策
- 针对特定 Agent 框架做 fine-tuning
演进总结
预训练(知识基底)
↓
指令微调(遵循指令)
↓
RLHF(对齐偏好)
↓
Agent 化(自主行动)📊 决策循环图:参见 agent_决策循环.mmd
📝 我的理解与思考
在这里记录你的个人理解、疑问和延伸思考: