Skip to content

LLM 作为 Agent 核心 ​

📖 理解为什么大语言模型(LLM)是 Agent 系统的最佳"大脑",以及从 LLM 到 Agent 的演进路径。


1. 为什么 LLM 适合做 Agent 的核心 ​

LLM 具备多项天然适合 Agent 场景的能力:

1.1 语言理解(Language Understanding) ​

  • 能理解自然语言形式的用户意图,无需结构化输入
  • 能解析模糊、不完整的指令,推断用户真实需求
  • 支持多语言,天然具备跨语言交互能力

1.2 推理能力(Reasoning) ​

  • 逻辑推理:能进行多步推理,处理因果关系
  • 常识推理:具备广泛的世界知识,能做出合理判断
  • Chain-of-Thought:通过思维链(CoT)逐步拆解复杂问题

1.3 工具调用(Tool Use) ​

  • 能理解工具的功能描述(function schema),选择合适的工具
  • 能生成符合格式的工具调用参数(JSON/结构化输出)
  • 能根据工具返回结果调整后续行动

1.4 上下文学习(In-Context Learning) ​

  • 无需重新训练即可通过 prompt 中的示例学习新任务
  • 能在对话上下文中积累信息,动态调整行为
  • 支持 few-shot 和 zero-shot 场景

2. LLM 的 Agent 能力 ​

2.1 通过经验调整行为 ​

  • 对话内学习:在一次对话中,根据用户反馈和工具返回不断调整策略
  • Prompt 引导:通过系统提示词定义行为模式,无需修改模型权重
  • 示例学习:在 prompt 中提供成功/失败案例,引导模型行为

2.2 工具使用(Tool Use) ​

LLM 作为 Agent 的工具使用流程:

1. 接收任务描述 + 可用工具列表
2. 分析任务需求,判断是否需要工具
3. 选择合适的工具,生成调用参数
4. 接收工具执行结果
5. 基于结果决定:继续调用工具 or 生成最终回答

工具使用的关键能力:

  • 工具选择:从多个工具中选择最适合当前任务的
  • 参数构造:根据工具 schema 生成正确的调用参数
  • 结果解读:理解工具返回值,判断是否达成目标
  • 错误恢复:工具调用失败时,能尝试其他策略

2.3 规划能力(Planning) ​

  • 任务分解:将复杂任务拆分为可执行的子任务
  • 顺序编排:确定子任务的执行顺序和依赖关系
  • 动态调整:根据执行结果实时修改计划
  • 目标追踪:始终记住最终目标,避免偏离

3. 从 LLM 到 Agent 的演进 ​

LLM 的发展经历了四个关键阶段,每个阶段为 Agent 能力奠定基础:

阶段一:预训练(Pre-training) ​

  • 目标:在海量文本上学习语言模式和世界知识
  • 获得能力:语言理解、知识存储、基础推理
  • Agent 意义:提供了 Agent 的"知识基底"

阶段二:指令微调(Instruction Tuning / SFT) ​

  • 目标:学会遵循指令,按要求格式输出
  • 获得能力:指令遵从、格式化输出、任务泛化
  • Agent 意义:使模型能理解和执行工具调用格式(如 function calling)

阶段三:RLHF(人类反馈强化学习) ​

  • 目标:对齐人类偏好,提升输出质量和安全性
  • 获得能力:更好的判断力、拒绝不当请求、输出质量提升
  • Agent 意义:提升 Agent 的决策质量和可靠性

阶段四:Agent 化 ​

  • 目标:专门针对 Agent 场景优化(工具调用、多轮推理、规划)
  • 获得能力:结构化工具调用、长程规划、自我反思
  • Agent 意义:LLM 真正成为 Agent 的核心引擎
  • 典型方法:
    • 在训练数据中加入工具调用 trace
    • 强化学习优化多步决策
    • 针对特定 Agent 框架做 fine-tuning

演进总结 ​

预训练(知识基底)
    ↓
指令微调(遵循指令)
    ↓
RLHF(对齐偏好)
    ↓
Agent 化(自主行动)

📊 决策循环图:参见 agent_决策循环.mmd



📝 我的理解与思考 ​

在这里记录你的个人理解、疑问和延伸思考: