外观
Agency 概念与 Agent 定义
📖 本文是 Agent 学习知识库的起点,梳理 Agency 的核心概念和 Agent 产品的基本定义。
1. 什么是 Agency
Agency(能动性)是指一个系统自主感知环境、进行推理并采取行动的能力。它由三个核心要素构成:
Agency 三元组
| 要素 | 英文 | 说明 |
|---|---|---|
| 感知 | Perception | 从环境中获取信息(用户输入、API 返回、文件内容等) |
| 推理 | Reasoning | 理解信息、分析问题、制定计划 |
| 行动 | Action | 执行具体操作(调用工具、生成回复、修改文件等) |
这三者形成一个持续循环:感知 → 推理 → 行动 → 感知 → …
💡 关键点:Agency 不是一个开关(有/无),而是一个光谱——从简单的 chatbot 到完全自主的 Agent,Agency 程度逐步提升。
2. 核心洞察:"Agency 来自模型,不来自代码"
这是理解 Agent 架构最重要的认知转变:
- ❌ 错误理解:通过编写复杂的编排代码(if-else、状态机、工作流引擎)来实现 Agent 行为
- ✅ 正确理解:Agency 源自模型的训练——LLM 在训练过程中习得了推理、规划、工具使用的能力
含义:
- 代码的角色是提供基础设施(工具接口、上下文管理),而不是控制决策逻辑
- 模型决定做什么,代码负责怎么做到
- 过度的代码编排反而会限制模型的 Agency
3. Agent 产品公式
Agent 产品 = Model(模型)+ Harness(载具)模型 vs 载具 的比喻
| 概念 | 比喻 | 职责 |
|---|---|---|
| Model(模型) | 🧑✈️ 驾驶者 | 感知、推理、决策——所有"智能"行为 |
| Harness(载具) | 🚗 汽车 | 提供能力通道、执行工具、管理上下文 |
Harness 的五大职责
- 提供系统提示词(System Prompt):定义 Agent 的角色、能力边界和行为准则
- 管理上下文(Context Management):维护对话历史、注入相关信息
- 提供工具定义(Tool Definitions):告诉模型有哪些工具可用及如何调用
- 执行工具调用(Tool Execution):将模型的工具调用请求转化为实际操作
- 解析和展示结果(Result Parsing):将执行结果格式化后反馈给模型或用户
4. Agent vs 传统自动化系统
| 维度 | 传统自动化系统 | AI Agent |
|---|---|---|
| 决策方式 | 预设规则、固定流程 | LLM 动态推理、自主决策 |
| 适应性 | 只能处理预见的场景 | 能应对未预见的新情况 |
| 错误处理 | 需要预先编写异常分支 | 能自主识别错误并尝试修复 |
| 灵活性 | 修改需求 = 修改代码 | 修改 Prompt 即可调整行为 |
| 学习能力 | 无(静态逻辑) | 上下文学习(In-Context Learning) |
| 交互方式 | 结构化输入 | 自然语言理解 |
| 可组合性 | 硬编码集成 | 通过工具描述动态组合 |
📊 概念对比图:参见 agent_概念对比.mmd
5. 李宏毅课程要点
AI Agent 的定义
- Agent 是一个能够感知环境并采取行动以达成目标的系统
- 核心是拥有一个强大的语言模型作为"大脑"
- Agent 不仅仅是聊天机器人——它能使用工具、规划步骤、与环境交互
与传统 AI 的区别
- 传统 AI:针对特定任务训练的专用模型(分类、检测、翻译等),能力边界固定
- AI Agent:以 LLM 为核心的通用系统,通过工具调用扩展能力边界,具备自主规划和执行能力
关键特征
- 自主性(Autonomy):能独立完成多步骤任务,不需要每一步都由人指导
- 工具使用(Tool Use):能调用外部 API、搜索引擎、代码解释器等
- 规划能力(Planning):能将复杂任务分解为子任务并制定执行计划
- 反思能力(Reflection):能评估自身输出,发现错误并自我修正
📝 我的理解与思考
在这里记录你的个人理解、疑问和延伸思考: