Skip to content

Agency 概念与 Agent 定义 ​

📖 本文是 Agent 学习知识库的起点,梳理 Agency 的核心概念和 Agent 产品的基本定义。


1. 什么是 Agency ​

Agency(能动性)是指一个系统自主感知环境、进行推理并采取行动的能力。它由三个核心要素构成:

Agency 三元组 ​

要素英文说明
感知Perception从环境中获取信息(用户输入、API 返回、文件内容等)
推理Reasoning理解信息、分析问题、制定计划
行动Action执行具体操作(调用工具、生成回复、修改文件等)

这三者形成一个持续循环:感知 → 推理 → 行动 → 感知 → …

💡 关键点:Agency 不是一个开关(有/无),而是一个光谱——从简单的 chatbot 到完全自主的 Agent,Agency 程度逐步提升。


2. 核心洞察:"Agency 来自模型,不来自代码" ​

这是理解 Agent 架构最重要的认知转变:

  • ❌ 错误理解:通过编写复杂的编排代码(if-else、状态机、工作流引擎)来实现 Agent 行为
  • ✅ 正确理解:Agency 源自模型的训练——LLM 在训练过程中习得了推理、规划、工具使用的能力

含义:

  • 代码的角色是提供基础设施(工具接口、上下文管理),而不是控制决策逻辑
  • 模型决定做什么,代码负责怎么做到
  • 过度的代码编排反而会限制模型的 Agency

3. Agent 产品公式 ​

Agent 产品 = Model(模型)+ Harness(载具)

模型 vs 载具 的比喻 ​

概念比喻职责
Model(模型)🧑‍✈️ 驾驶者感知、推理、决策——所有"智能"行为
Harness(载具)🚗 汽车提供能力通道、执行工具、管理上下文

Harness 的五大职责 ​

  1. 提供系统提示词(System Prompt):定义 Agent 的角色、能力边界和行为准则
  2. 管理上下文(Context Management):维护对话历史、注入相关信息
  3. 提供工具定义(Tool Definitions):告诉模型有哪些工具可用及如何调用
  4. 执行工具调用(Tool Execution):将模型的工具调用请求转化为实际操作
  5. 解析和展示结果(Result Parsing):将执行结果格式化后反馈给模型或用户

4. Agent vs 传统自动化系统 ​

维度传统自动化系统AI Agent
决策方式预设规则、固定流程LLM 动态推理、自主决策
适应性只能处理预见的场景能应对未预见的新情况
错误处理需要预先编写异常分支能自主识别错误并尝试修复
灵活性修改需求 = 修改代码修改 Prompt 即可调整行为
学习能力无(静态逻辑)上下文学习(In-Context Learning)
交互方式结构化输入自然语言理解
可组合性硬编码集成通过工具描述动态组合

📊 概念对比图:参见 agent_概念对比.mmd


5. 李宏毅课程要点 ​

AI Agent 的定义 ​

  • Agent 是一个能够感知环境并采取行动以达成目标的系统
  • 核心是拥有一个强大的语言模型作为"大脑"
  • Agent 不仅仅是聊天机器人——它能使用工具、规划步骤、与环境交互

与传统 AI 的区别 ​

  • 传统 AI:针对特定任务训练的专用模型(分类、检测、翻译等),能力边界固定
  • AI Agent:以 LLM 为核心的通用系统,通过工具调用扩展能力边界,具备自主规划和执行能力

关键特征 ​

  1. 自主性(Autonomy):能独立完成多步骤任务,不需要每一步都由人指导
  2. 工具使用(Tool Use):能调用外部 API、搜索引擎、代码解释器等
  3. 规划能力(Planning):能将复杂任务分解为子任务并制定执行计划
  4. 反思能力(Reflection):能评估自身输出,发现错误并自我修正


📝 我的理解与思考 ​

在这里记录你的个人理解、疑问和延伸思考: