—— AI Agent(智能体)知识培训 · 从聊天到办事 ——

智能体的觉醒

第四本《从Token到AI应用》里,小哲做出了会聊天的「账小灵」。但老板的要求升级了:「别光聊天,让它自己把月报写出来、把异常账单找出来、把报表发给财务!」——从「回答问题」到「动手办事」,这就是 AI Agent(智能体)。周师傅说:Agent = 大脑(LLM)+ 规划 + 记忆 + 工具。这一本,把 Agent 从骨架到落地完整拆解。

🧠 🗺️ 🧠 🛠️ 👥 🏗️ 🔄 🛡️ 🚀 🔮
序 章

AI 会聊天,但会干活吗

Agent 定义 · 三要素 · 从助手到员工
🧑‍💻
小哲

师傅!老板看了账小灵说:「聊天很厉害,但能不能让它自己干活?——月初自动把经营月报整理好、把异常账单标出来、发到财务邮箱?」这……不就是聊天加个按钮吗?

🧙
周师傅

差的远了——这就是 AI Agent(智能体)和普通聊天应用的分水岭:

  • 聊天应用:你问一句,它答一句——「答话」。
  • AI Agent:你给一个目标,它自己规划步骤、调用工具、查资料、干活、验证结果——「办事」。

Agent 的三要素(记住这个框架,全书都在讲它):大脑(LLM 做决策)+ 记忆(记得住上下文)+ 工具(能动手操作)——再加「规划」让它们串起来。

1
从 LLM 到 AgentPrompt→RAG→Function Calling→Agent 的进化之路
2
规划与思考任务分解、ReAct 循环、反思——Agent 的骨架
3
记忆短期/长期记忆、记忆写入召回——大脑皮层
4
工具与 MCPFunction Calling、工具编排、MCP 协议——手脚
5
多智能体主管-下属、Agent 间通信、角色分工——团队
6
Agent 框架LangGraph、AutoGen、CrewAI、Dify——开发脚手架
7
工作流与状态Agentic Workflow、状态机、人工介入——稳定干活
8
评估与安全任务成功率、提示注入、权限隔离——质检护栏
9
应用落地客服/代码/数据分析/运维 Agent——真实场景
10
未来与职业Agent 工程师、自主 Agent、学习路线——新职业
🧙
周师傅

记住一句话:LLM 是「会说话的大脑」,Agent 是「有手有脚有记忆、会自己安排活儿的员工」。走,第一站,看看大脑是怎么长出手脚的。

第 1 站

从 LLM 到 Agent:进化之路

Prompt → RAG → Function Calling → Agent · ReAct

Agent 不是一夜出现的——它是 LLM 应用「四步进化」的结果。看懂这条进化链,就懂了「为什么需要 Agent」。

🧙
周师傅

LLM 应用的四级进化(全是系列老朋友):

  • ① Prompt 工程:会「好好说话」——第四本的起点。
  • ② RAG:会「查资料再答」——给大脑装知识库。
  • ③ Function Calling:会「调用函数」——给大脑装一只手。
  • ④ Agent:会「自己决定何时查、何时调、何时停」——大脑 + 手 + 眼睛 + 思考循环。

Agent 的核心工作模式是 ReAct(Reason + Act):思考 → 行动 → 观察结果 → 再思考……直到任务完成。它把「一步问答」升级成「多步办事」。

LLM → Agent 进化链
【进化四步(每步都是上一部的老朋友)】
① Prompt 工程:写提示词让模型好好答
   例:你是一个记账助手……
② RAG:回答前先查知识库(第四本第5站)
   例:先查报销规则再回答
③ Function Calling:让模型调用工具(第四本第4站)
   例:模型说"我要调 query_expense(month)"
④ Agent:模型自己决定调用链(这一本!)
   例:查账 → 发现异常 → 调分析工具 → 生成报告 → 发邮件

【ReAct 循环(Agent 的心跳)】
用户目标:「分析本月支出并发送报告」
  ↓
Thought(思考):我需要先查本月支出数据
  ↓
Action(行动):调用 query_expense(month: "2026-09")
  ↓
Observation(观察):支出 1915.50,餐饮占比 40%
  ↓
Thought(思考):餐饮占比异常,需要分析趋势
  ↓
Action(行动):调用 trend_analysis(category: "餐饮")
  ↓
……(循环直到任务完成)……
  ↓
Final(收尾):生成报告并调用 send_email()

【Agent vs 普通应用(对照)】
  普通应用:固定流程,人一步一步点
  Agent    :目标驱动,自己拆步骤、自己决定工具
  → 灵活性是 Agent 的价值,不确定性是 Agent 的挑战

进化术语

  • Agent 定义:目标驱动的自主智能体——规划 + 记忆 + 工具。
  • 进化四步:Prompt → RAG → Function Calling → Agent——能力逐级叠加。
  • ReAct:Reason + Act——思考-行动-观察循环。
  • Thought/Action/Observation:循环三件套——Agent 的「内心独白」。
  • 目标驱动:给目标不给定步骤——Agent 自己拆。
  • 不确定性:Agent 可能走错路——需要护栏(第 7、8 站)。

本站收获:进化链 = Prompt 会说话 → RAG 有知识 → Function Calling 有手 → Agent 会自己安排活儿。ReAct 循环(想→做→看→再想)是 Agent 的心跳——这一站是全书的地基。

第 2 站

骨架:规划与思考

任务分解 · 规划 · 反思 · 思维链

Agent 的第一块骨架是「规划」——把大目标拆成小步骤,走一步看一步,错了能回头。没有规划,Agent 就是「无头苍蝇」。

🧙
周师傅

规划三层能力:

  • 任务分解(Decomposition):把大目标拆成可执行的小任务——「写月报」→「查数据 → 算指标 → 写正文 → 生成 PDF → 发邮件」。
  • 计划制定(Planning):排序 + 依赖——先查数据才能写正文。
  • 反思(Reflection):执行后「回头看」——结果对不对?要不要重来?错了能自己纠正(自我批评是 Agent 质量的倍增器)。

底层依赖:CoT(思维链)(第一本老朋友)——让模型「一步一步想」,复杂任务正确率暴涨。规划通常用 Plan-and-Execute 模式:先出计划,再逐步执行,执行中可调整。

规划实战:Plan-and-Execute
【Plan(先出计划)】
用户目标:整理本月经营月报并发给财务
  ↓
模型生成计划:
  1. 查询本月营收/支出/分类汇总(query_summary)
  2. 与上月对比,标注异常(analyze_trend)
  3. 生成 Markdown 月报(generate_report)
  4. 转 PDF 并发邮件(send_email)
  → 计划确认后再逐步执行

【Execute(逐步执行 + 反思)】
  步骤1:查数据 ✓  → 反思:数据完整,OK
  步骤2:分析 ✓  → 反思:餐饮支出 +40% 异常,标注
  步骤3:生成报告 ✓ → 反思:格式正确
  步骤4:发送 ✓  → 完成!

【规划失效的兜底】
  步骤失败 → 重试 2 次 → 仍失败 → 跳过并说明(别硬编!)
  结果异常 → 反思触发「重新规划」分支
  → 给 Agent 设「最大步数」上限(第8站成本控制)

【ReAct vs Plan-and-Execute】
  ReAct:走一步想一步(灵活,适合未知任务)
  Plan-and-Execute:先计划再执行(稳定,适合流程清晰任务)
  → 复杂任务常用「Plan 先行 + ReAct 微调」混合模式

规划术语

  • 任务分解:大目标 → 小任务——Agent 的第一能力。
  • Planning(计划):排序 + 依赖管理。
  • Reflection(反思):回头看结果——自我纠正。
  • CoT(思维链):一步一步想——正确率倍增器。
  • Plan-and-Execute:先计划再执行——稳定模式。
  • 最大步数:执行上限——防止无限循环烧钱。
  • 混合模式:Plan 先行 + ReAct 微调——复杂任务标配。

本站收获:规划 = 任务分解(拆)+ 计划(排)+ 反思(查)。Plan-and-Execute 保稳定、ReAct 保灵活、反思保质量——没有规划的 Agent 是乱撞,有规划的 Agent 才是员工。

第 3 站

记忆:大脑皮层

短期记忆 · 长期记忆 · 记忆写入/召回 · 工作记忆

Agent 干活要「记得住」:当前任务做到哪了(短期)、上次对话说过啥(长期)。记忆是 Agent 的「大脑皮层」——第四本讲过记忆,这本讲 Agent 专属的记忆架构。

🧙
周师傅

Agent 记忆分三层:

  • 短期记忆(上下文):当前任务的全部对话 + 思考过程——装进上下文窗口(第四本第 2 站的知识)。
  • 工作记忆:任务中途的「草稿本」——临时数据、中间结果(执行到一半断了能续)。
  • 长期记忆(向量库):跨任务/跨会话的持久知识——用户偏好、历史决策、领域规则(第四本第 7 站 + 第八本向量检索的老朋友)。

记忆两大操作:写入(Extraction)——从对话中提炼值得记的;召回(Recall)——干活前检索相关的记忆。Agent 框架把这两步做成自动管线。

Agent 记忆架构
┌────────────────────────────────────────┐
│ 短期记忆:当前任务上下文(窗口内)         │
│   用户目标 + 思考过程 + 工具结果           │
├────────────────────────────────────────┤
│ 工作记忆:任务草稿本(执行状态)           │
│   中间结果 / 进行到哪一步 / 临时数据       │
├────────────────────────────────────────┤
│ 长期记忆:向量数据库(跨任务)             │
│   用户偏好 / 历史决策 / 领域规则           │
└────────────────────────────────────────┘

【记忆写入(自动提炼)】
  任务完成后扫描对话 → 提取值得记的:
  { "type": "preference", "content": "财务报告用 PDF 格式" }
  → 存入向量库(带时间戳,可过期)

【记忆召回(干活前唤醒)】
  新任务开始 → 语义检索相关记忆 → 拼进上下文
  → Agent 像「有经验的老员工」,不每次都从零开始

【记忆管理要点】
  容量:短期窗口有限 → 摘要压缩(第四本第2站)
  时效:旧记忆要过期/降权(用户改主意了别死记)
  隐私:敏感记忆要隔离(第8站安全)
  可删:用户要求删除记忆 → 必须能删(第八本合规)

【案例:账小灵的月报 Agent】
  长期记忆:老板偏好 PDF + 只发财务部 + 上月基线数据
  短期记忆:本次任务上下文
  召回 → 「老板喜欢 PDF」→ 自动生成 PDF 而不是 Excel

记忆术语

  • 短期记忆:当前任务上下文——窗口内。
  • 工作记忆:任务草稿本——中间状态。
  • 长期记忆:向量库持久知识——跨任务。
  • 记忆写入:自动提炼值得记的信息。
  • 记忆召回:任务前检索相关记忆。
  • 记忆时效:过期/降权——别死记旧事。
  • 记忆隐私:隔离 + 可删除——合规底线。

本站收获:记忆 = 短期(上下文)+ 工作(草稿)+ 长期(向量库)。写入提炼、召回唤醒——「有记忆的 Agent 是老员工,没记忆的是新实习生」。别忘时效和隐私。

第 4 站

工具:手脚与 MCP

Function Calling · 工具编排 · MCP 协议 · 工具安全

记忆管「记得」,工具管「动手」——查数据库、发邮件、操作文件全靠工具。第四本讲了 Function Calling 的基础,这本讲 Agent 时代的工具体系:MCP 协议。

🧙
周师傅

Agent 工具三层:

  • Function Calling(基础):模型请求调用函数 → 代码执行 → 结果回喂(第四本第 4 站)。
  • 工具编排(进阶):多个工具的组合逻辑——「先查再算再发」的工具链;工具描述写得好,模型才知道啥时候用它。
  • MCP(模型上下文协议):工具的「USB 标准」——统一接口,一个 Agent 能接任意 MCP 工具服务器(文件系统/数据库/浏览器/日历……即插即用)。

你现在用的 Loomy,就是通过 MCP 接了一大堆工具(浏览器/邮箱/飞书……)——Agent 的「插线板」。

工具体系实战
【工具定义(描述决定会不会被正确调用)】
工具:query_expense
  描述:查询用户在指定月份的支出汇总(元)
  参数:{ month: "YYYY-MM" }
  → 描述写清楚 = 模型知道何时用它

【工具编排(组合拳)】
  月报任务的工具链:
  query_summary → analyze_trend → generate_report → send_email
  → 每个工具的输出是下一个工具的输入(管道思想)

【MCP 架构(USB 标准)】
  ┌─────────┐   MCP 协议   ┌──────────────────┐
  │ Agent   │ ←────────→  │ MCP 工具服务器    │
  │ (宿主)  │              │ ├ 文件系统工具    │
  └─────────┘              │ ├ 数据库工具      │
                          │ ├ 浏览器工具      │
                          │ └ 邮件工具        │
  → 工具即插即用,Agent 通用,生态共享

【工具安全(第8站重点,先立规矩)】
  最小权限:只给必要的工具(能读就别给删)
  高危操作:删除/付款 → 必须人工确认(Human-in-the-loop)
  沙箱执行:工具代码跑在隔离环境(别让 Agent 乱碰系统)

【工具失败处理】
  工具报错 → 反馈给模型 → 换参数重试 / 换工具 / 放弃
  → 工具会失败是常态,别让 Agent 一条道走到黑

工具术语

  • Function Calling:模型请求调用函数——手的基础。
  • 工具描述:工具的使用说明书——描述越好调用越准。
  • 工具编排:多工具组合链——输出接输入。
  • MCP 协议:工具连接标准——Agent 的 USB 口。
  • 工具服务器:MCP 服务端——文件/数据库/浏览器的封装。
  • 最小权限:只给必要的工具——安全第一原则。
  • 人工确认:高危操作 human-in-the-loop——保命闸。

本站收获:工具 = Function Calling 打底 + 编排成链 + MCP 统一插口。工具描述要写好、权限给最小、高危要人工确认——「Agent 的手脚越强,越要栓好绳子」。

第 5 站

多智能体:Agent 团队

多 Agent 架构 · 主管-下属 · 通信 · 角色分工

一个 Agent 干复杂活会「一肩挑」——又查数据又写文案又发邮件,容易乱。多智能体像「公司团队」:主管拆活、专家各干一摊、最后汇总。这一站,Agent 的组织学。

🧙
周师傅

多智能体三种经典组织:

  • 主管-下属(Supervisor):一个「主管 Agent」拆任务、分派给「专家 Agent」,汇总结果——最常见(像项目经理)。
  • 流水线(Pipeline):A 干完传给 B——产出是下一步输入(像工厂流水线)。
  • 辩论/协作(Collaborative):多个 Agent 各持视角互相评审——提高质量(红蓝对抗的 Agent 版)。

Agent 间通信:结构化消息(JSON)+ 共享黑板(状态存储)——通信协议要定义清楚,不然团队就「吵起来」了。

多智能体架构实战
【主管-下属模式(月报生产线)】
         ┌──────── Supervisor(主管)────────┐
         │  拆任务:查数据 / 分析 / 写报告 / 发邮件 │
         └────┬──────┬──────┬──────┬──────┘
        ┌─────┘      │      │      └─────┐
   ┌────┴───┐  ┌────┴───┐ ┌┴─────┐ ┌─────┴───┐
   │数据 Agent│ │分析 Agent│ │文案 Agent│ │邮件 Agent│
   │查库    │ │算指标  │ │写报告 │ │发送+归档│
   └────────┘ └────────┘ └──────┘ └────────┘
   → 每个 Agent 一个职责,主管统一协调

【角色分工原则(康威定律 Agent 版)】
  一个 Agent 一个「职业」:数据专家 / 文案专家 / 质检员
  职责边界清晰 → 提示词简单 → 效果稳定
  → 别让一个 Agent 干所有事(角色越纯越好)

【通信协议】
  消息格式:JSON({sender, action, payload, status})
  共享状态:黑板(Blackboard)——全局变量存储中间结果
  超时/重试:Agent 不响应 → 主管重派 / 跳过

【多 Agent 的代价】
  成本:N 个 Agent = N 倍 token
  复杂度:通信 bug 排查难
  → 简单任务别上多 Agent!「一个能干完就别组队」
  适用:任务确实需要多角色协作(报告+审核+发送)

多智能体术语

  • 主管-下属:Supervisor 拆活分派——最常见模式。
  • 流水线:A→B→C 接力——产出即输入。
  • 协作/辩论:多视角评审——质量提升。
  • 角色分工:一个 Agent 一个职业——边界清晰。
  • Agent 通信:JSON 消息 + 黑板共享状态。
  • 代价控制:N 倍 token——简单任务别组队。
  • 康威定律:组织架构决定系统架构——Agent 团队同理。

本站收获:多智能体 = 主管拆活 + 专家各干一摊 + 消息通信。角色越纯越好、简单任务别组队——「团队」是手段不是目的,复杂任务才值得上。

第 6 站

框架:Agent 开发

LangGraph · AutoGen · CrewAI · Dify · 低代码

从零写 Agent 要处理太多细节(循环、状态、工具、记忆)——框架就是 Agent 的「脚手架」。这一站,认识主流框架并学会选型。

🧙
周师傅

主流框架地图(按「代码 vs 低代码」分):

  • LangChain / LangGraph:最流行——LangGraph 是图状工作流(节点 + 边 + 状态机),适合复杂 Agent。
  • AutoGen(微软):多 Agent 对话——擅长多智能体协作。
  • CrewAI:角色化团队——「定义角色、分配任务」的极简多 Agent。
  • Dify / Coze(扣子):低代码/可视化——拖拽搭 Agent,业务同学也能玩。
  • 其他:LlamaIndex(RAG 强)、OpenAI Assistants(官方托管)。

选型口诀:个人学习用 LangChain 系;团队生产看 LangGraph;快速验证用 Dify/Coze;多 Agent 协作看 AutoGen/CrewAI

LangGraph 实战:图状 Agent
from langgraph.graph import StateGraph, END

# 节点(Agent 的每一步)
def call_tool(state): ...      # 调工具
def think(state): ...          # 思考
def should_continue(state):    # 循环判断
    return "continue" if state["steps"] < MAX else "end"

# 图:节点 + 边(状态机)
graph = StateGraph(AgentState)
graph.add_node("think", think)
graph.add_node("tool", call_tool)
graph.add_edge("think", "tool")
graph.add_conditional_edges("tool", should_continue,
    {"continue": "think", "end": END})
app = graph.compile()

# 运行
result = app.invoke({"task": "分析本月支出", "steps": 0})

【LangGraph 核心概念】
  StateGraph:图状状态机——Agent 的「地图」
  节点(Node):一步操作(思考/工具/结束)
  边(Edge):流转关系 + 条件分支
  状态(State):全局共享数据(工作记忆)

【框架选型速查】
  场景                推荐
  学习/灵活 Agent     LangChain / LangGraph
  多 Agent 团队       AutoGen / CrewAI
  快速验证/业务同学   Dify / Coze(可视化)
  RAG 为主           LlamaIndex
  省运维/官方托管     OpenAI Assistants API

【框架 vs 自研】
  框架:快、有生态、更新快——但黑盒 + 版本变化快
  自研:可控、贴业务——但重复造轮子
  → 先框架验证,复杂处再自研(第十一本老智慧)

框架术语

  • LangGraph:图状工作流框架——节点/边/状态机。
  • LangChain:最流行的 Agent 生态——工具/记忆/链。
  • AutoGen:多 Agent 对话框架(微软)。
  • CrewAI:角色化团队——极简多 Agent。
  • Dify / Coze:低代码可视化——拖拽搭 Agent。
  • StateGraph:状态机图——Agent 的地图。
  • 选型口诀:学习 LangChain、生产 LangGraph、快验 Dify、协作 AutoGen。

本站收获:框架 = LangGraph(图状状态机)领跑 + AutoGen/CrewAI 管多 Agent + Dify/Coze 低代码快验。先框架验证、复杂处自研——别从零造轮子。

第 7 站

工作流:稳定干活

Agentic Workflow · 状态管理 · Human-in-the-loop · 可靠性

Agent 的自由是优点也是风险——生产环境要的是「自由但不失控」。工作流与状态管理,就是把 Agent 从「脱缰野马」驯成「可靠员工」。

🧙
周师傅

稳定三件套:

  • Agentic Workflow(智能体工作流):给 Agent 框定「流程骨架」——哪些步自由发挥、哪些步强制检查、哪些步必须人工确认——「框内自由」。
  • 状态管理:任务状态(进行中/待确认/完成/失败)+ 幂等性(重跑不重复)——断点续跑的基础(第四本状态机老朋友)。
  • Human-in-the-loop(人工介入):关键节点人拍板——发邮件前确认、删数据前确认、付款前确认——「Agent 提议,人类决定」。
生产级 Agent 工作流
【Agentic Workflow(框内自由)】
  输入 → [自由执行区] → [强制检查点] → [人工确认点] → 完成
              ↑  Agent 可自主        ↑ 规则校验       ↑ 人拍板
              │  查数据/分析        │ 格式/金额校验   │ 发邮件/删除
              └───────────────────┘

【月报任务的工作流设计】
  ① 查数据(Agent 自由:选工具、定参数)
  ② 生成报告(Agent 自由)
  ③ 校验点:金额合计与财务系统对账(规则检查,不符打回)
  ④ 人工确认点:发送前老板点「批准」——Human-in-the-loop
  ⑤ 发送 + 归档(Agent 执行)

【状态管理】
  任务状态机:pending → running → awaiting_approval → done/failed
  持久化状态:数据库存状态 + 上下文(任务重启可续跑)
  幂等:重试不产生重复操作(发两次邮件 = 事故!)

【可靠性工程(第十一本老朋友)】
  重试 + 超时 + 熔断(工具调用)
  日志全链路(TraceID——第十二本)
  失败降级:Agent 挂了 → 退回人工流程

【设计原则】
  「让 AI 做的事」:可验证、可回滚、低风险
  「让人做的事」:高风险、不可逆、要判断
  → 分工明确,Agent 才敢放手

工作流术语

  • Agentic Workflow:框内自由——流程骨架 + 自由发挥。
  • 检查点:强制校验——格式/金额/规则。
  • Human-in-the-loop:人工介入——Agent 提议人决定。
  • 状态机:任务状态流转——可续跑可追踪。
  • 幂等性:重跑不重复——防事故。
  • 可回滚:高风险操作设计退路。
  • 降级预案:Agent 挂 → 人工流程兜底。

本站收获:工作流 = 框内自由(Agentic Workflow)+ 检查点(强制校验)+ 人工确认(HITL)+ 状态管理(幂等续跑)。「AI 提议,人类决定」——这是 Agent 上生产的黄金法则。

第 8 站

评估与安全:质检护栏

任务成功率 · 幻觉 · 提示注入 · 权限隔离 · 审计

Agent 自由度高 = 出错的姿势也多。评估(它干得好不好)+ 安全(别让它闯祸)——是 Agent 上生产的生死线。第七本安全 + 第四本评估在这里合体。

🧙
周师傅

评估四维度(第四本第 8 站的 Agent 版):

  • 任务成功率:目标有没有完成——不是「答得对」,是「事办成了」。
  • 效率与成本:步数、token 消耗、耗时——Agent 烧钱快,要监控。
  • 可靠性:同样的任务跑 10 次,几次成功——方差大 = 不稳定。
  • 幻觉率:编造数据/事实——Agent 干活时编数据更危险!

安全四道闸:提示注入(用户输入骗 Agent 干坏事——第七本老朋友)、权限隔离(工具最小权限 + 沙箱)、输出审核(结果过一道检查)、审计日志(全程留痕,出事能查)。

Agent 评估与安全
【评估:Agent 的「考试」】
  评测集:一批真实任务 + 标准结果
  跑分:任务成功率 / 平均步数 / token 成本 / 方差
  版本对比:改了提示词,成功率升没升?
  → 没有评测的 Agent 改动 = 玄学(第四本老朋友)

【安全四道闸】
  ① 提示注入防护:
     用户输入和系统指令严格隔离
     工具参数校验(别让用户输入直接拼进命令!)
  ② 权限隔离:
     工具最小权限(能读不给写、能查不给删)
     沙箱执行(代码跑隔离环境)
  ③ 输出审核:
     结果校验(金额对账/格式检查——第7站检查点)
     敏感信息脱敏(第八本脱敏手艺)
  ④ 审计日志:
     谁在何时调了哪个工具、输入输出全记录
     → 出事了能还原现场(第七本审计)

【高危操作护栏(必须)】
  删除/覆盖/付款/发信 → 双重确认 + 人工审批
  Agent 越权尝试 → 直接拒绝 + 告警
  超出权限的工具 → 返回「无权限」并记录

【成本控制】
  最大步数上限(防无限循环)
  模型分级:简单步骤用小模型(第十六本路由)
  缓存:相同子任务结果复用

评估安全术语

  • 任务成功率:Agent 的核心 KPI——事办成了没。
  • 可靠性方差:同任务多次结果稳定性。
  • 提示注入:用户输入劫持 Agent——头号威胁。
  • 权限隔离:最小权限 + 沙箱——手脚要拴绳。
  • 输出审核:结果校验 + 脱敏——防编造防泄露。
  • 审计日志:全程留痕——出事能查。
  • 成本控制:步数上限 + 模型路由 + 缓存。

本站收获:评估 = 成功率 + 成本 + 方差 + 幻觉四维考分;安全 = 防注入 + 限权限 + 审输出 + 留审计。Agent 越强越要护栏——「自由是能力,护栏是责任」。

第 9 站

落地:真实场景

客服 Agent · 代码 Agent · 数据分析 Agent · 运维 Agent

技术学完了,Agent 到底能干什么?这一站看五大成熟场景——都是已经在真实生产里「上班」的 Agent 岗位。

🧙
周师傅

五大成熟场景:

  • 客服 Agent:最成熟——查订单、退换货、答 FAQ;复杂问题转人工(RAG + 工具 + HITL 组合)。
  • 代码 Agent(Copilot):写代码、修 bug、跑测试——GitHub Copilot/Cursor 都是它(Agent 模式自动改多文件)。
  • 数据分析 Agent:问一句话出报表——查库、算指标、画图(账小灵的进化版!)。
  • 运维 Agent:看监控、查日志、定位故障、执行预案——SRE 的数字助手(第十二本 ELK 的 Agent 化)。
  • 个人助理 Agent:管日程、发邮件、订会议——多工具编排的样板(MCP 的用武之地)。
场景拆解:数据分析 Agent
【用户一句话 → Agent 干完一整套】
用户:「帮我看下这季度哪个分类超支最多,并生成图表」
  ↓
① 规划:查数据 → 分析 → 画图 → 生成报告
② 工具调用:
   query_summary(季度汇总)      → 数据
   analyze_category(占比/增长)  → 发现餐饮 +40%
   generate_chart(柱状图)       → 图表
   render_report(Markdown)      → 报告
③ 反思:检查数据完整性 ✓
④ 交付:报告 + 图表 + 一句话结论
  ↓
用户看到:图文报告(全程没手动操作)

【各场景的关键组合】
  客服     :RAG(知识库)+ 工具(订单查询)+ HITL(转人工)
  代码     :工具(终端/文件)+ 上下文(仓库)+ 测试验证
  数据分析 :工具(SQL/图表)+ 校验(对账检查点)
  运维     :工具(监控/日志)+ 预案 + 审计(第七本闭环)
  个人助理 :MCP 多工具(日历/邮件/会议)+ 记忆(偏好)

【落地要点】
  先小后大:单场景验证(如只做「异常账单标注」)再扩展
  有人兜底:复杂/高风险留人工复核(第7站 HITL)
  持续评估:上线后每月跑评测集(第8站)
应用场景:账小灵升级为「数据分析 Agent」

小哲给账小灵接了工具链(查库 + 算指标 + 生成图表 + 发邮件)+ 长期记忆(老板偏好 PDF)+ 人工确认点(发送前审批)。老板说「月度经营分析」——Agent 自己查数据、算指标、画图表、生成报告,发到老板待批,老板点「批准」才送达。第一版只做「异常账单标注」单场景验证,跑稳后再扩展。

场景术语

  • 客服 Agent:RAG + 工具 + 转人工——最成熟场景。
  • 代码 Agent:写改测一体——Copilot 类产品。
  • 数据分析 Agent:问一句话出报表——查算图报。
  • 运维 Agent:监控日志排查——SRE 数字助手。
  • 个人助理:多工具编排——MCP 样板。
  • 先小后大:单场景验证再扩展——落地铁律。
  • 持续评估:上线后每月评测——防退化。

本站收获:五大场景 = 客服(最成熟)/代码(写改测)/数据分析(问话出报表)/运维(排障)/助理(多工具)。落地铁律:先小后大 + 有人兜底 + 持续评估——「Agent 要从小事干起」。

第 10 站

未来:Agent 工程师

Agent 工程师 · 自主 Agent · 多模态/具身 · 学习路线

2025 年后最火的新职业之一:Agent 工程师。这一站,看 Agent 的方向、Agent 工程师的技能栈,以及怎么入门。

🧙
周师傅

方向四看:

  • 自主 Agent(Autonomous):AutoGPT 类——目标驱动长时间自主运行(当前还不可靠,但方向明确)。
  • 多模态 Agent:看图/听音/读文档——不只是文本(第四本 + 第三本的多模态趋势)。
  • 具身智能(Embodied):Agent + 机器人——能「动手」改变物理世界(自动驾驶/机器人)。
  • Agent 经济:Agent 替人干活 → Agent 之间交易/协作——未来工作形态的想象。

Agent 工程师技能栈 = 提示词工程 + 工具/MCP + 工作流编排 + 评估 + 安全——「会调 API 的人很多,能把 Agent 驯成可靠员工的少」。

Agent 工程师技能栈与学习路线
【Agent 工程师技能栈(五件套)】
  ① 提示词工程:会写系统提示词(第四本)
  ② 工具与 MCP:会定义工具、会接 MCP(本册第4站)
  ③ 工作流编排:会用 LangGraph 类框架(第6-7站)
  ④ 评估:会建评测集、跑分对比(第8站)
  ⑤ 安全与合规:护栏设计(第8站 + 第七本)

【学习路线(3 个月)】
  第1月:复习 LLM 基础(第四本)+ 提示词进阶
  第2月:Function Calling + 一个简单 Agent(查天气/记账)
  第3月:LangGraph 工作流 + MCP 工具 + 评测集
  + 做一个完整项目(如「日报自动生成 Agent」)

【练手项目推荐(从易到难)】
  Lv1:单工具 Agent(查天气)
  Lv2:RAG + 工具(知识库客服)
  Lv3:多工具工作流(月报自动生成 + 审批)
  Lv4:多 Agent 协作(主管 + 专家)
  Lv5:带评估与安全护栏的生产级 Agent

【给新人的话】
  别追「全自主」噱头——先做「可靠的单场景」
  Agent 不是黑魔法,是「LLM + 工程」的组合艺术
  会写代码 + 会写 Prompt + 会设计流程 = 抢手
应用场景:小哲的 Agent 工程师之路

小哲三个月路线:第 1 月复习第四本 + 练提示词;第 2 月给账小灵接 Function Calling(先做「异常账单标注」单场景);第 3 月用 LangGraph 搭「月报生成工作流」+ MCP 接邮件 + 评测集对比——上线后月报任务成功率 95%,成本比人工低 80%。公司正式设了「Agent 工程师」岗,小哲成了第一个。

未来术语

  • Agent 工程师:新职业——驯 Agent 的人。
  • 自主 Agent:长时间自主运行——方向明确、现状未满。
  • 多模态 Agent:文本 + 图像 + 音频——感知更全。
  • 具身智能:Agent + 机器人——改变物理世界。
  • Agent 经济:Agent 干活与协作——未来工作形态。
  • 技能栈五件套:Prompt + 工具 + 编排 + 评估 + 安全。
  • 可靠优先:先单场景可靠,再谈自主。

本站收获:方向 = 自主/多模态/具身/Agent 经济;技能 = Prompt + 工具 + 编排 + 评估 + 安全。别追噱头,先把「可靠的单场景」做出来——「Agent 不是黑魔法,是 LLM + 工程的组合艺术」。

附录

知识点速查总表

面试/开发前最后一页

Agent 知识全景表

环节核心知识点一句话人话
进化之路Prompt→RAG→Function Calling→Agent、ReAct从会说话到会办事
规划任务分解、Plan-and-Execute、反思、CoT拆活、排活、查活
记忆短期/工作/长期记忆、写入召回、时效大脑皮层
工具Function Calling、工具编排、MCP、最小权限手脚与 USB 口
多智能体主管-下属、流水线、协作、角色分工Agent 团队
框架LangGraph、AutoGen、CrewAI、Dify/Coze脚手架
工作流Agentic Workflow、状态机、HITL、幂等框内自由
评估安全成功率、幻觉、提示注入、权限隔离、审计质检与护栏
落地场景客服/代码/数据分析/运维/助理五大岗位
未来职业Agent 工程师、自主/多模态/具身、学习路线新职业

高频面试题速记

  • Agent 和普通 LLM 应用区别?→ 目标驱动 + 自主规划 + 工具调用 + 多步循环。
  • ReAct 是什么?→ Reason+Act——思考-行动-观察循环。
  • Agent 三要素?→ 大脑(LLM)+ 记忆 + 工具(+规划)。
  • 短期/长期记忆区别?→ 上下文窗口 vs 向量库持久化。
  • MCP 是什么?→ 工具连接协议——Agent 的 USB 标准。
  • 多智能体怎么组织?→ 主管-下属 / 流水线 / 协作辩论。
  • LangGraph 核心概念?→ StateGraph 图状状态机——节点/边/状态。
  • Human-in-the-loop 用在哪?→ 高风险不可逆操作(删除/付款/发送)。
  • Agent 怎么防提示注入?→ 指令隔离 + 工具参数校验 + 权限最小化。
  • Agent 上线前怎么评估?→ 评测集跑任务成功率 + 成本 + 方差 + 幻觉率。
进化 ReAct
规划 拆解反思
记忆 三层
工具 MCP
团队 多智能体
框架 LangGraph
稳定 工作流/审批
护栏 评估安全 🚀
LLM 是「会说话的大脑」,
Agent 是「有手有脚有记忆、会自己安排活儿的员工」。
规划让它会想,记忆让它记得,工具让它能做,
工作流让它稳,护栏让它不闯祸——
Agent 不是黑魔法,是 LLM + 工程的组合艺术;
而 Agent 工程师,就是那个驯服智能体的人。
🧠 🗺️ 🧠 🛠️ 👥 🏗️ 🔄 🛡️ 🚀 🔮 🌳
✌ 语言