智能体的觉醒
第四本《从Token到AI应用》里,小哲做出了会聊天的「账小灵」。但老板的要求升级了:「别光聊天,让它自己把月报写出来、把异常账单找出来、把报表发给财务!」——从「回答问题」到「动手办事」,这就是 AI Agent(智能体)。周师傅说:Agent = 大脑(LLM)+ 规划 + 记忆 + 工具。这一本,把 Agent 从骨架到落地完整拆解。
AI 会聊天,但会干活吗
Agent 定义 · 三要素 · 从助手到员工师傅!老板看了账小灵说:「聊天很厉害,但能不能让它自己干活?——月初自动把经营月报整理好、把异常账单标出来、发到财务邮箱?」这……不就是聊天加个按钮吗?
差的远了——这就是 AI Agent(智能体)和普通聊天应用的分水岭:
- 聊天应用:你问一句,它答一句——「答话」。
- AI Agent:你给一个目标,它自己规划步骤、调用工具、查资料、干活、验证结果——「办事」。
Agent 的三要素(记住这个框架,全书都在讲它):大脑(LLM 做决策)+ 记忆(记得住上下文)+ 工具(能动手操作)——再加「规划」让它们串起来。
记住一句话:LLM 是「会说话的大脑」,Agent 是「有手有脚有记忆、会自己安排活儿的员工」。走,第一站,看看大脑是怎么长出手脚的。
从 LLM 到 Agent:进化之路
Prompt → RAG → Function Calling → Agent · ReActAgent 不是一夜出现的——它是 LLM 应用「四步进化」的结果。看懂这条进化链,就懂了「为什么需要 Agent」。
LLM 应用的四级进化(全是系列老朋友):
- ① Prompt 工程:会「好好说话」——第四本的起点。
- ② RAG:会「查资料再答」——给大脑装知识库。
- ③ Function Calling:会「调用函数」——给大脑装一只手。
- ④ Agent:会「自己决定何时查、何时调、何时停」——大脑 + 手 + 眼睛 + 思考循环。
Agent 的核心工作模式是 ReAct(Reason + Act):思考 → 行动 → 观察结果 → 再思考……直到任务完成。它把「一步问答」升级成「多步办事」。
【进化四步(每步都是上一部的老朋友)】
① Prompt 工程:写提示词让模型好好答
例:你是一个记账助手……
② RAG:回答前先查知识库(第四本第5站)
例:先查报销规则再回答
③ Function Calling:让模型调用工具(第四本第4站)
例:模型说"我要调 query_expense(month)"
④ Agent:模型自己决定调用链(这一本!)
例:查账 → 发现异常 → 调分析工具 → 生成报告 → 发邮件
【ReAct 循环(Agent 的心跳)】
用户目标:「分析本月支出并发送报告」
↓
Thought(思考):我需要先查本月支出数据
↓
Action(行动):调用 query_expense(month: "2026-09")
↓
Observation(观察):支出 1915.50,餐饮占比 40%
↓
Thought(思考):餐饮占比异常,需要分析趋势
↓
Action(行动):调用 trend_analysis(category: "餐饮")
↓
……(循环直到任务完成)……
↓
Final(收尾):生成报告并调用 send_email()
【Agent vs 普通应用(对照)】
普通应用:固定流程,人一步一步点
Agent :目标驱动,自己拆步骤、自己决定工具
→ 灵活性是 Agent 的价值,不确定性是 Agent 的挑战
进化术语
- Agent 定义:目标驱动的自主智能体——规划 + 记忆 + 工具。
- 进化四步:Prompt → RAG → Function Calling → Agent——能力逐级叠加。
- ReAct:Reason + Act——思考-行动-观察循环。
- Thought/Action/Observation:循环三件套——Agent 的「内心独白」。
- 目标驱动:给目标不给定步骤——Agent 自己拆。
- 不确定性:Agent 可能走错路——需要护栏(第 7、8 站)。
本站收获:进化链 = Prompt 会说话 → RAG 有知识 → Function Calling 有手 → Agent 会自己安排活儿。ReAct 循环(想→做→看→再想)是 Agent 的心跳——这一站是全书的地基。
骨架:规划与思考
任务分解 · 规划 · 反思 · 思维链Agent 的第一块骨架是「规划」——把大目标拆成小步骤,走一步看一步,错了能回头。没有规划,Agent 就是「无头苍蝇」。
规划三层能力:
- 任务分解(Decomposition):把大目标拆成可执行的小任务——「写月报」→「查数据 → 算指标 → 写正文 → 生成 PDF → 发邮件」。
- 计划制定(Planning):排序 + 依赖——先查数据才能写正文。
- 反思(Reflection):执行后「回头看」——结果对不对?要不要重来?错了能自己纠正(自我批评是 Agent 质量的倍增器)。
底层依赖:CoT(思维链)(第一本老朋友)——让模型「一步一步想」,复杂任务正确率暴涨。规划通常用 Plan-and-Execute 模式:先出计划,再逐步执行,执行中可调整。
【Plan(先出计划)】
用户目标:整理本月经营月报并发给财务
↓
模型生成计划:
1. 查询本月营收/支出/分类汇总(query_summary)
2. 与上月对比,标注异常(analyze_trend)
3. 生成 Markdown 月报(generate_report)
4. 转 PDF 并发邮件(send_email)
→ 计划确认后再逐步执行
【Execute(逐步执行 + 反思)】
步骤1:查数据 ✓ → 反思:数据完整,OK
步骤2:分析 ✓ → 反思:餐饮支出 +40% 异常,标注
步骤3:生成报告 ✓ → 反思:格式正确
步骤4:发送 ✓ → 完成!
【规划失效的兜底】
步骤失败 → 重试 2 次 → 仍失败 → 跳过并说明(别硬编!)
结果异常 → 反思触发「重新规划」分支
→ 给 Agent 设「最大步数」上限(第8站成本控制)
【ReAct vs Plan-and-Execute】
ReAct:走一步想一步(灵活,适合未知任务)
Plan-and-Execute:先计划再执行(稳定,适合流程清晰任务)
→ 复杂任务常用「Plan 先行 + ReAct 微调」混合模式
规划术语
- 任务分解:大目标 → 小任务——Agent 的第一能力。
- Planning(计划):排序 + 依赖管理。
- Reflection(反思):回头看结果——自我纠正。
- CoT(思维链):一步一步想——正确率倍增器。
- Plan-and-Execute:先计划再执行——稳定模式。
- 最大步数:执行上限——防止无限循环烧钱。
- 混合模式:Plan 先行 + ReAct 微调——复杂任务标配。
本站收获:规划 = 任务分解(拆)+ 计划(排)+ 反思(查)。Plan-and-Execute 保稳定、ReAct 保灵活、反思保质量——没有规划的 Agent 是乱撞,有规划的 Agent 才是员工。
记忆:大脑皮层
短期记忆 · 长期记忆 · 记忆写入/召回 · 工作记忆Agent 干活要「记得住」:当前任务做到哪了(短期)、上次对话说过啥(长期)。记忆是 Agent 的「大脑皮层」——第四本讲过记忆,这本讲 Agent 专属的记忆架构。
Agent 记忆分三层:
- 短期记忆(上下文):当前任务的全部对话 + 思考过程——装进上下文窗口(第四本第 2 站的知识)。
- 工作记忆:任务中途的「草稿本」——临时数据、中间结果(执行到一半断了能续)。
- 长期记忆(向量库):跨任务/跨会话的持久知识——用户偏好、历史决策、领域规则(第四本第 7 站 + 第八本向量检索的老朋友)。
记忆两大操作:写入(Extraction)——从对话中提炼值得记的;召回(Recall)——干活前检索相关的记忆。Agent 框架把这两步做成自动管线。
┌────────────────────────────────────────┐
│ 短期记忆:当前任务上下文(窗口内) │
│ 用户目标 + 思考过程 + 工具结果 │
├────────────────────────────────────────┤
│ 工作记忆:任务草稿本(执行状态) │
│ 中间结果 / 进行到哪一步 / 临时数据 │
├────────────────────────────────────────┤
│ 长期记忆:向量数据库(跨任务) │
│ 用户偏好 / 历史决策 / 领域规则 │
└────────────────────────────────────────┘
【记忆写入(自动提炼)】
任务完成后扫描对话 → 提取值得记的:
{ "type": "preference", "content": "财务报告用 PDF 格式" }
→ 存入向量库(带时间戳,可过期)
【记忆召回(干活前唤醒)】
新任务开始 → 语义检索相关记忆 → 拼进上下文
→ Agent 像「有经验的老员工」,不每次都从零开始
【记忆管理要点】
容量:短期窗口有限 → 摘要压缩(第四本第2站)
时效:旧记忆要过期/降权(用户改主意了别死记)
隐私:敏感记忆要隔离(第8站安全)
可删:用户要求删除记忆 → 必须能删(第八本合规)
【案例:账小灵的月报 Agent】
长期记忆:老板偏好 PDF + 只发财务部 + 上月基线数据
短期记忆:本次任务上下文
召回 → 「老板喜欢 PDF」→ 自动生成 PDF 而不是 Excel
记忆术语
- 短期记忆:当前任务上下文——窗口内。
- 工作记忆:任务草稿本——中间状态。
- 长期记忆:向量库持久知识——跨任务。
- 记忆写入:自动提炼值得记的信息。
- 记忆召回:任务前检索相关记忆。
- 记忆时效:过期/降权——别死记旧事。
- 记忆隐私:隔离 + 可删除——合规底线。
本站收获:记忆 = 短期(上下文)+ 工作(草稿)+ 长期(向量库)。写入提炼、召回唤醒——「有记忆的 Agent 是老员工,没记忆的是新实习生」。别忘时效和隐私。
工具:手脚与 MCP
Function Calling · 工具编排 · MCP 协议 · 工具安全记忆管「记得」,工具管「动手」——查数据库、发邮件、操作文件全靠工具。第四本讲了 Function Calling 的基础,这本讲 Agent 时代的工具体系:MCP 协议。
Agent 工具三层:
- Function Calling(基础):模型请求调用函数 → 代码执行 → 结果回喂(第四本第 4 站)。
- 工具编排(进阶):多个工具的组合逻辑——「先查再算再发」的工具链;工具描述写得好,模型才知道啥时候用它。
- MCP(模型上下文协议):工具的「USB 标准」——统一接口,一个 Agent 能接任意 MCP 工具服务器(文件系统/数据库/浏览器/日历……即插即用)。
你现在用的 Loomy,就是通过 MCP 接了一大堆工具(浏览器/邮箱/飞书……)——Agent 的「插线板」。
【工具定义(描述决定会不会被正确调用)】
工具:query_expense
描述:查询用户在指定月份的支出汇总(元)
参数:{ month: "YYYY-MM" }
→ 描述写清楚 = 模型知道何时用它
【工具编排(组合拳)】
月报任务的工具链:
query_summary → analyze_trend → generate_report → send_email
→ 每个工具的输出是下一个工具的输入(管道思想)
【MCP 架构(USB 标准)】
┌─────────┐ MCP 协议 ┌──────────────────┐
│ Agent │ ←────────→ │ MCP 工具服务器 │
│ (宿主) │ │ ├ 文件系统工具 │
└─────────┘ │ ├ 数据库工具 │
│ ├ 浏览器工具 │
│ └ 邮件工具 │
→ 工具即插即用,Agent 通用,生态共享
【工具安全(第8站重点,先立规矩)】
最小权限:只给必要的工具(能读就别给删)
高危操作:删除/付款 → 必须人工确认(Human-in-the-loop)
沙箱执行:工具代码跑在隔离环境(别让 Agent 乱碰系统)
【工具失败处理】
工具报错 → 反馈给模型 → 换参数重试 / 换工具 / 放弃
→ 工具会失败是常态,别让 Agent 一条道走到黑
工具术语
- Function Calling:模型请求调用函数——手的基础。
- 工具描述:工具的使用说明书——描述越好调用越准。
- 工具编排:多工具组合链——输出接输入。
- MCP 协议:工具连接标准——Agent 的 USB 口。
- 工具服务器:MCP 服务端——文件/数据库/浏览器的封装。
- 最小权限:只给必要的工具——安全第一原则。
- 人工确认:高危操作 human-in-the-loop——保命闸。
本站收获:工具 = Function Calling 打底 + 编排成链 + MCP 统一插口。工具描述要写好、权限给最小、高危要人工确认——「Agent 的手脚越强,越要栓好绳子」。
多智能体:Agent 团队
多 Agent 架构 · 主管-下属 · 通信 · 角色分工一个 Agent 干复杂活会「一肩挑」——又查数据又写文案又发邮件,容易乱。多智能体像「公司团队」:主管拆活、专家各干一摊、最后汇总。这一站,Agent 的组织学。
多智能体三种经典组织:
- 主管-下属(Supervisor):一个「主管 Agent」拆任务、分派给「专家 Agent」,汇总结果——最常见(像项目经理)。
- 流水线(Pipeline):A 干完传给 B——产出是下一步输入(像工厂流水线)。
- 辩论/协作(Collaborative):多个 Agent 各持视角互相评审——提高质量(红蓝对抗的 Agent 版)。
Agent 间通信:结构化消息(JSON)+ 共享黑板(状态存储)——通信协议要定义清楚,不然团队就「吵起来」了。
【主管-下属模式(月报生产线)】
┌──────── Supervisor(主管)────────┐
│ 拆任务:查数据 / 分析 / 写报告 / 发邮件 │
└────┬──────┬──────┬──────┬──────┘
┌─────┘ │ │ └─────┐
┌────┴───┐ ┌────┴───┐ ┌┴─────┐ ┌─────┴───┐
│数据 Agent│ │分析 Agent│ │文案 Agent│ │邮件 Agent│
│查库 │ │算指标 │ │写报告 │ │发送+归档│
└────────┘ └────────┘ └──────┘ └────────┘
→ 每个 Agent 一个职责,主管统一协调
【角色分工原则(康威定律 Agent 版)】
一个 Agent 一个「职业」:数据专家 / 文案专家 / 质检员
职责边界清晰 → 提示词简单 → 效果稳定
→ 别让一个 Agent 干所有事(角色越纯越好)
【通信协议】
消息格式:JSON({sender, action, payload, status})
共享状态:黑板(Blackboard)——全局变量存储中间结果
超时/重试:Agent 不响应 → 主管重派 / 跳过
【多 Agent 的代价】
成本:N 个 Agent = N 倍 token
复杂度:通信 bug 排查难
→ 简单任务别上多 Agent!「一个能干完就别组队」
适用:任务确实需要多角色协作(报告+审核+发送)
多智能体术语
- 主管-下属:Supervisor 拆活分派——最常见模式。
- 流水线:A→B→C 接力——产出即输入。
- 协作/辩论:多视角评审——质量提升。
- 角色分工:一个 Agent 一个职业——边界清晰。
- Agent 通信:JSON 消息 + 黑板共享状态。
- 代价控制:N 倍 token——简单任务别组队。
- 康威定律:组织架构决定系统架构——Agent 团队同理。
本站收获:多智能体 = 主管拆活 + 专家各干一摊 + 消息通信。角色越纯越好、简单任务别组队——「团队」是手段不是目的,复杂任务才值得上。
框架:Agent 开发
LangGraph · AutoGen · CrewAI · Dify · 低代码从零写 Agent 要处理太多细节(循环、状态、工具、记忆)——框架就是 Agent 的「脚手架」。这一站,认识主流框架并学会选型。
主流框架地图(按「代码 vs 低代码」分):
- LangChain / LangGraph:最流行——LangGraph 是图状工作流(节点 + 边 + 状态机),适合复杂 Agent。
- AutoGen(微软):多 Agent 对话——擅长多智能体协作。
- CrewAI:角色化团队——「定义角色、分配任务」的极简多 Agent。
- Dify / Coze(扣子):低代码/可视化——拖拽搭 Agent,业务同学也能玩。
- 其他:LlamaIndex(RAG 强)、OpenAI Assistants(官方托管)。
选型口诀:个人学习用 LangChain 系;团队生产看 LangGraph;快速验证用 Dify/Coze;多 Agent 协作看 AutoGen/CrewAI。
from langgraph.graph import StateGraph, END
# 节点(Agent 的每一步)
def call_tool(state): ... # 调工具
def think(state): ... # 思考
def should_continue(state): # 循环判断
return "continue" if state["steps"] < MAX else "end"
# 图:节点 + 边(状态机)
graph = StateGraph(AgentState)
graph.add_node("think", think)
graph.add_node("tool", call_tool)
graph.add_edge("think", "tool")
graph.add_conditional_edges("tool", should_continue,
{"continue": "think", "end": END})
app = graph.compile()
# 运行
result = app.invoke({"task": "分析本月支出", "steps": 0})
【LangGraph 核心概念】
StateGraph:图状状态机——Agent 的「地图」
节点(Node):一步操作(思考/工具/结束)
边(Edge):流转关系 + 条件分支
状态(State):全局共享数据(工作记忆)
【框架选型速查】
场景 推荐
学习/灵活 Agent LangChain / LangGraph
多 Agent 团队 AutoGen / CrewAI
快速验证/业务同学 Dify / Coze(可视化)
RAG 为主 LlamaIndex
省运维/官方托管 OpenAI Assistants API
【框架 vs 自研】
框架:快、有生态、更新快——但黑盒 + 版本变化快
自研:可控、贴业务——但重复造轮子
→ 先框架验证,复杂处再自研(第十一本老智慧)
框架术语
- LangGraph:图状工作流框架——节点/边/状态机。
- LangChain:最流行的 Agent 生态——工具/记忆/链。
- AutoGen:多 Agent 对话框架(微软)。
- CrewAI:角色化团队——极简多 Agent。
- Dify / Coze:低代码可视化——拖拽搭 Agent。
- StateGraph:状态机图——Agent 的地图。
- 选型口诀:学习 LangChain、生产 LangGraph、快验 Dify、协作 AutoGen。
本站收获:框架 = LangGraph(图状状态机)领跑 + AutoGen/CrewAI 管多 Agent + Dify/Coze 低代码快验。先框架验证、复杂处自研——别从零造轮子。
工作流:稳定干活
Agentic Workflow · 状态管理 · Human-in-the-loop · 可靠性Agent 的自由是优点也是风险——生产环境要的是「自由但不失控」。工作流与状态管理,就是把 Agent 从「脱缰野马」驯成「可靠员工」。
稳定三件套:
- Agentic Workflow(智能体工作流):给 Agent 框定「流程骨架」——哪些步自由发挥、哪些步强制检查、哪些步必须人工确认——「框内自由」。
- 状态管理:任务状态(进行中/待确认/完成/失败)+ 幂等性(重跑不重复)——断点续跑的基础(第四本状态机老朋友)。
- Human-in-the-loop(人工介入):关键节点人拍板——发邮件前确认、删数据前确认、付款前确认——「Agent 提议,人类决定」。
【Agentic Workflow(框内自由)】
输入 → [自由执行区] → [强制检查点] → [人工确认点] → 完成
↑ Agent 可自主 ↑ 规则校验 ↑ 人拍板
│ 查数据/分析 │ 格式/金额校验 │ 发邮件/删除
└───────────────────┘
【月报任务的工作流设计】
① 查数据(Agent 自由:选工具、定参数)
② 生成报告(Agent 自由)
③ 校验点:金额合计与财务系统对账(规则检查,不符打回)
④ 人工确认点:发送前老板点「批准」——Human-in-the-loop
⑤ 发送 + 归档(Agent 执行)
【状态管理】
任务状态机:pending → running → awaiting_approval → done/failed
持久化状态:数据库存状态 + 上下文(任务重启可续跑)
幂等:重试不产生重复操作(发两次邮件 = 事故!)
【可靠性工程(第十一本老朋友)】
重试 + 超时 + 熔断(工具调用)
日志全链路(TraceID——第十二本)
失败降级:Agent 挂了 → 退回人工流程
【设计原则】
「让 AI 做的事」:可验证、可回滚、低风险
「让人做的事」:高风险、不可逆、要判断
→ 分工明确,Agent 才敢放手
工作流术语
- Agentic Workflow:框内自由——流程骨架 + 自由发挥。
- 检查点:强制校验——格式/金额/规则。
- Human-in-the-loop:人工介入——Agent 提议人决定。
- 状态机:任务状态流转——可续跑可追踪。
- 幂等性:重跑不重复——防事故。
- 可回滚:高风险操作设计退路。
- 降级预案:Agent 挂 → 人工流程兜底。
本站收获:工作流 = 框内自由(Agentic Workflow)+ 检查点(强制校验)+ 人工确认(HITL)+ 状态管理(幂等续跑)。「AI 提议,人类决定」——这是 Agent 上生产的黄金法则。
评估与安全:质检护栏
任务成功率 · 幻觉 · 提示注入 · 权限隔离 · 审计Agent 自由度高 = 出错的姿势也多。评估(它干得好不好)+ 安全(别让它闯祸)——是 Agent 上生产的生死线。第七本安全 + 第四本评估在这里合体。
评估四维度(第四本第 8 站的 Agent 版):
- 任务成功率:目标有没有完成——不是「答得对」,是「事办成了」。
- 效率与成本:步数、token 消耗、耗时——Agent 烧钱快,要监控。
- 可靠性:同样的任务跑 10 次,几次成功——方差大 = 不稳定。
- 幻觉率:编造数据/事实——Agent 干活时编数据更危险!
安全四道闸:提示注入(用户输入骗 Agent 干坏事——第七本老朋友)、权限隔离(工具最小权限 + 沙箱)、输出审核(结果过一道检查)、审计日志(全程留痕,出事能查)。
【评估:Agent 的「考试」】
评测集:一批真实任务 + 标准结果
跑分:任务成功率 / 平均步数 / token 成本 / 方差
版本对比:改了提示词,成功率升没升?
→ 没有评测的 Agent 改动 = 玄学(第四本老朋友)
【安全四道闸】
① 提示注入防护:
用户输入和系统指令严格隔离
工具参数校验(别让用户输入直接拼进命令!)
② 权限隔离:
工具最小权限(能读不给写、能查不给删)
沙箱执行(代码跑隔离环境)
③ 输出审核:
结果校验(金额对账/格式检查——第7站检查点)
敏感信息脱敏(第八本脱敏手艺)
④ 审计日志:
谁在何时调了哪个工具、输入输出全记录
→ 出事了能还原现场(第七本审计)
【高危操作护栏(必须)】
删除/覆盖/付款/发信 → 双重确认 + 人工审批
Agent 越权尝试 → 直接拒绝 + 告警
超出权限的工具 → 返回「无权限」并记录
【成本控制】
最大步数上限(防无限循环)
模型分级:简单步骤用小模型(第十六本路由)
缓存:相同子任务结果复用
评估安全术语
- 任务成功率:Agent 的核心 KPI——事办成了没。
- 可靠性方差:同任务多次结果稳定性。
- 提示注入:用户输入劫持 Agent——头号威胁。
- 权限隔离:最小权限 + 沙箱——手脚要拴绳。
- 输出审核:结果校验 + 脱敏——防编造防泄露。
- 审计日志:全程留痕——出事能查。
- 成本控制:步数上限 + 模型路由 + 缓存。
本站收获:评估 = 成功率 + 成本 + 方差 + 幻觉四维考分;安全 = 防注入 + 限权限 + 审输出 + 留审计。Agent 越强越要护栏——「自由是能力,护栏是责任」。
落地:真实场景
客服 Agent · 代码 Agent · 数据分析 Agent · 运维 Agent技术学完了,Agent 到底能干什么?这一站看五大成熟场景——都是已经在真实生产里「上班」的 Agent 岗位。
五大成熟场景:
- 客服 Agent:最成熟——查订单、退换货、答 FAQ;复杂问题转人工(RAG + 工具 + HITL 组合)。
- 代码 Agent(Copilot):写代码、修 bug、跑测试——GitHub Copilot/Cursor 都是它(Agent 模式自动改多文件)。
- 数据分析 Agent:问一句话出报表——查库、算指标、画图(账小灵的进化版!)。
- 运维 Agent:看监控、查日志、定位故障、执行预案——SRE 的数字助手(第十二本 ELK 的 Agent 化)。
- 个人助理 Agent:管日程、发邮件、订会议——多工具编排的样板(MCP 的用武之地)。
【用户一句话 → Agent 干完一整套】
用户:「帮我看下这季度哪个分类超支最多,并生成图表」
↓
① 规划:查数据 → 分析 → 画图 → 生成报告
② 工具调用:
query_summary(季度汇总) → 数据
analyze_category(占比/增长) → 发现餐饮 +40%
generate_chart(柱状图) → 图表
render_report(Markdown) → 报告
③ 反思:检查数据完整性 ✓
④ 交付:报告 + 图表 + 一句话结论
↓
用户看到:图文报告(全程没手动操作)
【各场景的关键组合】
客服 :RAG(知识库)+ 工具(订单查询)+ HITL(转人工)
代码 :工具(终端/文件)+ 上下文(仓库)+ 测试验证
数据分析 :工具(SQL/图表)+ 校验(对账检查点)
运维 :工具(监控/日志)+ 预案 + 审计(第七本闭环)
个人助理 :MCP 多工具(日历/邮件/会议)+ 记忆(偏好)
【落地要点】
先小后大:单场景验证(如只做「异常账单标注」)再扩展
有人兜底:复杂/高风险留人工复核(第7站 HITL)
持续评估:上线后每月跑评测集(第8站)
小哲给账小灵接了工具链(查库 + 算指标 + 生成图表 + 发邮件)+ 长期记忆(老板偏好 PDF)+ 人工确认点(发送前审批)。老板说「月度经营分析」——Agent 自己查数据、算指标、画图表、生成报告,发到老板待批,老板点「批准」才送达。第一版只做「异常账单标注」单场景验证,跑稳后再扩展。
场景术语
- 客服 Agent:RAG + 工具 + 转人工——最成熟场景。
- 代码 Agent:写改测一体——Copilot 类产品。
- 数据分析 Agent:问一句话出报表——查算图报。
- 运维 Agent:监控日志排查——SRE 数字助手。
- 个人助理:多工具编排——MCP 样板。
- 先小后大:单场景验证再扩展——落地铁律。
- 持续评估:上线后每月评测——防退化。
本站收获:五大场景 = 客服(最成熟)/代码(写改测)/数据分析(问话出报表)/运维(排障)/助理(多工具)。落地铁律:先小后大 + 有人兜底 + 持续评估——「Agent 要从小事干起」。
未来:Agent 工程师
Agent 工程师 · 自主 Agent · 多模态/具身 · 学习路线2025 年后最火的新职业之一:Agent 工程师。这一站,看 Agent 的方向、Agent 工程师的技能栈,以及怎么入门。
方向四看:
- 自主 Agent(Autonomous):AutoGPT 类——目标驱动长时间自主运行(当前还不可靠,但方向明确)。
- 多模态 Agent:看图/听音/读文档——不只是文本(第四本 + 第三本的多模态趋势)。
- 具身智能(Embodied):Agent + 机器人——能「动手」改变物理世界(自动驾驶/机器人)。
- Agent 经济:Agent 替人干活 → Agent 之间交易/协作——未来工作形态的想象。
Agent 工程师技能栈 = 提示词工程 + 工具/MCP + 工作流编排 + 评估 + 安全——「会调 API 的人很多,能把 Agent 驯成可靠员工的少」。
【Agent 工程师技能栈(五件套)】
① 提示词工程:会写系统提示词(第四本)
② 工具与 MCP:会定义工具、会接 MCP(本册第4站)
③ 工作流编排:会用 LangGraph 类框架(第6-7站)
④ 评估:会建评测集、跑分对比(第8站)
⑤ 安全与合规:护栏设计(第8站 + 第七本)
【学习路线(3 个月)】
第1月:复习 LLM 基础(第四本)+ 提示词进阶
第2月:Function Calling + 一个简单 Agent(查天气/记账)
第3月:LangGraph 工作流 + MCP 工具 + 评测集
+ 做一个完整项目(如「日报自动生成 Agent」)
【练手项目推荐(从易到难)】
Lv1:单工具 Agent(查天气)
Lv2:RAG + 工具(知识库客服)
Lv3:多工具工作流(月报自动生成 + 审批)
Lv4:多 Agent 协作(主管 + 专家)
Lv5:带评估与安全护栏的生产级 Agent
【给新人的话】
别追「全自主」噱头——先做「可靠的单场景」
Agent 不是黑魔法,是「LLM + 工程」的组合艺术
会写代码 + 会写 Prompt + 会设计流程 = 抢手
小哲三个月路线:第 1 月复习第四本 + 练提示词;第 2 月给账小灵接 Function Calling(先做「异常账单标注」单场景);第 3 月用 LangGraph 搭「月报生成工作流」+ MCP 接邮件 + 评测集对比——上线后月报任务成功率 95%,成本比人工低 80%。公司正式设了「Agent 工程师」岗,小哲成了第一个。
未来术语
- Agent 工程师:新职业——驯 Agent 的人。
- 自主 Agent:长时间自主运行——方向明确、现状未满。
- 多模态 Agent:文本 + 图像 + 音频——感知更全。
- 具身智能:Agent + 机器人——改变物理世界。
- Agent 经济:Agent 干活与协作——未来工作形态。
- 技能栈五件套:Prompt + 工具 + 编排 + 评估 + 安全。
- 可靠优先:先单场景可靠,再谈自主。
本站收获:方向 = 自主/多模态/具身/Agent 经济;技能 = Prompt + 工具 + 编排 + 评估 + 安全。别追噱头,先把「可靠的单场景」做出来——「Agent 不是黑魔法,是 LLM + 工程的组合艺术」。
知识点速查总表
面试/开发前最后一页Agent 知识全景表
| 环节 | 核心知识点 | 一句话人话 |
|---|---|---|
| 进化之路 | Prompt→RAG→Function Calling→Agent、ReAct | 从会说话到会办事 |
| 规划 | 任务分解、Plan-and-Execute、反思、CoT | 拆活、排活、查活 |
| 记忆 | 短期/工作/长期记忆、写入召回、时效 | 大脑皮层 |
| 工具 | Function Calling、工具编排、MCP、最小权限 | 手脚与 USB 口 |
| 多智能体 | 主管-下属、流水线、协作、角色分工 | Agent 团队 |
| 框架 | LangGraph、AutoGen、CrewAI、Dify/Coze | 脚手架 |
| 工作流 | Agentic Workflow、状态机、HITL、幂等 | 框内自由 |
| 评估安全 | 成功率、幻觉、提示注入、权限隔离、审计 | 质检与护栏 |
| 落地场景 | 客服/代码/数据分析/运维/助理 | 五大岗位 |
| 未来职业 | Agent 工程师、自主/多模态/具身、学习路线 | 新职业 |
高频面试题速记
- Agent 和普通 LLM 应用区别?→ 目标驱动 + 自主规划 + 工具调用 + 多步循环。
- ReAct 是什么?→ Reason+Act——思考-行动-观察循环。
- Agent 三要素?→ 大脑(LLM)+ 记忆 + 工具(+规划)。
- 短期/长期记忆区别?→ 上下文窗口 vs 向量库持久化。
- MCP 是什么?→ 工具连接协议——Agent 的 USB 标准。
- 多智能体怎么组织?→ 主管-下属 / 流水线 / 协作辩论。
- LangGraph 核心概念?→ StateGraph 图状状态机——节点/边/状态。
- Human-in-the-loop 用在哪?→ 高风险不可逆操作(删除/付款/发送)。
- Agent 怎么防提示注入?→ 指令隔离 + 工具参数校验 + 权限最小化。
- Agent 上线前怎么评估?→ 评测集跑任务成功率 + 成本 + 方差 + 幻觉率。
Agent 是「有手有脚有记忆、会自己安排活儿的员工」。
工作流让它稳,护栏让它不闯祸——
Agent 不是黑魔法,是 LLM + 工程的组合艺术;
而 Agent 工程师,就是那个驯服智能体的人。