一条清晰的路径
从下到上,每一阶段都有起点、终点和验证方式。
能向任何人讲清楚 Agent 本质。能独立完成 Phase 1 的 6 项自检清单。
能针对任意需求选择最合适的框架组合,并解释为什么这样选。
一个可运行的完整 Agent 系统,包含文档、测试、可视化界面。
评估与优化
建立评估体系,掌握监控方法。学习 Prompt 优化、成本控制、错误分析的实战技巧。
完整的 Eval Pipeline + 监控仪表盘 + 优化迭代记录。
一个完整、生产级、可开源或商业化的 Agent 项目。
它就是你最好的作品。
每一阶段的详细内容
可以按时间线顺序学习,也可以挑选最需要的阶段深入。
认知与心智模型
这一阶段的目的是建立"Agent 的眼睛"。你不需要会写代码,但你需要能: 看到产品需求时,立刻知道背后需要什么样的 Agent 能力;看到论文、博客、教程时,立刻把它们定位到心智地图的某个位置。
📚 核心模块
1.1 LLM 基础与心智模型
Transformer 架构、token、上下文窗口、推理参数。理解为什么"温度"和"top-p"有那么大影响。
1.2 提示工程核心
Zero-shot、Few-shot、CoT、System Prompt 的设计艺术。结构化输出与 JSON 模式。
1.3 Function Calling 与工具调用
从用户输入到工具执行的完整流程。工具描述的设计规范和最佳实践。
1.4 Agent 范式全景
ReAct、Plan-and-Execute、Reflection、Multi-Agent。四种核心范式的内在逻辑。
1.5 推理与思维链
CoT、Self-Consistency、ToT、ReAct 中的推理。o1/o3 类推理模型的范式转变。
1.6 记忆与检索
短期/长期记忆、向量检索、混合检索、RAG 模式全景。
1.7 评估与可观测性
为什么要评估、评估什么、怎么评估。可观测性的工业实践。
🎯 阶段输出标准
🧰 推荐资源
- 📖 OpenAI / Anthropic 官方文档
- 🎓 DeepLearning.AI 短课程
- 📄 经典论文 5 篇 (ReAct/Reflexion/ToT)
- 🛠 Anthropic Prompt Engineering 教程
技能与工具栈
这一阶段把认知落地为工具。掌握主流框架的核心理念、设计哲学、典型用法。学到的不只是 API 调用, 而是每个框架解决了什么问题、有什么 trade-off、什么场景下不适用。
📚 框架学习矩阵
2.1 LangChain · 行业基石
链、提示模板、工具集成、LCEL 表达式语言。理解 LangChain 为何成为事实标准。
2.2 LangGraph · 有状态编排
图结构、状态管理、检查点、人机协同。掌握"现代 Agent 构造方式"。
2.3 LlamaIndex · RAG 专家
专注文档问答场景。索引、检索器、查询引擎、Agent 集成。
2.4 CrewAI · 多 Agent 协作
角色化 Agent、任务分配、流程编排。多 Agent 入门首选。
2.5 AutoGen · 对话式 Agent
微软出品,对话驱动、群聊、可终止条件。企业级特性强大。
2.6 进阶:自建 Agent 引擎
不依赖框架,从零实现 ReAct 循环。理解所有框架背后的共通抽象。
🎯 阶段输出标准
🧰 推荐实践项目
- 🛒 用 LangGraph 搭一个电商助手
- 📚 用 LlamaIndex 做技术文档问答
- 🧑🔬 用 CrewAI 模拟研究团队
- ⚙️ 用 AutoGen 搭建多 Agent 会议
完整项目搭建
从代码玩具到生产系统。这一阶段专注于"工程化"——让 Agent 像一个真实的软件产品一样被开发、测试、部署。
🏗 工程化要素
配置管理
环境变量、密钥管理、多环境切换。.env、config.yaml、Pydantic Settings。
模块化设计
清晰的目录结构、抽象层、依赖注入。Agent、Tool、Memory、Orchestrator 分层。
可观测性
日志、追踪、监控。LangSmith、LangFuse、OpenTelemetry。
异常处理
工具失败、LLM 调用失败、超时、退避重试。鲁棒性源于细节。
测试体系
单元测试、集成测试、评估测试。LLM-as-a-Judge 与人工标注结合。
部署上线
FastAPI、Gradio、Docker、CI/CD。本地到云端的工程路径。
评估与优化
没有评估,Agent 系统就是"黑盒"。这一阶段建立完整的评测体系,掌握持续优化的方法论。
📊 评估维度全景
✅ 任务完成度
Agent 是否成功达成了最终目标?
⚡ 执行效率
花费的 token 数、调用步数、延迟。
🎯 准确率
结果是否与 ground truth 一致。
🛡 鲁棒性
面对异常输入、错误工具的反应能力。
💰 成本
单次任务平均成本、模型选择策略。
😊 用户体验
响应相关性、可解释性、信任度。
🧪 评估方法工具箱
🎯 优化方法清单
- Prompt 优化: 调整 System Prompt、Few-shot
- 模型选择: Haiku vs Sonnet vs Opus, GPT-3.5/4
- 工具精简: 删除冗余工具,合并重叠工具
- 检索优化: Reranking、HyDE、混合检索
- 上下文压缩: 摘要、剪枝、关键信息提取
- 缓存策略: 语义缓存、提示缓存
- 并行化: 独立子任务并发执行
- 反思循环: Self-Refine、Reflexion
- 路由策略: 简单任务用小模型
- 人机协同: 关键节点让人类确认
独立大型 Agent 项目
综合运用前四阶段所有能力,从零交付一个完整、可部署、可开源或商业化的大型 Agent 项目。
🏆 项目目标设定
与其复刻一个 GPT 套壳产品,不如选一个真正困扰你 / 你团队的需求。这样你会有持续投入的热情。
📋 项目交付清单
-
需求定义与架构设计明确核心场景、用户角色、核心 Agent 类型与协作方式。
-
项目结构与核心模块agent/, tools/, memory/, graph/, tests/, configs/ 等清晰分层。
-
核心循环实现ReAct / Plan-Execute / LangGraph 状态机完整实现。
-
工具注册与错误处理至少 3-5 个领域工具,包含超时、重试、降级策略。
-
评估 Pipeline 与监控离线 Eval + 在线监控 + Trace 追踪完整链路。
-
用户界面(Web/CLI)Gradio / Streamlit / FastAPI 提供可视化交互。
-
部署上线Docker 容器化、CI/CD、至少一个云平台部署。
-
README、Demo、文档让陌生人也能在 10 分钟内跑通你的项目。
🎯 项目蓝图示例
仅供参考,最终应选你真正想做的需求。
多 Agent · 价格比对 · 评价分析 · 自动下单
RAG · 权限管理 · 多源索引 · 引用追溯
Plan-Execute · 文献检索 · 综述生成
线索管理 · 邮件回复 · CRM 集成
代码理解 · 自动修复 · PR 评审
如何高效地走完这条路径
我们观察了大量学习者,总结出几条关键经验。
🚫 不要囤积
与其收藏 100 篇教程,不如认真消化 10 篇。读完立刻动手实践,写下自己的理解。
🧪 输出驱动
每个阶段都要有可展示的"作品"。你能展示给别人看的东西,才是真的学会了。
👥 找同伴
独自学习很容易放弃。加入社区、小组、项目,与同路人一起走得更远。