25 篇塑造 Agent 领域的论文
按学习顺序排列。每篇附摘要、阅读价值、推荐理由。
ReAct: Synergizing Reasoning and Acting in Language Models
Princeton / Google · Yao et al.
首次系统化提出"思考-行动-观察"循环。这是 Agent 范式的奠基性工作。
Chain-of-Thought Prompting Elicits Reasoning in Large Language Models
Google · Wei et al.
揭示了"一步一步思考"能显著提升 LLM 在复杂推理任务上的表现。Agent 推理能力的源头。
Attention Is All You Need
Google · Vaswani et al.
Transformer 架构的原始论文。所有现代 LLM 和 Agent 的根基。
Retrieval-Augmented Generation for Large Language Models
Meta AI · Lewis et al.
RAG 的奠基性工作。让 LLM 能接入外部知识库,解决幻觉和时效性。
GPT-4 Technical Report
OpenAI
虽然不是论文,但 Function Calling 能力的官方描述,理解现代 Agent 工具调用的基础。
Tree of Thoughts: Deliberate Problem Solving with Large Language Models
Princeton · Yao et al.
把 CoT 拓展为树结构,允许回溯和分支探索。复杂推理任务的有效升级。
Reflexion: Language Agents with Verbal Reinforcement Learning
Northeastern · Shinn et al.
让 Agent 通过"反思失败"来自我改进。是 Self-Refine、Reflexion 模式的开山之作。
OpenAI o1 System Card / Learning to Reason with LLMs
OpenAI
推理时计算的革命。揭示了更多思考 token = 更好表现,为 Agent 提供了更强的"大脑"。
Automatic Chain of Thought Prompting in Large Language Models
Zhang et al.
自动生成高质量 CoT 示例。让 prompt 工程自动化。
ReAct Meets ActRe: Autonomous Annotations of Robotic Navigations
把 ReAct 模式应用到真实物理世界。Agent 不只在数字世界,可以操作机器人。
Self-Taught Reasoner (STaR) 及其系列
让 Agent 通过自我生成的推理数据持续改进。是 Agent 元学习的基础工作之一。
MemGPT: Towards LLMs as Operating Systems
UC Berkeley · Packer et al.
把 Agent 当作操作系统,内存分层。突破上下文窗口的革命性记忆方案。
From Local to Global: A Graph RAG Approach
Microsoft Research
把知识图谱与 RAG 结合,处理全局性问题。把"点检索"升级为"关系检索"。
Self-RAG: Learning to Retrieve, Generate, and Critique through Self-Reflection
让 Agent 决定何时需要检索、是否需要重写查询、是否需要拒答。RAG 的智能化升级。
Corrective RAG (CRAG)
带纠错机制的 RAG 系统。检索结果不准确时,自动触发 web 搜索补充。
AutoGen: Enabling Next-Gen LLM Applications via Multi-Agent Conversation
Microsoft · Wu et al.
多 Agent 对话协作的开创性框架。展示了群聊、终止、人工参与的完整设计。
MetaGPT: Meta Programming for A Multi-Agent Collaborative Framework
Hong et al.
把多 Agent 抽象为软件公司:产品经理、架构师、工程师、QA。
CAMEL: Communicative Agents for "Mind" Exploration of LLMs
角色扮演式多 Agent 协作。展示通过 Inception Prompting 让 Agent 高质量完成复杂任务。
Multi-Agent Collaboration Mechanisms: A Survey of LLMs
Han et al.
多 Agent 协作机制的综述论文。适合综述当前 SOTA 的人。
AgentBench: Evaluating LLMs as Agents
Tsinghua · Liu et al.
最权威的 Agent 通用评估基准。多场景、多任务的全面评测。
SWE-bench: Can Language Models Resolve Real-World GitHub Issues?
评估代码 Agent 的事实标准。基于真实 GitHub issue,极具挑战性。
RAGAS: Automated Evaluation of Retrieval Augmented Generation
RAG 评估的事实标准。无需 ground truth 即可评估。
Judging LLM-as-a-Judge with MT-Bench and Chatbot Arena
用 LLM 评估 LLM 的方法论研究。奠定了 LLM Eval 的核心思路。
系统化学习资源
短期突破找短课,长期沉淀看书。
DeepLearning.AI 短课
Andrew Ng 团队出品。LangChain、Function Calling、Agent 等系列短课,每节 1-2 小时。
免费 · 短时Generative AI with LLMs
DeepLearning.AI + AWS 联合出品。3 周课程,系统覆盖 LLM 与 Agent 基础。
系统课Hugging Face Learn
免费 NLP/Agent 课程。从 Transformer 基础到 Smolagents 实战。
免费Udemy 实战课
多种 LangChain/LlamaIndex 实战课程。Udemy 打折时性价比高。
实战Anthropic Academy
Anthropic 官方 Prompt Engineering、Computer Use、Tool Use 系列课。
官方OpenAI Cookbook
官方示例库。Function Calling、Structured Output、Embeddings 等核心代码示例。
代码示例值得反复研读的书
不是书越多越好。这些书对我们设计 Agent Academy 产生了深远影响。
Designing Data-Intensive Applications
Martin Kleppmann · 经典的数据系统设计圣经。任何大规模 Agent 系统都受益于这本书。
AI Agents in Action
Michael Lanham · Manning 2025 · 专门讲 AI Agent 设计的实战书。
Prompt Engineering for LLMs
John Berryman 等 · 深入浅出讲清楚 Prompt Engineering 的全部核心。
Building LLM Applications
Various · O'Reilly 系列短书,覆盖 RAG、Agent、Embeddings 等专题。
Clean Architecture
Robert C. Martin · Agent 系统的工程实践必读。分层架构、依赖倒置。
Patterns of Application Architecture
Martin Fowler 等 · 软件架构模式全集。设计大型 Agent 系统的参考。
找到你的学习同伴
独自学习很容易放弃。加入社区让成长加速。
🐦 Twitter/X AI 圈
关注 @hwchase17, @yann_lecun, @karpathy 等顶级实践者。
🇨🇳 国内社区
即刻、知乎、掘金的 AI Agent 话题区。WeChat Reading 的相关学术号。
📺 YouTube 频道
Sam Witteveen, James Briggs, Dave Ebbelaar 等频道持续更新高质量 Agent 实战。
📮 r/LocalLLaMA
Reddit 的本地 LLM 与 Agent 子社区。开源、本地化 Agent 趋势首发地。
🏗 OpenAI Developer Forum
OpenAI 官方论坛。Function Calling、Assistants API 等核心能力的问题都能找到答案。
每周跟着前沿动态
领域变化太快,订阅高质量 Newsletter 是最有效的跟进方式。
📰 Import AI
Jack Clark · 每周精选 AI 领域最重要的事件与论文。
📰 TLDR AI
5 分钟读懂本周 AI 重大新闻。极简风格。
📰 LangChain Newsletter
LangChain 团队的官方更新,新功能发布、用户案例分享。
📰 AlphaSignal
深度解读最新 AI 论文和开源项目。Agent 占比越来越多。
📰 The Rundown AI
综合性 AI 日报,从新闻到工具到 prompt 模板都覆盖。
📰 Ahead of AI
Sebastian Raschka · 学术视角的深度解读。
如何持续跟进前沿
Agent 领域每周都有新东西。一套可持续的跟踪节奏比突击学习更重要。
📅 推荐的每周学习节奏
-
周一:扫一遍上周 AI 重大新闻 (TLDR AI, 15 min)保持对"发生了什么"的基本感知,知道业界在讨论什么。
-
周三:精读一篇值得深入的论文 / 文档 (45 min)优先与你当前正在做的项目相关的。写下自己的理解和疑问。
-
周五:动手实验 1 小时把本周学到的一个新东西,动手用在自己的项目里。
-
周末:复盘本周 + 设计下周小目标 (30 min)知道自己在什么位置、要去哪里。比埋头学习更重要。