刚刚出炉的电子书《深入理解 AI Agent:设计原理与工程实践》
地址:github.com/bojieli/ai-agent-book
作者李博杰(就是前两天说deepseek面试问题的那个[笑cry]),这个仓库里有电子书也有配套代码。
全书围绕核心公式 Agent = LLM + 上下文 + 工具 展开,十章内容如下:
第 1 章 · Agent 基础知识:从"模型即 Agent"的新范式出发,建立 Agent = LLM + 上下文 + 工具 的核心公式,并引入 Harness 工程——模型之外的一切工程能力,才是真正的竞争力所在。
第 2 章 · 上下文工程:上下文决定 Agent 的能力上限。深入大模型 API 的上下文结构、KV Cache 友好设计、提示工程、动态提示词与 Agent Skills、状态栏元信息,以及上下文压缩策略。
第 3 章 · 用户记忆和知识库:让 Agent 跨会话记住用户、并接入外部知识。涵盖用户记忆系统、RAG 基础管道,以及超越扁平文本的知识组织与检索(结构化索引、知识图谱等)。
第 4 章 · 工具:工具是 Agent 的双手。讲工具分类与通用设计原则、MCP 协议与工具选择的挑战、感知/执行/协作三类工具,以及事件驱动的异步 Agent。
第 5 章 · Coding Agent 与代码生成:代码是"能创造新工具的工具",是通用 Agent 的元能力。以生产级 Coding Agent 为例,展示这一最强通用工具的完整实现。
第 6 章 · Agent 的评估:把 Agent 的表现变成可比较的信号。从评估环境、数据集设计、指标体系,到统计显著性、可观测性、评估驱动选型,直至生产级内部评估与仿真环境。
第 7 章 · 模型后训练:预训练、SFT、RL 三阶段全景。何时选 SFT、何时选 RL,RLHF、算法比较、数据与环境,以及让模型学会工具调用、提升样本效率的前沿探索。
第 8 章 · Agent 的自我进化:不改权重也能成长。三种学习范式,从经验中学习、主动工具发现,到"从工具使用者到工具创造者",让 Agent 从"聪明"走向"熟练"。
第 9 章 · 多模态与实时交互:把感知与行动从文本扩展到语音、GUI 与物理世界。语音三范式(级联/端到端全模态/全双工)、流式语音感知与合成、Computer Use 与机器人操作。
第 10 章 · 多 Agent 协作:群体的智能可以高于个体。多 Agent 分类框架、何时真正优于单 Agent、共享与不共享上下文的协作、失败模式,以及涌现的"Agent 社会"。
