项目名称bojieli/ai-agent-book《深入理解 AI Agent:设计原理与工程实践》

作者:李博杰(Bojie Li)

项目亮点:GitHub 29.1k+ Stars | 10 大核心章节 | 95 个可运行配套实验 | 支持 13 种全球语言

开源协议:Apache-2.0

一、 引言:大模型时代的“智能体新圣经”

随着大语言模型(LLM)的突破性进展,AI 的应用范式正加速从传统的“问答对话”向具身化、自动化、主动执行的 AI Agent(智能体) 跨越。然而,在将 Agent 引入生产环境的过程中,开发者常面临理论与工程实现的鸿沟:如何设计长短期上下文?如何构建高可靠的工具调用协议(如 MCP)?如何评估智能体的执行轨迹?如何对 Agent 进行后训练与自我演进?

由知名学者与资深架构师李博杰(Bojie Li)领衔撰写的开源项目 bojieli/ai-agent-book(《深入理解 AI Agent:设计原理与工程实践》),正是为解决这些工程难题而生的权威全景指南。该项目在 GitHub 开源后迅速斩获超过 2.9 万 Stars,成为全球开发者学习与构建智能体系统的标杆之作。

二、 核心公理:Agent 的底层公式

全书围绕一个极其精炼且深远的工程公式展开:

$$\text{Agent} = \text{LLM} + \text{上下文} + \text{工具}$$

  • LLM(大语言模型):智能体的大脑,提供逻辑推理、指令理解与意图决策能力。

  • 上下文(Context):智能体的内存与工作空间,涵盖 Prompt 工程、KV Cache、历史对话压缩与动态知识检索。

  • 工具(Tools):智能体的双手与感官,包括 API 调用、代码执行、MCP 协议、网页/屏幕感知与多智能体协作。

项目特别强调:Harness(外围工程框架)才是 Agent 在真实工业界落地的核心竞争力

三、 全书 10 大章节与 95 个配套实验全景

本书打破了传统的纯理论说明,提供了包含 10 个循序渐进章节与 95 个动手实操实验的完整体系:

章节

核心主题

一句话核心与技术亮点

配套代码

第 1 章

Agent 基础知识

建立 Agent 总体架构认知;深入 Harness 工程与外围控制回路设计。

4 个实验

第 2 章

上下文工程

上下文决定能力上限:KV Cache 管理、Prompt 优化、Agent Skills 挂载与压缩算法。

9 个实验

第 3 章

用户记忆与知识库

跨会话持久化记忆:长短期记忆、RAG(检索增强生成)、结构化索引与知识图谱。

13 个实验

第 4 章

工具与 MCP 协议

工具是 Agent 的双手:深度剖析 MCP 协议、感知/执行工具、事件驱动与主动发现。

7 个实验

第 5 章

Coding Agent 实践

代码是“能创造新工具的工具”:生产级 Coding Agent 全景、自动审查与沙箱修复。

12 个实验

第 6 章

Agent 评估与基准

把表现转化为定量信号:构建测试环境,接入 GAIA、SWE-bench、OSWorld 等基准。

12 个实验

第 7 章

模型后训练 (Post-training)

预训练/SFT/RL 三阶段:权衡 SFT 与强化学习(RL),将工具调用能力内化于模型参数。

16 个实验

第 8 章

Agent 的持续进化

从运行轨迹(Trajectory)提取信号:实现知识、指令、程序代码与参数的自我更新闭环。

8 个实验

第 9 章

多模态与实时交互

拓展感知边界:语音交互三范式、Computer Use(屏幕与 GUI 操作)、WebRTC 交互。

10 个实验

第 10 章

多 Agent 协作系统

群体智能:多智能体协作框架、上下文隔离与共享机制、涌现出的“Agent 社会”。

8 个实验

四、 项目四大核心工程创新

  1. 精细化上下文工程(Context Engineering)

    提出了针对超长上下文的系统化工程方案,详细论述了 KV Cache 复用、层次化摘要、动态 Token 预算分配以及 Skill 模块化加载,有效避免“Lost in the Middle”现象。

  2. 前沿协议与能力集成(MCP & Computer Use)

    紧跟 Anthropic 的 Model Context Protocol (MCP) 标准,并探索了基于视觉与动作模拟的 Computer Use(电脑 GUI 操作),让 Agent 具备跨平台操作系统级能力。

  3. 从 Prompt 层走向模型层(Post-Training & RL)

    区别于普通套壳应用教程,第 7~8 章深入通过 DPO、强化学习(RL)将工具调用与推理链内化到模型参数中,并展示了如何通过轨迹(Trajectories)实现自进化。

  4. 现代化工程体验(uv 依赖管理与多语言支持)

    采用极速 Python 包管理器 uv 实现无痛依赖隔离与一键运行;支持中文、英文、日文、韩文、西班牙文、阿拉伯文等 13 种语言,打造真正无国界的开源技术社区。

五、 快速上手实操

Bash

# 1. 克隆 GitHub 仓库
git clone https://github.com/bojieli/ai-agent-book.git
cd ai-agent-book

# 2. 使用 uv 快速同步并隔离对应章节的依赖环境(例如第 1 章)
uv sync --locked --extra ch1

# 3. 配置环境变量与模型 API Key
cp .env.example .env
# 支持 Kimi, 智谱 GLM, SiliconFlow, DeepSeek, OpenRouter, Ollama 等

# 4. 一键运行章节配套实验代码
uv run python chapter1/context/main.py

六、 总结

《深入理解 AI Agent:设计原理与工程实践》(bojieli/ai-agent-book)不仅是一本系统化的技术著作,更是当前开源社区中不可多得的智能体全栈实战宝典。无论你是大模型算法工程师、系统架构师,还是 AI 原生应用开发者,这本书都能为你提供从理论底层到工业级落地的完整技术路线。