深入理解 AI Agent:设计原理与工程实践

Cosolar 27 阅读 AI大模型

AI Agent书籍封面设计.png

李博杰《深入理解 AI Agent:设计原理与工程实践》全书开源

核心理念

全书正文 + PDF + 10 章配套代码已完整释出,围绕一个核心公式展开:

Agent = LLM + 上下文 + 工具

📖 在线阅读:AgentBook

💻 GitHub:https://github.com/bojieli/ai-agent-book

适用人群

  • 想系统理解 Agent 工程(而非只会调 API)的开发者
  • 需要搭建 Coding Agent、RAG、多 Agent 协作等生产系统的工程师
  • 对上下文工程、KV Cache、工具设计等底层机制感兴趣的研究者

内容概览(10 章 / 28 个可运行项目)

image.png

章节主题亮点项目举例
第 1 章Agent 基础上下文消融实验、RL vs LLM 样本效率对比
第 2 章上下文工程KV Cache 友好设计、0.6B 小模型工具调用、提示注入攻防
第 3 章记忆与知识库混合检索流水线、Agentic RAG、GraphRAG、上下文感知检索
第 4 章工具感知/执行/协作三类 MCP 服务器、事件驱动异步 Agent
第 5 章Coding Agent17 工具生产级编码助手、NL→SQL、论文→PPT→视频
第 6 章评估Terminal-Bench、SWE-bench、GAIA、成本拆解、TTS 质量评估
第 7 章后训练SFT vs RL 对比、自适应推理深度、工具增强数学推理
第 8 章自我进化经验学习闭环、工作流录制→工具化、主动工具发现
第 9 章多模态与实时交互实时语音对话、端到端 vs 级联语音、Computer Use
第 10 章多 Agent 协作双 Agent 电话+浏览器并行、语音狼人杀、并行搜索协调

设计亮点

  • 小模型验证:第 2 章用 0.6B 本地模型演示完整工具调用,说明系统设计比模型规模更重要
  • 消融驱动:多个项目采用对照实验(如上下文各组件逐一移除),效果差异可量化
  • 生产导向:Coding Agent 纯 Python 实现无命令行依赖;MCP 服务器含 LLM 二次审批与沙箱隔离
  • 代码即元能力:第 5 章贯穿"代码能创造新工具"的思路,从数学求解到日志自愈解析

API 配置指南

按场景选择 API 平台:

平台适用场景
Kimi(月之暗面)长上下文、Agent 工具调用
智谱 GLM中文任务、性价比
Siliconflow开源模型(DeepSeek、Qwen、Kimi K2 等)
火山引擎豆包系列,国内低延迟
OpenRouter统一接口访问 Claude、Gemini、GPT 等海外模型

模型选型与 API 配置详见:https://01.me/2025/07/llm-api-setup/

image.png