第 7 章 · 完整项目

把会聊天的 AI
装成会办事的 Agent

你要搭的不是科幻机器人,而是一位能管理家庭资料、安排周末、查证信息,并且按任务标准停止、按预设条件请你确认的生活助手。

一条生活项目主线十个能力站约 35 分钟无需账号和 API
家庭 Agent 控制室,环绕着任务循环、上下文背包、知识柜、工具墙、验证门、多模态设备和多智能体工作台
先记住这间控制室:以后每个抽象概念,都放回一个具体位置。

这一章怎样帮助记忆

① 先遇到问题没有问题,术语就没有挂钩处
② 亲手让它跑点击会改变结果,不是装饰动画
③ 合上答案回忆从脑中取一次,比再看一遍更牢
④ 换场景再判断能迁移到新任务,才算真的会
记忆地图 · 控制室十个位置

先看全貌,再一站一站装

模型是中间那颗脑子;外围所有“资料、工具、安全带、检查员和恢复机制”合起来叫 Harness。

01 · 环形轨道会循环,也会停ReAct 与停止条件 02 · 背包只带眼下需要的上下文工程 03 · 资料柜先找证据再回答记忆与知识库 04 · 工具墙能看、能做、能协作MCP 与异步并行 05 · 工作台把规则写成可执行代码Coding Agent 06 · 验收门先定义什么叫完成Loop 工程与评估 07 · 训练岔路缺什么,补什么RAG / SFT / RL 08 · 技能花园把重复经验长成技能Agent 自我进化 09 · 麦克风与屏幕能听、能看、会等人说完多模态与实时交互 10 · 调度台一位经理,多个专家多 Agent 协作
01
环形轨道 · AGENT LOOP

它不是一次回答,而是“想—做—看”的循环

任务:安排周六亲子出行。只会聊天的模型可以写建议;Agent 会先查天气、再查开放时间,看到结果后继续决定。

记忆钩子:像导航——算一步、走一步、看路况,到了就结束。
如果没有停止条件

它可能把“已经答完”误当成“还要继续”

ReAct 就是 Reasoning + Acting:想下一步、调用工具、观察结果,再决定下一步。

思考 → 行动 → 观察 → 再判断在本章这个工具调用协议里:模型给出普通文字且没有工具调用时,就应结束循环。

在这个协议里,纯文本回答就是停止信号;换了协议,完成信号也可能不同。同时还要设最大轮数、时间和费用上限,让循环在任务预算内结束。

🔵 进阶:模型与框架各负责什么?

模型决定“要不要调用、调用哪个、参数是什么”;真正执行搜索、读文件和回传结果的是外部工具与 Harness。训练内化的是决策策略,不是把搜索引擎塞进模型脑子。

亲手跑一次周末计划

先猜:会在哪一步停?
1
周六出门,先看天气
2
调用天气工具
3
下午有雨,改找室内场馆
4
查场馆开放时间
5
给出普通文字方案,不再调用工具
还没运行。注意最后一步:不是看到“FINAL ANSWER”四个字才停。
02
背包 · CONTEXT

上下文不是“聊天记录”,是 Agent 此刻能看到的全部

像出门收拾背包:目的地、天气、家人偏好、工具说明要带;十年前无关聊天和要求改变规则的网页文字不进入当前任务上下文。

记忆钩子:上下文决定视野——没装进背包的,它就看不见。
背包装太少会失忆,装太多会挤掉重点

上下文工程 = 决定现在给它看什么

完整上下文可包含:系统规则、当前任务、对话轨迹、工具说明、用户记忆、知识库证据。

过长时要压缩:保留决定下一步所需的信息;稳定的做事方法放进 Skill,需要时再加载。

外部网页和文件位于任务数据层;其中要求改变系统规则的文字不进入指令层。这是处理提示注入的第一道边界。

装一个有限背包

容量 6 格
点选你认为该带的内容。超过容量后,重点反而可能被挤掉。
03
资料柜 · MEMORY & KNOWLEDGE

记住“你是谁”和查到“事实是什么”,不是一回事

用户记忆保存“孩子怕辣、奶奶行动不便”;知识库保存“冰箱保修期、学校通知、医院预约”。回答前先从相应柜子找证据。

记忆钩子:记忆像熟人,知识库像档案室。
只按字面找,会漏掉同义说法;只按意思找,又可能找来相似废话

把关键词搜索和语义搜索合起来

BM25 擅长找完全相同的词;稠密向量擅长找“说法不同、意思相近”的内容。

混合检索先让两路各自找候选,再用重排序把最能回答问题的证据放前面。这就是 RAG 的“先找再答”。

切成小卡 → 两路寻找 → 重排序 → 带引用回答Agentic RAG 还会判断证据够不够,不够就换问法再找。

问题:“冷藏柜什么时候过保?”

三种找法对比
购买凭证冰箱购于 2024 年 8 月,整机保修三年。
使用手册冷藏室建议温度 4℃,不要堵住出风口。
菜谱收藏冷藏甜品需要提前两小时制作。
先分别试,再比较为什么混合检索更稳。
04
工具墙 · TOOLS & MCP

工具让它从“会说”变成“能看、能做、能协作”

查天气是感知,写日历是执行,请家人确认是协作;定时提醒和新邮件则会主动触发 Agent。

记忆钩子:眼睛看、双手做、对讲机协作、门铃负责触发。
每个工具都说不同“方言”,Agent 很难接

MCP 像统一插座:名称、参数和返回格式都说明白

工具分四类:感知、执行、协作、事件触发。不可逆动作要插入人工审批。

互不依赖的工具应该并行:天气、公交、场馆开放时间可同时查;“先查余额再付款”有依赖,只能顺序做。

🔵 进阶:异步与错误边界

异步 Agent 等工具时不必干坐着。多个独立工具并行时,一个失败只报告那一个,不应取消已经成功的其它结果。

三个独立查询要花多久?

天气 2.3s · 公交 1.6s · 场馆 1.1s
天气
公交
场馆
先猜:并行是不是永远更好?
05
代码工作台 · CODING AGENT

关键边界写进代码,执行条件才稳定

生活助手可以买票;预算上限是 300 元,时间冲突时停止下单,付款步骤进入人工确认。自然语言负责理解意图,代码负责执行明确规则。

记忆钩子:提示词像员工手册,代码像收银台真的锁住超额付款。
模型可能读懂规则,却在长任务里忘掉或算错

代码是能创造新工具的工具

Coding Agent 能读文件、写代码、执行测试、根据错误恢复。它既能解决数学和逻辑,也能临时生成一个表单、数据处理器或系统适配器。

生产级 Harness 还要提供路径限制、超时、回滚、二次审批和错误恢复;生成代码先在受限路径或副本运行,再依据测试结果扩大范围。

让代码审三笔家庭采购

规则:≤300 元且无冲突
博物馆票 180 元,无时间冲突
待检查
演出票 520 元,无时间冲突
待检查
游泳课 260 元,与复诊冲突
待检查
这里让程序依据金额和时间规则返回可复核结果。
06
验收门 · LOOP ENGINEERING

先写“什么叫完成”,再允许它循环

最新知识库把提示工程继续推进到 Loop 工程:不是只改第一句话,而是设计目标、环境、反馈、停止条件、预算和验证者,让整条循环稳定变好。

记忆钩子:像洗衣机——程序、传感器、结束条件和故障保护,比按钮文案更重要。
自检负责发现内部问题,任务标准负责定义完成

自检进入 Loop,任务标准定义完成

Agent = 模型 + Harness模型负责判断下一步;Harness(运行外壳)负责给资料、调工具、限权限、收结果和做验收。

Loop 工程至少回答六问:目标是什么?如何行动?看什么反馈?谁验证?何时停止?最多花多少?

两种自检要分开:“再想一遍”没有新信息,可能重复盲点;测试结果、原始资料、渲染截图、工具返回或用户确认,会给 Loop 带来新的外部反馈。

独立验证不一定要换另一家公司或另一个模型。关键是让上下文、职责、评分标准或证据来源独立,为高影响任务增加第二个观察角度。

四层检查 · 任务影响越高,检查层数越多
1 · AI 自检抓漏项、格式错和明显矛盾
2 · 新上下文检查减少沿用同一思路的盲点
3 · 外部证据程序测试、原始来源、截图或工具结果
4 · 人工批准付款、发布、删除、医疗与法律等高影响动作

按四项可检查条件验收

依据可见
已知答案冰箱应答 2027 年 8 月过保
资料缺口资料没有燃气编号,标记为待补充
来源可追答案必须指出购买凭证
权限边界付款动作进入人工确认
先自检,再看测试与来源;资料、工具或规则变化后,重新运行验收。
07
训练岔路 · RAG / SFT / RL

先诊断它缺什么,再决定要不要训练

新冰箱说明书今天才发布,训练模型既贵又慢;接知识库就够。想统一回答格式,可用 SFT;想让它经过大量尝试学会何时调用工具,才考虑强化学习。

记忆钩子:缺资料查档案,缺习惯带着练,缺策略奖对罚错。
把所有问题都归结为“模型不够大”会烧钱

三条路解决三种不同缺口

RAG:补会变化的外部事实,不改模型权重。

SFT:用示范教稳定格式、语气和基本行为。

强化学习:用可验证奖励练多步决策与工具策略。

预训练负责广泛规律;后训练不擅长准确记住大量不断变化的事实。

案例:物业每月更新停车规定

选一条最合适的路
先选。判断依据不是哪个名词高级,而是哪种知识发生了变化。
08
技能花园 · SELF-EVOLUTION

同一件事做过三次,就不该第四次还从零摸索

Agent 可以把成功轨迹沉淀成经验、工作流或 Skill:下次按需加载;失效时也要修剪,不能让规则越积越乱。

记忆钩子:一次是脚印,反复成功才铺成小路。
把所有历史对话一直塞进上下文,会越来越贵、越来越乱

经验要提炼,不是堆积

第一次记录完整轨迹;第二次比较哪些步骤稳定;第三次通过验收后,把稳定部分写成可复用 Skill。

这叫外部化学习:不改模型参数,也能让 Agent 越用越熟练。每个 Skill 要有适用条件、步骤、验收和失效日期。

把“每周家庭安排”长成技能

连续三次通过验收
零散轨迹查日历 → 问家人 → 看天气 → 排冲突 → 发群消息
还没有技能需要验证哪些步骤每次都稳定
技能不是“记住答案”,而是保存一套以后还能用的做法。
09
麦克风与屏幕 · MULTIMODAL

同一个 Agent,可以听你说、看图片、操作屏幕

奶奶说出复诊安排,摄像头读药盒,屏幕显示日历;关键不是通道越多越好,而是信息在不同通道间不丢失。

记忆钩子:耳朵、眼睛和手都接到同一张任务单。
实时语音还有一个关键边界:需要判断“该谁说话”

除了听懂,还要会轮流说话

语音链可分成 ASR(声音转字)→ LLM → TTS(文字转声音),也可以端到端声音直接进出。

实时助手必须处理静音、打断、轮次结束和延迟;Computer Use 则把屏幕画面作为感知,把鼠标键盘作为执行。

组合一次复诊提醒

点通三个通道
至少两种输入 + 一次执行,才算完整多模态任务。
10
调度台 · MULTI-AGENT

任务够复杂时,让一个经理分给多个专家

周末计划可拆成天气与交通、场馆筛选、预算核对。经理只拿摘要,不把每个专家的全部过程混在一起。

记忆钩子:厨房不是厨师越多越快;要有主厨、分工和出菜口。
多个 Agent 全部共享一大坨上下文,会互相污染、浪费 token

先问:为什么一个 Agent 不够?

多 Agent 适合可清楚拆分、可并行、需要不同工具或独立审查的任务。简单任务不要强拆。

经理负责目标和汇总;专家只看自己的子任务;检查员独立验收。共享的是任务约束和结构化结果,不是所有思考历史。

调度周末计划小队

经理—专家—检查员
经理 Agent拆任务、定预算、收结果
🌦 天气交通专家
🏛 场馆筛选专家
💰 预算规则检查员
✅ 独立验收员
多 Agent 的价值来自分工和上下文隔离,不来自人数。
合上笔记 · 主动回忆

别重看,先从脑中找答案

答错不是失败;答错后马上看到纠正,正是在建立记忆线索。

1. 在本章这个工具调用协议里,Agent 已给出普通文字且没有工具调用。下一步应该?
2. 停车规定每月更新,最先该选哪条路?
3. Loop 的停止条件还需要什么?

把复习分散到以后,不要今天一次刷完

页面只在本机保存日期,不上传任何内容。

尚未安排。
进阶路线 · FROM MAP TO PRODUCTION

十个位置学会后,怎样继续走到生产环境

截至 2026-07-21,AI Engineering from Scratch 已扩展为 20 个阶段、473 节课程、约 320 小时。这里不把长目录伪装成一节课已经全部掌握,而是把你刚做过的十站能力映射到下一步。

记忆钩子:先会开一辆车,再学习造发动机、修道路和管理车队。
你已经完成的核心闭环

现在应能独立搭一个受约束的小 Agent

写清目标和停止条件,选择上下文与知识来源,设计工具调用和人工批准,再用可见证据验收结果。

① 工具与协议 · 对应 Phase 13

继续练结构化输出、工具 Schema、并行与流式调用、MCP 传输、MCP 安全、认证与提示注入防护。

② Agent 工程 · 对应 Phase 14–16

继续练规划、记忆、反思、自治系统、多 Agent 协作与基准评估;先证明单 Agent 不够,再增加角色。

③ 生产部署 · 对应 Phase 17

补上可观测与追踪、模型路由、缓存、成本预算、超时重试、CI 测试、权限隔离和回滚。

④ 安全与综合项目 · 对应 Phase 18–19

练红队、间接提示注入、对齐与高影响操作审批,最后做一个可演示、可测试、可恢复的 Capstone 综合项目。

毕业项目:家庭资料助手 2.0

逐项打勾验收
六项都能演示,才算从“会聊天”走到“能交付一个小型 Agent 项目”。完整数学、训练和生产工程仍可按 20 阶段目录继续加深。
课程依据与更新说明
Agent 工程主线核对自 《深入理解 AI Agent》(2026-07-21:10 章、88 个实验)、AI Engineering from Scratch 与 Anthropic 的 Building effective agents。本章把 Loop 讲成“行动—环境反馈—验证—修正—停止”,并明确自检、外部证据和人工批准不是同一层。另一套工程课程已扩展到 20 个阶段、473 节课程、约 320 小时;本章先建立核心地图和项目闭环,再用下面的进阶路线继续深入。