它不是一次回答,而是“想—做—看”的循环
任务:安排周六亲子出行。只会聊天的模型可以写建议;Agent 会先查天气、再查开放时间,看到结果后继续决定。
它可能把“已经答完”误当成“还要继续”
ReAct 就是 Reasoning + Acting:想下一步、调用工具、观察结果,再决定下一步。
在这个协议里,纯文本回答就是停止信号;换了协议,完成信号也可能不同。同时还要设最大轮数、时间和费用上限,让循环在任务预算内结束。
🔵 进阶:模型与框架各负责什么?
模型决定“要不要调用、调用哪个、参数是什么”;真正执行搜索、读文件和回传结果的是外部工具与 Harness。训练内化的是决策策略,不是把搜索引擎塞进模型脑子。
亲手跑一次周末计划
先猜:会在哪一步停?上下文不是“聊天记录”,是 Agent 此刻能看到的全部
像出门收拾背包:目的地、天气、家人偏好、工具说明要带;十年前无关聊天和要求改变规则的网页文字不进入当前任务上下文。
上下文工程 = 决定现在给它看什么
完整上下文可包含:系统规则、当前任务、对话轨迹、工具说明、用户记忆、知识库证据。
过长时要压缩:保留决定下一步所需的信息;稳定的做事方法放进 Skill,需要时再加载。
外部网页和文件位于任务数据层;其中要求改变系统规则的文字不进入指令层。这是处理提示注入的第一道边界。
装一个有限背包
容量 6 格记住“你是谁”和查到“事实是什么”,不是一回事
用户记忆保存“孩子怕辣、奶奶行动不便”;知识库保存“冰箱保修期、学校通知、医院预约”。回答前先从相应柜子找证据。
把关键词搜索和语义搜索合起来
BM25 擅长找完全相同的词;稠密向量擅长找“说法不同、意思相近”的内容。
混合检索先让两路各自找候选,再用重排序把最能回答问题的证据放前面。这就是 RAG 的“先找再答”。
问题:“冷藏柜什么时候过保?”
三种找法对比工具让它从“会说”变成“能看、能做、能协作”
查天气是感知,写日历是执行,请家人确认是协作;定时提醒和新邮件则会主动触发 Agent。
MCP 像统一插座:名称、参数和返回格式都说明白
工具分四类:感知、执行、协作、事件触发。不可逆动作要插入人工审批。
互不依赖的工具应该并行:天气、公交、场馆开放时间可同时查;“先查余额再付款”有依赖,只能顺序做。
🔵 进阶:异步与错误边界
异步 Agent 等工具时不必干坐着。多个独立工具并行时,一个失败只报告那一个,不应取消已经成功的其它结果。
三个独立查询要花多久?
天气 2.3s · 公交 1.6s · 场馆 1.1s关键边界写进代码,执行条件才稳定
生活助手可以买票;预算上限是 300 元,时间冲突时停止下单,付款步骤进入人工确认。自然语言负责理解意图,代码负责执行明确规则。
代码是能创造新工具的工具
Coding Agent 能读文件、写代码、执行测试、根据错误恢复。它既能解决数学和逻辑,也能临时生成一个表单、数据处理器或系统适配器。
生产级 Harness 还要提供路径限制、超时、回滚、二次审批和错误恢复;生成代码先在受限路径或副本运行,再依据测试结果扩大范围。
让代码审三笔家庭采购
规则:≤300 元且无冲突先写“什么叫完成”,再允许它循环
最新知识库把提示工程继续推进到 Loop 工程:不是只改第一句话,而是设计目标、环境、反馈、停止条件、预算和验证者,让整条循环稳定变好。
自检进入 Loop,任务标准定义完成
Loop 工程至少回答六问:目标是什么?如何行动?看什么反馈?谁验证?何时停止?最多花多少?
两种自检要分开:“再想一遍”没有新信息,可能重复盲点;测试结果、原始资料、渲染截图、工具返回或用户确认,会给 Loop 带来新的外部反馈。
独立验证不一定要换另一家公司或另一个模型。关键是让上下文、职责、评分标准或证据来源独立,为高影响任务增加第二个观察角度。
按四项可检查条件验收
依据可见先诊断它缺什么,再决定要不要训练
新冰箱说明书今天才发布,训练模型既贵又慢;接知识库就够。想统一回答格式,可用 SFT;想让它经过大量尝试学会何时调用工具,才考虑强化学习。
三条路解决三种不同缺口
RAG:补会变化的外部事实,不改模型权重。
SFT:用示范教稳定格式、语气和基本行为。
强化学习:用可验证奖励练多步决策与工具策略。
预训练负责广泛规律;后训练不擅长准确记住大量不断变化的事实。
案例:物业每月更新停车规定
选一条最合适的路同一件事做过三次,就不该第四次还从零摸索
Agent 可以把成功轨迹沉淀成经验、工作流或 Skill:下次按需加载;失效时也要修剪,不能让规则越积越乱。
经验要提炼,不是堆积
第一次记录完整轨迹;第二次比较哪些步骤稳定;第三次通过验收后,把稳定部分写成可复用 Skill。
这叫外部化学习:不改模型参数,也能让 Agent 越用越熟练。每个 Skill 要有适用条件、步骤、验收和失效日期。
把“每周家庭安排”长成技能
连续三次通过验收同一个 Agent,可以听你说、看图片、操作屏幕
奶奶说出复诊安排,摄像头读药盒,屏幕显示日历;关键不是通道越多越好,而是信息在不同通道间不丢失。
除了听懂,还要会轮流说话
语音链可分成 ASR(声音转字)→ LLM → TTS(文字转声音),也可以端到端声音直接进出。
实时助手必须处理静音、打断、轮次结束和延迟;Computer Use 则把屏幕画面作为感知,把鼠标键盘作为执行。
组合一次复诊提醒
点通三个通道任务够复杂时,让一个经理分给多个专家
周末计划可拆成天气与交通、场馆筛选、预算核对。经理只拿摘要,不把每个专家的全部过程混在一起。
先问:为什么一个 Agent 不够?
多 Agent 适合可清楚拆分、可并行、需要不同工具或独立审查的任务。简单任务不要强拆。
经理负责目标和汇总;专家只看自己的子任务;检查员独立验收。共享的是任务约束和结构化结果,不是所有思考历史。
