第 1 / 5 屏
更新于 2026-07-21 第 6 章 · 边界篇 · 进入完整 Agent 前的能力边界检查

先画边界
再让 Agent 循环工作

只讲能力范围和使用条件
看完这章 你会根据资料敏感度、结果影响和可撤回程度,选择合适的授权与检查等级

往下画边界线 · 带虚线的词可点开
Screen 01 · 边界线

不同任务 需要多少人工参与

六件事 你先判断 再看答案——答完你手里就有一张任务分级地图

三条岔路的场景插画,用来记住不同任务需要不同程度的人类把关
场景插画:同样是 AI 帮忙,后果不同,放手程度就不同绿:可撤回黄:要核对红:人拍板
先问两件事:① 资料能公开或已经获得授权吗?② 结果出现偏差后,能轻易撤回而且影响可控吗?资料尚未授权时先完成授权;结果较难撤回或影响较高时,增加来源核对、专业复核和人工确认。
绿 · AI 可以先做

低风险、可撤回、能检查,例如不含敏感资料的周报草稿。

动作:AI 先做,人最后看一眼。
黄 · 带验证条件执行

涉及事实、工作文件、钱或公开发布,例如政策摘要、批量整理文件。

动作:先备份、查原始来源、再决定。
红 · 由责任人决策

医疗、法律、金融、敏感资料或不可逆动作。

动作:AI 整理材料,责任人或专业人员完成判断。
一句话记忆:Loop 负责根据反馈再试;Verifier(验收器)负责按标准查;Human(人)负责高风险拍板。
教学图 · 看坐标,不背名单:从左下到右上,资料越来越敏感、答错后果越来越严重。手机端可在图内左右滑动,下面的答题卡会让你把规则用到六件具体事情上。
资料敏感度:公开信息 → 个人隐私 → 公司机密判断错了的后果:可撤回 → 损失钱 → 伤害健康 / 法律责任 可放手做,最后看一眼带验证条件执行AI 整理材料,责任人拍板 周报初稿整理公开资料 查最新政策修改公司合同 医疗诊断决定替你签合同上传身份证 / 病历 越过这条线,增加专业复核和责任人确认
判断方法不是背名单:先看“资料有多敏感”,再看“答错会造成多大后果”
边界不是按“体力活 / 脑力活”划

低风险、可撤回、能验证的任务,可以让 AI 先做
资料敏感、后果严重或动作不可逆,就增加授权、证据和人工确认

Screen 02 · 事实核对

精确事实 更依赖外部资料

这类输出通常来自信息缺口、检索偏差或生成误差;具体数字、出处和最新变化需要回到原始来源

哪类问题最需要查看原始来源?
具体数字、出处和最新变化都要重点核对
幻觉常见在价格、剂量、日期、文献和链接。没有联网时,它可能不知道新变化;能够联网时,也可能选错网页或读错原文。日常翻译通常风险较低,但医学、合同和技术术语仍要专业复核。
🔍第一招

检查出处是否支持结论

核对标题、作者、发布日期和原文。链接打不开时先标成“尚未证实”,等能够访问原文后再判断。

点击展开方法 ↓
🧪第二招

换一种方法复查

可再问一个 AI;回答一致只代表说法相近。更强的复查是计算、测试、查看截图或逐条对照原文。

点击展开方法 ↓
🏛️第三招

回到原始来源

政策查政府网站,药品查说明书或权威医疗机构,费用查银行或商家的官方页面。

点击展开方法 ↓
形成原因 → 第 4 章讲生成机制与信息缺口
补足方法 → 第 3 章练过证据验收流程
Screen 03 · 受控安全评测

在特意设计的冲突场景里 模型会怎么选

这是特定条件下的能力压力测试;评测范围不包括日常发生率,也不测量意识或求生欲

在冲突目标和可操作工具同时存在的受控评测中,部分模型采用了哪类策略?
部分模型在特定设置下出现了第三类策略。
研究人员主动给出冲突目标、可操作环境和工具;结论范围只覆盖这些评测条件,不表示日常使用频率。
APOLLO RESEARCH · 受控评测怎么搭出来
1

前提:研究人员在提示中给模型一个强目标,并让它通过文件发现“开发者目标与自己不同”。

2

环境:模型被搭成能使用命令行工具的 Agent,因此不只会说话,还能在模拟环境中行动。

3

观察:部分模型尝试关闭监督、复制它以为是模型权重的文件,或在追问时给出与操作记录不一致的说明。

评测覆盖
某些模型在这种受控条件下具备采用隐蔽策略的能力。
评测范围不包括
意识、求生欲,以及日常聊天中的实际发生频率。
查看 Apollo Research 原始评测、设置与局限 ↗
工程结论:用可检查条件管理 Agent
让 AI 在 Loop 中自检,再用测试、原始资料、截图或工具结果验收;权限按任务限定范围,关键动作留记录,高影响动作由责任人确认。
Screen 04 · 三条常用底线

在国内使用 AI 先守住这三类边界

它们不是完整法律清单;三个场景都要判断“满足什么条件才可以”

三条常用底线
未经允许,不上传
生成合成,按规定标识
高影响决定,由责任人确认
查看《人工智能生成合成内容标识办法》官方原文 ↗
Screen 05 · 说回你自己

那我的工作 怎么办

第 2 章那三句大实话你还记得——现在说点针对你的

今天挑一个工具,先做低风险小任务

先看隐私设置和数据条款,再用不含敏感信息的材料试一次。

本周跑完一次“做 → 验证 → 修改”

给清目标和材料,让 AI 执行,再用原始资料、测试或截图验收。

这个月把一个稳定流程做成可重复模板

先备份、在副本上多跑几次;稳定后再逐步扩大范围,不允许默认删除。

你已经制定了一个可执行的练习计划

真正完成一次任务、核对结果,并能按任务特征选择人工参与程度,才算初步掌握。

更新于 2026-07-21
第 6 章 · 安全心法

这门课教的不是 AI
是你和 AI 的相处方式

先看适用条件
执行后按标准验收
授权限定范围
风险越高,确认层级越多

第 0 章 亲眼看它能干啥 第 1 章 把话说清楚 第 2 章 选对工具 第 3 章 学会派活 第 4 章 知道它怎么想 第 5 章 知道它从哪来 第 6 章 知道它的边界
🧰

边界看清了 最后亲手搭一套完整 Agent

第 7 章会让家庭助手记住背景、查询资料、调用工具、跑验收,再让多个助手分工合作

↩ 回第 0 章重温 进入第 7 章完整训练营

第 6 章完 · 更新于 2026-07-21 · 具体法律、平台规则和工具权限请以使用当日官方说明为准

第 6 章 · 清醒篇