人类与 AI 的共同行动回路:解释、协作与反馈
人通过语言表达不完整的意图,AI 据此形成可修正的任务解释,再以工具行动和现实反馈共同校正目标、计划与结果。
专题:思维、意图与行动(4/4) 从第一篇开始阅读:思维是什么?人如何形成理解、判断与行动
人与 AI 之间真正要连接什么?
人类与 AI 的协作常被描述成:
人给出提示词
→ AI 给出答案
这个结构只描述了一次语言交换。它没有解释人为什么提出请求、AI 怎样理解请求、谁决定可以采取什么行动,也没有说明现实结果怎样反过来修正双方的判断。
更完整的结构是:
人的处境、需要与目的
→ 人形成暂时意图
→ 用语言表达请求
→ AI 构造任务解释
→ 双方校准目标、对象与边界
→ AI 形成计划并在授权内行动
→ 观察现实结果
→ 人评价结果,AI 更新解释
→ 进入下一轮
人机协作不是一次准确翻译,而是双方围绕共同任务持续校准、行动和纠错的过程。
人的意图为什么不能完整进入提示词?
人在行动以前,并不总有一个完整、固定、清晰的目标等待表达。很多意图是在表达、比较和尝试中逐渐形成的。
一个请求至少可能包含四层:
| 层次 | 问题 | 示例 |
|---|---|---|
| 表达内容 | 人说了什么? | “帮我把这篇文章处理一下。” |
| 操作意图 | 希望 AI 做什么? | 摘要、审校、重写或发布? |
| 任务目的 | 为什么做? | 对外发表、内部讨论或个人理解? |
| 价值边界 | 什么结果可以接受? | 保留原意、不能泄露、需要事实依据 |
提示词通常只显式表达其中一部分。其余信息可能存在于前文、当前文件、既往约定、组织规则和用户自己尚未说清楚的判断中。
所以,“把提示词写得足够长”不能从根本上消除意图问题。表达长度会增加信息,也可能增加冲突、噪声和虚假的精确感。
AI 理解的不是完整的人,而是当前任务
AI 能接触的只是证据:
- 当前语言;
- 对话历史;
- 可见文件和页面;
- 工具返回结果;
- 已保存的偏好与规则;
- 用户对中间结果的确认和修正。
据此,AI 构造的是一个工作性的任务模型:
当前对象是什么?
期望产生什么变化?
有哪些约束?
哪些事实仍然未知?
哪些行动已经获得授权?
怎样判断完成?
这个模型可以很准确,却仍然不是用户全部心理状态。把任务理解限制在当前可观察证据上,反而有助于防止 AI 把猜测写成事实。
三种“理解”需要分开
语义理解
AI 能否识别词语、句子和上下文的含义?例如,“使用第一种”中的“第一种”指向前面哪一个选项。
操作理解
AI 能否把语言转化成具体任务?例如,它是否知道要修改哪篇文章、生成哪些语言版本、使用什么格式。
结果理解
AI 是否知道什么结果才算满足人的目的?例如,文件已经生成,是否还需要提交仓库、部署网站,并验证线上地址。
三者并不自动同时成立。
听懂一句话
≠
知道该做什么
≠
知道怎样才算做完
很多人机协作失败并不是模型完全没有理解语言,而是操作对象、完成条件或结果标准没有对齐。
共同任务模型怎样形成?
双方需要逐步建立一个共享但可修正的任务模型。它通常包含六个部分:
| 要素 | 需要明确的问题 |
|---|---|
| 对象 | 正在处理哪个文件、页面、账户、产品或问题? |
| 目标 | 希望对象发生什么变化? |
| 约束 | 哪些格式、事实、风格、隐私和规则不能破坏? |
| 证据 | 哪些是事实,哪些是推断,哪些仍未知? |
| 权限 | AI 可以直接执行到哪一步? |
| 完成条件 | 用什么可观察结果判断任务已经完成? |
这不是要求人把所有内容一次性写进提示词。AI 可以先利用已有上下文完成低风险、可逆的工作,再在真正影响行动边界的地方取得必要信息。
良好的协作会保留已经确认的决定,避免每一轮都从头询问;也会在新证据出现时允许旧解释被推翻。
澄清、假设与行动怎样选择?
AI 面对歧义时,不应只有“猜”或“追问”两个选项。更合理的策略取决于三个变量:
歧义程度 × 出错代价 × 可逆性
低代价且可逆
可以说明合理假设后先做。例如先生成一个文章草稿,用户可以直接修改。
中等歧义
可以保留多个候选、先完成共同部分,或者给出可比较的方案。
高代价或不可逆
需要确认关键对象、权限或范围。例如公开发布、向他人发送消息、支付、删除不可恢复数据。
关键不是让 AI 永远等待,而是让确认发生在真正决定后果的边界上。
提示词是证据,不是完整契约
提示词对当前任务具有直接约束力,但它仍需要与上下文、权限和现实条件一起解释。
同一句话在不同位置具有不同作用:
- “这个能发布吗?”是在询问可行性;
- “准备成可发布版本”是在授权编辑;
- “发布到网站”是在授权外部行动;
- “我以后可能发布”只是陈述计划。
AI 需要识别请求、讨论、假设、背景和授权之间的差别。
对话也会形成承诺。用户已经选择方案、批准发布或规定格式以后,系统应当把这些决定带入后续步骤。共同理解并不只存在于最后一句提示词里,而存在于整个交互历史中。
行动怎样成为理解的检验?
单靠复述不能证明双方已经对齐。行动会把隐藏差异暴露出来。
例如,人说“把文章更新到网站”。AI 可能完成了本地 Markdown,却没有提交;完成提交,却没有部署;线上页面出现了,却缺少英文版本或 sitemap。
因此需要逐层验证:
任务解释正确
→ 产物内容正确
→ 行动实际执行
→ 外部状态改变
→ 用户目标得到满足
每一层都提供新的证据。失败不是单纯的终点,也会告诉双方此前的任务模型哪里不完整。
一个完整的人机行动回路
可以把共同回路分成八步。
1. 人感知问题
人从需要、阻碍、机会或不满意的结果中发现需要改变的状态。
2. 人形成初步意图
人确定一个大致方向,但目标、手段和判断标准可能仍然模糊。
3. 人表达请求
语言把部分意图外化为提示词,并带入背景、材料和限制。
4. AI 构造候选解释
AI 识别对象、动作、约束和缺失信息,并比较可能的任务解释。
5. 双方校准
AI 利用历史决定、复述、草稿、选项或必要追问,使任务达到足以行动的清晰度。
6. AI 在授权内行动
AI 规划步骤、调用工具、保存中间状态,并对高后果边界检查权限。
7. 系统观察结果
读取文件变化、命令结果、线上页面、用户反馈或其他外部证据。
8. 双方修正
用户可以改目标、指出偏差或接受结果;AI 据此更新任务模型,继续行动或结束。
这构成:
意图
→ 表达
→ 解释
→ 校准
→ 行动
→ 观察
→ 评价
→ 修正后的意图
谁负责什么?
共同回路不意味着人的责任和 AI 的责任完全相同。
人主要提供
- 需要改变的现实处境;
- 价值判断和最终目的;
- 私人背景与未公开限制;
- 对高后果行动的授权;
- 对结果是否值得接受的最终判断。
AI 主要提供
- 对当前证据的结构化解释;
- 候选方案、推理与风险差异;
- 可执行的步骤和工具使用;
- 对不确定性、权限和完成状态的显式记录;
- 根据新证据快速修正计划。
系统与组织必须提供
- 身份和权限控制;
- 数据与隐私边界;
- 日志、版本和可回退机制;
- 失败处理和责任分配;
- 对外部行动的可验证状态。
AI 不能替人决定所有价值;人也不能把一切错误归因于一个孤立模型。结果来自整个社会技术系统。
常见的断裂位置
人把感觉直接当成明确目标
用户知道“不对”,却还不知道要变成什么。此时 AI 应帮助比较结果,而不是假装存在唯一正确答案。
AI 把最可能解释当成真实意图
概率最高只说明现有证据更支持某种解释,不证明它就是用户内心的完整目的。
双方只确认内容,不确认行动
一篇文章得到认可,不自动等于获得公开发布的权限。
AI 把计划当成完成
“将会更新网站”不是更新证据。本地文件、提交、部署和线上验证是不同状态。
人只评价输出,不评价过程
一个偶然正确的答案可能来自不可靠方法;一个暂时失败的尝试也可能暴露关键未知。长期协作需要同时评价结果、证据和纠错能力。
反馈没有进入下一轮
如果用户的修正没有被保存或使用,同一种偏差会重复发生,协作就无法形成真正的闭环。
怎样提高共同回路的质量?
对人而言:
- 先说希望改变什么,而不只是给出一个动作词;
- 区分探索、草拟、修改、批准和发布;
- 在关键地方说明不能接受的结果;
- 用具体反馈指出哪一层理解错了;
- 允许意图在获得新信息后改变。
对 AI 而言:
- 把明确要求、推断和未知分开;
- 利用已确认的上下文,不重复索取信息;
- 在低风险任务上用可逆产物推进;
- 在高后果边界核对对象和权限;
- 报告实际结果,不把计划写成完成;
- 让反馈更新任务模型和后续行为。
结论
人类先在现实处境中形成需要、目标和意图,再通过语言把其中一部分交给 AI。AI 根据可见证据构造任务模型,通过推理与工具采取行动。现实结果和人的评价随后反过来修正这个模型,也可能修正人原来的意图。
所以,人机之间需要建立的不是一次性的“正确提示词”,而是一个能够持续校准的共同回路:
人提供目的、价值与授权
+
AI 提供解释、方案与执行
+
环境提供结果与证据
+
反馈推动双方修正
真正可靠的人机协作,不要求 AI 读懂一个不可见的“真实内心”;它要求双方把当前任务、行动边界和完成证据逐步变得清楚。
延伸阅读
如果这篇对你有用,可以订阅 RSS。
内容以署名方式开放引用,请回链原文。