<?xml version="1.0" encoding="utf-8" standalone="yes"?><rss version="2.0" xmlns:atom="http://www.w3.org/2005/Atom" xmlns:content="http://purl.org/rss/1.0/modules/content/" xmlns:dc="http://purl.org/dc/elements/1.1/"><channel><title>Ai-Agent on Moonment</title><link>https://moonment.net/tags/ai-agent/</link><description>Moon 的概念笔记、真实项目与可复查的判断。</description><generator>Hugo</generator><language>zh-CN</language><managingEditor>Moon</managingEditor><webMaster>Moon</webMaster><copyright>© 2026 Moonment</copyright><lastBuildDate>Tue, 29 Sep 2026 13:55:00 +0800</lastBuildDate><atom:link href="https://moonment.net/tags/ai-agent/index.xml" rel="self" type="application/rss+xml"/><item><title>系统：边界、关系、反馈与 AI</title><link>https://moonment.net/notes/what-is-a-system/</link><pubDate>Sun, 27 Sep 2026 21:07:57 +0800</pubDate><dc:creator>Moon</dc:creator><guid>https://moonment.net/notes/what-is-a-system/</guid><description>系统不是许多东西的集合，而是要素在边界与环境中相互作用、随时间变化并形成整体行为。本文进一步区分结构、机制、流程、模型与 AI 系统。</description><content:encoded><![CDATA[<p>“系统”最核心的含义是：</p>
<blockquote>
<p><strong>系统是在某个边界内，由相互关联的要素及其关系构成，并在环境中通过持续运行和状态变化表现出整体行为的对象。</strong></p>
</blockquote>
<p>系统的重点不是“包含很多东西”，而是：</p>
<ul>
<li>有哪些要素；</li>
<li>要素怎样相互作用；</li>
<li>哪些要素属于系统；</li>
<li>系统与外部环境怎样交换；</li>
<li>这些关系如何使整体产生某种行为、能力或结果。</li>
</ul>
<p>例如，一堆汽车零件只是集合。零件按照特定结构连接，能够传递能量、控制方向、制动并运送乘客时，才构成汽车系统。</p>
<h2 id="系统这个词是什么意思">“系统”这个词是什么意思？</h2>
<p>现代技术语境中的“系统”通常对应英文 <code>system</code>。</p>
<p><code>system</code> 来自希腊语 <code>systēma</code>，含义接近“由多个部分共同组成的整体”。词根包含“共同”和“使之站立、组织起来”的意思。因此，它从一开始强调的就不是单个部分，而是多个部分怎样共同成立为一个整体。<a href="https://www.etymonline.com/word/system">Etymonline: system</a></p>
<p>中文“系统”在日常语言中还有“全面、条理化”的意思，例如“系统地学习”。这是一种形容方式，表示内容彼此连接、形成完整结构。</p>
<p>本文讨论的是名词意义上的系统。</p>
<h2 id="系统至少包含什么">系统至少包含什么？</h2>
<p>一个系统通常需要三个最基本的部分：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">要素
</span></span><span class="line"><span class="cl">+ 要素之间的关系
</span></span><span class="line"><span class="cl">+ 系统边界
</span></span></code></pre></div><p>如果还要解释系统怎样运行，就需要继续加入：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">状态
</span></span><span class="line"><span class="cl">+ 变化规则
</span></span><span class="line"><span class="cl">+ 环境
</span></span><span class="line"><span class="cl">+ 输入与输出
</span></span><span class="line"><span class="cl">+ 时间
</span></span></code></pre></div><p>对于人为设计的系统，通常还要加入：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">目标
</span></span><span class="line"><span class="cl">+ 约束
</span></span><span class="line"><span class="cl">+ 评价标准
</span></span></code></pre></div><p>所以可以用一个分析式表示：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">系统
</span></span><span class="line"><span class="cl">= 要素
</span></span><span class="line"><span class="cl">+ 关系
</span></span><span class="line"><span class="cl">+ 边界
</span></span><span class="line"><span class="cl">+ 状态变化
</span></span><span class="line"><span class="cl">+ 环境交互
</span></span></code></pre></div><p>对于工程系统，还可以写成：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">工程系统
</span></span><span class="line"><span class="cl">= 系统结构
</span></span><span class="line"><span class="cl">+ 设计目的
</span></span><span class="line"><span class="cl">+ 运行约束
</span></span><span class="line"><span class="cl">+ 评价标准
</span></span></code></pre></div><p>ISO/IEC/IEEE 的工程定义通常把系统描述为为了一个或多个目标而组织起来的相互作用要素组合。<a href="https://www.iso.org/obp/ui?_escaped_fragment_=iso%3Astd%3Aiso-iec-ieee%3A42020%3Aed-1%3Av1%3Aen">ISO/IEC/IEEE 42020:2019</a></p>
<p>但“具有目标”主要适用于工程、组织和行动系统。太阳系、生态系统或者气候系统可以表现出稳定规律，却不一定拥有主观目的。</p>
<h2 id="要素为什么不能单独解释系统">要素为什么不能单独解释系统？</h2>
<p>系统首先包含组成要素。</p>
<p>例如，一个在线内容发布系统可能包含：</p>
<ul>
<li>作者；</li>
<li>文章；</li>
<li>Markdown 文件；</li>
<li>Git 仓库；</li>
<li>构建程序；</li>
<li>网站服务器；</li>
<li>域名；</li>
<li>发布权限；</li>
<li>搜索引擎；</li>
<li>读者。</li>
</ul>
<p>但是，列出这些要素还没有解释系统。</p>
<p>真正重要的是关系：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">作者 ──撰写──&gt; 文章
</span></span><span class="line"><span class="cl">文章 ──保存为──&gt; Markdown
</span></span><span class="line"><span class="cl">Git ──记录──&gt; 版本
</span></span><span class="line"><span class="cl">构建程序 ──转换──&gt; 网页
</span></span><span class="line"><span class="cl">部署服务 ──发布──&gt; 网站
</span></span><span class="line"><span class="cl">读者 ──访问──&gt; 页面
</span></span><span class="line"><span class="cl">搜索引擎 ──索引──&gt; 内容
</span></span></code></pre></div><p>如果没有这些关系，它们只是同时存在的一组对象。</p>
<p>因此：</p>
<blockquote>
<p><strong>系统不是要素的清单，而是要素经过组织后形成的关系整体。</strong></p>
</blockquote>
<h2 id="系统与集合有什么区别">系统与集合有什么区别？</h2>
<p>集合只要求成员被归在一起，不要求成员相互作用。</p>
<p>例如：</p>
<ul>
<li>一个仓库里的一百把椅子，可以构成椅子的集合；</li>
<li>一支球队的球员、教练、规则、训练和比赛关系，构成一个球队系统；</li>
<li>一份联系人名单是人的集合；</li>
<li>这些人形成沟通、分工、权限和反馈，才可能构成组织系统。</li>
</ul>
<p>可以这样区分：</p>
<table>
  <thead>
      <tr>
          <th>集合</th>
          <th>系统</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>强调有哪些成员</td>
          <td>强调成员怎样相互作用</td>
      </tr>
      <tr>
          <td>成员可以互不影响</td>
          <td>要素之间存在相关或依赖</td>
      </tr>
      <tr>
          <td>删除一个成员通常只改变数量</td>
          <td>改变一个部分可能改变整体行为</td>
      </tr>
      <tr>
          <td>不一定产生整体能力</td>
          <td>组织关系可能产生整体能力</td>
      </tr>
  </tbody>
</table>
<p>系统也可以被看作一种集合，但它还具有关系、边界和运行结构。</p>
<h2 id="系统为什么需要边界">系统为什么需要边界？</h2>
<p>如果没有边界，任何东西都可以和整个宇宙发生某种联系，“系统”就会失去分析价值。</p>
<p>系统边界回答：</p>
<blockquote>
<p>哪些要素和关系属于当前研究对象，哪些属于环境？</p>
</blockquote>
<p>例如，研究一家咖啡店时：</p>
<ul>
<li>分析出杯速度，可能包括顾客、点单、咖啡师、设备和排队规则；</li>
<li>分析盈利能力，还要包括租金、供应商、平台佣金和价格；</li>
<li>分析食品安全，还要包括仓储、温控、清洁和监管；</li>
<li>分析品牌，则可能包括社交媒体、顾客认知和公共评价。</li>
</ul>
<p>咖啡店并没有突然变成不同事物。变化的是我们为了回答不同问题而采用的系统边界。</p>
<p>INCOSE 将系统环境理解为系统之外、但会与系统发生重要交互并影响系统的部分；理解系统需要同时界定边界和环境。<a href="https://www.incose.org/wp-content/uploads/2026/01/INCOSEContent-410.pdf">INCOSE: Systems Thinking 101</a></p>
<p>系统边界具有两面性：</p>
<ul>
<li>它是一种认识和建模选择；</li>
<li>它也必须服从现实中的因果关系。</li>
</ul>
<p>不能为了让模型简单，就把真正影响结果的要素排除出去。</p>
<h2 id="系统与环境是什么关系">系统与环境是什么关系？</h2>
<p>系统边界以外不是“无关世界”，而是环境。</p>
<p>环境可能向系统提供：</p>
<ul>
<li>信息；</li>
<li>能量；</li>
<li>资源；</li>
<li>用户请求；</li>
<li>法律约束；</li>
<li>市场价格；</li>
<li>风险；</li>
<li>干扰。</li>
</ul>
<p>系统也会向环境输出：</p>
<ul>
<li>产品；</li>
<li>内容；</li>
<li>行为；</li>
<li>决策；</li>
<li>废弃物；</li>
<li>风险；</li>
<li>社会影响。</li>
</ul>
<p>因此可以表示为：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">环境
</span></span><span class="line"><span class="cl">  ↓ 输入
</span></span><span class="line"><span class="cl">系统内部处理
</span></span><span class="line"><span class="cl">  ↓ 输出
</span></span><span class="line"><span class="cl">环境发生变化
</span></span><span class="line"><span class="cl">  ↓ 新输入
</span></span><span class="line"><span class="cl">系统再次响应
</span></span></code></pre></div><p>大多数现实系统都是开放系统：它们与环境持续交换信息、物质、能量或价值。</p>
<p>“封闭系统”通常是为了研究而作出的理想化。它表示某类交换可以暂时忽略，不表示系统真的与外界毫无联系。</p>
<h2 id="系统具有状态并且随时间变化">系统具有状态，并且随时间变化</h2>
<p>系统不是一张静态结构图。</p>
<p>同样的要素和连接，在不同状态下可能产生不同结果。</p>
<p>例如，一个网站可能处于：</p>
<ul>
<li>正常运行；</li>
<li>构建中；</li>
<li>部署失败；</li>
<li>域名解析异常；</li>
<li>内容已更新但缓存未刷新；</li>
<li>仓库提交成功但生产环境尚未发布。</li>
</ul>
<p>这些状态决定系统接下来能够发生什么。</p>
<p>因此，理解系统还需要知道：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">当前状态
</span></span><span class="line"><span class="cl">+ 状态变化条件
</span></span><span class="line"><span class="cl">+ 变化所需时间
</span></span><span class="line"><span class="cl">+ 历史状态
</span></span></code></pre></div><p>系统行为可以表示为：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">当前状态 + 输入 + 规则
</span></span><span class="line"><span class="cl">             ↓
</span></span><span class="line"><span class="cl">         下一状态 + 输出
</span></span></code></pre></div><p>时间延迟尤其重要。</p>
<p>例如，内容已经发布，搜索引擎可能几天后才完成索引。产品已经改进，用户认知可能几个月后才改变。把延迟误认为“系统没有反应”，会造成错误判断。</p>
<h2 id="什么是反馈">什么是反馈？</h2>
<p>当系统的输出反过来影响后续输入或行为时，就形成反馈。</p>
<h3 id="负反馈">负反馈</h3>
<p>负反馈抵消变化，使系统保持在某个范围内。</p>
<p>例如：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">室温下降
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">暖气启动
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">室温上升
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">暖气停止
</span></span></code></pre></div><p>它的作用通常是稳定。</p>
<h3 id="正反馈">正反馈</h3>
<p>正反馈放大原有变化。</p>
<p>例如：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">内容获得更多互动
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">获得更多推荐
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">接触更多用户
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">产生更多互动
</span></span></code></pre></div><p>它可能带来增长，也可能放大错误和风险。</p>
<p>这里的“正”“负”不是价值判断，而是：</p>
<ul>
<li>正反馈放大变化；</li>
<li>负反馈抵消变化。</li>
</ul>
<p>系统还可能具有延迟反馈。反馈来得太晚，会导致系统过度调整、振荡或者失控。</p>
<h2 id="系统整体为什么不同于部分相加">系统整体为什么不同于部分相加？</h2>
<p>人们经常说：</p>
<blockquote>
<p>整体大于部分之和。</p>
</blockquote>
<p>这句话表达了系统的直觉，但不够精确。</p>
<p>真正增加的不是某种神秘力量，而是：</p>
<blockquote>
<p><strong>部分之间的关系、组织和相互约束。</strong></p>
</blockquote>
<p>氢和氧按照不同结构组合，可以形成水，也可以形成过氧化氢。相同的人进入不同制度和激励结构，可能形成完全不同的组织行为。</p>
<p>系统整体呈现而单个部分不具备的性质，通常称为<strong>涌现性质</strong>。</p>
<p>例如：</p>
<ul>
<li>单个水分子没有“水温”，大量分子的运动状态可以形成温度；</li>
<li>单辆汽车不会形成拥堵，大量车辆相互影响可能形成交通堵塞；</li>
<li>单个神经元不会独立产生完整认知，大量神经元的组织活动形成更高层能力；</li>
<li>单个用户没有市场价格，众多供需行为及制度共同形成价格。</li>
</ul>
<p>系统生物学强调，研究整体能力时，必须把组成部分放回相互作用和整体约束中。<a href="https://plato.stanford.edu/entries/systems-synthetic-biology/">Stanford Encyclopedia of Philosophy: Philosophy of Systems and Synthetic Biology</a></p>
<p>“涌现”并不意味着无法解释。它意味着解释不能只列出部分，还必须说明：</p>
<ul>
<li>部分怎样排列；</li>
<li>怎样相互作用；</li>
<li>哪些反馈存在；</li>
<li>整体怎样约束部分；</li>
<li>行为怎样随时间形成。</li>
</ul>
<h2 id="系统一定有目的吗">系统一定有目的吗？</h2>
<p>不一定。</p>
<p>需要区分三种情况。</p>
<h3 id="人工设计的系统">人工设计的系统</h3>
<p>支付系统、交通系统、内容发布系统和 AI Agent 系统，通常有设计目的。</p>
<p>但设计目的不等于实际结果。</p>
<p>一个推荐系统可能以提升用户满意度为目标，却实际优化点击率；提高点击率又可能带来沉迷、极化或者低质量内容。</p>
<p>所以还要区分：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">宣称的目的
</span></span><span class="line"><span class="cl">设计者的目的
</span></span><span class="line"><span class="cl">系统实际优化的指标
</span></span><span class="line"><span class="cl">系统产生的真实结果
</span></span></code></pre></div><h3 id="生物系统">生物系统</h3>
<p>心脏具有泵血功能，免疫系统具有防御作用。</p>
<p>这里的“功能”可以通过生物结构和演化解释，并不要求心脏具有主观意图。</p>
<h3 id="自然系统">自然系统</h3>
<p>太阳系、气候系统和河流系统呈现规律性行为，但没有必要假设它们在追求某个目标。</p>
<p>因此：</p>
<blockquote>
<p><strong>系统可以具有功能和稳定行为，不一定具有意图。</strong></p>
</blockquote>
<h2 id="系统和结构机制流程有什么区别">系统和结构、机制、流程有什么区别？</h2>
<p>这些概念彼此相关，但关注的问题不同。</p>
<table>
  <thead>
      <tr>
          <th>概念</th>
          <th>主要问题</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>系统</td>
          <td>哪些要素在什么边界内相互作用，并形成什么整体行为？</td>
      </tr>
      <tr>
          <td>结构</td>
          <td>要素怎样排列、连接和分层？</td>
      </tr>
      <tr>
          <td>机制</td>
          <td>某种结果通过哪些因果步骤产生？</td>
      </tr>
      <tr>
          <td>流程</td>
          <td>活动按照什么时间顺序进行？</td>
      </tr>
      <tr>
          <td>功能</td>
          <td>这个整体或部分能够产生什么作用？</td>
      </tr>
      <tr>
          <td>组织</td>
          <td>人、角色、规则和权力怎样被协调？</td>
      </tr>
      <tr>
          <td>模型</td>
          <td>我们用什么表示来理解、解释或预测对象？</td>
      </tr>
      <tr>
          <td>网络</td>
          <td>节点和连接形成什么拓扑关系？</td>
      </tr>
  </tbody>
</table>
<p>一个系统可以同时拥有结构、机制和流程。</p>
<p>例如，一个内容发布系统：</p>
<ul>
<li>仓库、构建器和服务器的连接是结构；</li>
<li>Markdown 被转换为 HTML 是机制；</li>
<li>写作、审核、提交、构建和部署是流程；</li>
<li>稳定发布并让读者访问是功能；</li>
<li>对整个对象的抽象表示是系统模型。</li>
</ul>
<p>系统是研究对象，模型是我们对系统的表示。地图不是道路，系统模型也不等于系统本身。</p>
<h2 id="系统与实体本体论是什么关系">系统与实体、本体论是什么关系？</h2>
<p>“实体”回答：</p>
<blockquote>
<p>我们正在谈论哪一个可以持续识别的对象？</p>
</blockquote>
<p>“系统”进一步回答：</p>
<blockquote>
<p>多个对象怎样通过关系和变化形成一个整体？</p>
</blockquote>
<p>因此可以表示为：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">实体：可被识别的对象
</span></span><span class="line"><span class="cl">关系：对象之间怎样连接
</span></span><span class="line"><span class="cl">系统：对象和关系怎样组织并随时间运行
</span></span><span class="line"><span class="cl">本体论：系统承认哪些对象、类别和关系
</span></span></code></pre></div><p>一个系统本身也可以作为实体。</p>
<p>例如，“支付系统”可以被当作一个整体实体，拥有名称、版本、所有者、状态、服务范围和生命周期。进入它的内部以后，它又可以分成账户、订单、支付渠道、风控和结算等子系统。</p>
<p>所以：</p>
<blockquote>
<p><strong>在一个层次上是系统的对象，在更高层次上可以成为另一个系统中的组成要素。</strong></p>
</blockquote>
<p>关于实体与本体论本身，可以分别参见<a href="/notes/what-is-an-entity/">《什么是实体？从身份、指称到 AI 的行动对象》</a>和<a href="/notes/what-is-ontology/">《什么是本体论？从存在者到 AI 的领域模型》</a>。</p>
<h2 id="什么是子系统和系统的系统">什么是子系统和系统的系统？</h2>
<p>复杂系统通常具有层级。</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">组件
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">子系统
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">系统
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">更大的系统
</span></span></code></pre></div><p>例如：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">支付接口
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">订单与支付子系统
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">电商平台
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">商业与物流生态
</span></span></code></pre></div><p>子系统在上一级系统中承担部分功能，但它本身也可能拥有内部要素、边界和运行规则。</p>
<p>多个能够独立运行、拥有各自管理权和目标的系统，再通过合作形成更大能力时，常被称为“系统的系统”。</p>
<p>例如城市交通可能连接道路系统、公交系统、地铁系统、导航系统、支付系统、交管系统以及出租车和网约车平台。它们不能简单由一个中心完全控制，却共同影响城市出行。</p>
<h2 id="系统是真实存在还是人的建模方式">系统是真实存在，还是人的建模方式？</h2>
<p>两者都有。</p>
<p>现实中确实存在相互作用、依赖、反馈和组织结构。交通拥堵、生态循环、组织协作和软件调用并非完全由观察者想象出来。</p>
<p>但系统的边界、层次和描述方式通常由研究问题决定。</p>
<p>例如，一个人可以同时被放进生物系统、家庭系统、企业系统、法律系统、经济系统和信息系统。这些划分不是说现实中存在六个互不相干的人，而是从不同关系观察同一个人。</p>
<p>所以系统具有双重性质：</p>
<blockquote>
<p><strong>关系和作用受到现实约束；边界和抽象层次由认识目的选择。</strong></p>
</blockquote>
<p>系统不是纯粹客观地摆在世界中的盒子，也不是可以任意划分的主观想象。</p>
<h2 id="系统分析中隐藏着价值与权力">系统分析中隐藏着价值与权力</h2>
<p>系统边界并不只是技术选择。</p>
<p>当我们决定：</p>
<ul>
<li>谁属于系统；</li>
<li>谁只是外部环境；</li>
<li>什么被计算为收益；</li>
<li>什么被视为成本；</li>
<li>优化什么指标；</li>
<li>谁能修改规则；</li>
<li>谁承担外部后果；</li>
</ul>
<p>我们也在作出价值和权力选择。</p>
<p>例如，一个配送系统如果只优化每小时完成订单数量，可能把骑手安全、等待压力和交通风险排除在评价之外。</p>
<p>从平台内部看，效率提高了；从更大的社会系统看，成本只是被转移给了其他人。</p>
<p>因此，系统分析不能只问“运行效率如何”，还要问：</p>
<blockquote>
<p>系统为谁优化，谁承担成本，哪些结果被边界排除？</p>
</blockquote>
<h2 id="ai-中的系统是什么">AI 中的系统是什么？</h2>
<p>在 AI 中，系统通常不是单独一个模型。</p>
<p>以大语言模型应用为例，完整系统可能包括：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">用户
</span></span><span class="line"><span class="cl">+ 界面
</span></span><span class="line"><span class="cl">+ 提示词和上下文
</span></span><span class="line"><span class="cl">+ 大语言模型
</span></span><span class="line"><span class="cl">+ 检索与知识库
</span></span><span class="line"><span class="cl">+ 记忆与状态
</span></span><span class="line"><span class="cl">+ 工具
</span></span><span class="line"><span class="cl">+ 任务编排
</span></span><span class="line"><span class="cl">+ 身份和权限
</span></span><span class="line"><span class="cl">+ 运行环境
</span></span><span class="line"><span class="cl">+ 日志与评测
</span></span><span class="line"><span class="cl">+ 人工确认
</span></span><span class="line"><span class="cl">+ 结果反馈
</span></span></code></pre></div><p>大模型只是其中负责部分推断和生成的组件。</p>
<p>OECD 把 AI 模型描述为 AI 系统的核心组件之一，而 AI 系统从输入中推断如何生成预测、内容、建议或决策，以影响虚拟或物理环境。<a href="https://oecd.ai/en/wonk/ai-system-definition-update">OECD: Updated Definition of an AI System</a></p>
<p>NIST 进一步强调，AI 系统具有社会技术性质：结果和风险来自技术组件、使用方式、操作者以及部署环境的共同作用。<a href="https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.100-1.pdf">NIST AI Risk Management Framework</a></p>
<h2 id="大模型与-ai-系统有什么区别">大模型与 AI 系统有什么区别？</h2>
<p>大模型主要完成：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">输入 token
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">概率计算与推断
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">输出 token
</span></span></code></pre></div><p>AI 系统还要完成：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">理解用户任务
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">解析具体实体
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">读取当前状态
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">制定行动步骤
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">调用工具
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">检查身份与权限
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">执行操作
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">验证现实结果
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">根据反馈修正
</span></span></code></pre></div><p>例如，大模型可以生成一篇文章。</p>
<p>但要把文章发布到网站，还需要：</p>
<ul>
<li>确定目标文章和语言版本；</li>
<li>读取网站规范；</li>
<li>修改真实文件；</li>
<li>运行构建验证；</li>
<li>使用正确 Git 身份；</li>
<li>提交并推送；</li>
<li>等待部署；</li>
<li>检查线上页面；</li>
<li>验证 sitemap、canonical 和语言关联。</li>
</ul>
<p>这些部分共同构成发布系统。</p>
<p>因此：</p>
<blockquote>
<p><strong>模型能够生成答案，不等于系统能够可靠地完成任务。</strong></p>
</blockquote>
<h2 id="如何分析一个系统">如何分析一个系统？</h2>
<p>可以按以下顺序进行。</p>
<ol>
<li><strong>明确研究问题。</strong> 究竟要解释、设计、改进还是评价什么？没有问题，系统边界就无从确定。</li>
<li><strong>确定边界。</strong> 哪些属于系统，哪些属于环境？边界为什么划在这里？</li>
<li><strong>找出要素。</strong> 包括人、物、软件、制度、规则、数据、资源和环境条件。</li>
<li><strong>画出关系。</strong> 谁依赖谁？信息、物质、资金和权力怎样流动？</li>
<li><strong>识别状态和变化。</strong> 系统有哪些状态？什么事件使它从一种状态进入另一种状态？</li>
<li><strong>找到反馈回路。</strong> 哪些结果会反过来加强或抑制原来的行为？</li>
<li><strong>检查时间延迟。</strong> 输入和结果之间有多长延迟？短期和长期结果是否相反？</li>
<li><strong>区分目标与指标。</strong> 系统真正想实现什么？实际优化的又是什么？</li>
<li><strong>检查约束和权限。</strong> 谁可以改变哪些部分？哪些规则不能由系统内部决定？</li>
<li><strong>检查外部后果。</strong> 哪些成本、风险和受影响者被排除在当前边界之外？</li>
</ol>
<h2 id="对系统的最终定义">对“系统”的最终定义</h2>
<p>可以把“系统”定义为：</p>
<blockquote>
<p><strong>系统是在一定边界和环境中，由相互依赖的要素按照某种结构与规则持续作用，并通过状态变化表现出整体行为、能力或结果的对象。</strong></p>
</blockquote>
<p>这个定义包含六个部分：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">要素
</span></span><span class="line"><span class="cl">关系
</span></span><span class="line"><span class="cl">边界
</span></span><span class="line"><span class="cl">环境
</span></span><span class="line"><span class="cl">变化
</span></span><span class="line"><span class="cl">整体行为
</span></span></code></pre></div><p>对于人工系统，还需要补充：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">目的
</span></span><span class="line"><span class="cl">约束
</span></span><span class="line"><span class="cl">指标
</span></span><span class="line"><span class="cl">权限
</span></span><span class="line"><span class="cl">责任
</span></span></code></pre></div><p>系统不是“很多东西放在一起”，也不是一张漂亮的架构图。</p>
<p>真正的系统意味着：</p>
<blockquote>
<p>部分的行为会影响其他部分，关系会改变整体结果，整体状态又会反过来限制各个部分。</p>
</blockquote>
<p>理解实体，是辨认系统里有什么；理解系统，则是解释这些实体怎样共同运行，以及为什么最后产生了现在看到的结果。</p>
<h2 id="参考资料">参考资料</h2>
<ul>
<li><a href="https://www.etymonline.com/word/system">Etymonline: system</a></li>
<li><a href="https://www.iso.org/obp/ui?_escaped_fragment_=iso%3Astd%3Aiso-iec-ieee%3A42020%3Aed-1%3Av1%3Aen">ISO/IEC/IEEE 42020:2019</a></li>
<li><a href="https://www.incose.org/wp-content/uploads/2026/01/INCOSEContent-410.pdf">INCOSE: Systems Thinking 101</a></li>
<li><a href="https://plato.stanford.edu/entries/systems-synthetic-biology/">Stanford Encyclopedia of Philosophy: Philosophy of Systems and Synthetic Biology</a></li>
<li><a href="https://oecd.ai/en/wonk/ai-system-definition-update">OECD: Updated Definition of an AI System</a></li>
<li><a href="https://nvlpubs.nist.gov/nistpubs/ai/NIST.AI.100-1.pdf">NIST AI Risk Management Framework</a></li>
</ul>
]]></content:encoded></item><item><title>实体：身份、指称与 AI 行动对象</title><link>https://moonment.net/notes/what-is-an-entity/</link><pubDate>Thu, 24 Sep 2026 16:31:31 +0800</pubDate><dc:creator>Moon</dc:creator><guid>https://moonment.net/notes/what-is-an-entity/</guid><description>实体是在特定系统中具有可区分身份的对象。本文解释实体、名称、类别和记录的边界，以及 AI 如何识别、链接、验证并操作实体。</description><content:encoded><![CDATA[<p>我们在语言中不断谈论人、公司、城市、产品、文件、事件和概念。它们彼此差异很大，却都可能被称为“实体”。</p>
<p>中文里的“实体”容易让人想到实体门店、实体经济或有形物品。但在哲学、信息科学和人工智能中，实体并不等于物质对象，也不只是一个名词。</p>
<blockquote>
<p><strong>实体是在某个讨论、认知或计算系统中，被赋予相对独立身份，因而可以被持续指称、识别、描述、关联、追踪或操作的对象。</strong></p>
</blockquote>
<p>这个定义的核心不是“摸不摸得到”，而是“能不能把它当作同一个东西继续谈论”。一个人是一种实体，一家公司可以是一种实体，一篇文章、一次会议、一份合同和一个虚构人物也可以成为实体。它们的存在方式不同，身份标准也不同。</p>
<h2 id="实体究竟指什么">“实体”究竟指什么？</h2>
<p>现代哲学与技术语境中的“实体”通常对应英文 <code>entity</code>。这个词来自中世纪拉丁语 <code>entitas</code>，又与表示“是”或“存在”的 <code>esse</code> 相连。它原本接近于“某个存在者”或者“某个可以被算作某物的东西”。<a href="https://www.ahdictionary.com/word/search.html?q=entity">American Heritage Dictionary: entity</a></p>
<p>因此，<code>entity</code> 的范围远大于中文日常表达中的“实体物品”。它可以包括：</p>
<ul>
<li>具体对象，例如人、树、手机；</li>
<li>社会和制度对象，例如公司、国家、账号；</li>
<li>事件和过程，例如会议、交易、学习；</li>
<li>抽象对象，例如数字、集合和命题；</li>
<li>心理状态，例如信念、欲望和意图；</li>
<li>作品和虚构人物，例如一部小说和小说中的角色。</li>
</ul>
<p>哲学家不会一致承认这些对象都以相同方式存在。有些理论承认抽象对象，有些理论否认；有些理论把事件视为基本存在者，有些理论试图用对象及其变化解释事件。但只要一种理论允许某个东西成为指称、量化或者解释的对象，它就在某种意义上把这个东西当作实体。<a href="https://plato.stanford.edu/entries/object/">Stanford Encyclopedia of Philosophy: Object</a></p>
<h2 id="实体不等于物体实质或者真实存在">实体不等于物体、实质或者真实存在</h2>
<h3 id="实体不等于物体">实体不等于物体</h3>
<p>物体通常指具有物质结构和空间边界的对象。实体的范围更广。</p>
<p>一家公司没有像石头一样固定的物质边界，却可以有名称、法律身份、资产、权利、责任和生命周期。一次会议不是一件物品，却可以有参与者、时间、地点、议题和结果。二者都可以被系统持续识别，所以都可以成为实体。</p>
<h3 id="entity-不等于-substance">Entity 不等于 substance</h3>
<p>英文 <code>entity</code> 与哲学中的 <code>substance</code> 也不能直接等同。</p>
<p><code>entity</code> 泛指可以作为某个存在者来讨论的东西。<code>substance</code> 则通常强调相对独立、能够承载属性或者构成事物基础的存在。事件、关系、数字和属性可以被称为 entity，却未必是传统哲学意义上的 substance。<a href="https://plato.stanford.edu/entries/substance/">Stanford Encyclopedia of Philosophy: Substance</a></p>
<p>中文都可能把二者译成“实体”，所以阅读哲学文本时需要回到原词和具体理论。</p>
<h3 id="被谈论不等于真实存在">被谈论不等于真实存在</h3>
<p>福尔摩斯可以被明确命名、拥有性格、住所和人物关系，因此是文学叙事与知识库中的实体。但这不能证明现实中曾经存在一位对应的侦探。</p>
<p>至少要区分三个判断：</p>
<table>
  <thead>
      <tr>
          <th>层次</th>
          <th>判断的问题</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>语言实体</td>
          <td>语言是否建立了一个可以被持续指称的对象？</td>
      </tr>
      <tr>
          <td>模型实体</td>
          <td>信息系统是否把它作为独立对象表示？</td>
      </tr>
      <tr>
          <td>现实实体</td>
          <td>是否有充分证据证明现实中存在对应对象？</td>
      </tr>
  </tbody>
</table>
<p>一个名称出现在文本中，只能证明文本出现了这个名称。它被模型识别为实体，也只说明模型作出了某种表示。现实存在需要另外的证据。</p>
<h2 id="一个东西凭什么成为同一个实体">一个东西凭什么成为同一个实体？</h2>
<p>实体概念最困难的部分不是给对象起名，而是确定它的身份。</p>
<p>一个人改名以后，通常仍是同一个人。一家公司更换员工和办公地址以后，法律身份可能继续存在。一篇文章修改正文以后，可能仍由同一条版本历史保持身份。一个商品更换包装以后，是否仍是同一 SKU，则取决于交易系统采用的规则。</p>
<p>这说明不同类型的实体具有不同的<strong>同一性条件</strong>：</p>
<table>
  <thead>
      <tr>
          <th>实体类型</th>
          <th>常见身份依据</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>人</td>
          <td>身份记录、生命连续性及社会关系</td>
      </tr>
      <tr>
          <td>公司</td>
          <td>法律登记、组织延续和权利义务</td>
      </tr>
      <tr>
          <td>文件</td>
          <td>文件标识、路径、内容哈希或版本链</td>
      </tr>
      <tr>
          <td>文章</td>
          <td>创作谱系、发布记录、slug 或版本历史</td>
      </tr>
      <tr>
          <td>产品型号</td>
          <td>型号、能力范围与规格定义</td>
      </tr>
      <tr>
          <td>具体商品</td>
          <td>SKU、序列号、批次或交易单位</td>
      </tr>
      <tr>
          <td>账号</td>
          <td>平台、稳定账号 ID 和控制关系</td>
      </tr>
      <tr>
          <td>事件</td>
          <td>参与者、时间、地点和发生结构</td>
      </tr>
  </tbody>
</table>
<p>名称不是身份。两个人可以同名，同一个人也可以使用多个名称。属性也不等于身份：人的年龄和地址会变化，却不因此每天变成另一个人。</p>
<p>更准确的实体表示通常需要：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">身份标识
</span></span><span class="line"><span class="cl">+ 实体类型
</span></span><span class="line"><span class="cl">+ 属性
</span></span><span class="line"><span class="cl">+ 关系
</span></span><span class="line"><span class="cl">+ 时间与状态
</span></span><span class="line"><span class="cl">+ 来源
</span></span><span class="line"><span class="cl">+ 身份置信度
</span></span></code></pre></div><h2 id="实体为什么离不开本体论">实体为什么离不开本体论？</h2>
<p>实体不是脱离认知框架后自然摆放好的一张清单。一个系统必须决定什么值得被当作独立对象、对象分成哪些类型，以及什么变化仍允许它保持身份。</p>
<p>这已经进入本体论：什么存在，存在者有哪些类别，又如何保持身份和彼此关联。</p>
<blockquote>
<p><strong>实体是系统承认的某个存在者；本体论规定什么可以成为实体，以及这些实体怎样组织起来。</strong></p>
</blockquote>
<p>例如，“上海”在一份简单用户表中可以只是地址字符串；在城市知识图谱中则可能成为拥有行政区划、地理位置和人口属性的独立实体。不同表示没有脱离任务的绝对优劣，关键在于系统是否需要持续识别上海，并围绕它建立更多关系。</p>
<p>哲学本体论研究现实中有哪些存在者。AI 和知识工程中的本体，则把一个领域中的类别、实体、属性、关系和约束明确写出来。关于本体论本身，可以参见<a href="/notes/what-is-ontology/">《什么是本体论？从存在者到 AI 的领域模型》</a>。本文只保留与实体身份直接有关的部分。</p>
<h2 id="ai-中的实体是什么">AI 中的实体是什么？</h2>
<p>在 AI 中，实体通常指系统为了理解、检索、记忆、推理或行动，而从文本、图像、数据库或现实环境中区分出来的对象。</p>
<p>但“实体”在不同任务中承担的角色不同。命名实体识别、实体链接、知识图谱、数据库和 AI Agent 谈论的并不是完全同一个层次。</p>
<h2 id="自然语言处理先识别的是实体提及">自然语言处理先识别的是“实体提及”</h2>
<p>看一句话：</p>
<blockquote>
<p>苹果计划明天在上海发布一款新手机。</p>
</blockquote>
<p>模型可能从中找出：</p>
<ul>
<li>“苹果”；</li>
<li>“明天”；</li>
<li>“上海”。</li>
</ul>
<p>这些首先是文本中的<strong>实体提及</strong>，也就是看起来在指向某个对象的词语片段。</p>
<p>命名实体识别，Named Entity Recognition，简称 NER，通常负责找出这些片段并标注类型。例如把“苹果”标为组织，把“上海”标为地点，把“明天”标为日期。spaCy 的实体识别组件把这项任务表述为识别互不重叠并带有标签的 token 片段。<a href="https://spacy.io/api/entityrecognizer/">spaCy: EntityRecognizer</a></p>
<p>但是，NER 只回答：</p>
<ol>
<li>哪段文字可能在指向实体；</li>
<li>这个提及大概属于什么类型。</li>
</ol>
<p>它还没有证明“苹果”究竟指水果、Apple Inc.、某个品牌，还是其他同名对象。“新手机”也可能只是一个产品类别，而不是已经拥有名称和身份的具体产品实体。</p>
<p>所以必须区分：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">实体提及 ≠ 实体身份
</span></span><span class="line"><span class="cl">实体名称 ≠ 具体实体
</span></span><span class="line"><span class="cl">实体类型 ≠ 现实存在
</span></span></code></pre></div><h2 id="实体链接把名称连接到具体身份">实体链接把名称连接到具体身份</h2>
<p>如果系统进一步判断句中的“苹果”指 Apple Inc.，并把它连接到知识库中的唯一标识，这一步称为<strong>实体链接</strong>。</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">文本中的“苹果”
</span></span><span class="line"><span class="cl">        ↓ 消歧
</span></span><span class="line"><span class="cl">Apple Inc.
</span></span><span class="line"><span class="cl">        ↓ 规范化
</span></span><span class="line"><span class="cl">知识库实体 ID：company/apple-inc
</span></span></code></pre></div><p>实体链接通常包含两个问题：</p>
<ul>
<li><strong>消歧</strong>：同一个名称在当前语境中指哪个对象？</li>
<li><strong>共指与规范化</strong>：“苹果公司”“Apple”和“Apple Inc.”是否指同一个实体？</li>
</ul>
<p>如果只识别名称而不确认身份，系统很容易把同名人物合并，或者把同一公司的不同写法当成三家公司。</p>
<p>实体链接仍然不是现实验证。链接成功只表示文本提及被连接到某条知识库记录。那条记录是否正确、最新，是否真的对应现实对象，还要检查来源和时间。</p>
<h2 id="知识图谱把实体放进关系网络">知识图谱把实体放进关系网络</h2>
<p>在知识图谱中，实体通常表现为节点，关系表现为连接节点的边。</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">苹果公司 ──总部位于──&gt; 库比蒂诺
</span></span><span class="line"><span class="cl">苹果公司 ──发布──&gt; iPhone
</span></span><span class="line"><span class="cl">iPhone ──属于──&gt; 智能手机
</span></span></code></pre></div><p>这里可以区分：</p>
<ul>
<li>实体：苹果公司、库比蒂诺、iPhone；</li>
<li>类别：公司、城市、产品；</li>
<li>属性：名称、成立时间、发布日期；</li>
<li>关系：总部位于、发布、属于。</li>
</ul>
<p>RDF 等知识表示方式使用“主体—谓词—客体”三元组描述信息。W3C 的 RDF 模型允许资源指向物理对象、文档、抽象概念和其他可以进入讨论领域的对象。<a href="https://www.w3.org/TR/rdf11-concepts/">W3C: RDF 1.1 Concepts and Abstract Syntax</a></p>
<p>本体规定哪些类型和关系可以出现，知识图谱则记录具体实体与事实：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">本体：公司可以发布产品
</span></span><span class="line"><span class="cl">事实：苹果公司发布 iPhone
</span></span></code></pre></div><h2 id="类别概念实体和记录不是一回事">类别、概念、实体和记录不是一回事</h2>
<p>“公司”与“苹果公司”处在不同层次。</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">公司：类别或概念
</span></span><span class="line"><span class="cl">苹果公司：一个具体实体
</span></span><span class="line"><span class="cl">“苹果”：文本中的名称或实体提及
</span></span><span class="line"><span class="cl">company_001：系统中的实体标识
</span></span><span class="line"><span class="cl">数据库某一行：关于实体的一条记录
</span></span></code></pre></div><p>可以用下表进一步区分：</p>
<table>
  <thead>
      <tr>
          <th>对象</th>
          <th>它回答什么问题？</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>词语</td>
          <td>人们用了什么表达？</td>
      </tr>
      <tr>
          <td>名称</td>
          <td>怎样称呼这个对象？</td>
      </tr>
      <tr>
          <td>概念</td>
          <td>我们用什么一般结构理解它？</td>
      </tr>
      <tr>
          <td>类别</td>
          <td>哪些对象被归入同一类型？</td>
      </tr>
      <tr>
          <td>实体</td>
          <td>当前具体指向哪个对象？</td>
      </tr>
      <tr>
          <td>标识符</td>
          <td>系统怎样稳定引用这个对象？</td>
      </tr>
      <tr>
          <td>数据记录</td>
          <td>系统保存了这个对象的哪些信息？</td>
      </tr>
      <tr>
          <td>现实对象</td>
          <td>模型之外是否有对应存在？</td>
      </tr>
  </tbody>
</table>
<p>同一个实体可以有多个名称和多条数据记录。一条记录也可能同时混合多个现实对象。建立 ID 能够减少歧义，却不能自动保证数据正确。</p>
<h2 id="什么时候应当把一个东西建模为实体">什么时候应当把一个东西建模为实体？</h2>
<p>并不是句子中的每个名词都必须成为独立实体。可以检查六个问题：</p>
<ol>
<li><strong>它是否具有独立身份？</strong> 系统需要区分这个对象与其他对象吗？</li>
<li><strong>它是否会被重复指向？</strong> 不同文本、记录或任务是否会再次谈到它？</li>
<li><strong>它是否有自己的属性？</strong> 是否需要记录名称、状态、时间或位置？</li>
<li><strong>它是否参与关系？</strong> 是否需要表达它属于谁、影响谁或者与谁互动？</li>
<li><strong>它是否跨时间持续？</strong> 属性变化后是否仍要把它视为同一个对象？</li>
<li><strong>系统是否会对它行动？</strong> 是否需要查询、修改、发送、授权、购买、删除或追踪？</li>
</ol>
<p>如果大多数答案是“是”，通常适合把它建模为实体。否则，一个属性值、标签或者临时文本片段可能已经足够。</p>
<h2 id="行为事件和状态也能成为实体吗">行为、事件和状态也能成为实体吗？</h2>
<p>语言中的名词、动词和形容词，与信息系统中的实体、事件、关系和属性并不一一对应。</p>
<p>“张三签署合同”可以先表示为关系：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">张三 ──签署──&gt; 合同
</span></span></code></pre></div><p>但如果系统需要记录签署时间、地点、版本、见证人和法律效力，就可以把这次签署建模为事件实体：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">签署事件 E1024
</span></span><span class="line"><span class="cl">├── 签署人：张三
</span></span><span class="line"><span class="cl">├── 对象：合同 C36
</span></span><span class="line"><span class="cl">├── 时间：2026-09-24
</span></span><span class="line"><span class="cl">├── 地点：上海
</span></span><span class="line"><span class="cl">└── 状态：已生效
</span></span></code></pre></div><p>同样，“意图”可以被当作一种心理状态；当系统需要记录是谁的意图、指向什么目标、依据什么证据推断、在什么时间成立时，也可以把一次意图判断建模为有来源和置信度的对象。</p>
<p>实体化是一种建模选择。它让系统能够围绕某个对象保存更多信息，也增加了身份、时间和一致性管理的成本。</p>
<h2 id="大语言模型怎样表示实体">大语言模型怎样表示实体？</h2>
<p>标准大语言模型直接接收的是 token。它从训练数据和当前上下文中学习名称、类别、属性与关系之间的统计模式。</p>
<p>模型可能知道“Apple”经常与公司、产品、iPhone 和库比蒂诺共同出现，也能在上下文中区分它与水果。但这并不意味着模型内部必然保存着一条像传统知识库一样清楚、唯一并可查询的 Apple Inc. 实体记录。</p>
<p>模型参数中的知识通常是分布式和概率性的。因此，大模型可能：</p>
<ul>
<li>在一个上下文中正确消歧，在另一个上下文中混淆；</li>
<li>把公司、品牌、产品和网站合并为一个对象；</li>
<li>记住旧属性，却不知道状态已经变化；</li>
<li>生成一个语言上合理、现实中不存在的人物或机构；</li>
<li>无法稳定说明某条事实的来源。</li>
</ul>
<p>需要可靠行动的 AI 系统，通常不能只依赖模型参数。它还需要显式的实体系统：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">语言模型
</span></span><span class="line"><span class="cl">+ 领域本体
</span></span><span class="line"><span class="cl">+ 实体标识与解析
</span></span><span class="line"><span class="cl">+ 当前状态数据
</span></span><span class="line"><span class="cl">+ 时间和来源
</span></span><span class="line"><span class="cl">+ 权限与行动规则
</span></span></code></pre></div><p>语言模型负责理解模糊表达，本体规定对象类型和关系，实体系统确定具体指向，事实系统验证当前状态，权限系统决定可以对什么做什么。</p>
<h2 id="ai-agent-为什么尤其需要可靠的实体身份">AI Agent 为什么尤其需要可靠的实体身份？</h2>
<p>看一个看似简单的提示词：</p>
<blockquote>
<p>把昨天那篇需求文章更新到 Moonment。</p>
</blockquote>
<p>系统至少要解析：</p>
<table>
  <thead>
      <tr>
          <th>表达</th>
          <th>待确认对象</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>昨天</td>
          <td>哪个时区和时间范围？</td>
      </tr>
      <tr>
          <td>那篇需求文章</td>
          <td>哪篇文章、哪个 slug？</td>
      </tr>
      <tr>
          <td>更新</td>
          <td>修改内容、提交代码还是发布线上？</td>
      </tr>
      <tr>
          <td>Moonment</td>
          <td>哪个项目、仓库和站点？</td>
      </tr>
      <tr>
          <td>语言版本</td>
          <td>只更新中文，还是同步英文？</td>
      </tr>
      <tr>
          <td>当前用户</td>
          <td>是否拥有修改和发布权限？</td>
      </tr>
  </tbody>
</table>
<p>AI 即使正确识别了“更新”这一意图，也可能因为实体解析错误而修改错文件、操作错项目、使用错账号或者覆盖错版本。</p>
<p>因此，从提示词到行动通常需要经过：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">原始语言
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">实体提及识别
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">类型判断与指代解析
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">实体链接和消歧
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">关系、事件与意图理解
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">现实状态、来源和权限验证
</span></span><span class="line"><span class="cl">    ↓
</span></span><span class="line"><span class="cl">对确定实体采取行动
</span></span></code></pre></div><p>识别出名称只是开始。真正可执行的理解，必须知道它指向哪个对象、对象当前是什么状态，以及用户是否授权对它行动。</p>
<h2 id="ai-能断定一个实体真实存在吗">AI 能断定一个实体真实存在吗？</h2>
<p>不能仅凭语言断定。</p>
<p>AI 可以判断一个表达看起来像人名、公司或地点，也可以计算它最可能对应哪条知识库记录。但现实存在需要外部证据，例如：</p>
<ul>
<li>官方登记和权威资料；</li>
<li>当前数据库记录；</li>
<li>文件系统中的真实文件；</li>
<li>可验证的网站和接口；</li>
<li>身份与权限系统；</li>
<li>传感器或人工确认。</li>
</ul>
<p>下面几步不能合并：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">文本提到一个对象
</span></span><span class="line"><span class="cl">≠ 模型正确识别它
</span></span><span class="line"><span class="cl">≠ 系统找到对应记录
</span></span><span class="line"><span class="cl">≠ 记录内容准确且仍然有效
</span></span><span class="line"><span class="cl">≠ 现实对象当前存在
</span></span><span class="line"><span class="cl">≠ 用户获准对它行动
</span></span></code></pre></div><p>大模型的置信度也不等于存在证明。它只描述模型在给定信息和计算方式下的判断强弱，不能替代证据来源。</p>
<h2 id="如何检查一个-ai-系统的实体设计">如何检查一个 AI 系统的实体设计？</h2>
<p>可以使用下面这组问题：</p>
<ol>
<li>系统中的实体类型有哪些，为什么需要它们？</li>
<li>名称、类别、实体和数据记录是否被明确区分？</li>
<li>每类实体的同一性条件是什么？</li>
<li>别名、同名、改名和重复记录怎样处理？</li>
<li>属性和关系是否带有时间与来源？</li>
<li>事件和状态是否被错误压缩成静态属性？</li>
<li>模型识别、知识库链接和现实验证是否分开？</li>
<li>虚构对象、计划对象和现实对象能否区分？</li>
<li>实体发生合并或拆分后，旧记录如何解释？</li>
<li>对实体采取行动前，如何验证身份、状态和权限？</li>
</ol>
<p>一个系统即使能抽取大量实体，如果没有稳定身份、时间、来源和权限，仍然无法可靠地连接语言与现实。</p>
<h2 id="实体是语言通向行动的接口">实体是语言通向行动的接口</h2>
<p>实体可以把现实、语言、知识和行动连接起来：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">现实中的对象、事件和状态
</span></span><span class="line"><span class="cl">          ↓
</span></span><span class="line"><span class="cl">语言中的名称与描述
</span></span><span class="line"><span class="cl">          ↓
</span></span><span class="line"><span class="cl">AI 识别实体、属性和关系
</span></span><span class="line"><span class="cl">          ↓
</span></span><span class="line"><span class="cl">系统连接到具体记录和现实证据
</span></span><span class="line"><span class="cl">          ↓
</span></span><span class="line"><span class="cl">理解需求、意图与行动对象
</span></span><span class="line"><span class="cl">          ↓
</span></span><span class="line"><span class="cl">在权限范围内执行并记录结果
</span></span></code></pre></div><p>实体回答的是“正在谈论谁或什么”。属性回答“它是什么样”，关系回答“它与什么相连”，事件回答“发生了什么”，意图回答“主体试图让什么发生”。</p>
<p>所以，实体不是一个名词标签，而是一项身份判断。它至少包含：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">可区分的身份
</span></span><span class="line"><span class="cl">+ 明确的类型
</span></span><span class="line"><span class="cl">+ 可变化的属性
</span></span><span class="line"><span class="cl">+ 与其他对象的关系
</span></span><span class="line"><span class="cl">+ 时间和状态
</span></span><span class="line"><span class="cl">+ 信息来源
</span></span></code></pre></div><p>AI 最危险的实体错误，不是漏掉一个名词，而是把一个模糊名称过早地当作已经确认身份、已经证实存在并且可以直接操作的现实对象。</p>
<h2 id="参考资料">参考资料</h2>
<ul>
<li><a href="https://www.ahdictionary.com/word/search.html?q=entity">American Heritage Dictionary: entity</a></li>
<li><a href="https://plato.stanford.edu/entries/object/">Stanford Encyclopedia of Philosophy: Object</a></li>
<li><a href="https://plato.stanford.edu/entries/substance/">Stanford Encyclopedia of Philosophy: Substance</a></li>
<li><a href="https://plato.stanford.edu/entries/logic-ontology/">Stanford Encyclopedia of Philosophy: Logic and Ontology</a></li>
<li><a href="https://spacy.io/api/entityrecognizer/">spaCy: EntityRecognizer</a></li>
<li><a href="https://spacy.io/usage/linguistic-features#named-entities">spaCy: Linguistic Features—Named Entity Recognition</a></li>
<li><a href="https://www.w3.org/TR/rdf11-concepts/">W3C: RDF 1.1 Concepts and Abstract Syntax</a></li>
<li><a href="https://www.w3.org/TR/owl2-primer/">W3C: OWL 2 Web Ontology Language Primer</a></li>
</ul>
]]></content:encoded></item><item><title>AI 的推理与行动：从模型生成到 Agent 执行</title><link>https://moonment.net/notes/ai-reasoning-and-action/</link><pubDate>Fri, 18 Sep 2026 15:20:00 +0800</pubDate><dc:creator>Moon</dc:creator><guid>https://moonment.net/notes/ai-reasoning-and-action/</guid><description>大语言模型如何从输入生成候选输出，推理为何不等于意识，AI Agent 又怎样把模型、工具、记忆、权限与反馈连接成行动系统。</description><content:encoded><![CDATA[<blockquote>
<p><strong>专题：思维、意图与行动（2/4）</strong> 上一篇：<a href="/notes/human-thinking/">人的思维</a>；下一篇：<a href="/notes/ai-user-intent-inference/">AI 如何理解用户意图</a></p>
</blockquote>
<h2 id="ai-是否在思考">AI 是否在“思考”？</h2>
<p>当人们说 AI 在思考，通常混合了三个不同问题：</p>
<ol>
<li>它能否完成推理、规划、比较和判断等任务？</li>
<li>它内部是否存在可以称为思维的计算过程？</li>
<li>它是否像人一样具有意识、体验、理解和自主意图？</li>
</ol>
<p>对第一个问题，可以肯定回答：现代大语言模型能够完成许多过去需要人类思考才能完成的任务。</p>
<p>对第二个问题，可以使用功能性的说法：</p>
<blockquote>
<p><strong>AI 的“思考”，是系统根据输入、上下文、内部参数和外部工具，对信息进行表示、转换、预测、比较与选择的计算过程。</strong></p>
</blockquote>
<p>但第三个问题不能从任务表现直接推出。一个系统能够解释概念、写出论证、规划步骤，并不能证明它具有人的主观体验，也不能证明它以人的方式理解自己正在做什么。</p>
<p>因此，讨论 AI 思维时，最好区分：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">功能表现
</span></span><span class="line"><span class="cl">≠
</span></span><span class="line"><span class="cl">内部机制
</span></span><span class="line"><span class="cl">≠
</span></span><span class="line"><span class="cl">主观体验
</span></span></code></pre></div><p>本文讨论的是前两层：AI 怎样形成输出、怎样处理复杂任务，以及怎样从语言生成走向外部行动。</p>
<h2 id="大语言模型的基本工作是什么">大语言模型的基本工作是什么？</h2>
<p>大语言模型的基础任务是：根据已有文本，预测接下来最可能出现的语言单位。</p>
<p>可以简化为：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">P(下一个 token | 当前输入、上下文、模型参数)
</span></span></code></pre></div><p>模型在训练中接触大量文本，通过调整参数，学习词语、句法、语义、文体、事实陈述和推理形式之间的统计关系。它得到的不是一本逐条查询的词典，也不是一组人工写好的全部规则，而是一套分布式的参数结构。</p>
<p>生成答案时，系统反复执行：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">读取当前上下文
</span></span><span class="line"><span class="cl">→ 计算候选 token 的概率
</span></span><span class="line"><span class="cl">→ 选择一个 token
</span></span><span class="line"><span class="cl">→ 把它加入上下文
</span></span><span class="line"><span class="cl">→ 继续预测
</span></span></code></pre></div><p>这个描述很重要，但不完整。因为“预测下一个 token”并不意味着模型只能机械续写。要准确预测技术解释、数学证明、程序代码或行动计划，模型必须形成能够支持这些输出的内部结构和中间计算。</p>
<p>问题在于：这些结构究竟多大程度上对应稳定的概念、世界模型和推理过程，仍然是正在研究的问题。</p>
<h2 id="为什么预测语言可以产生推理能力">为什么预测语言可以产生推理能力？</h2>
<p>语言记录了人类对世界的描述，也记录了大量推理、解释、计划和纠错过程。模型学习语言规律时，也会学习这些结构之间的关系。</p>
<p>例如，一个有效的回答需要处理：</p>
<ul>
<li>哪些信息与当前问题相关；</li>
<li>哪些概念应当区分；</li>
<li>前提能否支持结论；</li>
<li>哪个步骤必须先完成；</li>
<li>哪种工具适合取得缺失信息；</li>
<li>新证据是否推翻原来的判断。</li>
</ul>
<p>这使大模型能够表现出归纳、演绎、类比、因果解释、程序模拟和任务分解等能力。</p>
<p>但能力并不稳定。模型可能在熟悉形式上表现良好，在轻微改写、长链推理、分布外问题或需要精确状态跟踪时失败。语言上流畅的结论也可能没有足够证据。</p>
<p>所以，不能把“能生成推理文本”直接等同于“始终执行了可靠推理”。</p>
<h2 id="模型输出前发生了什么">模型输出前发生了什么？</h2>
<p>输入文本首先被切分为 token，并转换成向量表示。Transformer 通过注意力机制计算上下文中不同位置之间的关系，经过多层变换形成新的内部状态，最后输出候选 token 的概率分布。</p>
<p>可以概括为：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">提示词与上下文
</span></span><span class="line"><span class="cl">→ token 与位置表示
</span></span><span class="line"><span class="cl">→ 多层注意力和非线性变换
</span></span><span class="line"><span class="cl">→ 当前上下文的内部状态
</span></span><span class="line"><span class="cl">→ 候选输出分布
</span></span><span class="line"><span class="cl">→ 生成结果
</span></span></code></pre></div><p>这里的内部状态不是可以直接翻译成人类句子的“内心独白”。研究者可以分析激活、注意力和中间表示，但不能简单地把某个神经元或向量当作一个完整、透明的思想。</p>
<p>模型有时会输出“思考过程”或逐步解释。它们可以帮助系统分解问题，也能让人检查答案，但这些文字不必然忠实记录了导致答案的全部内部计算。研究表明，链式思维解释可能遗漏真实影响因素，甚至为已经形成的答案补写看似合理的理由。<a href="https://arxiv.org/abs/2305.04388">Turpin 等：Language Models Don&rsquo;t Always Say What They Think</a></p>
<p>因此：</p>
<blockquote>
<p><strong>可读的推理过程是工作界面和证据之一，不是模型内部过程的完整扫描。</strong></p>
</blockquote>
<h2 id="基础模型为什么会服从指令">基础模型为什么会服从指令？</h2>
<p>单纯进行下一词预测的基础模型，主要学习“什么文本可能接在后面”。但助手还需要判断“用户要求我完成什么”。</p>
<p>常见的训练过程包括：</p>
<ul>
<li>在大量文本上进行预训练；</li>
<li>使用示范数据进行指令微调；</li>
<li>根据人类或模型反馈进一步调整行为；</li>
<li>通过系统规则和工具协议约束运行时行为。</li>
</ul>
<p>GPT-3 展示了大模型通过上下文示例完成多种任务的能力；InstructGPT 则说明，仅仅扩大模型并不会自动使其更符合用户意图，指令微调和人类反馈能显著改变模型的行为方向。<a href="https://arxiv.org/abs/2005.14165">GPT-3</a> · <a href="https://arxiv.org/abs/2203.02155">InstructGPT</a></p>
<p>这意味着，AI 助手的回答不是只由用户最后一句话决定。它同时受模型参数、系统规则、对话历史、可见环境、工具返回值和解码策略影响。</p>
<h2 id="推理决定和行动不是一回事">推理、决定和行动不是一回事</h2>
<p>在一个 AI 系统中，可以区分四个环节：</p>
<table>
  <thead>
      <tr>
          <th>环节</th>
          <th>核心问题</th>
          <th>典型产物</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>解释</td>
          <td>当前任务是什么？</td>
          <td>任务表述、约束、候选意图</td>
      </tr>
      <tr>
          <td>推理</td>
          <td>已知信息支持什么？</td>
          <td>判断、解释、中间结论</td>
      </tr>
      <tr>
          <td>决策</td>
          <td>应选择哪个方案？</td>
          <td>计划、优先级、下一步</td>
      </tr>
      <tr>
          <td>行动</td>
          <td>怎样改变外部状态？</td>
          <td>工具调用、文件修改、消息、交易</td>
      </tr>
  </tbody>
</table>
<p>语言模型可以生成一个行动建议，却没有实际执行它；也可能调用了工具，却没有充分推理。把这四层分开，才能定位错误发生在哪里。</p>
<p>“删除文件”是行动。“这个文件可能是重复的”是判断。“删除它最节省空间”是决策理由。“用户允许删除”则是权限事实。它们不能相互替代。</p>
<h2 id="ai-怎样从模型变成-agent">AI 怎样从模型变成 Agent？</h2>
<p>大语言模型本身主要接收上下文并产生输出。要成为可以持续完成任务的 Agent，通常还需要外部系统提供：</p>
<ul>
<li><strong>目标与任务状态</strong>：现在要完成什么，进展到哪里；</li>
<li><strong>规划机制</strong>：把较大的目标拆成可执行步骤；</li>
<li><strong>工具</strong>：搜索、读取文件、执行代码、调用服务；</li>
<li><strong>记忆</strong>：保存当前任务状态、既往结果和长期约定；</li>
<li><strong>环境观察</strong>：读取工具结果和外部状态；</li>
<li><strong>权限边界</strong>：哪些操作允许执行，哪些需要确认；</li>
<li><strong>反馈与终止条件</strong>：怎样判断成功、失败或需要修正。</li>
</ul>
<p>典型回路是：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">观察环境
</span></span><span class="line"><span class="cl">→ 解释当前状态
</span></span><span class="line"><span class="cl">→ 选择下一步
</span></span><span class="line"><span class="cl">→ 调用工具
</span></span><span class="line"><span class="cl">→ 读取结果
</span></span><span class="line"><span class="cl">→ 更新计划
</span></span><span class="line"><span class="cl">→ 继续或停止
</span></span></code></pre></div><p>ReAct 把推理轨迹与行动交错起来：模型根据当前信息提出下一步，通过工具取得观察结果，再据此继续处理任务。<a href="https://arxiv.org/abs/2210.03629">ReAct</a></p>
<p>这里真正行动的不是一段孤立文本，而是“模型 + 工具 + 状态 + 权限 + 执行环境”组成的系统。</p>
<h2 id="ai-有自己的目标和意图吗">AI 有自己的目标和意图吗？</h2>
<p>工程系统可以具有目标变量、奖励函数、任务说明和停止条件。但这些“目标”不必等同于人的欲望、承诺或行动意图。</p>
<p>可以区分：</p>
<table>
  <thead>
      <tr>
          <th>层次</th>
          <th>含义</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>训练目标</td>
          <td>训练时被优化的数学指标</td>
      </tr>
      <tr>
          <td>系统目标</td>
          <td>产品或代理被设计来完成的任务</td>
      </tr>
      <tr>
          <td>当前任务</td>
          <td>本轮上下文中要求完成的工作</td>
      </tr>
      <tr>
          <td>生成计划</td>
          <td>模型提出的步骤和子目标</td>
      </tr>
      <tr>
          <td>人的意图</td>
          <td>人希望通过行动实现的目的与承诺</td>
      </tr>
  </tbody>
</table>
<p>模型生成“我打算先检查文件”时，这句话通常描述系统接下来的操作计划，不能单凭第一人称表达证明它具有人的主观意向。</p>
<p>这一区分也解释了为什么一个 Agent 可以表现出持续目标导向，却仍需要外部权限、监控和责任主体。</p>
<h2 id="行动为什么必须依赖反馈">行动为什么必须依赖反馈？</h2>
<p>一次生成无法保证计划与现实一致。工具可能报错，网页可能改变，文件可能不存在，早先假设也可能被新证据推翻。</p>
<p>可靠的行动系统需要闭环：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">提出假设
</span></span><span class="line"><span class="cl">→ 执行动作
</span></span><span class="line"><span class="cl">→ 观察结果
</span></span><span class="line"><span class="cl">→ 比较预期与实际
</span></span><span class="line"><span class="cl">→ 修正解释或计划
</span></span><span class="line"><span class="cl">→ 再次行动
</span></span></code></pre></div><p>没有反馈，AI 只能把行动当成语言中的想象；有了反馈，它才能发现自己是否真的改变了外部状态。</p>
<p>这也要求系统区分不同证据：</p>
<ul>
<li>“命令已生成”不等于“命令已成功执行”；</li>
<li>“代码通过构建”不等于“用户界面符合预期”；</li>
<li>“已经推送仓库”不等于“线上版本已经部署”；</li>
<li>“用户没有反对”不等于“用户授权了高后果行动”。</li>
</ul>
<h2 id="ai-推理与行动的主要局限">AI 推理与行动的主要局限</h2>
<h3 id="语言流畅会掩盖证据不足">语言流畅会掩盖证据不足</h3>
<p>模型可以用完整句子表达错误判断。表达质量与事实可靠性不是同一指标。</p>
<h3 id="上下文有限且具有选择性">上下文有限且具有选择性</h3>
<p>系统只处理当前可见的信息。遗漏的文件、隐藏的环境状态和未表达的用户目的，都可能改变正确行动。</p>
<h3 id="长任务会产生状态漂移">长任务会产生状态漂移</h3>
<p>任务越长，越需要外部记录、检查点和明确的完成条件。否则模型容易重复、遗漏或把计划误认为结果。</p>
<h3 id="工具结果也需要解释">工具结果也需要解释</h3>
<p>工具返回的内容可能不完整、过期、错误或恶意。调用工具并不会自动消除不确定性。</p>
<h3 id="目标可能冲突">目标可能冲突</h3>
<p>用户要求、系统规则、现实约束和不同子目标之间可能不一致。AI 需要识别冲突，而不是把任何一句指令都当作最高目标。</p>
<h3 id="行动后果由整个系统承担">行动后果由整个系统承担</h3>
<p>模型选择工具调用，执行器改变现实，平台决定权限，人承担或分配责任。不能只评价模型文本而忽略整个行动链。</p>
<h2 id="怎样判断一个-ai-系统是否真的完成了任务">怎样判断一个 AI 系统是否真的完成了任务？</h2>
<p>不能只看它是否给出自信的回答。更可靠的判断需要逐层核验：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">是否理解了正确对象？
</span></span><span class="line"><span class="cl">→ 是否引用了足够证据？
</span></span><span class="line"><span class="cl">→ 推理是否支持结论？
</span></span><span class="line"><span class="cl">→ 是否拥有行动权限？
</span></span><span class="line"><span class="cl">→ 工具是否实际执行？
</span></span><span class="line"><span class="cl">→ 外部状态是否按预期改变？
</span></span><span class="line"><span class="cl">→ 结果是否满足原始目标？
</span></span></code></pre></div><p>复杂任务还需要保留可回退的中间状态，让错误能够被发现和修正。</p>
<h2 id="结论">结论</h2>
<p>AI 的“思考”可以在功能上理解为：系统对输入和上下文进行表示、转换、预测与选择，从而产生判断、计划和输出。它与人的思维存在可比较的功能，却不能因此被断定为具有同样的意识和体验。</p>
<p>AI 的“行动”也不是模型单独完成的。它来自一个更大的系统：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">模型
</span></span><span class="line"><span class="cl">+ 上下文
</span></span><span class="line"><span class="cl">+ 工具
</span></span><span class="line"><span class="cl">+ 状态
</span></span><span class="line"><span class="cl">+ 权限
</span></span><span class="line"><span class="cl">+ 环境反馈
</span></span></code></pre></div><p>所以，理解 AI 不能只问“模型想了什么”，还要问：</p>
<ul>
<li>它依据了什么证据；</li>
<li>它怎样形成和检查计划；</li>
<li>谁赋予它行动权限；</li>
<li>工具实际改变了什么；</li>
<li>结果如何被验证；</li>
<li>错误怎样进入下一轮修正。</li>
</ul>
<blockquote>
<p><strong>AI 推理是生成行动方案的计算过程；AI 行动是受权限约束、接受现实反馈并能够修正的系统过程。</strong></p>
</blockquote>
<h2 id="参考资料">参考资料</h2>
<ul>
<li><a href="https://arxiv.org/abs/2005.14165">Brown 等：Language Models are Few-Shot Learners</a></li>
<li><a href="https://arxiv.org/abs/2203.02155">Ouyang 等：Training Language Models to Follow Instructions with Human Feedback</a></li>
<li><a href="https://arxiv.org/abs/2210.03629">Yao 等：ReAct: Synergizing Reasoning and Acting in Language Models</a></li>
<li><a href="https://arxiv.org/abs/2305.04388">Turpin 等：Language Models Don&rsquo;t Always Say What They Think</a></li>
</ul>
]]></content:encoded></item><item><title>人类与 AI 的共同行动回路：解释、协作与反馈</title><link>https://moonment.net/notes/human-ai-joint-action-loop/</link><pubDate>Fri, 18 Sep 2026 15:20:00 +0800</pubDate><dc:creator>Moon</dc:creator><guid>https://moonment.net/notes/human-ai-joint-action-loop/</guid><description>人通过语言表达不完整的意图，AI 据此形成可修正的任务解释，再以工具行动和现实反馈共同校正目标、计划与结果。</description><content:encoded><![CDATA[<blockquote>
<p><strong>专题：思维、意图与行动（4/4）</strong> 从第一篇开始阅读：<a href="/notes/human-thinking/">思维是什么？人如何形成理解、判断与行动</a></p>
</blockquote>
<h2 id="人与-ai-之间真正要连接什么">人与 AI 之间真正要连接什么？</h2>
<p>人类与 AI 的协作常被描述成：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">人给出提示词
</span></span><span class="line"><span class="cl">→ AI 给出答案
</span></span></code></pre></div><p>这个结构只描述了一次语言交换。它没有解释人为什么提出请求、AI 怎样理解请求、谁决定可以采取什么行动，也没有说明现实结果怎样反过来修正双方的判断。</p>
<p>更完整的结构是：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">人的处境、需要与目的
</span></span><span class="line"><span class="cl">→ 人形成暂时意图
</span></span><span class="line"><span class="cl">→ 用语言表达请求
</span></span><span class="line"><span class="cl">→ AI 构造任务解释
</span></span><span class="line"><span class="cl">→ 双方校准目标、对象与边界
</span></span><span class="line"><span class="cl">→ AI 形成计划并在授权内行动
</span></span><span class="line"><span class="cl">→ 观察现实结果
</span></span><span class="line"><span class="cl">→ 人评价结果，AI 更新解释
</span></span><span class="line"><span class="cl">→ 进入下一轮
</span></span></code></pre></div><blockquote>
<p><strong>人机协作不是一次准确翻译，而是双方围绕共同任务持续校准、行动和纠错的过程。</strong></p>
</blockquote>
<h2 id="人的意图为什么不能完整进入提示词">人的意图为什么不能完整进入提示词？</h2>
<p>人在行动以前，并不总有一个完整、固定、清晰的目标等待表达。很多意图是在表达、比较和尝试中逐渐形成的。</p>
<p>一个请求至少可能包含四层：</p>
<table>
  <thead>
      <tr>
          <th>层次</th>
          <th>问题</th>
          <th>示例</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>表达内容</td>
          <td>人说了什么？</td>
          <td>“帮我把这篇文章处理一下。”</td>
      </tr>
      <tr>
          <td>操作意图</td>
          <td>希望 AI 做什么？</td>
          <td>摘要、审校、重写或发布？</td>
      </tr>
      <tr>
          <td>任务目的</td>
          <td>为什么做？</td>
          <td>对外发表、内部讨论或个人理解？</td>
      </tr>
      <tr>
          <td>价值边界</td>
          <td>什么结果可以接受？</td>
          <td>保留原意、不能泄露、需要事实依据</td>
      </tr>
  </tbody>
</table>
<p>提示词通常只显式表达其中一部分。其余信息可能存在于前文、当前文件、既往约定、组织规则和用户自己尚未说清楚的判断中。</p>
<p>所以，“把提示词写得足够长”不能从根本上消除意图问题。表达长度会增加信息，也可能增加冲突、噪声和虚假的精确感。</p>
<h2 id="ai-理解的不是完整的人而是当前任务">AI 理解的不是完整的人，而是当前任务</h2>
<p>AI 能接触的只是证据：</p>
<ul>
<li>当前语言；</li>
<li>对话历史；</li>
<li>可见文件和页面；</li>
<li>工具返回结果；</li>
<li>已保存的偏好与规则；</li>
<li>用户对中间结果的确认和修正。</li>
</ul>
<p>据此，AI 构造的是一个工作性的任务模型：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">当前对象是什么？
</span></span><span class="line"><span class="cl">期望产生什么变化？
</span></span><span class="line"><span class="cl">有哪些约束？
</span></span><span class="line"><span class="cl">哪些事实仍然未知？
</span></span><span class="line"><span class="cl">哪些行动已经获得授权？
</span></span><span class="line"><span class="cl">怎样判断完成？
</span></span></code></pre></div><p>这个模型可以很准确，却仍然不是用户全部心理状态。把任务理解限制在当前可观察证据上，反而有助于防止 AI 把猜测写成事实。</p>
<h2 id="三种理解需要分开">三种“理解”需要分开</h2>
<h3 id="语义理解">语义理解</h3>
<p>AI 能否识别词语、句子和上下文的含义？例如，“使用第一种”中的“第一种”指向前面哪一个选项。</p>
<h3 id="操作理解">操作理解</h3>
<p>AI 能否把语言转化成具体任务？例如，它是否知道要修改哪篇文章、生成哪些语言版本、使用什么格式。</p>
<h3 id="结果理解">结果理解</h3>
<p>AI 是否知道什么结果才算满足人的目的？例如，文件已经生成，是否还需要提交仓库、部署网站，并验证线上地址。</p>
<p>三者并不自动同时成立。</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">听懂一句话
</span></span><span class="line"><span class="cl">≠
</span></span><span class="line"><span class="cl">知道该做什么
</span></span><span class="line"><span class="cl">≠
</span></span><span class="line"><span class="cl">知道怎样才算做完
</span></span></code></pre></div><p>很多人机协作失败并不是模型完全没有理解语言，而是操作对象、完成条件或结果标准没有对齐。</p>
<h2 id="共同任务模型怎样形成">共同任务模型怎样形成？</h2>
<p>双方需要逐步建立一个共享但可修正的任务模型。它通常包含六个部分：</p>
<table>
  <thead>
      <tr>
          <th>要素</th>
          <th>需要明确的问题</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>对象</td>
          <td>正在处理哪个文件、页面、账户、产品或问题？</td>
      </tr>
      <tr>
          <td>目标</td>
          <td>希望对象发生什么变化？</td>
      </tr>
      <tr>
          <td>约束</td>
          <td>哪些格式、事实、风格、隐私和规则不能破坏？</td>
      </tr>
      <tr>
          <td>证据</td>
          <td>哪些是事实，哪些是推断，哪些仍未知？</td>
      </tr>
      <tr>
          <td>权限</td>
          <td>AI 可以直接执行到哪一步？</td>
      </tr>
      <tr>
          <td>完成条件</td>
          <td>用什么可观察结果判断任务已经完成？</td>
      </tr>
  </tbody>
</table>
<p>这不是要求人把所有内容一次性写进提示词。AI 可以先利用已有上下文完成低风险、可逆的工作，再在真正影响行动边界的地方取得必要信息。</p>
<p>良好的协作会保留已经确认的决定，避免每一轮都从头询问；也会在新证据出现时允许旧解释被推翻。</p>
<h2 id="澄清假设与行动怎样选择">澄清、假设与行动怎样选择？</h2>
<p>AI 面对歧义时，不应只有“猜”或“追问”两个选项。更合理的策略取决于三个变量：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">歧义程度 × 出错代价 × 可逆性
</span></span></code></pre></div><h3 id="低代价且可逆">低代价且可逆</h3>
<p>可以说明合理假设后先做。例如先生成一个文章草稿，用户可以直接修改。</p>
<h3 id="中等歧义">中等歧义</h3>
<p>可以保留多个候选、先完成共同部分，或者给出可比较的方案。</p>
<h3 id="高代价或不可逆">高代价或不可逆</h3>
<p>需要确认关键对象、权限或范围。例如公开发布、向他人发送消息、支付、删除不可恢复数据。</p>
<p>关键不是让 AI 永远等待，而是让确认发生在真正决定后果的边界上。</p>
<h2 id="提示词是证据不是完整契约">提示词是证据，不是完整契约</h2>
<p>提示词对当前任务具有直接约束力，但它仍需要与上下文、权限和现实条件一起解释。</p>
<p>同一句话在不同位置具有不同作用：</p>
<ul>
<li>“这个能发布吗？”是在询问可行性；</li>
<li>“准备成可发布版本”是在授权编辑；</li>
<li>“发布到网站”是在授权外部行动；</li>
<li>“我以后可能发布”只是陈述计划。</li>
</ul>
<p>AI 需要识别请求、讨论、假设、背景和授权之间的差别。</p>
<p>对话也会形成承诺。用户已经选择方案、批准发布或规定格式以后，系统应当把这些决定带入后续步骤。共同理解并不只存在于最后一句提示词里，而存在于整个交互历史中。</p>
<h2 id="行动怎样成为理解的检验">行动怎样成为理解的检验？</h2>
<p>单靠复述不能证明双方已经对齐。行动会把隐藏差异暴露出来。</p>
<p>例如，人说“把文章更新到网站”。AI 可能完成了本地 Markdown，却没有提交；完成提交，却没有部署；线上页面出现了，却缺少英文版本或 sitemap。</p>
<p>因此需要逐层验证：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">任务解释正确
</span></span><span class="line"><span class="cl">→ 产物内容正确
</span></span><span class="line"><span class="cl">→ 行动实际执行
</span></span><span class="line"><span class="cl">→ 外部状态改变
</span></span><span class="line"><span class="cl">→ 用户目标得到满足
</span></span></code></pre></div><p>每一层都提供新的证据。失败不是单纯的终点，也会告诉双方此前的任务模型哪里不完整。</p>
<h2 id="一个完整的人机行动回路">一个完整的人机行动回路</h2>
<p>可以把共同回路分成八步。</p>
<h3 id="1-人感知问题">1. 人感知问题</h3>
<p>人从需要、阻碍、机会或不满意的结果中发现需要改变的状态。</p>
<h3 id="2-人形成初步意图">2. 人形成初步意图</h3>
<p>人确定一个大致方向，但目标、手段和判断标准可能仍然模糊。</p>
<h3 id="3-人表达请求">3. 人表达请求</h3>
<p>语言把部分意图外化为提示词，并带入背景、材料和限制。</p>
<h3 id="4-ai-构造候选解释">4. AI 构造候选解释</h3>
<p>AI 识别对象、动作、约束和缺失信息，并比较可能的任务解释。</p>
<h3 id="5-双方校准">5. 双方校准</h3>
<p>AI 利用历史决定、复述、草稿、选项或必要追问，使任务达到足以行动的清晰度。</p>
<h3 id="6-ai-在授权内行动">6. AI 在授权内行动</h3>
<p>AI 规划步骤、调用工具、保存中间状态，并对高后果边界检查权限。</p>
<h3 id="7-系统观察结果">7. 系统观察结果</h3>
<p>读取文件变化、命令结果、线上页面、用户反馈或其他外部证据。</p>
<h3 id="8-双方修正">8. 双方修正</h3>
<p>用户可以改目标、指出偏差或接受结果；AI 据此更新任务模型，继续行动或结束。</p>
<p>这构成：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">意图
</span></span><span class="line"><span class="cl">→ 表达
</span></span><span class="line"><span class="cl">→ 解释
</span></span><span class="line"><span class="cl">→ 校准
</span></span><span class="line"><span class="cl">→ 行动
</span></span><span class="line"><span class="cl">→ 观察
</span></span><span class="line"><span class="cl">→ 评价
</span></span><span class="line"><span class="cl">→ 修正后的意图
</span></span></code></pre></div><h2 id="谁负责什么">谁负责什么？</h2>
<p>共同回路不意味着人的责任和 AI 的责任完全相同。</p>
<h3 id="人主要提供">人主要提供</h3>
<ul>
<li>需要改变的现实处境；</li>
<li>价值判断和最终目的；</li>
<li>私人背景与未公开限制；</li>
<li>对高后果行动的授权；</li>
<li>对结果是否值得接受的最终判断。</li>
</ul>
<h3 id="ai-主要提供">AI 主要提供</h3>
<ul>
<li>对当前证据的结构化解释；</li>
<li>候选方案、推理与风险差异；</li>
<li>可执行的步骤和工具使用；</li>
<li>对不确定性、权限和完成状态的显式记录；</li>
<li>根据新证据快速修正计划。</li>
</ul>
<h3 id="系统与组织必须提供">系统与组织必须提供</h3>
<ul>
<li>身份和权限控制；</li>
<li>数据与隐私边界；</li>
<li>日志、版本和可回退机制；</li>
<li>失败处理和责任分配；</li>
<li>对外部行动的可验证状态。</li>
</ul>
<p>AI 不能替人决定所有价值；人也不能把一切错误归因于一个孤立模型。结果来自整个社会技术系统。</p>
<h2 id="常见的断裂位置">常见的断裂位置</h2>
<h3 id="人把感觉直接当成明确目标">人把感觉直接当成明确目标</h3>
<p>用户知道“不对”，却还不知道要变成什么。此时 AI 应帮助比较结果，而不是假装存在唯一正确答案。</p>
<h3 id="ai-把最可能解释当成真实意图">AI 把最可能解释当成真实意图</h3>
<p>概率最高只说明现有证据更支持某种解释，不证明它就是用户内心的完整目的。</p>
<h3 id="双方只确认内容不确认行动">双方只确认内容，不确认行动</h3>
<p>一篇文章得到认可，不自动等于获得公开发布的权限。</p>
<h3 id="ai-把计划当成完成">AI 把计划当成完成</h3>
<p>“将会更新网站”不是更新证据。本地文件、提交、部署和线上验证是不同状态。</p>
<h3 id="人只评价输出不评价过程">人只评价输出，不评价过程</h3>
<p>一个偶然正确的答案可能来自不可靠方法；一个暂时失败的尝试也可能暴露关键未知。长期协作需要同时评价结果、证据和纠错能力。</p>
<h3 id="反馈没有进入下一轮">反馈没有进入下一轮</h3>
<p>如果用户的修正没有被保存或使用，同一种偏差会重复发生，协作就无法形成真正的闭环。</p>
<h2 id="怎样提高共同回路的质量">怎样提高共同回路的质量？</h2>
<p>对人而言：</p>
<ul>
<li>先说希望改变什么，而不只是给出一个动作词；</li>
<li>区分探索、草拟、修改、批准和发布；</li>
<li>在关键地方说明不能接受的结果；</li>
<li>用具体反馈指出哪一层理解错了；</li>
<li>允许意图在获得新信息后改变。</li>
</ul>
<p>对 AI 而言：</p>
<ul>
<li>把明确要求、推断和未知分开；</li>
<li>利用已确认的上下文，不重复索取信息；</li>
<li>在低风险任务上用可逆产物推进；</li>
<li>在高后果边界核对对象和权限；</li>
<li>报告实际结果，不把计划写成完成；</li>
<li>让反馈更新任务模型和后续行为。</li>
</ul>
<h2 id="结论">结论</h2>
<p>人类先在现实处境中形成需要、目标和意图，再通过语言把其中一部分交给 AI。AI 根据可见证据构造任务模型，通过推理与工具采取行动。现实结果和人的评价随后反过来修正这个模型，也可能修正人原来的意图。</p>
<p>所以，人机之间需要建立的不是一次性的“正确提示词”，而是一个能够持续校准的共同回路：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">人提供目的、价值与授权
</span></span><span class="line"><span class="cl">+
</span></span><span class="line"><span class="cl">AI 提供解释、方案与执行
</span></span><span class="line"><span class="cl">+
</span></span><span class="line"><span class="cl">环境提供结果与证据
</span></span><span class="line"><span class="cl">+
</span></span><span class="line"><span class="cl">反馈推动双方修正
</span></span></code></pre></div><blockquote>
<p><strong>真正可靠的人机协作，不要求 AI 读懂一个不可见的“真实内心”；它要求双方把当前任务、行动边界和完成证据逐步变得清楚。</strong></p>
</blockquote>
<h2 id="延伸阅读">延伸阅读</h2>
<ul>
<li><a href="/notes/ai-user-intent-inference/">AI 能断定用户的真实意图吗？</a></li>
<li><a href="/notes/ai-reasoning-and-action/">AI 如何推理并行动？</a></li>
<li><a href="/notes/human-thinking/">思维是什么？人如何形成理解、判断与行动</a></li>
<li><a href="https://aclanthology.org/2024.emnlp-main.119/">EMNLP 2024：让语言模型显式处理歧义</a></li>
</ul>
]]></content:encoded></item><item><title>AI 用户意图推断：不确定性、确认与授权边界</title><link>https://moonment.net/notes/ai-user-intent-inference/</link><pubDate>Wed, 09 Sep 2026 01:30:24 +0800</pubDate><dc:creator>Moon</dc:creator><guid>https://moonment.net/notes/ai-user-intent-inference/</guid><description>大模型如何根据提示词、上下文和环境推断操作意图，以及为什么概率最高仍不等于读出了用户内心。</description><content:encoded><![CDATA[<blockquote>
<p><strong>专题：思维、意图与行动（3/4）</strong> 上一篇：<a href="/notes/ai-reasoning-and-action/">AI 如何推理并行动？</a>；下一篇：<a href="/notes/human-ai-joint-action-loop/">人类与 AI 如何形成共同的行动回路？</a></p>
</blockquote>
<p>大模型不是“读出”用户的真实意图，而是根据当前可见证据，生成一个最可能的任务解释。</p>
<p>更准确地说：</p>
<blockquote>
<p><strong>模型推断的是“这句话在当前上下文中最可能要求我做什么”，不是“用户内心真正想要什么”。</strong></p>
</blockquote>
<p>这里需要先拆开三层：</p>
<table>
  <thead>
      <tr>
          <th>层次</th>
          <th>问题</th>
          <th>例子</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>字面请求</td>
          <td>用户说了什么？</td>
          <td>“帮我看看这个方案。”</td>
      </tr>
      <tr>
          <td>操作意图</td>
          <td>用户希望模型做什么？</td>
          <td>摘要、找问题、修改，还是评价可行性？</td>
      </tr>
      <tr>
          <td>深层目的</td>
          <td>用户为什么需要它？</td>
          <td>准备汇报、说服客户、判断是否投资？</td>
      </tr>
  </tbody>
</table>
<p>模型通常较容易识别第一层；结合上下文，可以较可靠地推断第二层；第三层往往只能猜测。</p>
<h2 id="模型是怎么猜的">模型是怎么“猜”的？</h2>
<p>假设用户只说：</p>
<blockquote>
<p>帮我看看这个方案。</p>
</blockquote>
<p>模型首先把文本转换成内部的语义表示。这里的“语义表示”并不是一本机器词典，而是词语、句子和上下文之间形成的高维关系。</p>
<p>它会利用几类线索：</p>
<ol>
<li><strong>词语本身</strong></li>
</ol>
<p>“看看”通常表示审阅，但可能指摘要、评价、找问题或者修改。</p>
<ol start="2">
<li><strong>句法和语义角色</strong></li>
</ol>
<p>谁要做什么、对象是什么、有没有约束条件。例如：</p>
<blockquote>
<p>帮我检查这个方案有没有逻辑漏洞。</p>
</blockquote>
<p>这句话明确给出了动作“检查”、对象“方案”和判断目标“逻辑漏洞”。</p>
<ol start="3">
<li><strong>对话上下文</strong></li>
</ol>
<p>如果前面一直在讨论投资决策，“看看方案”更可能是评估可行性；如果前面在改文案，则更可能是审校表达。</p>
<ol start="4">
<li><strong>训练中学到的语言惯例</strong></li>
</ol>
<p>模型见过大量类似表达与回答之间的统计关系。例如，人们发来代码和报错，虽然没有明确说“请修复”，通常是在请求诊断或修改。</p>
<ol start="5">
<li><strong>产品环境提供的状态</strong></li>
</ol>
<p>包括当前文件、页面、工具能力、用户历史偏好等。这些信息能缩小解释范围，但也可能把模型带向错误的先入判断。</p>
<ol start="6">
<li><strong>行为规则</strong></li>
</ol>
<p>模型还会受到系统和开发者规则影响。例如，遇到明显歧义时，是提出澄清问题，还是说明假设后继续完成最可能的任务。</p>
<p>在传统对话系统里，这个过程可能被写成：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">输入文本
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">意图分类：查询订单 / 取消订单 / 修改地址
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">槽位提取：订单号、地址、时间
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">调用相应功能
</span></span></code></pre></div><p>现代大模型不一定存在一个独立的“意图模块”。它可能在一次生成过程中，同时完成语义理解、候选解释、任务规划和回答。不过，工程系统仍经常在大模型外增加意图分类器、路由器和权限检查。</p>
<h2 id="它真正计算的是什么">它真正计算的是什么？</h2>
<p>可以把它简化成一个概率问题：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">P(意图解释 | 提示词、上下文、环境、规则)
</span></span></code></pre></div><p>比如“苹果怎么样”可能对应：</p>
<ul>
<li>询问水果的营养；</li>
<li>询问苹果公司的经营状况；</li>
<li>询问苹果产品是否值得购买；</li>
<li>评价一个叫“苹果”的项目。</li>
</ul>
<p>上下文会改变这些候选解释的概率。模型选择概率较高的解释，然后生成相应回答。</p>
<p>但这里有一个很关键的区别：</p>
<blockquote>
<p><strong>概率最高，不等于事实为真。</strong></p>
</blockquote>
<p>模型的置信程度只能说明：“根据我掌握的线索，这个解释更符合既往语言模式。”它不能证明：“这就是用户内心真实存在的意图。”</p>
<h2 id="为什么不能断定真实意图">为什么不能断定真实意图？</h2>
<p>因为存在“证据不足”与“多种解释同时成立”的问题。</p>
<p>同一句话完全可能对应不同意图：</p>
<blockquote>
<p>帮我写一份辞职信。</p>
</blockquote>
<p>用户可能：</p>
<ul>
<li>已经决定辞职，准备正式提交；</li>
<li>只是想看看该怎么表达；</li>
<li>用它和当前公司谈判；</li>
<li>替小说人物写；</li>
<li>测试模型能力；</li>
<li>情绪激动，尚未作出决定。</li>
</ul>
<p>只看这句话，模型没有办法区分。</p>
<p>即使结合长期对话，模型也只能获得更多外部证据，仍然没有直接进入用户的心理状态。OpenAI 对模型行为的公开说明也明确承认：助手只能依赖当前交互中可观察的信息，通常并不知道用户的完整处境、真实意图和后续用途。<a href="https://openai.com/index/our-approach-to-the-model-spec/">OpenAI 关于 Model Spec 的说明</a></p>
<p>研究也发现，即使是先进大模型，对省略、不精确和多义表达仍会产生不同程度的歧义判断；如果系统强行把每个请求分入一个意图类别，就容易把任务路由错。<a href="https://aclanthology.org/2024.emnlp-main.119/">EMNLP 2024：让语言模型显式处理歧义</a></p>
<h2 id="用户亲口确认以后能不能断定">“用户亲口确认”以后，能不能断定？</h2>
<p>可以确认到一定程度，但仍要说明确认了什么。</p>
<p>例如模型问：</p>
<blockquote>
<p>你是希望我找出方案的问题，而不是直接重写，对吗？</p>
</blockquote>
<p>用户回答：</p>
<blockquote>
<p>对。</p>
</blockquote>
<p>这时候可以说：</p>
<blockquote>
<p>“审查问题”是本轮已经确认的操作意图。</p>
</blockquote>
<p>但不能进一步断定：</p>
<blockquote>
<p>用户内心最深处的真实目的就是审查问题。</p>
</blockquote>
<p>因为用户可能没有说出深层目的，也可能自己尚未完全意识到，甚至可能有意隐瞒。哲学层面的“真实意图”涉及人的自我认识、动机、欲望和行动承诺，不能由一次语言确认全部解决。</p>
<p>因此，AI系统更适合使用这样的状态标记：</p>
<table>
  <thead>
      <tr>
          <th>状态</th>
          <th>含义</th>
      </tr>
  </thead>
  <tbody>
      <tr>
          <td>明示意图</td>
          <td>用户直接说出的要求</td>
      </tr>
      <tr>
          <td>上下文推断</td>
          <td>根据前后文推断，尚未确认</td>
      </tr>
      <tr>
          <td>已确认意图</td>
          <td>模型复述后得到用户确认</td>
      </tr>
      <tr>
          <td>行为支持</td>
          <td>用户后续选择与该意图一致</td>
      </tr>
      <tr>
          <td>未知</td>
          <td>当前证据不能区分</td>
      </tr>
      <tr>
          <td>冲突</td>
          <td>用户的表达、选择或上下文互相矛盾</td>
      </tr>
  </tbody>
</table>
<p>这里不应该设置一个笼统的 <code>true_intent = true</code>。因为它会把“系统的解释”伪装成“用户的心理事实”。</p>
<h2 id="一个更可靠的意图推断过程">一个更可靠的意图推断过程</h2>
<p>好的AI系统可以按下面的顺序工作：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">用户表达
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">提取明确要求
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">生成多个可能解释
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">利用上下文排除不相关解释
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">评估歧义和出错代价
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">低风险：说明假设后继续
</span></span><span class="line"><span class="cl">高风险：请求用户确认
</span></span><span class="line"><span class="cl">  ↓
</span></span><span class="line"><span class="cl">根据用户反馈更新判断
</span></span></code></pre></div><p>例如：</p>
<blockquote>
<p>帮我把这些文件清理一下。</p>
</blockquote>
<p>模型可能推断“清理”包括整理目录、删除重复文件或修改内容。因为不同解释会造成明显不同的后果，模型不应直接把“清理”断定为“删除”。</p>
<p>更合理的处理是先读取和分类文件，形成具体方案，然后确认删除范围。</p>
<p>而对于：</p>
<blockquote>
<p>帮我把这段话写得简洁一点。</p>
</blockquote>
<p>即使“简洁”的标准存在轻微歧义，模型也可以先给出一个较短版本。这种错误成本低，结果也容易撤销，不需要追问用户内心对“简洁”的精确定义。</p>
<p>所以，要不要继续猜，关键不只在于模型有多自信，还取决于：</p>
<div class="highlight"><pre tabindex="0" class="chroma"><code class="language-text" data-lang="text"><span class="line"><span class="cl">行动风险 × 解释歧义 × 不可逆程度
</span></span></code></pre></div><p>模型置信度很高，但行动不可逆时，仍然应该确认。</p>
<h2 id="从概念层面得出的结论">从概念层面得出的结论</h2>
<p>“意图识别”这个名字容易制造一种错觉，好像用户心里已经存在一个固定标签，模型只需把它识别出来。</p>
<p>实际上，它更接近：</p>
<blockquote>
<p><strong>模型根据有限语言证据，为用户构造一个暂时可用的行动解释。</strong></p>
</blockquote>
<p>这个解释可以越来越准确：通过上下文、追问、用户修改、实际选择和结果反馈逐步更新。但它始终应当保留证据来源和不确定性。</p>
<p>因此：</p>
<ul>
<li>AI可以推断“最可能的操作意图”。</li>
<li>AI可以让用户确认某个意图表述。</li>
<li>AI可以观察后续行为是否支持这个解释。</li>
<li>AI不能仅凭提示词，断定用户不可观察的“真实意图”。</li>
<li>即使用户确认，也只能确认其当前表达和授权范围，不能证明全部心理动机。</li>
</ul>
<p>如果用一句概念定义来概括：</p>
<blockquote>
<p><strong>AI意图理解，是根据用户表达和上下文，对其期望行动作出的可修正解释；它是一种概率判断，不是对内心事实的直接读取。</strong></p>
</blockquote>
]]></content:encoded></item></channel></rss>