概率与贝叶斯:不确定性、证据与信念更新

从概率的数学骨架与哲学解释出发,理解贝叶斯公式、贝叶斯主义,以及新证据为何只能更新判断而不能直接产生真理。

理解“概率”和“贝叶斯”,首先要区分它们所处的层次:

  • 概率讨论:不确定性如何被表达和理解。
  • 贝叶斯公式讨论:获得新证据后,应当怎样调整原来的概率判断。
  • 贝叶斯主义则更进一步:把概率理解为一种可修正的相信程度,并把贝叶斯更新视为理性学习的方法。

因此,讨论从概率开始。

本文重点解释概率数值意味着什么、贝叶斯公式怎样连接条件概率,以及新证据如何改变判断。逻辑与概率专门比较证据支持与必然推导;逻辑则讨论推导本身的有效性。

一、概率到底是什么?

最朴素的回答是:

概率是对不确定性的量化。

但这句话还没有真正解决问题。因为“不确定性”可能来自两个完全不同的地方。

第一种不确定性来自世界。

例如抛一枚硬币,在它落地之前,我们不知道正面还是反面。这里可能存在物理过程本身的随机性。

第二种不确定性来自我们的知识。

例如一枚硬币已经落地,只是被杯子盖住。结果实际上已经确定,但我们不知道。这里的不确定性存在于我们的认识之中。

因此,当我们说:

A发生的概率是80%。

至少可能在说三件不同的事:

  1. A在同类重复事件中大约出现80%。
  2. 产生A的物理过程具有某种80%的倾向。
  3. 根据当前证据,我对“A会发生”的相信程度是80%。

这三种“概率”使用同一套数学,却未必描述同一种存在。

二、概率的数学定义

现代概率论通常从三个基本对象开始:

  • 样本空间 Ω:所有可能结果构成的集合。
  • 事件 A:我们关心的一组结果。
  • 概率函数 P:给事件分配0到1之间的数。

例如,掷一枚普通骰子:

Ω = {1, 2, 3, 4, 5, 6}

“掷出偶数”这个事件是:

A = {2, 4, 6}

如果假定六个结果等可能:

P(A) = 3/6 = 1/2

柯尔莫哥洛夫在1933年建立的公理化概率论,要求概率函数满足三个基本条件:

  1. P(A) ≥ 0:概率不能是负数。
  2. P(Ω) = 1:所有可能结果的总概率为1。
  3. 互不相容的事件可以相加。

例如,一次掷骰子不可能既得到1又得到2,所以:

P(得到1或2)
= P(得到1) + P(得到2)
= 1/6 + 1/6
= 1/3

这套公理告诉我们概率应该怎样运算,却没有告诉我们:

公式里的P在现实中究竟代表什么。

这是数学与哲学的分界。

数学研究概率之间必须满足什么关系;概率哲学研究这些数值到底意味着什么。斯坦福哲学百科:概率的解释

三、概率的几种哲学解释

1. 古典解释:等可能结果的比例

这是我们最熟悉的概率定义:

概率等于有利结果数除以所有等可能结果数。

例如骰子出现偶数的概率:

有利结果:{2, 4, 6}
所有结果:{1, 2, 3, 4, 5, 6}

概率 = 3/6 = 1/2

它特别适合扑克牌、骰子和抽签。

但它隐藏了一个问题:什么叫“等可能”?

如果我们用“等可能”定义概率,又用“概率相等”解释等可能,就会形成循环:

为什么六个面等可能?
因为每个面的概率相同。

为什么概率相同?
因为六个面等可能。

现实中的骰子还可能重量不均、边角磨损,甚至存在落在棱上的可能。因此,古典解释只适用于能够合理建立对称性的场景。

2. 频率解释:大量重复中的比例

频率主义把概率理解为:

某个结果在大量同类重复试验中的长期相对频率。

例如,在相同条件下生产100万件产品,其中约2万件存在缺陷,可以说缺陷概率约为2%。

这种解释的优势是可以通过观察检验。它不需要讨论个人相信什么。

但它遇到一个困难:如何解释只发生一次的事件?

例如:

某位候选人明天当选的概率是70%。

明天的这次选举只会发生一次。我们不能在完全相同的世界里重复举行十万次选举。

频率主义可以寻找“同类选举”,但怎样定义“同类”又成为问题。年份、候选人、经济环境、选民结构都不相同。

所以,单次事件概率很难单纯还原为长期频率。

3. 倾向解释:事物产生结果的物理倾向

倾向解释认为,概率是系统自身的一种物理属性。

例如,一枚结构均匀的硬币与特定抛掷装置共同形成一种物理倾向,使正反两面接近各有一半机会。

这种解释试图回答:

为什么长期频率会稳定下来?

因为产生结果的系统本身具有某种倾向。

但“倾向”很难被脱离频率而独立观察。如果我们问“怎么知道这枚硬币有50%的正面倾向”,最终仍然常常要靠重复实验。

4. 逻辑或证据解释:证据支持结论的程度

这种解释把概率理解为:

证据E在多大程度上支持假设H。

例如:

根据现有地质资料,未来十年发生某类地震的概率是多少?

这里的概率既不是一个人的随意信心,也不只是过去地震的简单频率,而是在问:现有证据给这个判断提供了多强的合理支持。

它比较接近科学推理中的“根据证据,这个解释有多可信”。

问题在于:是否存在唯一客观的证据支持度?

两个理性的人掌握相同资料,是否必须给出完全相同的概率?他们可能采用不同模型、变量和背景知识,因此仍得到不同结果。

5. 主观或贝叶斯解释:相信程度

主观概率把概率理解为:

一个主体在当前信息下,对某个命题的相信程度。

这里的“主观”不等于随便猜。

如果一个人的相信程度被称为概率,它至少应保持内部一致。例如,他不能同时认为:

P(A) = 0.8
P(非A) = 0.5

因为A与非A的概率之和应当为1。

主观贝叶斯主义认为,不同的人可以因为先验知识不同而拥有不同概率;但获得新证据后,他们应当按照一致的规则更新判断。

概率由此成为一种“部分相信”:

0   = 完全不相信
0.5 = 两边证据相当
1   = 完全相信

实际哲学中的观点比这个刻度复杂,尤其不鼓励轻易给经验命题分配绝对的0或1。

四、概率的哲学核心:它属于世界,还是属于认识?

可以把主要争论压缩成两个方向:

世界的不确定性
    ↓
物理机会、频率、倾向

以及:

认识的不确定性
    ↓
证据支持度、相信程度

前者通常称为本体意义上的概率:概率描述世界怎样运行。

后者通常称为认识意义上的概率:概率描述在证据有限时,我们有多大理由相信某件事。

例如,一枚硬币已经落地,但结果被遮住:

  • 从世界状态看,正反结果已经确定。
  • 从观察者知识看,可能仍然各有50%的可信度。

因此,“概率是多少”是不完整的问题。更完整的问题应当是:

对什么事件而言?根据哪些信息?采用什么模型?这个概率表示物理机会、长期频率,还是证据下的相信程度?

五、条件概率:概率不是脱离信息存在的数字

条件概率表示:

在已经知道B的条件下,A发生的概率。

写成:

P(A | B)

定义是:

P(A | B) = P(A ∩ B) / P(B)

条件非常关键。

例如:

  • P(一个人感冒):随机选一个人,他感冒的概率。
  • P(一个人感冒 | 他正在发烧):已知他发烧时,感冒的概率。
  • P(一个人发烧 | 他感冒):已知他感冒时,发烧的概率。

后面两项看起来相似,却是两个完全不同的问题。

这正是贝叶斯公式要处理的地方。


六、贝叶斯公式是什么?

贝叶斯公式写作:

P(H | E) = P(E | H) × P(H) / P(E)

其中:

  • H:假设,hypothesis。
  • E:证据,evidence。
  • P(H):先验概率。
  • P(E|H):似然。
  • P(E):证据概率。
  • P(H|E):后验概率。

它表达的是:

在看见证据E之后,我们应该怎样更新对假设H的判断。

可以把它读成:

更新后的判断
=
证据与假设的匹配程度
×
原来的判断
÷
证据本身出现的概率

七、贝叶斯公式是怎么来的?

它不是凭空发明出来的复杂公式,而是由条件概率直接推出来的。

根据条件概率:

P(H | E) = P(H ∩ E) / P(E)

同样:

P(E | H) = P(E ∩ H) / P(H)

所以:

P(E ∩ H) = P(E | H) × P(H)

将它代入第一个公式:

P(H | E) = P(E | H) × P(H) / P(E)

这就是贝叶斯公式。

因此,作为数学公式,它没有神秘性。它只是从两个方向观察同一个联合事件:

假设成立,并且证据出现

Penn State 概率论课程:Bayes’ Theorem

八、贝叶斯公式真正反转了什么?

我们经常容易知道:

如果H是真的,出现E的可能性有多大?

即:

P(E | H)

但我们真正想知道的通常是:

既然已经出现E,H为真的可能性有多大?

即:

P(H | E)

两者不能直接互换。

例如:

如果一个人患有某病,检测呈阳性的概率是90%。

这是:

P(阳性 | 患病) = 90%

它不等于:

P(患病 | 阳性) = 90%

因为没有考虑这种病原本有多罕见,也没有考虑健康人误报阳性的概率。

九、一个完整例子:阳性不等于患病概率90%

假设:

  • 人群患病率为1%。
  • 患病者检测阳性的概率为90%。
  • 未患病者误报阳性的概率为5%。

现在有一个人检测呈阳性。他真正患病的概率是多少?

假设有10,000人:

患病者:100人
其中检测阳性:90人

未患病者:9,900人
其中误报阳性:495人

所有阳性人数:

90 + 495 = 585

阳性者中真正患病的人数:

90 / 585 ≈ 15.4%

所以:

P(患病 | 阳性) ≈ 15.4%

尽管检测对患病者有90%的阳性率,看到阳性以后真正患病的概率仍只有约15.4%。

因为这种病本来很少见。大量健康人即使只有5%误报,绝对人数也会超过患病者。

这个例子揭示了贝叶斯推理的核心:

新证据的意义,取决于它与原有基准概率共同作用。

这也是为什么不能只看一条“很像”的证据。

十、先验、似然和后验分别是什么?

先验:看到新证据之前的判断

P(H)

先验不一定是主观猜测。它可以来自:

  • 历史数据;
  • 同类事件频率;
  • 已有理论;
  • 上一轮推断结果;
  • 专家判断;
  • 在证据不足时人为采用的初始分布。

例如,在客服系统中,过去60%的“帮我看看方案”最终被确认为评审请求,这可以成为先验参考。

但先验永远有适用范围。过去用户的分布不一定适合当前用户。

似然:假设成立时,证据有多容易出现

P(E | H)

假设用户确实希望“直接修改”,他说出“帮我直接改好”的概率可能较高。

似然回答的是:

这个假设能多好地解释目前看到的证据?

似然不是假设本身的概率。

后验:看到证据之后的新判断

P(H | E)

后验综合了:

  • 原来有多相信H;
  • H对新证据的解释力;
  • 其他假设是否也能产生相同证据。

这一轮的后验,还可以成为下一轮推断的先验:

先验
  ↓ 新证据1
后验1
  ↓ 新证据2
后验2
  ↓ 新证据3
后验3

所以贝叶斯思想描述的是一种持续学习过程,而不只是一次计算。

十一、贝叶斯公式与贝叶斯主义不是一回事

这是最需要区分的地方。

贝叶斯公式是一条数学定理。只要使用普通条件概率,它就成立。频率主义者也承认这条公式。

贝叶斯统计是一套统计方法。它为未知参数或假设设置先验,通过数据和似然得到后验。

贝叶斯认识论则是一种哲学立场:

人的相信可以有程度;理性的相信程度应符合概率公理;获得新证据后,应通过条件化更新自己的相信。

因此,从公式走向哲学,需要增加几个前提:

  1. 概率可以表示相信程度。
  2. 相信程度应当满足概率公理。
  3. 新证据应当以某种贝叶斯方式更新相信。
  4. 决策可以结合后验概率与结果价值进行。

这些都不是单凭贝叶斯公式证明出来的。

十二、贝叶斯主义在哲学上解决什么问题?

它主要处理一个古老问题:

人在不能确定真假的情况下,怎样进行理性判断?

传统逻辑通常处理确定性关系:

如果所有人都会死,
苏格拉底是人,
那么苏格拉底会死。

但现实中的多数推理不是确定性的:

这个症状可能由疾病A引起;
也可能由疾病B引起;
新的检测结果更支持A;
所以我应该提高对A的相信程度。

贝叶斯主义把“学习”理解为相信程度的变化:

原有认识 + 新证据 → 更新后的认识

它为归纳推理、科学确认、诊断和决策提供了统一语言。

十三、贝叶斯主义面临的哲学问题

1. 先验从哪里来?

两个人面对同一证据,可能因为先验不同而得到不同后验。

例如:

甲原来认为H的概率是1%
乙原来认为H的概率是50%

即使使用相同似然,新证据之后,他们仍可能得出不同结论。

客观贝叶斯主义希望通过对称性、最大熵或理性原则限制先验;主观贝叶斯主义允许先验因个人信息不同而不同,只要求内部一致并接受证据更新。

争论在于:允许多少主观差异,概率推理仍能被称为理性?

2. 候选假设可能不完整

这是AI意图推断中最关键的问题。

假设系统只有两个候选:

H₁:用户想让AI评审
H₂:用户想让AI改写

贝叶斯公式会把两者后验归一化,使总和等于1。

但用户真正的意思可能是:

H₃:用户只是想借方案展开讨论

如果H₃根本没有进入候选集合,那么无论计算多精确,系统都只是在两个错误选项之间分配概率。

因此:

后验概率只在模型建立的可能世界里成立。

模型之外的可能性不会自动被公式发现。

3. 先验为零的假设无法被挽救

如果:

P(H) = 0

那么无论新证据多强:

P(H | E) = 0

这意味着,一旦把某个假设视为绝对不可能,后续证据就无法使它复活。

因此,在经验问题中轻易赋予0或1非常危险。这相当于关闭了继续学习的可能。

4. 证据不是中性的

我们通常把证据E当作已经给定的事实,但现实中:

  • 证据可能测量错误;
  • 证据可能被选择性呈现;
  • 不同理论可能用不同方式描述同一现象;
  • 用户的回答可能受到提问方式影响。

例如AI问:

你是想让我直接修改,对吗?

这不是完全中性的澄清。它可能诱导用户接受模型提供的解释。

所以,多轮对话中的“新证据”有时也是系统和用户共同制造出来的。

5. 高后验概率仍不等于真

假设某个假设的后验概率达到95%,它仍然可能是假的。

贝叶斯公式表达的是:

在当前候选、先验、似然和证据之下,这个假设获得了多大支持。

它不是把“有充分理由相信”变成“客观上已经为真”。

这里必须区分:

认识上的合理性
≠
世界中的真实性

十四、贝叶斯怎样连接到AI意图推断?

假设系统考虑三个候选:

H₁:用户希望解释概念
H₂:用户希望把内容保存下来
H₃:用户希望写成公开文章

当用户说:

给我详细讲讲概率和贝叶斯。

这条新证据会提高H₁的权重。

当用户又说:

把这两段沉淀成固定知识。

这会提高H₂的权重。

如果用户说:

我要发在小报童上。

这会提高H₃的权重。

整个过程可以用贝叶斯方式理解:

原有候选解释
+
新的语言证据
→
更新候选解释的可信度

但这里要格外谨慎:

  • 大模型通常直接预测下一个token,并不等于内部存在一张明确的“用户意图贝叶斯表”。
  • 除非系统真的定义了候选、先验和似然,否则“贝叶斯更新”更多是一种解释框架。
  • 语言证据只能支持某种意图解释,不能直接证明用户的内心状态。
  • 推断出用户可能想做什么,不等于获得了执行该动作的授权。

十五、把两者放在一起

可以这样理解它们的关系:

概率:
我对一个不确定判断有多大把握?

贝叶斯公式:
出现新证据后,我应该怎样改变这个把握?

贝叶斯主义:
理性认识本身,可以被理解为一个持续修正相信程度的过程。

概率最深的哲学问题是:

不确定性存在于世界中,还是存在于我们的认识中?

贝叶斯主义给出的回答主要偏向认识论:

至少有一类概率,可以被理解为主体在当前证据下的合理相信程度;学习,就是根据新证据不断修正这种相信。

但贝叶斯方法始终有一个边界:

它能规范“在现有模型和证据下应该相信多少”,不能保证模型已经包含全部可能性,也不能保证证据可靠,更不能把高概率直接变成真理。

这也是它与“AI能否断定用户真实意图”之间最关键的联系。

如果这篇对你有用,可以订阅 RSS。

内容以署名方式开放引用,请回链原文。