概率与贝叶斯:不确定性、证据与信念更新
从概率的数学骨架与哲学解释出发,理解贝叶斯公式、贝叶斯主义,以及新证据为何只能更新判断而不能直接产生真理。
理解“概率”和“贝叶斯”,首先要区分它们所处的层次:
- 概率讨论:不确定性如何被表达和理解。
- 贝叶斯公式讨论:获得新证据后,应当怎样调整原来的概率判断。
- 贝叶斯主义则更进一步:把概率理解为一种可修正的相信程度,并把贝叶斯更新视为理性学习的方法。
因此,讨论从概率开始。
本文重点解释概率数值意味着什么、贝叶斯公式怎样连接条件概率,以及新证据如何改变判断。逻辑与概率专门比较证据支持与必然推导;逻辑则讨论推导本身的有效性。
一、概率到底是什么?
最朴素的回答是:
概率是对不确定性的量化。
但这句话还没有真正解决问题。因为“不确定性”可能来自两个完全不同的地方。
第一种不确定性来自世界。
例如抛一枚硬币,在它落地之前,我们不知道正面还是反面。这里可能存在物理过程本身的随机性。
第二种不确定性来自我们的知识。
例如一枚硬币已经落地,只是被杯子盖住。结果实际上已经确定,但我们不知道。这里的不确定性存在于我们的认识之中。
因此,当我们说:
A发生的概率是80%。
至少可能在说三件不同的事:
- A在同类重复事件中大约出现80%。
- 产生A的物理过程具有某种80%的倾向。
- 根据当前证据,我对“A会发生”的相信程度是80%。
这三种“概率”使用同一套数学,却未必描述同一种存在。
二、概率的数学定义
现代概率论通常从三个基本对象开始:
- 样本空间 Ω:所有可能结果构成的集合。
- 事件 A:我们关心的一组结果。
- 概率函数 P:给事件分配0到1之间的数。
例如,掷一枚普通骰子:
Ω = {1, 2, 3, 4, 5, 6}
“掷出偶数”这个事件是:
A = {2, 4, 6}
如果假定六个结果等可能:
P(A) = 3/6 = 1/2
柯尔莫哥洛夫在1933年建立的公理化概率论,要求概率函数满足三个基本条件:
P(A) ≥ 0:概率不能是负数。P(Ω) = 1:所有可能结果的总概率为1。- 互不相容的事件可以相加。
例如,一次掷骰子不可能既得到1又得到2,所以:
P(得到1或2)
= P(得到1) + P(得到2)
= 1/6 + 1/6
= 1/3
这套公理告诉我们概率应该怎样运算,却没有告诉我们:
公式里的P在现实中究竟代表什么。
这是数学与哲学的分界。
数学研究概率之间必须满足什么关系;概率哲学研究这些数值到底意味着什么。斯坦福哲学百科:概率的解释
三、概率的几种哲学解释
1. 古典解释:等可能结果的比例
这是我们最熟悉的概率定义:
概率等于有利结果数除以所有等可能结果数。
例如骰子出现偶数的概率:
有利结果:{2, 4, 6}
所有结果:{1, 2, 3, 4, 5, 6}
概率 = 3/6 = 1/2
它特别适合扑克牌、骰子和抽签。
但它隐藏了一个问题:什么叫“等可能”?
如果我们用“等可能”定义概率,又用“概率相等”解释等可能,就会形成循环:
为什么六个面等可能?
因为每个面的概率相同。
为什么概率相同?
因为六个面等可能。
现实中的骰子还可能重量不均、边角磨损,甚至存在落在棱上的可能。因此,古典解释只适用于能够合理建立对称性的场景。
2. 频率解释:大量重复中的比例
频率主义把概率理解为:
某个结果在大量同类重复试验中的长期相对频率。
例如,在相同条件下生产100万件产品,其中约2万件存在缺陷,可以说缺陷概率约为2%。
这种解释的优势是可以通过观察检验。它不需要讨论个人相信什么。
但它遇到一个困难:如何解释只发生一次的事件?
例如:
某位候选人明天当选的概率是70%。
明天的这次选举只会发生一次。我们不能在完全相同的世界里重复举行十万次选举。
频率主义可以寻找“同类选举”,但怎样定义“同类”又成为问题。年份、候选人、经济环境、选民结构都不相同。
所以,单次事件概率很难单纯还原为长期频率。
3. 倾向解释:事物产生结果的物理倾向
倾向解释认为,概率是系统自身的一种物理属性。
例如,一枚结构均匀的硬币与特定抛掷装置共同形成一种物理倾向,使正反两面接近各有一半机会。
这种解释试图回答:
为什么长期频率会稳定下来?
因为产生结果的系统本身具有某种倾向。
但“倾向”很难被脱离频率而独立观察。如果我们问“怎么知道这枚硬币有50%的正面倾向”,最终仍然常常要靠重复实验。
4. 逻辑或证据解释:证据支持结论的程度
这种解释把概率理解为:
证据E在多大程度上支持假设H。
例如:
根据现有地质资料,未来十年发生某类地震的概率是多少?
这里的概率既不是一个人的随意信心,也不只是过去地震的简单频率,而是在问:现有证据给这个判断提供了多强的合理支持。
它比较接近科学推理中的“根据证据,这个解释有多可信”。
问题在于:是否存在唯一客观的证据支持度?
两个理性的人掌握相同资料,是否必须给出完全相同的概率?他们可能采用不同模型、变量和背景知识,因此仍得到不同结果。
5. 主观或贝叶斯解释:相信程度
主观概率把概率理解为:
一个主体在当前信息下,对某个命题的相信程度。
这里的“主观”不等于随便猜。
如果一个人的相信程度被称为概率,它至少应保持内部一致。例如,他不能同时认为:
P(A) = 0.8
P(非A) = 0.5
因为A与非A的概率之和应当为1。
主观贝叶斯主义认为,不同的人可以因为先验知识不同而拥有不同概率;但获得新证据后,他们应当按照一致的规则更新判断。
概率由此成为一种“部分相信”:
0 = 完全不相信
0.5 = 两边证据相当
1 = 完全相信
实际哲学中的观点比这个刻度复杂,尤其不鼓励轻易给经验命题分配绝对的0或1。
四、概率的哲学核心:它属于世界,还是属于认识?
可以把主要争论压缩成两个方向:
世界的不确定性
↓
物理机会、频率、倾向
以及:
认识的不确定性
↓
证据支持度、相信程度
前者通常称为本体意义上的概率:概率描述世界怎样运行。
后者通常称为认识意义上的概率:概率描述在证据有限时,我们有多大理由相信某件事。
例如,一枚硬币已经落地,但结果被遮住:
- 从世界状态看,正反结果已经确定。
- 从观察者知识看,可能仍然各有50%的可信度。
因此,“概率是多少”是不完整的问题。更完整的问题应当是:
对什么事件而言?根据哪些信息?采用什么模型?这个概率表示物理机会、长期频率,还是证据下的相信程度?
五、条件概率:概率不是脱离信息存在的数字
条件概率表示:
在已经知道B的条件下,A发生的概率。
写成:
P(A | B)
定义是:
P(A | B) = P(A ∩ B) / P(B)
条件非常关键。
例如:
P(一个人感冒):随机选一个人,他感冒的概率。P(一个人感冒 | 他正在发烧):已知他发烧时,感冒的概率。P(一个人发烧 | 他感冒):已知他感冒时,发烧的概率。
后面两项看起来相似,却是两个完全不同的问题。
这正是贝叶斯公式要处理的地方。
六、贝叶斯公式是什么?
贝叶斯公式写作:
P(H | E) = P(E | H) × P(H) / P(E)
其中:
- H:假设,hypothesis。
- E:证据,evidence。
P(H):先验概率。P(E|H):似然。P(E):证据概率。P(H|E):后验概率。
它表达的是:
在看见证据E之后,我们应该怎样更新对假设H的判断。
可以把它读成:
更新后的判断
=
证据与假设的匹配程度
×
原来的判断
÷
证据本身出现的概率
七、贝叶斯公式是怎么来的?
它不是凭空发明出来的复杂公式,而是由条件概率直接推出来的。
根据条件概率:
P(H | E) = P(H ∩ E) / P(E)
同样:
P(E | H) = P(E ∩ H) / P(H)
所以:
P(E ∩ H) = P(E | H) × P(H)
将它代入第一个公式:
P(H | E) = P(E | H) × P(H) / P(E)
这就是贝叶斯公式。
因此,作为数学公式,它没有神秘性。它只是从两个方向观察同一个联合事件:
假设成立,并且证据出现
Penn State 概率论课程:Bayes’ Theorem
八、贝叶斯公式真正反转了什么?
我们经常容易知道:
如果H是真的,出现E的可能性有多大?
即:
P(E | H)
但我们真正想知道的通常是:
既然已经出现E,H为真的可能性有多大?
即:
P(H | E)
两者不能直接互换。
例如:
如果一个人患有某病,检测呈阳性的概率是90%。
这是:
P(阳性 | 患病) = 90%
它不等于:
P(患病 | 阳性) = 90%
因为没有考虑这种病原本有多罕见,也没有考虑健康人误报阳性的概率。
九、一个完整例子:阳性不等于患病概率90%
假设:
- 人群患病率为1%。
- 患病者检测阳性的概率为90%。
- 未患病者误报阳性的概率为5%。
现在有一个人检测呈阳性。他真正患病的概率是多少?
假设有10,000人:
患病者:100人
其中检测阳性:90人
未患病者:9,900人
其中误报阳性:495人
所有阳性人数:
90 + 495 = 585
阳性者中真正患病的人数:
90 / 585 ≈ 15.4%
所以:
P(患病 | 阳性) ≈ 15.4%
尽管检测对患病者有90%的阳性率,看到阳性以后真正患病的概率仍只有约15.4%。
因为这种病本来很少见。大量健康人即使只有5%误报,绝对人数也会超过患病者。
这个例子揭示了贝叶斯推理的核心:
新证据的意义,取决于它与原有基准概率共同作用。
这也是为什么不能只看一条“很像”的证据。
十、先验、似然和后验分别是什么?
先验:看到新证据之前的判断
P(H)
先验不一定是主观猜测。它可以来自:
- 历史数据;
- 同类事件频率;
- 已有理论;
- 上一轮推断结果;
- 专家判断;
- 在证据不足时人为采用的初始分布。
例如,在客服系统中,过去60%的“帮我看看方案”最终被确认为评审请求,这可以成为先验参考。
但先验永远有适用范围。过去用户的分布不一定适合当前用户。
似然:假设成立时,证据有多容易出现
P(E | H)
假设用户确实希望“直接修改”,他说出“帮我直接改好”的概率可能较高。
似然回答的是:
这个假设能多好地解释目前看到的证据?
似然不是假设本身的概率。
后验:看到证据之后的新判断
P(H | E)
后验综合了:
- 原来有多相信H;
- H对新证据的解释力;
- 其他假设是否也能产生相同证据。
这一轮的后验,还可以成为下一轮推断的先验:
先验
↓ 新证据1
后验1
↓ 新证据2
后验2
↓ 新证据3
后验3
所以贝叶斯思想描述的是一种持续学习过程,而不只是一次计算。
十一、贝叶斯公式与贝叶斯主义不是一回事
这是最需要区分的地方。
贝叶斯公式是一条数学定理。只要使用普通条件概率,它就成立。频率主义者也承认这条公式。
贝叶斯统计是一套统计方法。它为未知参数或假设设置先验,通过数据和似然得到后验。
贝叶斯认识论则是一种哲学立场:
人的相信可以有程度;理性的相信程度应符合概率公理;获得新证据后,应通过条件化更新自己的相信。
因此,从公式走向哲学,需要增加几个前提:
- 概率可以表示相信程度。
- 相信程度应当满足概率公理。
- 新证据应当以某种贝叶斯方式更新相信。
- 决策可以结合后验概率与结果价值进行。
这些都不是单凭贝叶斯公式证明出来的。
十二、贝叶斯主义在哲学上解决什么问题?
它主要处理一个古老问题:
人在不能确定真假的情况下,怎样进行理性判断?
传统逻辑通常处理确定性关系:
如果所有人都会死,
苏格拉底是人,
那么苏格拉底会死。
但现实中的多数推理不是确定性的:
这个症状可能由疾病A引起;
也可能由疾病B引起;
新的检测结果更支持A;
所以我应该提高对A的相信程度。
贝叶斯主义把“学习”理解为相信程度的变化:
原有认识 + 新证据 → 更新后的认识
它为归纳推理、科学确认、诊断和决策提供了统一语言。
十三、贝叶斯主义面临的哲学问题
1. 先验从哪里来?
两个人面对同一证据,可能因为先验不同而得到不同后验。
例如:
甲原来认为H的概率是1%
乙原来认为H的概率是50%
即使使用相同似然,新证据之后,他们仍可能得出不同结论。
客观贝叶斯主义希望通过对称性、最大熵或理性原则限制先验;主观贝叶斯主义允许先验因个人信息不同而不同,只要求内部一致并接受证据更新。
争论在于:允许多少主观差异,概率推理仍能被称为理性?
2. 候选假设可能不完整
这是AI意图推断中最关键的问题。
假设系统只有两个候选:
H₁:用户想让AI评审
H₂:用户想让AI改写
贝叶斯公式会把两者后验归一化,使总和等于1。
但用户真正的意思可能是:
H₃:用户只是想借方案展开讨论
如果H₃根本没有进入候选集合,那么无论计算多精确,系统都只是在两个错误选项之间分配概率。
因此:
后验概率只在模型建立的可能世界里成立。
模型之外的可能性不会自动被公式发现。
3. 先验为零的假设无法被挽救
如果:
P(H) = 0
那么无论新证据多强:
P(H | E) = 0
这意味着,一旦把某个假设视为绝对不可能,后续证据就无法使它复活。
因此,在经验问题中轻易赋予0或1非常危险。这相当于关闭了继续学习的可能。
4. 证据不是中性的
我们通常把证据E当作已经给定的事实,但现实中:
- 证据可能测量错误;
- 证据可能被选择性呈现;
- 不同理论可能用不同方式描述同一现象;
- 用户的回答可能受到提问方式影响。
例如AI问:
你是想让我直接修改,对吗?
这不是完全中性的澄清。它可能诱导用户接受模型提供的解释。
所以,多轮对话中的“新证据”有时也是系统和用户共同制造出来的。
5. 高后验概率仍不等于真
假设某个假设的后验概率达到95%,它仍然可能是假的。
贝叶斯公式表达的是:
在当前候选、先验、似然和证据之下,这个假设获得了多大支持。
它不是把“有充分理由相信”变成“客观上已经为真”。
这里必须区分:
认识上的合理性
≠
世界中的真实性
十四、贝叶斯怎样连接到AI意图推断?
假设系统考虑三个候选:
H₁:用户希望解释概念
H₂:用户希望把内容保存下来
H₃:用户希望写成公开文章
当用户说:
给我详细讲讲概率和贝叶斯。
这条新证据会提高H₁的权重。
当用户又说:
把这两段沉淀成固定知识。
这会提高H₂的权重。
如果用户说:
我要发在小报童上。
这会提高H₃的权重。
整个过程可以用贝叶斯方式理解:
原有候选解释
+
新的语言证据
→
更新候选解释的可信度
但这里要格外谨慎:
- 大模型通常直接预测下一个token,并不等于内部存在一张明确的“用户意图贝叶斯表”。
- 除非系统真的定义了候选、先验和似然,否则“贝叶斯更新”更多是一种解释框架。
- 语言证据只能支持某种意图解释,不能直接证明用户的内心状态。
- 推断出用户可能想做什么,不等于获得了执行该动作的授权。
十五、把两者放在一起
可以这样理解它们的关系:
概率:
我对一个不确定判断有多大把握?
贝叶斯公式:
出现新证据后,我应该怎样改变这个把握?
贝叶斯主义:
理性认识本身,可以被理解为一个持续修正相信程度的过程。
概率最深的哲学问题是:
不确定性存在于世界中,还是存在于我们的认识中?
贝叶斯主义给出的回答主要偏向认识论:
至少有一类概率,可以被理解为主体在当前证据下的合理相信程度;学习,就是根据新证据不断修正这种相信。
但贝叶斯方法始终有一个边界:
它能规范“在现有模型和证据下应该相信多少”,不能保证模型已经包含全部可能性,也不能保证证据可靠,更不能把高概率直接变成真理。
这也是它与“AI能否断定用户真实意图”之间最关键的联系。
如果这篇对你有用,可以订阅 RSS。
内容以署名方式开放引用,请回链原文。