---
aliases:
  - B1 概率空间、事件与期望
tags:
  - random-matrix-theory
  - foundation
  - probability
status: completed
review_status: passed
completed: 2026-09-04
lesson: L01
---

# L01：概率空间、事件与期望

> 课程地图：[[随机矩阵理论/notes/course-map|course-map]]
>
> 学习进度：[[随机矩阵理论/notes/progress|progress]]
>
> 术语表：[[随机矩阵理论/notes/glossary|glossary]]

## 1. 课程定位

- **层次：** 核心层，模块 1，基础桥接单元 B1。
- **核心问题：** “随机”如何成为可以积分、估计和证明的数学对象？
- **前承：** 基础诊断显示，概率积分和指示函数需要重新建立。
- **后续关系：** B2 的收敛定理、B3 的概率不等式，以及随机矩阵中对矩阵元、迹和异常事件的估计，都建立在本课语言之上。

本课结束时，应能无提示完成以下目标：

1. 写出概率空间、事件和随机变量的精确定义；
2. 从 Lebesgue 积分解释 $\mathbb E[\mathbf 1_A]=\mathbb P(A)$；
3. 区分期望的线性与独立性；
4. 完整证明 Markov 不等式；
5. 完整证明：若 $X\ge0$ 且 $\mathbb E[X]=0$，则 $X=0$ 几乎处处；
6. 解释方差为 0 的真正含义；
7. 区分概率测度的可数可加性与由它推出的可数次可加性；
8. 准确陈述常用收敛模式，并判断哪些蕴含成立、哪些反向推导失败。

## 2. 前置知识检查

沿用初始化诊断，不重复出题。诊断结果是：在分步提示下能够跟随证明，但暂时不能主动调用非负积分的单调性、指示函数期望和概率收敛定义。因此本课从这些逻辑接口开始，不从整套测度论公理重讲。

## 3. 直觉与最小例子

抛一枚均匀硬币。我们可以把所有可能结果写成

$$
\Omega=\{H,T\},\qquad
\mathcal F=2^\Omega,
\qquad
\mathbb P(\{H\})=\mathbb P(\{T\})=\frac12.
$$

令

$$
X(H)=1,\qquad X(T)=-1.
$$

这里有三个不同层次，不能混在一起：

1. $\omega$ 是一次具体结果，例如 $H$；
2. 事件 $A$ 是结果的集合，例如 $A=\{H\}$；
3. 随机变量 $X$ 是把结果映到数值的函数。

期望不是“最可能取值”。上例中 $X$ 从不取 0，但

$$
\mathbb E[X]=\frac12\cdot1+\frac12\cdot(-1)=0.
$$

这个反例必须记住：**期望是概率加权积分，不要求落在随机变量的取值集合中。**

## 4. 定义与规范化

### 4.1 概率空间

概率空间（probability space）是三元组

$$
(\Omega,\mathcal F,\mathbb P),
$$

其中：

- $\Omega$ 是样本空间（sample space）；
- $\mathcal F$ 是 $\Omega$ 上的 σ-代数（sigma-algebra）；
- $\mathbb P:\mathcal F\to[0,1]$ 是概率测度，满足 $\mathbb P(\Omega)=1$ 和可数可加性。

事件（event）就是 $\mathcal F$ 中的元素。不是 $\Omega$ 的任意子集都自动是事件；只有可测子集才允许赋予概率。

Tao 强调，后续概率论尽量只使用在扩张样本空间时保持不变的对象，例如事件的概率、随机变量的分布和期望。这使具体样本空间逐渐退居幕后。[Tao, §1.1，印刷页 2–5，PDF 页 13–16]

#### 4.1.1 σ-代数的封闭性

集合族 $\mathcal F\subseteq 2^\Omega$ 是 $\Omega$ 上的 σ-代数，指它满足：

1. $\Omega\in\mathcal F$；
2. 若 $A\in\mathcal F$，则 $A^c=\Omega\setminus A\in\mathcal F$；
3. 若 $A_1,A_2,\ldots\in\mathcal F$，则 $\bigcup_{n=1}^\infty A_n\in\mathcal F$。

由 De Morgan 律，σ-代数也对可数交封闭：

$$
\bigcap_{n=1}^\infty A_n
=\left(\bigcup_{n=1}^\infty A_n^c\right)^c
\in\mathcal F.
$$

这里“可数”和“可列”是同义词。因此“可数并”“可列并”以及“可数可加性”“可列可加性”分别指同一概念，不应列成不同性质。

#### 4.1.2 可数可加性

概率测度 $\mathbb P$ 的可数可加性（countable additivity，又称可列可加性）是指：若事件序列 $(A_n)_{n\ge1}$ 两两不交，即 $A_i\cap A_j=\varnothing$ 对所有 $i\ne j$ 成立，则

$$
\mathbb P\!\left(\bigcup_{n=1}^\infty A_n\right)
=\sum_{n=1}^\infty\mathbb P(A_n).
$$

“两两不交”是等号成立的关键假设。对一般事件序列，只能保证可数次可加性（countable subadditivity，又称可列次可加性）

$$
\mathbb P\!\left(\bigcup_{n=1}^\infty A_n\right)
\le\sum_{n=1}^\infty\mathbb P(A_n),
$$

也就是 union bound。后者是可数可加性的推论，不是概率测度定义中的另一条独立公理。完整推导见 §5.4。[Tao, §1.1，印刷页 2–5，PDF 页 13–16；union bound 为式 (1.1)]

### 4.2 随机变量

设 $(S,\Sigma)$ 是可测空间。随机变量（random variable）是可测映射

$$
X:(\Omega,\mathcal F)\longrightarrow(S,\Sigma).
$$

“可测”表示：对每个 $B\in\Sigma$，原像

$$
X^{-1}(B)=\{\omega:X(\omega)\in B\}
$$

属于 $\mathcal F$。因此诸如 $\{X\ge t\}$ 的集合确实是事件，概率 $\mathbb P(X\ge t)$ 才有定义。[Tao, §1.1，印刷页 7–9，PDF 页 18–20]

### 4.3 指示函数

事件 $A$ 的指示函数（indicator function）定义为

$$
\mathbf 1_A(\omega)=
\begin{cases}
1,&\omega\in A,\\
0,&\omega\notin A.
\end{cases}
$$

它把一个逻辑命题变成数值随机变量。概率估计中经常使用这座桥梁：

$$
\mathbb E[\mathbf 1_A]
=\int_\Omega \mathbf 1_A\,d\mathbb P
=\mathbb P(A).
$$

最后一个等号不是技巧，而是 Lebesgue 积分对简单函数的定义。

### 4.4 期望

对非负随机变量 $X\ge0$，允许期望取 $+\infty$，定义为

$$
\mathbb E[X]=\int_\Omega X\,d\mathbb P
=\int_{[0,\infty)}x\,d\mu_X(x),
$$

其中 $\mu_X=X_*\mathbb P$ 是 $X$ 的分布。Tao 还给出尾积分公式

$$
\mathbb E[X]=\int_0^\infty \mathbb P(X\ge t)\,dt.
$$

对实随机变量，令

$$
X^+=\max(X,0),\qquad X^-=\max(-X,0).
$$

若

$$
\mathbb E|X|=\mathbb E[X^+]+\mathbb E[X^-]<\infty,
$$

则称 $X$ 绝对可积（absolutely integrable），并定义

$$
\mathbb E[X]=\mathbb E[X^+]-\mathbb E[X^-].
$$

[Tao, §1.1，印刷页 13–15，PDF 页 24–26]

### 4.5 两个结构性质

若相关期望存在，则：

1. **单调性：** $X\le Y$ 几乎处处蕴含 $\mathbb E[X]\le\mathbb E[Y]$；
2. **线性：** 对常数 $a,b$，有 $\mathbb E[aX+bY]=a\mathbb E[X]+b\mathbb E[Y]$。

线性不要求 $X,Y$ 独立。独立性会在乘积期望或方差相加时出现，但不是期望线性的前提。[Tao, §1.1，印刷页 13–14，PDF 页 24–25]

### 4.6 常用收敛模式（B2 预览）

本节先建立后续会反复出现的语言，但不替代 B2 对收敛定理假设的系统训练。设 $X_1,X_2,\ldots,X$ 是同一概率空间上的实随机变量。

| 收敛模式 | 精确定义 | 常用记号 |
|---|---|---|
| 几乎必然收敛（almost sure convergence） | $\mathbb P(\{\omega:X_n(\omega)\to X(\omega)\})=1$ | $X_n\xrightarrow{\mathrm{a.s.}}X$ |
| 依概率收敛（convergence in probability） | 对每个 $\varepsilon>0$，$\mathbb P(\lvert X_n-X\rvert>\varepsilon)\to0$ | $X_n\xrightarrow{\mathbb P}X$ |
| 依分布收敛（convergence in distribution） | 对每个有界连续函数 $f:\mathbb R\to\mathbb R$，$\mathbb E[f(X_n)]\to\mathbb E[f(X)]$ | $X_n\xrightarrow{\mathrm d}X$ 或 $X_n\Rightarrow X$ |
| $L^p$ 收敛（$L^p$ convergence，$1\le p<\infty$） | $\mathbb E[\lvert X_n-X\rvert^p]\to0$ | $X_n\xrightarrow{L^p}X$ |
| 均方收敛（mean-square convergence） | $L^2$ 收敛，即 $\mathbb E[\lvert X_n-X\rvert^2]\to0$ | $X_n\xrightarrow{L^2}X$ |

前三个定义可推广到取值于度量空间 $(S,d)$ 的随机变量：把 $\lvert X_n-X\rvert$ 换成 $d(X_n,X)$，并在依分布收敛中测试所有有界连续函数 $f:S\to\mathbb R$。Tao 在 σ-紧度量空间上采用这一表述。[Tao, §1.1，印刷页 32，PDF 页 43，定义 1.1.29]

与测度论术语对照时：随机变量的“几乎必然收敛”就是函数的“几乎处处收敛”；在概率测度下，“依概率收敛”就是“依测度收敛”；$L^1$ 收敛也常称平均收敛（convergence in mean），$L^2$ 收敛则称均方收敛。依分布收敛等价于分布测度 $\mu_{X_n}$ 对所有有界连续测试函数的弱收敛。

需要特别区分：

- 几乎必然收敛和依概率收敛比较的是同一样本空间上 $X_n$ 与 $X$ 的距离；
- 依分布收敛只比较分布 $\mu_{X_n}$ 与 $\mu_X$，甚至允许随机变量定义在不同样本空间上；
- $L^p$ 收敛还控制误差矩，因此比单纯依概率收敛携带更多可积性信息。

$L^p$ 收敛的定义与相关证明是课程补充；Tao 在随后关于收敛与矩的练习中讨论矩条件，但没有在定义 1.1.29 中把 $L^p$ 收敛列为第 5 种模式。[Tao, §1.1，印刷页 34，PDF 页 45，练习 1.1.28]

## 5. 定理与证明

### 5.1 Markov 不等式

**定理。** 若 $X\ge0$，则对任意 $t>0$，

$$
\mathbb P(X\ge t)\le \frac{\mathbb E[X]}{t}.
$$

如果 $\mathbb E[X]=+\infty$，右端为无穷大，不等式仍成立但没有信息。实际使用时通常要求 $\mathbb E[X]<\infty$。

**证明。** 对每个 $\omega$ 分两种情况：

- 若 $X(\omega)\ge t$，则 $t\mathbf 1_{\{X\ge t\}}(\omega)=t\le X(\omega)$；
- 若 $X(\omega)<t$，则 $t\mathbf 1_{\{X\ge t\}}(\omega)=0\le X(\omega)$。

所以逐点有

$$
t\mathbf 1_{\{X\ge t\}}\le X.
$$

利用期望的单调性和指示函数期望公式，

$$
t\mathbb P(X\ge t)
=t\mathbb E[\mathbf 1_{\{X\ge t\}}]
\le \mathbb E[X].
$$

由于 $t>0$，两边除以 $t$ 即得结论。∎

教材给出这一证明的压缩形式；这里展开了逐点不等式的两种情形。[Tao, §1.1，印刷页 14，PDF 页 25，式 (1.13)]

### 5.2 非负随机变量零期望定理

**命题。** 若 $X\ge0$ 且 $\mathbb E[X]=0$，则

$$
X=0\qquad\text{几乎处处}。
$$

**证明一：由 Markov 不等式。** 对任意正整数 $m$，取 $t=1/m$，得到

$$
\mathbb P(X\ge1/m)
\le m\mathbb E[X]=0.
$$

另一方面，

$$
\{X>0\}=\bigcup_{m=1}^\infty\{X\ge1/m\}.
$$

这是因为每个正实数都至少大于某个 $1/m$。由概率测度的可数可加性，或先用可数次可加性，

$$
\mathbb P(X>0)
\le\sum_{m=1}^\infty\mathbb P(X\ge1/m)=0.
$$

因此 $\mathbb P(X=0)=1$。∎

**证明二：直接使用尾积分。** 因为

$$
0=\mathbb E[X]=\int_0^\infty\mathbb P(X\ge t)\,dt,
$$

被积函数非负且关于 $t$ 单调不增，所以它在每个 $t>0$ 处都必须为 0；否则会在某个正长度区间上产生正积分。再令 $t=1/m$ 并取可数并，得到同一结论。∎

第一种证明更基础，也更适合作为 B1 的退出检查。该命题及两个展开证明属于课程补全，不冒充教材逐字给出的独立定理。

### 5.3 方差为零的含义

若 $X$ 二阶可积，定义

$$
\operatorname{Var}(X)
=\mathbb E\bigl[|X-\mathbb E X|^2\bigr].
$$

注意 $|X-\mathbb E[X]|^2\ge0$。因此由上一命题，

$$
\operatorname{Var}(X)=0
\quad\Longleftrightarrow\quad
X=\mathbb E[X]\ \text{几乎处处}.
$$

所以“均值为 0”和“方差为 0”完全不同：

- $\mathbb E[X]=0$ 只表示正负偏差在积分意义下抵消；
- $\operatorname{Var}(X)=0$ 才表示没有随机波动，$X$ 几乎处处等于常数。

[Tao, §1.1，印刷页 17，PDF 页 28，式 (1.25)]

### 5.4 可数可加性的基本推论

下面各性质不是额外公理，而是由 $\mathbb P(\Omega)=1$、非负性和可数可加性推出。

#### 5.4.1 空集、有限可加性、补集与单调性

首先取 $A_1=\Omega$，并令 $A_n=\varnothing$（$n\ge2$）。这些事件两两不交，且并集为 $\Omega$。可数可加性给出

$$
1=\mathbb P(\Omega)
=\mathbb P(\Omega)+\sum_{n=2}^\infty\mathbb P(\varnothing).
$$

各项非负，因此 $\mathbb P(\varnothing)=0$。

若 $A_1,\ldots,A_m$ 两两不交，在其后补上无穷多个空集，便由可数可加性得到有限可加性

$$
\mathbb P\!\left(\bigcup_{j=1}^m A_j\right)
=\sum_{j=1}^m\mathbb P(A_j).
$$

由于 $\Omega=A\mathbin{\dot\cup}A^c$，有限可加性给出

$$
\mathbb P(A^c)=1-\mathbb P(A).
$$

若 $A\subseteq B$，则 $B=A\mathbin{\dot\cup}(B\setminus A)$，所以

$$
\mathbb P(B)=\mathbb P(A)+\mathbb P(B\setminus A)
\ge\mathbb P(A).
$$

这就是概率测度的单调性。

#### 5.4.2 可数次可加性

对任意事件序列 $(A_n)_{n\ge1}$，定义“不重复部分”

$$
B_1=A_1,\qquad
B_n=A_n\setminus\bigcup_{k=1}^{n-1}A_k
\quad(n\ge2).
$$

则 $B_n$ 两两不交，$B_n\subseteq A_n$，并且 $\bigcup_nB_n=\bigcup_nA_n$。因此由可数可加性和单调性，

$$
\mathbb P\!\left(\bigcup_{n=1}^\infty A_n\right)
=\sum_{n=1}^\infty\mathbb P(B_n)
\le\sum_{n=1}^\infty\mathbb P(A_n).
$$

这就证明了可数次可加性，也解释了 union bound 为什么不要求事件独立。

#### 5.4.3 概率的从下连续性与从上连续性

若 $A_n\uparrow A$，即 $A_1\subseteq A_2\subseteq\cdots$ 且 $A=\bigcup_nA_n$，令

$$
B_1=A_1,\qquad B_n=A_n\setminus A_{n-1}\quad(n\ge2).
$$

这些增量两两不交，并且 $A_N=\bigcup_{n=1}^NB_n$、$A=\bigcup_{n=1}^\infty B_n$。于是

$$
\mathbb P(A_N)=\sum_{n=1}^N\mathbb P(B_n)
\longrightarrow
\sum_{n=1}^\infty\mathbb P(B_n)
=\mathbb P(A).
$$

因此 $A_n\uparrow A$ 蕴含 $\mathbb P(A_n)\uparrow\mathbb P(A)$。

若 $A_n\downarrow A$，令 $C_n=A_1\setminus A_n$。则 $C_n\uparrow A_1\setminus A$。利用从下连续性和有限可加性，

$$
\mathbb P(A_n)
=\mathbb P(A_1)-\mathbb P(C_n)
\longrightarrow
\mathbb P(A_1)-\mathbb P(A_1\setminus A)
=\mathbb P(A).
$$

所以 $A_n\downarrow A$ 蕴含 $\mathbb P(A_n)\downarrow\mathbb P(A)$。对一般测度，从上连续性需要 $\mu(A_1)<\infty$；对概率测度该条件自动成立，因为 $\mathbb P(A_1)\le1$。

### 5.5 收敛模式的蕴含、特殊反推与反例

对 $p\ge q\ge1$，最常用的无条件蕴含关系是

$$
X_n\xrightarrow{L^p}X
\Longrightarrow X_n\xrightarrow{L^q}X
\Longrightarrow X_n\xrightarrow{\mathbb P}X
\Longrightarrow X_n\xrightarrow{\mathrm d}X,
$$

以及

$$
X_n\xrightarrow{\mathrm{a.s.}}X
\Longrightarrow X_n\xrightarrow{\mathbb P}X.
$$

Tao 将后三种模式的蕴含与特殊等价关系列为练习；下面的证明属于课程补全。[Tao, §1.1，印刷页 32–34，PDF 页 43–45，练习 1.1.25]

#### 5.5.1 $L^p\Rightarrow L^q\Rightarrow$ 依概率

令 $Y_n=X_n-X$。因为底层测度是总质量为 1 的概率测度，函数 $t\mapsto t^{q/p}$ 在 $[0,\infty)$ 上凹。Jensen 不等式给出

$$
\mathbb E|Y_n|^q
=\mathbb E\!\left[(|Y_n|^p)^{q/p}\right]
\le\left(\mathbb E|Y_n|^p\right)^{q/p}.
$$

因此 $\|Y_n\|_q\le\|Y_n\|_p$，故 $L^p$ 收敛推出 $L^q$ 收敛。

若 $X_n\xrightarrow{L^q}X$，则对每个 $\varepsilon>0$，对非负随机变量 $|X_n-X|^q$ 使用 Markov 不等式：

$$
\mathbb P(|X_n-X|>\varepsilon)
\le\frac{\mathbb E|X_n-X|^q}{\varepsilon^q}
\longrightarrow0.
$$

所以 $L^q$ 收敛推出依概率收敛。

#### 5.5.2 几乎必然 $\Rightarrow$ 依概率

固定 $\varepsilon>0$，定义尾部坏事件

$$
B_N=\bigcup_{n\ge N}\{|X_n-X|>\varepsilon\}.
$$

事件 $B_N$ 随 $N$ 递减，而 $\bigcap_NB_N$ 表示误差大于 $\varepsilon$ 的情况发生无穷多次。若 $X_n\to X$ 几乎必然，则 $\mathbb P(\bigcap_NB_N)=0$。由概率的从上连续性，

$$
\mathbb P(B_N)\downarrow0.
$$

当 $n\ge N$ 时，$\{|X_n-X|>\varepsilon\}\subseteq B_N$，故

$$
\limsup_{n\to\infty}\mathbb P(|X_n-X|>\varepsilon)
\le\mathbb P(B_N).
$$

再令 $N\to\infty$，得到依概率收敛。这个证明清楚展示了可数可加性经“从上连续性”进入收敛理论的位置。

#### 5.5.3 依概率 $\Rightarrow$ 依分布

设 $f:\mathbb R\to\mathbb R$ 有界连续，并令 $M=\|f\|_\infty$。给定 $\delta>0$，先取 $R>0$ 使

$$
\mathbb P(|X|>R)<\delta.
$$

函数 $f$ 在紧区间 $[-R-1,R+1]$ 上一致连续，故存在 $0<\rho<1$，使得该区间中的 $x,y$ 满足 $|x-y|\le\rho$ 时，有 $|f(x)-f(y)|\le\delta$。

在事件

$$
G_n=\{|X|\le R\}\cap\{|X_n-X|\le\rho\}
$$

上，$X,X_n\in[-R-1,R+1]$，所以 $|f(X_n)-f(X)|\le\delta$；在补集上则使用粗略界 $|f(X_n)-f(X)|\le2M$。因此

$$
\begin{aligned}
\lvert\mathbb E f(X_n)-\mathbb E f(X)\rvert
&\le\mathbb E|f(X_n)-f(X)|\\
&\le\delta+2M\bigl[\mathbb P(|X|>R)
+\mathbb P(|X_n-X|>\rho)\bigr].
\end{aligned}
$$

依概率收敛使最后一个概率趋于 0，于是

$$
\limsup_{n\to\infty}|\mathbb E f(X_n)-\mathbb E f(X)|
\le\delta+2M\delta.
$$

令 $\delta\downarrow0$，即得 $\mathbb E f(X_n)\to\mathbb E f(X)$，所以 $X_n\xrightarrow{\mathrm d}X$。

#### 5.5.4 两个重要的部分反推

**极限为常数时。** 若 $X_n\xrightarrow{\mathrm d}c$，其中 $c$ 是常数，对任意 $\varepsilon>0$ 定义有界连续函数

$$
\phi_\varepsilon(x)=\min\left\{1,\frac{|x-c|}{\varepsilon}\right\}.
$$

因为 $\mathbf 1_{\{|x-c|\ge\varepsilon\}}\le\phi_\varepsilon(x)$，所以

$$
\mathbb P(|X_n-c|\ge\varepsilon)
\le\mathbb E\phi_\varepsilon(X_n)
\longrightarrow\phi_\varepsilon(c)=0.
$$

故依分布收敛到常数等价于依概率收敛到该常数。极限不是常数时，这个反推一般错误。

**抽取子列时。** 若 $X_n\xrightarrow{\mathbb P}X$，可递归选取严格递增的 $n_k$，使

$$
\mathbb P(|X_{n_k}-X|>2^{-k})\le2^{-k}.
$$

令 $E_k=\{|X_{n_k}-X|>2^{-k}\}$。对每个 $m$，可数次可加性给出

$$
\mathbb P\!\left(\bigcup_{k\ge m}E_k\right)
\le\sum_{k\ge m}2^{-k}=2^{1-m}.
$$

令 $m\to\infty$ 并使用从上连续性，得到 $E_k$ 无穷多次发生的概率为 0。因此几乎处处存在 $m(\omega)$，使 $k\ge m(\omega)$ 时

$$
\lvert X_{n_k}(\omega)-X(\omega)\rvert\le2^{-k}\longrightarrow0.
$$

所以每个依概率收敛序列都能抽出一个几乎必然收敛到同一极限的子列。注意：这不是说原序列本身几乎必然收敛。

#### 5.5.5 为什么其余反向箭头不成立

| 错误反推 | 反例 | 失败原因 |
|---|---|---|
| 依分布 $\nRightarrow$ 依概率 | 令 $X$ 以相同概率取 $\pm1$，并令 $X_n=-X$。则 $X_n$ 与 $X$ 同分布，所以 $X_n\xrightarrow{\mathrm d}X$；但 $\lvert X_n-X\rvert=2$ 几乎处处成立。 | 依分布只比较边缘分布，不控制 $X_n$ 与 $X$ 在同一样本点上的耦合。 |
| $L^p\nRightarrow$ 几乎必然 | 在 $([0,1),\mathcal B,\mathrm{Leb})$ 上，若 $n=2^k+j$，其中 $0\le j<2^k$，令 $X_n=\mathbf 1_{[j2^{-k},(j+1)2^{-k})}$。则 $\mathbb E\lvert X_n\rvert^p=2^{-k}\to0$，但每个样本点在每一层恰落入一个区间，故序列反复取 0 和 1。 | $L^p$ 控制平均误差，却不排除坏事件在不同 $n$ 之间移动。 |
| 几乎必然 $\nRightarrow L^p$ | 在 $([0,1],\mathcal B,\mathrm{Leb})$ 上令 $X_n=n^{1/p}\mathbf 1_{(0,1/n)}$。则 $X_n\to0$ 几乎处处，但 $\mathbb E\lvert X_n\rvert^p=1$。 | 几乎处处的尖峰虽然不断缩小支撑，却可能保持不消失的 $p$ 阶矩。 |

因此，记忆“箭头方向”不够；必须同时记住每条箭头所控制的是样本点、尾概率、分布，还是误差矩。

## 6. 与随机矩阵主线的连接

考虑一个 $2\times2$ Hermitian 随机矩阵

$$
H=
\begin{pmatrix}
X_1 & Z\\
\overline Z & X_2
\end{pmatrix},
$$

其中 $X_1,X_2$ 为实随机变量，$Z$ 为复随机变量。此时：

- $H$ 是取值于 Hermitian 矩阵空间的随机变量；
- $\{\|H\|_{\mathrm{op}}\ge t\}$ 是事件；
- $\operatorname{tr}(H)=X_1+X_2$，故只要可积，就有 $\mathbb E[\operatorname{tr}H]=\mathbb E[X_1]+\mathbb E[X_2]$；这里不需要 $X_1,X_2$ 独立；
- 若要估计大矩阵中“异常矩阵元”的个数，可写成指示函数之和，再取期望。

收敛语言进入随机矩阵时，还必须先说明“什么对象在收敛”：

- 对固定测试函数 $f$，谱线性统计量
  $$
  Y_n=\int_{\mathbb R}f(x)\,d\mu_{M_n}(x)
  $$
  是标量随机变量，可以讨论 $Y_n$ 的几乎必然、依概率、依分布或 $L^p$ 收敛；
- 经验谱分布 $\mu_{M_n}$ 本身是随机概率测度。“$\mu_{M_n}$ 弱收敛”描述测度在测试函数下的极限；“几乎必然／依概率”则描述这一测度值随机对象的收敛方式。两层概念不能混写；
- 矩阵维度随 $n$ 改变时，$M_n$ 位于不同的矩阵空间。若没有先给出共同嵌入、范数或所研究的谱统计量，直接写“$M_n\to M$”是不完整的陈述。

Mehta 从 Gaussian ensembles 开始直接把矩阵元视为随机变量，并以“基变换不变性 + 独立性”定义 GOE／GUE；它不负责补上述测度论基础。[Mehta, Ch. 2, §2.3，印刷页 40，PDF 页 48]；[Mehta, Ch. 2, §2.5–§2.6，印刷页 46–47，PDF 页 54–55]

## 7. 双教材对照

| 维度 | Tao | Mehta |
|---|---|---|
| 切入方式 | 从概率空间、随机变量、分布和期望开始 | 从物理对称性和矩阵元联合密度开始 |
| 本课覆盖 | 系统给出概率空间、可数可加性、期望、Markov、方差以及几乎必然／依概率／依分布收敛 | 使用概率密度与独立性，但不系统补概率积分或收敛模式 |
| 本课角色 | 主教材 | 展示这些基础概念进入 RMT 后如何被直接使用 |

两书在本课不存在需要换算的矩阵归一化；矩阵尺度从模块 2 才开始固定。

本课关于 $L^p$ 收敛、可数可加性推论和各蕴含关系的展开证明属于课程补全；Tao 提供定义、练习和反例线索，Mehta 未系统覆盖这些基础内容。

## 8. Python 数值实验

本课不创建实验。指示函数期望、积分单调性和零期望命题是定义与证明问题，模拟只能给出频率近似，不能替代理论论证。

## 9. 练习

本课的 8 道分层习题与默认折叠的完整解答见：

[[随机矩阵理论/notes/exercises/L01-probability-space-expectation-exercises|L01 习题与完整解答]]

对话辅导仍按“提示 → 更具体提示 → 完整解答”推进，不因文件中已有解答而跳过学习者尝试。

## 10. 理解检查与单元状态

- **状态：** B1 审查通过。
- **确认依据：** 学习者已明确确认本单元审查通过。
- **掌握范围：** 该状态仅适用于 B1「概率空间、事件与期望」，不据此推断 B2–B6 或后续模块的掌握情况。
- **补充内容：** 本课已加入收敛模式的 B2 预览；阅读预览不等于完成 B2 的理解检查。
- **后续：** 等待学习者进一步指示，不自动把 B2 标为已完成。
