生成模型数学基础
一、随机事件
在试验中可能发生也可能不发生的事件,随机事件通常用字母A, B, C表示。
二、概率运算法则
事件独立
若事件A的发生与事件B的发生与否无关,则A, B相互独立:
P(A,B)=P(A)P(B) P(A, B)=P(A)P(B) P(A,B)=P(A)P(B)
其中P(A,B)P(A,B)P(A,B)表示事件A和事件B同时发生的概率。
条件概率
P(B∣A)P(B|A)P(B∣A)表示事件AAA发生的情况下,B发生的概率:
P(B∣A)=P(A,B)P(A) P(B|A)=\frac{P(A,B)}{P(A)} P(B∣A)=P(A)P(A,B)
全概率公式
将一个复杂的概率事件问题,转化为在不同原因下发生的简单事件概率的求和。
设一个完备事件组A1,A2,...,An,...A_1,A_2,...,A_n,...A1,A2,...,An,...
P(B)=∑iP(Ai,B)=∑iP(Ai)P(B∣Ai)=P(A1)P(B∣A1)+...+P(An)P(B∣An)+... P(B)=\sum_i P(A_i,B)=\sum_i P(A_i)P(B|A_i)=P(A_1)P(B|A_1)+...+P(A_n)P(B|A_n)+... P(B)=i∑P(Ai,B)=i∑P(Ai)P(B∣Ai)=P(A1)P(B∣A1)+...+P(An)P(B∣An)+...
也就是说,事件B的发生,是由事件A引起的,所以,穷举所有能够影响B事件的A,一件件列举出来,计算概率,然后求和。
贝叶斯公式
设一个完备事件组A1,A2,...,An,...A_1,A_2,...,A_n,...A1,A2,...,An,...
P(Ai∣B)=P(Ai∣B)P(B)=P(Ai)P(B∣Ai)∑jP(Aj)P(B∣Aj) P(A_i|B)=\frac{P(A_i|B)}{P(B)}=\frac{P(A_i)P(B|A_i)}{\sum_j P(A_j)P(B|A_j)} P(Ai∣B)=P(B)P(Ai∣B)=∑jP(Aj)P(B∣Aj)P(Ai)P(B∣Ai)
也就是当事件B发生,那么这件事是由AjA_jAj引起的可能性有多大。
三、随机变量
随机变量表示随机试验各种结果的实值单值函数。简单来说,随机变量不是变量,而是一个函数。其能够把随机事件量化。
比如抛硬币,我们把正反面这种概念给量化,设我们的随机变量为XXX:
X(正)=1,X(反)=0 X(正)=1,X(反)=0 X(正)=1,X(反)=0
试验结果的正、反,我们称之为样本点,用www表示;其所在空间成为样本空间,记为SSS。于是
离散随机变量和连续随机变量
离散随机变量: 随机变量的取值只有有限个或可数无穷个;
连续随机变量: 随机变量在一定区间内变脸取值有无限个,或数值无法一一列举出来
对于随机变量X=aX=aX=a的概率,表示为P(X=a)P(X=a)P(X=a) 或 P(a)P(a)P(a)
四、多维随机变量
设离散变量X,YX,YX,Y
离散时:
连续时:
P(Y=y)=∫XP(X,y)dX P(Y=y)=\int_XP(X,y)dX P(Y=y)=∫XP(X,y)dX
六、概率分布
用于表述随机变量取值的概率规律。


期望、方差、协方差
数学期望(均值):用于衡量随机变量取值水平。
设随机变量XXX的概率分布为:
P(X=xi)=pi P(X=x_i)=p_i P(X=xi)=pi
则数学期望为
E(X)=∑ixipi=∫xf(x)dx \mathbb{E}(X)=\sum_i x_ip_i=\int xf(x)dx E(X)=i∑xipi=∫xf(x)dx
在一些情况下,会直接写成
E(X)=∫Xf(X)dX \mathbb{E}(X)=\int Xf(X)dX E(X)=∫Xf(X)dX
随机变量函数的数学期望
E(g(X))=∑i=1ng(xi)pi=∫g(x)f(x)dx \mathbb{E}(g(X))=\sum_{i=1}^{n} g(x_i)p_i = \int g(x)f(x)dx E(g(X))=i=1∑ng(xi)pi=∫g(x)f(x)dx
其中g(X)是关于随机变量X的函数,比如g(X)=logXg(X)=logXg(X)=logX。
数学期望的性质:
- 常数的期望是其本省
- 若CCC是常数,则E(C∗X)=C∗E(X)\mathbb{E}(C*X)=C*\mathbb{E}(X)E(C∗X)=C∗E(X)
- E(X1+X2)=E(X1)+E(X2)\mathbb{E}(X_1+X_2)=\mathbb{E}(X_1)+\mathbb{E}(X_2)E(X1+X2)=E(X1)+E(X2)
- 如果X,YX,YX,Y相互独立,则E(X,Y)=E(X)E(Y)\mathbb{E}(X,Y)=\mathbb{E}(X)\mathbb{E}(Y)E(X,Y)=E(X)E(Y)
数学期望在一些文章或者论文中常常表示为:
EX∼Pdata[X] \mathbb{E}_{X \sim P_{data}} [X] EX∼Pdata[X]
意思是我们所求数学期望的随机变量XXX,服从的概率分布为PdataP_{data}Pdata
还可能写成这样
EX,Y[X] \mathbb{E}_{X,Y} [X] EX,Y[X]
表示对中括号里面,求随机变量X,YX,YX,Y的期望。由于中括号里面只有随机变量XXX,所以关于YYY求期望,就相当于对常数求期望:
EX,Y[X]=∫X,YX∗P(X,Y)d(X,Y)=∫X∫YX∗P(X,Y)dXdY=∫XX∫YP(X,Y)dYdX=∫XX∗P(X)dX=EX[X] \mathbb{E}_{X,Y} [X]=\int_{X,Y}X*P(X,Y)d(X,Y)\\=\int_X \int_Y X*P(X,Y)dXdY\\=\int_X X\int_YP(X,Y)dYdX\\=\int_X X*P(X)dX\\=\mathbb{E}_{X} [X] EX,Y[X]=∫X,YX∗P(X,Y)d(X,Y)=∫X∫YX∗P(X,Y)dXdY=∫XX∫YP(X,Y)dYdX=∫XX∗P(X)dX=EX[X]
倒数第二行是多维随机变量公式。
方差:用于衡量随机变量取值稳定性。
D(X)=E[X−E(X)]2=E(X2)−[E(X)]2 D(X)=\mathbb{E}[X-E(X)]^2=\mathbb{E}(X^2)-[\mathbb{E}(X)]^2 D(X)=E[X−E(X)]2=E(X2)−[E(X)]2
方差的性质:
- 常数的方差为0;
- 设CCC为常数,XXX为随机变量,则D(C∗X)=C2D(X)D(C*X)=C^2D(X)D(C∗X)=C2D(X)
- 设X,YX,YX,Y是两个随机变量,则D(X±Y)=D(X)+D(Y)±2E{[X−E(X)][Y−E(Y)]} D(X \pm Y) = D(X) + D(Y) \pm 2\mathbb{E}\{[X - \mathbb{E}(X)][Y - \mathbb{E}(Y)]\} D(X±Y)=D(X)+D(Y)±2E{[X−E(X)][Y−E(Y)]}当X,YX,YX,Y独立,有D(X±Y)=D(X)+D(Y) D(X \pm Y) = D(X) + D(Y) D(X±Y)=D(X)+D(Y)
协方差:用于衡量随机变量之间的依赖关系。
假设有随机变量X,YX,YX,Y,其协方差表示为:
cov(X,Y)=E[X−E(X)][Y−E(Y)] cov(X,Y)=\mathbb{E}{ [X-E(X)][Y-E(Y)] } cov(X,Y)=E[X−E(X)][Y−E(Y)]
七、极大似然估计
就是根据样本数据,来估计出分布中可能性最大的参数。
具体步骤如下:
- 写出似然函数;
- 对似然函数取对数,并整理;
- 关于参数求导数;
- 解似然方程得到参数的值。
似然函数:离散的时候,就等于P(x∣θ)P(x|\theta)P(x∣θ),而连续的时候,则是其密度函数f(x∣θ)f(x|\theta)f(x∣θ)。(常常省略参数θ\thetaθ)
其中,里面的θ\thetaθ表示所要求的概率分布的参数。
极大似然估计有一个假设:样本之间独立同分布。


八、信息熵
描述信息源各可能事件发生的不确定性。
H(X)=−∑i=1nP(xi)log2P(xi)=−E[log2P(X)] H(X)=-\sum_{i=1}^{n}P(x_i)log_2P(x_i)=-E[log_2P(X)] H(X)=−i=1∑nP(xi)log2P(xi)=−E[log2P(X)]
九、KL散度(相对熵)
一种用于衡量两个概率分布之间的差异的指标。
KL(q∣∣p)=∑q(x)logq(x)p(x)=∫q(x)logq(x)p(x)dx KL(q||p)=\sum q(x)log\frac{q(x)}{p(x)}=\int q(x)log\frac{q(x)}{p(x)}dx KL(q∣∣p)=∑q(x)logp(x)q(x)=∫q(x)logp(x)q(x)dx
性质:非负性,始终大于等于0,等于0表示两个概率分布相等;
性质:非对称性,KL(q∣∣p)KL(q||p)KL(q∣∣p)不等于KL(p∣∣q)KL(p||q)KL(p∣∣q)。
AtomGit 是由开放原子开源基金会联合 CSDN 等生态伙伴共同推出的新一代开源与人工智能协作平台。平台坚持“开放、中立、公益”的理念,把代码托管、模型共享、数据集托管、智能体开发体验和算力服务整合在一起,为开发者提供从开发、训练到部署的一站式体验。
更多推荐



所有评论(0)