3.1 为什么要使用概率?

3.2 随机变量

3.3 概率分布

3.3.1 离散型变量和概率质量函数
  • 离散型变量的概率分布可以用概率质量函数(probabilit mass function, PMF)描述。
3.3.2 连续型变量和概率密度函数
  • 连续型随机变量的分布可以用概率密度函数(probability denstity function, PDF)表示。概率密度函数 p(x) <script type="math/tex" id="MathJax-Element-1">p(x)</script>并没有直接对特定的状态给出概率,而是给出落在面积为 δx <script type="math/tex" id="MathJax-Element-2">\delta x </script> 的无限小的区域内的概率为 p(x)δx <script type="math/tex" id="MathJax-Element-3">p(x)\delta x</script>

3.4边缘概率

3.5条件概率

3.6条件概率的链式法则

3.7独立性和条件独立性

3.8期望、方差和协方差

  • 期望,
    ExP[f(x)]=xP(x)f(x)
    <script type="math/tex; mode=display" id="MathJax-Element-4">\mathbb E_{x\sim P}[f(x)]=\sum_xP(x)f(x)</script>对于连续型:
    ExP[f(x)]=p(x)f(x)dx.
    <script type="math/tex; mode=display" id="MathJax-Element-5">\mathbb E_{x\sim P}[f(x)]=\int p(x)f(x)dx.</script>
  • 方差(variance)衡量的是当我们对 x <script type="math/tex" id="MathJax-Element-6">x</script>根据它概率分布进行采样时,随机变量x<script type="math/tex" id="MathJax-Element-7">x</script>的函数值会呈现多大的差异:
    Var((fx))=E[(f(x)E[f(x)])2]
    <script type="math/tex; mode=display" id="MathJax-Element-8">Var((fx))=\mathbb E[(f(x)-\mathbb E[f(x)])^2]</script>.方差的平方根被称为标准差。
  • 协方差(covariance)给出两个变量线性相关性的强度:

    Cov(f(x),g(y))=E[(f(x)E[f(x)])(g(y)E[g(y)])]
    <script type="math/tex; mode=display" id="MathJax-Element-9">Cov(f(x),g(y))=\mathbb E[(f(x)-\mathbb E[f(x)])(g(y)-\mathbb E[g(y)])]</script>协方差的绝对值大,意味着变量值变化很大并且它们同时距离各自的均值很远。

    • 若协方差为正,两个变量都倾向于同时取得相对较大的值
    • 若协方差为负,其中一个变量倾向于取得相对较大的值的同时,另一个变量倾向于取得较小的值,反之亦然。

    协方差矩阵(covariance matrix)是一个 n×n <script type="math/tex" id="MathJax-Element-10">n\times n </script>的矩阵。 协方差矩阵的对角元是方差:

    Cov(xi,xi)=Var(xi)
    <script type="math/tex; mode=display" id="MathJax-Element-11">Cov(x_i,x_i)=Var(x_i)</script>

3.9 常用概率分布

3.9.1 Bernoulli分布
  • Bernoulli分布是单个二值随机变量的分布。由单个参数 ϕ <script type="math/tex" id="MathJax-Element-12">\phi</script>控制,表示随机变量等于1的概率:
    P(x=1)=ϕ
    <script type="math/tex; mode=display" id="MathJax-Element-13">P(\mathrm x=1)=\phi</script>
    P(x=0)=1ϕ
    <script type="math/tex; mode=display" id="MathJax-Element-14">P(\mathrm x=0)=1-\phi</script>
    P(x=x)=ϕx(1ϕ)1x
    <script type="math/tex; mode=display" id="MathJax-Element-15">P(\mathrm x=x)=\phi^x(1-\phi)^{1-x}</script>
    Ex[x]=ϕ
    <script type="math/tex; mode=display" id="MathJax-Element-16">\mathbb E_\mathrm x[\mathrm x]= \phi </script>
    Varx(x)=ϕ(1ϕ)
    <script type="math/tex; mode=display" id="MathJax-Element-17">Var_x(x)=\phi(1-\phi)</script>
3.9.2 Multinoulli分布
  • Multinoulli分布或者范畴分布(categorycal distribution)是指在具有 k <script type="math/tex" id="MathJax-Element-18">k</script>个不同状态的单个离散型随机变量上的分布。

3.9.3 高斯分布

  • 高斯分布(Gaussian distribution)也称正态分布(normal distribution):
    N(x;μ,σ2)=12πσ2exp(12σ2(xμ)2)
    <script type="math/tex; mode=display" id="MathJax-Element-19">\mathcal N(x;\mu,\sigma^2)=\sqrt{\frac{1}{2\pi\sigma^2}}exp \left(-\frac{1}{2\sigma^2}(x-\mu)^2\right)</script>分布的均值 E[x]=μ <script type="math/tex" id="MathJax-Element-20">\mathbb E[x] = \mu</script>,分布的标准差用 σ <script type="math/tex" id="MathJax-Element-21">\sigma表示</script>,方差 σ2 <script type="math/tex" id="MathJax-Element-22">\sigma^2</script>。
  • 当我们缺乏关于某个实数上分布的先验知识而不知道采用哪种分布,选择正态分布的原因:
    • 很多分布的真实情况比较接近正态分布。
    • 在具有相同方差的所有概率分布中,正态分布在实数上具有最大的不确定性。
3.9.4指数分布和Laplace分布
  • 泊松分布:一个时间段内时间平均发生的次数(离散变量)
  • 指数分布:两件事发生的平均时间间隔。
    p(x;λ)=λ1x0exp(λx)
    <script type="math/tex; mode=display" id="MathJax-Element-23">p(x;\lambda)=\lambda\mathbf 1_{x\geq0 }exp(-\lambda x)</script>其中 1x0 <script type="math/tex" id="MathJax-Element-24">\mathbf 1_{x\geq0 }</script>是指示函数(indicator function),使得 x <script type="math/tex" id="MathJax-Element-25">x</script>取负值的概率为零。泊松分布和指数分布
  • Laplace分布:
    Laplace(x;μ,γ)=12γexp(|xμ|γ)
    <script type="math/tex; mode=display" id="MathJax-Element-26">Laplace(x;\mu,\gamma)=\frac{1}{2\gamma}exp\left(-\frac{|x-\mu|}{\gamma}\right)</script>
    其中 μ <script type="math/tex" id="MathJax-Element-27">\mu</script>是位置参数, γ <script type="math/tex" id="MathJax-Element-28">\gamma</script>尺度参数。
  • 正态分布用平均值 μ <script type="math/tex" id="MathJax-Element-29">\mu</script>的差的平方 (xμ)2 <script type="math/tex" id="MathJax-Element-30">(x-\mu)^2</script>。
  • Laplace用相对平均值的差的绝对值表示,尾部比正态分布更平坦。(声音辨识、JPEG压缩等)
    E(x)=μ
    <script type="math/tex; mode=display" id="MathJax-Element-31">\mathbb E(\mathrm x)=\mu</script>
    Var(x)=2σ2
    <script type="math/tex; mode=display" id="MathJax-Element-32">Var(\mathrm x)=2\sigma^2</script>拉普拉斯分布-百度百科
3.9.5 Dira分布和经验分布
  • 所有质量都集中在一点上。Dirac Delta函数:
    p(x)=δ(xμ)
    <script type="math/tex; mode=display" id="MathJax-Element-33">p(x)=\delta(x-\mu)</script>,信号与系统中很熟悉了。除0点外所有点的值都是0,但整体积分为1.
  • 经验分布(empirical distribution):
    p(x)=1mi=1mδ(xx(i))
    <script type="math/tex; mode=display" id="MathJax-Element-34">p(x)=\frac{1}{m}\sum_{i=1}^{m}\delta(x-x^{(i)})</script>将概率密度为 1mm <script type="math/tex" id="MathJax-Element-35">\frac{1}{m}的m个点中赋给每一个,给定采样</script>
3.9.6 混合模型
  • 常见的高斯混合模型(Gaussian Mixture Model),高斯混合模型是概率密度的万能近似器(universal approximator)。

3.10 常用函数的有用性质

  • logistic sigmoid函数:
    σ(x)=11+exp(x)
    <script type="math/tex; mode=display" id="MathJax-Element-36">\sigma(x)=\frac{1}{1+exp(-x)}</script>,通常用来生成Bernoulli分布中的参数,(即得出分类的概率)。logistic 回归
  • softplus函数(softplus function):
    ζ(x)=log(1+exp(x))
    <script type="math/tex; mode=display" id="MathJax-Element-37">\zeta(x)=log(1+exp(x))</script>,可以用来产生正态分布的 βσ <script type="math/tex" id="MathJax-Element-38">\beta和\sigma</script>参数。来源于 x+=max(0,x) <script type="math/tex" id="MathJax-Element-39">x^+=max(0,x)</script>softplus Relu
  • 两者之间:
    σ(x)=exp(x)exp(x)+exp(0)
    <script type="math/tex; mode=display" id="MathJax-Element-40">\sigma(x)=\frac{exp(x)}{exp(x)+exp(0)}</script>等公式见书。

3.11贝叶斯规则

常用:

P(x|y)=P(x)P(y|x)P(y)
<script type="math/tex; mode=display" id="MathJax-Element-41">P(x|y)=\frac{P(x)P(y|x)}{P(y)}</script>,具体百度贝叶斯,朴素贝叶斯等。
###3.12连续型变量的技术细节
假设两个随机变量 x <script type="math/tex" id="MathJax-Element-42">x</script>和y<script type="math/tex" id="MathJax-Element-43">y</script>满足 y=g(x) <script type="math/tex" id="MathJax-Element-44">y=g(x)</script>,是否 py(y)=px(g1(y)) <script type="math/tex" id="MathJax-Element-45">p_y(y)=p_x(g^{-1}(y))</script>成立?
不成立
举例子:假设 y=x2x(0,1) <script type="math/tex" id="MathJax-Element-46">y = \frac x 2, x\in(0,1)</script>如果令 py(y)=px(2y) <script type="math/tex" id="MathJax-Element-47">p_y(y)=p_x(2y)</script>,此时 py <script type="math/tex" id="MathJax-Element-48">p_y</script>除了区间(0, 12 <script type="math/tex" id="MathJax-Element-49">\frac 1 2</script>)之外都为0,并在这个区间等于1(与 px <script type="math/tex" id="MathJax-Element-50">p_x</script>一致).所以整个区间积分为 12 <script type="math/tex" id="MathJax-Element-51">\frac 1 2</script>,与概率密度定义矛盾。这是因为没有考虑引入函数 g <script type="math/tex" id="MathJax-Element-52">g</script>引起的空间变形。(点的密度不同)。为解决这一矛盾:对于实值向量x<script type="math/tex" id="MathJax-Element-53">x</script>和 y <script type="math/tex" id="MathJax-Element-54">y</script>:引入Jacobian矩阵进行微分扩展运算:
px(x)=py(g(x))det(g(x)x)
<script type="math/tex; mode=display" id="MathJax-Element-55">p_x(x)=p_y(g(x)) \left|det\left(\frac{\partial g(x)}{\partial x}\right)\right|</script>

3.13信息论

本科和研一学过太多了,略过0.0

  • KL散度(Kullback-Leibler(KL)divergence)衡量两个单独的概率分布 P(x) <script type="math/tex" id="MathJax-Element-56">P(x)</script> Q(x) <script type="math/tex" id="MathJax-Element-57">Q(x)</script>的差异:
    DKL(P||Q)=ExP[logP(x)Q(x)]=ExP[logP(x)logQ(x)]
    <script type="math/tex; mode=display" id="MathJax-Element-58">D_{KL}(P||Q)=\mathbb E_{x\sim P}\left[log \frac{P(x)}{Q(x)}\right]=\mathbb E_{x\sim P}\left[logP(x)-logQ(x)\right]</script>在离散型变量的情况下,KL散度衡量的是当一种能被设计成概率分布Q产生的消息的最小的编码,发送包含由概率P产生的符号的消息时,所需要的额外信息量。
    • KL散度非负。KL散度为0,且 P(x)Q(x) <script type="math/tex" id="MathJax-Element-59">P(x)和Q(x)为离散型变量是相同的分布。</script>

结构化概率模型

  • 有向(directed)图
  • 无向(undirected)图
    还没用到过,不太了解。tensorflow用的就是这种格式。

  • 方差 D=1N1Ni=1(xix¯)2 <script type="math/tex" id="MathJax-Element-176">D = \frac{1}{N-1}\sum_{i=1}^{N}(x_i-\bar x)^2</script>,因为N - 1 x¯ <script type="math/tex" id="MathJax-Element-177">\bar x </script>,用掉了一个自由度。
  • softplus是relu的扩展,处处可导
  • nerual style ,数据很小优化可以用LBFGS
Logo

北京人形旗下天工造物具身智能开源社区,聚焦具身天工与慧思开物两大平台

更多推荐