数学、统计与计算方法 / QT13

Markov 性与状态选择

从矩阵和隐藏状态反例判断当前状态是否足够,并重建后验状态。

Agent Markdown ↓

当前这一个数,真的够用吗?

我们每天都在压缩历史:把一串成交概括成最新价格,把一系列观察概括成某个“状态”。压缩本身没有错,问题是压缩以后还剩下多少预测信息。本篇要完成两件事:从一个给定的转移矩阵算出多步分布;再用一个反例检查“当前观测就是状态”是否成立。所需先修是条件概率、条件期望的塔式性质和矩阵乘法。

这里的概率都是明确构造的模型概率。转移图不会因为看起来像市场状态图,就自动获得现实解释。我们先把数学条件说完整,再决定某个观测量配不配叫作状态。

Markov 性要连同信息一起给出

令 \(E\) 为有限状态集,\((\mathcal F_n)\) 为过滤,\(X_n\) 是适应过程。相对于这个过滤的 Markov 性,是说对每个有界函数 \(f\colon E\to\mathbb R\),存在转移核,使

\[ E[f(X_{n+1})\mid\mathcal F_n] =(P_{n,n+1}f)(X_n). \]

左边可以利用全部已知历史,右边只保留当前状态。如果转移规律还不随日历时点改变,才称为时间齐次;此时记为同一个 \(P\)。Markov 性与时间齐次性是两个条件,不能合成一句“只依赖现在”。1

有一个容易漏掉的范围问题:只观察从某个初始分布出发的一条过程,条件期望等式只约束该分布能够到达的状态。它不能替不可达状态规定转移概率。以下直接给定每个状态的整行转移概率,并对每一个起点定义一条链,这构成我们采用的全初始状态 Markov family。比如可以逐步使用独立均匀随机数,按照当前行的概率选择下一状态。这样得到的矩阵幂是全状态陈述,而不是对未观测状态的外推。

两步转移为什么是矩阵乘法

采用两个状态,行是当前状态,列是下一状态:

当前状态下一期到状态 1下一期到状态 2两期后到状态 1两期后到状态 2
10.800.200.700.30
20.300.700.450.55

从状态 1 两步后回到状态 1,有两条互斥路线:\(1\to1\to1\) 和 \(1\to2\to1\)。所以概率为 \(.8\times.8+.2\times.3=.70\)。这不是假设两步无条件独立;第二步的分布由中间状态决定。

一般地,对任何起点 \(i\),先对中间状态求和,利用 Markov 性,有

\[ \begin{aligned} P_i(X_{m+n}=j) &=\sum_kP_i(X_m=k)\,P_k(X_n=j)\\ &=(P^mP^n)_{ij}. \end{aligned} \]

等价地,若 \((P_nf)(i)=E_i[f(X_n)]\),塔式性质给

\[ \begin{aligned} E_i[f(X_{m+n})] &=E_i\{E[f(X_{m+n})\mid\mathcal F_m]\}\\ &=E_i[(P_nf)(X_m)]\\ &=(P_mP_nf)(i). \end{aligned} \]

因而 \(P_{m+n}=P_mP_n\)。这是 Chapman–Kolmogorov 关系。全初始状态的设定允许我们对每个 \(i\) 写最后这个等式;若只给了一个初始分布,就不能无声抹去“几乎处处”的限制。

同样看到“+”,为什么预测还会不同

现在换一个模型。先抽取一个隐藏且以后不变的状态 \(H\in\{-,+\}\),先验各为 \(1/2\)。给定 \(H\) 后,各期观测 \(Y_1,Y_2,\ldots\) 条件独立,每次正确报告 \(H\) 的概率为 \(0.8\)。条件独立很重要:它正是下面把似然相乘的依据。

若历史是 \(++\),两个隐藏状态下出现这段历史的似然分别为 \(.8^2\) 与 \(.2^2\)。因此

\[ P(H=+\mid++)=\frac{.8^2}{.8^2+.2^2}=\frac{16}{17}. \]

若历史为 \(-+\),两边似然均为 \(.2\times.8\),后验仍为 \(1/2\)。下一次看到 \(+\) 的概率,要再对隐藏状态求平均,而不是直接把后验当作预测:

\[ \begin{aligned} P(Y_3=+\mid++) &=.8\frac{16}{17}+.2\frac1{17}=\frac{13}{17},\\ P(Y_3=+\mid-+)&=\frac12. \end{aligned} \]

这两段历史长度相同,当前观测都为 \(+\),却给出不同的下一期分布。因此 \(Y_n\) 本身相对于观测历史的自然过滤不是 Markov 过程。我们否定的是这个状态选择,不是说“任何带隐藏状态的模型都无法计算”。

历史当前观测隐藏状态为 + 的后验下一期为 + 的概率
+++16/1713/17
+--1/21/2
-++1/21/2
-1/174/17

把历史压成后验,而不是压成最后一个符号

令 \(\pi_n=P(H=+\mid Y_1,\ldots,Y_n)\)。已知当前后验 \(\pi\),看到新观测以后,Bayes 公式给出封闭递推:

\[ \pi^+=\frac{4\pi}{1+3\pi}, \qquad \pi^-=\frac{\pi}{4-3\pi}. \]

而下一次为 \(+\) 的概率是

\[ g(\pi)=\frac15+\frac35\pi. \]

于是后验状态以概率 \(g(\pi)\) 移动到 \(\pi^+\),以概率 \(1-g(\pi)\) 移动到 \(\pi^-\)。其转移只依赖当前后验;完整历史已经通过似然比积压缩到这个数里。这里“充分”仅指本模型对未来观测的条件分布,并不等于后验在任何金融模型中都是一个标量。

读图时先选择两段当前符号相同的历史,看后验和预测是否相同;然后改看后验状态。界面不会重新估计概率,它只是把上述固定模型的递推展开。无需交互,上面的公式和四行表已经足以重算。

迁移:记住最近两期就够了吗?

题目。 比较 \(+++\) 与 \(-++\)。它们最后两期都是 \(++\)。分别求隐藏状态为 \(+\) 的后验、下一期为 \(+\) 的概率,并判断状态 \((Y_{n-1},Y_n)\) 是否充分。再说明向状态加入整个历史为什么虽然可行,却未必是好的建模答案。

解析。 对 \(+++\),后验赔率为 \(4^3\),所以后验 \(64/65\),预测为

\[ \frac15+\frac35\frac{64}{65}=\frac{257}{325}. \]

对 \(-++\),赔率为 \(4^{-1}4^2=4\),所以后验 \(4/5\),预测为 \(17/25\)。两者仍不同,因此最近两期也不够。

完整历史当然包含自己,并能保留所有已知信息,但它的维数随时间增加,未解释什么可以安全丢掉。本例的后验递推给出了一个更小而闭合的状态。面对真实数据,找到类似压缩需要额外模型与检验,不能由这个构造反例直接宣布某个价格、波动率或神经网络隐状态已具有 Markov 性。


  1. MIT 6.436J/15.085J,Fall 2018,Lecture 21: Markov Chains,物理 pp.1–4:有限状态定义、齐次矩阵与多步转移。隐藏状态数例是另述教学构造,不是讲义中的实证。 ↩︎

动手试一试

隐藏状态与矩阵

这篇词条与哪些内容相连

图中汇集本篇及其段落的直接关系,具体使用位置见下方列表。箭头按关系名称阅读。例如“需要先修”指向需要掌握的内容;推荐阅读顺序另见本领域路线。

逐条查看关系与依据

KEEP ASKING

把这一页,变成一堂课。

专属 Prompt 与同源材料会一并复制。Agent 先读取指定文献,再围绕本页的材料、推导和练习展开教学。

READ TOGETHER

一起读,也一起把问题说清楚。

关于整篇的想法留在这里;某个推导、算例或表格的问题,可以点小节旁的“章说”,在原处展开讨论。

使用 GitHub 账号参与

本篇讨论

搜索笔记

让 Agent 教我

这里包含专属 Prompt 及本次学习范围的正文、案例、来源和图表说明,分支内容以当前选择为准。复制后粘贴到你常用的 Agent。