多变点位置的识别隐马尔科夫链方法
2021-10-25郭卫娟
郭卫娟
(湖北第二师范学院a.数学与经济学院;b.大数据建模与智能计算研究所,武汉 430205)
1 变点问题简介
变点序列数据是数理统计中经常遇见的一个序列,在该序列中,各个子部分的总体的分布并不是一样的,对于这类问题,通常的处理方式是先识别该序列中的变点的位置,然后就可以利用相邻的两个变点之间的分布是相同的,进而来估计该部分的分布。
其一般模型如下:

(1)


2 状态转移概率
为此建立如下模型:在时刻,定义状态(i=0,1,2,…,t-1)表示离t最近的前向变点位置在t-i位置上,记其概率为p(Ct=i|xt-1,xt-i+1,…xt-1),意思即xt-i,xt-i+1,…xi-1这个观测值是独立同分布,例如(Ct=0|xt-i,xt-i+1,…xt)表示xi-1是变点,i=t-1表示该序列无变点。这与传统的马尔科夫链相比,就是将隐马尔科夫链中有限个状态改成成了与当前时刻t相关的一个变量。这样将会导致转移概率矩阵维数无限增大,因此为了最大程度上简化状态转移概率矩阵,为此笔者再假设模型(1)满足如下特征:
p(Ct=i|xt-i,xt-i+1,…,xt-1)=p(Ct-k=i|xt-k-i,xt-k-i+1,…xt-k+1),
也就是连续的i个观测值是同一分布(大部分参考文献称该值为链长,用字母g表示)与该观测值的起点位置无关,这样,整个状态概率概率就简单的由链长的概率分布确定了。考虑到本文是从当前时刻开始,逐步向前查找最近的变点 ,若令p表示每个观察值可能是变点的概率,即
p(xi是变点)=p

=p(1-p)i-1i=0,1,2,…,t-1。即此时链长g服从几何分布Ge(p) 。
实际上为链长g可以为取值于i=0,1,2,…,t-1的任意离散型分布,同样可以计算该分布的生存函数。利用生存函数可以计算出各个状态之间的转移概率。
则有……
