稳健估计的基本理论
在前几章所述的线性平差模型中,均假定观测误差服从正态分布,即 \(\bm{\Delta}\sim N(0,\sigma_{0}^{2}\bm{Q})\)。但在实际平差模型中,观测误差中还包含有粗差,它并非服从正态分布。在这种情况下,如果不考虑粗差的存在,仍按最小二乘估计方法处理,不仅得不到最优无偏的估值,甚至会严重影响成果的质量。
在部分观测值中含有粗差情况下,稳健估计是一种优于最小二乘估计的方法,并已应用于测量平差实践中。
本章叙述研究稳健估计所必须了解的基本概念和理论。考虑到在测绘专业本科生教材《实用测量数据处理》(2000)和《高等测量平差》(2006)中已列入用稳健估计处理平差问题的实用方法,为避免重复,本章不再叙述。
统计稳健性
基本概念
稳健性是从英语“robustness”翻译过来的一个名词,含有强壮、健康、坚韧等意思。它是统计方法可能具有的一种特性。一般说来,是人们在构造统计方法时所努力追求的一种特性。对这种性质的确切含义,很难用三言两语说清楚。
在理论上解决一个统计问题时,要假定问题适合一定的统计模型。就是说样本的概率分布属于一定的分布族。在这个基础上,根据按问题的要求(估计某一参数,检验某一假设等)而选定的优良性准则或者直观上的考虑,提出一定的统计方法(一个点估计量,一个检验等)。
但在实际上情况比较复杂:往往没有足够的根据去确定问题的统计模型,即使有相当的根据去确定其模型,但往往也只能说是近似地成立而不是一丝不差地成立。例如,在一些情况下有理由认为模型近似地为正态,但很少可能是确切的正态。由于这一点,我们希望所使用的统计方法有如下的性质:当模型有微小的变化时,统计方法的性能也只受到微小的影响。若不然,针对模型为正态所构造的统计方法虽说在理论上有良好的性能,但在实用中可能完全不是那回事。统计方法的性能对模型的微小变化反映不敏感这样一种性质,一般就理解为统计方法的稳健性。
稳健性还有另一方面的含义:在实施任何一个统计方法时,必然要计算某个或某些统计量 \(T\) 的值。\(T\) 的值由样本 \(X_{1},\cdots,X_{n}\) 决定。在通过观测或试验以得到 \(X_{1},\cdots,X_{n}\) 的过程中,可能由于仪器故障或观测者的疏忽及记录时的笔误等,使 \(X_{1},\cdots,X_{n}\) 中的一个或几个包含了较重大的误差,称为过失误差或粗差。受到这种误差影响的数据,一般是以离开数据群体的孤立值的面目出现,常称为样本中的异常值。我们希望,当样本中混入少量异常值时,统计量 \(T\) 的值受到的影响不大。若不然,一两个数据的错误可以使统计分析的结论完全改观,这就会使人们对分析的可靠性产生疑问。具有这种性质的统计量 \(T\),或者说基于这种统计量 \(T\) 的统计方法称为有稳健性。
从一定意义上说,上述对稳健性的两种解释是相通的。因为当数据受到过失误差的污染时,该数据可被视为抽自另一个总体,其分布与模型原来所规定的分布不同。
传统的统计方法——样本均值、样本方差、最小二乘估计等往往是不稳健的,因而在实用上也是不安全的。一个“好”的稳健统计方法,在标称模型严格成立时,可以达到 \(90\%\) 到 \(95\%\) 的效率,也就是说,它们在标称模型下以牺牲 \(5\%\) 到 \(10\%\) 的效率作为代价,换来实用上的安全性。
"稳健"不等于"效率无损",二者是明码标价的交换。书上这段给出了量化:一个稳健方法即使在标称模型(假设严格成立)下,效率也只是最优方法的 \(90\%\) 到 \(95\%\),即主动让出 \(5\%\) 到 \(10\%\) 的效率。理解时有两点要注意:其一,这笔效率损失是在"模型完全正确"的前提下算的;一旦模型被污染(哪怕混入 \(5\%\) 粗差),最小二乘这类非稳健方法的效率会急剧恶化,而稳健方法几乎不受影响——按例 5-1-1 的表格,\(\varepsilon=0.05\) 时中位数已反超均值,把两边的风险加总,稳健方法的总账反而更好。其二,Huber 三条要求中第 (1) 条特意写明"不必在某种标准下为最优",正是为这种折衷留的余地:稳健估计追求的是"处处不太差",而不是"某处最优"。
例 5-1-1
设 \(F(x)\) 是一个关于原点对称的分布,\(\theta\) 为待估实参数,\(X_{1},\cdots,X_{n}\) 为抽自 \(F(x-\theta)\) 的独立同分布样本,要由它估计 \(\theta\)。
若有一定的理由假定 \(F\) 为正态——为简单计就设其为标准正态 \(\Phi(x)\),则样本均值 \(\overline{X}_{n}\) 是一个在种种意义上有优良性质的估计量。另一个可供选择的估计量是样本中位数 \(\widetilde{X}_{n}\)。众所周知,虽然当 \(F\) 严格地为正态时 \(\overline{X}_{n}\) 优于 \(\widetilde{X}_{n}\),但后者亦有它的优点。例如即使 \(F\) 的期望值不存在,它仍可以使用。现从稳健性的观点对二者作一些比较:
设 \(F\) 与正态有些差距。具体说,有形式 \[F(x-\theta)=(1-\varepsilon)\Phi(x-\theta)+\varepsilon\Phi\!\left(\frac{x-\theta}{\tau}\right) \tag{5-1-1}\] 此处,\(\tau>1\),\(0<\varepsilon<1\)。就是说,分布 \(F\) 是由 \((1-\varepsilon)\) 与 \(\varepsilon\) 的比例混合两个正态分布 \(N(\theta,1)\) 与 \(N(\theta,\tau^{2})\) 而成。由于 \(\varepsilon\) 很小,主要成分是前者,因而也被称为受污染的正态模型。从样本的角度看,可以把这理解为:在全部数据中有 \(100\varepsilon\%\) 受到粗差的影响而使误差增大了 \(\tau\) 倍(按方差为 \(1\) 的标准)。分布 (5-1-1) 仍关于 \(\theta\) 对称,有方差 \[\sigma^{2}=1-\varepsilon+\varepsilon\tau^{2}=1+(\tau^{2}-1)\varepsilon \tag{5-1-2}\] 及概率密度函数 \[f(x-\theta)=(1-\varepsilon)\varphi(x-\theta)+\frac{\varepsilon}{\tau}\,\varphi\!\left(\frac{x-\theta}{\tau}\right) \tag{5-1-3}\] 其中 \(\varphi(x)=\dfrac{1}{\sqrt{2\pi}}e^{-x^{2}/2}\)。
由中心极限定理知,当 \(n\rightarrow\infty\) 时,有 \[\sqrt{n}\,(\overline{X}_{n}-\theta)\rightarrow N(0,\sigma^{2}) \tag{5-1-4}\] 又由中位数的极限分布知,当 \(n\rightarrow\infty\) 时,有 \[\sqrt{n}\,(\widetilde{X}_{n}-\theta)\rightarrow N(0,C^{2}) \tag{5-1-5}\] 式中 \[C^{2}=\frac{1}{4f^{2}(0)}\] 考虑到 (5-1-3),可得 \[f(0)=(1-\varepsilon)\varphi(0)+\frac{\varepsilon}{\tau}\varphi(0) =\varphi(0)\!\left[1+\varepsilon\!\left(\frac{1}{\tau}-1\right)\right]\] 所以有 \[C^{2}=\frac{\pi}{2}\cdot\frac{1}{\left[1+\varepsilon\!\left(\dfrac{1}{\tau}-1\right)\right]^{2}} \tag{5-1-6}\]
二者的渐近相对效率为 \[e(\overline{X}_{n},\widetilde{X}_{n},\tau,\varepsilon)=\frac{\sigma^{2}}{C^{2}} \tag{5-1-7}\]
取 \(\tau=4\),根据 (5-1-2)、(5-1-6)、(5-1-7) 算出对若干 \(\varepsilon\) 值的渐近相对效率 \(e\) 为
| \(\varepsilon\) | 0.00 | 0.025 | 0.050 | 0.100 | 0.150 | 0.200 |
|---|---|---|---|---|---|---|
| \(e\) | 0.637 | 0.843 | 1.033 | 1.362 | 1.637 | 1.840 |
由此表看出,当 \(\varepsilon=0\) 即模型确为正态时,\(\overline{X}_{n}\) 对 \(\widetilde{X}_{n}\) 的渐近相对效率不到 \(2/3\)。而在 \(\varepsilon=0.05\),即样本中混入 \(5\%\) 的异常值时,\(\widetilde{X}_{n}\) 即已优于 \(\overline{X}_{n}\)。随着 \(\varepsilon\) 的增加,优势愈来愈显著。若 \(\tau=10\),即粗差更大时,只要 \(\varepsilon=0.006\),即样本中混入 \(0.6\%\) 的异常值,\(\widetilde{X}_{n}\) 即已优于 \(\overline{X}_{n}\)。这就说明,如果在该项实际应用中,较大的粗差有可能存在时,样本均值在理论上对样本中位数的优越性已没有多少现实意义。用稳健性的概念说,就是 \(\widetilde{X}_{n}\) 的稳健性优于 \(\overline{X}_{n}\)。
例 5-1-1 的表格是体会"稳健=抗粗差"的最佳入口。\(\varepsilon=0\)(模型确为正态)时,均值对中位数的渐近相对效率只有 \(0.637\),均值明显占优;可一旦混入 \(\varepsilon=0.05\)(\(5\%\),\(\tau=4\))的粗差,比值反超为 \(1.033\),中位数已经更优,而且 \(\varepsilon\) 越大优势越明显。直觉上看:均值对每个数据一视同仁地取平均,一个被拖到远处的异常值就能把均值整个拉走;而中位数只看"位置",左端或右端的异常值拉得再远,最多让它挪动一个名次。这正是后面影响函数要量化的东西——均值对单个观测的"话语权"无界,中位数的"话语权"有界。
在这里我们把统计方法的稳健性理解为其性能对模型的微小变化不敏感。但是一个统计方法如果只具备这种特点,并不一定有用。例如不管样本如何,总是用一个固定的常数去估计某参数。稳健则有之,无用亦显然。因此,稳健统计所追求的并非只具有稳健性的统计方法,而还要有其他良好的性能。Huber 曾提出一种见解:认为稳健统计的目标是寻求有如下性质的统计方法:
(1) 在实际模型与所假定的模型符合时,该方法具有良好的性能,但不必在某种标准下为最优的;
(2) 在实际模型与假定模型有少许差异时,其性能所受到的影响也较小;
(3) 在实际模型与所假定模型有严重偏离时,其性能仍“过得去”,或者说,不致使该方法变得无用甚至引人歧途。
(1)、(2) 两条的背景是:有一定的理由假定模型有某种形状(如正态),且即使实际情况与之有偏差,程度也不会大。要求所用的统计方法在这种情况下保持较良好的性能,则一方面有了稳健性,另一方面也有用。第 (3) 条则是要求该方法有较强的“抗差性”。做到这些要求所可能付出的代价是:当实际模型与假定模型符合时,方法不必具有最优性。
从实用的观点看,这三条要求看来是合理和适度的。不过也要注意到,它们仍只是一些含义不甚明确的说法。在个别情况下可以把问题表达成严密的数学形式并作出相应的解。但因所使用的最优准则的局限性,这类解的意义仍是有限的。
一个理论模型通常包含多方面的假定,如总体分布的样式、样本的独立性,以至参数的先验分布的形式等。在目前,稳健统计主要还只限于针对总体分布的形式。另外,稳健性在很大程度上只有相对的意义,以前面的例子来说,相对于 \(\overline{X}_{n}\) 而言,\(\widetilde{X}_{n}\) 有较好的稳健性,但不可能找到“最稳健的估计”之类的东西。而且所谓稳健性的比较,也往往是在某种范围和准则下进行的。如在前例中,对正态模型的偏离只考虑 (5-1-1) 的形式。在实用问题中,其他情况也有可能。所采取的准则是极限分布的方差比,当样本容量不大时,这种准则的合理性是可以讨论的。
统计函数
总体分布 \(F\) 的独立同分布样本为 \(X_{1},\cdots,X_{n}\),它的经验分布函数记为 \[F_{n}(x)= \begin{cases} 0, & x<X_{(1)}\\[2pt] \dfrac{j}{n}, & X_{(j)}\leq x<X_{(j+1)},\ j=1,\cdots,n-1\\[6pt] 1, & X_{(n)}\leq x \end{cases} \tag{5-1-8}\] 这里 \(X_{(1)}\leq X_{(2)}\leq\cdots\leq X_{(n)}\) 是将 \(X_{1},\cdots,X_{n}\) 按其大小顺序重新排列后得到的序列。
对于给定的样本 \(X_{1},\cdots,X_{n}\),\(F_{n}(x)\) 是一种分布函数,它是 \(x\) 的阶梯函数,其跳跃点为 \(X_{(1)},X_{(2)},\cdots,X_{(n)}\)。对于固定的 \(x\),\(F_{n}(x)\) 作为样本的函数,是一个统计量。经验分布函数 \(F_{n}(x)\) 是数据的统一概括和描述,从它可以恢复全部样本的值,只是失去了数据出现的先后次序。
对于充分大的 \(n\),经验分布函数 \(F_{n}(x)\) 是 \(F(x)\) 的很好的近似,即
(1) 对每个固定的 \(x\),\(F_{n}(x)\) 是 \(F(x)\) 的无偏、相合、渐近正态估计量(相合估计的概念参见本章 5.2 节);
(2) 从整体上,可以用柯尔莫哥洛夫距离 \[d(F_{n},F)=\sup_{x}|F_{n}(x)-F(x)| \tag{5-1-9}\] 度量 \(F_{n}(x)\) 与 \(F(x)\) 的接近程度。
对一维分布函数 \(F(x)\),分位数函数被定义为 \[Q(u)=F^{-1}(u)=\inf\{x:F(x)\geq u\}\quad(0<u<1) \tag{5-1-10}\] 对于严格单调的连续分布函数 \(F(x)\),\(F^{-1}(u)\) 就是 \(F(x)\) 的反函数。
对于一维总体分布 \(F\) 的给定样本 \(X_{1},\cdots,X_{n}\),样本分位数函数可以定义为 \[Q_{n}(u)=F_{n}^{-1}(u),\quad 0<u<1 \tag{5-1-11}\] 这时 \(Q_{n}(u)\) 是分段函数: \[Q_{n}(u)=X_{(j)},\quad \frac{j-1}{n}<u\leq\frac{j}{n},\ (j=1,\cdots,n) \tag{5-1-12}\]
尽管在不同的文献中,样本分位数的定义并不完全相同,但通常彼此是渐近等价的。本书在实际计算样本分位数时,采用对 (5-1-12) 式略作修改的公式: \[Q_{n}(u)= \begin{cases} \dfrac{1}{2}\left[X_{([nu]+1)}+X_{(n-[n(1-u)])}\right], & nu\text{ 为整数}\\[10pt] X_{([nu]+1)}, & nu\text{ 不为整数,}\ u<\dfrac{1}{2}\\[6pt] X_{(n-[n(1-u)])}, & nu\text{ 不为整数,}\ u>\dfrac{1}{2} \end{cases} \tag{5-1-13}\] 其中,\([t]\) 表示 \(t\geq0\) 时,舍去小数点以后部分剩下的整数部分。对于 \(n=10\),中位数 \(Q_{n}\!\left(\dfrac{1}{2}\right)=\dfrac{1}{2}\left(X_{(5)}+X_{(6)}\right)\),分位数 \(Q_{n}\!\left(\dfrac{1}{4}\right)=X_{(3)}\),分位数 \(Q_{n}\!\left(\dfrac{3}{4}\right)=X_{(8)}\)。
式 (5-1-13) 的三种情形系据原书扫描件转录。当 \(nu\) 不为整数时,\([nu]+1=n-[n(1-u)]\),故第二、三种情形取同一顺序统计量,仅按 \(u\) 与 \(1/2\) 的大小关系加以区分;当 \(nu\) 为整数时取两侧顺序统计量的平均。据此核对文中 \(n=10\) 的实例:\(Q_n(1/2)=\tfrac{1}{2}(X_{(5)}+X_{(6)})\)、\(Q_n(1/4)=X_{(3)}\)、\(Q_n(3/4)=X_{(8)}\),均吻合。
下面我们引入统计函数的定义。记 \(k\) 维分布函数的全体为 \(\mathcal{F}\),在 \(\mathcal{F}\) 的某个子集上有定义的函数(泛函)\(T(F)\) 称为统计函数(统计泛函)。
如果 \(\psi(x)\) 是欧氏空间 \(\mathbb{R}^{k}\) 上的有界函数,且 \[T(F)=E(\psi(x))=\int\psi(x)\,\mathrm{d}F(x) \tag{5-1-14}\] 有意义,则 \(T(F)\) 是统计函数,且有以下性质:
(1) 如果 \(F\) 的密度函数是 \(f(x)\),则 \[T(F)=\int\psi(x)\,\mathrm{d}F(x)=\int\psi(x)f(x)\,\mathrm{d}x \tag{5-1-15}\]
(2) 如果 \(F\) 是单点分布 \(\delta_{x_{0}}(x)\),全部概率质量都落在 \(x_{0}\) 上,则 \[T(\delta_{x_{0}})=\int\psi(x)\,\mathrm{d}\delta_{x_{0}}(x)=\psi(x_{0}) \tag{5-1-16}\]
(3) \[T(\alpha G+\beta H)=\alpha T(G)+\beta T(H) \tag{5-1-17}\] 即 \[\int\psi(x)\,\mathrm{d}(\alpha G+\beta H)=\alpha\int\psi(x)\,\mathrm{d}G+\beta\int\psi(x)\,\mathrm{d}H \tag{5-1-18}\]
(4) 因 \(F_{n}(x)=\dfrac{1}{n}\sum\limits_{i=1}^{n}\delta_{X_{i}}(x)\),所以 \[T(F_{n})=\int\psi(x)\,\mathrm{d}F_{n}(x)=\frac{1}{n}\sum_{i=1}^{n}\psi(X_{i}) \tag{5-1-19}\]
(5) 设 \(a\) 是一维分布函数 \(F(x)\) 的连续点,则 \[\int_{-\infty}^{a}\psi(x)\,\mathrm{d}F(x)=\int_{0}^{F(a)}\psi(F^{-1}(u))\,\mathrm{d}u\] 当 \(a\rightarrow\infty\) 时,有 \[\int_{-\infty}^{\infty}\psi(x)\,\mathrm{d}F(x)=\int_{0}^{1}\psi(F^{-1}(u))\,\mathrm{d}u\]
例 5-1-2
某些统计量的统计函数表示
(1) 样本均值 \[\overline{X}_{n}=\int x\,\mathrm{d}F_{n}=T(F_{n})\] 总体均值 \[\mu=T(F)=\int x\,\mathrm{d}F\]
(2) 样本方差 \[\hat{\sigma}_{n}^{2}=\frac{1}{n}\sum_{i=1}^{n}(X_{i}-\overline{X}_{n})^{2} =\int(x-\overline{X}_{n})^{2}\,\mathrm{d}F_{n}\] 总体方差 \[\sigma^{2}=\int(x-\mu)^{2}\,\mathrm{d}F\]
(3) 样本分位数 \[Q_{n}(u)=F_{n}^{-1}(u)\] 总体分位数 \[Q(u)=F^{-1}(u)\]
(4) 密度函数 \(f(x,\theta)\) 的参数 \(\theta\) 的极大似然估计 \(\hat{\theta}_{n}\) 是方程 \[\frac{1}{n}\sum_{i=1}^{n}\psi(X_{i},\theta)=0\] 即 \[\int\psi(x,\theta)\,\mathrm{d}F_{n}=0\] 的解,其中 \(\psi(x,\theta)=\dfrac{\partial\ln f(x,\theta)}{\partial\theta}\),因此 \(\hat{\theta}_{n}=T(F_{n})\)。
许多重要的统计量可以表示为经验分布函数 \(F_{n}\) 的统计函数。近代估计理论中,将待估的参数 \(\theta\) 表示为统计函数 \(\theta=T(F)\),然后以经验分布代替总体分布 \(F\),得到估计量 \(\hat{\theta}_{n}=T(F_{n})\)。由于经验分布 \(F_{n}\) 是总体分布函数 \(F\) 的合理估计,在多种意义下,当 \(n\rightarrow\infty\) 时,\(F_{n}\) 收敛于 \(F\),只要统计函数 \(T(\cdot)\) 在 \(F\) 的附近满足一定的条件,\(F\) 本身满足一定的正则条件,则 \(T(F_{n})\) 也收敛于 \(T(F)\),因此 \(\hat{\theta}_{n}\) 是 \(\theta\) 的相合估计。参数 \(\theta\) 可以表示为不同的统计函数形式,相应地有种种估计量。从而可以将对于估计量的比较、选择和设计,归结为对于它们的统计函数的比较、选择和设计。从本章以后的内容可以看出,要设计(或说构造)位置参数的一个稳健估计,最终又归结为设计(或说构造)一个 \(\psi\) 函数,使它们具有一定的形状。\(\psi\) 函数只是普通意义下的函数。
本节把估计量一律写成"统计函数在经验分布上的取值" \(\hat{\theta}_{n}=T(F_{n})\),并指出极大似然估计正是方程 \(\int\psi(x,\theta)\,\mathrm{d}F_{n}=0\) 的解——这条"以似然为纲"的路线,在《最优估计基础》第2章"极大似然估计"一节有系统展开(似然方程、对数似然函数、正态模型下的闭式解);该书第2章"最小二乘估计"一节则给出了 \(\bm{V}^{T}\bm{P}\bm{V}=\min\) 的对应准则。到本章 5-3 节,\(M\) 估计将把这里的 \(\psi\) 从"似然函数的对数导数"放宽为任意选定的函数,稳健性设计随之归结为"选一个形状合适的 \(\psi\)"。
敏感度曲线、影响曲线和刀切法
设 \(\hat{\theta}\) 是估计量,\(\hat{\theta}=T(X_{1},X_{2},\cdots,X_{n})\),则称 \[SC_{n}(x)=\frac{T_{n+1}(X_{1},\cdots,X_{n},x)-T_{n}(X_{1},\cdots,X_{n})}{1/(n+1)} \tag{5-1-20}\] 这里,\(T_{n+1}(X_{1},\cdots,X_{n},x)\) 为增加样本值 \(x\) 后得到的估计量。
函数 \(SC_{n}(x)\) 称为估计量 \(\hat{\theta}_{n}\) 的敏感度曲线(敏感度函数)。它反映对于增加的 \(x\) 值,估计量的敏感程度。
例 5-1-3
样本均值的敏感度曲线
样本均值 \[T_{n}(X_{1},\cdots,X_{n})=\frac{1}{n}\sum_{i=1}^{n}X_{i}\] \[SC_{n}(x)=\frac{x-\overline{X}_{n}}{1/(n+1)}\] 这个敏感度曲线是无界的。当 \(x\rightarrow+\infty\) 时,\(SC_{n}(x)\rightarrow+\infty\);当 \(x\rightarrow-\infty\) 时,\(SC_{n}(x)\rightarrow-\infty\)。因此,样本均值对于离群值是极其敏感的。
设估计量或检验统计量有统计函数表示 \(T(F)\),令 \(F_{\varepsilon}=(1-\varepsilon)F+\varepsilon\delta_{x}\),则称 \[IC(x;F,T)=\lim_{\varepsilon\rightarrow 0^{+}}\frac{T(F_{\varepsilon})-T(F)}{\varepsilon} =\left.\frac{\mathrm{d}T(F_{\varepsilon})}{\mathrm{d}\varepsilon}\right|_{\varepsilon=0} \tag{5-1-21}\] 为 \(T(F)\) 的影响曲线(影响函数)。
例 5-1-4
样本均值的影响曲线
样本均值 \[\overline{X}_{n}=\int x\,\mathrm{d}F_{n}=T(F_{n}),\qquad T(F)=\int x\,\mathrm{d}F\] \[T((1-\varepsilon)F+\varepsilon\delta_{x})=(1-\varepsilon)T(F)+\varepsilon T(\delta_{x}) =(1-\varepsilon)T(F)+\varepsilon x\] \[IC(x;F,T)=x-T(F)\] 影响曲线反映了单个观测值对于统计函数的影响。上例中,样本均值的影响函数是无界的。因此单个离群值就可以有破坏性的影响。要抵抗这种破坏作用,就要影响函数是有界的。
补例 5-1-4 影响曲线的推导。对均值 \(T(F)=\int x\,\mathrm{d}F\),利用 (5-1-17) 式的线性性与 (5-1-16) 式 \(T(\delta_{x})=x\): \[T(F_{\varepsilon})=T\bigl((1-\varepsilon)F+\varepsilon\delta_{x}\bigr) =(1-\varepsilon)T(F)+\varepsilon T(\delta_{x}) =(1-\varepsilon)\mu+\varepsilon x\] 代入定义 (5-1-21): \[IC(x;F,T)=\lim_{\varepsilon\to0^{+}}\frac{\bigl[(1-\varepsilon)\mu+\varepsilon x\bigr]-\mu}{\varepsilon} =\lim_{\varepsilon\to0^{+}}\frac{\varepsilon(x-\mu)}{\varepsilon}=x-\mu\] 即例 5-1-4 的结果。\(IC=x-\mu\) 是 \(x\) 的线性函数,无界,故单个 \(|x|\to\infty\) 的观测对均值的拉动没有上限。敏感度曲线 \(SC_{n}\)(例 5-1-3)与影响曲线 \(IC\)(例 5-1-4)是同一件事的两个层次:\(SC_{n}\) 用经验分布 \(F_{n}\),描述有限样本下新增一个观测的影响;\(IC\) 用总体分布 \(F\),描述渐近情形;令 \(n\to\infty\)、\(F_{n}\to F\),\(SC_{n}\) 即收敛到 \(IC\)。因此"敏感度曲线无界"与"影响函数无界"说的是同一条性质:估计对离群值敏感。
影响曲线的绝对值的最大值 \[\sup_{x}|IC(x;F,T)| \tag{5-1-22}\] 称为过失误差敏感度。
影响曲线可用来简单、直观地评价估计量的渐近性质。当统计函数 \(T(\cdot)\) 满足适当的正则条件时,\(\sqrt{n}\,(T(F_{n})-T(F))\) 渐近于正态分布 \(N(0,A(F,T))\),其中 \(A(F,T)\) 为渐近方差: \[A(F,T)=\int[IC(x;F,T)]^{2}\,\mathrm{d}F \tag{5-1-23}\] 影响曲线是稳健统计的重要理论工具。它脱离开具体的样本,由估计量的统计函数表达式导出,影响函数可用以比较评价估计量的稳健性。
影响函数可形象地理解为"单个观测的话语权曲线":\(IC(x;F,T)\) 回答"在总体中额外放一个位于 \(x\) 的观测,估计值会被推动多少(按污染比例 \(\varepsilon\) 归一化)"。均值的 \(IC=x-\mu\) 是一条无界的直线——\(x\) 离中心越远话语权越大,粗差能轻易劫持均值;5-2 节例 5-2-8 将看到,中位数的 \(IC\) 是两段水平线 \(\pm\dfrac{1}{2f(\text{中位数})}\),\(x\) 跑得再远话语权也被封顶,这就是"影响函数有界即抗差"的直观含义。(5-1-23) 式 \(A(F,T)=\int[IC(x;F,T)]^{2}\,\mathrm{d}F\) 还说明影响函数不只是定性工具:它的平方积分决定渐近方差,稳健性与效率在这里统一——这正是后面 Huber 型 \(\psi\)"既有界又不失效率"的设计依据。
由例 5-1-3 及例 5-1-4 可以看出,影响曲线是敏感度曲线当样本大小 \(n\) 趋于无穷时的极限。
利用著名的刀切法也可以得到影响曲线在有限样本下的差商近似。
考虑估计量 \(T(X_{1},\cdots,X_{n})\) 的第 \(i\) 个刀切伪值 \[T_{i*}=nT(X_{1},\cdots,X_{n})-(n-1)T_{(n-1)}(X_{1},\cdots,X_{i-1},X_{i+1},\cdots,X_{n})\]
其中 \(T_{(n-1)}(X_{1},\cdots,X_{i-1},X_{i+1},\cdots,X_{n})\) 是从样本中切去 \(X_{i}\) 后的估计值。样本 \(X_{1},\cdots,X_{n}\) 中数据 \(X_{i}\) 的影响,可以用 \(F_{n}\) 代替 \(F\) 及令 \(\varepsilon=-1/(n-1)\),得到 \(IC(x_{i};F_{n},T)\) 的差商来近似
\[\begin{aligned} \frac{T\!\left(F_{n}-\dfrac{1}{n-1}\delta_{x_{i}}\right)-T(F_{n})}{1/(n-1)} &=(n-1)\left\{T(X_{1},\cdots,X_{n})\right.\\ &\qquad\left.-T_{(n-1)}(X_{1},\cdots,X_{i-1},X_{i+1},\cdots,X_{n})\right\}\\ &=T_{i*}-T(X_{1},\cdots,X_{n}) \end{aligned}\]
估计量 \(T(X_{1},\cdots,X_{n})\) 的刀切方差估计为 \[\widehat{\mathrm{var}}\left(T(X_{1},\cdots,X_{n})\right) =\frac{1}{n(n-1)}\sum_{i=1}^{n}\left(T_{i*}-\overline{T}_{*}\right)^{2}\] 其中刀切平均 \(\overline{T}_{*}=\dfrac{1}{n}\sum\limits_{i=1}^{n}T_{i*}\)。刀切方差估计值,不依赖于分布 \(F\) 的具体形式,完全由样本值确定。
影响曲线的有限样本近似,例如敏感度曲线等,不依赖于对真实分布的假定,可以得到给定样本的各个数据对于估计值的影响的大小。
稳健性的数学描述
在讨论统计量稳健性之前,先介绍两个关于随机变量序列收敛性的概念。
(1)几乎处处收敛
设 \((\Omega,\mathcal{A},\mu)\) 是一个测度空间,如果一个定义或一种关系除掉一个测度为零的集 \(N\) 以外处处成立,我们就称为关于 \(\mu\) 几乎处处成立,记作 \(\mu\)-a.e. 或 a.e.,称 \(N\) 为类外集。
限于篇幅,这里无法深入讨论关于测度的理论。但是可以把 \(\Omega\) 理解为基本事件空间,\(\mathcal{A}\) 为由以 \(\Omega\) 的一切子集为元素构成的集类,\(\mu\) 为概率。
设 \(\{f_{n}\}\) 是一个函数序列,\(f\) 是一个函数,若存在 \(N\in\mathcal{A}\),\(\mu(N)=0\),使得对于每一个 \(x\in N^{c}\)(\(N\) 为 \(N\) 的余集),有 \[f_{n}(x)\rightarrow f(x)\quad(n\rightarrow\infty)\] 则称 \(\{f_{n}\}\) 几乎处处收敛于 \(f\),记作 \(f_{n}\rightarrow f,\ \text{a.e.}\) 或 \(\lim\limits_{n\rightarrow\infty}f_{n}=f,\ \text{a.e.}\)。
对于随机变量序列 \(\{X_{n}\}\) 及随机变量 \(X\),当 \(X_{n}\rightarrow X,\ \text{a.e.}\) 时,通常代替“\(X_{n}\) 几乎处处收敛于 \(X\)”而称为“\(X_{n}\) 几乎必然收敛于 \(X\)”,记作 \(X_{n}\rightarrow X,\ \text{a.s.}\) 或 \(\lim\limits_{n\rightarrow\infty}X_{n}=X,\ \text{a.s.}\)。
(2)依概率收敛
设 \(\{X_{n}\}\) 是随机变量序列,\(X\) 是随机变量,如果对于任意 \(\varepsilon>0\),有 \[\lim_{n\rightarrow\infty}P(|X_{n}-X|\geq\varepsilon)=0\] 则称 \(X_{n}\) 依概率收敛于 \(X\)。
分布函数的距离
如前所述,稳健性考虑的是:当实际模型的分布与理论模型的分布有差异时,统计方法的性能受到的影响程度。分布之间的差异可以用适当的距离去刻画:当分布的距离大(小)时,其差异就大(小)。有若干种距离的概念可以刻画分布间的差异,如柯尔莫哥洛夫距离(由 (5-1-9) 定义),还有勒维距离、普洛霍洛夫距离等。下面介绍勒维距离。
设 \(F\) 和 \(G\) 都是一维分布函数,则勒维距离定义为 \[d_{L}(F,G)=\inf\{\varepsilon:\ \varepsilon>0;\ \text{对一切 }x\text{ 有 }F(x-\varepsilon)-\varepsilon\leq G(x)\leq F(x+\varepsilon)+\varepsilon\} \tag{5-2-1}\] 式 (5-2-1) 可用图 5-1 帮助理解。
原书此处有图 5-1(勒维距离定义示意图),系扫描图件,本重排本未收录。该图大意是:对每一点 \(x\),在纵轴方向作出以 \(F(x)\) 为中心、宽 \(2\varepsilon\) 高 \(2\varepsilon\) 的矩形(横轴上标出 \(x-\varepsilon\)、\(x\)、\(x+\varepsilon\) 三个点),若 \(G(x)\) 处处落于该矩形的上下两边即 \(F(x-\varepsilon)-\varepsilon\) 与 \(F(x+\varepsilon)+\varepsilon\) 之间,则此 \(\varepsilon\) 可用。
任取 \(\varepsilon>0\),在每一点 \(x\) 作出图 5-1 所示的矩形,若在每点均有 \(F(x-\varepsilon)-\varepsilon\leq G(x)\leq F(x+\varepsilon)+\varepsilon\),即 \(G(x)\) 落在此矩形的上下两边之间,则称此 \(\varepsilon\) 可用。所有可用的 \(\varepsilon\) 形成一个集合。勒维距离 \(d_{L}\) 是这个集合中所有元素的下确界。
勒维距离有如下基本性质:
以 \(\mathcal{F}\) 记一切一维概率分布所构成的类,则定义在 \(\mathcal{F}\times\mathcal{F}\) 上的函数 \(d_{L}(F,G)\) 满足距离空间的三条公理,且 \[d_{L}(F_{n},F)\rightarrow 0\iff F_{n}\rightarrow F \tag{5-2-2}\] 这里 \(F_{n}\rightarrow F\) 的意思是:对于 \(F\) 的任一连续点 \(x\),有 \(\lim\limits_{n\rightarrow\infty}F_{n}(x)=F(x)\)。通常称为“\(F_{n}\) 弱收敛于 \(F\)”。
为了帮助理解分布距离的概念,下面给出勒维距离的上述性质的证明。
证明:首先,若 \(F=G\),则由 (5-2-1) 式显然有 \(d_{L}(F,G)=0\);反过来,若 \(d_{L}(F,G)=0\),则对任给的 \(\varepsilon>0\),有 \[F(x-\varepsilon)-\varepsilon\leq G(x)\leq F(x+\varepsilon)+\varepsilon\] 若 \(x\) 是 \(F\) 的连续点,则令 \(\varepsilon\rightarrow 0\),得 \(F(x)=G(x)\)。由此即得 \(F=G\)。
又若 \[F(x-\varepsilon)-\varepsilon\leq G(x)\leq F(x+\varepsilon)+\varepsilon\] 则左边一式中以 \(x+\varepsilon\) 代替 \(x\);在右边一式中以 \(x-\varepsilon\) 代替 \(x\),得到 \[G(x-\varepsilon)-\varepsilon\leq F(x)\leq G(x+\varepsilon)+\varepsilon\] 于是得 \(d_{L}(G,F)=d_{L}(F,G)\)。
最后,若 \(F\)、\(G\)、\(H\) 为三个分布函数,而 \(\varepsilon_{1}>0\)、\(\varepsilon_{2}>0\),使得 \[F(x-\varepsilon_{1})-\varepsilon_{1}\leq G(x)\leq F(x+\varepsilon_{1})+\varepsilon_{1} \tag{5-2-3}\] \[G(x-\varepsilon_{2})-\varepsilon_{2}\leq H(x)\leq G(x+\varepsilon_{2})+\varepsilon_{2} \tag{5-2-4}\] 在 (5-2-3) 式的右边一式中以 \(x+\varepsilon_{2}\) 代 \(x\),并将所得的结果与 (5-2-4) 式的右边一式结合,得到 \[H(x)\leq F(x+\varepsilon_{1}+\varepsilon_{2})+\varepsilon_{1}+\varepsilon_{2}\] 类似地,由 (5-2-3)、(5-2-4) 左边的不等式得到 \[H(x)\geq F(x-\varepsilon_{1}-\varepsilon_{2})-\varepsilon_{1}-\varepsilon_{2}\] 由此不难推出 \[d_{L}(F,H)\leq d_{L}(F,G)+d_{L}(G,H)\] 这就证明了 \(d_{L}(F,G)\) 满足距离的三个公理。
下面证明 (5-2-2) 式。设 \(d_{L}(F_{n},F)\rightarrow 0\),给定 \(\varepsilon>0\) 及 \(F\) 的连续点 \(x_{0}\),找 \(\eta\ (0<\eta<\varepsilon/2)\),使 \(|F(x_{0}\pm\eta)-F(x_{0})|<\varepsilon/2\)。求 \(n_{0}=n_{0}(\varepsilon)\) 充分大,使当 \(n\geq n_{0}\) 时,有 \(d_{L}(F_{n},F)<\eta\)。于是根据 (5-2-1) 式,当 \(n\geq n_{0}\) 时,有 \[F(x_{0}-\eta)-\eta\leq F_{n}(x_{0})\leq F(x_{0}+\eta)+\eta\] 因此,当 \(n\geq n_{0}\) 时,有 \[F_{n}(x_{0})\leq F(x_{0})+\frac{\varepsilon}{2}+\eta\leq F(x_{0})+\varepsilon\] 这就证明了 \(\lim\limits_{n\rightarrow\infty}F_{n}(x_{0})=F(x_{0})\)。因而证明了 \(F_{n}\rightarrow F\)。反过来,设 \(F_{n}\rightarrow F\)。任给 \(\varepsilon>0\),取 \(F\) 的连续点 \(x_{0}<x_{1}<\cdots<x_{m}\),使 \(F(x_{0})<\varepsilon\),\(F(x_{m})>1-\varepsilon\),\(x_{i}-x_{i-1}<\varepsilon\ (i=1,2,\cdots,m)\)。取 \(N=N(\varepsilon)\) 充分大,使当 \(n>N\) 时,有 \[|F_{n}(x_{i})-F(x_{i})|<\varepsilon\quad(i=0,1,\cdots,m)\] 现任取 \(x\),若对某个 \(i\) 有 \(x_{i-1}\leq x\leq x_{i}\),则 \[F_{n}(x)\leq F_{n}(x_{i})\leq F(x_{i})+\varepsilon\leq F(x+\varepsilon)+\varepsilon\] \[F_{n}(x)\geq F_{n}(x_{i-1})\geq F(x_{i-1})-\varepsilon\geq F(x-\varepsilon)-\varepsilon\] 不难看出,当 \(x\leq x_{0}\) 及 \(x\geq x_{m}\) 时,此两式也成立,因而证明了 \[\text{当 }n\geq N(\varepsilon)\text{ 时,}\quad d_{L}(F_{n},F)\leq\varepsilon\] 即 \(d_{L}(F_{n},F)\rightarrow 0\),于是完成了定理的证明。
在 \(k\) 维分布函数类 \(\mathcal{F}_{k}\) 上,可以定义普洛霍洛夫距离 \[d_{P}(F,G)=\inf\{\varepsilon\,|\,F(A)\leq G(A^{\varepsilon})+\varepsilon,\ \text{对所有波雷尔可测集 }A\} \tag{5-2-5}\] 其中 \(A^{\varepsilon}=\{x\in\mathbb{R}^{k}\,|\,\inf_{y\in A}d(x,y)\leq\varepsilon\}\)。
可以证明普洛霍洛夫距离 \(d_{P}\) 满足距离的三个公理,而且按 \(d_{P}\) 收敛就是 \(k\) 维分布函数的弱收敛,即 \(d_{P}(F_{n},G)\rightarrow 0\),等价于分布函数序列 \(F_{n}\) 弱收敛于 \(G\)。
一维分布函数之间的距离有下述关系: \[d_{L}(F,G)\leq d_{P}(F,G),\qquad d_{L}(F,G)\leq d_{K}(F,G)\] 记估计量 \(T_{n}=T(X_{1},\cdots,X_{n})\) 在实际分布 \(F\) 下的分布为 \(f_{F}(T_{n})\),在标称分布 \(G\) 下的分布为 \(f_{G}(T_{n})\),用距离 \(d\bigl(f_{F}(T_{n}),f_{G}(T_{n})\bigr)\),可以衡量实际分布 \(F\) 与标称分布 \(G\) 有偏离时,\(f_{F}(T_{n})\) 与 \(f_{G}(T_{n})\) 的偏离程度。
稳健性的定性描述
一个统计方法的性能取决于总体分布及该方法所使用的统计量。总体分布所起的作用在于它决定统计量的分布。
考虑从总体分布 \(F\) 中抽出的独立同分布样本 \(X_{1},\cdots,X_{n}\),\(F\) 属于一定的分布族 \(\mathcal{F}\)。为解决某一统计问题,使用了统计量 \(T_{n}=T(X_{1},\cdots,X_{n})\),记 \(T=\{T_{n}\}\)。在许多情况下,有一种自然的形式把对不同样本大小的 \(T_{n}\) 联系起来,因而可以抽象地说“统计量 \(T\)”。例如人们提到样本均值 \(\overline{X}_{n}\) 指的是当样本大小为 \(n\) 时的 \(\dfrac{1}{n}(X_{1}+\cdots+X_{n})\)。或者说 \(\overline{X}=\{\overline{X}_{n}\}\)。
统计量 \(T\) 的性质取决于它的分布。当总体的分布为 \(F_{0}\) 时,\(T\) 的分布记为 \(f_{F_{0}}(T)=\{f_{F_{0}}(T_{n})\}\)。如果事实上的总体分布为 \(F\),它与原来假定的总体分布 \(F_{0}\) 有些差异,则稳健性要求:当 \(F\) 与 \(F_{0}\) 的距离不大时,\(f_{F}(T)\) 与 \(f_{F_{0}}(T)\) 的距离也不大。根据这一想法,Hampel 于 1971 年提出了关于 \(T\) 的稳健性的一个正式定义:
设 \(d\) 是 \(\mathcal{F}\) 上的一个距离,满足条件 \[G_{n}\rightarrow G\iff d(G_{n},G)\rightarrow 0 \tag{5-2-6}\] 设 \(F_{0}\in\mathcal{F}\)。若对任何给定的 \(\varepsilon>0\),存在 \(\delta>0\) 和自然数 \(N\),使 \[\{n\geq N,\ d(F_{0},F)\leq\delta\}\Longrightarrow d\bigl(f_{F_{0}}(T_{n}),f_{F}(T_{n})\bigr)\leq\varepsilon \tag{5-2-7}\] 则称统计量 \(T=\{T_{n}\}\) 在总体分布 \(F_{0}\) 处为稳健的。
本定义中值得注意之处是:(5-2-7) 式右边要在 \(F_{0}\) 的邻域 \(\{F:\ d(F_{0},F)\leq\delta\}\) 内一致成立。如果一个统计量 \(T\) 有本定义之下的稳健性,则当总体分布有微小扰动而样本大小 \(n\) 足够大时,统计量 \(T_{n}\) 的分布也只受到微小扰动。因此,本定义属于大样本类型。在样本大小 \(n\) 固定时,可以把 (5-2-7) 式左边的条件中的“\(n\geq N\)”去掉,就可以定义 \(T_{n}\) 的稳健性。另外,由于本定义规定的稳健性是通过一个(等度)连续性的关系刻画的,而没有引进什么衡量稳健性的数量指标,因而这个定义只是定性的。要注意:本定义中并未指定任何特定的距离。但由前述知,勒维距离与普洛霍洛夫距离均满足本定义中对于距离 \(d\) 的要求。
理解 Hampel 定义 (5-2-7) 有三处容易踩坑。其一,这是"大样本"定义:要求对足够大的 \(n\)、在 \(F_{0}\) 的 \(\delta\)-邻域内一致成立,描述的是 \(T_{n}\) 分布的连续性,并非固定小样本下的表现。其二,它是"定性"定义:只保证"总体分布距离小\(\Rightarrow\)统计量分布距离也小"这种连续性,没有给出任何数量指标,所以本节末尾才说对切尾均值、Winsor 化均值和中位数"已不能再加优劣之分"——稳健与否是质的分野,要比较稳健程度必须另用崩溃点、影响函数等定量指标。其三,定义没有指定具体距离(勒维距离与普洛霍洛夫距离都满足 (5-2-6) 式),稳健性结论一般与距离选择无关,但个例(如例 5-2-2 中 \(F_{0}\) 在 \(a\)、\(b\) 处是否连续)确实会随模型细节而变。
一般说来,统计量 \(T_{n}(X_{1},\cdots,X_{n})\) 只依赖于样本 \(X_{1},\cdots,X_{n}\) 所决定的经验分布函数 \(F_{n}\)。这样可以把统计量 \(T_{n}\) 表示为 \(F_{n}\) 的某个统计函数: \[T_{n}=T(F_{n}) \tag{5-2-8}\] 当我们把 \(T_{n}\) 写成泛函形式 (5-2-8) 时,一般地总是这样选定 \(T\) 的形式(在有的情况下,\(T\) 有唯一性,不容许自由选择;在有的情况下,则有一定的挑选余地),使 \(T\) 的定义域不限于经验分布类,而是在一更广泛的分布类(包含经验分布,但不必是一切分布的类 \(\mathcal{F}\))上有意义。例如样本均值 \(T_{n}=\dfrac{1}{n}\sum\limits_{i=1}^{n}X_{i}\) 可写为 \(T=T(F)=\displaystyle\int x\,\mathrm{d}F(x)\)。这可以扩展到分布类 \(\mathcal{F}_{1}=\{F:\ \int|x|\,\mathrm{d}F(x)<\infty\}\)。对这种泛函 \(T\),可以定义其弱连续性如下:称 \(T\) 在其定义域内的一点 \(F_{0}\) 处弱连续,若对任一分布序列 \(\{G_{n}\}\),当 \(G_{n}\rightarrow F_{0}\) 时,有 \(T(G_{n})\rightarrow T(F_{0})\)(当 \(T\) 的定义域不为 \(\mathcal{F}\) 时,自然要限制 \(G_{n}\) 属于 \(T\) 的定义域)。这显然与下述定义等价:设 \(d\) 为一满足 (5-2-6) 的距离,若对任给的 \(\varepsilon>0\),存在 \(\delta>0\),使当 \(d(F,F_{0})\leq\delta\) 时,有 \(|T(F)-T(F_{0})|\leq\varepsilon\),则称 \(T\) 在 \(F_{0}\) 处弱连续。
在估计问题中,被估计量表示为总体分布的一个泛函 \(T(F)\)。早在 1922 年 Fisher 就提出了一般的估计方法,即用 \(T(F_{n})\) 估计 \(T(F)\),这里 \(F_{n}\) 为样本 \(X_{1},\cdots,X_{n}\) 的经验分布。\(T(F_{n})\) 依赖于样本 \(X_{1},\cdots,X_{n}\),是一个随机变量。若当 \(n\rightarrow\infty\) 时, \[T(F_{n})\xrightarrow{P}T(F)\quad\text{或}\quad T(F_{n})\rightarrow T(F),\ \text{a.s.}\] 则分别称估计量 \(T(F_{n})\) 在总体分布 \(F\) 处为弱相合或强相合。若 \(T\) 在 \(F\) 处弱连续,则可以证明 \(T(F_{n})\) 在 \(F\) 处为 \(T(F)\) 的强相合估计。但是这一结论的逆不成立。例如对定义在 \(\mathcal{F}_{1}\) 上的泛函 \(T=T(F)=\displaystyle\int x\,\mathrm{d}F(x)\) 而言,\(T_{n}=T(F_{n})=\displaystyle\int x\,\mathrm{d}F_{n}(x)\) 在 \(\mathcal{F}_{1}\) 中的每个 \(F\) 处为强相合,可以证明:\(T\) 在 \(\mathcal{F}_{1}\) 上任一点 \(F\) 处都不是弱连续的。证明如下:
对任给的 \(\delta>0\),取足够大的正数 \(a\),使当 \(x\leq-a\) 及 \(x>a\) 时,有 \(F(x)<\dfrac{\delta}{|x|}\) 及 \(1-F(x)<\dfrac{\delta}{|x|}\)。令
\[G(x)=\begin{cases} F(x)+\dfrac{\delta}{x}, & x\leq-a\\[6pt] F(x), & -a<x\leq a\\[6pt] F(x)+\dfrac{\delta}{x}, & x>a \end{cases}\] 则 \[\sup_{x}|G(x)-F(x)|\leq\frac{\delta}{a}\] 于是有 \[d_{L}\bigl(G(x),F(x)\bigr)\rightarrow 0\] 而 \[\begin{aligned} T(G)-T(F)&=\int_{-\infty}^{-a}x\,\mathrm{d}\!\left(\frac{\delta}{x}\right) +\int_{a}^{\infty}x\,\mathrm{d}\!\left(\frac{\delta}{x}\right)\\ &=-\delta\ln|x|\Big|_{-\infty}^{-a}-\delta\ln|x|\Big|_{a}^{\infty} \end{aligned}\] 这就证明了 \(T\) 在任一点 \(F\) 处都不是弱连续的。
原书此页扫描件字迹较淡,\(G(x)\) 的逐段表达式(在两尾端按 \(\delta/x\) 扰动,使 \(\sup|G(x)-F(x)|\leq\delta/a\))及积分结果(含 \(\ln|x|\))系据扫描件并结合标准论证(均值泛函非弱连续)整理复原,个别符号可能与原书有出入。论证要点是:\(d_{L}(G,F)\rightarrow 0\),但 \(T(G)-T(F)\) 不趋于 \(0\)。
在上述讨论的基础上,Hampel 给出了如下结果,它把稳健性与弱连续性联系了起来。
设 \(d\) 是满足 (5-2-6) 式的距离,而统计量 \(T_{n}=T(X_{1},\cdots,X_{n})=T(F_{n})\)(\(F_{n}\) 如前,是 \(X_{1},\cdots,X_{n}\) 的经验分布)在 \(F_{0}\) 的某个按距离 \(d\) 决定的邻域中为弱相合,即存在 \(\delta>0\),使 \[d(F,F_{0})\leq\delta\Longrightarrow T(F_{n})\xrightarrow{P}T(F) \tag{5-2-9}\] 则统计量 \(T=\{T_{n}\}\) 按 (5-2-7) 式定义的在 \(F_{0}\) 处稳健的充要条件是:\(T(F)\) 在 \(F_{0}\) 处为弱连续。
由于条件 (5-2-9) 通常都满足,故 Hampel 实质上把稳健性归结为弱连续性。
例 5-2-1
总体均值,即在 \(\mathcal{F}_{1}\) 上定义的泛函 \(T(F)=\displaystyle\int x\,\mathrm{d}F(x)\)。样本均值 \(\overline{X}_{n}\):\(T(F_{n})=\displaystyle\int x\,\mathrm{d}F_{n}(x)\) 适合条件 (5-2-9) 式。但前边已提到 \(T(F)\) 在 \(\mathcal{F}_{1}\) 的任一点处皆非弱连续,故样本均值 \(\overline{X}_{n}\) 作为总体均值的估计,在任一总体分布处都没有稳健性。
例 5-2-2
在 \(\mathcal{F}_{a,b}=\{F:\ \int_{a}^{b}\mathrm{d}F(x)=F(b)-F(a)>0\}\) 上定义泛函 \[T(F)=\frac{\displaystyle\int_{(a,b]}x\,\mathrm{d}F(x)}{\displaystyle\int_{(a,b]}\mathrm{d}F(x)}\] 这里 \(a\)、\(b\) 为两个已知数,\(-\infty<a<b<\infty\),\(T(F)\) 可用切尾均值 \[T(F_{n})=\frac{\displaystyle\sum_{a<X_{i}\leq b}X_{i}}{X_{1},\cdots,X_{n}\text{ 落在 }(a,b]\text{ 内的个数}}\] 去估计。条件 (5-2-9) 式仍成立。但 \(T(F)\) 是否在 \(F\) 处为弱连续,则取决于 \(a\)、\(b\) 是否都为 \(F\) 的连续点。因此,作为 \(T(F)\) 的估计的 \(T(F_{n})\),在某总体分布 \(F_{0}\) 处是否有稳健性,取决于 \(F_{0}\) 是否在 \(a\)、\(b\) 处连续。若 \(F_{0}\) 是处处连续的分布,则这一点当然成立。
类似地,定义在整个 \(\mathcal{F}\) 上的泛函 \[T(F)=aF(a)+b\bigl[1-F(b)\bigr]+\int_{(a,b]}x\,\mathrm{d}F(x)\] (\(a\)、\(b\) 意义同前),可以用Winsor 化均值 \[T(F_{n})=\frac{1}{n}\Bigl(a\,n_{1}+\sum_{a<X_{i}\leq b}X_{i}+b\,n_{2}\Bigr)\] 去估计,此处 \(n_{1}\) 和 \(n_{2}\) 分别是 \(X_{1},\cdots,X_{n}\) 中 \(\leq a\) 和 \(>b\) 的个数。与前例相似,可以验证统计量 \(T(F_{n})\) 在 \(F_{0}\) 处为稳健的充要条件仍是 \(F\) 在 \(a\)、\(b\) 两点连续。
例 5-2-3
记 \[\mathcal{F}_{2}=\{F:\ F\text{ 为连续对称分布(对称中心 }\theta_{F}\text{ 与 }F\text{ 有关)}\} \tag{5-2-10}\] 取定 \(\alpha\in\left(0,\dfrac{1}{2}\right)\),以 \(\theta_{\alpha}\) 记分布函数 \(F(x)\) 的 \(\alpha\) 分位点。作两个分布函数 \(F_{1}\) 和 \(F_{2}\) 如下: \[F_{1}(x)=\begin{cases} 0, & x<\theta_{\alpha}\\[6pt] \dfrac{F(x)-\alpha}{1-2\alpha}, & \theta_{\alpha}\leq x\leq\theta_{1-\alpha}\\[10pt] 1, & x>\theta_{1-\alpha} \end{cases} \tag{5-2-11}\] \[F_{2}(x)=\begin{cases} 0, & x<\theta_{\alpha}\\[4pt] F(x), & \theta_{\alpha}\leq x\leq\theta_{1-\alpha}\\[4pt] 1, & x\geq\theta_{1-\alpha} \end{cases} \tag{5-2-12}\] 则 \(\theta\) 可以用两种方式表示为 \(F\) 的泛函 \[\theta=T^{(1)}(F)=\int x\,\mathrm{d}F_{1}(x) \tag{5-2-13}\] \[\theta=T^{(2)}(F)=\int x\,\mathrm{d}F_{2}(x) \tag{5-2-14}\]
例 5-2-4
记 \[\mathcal{F}_{3}=\{F:\ F\text{ 的中位数 }T^{(3)}(F)\text{ 唯一}\} \tag{5-2-15}\] 泛函 \(T^{(3)}(F)\) 定义在 \(\mathcal{F}_{3}\) 上。另外,若 \(F_{n}\) 为样本 \(X_{1},\cdots,X_{n}\) 的经验分布,则定义 \(T^{(3)}(F_{n})=X_{1},\cdots,X_{n}\) 的样本中位数。可以证明,对 \(\mathcal{F}_{3}\) 中的任一个 \(F\),\(T^{(3)}(F_{n})\) 为 \(T^{(3)}(F)\) 的相合估计,且作为定义在 \(\mathcal{F}_{3}\) 上的泛函,\(T^{(3)}\) 在任一点 \(F\in\mathcal{F}_{3}\) 处为弱连续,因此样本中位数 \(T^{(3)}(F_{n})\) 作为总体中位数 \(T^{(3)}(F)\) 的估计在 \(\mathcal{F}_{3}\) 的任一点处都是稳健的。
结合以上诸例可以引出一个重要思想,为此,引进分布类 \(\mathcal{F}\) 如下: \[\mathcal{F}=\mathcal{F}_{1}\cap\mathcal{F}_{2}\cap\mathcal{F}_{3} \tag{5-2-16}\] 则当 \(F\in\mathcal{F}\) 时,其对称中心 \(\theta\) 可以用好几种方式表为 \(F\) 的泛函,即期望值 \(T(F)=\displaystyle\int x\,\mathrm{d}F(x)\),由 (5-2-13) 和 (5-2-14) 定义的 \(T^{(1)}(F)\) 和 \(T^{(2)}(F)\),例 (5-2-4) 中的 \(T^{(3)}(F)\)。按这四种表达方式,可作出 \(\theta\) 的四个不同的估计:\(T(F_{n})\) 即样本均值,\(T^{(1)}(F_{n})\) 即切尾均值,\(T^{(2)}(F_{n})\) 即 Winsor 化均值,\(T^{(3)}(F_{n})\) 即样本中位数。根据以上各例知:除第一个外,其余的都是稳健的。由此看出:同一个量(在此即分布的对称中心)的若干个从直观上看来同为合理和可行的估计,确实可能有的为稳健,有的为不稳健。而且要找其稳健估计,往往归结为要找到该量的某种“稳健表达方式”,在此为 \(T^{(i)}(F)\)(\(i=1,2,3\))。从定义 (5-2-7) 的角度对这三者已不能再加优劣之分了(即不能说何者“更稳健”一些)。要作这种讨论,还须引进关于稳健性的某种定量的指标。
例 5-2-1 至例 5-2-4 放在一起传达一个关键思想:同一个待估量(分布的对称中心 \(\theta\))可以写成许多等价的泛函表达 \(T^{(i)}(F)\),对应不同的估计 \(T^{(i)}(F_{n})\)——样本均值、切尾均值、Winsor 化均值、样本中位数——其中只有第一个不稳健。所以"找一个稳健估计"实质是"找一个稳健表达方式":均值泛函 \(T(F)=\int x\,\mathrm{d}F\) 在 \(\mathcal{F}_{1}\) 上处处不是弱连续的(弱收敛的分布序列下 \(T\) 不连续),因而处处不稳健;而截断式的 \(T^{(1)}\)、\(T^{(2)}\) 和中位数 \(T^{(3)}\) 只"看清楚"了分布的有界区间或分位点,剔除了远端影响,故弱连续、稳健。把估计的设计问题化为泛函的设计问题,正是稳健统计方法论的精髓。
稳健性的定量描述
稳健性并不是一个在任何场合下都可以按人们的意志而获得的性质。换句话说,统计问题本身对所能获得的稳健性的程度施加了不可逾越的限制。这一点从下面的简单分析即可看出来。
仍设 \(X_{1},\cdots,X_{n}\sim F\in\mathcal{F}\),\(T(F)\) 为定义在 \(\mathcal{F}\) 上的泛函。统计问题是由样本 \(X_{1},\cdots,X_{n}\) 估计 \(T(F)\)。设 \(F_{0}\in\mathcal{F}\),而 \(T\) 在 \(F_{0}\) 的邻域内变化很剧烈。就是说,尽管 \(F\) 与 \(F_{0}\) 的距离很小,但 \(T(F)\) 与 \(T(F_{0})\) 的差距却很大。设 \(T_{n}\) 为 \(T(F)\) 的一个估计量。若要求它在 \(F_{0}\) 处有稳健性,则当真实的总体分布为 \(F_{0}\),而由于部分异常值的出现使样本 \(X_{1},\cdots,X_{n}\) 所来自的总体的分布实际上为 \(F\) 时,\(T_{n}\) 仍应较好地估计 \(T(F_{0})\)。可是由于 \(T(F)\) 与 \(T(F_{0})\) 差别很大,这样一来,当总体分布为 \(F\) 而样本无异常值时,\(T_{n}\) 将与 \(T(F_{0})\) 有很大差距,而不能作为 \(T(F_{0})\) 的估计。可见,如果坚持下述合理要求“在样本正常的条件下,对一切 \(F\in\mathcal{F}\),\(T_{n}\) 较好地估计了 \(T(F_{0})\)”,则不能期望 \(T_{n}\) 有多大程度的稳健性。也许有可能把上述要求放松一些,而使 \(T_{n}\) 在某个指定的 \(F_{0}\) 的邻近有较好的稳健性。崩溃点的概念从另一个角度对上述想法作了定量的刻画。
设 \(F_{0}\) 为一分布,对任给的 \(\varepsilon\in(0,1]\),给定了某个包含 \(F_{0}\) 的分布集 \(\mathcal{Q}\),称为 \(F_{0}\) 的“邻域”。\(\mathcal{Q}\) 的具体形式可根据需要和方便选定,但要满足条件 \[\mathcal{Q}\subset\mathcal{F} \tag{5-2-17}\] 且 \(\mathcal{Q}\) 一般就是问题中所考虑的所有分布的类,例如全体分布构成的类。适合条件 (5-2-17) 的两个重要特例是 \[\begin{aligned} \mathcal{Q}'&=\{F:\ d_{L}(F,F_{0})\leq\varepsilon\},\qquad d_{L}\text{ 为勒维距离}\\ \mathcal{Q}''&=\{F:\ F=(1-\varepsilon')F_{0}+\varepsilon'H,\ H\in\mathcal{F}^{*},\ 0\leq\varepsilon'\leq\varepsilon\} \end{aligned} \tag{5-2-18}\] 其中 \(\mathcal{F}^{*}\) 是某一选定的分布类,例如 \(\mathcal{F}_{1}\)、\(\mathcal{F}_{2}\)、\(\mathcal{F}_{3}\) 等。\(\mathcal{Q}''\) 称为 \(F_{0}\) 的“污染邻域”,它反映这样的情况:总体的真实分布为 \(F_{0}\),但在抽样时有 \(100\varepsilon\%\) 的样本受到“污染”,它们实际上是来自具有分布 \(H\) 的总体,因此综观整个样本,可以看成是抽自具有分布 \(F=(1-\varepsilon)F_{0}+\varepsilon H\) 的总体。由于这个解释,\(\mathcal{Q}''\) 这种邻域在处理联系于样本异常值的稳健性问题中有重要的意义。易见,不论 \(\mathcal{F}^{*}\) 如何取,总有 \(\mathcal{Q}''\subset\mathcal{Q}'\)。
泛函 \(T(F)\) 在 \(\mathcal{Q}\) 上的变化幅度可以用 \[b(\varepsilon)=b(\varepsilon,F_{0},T)=\sup\{|T(F)-T(F_{0})|:\ F\in\mathcal{Q}\} \tag{5-2-19}\] 来刻画。显然,若 \(0<\varepsilon_{1}<\varepsilon_{2}<1\),则 \(0\leq b(\varepsilon_{1})\leq b(\varepsilon_{2})\leq b(1)\)。在不少情况下 \(b(1)=\infty\),但不必如此。有时对某个 \(\varepsilon\in(0,1)\) 即已有 \(b(\varepsilon)=b(1)\)。这可以说成是 \(T(F)\) 在 \(F_{0}\) 的邻域内已“失去控制”,或者说产生“崩溃”。发生这种情况的 \(\varepsilon\) 愈小,表明 \(T(F)\) 在 \(F_{0}\) 的变化愈剧烈,因而对 \(T(F)\) 的估计而言,在 \(F_{0}\) 处的稳健性愈难于获得。根据这一分析,引进崩溃点的定义如下:
称 \[\varepsilon^{*}=\varepsilon^{*}(F_{0},T)=\inf\{\varepsilon:\ 0<\varepsilon\leq1,\ b(\varepsilon)=b(1)\} \tag{5-2-20}\] 为泛函 \(T\) 相对于邻域 \(\mathcal{Q}\) 在 \(F_{0}\) 处的崩溃点。
有的文献中把崩溃点定义为 \(\sup\{\varepsilon:\ 0<\varepsilon<1,\ b(\varepsilon)<b(1)\}\),这一定义的缺点在于:可能根本不存在 \(\varepsilon\in(0,1)\) 使 \(b(\varepsilon)<b(1)\)。易见若存在这种 \(\varepsilon\),则此定义与 (5-2-20) 一致。
在有些情况下,\(\varepsilon^{*}(F_{0},T)\) 不依赖于 \(F_{0}\),这时 \(\varepsilon^{*}\) 就可简称为 \(T\) 的崩溃点。
崩溃点回答一个很实用的问题:"坏数据占到多大比例,估计就彻底没救了?"形式上 \(\varepsilon^{*}\) 是使 \(b(\varepsilon)=b(1)\) 的最小 \(\varepsilon\):\(b(\varepsilon)\) 衡量在 \(F_{0}\) 的 \(\varepsilon\)-邻域里 \(T(F)\) 能偏离 \(T(F_{0})\) 多远,一旦 \(b(\varepsilon)\) 冲到 \(b(1)\)(通常即 \(\infty\)),估计已被坏数据完全劫持、失去控制。对照例 5-2-5 与例 5-2-7:均值的崩溃点是 \(0\)——一个被拉到无穷大的异常值就足以把均值拖到无穷,抗差能力为零;中位数的崩溃点是 \(\dfrac{1}{2}\)——坏数据不过半,中位数就还在原位置附近,这是任何(平移同变)估计的崩溃点上限。\(0\) 与 \(1/2\) 这两个极端值,正是"最小二乘最脆弱、中位数最顽强"的量化注脚。
例 5-2-5
设 \(T(F)=\displaystyle\int x\,\mathrm{d}F(x)\) 定义于 \(\mathcal{F}_{1}\),\(F_{0}\in\mathcal{F}_{1}\)。选 \(\mathcal{Q}=\{F:\ F=(1-\varepsilon)F_{0}+\varepsilon H,\ H\in\mathcal{F}^{*}\}\),其中 \(\mathcal{F}^{*}=\mathcal{F}_{1}\)。因此 \[\begin{aligned} b(\varepsilon)&=\sup\{|T(F)-T(F_{0})|\}\\ &=\sup\left|\int x\,\mathrm{d}\bigl[(1-\varepsilon)F_{0}+\varepsilon H\bigr]-\int x\,\mathrm{d}F_{0}\right|\\ &=\sup\left|\varepsilon\int x\,\mathrm{d}(H-F_{0})\right| \end{aligned}\] 对于任意给定的 \(0<\varepsilon\leq 1\),均有 \(b(\varepsilon)=\infty\),所以 \[\varepsilon^{*}=\inf\{\varepsilon:\ 0<\varepsilon\leq1,\ b(\varepsilon)=b(1)\}=0\] 若将 \(\mathcal{F}^{*}\) 取为 \[\mathcal{F}^{*}=\{F:\ a\leq\int x\,\mathrm{d}F(x)\leq b\}\] (\(a\)、\(b\) 为有限实数,\(a<b\)),则 \[b(\varepsilon)=\sup\left\{\varepsilon\Bigl|\int x\,\mathrm{d}(H-F_{0})\Bigr|\right\} =\varepsilon\Bigl(b-\int x\,\mathrm{d}F_{0}\Bigr)\] 显然 \[\varepsilon^{*}=\inf\{\varepsilon:\ 0<\varepsilon\leq1,\ b(\varepsilon)=b(1)\}=1\]
例 5-2-6
以 \(\mathcal{F}_{c}\) 记一切一维连续分布的类。在 \(\mathcal{F}_{c}\) 上定义泛函 \(T(F)\) 如下:以 \(\theta_{\alpha}\) 记 \(F\) 的 \(\alpha\) 分位点。取定 \(\alpha\in\left(0,\dfrac{1}{2}\right)\)。令 \[T(F)=\frac{1}{1-2\alpha}\int_{\theta_{\alpha}}^{\theta_{1-\alpha}}x\,\mathrm{d}F(x) \tag{5-2-21}\] 选 \(\mathcal{Q}=\{F:\ F=(1-\varepsilon)F_{0}+\varepsilon H,\ H\in\mathcal{F}^{*}\}\)。这里 \(\mathcal{F}^{*}=\mathcal{F}_{c}\)。不难证明 \(\varepsilon^{*}(F_{0},T)=\alpha\) 对任何 \(F_{0}\in\mathcal{F}_{c}\) 成立。事实上,若 \(\varepsilon\in(0,\alpha)\),则 \(b(\varepsilon)<\infty\)。因为 \((1-\varepsilon)F_{0}+\varepsilon H\) 的 \(\alpha\) 分位点不小于 \(l_{\alpha}\),而其 \((1-\alpha)\) 分位点不大于 \(l_{1-\alpha}\),故 \[b(\varepsilon)\leq|T(F_{0})|+\frac{1}{1-2\alpha}\bigl(|l_{\alpha}|+|l_{1-\alpha}|\bigr)<\infty\] 另一方面,若 \(\varepsilon\in(\alpha,1]\),取 \(H\) 为 \((n,n+1)\) 内的均匀分布。记 \(l=\inf\{x:\ F_{0}(x)=\alpha/(1-\varepsilon)\}\),则当 \(n>|l|\) 时,\(F=(1-\varepsilon)F_{0}+\varepsilon H\) 的 \(\alpha\) 分位点不小于 \(l\),而其 \((1-\alpha)\) 分位点则不小于 \(n\)。若 \(l\geq 0\),则 \(T(F)\geq n(\varepsilon-\alpha)\)。若 \(l<0\),则 \(T(F)\geq n(\varepsilon-\alpha)-|l|\)。总之,当 \(n\rightarrow\infty\) 时,有 \(T(F)\rightarrow\infty\)。这就证明了当 \(\varepsilon>\alpha\) 时,\(b(\varepsilon)=\infty\),从而证明了 \(\varepsilon^{*}(F_{0},T)=\alpha\)。
原书此段扫描件中 \(l_{\alpha}\)、\(l_{1-\alpha}\) 的具体定义式(形如 \(l_{\alpha}=\inf\{x:\ F_{0}(x)=\alpha/(1-\varepsilon)\}\) 之类)字迹较淡,据扫描件及论证需要整理复原;其要点是:对 \(\varepsilon<\alpha\),\(\alpha\) 分位点与 \((1-\alpha)\) 分位点被夹在 \(l_{\alpha}\) 与 \(l_{1-\alpha}\) 之间,故 \(b(\varepsilon)<\infty\)。
例 5-2-7
设 \(T(F)\) 定义于一切一维分布的类 \(\mathcal{F}\),\(T(F)=F\) 的中位数区间的中点。定义 \(\mathcal{Q}\) 如例 5-2-6,其中 \(\mathcal{F}^{*}=\mathcal{F}_{c}\),则 \(\varepsilon^{*}(F_{0},T)=\dfrac{1}{2}\)。这事实的证明依据下述简单的断言:若 \(F(b)-F(a)>\dfrac{1}{2}\),则 \(F\) 的任一中位数必在 \([a,b]\) 内。按此,若 \(\varepsilon\in\left(0,\dfrac{1}{2}\right)\),则对任何一维分布 \(H\) 可以找到不依赖于 \(H\) 的 \(a\)、\(b\),使 \(F(b)-F(a)>\dfrac{1}{2}\),其中 \(F=(1-\varepsilon)F_{0}+\varepsilon H\)。为此,只须找 \(a<b\),使 \(F_{0}(b)-F_{0}(a)>\dfrac{1}{2(1-\varepsilon)}\)。这证明了当 \(\varepsilon\in\left(0,\dfrac{1}{2}\right)\) 时,\(b(\varepsilon)<\infty\)。反过来,设 \(\varepsilon\in\left(\dfrac{1}{2},1\right)\),\(H\) 记退化于 \(n\) 的分布,则 \(F=(1-\varepsilon)F_{0}+\varepsilon H\) 的中位数为 \(n\)。由此知当 \(\varepsilon\in\left(\dfrac{1}{2},1\right)\) 时 \(b(\varepsilon)=\infty\)。这即证明了上述断言。
中位数是 (5-2-21) 式定义的切尾均值当 \(\alpha\rightarrow\dfrac{1}{2}\) 时的极限,因此所得结论是在意料之中的。
以上崩溃点的概念是针对总体参数 \(T(F)\) 来说的。一般,在有了样本 \(X_{1},\cdots,X_{n}\) 以后用 \(T(F_{n})\) 去估计。因此也常把上面定义的 \(\varepsilon^{*}(F_{0},T)\) 称为 \(T(F)\) 的(渐近)崩溃点。更一般一些,统计量也不一定通过 \(T(F_{n})\) 的形式与 \(T(F)\) 联系。设 \(T_{n}=T_{n}(X_{1},\cdots,X_{n})\) 为统计量。若当 \(n\rightarrow\infty\) 时,\(T_{n}\rightarrow T(F)\) 是弱相合估计,则据 \(T(F)\) 按定义 (5-2-20) 算出的 \(\varepsilon^{*}(F_{0},T)\) 可定义为统计量 \(T_{n}\) 在 \(F_{0}\) 处的(渐近)崩溃点。因此,从这个角度看,崩溃点仍是一个大样本性质的概念。
除上述崩溃的概念外,5-1 节定义的影响函数 \[IC(x;F,T)=\lim_{\varepsilon\rightarrow 0^{+}}\frac{T(F_{\varepsilon})-T(F)}{\varepsilon} =\left.\frac{\mathrm{d}T(F_{\varepsilon})}{\mathrm{d}\varepsilon}\right|_{\varepsilon=0}\] 及过失误差敏感度 \[\gamma^{*}=\sup_{x}|IC(x;F,T)|\] 也可以作为衡量统计量稳健性的定量指标。
对于样本均值 \(\overline{X}_{n}=T_{n}=T(F_{n})\),\(T(F)=\displaystyle\int x\,\mathrm{d}F(x)\),在 5-1 节已经算出 \[IC(x;F,T)=x-\int x\,\mathrm{d}F(x),\qquad \gamma^{*}=\infty\] 影响曲线是无界的。它反映了样本均值对异常值的存在很敏感这一事实。
例 5-2-8
\(T=X_{1},\cdots,X_{n}\) 的样本中位数,设总体分布 \(F\) 的中位数唯一,则与 \(T\) 相应的泛函为 \[T(F)=F\text{ 的中位数}=F^{-1}\!\left(\frac{1}{2}\right)\] 为求其影响曲线,设 \(F\) 有密度 \(f\),并且 \(f\) 在 \(F^{-1}\!\left(\dfrac{1}{2}\right)\) 处连续,\(f\!\left(F^{-1}\!\left(\dfrac{1}{2}\right)\right)>0\)。这时易见:若 \(x\neq F^{-1}\!\left(\dfrac{1}{2}\right)\) 且 \(\varepsilon>0\) 充分小,则 \(F_{\varepsilon}=(1-\varepsilon)F+\varepsilon\delta_{x}\) 的中位数 \(T(F_{\varepsilon})\) 满足 \(F_{\varepsilon}\bigl(T(F_{\varepsilon})\bigr)=\dfrac{1}{2}\)。将此式关于 \(\varepsilon\) 求导,并令 \(\varepsilon=0\),得 \[0=-F\!\left(F^{-1}\!\left(\frac{1}{2}\right)\right) +f\!\left(F^{-1}\!\left(\frac{1}{2}\right)\right)\left.\frac{\mathrm{d}T(F_{\varepsilon})}{\mathrm{d}\varepsilon}\right|_{\varepsilon=0} +\delta_{x}\!\left(F^{-1}\!\left(\frac{1}{2}\right)\right) \tag{5-2-22}\] 当 \(x=F^{-1}\!\left(\dfrac{1}{2}\right)\) 而 \(\varepsilon>0\) 时有 \[T(F_{\varepsilon})=F_{\varepsilon}^{-1}\!\left(\frac{1}{2}\right)=F^{-1}\!\left(\frac{1}{2}\right)=T(F)\] 于是 \(\left.\dfrac{\mathrm{d}T(F_{\varepsilon})}{\mathrm{d}\varepsilon}\right|_{\varepsilon=0}=0\),由此及 (5-2-22) 式得 \(\{T_{n}\}\) 的影响函数为 \[IC(x;F,T)=\begin{cases} -\dfrac{1}{2f\!\left(F^{-1}\!\left(\frac{1}{2}\right)\right)}, & x<F^{-1}\!\left(\frac{1}{2}\right)\\[12pt] 0, & x=F^{-1}\!\left(\frac{1}{2}\right)\\[4pt] \dfrac{1}{2f\!\left(F^{-1}\!\left(\frac{1}{2}\right)\right)}, & x>F^{-1}\!\left(\frac{1}{2}\right) \end{cases} \tag{5-2-23}\] 为有界的,这意味着样本中位数对异常值的存在比较不敏感。
同样,对切尾均值和 Winsor 化均值,亦可证明其影响函数有界。这说明就异常值而言,切尾均值与 Winsor 均值比样本均值更不敏感。
补例 5-2-8 的推导细节。记 \(m=F^{-1}\!\left(\dfrac{1}{2}\right)\),把点质量分布的累积函数写成阶跃函数 \(H(t)=\mathbf{1}\{t\geq 0\}\),则 \(F_{\varepsilon}=(1-\varepsilon)F+\varepsilon\delta_{x}\) 的累积函数为 \[F_{\varepsilon}(t)=(1-\varepsilon)F(t)+\varepsilon H(t-x)\] 其中位数 \(T(F_{\varepsilon})\) 满足 \(F_{\varepsilon}\bigl(T(F_{\varepsilon})\bigr)=\dfrac{1}{2}\)。两边对 \(\varepsilon\) 求导并令 \(\varepsilon=0\)(此时 \(T(F_{\varepsilon})\to m\)),得 \[-F(m)+f(m)\left.\frac{\mathrm{d}T(F_{\varepsilon})}{\mathrm{d}\varepsilon}\right|_{\varepsilon=0}+H(m-x)=0\] 第一项来自 \(1-\varepsilon\) 的显式导数,第二项是复合函数求导(注意 \((1-\varepsilon)\) 在 \(\varepsilon=0\) 处取 \(1\)),第三项来自 \(\varepsilon H(T-x)\) 的显式导数。由 \(F(m)=\dfrac{1}{2}\),分情况: \[x<m:\ H(m-x)=1\ \Rightarrow\ T'=-\frac{1}{2f(m)},\qquad x>m:\ H(m-x)=0\ \Rightarrow\ T'=\frac{1}{2f(m)}\] 当 \(x=m\) 时 \(F_{\varepsilon}\) 在 \(m\) 处有跳跃、中位数恒为 \(m\),故 \(T'=0\)。三式合起来即 (5-2-23) 式。它与均值的影响函数 \(x-\mu\) 形成鲜明对照:中位数的影响函数是"台阶形"有界函数,单个异常值对中位数的最大推动只有 \(\dfrac{1}{2f(m)}\),且与它偏离多远无关——这正是"中位数抗差"的精确表达。
位置参数的稳健估计
位置参数
概率分布 \(F\) 的位置参数,是指 \(F\) 的一个满足平移同变性条件的统计函数。它的定义如下:
设 \(\mathcal{F}\) 是一个由某些一维分布构成的类(族),满足条件 \[F(x)\in\mathcal{F}\Longrightarrow F(x-\alpha)\in\mathcal{F}\quad(\text{对任何实数 }\alpha) \tag{5-3-1}\] 设 \(T\) 是定义在 \(\mathcal{F}\) 上的一个统计泛函。若 \(T\) 满足条件 \[T\bigl(F(x-\alpha)\bigr)=T\bigl(F(x)\bigr)+\alpha,\qquad -\infty<\alpha<\infty \tag{5-3-2}\] 则称 \(T(F)\) 为 \(F\) 的一个位置参数。
例如以 \(\mathcal{F}\) 记一切数学期望有限的一维分布类,则 (5-3-1) 成立。而 \(T\bigl(F(x)\bigr)=\displaystyle\int x\,\mathrm{d}F(x)\) 是 \(F\) 的一个位置参数。又如以 \(\mathcal{F}\) 记一切其中位数唯一的一维分布,同样 (5-3-1) 式成立。而 \(T\bigl(F(x)\bigr)=F^{-1}\!\left(\dfrac{1}{2}\right)\)(\(F^{-1}\) 为 \(F\) 的反函数),即 \(F\) 的中位数是 \(F\) 的一个位置参数。
位置参数有下面的解释:不妨设想 \(F(x)\) 已知,但总体分布为 \(F(x-\theta)\),实参数 \(\theta\) 的值未知。若 \(T\) 为一位置参数,则 \(T\bigl(F(x-\theta)\bigr)\) 与参数 \(\theta\) 之间有一一对应的关系。事实上据 (5-3-2) 式,\(T\bigl(F(x-\theta)\bigr)\) 与 \(\theta\) 之间只相差一个与 \(\theta\) 无关的数 \(T\bigl(F(x)\bigr)\)。估计了 \(T\bigl(F(x-\theta)\bigr)\),就等于估计了 \(\theta\)。从稳健性的观点可选择适当的 \(T\),使 \(T(F)\) 具有较高的崩溃点,较平缓的影响曲线等,从而提高位置参数估计的稳健性。
定义位置参数的一个一般方法如下:设 \(\psi(x)\) 是定义在 \((-\infty,\infty)\) 上的函数,以 \(\mathcal{F}\) 记一切具有下述性质的一维分布 \(F(x)\) 的集合:
(1)对任意实数 \(t\),积分 \[\lambda(t,F)=\int\psi(x-t)\,\mathrm{d}F(x) \tag{5-3-3}\] 存在有限;
(2)方程 \[\lambda(t,F)=0 \tag{5-3-4}\] 有唯一解,记为 \(T(F)\)。则易见 \(\mathcal{F}\) 满足条件 (5-3-1),而 \(T(F)\) 满足条件 (5-3-2),因此 \(T(F)\) 为一位置参数。例如若 \(\psi(x)=x\),\(\mathcal{F}\) 为一切其数学期望有限的分布的类,而 \(T(F)=\displaystyle\int x\,\mathrm{d}F(x)\);又如,设 \[\psi(x)=\begin{cases} -1, & x\leq 0\\[4pt] 1, & x>0 \end{cases} \tag{5-3-5}\] 则任一分布 \(F\) 满足条件 (1),若 \(F\) 的中位数唯一,且 \(F\) 在该点处连续,则条件 (2) 也满足,且 \(T(F)\) 就是 \(F\) 的中位数。
这样定义的位置参数 \(T(F)\) 有一良好的性质,即它在一定条件下有弱连续性。具体表述如下:
设 \(\psi(x)\) 在 \(-\infty<x<\infty\) 非降有界,\(G_{0},G_{1},\cdots\) 为一列分布,每一个 \(G_{i}\) 满足上述条件 (1) 和 (2),且当 \(n\rightarrow\infty\) 时 \(G_{n}\rightarrow G_{0}\),则 \(\lim\limits_{n\rightarrow\infty}T(G_{n})=T(G_{0})\)(证明略)。
位置参数的 M 估计
设 \(X_{1},\cdots,X_{n}\sim F\in\mathcal{F}\),\(T(F)\) 为位置参数。为估计 \(T(F)\),通常有三种类型的估计量:\(L\) 估计,\(R\) 估计及 \(M\) 估计。因为在测量数据处理中,第三种估计应用较广,这里只介绍这一种方法。
\(M\) 估计又称为极大似然型估计,设 \(\rho(x)\) 为一个定义在 \((-\infty,\infty)\) 上的函数,且存在 \(b\),使 \(\rho\) 在 \((-\infty,b]\) 非增,在 \([b,\infty)\) 非降。若统计量 \(T_{n}=T_{n}(X_{1},\cdots,X_{n})\) 满足条件 \[\sum_{i=1}^{n}\rho(X_{i}-T_{n})=\min \tag{5-3-6}\] 则称 \(T_{n}\) 为位置的一个\(M\) 估计。满足 (5-3-6) 的 \(T_{n}\) 可能不唯一。但是当 \(\rho\) 在 \((-\infty,+\infty)\) 上处处连续,则 \(T_{n}\) 一定存在。当 \(\rho\) 为严格凸函数时,\(T_{n}\) 一定唯一。
当 \(\rho'=\psi\) 存在时,式 (5-3-6) 可写成 \[\sum_{i=1}^{n}\psi(X_{i}-T_{n})=0 \tag{5-3-7}\] 只有当 \(\rho\) 为凸函数且 \(\rho'\) 在 \((-\infty,\infty)\) 上处处存在时,才可以断言 (5-3-6) 与 (5-3-7) 等价。由于 (5-3-7) 一般比 (5-3-6) 容易处理,有时也把 (5-3-7) 式作为 \(M\) 估计的定义。即
设 \(\psi\) 为 \((-\infty,\infty)\) 上的非降函数,\(\psi(-\infty)<0<\psi(\infty)\),若 \(T_{n}\) 满足 (5-3-7),则称 \(T\) 为位置参数的 \(M\) 估计。
导致 \(M\) 估计的想法及其名称的由来如下:为估计总体均值 \(\theta\),一个常用的估计量是样本均值 \(\overline{X}=\dfrac{1}{n}\sum\limits_{i=1}^{n}X_{i}\),它是极值问题 \[\sum_{i=1}^{n}(X_{i}-a)^{2}=\min \tag{5-3-8}\] 的解。这就是最小二乘的最简单的形式,相当于 (5-3-6) 中的 \(\rho(x)=x^{2}\),因为当 \(|X_{i}|\) 增加时,\((X_{i}-a)^{2}\) 变动很大,因而极值问题 (5-3-8) 的解 \(\overline{X}\) 受异常值的影响很大,缺乏稳健性。一个自然想到的改进办法,是把 \(x^{2}\) 改为一个变化较缓的函数,例如取 \(\rho(x)=|x|\),则 (5-3-8) 改为 \[\sum_{i=1}^{n}|X_{i}-a|=\min \tag{5-3-9}\] 其解是样本中位数。从以往的讨论知,它的稳健性确比样本均值好。把这种想法一般化,即允许 \(\rho\) 在一定范围内可以自由选择,就得到了一般定义的 \(M\) 估计。可以看出,\(M\) 估计的出发点在于对付样本的异常值。
\(M\) 估计的直觉可浓缩成一句:把最小二乘的"平方惩罚"换成更平缓的惩罚。\(\rho(x)=x^{2}\) 时,惩罚随残差二次增长,个别大残差在目标函数里权重过大,解(样本均值)就被离群点牵着走;把 \(\rho\) 改成 \(|x|\)(\(L_{1}\)),惩罚线性增长,解变为样本中位数,离群点的话语权骤降。\(M\) 估计把这种替换推广为"\(\rho\)(或 \(\psi=\rho'\))可在一定范围内自由选择":\(\rho\) 的凸性保证 (5-3-6) 的解存在且唯一((5-3-6) 与 (5-3-7) 的等价也依赖凸性);\(\rho\) 增长越慢、\(\psi\) 越早封顶,估计越抗差。例 5-3-3 的 Huber 函数正是"中间二次、两端线性"的折衷:小残差区保留最小二乘的效率,大残差区抑制离群点。这与第 1 章的 \(L_{p}\) 最小估计(例 5-3-2,\(1<p<2\))同族:\(p\to2\) 像均值,\(p\to1\) 像中位数。
特别,若总体有概率密度 \(f(x-\theta)\),\(f(x)\) 为已知函数,则取 \(\psi(x)=\bigl[\log f(x)\bigr]'\) 时,(5-3-7) 的解就是 \(\theta\) 的极大似然估计。因此,由 (5-3-7) 定义的估计可看做极大似然估计的推广,所以可称为极大似然型的。
"\(M\) 估计是极大似然估计的推广"这句话可与两处前文精确对接。其一,《最优估计基础》第2章"极大似然估计"一节(2.4 节)中,似然方程 \(\sum_{i}\dfrac{\partial\ln f(x_{i},\theta)}{\partial\theta}=0\) 正是 (5-3-7) 式取 \(\psi(x)=\bigl[\ln f(x)\bigr]'\) 的特例;第2章"最小二乘估计"一节(2.2 节)的准则 \(\bm{V}^{T}\bm{P}\bm{V}=\min\) 则对应 \(\rho(x)=x^{2}\)。其二,本书第1章例 1-3-3、1-3-4 由极大似然原理导出的 \(p\) 范分布,其 \(L_{p}\) 最小估计(\(\rho(x)=|x|^{p}\))正是例 5-3-2 的 \(M\) 估计——\(p=2\) 退化为最小二乘、\(p=1\) 退化为中位数,恰好覆盖 \(M\) 估计族的两端。对照阅读可以看清:极大似然是从"误差分布"出发推出估计准则,\(M\) 估计则反过来从"选定惩罚函数 \(\rho\)"出发设计估计,这一主动设计的思路正是稳健估计的灵魂。
在以上的叙述中要注意这样一个问题:把 \(\rho(x)\) 由 \(x^{2}\) 改为 \(|x|\) 相当于从样本均值 \(\overline{X}\) 转向于样本中位数 \(\widetilde{X}\),它们分别估计总体的均值和中位数。这二者虽然都是位置参数,但一般并不一致。因此,一般地说,不同的 \(\rho\),或者说不同的 \(\psi\) 所决定的 \(M\) 估计是估计总体不同的位置参数,而不是同一个位置参数的不同估计。只在特殊情况下,不同的 \(\rho\) 所决定的 \(M\) 估计可看做是同一位置参数的不同估计,如当总体分布对称时,\(\rho(x)=x^{2}\) 和 \(|x|\) 所对应的 \(M\) 估计是估计同一位置参数——分布的对称中心。因此在这里需要明确由 (5-3-7) 式决定的 \(M\) 估计可以合理地视为估计总体的什么样的位置参数?答案是:它是由方程 \[\lambda(t)=E_{F}\,\psi(x-t)=\int\psi(x-t)\,\mathrm{d}F(x)=0 \tag{5-3-10}\] 的解所决定的位置参数。这里需假定对任何 \(t\) \[\int|\psi(x-t)|\,\mathrm{d}F(x)<\infty\] 我们可以证明在一定的条件下,由 (5-3-7) 所决定的 \(M\) 估计 \(T_{n}\) 是由 (5-3-10) 的解所决定的位置参数 \(T(F)\) 的相合估计。这一结论可表述如下:
设方程 (5-3-10) 的解 \(T(F)=t_{0}\) 唯一,且对任何样本 \(X_{1},\cdots,X_{n}\),方程 (5-3-7) 的解 \(T_{n}\) 存在(不必唯一),以 \(T_{n}=T_{n}(X_{1},\cdots,X_{n})\) 记 (5-3-7) 的任一解,则当 \(n\rightarrow\infty\) 时,有 \[\lim_{n\rightarrow\infty}T_{n}=t_{0},\quad \text{a.s.}\ F \tag{5-3-11}\]
根据这一结论,由方程 (5-3-10) 的解所确定的位置参数 \(T(F)\) 所定出的崩溃点和影响函数等,也可解释为由方程 (5-3-7) 所确定的统计量 \(T_{n}\) 的崩溃点和影响函数。因此,为了得到位置参数的具有良好稳健性的估计,就要适当的选定 \(\psi\),以 (5-3-10) 的解作为位置参数,并用 (5-3-7) 的根去估计。
一个常见混淆是把稳健估计误当作"同一个量的多个估计"。书上这段明确提醒:\(\rho(x)=x^{2}\) 对应的 \(M\) 估计估计的是总体均值 \(E_{F}(x)\),\(\rho(x)=|x|\) 对应的 \(M\) 估计估计的是总体中位数 \(F^{-1}(1/2)\)——这是两个不同的位置参数,只有在总体分布对称时二者才重合(都等于对称中心)。所以动手之前先要问:我要估的量到底是什么?若业务上必须估对称中心(测量平差求参数真值即属此类),不能随手换成中位数,而应保留效率又抗差——这正是 Huber 型 \(\psi\) 的意义。另外,\(c\) 的选取是一对矛盾:\(c\) 太大接近最小二乘(效率高、抗差弱),\(c\) 太小接近中位数(抗差强、效率低),书上给的经验区间 \(c\in[1.5,2.0]\) 应在具体应用里按粗差比例与效率要求再权衡。
例 5-3-1
样本中位数 \(\widetilde{X}\) 是 \(L_{1}\) 最小估计。 \[\sum_{i=1}^{n}|X_{i}-\widetilde{X}|=\min \quad\text{或}\quad \sum_{i=1}^{n}\operatorname{sgn}(X_{i}-\widetilde{X})=0\] 是 \(M\) 估计,相应的 \(\rho(x)=|x|\) 是凸函数,\(\psi(x)=\operatorname{sgn}(x)\),\(x=0\) 是 \(\psi(x)\) 的间断点。对于 Laplace 分布,\(f(x)=\dfrac{1}{2}e^{-|x-\mu|}\),样本中位数是位置参数 \(\mu\) 的极大似然估计。
例 5-3-2
\(L_{p}\) 最小估计,\(\widetilde{X}\) 由以下的极小问题定义: \[\sum_{i=1}^{n}|X_{i}-\widetilde{X}|^{p}=\min\qquad(1<p<2)\] 它是位置 \(M\) 估计,\(\rho(x)=|x|^{p}\),是凸函数。\(\psi(x)=p|x|^{p-1}\operatorname{sgn}(x)\)。对于一元 \(p\) 范分布,\(\widetilde{X}\) 是位置参数 \(\mu\) 的极大似然估计。
例 5-3-3
呼勃 \(M\) 估计 \[\rho(x)=\begin{cases} \dfrac{x^{2}}{2}, & |x|\leq c\\[10pt] c|x|-\dfrac{c^{2}}{2}, & |x|>c \end{cases}\] 是凸函数。 \[\psi(x)=\min\{c,\max(-c,x)\}=\begin{cases} x, & |x|\leq c\\[4pt] c, & x>c\\[4pt] -c, & x<-c \end{cases}\] 是有界、逐段光滑、单调上升的。\(c\) 是可调常数,通常取 \(1.5\) 到 \(2.0\) 之间的一个数。
补例 5-3-3 中 \(\psi\) 的求导来源。对分段函数 \[\rho(x)=\begin{cases} \dfrac{x^{2}}{2}, & |x|\leq c\\[6pt] c|x|-\dfrac{c^{2}}{2}, & |x|>c \end{cases}\] 分段求导:\(|x|\leq c\) 时 \(\rho'(x)=x\);\(|x|>c\) 时,在 \(x>0\) 段 \(\rho(x)=cx-\dfrac{c^{2}}{2}\) 给出 \(\rho'(x)=c\),在 \(x<0\) 段 \(\rho(x)=-cx-\dfrac{c^{2}}{2}\) 给出 \(\rho'(x)=-c\)。合起来正是 \[\psi(x)=\rho'(x)=\begin{cases} x, & |x|\leq c\\ c, & x>c\\ -c, & x<-c \end{cases} =\min\{c,\ \max(-c,x)\}\] 即"在 \(-c\) 与 \(c\) 之间被截断的线性函数"。注意 \(\rho\) 在 \(|x|=c\) 处光滑拼接(\(\dfrac{c^{2}}{2}=c\cdot c-\dfrac{c^{2}}{2}\)),故 \(\psi\) 在 \(x=\pm c\) 处连续但不可导(这正对应书上说的"逐段光滑")。\(c\) 越小,\(\psi\) 越早封顶,抗差越强,但小残差区偏离最小二乘越多、效率损失越大。
例 5-3-4
将与数据中心的距离超过一定值的数据作为离群点而剔除掉,对于剩下的数据求样本均值,这个位置估计是 \(M\) 估计。它相应的 \[\rho(x)=\begin{cases} \dfrac{x^{2}}{2}, & |x|\leq a\\[10pt] \dfrac{a^{2}}{2}, & |x|>a \end{cases}\] 不是凸函数,相应的 \[\psi(x)=\begin{cases} x, & |x|\leq a\\[4pt] 0, & |x|>a \end{cases}\] 它的中间部分是线性函数,在 \(-a\)、\(a\) 处突然回到 \(0\)。
例 5-3-3 与例 5-3-4 的 \(\rho\)、\(\psi\) 分段表达式系据扫描件并结合 Huber 型 \(M\) 估计的通常取法整理复原:例 5-3-3 中 \(\psi(x)=\min\{c,\max(-c,x)\}\) 当 \(x<-c\) 时取 \(-c\);例 5-3-4 中离群点直接剔除(硬剔除)对应的 \(\rho\) 在两尾取常数 \(a^{2}/2\),\(\psi\) 在两尾取 \(0\)。
补一段把 (5-3-7) 落到平差框架的"加权迭代"推导,这是本章绪论所说的"用稳健估计处理平差问题"的理论核心。对线性模型 \(\bm{L}=\bm{B}\bm{X}+\bm{\Delta}\)、残差 \(\bm{V}=\bm{B}\hat{\bm{X}}-\bm{L}\),\(M\) 估计准则取 \(\sum_{i}\rho(v_{i})=\min\),对 \(\hat{\bm{X}}\) 求导得 \[\sum_{i=1}^{n}\psi(v_{i})\bm{b}_{i}=\bm{0}\quad\Longleftrightarrow\quad \bm{B}^{T}\bm{\psi}(\bm{V})=\bm{0}\] 其中 \(\bm{b}_{i}\) 为 \(\bm{B}\) 的第 \(i\) 行转置,\(\bm{\psi}(\bm{V})=\bigl[\psi(v_{1}),\cdots,\psi(v_{n})\bigr]^{T}\)。令 \[w_{i}=\frac{\psi(v_{i})}{v_{i}},\qquad \bm{W}=\operatorname{diag}(w_{1},\cdots,w_{n})\] 则 \(\bm{B}^{T}\bm{W}\bm{V}=\bm{0}\),代入 \(\bm{V}=\bm{B}\hat{\bm{X}}-\bm{L}\) 得加权法方程 \[\bm{B}^{T}\bm{W}\bm{B}\hat{\bm{X}}=\bm{B}^{T}\bm{W}\bm{L}\] 与 1-4 节最小二乘法方程 \(\bm{B}^{T}\bm{P}\bm{B}\hat{\bm{X}}=\bm{B}^{T}\bm{P}\bm{L}\) 形式完全相同,只是权阵由残差决定。因 \(w_{i}\) 依赖 \(\hat{\bm{X}}\),需迭代:以最小二乘解为初值,算残差\(\to\)定权\(\to\)解法方程\(\to\)再算残差,直至收敛。对 Huber 型 \(\psi\),\(|v_{i}|\leq c\) 时 \(w_{i}=1\)(正常观测按原权),\(|v_{i}|>c\) 时 \(w_{i}=\dfrac{c}{|v_{i}|}\)(大残差自动降权)——这就是"稳健加权迭代"(迭代加权最小二乘)的本质。
M 估计的影响函数
以 \(T(F)\) 记由 (5-3-10) 的根所确定的位置参数。有 \[\int\psi\bigl(x-T(F)\bigr)\,\mathrm{d}F(x)=0 \tag{5-3-12}\] 以 \(\delta_{x}\) 记退化于点 \(x\) 的分布,\(F_{\varepsilon}=(1-\varepsilon)F+\varepsilon\delta_{x}\),以 \(F_{\varepsilon}\) 代替上式中的 \(F\),对 \(\varepsilon\) 求导后令 \(\varepsilon=0\),并记 \[T'=\left.\frac{\mathrm{d}T(F_{\varepsilon})}{\mathrm{d}\varepsilon}\right|_{\varepsilon=0}\] 得 \[T'\int\psi'\bigl(x-T(F)\bigr)\,\mathrm{d}F(x) +\int\psi\bigl(x-T(F)\bigr)\,\mathrm{d}F(x) -\psi\bigl(x-T(F)\bigr)=0 \tag{5-3-13}\] 由 \(T(F)\) 的定义知上式左边第二项为 \(0\)。由此得 \(T(F)\) 的影响函数为 \[IC(x;F,T)=\frac{\psi\bigl(x-T(F)\bigr)}{\displaystyle\int\psi'\bigl(x-T(F)\bigr)\,\mathrm{d}F(x)} \tag{5-3-14}\] 需注意的是在导出上式时,假定了一定的条件,即 \(\rho'(x)\) 存在,可以在积分 \(\displaystyle\int\psi\bigl(x-T(F)\bigr)\,\mathrm{d}F(x)\) 号下对 \(\varepsilon\) 求导。
(5-3-13) 式的具体写法系据扫描件整理复原:原书将 \(\left.\dfrac{\mathrm{d}T(F_{\varepsilon})}{\mathrm{d}\varepsilon}\right|_{\varepsilon=0}\) 记为 \(T'\) 后写出对 \(\varepsilon\) 求导并令 \(\varepsilon=0\) 所得方程。为保证与 (5-3-14) 一致(第二项为 \(0\) 后应得 \(T'\int\psi'\,\mathrm{d}F-\psi=0\)),式中 \(T'\) 因子及各项符号系据标准推导复原,个别符号可能与扫描件有出入。
补 (5-3-12) 到 (5-3-14) 的求导链条。\(T(F)\) 满足 \(\lambda(t,F)=\int\psi\bigl(z-t\bigr)\,\mathrm{d}F(z)=0\),把 \(F_{\varepsilon}=(1-\varepsilon)F+\varepsilon\delta_{x}\) 代入并以 \(T_{\varepsilon}=T(F_{\varepsilon})\) 记其根: \[(1-\varepsilon)\int\psi\bigl(z-T_{\varepsilon}\bigr)\,\mathrm{d}F(z)+\varepsilon\,\psi\bigl(x-T_{\varepsilon}\bigr)=0\] 对 \(\varepsilon\) 求导后令 \(\varepsilon=0\)(记 \(T'=T_{\varepsilon}'\big|_{\varepsilon=0}\))。第一项产生 \(-\displaystyle\int\psi\bigl(z-T(F)\bigr)\mathrm{d}F(z)\)(对 \(\varepsilon\) 显式求导)与 \(-T'\displaystyle\int\psi'\bigl(z-T(F)\bigr)\mathrm{d}F(z)\)(复合函数求导);第二项产生 \(\psi\bigl(x-T(F)\bigr)\)(与 \(\varepsilon\) 相乘的项在 \(\varepsilon=0\) 处消失)。故 \[-\int\psi\,\mathrm{d}F-T'\int\psi'\,\mathrm{d}F+\psi\bigl(x-T(F)\bigr)=0\] 由 (5-3-12) 式 \(\int\psi\,\mathrm{d}F=0\),得 \(T'\displaystyle\int\psi'\,\mathrm{d}F=\psi\bigl(x-T(F)\bigr)\),即 (5-3-14) 式。分母 \(\int\psi'\,\mathrm{d}F\) 只起归一化作用,所以"\(\psi\) 有界\(\Leftrightarrow IC\) 有界"——选有界的 \(\psi\)(如 Huber 的 \(\psi\))就是选抗差的 \(M\) 估计。
M 估计的崩溃点
在计算 \(M\) 估计的崩溃点之前,先介绍下述引理:
设 \(F\) 为一个分布函数,\(F_{1}\)、\(F_{2}\) 都是非降右连续函数,满足条件 \[\text{对一切 }x\in(-\infty,\infty),\ F_{1}(x)\geq F(x);\qquad F_{1}(\infty)=1 \tag{5-3-15}\] \[\text{对一切 }x\in(-\infty,\infty),\ F_{2}(x)\leq F(x);\qquad F_{2}(-\infty)=0 \tag{5-3-16}\] 又设 \(\psi(x)\) 为定义在 \((-\infty,\infty)\) 上的非降有界函数,则 \[\int\psi(x)\,\mathrm{d}F(x)\geq\int\psi(x)\,\mathrm{d}F_{1}(x)+\psi(-\infty)F_{1}(-\infty) \tag{5-3-17}\] \[\int\psi(x)\,\mathrm{d}F(x)\leq\int\psi(x)\,\mathrm{d}F_{2}(x)+\psi(\infty)\bigl[1-F_{2}(\infty)\bigr] \tag{5-3-18}\]
证明:只证明 (5-3-17) 式,因为 (5-3-18) 类似。先设 \(F_{1}(-\infty)=0\)(即 \(F_{1}\) 也是分布函数),则因 \(F_{1}\geq F\),对任何 \(t\in(0,1)\),有 \(F_{1}^{-1}(t)\leq F^{-1}(t)\),于是由 \(\psi\) 的非降性,得 \[\int\psi(x)\,\mathrm{d}F(x)=\int_{0}^{1}\psi\bigl(F^{-1}(t)\bigr)\,\mathrm{d}t \geq\int_{0}^{1}\psi\bigl(F_{1}^{-1}(t)\bigr)\,\mathrm{d}t =\int\psi(x)\,\mathrm{d}F_{1}(x) \tag{5-3-19}\] 对一般情况,取实数 \(a\) 定义两个分布函数: \[F^{(a)}(x)=\begin{cases} F(x), & x\geq a\\[4pt] 0, & x<a \end{cases}, \qquad F_{1}^{(a)}(x)=\begin{cases} F_{1}(x), & x\geq a\\[4pt] 0, & x<a \end{cases}\] 则对一切 \(x\),有 \(F_{1}^{(a)}(x)\leq F^{(a)}(x)\),由已证的 (5-3-19) 式,有 \[\int\psi(x)\,\mathrm{d}F^{(a)}(x)\geq\int\psi(x)\,\mathrm{d}F_{1}^{(a)}(x)\] 即 \[\int\psi(x)\,\mathrm{d}F(x)+\psi(a)F(a^{-}) \geq\int\psi(x)\,\mathrm{d}F_{1}(x)+\psi(a)F_{1}(a^{-}) \tag{5-3-20}\] 令 \(a\rightarrow-\infty\),注意到 \(\psi\) 的有界性,\(F(a^{-})\rightarrow 0\) 以及 \(F_{1}(a^{-})\rightarrow F_{1}(-\infty)\),由 (5-3-20) 式即得 (5-3-17)。
引理证明中 \(F^{(a)}\)、\(F_{1}^{(a)}\)(在 \(x<a\) 处取 \(0\))的定义及 (5-3-20) 式的整理系据扫描件复原:扫描件中这两个分段函数的定义式及下标字迹较淡,本重排本按 \(\int\psi\,\mathrm{d}F^{(a)}=\int_{x\geq a}\psi\,\mathrm{d}F+\psi(a)F(a^{-})\) 的关系整理,个别符号可能与原书有出入。
现在设 \(\psi\) 为有界非降,\(T(F)\) 为方程 (5-3-10) 的根,现在来计算 \(T(F)\) 的崩溃点。将邻域选为 \[\mathcal{Q}=\{F:\ d(F_{0},F)\leq\varepsilon\},\quad d \text{ 为勒维距离}\] 取定分布 \(F_{0}\),\(\varepsilon\in(0,1)\),令 \[b_{+}(\varepsilon)=\sup\{T(F):\ d(F_{0},F)\leq\varepsilon\} \tag{5-3-21}\] \[b_{-}(\varepsilon)=\inf\{T(F):\ d(F_{0},F)\leq\varepsilon\} \tag{5-3-22}\] 记 \(\lambda(t,F)=\displaystyle\int\psi(x-t)\,\mathrm{d}F(x)\),以及 \[F_{2}(x)=\max\{0,\ F_{0}(x-\varepsilon)-\varepsilon\}\] 则 \(F_{2}(x)\) 为非降右连续,\(F_{2}(-\infty)=0\),\(F_{2}(\infty)=1-\varepsilon\)。由勒维距离的定义知:若 \(F\) 为一分布,且 \(d(F_{0},F)\leq\varepsilon\),则对一切 \(x\),\(F(x)\geq F_{2}(x)\),于是由 (5-3-18) 式,并以 \(x_{\varepsilon}\) 记 \(F_{0}\) 的 \(\varepsilon\) 分位点,得 \[\lambda(t,F)\leq\int_{x_{\varepsilon}}^{\infty}\psi(x-t+\varepsilon)\,\mathrm{d}F_{0}(x)+\varepsilon\psi(\infty)\ (=k(t)) \tag{5-3-23}\] 由 \(\psi\) 的单调性知 \(k(t)\) 非增。又因 \(\psi(-\infty)<0<\psi(\infty)\),知 \(k(-\infty)>0\),为简便计,设 \(F_{0}\) 在 \(x_{\varepsilon}\) 处连续,则有 \(k(\infty)=(1-\varepsilon)\psi(-\infty)+\varepsilon\psi(\infty)\)。当 \(\varepsilon<-\psi(-\infty)\big/[\psi(\infty)-\psi(-\infty)]\) 时,\(k(\infty)<0\),而 \(k(t)\) 有零点。以 \(t_{0}\) 记其最大零点,则由 (5-3-23) 知当 \(d(F_{0},F)\leq\varepsilon\),\(T(F)\leq t_{0}\)。因而 \(b_{+}(\varepsilon)<\infty\)。反之,若 \(\varepsilon>-\psi(-\infty)\big/[\psi(\infty)-\psi(-\infty)]\),则存在 \(\eta>0\),使 \(k(t)\geq\eta\) 对一切 \(t\) 成立,取分布 \[G_{a}(x)=\begin{cases} F_{2}(x), & x<a\\[4pt] F_{0}(x), & x\geq a \end{cases}\] 则易见 \(d(F_{0},G_{a})\leq\varepsilon\),且当 \(a\rightarrow\infty\) 时,\(\lambda(t,G_{a})\) 在 \((-\infty,\infty)\) 一致收敛于 \(k(t)\)。因此,当 \(a\) 充分大时,\(\lambda(t,G_{a})\) 的零点可以任意大,以至没有零点。由此可知,当 \(\varepsilon>-\psi(-\infty)\big/[\psi(\infty)-\psi(-\infty)]\) 时,\(b_{+}(\varepsilon)=\infty\)。另一方面取 \[F_{1}(x)=\min\{F_{0}(x+\varepsilon)+\varepsilon,\ 1\}\] 利用 (5-3-17) 式,与上述平行讨论可知 \(b_{-}(\varepsilon)<\infty\) 或 \(b_{-}(\varepsilon)=\infty\),视 \(\varepsilon<\psi(\infty)\big/[\psi(\infty)-\psi(-\infty)]\) 或 \(\varepsilon>\psi(\infty)\big/[\psi(\infty)-\psi(-\infty)]\) 而定,由此得到 \(T(F)\) 的崩溃点: \[\varepsilon^{*}=\frac{\min\{\psi(\infty),\ |\psi(-\infty)|\}}{\psi(\infty)+|\psi(-\infty)|}\]
注意 \(\varepsilon^{*}\) 与 \(F_{0}\) 无关。显然,\(0<\varepsilon^{*}\leq\dfrac{1}{2}\),当且仅当 \(\psi(\infty)=|\psi(-\infty)|\) 时,\(\varepsilon^{*}\) 达到最大值 \(\dfrac{1}{2}\)。另外,不难证明,当 \(\psi(\infty)+|\psi(-\infty)|=\infty\) 时,必有 \(\varepsilon^{*}=0\)。因此,为选定可给予稳健估计的位置参数,应取非降有界的 \(\psi\),且 \(\psi(-\infty)<0<\psi(\infty)\)。总体中位数相当于挑选 \(\psi\):当 \(x\leq 0\) 时,\(\psi(x)=-1\),当 \(x>0\) 时,\(\psi(x)=1\),这时崩溃点为 \(\dfrac{1}{2}\),与前面计算的结果相符合。
(5-3-23) 式中积分下限 \(x_{\varepsilon}\) 系据扫描件及论证需要整理复原:扫描件中积分记号字迹较淡,原书以 \(x_{\varepsilon}\) 记 \(F_{0}\) 的 \(\varepsilon\) 分位点,且下文用到 \(k(\infty)=(1-\varepsilon)\psi(-\infty)+\varepsilon\psi(\infty)\),据此确定积分下限为 \(x_{\varepsilon}\)。崩溃点公式 \(\varepsilon^{*}=\min\{\psi(\infty),|\psi(-\infty)|\}\big/[\psi(\infty)+|\psi(-\infty)|]\) 为未编号的展示式,与 (5-3-21)~(5-3-23) 之后的结论一致。