返朴

从抛物线到马鞍面,如何理解矩阵二次型?

你是否还记得中学数学里那个熟悉的抛物线y=ax2+bx+c?它的开口方向由a决定,与x轴的交点由判别式Δ决定。这就引出了一个核心问题:如何判断一个多项式的值是恒正、恒负还是有正有负?
本文正是从这个简单的中学问题出发,将视野拓展到更广阔的领域。它展示了如何用矩阵语言来描述多变量的二次函数,并利用特征值、行列式和合同变换等线性代数工具,来解决更复杂维度的“开口方向”和“正负性”问题。
撰文 | 朱慧坚(广州南方学院数学与统计学院副教授)、丁玖(广州南方学院数学与统计学院教授)
从一元二次函数说起
读过中学的人对实系数二次多项式𝑦 = 𝑎𝑥2 + 2𝑏𝑥 + 𝑐是最熟悉不过的了。这个函数的图像是站立的抛物线,开口朝上或朝下依二次项系数𝑎大于或小于零而定。另外,这根抛物线是否完全不碰𝑥-轴,又和另一数有关系:如果𝑎𝑐 − 𝑏2大于零,则抛物线不碰横坐标轴,这时上述方程没有实数根;如果𝑎𝑐 − 𝑏2小于零,则抛物线非穿过𝑥-轴两次不可,两个交点的𝑥坐标分别等于一元二次方程𝑎𝑥2 + 2𝑏𝑥 + 𝑐 = 0的相异实数根。剩下的情形是𝑎𝑐 − 𝑏2等于零,此时光滑曲线与𝑥-轴像恋人般“相拥而吻”。看来𝑎𝑥2 + 2𝑏𝑥 + 𝑐中三个常数字母构成的表达式𝑎𝑐 − 𝑏2,决定了多项式的不同行为;它的相反数被叫做“判别式”。注意,在通常初等代数教科书里,(2𝑏)2 − 4𝑎𝑐称为判别式,但它与这里的判别式仅差正数因子4,故它们本质上无异。
这些简单的初等知识可以引导人们走向更加宽广的数学世界,帮助理解一系列属于不同学科的新概念,而它们的源头依然是我们最近一直在谈论的线性代数。首先,将上面单变量函数中的一次幂𝑥乘上一个因子𝑦,然后在常数𝑐后面乘上𝑦的平方,得到两个变元的齐次二次多项式𝑎𝑥2 + 2𝑏𝑥𝑦 + 𝑐𝑦2。说它是 “齐次”是因为所有项的次数(各因子变元的幂次数之和)都一样;对于n次齐次多项式,如果你把其中的每一个变元都同时放大k倍,那么整个多项式就会放大kn倍。
为什么要引进如上两个变量的齐次多项式?原因是它可以很自然地用矩阵乘法的语言重新表达。读者马上就能验证如下的恒等式
Image
如果将上式中的二阶方阵用𝐴表示,二维列向量记为𝑝,则𝑎𝑥2 + 2𝑏𝑥𝑦 + 𝑐𝑦2变成𝑝𝑇𝐴𝑝,其中上标𝑇代表矩阵和向量的转置运算。
模仿中学代数所问“单变量二次多项式何时恒正,何时恒负,或者有正有负?”我们问大学代数中的类似问题:“在什么情况下,双变量二次多项式𝑎𝑥2 + 2𝑏𝑥𝑦 + 𝑐𝑦2的值对所有不全为零的𝑥和𝑦都为正、都为负或有正有负?”
二元二次型的符号判别
下面分别用中学生的方法和大学生的方法求解上述问题。先用初等代数。将二次函数进行恒等变形:
Image
由上可见,要想左式恒大于零或恒小于零,𝑎必须大于零或小于零。在这个必要条件下,假设𝑎𝑐 − 𝑏2 > 0。如果𝑦不为零,那么无论𝑥取什么实数,上面最后一个等号后面方括号内那个表达式大于或等于正数(𝑎𝑐 − 𝑏2)𝑦2/𝑎2。此时𝑎𝑥2 +2𝑏𝑥𝑦 + 𝑐𝑦2在𝑎 > 0时总大于零,在𝑎 < 0时总小于零。若𝑦 = 0,则对所有的非零数𝑥,都有𝑎𝑥2 + 2𝑏𝑥𝑦 + 𝑐𝑦2 = 𝑎𝑥2全大于零或全小于零,依𝑎 > 0或𝑎 < 0而定。所以,若𝑎 > 0和𝑎𝑐 − 𝑏2 > 0,则𝑎𝑥2 + 2𝑏𝑥𝑦 + 𝑐𝑦2的值除了当𝑥 = 𝑦 = 0外都大于零;若𝑎 < 0和𝑎𝑐 − 𝑏2 > 0,则该多项式的值对所有不全为零的𝑥和𝑦都小于零。由于𝑥和𝑦在多项式中的对称性,同理可知,𝑎𝑥2 + 2𝑏𝑥𝑦 + 𝑐𝑦2 > 0或< 0对所有不全为零的𝑥和𝑦都为真的另一个充分条件是𝑐 > 0和𝑎𝑐 − 𝑏2 > 0或𝑐 < 0和𝑎𝑐 − 𝑏2 > 0。反过来易见,𝑎 > 0, 𝑐 > 0和𝑎𝑐 − 𝑏2 > 0或𝑎 < 0, 𝑐 < 0和𝑎𝑐 − 𝑏2 > 0也是函数值恒大于零或小于零的必要条件。此外不难看出,𝑎𝑥2 + 2𝑏𝑥𝑦 + 𝑐𝑦2的值可正可负的充要条件是𝑎𝑐 − 𝑏2 < 0。
下面用矩阵手段证明同一结论,走一条与本文主题相关的道路,即采用笔者在之前文章中介绍过的“特征值”概念。计算𝐴的特征多项式
Image
它的两个实数根是
Image
分别求解齐次线性方程(𝜆𝐼 − 𝐴)𝑢 = 0和(𝜇𝐼 − 𝐴)𝑣 = 0,算出对应于各自特征值𝜆和𝜇的特征向量(假定𝑏 ≠ 0)
Image

显见这两个特征向量相互正交,即𝑣𝑇𝑢 = 0,这也是上篇文章《正规矩阵有哪些特色?》里命题“实对称矩阵对应于相异特征值的特征向量必定正交”的直接应用。设𝑏 = 0,则𝐴有特征值𝑎和𝑐。无论𝑎和𝑐是否相等,都有正交特征向量
Image
避开𝑏 = 0这一特殊情形,令
Image
其中‖𝑢‖和‖𝑣‖分别为𝑢和𝑣的欧几里得2-范数(所有分量平方和的平方根),则𝑊是正交矩阵,因而它是可逆矩阵且逆矩阵等于它的转置矩阵。由于𝑢/‖𝑢‖和𝑣/‖𝑣‖是𝐴分别对应于𝜆和𝜇的特征向量,有𝐴𝑊 = 𝑊𝐷,其中对角矩阵
Image
由此得到正交相似关系𝐴 = 𝑊𝐷𝑊𝑇 = 𝑊𝐷𝑊−1。令
Image
它建立了从𝑅2到自身的一个双射(即单射和满射)。进行变量替换:
Image
现考虑第一种情形𝑎 > 0(或𝑎 < 0)和𝑎𝑐 − 𝑏2 > 0,即𝐴的第一行第一列元素大于零(或小于零),且它的行列式大于零。这时,由于𝑎𝑐 > 𝑏2 ≥ 0,系数𝑐 > 0(或𝑐 < 0)。由特征值𝜆和𝜇的表达式(1),它们均为正(或均为负)。故对不全为零的𝑔和ℎ,有𝜆𝑔2 + 𝜇ℎ2 > 0(或< 0)。所以对全部不全为零的数𝑥和𝑦,都有
𝑎𝑥2 + 2𝑏𝑥𝑦 + 𝑐𝑦2 > 0(或< 0)。
反过来,如果上式对所有非零向量[𝑥, 𝑦]都满足,即
Image
则
Image
类似地,代入[𝑥, 𝑦] = [0, 1]给出𝑐 > 0(或 < 0)。由𝐴的特征值𝜆和𝜇的表达式(1)可知,它们均为实数。设𝜉(= 𝜆或𝜇)是𝐴的一个特征值,𝑤为其对应的实特征向量。将𝑤𝑇左乘𝐴𝑤 = 𝜉𝑤,得𝑤𝑇𝐴𝑤 = 𝜉𝑤𝑇𝑤,故𝜉 = 𝑤𝑇𝐴𝑤/𝑤𝑇𝑤。既然𝑤𝑇𝑤为正,𝜉便与𝑤𝑇𝐴𝑤同号。所以𝐴的两个特征值(包括重数)同号。因为它们的积等于𝐴的行列式,故有𝑎𝑐 − 𝑏2 = |𝐴|> 0。
上面的推理过程也让我们明白,第二种假设𝑎𝑐 − 𝑏2 < 0等价于𝜆和𝜇一正一负,因而𝑎𝑥2 + 2𝑏𝑥𝑦 + 𝑐𝑦2 = 𝜆𝑔2 + 𝜇ℎ2对某些[𝑥, 𝑦]为正,对别的[𝑥, 𝑦]为负。
一般二次型与合同变换
熟悉了二阶实对称矩阵给出的双变量二次型的值域特征,就可对任意阶实对称矩阵进行一般性的理论探讨。设𝐴 = [𝑎𝑖𝑗]为一𝑛阶实对称矩阵,即它所有元素都是实数,且关于主对角线对称分布,即对所有行列指标𝑖和𝑗都有𝑎𝑖𝑗 = 𝑎𝑗𝑖。下文中的𝐴均为实对称矩阵,不再每次都交代。我们将表达式𝑥𝑇𝐴𝑥称为由𝐴确定的关于𝑥的矩阵二次型,简称二次型,其中列向量𝑥的分量记作x₁, x₂, … , 𝑥𝑛。所有这样的𝑛维列向量的全体,按照通常的向量加法和数乘向量运算,构成了欧几里得空间𝑅𝑛,其中任意两个向量𝑥和𝑦的内积由表达式𝑥₁𝑦₁ + ⋯ + 𝑥𝑛𝑦𝑛定义。向量𝑥的欧几里得2-范数‖𝑥‖定义为𝑥与𝑥的内积之平方根。如果两个向量的内积等于零,则说它们是相互正交的。
之所以将𝑥𝑇𝐴𝑥称为二次型,是因为乘出后它的代数表达式
Image
是变量𝑥₁, … , 𝑥𝑛的齐次二次多项式。二次型的用途多种多样,至今仍吸引着研究者们为之钻研。
“变量替换”是数学中常见的一种把戏,目的不外乎是化繁为简,便于计算。初等微积分里的定积分变量替换法就是众所皆知的一例。对于二次型,这也是获取“标准型”的一条途径。此法的基本思想已经体现在本文前面的二元例子中。如果让𝑥 ∈ 𝑅𝑛被替换成𝑦 ∈ 𝑅𝑛,当然需要这种替换不仅“简单易行”,而且“来去自由”。满足这两个要求的非“线性可逆变换”莫属,“线性”使得运算简单,“可逆”保证往返都行。故令𝑥 = 𝑆𝑦,其中𝑆为一可逆矩阵,然后
𝑥𝑇𝐴𝑥 = (𝑆𝑦)𝑇𝐴𝑆𝑦 = 𝑦𝑇(𝑆𝑇𝐴𝑆)𝑦。
记𝐵 = 𝑆𝑇𝐴𝑆,则𝐵继承了𝐴的对称性。与矩阵𝐴相关的二次型𝑥𝑇𝐴𝑥变成了与矩阵𝐵相关的二次型𝑦𝑇𝐵𝑦。这时我们说𝐵与𝐴合同。所有同阶矩阵之间的合同关系是个等价关系,即:方阵𝐴与自己合同(因为𝐴 = 𝐼𝑇𝐴𝐼,其中𝐼是单位矩阵);若𝐴与𝐵合同,则𝐵与𝐴合同(因为𝐴 = 𝑆𝑇𝐵𝑆推出𝐵 = (𝑆−1)𝑇𝐴𝑆−1);条件𝐴与𝐵合同及𝐵与𝐶合同隐含𝐴与𝐶合同(因为𝐴 = 𝑆𝑇𝐵𝑆及𝐵 = 𝑇𝑇𝐶𝑇隐含𝐴 = 𝑆𝑇𝑇𝑇𝐶𝑇𝑆 =(𝑇𝑆)𝑇𝐶(𝑇𝑆))。
由于在上述可逆线性变换关系下,𝑥同𝑦双双可以穷尽它们所在的基本空间𝑅𝑛中的所有向量,所以多元二次函数𝑥𝑇𝐴𝑥与多元二次函数𝑦𝑇𝐵𝑦具有同样的值域,找到其中的一个,也就获得了另外的一个。如果变换𝑆取得特别好,以至于矩阵𝐵成了一个对角矩阵,那么人们“化简二次型中嵌入的矩阵”之希望就完全实现了。问题是,这个希望有可能落空吗?
答案是“不必担心”,因为实对称矩阵具有与生俱来的优秀性质:它们正交相似于实对角矩阵。再次回忆矩阵相似的意思:两个同阶方阵𝐴和𝐵称为彼此相似,如果存在非奇异矩阵𝑃使得𝐴 = 𝑃𝐵𝑃−1。与合同一样,所有同阶矩阵之间的相似关系也是一个等价关系。
与实对称矩阵常常形影不离的一类实矩阵是“正交矩阵”,它们的每一列都是单位向量,即欧几里得2-范数为1,并且所有列两两正交。或言之,方阵𝑈为正交矩阵意指𝑈𝑇𝑈 = 𝐼。正交矩阵是可逆矩阵,逆矩阵就是其转置矩阵。这样就有此类矩阵的特色双等式:𝑈𝑇𝑈 = 𝑈𝑈𝑇 = 𝐼。第二个等式说明正交矩阵的所有行向量也像所有列向量那样构成了𝑅𝑛的一个标准正交基。
在相似性等式𝐴 = 𝑃𝐵𝑃−1内,如果非奇异矩阵𝑃更上了一层楼升格为正交矩阵𝑈,那么这个相似关系同时又是合同关系𝐴 = 𝑈𝐵𝑈𝑇!妙就妙在,正如线性代数教科书中都会摆出来展示的那样,正交矩阵可以出马使得相应的合同关系中的𝐵成为形式最为简单的对角矩阵,其主对角元恰好是𝐴的全部特征值。
现在我们采取拿来主义的方针,将上一篇文章《正规矩阵有哪些特色?》中的一个主要结果借来,作为下面继续讨论的出发点。这个结果对更一般的复数域上的埃尔米特矩阵(也叫厄米矩阵,即其共轭转置等于自己的那些矩阵)成立,自然对本文的主角实对称矩阵也情有独钟,因此我们只对实矩阵列出如下的预备知识:
引理.存在正交矩阵𝑈使得
𝐴=𝑈𝐷𝑈𝑇,
其中𝐷为实对角矩阵,它的𝑛个主对角元均为𝐴的特征值,且相同特征值出现的次数等于该特征值的代数重数(这时等于几何重数,可以简称重数了)。
等式𝐴 = 𝑈𝐷𝑈𝑇的等价形式𝐴𝑈 = 𝑈𝐷告诉我们,正交矩阵𝑈的每一列都是𝐴的特征向量,它所属的特征值就位于𝐷的主对角线相对应的那个位置上。如果将𝐴的所有相异特征值排列成𝜆₁, 𝜆₂, … , 𝜆𝑘,则可相应重排𝑈的各列,使得在上述引理中, 可以将与𝐴正交相似的实对角矩阵𝐷的主对角元按照特征值的重数如下排列:
𝜆₁, … , 𝜆₁, 𝜆₂, … , 𝜆₂, … , 𝜆𝑘, … , 𝜆𝑘。
这样,𝐴𝑈 = 𝑈𝐷的分块矩阵写法就是
Image
或可按块写成
𝐴𝑈𝑗 = 𝜆𝑗𝑈𝑗,𝑗 = 1, … , 𝑘。
我们早已知道,彼此相似的矩阵具有完全一样的特征值,即不仅它们的数值一样,而且其代数重数和几何重数也一样。从正交相似于𝐴的对角矩阵𝐷,一眼就可看出𝐴有几个正特征值、几个负特征值、几个零特征值,全部把重数考虑在内。只要知道了正特征值的个数,负特征值的个数就可随即得知,因为这两个非负整数之和等于𝐴的秩。而特征值零的个数则等于𝐴的阶数减去秩。我们继而说明,从𝑈出发,一步就可构造出某个非奇异矩阵𝑆,使得𝐴 = 𝑆Σ𝑆𝑇,其中 Σ为一特殊对角矩阵,特殊性表现为其主对角元顶多包含三个数+1, −1,  0,而它们在主对角线上出现的次数恰好是𝐴的正特征值、负特征值、零特征值的个数(重数包括在内)。𝑆的构造如下:
任一实数都可写成它的符号(+1或− 1)乘以它的绝对值的形式。据此,将引理中正交相似等式𝐴 = 𝑈𝐷𝑈𝑇内的对角矩阵𝐷做进一步的因子分解:
𝐷=𝐸Σ𝐸=𝐸Σ𝐸𝑇,
其中三因子均为对角矩阵,它们的主对角元如下指定:对𝑖 = 1, … , 𝑛,若𝐷的第𝑖个主对角元为非零数,则𝐸的第𝑖个主对角元取为该数绝对值的平方根,而Σ的第𝑖个主对角元为+1或−1,全依𝐷主对角线上的那个数是正数或负数而定;若𝐷的第𝑖个主对角元为零,则将𝐸的第𝑖个主对角元取为1,而将Σ的第𝑖个主对角元取为零。这样就保证了矩阵𝑈𝐸可逆。如此的分解给出
𝐴 = 𝑈𝐷𝑈𝑇 = 𝑈𝐸Σ𝐸𝑇𝑈𝑇 = (𝑈𝐸)Σ(𝑈𝐸)𝑇。
定义𝑆 = 𝑈𝐸,则𝐴 =  𝑆Σ𝑆𝑇,同时我们完成了下一个命题的证明。
命题 1. 任一𝑛阶矩阵𝐴与某个对角矩阵Σ合同,其中Σ的主对角元组成{+1, −1,0}的子集,且主对角元中+1和−1各自出现的次数分别等于𝐴的正特征值重数之和和负特征值重数之和,而0出现的次数等于特征值0的重数。
命题 1 中出现的+1的次数和−1的次数(即𝐴的正特征值和负特征值的各自总重数),被分别称为𝐴的正惯性指数和负惯性指数,而0出现的次数则等于𝐴的阶数减去这两个惯性指数之和,它也恰好是𝐴的零空间𝑁(𝐴)的维数(有时叫做𝐴的零度)。上述结果表明,实对称矩阵合同于某个主对角元只可能是+1, −1和0的一个对角矩阵。
西尔维斯特惯性定律
下面问题来了:如果同一个𝐴经过另一个非奇异矩阵𝑆而合同于一个新的对角矩阵Σ,其主对角元只可能包含+1, −1和0,那么所得的正惯性指数和负惯性指数会有变化吗?如果有变化,则上一段中所说的“𝐴的正负惯性指数”就不尽合理,因为这两个指数不能由𝐴唯一确定。
令人放心的是,“𝐴的正惯性指数和负惯性指数”是定义合理的,因为早在1852 年,“矩阵”一词的创造者、英国数学家西尔维斯特(James Joseph Sylvester,1814-1897)证明了现以他名字命名的“西尔维斯特惯性定律”(Sylvester’s law of inertia):
定理1.𝐴的正惯性指数和负惯性指数是𝐴的不变量。换言之,所有与𝐴合同的主对角元只可能包含+1, −1和0的对角矩阵中的+1, −1和0之各自个数保持不变。
定理 1 的证明需要向量子空间直和维数加法关系的一个等式,我们先复习一下这个等式。如果向量子空间𝑉和𝑊只有零向量彼此共享,则它们的“和向量空间”𝑉 + 𝑊 = {𝑣 + 𝑤|𝑣 ∈ 𝑉, 𝑤 ∈ 𝑊}的维数等于𝑉的维数加上𝑊的维数。此时𝑉 + 𝑊称为直和,记为𝑉 ⊕ 𝑊。
现在开始证明惯性定律。假设存在两个非奇异矩阵𝑆和𝑇,使得𝑆𝑇𝐴𝑆 = Σ和𝑇𝑇𝐴𝑇 = 𝚲,其中两个对角矩阵Σ和𝚲的主对角元依次分别为ℎ个+1,𝑙个−1以及𝑛 − ℎ − 𝑙个0和𝑠个+1,𝑡个−1以及𝑛 − 𝑠 − 𝑡个0。注意到因为在合同变换下,矩阵的秩不会改变,故ℎ + 𝑙 = 𝑠 + 𝑡。我们先证明ℎ ≤ 𝑠。
定义𝑅𝑛的两个子空间如下:
Image
既然𝑆: 𝑅𝑛 → 𝑅𝑛是双射,它保持𝑅𝑛的任何子空间的维数不变,而子空间{𝑥 ∈𝑅𝑛|𝑥ℎ+1 = ⋯ = 𝑥𝑛 = 0}的维数等于ℎ,所以𝑉的维数为ℎ。因为𝑇: 𝑅𝑛 → 𝑅𝑛也是双射,同理可证𝑊的维数是𝑛 − 𝑠。
任一非零向量𝑦 ∈ 𝑉可以写成𝑦 = 𝑆𝑥,其中𝑥的后𝑛 − ℎ个分量为0。这样,
𝑦𝑇𝐴𝑦 = (𝑆𝑥)𝑇𝐴𝑆𝑥 = 𝑥𝑇𝑆𝑇𝐴𝑆𝑥 = 𝑥𝑇Σ𝑥 > 0。
类似地,任一向量𝑦 ∈ 𝑊可以写成𝑦 = 𝑇𝑥,其中𝑥的前𝑠个分量为0。这样,
𝑦𝑇𝐴𝑦 = (𝑇𝑥)𝑇𝐴𝑇𝑥 = 𝑥𝑇𝑇𝑇𝐴𝑇𝑥 = 𝑥𝑇𝚲𝑥 ≤ 0。
上面两个不等式的直接推论是𝑉 ∩ 𝑊 = {0}。
根据前述的子空间直和的维数关系, 𝑉的维数ℎ加上𝑊的维数𝑛 − 𝑠等于𝑉 ⊕ 𝑊的维数。因为𝑉 ⊕ 𝑊的维数总是小于或等于母空间𝑅𝑛的维数𝑛,故有不等式ℎ + (𝑛 − 𝑠) ≤ 𝑛,即ℎ ≤ 𝑠。同法可证𝑠 ≤ ℎ。所以ℎ = 𝑠,并直接推出𝑙 =𝑡。这就完成了对这一经典定理的论证。
𝐴的正惯性指数和负惯性指数之差被称为𝐴及其对应的二次型的符号差。俄罗斯数学家阿诺德(Vladimir Arnold,1937-2010)讲过这样一个故事,他曾面试一位法国应用数学家,问道:“𝑥𝑦的符号差是什么?”这位就数值计算二次型已发表了数十篇研究论文的专家答不出,嘟哝道:“我编写的电脑程序可以很快算出随便多大矩阵的符号差,但我的头脑不能像电脑算得那么快。”其实这个二次型是由矩阵
Image
确定的。阿诺德想通过这个真实故事来嘲弄一番他眼里的“法国布尔巴基主义数学家”。我们邀请本文读者替这个倒霉的法国人解答俄国人阿诺德的试题,顺便向这位已故 15 年的世界著名数学家展示一下中国人的数学思维能力。
如用特征值的术语,上述西尔维斯特惯性定律的等价说法是:两个同阶的实对称矩阵具有相同数量的正特征值、负特征值和零特征值,当且仅当它们是合同的。
正定性的判别法:特征值与主子式
回想起在本文开始,我们不厌其烦地讨论了一个初等代数问题:“𝑎𝑥2+ 2𝑏𝑥𝑦 + 𝑐𝑦2在何种条件下,对所有不全为零的𝑥和𝑦值保持为正、为负或正负相间?”现在,我们已经储备了足够的知识,可进一步对多元齐次二次多项式探讨同一类型的“值域”问题。
一个𝑛阶矩阵𝐴如果满足条件:对所有的非零向量𝑥 ∈ 𝑅𝑛,不等式𝑥𝑇𝐴𝑥 > 0(或< 0)都成立,则称它为正定(或负定)的;如果对所有的向量𝑥 ∈ 𝑅𝑛都有𝑥𝑇𝐴𝑥 ≥ 0(或 ≤ 0),则称𝐴为半正定(或半负定)的;若存在𝑅𝑛中的两个向量𝑥和𝑦,使得𝑥𝑇𝐴𝑥 > 0和𝑦𝑇𝐴𝑦 < 0,则说𝐴为不定的。如下结果清楚表明,𝐴的特征值的符号可以刻画它的正定(或负定)性和半正定(或半负定)性。
命题2.正定(或负定)矩阵的所有特征值均为正数(或负数);半正定(或半负定)矩阵的所有特征值均为非负数(或非正数)。反之亦然。
证明. 首先𝐴的所有特征值都是实数,设𝜆为其中之一,𝑣为对应的实特征向 量。则𝐴𝑣 = 𝜆𝑣隐含𝑣𝑇𝐴𝑣 = 𝜆𝑣𝑇𝑣。若𝐴正定(或负定),则𝜆 = 𝑣𝑇𝐴𝑣/𝑣𝑇𝑣 > 0(或< 0),若𝐴半正定(或半负定),则𝜆 = 𝑣𝑇𝐴𝑣/𝑣𝑇𝑣 ≥ 0(或≤ 0)。
反之,设𝐴的所有特征值𝜆1, … , 𝜆𝑛为正,则由正交相似关系𝐴 = 𝑈𝐷𝑈𝑇可知,对角矩阵𝐷的所有主对角元𝜆1, … , 𝜆𝑛都是正数。任给非零向量𝑥 ∈ 𝑅𝑛,令𝑈𝑇𝑥 = 𝑦,则有
Image
即𝐴是正定矩阵。若𝐴的所有特征值为负、非负或非正,同理可证相应结论。上述命题的一个直接结果是:𝐴是不定的当且仅当𝐴有正负特征值。此外,正定或负定矩阵因为无零特征值,必定是非奇异的。
在本文前部,我们证明了二阶实对称矩阵是正定(或负定)的充要条件是它的首行首列元素为正(或为负)及它的行列式为正。首行首列元素既是方阵的一阶子方阵,也是它所对应的行列式,而方阵的行列式则是它的第一行第二行以及第一列第二列元素构成的二阶子方阵所对应的行列式。这两个行列式的行和列在方阵中的指标分别从1连续增加到1或2,因此分别被叫做它的一阶或二阶前导主子式。这样,我们已知的结果用新的术语来叙述就是:二阶实对称矩阵是正定(或负定)的,当且仅当它的一阶前导主子式大于(或小于)零及二阶前导主子式大于零。
这个结论可以推广到𝑛阶矩阵𝐴。对于𝑘 = 1, … , 𝑛,由𝐴的第1行至第𝑘行与第1列至第𝑘列相交处的元素构成的𝑘阶子方阵所对应的行列式称为𝐴的𝑘阶前导主子式。下面的定理 2用行列式刻画了𝐴的正定性,和上面的定理 1 一样都是由西尔维斯特发现的;它被称为关于正定矩阵的“西尔维斯特判别法”。
定理2. 一个实对称矩阵是正定的,当且仅当它的所有前导主子式均为正数。
证明. 先证必要性。设𝐴为正定矩阵,并令𝐴𝑘为𝐴的第1行至第𝑘行与第1列至第𝑘列相交处的元素构成的𝑘阶子方阵,它显然也是对称矩阵。任给一𝑘维非零向量𝑦 ∈ 𝑅𝑘,在𝑦的所有分量后面添加𝑛 − 𝑘个0,所得的𝑛维非零向量记为𝑥,则有
𝑦𝑇𝐴𝑘𝑦=𝑥𝑇𝐴𝑥>0,
即𝐴𝑘是正定矩阵。命题 2 保证𝐴𝑘的所有特征值均是正数。另一方面,由于方阵的行列式等于它的全部特征值之积,故有|𝐴𝑘| > 0,也就是说,𝐴的𝑘阶前导主子式大于零。
现证充分性。我们用数学归纳法证明:如果𝐴的所有𝑛个前导主子式都大于零,则𝐴是正定的。对𝑛 = 1,二次型为二次单项式函数𝑎𝑥2,显然当𝑎 > 0时,一阶矩阵[𝑎]是正定的。𝑛 = 2的情形本文最前面已经得证。假若定理 2 对𝑛为真,并设分块写出的𝑛 + 1阶实对称矩阵
Image
的所有𝑛 + 1个前导主子式都大于零;特别地,𝑛阶实对称矩阵𝐵的所有𝑛个前导主子式都是正数,故根据归纳假设,𝐵为正定矩阵。相应地,将非零向量𝑥 ∈𝑅𝑛+1写成分块形式
Image
则
Image
将𝑥𝑛+1𝐵-1𝑢记为𝑣,则上式便可写成
Image
若𝑥𝑛+1 = 0,则𝑣 = 0,但因这时𝑦 ≠ 0,故由于归纳假设,𝑥𝑇𝐴𝑥 = 𝑦𝑇𝐵𝑦 > 0。若𝑥𝑛+1 ≠ 0,则由在下一段里将补充证明的不等式𝑐 > 𝑢𝑇𝐵-1𝑢,有
Image
为了让证明完善,我们用分块高斯消元法证实𝑐 − 𝑢𝑇𝐵−1𝑢 > 0:用−𝑢𝑇𝐵−1
左乘分块矩阵(2)中的第一行,再将结果加到第二行,就得到形如
Image
的因子分解。两边取行列式,得
Image
因为|𝐴|和|𝐵|均为正数,𝑐 − 𝑢𝑇𝐵−1𝑢也应是正数。这就完成了定理 2 的证明。
如果读者想“举一反三”,可能会受命题 2 的“误导”,猜测半正定矩阵𝐴的一个等价说法是“𝐴的所有前导主子式均为非负数。”这个说法其实是错的,因为下面的三阶实对称矩阵
Image
提供了一个反例:这个简单矩阵的三个前导主子式分别是非负数0, 0, 1,然而
Image
上例说明,仅仅要求所有的前导主子式均为非负数,不足以保证矩阵的半正定性,比之更强的条件是所论方阵的全部主子式都是非负数。一般主子式与前导主子式的区别在于,后者的行和列在原矩阵中的指标必须穷尽从1到某个𝑘的所有自然数,而前者只需要子矩阵所有行和列在母矩阵中的原先行列指标是全然相同的正整数。下面是用全部主子式表达出的半正定性质之等价条件,因为它的证明依赖于定理 2,我们将它列为一个直接推论:
系1. 实对称矩阵为半正定的充分必要条件是它所有的主子式都是非负数。
证明. 必要性的证明与定理 2 证明中必要性的论证过程大同小异,我们就省略不写了。现证充分性。假设𝐴的所有主子式都大于或等于零。令𝜀为一正数,考虑摄动后的实对称矩阵𝐴 + 𝜀𝐼。下面我们用定理 2 证明它是正定的。
任取𝐴 + 𝜀𝐼的一个𝑘阶前导主子式,它对应的子矩阵为𝐵 + 𝜀𝐼,其中𝐵是𝐴的对应子矩阵。由假设条件知,|𝐵| ≥ 0。通过展开行列式,我们有
Image
其中𝑠𝑖(𝐵)为𝐵中所有的𝑖阶主子式之和。由于𝐵的所有主子式也是𝐴的主子式,故都是非负数,因此𝑠𝑖(𝐵) ≥ 0。又因为𝜀 > 0,所以上面|𝐵 + 𝜀𝐼|的表达式说明|𝐵 + 𝜀𝐼| ≥ 𝜀𝑘 > 0。定理 2 则保证了𝐴 + 𝜀𝐼对任一正数𝜀都是正定矩阵,即对所有的非零向量𝑥 ∈ 𝑅𝑛,
Image
对上面不等式的两端取𝜀 → 0的极限,得到𝑥𝑇𝐴𝑥 ≥ 0。这证明了𝐴是半正定的。
对于负定矩阵和半负定矩阵,分别有与定理2和系1相似的结果。因为𝐴是负定(或半负定)矩阵当且仅当-𝐴是正定(或半正定)矩阵,从上述定理2和系1出发就能毫无困难地分别推出对矩阵负定性(或半负定性)的判别法:
系2. 一个实对称矩阵是负定的,当且仅当它的所有偶数阶前导主子式均为正数,所有奇数阶前导主子式均为负数。
系 3.一个实对称矩阵是半负定的,当且仅当它的所有偶数阶主子式均为非负数,所有奇数阶主子式均为非正数。
应用掠影:最优化问题与动力系统
到目前为止,我们学到了实对称矩阵及其子类——正定或半正定矩阵的基本性质,读者肯定想知道这些知识在其他学科中有哪些重要应用。老实说,它们的应用例子多如牛毛,尤其在当今的大数据时代。作为一个范例,让我们瞧一瞧正定矩阵的二次型性质怎样用于在机器学习中大放异彩的最优化理论。
在最优化这门学科,一个函数𝑓: Ω ⊆ 𝑅𝑛 → 𝑅的局部极小点𝑥∗ ∈ Ω意指,在𝑥∗的一个小邻域中,𝑓(𝑥∗)的值最小,即存在𝛿 > 0,使得只要𝑥 ∈ Ω满足不等式‖𝑥 − 𝑥∗‖ < 𝛿,就有𝑓(𝑥∗) ≤ 𝑓(𝑥)。局部极大点的定义与此类似,它们统称为极值点。如果上述不等式对𝑥 ≠ 𝑥∗是严格的,则可在相应术语前加上“严格”二字。若对所有的𝑥∈ Ω都有𝑓(𝑥∗) ≤ 𝑓(𝑥),则称𝑥∗为全局极小点或最小值点。同理可定义全局极大点或最大值点。
当目标函数𝑓在极值点可求导时,极值点𝑥∗的必要条件是它为𝑓的临界点,即𝑓′(𝑥∗) = 0。这由导数和极值点的定义立即可得,也从抛物线𝑦 = 𝑥2在其顶点(对应于极小点)的切线为水平线的几何直观可见。如果𝑓不可导,恐怕要借用其他分析手段如“凸分析”来获取一个有价值的必要条件了;这里按下不表。
我们更感兴趣的是在可微性条件下极值点的充分条件。上述最优性必要条件提示我们,极值点属于临界点集合。那么,何种性质能确保一个临界点担当起极值点的角色?这时,二次型的理论派上了用处。
我们还是以本文最开始的一元二次多项式函数作先导。令𝑓(𝑥) = 𝑎𝑥2 + 2𝑏𝑥 + 𝑐。众所周知,该函数的抛物线图像之顶点坐标为(𝑥∗, 𝑓(𝑥∗)),其中𝑥∗ =−𝑏/𝑎。在顶点处曲线的切线是水平的,即𝑓′(𝑥∗) = 0。若𝑎 > 0,𝑓(𝑥∗)是所有 函数值𝑓(𝑥)中的最小值,而当𝑎 < 0时,𝑓(𝑥∗)则是函数𝑓的最大值。这是连中学生都知道的事实。如果我们用微积分中的导数概念,就会发现,由于𝑓的二阶导数𝑓′′(𝑥) = 2𝑎,在𝑓的临界点𝑥∗处,𝑓′′(𝑥∗) = 2𝑎当𝑎 > 0时大于0,当𝑎< 0时小于0。改用矩阵二次型的语言重述之,就是说,在临界点𝑥∗,当函数𝑓的二阶导数值被看成是一阶矩阵时,若它是正定的,则𝑥∗是𝑓的全局极小点,若它是负定的,则𝑥∗是𝑓的全局极大点。
现在,我们将上面一元情形直观的事实推广到𝑛元二次多项式
Image
其中𝐴为𝑛阶实对称矩阵,𝑏 ∈ 𝑅𝑛,𝑐为一实数。这是非线性规划子领域“二次规划”中的基本函数,也是逼近一般非线性目标函数的基本工具。简单计算给出𝑓′(𝑥) = 𝑥𝑇𝐴 + 𝑏𝑇和𝑓′′(𝑥) = 𝐴。这里我们仅给出当𝐴为正定或负定时关于极值问题的确切结论。这时,𝑓有唯一的临界点𝑥∗ = −𝐴-1𝑏。令𝑥 ∈ 𝑅𝑛,计算函数值的差
Image
Image
然后,前面所得到的二次型性质引出如下的结论:
系 4. 若𝐴正定,则(3)式定义的二次函数𝑓有最小值𝑓(𝑥∗),其中𝑥∗ = −𝐴-1𝑏是严格全局极小点。若𝐴负定,则𝑓在严格全局极大点𝑥∗处达到最大值。
更进一步,当𝐴是半正定的,只要𝑏属于𝐴的值域,满足等式𝐴𝑥∗ = −𝑏的任一个向量𝑥∗都是𝑓的最小值点,在𝐴是半负定的时候,这样的𝑥∗则是𝑓的一个最大值点。证明完全与上面如同一辙,不再复述。然而需要强调的是,与正定或负定矩阵情形严格全局极值点是唯一的事实相反,矩阵为半正定或半负定的二次型最优化问题的解一般不唯一,甚至无最优解。此外,读者自然也会明白,倘若𝐴是不定矩阵,对应的最优化问题则无解,因为此时对某些𝑥 ∈ 𝑅𝑛有𝑓(𝑥) >𝑓(𝑥∗),而对其他𝑥出现𝑓(𝑥) < 𝑓(𝑥∗)。这是最优化界人士不愿看到的现象,然而却是另一门覆盖面广泛的学科“动力系统”的专家们津津乐道的话题。
我们就对这个话题以一个二维梯度向量场为例再说几句。二次型𝑓(𝑥, 𝑦) =𝑥2 − 𝑦2对应于不定矩阵
Image
考虑平面上的线性常微分方程组
Image
在连续动力系统领域,这个梯度向量场∇𝑓(𝑥, 𝑦)的零点(𝑥, 𝑦) = (0, 0)称为向量场的平衡点或解曲线族的不动点,它也是函数𝑓的临界点。由于𝑓′′(0, 0)是不定矩阵,𝑓(0, 0)既不是局部极小值也不是局部极大值。事实上,𝑧 = 𝑥2 − 𝑦2在𝑥𝑦𝑧-直角坐标系中的图像是双曲抛物面,其形状像一副马鞍,如下图所示:
Image
图片来源:Nicoguaro/wikipedia
双曲抛物面与坐标平面𝑦 = 0的交集是开口向上的抛物线𝑧 = 𝑥2(故𝑓(0, 0)是𝑓(𝑥, 0)的最小值),而与坐标平面𝑥 = 0的交集是开口向下的抛物线𝑧 = −𝑦2(故𝑓(0, 0)是𝑓(0, 𝑦)的最大值)。正因如此,不动点(0, 0)被几何形象地赋予“鞍点”之名。
这个鞍点对所论微分方程的解有何意义呢?它意味着所谓“稳定流形”和 “不稳定流形”的共同存在性;对此例,稳定流形是𝑦-轴,不稳定流形是𝑥-轴,意思是初始点属于𝑦-轴的解曲线最终将收敛于平衡点(0, 0),而初始点位于𝑥-轴的解曲线将远离平衡点(0, 0)。如下对此加以证明:直接求解初值问题
Image
其唯一解是
Image
显然,对𝑦-轴上的任一初始点(0, 𝑦0),解(𝑥(𝑡), 𝑦(𝑡)) = (0, 𝑦0𝑒−2𝑡)当𝑡 → ∞时收敛到平衡点(0, 0),而对𝑥-轴上的任一初始点(𝑥0, 0),解(𝑥(𝑡), 𝑦(𝑡)) = (𝑥0𝑒2𝑡, 0)当𝑡 → ∞时发散到无穷远。
我们只对多元二次函数的临界点分类小试了二次型理论,此时,函数的二阶导数是个实对称常数矩阵。对一般的非线性可微多元函数的同样问题,人们面临的现实是二阶导数矩阵依赖于函数定义域中点的位置而成为多变量矩阵函数,然而,借助于在临界点处二阶导数矩阵的二次型性质,正定(半正定)、负定(半负定)及不定矩阵仍然是解决问题的关键概念。
上述两例只是浮光掠影地简述了二次型理论在最优化和动力系统中的个别应用,其他领域如控制理论、最优传输、计算几何等,都是一般埃尔米特矩阵谱理论的用兵之处,读者们不妨多留个心眼,说不定哪天你调试的机器学习模型、规划的物流最优路线,甚至手机里信号的精准过滤,背后都藏着二次型悄悄“发力”的身影,这数学世界的小秘密,还等着大家慢慢发掘呢!
完稿于从化温泉镇广州南方学院

注:本文封面图片来自版权图库,转载使用可能引发版权纠纷。

Image

相关阅读

1 正规矩阵有哪些特色?

2 如何理解矩阵的特征值问题?

3 从反函数的观点看逆矩阵

4 为什么矩阵的行秩等于列秩?

5 从线性算子的角度看广义逆矩阵

近期推荐

1 坚守53年,一本理想主义顶刊倒在了这个冬天

2 著名高校大一新生批量“回炉”,补习初中数学

3 经济学大师也曾看走了眼:工业革命的失业潮,正在 AI 时代重演?

4 诺奖背后的十年弯路:产出原创性突破究竟需要什么土壤?

5 Topos理论首部著作问世,这是当代科技前沿离不开的数学

特 别 提 示

1. 进入『返朴』微信公众号底部菜单“精品专栏“,可查阅不同主题系列科普文章。

2. 『返朴』提供按月检索文章功能。关注公众号,回复四位数组成的年份+月份,如“1903”,可获取2019年3月的文章索引,以此类推。

3. 欢迎投稿!邮箱:[email protected] ,如有参考文献请附文末。稿件合适会尽快联系!

版权说明:欢迎个人转发,任何形式的媒体或机构未经授权,不得转载和摘编。转载授权请在「返朴」微信公众号内联系后台。

找不到《返朴》了?快加星标!!
Image
Image

长按下方图片关注「返朴」,查看更多历史文章

Image
微信实行乱序推送,常点“在看”,可防失联
Image