行列の指数関数

同義語:行列指数関数matrix exponential

概要

行列の指数関数(matrix exponential)とは、正方行列 $A$ に対して級数 $e^A=\sum_{k\ge0}A^k/k!$ で定まる行列であり、この級数はどの $A$ についても絶対収束する。$t\mapsto e^{tA}$ は $\frac{d}{dt}e^{tA}=Ae^{tA}$ を満たし、連立の線形微分方程式 $x'=Ax$ の解を $e^{tA}x(0)$ と表す。$AB=BA$ なら $e^{A+B}=e^Ae^B$ が成り立つが、可換でないと成り立たないことがある。対角化や Jordan 標準形で計算でき、$\det e^A=e^{\operatorname{tr}A}$ が成り立つ。

$$\newcommand{C}[0]{\mathbb{C}} \newcommand{div}[0]{\mathbin{÷}} \newcommand{N}[0]{\mathbb{N}} \newcommand{Q}[0]{\mathbb{Q}} \newcommand{R}[0]{\mathbb{R}} \newcommand{Z}[0]{\mathbb{Z}} $$

前提知識: 行列, 指数関数, 対角化

高校での出発点:$e^{at}$ を行列に広げる

量 $x(t)$ が自分の大きさに比例する速さで変わるとき、$x'=ax$ であり、解は $x(t)=e^{at}x(0)$ である(指数関数)。2 つの量 $x(t)$、$y(t)$ が互いに影響し合って $x'=ax+by$、$y'=cx+dy$ と変わるときは、縦ベクトル $\boldsymbol{x}=\begin{pmatrix}x\\y\end{pmatrix}$ と行列 $A=\begin{pmatrix}a&b\\c&d\end{pmatrix}$ を使って $\boldsymbol{x}'=A\boldsymbol{x}$ と書ける。数の場合と同じ形の答え $\boldsymbol{x}(t)=e^{tA}\boldsymbol{x}(0)$ を得るには、「$e$ の行列乗」に意味を与えればよい。
指数関数は級数 $e^{a}=1+a+\frac{a^2}{2!}+\frac{a^3}{3!}+\cdots$ で表せる(指数関数)。この式は足し算と掛け算しか使わないので、数 $a$ を正方行列 $A$ に置き換えても意味をもちうる。これが行列の指数関数である。漸化式 $\boldsymbol{x}_{n+1}=A\boldsymbol{x}_n$ の解が $A^n\boldsymbol{x}_0$ であること(漸化式の行列表示)の、連続な時間での類似といってもよい。
この記事では次の問いに答える。

  1. $e^A$ はどんな正方行列についても意味をもつか。→ prop-mexp-convergence
  2. 指数法則 $e^{A+B}=e^Ae^B$ は成り立つか。→ thm-mexp-product、「反例:指数法則と指数写像の限界」の節
  3. $e^{tA}$ を微分すると何になり、微分方程式とどう関わるか。→ thm-mexp-derivative
  4. 具体的な行列ではどう計算するか。→ prop-mexp-similar、fml-mexp-2x2、prop-mexp-jordan
  5. 行列式・固有値とどう関わるか。→ thm-mexp-det
    高校での見方この記事の言葉
    $e^a=1+a+\frac{a^2}{2!}+\cdots$行列の指数関数 $e^A=\sum_k A^k/k!$
    $e^{a+b}=e^ae^b$$AB=BA$ なら $e^{A+B}=e^Ae^B$
    $(e^{at})'=ae^{at}$$\frac{d}{dt}e^{tA}=Ae^{tA}$
    $y'=ay$ の解は $Ce^{at}$$\boldsymbol{x}'=A\boldsymbol{x}$ の解は $e^{tA}\boldsymbol{x}(0)$
    $e^{i\theta}=\cos\theta+i\sin\theta$回転の行列 $e^{\theta J}$

定義

以下、$\mathbb{K}$ は $\mathbb{R}$ または $\mathbb{C}$ とし、$\mathbb{K}$ の元を成分とする $n$ 次正方行列の全体を $M_n(\mathbb{K})$、単位行列を $I$ と書く。$A^0:=I$ とする。

行列の大きさ

行列の級数を扱うために、行列の大きさを 1 つの数で測る。$u\in\mathbb{K}^n$ の長さを $\lvert u\rvert:=\bigl(\sum_i\lvert u_i\rvert^2\bigr)^{1/2}$ とする。

作用素ノルム

$A\in M_n(\mathbb{K})$ に対して
$$ \|A\|:=\sup\bigl\{\lvert Au\rvert\ \big|\ u\in\mathbb{K}^n,\ \lvert u\rvert=1\bigr\} $$
を $A$ の作用素ノルムという。$A$ が $\mathbb{K}^n$ のベクトルを最大で何倍に伸ばすかを表す量である。

実行列の場合、これは 常微分方程式 の記事で $\|A\|_{\mathrm{op}}$ と書いたものと同じである。

作用素ノルムの性質

$A,B\in M_n(\mathbb{K})$、$c\in\mathbb{K}$、$u\in\mathbb{K}^n$ について次が成り立つ。
(R1) $\|A\|$ は有限で、$\lvert A_{ij}\rvert\le\|A\|\le\bigl(\sum_{i,j}\lvert A_{ij}\rvert^2\bigr)^{1/2}$ である。
(R2) $\lvert Au\rvert\le\|A\|\,\lvert u\rvert$ である。
(R3) $\|A+B\|\le\|A\|+\|B\|$、$\|cA\|=\lvert c\rvert\,\|A\|$ である。
(R4) $\|AB\|\le\|A\|\,\|B\|$、とくに $\|A^k\|\le\|A\|^k$ である。

要点:(i) は各成分への Cauchy–Schwarz の不等式、(iv) は (ii) を 2 回使うことから従う。

詳しい証明を開く

(i):$\lvert u\rvert=1$ なら、$Au$ の第 $i$ 成分に Cauchy–Schwarz の不等式を使って $\lvert(Au)_i\rvert^2\le\sum_j\lvert A_{ij}\rvert^2$ であり、$i$ について足すと $\lvert Au\rvert^2\le\sum_{i,j}\lvert A_{ij}\rvert^2$ となる。また標準基底 $e_j$ について $\lvert A_{ij}\rvert\le\lvert Ae_j\rvert\le\|A\|$ である。

(ii):$u\ne0$ なら $u/\lvert u\rvert$ に定義を使えばよい。(iii):$\lvert(A+B)u\rvert\le\lvert Au\rvert+\lvert Bu\rvert$ から従う。(iv):(ii) を 2 回使うと $\lvert ABu\rvert\le\|A\|\,\lvert Bu\rvert\le\|A\|\,\|B\|\,\lvert u\rvert$ である。$\square$

lem-mexp-norm の (i) から、行列の列 $C_m$ が $C$ に成分ごとに収束することと、$\|C_m-C\|\to0$ となることは同値である。行列の級数 $\sum_kC_k$ は、成分ごとの級数が収束するとき収束するという。

行列の指数関数

行列の指数関数

$A\in M_n(\mathbb{K})$ に対して
$$ e^{A}:=\sum_{k=0}^{\infty}\frac{1}{k!}A^k=I+A+\frac{1}{2!}A^2+\frac{1}{3!}A^3+\cdots $$
と定め、$A$ の行列の指数関数という。$\exp A$ とも書く。和は成分ごとの級数の和である(次の prop-mexp-convergence で収束を示す)。

$n=1$ なら $e^A$ はふつうの指数関数 $e^a$($\mathbb{K}=\mathbb{C}$ なら複素数の指数関数)である。実行列 $A$ では、$A$ を複素行列とみて計算しても同じ $e^A$ が得られ、それは実行列である。

収束と大きさの評価

$A\in M_n(\mathbb{K})$ とする。
(R1) $e^A$ の各成分の級数は絶対収束し、$\|e^A\|\le e^{\|A\|}$ である。
(R2) $\|e^A-I\|\le e^{\|A\|}-1$、$\|e^A-I-A\|\le\frac12\|A\|^2e^{\|A\|}$ である。

要点:$\|A^k/k!\|\le\|A\|^k/k!$ であり、右辺の和 $e^{\|A\|}$ が収束するので、比較判定法で各成分が絶対収束する。(ii) は同じ評価を $k\ge1$、$k\ge2$ の項に使う。

詳しい証明を開く

まず一般に、$\sum_k\|C_k\|<\infty$ となる行列の級数 $\sum_kC_k$ は成分ごとに絶対収束し、和 $C$ について $\|C\|\le\sum_k\|C_k\|$ となることを示す。lem-mexp-norm の (i) から $\lvert(C_k)_{ij}\rvert\le\|C_k\|$ なので、成分ごとの絶対収束は比較判定法から従う。部分和を $S_m$ とすると、lem-mexp-norm の (iii) から $\|S_m\|\le\sum_k\|C_k\|$ であり、$\|C\|\le\|S_m\|+\|C-S_m\|$ で $\|C-S_m\|\to0$(lem-mexp-norm の (i) の右の不等式と成分ごとの収束による)なので、$\|C\|\le\sum_k\|C_k\|$ である。

(i):$C_k=A^k/k!$ とすると、lem-mexp-norm の (iv) から $\|C_k\|\le\|A\|^k/k!$ であり、$\sum_k\|A\|^k/k!=e^{\|A\|}$ は収束する。上のことから結論が従う。

(ii):同じ評価を $k\ge1$ の項に使うと $\|e^A-I\|\le\sum_{k\ge1}\|A\|^k/k!=e^{\|A\|}-1$ である。$k\ge2$ の項には $k!\ge2\,(k-2)!$ を使うと

$$\|e^A-I-A\|\le\sum_{k\ge2}\frac{\|A\|^k}{k!}\le\frac{\|A\|^2}{2}\sum_{j\ge0}\frac{\|A\|^j}{j!}=\frac12\|A\|^2e^{\|A\|}$$

である。$\square$

(ii) は、$A$ が小さいとき $e^A$ が $I+A$ でよく近似されることを表す。これが後で微分を計算するときの要になる。

基本的な例

対角行列と冪零行列
  1. 対角行列 $D=\operatorname{diag}(\lambda_1,\dots,\lambda_n)$ では $D^k=\operatorname{diag}(\lambda_1^k,\dots,\lambda_n^k)$ なので、成分ごとに指数関数の級数が現れて
    $$ e^{D}=\operatorname{diag}\bigl(e^{\lambda_1},\dots,e^{\lambda_n}\bigr) $$
    である。とくに $e^{O}=I$($O$ は零行列)、$e^{\lambda I}=e^{\lambda}I$ である。
  2. ある $m$ で $N^m=O$ となる行列(冪零行列)では、級数は有限和
    $$ e^{N}=I+N+\frac1{2!}N^2+\cdots+\frac1{(m-1)!}N^{m-1} $$
    になる。たとえば $N=\begin{pmatrix}0&1&0\\0&0&1\\0&0&0\end{pmatrix}$ では $N^2=\begin{pmatrix}0&0&1\\0&0&0\\0&0&0\end{pmatrix}$、$N^3=O$ なので
    $$ e^{tN}=I+tN+\frac{t^2}2N^2=\begin{pmatrix}1&t&\frac{t^2}2\\0&1&t\\0&0&1\end{pmatrix} $$
    である。成分に $t$ の多項式が現れる。
回転と Euler の公式

$J=\begin{pmatrix}0&-1\\1&0\end{pmatrix}$ とおくと、$J^2=-I$、$J^3=-J$、$J^4=I$ である。$e^{\theta J}$($\theta\in\mathbb{R}$)の級数を偶数番目と奇数番目の項に分けると
$$ e^{\theta J}=\Bigl(1-\frac{\theta^2}{2!}+\frac{\theta^4}{4!}-\cdots\Bigr)I+\Bigl(\theta-\frac{\theta^3}{3!}+\frac{\theta^5}{5!}-\cdots\Bigr)J=\cos\theta\,I+\sin\theta\,J=\begin{pmatrix}\cos\theta&-\sin\theta\\\sin\theta&\cos\theta\end{pmatrix} $$
となり、原点のまわりの角 $\theta$ の回転の行列 $R_\theta$ が得られる(部分和を偶数番目と奇数番目に分けてから極限をとればよい)。
これは Euler の公式 $e^{i\theta}=\cos\theta+i\sin\theta$ の行列版である。実際、写像 $a+bi\mapsto aI+bJ$($a,b\in\mathbb{R}$)は和と積を保つ単射であり($J^2=-I$ が $i^2=-1$ にあたる)、級数 $e^{i\theta}=\sum_k(i\theta)^k/k!$ の各項を $(\theta J)^k/k!$ に移す。複素数の積 $e^{i\alpha}e^{i\beta}=e^{i(\alpha+\beta)}$ は、回転の合成 $R_\alpha R_\beta=R_{\alpha+\beta}$ にあたる。
常微分方程式 の例「単振動と回転」は、$J$ の転置 $J^{\mathsf T}=-J$ について同じ計算をしたもので、$e^{tJ^{\mathsf T}}=R_{-t}$ は時計回りの回転になる。

指数法則

数の指数関数では $e^{a+b}=e^ae^b$ である。行列では積の順序が問題になる。$A$ と $B$ が可換なら、数の場合と同じ証明が通る。

可換な行列の指数法則

$A,B\in M_n(\mathbb{K})$ が $AB=BA$ を満たすなら、$e^{A+B}=e^Ae^B$ である。

$S_N(X):=\sum_{j=0}^{N}X^j/j!$ とおく。$AB=BA$ なので、数の場合と同じように二項定理 $(A+B)^k=\sum_{j+l=k}\frac{k!}{j!\,l!}A^jB^l$ が成り立つ(積を展開して $B$ を右へ移すときに可換性を使う)。したがって
$$ S_{2N}(A+B)=\sum_{j+l\le2N}\frac{A^jB^l}{j!\,l!},\qquad S_N(A)S_N(B)=\sum_{j\le N,\ l\le N}\frac{A^jB^l}{j!\,l!} $$
である。後者の添字の範囲は前者に含まれるので、差 $S_{2N}(A+B)-S_N(A)S_N(B)$ は、$j+l\le2N$ かつ「$j>N$ または $l>N$」となる $(j,l)$ についての和である。$a:=\|A\|$、$b:=\|B\|$ とおくと、lem-mexp-norm から
$$ \bigl\|S_{2N}(A+B)-S_N(A)S_N(B)\bigr\|\le\sum_{j>N\text{ または }l>N}\frac{a^jb^l}{j!\,l!}=e^ae^b-S_N(a)S_N(b) $$
であり、右辺は $N\to\infty$ で $0$ に近づく。一方 $S_{2N}(A+B)\to e^{A+B}$ であり、$S_N(A)\to e^A$、$S_N(B)\to e^B$ で行列の積は成分の多項式なので $S_N(A)S_N(B)\to e^Ae^B$ である。よって $e^{A+B}=e^Ae^B$ である。$\square$

常微分方程式 の命題「行列の指数関数の性質」は、同じ主張を微分方程式の解の一意性から導いている。ここでは級数の積(Cauchy 積)で直接示した(主張は Tes12 Lemma 3.1 と同じ)。

逆行列と整数乗

$A\in M_n(\mathbb{K})$、$s,t\in\mathbb{K}$ とする。
(R1) $e^{(s+t)A}=e^{sA}e^{tA}$ である。
(R2) $e^A$ はつねに正則で、$(e^A)^{-1}=e^{-A}$ である。
(R3) 整数 $m$ について $e^{mA}=(e^A)^m$ である。

(i):$sA$ と $tA$ は可換なので thm-mexp-product から従う。(ii):$A$ と $-A$ は可換なので $e^Ae^{-A}=e^{O}=I$、同様に $e^{-A}e^A=I$ である。(iii):$m\ge0$ は (i) と $m$ についての帰納法、$m<0$ は (ii) から従う。$\square$

指数法則のほかに、行列の変換と相性がよいことも級数の形から分かる。

相似・転置・固有ベクトル

$A\in M_n(\mathbb{K})$ とする。
(R1) 正則な $P\in M_n(\mathbb{K})$ について $e^{PAP^{-1}}=Pe^AP^{-1}$ である。
(R2) $(e^A)^{\mathsf T}=e^{A^{\mathsf T}}$ であり、複素共役について $\overline{e^A}=e^{\bar A}$ である。
(R3) $Av=\lambda v$($v\in\mathbb{K}^n$、$\lambda\in\mathbb{K}$)なら $e^Av=e^{\lambda}v$ である。
(R4) $A$ がブロック対角 $\operatorname{diag}(A_1,\dots,A_r)$($A_i$ は正方行列)なら $e^A=\operatorname{diag}\bigl(e^{A_1},\dots,e^{A_r}\bigr)$ である。

要点:どれも、部分和で成り立つことを確かめて極限をとればよい。

詳しい証明を開く

(i):$(PAP^{-1})^k=PA^kP^{-1}$ なので $S_N(PAP^{-1})=PS_N(A)P^{-1}$ であり、$X\mapsto PXP^{-1}$ は成分の 1 次式なので極限と交換する。(ii):$(A^k)^{\mathsf T}=(A^{\mathsf T})^k$、$\overline{A^k}=\bar A^k$ であり、転置と共役は成分ごとの操作である。(iii):$A^kv=\lambda^kv$ なので $S_N(A)v=S_N(\lambda)v$ であり、極限をとると $e^Av=e^\lambda v$ である。(iv):ブロック対角行列の冪はブロックごとの冪である。$\square$

(i) から、$A=PDP^{-1}$($D=\operatorname{diag}(\lambda_1,\dots,\lambda_n)$)と対角化できれば
$$ e^{tA}=P\operatorname{diag}\bigl(e^{\lambda_1t},\dots,e^{\lambda_nt}\bigr)P^{-1} $$
である(ex-mexp-diag-nilpotent、対角化 の命題「対角化による冪と多項式の計算」と同じ考え方)。$A^n=PD^nP^{-1}$ で漸化式を解くのと同じ手順で、$D^n$ の代わりに $e^{tD}$ を計算すればよい。

微分と線形微分方程式

指数関数の微分と $x'=Ax$ の解

$A\in M_n(\mathbb{K})$ とする。
(R1) $t\mapsto e^{tA}$($t\in\mathbb{R}$)は微分可能で、$\dfrac{d}{dt}e^{tA}=Ae^{tA}=e^{tA}A$ である。
(R2) $T\subset\mathbb{R}$ を $t_0$ を含む区間、$x_0\in\mathbb{K}^n$ とする。微分可能な $x\colon T\to\mathbb{K}^n$ が $x'=Ax$ と $x(t_0)=x_0$ を満たすのは、$x(t)=e^{(t-t_0)A}x_0$($t\in T$)のときに限る。

(i):cor-mexp-inverse から $e^{(t+h)A}-e^{tA}=e^{tA}\bigl(e^{hA}-I\bigr)$ である。prop-mexp-convergence の (ii) を $hA$ に使うと、$h\ne0$ について
$$ \Bigl\|\frac{e^{hA}-I}{h}-A\Bigr\|=\frac{\|e^{hA}-I-hA\|}{\lvert h\rvert}\le\frac12\lvert h\rvert\,\|A\|^2e^{\lvert h\rvert\|A\|}\longrightarrow0\qquad(h\to0) $$
である。よって差分商 $\bigl(e^{(t+h)A}-e^{tA}\bigr)/h$ は $e^{tA}A$ に収束する。$A$ は各部分和 $S_N(tA)$ と可換なので、極限でも $e^{tA}A=Ae^{tA}$ である。
(ii):$x(t):=e^{(t-t_0)A}x_0$ は、(i) と合成関数の微分から $x'(t)=Ae^{(t-t_0)A}x_0=Ax(t)$ を満たし、$x(t_0)=Ix_0=x_0$ である。逆に $x$ が条件を満たすとし、$y(t):=e^{-(t-t_0)A}x(t)$ とおく。行列値関数と縦ベクトル値関数の積も、成分ごとに見れば積の微分法が使えるので、(i) から
$$ y'(t)=-Ae^{-(t-t_0)A}x(t)+e^{-(t-t_0)A}Ax(t)=0 $$
である($A$ と $e^{-(t-t_0)A}$ は可換)。区間の上で導関数が $0$ の関数は定数なので(複素数値なら実部と虚部に平均値の定理を使う)、$y(t)=y(t_0)=x_0$ である。両辺に左から $e^{(t-t_0)A}$ を掛けると、cor-mexp-inverse から $x(t)=e^{(t-t_0)A}x_0$ である。$\square$

(ii) の一意性の証明は、高校の $y'=ay$ の解が $Ce^{at}$ に限ることの証明($e^{-at}y$ を微分する)と同じ形である。右辺に $t$ の関数 $b(t)$ を加えた $x'=Ax+b(t)$ の解の公式(定数変化法)は 常微分方程式 の定理「定数係数の線形方程式の解」にある。係数行列 $A(t)$ が $t$ によって変わる場合、$n=1$ なら解は $e^{\int_{t_0}^tA(s)\,ds}x_0$ であるが、$n\ge2$ では異なる時刻の $A(t)$ が可換とは限らないので、この式は解になるとは限らない。その場合の理論と、この式が解にならない例は 線形微分方程式 で扱う。

漸化式との対応

$M:=e^{B}$ とおくと、cor-mexp-inverse の (iii) から $M^nx_0=e^{nB}x_0$ である。つまり漸化式 $x_{n+1}=Mx_n$ の点列は、微分方程式 $x'=Bx$ の解曲線 $e^{tB}x_0$ の上に、時刻 $t=0,1,2,\dots$ ごとに並ぶ(図 1)。
x' = Bx の解曲線 e^{tB}x_0 と、漸化式 x_{n+1} = e^B x_n の点列。点列は解曲線の上の時刻 t = n の点である x' = Bx の解曲線 e^{tB}x_0 と、漸化式 x_{n+1} = e^B x_n の点列。点列は解曲線の上の時刻 t = n の点である
図 1 では $B=-0.1I+J$($J$ は ex-mexp-rotation の行列)であり、$-0.1I$ と $J$ は可換なので $e^{tB}=e^{-0.1t}e^{tJ}=e^{-0.1t}R_t$ である。解曲線は、時間 $1$ あたり角 $1$(ラジアン)ずつ反時計回りに回りながら半径が $e^{-0.1t}$ 倍に縮む渦巻きになる。$t=12$ での点の長さは $e^{-1.2}\approx0.301$ である。
漸化式と微分方程式の対応を表にまとめる。$A$ は $\mathbb{C}$ の上で考え、固有値を $\lambda$ とする。

漸化式 $x_{n+1}=Ax_n$微分方程式 $x'=Ax$
解$A^nx_0$$e^{tA}x_0$
固有ベクトル $v$ から出た解$\lambda^nv$$e^{\lambda t}v$
解が $0$ に近づく条件(すべての固有値について)$\lvert\lambda\rvert<1$$\operatorname{Re}\lambda<0$
大きさ $2$ の Jordan 細胞で現れる項$n\lambda^{n-1}$$te^{\lambda t}$
固有値が相異なるときの計算$A^n=PD^nP^{-1}$$e^{tA}=Pe^{tD}P^{-1}$

表の 3 行目の微分方程式の側について、条件が必要なことは 2 行目から分かる($\operatorname{Re}\lambda\ge0$ なら $\lvert e^{\lambda t}v\rvert=e^{t\operatorname{Re}\lambda}\lvert v\rvert$ は $0$ に近づかない)。十分なことは、後の prop-mexp-jordan で $e^{tA}$ の成分が $t^ke^{\lambda t}$ の 1 次結合になり、$\operatorname{Re}\lambda<0$ なら $t^ke^{\lambda t}\to0$($t\to\infty$)となることから分かる。漸化式の側も、$n$ が $A$ の次数以上なら $A^n$ の成分が $n^k\lambda^n$ の 1 次結合になること(Jordan標準形 の命題「Jordan細胞の冪」)から同じように分かる。

計算法

2 次の行列の公式

2 次の行列では、対角化できるかどうかによらず使える閉じた公式がある。

2 次の行列の指数関数

$A\in M_2(\mathbb{R})$ とし、$\delta:=\frac12\operatorname{tr}A$、$B:=A-\delta I$、$D:=\delta^2-\det A$ とおく。このとき $B^2=DI$ であり、
$$ e^{tA}=\begin{cases}e^{\delta t}\Bigl(\cosh(\mu t)\,I+\dfrac{\sinh(\mu t)}{\mu}\,B\Bigr)&(D>0,\ \mu:=\sqrt{D})\\[2mm] e^{\delta t}\bigl(I+tB\bigr)&(D=0)\\[1mm] e^{\delta t}\Bigl(\cos(\nu t)\,I+\dfrac{\sin(\nu t)}{\nu}\,B\Bigr)&(D<0,\ \nu:=\sqrt{-D})\end{cases} $$
である。$A$ の固有値は $D\ge0$ なら $\delta\pm\sqrt D$、$D<0$ なら $\delta\pm i\sqrt{-D}$ なので、3 つの場合はそれぞれ「相異なる 2 つの実数の固有値」「実数の重根」「共役な 2 つの虚数の固有値」にあたる。

$A$ の固有多項式は $p_A(x)=x^2-(\operatorname{tr}A)x+\det A$ である。$\operatorname{tr}B=\operatorname{tr}A-2\delta=0$、$\det B=\det(A-\delta I)=p_A(\delta)=\delta^2-2\delta^2+\det A=-D$ なので、$B$ に 2 次の Cayley–Hamiltonの定理 を使うと $B^2-(\operatorname{tr}B)B+(\det B)I=O$、すなわち $B^2=DI$ である。したがって $B^{2j}=D^jI$、$B^{2j+1}=D^jB$ である。$\delta tI$ と $tB$ は可換なので、thm-mexp-product と ex-mexp-diag-nilpotent から $e^{tA}=e^{\delta t}e^{tB}$ であり、$e^{tB}$ の絶対収束する級数を偶数番目と奇数番目の項に分けると
$$ e^{tB}=\Bigl(\sum_{j\ge0}\frac{D^jt^{2j}}{(2j)!}\Bigr)I+\Bigl(\sum_{j\ge0}\frac{D^jt^{2j+1}}{(2j+1)!}\Bigr)B $$
となる。$D=\mu^2>0$ なら 2 つの和は $\cosh(\mu t)$ と $\sinh(\mu t)/\mu$ の Taylor 展開であり、$D=-\nu^2<0$ なら $\cos(\nu t)$ と $\sin(\nu t)/\nu$ の Taylor 展開である。$D=0$ なら $j=0$ の項だけが残り、$I+tB$ である。$\square$

同じ公式は、双曲線関数の形にまとめて Tes12 の式 (3.21) にある($D<0$ では $\cosh(i\nu t)=\cos(\nu t)$ と読み替える)。

固有値の 3 つの場合
  1. $A=\begin{pmatrix}2&1\\1&2\end{pmatrix}$:$\delta=2$、$D=4-3=1$、$B=\begin{pmatrix}0&1\\1&0\end{pmatrix}$ なので
    $$ e^{tA}=e^{2t}\begin{pmatrix}\cosh t&\sinh t\\\sinh t&\cosh t\end{pmatrix}=\frac12\begin{pmatrix}e^{3t}+e^{t}&e^{3t}-e^{t}\\e^{3t}-e^{t}&e^{3t}+e^{t}\end{pmatrix} $$
    である。固有値 $3$、$1$ の固有ベクトル $(1,1)^{\mathsf T}$、$(1,-1)^{\mathsf T}$ で対角化して計算しても同じ結果になる。
  2. $A=\begin{pmatrix}1&-2\\1&3\end{pmatrix}$:$\delta=2$、$D=4-5=-1$、$B=\begin{pmatrix}-1&-2\\1&1\end{pmatrix}$ なので
    $$ e^{tA}=e^{2t}\begin{pmatrix}\cos t-\sin t&-2\sin t\\\sin t&\cos t+\sin t\end{pmatrix} $$
    である。固有値は $2\pm i$ で、実数の範囲では対角化できないが、公式は実数の計算だけで済む。
  3. $A=\begin{pmatrix}3&1\\-1&1\end{pmatrix}$:$\delta=2$、$D=4-4=0$、$B=\begin{pmatrix}1&1\\-1&-1\end{pmatrix}$($B^2=O$)なので
    $$ e^{tA}=e^{2t}\begin{pmatrix}1+t&t\\-t&1-t\end{pmatrix} $$
    である。固有値は $2$ の重根で、$A$ は対角化できない。成分に $te^{2t}$ が現れる。
    どの場合も、$t=0$ で $I$ になり、$t$ で微分すると $A$ を左から掛けたものになることを直接確かめられる(thm-mexp-derivative)。

一般の行列:Jordan 標準形による計算

Jordan 分解による計算

$A\in M_n(\mathbb{C})$ とする。
(R1) 対角化可能な $S$ と冪零な $N$($N^n=O$)で、$A=S+N$ かつ $SN=NS$ となるものがある。このとき
$$ e^{tA}=e^{tS}e^{tN},\qquad e^{tN}=\sum_{k=0}^{n-1}\frac{t^k}{k!}N^k $$
である。
(R2) $e^{tA}$ の各成分は、$A$ の固有値 $\lambda$ と $0\le k< m_\lambda$($m_\lambda$ は $\lambda$ の代数重複度)についての関数 $t^ke^{\lambda t}$ の、$\mathbb{C}$ 係数の 1 次結合である。

要点:$A=PJP^{-1}$($J$ は Jordan 行列)とし、$J$ を対角部分と冪零部分に分けて $P$ で戻す。各 Jordan 細胞 $\lambda I+N_k$ では $e^{t(\lambda I+N_k)}=e^{\lambda t}\sum_{j< k}\frac{t^j}{j!}N_k^j$ となる(常微分方程式 の例「Jordan 細胞の指数関数」と同じ計算)。

詳しい証明を開く

Jordan標準形 の定理「Jordan標準形の存在」から、正則な $P$ と Jordan 行列 $J$ で $A=PJP^{-1}$ となるものがある。$J$ の対角部分を $\Lambda$、残り(対角線のすぐ上の $1$ の並び)を $N'$ とすると、各 Jordan 細胞 $\lambda I+N_k$ の中で $\lambda I$ と $N_k$ は可換なので、$\Lambda N'=N'\Lambda$ であり、$N'$ は狭義上三角なので $N'^n=O$ である。$S:=P\Lambda P^{-1}$、$N:=PN'P^{-1}$ とおけば (i) の前半が成り立つ。$e^{tA}=e^{tS}e^{tN}$ は thm-mexp-product から、$e^{tN}$ の式は ex-mexp-diag-nilpotent から従う。

(ii):prop-mexp-similar の (i)・(iv) から $e^{tA}=Pe^{tJ}P^{-1}$ であり、$e^{tJ}$ は各細胞の指数関数を並べたブロック対角行列である。大きさ $k$ の細胞 $\lambda I+N_k$ については、$\lambda I$ と $N_k$ が可換で $N_k^k=O$ なので

$$e^{t(\lambda I+N_k)}=e^{\lambda t}\sum_{j=0}^{k-1}\frac{t^j}{j!}N_k^j$$

であり、その成分は $\frac{t^j}{j!}e^{\lambda t}$($j< k$)か $0$ である。細胞の大きさ $k$ は $m_\lambda$ 以下である(固有値 $\lambda$ の細胞の大きさの和が $m_\lambda$)。$P$ と $P^{-1}$ を掛けると成分は定数係数の 1 次結合になる。$\square$

$e^{tA}$ は $A$ の多項式である

$A\in M_n(\mathbb{K})$ について、$e^{tA}=c_0(t)I+c_1(t)A+\cdots+c_{n-1}(t)A^{n-1}$ となる関数 $c_0,\dots,c_{n-1}$ がある。Cayley–Hamiltonの定理 の系「冪を次数 $n$ 未満に落とす」から、すべての $A^k$ は $I,A,\dots,A^{n-1}$ の張る部分空間 $W\subset M_n(\mathbb{K})$ に属する。部分和 $\sum_{k\le N}t^kA^k/k!$ は $W$ に属し、有限次元の部分空間 $W$ は閉集合なので、極限 $e^{tA}$ も $W$ に属する。fml-mexp-2x2 の $e^{tA}$ は $I$ と $B=A-\delta I$ の 1 次結合、したがって $I$ と $A$ の 1 次結合であり、その $n=2$ の場合にあたる。

行列式と固有値

指数関数の固有値と行列式

$A\in M_n(\mathbb{C})$ の固有値を、代数重複度の分だけ重複を許して $\lambda_1,\dots,\lambda_n$ とする。
(R1) $e^A$ の固有多項式は $\prod_{i=1}^n\bigl(x-e^{\lambda_i}\bigr)$ である。とくに $e^A$ の固有値は $e^{\lambda_1},\dots,e^{\lambda_n}$ である。
(R2) $\det e^A=e^{\operatorname{tr}A}$ である。
(R3) $A$ が実行列なら $\det e^A>0$ である。

Jordan標準形 の定理「Jordan標準形の存在」から $A=PTP^{-1}$ となる Jordan 行列 $T$ があり、$T$ は上三角行列で、対角成分には $\lambda_1,\dots,\lambda_n$ が重複度の分だけ並ぶ。上三角行列どうしの積は上三角行列で、その対角成分は対角成分どうしの積なので、$T^k$ は対角成分 $\lambda_i^k$ の上三角行列である。したがって部分和 $\sum_{k\le N}T^k/k!$ は対角成分 $\sum_{k\le N}\lambda_i^k/k!$ の上三角行列であり、極限 $e^T$ は対角成分 $e^{\lambda_i}$ の上三角行列である(対角線より下の $0$ は極限でも $0$)。
(i):上三角行列の固有多項式は $\prod_i(x-(\text{対角成分}))$ であり、$e^A=Pe^TP^{-1}$(prop-mexp-similar)と $e^T$ は相似なので固有多項式が等しい(固有値 の命題「固有多項式の相似不変性」)。
(ii):(i) の固有多項式の定数項から、または $e^T$ の対角成分の積から、$\det e^A=\det e^T=\prod_ie^{\lambda_i}=e^{\lambda_1+\cdots+\lambda_n}$ である。$\operatorname{tr}A=\operatorname{tr}T=\lambda_1+\cdots+\lambda_n$ なので $\det e^A=e^{\operatorname{tr}A}$ である。
(iii):$A$ が実行列なら $\operatorname{tr}A$ は実数なので、$e^{\operatorname{tr}A}>0$ である。$\square$

(ii) は Tes12 の式 (3.23) で、Jordan 標準形を経由する同じ方針で述べられている。Lie群 の命題「指数写像と行列式」では $\varphi(t):=\det e^{tX}$ の満たす微分方程式 $\varphi'=(\operatorname{tr}X)\varphi$ から示されている。$\det$ は体積の拡大率なので、(ii) は「$x'=Ax$ の流れ $e^{tA}$ は体積を $e^{t\operatorname{tr}A}$ 倍にする」と読める。とくに $\operatorname{tr}A=0$ なら流れは体積を保つ。

反例:指数法則と指数写像の限界

数の指数関数の性質のうち、行列では成り立たなくなるものを並べる。

外す条件・誤った期待反例成り立たなくなること
$AB=BA$$A=E_{12}$、$B=E_{21}$$e^{A+B}=e^Ae^B$
「$e^{A+B}=e^Ae^B$ なら $AB=BA$」$A=\operatorname{diag}(0,2\pi i)$、$B=\begin{pmatrix}0&1\\0&2\pi i\end{pmatrix}$指数法則から可換性を導くこと
「$e^A=e^B$ なら $A=B$」$2\pi J$ と $O$指数写像の単射性
「正則な実行列は実行列の $e^X$ で書ける」$\operatorname{diag}(-1,1)$、$\operatorname{diag}(-2,-\frac12)$指数写像 $M_n(\mathbb{R})\to GL_n(\mathbb{R})$ の全射性

ここで $E_{ij}$ は $(i,j)$ 成分だけが $1$ でほかが $0$ の行列、$J$ は ex-mexp-rotation の行列である。

反例:可換でない行列では指数法則が崩れる

$A=E_{12}=\begin{pmatrix}0&1\\0&0\end{pmatrix}$、$B=E_{21}=\begin{pmatrix}0&0\\1&0\end{pmatrix}$ とする。$AB=E_{11}$、$BA=E_{22}$ なので可換でない。$A^2=B^2=O$ なので
$$ e^Ae^B=\begin{pmatrix}1&1\\0&1\end{pmatrix}\begin{pmatrix}1&0\\1&1\end{pmatrix}=\begin{pmatrix}2&1\\1&1\end{pmatrix},\qquad e^Be^A=\begin{pmatrix}1&1\\1&2\end{pmatrix} $$
である。一方 $K:=A+B=\begin{pmatrix}0&1\\1&0\end{pmatrix}$ は $K^2=I$ を満たすので、fml-mexp-2x2($\delta=0$、$D=1$)から
$$ e^{A+B}=\cosh1\cdot I+\sinh1\cdot K=\begin{pmatrix}\cosh1&\sinh1\\\sinh1&\cosh1\end{pmatrix}\approx\begin{pmatrix}1.543&1.175\\1.175&1.543\end{pmatrix} $$
である。$e^{A+B}$ は $e^Ae^B$ とも $e^Be^A$ とも異なる。満たす性質は「$e^A$、$e^B$、$e^{A+B}$ が定義されること」、満たさない性質は「$AB=BA$」であり、破れる結論は thm-mexp-product の $e^{A+B}=e^Ae^B$ である。

反例:指数法則が成り立っても可換とは限らない

$A=\begin{pmatrix}0&0\\0&2\pi i\end{pmatrix}$、$B=\begin{pmatrix}0&1\\0&2\pi i\end{pmatrix}$ とすると
$$ AB-BA=\begin{pmatrix}0&0\\0&-4\pi^2\end{pmatrix}-\begin{pmatrix}0&2\pi i\\0&-4\pi^2\end{pmatrix}=\begin{pmatrix}0&-2\pi i\\0&0\end{pmatrix}\ne O $$
である。一方 $e^A=\operatorname{diag}(1,e^{2\pi i})=I$ である。$B$ と $A+B=\begin{pmatrix}0&1\\0&4\pi i\end{pmatrix}$ は、それぞれ相異なる固有値 $0,2\pi i$ と $0,4\pi i$ をもつので対角化でき、prop-mexp-similar から $e^B=P\operatorname{diag}(1,e^{2\pi i})P^{-1}=I$、同様に $e^{A+B}=I$ である。よって $e^{A+B}=I=e^Ae^B$ である。$AB=BA$ は指数法則の十分条件であって、必要条件ではない。

反例:指数写像は単射でない

ex-mexp-rotation から $e^{2\pi J}=R_{2\pi}=I=e^{O}$ であるが、$2\pi J\ne O$ である。より一般に、すべての整数 $k$ について $e^{2\pi kJ}=I$ である。これは複素数の $e^{2\pi i}=1$ の行列版である。満たす性質は「$e^{2\pi J}=e^O$」、満たさない性質は「$2\pi J=O$」であり、実数の指数関数では成り立つ「$e^a=e^b$ なら $a=b$」が行列では崩れる。$I$ に近い行列 $A$ については、後の prop-mexp-log の対数によって $A=e^{\log A}$ と書き表せる。

反例:実行列の指数写像は全射でない

実行列 $X$ について thm-mexp-det の (iii) から $\det e^X>0$ なので、$\det$ が負の行列、たとえば $\operatorname{diag}(-1,1)$ は実行列の $e^X$ の形に書けない。
$\det$ が正でも書けないものがある。$A=\operatorname{diag}\bigl(-2,-\frac12\bigr)$($\det A=1$)が実行列 $X$ によって $e^X$ と書けたとすると、$e^{\operatorname{tr}X}=\det A=1$ から $\operatorname{tr}X=0$ である。ところが Lie群 の例「反例:連結でも指数写像は全射でない」のとおり、$\operatorname{tr}X=0$ の実行列 $X$ ではつねに $\operatorname{tr}e^X\ge-2$ であり、$\operatorname{tr}A=-\frac52$ と矛盾する。
一方、固有値が負でも $e^X$ と書ける実行列はある。$e^{\pi J}=R_\pi=-I$ である。また $A$ 自身は 2 つの指数の積 $e^{\pi J}e^{D}$($D=\operatorname{diag}(\log2,-\log2)$)である。複素行列の範囲では、次の節の thm-mexp-surjective のとおり、どの正則行列も $e^X$ と書ける。満たす性質は「$A$ は正則な実行列」、満たさない性質は「実行列の指数関数の像に入ること」である。

対数と複素行列の指数写像

数の対数 $\log(1+x)=x-\frac{x^2}2+\frac{x^3}3-\cdots$($\lvert x\rvert<1$)も、同じように行列へ広げられる(冪級数 の例「対数の冪級数」)。

$I$ の近くの対数

$M\in M_n(\mathbb{K})$ が $\|M\|<1$ を満たすか、冪零であるとする。
$$ \log(I+M):=\sum_{k=1}^{\infty}\frac{(-1)^{k+1}}{k}M^k=M-\frac12M^2+\frac13M^3-\cdots $$
は収束し(冪零なら有限和)、$e^{\log(I+M)}=I+M$ である。

要点:$L(t):=\log(I+tM)$($0\le t\le1$)とおくと、$F(t):=e^{L(t)}$ と $G(t):=I+tM$ はどちらも「微分すると $M(I+tM)^{-1}$ を左から掛けたものになり、$t=0$ で $I$」という同じ条件を満たすので、$G(t)^{-1}F(t)$ の導関数が $0$ になり、$F=G$ が従う。

詳しい証明を開く

収束:$\|M^k/k\|\le\|M\|^k$ なので、$\|M\|<1$ なら prop-mexp-convergence の証明の前半と同じ理由で収束する。冪零なら有限和である。以下 $0\le t\le1$ とすると、$tM$ も同じ仮定を満たす。

段 1($I+tM$ の逆行列).$(I+tM)\sum_{j=0}^{N}(-tM)^j=I-(-tM)^{N+1}$ であり、右辺は $N\to\infty$ で $I$ に近づく($\|tM\|<1$、または冪零)。よって $I+tM$ は正則で、$(I+tM)^{-1}=\sum_{j\ge0}(-tM)^j$ である。

段 2($L$ の微分).$L(t)$ の各成分は $t$ の冪級数で、係数の大きさは $\|M\|^k/k$ 以下なので、収束半径は $1/\|M\|>1$ 以上である(冪零なら多項式)。冪級数 の定理「項別微分」(複素数の係数なら実部と虚部に分けて使う)から項別に微分でき、$L'(t)=\sum_{k\ge1}(-1)^{k+1}t^{k-1}M^k=M\sum_{j\ge0}(-tM)^j=M(I+tM)^{-1}$ である。

段 3($F$ の微分).$L(s)$、$L'(s)$ はどれも $M$ の多項式の極限なので、互いに可換である。$X_h:=L(t+h)-L(t)$ とおくと、thm-mexp-product から $F(t+h)-F(t)=F(t)\bigl(e^{X_h}-I\bigr)$ であり、prop-mexp-convergence の (ii) から $\bigl\|e^{X_h}-I-X_h\bigr\|\le\frac12\|X_h\|^2e^{\|X_h\|}$ である。$X_h/h\to L'(t)$ なので、$\bigl(F(t+h)-F(t)\bigr)/h\to F(t)L'(t)=M(I+tM)^{-1}F(t)$ である。

段 4(比べる).$G(t)=I+tM$ の逆行列の成分は Cramer の公式から $t$ の有理式で微分可能であり、$GG^{-1}=I$ を微分して $(G^{-1})'=-G^{-1}MG^{-1}$ である。$H(t):=G(t)^{-1}F(t)$ とおくと、$G^{-1}$ と $M$ は可換なので $H'=-G^{-1}MG^{-1}F+G^{-1}MG^{-1}F=O$ であり、$H(t)=H(0)=I$ である。$t=1$ として $e^{\log(I+M)}=F(1)=G(1)=I+M$ を得る。$\square$

この対数を使うと、複素行列の範囲では指数写像が全射であることが分かる。

複素行列の指数写像の全射性

正則な複素行列 $A\in GL_n(\mathbb{C})$ に対して、$e^X=A$ となる $X\in M_n(\mathbb{C})$ が存在する。

要点:Jordan 細胞ごとに考え、$\lambda I+N_k=\lambda\bigl(I+\lambda^{-1}N_k\bigr)$ の $\lambda$ には複素数の対数を、$I+\lambda^{-1}N_k$ には prop-mexp-log の対数を使う。

詳しい証明を開く

Jordan標準形 の定理「Jordan標準形の存在」から $A=PJP^{-1}$ と書け、prop-mexp-similar の (i)・(iv) により、各 Jordan 細胞 $\lambda I+N_k$ について $e^{X_k}=\lambda I+N_k$ となる $X_k$ を見つければよい($X:=P\operatorname{diag}(X_1,\dots)P^{-1}$ とおく)。$A$ は正則なので $\lambda\ne0$ であり、$\lambda I+N_k=\lambda\bigl(I+\lambda^{-1}N_k\bigr)$ と書ける。$\lambda^{-1}N_k$ は冪零なので、prop-mexp-log から $L:=\log\bigl(I+\lambda^{-1}N_k\bigr)$ について $e^{L}=I+\lambda^{-1}N_k$ である。複素数の指数関数は $\mathbb{C}\setminus\{0\}$ への全射なので、$e^{\mu}=\lambda$ となる $\mu\in\mathbb{C}$ がある($\lambda=re^{i\theta}$ なら $\mu=\log r+i\theta$)。$\mu I$ と $L$ は可換なので、$X_k:=\mu I+L$ について $e^{X_k}=e^{\mu}e^{L}=\lambda\bigl(I+\lambda^{-1}N_k\bigr)$ である。$\square$

実行列では ex-mexp-not-surjective のとおり全射でない。この違いは、実数の範囲では負の数の対数がとれないことに対応している。

補足

行列の指数関数は、Lie 群と Lie 環を結ぶ写像として現れる。

Lie 群・Lie 環とのつながりを開く
  • 行列 Lie 群 $G$ の Lie 環 $\mathfrak{g}$ の元 $X$ について、$t\mapsto e^{tX}$ は $\mathbb{R}$ から $G$ への準同型(1 径数部分群)であり、逆に 1 径数部分群はすべてこの形である(Lie群 の定理「1 径数部分群と Lie 環」)。$\mathfrak{so}(n)$ の元(交代行列)の指数関数は回転の行列になる。
  • 可換でない $X,Y$ では $e^{tX}e^{tY}\ne e^{t(X+Y)}$ となりうる(ex-mexp-noncommuting)。その差を表すのが交換子 $[X,Y]=XY-YX$ であり、$e^{tX}e^{tY}=e^{t(X+Y)+\frac{t^2}2[X,Y]+\cdots}$ と展開される(Campbell–Hausdorff の公式、Nic26 Remark 3.1.22)。交換子を積とする代数が Lie環 である。
  • 行列 $A$ の定める線形のベクトル場 $u\mapsto Au$ の流れは $e^{tA}$ である(Nic26 Example 3.1.2・Example 3.1.5)。一般の多様体の上の流れは ベクトル場 の定理「流れの基本定理」にある。

関連項目

参考文献

Mathpediaは寄付と、参考文献の書籍リンク(Amazonアソシエイト)の紹介料で運営されています。 支援について / 寄付する