2次関数

同義語:二次関数quadratic function

概要

2次関数(quadratic function)とは、零でない実対称行列 $A$、ベクトル $b$、実数 $c$ によって $f(x)=x^{\top}Ax+b^{\top}x+c$ と書ける $\mathbb{R}^n$ 上の関数のことで、$n=1$ の場合が $ax^2+bx+c$($a\neq0$)である。$2Ap=-b$ となる $p$ があれば $f(x)=(x-p)^{\top}A(x-p)+f(p)$ と平方完成でき、$f$ が最小値をもつことは $A$ が半正定値で $b$ が $A$ の像に入ることと同値で、最小点がただ1つであることは $A$ が正定値であることと同値になる。また $f$ が凸関数であることは $A$ が半正定値であることと同値である。最小二乗法や Cauchy–Schwarz の不等式の判別式による証明は、2次関数の最小値の問題として理解できる。

$$\newcommand{C}[0]{\mathbb{C}} \newcommand{div}[0]{\mathbin{÷}} \newcommand{N}[0]{\mathbb{N}} \newcommand{Q}[0]{\mathbb{Q}} \newcommand{R}[0]{\mathbb{R}} \newcommand{Z}[0]{\mathbb{Z}} $$

前提知識: 2次方程式, 2次形式, 対称行列

高校数学の 2 次関数は $y=ax^2+bx+c$($a\neq0$)の形の関数で、平方完成 $y=a(x-p)^2+r$ によってグラフが放物線 $y=ax^2$ の平行移動であることが分かり、$a>0$ なら頂点 $x=p$ で最小値 $r$ をとる。大学では、同じ考え方を変数が $n$ 個の場合へ広げる。2 次の部分は 2次形式 $x^{\top}Ax$ になり、平方完成は「1 次の項を平行移動で消す」操作として行列で書ける。最小値をもつかどうかは、2 次形式の符号(半正定値か)と、1 次の項が消せるかどうかで完全に決まる。さらに、2 次関数が凸関数になることも 2 次形式の符号で判定できる。
この記事では、多変数の 2 次関数を定義し、平方完成の一般化、最小値が存在するための必要十分条件、凸性の判定を証明し、高校数学の 2 次関数の計算と、最小二乗法・平均値・Cauchy–Schwarz の不等式などとのつながりを述べる。

高校数学との対応

高校で学ぶことこの記事での形箇所
平方完成 $ax^2+bx+c=a\Bigl(x+\dfrac{b}{2a}\Bigr)^2-\dfrac{b^2-4ac}{4a}$行列による平方完成 $f(x)=(x-p)^{\top}A(x-p)+f(p)$thm-qfn-complete
グラフは $y=ax^2$ を平行移動した放物線頂点(中心)$p$ への平行移動、焦点と準線thm-qfn-complete、prop-qfn-parabola
$a>0$ なら頂点で最小、$a<0$ なら最小値なし最小値の存在 ⇔ $A$ が半正定値で $b$ が $A$ の像に入るthm-qfn-min
$a>0$ なら下に凸凸 ⇔ $A$ が半正定値thm-qfn-convex
つねに $ax^2+bx+c\ge0$ ⇔ $a>0$、$D\le0$非負性と判別式、Cauchy–Schwarz の不等式cor-qfn-nonneg

閉区間での最大・最小(軸と区間の位置で場合を分ける計算)は 2次関数の最大・最小 の定理「閉区間における 2 次関数の最大・最小」に、グラフの平行移動の式は グラフの平行移動と対称移動 の系「関数のグラフの移動」にある。

定義

$\mathbb{R}^n$ の元は縦ベクトルとし、$x^{\top}$ は転置を表す。

2次関数

$n\ge1$ とする。実数を成分とする $n$ 次の対称行列 $A\neq O$、$b\in\mathbb{R}^n$、$c\in\mathbb{R}$ によって
$$ f(x)=x^{\top}Ax+b^{\top}x+c\qquad(x\in\mathbb{R}^n) $$
と書ける関数 $f\colon\mathbb{R}^n\to\mathbb{R}$ を、$n$ 変数の(実)2 次関数(quadratic function)という。$q(x):=x^{\top}Ax$ を $f$ の 2 次の部分 という。$q$ は $\mathbb{R}^n$ 上の 2次形式 である。

$n=1$ のとき $A=(a)$ で、$f(x)=ax^2+bx+c$($a\neq0$)が高校の 2 次関数である。$n=2$ では $f(x,y)=a_{11}x^2+2a_{12}xy+a_{22}y^2+b_1x+b_2y+c$ となる。$x^{\top}Mx$ の形の式は、$M$ を対称行列 $\frac12(M+M^{\top})$ に取り替えても値が変わらない(2次形式 の命題「2次形式と対称行列の対応」)ので、$A$ を対称行列としてよい。
$A$、$b$、$c$ は関数 $f$ からただ 1 通りに決まる。実際、$c=f(0)$、$b^{\top}x=\frac12\bigl(f(x)-f(-x)\bigr)$、$q(x)=\frac12\bigl(f(x)+f(-x)\bigr)-c$ であり、対称行列 $A$ は $x^{\top}Ay=\frac12\bigl(q(x+y)-q(x)-q(y)\bigr)$ によって $q$ から決まる。
2 次形式の符号について、次の語を使う。$A$ が 半正定値 であるとは、すべての $v\in\mathbb{R}^n$ で $v^{\top}Av\ge0$ となることであり、正定値 であるとは、$v\neq0$ ならつねに $v^{\top}Av>0$ となることである(2次形式 の定義「実2次形式の符号」)。$A$ の 像 $\operatorname{Im}A=\{Ax : x\in\mathbb{R}^n\}$ と 核 $\operatorname{Ker}A=\{x : Ax=0\}$ も使う。

直感

2 次関数は、$x$ を少し動かしたときの値の変化が「1 次の項」と「2 次の項」だけで尽きる関数である。点 $p$ を中心に見直すと、1 次の項は $p$ の選び方で変わり、うまく選べば消える。そのとき $f$ は「2 次形式を $p$ だけ平行移動して定数を足したもの」になり、形は 2 次形式 $q$ で決まる。$q$ がどの方向にも上向き(正定値)なら $p$ がただ 1 つの谷底になり、下向きの方向が 1 つでもあれば谷底はない。平らな方向($Av=0$ となる $v$)があるときは、その方向に 1 次の項が残っていなければ谷底は直線や平面になり、残っていれば値は坂を下り続ける。

平方完成の一般化

行列による平方完成

$f(x)=x^{\top}Ax+b^{\top}x+c$ を 2 次関数とし、$p\in\mathbb{R}^n$ が $2Ap=-b$ を満たすとする(このような $p$ があることは $b\in\operatorname{Im}A$ と同値である)。このとき、すべての $x\in\mathbb{R}^n$ について
$$ f(x)=(x-p)^{\top}A(x-p)+f(p),\qquad f(p)=c-p^{\top}Ap $$
が成り立つ。とくに $A$ が正則なら $p=-\frac12A^{-1}b$ はただ 1 つに決まり、$f(p)=c-\frac14b^{\top}A^{-1}b$ である。

右辺を展開する

$A$ は対称なので $p^{\top}Ax=(p^{\top}Ax)^{\top}=x^{\top}Ap$ である。よって
$$ (x-p)^{\top}A(x-p)=x^{\top}Ax-2p^{\top}Ax+p^{\top}Ap $$
である。$2Ap=-b$ の転置をとると $2p^{\top}A=-b^{\top}$($A^{\top}=A$)なので、$-2p^{\top}Ax=b^{\top}x$ であり、
$$ (x-p)^{\top}A(x-p)=x^{\top}Ax+b^{\top}x+p^{\top}Ap=f(x)-c+p^{\top}Ap $$
となる。$x=p$ を代入すると左辺は $0$ なので $f(p)=c-p^{\top}Ap$ であり、これを代入すれば主張の式になる。$A$ が正則なら $2Ap=-b$ の解は $p=-\frac12A^{-1}b$ だけで、$p^{\top}Ap=\frac14b^{\top}A^{-1}AA^{-1}b=\frac14b^{\top}A^{-1}b$ である($(A^{-1})^{\top}=A^{-1}$ を使った)。$\square$

$n=1$、$A=(a)$ では $p=-\frac{b}{2a}$、$f(p)=c-\frac{b^2}{4a}=-\frac{b^2-4ac}{4a}$ となり、高校の平方完成そのものである。定理の式は、$f$ のグラフが 2 次形式 $q$ のグラフを $p$ だけ平行移動し、高さ $f(p)$ だけ持ち上げたものであることを表す。$A$ が正則でなく $b\notin\operatorname{Im}A$ のときは、どこを中心にとっても 1 次の項が残る。たとえば $f(x,y)=x^2+y$ では $A=\begin{pmatrix}1&0\\0&0\end{pmatrix}$、$b=(0,1)^{\top}$ で、$b$ は $\operatorname{Im}A=\{(s,0)^{\top}\}$ に入らない。
1 変数の 2 次関数のグラフが放物線であることは、焦点と準線で確かめられる。

2 次関数のグラフの焦点と準線

$a\neq0$、$f(x)=a(x-p)^2+r$ とし、$F=\Bigl(p,\ r+\dfrac1{4a}\Bigr)$、直線 $\ell\colon y=r-\dfrac1{4a}$ とおく。平面の点 $P$ について、$P$ が $y=f(x)$ のグラフ上にあることと、$P$ から $F$ までの距離と $P$ から $\ell$ までの距離が等しいことは同値である。

2 つの距離の 2 乗を比べる

平行移動 $(x,y)\mapsto(x-p,\,y-r)$ は距離を変えず、グラフ・$F$・$\ell$ をそれぞれ $y=ax^2$、$(0,\frac1{4a})$、$y=-\frac1{4a}$ に移すので、$p=r=0$ としてよい。$h:=\frac1{4a}$ とおく。点 $P=(x,y)$ について、$F$ までの距離の 2 乗は $x^2+(y-h)^2$、$\ell$ までの距離の 2 乗は $(y+h)^2$ である。両者が等しいことは
$$ x^2+y^2-2hy+h^2=y^2+2hy+h^2\iff x^2=4hy=\frac{y}{a}\iff y=ax^2 $$
と同値である。距離は $0$ 以上なので、2 乗が等しいことと距離が等しいことは同値である。$\square$

焦点と準線をもつ曲線としての放物線と、ほかの円錐曲線との関係は 円錐曲線 の定理「実アフィン平面の非退化な円錐曲線」にある。

最小値の存在

最小値の判定には、対称行列の像と核についての次の 2 つの事実を使う。$v^{\top}w=0$ のとき $v$ と $w$ は直交するといい、部分空間 $W$ の元すべてと直交するベクトルの全体を $W^{\perp}$ と書く。

対称行列の像と核

$A$ を $n$ 次の実対称行列とする。

  1. $\operatorname{Im}A=(\operatorname{Ker}A)^{\perp}$ である。
  2. $A$ が半正定値で $v^{\top}Av=0$ なら $Av=0$ である。
直交と次元、および 1 次の項の符号

1:$z=Ax\in\operatorname{Im}A$、$y\in\operatorname{Ker}A$ なら $y^{\top}z=y^{\top}Ax=(Ay)^{\top}x=0$ なので $\operatorname{Im}A\subset(\operatorname{Ker}A)^{\perp}$ である。次元を比べる。$k=\dim\operatorname{Ker}A$ とし、$\operatorname{Ker}A$ の基底 $w_1,\dots,w_k$ を行に並べた $k\times n$ 行列を $W$ とすると、$(\operatorname{Ker}A)^{\perp}=\operatorname{Ker}W$ である。$W$ の階数は $k$ なので、次元公式により $\dim(\operatorname{Ker}A)^{\perp}=n-k$ である。一方、$A$ についての次元公式から $\dim\operatorname{Im}A=n-k$ である。包含関係にある同じ次元の部分空間なので等しい。
2:任意の $w\in\mathbb{R}^n$ と実数 $s$ について、半正定値性から
$$ 0\le(v+sw)^{\top}A(v+sw)=2s\,w^{\top}Av+s^2\,w^{\top}Aw $$
である($v^{\top}Av=0$ と $A$ の対称性を使った)。$w^{\top}Av\neq0$ なら、$s$ を $w^{\top}Av$ と逆の符号で絶対値を十分小さくとると右辺が負になるので、$w^{\top}Av=0$ である。$w=Av$ とすれば $\|Av\|^2=0$、すなわち $Av=0$ である。$\square$

2 次関数の最小値

$f(x)=x^{\top}Ax+b^{\top}x+c$ を 2 次関数とする。

  1. $f$ が $\mathbb{R}^n$ で下に有界であることと、「$A$ が半正定値で、$b\in\operatorname{Im}A$」であることは同値である。
  2. 1 の条件が成り立つとき、$f$ は最小値をもつ。最小値は $2Ap=-b$ を満たす任意の $p$ での値 $f(p)=c-p^{\top}Ap$ であり、最小値をとる点の全体は、方程式 $2Ax=-b$ の解の全体 $p+\operatorname{Ker}A$ である。
  3. 最小値をとる点がただ 1 つであることと、$A$ が正定値であることは同値である。そのとき最小点は $-\frac12A^{-1}b$ である。
下がる方向を探すか、平方完成する

$A$ が半正定値でない場合。 $v^{\top}Av<0$ となる $v$ がある。実数 $t$ について $f(tv)=t^2\,v^{\top}Av+t\,b^{\top}v+c$ は、$t\to\infty$ で $-\infty$ に発散するので、$f$ は下に有界でない。
$A$ が半正定値で $b\notin\operatorname{Im}A$ の場合。 lem-qfn-image-kernel の 1 により $b\notin(\operatorname{Ker}A)^{\perp}$ なので、$b^{\top}v\neq0$ となる $v\in\operatorname{Ker}A$ がある。$Av=0$ なので $f(tv)=t\,b^{\top}v+c$ であり、$t$ を $b^{\top}v$ と逆の符号で $|t|\to\infty$ とすると $-\infty$ に発散する。
$A$ が半正定値で $b\in\operatorname{Im}A$ の場合。 $2Ap=-b$ となる $p$ がとれ、thm-qfn-complete により $f(x)=(x-p)^{\top}A(x-p)+f(p)\ge f(p)$ である。よって $f$ は下に有界で、$f(p)$ が最小値である。等号が成り立つのは $(x-p)^{\top}A(x-p)=0$ のときで、lem-qfn-image-kernel の 2 によりこれは $A(x-p)=0$、すなわち $2Ax=2Ap=-b$ と同値である(逆に $A(x-p)=0$ なら $(x-p)^{\top}A(x-p)=0$)。以上で 1 と 2 が示された。
3:最小点がただ 1 つあるとする。最小値があるので 1 により $A$ は半正定値で、2 により最小点の全体 $p+\operatorname{Ker}A$ が 1 点なので $\operatorname{Ker}A=\{0\}$ である。すると $v\neq0$ なら $Av\neq0$ で、lem-qfn-image-kernel の 2 の対偶から $v^{\top}Av\neq0$、半正定値なので $v^{\top}Av>0$ であり、$A$ は正定値である。逆に $A$ が正定値なら、$Av=0$ のとき $v^{\top}Av=0$ から $v=0$ なので $\operatorname{Ker}A=\{0\}$ で、$A$ は正則である。とくに $b\in\operatorname{Im}A=\mathbb{R}^n$ なので 2 が使え、最小点は $p+\operatorname{Ker}A=\{p\}$、$p=-\frac12A^{-1}b$ のただ 1 つである。$\square$

最大値は $-f$ に定理を使えば分かる。$n=1$ では、$a>0$ なら頂点 $-\frac{b}{2a}$ で最小、$a<0$ なら下に有界でないという高校の結果になる($a\neq0$ なので $\operatorname{Im}A=\mathbb{R}$)。正定値かどうかの具体的な判定法(固有値、左上の小行列式)は 2次形式 の定理「正定値であるための条件」にある。最小点の条件 $2Ax+b=0$ は、$f$ の各変数についての偏微分がすべて $0$ になる条件でもある。

凸性

2 次関数の凸性

$f(x)=x^{\top}Ax+b^{\top}x+c$ を 2 次関数とする。すべての $x,y\in\mathbb{R}^n$ と実数 $\lambda$ について
$$ \lambda f(x)+(1-\lambda)f(y)-f\bigl(\lambda x+(1-\lambda)y\bigr)=\lambda(1-\lambda)\,(x-y)^{\top}A(x-y) $$
が成り立つ。したがって、$f$ が凸関数であることと $A$ が半正定値であることは同値であり、$f$ が狭義凸であることと $A$ が正定値であることは同値である。

1 次の部分は消え、2 次の部分だけが残る

$z=\lambda x+(1-\lambda)y$ とおく。定数 $c$ と 1 次の部分 $b^{\top}x$ については、左辺への寄与は $\lambda c+(1-\lambda)c-c=0$、$\lambda b^{\top}x+(1-\lambda)b^{\top}y-b^{\top}z=0$ である。2 次の部分 $q(x)=x^{\top}Ax$ については、$A$ の対称性から $q(z)=\lambda^2q(x)+2\lambda(1-\lambda)x^{\top}Ay+(1-\lambda)^2q(y)$ なので
$$ \lambda q(x)+(1-\lambda)q(y)-q(z)=\lambda(1-\lambda)\bigl(q(x)-2x^{\top}Ay+q(y)\bigr)=\lambda(1-\lambda)\,(x-y)^{\top}A(x-y) $$
である($\lambda-\lambda^2=\lambda(1-\lambda)$、$(1-\lambda)-(1-\lambda)^2=\lambda(1-\lambda)$ を使った)。
$f$ が凸であるとは、すべての $x,y$ と $0<\lambda<1$ で左辺が $0$ 以上であることである。$0<\lambda<1$ では $\lambda(1-\lambda)>0$ で、$x-y$ は任意のベクトル $v$ をとりうるので、これは「すべての $v$ で $v^{\top}Av\ge0$」と同値である。狭義凸($x\neq y$、$0<\lambda<1$ で左辺が正)は「$v\neq0$ で $v^{\top}Av>0$」と同値である。$\square$

$n=1$ では、$f(x)=ax^2+bx+c$ が凸であることと $a>0$ が同値になる($a\neq0$ なので、半正定値と正定値はどちらも $a>0$ と同じ)。これは 2次関数の最大・最小 の命題「下に凸の 2 次関数は凸関数」と同じ内容である。凸関数では局所的な最小が全体の最小になる(凸関数 の命題「凸関数の局所的な最小は全体の最小」)ので、半正定値の場合に最小点が $2Ax+b=0$ の解の全体になることは、凸関数の一般論とも合う。

非負性と判別式

thm-qfn-min を $n=1$ で使うと、高校で学ぶ「2 次式がつねに $0$ 以上である条件」が、2 次の係数が $0$ の場合まで含めて得られる。

1 変数の 2 次式の非負性

実数 $a,b,c$ について、すべての実数 $t$ で $at^2+2bt+c\ge0$ となることと、
$$ a\ge0,\qquad c\ge0,\qquad b^2\le ac $$
がすべて成り立つことは同値である。

2 次の係数の符号で分ける

$g(t)=at^2+2bt+c$ とおく。
$a\neq0$ のとき、$g$ は $A=(a)$、1 次の係数 $2b$ の 2 次関数で、$\operatorname{Im}A=\mathbb{R}$ である。thm-qfn-min により、$g$ が下に有界であることは $a>0$ と同値で、そのとき最小値は $p=-b/a$ での値 $c-ap^2=c-\frac{b^2}{a}$ である。よって $g\ge0$ は「$a>0$ かつ $ac\ge b^2$」と同値であり、このとき $c\ge\frac{b^2}{a}\ge0$ である。逆に $a>0$、$b^2\le ac$ なら最小値は $0$ 以上である。
$a=0$ のとき、$g(t)=2bt+c$ がすべての $t$ で $0$ 以上であることは $b=0$ かつ $c\ge0$ と同値である($b\neq0$ なら $t$ を $b$ と逆の符号で大きくとると負になる)。条件の側も、$a=0$ なら $b^2\le0$ から $b=0$ となり、$c\ge0$ と合わせて同じである。$\square$

$a\neq0$ のとき、$b^2\le ac$ は判別式 $(2b)^2-4ac\le0$ と同じである。この系から Cauchy–Schwarzの不等式 が出る。$x,y\in\mathbb{R}^m$ について
$$ g(t)=\sum_{i=1}^m(tx_i+y_i)^2=\Bigl(\sum_ix_i^2\Bigr)t^2+2\Bigl(\sum_ix_iy_i\Bigr)t+\sum_iy_i^2 $$
はつねに $0$ 以上なので、系により $\bigl(\sum_ix_iy_i\bigr)^2\le\bigl(\sum_ix_i^2\bigr)\bigl(\sum_iy_i^2\bigr)$ である。$\sum_ix_i^2=0$ の場合も系は $a=0$ を含めて述べてあるので、場合分けは要らない。この論法は 相関係数(高校数学) の定理「Cauchy–Schwarz の不等式」や 判別式で示す不等式 で使われている。

例

2 変数の 2 次関数の最小値

$f(x,y)=x^2+xy+y^2-3x$ では $A=\begin{pmatrix}1&\frac12\\[2pt]\frac12&1\end{pmatrix}$、$b=(-3,0)^{\top}$、$c=0$ である。$v^{\top}Av=v_1^2+v_1v_2+v_2^2=\bigl(v_1+\frac{v_2}{2}\bigr)^2+\frac34v_2^2$ は $v\neq0$ なら正なので、$A$ は正定値である。$2Ap=-b$ は $2p_1+p_2=3$、$p_1+2p_2=0$ で、$p=(2,-1)$ である。thm-qfn-min により、$f$ は点 $(2,-1)$ だけで最小値 $f(2,-1)=4-2+1-6=-3$ をとる。$c-\frac14b^{\top}A^{-1}b$ で計算しても、$A^{-1}=\frac43\begin{pmatrix}1&-\frac12\\[2pt]-\frac12&1\end{pmatrix}$ から $b^{\top}A^{-1}b=9\cdot\frac43=12$ で、$0-3=-3$ となる。同じ関数の極値を Hesse 行列で調べる方法は 2次曲線と2次形式 の例「$x^2+xy+y^2-3x$ の極小」にある。

平均値と最小二乗法
  1. 平均値:実数 $x_1,\dots,x_m$ について $E(s)=\sum_i(x_i-s)^2=ms^2-2\bigl(\sum_ix_i\bigr)s+\sum_ix_i^2$ は $A=(m)$ の 2 次関数なので、$p=\frac1m\sum_ix_i$(平均値)だけで最小になる(平均値と二乗誤差 の定理「平均値は二乗誤差の和を最小にする」)。
  2. 最小二乗法:$M$ を零行列でない $m\times n$ 実行列、$y\in\mathbb{R}^m$ とし、$f(x)=\|Mx-y\|^2=x^{\top}(M^{\top}M)x-2(M^{\top}y)^{\top}x+\|y\|^2$ を考える。$A=M^{\top}M$ は $v^{\top}Av=\|Mv\|^2\ge0$ なので半正定値である($A=O$ なら $\|Mv\|^2=0$ がすべての $v$ で成り立って $M=O$ となるので、$A\neq O$)。さらに $\operatorname{Ker}A=\operatorname{Ker}M$ である($Av=0$ なら $\|Mv\|^2=v^{\top}Av=0$)。$v\in\operatorname{Ker}A$ なら $v^{\top}M^{\top}y=(Mv)^{\top}y=0$ なので、$M^{\top}y\in(\operatorname{Ker}A)^{\perp}=\operatorname{Im}A$(lem-qfn-image-kernel)である。したがって thm-qfn-min の条件がつねに満たされ、最小値が存在し、最小点は正規方程式 $M^{\top}Mx=M^{\top}y$ の解の全体である。最小点がただ 1 つであることは $\operatorname{Ker}M=\{0\}$、すなわち $M$ の列が 1 次独立であることと同値である(最小二乗法 の定理「最小二乗解と正規方程式」)。

条件を外すと成り立たなくなること

thm-qfn-min の仮定を 1 つずつ外した反例と、定義の直後に述べた「係数は関数から決まる」の仮定(係数が実数)を外した反例を表にまとめる。各行の確かめは下の例にある。

外す条件反例成り立たなくなること
$A$ が半正定値$f(x,y)=x^2-y^2$下に有界(最小値をもつ)
$b\in\operatorname{Im}A$$f(x,y)=x^2+y$下に有界(最小値をもつ)
$A$ が正定値(3 の仮定)$f(x,y)=x^2$最小点がただ 1 つ
定義域が $\mathbb{R}^n$ 全体開区間 $(1,2)$ 上の $f(x)=x^2$下に有界なら最小値をもつ
係数が実数2 元体 $\mathbb{F}_2$ 上の 2 変数の $x_1^2+2x_1x_2$ と $x_1^2$係数が関数から決まる
反例:表の各行の確かめ
  1. $A=\begin{pmatrix}1&0\\0&-1\end{pmatrix}$ は $v=(0,1)^{\top}$ で $v^{\top}Av=-1<0$ なので半正定値でない($b=0\in\operatorname{Im}A$ は満たす)。$f(0,t)=-t^2$ は $t\to\infty$ で $-\infty$ に発散する。
  2. $A=\begin{pmatrix}1&0\\0&0\end{pmatrix}$ は半正定値だが、$b=(0,1)^{\top}$ は $\operatorname{Im}A=\{(s,0)^{\top}\}$ に入らない。$f(0,t)=t$ は $t\to-\infty$ で $-\infty$ に発散する。
  3. $A=\begin{pmatrix}1&0\\0&0\end{pmatrix}$、$b=0$ は 1・2 の条件を満たすので最小値 $0$ をもつが、$A$ は正定値でなく($v=(0,1)^{\top}$ で $v^{\top}Av=0$)、最小点は直線 $x=0$ 上のすべての点である。
  4. $(1,2)$ 上で $x^2>1$ であり、$x\to1$ で $x^2\to1$ なので下限は $1$ だが、$1$ は区間に含まれず、最小値はない。証明で使った「$x=p$ を代入する」「$tv$ と動かす」が定義域の外に出る。
  5. 2 元体 $\mathbb{F}_2$ の上で、零でない対称行列 $A_1=\begin{pmatrix}1&1\\1&0\end{pmatrix}$ と $A_2=\begin{pmatrix}1&0\\0&0\end{pmatrix}$ をとり、$b=0$、$c=0$ とする。$x^{\top}A_1x=x_1^2+2x_1x_2=x_1^2=x^{\top}A_2x$($2=0$)なので、異なる係数 $A_1\neq A_2$ が同じ関数を与え、係数が関数から決まらない。実数で係数が決まる証明は $\frac12$ を掛ける操作を使い、$\mathbb{F}_2$ では $2x_1x_2=0$ となって非対角成分が値に現れない。

補足

  • 一般のベクトル空間の上で:実ベクトル空間 $V$ 上の 2 次形式 $q$、線形形式 $\ell$、定数 $c$ により $f=q+\ell+c$ と書ける関数を、$V$ 上の 2 次関数と呼ぶ。有限次元で $q\neq0$ なら、基底をとって座標で書けばこの記事の形になり、thm-qfn-min と thm-qfn-convex が使える。半正定値・正定値であるかは $q$ の値の符号だけで決まるので、基底の取り方によらない。
  • 滑らかな関数の 2 次近似:2 回連続微分可能な関数 $F$ は、点 $p$ の近くで Taylorの定理(多変数の場合)により $F(p)+\nabla F(p)^{\top}(x-p)+\frac12(x-p)^{\top}H(x-p)$($H$ は Hesse 行列)で近似される。この近似は 2 次関数であり、極値の判定(2次曲線と2次形式 の注意「極値判定への応用」)は、近似の 2 次関数の最小値・最大値を thm-qfn-min で調べることにあたる。2 次関数 $f$ 自身の Hesse 行列は定数 $2A$ である。
  • 凸最適化:2 次関数の最小化は、制約がなければ連立 1 次方程式 $2Ax=-b$ を解くことに帰着する。この事実は BV04 の例 3.2(p. 71、凸性が $A$ の半正定値性で決まること)と例 4.5(pp. 140–141、制約のない 2 次関数の最小化の場合分け)にも述べられている。

関連項目

参考文献

[1]
Stephen Boyd, Lieven Vandenberghe, Convex Optimization, 1st ed., Cambridge University Press, 2004, §3.1.4 Example 3.2 Quadratic functions(凸性と半正定値性、p. 71)、§4.2.3 Example 4.5 Unconstrained quadratic optimization(制約のない 2 次関数の最小化、pp. 140–141)

Mathpediaは寄付と、参考文献の書籍リンク(Amazonアソシエイト)の紹介料で運営されています。 支援について / 寄付する