2次関数の最大・最小は、平方完成した形 $f(x)=a(x-p)^2+q$ から読み取れる。$a>0$ なら $f(x)$ の大小は軸 $x=p$ からの距離 $|x-p|$ の大小と一致するので、閉区間 $\alpha\le x\le\beta$ での最小値は区間の中で軸に最も近い点($p$ が区間内なら頂点、区間外なら近いほうの端点)でとり、最大値は軸から遠いほうの端点でとる($p$ が中点 $\frac{\alpha+\beta}2$ に等しければ両端)。$a<0$ では最大と最小の役割が入れ替わる。最大値が端点に来るのは、$a>0$ の2次関数が凸関数だからであり、閉区間上の凸関数はいつも端点で最大値をとる。端点を含まない区間や端のない区間では、最大値・最小値が存在しないことがある。
高校では、2 次関数の最大値・最小値を次の手順で求める。
$f(x)=x^2-4x+5$ を平方完成する。$x^2-4x=(x-2)^2-4$ なので
$$
f(x)=(x-2)^2-4+5=(x-2)^2+1
$$
である。$(x-2)^2\ge0$ であり、等号は $x=2$ のときだけ成り立つ。よって $f(x)\ge1$ で、最小値は $f(2)=1$ である。
一方、$x$ を大きくすると $(x-2)^2$ はいくらでも大きくなる。たとえば $f(12)=101$、$f(102)=10001$ である。したがって最大値はない。
同じ $f(x)=(x-2)^2+1$ を $0\le x\le3$ で考える。軸 $x=2$ は区間の中にある。
図1:$y=(x-2)^2+1$ のグラフのうち $0\le x\le3$ の部分(太線)。最小は頂点、最大は軸から遠い端点 $x=0$ でとることを見る図。両端 $x=0$、$x=3$ は区間に含まれるので、塗りつぶした点で描いている。
同じ $f$ を $3\le x\le5$ で考える。軸 $x=2$ は区間の左の外にある。この区間では、$x$ が増えると $f(x)$ も増える(理由は後の cor-qmm-monotone で示す)。したがって
3 つの例から、次の問いが出てくる。
| 高校の計算 | この記事での見方 | ボックス |
|---|---|---|
| 平方完成 $a(x-p)^2+q$ | 値は軸からの距離 $\lvert x-p\rvert$ だけで決まる | lem-qmm-distance |
| 頂点で最小($a>0$) | 区間の中で軸に最も近い点で最小 | thm-qmm-closed-interval |
| 最大は軸から遠い端点 | 凸関数の最大値は端点でとる | prop-qmm-convex-max |
| 閉区間なら答えがある | 連続関数の最大値・最小値の定理 | thm-qmm-continuous-extremes |
実数 $a,b,c$ で $a\ne0$ のものに対し、$f(x)=ax^2+bx+c$ を 2 次関数 という。
$$
p:=-\frac{b}{2a},\qquad q:=-\frac{b^2-4ac}{4a}
$$
とおくと、次の prop-qmm-completing-square により、すべての実数 $x$ について $f(x)=a(x-p)^2+q$ と書ける。この形を $f$ の 標準形、点 $(p,q)$ を 頂点、直線 $x=p$ を 軸 という。$a>0$ のときグラフは下に凸、$a<0$ のとき上に凸であるという。
$a\ne0$ のとき、すべての実数 $x$ について
$$
ax^2+bx+c=a\Bigl(x+\frac b{2a}\Bigr)^2-\frac{b^2-4ac}{4a}
$$
が成り立つ。
右辺の第 1 項を展開する。$(u+v)^2=u^2+2uv+v^2$ を $u=x$、$v=\frac b{2a}$ として使うと
$$
a\Bigl(x+\frac b{2a}\Bigr)^2=a\Bigl(x^2+\frac bax+\frac{b^2}{4a^2}\Bigr)=ax^2+bx+\frac{b^2}{4a}
$$
である。右辺の第 2 項は
$$
-\frac{b^2-4ac}{4a}=-\frac{b^2}{4a}+c
$$
である。2 つを足すと $\frac{b^2}{4a}$ が打ち消し合い、$ax^2+bx+c$ が残る。これが左辺である。$\square$
標準形 $a(x-p)^2+q$ では、$x$ は $(x-p)^2$ の形でしか現れない。実数 $u$ について $u^2=|u|^2$ なので、$(x-p)^2=|x-p|^2$ である。$|x-p|$ は数直線上での $x$ と $p$ の距離、つまり点 $x$ と軸との距離である。したがって、$f(x)$ の値は軸からの距離 $|x-p|$ だけで決まる。これを不等式の形で述べたのが次の補題で、この記事のすべての場合分けの土台になる。
$a>0$ とし、$f(x)=a(x-p)^2+q$ とする。実数 $x,y$ について次が成り立つ。
方針:$f(y)-f(x)$ を、2 つの距離 $|x-p|$、$|y-p|$ の式として因数分解し、各因数の符号を調べる。
段 1($q$ を消す)。$f(y)-f(x)=\bigl(a(y-p)^2+q\bigr)-\bigl(a(x-p)^2+q\bigr)=a\bigl((y-p)^2-(x-p)^2\bigr)$ である。
段 2(距離で書いて因数分解する)。実数 $u$ について $u^2=|u|^2$ だから、$(y-p)^2-(x-p)^2=|y-p|^2-|x-p|^2$ である。これに $s^2-t^2=(s-t)(s+t)$ を使うと
$$
f(y)-f(x)=a\bigl(|y-p|-|x-p|\bigr)\bigl(|y-p|+|x-p|\bigr)
$$
となる。
段 3(1 の場合)。$|x-p|<|y-p|$ とする。第 1 の因数 $|y-p|-|x-p|$ は正である。絶対値は $0$ 以上なので $|y-p|>|x-p|\ge0$ であり、第 2 の因数 $|y-p|+|x-p|$ も正である。$a>0$ だから、3 つの因数の積は正で、$f(y)-f(x)>0$、すなわち $f(x)< f(y)$ である。
段 4(2 の場合)。$|x-p|=|y-p|$ なら第 1 の因数が $0$ なので、$f(y)-f(x)=0$ である。
段 5($a<0$ の場合)。段 3 で、2 つの距離の因数は正のまま、$a$ だけが負になる。よって積は負で、$f(x)>f(y)$ となる。$\square$
$f(x)=(x-2)^2+1$($a=1$、軸 $p=2$)で確かめる。
高校で習う「軸の左側で減少、右側で増加」も、この補題から出る。
$a>0$、$f(x)=a(x-p)^2+q$ とする。
1:$s< t\le p$ とする。$s-p<0$、$t-p\le0$ なので $|s-p|=p-s$、$|t-p|=p-t$ である。$s< t$ の両辺を $-1$ 倍して $p$ を足すと $p-t< p-s$、すなわち $|t-p|<|s-p|$ である。lem-qmm-distance の 1 を $x=t$、$y=s$ として使うと $f(t)< f(s)$ となる。
2:$p\le s< t$ とする。$s-p\ge0$、$t-p>0$ なので $|s-p|=s-p$、$|t-p|=t-p$ であり、$s< t$ から $|s-p|<|t-p|$ である。lem-qmm-distance の 1 により $f(s)< f(t)$ となる。$\square$
$f(x)=(x-2)^2+1$($a=1$、軸 $p=2$)で、整数の点の値を計算する。
$$
f(-1)=10,\quad f(0)=5,\quad f(1)=2,\quad f(2)=1,\quad f(3)=2,\quad f(4)=5.
$$
平方完成したときに現れる $b^2-4ac$ の意味(解の差の 2 乗)は 2次方程式の判別式の正体 で扱う。
$\alpha<\beta$ のとき、$\alpha\le x\le\beta$ を満たす実数 $x$ 全体を 閉区間 といい、$[\alpha,\beta]$ と書く。$\alpha$、$\beta$ をその 端点、$m:=\frac{\alpha+\beta}2$ を 中点 という。lem-qmm-distance により、閉区間での最小・最大を求めることは、区間の点のうち軸に最も近い点・最も遠い点を探すことに言い換えられる。
$a>0$、$f(x)=a(x-p)^2+q$ とし、閉区間 $[\alpha,\beta]$($\alpha<\beta$)の中点を $m=\frac{\alpha+\beta}2$ とする。$f$ はこの区間で最小値と最大値をもち、それは次のとおりである。
方針:lem-qmm-distance により、$f(x)$ の大小は距離 $|x-p|$ の大小と一致する。そこで、区間の点 $x$ のうち $|x-p|$ が最小・最大になる点を求める。
段 1(最小、軸が区間の左の外)。$p<\alpha$ とする。区間の点 $x$ は $x\ge\alpha>p$ を満たすので、$|x-p|=x-p\ge\alpha-p=|\alpha-p|$ であり、等号は $x=\alpha$ のときだけである。よって $x\ne\alpha$ なら $|\alpha-p|<|x-p|$ で、lem-qmm-distance の 1 から $f(\alpha)< f(x)$ となる。$\alpha$ は区間の点なので、最小値は $f(\alpha)$ であり、それをとる点は $\alpha$ だけである。
段 2(最小、軸が区間の中)。$\alpha\le p\le\beta$ なら $p$ は区間の点で、$|p-p|=0$ である。$x\ne p$ なら $|x-p|>0$ なので、lem-qmm-distance の 1 から $f(p)< f(x)$ となる。最小値は $f(p)=q$ で、それをとる点は $p$ だけである。
段 3(最小、軸が区間の右の外)。$\beta< p$ とする。区間の点 $x$ は $x\le\beta< p$ を満たすので、$|x-p|=p-x\ge p-\beta=|\beta-p|$ であり、等号は $x=\beta$ のときだけである。段 1 と同じ理由で、最小値は $f(\beta)$、それをとる点は $\beta$ だけである。
段 4(どの点も、どちらかの端点より軸に近い)。区間の点 $x$ について
$$
|x-p|\le\max\bigl\{|\alpha-p|,\ |\beta-p|\bigr\}
$$
を示す。$x\ge p$ のときは $|x-p|=x-p\le\beta-p\le|\beta-p|$ である($x\le\beta$ を使った)。$x< p$ のときは $|x-p|=p-x\le p-\alpha\le|\alpha-p|$ である($x\ge\alpha$ を使った)。どちらの場合も上の不等式が成り立つ。
段 5(どちらの端点が軸から遠いか)。次の計算をする。
$$
|\alpha-p|^2-|\beta-p|^2=(\alpha-p)^2-(\beta-p)^2=(\alpha-\beta)(\alpha+\beta-2p)=2(\alpha-\beta)(m-p).
$$
2 つ目の等号は $s^2-t^2=(s-t)(s+t)$ を $s=\alpha-p$、$t=\beta-p$ で使った。$\alpha-\beta<0$ なので、この値は $p>m$ のとき正、$p< m$ のとき負、$p=m$ のとき $0$ である。距離は $0$ 以上なので、2 乗の大小と距離の大小は一致する。したがって、$p>m$ なら $|\alpha-p|>|\beta-p|$、$p< m$ なら $|\beta-p|>|\alpha-p|$、$p=m$ なら $|\alpha-p|=|\beta-p|$ である。
段 6(最大値)。$p>m$ とする。段 4 と段 5 から、区間のすべての点で $|x-p|\le|\alpha-p|$ である。lem-qmm-distance により、距離が小さい点では $f(x)< f(\alpha)$、距離が等しい点では $f(x)=f(\alpha)$ なので、いずれにしても $f(x)\le f(\alpha)$ である。$\alpha$ は区間の点なので、最大値は $f(\alpha)$ である。$p< m$ のときは、段 5 から $\beta$ のほうが遠いので、同じ議論で $\alpha$ を $\beta$ に替えて最大値は $f(\beta)$ である。$p=m$ のときは、段 4 から区間のすべての点で $|x-p|\le|\alpha-p|=|\beta-p|$ であり、lem-qmm-distance の 2 から $f(\alpha)=f(\beta)$ で、これが最大値である。$\square$
図2:同じ関数 $y=(x-2)^2+1$ で、軸 $x=2$ と区間の位置関係を 3 通りに変えたもの。丸が最小、四角が最大をとる点で、最小は軸に最も近い点、最大は軸から遠い端点であることを見る図。
$f(x)=(x-2)^2+1$(軸 $p=2$)で、区間をいろいろに変える。
| 区間 | 軸の位置 | 最小値 | 中点 $m$ | 最大値 |
|---|---|---|---|---|
| $[-1,1]$ | 右の外 | $f(1)=2$ | $0$ | $p>m$ なので $f(-1)=10$ |
| $[0,3]$ | 中 | $f(2)=1$ | $1.5$ | $p>m$ なので $f(0)=5$ |
| $[1,4]$ | 中 | $f(2)=1$ | $2.5$ | $p< m$ なので $f(4)=5$ |
| $[1,3]$ | 中 | $f(2)=1$ | $2$ | $p=m$ なので $f(1)=f(3)=2$ |
| $[3,5]$ | 左の外 | $f(3)=2$ | $4$ | $p< m$ なので $f(5)=10$ |
2 行目と 5 行目は ex-qmm-interval-inside、ex-qmm-interval-outside と一致する。4 行目では、軸がちょうど中点にあるので、最大値を両端でとる。1 行目・2 行目・5 行目の様子を図2 に描いた。
2 次の係数が負のとき(上に凸のとき)は、最大と最小の役割が入れ替わる。これを系として述べておく。
$a<0$、$f(x)=a(x-p)^2+q$ とし、閉区間 $[\alpha,\beta]$($\alpha<\beta$)の中点を $m=\frac{\alpha+\beta}2$ とする。$f$ はこの区間で最大値と最小値をもち、それは次のとおりである。
方針:符号を変えた関数 $-f$ は下に凸の 2 次関数なので、thm-qmm-closed-interval が使える。その結果を $f$ に戻す。
段 1($-f$ は下に凸)。$-f(x)=-a(x-p)^2-q=(-a)(x-p)^2+(-q)$ である。$a<0$ なので 2 次の係数 $-a$ は正であり、軸は同じ $x=p$ である。よって $-f$ に thm-qmm-closed-interval が使える。
段 2(大小は符号を変えると逆になる)。区間の点 $x$、$x_0$ について、不等式の両辺に $-1$ を掛けると向きが変わるので
$$
-f(x)\ge-f(x_0)\iff f(x)\le f(x_0)
$$
である。したがって、「$x_0$ で $-f$ が最小値をとる(区間のすべての $x$ で $-f(x)\ge-f(x_0)$)」ことと、「$x_0$ で $f$ が最大値をとる(区間のすべての $x$ で $f(x)\le f(x_0)$)」ことは同じである。同じように、$-f$ が最大値をとる点と、$f$ が最小値をとる点も同じである。
段 3(まとめ)。thm-qmm-closed-interval の 1 により、$-f$ は区間の中で軸に最も近い点で最小値をとる。段 2 から、$f$ はその点で最大値をとる。これが 1 である。thm-qmm-closed-interval の 2 により、$-f$ は軸から遠いほうの端点で最大値をとる($p=m$ なら両端)。段 2 から、$f$ はその点で最小値をとる。これが 2 である。$\square$
$g(x)=-x^2+2x+3=-(x-1)^2+4$(ex-qmm-completing-square の 2)を $-1\le x\le2$ で考える。2 次の係数が $-1<0$ なので cor-qmm-negative を使う。軸は $x=1$、中点は $\frac12$ である。
ずれの 2 乗の和 $\sum(x_i-a)^2$ を最小にする $a$ が平均値であることも同じ 2 次関数の最小値の問題で、平均値と二乗誤差 で扱う。
thm-qmm-closed-interval は、文字を含む問題の場合分けの「地図」になる。最小値の式は軸が区間の左・中・右の 3 通りで変わり、境目は端点 $\alpha$、$\beta$ である。最大値の式は軸が中点の左・右の 2 通りで変わり、境目は中点 $m$ である。
$k$ を実数の定数とし、$f(x)=x^2-2kx+3$ の $0\le x\le2$ での最小値 $f_{\min}(k)$ と最大値 $f_{\max}(k)$ を求める。
平方完成すると、$x^2-2kx=(x-k)^2-k^2$ より $f(x)=(x-k)^2+3-k^2$ である。軸は $x=k$、区間の中点は $1$ である。
最小値(thm-qmm-closed-interval の 1):
図3:$f(x)=x^2-2kx+3$ の $0\le x\le2$ での最大値 $f_{\max}(k)$ と最小値 $f_{\min}(k)$ を、軸の位置 $k$ の関数として描いたもの。最小値の式は $k=0,2$ で、最大値の式は区間の中点 $k=1$ で切り替わることを見る図。
$h(x)=(x^2-2x)^2-2(x^2-2x)$ の $0\le x\le3$ での最大値と最小値を求める。
段 1(置き換える文字の範囲)。$u:=x^2-2x=(x-1)^2-1$ とおく。thm-qmm-closed-interval により、$0\le x\le3$ での $u$ の最小値は、軸 $x=1$ が区間の中にあるので $-1$($x=1$)である。中点 $\frac32$ は軸 $1$ より右なので、最大値は右端 $x=3$ で $u=3$ である。さらに、$-1\le c\le3$ を満たすどの $c$ についても、$x=1+\sqrt{c+1}$ は $1\le x\le3$ を満たし、$u=(\sqrt{c+1})^2-1=c$ となる。よって $u$ は $-1\le u\le3$ のすべての値をとる。
この確認が要るのは、最小値 $-1$ と最大値 $3$ が分かっただけでは、途中の値(たとえば $u=1$)を本当にとるかどうかは分からないからである。とらない値があると、段 2 で $u=1$ を使うことができなくなる。なお、$0\le x<1$ の部分では $u=(x-1)^2-1$ は $-1< u\le0$ の値をとる。これらは $1\le x\le3$ の部分でもとる値で、同じ $u$ の値を 2 回とっていることになる。一方、$u=1$ は $0\le x<1$ の部分ではとらないので、段 3 で $u=1$ に対応する $x$ を探すと、区間に入るのは $1\le x\le3$ の側の 1 つだけになる。
段 2($u$ の 2 次関数として解く)。$h=u^2-2u=(u-1)^2-1$ で、$-1\le u\le3$ である。軸 $u=1$ は区間の中にあるので最小値は $-1$($u=1$)。中点 $\frac{-1+3}2=1$ が軸と一致するので、最大値は両端 $u=-1$、$u=3$ でとり、値は $(-2)^2-1=3$ である。
段 3($x$ に戻す)。$u=1$ となるのは $x^2-2x-1=0$、すなわち $x=1\pm\sqrt2$ のときで、区間に入るのは $x=1+\sqrt2$ である($1-\sqrt2<0$ なので $x=1-\sqrt2$ は区間の外にある。段 1 の最後で見たとおり、$u=1$ は $0\le x<1$ の部分ではとらない)。$u=-1$ となるのは $x=1$、$u=3$ となるのは $x^2-2x-3=(x-3)(x+1)=0$ で区間に入る $x=3$ である。
答:最小値は $-1$($x=1+\sqrt2$)、最大値は $3$($x=1$ と $x=3$)。確かめると $h(1)=1+2=3$、$h(3)=9-6=3$ である。$u$ の範囲をもとの $x$ の範囲 $0\le x\le3$ と取り違えると、誤った答えになる。
2 次関数については、thm-qmm-closed-interval が最大値・最小値をとる点を具体的に示したので、閉区間で両方が存在することはすでに分かっている。一般の関数については、次の定理が存在を保証する。$f$ が点 $c$ で連続(連続関数)であるとは、$x$ を $c$ に近づけると $f(x)$ が $f(c)$ に近づくことをいう。
閉区間 $[\alpha,\beta]$ のすべての点で連続な関数は、その区間で最大値と最小値をもつ。
この定理は 最大値・最小値の定理 と呼ばれ、実数の連続性(実数の集合には「すき間がない」という性質)を使って証明される。本記事では証明しない(Leb26 Theorem 3.3.2)。この定理は「最大値がある」ことだけを述べ、どこでとるかは教えない。2 次関数では、どこでとるかまで thm-qmm-closed-interval で分かる。
$r(x)=x^3-3x$ を閉区間 $[-2,2]$ で考える。$r$ は多項式なので、区間のすべての点で連続である。thm-qmm-continuous-extremes により、最大値と最小値は存在する。実際に求めてみる。
thm-qmm-continuous-extremes と thm-qmm-closed-interval の仮定を 1 つずつ外すと、結論が崩れる。次の表の反例で確かめる。1〜3 行目は thm-qmm-continuous-extremes の仮定、4 行目は thm-qmm-closed-interval の仮定 $a>0$ である。
| どの定理の仮定か | 外した仮定 | 崩れる主張 | ボックス |
|---|---|---|---|
| thm-qmm-continuous-extremes | 区間が端点を含む | 最大値・最小値の存在 | ex-qmm-open-interval |
| thm-qmm-continuous-extremes | 区間が有界(両端がある) | 最大値の存在 | ex-qmm-unbounded |
| thm-qmm-continuous-extremes | 関数が連続 | 最大値の存在 | ex-qmm-discontinuous |
| thm-qmm-closed-interval | 2 次の係数が正(下に凸) | 最大値は軸から遠い端点でとる | ex-qmm-concave |
$f(x)=(x-2)^2+1$ を $3< x<5$(端点を含まない)で考える。cor-qmm-monotone の 2 により、$f$ はこの範囲で増加し、値は $f(3)=2$ と $f(5)=10$ の間を動くが、$2$ にも $10$ にもならない。
最小値がないことを確かめる。範囲のどの点 $x$ についても、$x':=\frac{3+x}2$ は $3< x'< x$ を満たすので範囲の点であり、cor-qmm-monotone から $f(x')< f(x)$ である。よって $f(x)$ は最小値ではない。同じように $x'':=\frac{x+5}2$ を考えると $x< x''<5$ で $f(x'')>f(x)$ となり、最大値もない。
満たす性質:関数は連続で、範囲は有界である。満たさない性質:範囲が端点を含むこと。破る主張:最大値・最小値の存在。
$f(x)=(x-2)^2+1$ を $x\ge3$ で考える。cor-qmm-monotone の 2 により、最小値は左端の $f(3)=2$ である。しかし最大値はない。範囲のどの点 $x_0$ についても、$x_0+1$ も範囲の点であり、$f(x_0+1)>f(x_0)$ だからである。実際、値はいくらでも大きくなる。たとえば $f(12)=101$、$f(102)=10001$ である。
満たす性質:関数は連続で、範囲は左端 $3$ を含む。満たさない性質:範囲が有界であること。破る主張:最大値の存在。
閉区間 $[0,1]$ で、$0\le x<1$ では $g(x)=x$、$x=1$ では $g(1)=0$ と定める。$g$ は $x=1$ で連続でない($x$ を $1$ に近づけると $g(x)$ は $1$ に近づくが、$g(1)=0$ である)。
最大値がないことを確かめる。$g$ の値はすべて $0\le g(x)<1$ である。$0\le x_0<1$ なら、$x_1:=\frac{x_0+1}2$ は $x_0< x_1<1$ を満たし、$g(x_1)=x_1>x_0=g(x_0)$ である。$x_0=1$ なら $g(1)=0<\frac12=g\bigl(\frac12\bigr)$ である。どの値も最大値ではない。
満たす性質:範囲は閉区間である。満たさない性質:連続性。破る主張:thm-qmm-continuous-extremes の結論(最大値の存在)。
$k(x)=-(x-2)^2+4$ を $[0,3]$ で考える。端点の値は $k(0)=0$、$k(3)=3$ であるが、内部の点 $x=2$ で $k(2)=4$ となり、これが最大値である(lem-qmm-distance の $a<0$ の場合)。
満たす性質:連続、閉区間。満たさない性質:thm-qmm-closed-interval の仮定である、2 次の係数が正であること。破る主張:thm-qmm-closed-interval の 2「最大値は軸から遠い端点でとる」。この場合は cor-qmm-negative により、最大値は軸に最も近い点(ここでは頂点 $x=2$)でとり、最小値のほうを軸から遠い端点 $x=0$ でとる($k(0)=0$ が最小値)。ex-qmm-negative も同じ形である。
thm-qmm-closed-interval の 2 は「最大値は端点でとる」と言っている。これは 2 次関数に特有の性質ではなく、凸関数 と呼ばれる関数すべてに共通する性質である。
区間 $I$ 上で定義された関数 $f$ が、$I$ のすべての点 $x,y$ と $0\le\lambda\le1$ を満たすすべての実数 $\lambda$ について
$$
f\bigl((1-\lambda)x+\lambda y\bigr)\le(1-\lambda)f(x)+\lambda f(y)
$$
を満たすとき、$f$ を $I$ 上の 凸関数 という。
$\lambda$ を $0$ から $1$ まで動かすと、$(1-\lambda)x+\lambda y$ は $x$ から $y$ までの線分上を動く。右辺は、グラフ上の 2 点 $(x,f(x))$、$(y,f(y))$ を結ぶ線分(弦)の、同じ横座標での高さである。したがって凸関数とは、グラフがどの弦よりも上に出ない関数 である。高校の「下に凸」を式で述べたものと考えてよい。
$a>0$ なら、$f(x)=ax^2+bx+c$ は実数全体で凸関数である。より詳しく、すべての実数 $x,y,\lambda$ について
$$
(1-\lambda)f(x)+\lambda f(y)-f\bigl((1-\lambda)x+\lambda y\bigr)=a\lambda(1-\lambda)(x-y)^2
$$
が成り立つ。
方針:左辺を $f$ の 1 次の部分 $bx+c$ と 2 次の部分 $ax^2$ に分けて計算する。$z:=(1-\lambda)x+\lambda y$ とおく。
段 1(1 次の部分は消える)。$(1-\lambda)(bx+c)+\lambda(by+c)=b\bigl((1-\lambda)x+\lambda y\bigr)+\bigl((1-\lambda)+\lambda\bigr)c=bz+c$ なので、1 次の部分の寄与は $(bz+c)-(bz+c)=0$ である。
段 2(2 次の部分)。$z^2=(1-\lambda)^2x^2+2\lambda(1-\lambda)xy+\lambda^2y^2$ である。$(1-\lambda)-(1-\lambda)^2=(1-\lambda)\lambda$、$\lambda-\lambda^2=\lambda(1-\lambda)$ を使うと
$$
(1-\lambda)x^2+\lambda y^2-z^2=\lambda(1-\lambda)x^2-2\lambda(1-\lambda)xy+\lambda(1-\lambda)y^2=\lambda(1-\lambda)(x-y)^2
$$
となる。これに $a$ を掛けたものが左辺である。
段 3(符号)。$a>0$、$0\le\lambda\le1$ なら $\lambda(1-\lambda)\ge0$、$(x-y)^2\ge0$ なので右辺は $0$ 以上であり、凸関数の定義の不等式が成り立つ。$\square$
$f$ が閉区間 $[\alpha,\beta]$ 上の凸関数ならば、区間のすべての点 $x$ で
$$
f(x)\le\max\bigl\{f(\alpha),\ f(\beta)\bigr\}
$$
が成り立つ。したがって $f$ はこの区間で最大値をもち、それは $f(\alpha)$ と $f(\beta)$ の大きいほうである。
方針:区間の点 $x$ を $(1-\lambda)\alpha+\lambda\beta$ の形に書き、凸関数の定義を $\alpha$ と $\beta$ に使う。
段 1。$x$ を区間の点とし、$\lambda:=\frac{x-\alpha}{\beta-\alpha}$ とおく。$\alpha\le x\le\beta$ から $0\le x-\alpha\le\beta-\alpha$ なので、$0\le\lambda\le1$ である。また
$$
(1-\lambda)\alpha+\lambda\beta=\alpha+\lambda(\beta-\alpha)=\alpha+(x-\alpha)=x
$$
である。
段 2。$M:=\max\{f(\alpha),f(\beta)\}$ とおく。凸関数の定義(def-qmm-convex)を $\alpha$、$\beta$、$\lambda$ に使うと
$$
f(x)=f\bigl((1-\lambda)\alpha+\lambda\beta\bigr)\le(1-\lambda)f(\alpha)+\lambda f(\beta)\le(1-\lambda)M+\lambda M=M
$$
である。2 つ目の不等号では、$1-\lambda\ge0$、$\lambda\ge0$ と $f(\alpha)\le M$、$f(\beta)\le M$ を使った。
段 3。$M$ は $f(\alpha)$ か $f(\beta)$ のどちらかであり、端点は区間の点なので、$M$ は区間での $f$ の値である。段 2 から、$M$ が最大値である。$\square$
この命題は、関数の連続性も微分も使っていない。2 次関数の場合は、prop-qmm-quadratic-convex と組み合わせると thm-qmm-closed-interval の 2 の「最大値は端点でとる」がもう一度得られる。どちらの端点かは、端点の値を比べれば決まる。
$g(x)=|x-1|$ を $[-1,2]$ で考える。$g$ は 2 次関数ではなく、グラフは $x=1$ で折れ曲がる。
段 1($g$ は凸関数)。実数 $u,v$ について $|u+v|\le|u|+|v|$ が成り立つ。実際、両辺は $0$ 以上で、$(|u|+|v|)^2-(u+v)^2=2(|u||v|-uv)\ge0$ だからである($uv\le|uv|=|u||v|$)。$x,y$ を実数、$0\le\lambda\le1$ とすると、$(1-\lambda)x+\lambda y-1=(1-\lambda)(x-1)+\lambda(y-1)$ なので、$u=(1-\lambda)(x-1)$、$v=\lambda(y-1)$ として
$$
g\bigl((1-\lambda)x+\lambda y\bigr)=\bigl|(1-\lambda)(x-1)+\lambda(y-1)\bigr|\le(1-\lambda)|x-1|+\lambda|y-1|
$$
である。最後に $1-\lambda\ge0$、$\lambda\ge0$ を使って $|(1-\lambda)(x-1)|=(1-\lambda)|x-1|$ などとした。これは凸関数の定義(def-qmm-convex)の不等式である。
段 2(最大値)。端点の値は $g(-1)=2$、$g(2)=1$ である。prop-qmm-convex-max により、区間のすべての点で $g(x)\le2$ であり、最大値は $g(-1)=2$ である。内部の点でも確かめると、$g(0)=1$、$g\bigl(\frac12\bigr)=\frac12$、$g(1)=0$、$g\bigl(\frac32\bigr)=\frac12$ で、どれも $2$ 以下である。
最小値は内部の点 $x=1$ でとり、$g(1)=0$ である。$g$ は $x=1$ で微分できないが、prop-qmm-convex-max は微分を使わないので、この例にもそのまま使える。
$g(x)=e^x-2x$ を $[-1,2]$ で考える。この例は数学 III の微分(導関数 と第 2 次導関数)を使う。数学 III で習うとおり、第 2 次導関数 $g''(x)=e^x$ が正なのでグラフは下に凸であり、$g$ は凸関数である(第 2 次導関数による凸性の判定は本記事では証明しない。BV04 §3.1.4)。prop-qmm-convex-max により、最大値は端点の値
$$
g(-1)=e^{-1}+2=2.367\ldots,\qquad g(2)=e^2-4=3.389\ldots
$$
の大きいほうの $g(2)=e^2-4$ である。最小値は、$g'(x)=e^x-2$ が $x<\log2$ で負、$x>\log2$ で正なので(増減表)、$x=\log2=0.693\ldots$ でとり、$g(\log2)=2-2\log2=0.613\ldots$ である(図4)。
図4:凸関数 $y=e^x-2x$ の $-1\le x\le2$ の部分と、両端を結ぶ弦(破線)。グラフが弦の下にあるので、区間の値は両端の値の大きいほうを超えないことを見る図。
凸関数の最大値は端点で決まるが、最小値のほうは内部でとることが多い。2 次関数では、それが頂点(軸に最も近い点)であった。
2 階導関数による凸性の判定と接線の不等式は 曲線の凹凸と接線 で扱う。
変数が 2 つ以上のときも、平方完成は同じ働きをする。平方の和に直せる 2 次式は $0$ 以上の値しかとらない。一般に、正定値な 2次形式 に 1 次式を加えた関数は、ただ 1 つの最小点をもつ(BV04 §4.2.3 の Example 4.5。行列を使った平方完成でも示せる)。条件の付いた最大・最小(たとえば $x+y=1$ のもとでの $x^2+y^2$ の最小)は 条件付きの最大・最小 で扱い、大学では Lagrangeの未定乗数法 や 凸最適化 へつながる。
Mathpediaは寄付と、参考文献の書籍リンク(Amazonアソシエイト)の紹介料で運営されています。 支援について / 寄付する