これは機械翻訳であり、原文は英語です。 原文を読む
ランダム性によって精度を得る交換比率は極めて悪い
サンプル数を10倍に増やしても、得られる精度向上は約3倍にとどまる。10倍ではない。この交換比率は固定されており、いかなる工夫を用いても改変することはできない。
正方形にダーツを投げて π を測定することは、モンテカルロ法の最も標準的な最初の実演である。四分円の内側に落ちた割合を数え、4倍すれば推定値が得られる。
この実演で通常語られないのは、この方法がどれほど効率の悪いものかという点である。
3つのプリセットと、そのコスト
Monte Carlo π には、200、2000、20000 という3つのサンプルサイズが用意されている。これらは固定されたシード値で実行されるため、単なる偶発的な事例ではなく、誰がこのページを開いても毎回同じ3つの数値が得られる。
- 200個の点では 3.040000 が得られ、誤差は 1.02 × 10⁻¹
- 2000個の点では 3.122000 が得られ、誤差は 1.96 × 10⁻²
- 20000個の点では 3.127800 が得られ、誤差は 1.38 × 10⁻²
最初の行と最後の行の間で100倍の作業を費やしたにもかかわらず、得られた答えは小数第2位の時点でまだ間違っている。すべての学童が暗唱できる「3.14」にすら、いまだ到達していない。
変化率は平方根の逆数である
各ダーツの試行は独立した二者択一の試行であり、n 回の試行から測定される比率の標準誤差は 1/√n に比例して減少する。この特定の推定量において、標準的な誤差は200サンプルで 0.116、2000サンプルで 0.0367、20000サンプルで 0.0116 と計算される。
したがって、サンプル数を10倍に増やすことで得られる精度向上は約3.16倍である。なぜなら3.16は10の平方根だからだ。精度を10倍にして1桁増やすには、サンプル数を100倍にする必要がある。2000サンプルでの誤差である約0.037から0.0037に引き下げるには、200,000個のダーツが必要となる。
この結論は記憶に留めておく価値がある。なぜなら、これは π やダーツ、あるいはこの実装特有の性質ではないからだ。これは中心極限定理が作用している結果である。互いに独立したものの平均における誤差は、それが何であれ、平均をとった個数の平方根に応じて縮小する。世論調査、素粒子物理学における事象数のカウント、そして人間が実行するあらゆるシミュレーションを支配しているのは、全く同じ算術原理である。
単一のシード値からは分からないこと
ここで、先ほどの3つのプリセット誤差を改めて見てほしい。それらは先ほどの法則が示唆した通りには動いていないからだ。200から2000に増やすと誤差は 5.19 倍減少したが、2000から20000へ増やすと 1.42 倍しか減少していない。どちらも 3.16 ではない。
何も故障しているわけではない。平方根の法則が記述しているのは典型的な誤差、すなわち推定量が抽出される分布の幅であり、1回の実行はその分布からの1回の抽出に過ぎない。2000点の実行は、たまたま典型的な誤差よりも近い場所、標準偏差の約半分ほどの位置に収まった。20000点の実行は、たまたま外側に外れた。それらの比率はほとんど何も意味しない。
これこそが、シミュレーションにおける最もありがちな誤読である。良好な結果が得られた1回の実行は優れた手法である証拠にはならず、悪い結果が出た1回の実行も悪い手法である証拠にはならない。単一のシード値から収束率を観察することはできず、試行を繰り返してばらつきを見ることによってのみ確認できる。それこそが、Normal Distribution がそのばらつきを曲線として描くことで記述している内容である。
なぜこの方法が受け入れられているのか
1桁の精度を得るために100倍の作業量を要する手法など到底弁護できないように思えるし、1次元の問題においては実際にその通りである。格子上の通常の数値積分を行えば、容易にこの方法を上回ることができる。
実際の計算においてモンテカルロ法が圧倒的な立場にある理由は、1/√n に次元に関する記述が一切含まれていないからである。20次元の問題において各軸に10個の点を取る格子を設定すると、10²⁰ 回の評価計算が必要となる。しかし、確率的手法で必要な計算量は、求める精度に応じて 1/√n が要求するものだけであり、軸が20本あろうと全く影響を受けない。
したがって、この交換比率は劣悪であると同時に、次元によらず一定(フラット)でもある。低次元においては、この手法を拒否すべきである。しかし高次元においては、これが事実上唯一選択可能な手段となることが多いため、物理学、金融、レンダリングの全分野において、このコストが支払われているのである。
Poisson は、カウントの観点から見たこれと同じ算術である。まれな事象をカウントする場合、分散は平均に等しくなるため、相対誤差はここでもカウント数の平方根の逆数に比例して低下する。発生率の信頼度を2倍にするということは、常に観測量を4倍にすることを意味する。