本記事は機械翻訳されたものであり、原文は英語です。 原文を読む

1桁の数字を入力した。返ってきた答えは6桁だった。

A scientist in a lab coat sits at a cluttered bench under a single lamp, calipers in hand, studying the readout of an old instrument while rain runs down the window.

入力は視差0.2角秒、出力は16.3078光年。入力された数値の有効数字は1桁であるが、出力には6桁が表示されている。

you typed0.216.3078 lymeasureddecoration4.0 pc6.7 pcquoted: 5 pc345678 pc
入力は有効数字1桁、出力は6桁。視差が0.2 ± 0.05であるなら、その恒星は網掛けの帯のどこかに位置しており、小数点以下第4位の数字は何ひとつそれを表していない。

0.2をparallax toolに入力すると、5 pc、16.3078 light years、1,031,325 AU という答えが返ってくる。

入力した視差の有効数字は1桁である。しかし、最後の答えは7桁まで表示されている。入力ボックスと表示装置の間のどこかで、測定されたことのない6桁分の精度が新たに作り出されたのだ。

余分な桁数が実際には何を意味しているのか

それらは嘘をついているわけではない。ただ、あなたが尋ねた問いとは異なる問いに答えているだけである。

「16.3078 light years」という数値は、もし視差が正確に0.2000000であるならば、距離はいくらになるか?という問いに対する正しい答えである。それは四則演算の問題であり、ツールはそれに完璧に答えている。あなたが本来尋ねたかった問いはこの恒星はどれくらい離れているのか?であり、その問いはあなた自身の持つ不確かさを伴っている。

逆数の場合、その変換は至極単純である。d = 1/p であるため、誤差が小さければ、p の相対誤差はそのまま d の相対誤差とほぼ同じになる。したがって、仮にその 0.2 が実際には 0.2 ± 0.01(かなり高精度な測定)を意味しているなら、距離は 5 pc ± 0.25 であり、16.3078 ly と表記することは、実際の測定精度よりも1,000倍も正確に答えを知っていると主張することになる。もしそれが、有効数字1桁が率直に意味する 0.2 ± 0.05 を意味しているなら、その恒星は 4 から 6.7 parsecs の間のどこかに位置することになり、小数点以下第4位の数字は架空のものに過ぎない。

その根本にあるルールは、すべての実験授業で教えられ、すべての表計算ソフトが失念しているものである。計算結果の精度は、入力された中で最も精度の低い要素の精度を超えることはできない。 乗除算では有効数字の桁数が引き継がれ、加法では小数点以下の桁数が引き継がれる。計算機の機能がそのどちらかを強制することはない。

逆数は危険な事例である

視差の例を詳しく検討する価値があるのは、1/p が特定の方向に都合の悪い振る舞いをするからである。

p = 0.2 ± 0.05 とすると、p は 0.15 から 0.25 までの範囲をとる。このとき d = 1/p は 6.67 pc から 4.00 pc へと変化する。距離は 5 ± 1.25 にはならない。誤差の範囲は上に 1.67、下に 1.00 と歪んでいる。なぜなら、逆数は p の小さい側を引き伸ばし、大きい側を圧縮するからだ。測定した値における対称な不確かさが、知りたかった値における非対称な不確かさへと変換されるのである。

この非対称性は p が小さくなるほど悪化するが、天文学が探求しようとしているのはまさにその領域である。p = 0.02 ± 0.005 では、距離は 40 から 66.7 pc の範囲に及ぶ。50 pc という公称値に対して、その範囲は値自体の3分の2にも達する。これは単なる机上のリスクではない。暗い恒星の距離カタログにおいて、距離そのものではなく不確かさを伴う視差として記載されるのはまさにこれが理由である。生の測定値は扱いやすい誤差を持つが、求めたい数値はそうではないからだ。

では、なぜ当サイトではそれらを表示するのか?

それは、ここでの桁数が異なる役割を果たしているからであり、その役割が何であるかを明確にしておく価値があるからである。

これらのツールは、スライダーをドラッグして動かすことを前提に作られている。表示装置が小数点以下4桁まで表示する理由は、スライダーをわずかに動かしたときに目に見える変化を生じさせるためである。もし増幅率の表示が 6.7 に四捨五入されてしまったら、減衰スライダーを動かす意義の半分が失われ、2つの入力間の相関関係が見えなくなってしまう。桁数が存在するのは精度を主張するためではなく、変化を示すためなのだ。

それは筋の通った選択であると同時に、非常に紛らわしい選択でもある。実験レポートにおいて同じ数字の並びは全く異なる意味を持つからだ。したがって、これらのページに表示される桁数は四則演算上の意味で正確なだけであり、対象がどれほど正確に知られているかについては何も語っていない。これらのツールの数値を実際の作業に転記する際には、表示装置の精度ではなく、入力の精度に従うべきである。

当サイトの2つのツールは対照的なアプローチをとっており、比較してみる価値がある。confidence interval ツールは、範囲こそが誠実な答えであるという立場をとるため、単一の数値を表示することを拒否する。そして sample size 計算ツールでは、許容誤差を最初に指定させる。支払う意図のある精度を指定すると、そのコストが示される。どちらのツールも、精度が表示形式の偶然ではなく、入力値として扱われるように設計されている。

通常は2桁が適切な答えである

1977年のエーレンバーグの主張は風化していない。ほとんどの数値は有効数字2桁で記載されるべきである。なぜなら、人間が頭の中で保持し比較できるのはおおよそそれくらいであり、通常データが裏付けているのもそれだけで十分だからである。2桁に丸められた表は読まれるが、6桁の表は読み飛ばされる。

彼の検証法は、自分が作成するあらゆるものに適用する価値がある。末尾の数字を親指で隠してみるのだ。書こうとしていた文章がそれでも真実であるなら、それらの桁は最初から意味を担っていなかったことになる。それらは意味の「印象」を担っていたのであり、それは何も担っていないことよりもタチが悪い。

親指で隠された 16.3078 light years は「約16 light years」となり、それこそがその測定が持つ情報のすべてである。