量子化ラボ

量子化がなめらかな階調をどのように段差に変えるか

インタラクティブシミュレーションを読み込んでいます...

圧縮は量子化の痛みから始まることが多い 🖖

量子化とは、連続値や高精度な値を有限のコードブックに丸める処理である。誤差は1サンプルあたりでは通常小さいが、なめらかなグラデーションでは隣接するピクセルが同じ少数の出力値に丸められるため、輪郭バンドとして目に見えるようになる。ディザは丸める前に意図的にノイズを加える手法で、局所的なノイズは増えるが、まとまったバンドを崩す。これは人間の視覚には見た目がよいことが多く、コーデックでの圧縮のされ方も変わる。 • 元のグラデーションと出力: 上の帯は数学的になめらかな入力グラデーションを示している。下の帯は、選択したレベルに丸められた量子化後の出力を示している。ビット深度が低いと、この丸め処理が目に見える輪郭バンドを生み出す。 • 量子化誤差グラフ: これはグラデーション上の各位置における差分(出力 − 入力)をプロットしたものである。黄色の線が誤差、緑色の線が誤差ゼロを表す。周期的な大きな誤差の波はバンディングを示し、ディザを加えるとこの誤差が高周波ノイズにランダム化される。

ビットとは段階の数のこと 🖖

現実のグラデーションは連続的ですが、コンピューターは決まった値のリストから選ぶしかありません。ビット深度はそのリストの長さを決めます。1ビット増えるごとに数が倍になり、8ビットなら2⁸ = 256階調、10ビットなら1024階調です。段階が少ないほど丸めが粗くなり、6ビット(64階調)まで下げると滑らかな空が目に見える縞に分かれてしまいます。

1ビットごとに約6 dB得をする 🖖

SNRの表示にはきれいな法則が隠れています。均一量子化では、1ビット増えるごとに信号対雑音比が約6.02 dB改善し、フルスケール正弦波では SNR ≈ 6.02·N + 1.76 dB に従います。同じ式が音声コンバーターにも画像エンコーダーにも当てはまるため、16ビットの音声トラックと16ビットの画像は同じ理論上の量子化雑音の下限を共有します。1ビット足せば6 dBの利得――媒体を問いません。

連鎖のひとつの段 — 何が入り、何が出て、後段で何が壊れるか

この段はエンコード処理のどこに位置するか

動画エンコーダは単一のアルゴリズムではなく、順序の決まった 8 つの段です。その順序は恣意的ではありません。どの段も、直前の段が仕事を可能にしてくれたからこそ存在します。このツールはそのうちの 1 つを扱います。下の連鎖から残りの 7 つに移動できます。

量子化ラボ — 係数を刻み幅で割って丸める — 意図的に情報を捨てる唯一の段

入ってくるもの
残差の変換係数、フル精度。
出ていくもの
より粗い整数。小さな高周波係数の多くはゼロに丸められます。
次の段が前提とすること
エントロピー符号化は、利用できる長いゼロの連なりを前提にします。それを作り出しているのがこの段です。
ここで壊れるもの
意図的に情報を捨てる唯一の段なので、画質が実際に決まるのはここです。刻みが粗すぎると、なめらかな階調が目に見える帯に崩れます。隣り合う階調が同じ整数に丸められるからです。

全プロセスの詳細解説

  1. 8ビット量子化の56.18 dBと教科書の法則との整合性 6 ステップ

    8ビット量子化ではここでは56.18 dBが得られるが、教科書の規則では6.02 × 8 + 1.76 = 49.92 dBとなる。どちらも正しい。両者を整合させよ。

    1. ステップサイズは、レベル数ではなくレベル間の間隔数で範囲を割ったものである。256レベルには255個の間隔が存在し、この1の差は誰も気づかない0.017 dBの差異と、誰もが受け継いでしまう誤った公式を生むことになる。

    2. 最も近いレベルへ丸めることで、誤差は1ステップにわたって一様に分布する。そのRMSはステップ幅を√12で割ったものであり、これが導出全体における唯一の統計的要素である。

    3. その予測値を、ツールが900個のサンプルにわたって測定した値と比較する。1%以内の不一致にとどまることこそが、実際のランプ信号において一様誤差の仮定が持つ価値である。

    4. SNRは2つのRMS値のデシベル比である。両方の数値が表示されているため、このステップは導出というよりも確認である。

    5. 次に、前提条件を明確にした教科書の規則を見る。これは入力範囲をちょうど満たす正弦波に対して導出されたものである。

    6. 2つのRMS値の比を取り、変換する。この補正により、差は100分の4デシベル以内にまで縮まる。

    解答

    6.2 dBの差はクレストファクタそのものであり、それ以外の何物でもない。6.02N + 1.76は変換器に関する法則ではなく、フルスケール正弦波に関する法則である。フルレンジを満たす正弦波のRMSはその1/(2√2) = 0.354となる。この画像ランプのRMSは0.724であり、これは2倍をわずかに上回り、20 log₁₀(2.05)は6.22 dBとなる。これを加算するとパネルの56.18 dBに対して56.14 dBが得られ、残りの0.04 dBは測定誤差が理論値Δ/√12より0.7%下回っていることによるものである。したがって、任意の実システムの公称SNRは、ハードウェアと同様に信号に関する記述でもあり、これがオーディオエンジニアがヘッドルームを別個に示し、16ビットディスクの静寂なフレーズにおいて96 dBが得られるわけではない理由である。

参考文献 (1)

例題

  • シネマ10ビット - カラーグレーディング向けの10bit設定、滑らかな階調変化
  • Web 8ビット - 標準的な8bitパイプライン、量子化ステップは中程度
  • 低品質6ビット - 低精度では、目に見えるバンディング(縞状の輪郭)が現れる
  • ディザ処理6ビット - ディザリングは、滑らかなノイズと引き換えにバンディングを減らす