一言で!
エントロピーとは、袋とじを開けるときの期待度。
他には?
データの答えが、どれだけばらけていて読めないかを表す数字。
高いと、まだほとんど開いておらず中身が読めない状態。低いと、開封が進んでほぼ丸見えの状態。
だが、単に完全開封(エントロピーゼロ)すればいいわけではない。
年表
| 年代・年 | 主な出来事 | 主な人物・組織 | 主な国・地域 | 特徴 |
|---|---|---|---|---|
| 1865年 | クラウジウスが「エントロピー」と名付ける | ルドルフ・クラウジウス | ドイツ | 熱の理論で物体の「変化の中身」を表す量に、ギリシャ語で「変化」を意味する語から名前を付けた。エネルギーという言葉にわざと似せたと論文に書いている。[クラウジウスの1865年の論文(ウィキメディア・コモンズ)](https://commons.wikimedia.org/wiki/File:Clausius_R._Ueber_verschiedene_f%C3%BCr_die_Anwendung_bequeme_Formen_der_Hauptgleichungen_der_mechanischen_W%C3%A4rmetheorie_1865.pdf) |
| 1877年 | ボルツマンがエントロピーを「並び方の数」で数える | ルートヴィッヒ・ボルツマン | オーストリア | 同じ状態になる粒の並び方が多いほどエントロピーが大きい、という見方を示した。エントロピーが確率の話とつながる。[スタンフォード哲学百科事典](https://plato.stanford.edu/entries/statphys-Boltzmann/) |
| 1928年 | ハートレーが情報を「選べる数の対数」で測る | ラルフ・ハートレー(ベル研究所) | アメリカ | 送れるメッセージの候補が多いほど情報が多い、と数える方法を出した。ただし全部が同じ確率だという前提付きだった。[Transmission of Information(Internet Archive)](https://archive.org/details/bstj7-3-535) |
| 1948年 | シャノンが情報のエントロピーを定義する | クロード・シャノン(ベル研究所) | アメリカ | 確率の偏りまで入れて、答えの読めなさを計算する式を作った。全部同じ答えなら0、全部が同じ確率なら最大。統計力学と同じ形なのでエントロピーと呼んだ。[A Mathematical Theory of Communication](https://people.math.harvard.edu/~ctm/home/text/others/shannon/entropy/entropy.pdf) |
| 1948年 | 「ビット」という単位が広まる | ジョン・テューキー、クロード・シャノン | アメリカ | binary digit(2進数の桁)を縮めた呼び名。シャノンの論文が、テューキーの提案として紹介した。[A Mathematical Theory of Communication](https://people.math.harvard.edu/~ctm/home/text/others/shannon/entropy/entropy.pdf) |
| 1951年 | カルバックとライブラーが、2つの分布の違いを測る量を出す | ソロモン・カルバック、リチャード・ライブラー | アメリカ | いまKLダイバージェンスと呼ばれる量。AIの学習で使う交差エントロピーの親戚にあたる。[On Information and Sufficiency](https://projecteuclid.org/journals/annals-of-mathematical-statistics/volume-22/issue-1/On-Information-and-Sufficiency/10.1214/aoms/1177729694.full) |
| 1957年 | ジェインズが最大エントロピー原理を示す | エドウィン・ジェインズ | アメリカ | 分かっていること以外は決めつけず、一番読めない状態を仮定して推測する、という考え方。情報のエントロピーを物理へ逆輸入した。[Information Theory and Statistical Mechanics](https://bayes.wustl.edu/etj/articles/theory.1.pdf) |
| 1986年 | 決定木ID3が、質問の順番をエントロピーで選ぶ | ロス・キンラン | オーストラリア | 分けたあとのエントロピーが一番下がる項目から聞く。下がった分が情報利得。[Induction of Decision Trees](https://link.springer.com/article/10.1007/BF00116251) |
| 2016年 | 交差エントロピーがAIの学習の標準の物差しになる | イアン・グッドフェローら | アメリカ | ディープラーニングの教科書が、多くの場合は訓練データとモデルの予想の交差エントロピーをコストに使う、と整理した。[Deep Learning、第6章](https://www.deeplearningbook.org/contents/mlp.html) |