エントロピーとは何か

2026年9月25日
7分

一言で!

エントロピーとは、袋とじを開けるときの期待度。

他には?

データの答えが、どれだけばらけていて読めないかを表す数字。

高いと、まだほとんど開いておらず中身が読めない状態。低いと、開封が進んでほぼ丸見えの状態。

だが、単に完全開封(エントロピーゼロ)すればいいわけではない。

年表

年代・年主な出来事主な人物・組織主な国・地域特徴
1865年クラウジウスが「エントロピー」と名付けるルドルフ・クラウジウスドイツ熱の理論で物体の「変化の中身」を表す量に、ギリシャ語で「変化」を意味する語から名前を付けた。エネルギーという言葉にわざと似せたと論文に書いている。[クラウジウスの1865年の論文(ウィキメディア・コモンズ)](https://commons.wikimedia.org/wiki/File:Clausius_R._Ueber_verschiedene_f%C3%BCr_die_Anwendung_bequeme_Formen_der_Hauptgleichungen_der_mechanischen_W%C3%A4rmetheorie_1865.pdf)
1877年ボルツマンがエントロピーを「並び方の数」で数えるルートヴィッヒ・ボルツマンオーストリア同じ状態になる粒の並び方が多いほどエントロピーが大きい、という見方を示した。エントロピーが確率の話とつながる。[スタンフォード哲学百科事典](https://plato.stanford.edu/entries/statphys-Boltzmann/)
1928年ハートレーが情報を「選べる数の対数」で測るラルフ・ハートレー(ベル研究所)アメリカ送れるメッセージの候補が多いほど情報が多い、と数える方法を出した。ただし全部が同じ確率だという前提付きだった。[Transmission of Information(Internet Archive)](https://archive.org/details/bstj7-3-535)
1948年シャノンが情報のエントロピーを定義するクロード・シャノン(ベル研究所)アメリカ確率の偏りまで入れて、答えの読めなさを計算する式を作った。全部同じ答えなら0、全部が同じ確率なら最大。統計力学と同じ形なのでエントロピーと呼んだ。[A Mathematical Theory of Communication](https://people.math.harvard.edu/~ctm/home/text/others/shannon/entropy/entropy.pdf)
1948年「ビット」という単位が広まるジョン・テューキー、クロード・シャノンアメリカbinary digit(2進数の桁)を縮めた呼び名。シャノンの論文が、テューキーの提案として紹介した。[A Mathematical Theory of Communication](https://people.math.harvard.edu/~ctm/home/text/others/shannon/entropy/entropy.pdf)
1951年カルバックとライブラーが、2つの分布の違いを測る量を出すソロモン・カルバック、リチャード・ライブラーアメリカいまKLダイバージェンスと呼ばれる量。AIの学習で使う交差エントロピーの親戚にあたる。[On Information and Sufficiency](https://projecteuclid.org/journals/annals-of-mathematical-statistics/volume-22/issue-1/On-Information-and-Sufficiency/10.1214/aoms/1177729694.full)
1957年ジェインズが最大エントロピー原理を示すエドウィン・ジェインズアメリカ分かっていること以外は決めつけず、一番読めない状態を仮定して推測する、という考え方。情報のエントロピーを物理へ逆輸入した。[Information Theory and Statistical Mechanics](https://bayes.wustl.edu/etj/articles/theory.1.pdf)
1986年決定木ID3が、質問の順番をエントロピーで選ぶロス・キンランオーストラリア分けたあとのエントロピーが一番下がる項目から聞く。下がった分が情報利得。[Induction of Decision Trees](https://link.springer.com/article/10.1007/BF00116251)
2016年交差エントロピーがAIの学習の標準の物差しになるイアン・グッドフェローらアメリカディープラーニングの教科書が、多くの場合は訓練データとモデルの予想の交差エントロピーをコストに使う、と整理した。[Deep Learning、第6章](https://www.deeplearningbook.org/contents/mlp.html)