情報利得とは何か

2026年9月20日
7分

一言で!

情報利得とは、「質問」の切れ味を測る数字。

他には?

この数字だけでは答えは出ない。

ただし、どの質問から聞いていけば、最短で正解にたどり着くかは、これで決まる。

年表

年代・年主な出来事主な人物・組織主な国・地域特徴
1948年シャノンが「分からなさ」をビットという単位で測れるようにするクロード・シャノン(ベル研究所)アメリカ通信路にどれだけ情報を通せるかという問題から、確率にもとづく情報量(エントロピー)を定義した。のちに機械学習が借りてくる物差しがここで生まれている。[A Mathematical Theory of Communication(原論文PDF)](https://people.math.harvard.edu/~ctm/home/text/others/shannon/entropy/entropy.pdf)
1984年CARTがジニ不純度という別の物差しで同じ問題を解くレオ・ブレイマンらアメリカ分かれたあとの純度を測るのに、エントロピーではなくジニ不純度を使う系統。結論は似るが計算が軽く、いまも広く使われている。[scikit-learnの決定木の説明(両者の式を併記)](https://scikit-learn.org/stable/modules/tree.html)
1986年決定木ID3が、分岐に使う項目を情報利得で自動的に選ぶロス・キンランオーストラリアどの質問から聞くかを人が決めるのではなく、減る分からなさが最大の項目を採る形にした。情報利得が実務で使われる原型。[Induction of Decision Trees](https://link.springer.com/article/10.1007/BF00116251)
1993年C4.5が利得比を導入し、選択肢の多い項目への偏りを補正するロス・キンランオーストラリア顧客IDのように値の種類が多い項目は、分ければ必ず純度が上がるため利得が過大に出る。分かれ方の細かさで割ることで打ち消した。[C4.5の改良(1996年、JAIR)](https://www.jair.org/index.php/jair/article/view/10492)
2001年ランダムフォレストの副産物として特徴量重要度が広まるレオ・ブレイマンアメリカ木を何百本も束ねる手法。各項目が分岐で稼いだ利得を合計して、どの項目が効いたのかを一覧にする使い方が定着した。[Random Forests](https://link.springer.com/article/10.1023/A:1010933404324)
2007年その特徴量重要度にも偏りがあることが実証されるStrobl、Boulesteix らドイツ値の種類が多い項目や尺度の違う項目が過大評価されることを、人工データで確かめた。順位をそのまま信じてはいけない、という警告。[Bias in random forest variable importance measures](https://bmcbioinformatics.biomedcentral.com/articles/10.1186/1471-2105-8-25)
2016年勾配ブースティングの普及で、利得ベースの重要度が実務の標準になるTianqi ChenらアメリカXGBoostが広く使われ、分岐で稼いだ利得の合計を重要度として見る運用が一般化した。速さと精度の代わりに、解釈は間接的なままだった。[XGBoost: A Scalable Tree Boosting System](https://arxiv.org/abs/1603.02754)
2017年予測への寄与を配分し直す見方(SHAP)が出て、重要度の読み方が整理されるLundberg、Leeアメリカどの項目がその予測をどれだけ動かしたかを、協力ゲームの分配の考え方で割り当てる。利得の合計とは別の角度から重要度を見る道具になった。[A Unified Approach to Interpreting Model Predictions](https://arxiv.org/abs/1705.07874)