一言で!
情報利得とは、「質問」の切れ味を測る数字。
他には?
この数字だけでは答えは出ない。
ただし、どの質問から聞いていけば、最短で正解にたどり着くかは、これで決まる。
年表
| 年代・年 | 主な出来事 | 主な人物・組織 | 主な国・地域 | 特徴 |
|---|---|---|---|---|
| 1948年 | シャノンが「分からなさ」をビットという単位で測れるようにする | クロード・シャノン(ベル研究所) | アメリカ | 通信路にどれだけ情報を通せるかという問題から、確率にもとづく情報量(エントロピー)を定義した。のちに機械学習が借りてくる物差しがここで生まれている。[A Mathematical Theory of Communication(原論文PDF)](https://people.math.harvard.edu/~ctm/home/text/others/shannon/entropy/entropy.pdf) |
| 1984年 | CARTがジニ不純度という別の物差しで同じ問題を解く | レオ・ブレイマンら | アメリカ | 分かれたあとの純度を測るのに、エントロピーではなくジニ不純度を使う系統。結論は似るが計算が軽く、いまも広く使われている。[scikit-learnの決定木の説明(両者の式を併記)](https://scikit-learn.org/stable/modules/tree.html) |
| 1986年 | 決定木ID3が、分岐に使う項目を情報利得で自動的に選ぶ | ロス・キンラン | オーストラリア | どの質問から聞くかを人が決めるのではなく、減る分からなさが最大の項目を採る形にした。情報利得が実務で使われる原型。[Induction of Decision Trees](https://link.springer.com/article/10.1007/BF00116251) |
| 1993年 | C4.5が利得比を導入し、選択肢の多い項目への偏りを補正する | ロス・キンラン | オーストラリア | 顧客IDのように値の種類が多い項目は、分ければ必ず純度が上がるため利得が過大に出る。分かれ方の細かさで割ることで打ち消した。[C4.5の改良(1996年、JAIR)](https://www.jair.org/index.php/jair/article/view/10492) |
| 2001年 | ランダムフォレストの副産物として特徴量重要度が広まる | レオ・ブレイマン | アメリカ | 木を何百本も束ねる手法。各項目が分岐で稼いだ利得を合計して、どの項目が効いたのかを一覧にする使い方が定着した。[Random Forests](https://link.springer.com/article/10.1023/A:1010933404324) |
| 2007年 | その特徴量重要度にも偏りがあることが実証される | Strobl、Boulesteix ら | ドイツ | 値の種類が多い項目や尺度の違う項目が過大評価されることを、人工データで確かめた。順位をそのまま信じてはいけない、という警告。[Bias in random forest variable importance measures](https://bmcbioinformatics.biomedcentral.com/articles/10.1186/1471-2105-8-25) |
| 2016年 | 勾配ブースティングの普及で、利得ベースの重要度が実務の標準になる | Tianqi Chenら | アメリカ | XGBoostが広く使われ、分岐で稼いだ利得の合計を重要度として見る運用が一般化した。速さと精度の代わりに、解釈は間接的なままだった。[XGBoost: A Scalable Tree Boosting System](https://arxiv.org/abs/1603.02754) |
| 2017年 | 予測への寄与を配分し直す見方(SHAP)が出て、重要度の読み方が整理される | Lundberg、Lee | アメリカ | どの項目がその予測をどれだけ動かしたかを、協力ゲームの分配の考え方で割り当てる。利得の合計とは別の角度から重要度を見る道具になった。[A Unified Approach to Interpreting Model Predictions](https://arxiv.org/abs/1705.07874) |