SUNABACOさんのAI人材育成講座第6期
7日目の復習記事、1本目です。
いつものように、前回の質問への回答から始まりました。
質問1:データを変えると予測も変わる
SARIMAXで予測モデルを作ったとき、
比較に使うデータの範囲を変えただけで、
予測がかなり変わりました。
講座の最初から
「何のデータなのかを人間が把握しておくことが大事」
と言われてきましたが、
それを実感した、という質問です。
講師の回答はこうでした。
予測モデルの世界には
「GIGO(Garbage In, Garbage Out)」
という言葉があります。
ゴミを入れればゴミが出てくる、という意味です。
モデルは渡されたデータを疑いません。
いいかげんなデータを渡せば、
いいかげんな結果が返ってきます。
だから、何が予測を左右する因子なのかは、
人間が押さえておく必要があります。
質問2:精度はどこまで上げればいいのか
精度が高いほど良いモデルだと考えがちです。
でも、どこかで区切らないと、
やりすぎて過学習になりそうです。
過学習とは、手元のデータに合わせ込みすぎて、
初めて見るデータに弱くなることです。
グラフで見ると分かりやすくて、
予測の線が実データの点を一つ残らず拾おうとして、
細かくギザギザに暴れます。
きれいに当たっているように見えるのに、
新しいデータを入れたとたん外れる。
過去問の答えを丸暗記した人が、
問題文の言い回しが変わっただけで
解けなくなるのと同じです。
手元のデータの「たまたま」まで
覚えてしまっている状態だと言えます。
講師の回答では、
「精度が高い=良いモデル」は
ひとつの面では正しい、とのことでした。
ただし、必要な精度は使い道によって変わります。
例として、スマホの顔認証と
スマートグラスの顔認識では
求められる精度が違う、という話がありました。
精度を上げるにはコストがかかるので、
その釣り合いも問題になります。
もうひとつ大事なのは、
モデルは作りっぱなしにしないということです。
実際に使いながら実データがたまったら、
そのデータで改善していきます。
放っておくと、予測モデルの精度は
時間とともに悪くなります。
これを「ドリフト」と呼びます。
世の中の状況が変わると、
過去のデータで学んだ前提が
少しずつずれていくからです。
対策は、新しいデータでの再学習です。

ここから、7日目の本題につながります。
ゴールは予測モデルを作ることではありません。
データを継続的に集めて、
更新し続ける仕組みを作ることです。
この仕組みを「データパイプライン」と呼びます。
手術の腕を一度磨いて終わりにしないのと同じで、
モデルも新しい症例(データ)で
学び直し続ける必要がある。
私はそう理解しました。