(627)GIGOゴミの話とドリフト | 大阪肛門科診療所 院長 佐々木いわおブログ──『過ぎたるは及ばざるにしかずだよ、佐々木君』

大阪肛門科診療所 院長 佐々木いわおブログ──『過ぎたるは及ばざるにしかずだよ、佐々木君』

「切りすぎた肛門は元には戻せないんだよ・・」故隅越幸男先生の言葉をいつも心の真ん中に置いて「切りすぎない手術」「切らない肛門診療」を追求する肛門科専門医が、手術のこと、治療のこと、日常のことを、綴ります。

SUNABACOさんのAI人材育成講座第6期
7日目の復習記事、1本目です。

いつものように、前回の質問への回答から始まりました。


質問1:データを変えると予測も変わる

SARIMAXで予測モデルを作ったとき、
比較に使うデータの範囲を変えただけで、
予測がかなり変わりました。

講座の最初から
「何のデータなのかを人間が把握しておくことが大事」
と言われてきましたが、
それを実感した、という質問です。

講師の回答はこうでした。

予測モデルの世界には
「GIGO(Garbage In, Garbage Out)」
という言葉があります。

ゴミを入れればゴミが出てくる、という意味です。

モデルは渡されたデータを疑いません。
いいかげんなデータを渡せば、
いいかげんな結果が返ってきます。

だから、何が予測を左右する因子なのかは、
人間が押さえておく必要があります。


質問2:精度はどこまで上げればいいのか

精度が高いほど良いモデルだと考えがちです。

でも、どこかで区切らないと、
やりすぎて過学習になりそうです。

過学習とは、手元のデータに合わせ込みすぎて、
初めて見るデータに弱くなることです。

グラフで見ると分かりやすくて、
予測の線が実データの点を一つ残らず拾おうとして、
細かくギザギザに暴れます。

きれいに当たっているように見えるのに、
新しいデータを入れたとたん外れる。

過去問の答えを丸暗記した人が、
問題文の言い回しが変わっただけで
解けなくなるのと同じです。

手元のデータの「たまたま」まで
覚えてしまっている状態だと言えます。

講師の回答では、
「精度が高い=良いモデル」は
ひとつの面では正しい、とのことでした。

ただし、必要な精度は使い道によって変わります。

例として、スマホの顔認証と
スマートグラスの顔認識では
求められる精度が違う、という話がありました。

精度を上げるにはコストがかかるので、
その釣り合いも問題になります。

もうひとつ大事なのは、
モデルは作りっぱなしにしないということです。

実際に使いながら実データがたまったら、
そのデータで改善していきます。

放っておくと、予測モデルの精度は
時間とともに悪くなります。

これを「ドリフト」と呼びます。

世の中の状況が変わると、
過去のデータで学んだ前提が
少しずつずれていくからです。

対策は、新しいデータでの再学習です。



ここから、7日目の本題につながります。

ゴールは予測モデルを作ることではありません。

データを継続的に集めて、
更新し続ける仕組みを作ることです。

この仕組みを「データパイプライン」と呼びます。

手術の腕を一度磨いて終わりにしないのと同じで、
モデルも新しい症例(データ)で
学び直し続ける必要がある。

私はそう理解しました。