SUNABACOさんのAI人材育成講座第6期
8日目の復習記事、2本目です。
ここからが本編、
テーマは引き続きデータパイプラインです。

【分析に適したデータの形とは】
まず、そもそもの話からでした。
分析しやすいデータの形があります。
1行目が見出し(ヘッダー)で、
2行目以降がデータ。
無駄なセル結合がない。
欠損値がない。

逆に、分析しにくいデータもあります。
行が連結されていたり、
途中に別のデータが挿入されていたり。
政府統計でよく見かける、
あの複雑な表がまさにそうです。

セル結合は、機械には読めません。
ではなぜ人はセル結合をするのか。
人が見るためです。
見やすくするために結合している。
講師の言葉はこうでした。
保存は、機械が読める状態にしておく。
見せ方は、そのあとで作ればいい、
ということだと理解しました。
【生成AIは「見れる」が、解釈はできない】
最近は事情が少し変わってきた、
という話もありました。
生成AIが画像として表を「見れる」ように
なってきたからです。
ただし、見えることと、
正しく解釈できることは別です。
ちなみに、
OCR(画像から文字を読み取る技術)で、
段組みのあるページの精度が悪いのは
おそらく日本語のせいだろう、
とのことでした。
あと、
現状ではGeminiが一番高精度、
という話も出ました。
そして、
元データから変換すると失われるものがある。
これが次の話につながります。
【池と、倉庫と、店】
ではどうするのか。
解決策として示されたのが、
3段構えの考え方です。
データレイク(池)
データを加工せず、そのまま貯めておく場所
データウェアハウス(物流倉庫)
きれいに整えられた構造化データを置く場所
データマート(店)
特定の分析目的に合わせて加工したものを
並べておく場所

池にはとにかく生のまま流し込む。
倉庫では使える形に整える。
店では、Aさん用・Bさん用・Cさん用に
小分けして並べる。
大事なのは、
加工する前の元データを池に残しておくことです。
変換すると失われるものがある以上、
元が残っていなければ取り返せません。
データパイプラインとは、
この池・倉庫・店が
随時自動で更新されている状態のことです。
処理されたデータは全部保存しておきます。
そして講師の言葉です。
デザインを組むのは人間。処理は自動。
どんな池を掘り、どんな棚を作るのかは
人が決める。
決まってしまえば、あとは機械が回す。
カルテも同じかもしれません。
見やすく整えた紙の形と、
あとから集計できる形は、別物です。
#データ分析 #セル結合 #データレイク #データウェアハウス #データマート