コラムバックナンバー
Option合同会社 柳井 隆道
発信元:メールマガジン2019年3月13日号より
データを扱う仕事の中で、データに基づいて将来の数値を予測することはよくあります。その際過去のデータに基づいて予測を行うわけですが、過去データの扱い方で気を付けなければならないことを紹介します。
1. データに不備がある
データの誤りは気づきやすいのですが、意外と盲点になるのがデータが一部欠損している(行が欠損している)ケースです。
人間が入力しているデータで、気まぐれで入力されていないケースもありますし、入力しないインセンティブ(不利な結果を入力すると担当者の評価が下がるなど)がはたらいているケースもあります。
またわれわれ分析者は分析用データの抽出を依頼することもあるわけですが、データ抽出条件の誤りにより特定の条件に当てはまるデータだけが抜け落ちるなどのケースもあります。
欠損がランダムに発生する場合は悪影響は小さいのですが、このような場合は欠損の発生に偏り(特定の条件でデータが欠損する)があるため、その後の分析に悪影響を及ぼします。
2. 前提条件が変わる
過去どのくらいの期間のデータに基づいて予測をすればいいのでしょうか。
これをよく感じるのは競馬です。過去のデータから勝ち馬を予想する人は多いものです。昔からのデータから示すとおり長期休養明けは不利だとか、テン乗り(それまで騎乗したことのない騎手に乗り替わる)は不利だとか、よく言われています。たしかに馬が走るための調整が不十分だったり、騎手が馬の特徴を知らなかったりするなど、このデータをサポートする理論はあるのです。
しかし直近では休養中もトレーニングを積む設備ができ、調整が十分にできるようになった。また日本人より騎乗技術が圧倒的に優れている外国人騎手が多く乗るようになったことで、そのような条件でも勝つケースが多くなっています。つまりデータに反する結果がよく現れるようになってきているのです。
過去のデータの前提になっている環境が今では崩れてきている。だから過去のデータを使って予想すること自体がナンセンスになっているわけです。
データといっても直近のデータしか意味をなさないわけですが、競馬の場合は同条件のサンプルサイズ(行われたレースの数)が小さすぎて予想に不足するので、結局データが役に立つとは言いにくいのです。
私もデータを仕事としているわけですが、競馬で過去のデータばかり主張する人はセンスが悪いと思うわけです。
環境が変わることで過去のデータが役に立たなくなる例は実際のビジネスの世界でもあるわけで、現在の環境が有効となるデータの期間にも気を使う必要があります。
3. 1回しか発生したことのないイベントが要因になっている
データの期間中、1回しか起こらなかったイベントが目的変数に影響を及ぼす場合の扱いです。
たとえばB2C分野での今年の売上を予測する場合、消費税増税の影響は免れないでしょう。ではその影響の大きさはどの程度なのでしょうか。その大きさを見積もれないと売上の精度の高い予測はできません。
ところが過去のデータでその影響の大きさがわかるのは2014年のデータだけで、その1回を根拠に影響の大きさを見積もる必要があるわけです。影響の大きさを算出する根拠がたった1回のデータなのです。
過去のデータで何度か発生するイベントはその影響の大きさを見積もることはできますが、一度しか発生しなかったものを根拠にせざるを得ないというのは苦しいですよね。
ところがデータにはこういった事象もつきものなのです。
どんなにイケてるアルゴリズムを使ったところで、分析・予測のアルゴリズムはデータを反映するものでしかないわけです。もしデータがポンコツであれば、データがポンコツであることを示すのがアルゴリズムです。アルゴリズムはデータに正直です。データが悩ましいものである場合は、予測の結果も悩ましさを含んでしまう、それがデータドリブンなのです。
東京大学を卒業後、webマーケティングやサービス企画、システム開発などに従事。
デジタルマーケティングの世界に落ち着き、事業会社、広告代理店を経て2014年に独立。
現在は大小さまざまの事業会社、広告代理店などに対して、テクノロジー観点からデジタルマーケティングの支援を行っている。データ計測の設計、実装から分析、マーケティングオートメーションや広告運用などの施策との連携まで扱う。
さまざまな規模の経験から、企業の身の丈にあったデジタルマーケティングの企画に強い。フリーランスで活動していたが、2017年から法人化。
2026/03/18(水)
オンラインセミナー「GA4×生成AIで改善提案の精度を高める ― AIから「使える施策」を引き出す実践アプローチ ―」|2026/3/18(水)
GA4によるサイト改善は、生成AIと組み合わせることで新しい段階に入りつつあります。 しかし一方で、「AIに分析させても表面的なコメントしか …
2026/02/19(木)
オンラインセミナー「GA4×ヒートマップで成果を出すCVR改善入門」|2026/2/19(木)
本セミナーは、Google アナリティクス 4(GA4)とヒートマップを活用してCVR改善の施策設計と効果検証を再現性高く行うための実践的な …
2026/01/22(木)
オンラインセミナー「検索行動・消費者分析ツール「DS.INSIGHT」の最新機能と活用事例」|2026/1/22(木)
ツール研究会の3回目は、DS.INSIGHTがテーマです。 このセミナーは、どなたでも参加可能です。 一般の方の申込には、ライト会員(登録・ …
【コラム】生成AIは「飼い主」を選ぶ──GA4×生成AIで「使える施策」を引き出すために
アナリティクスアソシエーション 大内 範行生成AIに仕事をさせてみたものの、表面的なコメントしか出てこなかった──そんな経験をお持ちの方も多いのではないでしょうか。 「プロンプトが悪 …
【コラム】2026年以降も生き残るであろうアクセス解析業務とは?
株式会社MOLTS/株式会社月曜日のトラ 西 正広こんにちは、月曜日のトラの西です。 私は2006年に社会人となり、社会人1年目からアクセス解析ツールに触れてきました。2026年は、私がアク …
【コラム】生成AIはデータ分析をどう変えていくのか?自動運転レベルに学ぶ3段階の進化へ
アナリティクスアソシエーション 大内 範行2026年が明けました。今年は「生成AIを使ったデータ分析」が、大きなテーマになりそうです。 年初のコラムですし、まずは少し広い視野で、デー …