「チェックで質は保てる」——だが品質は一度の点検で確定する状態でなく、たえず手入れを続ける過程。多次元で用途依存で、時間とともに劣化する
集めたデータは、そもそも信じられるのか。入り口できちんとチェックすれば質は保てる、と考えたくなる。だが品質は、一度の点検で確定する『状態』ではなく、たえず手入れを続ける『過程』である。チェックはある瞬間を写したスナップショットにすぎない。質の低いデータはどんな組織にも広く存在し高くつき(Redman 1998、Haug ら 2011)、品質は正確さ・完全さ・新しさ・一貫性という多次元で、その評価・改善は方法論の問題であり(Batini ら 2009)、どこまでの質が要るかは用途によって変わる(Even & Shankaranarayanan 2007)。小さなエラーは集計・グラフを経て判断まで伝播し(Klein 1999)、品質は時間とともに動的に劣化する(Labouseur & Matheus 2017)。だから保つべきは、状態でなく過程である。
「チェックで質は保てる」——品質は状態でなく、過程である
前の単位では、データを一箇所に集める話を扱った。集めることと使えることの間には距離がある、と見た。だが、その距離を渡ろうとする前に、もっと足元の問いがある。そもそも、その集めたデータは、信じられるのか。 ここでは、データの品質——数字が正しく、そろっていて、新しく、食い違いのない状態か——を扱う。どんなに立派な分析も、もとの数字が間違っていれば、間違った答えを、もっともらしく差し出すだけになる。
「入力のときにきちんとチェックすれば、質は保てる」——そう考えたくなる。入り口で間違いを弾けば、あとは安心だ、と。だが、この単位が最初に置く注意はこうだ。品質は、一度の点検で確定する「状態」ではなく、たえず手入れを続ける「過程」である。 チェックは、ある瞬間を写した写真(スナップショット)にすぎない。撮った瞬間は正しくても、時間がたてば、顧客は引っ越し、担当は代わり、商品は入れ替わる。データは、放っておくと、静かに古び、食い違い、傷んでいく。だから「一度チェックしたから大丈夫」は、成り立たない。質を保つとは、写真を一枚撮ることではなく、庭の手入れのように、続けることなのだ。この見方の切り替えは、地味だが大きい。「状態」だと思っていると、一度きれいにした達成感で、つい手を止めてしまう。だが「過程」だと分かっていれば、劣化は当たり前の前提になり、いつ・どう手を入れ続けるかを、はじめから仕組みに組み込める。完璧な一枚を目指して力尽きるより、そこそこの手入れを、細く長く続けるほうが、結局は澄んだデータに近づく。
質の低いデータは、広く、高くつく
まず、地味だが動かせない事実から。質の低いデータは、どんな組織にも広く存在し、しかも高いコストを課している。
Redman が1998年に、多くの企業で、質の低いデータが業務のあちこちに潜み、実務に無視できない負担をかけていることを論じた。間違った住所への再発送、二重に登録された顧客への重複連絡、食い違う在庫数による欠品や過剰——一つひとつは小さくても、積もれば大きな時間とお金が失われる。しかも、こうした損は「データ品質のコスト」という名前では、帳簿のどこにも載らない。再発送の送料や、問い合わせ対応の残業として、別の科目にまぎれて、静かに支払われている。Haug、Zachariassen、van Liempd も2011年に、質の低いデータが生むコストを具体的に調べ、その負担が想像以上に大きいことを示した。データの質は、「あればいい」程度の話ではない。悪い質は、目に見えないところで、日々、静かに請求書を積み上げている。だからこそ、質は、後回しにできない土台なのだ。前の単位で「集めれば使える、わけではない」と見たが、それ以前に、集めたものの中身が濁っていれば、どんなに立派に統合しても、濁った水を大きな樽に移し替えるだけになる。質の悪いデータの上に築いた分析は、どれだけ精巧でも、砂の上の建物と変わらない。だからこの単位は、派手な分析の手前で、あえて足元の掃除に立ち止まる。
品質は多次元で、用途によって変わる
では、「良いデータ」とは、どういうものか。ここが、チェックリストで割り切れないところだ。データの品質は、一つのものさしでは測れない。 正確さ(間違っていないか)、完全さ(欠けていないか)、新しさ(古びていないか)、一貫性(同じものが別々の場所で食い違っていないか)——いくつもの側面があり、それらは、ときにぶつかる。「良いデータ」と一口に言っても、そのどれを指しているのかで、やるべきことは変わってくる。
Batini、Cappiello、Francalanci、Maurino が2009年に、データ品質の評価と改善を、単発のチェックではなく「方法論」の問題として整理した。品質は、その場で丸かバツかを付けて終わり、ではない。何を、どの側面で、どう測り、どう直し続けるかという、仕組みの話なのだ。しかも、側面どうしは、ときに引っ張り合う。たとえば、完全さを求めて空欄を無理に埋めれば、正確さが下がる。新しさを求めて速く取り込めば、確認が甘くなって一貫性が崩れる。だから「全部を最高に」は、そもそも成り立たない。さらに、Even と Shankaranarayanan が2007年に、「良い品質」は用途によって変わることを示した。同じデータでも、大まかな傾向を見るには十分な質が、一人ひとりに請求書を出すには足りない、ということがある。どこまでの質が必要かは、そのデータを何に使うかで決まる。だから、「完璧なデータ」を目指す前に、「この用途に、どこまでの質が要るのか」を問うほうが、現実的だ。これは、手を抜いてよい、という話ではない。むしろ、力の入れどころを見極める、という話だ。限られた時間と手間を、すべての側面に薄く広げるより、その用途で狂うと痛いところに、集中して注ぐ。たとえば、月次のざっくりした売上傾向を見るだけなら、一件二件の記入漏れは大勢に影響しない。だが、その数字をもとに一人ひとりに請求書を出すなら、一件の間違いが、そのまま一人の顧客の不信につながる。同じ「売上データ」でも、後者では、正確さと完全さに、はるかに高い水準が要る。
エラーは静かに、判断まで伝わる
質の低さが厄介なのは、それが、入り口で止まらないからだ。小さな入力ミスや古びた数字は、そのまま集計され、グラフになり、最後には判断にまで、静かに流れ込む。
Klein が1999年に、データのエラー率が、そこから作られる予測や分析の精度に伝播することを示した。もとが少し歪んでいれば、それを土台にした計算も、同じだけ歪む。しかも、きれいなグラフになった数字は、いかにも正しそうに見えるから、途中の歪みは、たいてい気づかれない。そして、Labouseur と Matheus が2017年に、データの品質は、時間とともに動的に劣化するという、この単位の芯を、あらためて指摘した。世界が変われば、それを写したデータも古びる。保つべきは、ある瞬間の「きれいな状態」ではなく、劣化に合わせて手入れを続ける「過程」なのだ。一度きれいにしたデータも、手を入れなければ、また濁っていく。川の水と同じで、流し続け、澱みを取り続けることでしか、澄んだままには保てない。ここには、少し怖い面もある。エラーが判断まで伝わっても、途中では、たいてい誰も気づかない。むしろ、きれいに整ったグラフや、小数点まで並んだ数字ほど、私たちは「正確だ」と信じてしまう。見た目の精密さと、中身の正しさは、まったく別のことなのに。だから、数字を見るときに大事なのは、その数字が「どんなデータから、どんな手入れを経て」出てきたのかを、一度は疑ってみることだ。きれいな結論ほど、その足元を、一度は確かめておきたいものだ。
時間・変化:1998年から今へ
順に置く。1998年、Redman が、質の低いデータが広く存在し高くつくことを論じる。1999年、Klein が、エラー率が分析の精度に伝播すると示す。2007年、Even と Shankaranarayanan が、良い品質は用途によって変わると示し、2009年、Batini らが、品質の評価・改善は単発でなく方法論の問題だと整理する。2011年、Haug らが、質の低いデータのコストを具体的に調べ、2017年、Labouseur と Matheus が、品質は動的に劣化すると指摘した。
こうして並べると、研究の目が、少しずつ深まってきたのが分かる。はじめは「質の低いデータは、どれほど損か」を測ることから始まり、やがて「良い品質とは、そもそも何を指すのか(多次元・用途依存)」へ、そして「それは、どう時間とともに崩れていくのか(過程)」へと、問いが移ってきた。
この間に確からしくなったのは、「チェックで質は保てる」ということではない。確からしくなったのは、質の低さは広く高くつき、品質は多次元で用途依存で、時間とともに劣化する——だから保つべきは状態でなく過程である——という、向きのほうである。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、「一度きれいにしたから、もう大丈夫」という安心である。データは、放っておけば古びる。掃除を一度したから、二度と汚れない部屋がないのと同じだ。もう一つは、逆に「完璧なデータでなければ使えない」と、質の低さを理由に何も始めないことだ。用途しだいで、必要な質は変わる。大まかな傾向を掴むだけなら、多少の欠けや古さは、致命傷にならないこともある。
助けになるのは、いきなり全部を点検する前に、「前の単位で決めた大事な数字にとって、どの側面の質が、いちばん効くか」を一つ決めることだ。全部を守ろうとすると、たいてい何も守れない。一点に絞るからこそ、続けられる。最初の一歩は10分。その数字を出すデータについて、正確さ・完全さ・新しさ・一貫性のうち、狂うと判断がいちばん歪むのはどれかを一つ選び、それを「いつ・誰が・どうやって手入れし続けるか」を、一行決める。負担が小さく、無理なく続けられる形にしておくのがコツだ。全部を完璧にしようとせず、効く一点を、過程として回す。この「効く一側面を、続けて手入れする」構えが、きれいな写真を一枚撮って安心する罠から、あなたを守ってくれる。データの質は、一日で完璧にするものではなく、毎日ほんの少しずつ、続けて守るものだ。地味だが、この土台がしっかりしているかどうかで、この先に積む読む力も使う力も、まるで変わってくる。濁った水の上には、澄んだ結論は、決して立ちようがないのだ。
- 青段(基盤)3単位目。前の単位でデータを集める話をした続きで、その集めたデータがそもそも信じられるか=データの品質(数字が正しく・そろっていて・新しく・食い違いのない状態)を扱う。俗説はチェックで質は保てる。だが最初の注意は、品質は一度の点検で確定する状態でなく、たえず手入れを続ける過程だということ。チェックはある瞬間を写した写真(スナップショット)にすぎず、時間がたてば顧客は引っ越し担当は代わり商品は入れ替わる。放っておくとデータは静かに古び傷む
- 地味だが動かせない事実——質の低いデータはどんな組織にも広く存在し高いコストを課す。Redman 1998 は多くの企業で質の低いデータが業務に潜み実務に無視できない負担をかけると論じた。間違った住所への再発送、二重登録の重複連絡、食い違う在庫数の欠品や過剰。Haug, Zachariassen & van Liempd 2011 は質の低いデータが生むコストを具体的に調べ想像以上に大きいと示した。悪い質は目に見えないところで日々静かに請求書を積み上げる。※Haugは530(統合障壁2013)とは別論文
- 良いデータとは何か——品質は一つのものさしで測れない。正確さ・完全さ・新しさ・一貫性など、いくつもの側面があり、ときにぶつかる。Batini, Cappiello, Francalanci & Maurino 2009 はデータ品質の評価と改善を単発のチェックでなく方法論の問題として整理した。品質はその場で丸かバツを付けて終わりでなく、何をどの側面でどう測りどう直し続けるかという仕組みの話。品質はチェックリストで割り切れない
- Even & Shankaranarayanan 2007 は良い品質は用途によって変わると示した。同じデータでも大まかな傾向を見るには十分な質が、一人ひとりに請求書を出すには足りないことがある。どこまでの質が必要かはそのデータを何に使うかで決まる。だから完璧なデータを目指す前に、この用途にどこまでの質が要るのかを問うほうが現実的。だからこの棚は特定のデータ品質ツールの優劣を名指しせず、このチェックで質は保てると断定しない
- 質の低さが厄介なのは入り口で止まらないこと。小さな入力ミスや古びた数字はそのまま集計されグラフになり最後には判断にまで静かに流れ込む。Klein 1999 はデータのエラー率がそこから作る予測や分析の精度に伝播すると示した。もとが少し歪めば計算も同じだけ歪むが、きれいなグラフはいかにも正しそうで途中の歪みは気づかれない。エラー率の具体的な%は書かない。application は自分のデータ・記録で完結し個人データを課題材料にしない
- Labouseur & Matheus 2017 はデータの品質は時間とともに動的に劣化するとこの単位の芯を指摘した。世界が変われば写したデータも古びる。保つべきはある瞬間のきれいな状態でなく、劣化に合わせて手入れを続ける過程。一度きれいにしたデータも手を入れなければまた濁る。川の水と同じで流し続け澱みを取り続けることでしか澄んだままには保てない。この間に確からしくなったのは、質の低さは広く高くつき品質は多次元で用途依存で時間とともに劣化するという向き
- だからこの単位でやるのは、いきなり全部を点検する前に、前の単位で決めた大事な数字にとってどの側面の質がいちばん効くかを一つ決めること。その数字を出すデータについて正確さ・完全さ・新しさ・一貫性のうち狂うと判断がいちばん歪むのはどれかを一つ選び、それをいつ・誰が・どうやって手入れし続けるかを一行決める。全部を完璧にせず効く一点を過程として回す。この効く一側面を続けて手入れする構えが、きれいな写真を一枚撮って安心する罠から守る
| よくある誤解 | 実際のところ |
|---|---|
| データは入力のときにきちんとチェックして間違いを弾けば、そのあとは質を保てる | 品質は、一度の点検で確定する『状態』ではなく、たえず手入れを続ける『過程』である。チェックは、ある瞬間を写した写真(スナップショット)にすぎない。撮った瞬間は正しくても、時間がたてば顧客は引っ越し、担当は代わり、商品は入れ替わり、データは静かに古び食い違い傷んでいく。Labouseur & Matheus 2017 は、データの品質が時間とともに動的に劣化することを指摘した。だから『一度チェックしたから大丈夫』は成り立たず、質を保つとは写真を一枚撮ることではなく、庭の手入れのように続けることである |
| データの品質は、正しいか正しくないか、チェックリストで丸かバツかを付ければ判定できる | 品質は一つのものさしでは測れない。正確さ・完全さ・新しさ・一貫性など、いくつもの側面(多次元)があり、ときにぶつかる。Batini et al 2009 は、データ品質の評価と改善を、単発のチェックではなく『方法論』の問題――何を、どの側面で、どう測り、どう直し続けるかという仕組みの問題――として整理した。さらに Even & Shankaranarayanan 2007 は『良い品質』が用途によって変わることを示した。同じデータでも、大まかな傾向を見るには十分な質が、一人ひとりに請求書を出すには足りないことがある。どこまでの質が要るかは、そのデータを何に使うかで決まる |
| 多少データが古かったり間違っていたりしても、集計してグラフにすれば、影響は薄まってならされる | 質の低さは入り口で止まらない。小さな入力ミスや古びた数字は、そのまま集計され、グラフになり、最後には判断にまで静かに流れ込む。Klein 1999 は、データのエラー率が、そこから作られる予測や分析の精度に伝播することを示した。もとが少し歪んでいれば、それを土台にした計算も同じだけ歪む。しかも、きれいなグラフになった数字はいかにも正しそうに見えるため、途中の歪みはたいてい気づかれない。だから集計は歪みを薄めてくれるどころか、正しそうな見た目で歪みを隠してしまう。この棚は特定のデータ品質ツールの優劣を名指ししない |
皮肉なのは、いちばん安心できる瞬間――『チェックが全部通った』瞬間――が、いちばん油断の入り口だということだ。その一枚の写真が正しくても、世界は動き続け、データはその瞬間から、また古びはじめる。確からしいのは、質の低さは広く、静かに高くつき、品質は一つのものさしでは測れず、用途によって必要な水準が変わり、そして時間とともに劣化する、ということだ。だから、質を保つとは、完璧な状態を一度作ることではない。庭の手入れのように、川の水のように、続けることだ。とはいえ、全部の側面を、全部のデータで、完璧に手入れし続けるのは無理がある。だから、まず一点。前の単位で決めた大事な数字にとって、狂うといちばん判断が歪む側面はどれか。その一つを、いつ・誰が・どう手入れし続けるかを決める。効く一点を過程として回す――これが、きれいな写真に安心しない構えだ。次の単位は 532「誰もが使えるダッシュボードにするには?」。ここまでで、見るべき数字を決め、集め、質を保った。青段の締めとして、それを見える形にする話へ進む。
Q1. データの品質は、一度の点検で確定する『____』ではなく、たえず手入れを続ける『____』である。一度のチェックはある瞬間を写した ____ にすぎず、データは時間とともに動的に劣化していく。穴埋め
Q2. Even & Shankaranarayanan 2007 が、データの『良い品質』について示したことはどれか。選択
Q3. 『質の低いデータは、後回しにできない』のはなぜか。Redman 1998 と Klein 1999 に触れて述べよ。一問一答
Q4. 『品質はチェックリストで割り切れない』とはどういうことか。Batini et al 2009 と Labouseur & Matheus 2017 に触れて述べよ。一問一答
Q5. この単位が示した研究を、年の早い順に並べよ。(ア)Klein がエラー率は精度に伝播すると示す(イ)Batini らが品質は方法論の問題と整理する(ウ)Redman が質の低いデータは広く高くつくと論じる(エ)Labouseur & Matheus が品質は動的に劣化すると指摘する並べ替え
紙かメモアプリに今日の日付を書く。次に、前の単位までで決めた『本当に大事にしたい数字』を一つ選び、その数字を出すもとになるデータについて、品質の四つの側面――(1) 正確さ(間違っていないか)、(2) 完全さ(欠けていないか)、(3) 新しさ(古びていないか)、(4) 一貫性(食い違っていないか)――のうち、狂うと判断がいちばん歪みそうなのはどれか、を一つ選ぶ。そのうえで、その一側面について、『いつ・誰が・どうやって手入れし続けるか』を一行で決める(たとえば「月初に、自分が、先月分の記録を見直して古い連絡先を直す」のように)。全部を完璧にしようとせず、いちばん効く一点を、続けられる過程として書くのがねらい。統計的な判定や特定ツールの良し悪しは書かない。従業員や顧客の個人データそのものを材料にはせず、自分の数字とデータの手入れ計画として完結させる。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Redman T.C. (1998) ‘The impact of poor data quality on the typical enterprise’, Communications of the ACM 41(2):79-82 — doi.org
- Batini C., Cappiello C., Francalanci C., Maurino A. (2009) ‘Methodologies for data quality assessment and improvement’, ACM Computing Surveys 41(3):1-52 — doi.org
- Haug A., Zachariassen F., van Liempd D. (2011) ‘The costs of poor data quality’, Journal of Industrial Engineering and Management 4(2):168-193 — doi.org
- Even A., Shankaranarayanan G. (2007) ‘Utility-driven assessment of data quality’, ACM SIGMIS Database 38(2):75-93 — doi.org
- Klein B.D. (1999) ‘Data quality in neural network models: effect of error rate and magnitude of error on predictive accuracy’, Omega 27(5):569-582 — doi.org
- Labouseur A.G., Matheus C.C. (2017) ‘An Introduction to Dynamic Data Quality Challenges’, Journal of Data and Information Quality 8(2):1-3 — doi.org