「匿名化すれば安全」——だが少数の手がかりで個人は戻る。匿名化は絶対でなく、加工+契約+管理を重ねる
匿名化すれば安全だ、と教わる。皮肉なことに、この言葉ほど人を油断させるものはない。名前を消した——その一言で、私たちは安心し、そのデータを気軽に外へ出してしまう。だが、消したのは名札だけで、その人の振る舞いの型はそのまま残っている。いつ・どこで・何を、という、たった数個の点が、名前の代わりにその人を名指しする。だから匿名のデータは、外の情報と照らされた瞬間に、しばしば個人へと戻っていく。
前の単位では、データを誰が持ち、どう統治するかを扱った。ここでは、そのデータの中身——一人ひとりの個人にひもづく情報を、どう守りながら活かすか、というプライバシーの問題を扱う。
「匿名化すれば安全」——これが、この単位が向き合う俗説だ。名前や住所を消して「匿名」にすれば、あとは自由に使ってよい、他社に渡してよい、という発想である。個人が特定できないように加工することは、大切な備えだ。だが、この単位で見るのは、その先だ。「匿名化」したはずのデータは、他の情報と照らし合わせることで、しばしば個人に戻せてしまう。匿名化は、絶対の安全ではない。 まず断っておく。ここで扱うのは、あなたの商いの個別のデータの扱いが適法かどうかの判定(それは専門家の持ち場だ)ではなく、匿名化という技術の「限界」を知る、という一般の話である。そして、再識別の手口を、誰かを暴くために使う話でもない。知るのは、守る側として、「匿名化すれば大丈夫」という思い込みを捨てるためだ。
「匿名化」したデータは、照合で個人に戻る
まず、事実から入る。二〇〇八年、Narayanan と Shmatikov が *2008 IEEE Symposium on Security and Privacy*:111-125 で、大規模で疎(スパース)なデータの脱匿名化を実証した。動画配信のNetflixが研究用に公開した「匿名」の映画評価データを、別の公開情報(映画データベースの評価)と照らし合わせるだけで、そこに含まれる個人を高い確率で言い当てられることを示したのだ。名前を消しても、「いつ・どの映画に・どんな評価をつけたか」という振る舞いの型そのものが、その人を指す指紋になる。 ここに、この単位の「証拠の読み違え方」がある——匿名化すれば安全だと思い込み、外の情報と照らせば個人に戻りうるという「照合の危うさ」を見落とす。 匿名化は、データを単体で見れば個人が分からない、という状態にすぎない。世の中には他のデータがいくらでもあり、それらと突き合わされた瞬間、匿名の壁はしばしば崩れる。安全かどうかは、そのデータ単体では決まらない。世の中に出回る情報は年々増え、突き合わせに使える手がかりも増えていく。だから、いま安全に見える匿名化も、明日には戻せるようになっているかもしれない。匿名化の安全は、その時点での、暫定のものにすぎないのだ。
ごく少数の手がかりで、個人は一意に特定される
では、どれくらいの手がかりで個人は特定されるのか。驚くほど少ない。二〇一三年、de Montjoye らが *Scientific Reports* 3:1376 で、人の移動履歴を調べ、いつ・どこにいたか、というたった四つの点が分かれば、約95%の人が一意に特定できることを示した。二〇一五年には、de Montjoye らが *Science* 347(6221):536-539 で、クレジットカードの決済記録でも、いつ・どの店で使ったか、という四つの点で約90%が特定できることを示した。名前も番号も無い、ただの「いつ・どこで」の記録が、これだけで個人を指してしまう。私たちは「名前さえ消せば匿名」と思うが、人の行動は、それ自体がその人に固有の形をしている。 顧客の買い物の記録も、来店の時刻も、消したはずの名前の代わりに、その人を静かに名指ししている。手がかりは、私たちが思うよりずっと少なくてよいのだ。ここで大切なのは、「一意に特定できる」という言葉の重みだ。約95%という数字は、百人のうち九十五人が、たった四つの点だけで、他の誰でもないその人だと言い当てられる、ということである。名前や住所という「はっきりした目印」を消すことに気を取られて、いつ・どこで・何を、という「振る舞いの目印」が残っていることには、私たちはなかなか気づかない。だが、後者こそが、その人を最も確かに指し示す。だから、匿名化のときに消すべきは、名札だけではないのだ。
不完全なデータでも、高い確率で戻せる
「でも、うちが持っているのは一部の、欠けの多いデータだから大丈夫」——そうとも限らない。二〇一九年、Rocher・Hendrickx・de Montjoye が *Nature Communications* 10:3069 で、不完全なデータからの再識別を推定する手法を示し、わずか十五個ほどの属性があれば、不完全なデータセットの中でも99.98%の人を正しく再識別できると見積もった。一部を抜き出しただけのデータでも、匿名は守られない。さかのぼれば二〇〇二年、Sweeney が *k-匿名性* のモデルを提唱し、匿名化を数理的に扱う枠組みを作ったが、同時にそれにも限界があることが知られてきた。匿名化の技術は進んだが、「これで絶対に戻らない」と言い切れる完全な方法は、いまだに無い。 加工を強くすればデータの値打ちは減り、値打ちを残せば戻る危うさが残る。この綱引きから、匿名化は逃れられない。だから、匿名化を「済ませたか・済ませていないか」の二択で考えるのは、そもそも無理がある。問うべきは「完全に匿名にできたか」ではなく、「どこまで危うさを減らせたか、残った危うさをどう補うか」だ。完璧な壁は無いと知ったうえで、なお、できるだけ高い壁を積み、足りない分を別の備えで補う——そういう構えでなければ、匿名化はかえって油断を生む。
だから制度も、「再識別の禁止」を義務にしている
匿名化が絶対でないことは、法律の作りにも表れている。日本の個人情報保護法は「匿名加工情報」という区分を設け、個人情報保護委員会は、それを特定の個人を識別することができず、かつ、元の個人情報を復元できないように加工した情報と定めている。そして扱う事業者の義務の中に、識別行為の禁止——すなわち他の情報と照合して個人を再識別してはならないことを含めている。つまり、制度そのものが「加工しただけでは戻る危うさが残る」ことを前提に、「戻す行為」を禁じて穴を塞ごうとしているのだ。(なお、氏名だけを別の符号に置き換える「仮名加工情報」という、より緩い区分も別にあるが、これは単体では個人を識別できないだけで、他の情報と照合すれば戻りうる、より弱い加工だ。)ここで大切なのは、個別のデータが適法かを自分で判定しないこと。それは専門家に相談すべき事柄だ。ここで受け取るべきは、「制度でさえ再識別を警戒している=匿名化は絶対ではない」という、その一点である。法律がわざわざ「戻してはならない」と釘を刺すのは、裏を返せば、加工しただけのデータは戻せてしまう、という現実があるからだ。もし匿名化が本当に絶対なら、こんな禁止は要らない。禁止があること自体が、限界の何よりの証拠なのである。
時間・変化:2002年から2019年へ
順に置く。二〇〇二年、Sweeney が k-匿名性のモデルを示し、匿名化を数理で扱う枠組みを作る。二〇〇八年、Narayanan と Shmatikov が、「匿名」データが外の情報との照合で個人に戻ることを実証する。二〇一三年、de Montjoye らが、移動履歴の四点で約95%が特定できると示す。二〇一五年、同じく de Montjoye らが、決済記録の四点で約90%が特定できると示す。二〇一九年、Rocher らが、不完全なデータでも十五属性で99.98%が再識別できると見積もる。この歩みで確からしくなったのは、「匿名化すれば安全」ではない。確からしくなったのは、匿名化には限界があり、少数の手がかりと外の情報で個人はしばしば戻る——という向きのほうだ。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、「匿名化した」ことで、安全になったと思い込むことである。名前を消した瞬間に安心し、そのデータを気軽に他社に渡したり、社外に出したりしてしまう。だが、渡した先で外の情報と照らされれば、個人に戻りうる。助けになるのは、匿名化を「絶対の安全」ではなく「危うさを減らす一枚」と捉え、加工に加えて、契約(渡す相手に再識別を禁じる)と管理(誰に・どこまで渡すかを絞る)を重ねることだ。匿名化は、鍵の一つにすぎない。鍵を一つかけたから開かない、ではなく、いくつかの備えを重ねて、はじめて危うさは小さくなる。守るのは、顧客や取引先の、生身の一人ひとりだ。その人たちが「まさか自分だと分かるとは」と驚かないよう、こちらが先に、匿名の限界を知っておく。
この単位は、「匿名化するな」と言うものではない。匿名化は、必要で有効な備えだ。言うのは、匿名化すれば安全、で止まるなということだ。少数の手がかりで個人は戻り、外の情報と照らせば匿名の壁は崩れる。だから、加工の一枚に頼りきらず、契約と管理を重ねる。そして、迷ったら自分で適法性を判定せず、専門家に相談する。再識別の手口を、誰かを暴くために使うのでもない。知っておくのは、あくまで守る側の分別としてである。
最初の一歩は10分。自分の商いで「これは匿名だから大丈夫」と思って共有した、あるいは共有しようとしているデータ——顧客の購買記録、来店の記録など——を一つ思い浮かべる。そのうえで、(1)そこに残っている手がかり(日付、金額、来店時刻、地域など)を書き出し、(2)その手がかりを外のどんな情報と照らせば、個人に戻りうるかを一つでも考えてみる。「名前を消したか」で終わらせない。「どの手がかりで、誰と照らせば戻るか」まで考えて、はじめて匿名化の限界が見える。戻る道が一つでも思いつけば、それは、まだ絶対に匿名ではないということだ。消すべきは名札だけではない。振る舞いの跡まで見て、はじめて守りは形になる。
- 桃の段、プライバシーの単位。匿名化すれば安全という俗説に向き合う。Narayanan・Shmatikov 2008(2008 IEEE Symposium on Security and Privacy:111-125)は、Netflixが公開した「匿名」の映画評価データを別の公開情報(映画データベースの評価)と照合するだけで個人を高い確率で再識別できることを実証した。名前を消しても、いつ・どの対象にどう反応したかという振る舞いの型がその人を指す指紋になる。匿名化はデータ単体で個人が分からない状態にすぎない
- 証拠の読み違え方は、匿名化すれば安全だと思い込み、外の情報と照らせば個人に戻りうるという照合の危うさを見落とすこと。中心命題は、匿名化は絶対でなく危うさを減らす一枚で、加工に契約と管理を重ねること。F11(情報管理一般)と持ち場切りで、542はデータ固有の匿名化・再識別。再識別の手口は守る側の分別として知り、誰かを暴くためでない。顧客・従業員の個人データを課題材料にしない
- de Montjoye ら2013(Scientific Reports 3:1376)は移動履歴のわずか4点で約95%が一意に特定できると示し、de Montjoye ら2015(Science 347(6221):536-539)は決済記録の4点で約90%が特定できると示した。名前も番号も無いただの「いつ・どこで」の記録が、これだけで個人を指す。人の行動はそれ自体がその人に固有の形をしており、消したはずの名前の代わりにその人を静かに名指しする。手がかりは思うよりずっと少なくてよい
- Rocher・Hendrickx・de Montjoye 2019(Nature Communications 10:3069)は、不完全なデータからの再識別を推定し、わずか15個ほどの属性があれば不完全なデータセットでも99.98%を正しく再識別できると見積もった。一部を抜き出しただけのデータでも匿名は守られない。Sweeney 2002(k-匿名性)は匿名化を数理的に扱う枠組みを作ったが限界も知られ、これで絶対に戻らないと言い切れる完全な方法はいまだに無い。加工の強さとデータの値打ちは綱引きになる
- 個人情報保護委員会は「匿名加工情報」を、特定の個人を識別することができず元の個人情報を復元できないように加工した情報と定め(ppc.go.jp/personalinfo/tokumeikakouInfo/・2026年8月到達確認)、扱う事業者の義務に識別行為の禁止(再識別の禁止)を含める。制度そのものが加工だけでは戻る危うさが残ることを前提に戻す行為を禁じて穴を塞ぐ。氏名を符号に置き換える仮名加工情報はより緩く、照合すれば戻りうる弱い加工。個別のデータが適法かは自分で判定せず専門家に相談する
- 妨げるのは、匿名化したことで安全になったと思い込むこと。名前を消した瞬間に安心し、気軽に他社に渡したり社外に出したりするが、渡した先で外の情報と照らされれば個人に戻りうる。助けになるのは、匿名化を絶対の安全でなく危うさを減らす一枚と捉え、加工に加えて契約(渡す相手に再識別を禁じる)と管理(誰にどこまで渡すかを絞る)を重ねること。再識別実証は大規模データセット中心で中小の名簿に断定転用しない
- 中心命題は、匿名化すれば安全で止まらないこと。少数の手がかりで個人は戻り、外の情報と照らせば匿名の壁は崩れる。加工の一枚に頼りきらず契約と管理を重ね、迷ったら自分で適法性を判定せず専門家に相談する。再識別の手口は誰かを暴くためでなく守る側の分別として知る。次は543で、そのデータを使う文化——研修でデータ好きになるか、を扱う
| よくある誤解 | 実際のところ |
|---|---|
| 名前や住所を消して「匿名」にすれば、そのデータは自由に使ってよいし、他社に渡してもよい | Narayanan・Shmatikov 2008は、Netflixが公開した「匿名」の映画評価データを別の公開情報と照合するだけで個人を高い確率で再識別できることを実証した。名前を消しても、いつ・どの対象にどう反応したかという振る舞いの型がその人を指す指紋になる。匿名化はデータ単体で個人が分からない状態にすぎず、外の情報と突き合わされた瞬間に匿名の壁はしばしば崩れる。安全かどうかはそのデータ単体では決まらない |
| 個人を特定するには多くの情報が要るから、少しの記録なら匿名のままで問題ない | de Montjoye ら2013は移動履歴のわずか4点で約95%が一意に特定できると示し、de Montjoye ら2015は決済記録の4点で約90%が特定できると示した。名前も番号も無い、ただの「いつ・どこで」の記録が、これだけで個人を指す。Rocher ら2019は不完全なデータでも15属性で99.98%を再識別できると見積もった。人の行動はそれ自体がその人に固有の形をしており、手がかりは思うよりずっと少なくてよい |
| 匿名化の技術は進んだのだから、正しく加工すれば絶対に元へは戻らない | Sweeney 2002はk-匿名性のモデルで匿名化を数理的に扱う枠組みを作ったが、それにも限界があることが知られてきた。加工を強くすればデータの値打ちは減り、値打ちを残せば戻る危うさが残る。この綱引きから匿名化は逃れられず、これで絶対に戻らないと言い切れる完全な方法はいまだに無い。だから個情法の匿名加工情報も再識別(識別行為)を禁じ、制度そのものが匿名化の限界を前提にしている |
皮肉なのは、「匿名化すれば安全」という言葉ほど、人を油断させるものはないことだ。名前を消した——その一言で、私たちは安心し、そのデータを気軽に外へ出してしまう。だが、消したのは名札だけで、その人の振る舞いの型はそのまま残っている。いつ・どこで・何を、という、たった数個の点が、名前の代わりにその人を名指しする。だから「匿名」のデータは、外の情報と照らされた瞬間に、しばしば個人へと戻っていく。制度でさえ、そのことを前提に、再識別という「戻す行為」を禁じて穴を塞ごうとしている。匿名化は、絶対の安全ではなく、危うさを減らす一枚にすぎない。だから、加工の一枚に頼りきらず、契約と管理を重ねる。そして、個別の適法性は自分で判じず、専門家に委ねる。守るのは、データではなく、その向こうにいる生身の一人ひとりだ。その人が「まさか自分だと分かるとは」と驚かずに済むように、こちらが先に、匿名の限界を知っておく——それが、この単位のいちばんの勘どころである。
Q1. 「匿名化すれば安全」という見方の落とし穴を、Narayanan・Shmatikov 2008 の再識別の実証に触れて説明せよ。一問一答
Q2. de Montjoye ら2013・2015 が示した「少数の手がかりでの特定」に最も近いものはどれか。選択
Q3. Rocher ら2019 は、わずか ____ 個ほどの属性があれば、____ なデータセットの中でも ____ %の人を正しく再識別できると見積もった。Sweeney 2002 の ____ 匿名性のモデルにも限界がある。穴埋め
Q4. 個人情報保護委員会の「匿名加工情報」の定義と義務が、「匿名化すれば安全」への反証としてどう働くかを説明せよ。個別の適法判定はしないという規律にも触れよ。一問一答
Q5. この単位が扱った研究を、年の早い順に並べよ。(ア)de Montjoye らが移動4点で約95%(イ)Sweeney が k-匿名性のモデル(ウ)Rocher らが不完全でも15属性で99.98%(エ)Narayanan・Shmatikov が匿名データの脱匿名化並べ替え
紙かメモアプリに今日の日付を書く。自分の商いで「これは匿名だから大丈夫」と思って共有した、あるいは共有しようとしているデータ——顧客の購買記録、来店の記録など——を一つ思い浮かべる。そのうえで二つを書く。(1)そこに残っている手がかり(日付、金額、来店時刻、地域、買った品など)を書き出す。(2)その手がかりを、外のどんな情報と照らせば個人に戻りうるかを、一つでも考えて書く。「名前を消したか」で終わらせず、「どの手がかりで、誰と照らせば戻るか」まで考えて、はじめて匿名化の限界が見える。戻る道が一つでも思いつけば、それはまだ絶対には匿名でないということだ。個別のデータが適法かは自分で判定せず、必要なら専門家に相談する。再識別を、誰かを暴くために使わない。点検するのは、自分が守るべきデータの匿名の限界だけである。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Narayanan A., Shmatikov V. (2008) ‘Robust De-anonymization of Large Sparse Datasets’, 2008 IEEE Symposium on Security and Privacy:111-125 — doi.org
- de Montjoye Y-A., Hidalgo C.A., Verleysen M., Blondel V.D. (2013) ‘Unique in the Crowd: The privacy bounds of human mobility’, Scientific Reports 3:1376 — doi.org
- de Montjoye Y-A., Radaelli L., Singh V.K., Pentland A. (2015) ‘Unique in the shopping mall: On the reidentifiability of credit card metadata’, Science 347(6221):536-539 — doi.org
- Rocher L., Hendrickx J.M., de Montjoye Y-A. (2019) ‘Estimating the success of re-identifications in incomplete datasets using generative models’, Nature Communications 10:3069 — doi.org
- Sweeney L. (2002) ‘k-anonymity: A model for protecting privacy’, International Journal of Uncertainty, Fuzziness and Knowledge-Based Systems 10(5):557-570 — doi.org
- 個人情報保護委員会「匿名加工情報」(2026年8月参照) — www.ppc.go.jp