3,000万語の差は、6家庭分の記録を4年に引き伸ばして作られた
読めないのは読み方が下手だからだ、ということになっている。ところが実際に文章が崩れる地点を測ると、たいてい単に語を知らない。そして「語彙の差はここで決まる」と言われてきた数字のほうは、測り直すと出てこなかった。
読めないのは、たいてい語を知らないから
技術書の一節が頭に入ってこないとき、原因を読解力に求めるのは自然に見える。だが、実際に測った実験は、もっと素っ気ない答えを出す。知らない語が一定の割合を超えると、文章は崩れる。
2000年に公表された実験は、同じ文章の語をすこしずつ入れ替えて、既知語の割合が 100%・95%・90%・80% の4種類の版を作り、ニュージーランドの大学生66人に読ませた。80%では、十分に理解できた人はいなかった。90%でもごくわずか。95%でも、十分に理解できた人は過半数に届かなかった。
著者たちは、助けなしで読むために必要な既知語の割合を、当時よく言われていた95%ではなく 98% と見積もった。98%とは、50語に1語しか知らない語が無い状態である。 数行に一度の穴でも、文章は静かに崩れる。
この割合を語の数に直すとどうなるか。2006年の分析は、大規模な英語の資料集を1,000語族ずつの階層に分けて調べ、98%の被覆を得るには、書き言葉でおよそ8,000〜9,000語族、話し言葉でおよそ6,000〜7,000語族が要ると見積もった。語族とは、原形と派生形をひとまとめに数える単位である。
その98%も、測り直されている
ここで一度立ち止まる値打ちがある。98%という敷居は、1つの国の大学生66人の実験から出た数字である。 それが四半世紀にわたり、教材の設計や指導の目安として世界中で引かれてきた。
2023年に、この実験を再現する研究が公表された。対象は学術的な文脈の外にいるスリランカの成人学習者104人。結果は、もとの研究の知見を完全には再現できなかったというものだった。
「98%は嘘だった」ではない。「66人の大学生で得た敷居が、別の学習者にそのまま当てはまるとは限らない」である。 目安の出どころが1本の実験であることは、引用されるたびに落ちる。
語彙は、教えられて増える分では足りない
では、8,000語族はどこから来るのか。
1984年に公表された推定は、米国の学校で使われる印刷物におよそ88,500語があると算出し、そのうえで、直接教える方式だけでは、子どもが実際に覚える語のうち意味のある割合を説明できず、学校の読み物で出会う語のうちわずかしかまかなえないと結論した。授業で教えられる語の数と、必要な語の数の桁が合わない。
差を埋めているのは、文脈からの取り込みである。ただしこれは効率のよい仕組みではない。1回の出会いで足されるのは、語のごく部分的な知識にすぎない。だから語彙は「知っている・知らない」の2択ではなく、同じ語について、どこまで分かっているかの度合いとして少しずつ育つ。
読めば読むほど語が増え、語が増えるほど読めるようになる。この向きが、次の数字の背景にある。
値切り:「3歳までに3,000万語の差」
教育の資料でもっともよく引かれる数字のひとつが、これである。出どころは、米国で行われた縦断観察と、その著者たち自身が2003年に一般向けにまとめた記事だ。
記事に書かれている設計は、こうである。最後まで残った標本は42家庭。 職業をもとに、13家庭が上位の社会経済層、10家庭が中位、13家庭が下位、そして6家庭が公的扶助を受けていた。各家庭を、月1回1時間ずつ、2年半以上にわたって観察した。
結果として報告された1時間あたりの語数は、公的扶助を受けている家庭で616語、働いている家庭で1,251語、専門職の家庭で2,153語。そして記事は、この1時間あたりの値を4年分に引き伸ばす。専門職の家庭でおよそ4,500万語、働いている家庭で2,600万語、公的扶助の家庭で1,300万語。 この差が「3,000万語」になった。
確かめられる部品を数えておく。月1回1時間の記録が、起きているあいだ全部の代理になっている。6家庭の平均が、低いほうの端を担っている。そして語数という単位が、語りかけの質を代表している。
ここで断っておく。この単位が扱っているのは、数字が旅をした経路であって、家庭の優劣ではない。 政策も提案しない。この棚は、成績の低さを努力不足として描かない。
2019年、この主張を別の標本で試した研究が公表された。米国の5つの地域で、18か月から48か月の子ども42人の家庭の言語環境を、民族誌的な観察と縦断的な記録で調べたものである。結論は三つ。もとの主張は支持されなかった。 各層の内側の変動が大きかった。そして、複数の養育者の発話や、その場にいる大人どうしの会話を数から除く定義は、収入の低い家庭の子どもが浴びている語数を不釣り合いに小さく見積もる、と述べた。
ここで、この棚が守っている手続きがある。批判論文を主役にするときは、提唱者側の応答が査読誌にあるかを必ず探す。 この件では、応答は同じ雑誌の同じ年に載っていた。
応答の言い分はこうである。まず認めるところ——「収入の低い家庭の親はみな子どもと十分に話していない、という欠損の見方を、私たちは支持しない。」 そのうえで反論を二つ。ひとつ、批判した側の設計には、もとの研究にあった高学歴の群に相当するものが置かれていない。 ふたつ、その場で聞こえてくる会話と、子どもに向けられた会話は、同じ働きをしない。 応答が守ろうとしているのは、3,000万語という数字ではなく、子どもに向けられた発話の量が効くという主張のほうである。
決着はしていない。 決着していないことのほうが、この単位の要点である。引かれ続けているのは、決着していない側の、いちばん大きい数字だけだ。
時間・変化:語彙が育つ時間と、数字が旅する時間
語彙の側の時間は長い。1997年に公表された米国の縦断研究は、1年生のときに測った読みの力が、10年後の11年生の読解・語彙・一般知識をいずれも予測したと報告している。認知能力の指標を統計的に取り除いても、この関係は残った。さらに、活字に触れる量は、11年生の読解力を取り除いてもなお成果と結びつき、読解力の伸びを予測した。
これは予測であって、宣告ではない。 児童を対象にした研究であり、大人でも同じことが起きるかは別に確かめる必要がある。
もうひとつの時間が、数字の側の時間である。1995年に本になり、2003年に一般向けの記事で「3,000万語」という見出しの形になり、そこから政策の言葉になり、教材の前書きになった。設計の但し書き——42家庭、月1回1時間、うち6家庭——は、旅の途中で落ちた。
この棚がくり返し書くことをここでも1文だけ。学んでいる本人には、覚えた量も、伸びた幅も見えない。 語彙はとくにそうで、知らない語は、知らないという理由で目に留まらない。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、分からなさの原因を読み方に求めることである。読み返す速度を落とす、線を引く、要約を作る——どれも、穴が50語に1語より多い文章では効きにくい。効きにくいのに、効いていない理由が見えない。
ここで、この棚として毎回断ることがある。ここまでの数字は、ほとんどが英語圏の学習者と、米国の児童を対象に採られている。98%や8,000語族という値は英語についてのもので、日本語にそのまま当てはめられない。 働きながら学んでいる大人を対象にした研究はごく少なく、実験室の課題と実際の読書は別物である。そして続けられた人のデータだけが残る。とりわけ、もともと学ぶ余裕のある人ほど、その学習法を試せる、という逆向きを、この種の研究は排除できない。 読む時間があるかどうかは、人によって大きく違う。
助けるのは、未知語の割合を数えることである。多いか少ないかではなく、100語あたり何語か。2語を超えていれば、その文章は、いまの自分にとって助けなしで読む材料ではない。読み方を変えるのではなく、材料を変えるか、語のほうを先に取りに行くという判断ができる。もうひとつ、理解の証拠は原文の語を使わずに一文で言い直せるかである。原文の語を並べ替えたものは、理解ではなく、なぞりだ。
最初の一歩は5分。今日読んだ文章から知らなかった語を拾い、100語あたり何語だったかを概算して記録する。
次の単位は 056「論理的思考」——語が足りていれば筋道が通る、というわけではない。言葉の引き出しの隣に、筋道の引き出しがある。そちらには、教えれば伸びるのかという別種の問いが入っている。
- Hu & Nation 2000(Reading in a Foreign Language 13(1))は、既知語の割合が100%・95%・90%・80%の4種類の版を作りニュージーランドの大学生66人に読ませた。80%では十分に理解できた人はおらず、90%でもごくわずか、95%でも過半数に届かなかった。著者たちは助けなしで読むのに必要な割合を95%ではなく98%と見積もった
- 98%とは、50語に1語しか知らない語が無い状態である。Nation 2006(The Canadian Modern Language Review 63(1))は、98%の被覆を得るには書き言葉でおよそ8,000〜9,000語族、話し言葉でおよそ6,000〜7,000語族が必要と見積もった
- Kremmel, Indrarathne, Kormos & Suzuki 2023(Language Learning 73(4))は、学術的な文脈の外にいるスリランカの成人学習者104人でこの実験を再現し、もとの研究の知見を完全には再現できなかったと報告した。98%という敷居は、1つの国の大学生66人の実験から出た数字である
- Nagy & Anderson 1984(Reading Research Quarterly 19(3))は、米国の学校で使われる印刷物におよそ88,500語があると算出し、直接教える方式だけでは実際に覚える語の意味のある割合を説明できず、読み物で出会う語のわずかしかまかなえないと結論した。差を埋めるのは文脈からの取り込みだが、1回の出会いで足されるのは部分的な知識にすぎない
- 「3歳までに3,000万語の差」の出どころとなった研究の設計は、著者自身の2003年の記事(American Educator 27(1))に書かれている。最後まで残った標本は42家庭で、内訳は上位の社会経済層13・中位10・下位13・公的扶助を受けている家庭6。月1回1時間ずつ2年半以上観察し、1時間あたり616語・1,251語・2,153語という値を4年分に引き伸ばして、およそ1,300万語・2,600万語・4,500万語という数字を出した
- Sperry, Sperry & Miller 2019(Child Development 90(4))は、米国の5つの地域で18か月から48か月の子ども42人の家庭の言語環境を調べ、もとの主張は支持されず、各層の内側の変動が大きく、複数の養育者の発話やその場の会話を除く定義は収入の低い家庭の子どもが浴びる語数を不釣り合いに小さく見積もると報告した
- Golinkoff, Hoff, Rowe, Tamis-LeMonda & Hirsh-Pasek 2019(Child Development 90(3))は同じ雑誌の同じ年に応答を載せた。収入の低い家庭の親はみな十分に話していないという欠損の見方は支持しないと明言したうえで、批判側の設計にはもとの研究にあった高学歴の群に相当するものが無いこと、その場で聞こえる会話と子どもに向けられた会話は同じ働きをしないことを反論として挙げた。決着はしていない
| よくある誤解 | 実際のところ |
|---|---|
| 3歳までの語りかけに3,000万語の差がある、というのは確立した事実である | もとの研究の標本は42家庭で、低いほうの端を担っていたのは公的扶助を受けている6家庭だった。観察は月1回1時間で、その値を4年分に引き伸ばして得た数字である。2019年に米国の5つの地域で42人の子どもを観察し直した研究は、この規模の差を支持せず、各層の内側の変動の大きさと、複数の養育者やその場の会話を除く定義の問題を指摘した。同じ雑誌の同じ年に載った提唱者側の応答は、批判側の設計に高学歴の群が欠けていること、その場で聞こえる会話と子どもに向けられた会話は同じ働きをしないことを反論として挙げている。決着はしていない |
| 文章が読めないのは、読み方の技術が足りないからである | 既知語の割合を変えた実験では、80%では十分に理解できた人はおらず、95%でも過半数に届かなかった。助けなしで読むのに必要な割合は98%——50語に1語しか知らない語が無い状態——と見積もられている。読み返し方や線の引き方を変えても、穴の数がこの水準を超えていれば効きにくい。ただしこの98%という敷居自体、ニュージーランドの大学生66人の実験から出た値で、2023年にスリランカの成人104人で再現を試みた研究は、完全には再現できなかったと報告している |
| 語彙は、知っているか知らないかの2択である | 文脈からの取り込みでは、1回の出会いで足されるのは語のごく部分的な知識にすぎない。だから語彙は、同じ語についてどこまで分かっているかの度合いとして少しずつ育つ。また、米国の学校で使われる印刷物にはおよそ88,500語があり、直接教える方式だけでは出会う語のわずかしかまかなえないと1984年の推定は結論している。授業で教えられる数と必要な数は、桁が合っていない |
3,000万語という数字には、優れた性質がある。大きい。覚えやすい。そして、誰も自分では数えられない。皮肉なのは、この数字が世に広まる過程で最初に落ちたのが、それを支えていた6家庭分の記録と、月1回1時間という観察の間隔だったことである。数字は身軽になるほど速く走る。走っている数字を止めるには、走っていない但し書きのほうを、いちいち拾いに行くしかない。
Q1. 「3歳までに3,000万語の差」という数字は、どのような観察から作られたか。標本の規模と内訳、観察の頻度、そして数字の作り方に触れて答えよ。一問一答
Q2. 2019年に同じ雑誌の同じ年に載った、批判した側と応答した側は、それぞれ何を主張したか。両方に触れて答えよ。一問一答
Q3. 既知語の割合と理解の関係について、2000年に公表された実験の内容に合うものはどれか。選択
Q4. 98%という敷居そのものについて、本文の内容に合うものはどれか。選択
Q5. 語彙の量と供給について、本文の内容に合うものはどれか。選択
今日読んだ文章を1本選ぶ。技術書でも、契約書でも、外国語の記事でも、子どもの教科書でもよい。適当な段落を1つ選び、その段落のおよその語数を数える(日本語なら、読点で切れる単位でおおまかに数えてよい)。次に、その段落の中で意味が取れなかった語に印を付け、印の数を数える。最後に、100語あたり何語だったかを概算して記録する。2語を超えていたら、読み方ではなく材料か語のほうに手を入れる合図である。学校に通っていない場合は、今日届いた業務文書や説明書で置き換えてよい。分からなかったことを問題として扱う必要はない。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Hu M.H.-C., Nation P. (2000) 'Unknown vocabulary density and reading comprehension', Reading in a Foreign Language 13(1):403-430 — eric.ed.gov
- Nation I.S.P. (2006) 'How Large a Vocabulary Is Needed for Reading and Listening?', The Canadian Modern Language Review 63(1):59-82 — eric.ed.gov
- Kremmel B., Indrarathne B., Kormos J., Suzuki S. (2023) 'Unknown Vocabulary Density and Reading Comprehension: Replicating Hu and Nation (2000)', Language Learning 73(4):1127-1163 — onlinelibrary.wiley.com
- Nagy W.E., Anderson R.C. (1984) 'How Many Words Are There in Printed School English?', Reading Research Quarterly 19(3):304-330 — eric.ed.gov
- Hart B., Risley T.R. (2003) 'The Early Catastrophe: The 30 Million Word Gap by Age 3', American Educator 27(1):4-9(著者自身による研究の要約。発行元の公開資料、2026年閲覧。もとの研究は1995年) — www.aft.org
- Sperry D.E., Sperry L.L., Miller P.J. (2019) 'Reexamining the Verbal Environments of Children From Different Socioeconomic Backgrounds', Child Development 90(4):1303-1318 — eric.ed.gov
- Golinkoff R.M., Hoff E., Rowe M.L., Tamis-LeMonda C.S., Hirsh-Pasek K. (2019) 'Language Matters: Denying the Existence of the 30-Million-Word Gap Has Serious Consequences', Child Development 90(3):985-992 — files.eric.ed.gov
- Cunningham A.E., Stanovich K.E. (1997) 'Early Reading Acquisition and Its Relation to Reading Experience and Ability 10 Years Later', Developmental Psychology 33(6):934-945 — eric.ed.gov