同じ設計で測り直したら、集団の賢さの8割は個人の知能に吸い込まれた
チームは個の総和を超える、という言い方は、比較の文の形をしている。それなら、超えられた側の総和がどこかに書かれていなければならない。書かれていないことのほうが多い。
前の単位では、組織が抱えている知識が、放っておくと目減りしていくことを見た。ここではその上に、複数の人が同時に働いているときの成績を置く。ここから、この棚の第4段——学習する組織への進化——に入る。
持ち場を狭めておく。安心して発言できるかどうか、異論がどう扱われるかは、組織の基盤の棚が扱った。この単位が扱うのは、集団の成績は誰の成績か——その数字を何と比べたときに「超えた」と言えるのか、だけである。会議の回し方は書かない。
「個の総和を超える」の、総和のほう
集団についていちばんよく使われる言い方は、個の総和を超える、である。これは比較の文だ。だから本来なら、超えられた側——総和——が、どこかに書かれていなければならない。
書かれていないことが多い。残るのは、集団の成績が良かった、という報告だけである。だが同じ人数を集めれば、そのなかの誰か一人くらいは正解する。5人いれば、5人ぶんの試行がある。比べる相手を決めないかぎり、集団の成績は良くも悪くも読める。
研究の側では、比較の相手が2本に分けて置かれている。同じ人数の個人をばらばらに働かせ、その成績をあとから機械的にまとめたものを名目集団という。実際に話し合った集団が、名目集団の平均的な一人を上回れば弱い相乗、名目集団のなかで最も良かった一人まで上回れば強い相乗、と呼び分ける。この2本を引かないまま「超えた」と書くことはできない。
原典——cという因子
この分野でいちばん引かれているのは、2010年に Science へ出た米国の研究である。原典に当たる。
集められたのは699人。2〜5人の集団に分けられた。研究1は3人集団が40組、研究2は2人から5人までの152組である。集団はいくつもの違う課題をこなす——視覚のパズル、言葉の連想、集団での交渉、共同での買い物の計画。その成績を因子分析にかけると、研究1では第1因子が分散の43%以上、研究2では44%を占めた。これがc、集合知の因子と名付けられたものである。
驚かれたのはその次だった。2つの研究を合わせると、cと構成員の平均知能の相関は 0.15(P = 0.04)、最も点の高かった一人の知能との相関は 0.19(P = 0.008)にとどまった。相関係数としては小さい。かわりにcとよく結びついていたのは、相手の様子から気持ちを読み取る課題の平均点(r = 0.26、P = 0.002)、発言回数のばらつき(r = −0.41、P = 0.01。ばらつきが小さいほどcが高い)、そして集団に含まれる女性の比率(r = 0.23、P = 0.007)だった。別に用意した基準課題の成績を予測させると、cの係数は 0.51(P = 0.001)、平均知能は 0.08、最高知能は 0.01 で、後の2つは有意にならなかった。
読み方に注意がいる。この論文が言っているのは、個人の知能が集団の成績と無関係だということではない。小さいということである。そして小さいという結論は、追試でいちばん動きやすい種類の結論だ。
同じ設計で測り直す
2017年、Intelligence に3件の追試が出た。合計312人。設計は元の研究に合わせてある。
結果は逆を向いた。集団の成績の差のおよそ80%が、構成員個人の知能で説明された。さらに、研究2と研究3のデータを合わせて構造モデルを当てはめると、集団の潜在的な成績因子の100%が個人の知能によって決まるという当てはまりのよい解が得られた。女性の比率が高いほど集団の成績が上がる、発言が交代するほど上がる、という2つの仮説は支持されなかった。相手の様子を読み取る課題の点は個人の知能と関連したが、潜在因子そのものには効いていなかった。
同じ年、別の角度からの再検討も出ている。2017年に Journal of Applied Psychology へ出た論文は、すでに公表されていた6つの標本のデータを取り直して分析し、一般因子が集団の課題成績に対して説明している分散はごくわずかだと報告した。加えて、その小さな共変動さえ2つの統計的な人工物——ほとんど努力していないとみられる回答が混ざっていることと、データが集団という入れ子の構造を持っていること——によって膨らんでいる可能性があると指摘している。
ここで「集合知は存在しない」と書くのは、行きすぎである。書けるのは、同じ設計で測り直すと、残るものが変わったということだけだ。
提唱した側が、22件を積み上げると
提唱した側も黙ってはいない。2021年に PNAS へ出た論文は、22件の研究・5,279人・1,356集団のデータを集めて解析し、集団の課題成績をまたぐ因子はやはり頑健に現れる、と報告した。女性の比率がその因子を予測し、その関係は構成員の社会的な察しの平均によって媒介されていた。そして、集団の協働の過程のほうが、構成員個人の技能よりも、この因子をよく予測した。
2014年に PLoS ONE へ出た研究も、同じ方向の結果を出している。272人・68集団(対面が34組、オンラインが34組、いずれも4人)で、第1因子は対面で49%、オンラインで41%の分散を占め、相手の様子を読み取る課題の平均点とその因子の相関は対面 0.53(p = 0.002)、オンライン 0.55(p < 0.001)だった。顔が見えない条件でも同じ形が出る、という点が新しい。
数字は増えている。だが増えているのは、因子が見つかるかどうかについての証拠であって、その因子が個人の合計を超えているかについての証拠ではない。この2つは別の問いである。
総和を数えた研究——複雑な課題でだけ、超える
総和のほうを正面から数えた研究がある。2021年に PNAS へ出た別の論文は、まず1,200人に一人で課題をやらせ、次の段階で828人を割り当てた——591人が3人1組になり、有効な組は196。234人は最後まで一人である。課題の複雑さは段階的に変えてある。
結果は、複雑さで割れた。複雑な課題では、集団は最も速かった個人と同じ速さで解き、最も効率のよかった個人より効率が高かった——強い相乗が立った。単純な課題では、この優位が消える。手間のぶんだけ損が出て、相乗の得を打ち消してしまう。
つまり「チームでやると賢くなる」も「チームでやると鈍る」も、どちらも正しい。課題の複雑さを書かないかぎり、どちらの文も検証できない。
時間・変化:数字が丸くなっていく順番
2010年の論文、その後の報道、そして日常の言い回し。3つを並べると、変化の向きが一定であることが分かる。
最初に落ちるのは相関係数の小ささである。0.15と0.19という数字は、引用の途中で「関係がなかった」に変わる。次に落ちるのが条件だ——2〜5人、実験室、数時間、初対面。最後に残るのは、集団には集団の知能がある、という短い一文になる。逆向き——限定が増える方向——には、まず動かない。
これは誰かが嘘をついている、という話ではない。運ばれる過程には選別がかかっていて、短くて強い形のほうが選ばれる、というだけである。だから集団についての一文を疑うときは、悪意を探すより、比較の相手が書いてあるかどうかを探すほうが早い。
妨げるもの、助けるもの、最初の一歩
妨げるものの筆頭は、うまくいった集団の話だけが手元に残ることである。解散した集団、途中で止まった集団の記録は、たいてい誰も取っていない。第二の妨げは、人数を増やすことを、比較の相手を増やすことと取り違えることだ。人数が増えれば、名目集団の「最も良かった一人」の水準も上がる。基準線は、こちらが動かなくても勝手に上がっていく。
標本の偏りを断っておく。ここまでの数字は、ほぼすべて欧米の大学や実験室に集まった参加者から採られている。集団は2人から5人、初対面、課題は数時間で終わるものだ。30人規模の組織を対象にした研究はほとんど無い。日本の職場での追試も見当たらない。そして、こうした研究で見えた関連は、学ぼうとする人ほど学ぶ機会を得やすい、という逆向きを排除できない——実験に参加する人も、集団の課題に前のめりになる人も、はじめから偏っている。
助けるのは、集団の成績を書き留めるときに、同じ紙に一人ぶんの成績も書いておくことである。あとで比べられるのは、そのとき両方を書いた場合だけだ。
最初の一歩は3分。直近の話し合いで自分の考えが変わった場面を1つ思い出し、変わったきっかけが新しい情報だったのか、同じことを言う人の数だったのかを、どちらかに印を付ける。どちらでもよい。区別が付かなければ、それは印を付けなかったのではなく、まだ分けていないという意味である。
次の単位は 206「ダブルループ学習」——ここでは集団の成績を何と比べるかを見た。その上に、そもそも比べている目標のほうを疑えたかどうか、という問いを置く。ただしその問いには、後からしか答えられないという難点がある。
- Woolley, Chabris, Pentland, Hashmi & Malone 2010(Science 330(6004):686-688)は米国の699人を2〜5人の集団に分け(研究1は3人集団40組、研究2は152組)、集団の課題成績を因子分析して第1因子が研究1で分散の43%以上、研究2で44%を占めることを示し、これをcと名付けた
- 同じ論文で、2つの研究を合わせたcと構成員の平均知能の相関は 0.15(P = 0.04)、最高得点者の知能との相関は 0.19(P = 0.008)。かわりにcは、相手の様子を読み取る課題の平均点(r = 0.26)、発言回数のばらつき(r = −0.41)、女性比率(r = 0.23)と結びついていた
- Bates & Gupta 2017(Intelligence 60:46-56)は3件・312人で同じ設計を測り直し、集団の成績の差のおよそ80%が個人の知能で説明されると報告した。構造モデルでは潜在的な集団成績因子の100%が個人の知能で決まり、女性比率と発言の交代という2つの仮説は支持されなかった
- Credé & Howardson 2017(Journal of Applied Psychology 102(10):1483-1492)は既に公表されていた6標本を再解析し、一般因子が説明する分散はごくわずかで、しかもその小さな共変動が、努力の低い回答の混入とデータの入れ子構造という2つの統計的な人工物で膨らんでいる可能性があると指摘した
- Riedl, Kim, Gupta, Malone & Woolley 2021(PNAS 118(21):e2005737118)は22件・5,279人・1,356集団を統合し、課題をまたぐ因子は頑健に現れること、女性比率がそれを予測し社会的な察しが媒介すること、そして協働の過程のほうが個人の技能よりよく予測することを報告した
- Almaatouq, Alsobay, Yin & Watts 2021(PNAS 118(36):e2101062118)は第1段階で1,200人、第2段階で828人(591人が3人1組で有効な組は196、234人は単独)を用い、複雑な課題では集団が最も速い個人と同等かつ最も効率のよい個人を上回る一方、単純な課題ではその優位が消えることを示した
- 比較の相手は2本ある。同じ人数の個人をばらばらに働かせて機械的にまとめた名目集団の、平均的な一人を上回れば弱い相乗、最も良かった一人まで上回れば強い相乗。この2本を引かないかぎり「個の総和を超えた」は検証できない
| よくある誤解 | 実際のところ |
|---|---|
| 集団には個人の知能とは別の「集合知」があることが、研究で確かめられている | 2010年に Science へ出た米国の699人の研究では、集団の課題成績に共通の因子が見つかり、それと構成員の平均知能の相関は 0.15、最高得点者の知能との相関は 0.19 にとどまった。しかし2017年に Intelligence へ出た3件・312人の追試では、集団の成績の差のおよそ80%が個人の知能で説明され、構造モデルでは潜在因子の100%が個人の知能で決まった。同じ年、既発表6標本の再解析(Journal of Applied Psychology)は一般因子の説明力がごくわずかだと報告している。集合知が存在しないと断定はできない。言えるのは、同じ設計で測り直すと残るものが変わった、ということである |
| チームでやったほうが、一人でやるより良い結果が出る | 何と比べるかで答えが変わる。2021年に PNAS へ出た米国の実験は、第1段階で1,200人、第2段階で828人(591人が3人1組で有効な組は196、234人は単独)を用い、課題の複雑さを変えて比べた。複雑な課題では集団が最も速い個人と同等の速さで、最も効率のよい個人を上回った。だが単純な課題ではその優位が消える。手間のぶんの損が、相乗の得を打ち消すからである。課題の複雑さを書かないかぎり、チームが良いという文もチームが鈍いという文も検証できない |
| 女性が多いチームほど賢い、というのは繰り返し確かめられた発見だ | 2010年の原典では、女性比率とcの相関は 0.23(P = 0.007)で、主に相手の様子を読み取る課題の平均点を通じて効くと解釈された。2021年に PNAS へ出た22件・5,279人・1,356集団の統合でも、女性比率が因子を予測し社会的な察しが媒介するという同じ形が報告されている。いっぽう2017年の3件・312人の追試では、この仮説は支持されなかった。同じ設計で測り直しても結果が割れている段階の主張であり、人の属性でチームの賢さを見積もる根拠にはならない |
集合知には、売り物として理想的な性質がある。集団の成績は一つしか記録されないので、それを個人の合計と比べようと思う人がいなければ、比較そのものが起きない。しかも比べる相手は、こちらが何もしなくても人数とともに上がっていく。皮肉なのは、この分野でいちばん丁寧に測られていたのが、集団の賢さではなく、比較の相手の置き方のほうだったことである。0.15という相関は、集団についてではなく、私たちが総和を数えずに「超えた」と言う癖についての数字だった。
Q1. 2010年に Science へ出た米国の研究(699人)の標本と結果として、本文の内容に合うものはどれか。選択
Q2. 2017年に Intelligence へ出た追試は、2010年の研究と同じ設計で何を測り直し、何が変わったか。標本の規模と主要な数値に触れて答えよ。一問一答
Q3. 2017年に Journal of Applied Psychology へ出た再解析が指摘した、2つの統計的な人工物とは何か。選択
Q4. 2021年に PNAS へ出た、課題の複雑さを変えた実験(第1段階1,200人、第2段階828人)の結果として正しいものはどれか。選択
Q5. 集団の成績を読むときに置かれる比較の相手を、ゆるい順(越えやすい順)に並べよ。(名目集団で最も良かった一人/比較の相手を置かない/名目集団の平均的な一人)並べ替え
紙かメモアプリを開く。直近の話し合い——仕事の打ち合わせでも、家族との相談でも、オンラインのやり取りでもよい——で、自分の考えが途中で変わった場面を1つだけ思い出して、1行で書く。その下に2つの選択肢を書き、どちらか一方にだけ印を付ける。ひとつめ、変わったきっかけは自分が知らなかった情報だった。ふたつめ、変わったきっかけは同じことを言う人の数だった。組織に所属していない場合は、家族や友人とのやり取り、あるいは掲示板や交流サイトで意見を変えた場面に置き換えてよい。どちらとも言えないときは、その旨を1行書いて終わりにする。相手に確かめない。誰にも見せなくてよい。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- Woolley A.W., Chabris C.F., Pentland A., Hashmi N., Malone T.W. (2010) 'Evidence for a Collective Intelligence Factor in the Performance of Human Groups', Science 330(6004):686-688 — www.science.org
- Bates T.C., Gupta S. (2017) 'Smart groups of smart people: Evidence for IQ as the origin of collective intelligence in the performance of human groups', Intelligence 60:46-56 — www.sciencedirect.com
- Credé M., Howardson G. (2017) 'The structure of group task performance—A second look at “collective intelligence”: Comment on Woolley et al. (2010)', Journal of Applied Psychology 102(10):1483-1492 — pubmed.ncbi.nlm.nih.gov
- Riedl C., Kim Y.J., Gupta P., Malone T.W., Woolley A.W. (2021) 'Quantifying collective intelligence in human groups', Proceedings of the National Academy of Sciences 118(21):e2005737118 — www.pnas.org
- Almaatouq A., Alsobay M., Yin M., Watts D.J. (2021) 'Task complexity moderates group synergy', Proceedings of the National Academy of Sciences 118(36):e2101062118 — www.pnas.org
- Engel D., Woolley A.W., Jing L.X., Chabris C.F., Malone T.W. (2014) 'Reading the Mind in the Eyes or Reading between the Lines? Theory of Mind Predicts Collective Intelligence Equally Well Online and Face-To-Face', PLoS ONE 9(12):e115212 — journals.plos.org