「AIに任せられる/任せられない」——どちらの断定も俗説。効くが凸凹、頼りすぎ、振る舞いも変わる
生成AIをめぐる声は両極端だ。もう何でも任せられる、か、まだ任せられない、か。だがその両方が俗説である。確からしいのは込み入った姿だ——生成AIはあるタスクで大きく助け、別のタスクで静かに品質を下げる。人はそれに頼りすぎ、振る舞いは時とともに変わる。だから問いは任せるか否かでなく、どのタスクをどう検算しながら任せるか。この単位はその分けかたと確かめかたを渡す。特定のAI製品の優劣は論じない。
前の単位から、この単位へ
前の単位では、決まった予測モデルと人の判断の使い分けを扱った。ここでは一歩進んで、文章も要約も下書きもこなす生成AI——たくさんの文章から言葉のつながりを学び、指示に応じて文章や答えを作る仕組み——に、どこまで、どう任せるかを扱う。これはSTEP3(使う力)の最後の単位で、道具の話の締めくくりにあたる。
この段の読者も、これまでと同じ——自分の商いの数字や仕事を、自分の手で回す人だ。専任のAI担当がいる前提は置かない。生成AIをめぐる声は、たいてい両極端だ。「もう何でも任せられる」か、「まだ任せられない」か。同じニュースを見ても、片方は歓喜し、片方は警戒する。だがこの単位が立てる見方はこうだ——その両方が、俗説である。 「任せられる」も「任せられない」も、どちらの断定も、事実を単純にしすぎている。確からしいのは、もっと込み入った姿だ。生成AIは、あるタスクでは大きく助けになり、別のタスクでは静かに品質を下げる。人はそれに頼りすぎ、そのうえ振る舞いは時とともに変わる。だから問いは「任せるか、任せないか」ではなく、「どのタスクを、どう検算しながら任せるか」になる。二択で身構えるほど、この肝心の問いが見えなくなる。この単位は、その分けかたと確かめかたを渡す。特定のAI製品の優劣は論じないし、使うべきか否かを説教もしない。
生成AIは、たしかに生産性を上げる
まず、効く側の事実から。Noy と Zhang が2023年に、専門的な文章を書く仕事を任された人たちを、生成AIを使える群と使えない群に分けて比べる実験を行った。結果、生成AIを使えた側は、作業にかかる時間が減り、仕上がりの質も上がった。とりわけ、もともと不得手だった人ほど底上げされ、書き手のあいだの差が縮まった。これは、しっかりした実験(ランダム化比較試験)で確かめられた、確度の高い知見だ。だから「AIは役に立たない」という側の断定は、まず退けてよい。下書き、要約、言い換え、たたき台づくり——こうした「ゼロから一を作る」手間の重い作業で、生成AIは実際に時間を節約する。白紙を前にした最初の一歩が、いちばん重い。そこを肩代わりしてもらえるのは、確かに大きくありがたい。ここは、素直に活かせるところだ。
だが、性能は凸凹している——ジャギッド・フロンティア
とはいえ、「役に立つ」から「何でも任せられる」へは、飛べない。Dell'Acqua たちが2023年に、多くの専門職を巻き込んだ大規模な実地の実験で、重要なことを示した(これは査読を経た論文ではなく、SSRNという場で公開されたワーキングペーパー——作業中の研究報告——である点は断っておく)。彼らがジャギッド・フロンティア(ぎざぎざの境界)と呼んだのは、生成AIの得手不得手が、なめらかな線ではなく、ぎざぎざに入り組んでいる、という姿だ。境界の内側にあるタスクでは、AIは大きく質と速さを上げる。ところが、境界のすぐ外にある、一見似たタスクでは、AIを使うとかえって成績が下がった。
厄介なのは、この境界が、素人目には見えないことだ。難しそうな仕事をあっさりこなす一方で、簡単そうな仕事で不自然に間違える。人間なら、難しい問題ができる人は簡単な問題もできる、と推測できる。ところが生成AIでは、その推測が崩れる。だから「これができたのだから、あれもできるはず」という素直な当てが、通用しない。しかも、外すときに堂々と、もっともらしく外すから、うっかり信じてしまう。任せてよいタスクと、任せると危ないタスクの線は、実際に試して、確かめるしかない。自分の仕事のどれが境界の内で、どれが外か——それは、一般論ではなく、自分で当ててみて初めて分かる。ここが、この単位のいちばんの勘所になる。
人は、AIに頼りすぎる——オーバーリライアンス
もう一つ、人の側の癖がある。AIがもっともらしい答えを返すと、人はそれを十分に確かめないまま受け入れてしまう。これをオーバーリライアンス(過度の依存)という。Buçinca たちが2021年に、AIの支援を受けて判断する場面で、人がAIの出力を鵜呑みにしがちなことを実験で示し、あえて一手間かけて考えさせる仕掛け(認知的強制)を入れると、鵜呑みが減ることを確かめた。Vasconcelos たちも2023年に、AIがなぜその答えを出したかの説明を添えると、過度の依存が減ることを示している。
ただし、どちらの研究も、緩和は「できる」が「自動では起きない」ことを同時に語る。説明を付ければ勝手に安全になるのではなく、人が確かめる一手間を、仕組みとして組み込んで初めて効く。便利さは、そのまま、確かめない言い訳になりやすい。 きれいな文章がすぐ返ってくると、それが正しいかどうかを問う気持ちが、するりと薄れる。流暢さは、正しさの証拠ではないのに、正しさのように感じられてしまう。任せるとは、確かめをやめることではない。むしろ、任せる範囲を決めたら、その出力をどこで検算するかを、セットで決めることだ。検算の一手間を省いた瞬間、それは「任せた」ではなく「投げた」になる。
AIの振る舞いは、時とともに変わる——ドリフト
さらに、前の単位で見た劣化の話が、生成AIにも別の形で現れる。Chen と Zaharia と Zou が2024年に、同じ生成AIサービスの応答が、時期によって変わっていくことを記録した。同じような使い方をしても、数か月前とは違う挙動を返すことがある。裏側の仕組みは、利用者に断りなく更新されうるからだ。
これが意味するのは、一度うまくいった任せ方が、ずっと同じようにうまくいく保証はない、ということだ。「前はこの頼み方でうまくいったから」と安心して検算をやめた頃に、静かに挙動が変わっている、ということが起こりうる。前の単位で見た予測モデルのドリフトは、こちらの環境が変わることで起きた。生成AIのそれは、道具そのものが向こうの都合で変わることで起きる。原因は逆でも、「昔の当たりは、いまの当たりを保証しない」という含みは同じだ。だから、任せ方は一度決めて固定するものではなく、時々、いまも期待どおりかを見直す必要がある。ここでも、特定サービスの優劣を言っているのではない。更新されうる道具は、みなこの性質を持つ、という一般の注意である。
公式の指針——AI事業者ガイドライン(2024)
生成AIを使う側の拠り所として、日本には公式の指針がある。経済産業省と総務省が2024年に、既存の複数の指針を統合・更新して、AI事業者ガイドラインを取りまとめた。AIを開発・提供・利用する事業者が、安全や公平や透明性のために何に気をつけるべきかを示す、現行の公式の枠組みである。ここでは、その細目の逐語や数値には立ち入らず、こうした公式の指針が存在し、更新され続けているという事実だけを置く。個別の適法判断は、この単位の仕事ではない。道具を使う前に、自分の分野に関わる公式の指針が出ていないかを一度あたる——それも、任せかたの設計の一部だ。とりわけ、顧客や取引先の情報をAIに渡す前には、こうした指針や自分の分野の決まりに、いま一度目を通しておきたい。便利だからと勢いで渡してしまう前に、立ち止まる一拍が要る。
時間・変化:2021年から今へ
順に置く。2021年、Buçinca たちがAIへの過度の依存と、その緩和の手立てを示す。2023年、Noy と Zhang が生成AIの生産性への効果を実験で確かめ、同年、Dell'Acqua たちがジャギッド・フロンティア(凸凹の境界)を報告し、Vasconcelos たちが説明で過信が減ると示す。2024年、経済産業省と総務省がAI事業者ガイドラインを取りまとめ、Chen たちが生成AIの振る舞いが時期で変わることを記録する。
この間に確からしくなったのは、「任せられる」でも「任せられない」でもない。確からしくなったのは、生成AIは効くが凸凹で、人は頼りすぎ、振る舞いは変わる——だから、タスクを選び、検算をセットにし、時々見直す、という使い方の作法のほうである。両極端の断定は、どちらも、この込み入った事実を平らにならしてしまう。
妨げるもの、助けるもの、最初の一歩
妨げるものは、両側にある。一方は「まだ危ないから使わない」と丸ごと遠ざけること。もう一方は「もう何でもできる」と検算せず丸投げすること。どちらも、凸凹の境界を見ていない点で同じだ。便利さに慣れるほど、確かめる手間が惜しくなる——この引力を、忘れやすい。
助けになるのは、任せる作業を一つに絞って、境界を実地に描いてみることだ。最初の一歩は10分。自分がAIに任せた、あるいは任せたい作業を一つ選ぶ。それを、AIが得意そうな部分(下書き・要約・言い換え)と、外しそうな部分(固有の事実・数字・自分の事情)に分ける。そして、任せた出力のどこを、どうやって自分で検算するかを、一行で決めて書いておく。事実は原典にあたる、数字は自分で計算し直す、など。全部を任せるのでも、全部を抱え込むのでもなく、その一つの作業の中に、境界線を一本引いてみる。任せる範囲と、確かめる方法を、セットで書く。 それが、生成AIを道具として飼いならす、最初の一歩になる。この作法が身につけば、次にどんな新しい道具が来ても、同じやり方で向き合える。
次の単位は 541「データの持ち主と権限を決めるには?」——ここから段は変わり、道具を使う力から、データを統べる力へ。まずは、そのデータを誰が持ち、誰が触れてよいかを決める話へ進む。
- この単位はSTEP3(橙・使う力)の最後で道具の話の締めくくり。生成AIはたくさんの文章から言葉のつながりを学び指示に応じて文章や答えを作る仕組み。両断定を避ける——任せられるも任せられないもどちらの断定も事実を単純にしすぎた俗説で、問いは任せるか否かでなくどのタスクをどう検算しながら任せるか。特定のAI製品の優劣は論じない
- 生成AIは生産性を上げる。Noy & Zhang 2023は専門的な文章を書く仕事で生成AIを使える群と使えない群を比べるランダム化比較試験を行い、使えた側は作業時間が減り仕上がりの質も上がり、もともと不得手だった人ほど底上げされ書き手の差が縮んだと確かめた。下書き・要約・言い換え・たたき台づくりでは実際に時間を節約でき、AIは役に立たないという断定は退けてよい
- 性能は凸凹している。Dell'Acqua ら 2023(査読論文でなくSSRNワーキングペーパーと性格明示)は大規模な実地実験でジャギッド・フロンティア(ぎざぎざの境界)を示し、境界の内側ではAIが大きく質と速さを上げるが、境界のすぐ外の一見似たタスクではかえって成績が下がることを報告した。境界は素人目に見えず、これができたのだからあれもという推測は通用せず、任せてよい線は実際に試して確かめるしかない
- 人はAIに頼りすぎる(オーバーリライアンス)。Buçinca ら 2021はAI支援の判断で人が出力を鵜呑みにしがちなことを示し、一手間かけて考えさせる認知的強制で鵜呑みが減ると確かめた。Vasconcelos ら 2023はなぜその答えかの説明を添えると過度の依存が減ると示した。ただし緩和はできるが自動では起きず、人が確かめる一手間を仕組みとして組み込んで初めて効く。便利さは確かめない言い訳になりやすい
- AIの振る舞いは時とともに変わる(ドリフト)。Chen・Zaharia・Zou 2024は同じ生成AIサービスの応答が時期によって変わっていくことを記録した。裏側の仕組みは利用者に断りなく更新されうるため、一度うまくいった任せ方がずっと同じようにうまくいく保証はない。任せ方は一度決めて固定するのでなく時々いまも期待どおりかを見直す必要があり、更新されうる道具はみなこの性質を持つ
- 公式の指針として経済産業省と総務省が2024年に既存の複数の指針を統合・更新しAI事業者ガイドラインを取りまとめた。AIを開発・提供・利用する事業者が安全・公平・透明性のため何に気をつけるべきかを示す現行の公式の枠組みで、細目の逐語や数値には立ち入らず公式の指針が存在し更新され続けているという事実だけを置く。個別の適法判断はせず、道具を使う前に自分の分野に関わる公式の指針を一度あたることも任せかたの設計の一部
- 確からしくなったのは任せられるでも任せられないでもなく、生成AIは効くが凸凹で人は頼りすぎ振る舞いは変わるという事実。だからこの単位でやるのは、AIに任せた(任せたい)作業を一つ選び、AIが得意そうな部分(下書き・要約・言い換え)と外しそうな部分(固有の事実・数字・自分の事情)に分け、任せた出力のどこをどうやって自分で検算するかを一行で決めて書き、任せる範囲と確かめる方法をセットにすることである
| よくある誤解 | 実際のところ |
|---|---|
| 生成AIはもう賢いのだから、たいていの仕事はそのまま任せてしまってよい | 任せられるという断定は俗説である。Noy & Zhang 2023が示すとおり生成AIは下書きや要約など手間の重い作業で生産性を上げるが、Dell'Acqua 2023(SSRNワーキングペーパー)はジャギッド・フロンティア(ぎざぎざの境界)を示し、境界のすぐ外の一見似たタスクではかえって成績が下がると報告した。境界は素人目に見えず、これができたのだからあれもという推測は通用しない。任せてよい線は実際に試して確かめるしかなく、どのタスクをどう検算して任せるかの設計が要る |
| AIはまだ信用できないのだから、仕事に使わず遠ざけておくのが安全だ | 任せられないという断定も俗説である。Noy & Zhang 2023はランダム化比較試験で、生成AIを使えた側は作業時間が減り質も上がり、もともと不得手だった人ほど底上げされたことを確かめた。下書き・要約・言い換え・たたき台づくりでは実際に時間を節約でき、丸ごと遠ざけるのは効く場面を捨てることになる。問いは使うか使わないかでなく、効く凸凹の内側を選び、便利さに慣れても確かめる手間を仕組みで残せるかである |
| 一度うまく任せられたやり方が見つかれば、あとは同じ頼み方でずっと安心して使える | Chen・Zaharia・Zou 2024は同じ生成AIサービスの応答が時期によって変わっていくことを記録した。裏側の仕組みは利用者に断りなく更新されうるため、前はこの頼み方でうまくいったからと検算をやめた頃に静かに挙動が変わっていることが起こりうる。さらに人はもっともらしい答えを鵜呑みにしがちで(Buçinca 2021・Vasconcelos 2023)、緩和はできるが自動では起きない。任せ方は固定でなく、時々いまも期待どおりかを見直し、検算をセットで保つ |
皮肉なのは、生成AIほど、両極端の断定を誘う道具も珍しい、ということである。少し使えば「これはもう何でもできる」と言いたくなり、一度大きく外されれば「やはり使えない」と言いたくなる。だが、そのどちらの断定も、事実を平らにならしてしまう。確からしいのは、もっと込み入った姿だ。生成AIは、下書きや要約のような手間の重い作業で確かに生産性を上げる。だが得手不得手はぎざぎざに入り組み、境界のすぐ外では、かえって成績を下げる。人はもっともらしい答えを鵜呑みにしがちで、便利さは、そのまま確かめない言い訳になりやすい。そのうえ、裏側は断りなく更新され、前うまくいった任せ方が、いつのまにか同じには働かなくなる。AIが「もう任せて大丈夫」と語りかけているように見えるとき、たいていそれは、まだ誰も、そのタスクが凸凹の境界の内か外かを、そして出力のどこを検算すべきかを、確かめていないだけかもしれない。この単位は、AIを崇めも遠ざけもしない——どのタスクを、どう検算しながら任せるかを、自分の手元で設計する目を持つための、使う力の段の締めくくりである。次の単位は 541「データの持ち主と権限を決めるには?」——ここから段は変わり、道具を使う力から、データを統べる力へ進む。
Q1. この単位の中心の構え——「任せられる」も「任せられない」も、どちらの ____ も俗説である。問いは任せるか否かでなく、どの ____ を、どう ____ しながら任せるか、だ。穴埋め
Q2. Dell'Acqua ら 2023 が言う『ジャギッド・フロンティア』の説明として正しいものはどれか。選択
Q3. 『AIが説明を付けてくれるなら、過度の依存は自然に防げる』という考えに対し、Buçinca ら 2021 と Vasconcelos ら 2023 から言える反論を述べよ。一問一答
Q4. Chen ら 2024 が示した『ドリフト』は、AIへの任せ方にどんな注意を促すか。前提となる事実とともに述べよ。一問一答
Q5. この単位が扱った事柄を、年の早い順に並べよ。(ア)Noy と Zhang が生成AIの生産性への効果を実験で確かめる(イ)Buçinca らがAIへの過度の依存と緩和を示す(ウ)Chen らが生成AIの振る舞いが時期で変わると記録する(エ)Dell'Acqua らがジャギッド・フロンティアを報告する並べ替え
紙かメモアプリに今日の日付を書く。次に、自分がAIに任せた、あるいは任せてみたい作業を一つ選ぶ(メールの下書き、長文の要約、文章の言い換え、アイデア出しなど、自分の仕事でよい)。その作業について、三つを書く——(1) AIが得意そうな部分(ゼロから一を作る・言い換える・要約するなど手間の重いところ)、(2) AIが外しそうな部分(固有名詞や数字、自分の事情、最新の事実など)、(3) 任せた出力のどこを、どうやって自分で検算するか(事実は原典にあたる、数字は自分で計算し直す、など具体的に一行で)。最後に、その作業を『全部任せる/全部自分でやる』ではなく、どこで線を引いたかを一言添える。従業員や顧客の個人データをAIに渡す形にはせず、自分の作業だけで完結させる。
——とはいえ、その“正しい用法・用量”は、まだ誰も知らない。ここまでの研究に、あなたのデータは1件も入っていないからだ。平均は地図にすぎない。自分の“いい具合”は、試して探すしかない。
あなたの実験(N=1)を始める → プロジェクトに追加(記録機能は準備中)
- 経済産業省・総務省「AI事業者ガイドライン(第1.0版)」(2024)/経済産業省公表ページ — www.meti.go.jp
- Noy S., Zhang W. (2023) ‘Experimental evidence on the productivity effects of generative artificial intelligence’, Science 381(6654):187-192 — doi.org
- Dell’Acqua F., McFowland III E., Mollick E.R. ほか (2023) ‘Navigating the Jagged Technological Frontier’, SSRN Working Paper(ワーキングペーパー・非査読) — doi.org
- Buçinca Z., Malaya M.B., Gajos K.Z. (2021) ‘To Trust or to Think: Cognitive Forcing Functions Can Reduce Overreliance on AI in AI-assisted Decision-making’, Proceedings of the ACM on Human-Computer Interaction 5(CSCW1):1-21 — doi.org
- Vasconcelos H., Jörke M., Grunde-McLaughlin M., Gerstenberg T., Bernstein M.S., Krishna R. (2023) ‘Explanations Can Reduce Overreliance on AI Systems During Decision-Making’, Proceedings of the ACM on Human-Computer Interaction 7(CSCW1):1-38 — doi.org
- Chen L., Zaharia M., Zou J. (2024) ‘How Is ChatGPT’s Behavior Changing Over Time?’, Harvard Data Science Review 6(2) — doi.org