AI家庭教師が人間の講師と並んだ実験、中学生の勉強に当てはめていいか

Nao
Nao

@naotutor ・ 1本

サムネイル

AI家庭教師が、人間の講師と同じくらい点数を伸ばしたという論文が9月下旬に出ました。中学生のお子さんの勉強も、塾の代わりにAIで足りるのでは、と考えませんでしたか? 実験の条件を中学生の勉強と1つずつ並べると、使える部分と、まだ誰も確かめていない部分がはっきり分かれます。

AI家庭教師の結果、中学生にはそのまま当てはめない

かといって、全部が使えないわけでもありません。分けるとこうなります。

  • 使えそうなこと: 間違えた問題を見てから1時間教える形なら、AIでも点数は直後に伸びた
  • 当てはまらないこと: 参加者は全員が成人で、中学生は入っていない。教材は英語のGRE(アメリカの大学院入試)
  • まだ分からないこと: 伸びた点数が数か月後も残るか。AIなしで自分で問題を解いた場合と比べてどうか

StudentBenchが測ったのは、1時間の指導直後の27問

論文は就職支援サービスHandshakeの研究チームが2026年9月にarXivで公開したもので、9月30日付で第2版が出ています。

参加したのは18〜67歳の2,383人で、83.3%が18〜24歳でした。1回終えると、点数に関係なく50ドル(約7,500円)が支払われています。

GRE形式の27問を解き、5分だけ自分の誤答を見直したあと、1時間を次のどれかで過ごします。振り分けはくじです。

  • AI家庭教師: 13種類のAIのどれか1つと、文字のチャットで学ぶ
  • 人間の講師: ビデオ通話で1対1。GREの問題作成に関わったETSやKaplanの元社員か、指導歴5年以上の講師
  • 統制群: GREと関係のない教育動画を見る

最後に別の問題で27問を解き、伸びた分を測ります。AIにも講師にも、生徒が事前テストで何を間違えたかが渡されていました。誤答を見てから授業を組むのは、個別指導塾が毎回やっていることとほとんど同じなんですよね。

人間の講師と同等とは、27問で約1問ぶんの幅

「同等」は、同じ点数だったという意味ではありません。AIと人間の差の90%信頼区間が±4.09ポイントに収まるかを統計で確かめ、収まれば同等と判定しています。27問では1問が約3.7ポイントなので、許した幅はおよそ1問ぶんです。

実際の差は−0.58ポイントで、人間がわずかに上でした。動画の群と比べると、AIは事前の点数をそろえたうえで6.15ポイント多く伸びていて、論文は「27問中およそ1.5〜2問」と説明しています。

27問で1問の差を「同じ」と呼んでいいでしょうか? 大人の実力をおおまかに比べるには十分ですが、内申や合否が1点で動く中学生の感覚とは少しずれます。

数学系と言語系を分けると、見え方が変わります。数学系は差が+0.88ポイントとAIがやや上で、同等と判定されました。言語系(読解、文の完成、文の言い換え)は差が−2.19ポイントで、同等を示せていません。言語系の3領域とも人間の平均がAI全体の平均を上回っていましたが、論文は「人間が勝った」とまでは書いていません。

13種類のうち6種類のAIが個別に同等と判定された点は、検定の回数が多いことを補正していない結果だと論文に明記されています。人間の講師ごとにまとめて分析し直すと、数学系でも言語系でも同等を示せなかった検算も付録に載っています。

成人のGREと中学生の勉強、条件を並べると?

項目
StudentBenchの実験
中学生の家での勉強
学ぶ人
成人、中心は18〜24歳
12〜15歳
言語と教材
英語のGRE
日本語の教科書、定期テスト
取り組む理由
参加すると50ドル
宿題、成績、内申
指導の量
1時間を1回
毎日少しずつ、何週間も
点数を測る時期
指導の直後
数週間後のテスト、数か月後の入試
比べた相手
人間の講師、動画視聴
自分で問題集を解く時間
そばにいる大人
いない
保護者、先生

右の列の条件は、この論文ではほとんど確かめられていません。「比べた相手」の行は論文自身も限界に挙げていて、AIと話した効果を、自分で練習問題を解いた効果と切り分けて測れていないと書いています。

塾で見ていると、授業の直後に解けた問題を1週間後の小テストで落とす生徒は珍しくありません。論文の関連研究の節にも、ガードのないAIの手助けで練習中の成績は上がったものの、そのあとAIなしで解いた数学の成績は下がった、という先行研究が紹介されています。

お子さんがAIで宿題を終えた日、AIを閉じて同じ型の問題を1問解けるか、確かめたことはありますか?

918倍安いAI家庭教師、何と何を比べた数字か

「918倍安い」は、1回あたりの料金差ではありません。点数を1ポイント上げるのにかかったお金の比です。

AI側はGemma 4 31Bというモデルで、1回の推論費0.067ドル(約10円)を平均の伸び12.7ポイントで割り、1ポイントあたり約0.0052ドル。人間側は、公開されている指導料金から借りた1時間75ドル(約1万1,000円)を人間の講師の平均の伸び15.6ポイントで割り、4.81ドル(約720円)です。丸める前の値で割ると918倍になります。

並べると、比べている中身がそろっていません。

  • AI側はAIを動かす費用だけで、開発や運営、端末、見守る大人の手間は入っていない
  • 人間側の75ドルは研究で実際に払った額と違い、参考の単価
  • Gemma 4 31Bの伸びは人間より低く、同等の判定(p=.044)は補正なしの個別検定

日本の個別指導とは前提がまるで違うので、この倍率を家計の計算に持ち込むのは控えたほうがいいと私は考えています。

中学生の宿題と定期テスト前、AIに任せていいのはどこまで?

明光義塾が2026年7月に公表した保護者1,000人の調査では、小5〜高3の子どもの48.6%が勉強や宿題に生成AIを使っていました。家で使うなら、実験の「誤答を見てから教える」形を借りて、最後にAIなしで確かめる時間を足すのがおすすめです。

宿題でAIに答えを聞きたくなったとき

答えを聞くと、その1問は終わっても次の1問でまた手が止まります。AIには、答えを出さずにヒントを1段ずつ出すよう頼んでみてください。

この問題の答えは言わないでください。
次に何をすればいいか、ヒントを1つだけください。
私が答えを書いたら、合っているかと理由を教えてください。

定期テスト2週間前のAIの使い方

ワークで間違えた問題をAIに見せて同じ型の類題を作ってもらうのは、実験でAIがやっていたことに近い使い方です。AIの解答は間違うこともあるので、答えは教科書やワークの解説と突き合わせてほしいです。作った類題をテストの3日前にAIなしでもう一度解くと、定着したかが見えてきます。

英語長文と国語の記述でAIを使うとき

同等を示せなかったのは言語系でした。GREの言語問題と中学の国語や英語長文は別物なので、この結果からは何も言い切れません。それでも、記述の採点や読み取りのずれの指摘は、今のところ先生や大人の目を通したほうが安心ではないでしょうか。

お子さんがいちばんAIを使っているのは、この3つのうちどの場面でしょうか?

次に見たいのは、中学生で数か月後を測るAI家庭教師の実験

この論文は、伸びた点数が数か月後まで残るかは測っていないと自ら書いています。中学生を対象に、日本語の教材で、AIだけで自習した群とも比べながら入試の時期まで追う研究が出てはじめて、中学生にも使えると言えるはずです。

それまでは、AIで点数が上がったかより、AIなしで解けるようになったかを見てほしいです。同じ点数が上がっても、解き方が身についたかは別の話なんですよね。