학습 중 이해가 안 되는 부분을 쉽게 질문할 수 있는 가정교사가 있으면 도움이 되지만, 인간의 전문가에게 1対1로 배우는 데는 높은 지도료가 발생합니다. 인공지능 가정교사로도 똑같은 정도의 학습을 할 수 있는지 확인하기 위해, Handshake AI Research의 카티스·노컷 氏らは 미국 대학원 진학에 사용되는 시험 “GRE”의 대비 학습 효과와 비용을 비교했습니다. StudentBench: AI and human tutoring yield equivalent GRE learning gains - arXiv https://arxiv.org/abs/2609.28470 인공지능에 의한 개별 지도는 지금까지도 연구가 진행되어 왔으며, 대학의 물리학 수업을 대상으로 진행된 2025년의 연구에서는 인공지능의 개별 지도를 받은 학생은 교실에서 수업을 들은 학생보다 짧은 시간 안에 높은 학습 성과를 얻고, 학습 의욕도 높았다고 보고되었습니다. “AI튜터”를 사용한 개별 지도로 인해 대학교생의 학습 효율이 향상되고, 흥미도 증가했습니다 - GIGAZINE
이 연구는 인간에 의한 그룹 수업과 AI 튜터 기반의 개별 지도 시스템을 비교한 것으로, 노스컷 氏 등이 비교한 것은 AI 튜터 기반의 지도와 인간 전문가에 의한 개별 지도입니다. 실험은 다음과 같은 흐름으로 진행되었습니다. 먼저, 실험에 참여한 성인 2383명은 수학 또는 언어의 GRE 문제를 27문항 풀고, 틀린 문제를 약 5분간 복습합니다. 다음으로, 참가자는 “13가지 AI 중 하나와 대화하며 학습하는 그룹”, “인간 전문가로부터 비디오 통화로 배우는 그룹”, “GRE와 관련 없는 교육 영상 시청 그룹”으로 분할되어, 그룹별로 정해진 1시간을 보냈습니다. 한편, 지도에 있어서, 첫 번째 테스트에서 참가자가 틀린 문제가 각 참가자를 담당하는 AI 또는 인간 전문가에게 전달되었습니다.
그리고 1시간이 경과한 후, 참가자 전원이 동일 분야의 다른 문제 27개를 풀고, 연구팀은 첫 번째 테스트에서 정답률이 얼마나 향상되었는지 비교했습니다. 그 결과, 수학 및 언어 테스트 결과를 합치면 AI에 의한 2139회 지도로 평균 13.9점, 인간 전문가에 의한 140회 지도로 15.6점, 190회 영상 시청으로 7.1점 상승했습니다. 아래 그래프 상단의 점과 선은 사전 테스트의 정답률 등을 고려하여 추정한 AI와 인간의 차이점과 그 추정의 범위를 나타내며, 파란 막대는 AI 지도를 받은 그룹, 빨간 막대는 인간 전문가에 의한 지도를 받은 그룹, 회색 막대는 교육 영상을 본 그룹을 나타냅니다.
단순한 평균에서는 인간으로부터의 지도가 정답률의 성장에 더 유리하며, 사전 테스트의 정답률 등을 고려할 때, AI 지도가 가져오는 정답률의 성장은 인간 지도를 받은 경우보다 0.58 포인트 작았다는 추정치였습니다. 그러나, 이 차이는 연구팀이 사전에 설정한 “동등”의 범위 이내, 혹은 ±4.09 포인트 이내에 갇혀 있었기 때문에, 수학과 언어를 합한 학습 효과는 “동등”으로 판정되었습니다. 다만, 분야별로 살펴보면 수학만 “동등”으로 판정되었고, 언어만으로는 인간으로부터의 지도가 정답률의 성장에 더 효과적이라는 결과가 나타났습니다. 수학과 언어로 각각 13 종류의 AI를 시험한 결과, 두 분야에서 모두 사용된 12 종류의 AI를 인간의 전문가는 물론 개별적으로 비교했을 때, 6 종류에서 학습 효과가 “동등”으로 판정되었습니다. 또한, 6 종류의 AI 모델 중 비용이 가장 저렴한 “Gemma 4 31B”는 학습 계획과 연습 문제 작성부터 1시간의 대화까지에 걸친 AI 모델 이용료가, 지도를 1회당 평균 약 0.067 달러(약 11원)였다고 합니다. 지도를 받는 데 드는 비용을 비교하기 위해, 연구팀은 공개된 자료를 참고하여 인간 전문가는 1시간 75 달러(약 1만 1900원)로 가정하고, AI와 인간 각각의 지도를 1회당 평균 정답률의 평균적인 성장에 따라 산출했습니다. 그 결과, 정답률의 성장에 1 포인트당 비용은 Gemma 4 31B가 약 0.0052 달러(약 0.82원), 인간 전문가는 약 4.81 달러(약 760원)로, Gemma 4 31B는 인간의 약 918분의 1에 해당했습니다. 덧붙여, Gemma 4 31B를 제외한 AI 모델도 정답률의 성장에 1 포인트당 비용은 0.024 달러(약 3.8원)에서 1.40 달러(약 220원) 사이로, 인간 전문가는의 지도료를 하회했습니다. 다음 그래프의 수직축은 1 포인트당 비용, 오른쪽의 “Cost multiple”는 Gemma 4 31B와 비교한 배수이며, 인간 지도를 동등한 학습 효과가 확인된 6 종류의 AI에는 파란색 띠와 체크 표시가 있습니다.
하지만 918분의 1이라는 숫자는 AI 모델의 이용료와 인간에 의한 지도료의 참고 가격에서 산출된 것으로, 지도 1회 비용을 그대로 비교한 결과가 아닙니다. 또한 실험에서 확인한 것은 GRE 대비 직후의 학습 효과이며, 수개월 후에도 학습한 내용이 정착되어 있는지 여부는 향후 조사해야 한다고 연구팀은 밝혔습니다.
원문 보기 | 출처: Gigazine