虎嗅

**답변이 저렴해진 후, 학교는 어떻게 학생을 평가해야 할까?**

原文:答案变得廉价之后,学校该如何评价一个学生?

핵심 내용 요약

덴마크는 고등학생들의 AI를 이용한 부정행위에 대응하기 위해 구두 답변과 같은 조치를 도입했지만, 이는 단순한 부정방지가 아닙니다. 생성형 AI는 전통적인 교육 평가의 핵심 논리인 “학생이 제출한 결과 = 실제 능력”을 뒤흔들고 있습니다. 이제 AI 덕분에 고품질의 과제를 쉽게 만들 수 있게 되었으며, 많은 경우 “보조 학습”이나 “직접 대리 작성”의 회색 지대에 속하게 되었습니다. 결과만으로 능력을 판단하는 전통적인 방식은 더 이상 효과가 없습니다. 각국은 “AI 검사”에서 “능력 검증”으로 방향을 바꾸고 있으며, 학교 내에서의 통제된 과제, 구두 답변, 학습 과정 기록 등을 통해 평가 체계를 재구성하고 있습니다. 하지만 이러한 개혁은 인력 비용, 공정성, 개인 정보 보호와 같은 문제에 직면하고 있습니다.

1. AI는 단순한 부정행위 도구가 아닙니다; 전통적인 평가 방식을 뒤흔들었습니다

전통적인 교육 평가는 “최종 결과”(논문, 과제)를 통해 학생의 능력을 판단했는데, 이는 좋은 논문을 쓰기 위해 며칠 동안 자료를 조사하고 사고를 정리해야 했기 때문입니다. 부정행위(복제, 대리 작성)도 어느 정도의 장벽이 있었으며 쉽게 식별할 수 있었습니다. 하지만 AI는 이 모든 것을 바꿔놓았습니다:

  • 비용의 급격한 감소: 학생들은 AI를 사용해 몇 분 만에 주제, 구조, 논증을 생성하고 문체까지 조정할 수 있으며, 과거 며칠간의 작업량이 순식간에 완료됩니다;
  • 회색 지대의 확대: 모든 AI 사용이 부정행위는 아닙니다. 일부 학생들은 AI를 사용해 개념을 확인하거나 문법을 수정하지만, 그 경계선을 정하는 것은 어렵습니다;
  • 데이터가 말한다: 영국의 조사에 따르면 95%의 대학생이 AI를 사용해 과제를 보조하고 있으며, 국내에서도 85% 이상의 학생이 AI를 사용해 학습합니다. 일부는 내용을 그대로 복사하기도 합니다.

이제 선생님들은 좋은 논문을 받았을 때 “학생의 능력이 뛰어나다”고 생각하기보다는 “이 중 얼마나 많은 부분이 AI가 작성한 것인가? 학생은 정말 이해하고 있는가?”라는 의문을 갖게 됩니다.

2. AI 검사 도구로 AI를 잡으려 해도 따라잡기 어렵습니다

처음에 학교들은 “AI 검사 도구”를 사용해 AI 부정행위를 막으려 했지만, 이는 결코 이길 수 없는 기술 경쟁입니다:

  • AI가 생성한 내용은 ‘완전히 새로운’ 것: 복제 검사는 기존 내용과의 유사성을 찾지만, AI가 생성한 내용은 이전에 없었던 것이므로 검사 도구로는 식별하기 어렵습니다;
  • 수정 후에는 더욱 잡기 어렵습니다: 몇 마디만 수정하거나 도구를 사용해 “인간적으로 처리”하면 검출 정확도가 39%에서 22%로 떨어집니다;
  • 오류의 위험이 큽니다: AI를 잘 사용하지 못하는 학생들은 쉽게 발견되지만, AI를 잘 사용하는 학생들은 피할 수 있어 공정성에 문제가 생깁니다.

덴마크의 현명한 접근법은 “어떤 부분이 AI가 작성했는지”에 집착하지 않고, 학생들에게 직접 논문을 설명하도록 하는 것입니다. AI는 결과를 생성할 수 있지만, “왜 이 자료를 선택했는지”, “결론이 다른 조건에서도 성립하는가”와 같은 질문에는 답할 수 없습니다.

3. 이제 “능력 검증”이 대세입니다: 평가 개혁의 새로운 방향

각국은 평가 체계를 재구성하고 있으며, 핵심은 “다양한 증거를 통해 학생이 실제로 능력이 있는지”를 확인하는 것입니다. 주요 방법은 다음과 같습니다:

  • AI가 없는 기준을 유지하기: 예를 들어, 덴마크에서는 더 많은 과제를 학교 내에서 완성하도록 하고, 선생님들이 학생들이 기본적인 과제(예: 문장을 순조롭게 쓰기)를 독립적으로 수행할 수 있도록 감독합니다;
  • 능력 검증의 추가: 논문을 제출한 후에는 반드시 답변해야 하며, 선생님들은 무작위로 세부 사항을 질문합니다 (예: “당신이 인용한 이 데이터의 출처가 신뢰할 수 있습니까?”);
  • 과정 중심의 평가: 학습 과정을 기록합니다 – 주제 선택 초안, 수정 내역, AI와의 대화 기록 등을 통해 결과를 단순한 “단일 파일”이 아니라 종합적으로 평가합니다;
  • AI의 합리적인 사용: AI를 금지하지 않지만, 사용 상황을 공개하도록 요구합니다 (예: 국제 디플로마 기관은 AI 사용 내용을 문헌 인용처럼 표기하도록 요구함). 평가의 중점은 “학생이 AI를 사용해 문제를 해결할 수 있는지”입니다 (예: AI의 오류를 발견할 수 있는지).

4. 국내 학교들: 단순히 금지하는 것에서 벗어나 평가 논리를 바꿔야 합니다

국내 학교들도 변화를 시도하고 있지만, 많은 곳이 여전히 “AI 사용을 금지”하거나 “검사 도구로 단속하는” 수준에 머물러 있습니다. 진정한 개혁은 “평가의 목적”으로 돌아가야 합니다:

  • 규칙의 업그레이드: 청화대학교 등은 학생들에게 AI 사용 상황을 공개하도록 요구하며, “과제의 본래 목적이 무엇인지”를 기준으로 판단합니다 – 예: 기초 작문 수업에서는 AI를 사용할 수 없지만, 연구 논문에서는 자료 조사에 AI를 사용할 수 있습니다;
  • 실습 중심의 교육: 청화대학교의 뉴스 수업에서는 학생들이 현장 인터뷰를 통해 관찰 기사를 쓰도록 하며, AI는 자료를 정리하는 데 도움을 줄 수 있지만 “골목길로 가서 사람들과 대화하고 세부 사항을 발견하는” 것은 대체할 수 없습니다;
  • 차별적인 규칙: 다른 학문 분야와 학년에 따라 요구사항이 다릅니다 – 초등학생들은 글쓰기 연습에 AI를 사용할 수 없지만, 대학생들은 프로젝트 작업에 AI를 사용할 수 있지만, 그 방법을 명확히 설명해야 합니다.

5. 개혁은 쉽지 않습니다: 비용, 공정성, 개인 정보 보호가 문제입니다

평가 개혁은 좋아 보이지만 실제로는 어렵습니다:

  • 인력 비용의 부담: 100개의 논문을 채점하고 100번의 답변을 조직하는 데 선생님들이 소요하는 시간은 열 배나 차이가 납니다;
  • 공정성 문제: 내성적인 학생이나 언어 장애가 있는 학생들은 답변 과정에서 불리하며, 자원이 부족한 학교(대규모 수업, 선생님 부족)는 답변을 진행하기 어려워 교육 불평등을 악화시킬 수 있습니다;
  • 개인 정보 보호: 화면 모니터링, 학습 과정 기록은 학생들의 개인 정보와 관련이 있습니다 – 학교는 데이터를 얼마나 오래 보관할 수 있을까요? 누가 볼 수 있을까요? 오류가 발생하면 어떻게 항소할 수 있을까요?

교육 기술 회사들도 변화해야 합니다: 단순히 “AI 사용률 검사”를 하는 것에서 벗어나 “선생님들이 증거를 수집하는 데 도움을 주는 도구”로 전환해야 합니다 – 예: 과제 수정 내역을 기록하거나 답변 질문을 생성하여 선생님이 학생의 실제 능력을 더 쉽게 판단할 수 있도록 해야 합니다.

결론

덴마크의 구두 답변은 최종적인 해결책은 아니지만, AI 시대의 교육 평가에서는 “결과가 AI가 작성한 것인지”에 집착하는 것을 멈추고 “학생이 실제로 무엇을 배웠는지”에 초점을 맞춰야 합니다. AI는 논문 작성을 도와줄 수 있지만, 문제를 제기하고 사실을 검증하며 책임을 지는 것은 학생 스스로가 해야 합니다. 교육이 진정으로 지켜야 할 것은 “사고가 실제로 일어났는지”입니다.