1. 핵심 내용의 간단한 요약
이 기사는 아마존이 21년 동안 운영해 온 전설적인 인공 데이터 레이블링 플랫폼인 MTurk가 2026년에 공식적으로 서비스를 종료한다고 발표한 사실을 다룹니다. MTurk는 AI 업계의 “조상급 인프라”로 불릴 만하며, 전성기에는 전 세계적으로 50만 명 이상의 등록 사용자가 있었습니다. 이 플랫폼은 복잡한 작업을 몇 센트로 처리할 수 있는 작은 작업들로 나누어서, 리 페이페이(Li Fei-Fei)가 2년 만에 1,400만 장의 ImageNet 훈련 이미지를 레이블링하는 데 도움을 주었습니다(만약 대학생을 고용한다면 19년이 걸렸을 것입니다). 또한 초기 AI 기술들과 ChatGPT의 첫 버전 훈련에도 필수적인 역할을 했으며, “긱 경제(gig economy)”라는 개념의 탄생에도 기여했습니다.
그러나 장기간에 걸친 방치와 품질 관리의 부족으로 인해 대형 모델 시대의 고품질 데이터 요구사항을 충족시키지 못하게 되었고, 결국 작업자들이 대형 모델을 이용해 부정행위를 하는 등의 문제가 발생하면서 서비스를 종료하게 되었습니다. MTurk의 종료는 데이터 레이블링 업계가 쇠퇴한 것이 아니라, 업계가 완전히 업그레이드되고 있음을 의미합니다. 저렴한 노동력을 필요로 하는 단순한 작업은 점점 줄어들고, 전문 지식을 가진 고급 인력의 가치는 급상승하고 있으며, 업계는 “인력 차액을 이용한 단순한 일”에서 “전문 지식을 바탕으로 한 고급 서비스”로 전환되고 있습니다.
---
2. 세부적인 해석
1. 서비스가 종료된 MTurk는 사실 AI 업계의 “보이지 않는 스승”이었습니다
오늘날 대화나 그림을 할 수 있는 AI들도 초기에는 유치원에 다니는 어린아이처럼 어리석어서 고양이와 개조차 구별할 수 없었습니다. 2005년 아마존이 MTurk를 만든 이유는 간단했습니다. 자사 전자상거래 플랫폼에 있는 수백만 개의 상품을 분류하고 오류를 수정해야 했는데, 당시의 알고리즘으로는 이런 작업을 처리할 수 없었습니다. 베조스는 상품에 분류 태그를 달거나, 이미지 속 사람에게 테두리를 그리거나, 10초 분량의 음성을 텍스트로 변환하는 등의 작업을 몇 분 만에 처리할 수 있는 작은 작업들로 나누어 전 세계의 여유 노동력을 활용하기로 했습니다. 이 작업들은 마치 AI가 직접 처리한 것처럼 보였습니다.
MTurk는 이후 AI의 부흥에 필수적인 기반이 되었습니다. 리 페이페이는 MTurk를 통해 컴퓨터 비전 업계를 변화시키는 ImageNet 데이터 세트를 만들었으며, 음성 인식, 자율 주행, 콘텐츠 검열 등 다양한 분야에서도 데이터 검증에 사용되었습니다. “긱 경제”라는 용어도 MTurk의 운영 방식을 연구한 학자들이 만들어낸 것입니다. 이는 현재의 배달 서비스나 온라인 차량 호출 서비스의 기반이 되는 개념입니다.
2. “긱 노동력의 방치”가 성공과 실패의 원인이었습니다
MTurk가 성공한 이유는 “전혀 관리하지 않는” 방식이었습니다. 노동자와 노동 계약을 맺지 않고, 사회 보험도 제공하지 않으며, 교육이나 평가도 없었습니다. 컴퓨터만 있으면 누구나 작업을 받을 수 있었기 때문에 비용을 최소화할 수 있었습니다. 하지만 이는 결국 치명적인 단점이 되었습니다. 플랫폼은 노동자의 능력을 검증하지 않았고, 품질 관리도 하지 않아서 노동자들은 몇 시간 동안 일한 후에도 “작업이 부족하다”는 이유로 돈을 받지 못하는 경우가 많았습니다. 가장 아이러니한 것은 2023년 연구에서 MTurk 사용자의 30~50%가 대형 언어 모델을 이용해 작업을 처리하고 있었다는 사실입니다. 원래는 “인간이 기계처럼 일하는” 것이었지만, 결국은 “기계가 인간처럼 일하는” 상황이 되어 데이터의 품질이 매우 낮아졌습니다.
3. 같은 업계라도 운명은 다릅니다
MTurk의 종료는 업계의 축소가 아니라 업계의 재편과 업그레이드를 의미합니다. 데이터 레이블링 업계에서도 회사들의 운명은 크게 달랐습니다.
- 시기를 잘 맞춘 회사들은 급성장했습니다. 미국의 Scale AI는 초기에는 일반적인 레이블링 작업을 했지만, 곧 전문적인 레이블링 작업으로 전환하여 AI에 필요한 합성 데이터를 생성하기 시작했고, Meta의 투자로 기업 가치가 29억 달러에 달했습니다. 30대 창업자들이 설립한 Mercor는 3년 만에 기업 가치가 20억 달러에 달했으며, 인력 차액을 이용하는 것이 아니라 전 세계의 전문가들을 모아 대형 모델에 대한 고난도 평가와 맞춤형 훈련을 제공함으로써 수익을 올렸습니다.
- MTurk의 기존 모델을 고수한 회사들은 큰 타격을 받았습니다. 호주의 상장 기업 Appen은 초기에는 MTurk의 방식을 사용하여 구글의 레이블링 작업을 처리했지만, 구글이 계약을 중단하자 주가가 1%로 떨어져 거의 파산 직전까지 갔습니다.
4. 데이터 레이블링은 더 이상 “저렴한 단순 노동”이 아닙니다
국내에서도 이 업계의 변화는 예상보다 빠립니다. 예전에는 3선 도시에서 사무실을 임대하고 중등 전문학교 출신의 젊은이들을 고용해 이미지에 테두리를 그리는 단순한 작업을 했습니다. 하지만 이제는 상황이 반대입니다. 대기업들은 레이블링 작업을 “데이터 전문가”나 “AI 문제 출제 전문가”로 재정의하고 있으며, 채용 기준도 높아졌습니다. 예를 들어, 소규모 언어 레이블링 작업에는 전문 영어 능력이 필요하고, 대형 모델 평가에는 석사 학위가 필요하며, 일부 대기업은 의료 관련 레이블링 작업을 위해 10만 원의 월급을 제공하기도 합니다. 정부도 2027년까지 데이터 레이블링 산업의 연평균 성장률을 20% 이상으로 설정했으며, “AI가 먼저 레이블링을 하고 전문가가 검토하는” 것을 주류 방식으로 정했습니다.
5. 가장 충격적인 업계의 비유
MTurk의 이름은 18세기의 유명한 사기에서 유래했습니다. 당시 “자동 기계 터키인”이라는 기계가 있었는데, 실제로는 사람이 기계인 척하며 사람들을 속였습니다. 베조스가 MTurk에 이 이름을 붙인 것은 자신들이 “기계 뒤에 숨은 인간 AI”라는 것을 농담으로 표현한 것이었습니다.
21년이 지난 지금, 이 비유가 현실이 되었습니다. MTurk에서 수백만 명의 노동자들이 만든 데이터로 AI가 점점 더 똑똑해졌고, 이제는 AI가 인간이 했던 단순한 작업들을 스스로 처리할 수 있게 되었습니다. 이는 AI가 모든 레이블링 작업을 대체하는 것이 아니라, 인간이 더 이상 AI의 단순한 작업을 대신하지 않고, AI가 배울 수 없는 고급 작업을 해야 함을 의미합니다.