핵심 내용 요약
AI가 발전함에 따라 공개된 인터넷 데이터는 거의 소진되었습니다. 더 지능적으로 진화하기 위해(챗봇에서 실제 업무를 수행하는 “디지털 직원”으로) AI 기업들은 파산하거나 인수된 스타트업의 내부 데이터에 관심을 갖기 시작했습니다. 여기에는 코드, 채팅 기록, 이메일, 회의 녹음 등이 포함됩니다. 이러한 데이터 거래는 올해 급격히 증가했지만, 그 뒤에는 개인 정보 유출, 법적 공백, 윤리적 갈등과 같은 심각한 문제들이 숨어 있습니다. 아이러니하게도 구글, 메타와 같은 거대 기업들은 이미 개인 정보 정책을 수정하여 사용자 데이터를 “합법적으로” 활용해 AI를 훈련시키고 있으며, 메르코어(Mercor)는 이러한 수요를 더욱 애매한 영역으로 밀어냈습니다. AI의 진화는 본질적으로 인간의 디지털 프라이버시를 소모하는 것이며, 이 갈등은 단기간에 해결될 가능성이 낮습니다.
1. 왜 AI가 파산한 회사의 “업무 기록”을 탐내는가? 공개된 데이터만으로는 부족하다
AI의 지능은 무에서 비롯되지 않으며, 데이터를 통해 발전합니다. 과거에는 여러 연구소들이 인터넷상의 웹페이지, 논문, 코드, 포럼 게시물 등을 수집했는데, 이것을 “공개 데이터의 축제”라고 불렀습니다. 하지만 이제 그 축제는 끝났습니다. AI가 단순히 대화하는 것에서 실제 업무를 수행하는 것으로 발전하기 위해서는 “답”이 아니라 “과정”이 필요합니다. 예를 들어, 엔지니어들이 어떻게 문제를 발견하고, 어떻게 해결책을 논의하며, 코드를 수정하는지 등입니다. 이러한 정보는 파산한 회사의 내부 기록(슬랙 채팅, 줌 회의 녹음, 코드 변경 기록 등)에 담겨 있으며, AI 훈련에 필수적인 “실제 업무 데이터”입니다.
예를 들어, 깃허브(GitHub)가 AI의 코드 능력을 급속히 발전시킬 수 있었던 이유는 커밋 기록(코드 변경 내역)이 “문제 → 논의 → 수정 → 검증”의 전 과정을 보여주기 때문입니다. 다른 산업에서는 이러한 데이터가 존재하지 않으므로, 파산한 회사의 내부 데이터가 그 부족함을 메워줍니다. 그래서 메르코어는 30만 달러를 지불하고 이 데이터를 인수했으며, 이 사업도 성공적이었습니다.
2. 이러한 데이터 인수의 위험: 개인 정보 유출은 빙산의 일각에 불과하다
이러한 내부 데이터에는 매우 민감한 정보가 포함되어 있으며, 잘못 사용하면 큰 문제가 발생할 수 있습니다:
1. 개인 정보 유출: 메르코어는 민감한 정보를 숨길 수 있다고 주장하지만, 업계에서는 “누가 언제 무엇을 말했으며, 그로 인해 어떤 행동이 발생했는지”가 가장 중요하다는 것을 알고 있습니다. 예를 들어, 직원의 이름을 “엔지니어 A”로 바꾸더라도 직무, 프로젝트, 고객 관계와 같은 정보는 쉽게 식별될 수 있으며, 개인 정보가 유출될 수 있습니다.
2. 직원의 동의 부족: 기업이 데이터를 판매할 때 직원들은 자신의 채팅 기록이나 회의 발언이 판매되는 것을 모릅니다. 지적 재산권 계약을 체결했다고 해도 이것이 AI 훈련에 동의하는 것을 의미하지 않습니다.
3. 상업 기밀과 편견: 데이터에는 고객 정보나 회사 기밀이 포함될 수 있으며, 더 심각한 것은 인간의 작업 중에 발생하는 편견(특정 고객에 대한 차별, 의사 결정의 오류 등)이 AI에 의해 복제되어 “알고리즘 편견”으로 확대될 수 있습니다.
4. 법적 불명확성: 전 세계적으로 기업이 내부 업무 데이터를 AI 기업에 판매할 수 있는지에 대한 명확한 규정이 없으며, 이는 법적 공백입니다. 이로 인해 AI가 빠르게 발전할 수도 있지만, 개인 정보 유출의 위험도 증가합니다.
3. 거대 기업들은 이미 이를 하고 있다: 개인 정보 정책을 수정하면 당신의 데이터는 AI의 연료가 된다
메르코어만이 애매한 거래를 하는 것은 아닙니다. 구글, 메타와 같은 거대 기업들도 이미 사용자 데이터를 “합법적으로” 활용해 AI를 훈련시키고 있습니다:
- 구글은 2023년 독립기념일에 개인 정보 정책을 수정하여 “공개된 정보를 사용해 AI를 훈련한다”고 밝혔으며, 여기에는 이메일, 구글 문서, 검색 기록도 포함됩니다. 2026년에는 모든 사용자를 자동으로 AI 훈련 프로그램에 포함시켰으며, 사용자가 직접 탈퇴해야 합니다.
- 메타도 2023년에 정책을 수정하여 페이스북, 인스타그램의 공개 게시물과 사진을 사용해 AI를 훈련시켰습니다. 2024년에는 유럽 사용자 데이터의 훈련을 일시 중단했다가 2026년에 다시 시작했으며, 사용자에게는 “동의”가 아닌 “반대”的 권리만 제공합니다.
결국 메르코어는 거대 기업들이 이미 하고 있던 일을 공개적으로 한 것뿐이며, 차이점은 거대 기업들이 “서비스 약관 수정”이라는 합법적인 방법을 사용하는 반면, 메르코어는 애매한 경로를 선택했다는 것입니다.
4. 어떻게 해결할 수 있을까? 법률, 기술, 자율 규제가 모두 필요하지만 길은 멀다
이 갈등은 해결 불가능한 것은 아니지만, 모든 관련자의 노력이 필요합니다:
1. 법적 개선: “데이터의 소유권”(회사? 직원? 고객?)과 “데이터 판매 전 동의 절차”를 명확히 해야 합니다.
2. 기술적 보호: “페더럴 러닝”(AI가 데이터가 있는 곳에서 직접 훈련함), “디퍼렌셜 프라이버시”(데이터에 잡음을 추가하여 실제 소유자를 숨기지만 AI 학습에는 영향을 주지 않음)와 같은 기술을 통해 개인 정보 유출 위험을 줄일 수 있습니다.
3. 업계 및 기업의 자율 규제: 데이터 회사는 데이터 출처를 명확히 하고, 기업은 데이터를 판매하기 전에 직원에게 알리고 동의를 받아야 합니다.
하지만 이러한 해결책들은 시간이 필요합니다. AI 기업은 발전해야 하고, 사용자는 프라이버시를 원하며, 거대 기업은 이익을 추구하기 때문에 갈등은 계속될 것입니다. 단기간 내에 AI의 진화는 인간의 디지털 프라이버시를 소모하는 상황이며, 이 경쟁은 아직 끝나지 않았습니다.
마지막 말
AI의 지능 향상은 우리가 남긴 디지털 흔적을 소모하는 것입니다. 공개된 웹페이지에서부터 업무 기록에 이르기까지, 거대 기업의 “합법적” 수집에서 애매한 인수에 이르기까지 말입니다. 우리는 AI의 강력함에 놀라워하지만, 그 지능의 기반이 수많은 사람들의 잘 관리되지 않은 “디지털 유산”이라는 사실을 받아들여야 합니다. 미래에는 규제가 강화될 것입니다만, 지금은 “개인 정보를 바꾸어 얻는 지능”의 게임이 계속되고 있습니다.