虎嗅

미국, 중국의 AI 기술을 “산업 규모의 정제 과정”이라고 비난: 이것은 지적 재산권 전쟁이 아니라 시장 진출을 둘러싼 전쟁입니다.

原文:美国指控中国AI“工业规模蒸馏”:这不是知识产权战,是准入战

미국, 중국 AI 기술에 대해 “도둑질” 혐의를 제기하다: 도대체 무엇을 두고 싸우는가?

안녕하세요, 여러분의 금융 전문 기자이자 경제학자입니다. 오늘은 겉보기에는 “기술적”인 문제처럼 보이지만 실제로는 “정치적” 색채가 짙은 중대한 사건에 대해 이야기하려고 합니다.

9월 8일, 미국 국가안보국(NSA), 사이버보안기반시설보호국(CISA), 연방수사국(FBI)이 공동으로 성명을 발표하여 DeepSeek, Moonlit Side, 알리바바 등 6개의 중국 AI 기업을 지목하고, 이들이 “산업 규모”의 지식 추출(knowledge distillation)을 하고 있다고 비난했습니다. 즉, 미국의 최첨단 AI 모델의 기술을 대량으로 “도용”하고 있다는 것입니다.

중국 상무부는 단호하게 반응했습니다: “근거가 없으며, 법적으로도 타당하지 않습니다.” 외교부는 이를 중국의 과학기술 자립의 결과라고 직접 밝혔습니다.

많은 비전문가들이 의문을 가질 수 있습니다: “지식 추출”이란 무엇인가? 미국은 왜 갑자기 “학습”에 대해 이렇게 화를 내는가? 이 뒤에는 어떤 음모가 있는가?

걱정하지 마세요, 이 소식을 자세히 분석하여 쉽게 설명해 드리겠습니다.

---

1. **지식 추출(Knowledge Distillation)이란 무엇인가? 미국은 왜 이를 “도둑질”이라고 보는가?**

먼저, 이번에 비난받은 핵심 기술인 지식 추출에 대해 이해해 보겠습니다.

이를 “선생님이 학생에게 가르치는” 것에 비유할 수 있습니다.

  • 전통적인 훈련: 선생님이 사진을 가리키며 “이것은 고양이, 이것은 개”라고 말합니다. 학생은 그대로 외웁니다.
  • 지식 추출: 선생님은 고양이라고 말할 뿐만 아니라 “80%는 고양이처럼 보이고, 15%는 개처럼 보이며, 5%는 여우처럼 보인다”고도 말합니다. 이러한 세밀하고 확률적인 판단을 “소프트 레이블(soft label)”이라고 하며, 여기에는 세상에 대한 선생님의 깊은 이해(즉, 이른바 “암묵지식)”가 담겨 있습니다.

중요한 점은:

1. 이것은 보편적인 기술입니다: 지식 추출은 중국이 발명한 것이 아니며, 2015년 노벨상 수상자인 힌튼(Hinton)이 이 개념을 제시했습니다. 미국의 거대 기업을 포함한 전 세계 모든 AI 기업들이 이를 사용하고 있습니다.

2. 합법 vs. 불법: 제 책을 사서 혼자 읽는 것은 합법입니다. 하지만 제 API를 통해 엄청난 양의 질문을 하고 그 답변으로 모델을 훈련시킨다면, 이는 이용자 계약 위반에 해당합니다.

미국이 왜 급하게 반응하는가?

미국은 중국 기업들이 정상적인 연구 개발을 하지 않고, “수백만 번의 상호작용”을 통해 미국의 최첨단 모델(예: Claude, GPT 시리즈)의 기능을 “빼앗고 있다”고 생각합니다.

미국의 논리는 이렇습니다: “당신은 훨씬 적은 돈과 컴퓨팅 파워로 ‘숙제를 베끼는’ 방식으로 제 수준에 도달했으니, 이 길을 허용할 수 없다.”

이는 마치 당신이 독점적인 레시피를 개발했는데, 경쟁자가 직접 식당에 가서 맛을 보고 그대로 복제하는 것과 같습니다. 비록 당신의 레시피를 훔치지는 않았지만, 실제로는 그 맛을 “도용한” 셈입니다.

---

2. 미국의 비난 내용: “물리적 봉쇄”에서 “지식 봉쇄”까지

이번 성명(AA26-251A)은 매우 구체적이며, 사실상 “증거에 기반한” 비난입니다. 미국이 어떤 “증거”를 확보했는지 살펴보겠습니다:

1. 규모가 매우 크다: 중국 기업들이 “수백만 번”의 모델 상호작용을 통해 “수십억 개의 토큰(token)”을 얻었다고 비난합니다.

2. 수단이 은밀하다:

  • 공식 API뿐만 아니라 제3자 플랫폼, 프록시 채널을 통해 접근했습니다.
  • 고급 계정을 대량으로 구매하여 여러 사람이 공유하고, 감지를 피하기 위해 채널을 자동으로 전환했습니다.
  • 심지어 “하류 훈련 데이터를 오염시킨다”는 혐의도 받고 있습니다. 즉, 의도적으로 모델에 잘못된 데이터를 제공하여 상대방의 반응을 살펴봅니다.

3. 목표가 명확하다: “추출” 대상에는 Anthropic의 Claude 시리즈, 구글의 Gemini 시리즈, OpenAI의 GPT 시리즈, xAI의 Grok 시리즈가 포함됩니다.

4. 능력 추출: 기본적인 대화뿐만 아니라 법률 전문성, 논리적 추론, 에이전트 기능과 같은 고가치 능력도 특별히 추출했습니다.

더 깊은 논리: 봉쇄선의 확장

  • 2022년: 칩(물리적 접근 차단).
  • 2023년: 광리소(제조 차단).
  • 2026년(현재): 모델 출력(지식 접근) 차단.

미국은 하드웨어를 막아도 중국이 오픈소스와 알고리즘 최적화를 통해 따라잡을 수 있다는 것을 알았습니다. 이제 미국은 **“지식의 흐름”을 막으려고 합니다. 칩은 몸이고, 모델의 능력은 영혼입니다. 미국은 중국 AI의 “영혼”에 미국 기술의 흔적이 남지 않도록, 또는 더 정확히 말하자면, 중국이 저비용으로 미국의 고가치 기술을 얻는 것을 원하지 않습니다.

---

3. 중국의 반격: 이것은 “도둑질”이 아니라 “계약 위반”

중국의 반응은 매우 차분하고 강력했으며, 핵심 논리는 세 가지입니다:

1. 기술 중립론: 지식 추출은 업계에서 흔히 사용되는 방법이며, 중국만의 것이 아닙니다. 미국 기업들도 중국의 오픈소스 모델(Llama나 Qwen을 기반으로 미세 조정)을 사용하고 있습니다. 당신이 저를 비난한다면, 당신도 마찬가지로 하고 있습니다. 이는 이중 기준입니다.

2. 법적 정의:

  • 미국의 관점: 이것은 “지적 재산권 침해”로서 형사 범죄이므로 국가안보기관을 동원합니다.
  • 중국/법률계의 관점: 지식 추출은 코드나 원본 훈련 데이터를 직접 복제하는 것이 아니며, “지식 형태”를 모방하는 것입니다. 법적으로는 저작권이나 특허 침해로 볼 수 없습니다. 가장 가능한 법적 근거는 “서비스 약관 위반”입니다.
  • 차이점: 위반은 민사 분쟁이므로 돈을 지불하면 되지만, 지적 재산권 침해는 형사 범죄로 처벌받습니다. 미국은 “위반”을 “범죄”로 포장하여 후속 제재의 명분을 만들고 있습니다.

3. 상업 독점론: 미국 기업들이 이용자 계약에 “강제 조항”을 설정(예: 경쟁 제품에 사용 금지)하고, 국가 안보기관이 이를 실행합니다. 이는 본질적으로 국가 권력을 이용한 상업 독점 보호입니다.

요약: 중국은 이것이 미국 거대 기업들이 시장 독점을 유지하기 위해 상업 경쟁을 국가 안보 문제로 부각시키는 것이라고 보고 있습니다.

---

4. 시기와 카드: 정상회담 전의 “칼을 들어보이기”

이 사건이 발생한 시점은 매우 미묘합니다: 중미 정상회담 워싱턴에서 3주도 채 남지 않았습니다.

국제 협상에서는 **“칼을 들어보이기”(Show the Knife)라는 전략이 있습니다.

  • 행동: 공식 협상 전에 먼저 강경한 태도를 보여주어 카드를 최대한 높이 올립니다.
  • 목적:

1. 기준선을 시험해 보기: 중국이 AI 분야에서 양보할지 확인합니다.

2. 압력을 가하기: 중국이 협상 테이블에서 압박을 느끼게 하여 다른 분야(예: 무역, 지정학)에서 양보를 이끌어냅니다.

3. 국내 정치: 미국 국민과 의회에 “우리가 미국의 기술 우위를 보호하고 있다”는 것을 보여줍니다.

중국의 반응도 여지를 남겼습니다: “대화할 의향이 있다”고 하지만, “압박을 가한다면 반격할 것”이라고 했습니다.

이는 양측 모두 완전히 대립하기를 원하지 않지만, 먼저 양보하고 싶어하지 않는다는 것을 의미합니다. 이것은 **“싸우면서 협상하는” 게임입니다.

---

5. 미래의 영향: AI 생태계의 “철의 장막”이 내려지는가?

이 사건의 가장 깊은 영향은 다음과 같습니다:

1. “지식 추출” 방식에 대한 타격

미국 모델 API에 의존하여 훈련을 하는 중국 AI 기업들에게는 경고 신호입니다.

  • 위험: 미국은 향후 법률을 통해 “모델 출력”을 수출 통제에 포함시킬 수 있습니다. 이가 시행되면, 미국 API를 사용하여 모델을 훈련하는 것이 “통제된 기술을 불법적으로 획득하는” 것으로 간주될 수 있습니다.
  • 결과: 이 길은 더 이상 갈 수 없을 것입니다. 기술적으로 불가능한 것이 아니라 **정치적, 법적으로 허용되지 않기 때문입니다.

2. “탈동”과 “독립적인 생태계”의 가속화

  • 국산 대체의 가속화: 중국 AI 기업들은 국산 컴퓨팅 파워(화웨이 승천 등)와 국산 기본 모델(Qwen, DeepSeek, GLM 등)을 사용하여 훈련을 가속화해야 할 것입니다.
  • 오픈소스 생태계의 독립: 중국은 미국 기술 스택과 독립된 오픈소스 모델 생태계를 구축하여 “목을 조이는” 것을 피할 수 있습니다.
  • 데이터 오염의 위험: 미국이 제안한 “하류 훈련 데이터 오염”은 API에 접근할 수 있더라도 얻은 데이터가 “오염될 수 있음”을 의미합니다. 이는 기업들이 미국 모델에 대한 의존을 완전히 끊어야 함을 의미합니다.

3. 글로벌 AI 생태계의 분열

미국이 “모델 능력”을 전략적 자원으로 삼아 봉쇄한다면, 글로벌 AI는 두 개의 진영으로 분열될 것입니다:

  • 미국 진영: 폐쇄형, 높은 장벽, 높은 비용, 높은 이익.
  • 중국 진영: 오픈소스,