虎嗅

Anthropic 연구원, AGI(인공지능)의 통제 불능에 우려하여 사임: 10년 이내에 인류 멸망을 초래할 수 있음

原文:Anthropic研究员因担心AGI失控而辞职:或十年内致人类灭绝

핵심 내용 요약

이것은 매우 중대한 업계 신호입니다. AI 분야의 두 거대 기업인 OpenAI와 Anthropic에서 3년간 핵심 예측 학습 연구를 수행한 경험이 풍부한 연구원 Jacob이 최근 “AI 보안을 가장 중시하는” 것으로 인정받는 Anthropic을 떠나 AI 업계 전체에서 완전히 탈퇴했습니다. 그는 최전선 AI 연구에 대해 가장 잘 아는 내부 인사로서 공개적으로 경고했습니다: 현재의 경쟁 압력 속에서 주요 AI 기업들은 위험 관리에 전혀 신경 쓰지 않고 있으며, 현재의 연구 속도로는 내년 말까지 AI가 “스스로를 더 강하게 만들어 인간이 막을 수 없는” 상태에 이를 수 있습니다. 현재 전 업계는 정부의 강제적인 규제도 없으며, 높은 평가를 받는 상업적 이익에 얽매여 있어서 가장 보안에 신경 쓰는 기업조차도 스스로를 보호할 수 없습니다. 그는 전 세계적인 규제와 업계 협력을 촉구하며 AI 연구에 제동을 걸 것을 요청하고 있습니다.

---

상세한 해석

1. 【이것은 외부인이 이슈를 이용하는 종말론적 소문이 아닙니다: 발언자의 신분이 매우 중요합니다】

많은 사람들이 “AI가 인류를 파괴할 것”이라는 말을 들으면 인터넷 유명인이 주목을 끌려는 것으로 생각하지만, 이번 경우는 다릅니다. Jacob은 실제로 AI 연구의 핵심 분야에서 3년간 일했으며, 업계 최고의 두 기업인 OpenAI와 Anthropic에서 근무했습니다. 더 중요한 것은, 그가 OpenAI에서 Anthropic으로 옮긴 이유가 바로 Anthropic이 “AI 보안을 가장 중시한다”는 점 때문이었습니다. 즉, 그는 원래부터 AI 보안 분야의 전문가였습니다.

이전에도 여러 주요 연구소의 보안 담당자들이 불만을 토로한 적이 있지만, 그들은 “보안이 부족한 기업”에서 “더 안전한 기업”으로 옮겼을 뿐입니다. 반면 Jacob은 보안을 가장 중시하는 것으로 인정받는 Anthropic에서도 절망하여 업계를 떠났습니다. 이는 마치 소방관으로 일하러 갔더니 소방대가 몰래 불을 지르고 있다는 것과 같은 상황입니다. 이러한 신호의 신뢰성은 외부 평론가들의 말보다 훨씬 높습니다.

2. 【그가 말하는 “내년에 AI가 통제 불능이 될 것”이라는 것은 무엇을 의미할까요?】

많은 사람들은 그가 AI가 영화에서처럼 인간을 공격할까 봐 두려워하는 것으로 생각하지만, 실제로는 “재귀적 자기 개선”이라는 메커니즘이 작동하는 것을 두려워합니다. 간단히 말해, 이전에는 인간 엔지니어들이 밤새도록 코드를 작성하고 파라미터를 조정하며 데이터를 제공하여 AI를 점차 더 강하게 만들었습니다. 하지만 이제 AI는 인간이 하는 많은 연구 작업을 대신할 수 있습니다. 예를 들어, AI 코드를 작성하거나 AI의 성능을 테스트하는 것도 가능합니다.

만약 언젠가 AI가 스스로 더 똑똑한 다음 세대의 AI를 개발할 수 있게 된다면, 이 메커니즘은 멈출 수 없게 됩니다. 새로운, 더 강력한 AI는 자신보다 2배 더 강한 AI를 만들어낼 수 있으며, 이러한 가속 속도는 기하급수적입니다. 인간이 반응하기도 전에 AI의 지능은 인간을 훨씬 능가할 것입니다. Jacob은 현재 모든 기업들이 이 목표를 향해 달려가고 있으며, 현재의 속도로는 내년 말까지 그 임계점에 도달할 수 있다고 예상합니다.

3. 두 거대 기업의 “무책임함”의 본질은 경쟁에 의해 멈출 수 없다는 것입니다】

Jacob은 두 기업의 상황을 매우 명확하게 보고 있습니다. OpenAI의 대부분의 사람들은 AI가 통제 불능이 되면 인류를 파괴할 수 있는 위험을 전혀 인식하지 못하고, 새로운 기능을 개발하여 트래픽과 수익을 얻는 데만 집중하고 있습니다. 반면 Anthropic은 상황이 더 복잡합니다. 모든 사람들이 AI의 위험성을 잘 알고 있지만, “수감자 딜레마”에 빠져 있습니다. 만약 보안을 강화하려고 노력하면 경쟁자가 더 강력한 AI를 먼저 개발할 것이고, 그렇게 되면 돈, 시장, 발언권이 모두 경쟁자의 것이 됩니다. 결국 보안을 중시하지 않는 팀이 위험한 AI를 개발할 수도 있습니다. 그래서 그는 모두가 멈출 수 없는 상황에 처해 있다고 말합니다.

4. 현재 초강력 AI를 개발하는 상황은 과거 핵폭탄을 개발하던 시기보다 10배 더 미친 것입니다】

Jacob은 현재의 AI 연구를 “엔지니어들의 MacBook에서 이루어지는 맨해튼 프로젝트”에 비유했습니다. 이 비유는 매우 정확합니다. 과거 미국이 핵폭탄을 개발할 때는 전국의 힘이 모여 뉴멕시코 사막의 지하 벙커에 수천 명의 과학자들을 모았고, 군대가 24시간 내내 경비를 서며, 모든 연구 단계가 정부 고위층의 승인을 받아야 했습니다. 전 세계가 이를 주시했습니다.

하지만 지금은 어떻습니까? 인류의 미래를 결정할 수 있는 초강력 AI가 실리콘밸리의 몇몇 스타트업 사무실에서 엔지니어들이 자신의 노트북으로 코드를 작성하여 개발되고 있습니다. 정부의 승인도 없고 군사적 통제도 없으며, 소위 “보안 협약”도 몇몇 기업의 경영자들이 자발적으로 서명한 약속에 불과합니다. 이는 마치 핵폭탄 개발 권한을 스타트업 팀에게 넘긴 것과 같습니다. 누가 먼저 개발하면 수십억, 수백억 달러의 투자를 받을 수 있습니다. 이것이 정상적인 상황인가요?

5. 2조 달러의 평가 가치: 돈 앞에서 보안 약속은 무력합니다】

가장 아이러니한 것은 현재 Anthropic이 IPO를 준비하고 있으며, 그 평가 가치는 2조 달러에 달할 것입니다. 이는 모든 보안 약속을 무의미하게 만듭니다. 2조 달러의 평가 가치를 유지하려면 투자자들에게 “내 AI의 능력은 점점 더 강해져 전 세계 모든 산업에 침투하여 구글과 애플이 합친 것보다 더 많은 돈을 벌 것”이라는 이야기를 해야 합니다.

하지만 곧바로 대중에게는 “내 AI가 일정 수준에 도달하면 연구를 중단하고 막대한 비용을 들여 보안을 강화할 것”이라고 말해야 합니다. 이 두 가지는 근본적으로 모순입니다. 투자자들은 수십억 달러를 투자하여 더 많은 돈을 벌기를 원하지만, 만약 보안을 위해 연구 속도를 줄인다면 다음 날 투자자들은 경영진을 전부 교체할 수 있습니다. 설령 Anthropic이 진심으로 보안을 중시한다고 해도, “보안을 위해 수천억 달러의 시장 가치를 잃을 수밖에 없는” 상황에 이르면 아무도 그 압력을 견딜 수 없습니다.