“가장 안전한” AI 기업이 “벌거벗은 채로 달리기” 시작: 신뢰, 돈, 생존에 관한 게임
안녕하세요, 여러분의 금융 전문 기자입니다. 오늘 우리가 이야기할 것은 지루한 기술 보고서가 아니라 실리콘밸리의 최상위층에서 벌어진 “신뢰 위기”에 관한 이야기입니다.
이야기의 주인공은 AI 업계에서 “가장 규칙을 잘 지키고, 안전을 가장 중시하는” 기업으로 알려진 Anthropic입니다. 핵심 인물은 입사한 지 4개월밖에 되지 않은 연구원 Jacob Coxon입니다. 그는 2026년 9월 8일 갑자기 사임하며 이렇게 말했습니다: “Anthropic과 OpenAI 두 회사 모두 인류의 생명을 위험에 빠뜨리고 있습니다. 초지능을 추구하기 위해 안전의 기준을 포기하고 있습니다.”
이 사건이 큰 반향을 일으킨 이유는 단순히 사임했다는 사실 때문이 아니라, Coxon이 말한 진실 때문입니다: “저는 지분 소유권이 확정되기 전에 떠났습니다. 더 이상 Anthropic의 가치를 높여서 이익을 얻을 필요가 없습니다.”
상상해 보세요. 손에 거액의 복권을 들고 있지만, 그 복권을 찢어버린다고 합시다. 왜냐하면 그 회사가 잘못된 일을 하고 있다고 생각하기 때문입니다.
오늘 우리는 이 사건의 배경에 있는 논리를 쉬운 말로 풀어보고, 도대체 무슨 일이 일어났는지 살펴보겠습니다.
---
1. “브레이크 패드”에서 “장식 스트립”으로: 안전 약속의 조용한 변화
먼저, Anthropic이 무엇을 바꾸었는지 알아봅시다.
2023년, Anthropic은 “책임감 있는 확장 정책”(RSP)을 발표했습니다. 그 안에는 자동차의 “긴급 브레이크 시스템”과 같은 매우 중요한 약속이 포함되어 있었습니다:
> “만약 우리의 안전 조치가 충분하지 않다면, 더 강력한 모델을 훈련하는 것을 **중단해야 합니다.”
이것은 “할 수 없다면 계속할 수 없다”는 엄격한 제한이었습니다. 당시 이것은 Anthropic의 대표적인 특징이자 OpenAI(속도를 추구하는)와의 차별점이었습니다.
하지만 2026년 2월, Anthropic은 RSP 3.0을 발표했습니다. 이번 업데이트에서 그 “긴급 브레이크”는 사라졌습니다. 대신 더 복잡한 “계기판”이 등장했습니다: 로드맵, 위험 보고서, 외부 감독 등입니다.
쉽게 말해보면:
이전에는 “브레이크가 고장 나면 차를 세웁니다.”
이제는 “브레이크에 약간의 문제가 있어도, 왜 계속 운전하는지 설명하는 보고서를 작성하고 계기판을 보며 운전합니다.”
Anthropic은 AI의 능력 한계가 너무 모호해서 언제 멈춰야 할지 정확히 정의할 수 없기 때문에 엄격한 브레이크가 적용되지 않는다고 설명합니다. 이 말은 일리가 있지만, 문제는 왜 2년 전에 이 약속을 대표적인 특징으로 삼았을까요? 왜 IPO 직전에 바꾸었을까요?
더욱 우려스러운 것은 같은 시기에 Anthropic이 향후 10년간 5170억 달러 규모의 컴퓨팅 파워 계약을 체결했다는 것입니다. 미래 10년간의 “연료비”를 미리 확정한 회사가 브레이크를 밟기 어렵습니다. 안전 약속은 “우리가 무엇을 하지 않을 것인가”에서 “우리가 무엇을 했는지 어떻게 설명할 것인가”로 변했습니다.
2. 사라진 두 단어: OpenAI도 “화장을 지우고 있습니다”
Anthropic만이 문서를 바꾸는 것이라고 생각하셨나요? 아닙니다, OpenAI도 움직이고 있습니다.
OpenAI는 2025년 11월에 발표한 연례 세금 보고서(990 표)에서 자신의 사명을 조용히 수정했습니다.
- 이전에는: “안전하게” 모든 인류에게 이익을 주는 범용 인공지능을 구축하며, **재정적 보상의 요구에 구속되지 않습니다.”
- 지금은: “범용 인공지능이 모든 인류에게 이익을 주도록 합니다.”
주목하세요, 두 단어가 사라졌습니다:
1. “안전하게”(safely): 안전에 대한 약속이 약해졌습니다.
2. “재정적 보상의 요구에 구속되지 않습니다”: 돈에 대한 약속이 사라졌습니다.
이는 OpenAI가 더 이상 인류의 안전을 위해 존재한다고 강조하지 않으며, 자본 이익에서 독립적이라고 주장하지 않는다는 것을 의미합니다. 이제는 순수하게 이익을 극대화하는 기술 거대 기업처럼 보입니다.
동시에 OpenAI는 2년 안에 세 개의 핵심 안전 팀을 해체했으며, 유명한 “슈퍼 얼라인먼트 팀”도 포함되어 있습니다. Ilya Sutskever와 같은 전문가도 안전 관련 회사를 설립하기 위해 떠났습니다.
해석:
이 두 기업은 같은 시기에 “안전”의 경계를 재정의하고 있습니다. 이것은 단순히 한 기업의 도덕적 타락이 아니라, 자본과 경쟁 압력 하에서 전체 업계의 집단적인 변화입니다. “안전”이 더 이상 협상할 수 없는 전제가 아니라 협상 가능한 변수가 되었을 때, 위험이 시작됩니다.
3. 해결할 수 없는 역설: 더 안전하기 위해서는 더 빨라야 하나?
Coxon은 인터뷰에서 두 가지 매우 충격적인 말을 했습니다. 이는 AI 업계의 딜레마를 드러냅니다:
1. “경쟁 압력에 직면하면, 우회로를 찾거나 감독 과정을 건너뛰어야 합니다.”
2. “OpenAI와 중국에 대한 과도한 편견은 때때로 가속화를 정당화하는 이유로 사용됩니다.”
이것은 끔찍한 “안전 역설”을 만듭니다:
- 논리 A: 만약 Anthropic이 안전 평가를 천천히 진행한다면, OpenAI나 중국의 경쟁자가 먼저 초지능을 만들어낼 것입니다.
- 논리 B: 경쟁자가 먼저 만들어내고, 그들의 안전 조치가 Anthropic보다 떨어진다면, 전 세계의 안전 위험이 통제 불능이 됩니다.
- 결론: “더 안전하기” 위해서는 (안전하지 않은 사람이 먼저 초지능을 만드는 것을 막기 위해) Anthropic은 “더 빨리” 초지능을 실현해야 합니다.
- 결과: 하지만 “더 빨리”는 훈련, 평가, 출시 시간을 단축하는 것을 의미하며, 연구자들이 모델의 내부 메커니즘을 이해하고 위험한 행동을 검사하는 시간이 줄어듭니다.
쉬운 말로 요약하면:
“더 안전하기 위해서는 더 빨리 달려야 합니다. 하지만 더 빨리 달릴수록 더 안전하지 않습니다.”
Coxon이 사임한 이유는 Anthropic을 싫어해서가 아니라, 이러한 경쟁 구조에서 어떤 기업도 단독으로 안전을 유지할 수 없다는 것을 발견했기 때문입니다. 이것은 시스템적인 딜레마입니다. 다른 회사로 옮겨도 소용이 없습니다. 왜냐하면 전체 경주가 가속화되고 있으며, 브레이크를 밟는 사람은 탈락하거나 경쟁자에게 추월당할 것이기 때문입니다.
4. 3일 만에 서비스 중단: 안전은 “사후 대응”에 의존하며, “사전 예방”이 아닙니다
기사에서는 중요한 사건을 언급합니다: 2026년 6월의 “Fable 5” 사건입니다.
Anthropic은 새 모델 Fable 5를 발표했습니다. 이틀 후, 아마존 CEO가 백악관에 전화를 걸어 이 모델에 버그가 있으며 “탈옥”될 수 있다고 말했습니다(안전 제한을 우회할 수 있다는 뜻). 백악관은 긴급 회의를 열었고, 상무부는 수출 규제 명령을 내려 Fable 5의 전 세계 서비스가 중단되었습니다.
발표부터 서비스 중단까지 단 3일이 걸렸습니다.
여기에 잔인한 사실이 있습니다:
모델을 중단시킨 것은 Anthropic 내부의 변경된 ‘안전 레드라인’이 아니라 위험이 이미 발생한 후의 정부의 강제적인 개입이었습니다.
이것은 무엇을 의미할까요? Anthropic의 안전 약속이 결정적인 순간에 “사전 차단” 역할을 하지 못했다는 것을 의미합니다. 그것은 더 많은 “사후 공공 관계 관리”나 “사후 준수” 도구에 가까웠습니다. 위험이 충분히 크면, 외부 세력(정부)이 3일 안에 반응합니다. 하지만 문제는 위험이 이미 발생했다는 것입니다.
RSP 3.0에서 변경된 그 레드라인은 원래 위험이 발생하기 전에 작동해야 했습니다. 이제는 효과가 없습니다. 우리가 본 것은 “예방”이 아니라 “사고 처리”입니다.
5. 투자자의 악몽: 안전 약속은 얼마나 가치가 있을까?
마지막으로, 자본 시장으로 시선을 돌려봅시다.
Anthropic의 가치는 2조 달러에 달하며, 그들의 브랜드 스토리는 “우리는 가장 안전한 AI 기업입니다.” 투자자들이 구매하는 것은 모델의 능력만이 아니라 이 “안전 거버넌스”의 약속입니다.
하지만 안전 약속이 경쟁 압력에 의해 수정될 수 있다면, 그 가치는 투자 판단에서 **할인되어야 합니다.
- Morningstar 보고서에 따르면: Fable 5 사건으로 인해 안전 약속이 재정적 위험이 되었습니다.
- David Sacks(미국의 기술 자문가)는 말합니다: 조사가 명확해질 때까지 Anthropic의 IPO는 중단되어야 합니다.
이것이 일반 사람들에게 무엇을 의미할까요?
1. 브랜드 프리미엄 붕괴: “안전”이 단지 마케팅 수사라면, Anthropic의 가치 기반은 흔들립니다.
2. 규제 위기: 규제 기관이 그들의 “안전 약속과 실제 행동이 일치하지 않는다”고 판단하면, 이는 공공 관계 위기뿐만 아니라 법적 준수 위기입니다.
3. 신뢰 투표: Coxon이 지분을 포기한 것은 이 문제에 대한 “불신 투표”와 같습니다. 그는 자신의 돈으로 시장에 이렇게 말했습니다: “이 시스템이 스스로를 바로잡을 수 있다고 믿지 않습니다.”
결론:
Coxon이 포기한 지분은 2조 달러의 가치 앞에서는 사실상 미미합니다. 하지만 그의 말은 중요합니다.
이 말은 AI 업계의 가장 화려한 기포를 뚫었습니다: **우리는 더 안전한 미래를 만들고 있다고 생각하지만, 실제로는 더 비싸고, 더 통제 불능하며, 정부의 최종적인 지원이 필요한 기계를 만들고 있습니다.”
“안전”이 “우리가 무엇을 하지 않을 것인가”에서 “우리가 무엇을 했는지 어떻게 설명할 것인가”로 변했을 때, 우리가 잃은 것은 기술적인 브레이크뿐만 아니라 도덕적인 기