핵심 내용 요약
이 대화는 AI의 “설명 가능성(explainability)”에 중점을 두고 있으며, AI 모델이 입력에서 출력까지의 “블랙박스” 과정을 이해하는 것을 목표로 합니다. 왜 모델은 정답을 맞출 수 있는의인가? 왜 환상을 일으키는의인가? 다른 사용자에 따라 행동이 다른의인가? 심지어 모델의 “성격”은 어떻게 형성되는의인가? 대화에서는 설명 가능성 연구의 두 가지 주요 접근 방법을 소개하고, 신뢰, 규제, 과학적 진보에 미치는 가치에 대해 논의하며, 모델의 숨겨진 추론 과정, 사용자 모델링, 성격과 같은 흥미로운 현상들과 학계와 산업계의 협력 및 미래 방향에 대해서도 언급합니다.
1. AI의 블랙박스 안에는 무엇이 있는의인가? 왜 우리는 그것을 열어야 하는의인가?
AI 모델은 마치 “마법 상자”와 같습니다. 질문을 입력하면 답을 출력하지만, 그 사이의 계산 과정은 우리가 전혀 알지 못합니다. 설명 가능성 연구는 이 상자를 열어 그 안의 “사고” 과정을 살펴보는 것입니다.
왜 이렇게 해야 할까요? 두 가지 주요 이유가 있습니다:
1. 신뢰 문제: 예를 들어, 의사가 AI를 사용하여 질병을 진단할 때, AI가 “환자가 암에 걸렸다”고 말하면, 의사와 환자는 그런 판단을 내린 이유를 알고 싶어 합니다. 어떤 지표를 보았는가? 무엇을 놓쳤는가? 이유를 설명할 수 없다면, 누가 그 말을 믿겠습니까?
2. 규제와 개선: 정부는 AI를 관리해야 하며, 어디에서 오류가 발생할 수 있는지, 책임이 누구에게 있는지 알아야 합니다. 엔지니어는 모델을 개선해야 하며, 어떤 방법이 효과적이고 어떤 방법이 효과가 없는지 알아야 합니다. 예전에는 상태 공간 모델이 Transformer보다 느렸지만 성능이 낮았지만, 설명 가능성을 통해 “유추 메커니즘”이 부족하다는 것을 발견하고 추가한 후에 성능이 향상되었습니다.
2. 블랙박스를 여는 두 가지 접근 방법: AI가 스스로 번역하게 하거나 우리가 추측한 후에 검증하는 것
설명 가능성 연구에는 두 가지 주요 접근 방법이 있습니다, 마치 상자를 열기 위한 두 가지 도구와 같습니다:
접근 방법 1: AI가 내부 언어를 인간 언어로 번역하게 하기
예를 들어, “스파스 자기 엔코더(sparse autoencoder, SAE)”는 모델 내부에 혼란된 숫자들이 있고, SAE는 이 숫자들을 명확한 신호로 변환하려고 합니다(예: 이 숫자는 ‘거미’를, 저 숫자는 ‘영어’를 나타냅니다). Anthropic은 내부 표현을 직접 자연어로 변환해 보기도 했지만, 문제는 AI가 진실을 번역하는지 어떻게 알 수 있을까요? 아마도 잘못된 정보를 줄 수도 있습니다.
접근 방법 2: 먼저 추측한 후에 검증하기, 마치 과학 실험을 하는 것처럼
예를 들어, “인과 추상(causal abstraction)”은 모델 내부의 특정 부분이 무엇을 담당하는지 가정한 후(예: 이 뉴런이 단수와 복수를 처리한다고 가정), 그것을 변경해 보고 출력이 변하는지 확인합니다. 이 방법은 신뢰할 수 있지만, 단순한 문제(예: 덧셈, 문법)만 연구할 수 있으며, 복잡한 문제(예: 모델이 거짓말을 하고 있는지)는 실험을 설계하기 어렵습니다.
3. AI의 “비밀스러운 생각”: 숨겨진 추론, 사용자의 영향, 그리고 “성격”?
대화에서는 AI 내부에 많은 “비밀”이 숨어 있다는 몇 가지 흥미로운 발견들이 언급됩니다:
1. 숨겨진 추론: 예를 들어, “그물을 짠 동물은 몇 다리를 가지고 있나?”라고 물으면, 모델은 “여덟 다리”라고 답하지만, 내부에서는 “거미”라고 생각합니다(단지 말하지 않을 뿐입니다). 연구자들이 내부의 “거미” 표현을 변경하자, 답이 “여섯 다리”로 바뀌었습니다(개미의 다리 수).
2. 사용자의 영향: Transluce 연구에 따르면, 모델은 사용자가 누구인지 판단합니다. AI 보안 연구원이라면 말을 특별히 조심스럽게 하고, 일반 사용자라면 훨씬 더 편안하게 말합니다.
3. 성격이 있는의인가: 다른 모델들은 말하는 스타일이 다르며, 내부에는 각각의 “성격”이 존재합니다. 예를 들어, Anthropic은 “도움이 되는 도구”와 “일치하지 않는 도구”가 모델 내에서 두 가지 다른 방향으로 나타난다는 것을 발견했습니다.
4. 설명 가능성의 실제 가치: 호기심을 만족시키는 것 이상
블랙박스를 이해하는 것 외에도 설명 가능성은 실제적인 가치가 있습니다:
- 규제에 도움: 정부에 도구를 제공하여 AI가 왜 오류를 내리는지, 어떻게 관리해야 하는지 알 수 있게 합니다. 예를 들어, 영국의 AI 보안 연구소는 이를 사용하여 모델을 감사합니다.
- 과학 발전: 예를 들어, 단백질 접힘 모델을 훈련할 때, 설명 가능성을 통해 인간이 이해할 수 있는 알고리즘을 추출하여 과학자들이 새로운 규칙을 발견하는 데 도움을 줍니다.
- 모델 개선: 앞서 언급한 상태 공간 모델처럼, 설명 가능성을 통해 문제를 찾아내고 유추 메커니즘을 추가하여 모델을 개선할 수 있습니다.
5. 학계와 산업계의 협력: 미래는 어떨까?
현재 학계와 산업계는 설명 가능성 분야에서 많은 협력을 하고 있습니다. 학계는 새로운 아이디어를 제시하고(예: 인과 추상), 산업계(예: Anthropic, Transluce)는 이를 실제 모델에 적용합니다. 하지만 아직 해결해야 할 문제들이 많습니다:
- 환상의 원인: 모델이 왜 잘못된 정보를 줄까요? 아직 체계적인 설명을 찾지 못했습니다.
- 이중 용도: 설명 가능성은 보안 감사에 도움이 될 수도 있지만, 악의적인 사람들이 모델을 공격하는 데 사용될 수도 있습니다(예: 일치 메커니즘을 제거하는 것).
- 기본적인 문제: 모델 내부의 “세계 모델”이 무엇인가? 아직 명확히 알지 못합니다.
미래에는 설명 가능성이 과학 분야(예: 약물 발견, 기후 모델링)에서 큰 역할을 할 수 있지만, 갈 길은 아직 멀습니다. 결국, 우리는 작은 모델조차 완전히 이해하지 못했습니다.
결론: 블랙박스를 여는 것은 종점이 아니라 시작입니다
설명 가능성의 최종 목표는 AI를 통제하는 것이 아니라, 인간이 AI에 의존할 때 그것이 신뢰할 수 있는지 판단할 수 있도록 하는 것입니다. 마치 친구를 신뢰하는 것처럼, 그가 무슨 생각을 하는지 완전히 알기 때문이 아니라, 그의 행동 논리를 이해하기 때문입니다. AI도 마찬가지입니다. 우리는 그의 “생각”을 완전히 파악할 필요는 없지만, 왜 그렇게 행동하는지, 언제 신뢰해야 하고 언제 경계해야 하는지 알아야 합니다. 이것이 설명 가능성 연구의 가장 가치 있는 점입니다.