핵심 내용 요약
이 보도는 현재 엄청난 인기를 끌고 있는 대형 모델(AI) 산업에 차가운 물을 끼얹는 것과 같습니다. 현재 모든 주류 AI 제품(GPT부터 국내의 통의천문에 이르기까지)의 기반 기술은 2017년 구글이 제안한 Transformer 기술입니다. 이 기술은 지난 7년 동안 AI 산업을 전례 없는 수준으로 이끌었지만, 이제는 성능의 한계에 도달했습니다. 최근에 등장한 “장문 상호작용 기능”이나 “추론 속도 향상”과 같은 새로운 기능들은 사실 기존 기술의 본질적인 결함을 보완하는 것에 불과하며, 연산 비용의 급격한 상승, 에너지 소비의 증가, 복잡한 작업 수행 능력의 부족과 같은 근본적인 문제를 해결하지 못합니다.
현재 역사적 부담이 없는 일부 AI 스타트업들은 네 가지 완전히 다른 기술적 돌파구를 모색하고 있으며, 이를 통해 대형 모델의 속도를 수배로 높이고 비용을 극적으로 줄일 수 있으며, 현재 Transformer로는 불가능한 복잡한 추론 작업도 수행할 수 있습니다. 이들은 다음 AI 산업의 돌파구가 될 가능성이 높으며, 현재의 경쟁 구조를 완전히 바꿀 수도 있습니다.
---
상세한 설명
1. 과거의 AI “신기술”이 왜 이제는 걸림돌이 되었을까?
Transformer의 핵심 장점이 바로 현재의 가장 큰 약점입니다. 이 기술은 텍스트를 처리하는 논리가 매우 엄격합니다. 예를 들어, 1만 자의 텍스트를 입력하면 각 문자가 나머지 9,999개의 문자와 하나하나 비교되어 연관성을 계산해야 합니다. 이는 마치 1만 자 분량의 글을 읽으면서 모든 문자 조합을 고려해야만 전체 의미를 파악할 수 있는 것과 같습니다. 이 방식은 정확도는 높지만, 비용이 매우 많이 듭니다. 1만 자의 텍스트를 처리하는 데 5,000만 번의 곱셈 연산이 필요하며, OpenAI는 매년 연산 능력 구매에만 50억 달러를 지출합니다. 국제에너지기구(IEA)는 2030년까지 전 세계 데이터 센터의 전력 소비가 두 배로 증가할 것으로 예상하며, 이는 마치 유럽 연합의 전력 사용량의 절반에 해당하는 양입니다.
더 큰 문제는 AI가 처리해야 할 작업이 점점 더 복잡해지고 있다는 것입니다. 예를 들어, 코드 라이브러리 전체를 읽거나 몇 주 동안 자동으로 연구 작업을 수행하거나 수십만 개의 수학 문제를 해결하는 것과 같은 작업은 Transformer의 엄격한 처리 방식으로는 감당할 수 없습니다. 현재 사용되는 장문 상호작용 기능들은 사실 20년 전의 구형 컴퓨터에 외부 하드디스크를 10개 연결하여 최신 3A 게임을 실행하려는 것과 같은 임시적인 해결책에 불과합니다.
2. 주의력 메커니즘의 개선: 불필요한 계산을 90% 줄이면서도 성능은 그대로 유지
첫 번째 돌파구는 현실적입니다. Transformer의 기본 프레임워크를 바꾸지 않고, 가장 많은 에너지를 소비하는 “문자별 비교” 과정을 개선하여 불필요한 계산을 모두 제거하는 것입니다. 이전에도 비슷한 “스파스 주의력(sparse attention)” 기술이 있었지만, 계산량을 줄인 후에는 AI의 의미 이해 능력이 저하되었습니다. 그러나 두 스타트업(Subquadratic와 Manifest AI)이 이 문제를 해결했습니다. Subquadratic는 동적 필터링 메커니즘을 사용하여 AI가 글을 읽을 때 중요한 정보와 불필요한 단어를 실시간으로 구분하여 중요한 단어들만 비교하도록 합니다. 이로 인해 성능이 시장의 주류 대형 모델과 동등해졌으며, 수만 명의 사람들이 이 기능을 사용하기 위해 대기 중입니다. Manifest AI는 기존의 전체 주의력 메커니즘을 “롤링 요약(rolling summary)” 방식으로 대체했습니다. 이는 마치 3시간 동안 회의를 진행한 후 요약을 작성하는 것과 같아서 모든 사람의 말을 모두 기록할 필요가 없으며, 관련된 내용만 지속적으로 업데이트하면 됩니다. 이로 인해 계산량이 크게 줄었으며, 기존의 오픈소스 대형 모델도 기존 코드를 수정하지 않고 이 기능을 사용할 수 있습니다. 이를 통해 AI가 몇 주 동안 작업을 수행하거나 장시간 동안 비디오를 분석할 때도 성능이 저하되지 않습니다.
3. 반직관적인 접근: 대형 모델을 사용하지 않고도 소형 모델이 더 똑똑하고 에너지 효율적
현재 업계에서는 “대형 모델의 파라미터가 클수록 더 똑똑하다”는 것이 일반적인 인식입니다. 하지만 MIT에서 출신한 Liquid AI는 이와 반대의 접근을 취했습니다. 이들은 웜의 뇌에서 영감을 얻은 “액체형 신경망(liquid neural network)”과 Transformer를 결합하여 만든 모델을 개발했으며, 이 모델의 크기는 일반 대형 모델의 몇 분의 일에 불과하지만 성능은 4배 더 뛰어납니다. 일반적인 Transformer 대형 모델은 훈련이 완료되면 모든 행동 패턴이 고정되어 있어 새로운 기능을 추가하려면 다시 훈련하거나 더 많은 파라미터를 추가해야 합니다. 반면, 이 액체형 모델은 자가 적응 능력이 있어 실시간으로 새로운 정보에 따라 사고 방식을 조정할 수 있습니다. 이는 마치 사람이 새로운 자료를 보면서 새로운 지식을 배우는 것과 같습니다. 이 모델은 50달러짜리 라즈베리파이 개발 보드에서도 실행할 수 있으며, 저가형 차량용 칩에서도 작동할 수 있습니다. 연매출 1,000만 달러 미만의 소규모 기업도 무료로 사용할 수 있어 대형 모델의 사용 장벽을 낮췄습니다. 이로 인해 모든 작업을 클라우드 서버에 의존하지 않고도 스마트폰에서 고성능 AI를 사용할 수 있으며, 개인 정보 유출이나 응답 속도 문제를 걱정할 필요가 없습니다.
4. 문자별 처리의 문제를 해결하기: AI가 한 번에 전체 내용을 출력하도록 하여 속도를 10배 향상
AI 채팅 도구를 사용해 본 사람이라면 AI가 한 번에 한 자씩 내용을 출력하는 것을 알고 있을 것입니다. 이는 제품의 의도적인 설계가 아니라 Transformer의 본질적인 한계입니다. AI는 첫 번째 문자를 계산한 후에만 다음 문자를 계산할 수 있어 효율이 매우 낮습니다. 최근에는 이미지 생성 분야에서 성공적인 “확산 기술(diffusion technology)”을 텍스트 대형 모델에 적용하는 회사들이 등장했습니다. 이 기술은 화면에 흩어진 점들을 한 번에 고해상도 이미지로 변환하는 것과 같으며, 이를 텍스트 대형 모델에 적용하여 계산량을 줄이고 성능을 향상시켰습니다.
5. 결론
이러한 기술들은 AI의 성능과 에너지 효율성을 크게 향상시킬 수 있으며, 새로운 응용 분야를 열어줄 것입니다. 이러한 기술들은 우리의 삶을 더 편리하고 효율적으로 만들어 줄 것입니다.