虎嗅

**소비자용 그래픽 카드로 대형 모델 구축, 일반인도 토큰을 자유롭게 사용할 수 있을까?**

原文:消费级显卡部署大模型,普通人Token自由了?

핵심 내용 요약

DeepSeek가 갑작스럽게 가격을 대폭 인상하면서(피크 시간대 출력 비용 350%, 캐시 입력 비용 12배 증가), 이 모델의 API를 사용하는 개발자들은 큰 불편을 겪고 있습니다. 이때 알리바바가 오픈소스로 공개한 Qwen3.8-27B 모델이 “시의적절한 구원자”가 되었습니다. 단 270억 개의 파라미터만으로도 2840억 개의 파라미터를 가진 플래그십 모델과 동등한 성능을 발휘하며, 일반 소비자용 그래픽 카드(예: RTX3090/4090)에서도 구동이 가능해 개발자들이 API 토큰을 구매할 필요가 없게 되었습니다. 커뮤니티에서는 이 모델의 배포 방법을 열심히 연구하고 있지만, 사용 시 발생하는 문제점과 적합한 사용자층도 함께 밝혀지고 있습니다.

1. Qwen3.8-27B가 왜 이렇게 인기가 있는가? – 적은 파라미터로도 플래그십급 성능을 내며 가성비가 뛰어남

많은 사람들은 모델의 파라미터가 많을수록 좋다고 생각하지만, Qwen3.8-27B는 이러한 고정관념을 깨뜨렸습니다:

  • 성능이 기대를 초월함: 단 270억 개의 파라미터로도 2840억 개의 파라미터를 가진 DeepSeek V4 Flash와 동등한 성능을 내며, 40~150억 개의 파라미터를 가진 중형 모델들보다도 뛰어납니다. 비결은 “더 긴 추론 과정”에 있습니다. 모델은 더 많은 단계를 거쳐 추론을 수행함으로써 시간을 통해 더 좋은 결과를 얻습니다.
  • 비용 효율성이 가장 높음: 동일한 성능을 내면서 가장 낮은 비용을 소모하며, 동일한 비용으로는 가장 좋은 결과를 얻습니다(전문 용어로 “파레토 최전선”이라고 함). 예를 들어, 한 작업을 수행할 때 Qwen3.8-27B는 0.5달러로 51점을 얻는 반면, Claude Opus는 6달러를 지불해야 59점을 얻으며, 1점을 더 얻기 위해 비용이 거의 두 배로 증가합니다.
  • 로컬에서 구동 가능: 이것이 가장 중요한 점입니다. 일반 소비자용 그래픽 카드에서도 구동이 가능해 가격이 인상된 API에 의존할 필요가 없습니다.

2. 어떻게 소비자용 그래픽 카드에서 구동할 수 있을까? – 압축과 예측 기반의 디코딩을 통해 속도를 향상시킴

270억 개의 파라미터를 가진 모델을 소비자용 그래픽 카드(예: 24GB 메모리의 RTX3090)에서 구동하기 위해 커뮤니티는 두 가지 핵심 기술을 사용했습니다:

  • 모델 압축: 모델을 고정밀도(BF16)에서 저정밀도(4비트 가중치 + 16비트 활성화)로 압축하고, 일부 모듈을 더 작은 크기의 int8/int4로 변환함으로써 모델의 크기를 15~17GB로 줄였습니다. 캐시를 포함해도 총 22.3GB로, 24GB 메모리에 충분히 저장할 수 있으며 64K 긴 상황도 처리할 수 있습니다.
  • 예측 기반의 디코딩: 간단히 말해 “먼저 추측하고 검증하는” 방식입니다. 가벼운 모델을 사용해 토큰을 추측한 후, Qwen3.8이 한 번에 검증을 수행합니다. 정확한 결과만 남기고 잘못된 결과는 다시 처리합니다. 이 방식은 개별적으로 토큰을 생성하는 것보다 훨씬 빠르며, 출력 결과도 예측하지 않는 경우와 동일한 품질을 유지합니다. 실제 테스트에서는 초당 381개의 토큰을 처리할 수 있었으며(일반 채팅의 경우 초당 133개의 토큰), 독립 개발자의 경우 성능이 2.28배 향상되었습니다.
  • 품질의 영향은 적음: 압축 후에도 코드 생성, 명령어 처리 등의 기본 기능은 거의 변하지 않았지만(테스트에서 90% 이상 정상적), 장거리 코드 재구성과 같은 경우에는 영향이 있을 수 있습니다.

3. 실제 사용 시 주의해야 할 문제점들

그래픽 카드를 구입했다고 해서 바로 사용할 수 있는 것은 아닙니다. 다음과 같은 문제점들을 주의해야 합니다:

  • 메모리 요구 사항: 24GB 메모리(RTX3090/4090)를 사용할 때 가장 좋은 성능을 얻을 수 있으며, 16GB 메모리로도 가능하지만 상황 처리에 제한이 있습니다. 12GB 메모리의 그래픽 카드(예: 2개의 16GB 5060 Ti)를 사용할 경우 통신 손실로 인해 성능이 느려질 수 있습니다(초당 23개의 토큰만 처리 가능).
  • 동시 처리 제한: 8개 이상의 작업을 동시에 실행하면 속도가 느려지며, 첫 응답 시간도 5초에서 11초로 증가합니다.
  • 장거리 상황 처리의 속도: 64K 상황은 처리할 수 있지만, 32K 문서의 경우 첫 응답에 29초가 소요되며, 60K 문서는 59초가 소요됩니다. 장거리 문서를 처리할 때는 먼저 압축하거나 분할하는 것이 좋습니다.
  • 추론 설정: 기본 설정의 최고 단계(xhigh)에서는 최종 결과가 나오지 않을 수 있습니다(예: 12K 토큰을 모두 입력해도 결론이 나오지 않음). 설정을 medium으로 낮추면 정확도가 높아지며(73% → 93%), 비용도 절반으로 줄어듭니다.

4. 누가 로컬에서 구동하기에 적합한가? – 세 가지 유형의 사용자는 이점이 있으며, 두 가지 유형의 사용자는 신중해야 합니다

  • 적합한 사용자:

1. 고도로 사용하는 사용자: API 사용 비용이 월간 수천 달러에 이르는 경우, 중고 24GB 그래픽 카드를 구입하면 몇 달 안에 비용을 회수할 수 있으며, 비용을 “통제 가능”하게 만들 수 있습니다.

2. 개인 정보 보호가 필요한 사용자: 회사 데이터를 클라우드에 올릴 수 없는 경우, 오픈소스 모델이 유일한 대안입니다.

3. 최적화를 즐기는 사용자: 240K 상황을 확장하거나 AMD 그래픽 카드로 이식하는 등의 최적화 작업을 즐기는 사용자에게는 배포 과정 자체가 즐거움이 됩니다.

  • 신중해야 할 사용자:

1. 간헐적으로 사용하는 사용자: 가끔씩 콘텐츠를 작성하는 경우, 가격 인상 후 1년 동안 지출한 비용이 그래픽 카드를 구입하는 데 필요한 비용의 절반에도 미치지 않아 비용 효율이 낮습니다.

2. 한 번에 해결하려는 사용자: 하드웨어는 시간이 지남에 따라 구현되며, 모델은 매월 업데이트되므로 그래픽 카드를 구입해도 곧 사용할 수 없게 될 수 있습니다.

5. 시도하고 싶은 사람들을 위한 실용적인 조언 – 혼합적인 전략이 더 효율적입니다

“비용 제로”를 기대하지 말고, 다음과 같은 실용적인 방법을 사용하세요:

  • 추론 설정 조정: 기본 설정을 medium으로 사용하며, 필요에 따라 xhigh로 조정합니다.
  • 비용 관리: 예산을 잘 계획하고, 필요한 경우 추가 비용을 지불할 준비를 합니다.
  • 성능 향상: 모델의 성능을 최대한 활용하기 위해 최적화 작업을 진행합니다.

이러한 조언들을 따르면 소비자용 그래픽 카드에서도 고품질의 모델을 효율적으로 사용할 수 있을 것입니다.