핵심 내용 요약
구글은 불과 6주 만에 Gemini Flash 시리즈의 대형 모델 3개를 연속으로 출시했습니다. 최신 모델인 3.8 Flash는 “저렴한 가격”(입력 비용 0.75달러/백만 토큰, 출력 비용 3.75달러)을 유지하면서도 뛰어난 성능을 보였습니다(프로그래밍 능력은 Claude Opus 5와 동등하고, 추론 능력은 GPT-5.6 Sol을 능가했습니다). 또한 사이버 보안에 특화된 Cyber 버전도 출시되었습니다. 하지만 실제 사용자들은 3.8 Flash가 성능은 좋지만 실용성에서는 부족하다고 평가했습니다. 이는 구글의 플래그십 모델인 Gemini Pro의 개발이 지연되고 핵심 인재들이 이직하면서, 구글이 Flash와 같은 소형 모델을 통해 시장에서의 존재감을 유지하려는 노력의 결과입니다.
1. 저렴한 가격의 “성능 강자”: 플래그십 모델에 근접한 성능
3.8 Flash는 구글이 “가장 똑똑한 Flash 모델”이라고 평가하며, 장기 프로그래밍, 복잡한 추론, 전문 에이전트 시나리오에 중점을 두었습니다. 그러나 가격은 이전 모델인 3.7 Flash와 동일합니다.
- 프로그래밍 능력의 한계에 도달: DeepSWE 장기 프로그래밍 테스트에서 73.7%의 점수를 기록하여 Claude Opus 5(74%)와 동등한 수준을 보였지만, 비용은 절반에 불과했습니다(문제당 2.36달러 vs 11.84달러).
- 다학제적 추론 능력: STEM과 인문학을 포함한 “인류 최종 시험”(HLE)에서 54.9%의 점수를 얻어 Opus 5(54.4%)와 GPT-5.6 Sol(54.5%)을 약간 앞섰습니다.
- 전문 시나리오에서의 우수성: 금융 에이전트 테스트(Vals V2)에서 61.4%의 점수를 기록하여 GPT-5.6 Sol(53.8%)을 능가했으며, 법률 에이전트 테스트(Harvey)에서는 10%의 통과율을 보였는데, 이는 Opus 5의 1.5배에 해당합니다.
- 사이버 보안 전용 버전: 취약점 발견률이 86.2%로 GPT-5.5-Cyber를 능가했으며, 취약점 수정 비용도 저렴했습니다. Chrome 팀이 이 모델을 사용하여 생성한 패치는 다른 모델의 2.6배 효과적이었지만, “신뢰할 수 있는 방어자”에게만 제공됩니다.
비결: 3.8 Flash는 어려운 문제에 직면했을 때 더 많은 고민을 합니다. 예를 들어, 프로그래밍 작업에서 3.7 Flash보다 36,000개의 토큰을 더 출력하고 41개의 단계를 더 수행하지만, 복잡한 작업의 실제 비용은 약간 증가했음에도 불구하고 전체적으로는 플래그십 모델에 비해 여전히 저렴합니다.
2. 실제 사용에서의 한계: 높은 성능에 비해 실용성 부족
공식 데모에서는 3.8 Flash가 3D 성을 만들거나 구글 지도의 DOS 버전을 구현하는 등의 기능을 보였지만, 일반 사용자들은 실제 사용 시 큰 차이를 느꼈습니다.
- 구성의 차이: 공식 데모에서는 Antigravity 플랫폼과 Nano Banana를 사용하여 텍스처를 생성했지만, 일반 사용자는 기본 모델만 사용할 수 있었습니다. 예를 들어, Three.js를 사용하여 에어버스 헬리콥터를 만들었을 때 결과는 나왔지만 모델의 디테일이 거칠고 움직임이 어색했습니다.
- 속도는 빠르지만 품질이 낮음: Sticky Ball 게임에서는 빠른 속도를 보였지만, Kimi K3에 비해 움직임이 부족했습니다. 뉴욕 시장 시나리오 테스트에서는 3.7 Flash의 10개에 비해 6개의 나무만 사용되었으며, 보도등이 누락되었고, 카메라 설정과 후처리 기능이 잘못 적용되었습니다.
- 장기 작업의 한계: Terminal-Bench 4.0(더 어려운 테스트)에서는 19.1%의 점수를 기록하여 Opus 5(51.8%)에 미치지 못했습니다. OSWorld 컴퓨터 작업 테스트에서는 59%의 점수를 얻었지만, Opus 5는 75.4%였습니다. 전반적인 지능 순위에서는 8위였지만, 특정 분야에서는 한계가 드러났습니다.
3. 급한 출시의 이유: 플래그십 모델의 지연과 인재 이직
구글이 3.8 Flash를 서둘러 출시한 이유는 기술적 혁신 때문이 아니라, 다른 경쟁자들에게 뒤처지지 않기 위함입니다.
- 플래그십 모델의 지연: 올해 5월 피차이(Pichai)는 새로운 Pro 버전이 “1개월 후에 출시될 것”이라고 했지만, 3.5 Pro 계획은 취소되었으며 Gemini 4도 아직 개발 중입니다.
- 핵심 인재의 이직: 지난 1개월 반 동안 Noam Shazeer(대형 모델의 선구자), Jeff Dean(구글 AI의 핵심 인물) 등이 연이어 퇴사하여 조직이 불안정해졌습니다. 새로운 경영진은 출시 속도를 높이라고 요구하고 있습니다.
- Flash의 역할: Flash는 소형 모델이기 때문에 수정과 훈련에 필요한 컴퓨팅 자원이 Pro 시리즈에 비해 훨씬 적습니다. 여러 팀이 동시에 다양한 실험을 할 수 있어 3주마다 한 번씩 업데이트가 가능하지만, Pro 시리즈는 더 많은 GPU와 시간이 필요하여 실험 비용이 높습니다.
따라서 3.8 Flash의 급한 출시는 플래그십 모델의 개발이 지연되고 인재가 이직하는 상황에서 구글이 시장에서의 존재감을 유지하기 위한 임시 조치입니다.
4. Flash의 실제 위치: 최종 목표는 아니지만, 현재로서는 유용한 도구
Flash는 구글의 최종 목표는 아니지만, 현재로서는 가장 실용적인 도구입니다.
- 전능한 플래그십 모델은 아님: 실제 사용 결과에서 보듯이, 장기 작업과 세부 사항 처리에서 플래그십 모델에 비해 부족합니다.
- 긴급한 상황에 유용: 저렴하고 빠르게 업데이트가 가능하며, 프로그래밍, 금융 에이전트와 같은 특정 시나리오에서는 플래그십 모델과 비슷한 성능을 보입니다. 이를 통해 Pro와 Gemini 4가 출시될 때까지 시장 점유율과 개발자들의 관심을 유지할 수 있습니다.
결론적으로, Flash는 구글의 “임시적인 해결책”입니다. 최종적인 경쟁에서 승리하기 위해서는 플래그십 모델이 필요하지만, 현재는 Flash를 사용하여 경쟁에서 뒤처지지 않으려는 것입니다.
결론
구글의 Flash 시리즈는 특정 분야(프로그래밍, 금융)에서 뛰어난 성능을 보이지만, 전반적인 능력은 플래그십 모델에 비해 부족합니다. 이는 플래그십 모델의 개발이 지연되고 인재가 이직하는 상황에서 구글이 시장에서의 입지를 유지하기 위한 임시적인 조치입니다.