虎嗅

중국어 헤드라인: “천문(千问)”은 95%의 업무가 표준 모드로 충분하다고 주장하지만, 실제 테스트 결과는 다소 미묘했습니다.

原文:千问说95%的办公任务标准模式就够了,实测结果有点微妙

알리천문, 자사의 플래그십 모델 사용을 “권유”하는가? AI 오피스의 “성능 대비 가격”에 대한 대형 시험

핵심 내용 요약

이 보도의 핵심은 직관에 반하는 비즈니스 현상을 밝혀냅니다: 알리바바의 AI 오피스 도구인 ‘천문 오피스’가 사용자들에게 가장 강력한 플래그십 모델(Pro/Max)을 항상 사용하지 말고, 더 가볍고 저렴한 표준 모델(Flash)을 우선 사용할 것을 권장한다는 점입니다.

이 주장을 검증하기 위해 기자는 실제 테스트를 진행했습니다: 9개의 복잡한 증권사 리포트(그중 하나는 의도적으로 중복된 파일로 섞여 있었습니다)를 AI에게 제공하고, 이를 Word 문서로 정리하고 한 페이지 분량의 PPT로 압축하여 보고하도록 요청했습니다.

테스트 결과는 다음과 같습니다:

1. 표준 모델(Flash): 속도가 빠르며(Word는 10분, PPT는 3분 만에 완성), 중복된 파일을 인식하고 구조가 완전하며 데이터가 정확합니다. 하지만 내용은 “요약”에 치우쳐 있고 심층 분석이 부족하며, PPT 레이아웃이 빽빽하고 작은 글씨가 많아 빠른 둘러보기와 초안 작성에 적합합니다.

2. 고급 모델(Pro/Max): 속도가 느리지만(Word와 PPT 모두 10분 소요), 마치 “고급 분석가”처럼 작동합니다. 데이터를 정리할 뿐만 아니라 다양한 증권사의 의견 차이점 뒤에 있는 논리(예: 다른 가정)를 깊이 있게 분석하고, 레이아웃 오류(예: 글자 겹침, 색상 대비도)를 자동으로 확인하며, 더 전문적인 피드백을 제공합니다.

3. 결론: 알리바바가 주장하는 “95%의 일상 업무에 표준 모델을 사용한다”는 것은 대체로 사실입니다. 여기서의 “사용 가능”은 “작업을 완수할 수 있고 오류가 없다”는 의미이지, “완벽하게 제출한다”는 의미는 아닙니다. 표준 모델은 “작업을 완수하는” 역할을 하고, 고급 모델은 “작업을 더 잘 완성하는” 역할을 합니다. 대부분의 일상 업무에는 표준 모델의 성능 대비 가격이 매우 높습니다. 하지만 공식 보고나 복잡한 의사결정에는 고급 모델이 여전히 필수적입니다.

---

이 AI 오피스 변화를 이해하기 위한 다섯 가지 차원

1. 비즈니스 논리의 반전: 왜 대기업은 최고의 모델 사용을 “권유”하는가?

일반적으로 기술 기업은 제품을 판매할 때 “더 비싸면 더 좋다”는 원칙을 따릅니다. 플래그십 버전은 이익의 원천이자 기술력의 상징입니다. 하지만 알리바바의 이번 조치는 매우 대담합니다: 플래그십 모델의 역할을 낮추고, 가벼운 모델의 역할을 높입니다.

  • 이유:
  • 비용과 규모의 경제: 대형 모델의 추론(즉, AI의 사고 과정)은 많은 컴퓨팅 자원을 소모하므로 비용이 많이 듭니다. 모든 사용자가 최고급 모델을 기본적으로 사용한다면 서버에 큰 부담이 가고 운영 비용이 증가합니다. 95%의 사용자가 가벼운 Flash 모델을 사용하도록 유도함으로써 알리바바는 단일 호출 비용을 크게 줄이고 더 많은 사용자를 지원할 수 있습니다.
  • 사용 장벽 낮춤: 많은 일반 사용자는 “가장 똑똑한” AI가 필요하지 않습니다. 그들에게는 “복종적이고, 빠르며, 저렴한” 도구가 필요합니다. 기본 옵션이 비싸고 느린 플래그십 버전이라면 많은 경량 사용자를 겁먹게 할 수 있습니다.
  • “충분히 사용 가능한” 것의 재정의: 알리바바는 오피스 환경에서의 “지능 기준”을 재정의하고 있습니다. 대부분의 일상 업무에서는 “속도”와 “정확성”이 “심도”보다 중요하다**고 시장에 말합니다. 이는 AI를 자주 사용하는 작업 흐름에 진정으로 통합시키는 실용적인 제품 전략입니다.
  • 간단한 비유:

이는 식당에서 음식을 먹는 것과 같습니다. 예전에는 식당 주인이 항상 가장 비싼 “만한전석”을 추천했지만, 이제는 “95%의 경우에는 ‘일반 메뉴’(표준 모델)로도 충분하며, 서비스가 빠르고 가격이 저렴합니다. 중요한 고객을 대접할 때만 ‘만한전석’(고급 모델)이 필요합니다.” 이는 식당(알리바바)에게는 매출 증가를 의미하고, 사용자에게는 돈과 시간을 절약할 수 있습니다.

2. 실제 테스트 결과: AI가 복잡한 문서를 처리하는 “실제 능력”

이번 테스트에 사용된 자료인 9개의 증권사 리포트는 AI 오피스 분야에서 “어려운 과제”입니다. 그 이유는 리포트가 단순한 텍스트의 모음이 아니라 다음과 같은 특징을 가지고 있기 때문입니다:

  • 데이터의 함정: 다른 연도, 다른 회계 기준(GAAP vs Non-GAAP)의 수치가 혼재되어 있습니다.
  • 의견의 충돌: A 증권사는 긍정적이고, B 증권사는 부정적이며, C 증권사는 중립적입니다.
  • 정보의 중복: 여러 기관이 동일한 재무 보고서 데이터를 인용하지만 결론이 다릅니다.

표준 모델의 성능 (“합격선” 이상):

  • 중복 제거 능력: 9개의 파일 중 2개가 완전히 동일하다는 것을 성공적으로 인식하여 중복 계산을 방지했습니다. 이는 AI가 기본적인 “문서 식별” 능력을 가지고 있음을 보여줍니다.
  • 구조화 능력: 로봇처럼 각 문서를 복사하는 대신 주제(알리바바의 경영, AI의 진전, 증권사의 의견)에 따라 분류했습니다. 이는 인간의 독서 논리에 맞습니다.
  • 한계: AI는 “속기사”에 가깝습니다. AI는 “화타이는 이익이 X라고 하고, 국신은 이익이 Y라고 한다”고 알려줍니다. 하지만 “왜 화타이와 국신의 의견이 이렇게 다른가? 그 이유는 AI에 대한 가정이 다르기 때문인가?”라고는 알려주지 않습니다. 이는 뒤에 있는 논리적 연결 고리를 생략합니다.

고급 모델의 성능 (“전문가 수준” 이상):

  • 심층 분석: “경험이 풍부한 분석가”처럼 작동합니다. 데이터를 나열할 뿐만 아니라 차이의 원인(예: “차이는 주로 클라우드 사업의 이익률에 대한 가정이 다르기 때문”이라고 설명합니다).
  • 자가 수정 능력: PPT를 생성할 때 레이아웃 문제(글자 겹침, 색상 대비도)를 자동으로 확인하고, PPT를 이미지로 내보낸 후 다시 한 번 확인합니다. 이러한 “자가 반성” 능력은 고급 모델의 특징입니다.
  • 한계: 더 전문적이지만 속도가 표준 모델의 3배 이상입니다. 또한, 고급 모델로 생성된 PPT도 여전히 “빽빽하게” 작성되어 있어 AI는 “미학”과 “정보 선택”에서 인간 디자이너에게는 미흡합니다.
  • 간단한 비유:

표준 모델은 “뉴스 요약”과 같아서 무슨 일이 일어났는지, 누가 무슨 말을 했는지를 알려주어 빠르게 전체 상황을 이해할 수 있게 해줍니다.

고급 모델은 “심층 보도”와 같아서 무슨 일이 일어났는지, 왜 그런지, 각자의 동기가 무엇인지, 그리고 잠재적인 위험이 무엇인지를 분석해줍니다.

3. “95%의 시나리오에서 사용 가능한” 것의 진실: “사용 가능”이란 무엇인가?

알리바바는 “95%의 일상 업무에 표준 모델로 충분하다”고 주장합니다. 이 말은 매력적이지만, “사용 가능”의 정의가 중요합니다.

  • “사용 가능” = “오류가 없고, 제출 가능”인 경우: 표준 모델은 이를 충족합니다. 모든 파일을 읽고 중복된 부분을 제거하며 구조가 명확한 Word와 PPT를 생성합니다. 일상적인 자료 정리, 주간 보고서 작성, 초기 조사에는 충분합니다.
  • “사용 가능” = “즉시 사용 가능하고, 수정이 필요 없는” 경우: 표준 모델은 이를 충족하지 못합니다. PPT의 글씨가 작고 레이아웃이 빽빽하여 사용자가 수동으로 조정해야 합니다. 고급 모델은 더 좋지만 여전히 약간의 조정이 필요합니다.
  • 실제 “95%의 시나리오”는 무엇인가: 테스트에 따르면 이 95%의 시나리오는 정보 정리, 초기 요약, 형식 변환, 간단한 질문응답입니다.

나머지 5%의 시나리오는 공식 보고, 복잡한 의사결정 지원, 다양한 데이터의 교차 검증, 높은 미학적 요구의 시각적 표현입니다.

  • 일반 사용자에게의 조언:
  • 일상적인 작업: 회의록 정리, 계약의 핵심 조항 추출, 이메일 초안 작성: 표준 모델을 안심하고 사용하세요. 빠르고 저렴합니다.
  • 중요한 작업: 상사에게 보고, 투자 분석, 복잡한 프로젝트 계획: 반드시 고급 모델로 전환하세요. 몇 분을 더 투자하면 더 엄격한 논리와 더 전문적인 표현을 얻을 수 있습니다.

4. AI 오피스의 “새로운 기준”: “채팅”에서 “Agent”로의 진화

이 기사는 중요한 추세를 밝혀냅니다: AI는 “채팅 로봇”에서 “오피스 Agent(지능체)”로 진화하고 있습니다.

  • 전통적인 AI 채팅: 질문하면 텍스트로 답변합니다.
  • AI Agent: 작업을 주면(예: “이 9개의 리포트를 정리하여 PPT로 만들어주세요”) 자동으로 단계를 계획합니다:

1. 파일을 읽습니다.

2. 중복된 부분을 제거합니다.

3. 핵심 정보를 추출합니다.

4. 분류하여 정리합니다.

5. Word를 생성합니다.

6. Word의 내용을 추출합니다.

7. PPT의 구조를 계획합니다.

8. PPT를 생성합니다.

9. 자가 검사 (고급 모델의 특징): 레이아웃, 색상, 겹침을 확인합니다.

10. 최종 파일을 출력합니다.

  • 주요 돌파:
  • 다중 파일 처리: AI는 여러 PDF를 동시에 처리하고 그들 간의 관계(예: 중복, 충돌)를 이해할 수 있습니다.
  • 형식 변환: 비구조화된 PDF에서 구조화된 Word, 그리고 시각화된 PPT로 변환함으로써 AI는 오피스 문서의 “기본 기능”을 모두 처리할 수 있게 되었습니다.
  • 자가 반성: 고급 모델은 자신이 생성한 PPT에 문제가 있는지 확인하고 수정하려고 합니다. 이는 AI가 “자율성”을 향한 중