虎嗅

텐센트, 알리바바, 바이트댄스, 왜 모두 ‘에이전트(Agent)’를 위한 ‘세계’를 만들고 있는 걸까?

原文:腾讯、阿里、字节,为什么都在给Agent“造世界”?

텐센트, 알리바바, 字节跳动… 모두 AI를 위한 ‘가상 세계’를 만들고 있나요? 그 뒤에는 AI의 새로운 전략이 숨어 있습니다.

안녕하세요, 여러분의 금융 전문 기자입니다. 오늘은 다소 공상 과학적으로 들릴 수 있지만, 실제로 기술 산업의 구조를 깊이 변화시키고 있는 주제에 대해 이야기하려고 합니다: 왜 텐센트, 알리바바, 字节跳动은 물론 해외의 오픈AI(OpenAI)와 앤서로픽(Anthropic)까지 AI 에이전트(AI Agent)를 위한 ‘가상 세계’를 열심히 만들고 있는 걸까요?

AI 관련 뉴스를 주목해 보신 분이라면, 최근 대형 AI 모델들이 누가 더 똑똑한지, 누가 더 빨리 답변하는지를 경쟁하고 있다는 것을 알고 계실 것입니다. 하지만 이번에는 다릅니다. 거대 기업들이 더 기본적이고 핵심적인 것, 즉 **‘환경’을 경쟁하고 있습니다.

여러분이 이해하기 쉽도록 먼저 《갑자광년》(Ji Zi Guang Nian)에서 발표된 이 심층 보도의 핵심 내용을 요약한 뒤, 다섯 가지 측면으로 나누어 그 뒤에 숨겨진 논리와 기회를 설명해 드리겠습니다.

📝 핵심 내용 요약

간단히 말해, AI의 발전은 ‘하반기’에 접어들었습니다. 상반기에는 ‘문제 해결 능력’(코드 작성, 기사 작성 등)을 겨루었다면, 하반기에는 ‘문제를 정의하는 능력’과 ‘복잡한 현실에서 작업하는 능력’을 겨룹니다.

AI가 사람처럼 복잡한 작업을 수행하게 하려면(버그 수정, 항공권 예약, 데이터베이스 관리 등), 단순히 텍스트 자료(정적 데이터)만 제공하는 것으로는 충분하지 않습니다. AI에게는 상호작용할 수 있고, 실패를 통해 학습할 수 있으며, 실제 피드백을 받을 수 있는 ‘훈련장’ 또는 **‘시험장’, 즉 ‘가상 세계’가 필요합니다.

현재 텐센트의 훈원(Hunyuan), 알리바바의 통의(Tongyi), 字节跳动의 시드(Seed)를 비롯한 해외 거대 기업들은 이러한 ‘가상 세계’를 구축하기 위해 막대한 자원을 투자하고 있습니다. 이는 단순한 기술 경쟁을 넘어 새로운 인프라 시장을 만들어내고 있습니다. 누가 고품질이고 대규모이며 진화 가능한 ‘AI 훈련 환경’을 제공할 수 있을지에 따라, 그 기업이 AI 시대의 ‘새로운 스케일 AI(Scale AI)’가 될 수 있습니다.

---

🔍 심층 분석: ‘가상 세계’를 만드는 다섯 가지 측면

1. 왜 갑자기 ‘가상 세계’를 만들기 시작했을까요? AI가 실제로 작업을 해야 하기 때문입니다

이전에는 AI와 대화할 때 AI가 마치 백과사전처럼 답변만 해주었지만, 이제는 AI에게 실제 작업을 수행하도록 해야 합니다.

예를 들어, 인턴에게 소프트웨어 오류를 찾아달라고 요청할 때, 단순히 ‘오류 찾기 매뉴얼’만 보여주는 것은 충분하지 않습니다. 컴퓨터, 코드 저장소, 실행 환경을 제공해야 하며, 그 인턴이 버튼을 누르고 오류를 확인하고 코드를 수정한 뒤 다시 실행해 보도록 해야 합니다. 이 과정에서 인턴은 “내가 이런 작업을 했을 때 시스템이 어떻게 변했는지”를 확인해야 합니다.

이것이 바로 AI 에이전트에게 필요한 것입니다.

텐센트의 수석 AI 과학자인 야오 순위(Yao Shunyu)는 이렇게 말했습니다: “좋은 환경이 없다면, 에이전트는 다양한 작업을 할 수 없습니다.”

지난 반년 동안 텐센트 훈원 팀은 ‘환경’에 관한 6편의 논문을 발표했습니다. 그들은 이전의 훈련 데이터가 ‘정적인 문서’였다면, 이제는 ‘동적인 상호작용 과정’이어야 한다는 것을 발견했습니다. 즉, AI는 코드를 어떻게 작성하는지뿐만 아니라, 코드가 실행된 후 데이터베이스가 어떻게 변하는지, 오류 메시지가 어떤 모습인지도 알아야 합니다.

쉽게 말해: 이전에는 AI에게 ‘레시피를 외우게’ 했다면, 이제는 ‘실제 주방에서 요리를 하게’ 하는 것입니다. 진짜 냄비, 불, 재료를 제공해야 AI가 요리 기술을 배울 수 있습니다.

2. 텐센트 훈원은 어떻게 ‘가상 세계’를 만들고 있을까요? 네 개의 팀이 각자의 전문성을 발휘하고 있습니다

텐센트 훈원은 이번에 큰 움직임을 보였으며, 적어도 네 개의 팀이 동시에 작업을 진행하고 있으며, 각 팀의 방향은 매우 구체적입니다:

  • 첫 번째 팀: 장기적인 작업 설계 (Long-Horizon)

이전의 테스트 작업은 몇 분 만에 끝났지만, 이제는 몇 시간이 걸리는 장기적인 작업을 만들고 있습니다. 예를 들어, 단순히 ‘Hello World’를 작성하는 것이 아니라, 전체 백엔드 서비스를 배포하도록 합니다. 더 놀라운 것은 자동화를 통해 3만 7천 개의 이러한 장기적인 작업을 생성했으며, 평균 비용은 단 5센트에 불과합니다. 이는 ‘가상 세계’ 구축이 대규모로, 저비용으로 가능하다는 것을 의미합니다.

  • 두 번째 팀: 모바일 환경 구축 (Mobile)

훈원의 비전 팀은 ‘PhoneWorld’라는 프로젝트를 진행 중이며, 여기에는 34개의 모의 앱(텐센트 헬스, 지도 등)이 포함되어 있습니다. AI는 이 안에서 예방접종을 예약하거나 앱 간에 작업을 조정할 수 있습니다. 이는 우리가 스마트폰에서 실제로 하는 작업을 모방한 것입니다.

  • 세 번째 팀: 환경의 자동 업그레이드 (Evolution)

이것이 가장 중요한 점입니다. 환경이 너무 단순하면 AI가 몇 번만 반복하면 모든 것을 파악해 버리므로, 훈원 팀은 환경을 자동으로 업그레이드하고 있습니다. 예를 들어, 단순히 정적 웹 페이지를 작성하는 것에서 시작해, 배포하고 동적으로 유지보수하며 병렬 처리하는 것으로 발전시키고 있습니다. 환경이 AI의 능력과 함께 점점 더 복잡해지면서 AI가 계속 학습할 수 있도록 합니다.

  • 네 번째 팀: 훈련 과정 자동화 (Pipeline)

그들은 ‘작업 생성’, ‘샌드박스 구축’, ‘결과 검증’ 등의 단계를 자동화하여 AI의 훈련 과정에 직접 통합했습니다. 이는 AI가 훈련하는 동안 실시간으로 이러한 가상 세계에서 연습할 수 있음을 의미합니다.

참고로: 텐센트 내부에서는 조직 조정이 이루어졌으며, 대형 언어 모델과 다중 모달 모델을 통합하여 야오 순위가 책임을 맡았으며, ‘강화 학습 및 에이전트 능력’을 업무에 명확히 포함시켰습니다. 이는 ‘가상 세계’ 구축이 단순한 팀의 활동이 아니라 회사 차원의 전략적 중점임을 의미합니다.

3. 알리바바와 字节跳动도 경쟁 중이며, 그 경쟁은 더 치열합니다

텐센트만이 아니라 알리바바와 字节跳动도 같은 시기에 이 분야에 투자하고 있으며, 각자의 독특한 접근 방식을 가지고 있습니다.

  • 알리바바 통의: ‘환경 확장’을 명확히 명명

알리바바는 절강대학교와 베이징대학교와 공동으로 논문을 발표했으며, 제목은 《환경 확장을 통한 일반적인 에이전트 지능(Towards General Agentic Intelligence via Environment Scaling)》입니다. 알리바바의 수석 과학자인 주징인(Zhou Jingren)도 저자 중 한 명입니다.

그들의 핵심 주장은 “경험한 환경이 많을수록 처리할 수 있는 도구가 많아진다”는 것입니다. 마치 사람이 많은 도시를 방문할수록 세계관이 넓어지는 것과 같습니다. 알리바바는 80만 개 이상의 검증 가능한 소프트웨어 엔지니어링 환경을 구축했으며, 그 규모는 놀랍습니다.

  • 字节跳动의 시드: 환경이 모델과 함께 성장

字节跳动과 인민대학교 팀은 ‘Agent-World’라는 프로젝트를 진행 중이며, 여기에는 2000개 이상의 환경과 1만 9천 개의 도구가 포함되어 있습니다. 그들의 특징은 ‘동적 생성’입니다. AI가 어딘가에서 막히거나 능력의 격차가 드러나면, 시스템이 자동으로 새로운, 맞춤형 작업을 생성하여 훈련시킵니다. 이는 선생님이 학생의 오답지를 보고 비슷한 문제를 내어 연습시키는 것과 같습니다.

공통점: 모두 ‘정적 데이터’에서 ‘동적 상호작용 환경’으로 전환하고 있습니다. 또한, 모두 ‘고품질 환경’을 구축하는 데 어려움을 겪고 있습니다.

4. 가장 큰 문제: 99.7%의 환경이 ‘쓰레기’라면 어떻게 해야 할까요?

이것은 기사에서 가장 경고적인 데이터입니다.

텐센트 훈원 팀은 GitHub과 Hugging Face에서 4만 7,678개의 공개된 가상 환경을 수집했으며, 엄격한 심사(버그 유무, 난이도 적합성, 표준 명확성 등)를 거쳐 최종적으로 127개만을 남겼습니다.

탈락률은 무려 99.7%입니다!

왜일까요?

1. 품질이 낮음: 많은 환경에 버그가 있거나 테스트 기준이 일관되지 않습니다.

2. 너무 단순하거나 가짜임: 소형 모델은 그런 환경에서도 문제없이 통과할 수 있지만, 대형 모델은 환경의 결함을 이용해 테스트를 통과할 수 있습니다. 이는 시험 문제에 오류가 있어도 학생이 운으로 높은 점수를 받을 수 있지만, 실제로는 문제를 배운 것이 아님을 의미합니다.

3. 불안정성: 오픈AI와 앤서로픽도 발견했습니다. 같은 작업이라도 컴퓨터 사양(CPU, 메모리)에 따라 AI의 성능이 6%까지 차이날 수 있습니다. 환경이 불안정하면 훈련 결과가 예측할 수 없습니다.

이것은 무엇을 의미할까요?

‘가상 세계’를 만드는 것은 단순한 복사 붙여넣기가 아니라 고난도이고 비용이 많이 드는 공정입니다. AI가 스스로 환경을 생성할 수는 없으며(품질이 너무 낮음), 전적으로 인력에 의존할 수도 없습니다(비용이 너무 많음). 이에는 새로운 능력이 필요합니다: AI가 무엇을 필요로 하는지 이해하고, 안정적이고 복잡하며 실제적인 가상 비즈니스 시나리오를 구축하는 방법을 알아야 합니다.

5. 다음 ‘스케일