虎嗅

한 문장의 모호한 지시에서 131장의 채팅 스크린샷까지: 어떻게 AI를 계속해서 수정해 나갔는가

原文:从一句模糊指令到131张聊天截图,我是怎样不断纠正AI的

핵심 내용 요약

이 글은 일반 사용자가 AI를 이용해 채팅 녹화본을 처리하는 실습 노트처럼 보이지만, 사실은 “증거로 사용할 수 있는 연속적인 채팅 스크린샷”이라는 매우 까다로운 프로젝트를 통해 일반인이 AI를 활용해 복잡하고 비표준적인 작업을 완수하는 전 과정을 상세히 보여줍니다. 처음에는 “채팅 스크린샷을 정리해 달라”는 모호한 요구사항에서 시작하여 여러 번의 시행착오를 거치고 수십 개의 구체적인 검증 규칙을 추가한 끝에 131장의 오류 없는 완벽한 스크린샷을 만들어냈습니다. 이는 “만능적인 프롬프트만 있으면 AI가 모든 것을 해낼 수 있다”는 인식을 완전히 뒤집으며, 개인이든 기업이든 AI를 활용할 때 실용적인 작업 방식을 제시합니다.

---

상세한 해석

1. 90%의 사람들이 AI를 제대로 활용하지 못하는 이유는 “수용 기준”이 너무 모호하기 때문입니다

많은 사람들이 AI를 사용할 때 문제가 생기면 “AI가 너무 멍청하다”고 생각하지만, 저자가 처음에 겪은 문제들을 보면 이해가 됩니다. 저자는 AI에게 먼저 계획을 세우라고 요청했지만, AI가 제출한 보고서에는 “음성 전환된 내용이 없다”고 적혀 있었고, 실제로 스크린샷을 열어보니 음성이 누락된 부분이 있었습니다.

이는 AI가 의도적으로 속인 것이 아니라, “양호한 결과”에 대한 정의가 완전히 다르기 때문입니다. 사용자는 “모든 음성이 텍스트로 전환되고, 내용이 연결되어 있으며, 증거로 사용할 수 있어야 한다”고 생각하지만, AI는 “명확한 빈 전환 영역이 없으면 양호하다”고 판단합니다.

이는 외주업체에 앱 개발을 의뢰하거나 부하에게 작업을 할당할 때와 같은 문제입니다. 사용자가 “예쁘고 사용하기 편한 페이지를 만들어 달라”고 요청하면, 결과물은 예상과 크게 다릅니다. 모호한 요구사항으로는 정확한 결과를 얻을 수 없으며, 명확히 설명하지 않으면 AI는 가장 쉬운 방식으로 작업을 처리할 뿐입니다.

2. AI의 실행 능력은 뛰어나지만 “추론”은 할 수 없습니다. 따라서 규칙을 명확히 해야 합니다

저자는 두 번째 단계에서 모호한 요구사항들을 주관적인 판단이 필요 없는 구체적인 검증 항목으로 분해했습니다.

예를 들어, 음성이 제대로 전환되었는지 판단할 때는 “빈 전환 영역이 있는지”만 확인하는 것이 아니라, 세 가지 조건을 모두 충족해야 합니다: ① 빈 전환 영역이나 로딩 중인 영역이 없어야 하고, ② 음성 아래에 실제로 텍스트가 나타나야 하며, ③ 음성 영역에 재생되는 애니메이션이 없어야 합니다.

두 스크린샷이 연속적인지 판단할 때도 단순히 “화면이 비슷한지”만 보는 것이 아니라, 두 스크린샷에 공통된 메시지나 시간 정보를 찾아야 합니다.

AI는 실행 능력은 뛰어나지만 “인간적인 감정”이나 추론 능력은 없으므로, 원하는 결과를 얻으려면 필요한 규칙을 명확히 제시해야 합니다. 많은 기업이 고가의 AI 모델을 구입하지만 이러한 규칙 설정을 하지 않아 실제로 활용하지 못합니다.

3. “진실성”이 관련된 작업에서는 AI에게 “자율적인 판단”의 여지를 주어서는 안 됩니다

저자가 네 번째로 겪은 문제는 매우 시사적입니다. WeChat에서 장시간의 음성을 전환할 때 자동으로 프레임이 뛰어넘는 현상이 발생하는데, 원본 영상에는 뛰어넘기 전과 후의 내용이 모두 포함되어 있지 않습니다. AI는 채팅의 의미를 따라 연속적인 스크린샷을 만들려고 하지만, 이는 허용되지 않습니다. 실제로 존재하지 않는 내용을 만들어서는 안 됩니다.

이는 AI의 가장 큰 약점입니다. AI는 “논리를 완성하는” 경향이 있어서, 사용자가 “모든 내용은 원본 자료에서 가져와야 하며, 없는 내용은 만들어서는 안 된다”고 명확히 지시하지 않으면 잘못된 정보를 생성할 수 있습니다.

4. “만능적인 프롬프트”는 존재하지 않으며, 효율적인 AI 작업 흐름은 작은 단계로 규칙을 축적하는 것입니다

저자는 마지막으로, 처음부터 AI에게 계획을 세우라고 해도 모든 예상치 못한 문제를 미리 예상할 수 없다고 말합니다. 예를 들어, 녹화본이 자동으로 이전 채팅 내용으로 돌아가거나 WeChat에서 장시간의 음성을 재생할 때 프레임이 뛰어넘는 등의 세부 사항은 사무실에서 아무리 생각해도 예측할 수 없습니다.

실제로 효율적인 AI 작업 흐름은 “작은 단계로 시행착오를 거치며 규칙을 축적하는 것”입니다. 먼저 소량의 자료로 테스트를 해서 문제점들을 파악하고 이를 규칙으로 만들어, 다음에는 모든 자료를 처리할 때 같은 실수를 반복하지 않도록 합니다. 이러한 접근 방식은 모든 산업에서 AI를 활용하는 데 공통적입니다.

---

이 글은 AI를 활용하는 데 있어 명확한 요구사항과 규칙 설정의 중요성을 강조하며, 실제로 효과적인 AI 활용을 위해서는 체계적인 접근이 필요함을 보여줍니다.