안녕하세요.
이번 주에 마테크 조사 하나를 들여다보다가 손이 멈춘 부분이 있었습니다. 마케팅·마테크 리더의 90.3%가 "AI 에이전트를 쓰고 있다"고 답했더군요. 이제 안 쓰는 팀이 이상한 축에 속하는 수준입니다.
그런데 같은 조사 안에 이런 문항이 또 있었습니다. 실제로 전면 운영까지 간 곳은 23.3%. 나머지 80.6%는 사람이 결과를 하나하나 검수하는 보조 모드에 묶여 있었습니다.
같은 표본에서 나온 숫자입니다. 도입은 했는데 맡기지는 않았다는 뜻이죠.
처음엔 이걸 "아직 기술이 덜 익어서"로 읽었습니다. 그런데 곱씹을수록 아니라는 생각이 들었어요. 이메일 발송 타이밍을 잡거나 광고 소재 변형을 만드는 일은 몇 년 전 모델로도 충분히 되던 일입니다. 기술이 못 따라와서 멈춘 게 아닙니다. 승인 버튼을 누가 누를 것인가에서 멈춘 겁니다.
오늘은 그 지점 이야기를 하려고 합니다.
■ 어시스트 모드는 안전지대가 아닙니다
많은 팀이 "일단 사람이 검수하는 방식으로 쓰고 있다"고 말합니다. 신중한 접근처럼 들리고, 실제로 그렇게 여겨집니다. 저는 여기에 조금 다르게 봅니다.
구체적인 장면을 그려볼게요.
에이전트가 이메일 카피 12개 변형을 5분 만에 뽑습니다. 담당자가 12개를 전부 읽고, 브랜드 톤에 맞는지 확인하고, 3개를 고르고, 그중 2개를 손봅니다. 여기에 40분이 듭니다. 예전에 직접 3개를 쓸 때는 50분이 들었습니다.
10분 아꼈습니다. 나쁘지 않죠. 그런데 업계에서 자주 인용되는 "AI로 주당 8시간 회수" 같은 기대치에 도달하려면 이 사이클이 주 48번 돌아야 합니다. 대부분의 팀에서는 안 돕니다.
진짜 문제는 시간이 아니라 그 다음에 있습니다.
생성량이 늘면 검수 대상도 정확히 같은 비율로 늘어납니다. 처음 2주는 꼼꼼히 봅니다. 한달쯤 지나면 대충 훑습니다. 두 달쯤 되면 사실상 통과 도장만 찍고 있습니다.
이 시점의 팀은 서류상으로는 어시스트 모드지만, 실제로는 검증이 사라진 자율 집행 상태입니다. 위험을 관리하고 있다고 믿으면서 관리하지 않는 상태요. 저는 이게 대놓고 자동으로 돌리는 것보다 위험하다고 생각합니다. 최소한 후자는 "우리가 자동으로 돌리고 있다"는 자각이라도 있으니까요.
■ 90일을 못 넘기는 29%
숫자 몇 개를 더 붙여보겠습니다.
AI 에이전트 배포 중 29%가 90일 안에 폐기됩니다. 분기 하나를 못 버틴다는 뜻입니다. 파일럿 예산을 쓰고, 벤더 온보딩을 하고, 팀 교육을 하고, 다음 분기 계획서에서 조용히 사라집니다.
이 패턴이 낯설지 않으실 겁니다. 2015년 전후 마케팅 오토메이션 붐 때도 똑같았어요. 리드 스코어링 모델을 붙였다가 반년 뒤 아무도 안 보는 대시보드로 남았죠.
당시 복기해보면 모델 정확도가 낮아서 버려진 경우는 의외로 적었습니다. 대부분은 영업팀이 그 점수를 안 믿었거나, 점수가 낮게 나온 리드를 그냥 무시해도 되는지 아무도 결정해주지 않아서 흐지부지됐습니다. 도구가 아니라 합의가 없었던 거죠. 지금 에이전트에서 벌어지는 일과 구조가 정확히 같습니다.
실패 원인 분류가 특히 뼈아팠습니다. 성공 기준이 불명확한 경우가 전체 실패의 41%로 1위였습니다. 데이터·툴 접근 문제가 33%, 브랜드 보이스 이탈이 19%로 뒤를 이었고요.
41%를 다시 읽어보세요. 실패의 절반 가까이가 "무엇을 성공으로 볼지 안 정하고 시작해서" 발생합니다. AI 문제가 아닙니다. 프로젝트 관리 문제입니다. 이름만 바꿔서 10년째 같은 실수를 반복하고 있는 셈이죠.
■ 그래서 어떻게 하느냐
전면 자동화냐 사람 검수냐, 이 이분법이 문제라고 봅니다. 그 사이에 단계가 있어야 하는데 대부분 없습니다.
제가 실무에서 쓰는 방식은 "범위를 숫자로 정하고, 그 안에서는 묻지 않는다"입니다.
예를 들어 광고 입찰가를 ±15% 범위에서 조정하는 건 에이전트에게 맡깁니다. 그 범위를 넘어가는 판단이 필요하면 사람에게 알림이 옵니다. 발송 타이밍도 마찬가지입니다. 사전에 합의한 시간대 안에서는 자율, 밖으로 나가면 승인.
이 경계 하나를 숫자로 정의해두면 에이전트가 갑자기 운영 가능한 물건이 됩니다. 반대로 "알아서 잘해줘"로 던지면 90일 뒤 폐기되는 29%에 합류합니다.
재미있는 건, 위임 범위를 정의하는 작업 자체가 성공 기준을 정의하는 작업이라는 점입니다. 앞에서 본 41% 문제가 여기서 저절로 풀립니다.
■ 경계를 정할 때 던지는 질문 세 개
"범위를 숫자로 정하라"는 말이 추상적으로 들릴 수 있어서, 제가 실제로 회의에서 던지는 질문을 공유합니다.
첫 번째. "이 판단이 잘못됐을 때 되돌리는 데 얼마나 걸리나요?" 소재 하나를 잘못 만든 건 5분이면 교체됩니다. 5만 명에게 잘못된 세그먼트 메일이 나간 건 되돌릴 수 없습니다. 되돌릴 수 있는 것부터 맡기면 됩니다. 이 질문 하나로 위임 후보의 절반이 걸러집니다.
두 번째. "이 판단을 신입이 하면 결재를 올릴까요?" 조직에는 이미 암묵적인 권한 기준이 있습니다. 사람에게 적용하는 기준을 그대로 에이전트에 옮기면 대체로 맞습니다. 새로 만들려고 하니까 회의가 길어지는 겁니다.
세 번째. "이게 틀리면 누가 설명하러 가나요?" 이 질문에 이름이 안 나오면 아직 자동화하면 안 되는 영역입니다. 자동화의 반대말은 수동이 아니라 무책임입니다.
■ 검수 피로를 막는 현실적인 장치
앞에서 검수가 두 달이면 통과 도장이 된다고 했는데, 그럼 어떻게 해야 하느냐는 질문이 따라옵니다.
전수 검수를 포기하고 샘플링으로 바꾸는 게 낫다고 봅니다. 전부 대충 보는 것보다 20%를 제대로 보는 쪽이 실제 품질 관리에는 훨씬 효과적입니다. 대신 샘플에서 문제가 나오면 그 배치 전체를 멈추는 규칙을 함께 둡니다.
그리고 검수자를 고정하지 마세요. 같은 사람이 계속 보면 무뎌집니다. 격주로 돌리기만 해도 놓치던 게 눈에 들어옵니다. 별거 아닌 것 같지만 실무에서 체감 차이가 큽니다.
하나 더. 에이전트를 켤 때 끄는 조건도 같이 문서에 적어두세요. "이런 일이 벌어지면 즉시 중단한다"는 문장이 없으면, 문제가 생겼을 때 끄는 결정 자체가 회의 안건이 됩니다. 그 사이에 계속 돌아갑니다.
■ 오늘 바로 점검해볼 것 세 가지
첫째, 지금 켜둔 AI 도구 중에 "3개월 뒤 이 지표가 이만큼이면 유지, 아니면 끈다"는 문장이 문서로 남아 있는 게 몇 개인지 세어보세요. 아마 없을 겁니다.
둘째, 새 도구를 켤 때 어떤 워크플로를 끌 건지 같이 정하세요. 안 끄면 그건 자동화가 아니라 그냥 레이어 하나 더 얹은 겁니다. 마테크 활용률이 2020년 58%에서 33%까지 떨어진 이유가 여기 있습니다.
셋째, 데이터 정합성은 전사 단위로 잡으려 하지 마세요. 영원히 안 끝납니다. 그 에이전트가 실제로 읽는 필드만, 열 개 남짓만 검증하세요. 범위를 좁히면 끝낼 수 있습니다.
■ 마지막으로
이번에 조사 자료를 파면서 가장 불편했던 건 따로 있었습니다. "에이전트 도입 기업이 미도입 기업보다 성과 2배, ROI 20% 높다"는 식의 수치들이요.
방향성은 맞다고 봅니다. 그런데 그 성과가 어디서 나오는지를 따져보면 이야기가 꽤 달라집니다. 벤더 자료에 흔히 붙는 "비용 30~70% 절감" 같은 수치도 뜯어보면 AI의 성과가 아닌 경우가 많고요.
솔직히 말하면 저도 처음엔 그 수치들을 그대로 인용할 생각이었습니다. 출처가 그럴듯했거든요. 그런데 어떤 조건에서 그 숫자가 나왔는지 역산해보다가 생각을 바꿨습니다.
이 부분을 짚지 않으면 내년 예산 회의에서 잘못된 근거로 잘못된 결정을 내리게 됩니다. 전체 글 후반부에서 이 수치들을 하나씩 분해했는데, 결론이 처음 예상과는 반대 방향으로 갔습니다. 도구를 사는 게 성과를 만드는 게 아니라는 쪽으로요.
거기까지 읽어보셔야 오늘 이야기가 완성됩니다.
원문 보기: https://medium.com/@hoon_16083/ai-%EC%97%90%EC%9D%B4%EC%A0%84%ED%8A%B8-90-%EA%B0%80-%EC%93%B4%EB%8B%A4-23-%EB%A7%8C-%EC%A7%84%EC%A7%9C%EB%8B%A4-77f27c013a07
의견을 남겨주세요