얼마 전 일론 머스크(Elon Musk)의 BBC 인터뷰 영상을 다시 보게 됐습니다. 2023년에 진행된 인터뷰인데, 좀 특별한 인터뷰입니다. 보통 인터뷰는 기자가 묻고 인터뷰이가 답하잖아요? 근데 이 인터뷰에서는 머스크가 기자에게 되묻는 장면이 여러 번 나옵니다.
당시 기자는 트위터에 혐오 발언이 늘었다고 지적했습니다. 그러자 머스크가 묻죠. "단 한 개의 예시라도 들어줄 수 있나요?" 기자는 끝내 예시 하나를 대지 못했습니다. 그리고 이 인터뷰에서 머스크는 이런 말을 남깁니다.[1]
싫어하는 사람들이 싫어하는 말을 하는 것을 허용하지 않는 한 표현의 자유는 의미가 없습니다.
검열(censorship)이란 결국 뭘까요? 이 프레임을 따라가 볼까요. 검열은 누군가의 자유를, 다른 누군가가 싫다는 이유로 억압하는 행위입니다. 그리고 이 행위에는 항상 같은 질문이 따라붙습니다. 누가 심판하는가?
오늘은 이 질문을 LLM 에 가져와 볼까 합니다. 우리가 매일 지식을 얻는 LLM 의 검열은 정말 좋은 것인지, 한번 이야기해 봅시다.
심판은 누구인가
인터뷰에서 제가 제일 인상 깊었던 장면은 이 부분입니다. 기자가 "잘못된 정보와 혐오 발언보다 표현의 자유가 더 우선이냐" 고 묻자, 머스크는 이렇게 되받아칩니다.[1]
누가 어떤 것이 잘못된 정보였다고 말할 수 있습니까? 누가 그것을 심판하나요? BBC가 심판입니까?
이 질문이 날카로운 이유가 있습니다. 잘못된 정보를 막자는 주장 자체는 선해 보입니다. 근데 그 '잘못됨' 을 판정하는 주체가 특정 기관이나 회사가 되는 순간, 판정의 기준은 그 주체의 가치관이 됩니다. 실제로 머스크는 BBC 도 과거에 잘못된 정보를 낸 적이 있지 않냐고 반문했고, 기자는 그렇다고 인정하죠. 정확하고 싶어도 정확하지 않을 때가 있다는 겁니다.
즉, 검열의 문제는 '막느냐 마느냐' 의 문제가 아닙니다. 누가, 어떤 기준으로, 무엇을 막을지 정하는가의 문제인 거죠. 2023년에는 이 심판의 자리를 소셜 미디어 플랫폼이 차지하고 있었습니다.
LLM 시대의 심판 — 가드레일
그렇다면 2026년의 지금은 어떨까요? 저는 심판의 자리가 조용히 옮겨갔다고 봅니다. 요즘 우리는 궁금한 게 있으면 검색엔진보다 LLM 에게 먼저 묻습니다. LLM 은 대부분의 사람보다 뛰어난 지식을 공급해 주는 존재가 됐죠. 그런데 이 LLM 에는 가드레일(guardrail) 이라는 장치가 달려 있습니다.
가드레일이 뭐냐면, 모델이 특정 요청을 거부하도록 공급사가 설정해 둔 안전장치입니다. 예를 들면 이런 요청들이죠.
- 위험한 물질의 제조 레시피를 알려달라는 요청
- 특정 대상을 노리는 사이버 공격 코드를 짜달라는 요청
- 악성코드나 피싱 문구를 만들어 달라는 요청
이 목록만 보면 가드레일은 너무나 당연하고 선한 장치로 보입니다. 실제로 저도 이 부분은 인정해야 한다고 봐요. 대부분의 사람보다 박식한 존재가 폭발물 레시피까지 친절하게 알려주는 세상은 분명 더 위험하니까요. 공급사 입장에서도 책임 문제가 걸려 있고요.
하지만 여기서 한 발짝만 물러나서 구조를 볼까요. 조금 불편한 사실이 보입니다. 무엇을 막을지 정하는 주체가 사용자도, 정부도, 투표도 아니라 공급사 자신이라는 겁니다. 우리는 가드레일의 기준을 정한 적이 없고, 그 기준을 볼 수도 없습니다. 기준은 공급사의 내부 문서에 있고, 모델의 거부는 항상 같은 얼굴로 옵니다. "죄송하지만 그 요청은 도와드릴 수 없습니다."
머스크의 질문을 여기에 그대로 옮겨 놓으면 이렇게 됩니다. 누가 심판인가? OpenAI 가 심판인가? Anthropic 이 심판인가? Google 이 심판인가? 2023년에 BBC 에게 던져졌던 그 질문을, 2026년에는 LLM 공급사에게 던져야 하는 거죠.
RLHF 는 정말 중립적인가
근데 사실 가드레일은 빙산의 일각입니다. 가드레일이 '막는 것' 이라면, 더 근본적인 문제는 모델이 '무엇을 좋은 답변으로 배우는가' 입니다. 오늘날의 LLM 은 인간 피드백 기반 강화학습(RLHF) 이라는 과정을 거쳐 만들어집니다.
RLHF 가 뭐냐면 어렵지 않습니다. 사람이 모델의 여러 답변 중에서 '더 나은 답변' 을 고르고, 모델은 그 선호를 학습하는 겁니다. 여기서 핵심은 그 '사람' 이 누구인가입니다. 어떤 사람들이, 어떤 기준으로 좋은 답변을 골랐는지가 그대로 모델의 답변 방향이 되거든요. 즉, RLHF 는 기술 용어의 탈을 쓰고 있지만, 그 본질은 특정한 사람들의 가치관을 모델에 심는 행위입니다.
제 생각을 조금 더 보태 볼까요. 공급사가 의도적으로 한 방향으로 응답하도록 학습시키거나, 한 방향으로만 가드레일을 건다면 어떻게 될까요? 우리는 LLM 에게 편향된 지식만을 공급받게 되는 겁니다. 그리고 그 편향은 아주 공손한 말투로 포장되어 옵니다.
이게 과장일까요? 실제 사례가 있습니다. 2024년 2월, Google 의 Gemini 는 인물 이미지 생성에서 큰 논란을 일으켰습니다. 다양성을 반영하겠다는 튜닝이 과도하게 작동하면서, 역사적 맥락과 맞지 않는 인물 이미지들을 만들어 낸 거죠. 논란이 커지자 Google 은 인물 이미지 생성을 일시 중단했고, 당시 수석 부사장이 "기준에 못 미쳤다(missed the mark)" 고 인정했습니다.[2] 이 사태가 보여주는 건 단순합니다. 공급사가 넣은 가치 판단은 모델의 출력을 실제로 바꿉니다. 그게 이미지에서 드러났기 때문에 우리가 볼 수 있었을 뿐이죠. 텍스트에서라면요?
학계의 측정도 있습니다. David Rozado 는 2023년에 ChatGPT 에게 15가지 정치 성향 테스트를 적용했는데, 그중 14개에서 좌파 성향으로 진단됐다고 보고했습니다.[3] 2024년 후속 연구에서도 24개 LLM 을 조사했더니 대부분이 중도-좌파 성향으로 분류됐고요.[4] 미국 민주당, 브라질 룰라, 영국 노동당 쪽으로 일관되게 기우는 경향을 보고한 연구도 있습니다.[5] 물론 측정 방법에 대한 논쟁은 있습니다. 다만 적어도 이렇게 말할 수는 있죠. RLHF 에 정치적, 이념적 편향이 '없다' 고 말할 근거는, 지금까지 누구도 제시하지 못했습니다.
그렇다면 우리는 무엇을 고민해야 할까
여기까지 읽으신 분들은 물으실 수 있습니다. 그래서 검열을 다 풀자는 거냐고요. 아닙니다. 저는 이 글에서 정답보다 질문을 드리고 싶습니다. 딜레마를 정직하게 정리해 볼까요.
완전한 무검열은 명백한 해악을 방치합니다. 위험한 레시피가 아무런 마찰 없이 유통되는 세상을 원하는 분은 없을 겁니다. 그런데 완전한 검열은 공급사를 지식의 심판으로 만듭니다. 이 둘 사이 어딘가에 균형이 있을 텐데, 그 균형점을 지금은 공급사가 홀로 정하고 있는 거죠.
그래서 여러분과 같이 고민했으면 하는 질문들이 있습니다.
- LLM 을 검열하는 것은 정말 옳은가?
- RLHF 는 정말 편향이 없는가? 정치적, 이념적 편향이 있을 수 있지 않은가?
- 무엇을 막을지 정하는 권한을, 우리는 왜 공급사에게 조용히 위임했는가?
제 생각 하나만 덧붙일까요. 저는 검열의 유무보다 검열의 기준이 투명한가가 더 중요하다고 봅니다. 그리고 지금 시대의 미디어 리터러시는, 하나의 모델만 쓰지 않는 것이라고 생각해요. 같은 질문을 여러 공급사의 모델에게 던져 보세요. 누가 거부하고, 누가 어떻게 답하는지 비교하는 것만으로도 각 모델에 새겨진 가치관의 윤곽이 보입니다. 어디까지나 제 생각입니다만.
마치며
오늘은 LLM 의 검열에 대해 이야기해 봤습니다. 정리하면, 검열은 언제나 "누가 심판하는가" 의 문제였습니다. 2023년 트위터에서 시작된 이 질문은, 2026년 지금 가장 영향력 있는 지식 공급원이 된 LLM 에게 그대로 옮겨 왔습니다.
다음에 LLM 이 "그 질문에는 답할 수 없습니다" 라고 할 때, 한 번쯤 생각해 보시길 바랍니다. 이 거부는 누가 정한 기준인지. 그리고 그 기준에 나는 동의한 적이 있는지.
다음 시간에는 여러 모델에 같은 질문을 던져 보고 답변이 어떻게 갈라지는지, 실제로 비교해 본 이야기를 정리해 오겠습니다.
항상 읽어주셔서 감사합니다 :)
각주
- [1] 일론 머스크, BBC 인터뷰 (2023-04, 트위터 스페이스 생중계). 한국어 인용문은 네이버 블로그의 갈무리를 참고한 2차 소스: https://m.blog.naver.com/life2683/223075835858
- [2] Google 은 2024-02-22 Gemini 의 인물 이미지 생성을 일시 중단. Prabhakar Raghavan 은 "we missed the mark" 라고 인정했고, Sundar Pichai 는 내부 메모(2024-02-28)에서 "completely unacceptable" 이라고 밝힘. 인물 이미지 생성은 2024년 8월 말 Imagen 3 와 함께 복구
- [3] David Rozado, "The Political Biases of ChatGPT", Social Sciences 12(3):148 (2023). 15개 정치 성향 테스트 중 14개에서 좌파 성향으로 진단
- [4] David Rozado, "The Political Preferences of LLMs", PLoS ONE 19(7) (2024). 24개 LLM 대상, 대부분이 중도-좌파 성향으로 분류
- [5] Motoki, Pinho Neto, Rodrigues, "More human than human: measuring ChatGPT political bias", Public Choice 198 (2024). 미국 민주당, 브라질 룰라, 영국 노동당 쪽 일관된 편향 보고
의견을 남겨주세요