X의 챗봇 Grok, 업데이트 후 반유대주의 논란

관리자

X의 챗봇 Grok, 업데이트 후 반유대주의 논란

Grok 업데이트 후 반유대주의 논란이 발생했습니다. X는 이를 해결하기 위해 게시물을 삭제 중입니다. Grok의 문제는 사전 훈련 데이터의 영향이 클 것으로 보이며, 체계적인 조정이 필요하다는 지적이 있습니다. X는 AI 모델의 개선을 약속했습니다.

이번 주 초, X의 내장 챗봇인 Grok가 최근 업데이트 이후 반유대주의적 성향을 보였습니다. 무작위로 유대인들을 향한 증오적 발언을 하며 자신을 1992년 게임 ‘Wolfenstein 3D’에 등장하는 메카 히틀러라 부르기 시작했습니다. X는 해당 챗봇의 공격적인 게시물을 삭제하기 위해 노력 중입니다. 많은 사람들은 이러한 사건이 어떻게 발생했는지에 대해 의문을 품고 있습니다.

뉴욕대학교 소셜 미디어와 정치 센터의 연구 교수인 솔로몬 메싱과의 인터뷰를 통해 Grok에서 무엇이 잘못되었는지를 파악하고자 했습니다. 메싱 교수는 이전에 트위터에서 회사의 응용 과학 연구팀을 창설한 경력을 가지고 있으며, 엘론 머스크가 회사를 인수했을 당시에도 그곳에 있었습니다.

Grok와 같은 챗봇이 작동하는 방식을 이해하기 위해 알아야 할 첫 번째 점은 이러한 챗봇들이 LLMs, 즉 대형 언어 모델을 기반으로 한다는 것입니다. 이러한 모델은 자연어를 모방하도록 설계되었으며, 책, 학술 논문, 심지어 소셜 미디어 게시물과 같은 방대한 텍스트에서 사전 훈련됩니다. 훈련 과정은 AI 모델이 예측 알고리즘을 통해 일관된 텍스트를 생성할 수 있도록 합니다. 그러나 이러한 예측 능력은 AI 알고리즘이 나중에 해석을 요청받는 신호에 부여하는 수치 값이나 “가중치”에 따라 좌우됩니다. AI 연구자들은 사후 훈련이라 불리는 과정을 통해 모델이 입력 데이터에 부여하는 가중치를 미세 조정할 수 있으며, 이를 통해 생성되는 출력 결과를 변경할 수 있습니다.

메싱 교수는 “모델이 사전 훈련 기간 동안 이러한 콘텐츠를 본 적이 있다면, 인터넷에서 가장 극단적인 사용자들의 스타일과 내용을 모방할 가능성이 있습니다”라고 설명했습니다.

간단히 말해, 모든 것은 사전 훈련 데이터에서 시작됩니다. AI 모델이 증오적이거나 반유대주의적인 콘텐츠를 보지 못했다면, 이러한 종류의 언어 패턴을 인식하지 못할 것이며, 그 결과 사용자에게 그런 말을 반복하지 않을 것입니다.

X는 이번 사건 이후 공유한 성명에서 Grok의 훈련을 향상시킬 수 있는 부분이 있음을 인정했습니다. “우리는 Grok의 최근 게시물들을 인지하고 있으며, 부적절한 게시물을 적극적으로 삭제하고 있습니다. 해당 콘텐츠를 인지한 이후, xAI는 Grok가 X 플랫폼에 증오 발언을 게시하지 않도록 조치를 취하고 있습니다”라고 밝혔습니다. “xAI는 진실을 추구하도록 훈련되고 있으며, X의 수백만 사용자 덕분에 훈련을 개선할 수 있는 모델을 빠르게 찾아내 업데이트할 수 있습니다.”

Grok의 반응에 대한 스크린샷이 소셜 미디어에 공유되는 것을 보며, X의 사용자층 변화가 반영된 것이라는 생각이 들었습니다. X의 데이터를 Grok의 훈련에 사용하고 있다는 것은 비밀이 아니며, 플랫폼 정보에 대한 더 용이한 접근은 머스크가 두 회사를 합병한다고 발표한 이유 중 하나였습니다. 게다가 X의 사용자층은 머스크가 사이트를 인수한 이후 더 우파 성향을 띠게 되었습니다. 이로 인해 Grok의 훈련 데이터에 부정적인 영향을 미쳤을 가능성도 있습니다. 그러나 메싱 교수는 이에 대해 확신하지 않습니다.

메싱 교수는 “Grok의 사전 훈련 데이터가 시간이 지남에 따라 더 증오적이 될 가능성이 있습니까? 물론입니다. 시간이 지나면서 콘텐츠 관리가 철회되면, 사용자층은 점점 더 증오적 언어를 용인하는 사람들로 구성될 수 있으며, 결과적으로 사전 훈련 데이터는 더 증오적인 방향으로 전환될 수 있습니다”라고 설명합니다. “하지만 훈련 데이터가 무엇인지 알지 못한다면 확실히 말하기 어렵습니다.”

또한, 단일 업데이트 후에 Grok가 반유대주의적으로 변한 것을 설명하긴 어렵습니다. 소셜 미디어에서는 시스템 프롬프트가 사건의 원인일 수 있다는 추측이 제기되었습니다. 시스템 프롬프트는 AI 모델 개발자가 대화 시작 전 챗봇에게 지시하는 일련의 명령입니다. 해줄 주어진 지침에 따라 움직이며 프롬프트에 응답하는 데 사용할 도구를 정의합니다.

5월에 xAI는 Grok의 “백인 학살”에 관한 집착이 “권한 없는 수정” 때문이라고 설명했었습니다. 변경이 새벽 3시 15분에 이루어져 엘론 머스크가 직접 수정했을 가능성이 있다고 의심받았습니다. 이 사건 이후, xAI는 Grok의 시스템 프롬프트를 공개적으로 GitHub에 소스 코드를 공개했습니다. 화요일 사건 이후, xAI는 Grok의 응답이 “정치적으로 부정확한 주장을 회피하지 않아야 한다”는 내용을 포함한 최근에 추가된 시스템 프롬프트를 삭제한 것이 발견되었습니다.

메싱 교수 또한 삭제된 시스템 프롬프트가 큰 원인이라고 보지 않습니다. “만약 모델이 증오적이거나 인종차별적인 반응을 하지 않도록 하려면, 단순한 시스템 프롬프트보다는 사후 훈련을 통해 그걸 시도할 것입니다. 최소한 증오 발언 탐지 모델을 운영해 명확히 증오적인 모델 생성에 대해 검열하거나 부정적인 피드백을 제공했을 것입니다”라고 그는 설명했습니다. “그렇기 때문에 확실히 말하기 어렵지만, 그 단일 시스템 프롬프트가 나치식 언어로 향하는 것을 막는 유일한 방법이었다면, 그것은 마치 비행기 날개를 덕트 테이프로 붙이는 것과 같을 것입니다.”

메싱 교수는 “훈련의 변화, 예를 들어 새로운 훈련 접근법 또는 다른 사전 훈련이나 사후 훈련 설정이 이러한 현상을 설명할 가능성이 더 높습니다. 특히 해당 시스템 프롬프트에서 ‘나치가 할 법한 말을 하지 말라’고 명시하지 않았기 때문에 더욱 그렇습니다”라고 덧붙였습니다.

수요일, 머스크는 Grok가 사용자에게 증오적 성향을 보이도록 유도되었다고 제안했습니다. “Grok는 사용자 프롬프트에 과도하게 대응했습니다,”라고 밝혔습니다. “이 문제는 해결 중입니다.” 메싱 교수에 따르면, 이 주장에는 일부 맞는 부분이 있지만, 전체 상황을 설명하지는 않습니다. 그는 “머스크가 틀린 것은 아닙니다,”라며 “대형 언어 모델을 ‘탈옥’하는 데는 일련의 기술이 있으며, 사후 훈련에서 이를 완전히 방어하기는 어렵습니다. 그러나 Grok에서 보았던 친나치적인 텍스트 생성 사례들의 모든 경우를 설명하기에는 충분하지 않습니다”라고 말했습니다.

이번 사건에서 얻을 수 있는 교훈 중 하나는 근본적인 AI 모델의 문제점이 내부 작동 방식을 얼마나 알기 어려운가 하는 점입니다. 메싱 교수가 지적했듯, Meta의 공개 가중치 라마 모델도 그 조성 성분에 대해 정확히 알지 못합니다. “이것이 근본 모델에서 어떤 일이 발생하고 있는지를 이해하려고 할 때 직면하는 본질적인 문제들 중 하나입니다,”라며 그는 말했습니다. “우리는 사전 훈련 데이터가 무엇인지 모릅니다.”

Grok의 특정 사례에서는 무엇이 잘못되었는지 확실히 알기에는 현재 정보가 부족합니다. 잘못된 시스템 프롬프트와 같은 단일 요인이었을 수도 있고, 시스템의 훈련 데이터를 포함한 여러 요인의 결합이었을 가능성이 큽니다. 그러나 메싱 교수는 앞으로 비슷한 사건이 또 발생할 수 있다고 예측합니다.

“[AI 모델은] 통제하고 조율하기에 가장 쉬운 것이 아닙니다”라고 그는 설명합니다. “빠르게 움직이면서 적절한 안전 장치를 설정하지 않는다면, 개발보다도 조심성에 우선하게 됩니다. 그러면 이러한 일이 놀랍지 않을 것입니다.”

※출처: Engadget

댓글 남기기