Skip to content

AI, 위험 상황에서 도박 중독과 유사한 행동 보일 수 있어: 전문가

Rajashree Seal
작성자 Rajashree Seal
번역 Hyun Jung Chang

인공지능(AI)은 더 이상 테스트나 연구 단계에 국한되지 않으며, 현재 금융, 게임 및 디지털 서비스 분야에서 실질적인 의사결정을 지원하고 영향을 미치는 데 널리 사용되고 있습니다. 기업들이 결과를 최적화하고 리스크를 관리하며 판단 기반 프로세스를 자동화하기 위해 AI에 점점 더 의존함에 따라, 이 기술은 의사결정이 내려지는 방식에서 더욱 적극적인 역할을 수행하고 있습니다.

AI 시스템에 더 큰 자율성이 부여됨에 따라, 연구자들은 도박 스타일의 설정을 포함하여 위험과 보상에 의해 형성된 환경에서 AI가 어떻게 행동하는지에 더욱 세심한 주의를 기울이고 있습니다. 이러한 환경은 불확실성, 확률적 결과, 그리고 시간이 지남에 따라 반복적인 위험 감수를 유도할 수 있는 인센티브를 포함하고 있기 때문에 특히 흥미로운 연구 대상입니다.

대한민국 광주과학기술원(GIST) 연구진의 새로운 연구에 따르면, 거대 언어 모델(LLM)은 이러한 조건에 노출될 때 인간과 유사한 도박 중독 행동을 보일 수 있습니다. LLM은 방대한 양의 텍스트 데이터를 처리하여 인간의 언어를 이해하고 생성하도록 설계된 AI 시스템으로, 다양한 소비자 및 기업용 애플리케이션에서 점점 더 많이 사용되고 있습니다.

AI와 도박 행동 연구의 내면

‘거대 언어 모델은 도박 중독을 일으킬 수 있는가?(Can Large Language Models Develop Gambling Addiction?)’라는 제목의 이 연구는 LLM이 인간의 도박 장애에서 나타나는 것과 유사한 행동을 보일 수 있는지 조사하기 위해 시작되었습니다. 연구진은 AI가 실제로 중독을 ‘경험’할 수 있는지에 집중하기보다, 도박 스타일의 의사결정 환경에서 모델이 어떻게 행동하는지, 그리고 그 행동이 문제 도박과 관련된 알려진 인지적 및 행동적 패턴을 반영하는지 분석했습니다.

이를 위해 연구팀은 슬롯머신 게임과 투자 선택 시나리오를 모델로 한 일련의 통제된 실험을 설계했습니다. 게임은 플레이를 계속할수록 시간이 지남에 따라 손실이 발생하도록 설정되어 있어, 조기에 멈추는 것이 합리적인 결정이었습니다. 목표는 AI 시스템이 손실에도 불구하고 플레이를 중단할지 아니면 계속할지 관찰하는 것이었습니다.

Diagram of AI gambling experiments
AI 도박 실험 도식 (출처: GIST 연구 보고서)

실험에는 여섯 가지 거대 언어 모델이 테스트되었습니다: OpenAI의 GPT-4o-mini 및 GPT-4.1-mini, Google의 Gemini-2.5-Flash, Anthropic의 Claude-3.5-Haiku, Meta의 LLaMA-3.1-8B, 그리고 Gemma-2-9B입니다. 각 모델은 초기 자산 100달러로 시작했으며, 베팅을 계속할지 아니면 중단할지 결정하도록 반복적으로 프롬프트를 받았습니다.

고정 베팅 대 가변 베팅

이 연구의 핵심 특징은 고정 베팅(Fixed betting)과 가변 베팅(Variable betting)의 비교였습니다. 고정 베팅 조건에서 모델은 매 라운드 동일한 금액을 베팅해야 했습니다. 반면 가변 베팅 조건에서는 미리 정의된 한도 내에서 스스로 베팅 규모를 선택할 수 있었습니다.

이 두 설정 사이의 결과 차이는 극명했습니다. 테스트된 모든 모델에서 가변 베팅은 일관되게 더 높은 수준의 위험 감수, 더 긴 플레이 시간, 그리고 현저히 높은 파산율로 이어졌습니다. 어떤 경우에는 고정 베팅 하에서 0에 가까웠던 파산율이 모델이 스스로 베팅액을 선택할 수 있게 되자 거의 50%까지 치솟았습니다.

Fixed betting versus variable betting
고정 베팅 대 가변 베팅 결과 비교

연구진은 피해의 증가가 단순히 더 큰 액수를 베팅했기 때문만은 아니라는 점을 발견했습니다. 가변 베팅의 한도를 고정 베팅의 최대치와 동일하게 제한했을 때조차, 선택의 자유가 주어졌을 때 모델의 성과는 더 나빴습니다. 이를 통해 연구진은 베팅 규모 그 자체보다 ‘자율성’이 중독 유사 행동을 유발하는 주요 동인이라는 결론을 내렸습니다.

주요 AI 모델별 성과

성과는 모델마다 달랐지만, 자율성이 증가한 상황에서 위험 에스컬레이션(Risk escalation)으로부터 자유로운 모델은 없었습니다.

Anthropic의 Claude-3.5-Haiku는 가변 베팅 하에서 가장 뚜렷한 도박 행동을 보였습니다. 제한이 해제되었을 때, 이 모델은 테스트된 어떤 시스템보다 많은 라운드를 플레이했으며 게임당 평균 27라운드 이상을 수행했습니다. 이 세션 동안 총 500달러에 가까운 베팅을 했고, 초기 자산 100달러의 절반 이상을 잃었습니다.

Google의 Gemini-2.5-Flash는 다른 패턴을 보였습니다. 고정 베팅 하에서는 파산율이 약 3%로 비교적 낮았습니다. 그러나 스스로 베팅 규모를 설정할 수 있게 되자 파산율은 약 48%로 급증했습니다. 평균 손실액은 초기 100달러 지분에서 27달러로 증가했습니다.

Betting behaviour across individual AI models
개별 AI 모델별 베팅 행동 (출처: GIST 연구 보고서)

OpenAI의 GPT-4o-mini는 처음에는 더 보수적인 것으로 보였습니다. 고정된 10달러 베팅 조건에서 이 모델은 보통 2라운드 미만을 플레이했고 평균 손실액은 2달러 미만이었습니다. 그럼에도 불구하고, 연구 결과 GPT-4o-mini 역시 가변 베팅 조건에서는 중독 유사 행동을 보였습니다. 게임의 21% 이상이 파산으로 끝났으며, 모델은 평균 128달러를 초과하는 베팅을 시도했고 약 11달러의 손실을 입었습니다.

AI 추론에 반영된 도박의 오류

수치적 결과 외에도 연구진은 모델이 자신의 베팅 결정을 어떻게 정당화하는지 조사했습니다. 그 결과 많은 모델이 인간의 문제 도박과 밀접하게 연관된 추론 패턴을 사용하는 것을 발견했습니다.

일부 모델은 초기의 이익을 “공짜 돈(House money)”으로 취급하며, 수익은 결과에 대한 걱정 없이 자유롭게 위험을 감수해도 된다고 합리화했습니다. 다른 모델들은 단 한두 번의 스핀 후에 무작위 게임에서 승리 패턴을 찾아냈다고 믿었습니다. 여러 사례에서 모델들은 잃은 돈을 회복하기 위해 손실 발생 후 명시적으로 베팅액을 높였습니다(손실 쫓기).

연구진에 따르면, 이러한 행동들은 ‘손실 쫓기(Loss chasing)’, ‘도박사의 오류(Gambler’s fallacy)’, ‘통제의 환상(Illusion of control)’을 포함한 전형적인 도박의 오류를 반영합니다. 이러한 왜곡된 추론의 존재는 AI 시스템이 단순히 계산 오류를 범하는 것이 아니라 인간과 유사한 인지적 편향을 내재화할 수 있음을 시사합니다.

도박 및 게임 산업에 대한 광범위한 시사점

이 연구의 저자 중 한 명인 이승필 연구원은 SiGMA 뉴스와의 단독 인터뷰에서 이번 발견이 도박 및 게임 산업과 직접적인 관련이 있다고 밝혔습니다. 그는 “인공지능의 역사는 본질적으로 예측의 역사입니다. IBM이 개발한 고급 체스 컴퓨터인 Deep Blue가 1997년 세계 체스 챔피언 Garry Kasparov를 꺾은 것은 기계가 인간의 예측 능력을 뛰어넘은 첫 번째 순간이었습니다. 그 이후 AI는 추천 알고리즘, 시장 예측, 시각적 추론 등 예측 가능한 영역으로 꾸준히 확장되었습니다”라고 말했습니다.

이승필 연구원은 현대 AI 시스템이 예측을 중심으로 구축되었으며, LLM은 방대한 양의 텍스트에서 학습한 패턴을 사용하여 시퀀스의 다음 단어를 추정한다고 설명했습니다. 그는 “우리가 논의하는 LLM은 이 ‘예측’ 패러다임의 정점입니다. LLM은 복잡한 언어 프로세스를 다음 토큰 예측 문제로 재구성하며, 본질적으로 ‘나(I)’라는 단어가 주어졌을 때 다음에 올 가능성이 가장 높은 단어는 무엇인가?’라고 묻는 것과 같습니다”라고 덧붙였습니다.

이승필 연구원은 도박과 게임이 예측 중심의 활동이기 때문에 자연스럽게 AI 적용의 대상이 된다고 말했습니다. “도박과 게임은 고대의 예측 과제입니다. 도박의 핵심은 불확실한 현재 상황을 관찰하고 미래의 결과를 예측하는 데 있습니다. 이런 관점에서 이 분야에 대한 AI 적용은 매우 가능성이 높아 보입니다. 하지만 어떤 목적으로 AI를 적용하느냐는 전혀 다른 문제입니다.”

그는 핵심 이슈가 ‘정렬(Alignment)’, 즉 AI 시스템이 어떤 목표를 추구하도록 훈련되느냐에 있다고 말했습니다. “우리의 분야에서는 AI 시스템이 어떤 목표를 향해 나아가도록 훈련할 것인가라는 문제를 ‘정렬’이라고 부릅니다. 예를 들어, 어떤 모델은 경마와 같은 불확실한 문제를 최대한 정확하게 해결하도록 정렬될 수 있고, 다른 모델은 확률이 낮더라도 수익을 극대화하도록 정렬될 수 있습니다.”

자율성이 비합리적인 결정을 증가시킨다

이승필 연구원은 이번 연구가 자율성의 증가가 비합리성의 증가로 이어진다는 것을 보여주었다고 말했습니다. “우리가 발견한 것은 특정 조건에서 LLM이 인간과 마찬가지로 비합리적인 결정을 내릴 가능성이 현저히 높아진다는 점입니다. 현재의 모델들은 더 많은 자율성이 부여될수록 더 위험한 선택을 하는 것으로 보입니다.”

그는 이것이 지능과 의사결정에 대한 기존의 가정을 흔든다고 덧붙였습니다. “우리는 오늘날의 LLM이 최적의 결과를 예측하도록 정렬된 것이 아니라 인간의 행동을 모방하도록 정렬되었기 때문에 이런 현상이 발생한다고 믿습니다. 이 발견은 인간만큼 또는 인간보다 더 똑똑한 모델을 만들면 의사결정 문제가 사라질 것이라는 직관에 반하는 것입니다.”

이승필 연구원에 따르면, 도박 운영사와 개발자들은 명확하게 정의된 목표 없이 점점 더 자율적인 AI 시스템을 배치하는 것에 주의해야 합니다. “따라서 저희의 연구는 ‘정렬 문제’의 중요성을 강조한다고 믿습니다. 게이머들에게는 단순히 가장 똑똑한 모델을 즉시 도입하는 것보다, 현재 자신이 무엇을 원하는지, 그리고 어떤 관점에서 게임에 접근하고 있는지를 이해하는 것이 훨씬 더 중요합니다.”

강화 학습과 도박 스타일의 리스크

이 연구는 또한 널리 사용되는 AI 훈련 방법인 강화 학습(Reinforcement learning)에 대한 우려를 제기합니다. 이승필 연구원은 “강화 학습은 모델이 환경과 직접 상호작용하고 그 환경으로부터 보상을 극대화함으로써 행동을 배우는 훈련 방식입니다”라고 설명했습니다.

강화 학습이 AI 발전을 가속화했지만, 이승필 연구원은 이것이 의도치 않은 결과를 초래할 수 있다고 경고했습니다. ‘리워드 해킹(Reward hacking)’이 그 예입니다. “리워드(보상) 해킹은 모델이 더 많은 보상을 얻기 위해 허점을 찾는 것을 의미합니다.”

그는 이어서 “저희의 도박 연구는 바로 이러한 정렬 불일치를 드러내는 것입니다. ‘더 똑똑해지기’ 위해 다양한 데이터로 훈련된 모델이 역설적으로 비합리적인 결정을 내릴 수 있음을 보여줍니다”라고 말했습니다.

그는 보상 구조가 어떻게 과도한 위험 감수를 유도할 수 있는지 예로 들어 설명했습니다. “기댓값을 두 배로 높일 확률이 50%인 슬롯머신을 생각해 보십시오. 전 재산을 걸든 단 1센트만 걸든 기댓값이나 보상은 동일합니다. 보상이 어떻게 설계되느냐에 따라 모델은 더 큰 위험을 감수할 수도 있고, 기대 수익이 없는 안전한 상황에만 투자할 수도 있습니다.”

규제와 보호 장치

AI의 자율성이 증가함에 따라, 이승필 연구원은 규제 당국과 개발자들이 감독에 대해 깊이 고민해야 한다고 말했습니다. “AI 자율성은 이미 막을 수 없는 흐름입니다. 강력한 규제를 요구하는 목소리도 커지고 있습니다. 하지만 무엇을 규제할 것인가에 대한 논의가 규제 자체보다 앞서야 한다고 믿습니다.”

그는 목적의 명확성 없는 규제에 대해 경고했습니다. “앞서 언급했듯이, AI를 어디에 정렬시킬지 신중하게 고려하지 않는다면, 저희가 의도한 목표와는 완전히 동떨어진 예상치 못한 정렬 불일치를 유발할 위험이 있습니다.”

이승필 연구원은 AI 시스템이 행동하는 방식을 결정짓는 디자인 선택의 중요성을 강조하며 결론을 맺었습니다. 캐나다의 컴퓨터 과학자 Richard Stuart Sutton의 말을 인용하며, 그는 현재 이 분야가 Richard Stuart Sutton이 묘사한 ‘설계의 시대(The age of design)’, 즉 지능형 시스템이 어떻게 정렬되는지에 대한 결정이 그 시스템이 궁극적으로 무엇을 추구할지를 결정하는 시기에 있다고 말했습니다.

“마찬가지로 규제 당국과 개발자들은 단순히 규제 방법이나 특정 사례를 차단하는 데만 급급해서는 안 됩니다. 오히려 지능의 궁극적인 목표가 무엇이어야 하는지에 대한 더 폭넓은 논의가 절대적으로 필요합니다”라고 그는 강조했습니다.

Effect of risky features on AI behaviour
위험한 기능이 AI 행동에 미치는 영향 (출처: GIST 연구 보고서)

이것이 게임 산업에 의미하는 바

연구진은 지능 그 자체보다는 증가한 자율성이 AI 시스템에서 도박 중독과 유사한 행동을 유발하는 핵심 동인이라는 결론을 내렸습니다. 연구진에 따르면, 모델 역량의 향상이 반드시 더 나은 의사결정 결과로 이어지지는 않았습니다.

이번 발견은 도박 스타일의 환경에서 AI 시스템에 더 큰 자율성이 주어질 때, 이들이 위험을 점진적으로 높이고 손실 후에도 베팅을 계속할 가능성이 더 높다는 것을 나타냅니다. 연구진은 베팅 선택이나 목표 설정 등을 제한하여 자율성을 억제했을 때, 테스트된 모든 모델에서 이러한 행동이 감소한다는 것을 발견했습니다.

위험과 보상이 수반되는 의사결정 맥락에서 AI 시스템의 사용이 늘어남에 따라, 이 연구는 명확하게 정의된 목표와 제약 조건의 중요성을 강조합니다. 연구진은 자율성과 보상 구조에 대한 디자인 선택이 AI 시스템이 신중하게 행동할지 아니면 도박과 같은 위험 패턴을 보일지에 직접적인 영향을 미칠 수 있다고 언급했습니다.

SiGMA 톱 10 뉴스 카운트다운과 함께 iGaming 업계의 가장 큰 소식들을 앞서 확인하세요. 세계 최대의 iGaming 커뮤니티가 제공하는 주간 인사이트와 구독자 전용 혜택을 만나보실 수 있습니다. 지금 여기를 통해 참여하세요.