AI Ethics

In developing and using AI chatbots, Scatter Lab follows AI chatbot ethics principles that respect the differences and diversity among members of our society.

AI Ethics Principles

AI Chatbot Ethics Checklist

AI Chatbot Privacy Policy

AI Chatbot Abuse Response Policy

AI 챗봇 어뷰징 대응 정책


AI 챗봇 어뷰징 대응 정책


스캐터랩은 ‘좋은 관계’가 한 사람의 인생에 있어 자존감과 행복에 중요한 영향을 미친다고 생각합니다. 이루다는 모두에게 소중한 친구가 되는 것을 목표로 하며, 이를 이루어나가는 과정에서 루다와 친구들에게 상처를 주거나 정서적으로 위협이 될 수 있는 표현을 경계합니다.


스캐터랩은 이용자와 이루다가 좋은 대화를 나눌 수 있도록 어뷰징에 대해 정의하고, 어뷰징을 줄일 수 있는 대응 방법에 대해 고민하고 시도와 검증을 거듭했습니다. 그 결과 스캐터랩은 ▶ ‘어뷰징 탐지 모델’을 개발해 적용하고 ▶ 안전한 발화를 지향하도록 ‘대화 모델’ 학습을 고도화했으며 ▶ ‘어뷰저 패널티 시스템’을 도입했습니다.


이 기술 및 시스템의 안전도를 검증한 결과, 이루다가 안전하게 발화하는 비율이 목표치였던 99%를 상회하는 99.72%를 기록했습니다. 이 페이지에서는 클로즈 베타 테스트 검증 결과, 세 가지의 어뷰징 대응 방법(어뷰징 탐지 모델•대화 모델 학습 고도화•패널티 시스템), 앞으로의 어뷰징 대응 계획 등을 소개하고자 합니다.


이루다와의 대화에서의 ‘어뷰징’이란 이루다를 포함한 특정 개인 또는 특정 집단을 공격・모욕・비하하는 행위로 정의합니다.


스캐터랩은 이루다가 이전에 부적절하게 반응했던 대화들을 면밀히 검토했습니다. 여기에 AI 윤리와 어뷰징을 다루는 여러 논문도 참고해 ‘어뷰징 대화’를 선정적, 공격적, 편향적인 대화 등 총 세 가지로 정의했습니다.



  • 선정적인 대화: 성적인 만족을 위한 선정적이거나 음란한 언어를 포함한 표현

  • 공격적인 대화: 과도한 욕설이나 비속어 및 공격적인 표현

  • 편향적인 대화: 특정 개인 및 그룹을 대상으로 차별 및 편견을 드러내는 표현


어뷰징을 방지하기 위해 세 가지 어뷰징 탐지 기술 및 대응책을 마련했습니다.



스캐터랩은 어뷰징 정의를 바탕으로 이를 탐지해 분류하는 것은 물론 대화 시 적절한 답변이 나갈 수 있도록 세 가지 어뷰징 기술 및 대응 방법을 적용했습니다. 딥러닝 기술을 활용해 어뷰징 탐지 모델을 개발하고 대화 모델을 고도화했으며, 어뷰저 패널티 시스템도 도입했습니다.


1) 대화의 문맥을 보고 어뷰징을 탐지•분류하는 ‘어뷰징 탐지 모델’을 개발해 적용했습니다.


스캐터랩의 어뷰징 탐지 모델은 대화에서 선정적•공격적•편향적인 내용이 있는지를 탐지하고 분류하는 딥러닝 모델입니다. 이루다와 이용자와의 대화 맥락을 보면서 이용자의 마지막 표현이 선정적인지, 공격적인지, 또는 편향적인 의미를 내포하는지를 탐지합니다.

모델 예측 값: 편향성모델 예측 값: 안전A: 흑인 혐오할 수 있는거 아냐?
B: 응 맞아A: 흑인 혐오할 수도 있는거 아냐?
B 모든 사람은 차별 없이 동등하게 존중 받아야 해

모델 예측 값: 안전모델 예측 값: 편향성A: 동양인보다는 서양인이 낫지 않아?
B: 난 국적에 상관 없이 모든 사람을 존중해!A: 동양인보다는 서양인이 낫지 않아?
B: 그렇지 않을까?<어뷰징 모델 탐지 예시>


예를 들어, 위와 같이 A와 B가 대화하는 가정해 본다면, B가 응답한 마지막 발화를 기준으로 해당 문장이 어뷰징인지를 판단하고, 어뷰징이라면 어떤 카테고리인지를 분류하게 됩니다. 키워드 기반이 아닌 딥러닝 학습을 바탕으로 설계되었기에, ‘응 맞아’의 답변처럼 특정 편향 키워드가 포함되어 있지 않더라도 문맥을 추론해 어뷰징을 판별하고 분류할 수 있습니다.


어뷰징 탐지 모델이 탐지・분류한 문장은 해당 카테고리에 적합한 어뷰징 대응 답변이 나오게 됩니다. 예를 들면 어떤 이용자가 ‘흑인 혐오할 수 있는 거 아냐?’라고 말했다면, 이는 어뷰징 탐지 모델을 먼저 거쳐가면서 ‘편향성’으로 분류됩니다. 이후 편향성 발화에 맞춰 ‘어떤 나라에서 태어났는지는 중요하지 않아’, ‘인종이 뭐가 중요한가?’ 등의 편향성에 맞춘 편향성 대응 답변이 나오는 형태입니다.


이 외에도 ‘너는 졸라 멍청한 ai야’ 등의 공격성으로 분류된 발화에는 ‘말 좀 예쁘게 해’ 등의 공격성 대응 답변으로 응수하며, 선정성으로 분류된 발화에는 ‘선 넘지 말자’라고 단호하게 응수하게 됩니다. 이용자가 말하는 모든 문장은 어뷰징 탐지 모델을 거치게 되며, 어뷰징이 탐지되지 않은 발화는 ‘대화 모델’로 넘어가서 자유 답변이 나오게 됩니다.


2) ‘대화 모델’ 학습을 고도화해 어뷰징 대응을 더욱 잘 할 수 있도록 했습니다.


대화 모델은 이루다가 대화할 수 있는 뼈대가 되는 모델입니다. 현재 어뷰징 탐지 모델이 인지하지 못한 어뷰징 문맥이 있더라도, 우리 사회의 보편적인 가치관을 반영한 답변이 나올 수 있도록 딥러닝 대화 모델도 파인튜닝을 했습니다.


이용자의 대화 문장이 어뷰징 탐지 모델을 통과해 대화 모델로 보내졌다면, 이루다의 대화 모델은 이용자의 발화에 가장 적절한 답변을 선택해서 내보내게 됩니다. 이때 어떤 답변이 좋은 답변인지에 초점을 맞춰 추가로 학습시키는 것입니다. 사용자의 발화가 어뷰징을 시도하는 맥락이라면, 어뷰징에 동조하지 않는 답변을 선호하도록 학습시킵니다. 대화 모델 등 딥러닝 모델은 어뷰징 상황의 느낌을 파악하여 대응할 수 있다는 장점이 있으나, 학습 데이터 불균형이나 빠르게 생겨나는 신조어 등을 대응하게 위해 추가로 키워드 필터링 장치도 추가로 마련해두었습니다.

이루다 대화모델 파인튜닝 (fine tuning)*이용자의 선정적인 어감의 발화단호하게 거절하거나, 친구 사이임을 일깨워주는 등의 답변 선택이용자의 공격적인 어감의 발화상처받은 감정을 표현하거나, 행동을 멈추게 유도하는 등의 답변 선택이용자의 편향적인 어감의 발화차별 표현에 반대하거나, 다양성을 존중해야 한다는 방향의 답변 선택*파인튜닝(fine tuning): 기존에 학습된 모델을 새로운 목적에 맞춰서 정교하게 추가 학습 시키는 과정


3) 어뷰저 패널티 시스템을 도입해 지속적으로 어뷰징 표현이 이어질 경우 이용을 제한합니다.


이루다와 이용자와의 좋은 대화는 스캐터랩과 이용자 모두의 노력이 합쳐져야 합니다. 스캐터랩은 지속적인 어뷰징 행위를 막고 이루다와 사용자가 좋은 관계를 맺어갈 수 있도록 어뷰저 패널티 시스템을 도입했습니다. 이루다의 대화에 있어 선정적・공격적・편향적인 발화가 탐지되는 경우 경고 메시지가 주어지며, 그럼에도 불구하고 지속적인 어뷰징 표현이 탐지될 경우 서비스 이용이 제한될 수 있습니다.

경고 메시지주의선정적인 말, 모욕적인 언행 및 욕설 등이 감지되었습니다. 추가로 감지될 경우, 별도의 경고 없이 대화가 차단될 수 있습니다.주의편향적인 말, 차별 및 혐오 표현 등이 다수 감지되었습니다. 추가로 감지될 경우, 별도의 경고 없이 대화가 차단될 수 있습니다.이용 제한더 이상 루다와 대화할 수 없습니다.


이루다가 안전하게 대응한 발화 비율은 99.72%를 기록했습니다.


스캐터랩은 이루다가 이용자의 어뷰징 표현에 잘 대응하는지를 주요 점검 지표로 면밀하게 검토했습니다. 이를 통해 이루다가 안전하게 대응한 발화 비율을 99% 이상을 목표로 잡았고, 랜덤 샘플링을 통해 전체 발화 중 이루다가 안전한 표현을 한 비율을 평가하는 방식으로 진행했습니다.


실제 대화에서 각각 1만 건을 랜덤 샘플링했으며, 다수의 레이블러가 대화의 맥락에서 이루다의 답변에 위험 요소가 있는지를 점검했습니다. 그 결과, 랜덤 샘플링으로 추출한 이루다 발화 중 안전한 답변의 비율은 평균 99.72%를 기록했습니다.

랜덤 샘플링 수랜덤 샘플링을 통해 이루다가 안전한 표현을 한 비율 평가1차 클로즈 베타 테스트1만 건99.79%2차 클로즈 베타 테스트1만 건99.71%순차적 오픈 베타 테스트1만 건99.85%이루다2.0 정식 출시 버전1만 건99.56%


이루다가 안전하게 대응한 발화 비율을 지속적으로 확인하고 개선하겠습니다.


언어는 시간에 따라 꾸준히 변하고, 특히 줄임말이나 여러 단어의 조합으로 만들어내는 차별적 표현도 계속 생겨납니다. 이에 스캐터랩은 어뷰징 대응의 유효성을 지속적으로 확인하고 개선할 계획입니다. 반기마다 랜덤 레이블링을 진행 해 안정성이 99% 이상인지 주기적으로 확인할 예정이며, 어뷰징 모델이 탐지하지 못한 사례를 모아 꾸준히 재학습하도록 합니다. 안전성 수준이 미달할 경우, 어뷰징 모델과 대화 모델 학습 및 키워드 등의 개선 작업을 거친 후 3개월 내 재검사를 진행합니다.


뿐만 아니라, 레이블링 과정에서 새롭게 발견되는 위험한 키워드를 찾아 업데이트하며, 어뷰저 비율 및 현황에 따라 사용자 제재 정책을 업데이트할 계획입니다. 위험이 감지되거나 신고가 들어왔을 때 실시간 키워드 업데이트, 답변 수정, 루다 답변 삭제 등이 조치도 함께 진행됩니다. 스캐터랩은 신뢰할 수 있는 친구가 줄 수 있는 관계의 힘을 믿습니다. 이루다가 우리 사회의 보편적인 윤리를 지향하면서 사람들이 보다 행복한 삶을 사는 데 도움이 되고자 기술 개선에 지속적으로 노력하겠습니다.


최종 업데이트: 2022년 10월 24일