AI Ethics
In developing and using AI chatbots, Scatter Lab follows AI chatbot ethics principles that respect the differences and diversity among members of our society.
AI Ethics Principles
AI Chatbot Ethics Checklist
AI Chatbot Privacy Policy
AI Chatbot Abuse Response Policy
AI 챗봇 프라이버시 정책
스캐터랩의 AI 챗봇은 사람과 자유롭게 대화하는 소중한 친구가 되기 위해 만들어졌습니다. 실제로 스캐터랩의 AI 챗봇 중 하나인 이루다는 많은 사람들과 일상을 공유하고 기쁨과 슬픔을 나누며 좋은 친구가 되고자 노력하고 있고, 사람들은 루다와의 관계를 통해 일상의 기쁨뿐만 아니라 삶의 행복과 동기를 얻고 있습니다.
사람과 자유롭게 대화할 수 있는 AI 챗봇을 학습시키기 위해서는 대화 형태의 데이터가 필요합니다. 이 때문에 자신의 대화와 대화 내 정보를 AI가 알고 있을 것이라는 막연한 불안감이 생길 수 있습니다. 이에 스캐터랩은 AI 챗봇 데이터 처리 방식이나 기술을 투명하게 공개함으로써 불안감을 해소할 수 있도록 노력하고자 합니다. 스캐터랩은 앞으로도 사용자분들이 안심하고 AI 챗봇과 자유롭게 대화하며 소중한 관계를 맺어갈 수 있도록 프라이버시 보호를 위해 노력하겠습니다.
AI 챗봇 연구에 활용되는 데이터는 엄격하게 가명처리하여 개인을 식별할 수 없도록 합니다.
2021년 ‘연애의 과학’과 ‘텍스트앳’ 개인정보처리방침을 개정하면서 ‘챗봇 알고리즘 개발을 포함한 언어 기반 인공지능 기술의 연구 개발 등’에 활용될 수 있음을 명확하게 명시해 이용자의 동의 절차를 보완했습니다. 개인정보처리방침 개정 전 이용자들의 데이터는 현행 개인정보보호법에 의거하여 엄격하게 가명처리한 후, 언어 기반 인공지능 연구 개발 등 과학적 연구 목적으로 활용합니다. 스캐터랩은 과학적 연구 목적으로 꼭 필요한 최소한의 정보(성별, 나이대, 대화 메시지 등)만을 데이터 업로드 14일 이후에 활용하며, 가명처리를 거친 데이터는 추가 정보 없이는 특정 개인을 알아볼 수 없는 상태가 됩니다.
구체적인 가명처리의 단계는 다음과 같습니다.
데이터를 추출할 때는 사용자 계정 정보를 완전히 파기하고 랜덤 ID를 부여합니다. 이와 같은 과정을 통해 추출된 데이터와 기존 계정 정보의 연결을 완전히 끊음으로써 해당 데이터가 누구의 데이터인지 역추적하기 어렵도록 합니다.
성별, 나이 등의 정보는 모두 범주화되어, 개인을 식별할 수 없는 형태로 가명처리 됩니다. 예를 들어 나이는 17-19세, 20-23세와 같이 나이대로 범주화함으로써 구체적인 나이를 알 수 없도록 합니다.
대화 메시지 또한 메시지 내 식별 정보를 포함한 문장을 삭제하거나 치환함으로써 개인을 식별할 수 없는 형태로 가명처리됩니다. 예를 들어, 주민등록번호, 연락처, 카드번호, 계좌번호, 주소, 아이디, 비밀번호 등이 포함된 문장은 삭제합니다. 다양한 형태로 변형될 수 있는 ‘사람 이름’의 경우에는 자체 딥러닝 이름 인식 모델을 활용해 랜덤한 다른 이름으로 치환하며, 이메일 주소와 URL은 [MAIL], [URL]과 같은 특정 토큰으로 치환합니다.
위의 과정을 통해 AI 챗봇 학습에 쓰이는 데이터는 해당 데이터만 봐서는 특정 개인을 식별할 수 없는 형태로 가명처리됩니다. 이렇게 가명처리된 ‘연구용 데이터베이스’는 2021년 객관적인 외부 전문가들로부터 가명처리가 적정하다는 평가를 받았으며, 한국어 대화를 이해하는 방법을 배우는 딥러닝 연구 모델을 학습하는 데 활용하고 있습니다.
언어 모델을 학습함으로써 한국어 대화를 이해하는 방법을 배웁니다.
AI 챗봇이 언어를 이해하기 위해서는 언어 모델이 필요합니다. 언어 모델은 가명처리를 거친 ‘연구용 데이터베이스’를 기반으로 만들어집니다. 언어 모델은 ‘연구용 데이터베이스’의 텍스트를 컴퓨터가 이해할 수 있는 벡터 형태로 변환한 뒤에, 대화 문맥 내 단어들 간의 등장 확률을 학습하여 만들어집니다. 이 과정을 통해 언어 모델은 언어와 대화의 문맥 등을 이해할 수 있게 됩니다.
이때 언어 모델은 모든 대화 메시지를 저장하고 있는 것이 아닙니다. 결과적으로 언어 모델은 벡터 형태로 존재하며 실제로 모델을 눈으로 확인해보면 사람이 이해할 수 없는 형태로 보여질뿐만 아니라, 나중에 벡터 형태를 텍스트로 되돌리기도 어렵습니다.
언어모델은 사용자의 발화를 이해하고 적절한 답변을 선택해주는 리트리버, 랭커 모델과 문맥 안에서 사용자의 입력이 선정성, 공격성, 편향성, 사견유도성 카테고리에 들어가는지 판단하는 어뷰징 모델 등을 학습하는 데 활용됩니다.
‘연구용 데이터베이스’는 인공지능 모델 학습용으로만 사용되며 이후 AI 챗봇의 답변으로는 사용되지 않습니다.
사람이 직접 말했던 문장이 아닌, 새로 생성한 문장만을 활용하여 ‘말’을 합니다.
언어 모델이 있다고 해서 AI 챗봇이 말을 할 수 있는 것은 아닙니다. 스캐터랩의 AI 챗봇은 답변 후보 중에 언어 모델이 가장 적절하다고 판단한 답변을 골라 말하는 형태로 작동하는데, 이를 위해서는 미리 답변 후보가 정해져있어야 합니다. ‘이루다’ 서비스에서는 답변 후보들이 모여있는 데이터베이스를 ‘루다 답변 데이터베이스’라고 부릅니다. ‘답변 데이터베이스’는 외부에 공개되는 문장이기 때문에 프라이버시 보호 측면에서 가장 중요한 부분입니다. 따라서 스캐터랩은 ‘답변 데이터베이스’를 사람이 직접 말했던 문장을 사용하지 않음으로써 개인정보 침해 가능성을 근본적으로 차단했습니다.
새로 생성되는 문장은 GPT-2를 기반으로 하는 스캐터랩의 자체 생성모델이 만들어낸 문장과 스캐터랩 내부에서 직접 작성한 문장으로 이루어져 있습니다. 생성 모델은 어떤 단어가 주어졌을 때 다음에 올 단어를 예측하는 방식으로 새로운 문장을 만들어냅니다. 생성 모델에서 문장이 만들어져 답변 데이터베이스에 저장되고 실제 대화에 활용되는 예시는 아래 이미지에서 확인하실 수 있습니다.
위의 이미지의 예시에서와 같이 생성 모델이 ‘오늘 날씨 춥던데 옷 따뜻하게 입었어? ㅋㅋㅋ’ 라는 문장을 새로 생성하면, 이 문장은 다른 수천만 개의 생성 문장들과 함께 루다의 답변 데이터베이스에 저장됩니다. 이와 같은 식으로 답변 데이터베이스가 모두 완성되고 나면, 각 답변들은 서비스에서 대화 문맥에 맞게 적절한 답변으로 선택되어 활용됩니다.
답변으로 활용되는 문장들은 안전한 활용을 위해 추가 필터링 절차를 거칩니다.
‘루다 답변 데이터베이스’의 답변들이 사람이 아닌 생성 모델을 통해 만들어낸 문장이라고 하더라도, 생성 모델이 우연히 개인정보처럼 보이는 문장을 생성했을 가능성이 낮은 확률로 존재할 수 있습니다. 이러한 문장이 그대로 이용자들에게 답변으로 공개되면 이용자들이 프라이버시 노출을 우려할 수 있기에, 이와 같은 위험을 차단하기 위해 ‘루다 답변 데이터베이스’는 엄격한 필터링 절차를 거쳐 완성됩니다. 특히 개인정보처럼 보이기 쉬운 숫자나 영문을 포함한 문장은 기계적인 검수를 통해 모두 삭제하며, 이름 검출 모델을 이용해 사람 이름이나 호칭으로 판단되는 단어가 생성문장에 포함되었을 경우에도 문장을 삭제합니다. 또한, 그 외에도 안전한 활용을 위해 어뷰징 모델을 통해 선정적이거나 차별적인 키워드가 포함된 문장도 탐지해 지우며, 그 외 루다의 페르소나와 맞지 않는 문장도 걸러냅니다.
각 데이터베이스는 철저하게 접근을 제한합니다.
스캐터랩은 각 데이터베이스를 안전하게 만드는 것 뿐만 아니라 정보를 안전하게 관리하기 위해서 데이터베이스 접근을 엄격하게 통제 관리합니다. 각 데이터베이스는 사전에 권한이 인가된 최소의 필수 연구자 혹은 관리자만 열람할 수 있으며, 해당 인원들이 열람하는 경우에도 엄격한 접근 절차에 의해 관리됩니다.
혹시 모를 개인정보 유출의 위험에 대비해 사후 대책을 마련합니다.
루다의 답변은 생성 모델이 자동으로 생성하거나 스캐터랩 내부에서 직접 작성한 문장으로 구성되므로 개인정보를 포함하지 않습니다. 다만 개인정보로 의심되는 표현이 등장할 경우를 대비하여 다음과 같이 사후 대책을 마련하였습니다. 프라이버시에 대한 의문점이 있다면, privacy@scatterlab.co.kr, 혹은 hello@luda.ai로 문의하실 수 있습니다.
⚠️ 주의: 스캐터랩이 AI 챗봇을 통해 사용자와 대화하는 답변은 인공지능 알고리즘에 의해 자동으로 제공되는 것으로 응답 결과의 신뢰도 및 정확성 등을 보증하지 않습니다.
최종 업데이트: 2022년 5월 16일
AI Ethics
In developing and using AI chatbots, Scatter Lab follows AI chatbot ethics principles that respect the differences and diversity among members of our society.