OpenAI는 ChatGPT의 답변 품질을 개선하기 위해, 실제 사용자 및 ChatGPT의 대화를 인데로 읽어대고 평가하는 내부 프로젝트 “Project Lily”를 진행하고 있다고, 해외 미디어 404 Media가 보도했습니다. 리뷰 담당자에게 사용자 이름이 표시되지 않으며, 개인 정보를 숨기는 처리가 또한 수행됩니다만, 대화에 포함되는 개인적인 정보가 완전히 제거되지 않고, 인간까지 도달하는 경우도 있습니다.
수백 명의 계약직 직원이 실제 ChatGPT 대화를 읽고 있음이 보고됨https://thenextweb.com/news/chatgpt-human-reviewers-gdprChatGPT와 같은 생성 AI를 개선하려면 단순히 방대한 양의 텍스트를 학습시키는 것뿐만 아니라 생성된 답변이 적절했는지 사람이 평가하는 작업도 필요합니다. Project Lily에서는 수백 명 규모의 계약직 직원이 실제로 이루어진 인간과 ChatGPT의 대화를 읽고 답변의 품질이나 문제점을 평가하고 있는 것으로 전해졌습니다.
ChatGPT는 업무나 문서 작성뿐만 아니라 가족 관계, 건강, 고민 등과 같이 개인적인 대화 주제에도 활용되고 있습니다. 404 Media는 “실제 사용자의 대화가 평가 대상이 되는 것에 대해 개인 정보 보호상의 큰 위험이 있다”고 지적했습니다. 같은 문제를 보도하고 있는 The Next Web에 따르면, 리뷰 화면에서는 사용자 이름이 익명화되어 있지만 ChatGPT가 보유하고 있는 메모리의 요약이 표시되는 경우도 있으며, 과거의 이용 내용이나 대략적인 거주 지역에 대한 정보가 포함되는 경우도 있습니다. OpenAI는 리뷰 전에 개인 정보를 줄이기 위해 “OpenAI Privacy Filter”를 사용하고 있습니다. OpenAI가 공개하고 있는 OpenAI Privacy Filter 동작 예시에서는 아래 그림과 같이 이름, 주소, 이메일 주소, 전화번호 등 개인을 특정할 수 있는 정보가 레이블로 대체됩니다.
다만, 프라이버시 필터로 모든 개인 정보를 제거할 수 있는 것은 아닙니다. OpenAI 자체도 “일반적이지 않은 식별 정보나 맥락에 따라 의미가 달라지는 개인적인 정보를 놓칠 수 있다”고 설명하고 있으며, 404 Media는 “기밀성이 높은 정보가 그대로 검토 담당자에게 전달될 가능성을 OpenAI가 인정했다”고 보도했습니다. 또한, OpenAI의 개인정보처리방침에는 서비스 운영 및 개선에 필요한 범위 내에서 벤더 또는 서비스 제공 사업자가 개인 데이터를 처리하는 경우에 해당한다고 명시되어 있습니다. 더불어 개인용 ChatGPT에서는 표준적으로 대화가 모델 개선에 활용되는 설정으로 되어 있습니다. 설정에 따라 대화 데이터를 모델 개선에 활용되지 않도록 할 수도 있습니다. “설정”을 열고 “데이터 컨트롤”에서 “모델 개선에 협력”을 끄면, 그 이후의 새로운 대화는 모델의 훈련에 사용되지 않습니다.
한편, ChatGPT Business, Enterprise, Edu에서는 대화가 기본적으로 모델 개선에 사용되지 않는 설정이 되어 있습니다. 또한 “일시 채팅”의 대화도 모델 개선에는 사용되지 않으며, 일반적으로 30일 후에 삭제됩니다. 404 Media가 Project Lily를 둘러싸고 인간이 ChatGPT와의 대화를 읽는 가능성을 OpenAI에 어디에서 사용자에게 알리고 있는지 문의한 결과, OpenAI는 인간 검토에 대한 내용을 담은 도움말 페이지를 안내했습니다.
원문 보기 | 출처: Gigazine