# AI 시대에는 이전보다 훨씬 더 “얼굴의 좋은 점”이 중요해질 수 있으며, AI는 인간보다 훨씬 더 얼굴 편견이 강하기 때문입니다.

> https://bookfactory.kr/board/news/19599
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-10-02T05:46:34.951Z

---

사람은 타인을 평가할 때 그 사람의 “얼굴”에 영향을 받기 쉬운 경향이 있으며, 외모가 매력적인 사람일수록 성적이 높거나 범죄로 체포되었을 때 형량이 짧아지는 경향이 있습니다. 다양한 현장에 AI를 도입한다면 이러한 편견(바이애스)을 배제할 수 있다고 생각할 수 있지만, OpenAI, Google, Anthropic의 AI 모델을 조사한 연구에 따르면 AI는 오히려 인간보다 얼굴에 대한 편견이 더 강한 것으로 나타났습니다. Like humans, language models demonstrate face-to-character biases | PNAS Nexus | Oxford Academic

인간은 타인의 얼굴을 보게 되면 그 형태와 질감의 미묘한 차이점에 근거하여 그 사람이 신뢰할 만한지, 혹은 능력이 있는지 즉시 추측하는 경향이 있습니다. 실제로는 얼굴의 구조가 그 사람의 성격을 나타내는 것은 아니지만, 인간에게는 어릴 때부터 이러한 인지적 오류가 뿌리내려 있는 것으로 보입니다. 하버드 대학교의 윤리학 교수인 마자린 바나이지는 “얼굴에 기반한 판단은 우리가 내리는 많은 결정에 깊이 관여합니다. 그래서 올바른 판단을 내리는 것이 중요한 것입니다”라고 밝혔습니다. 최근에는 텍스트, 이미지, 음성 등을 처리할 수 있는 멀티모달 AI가 보편화되고 있지만, 이러한 AI의 학습 데이터에는 엄청난 양의 인간의 글과 언어가 포함되어 있기 때문에 인간이 가지고 있는 편견이 재현될 수 있습니다. 반면에, 언어에 기반하여 훈련된 AI는 이미지에서 발생하는 편견을 학습하지 않을 가능성도 있으며, AI 개발 기업의 얼라인먼트(alignment)에 의해 편견이 억제되고 인간보다 얼굴에 대한 편견이 약한 가능성도 고려될 수 있습니다.

새로운 실험에서 연구팀은 인간이 “능력” 또는 “신뢰성”과 연결짓는 얼굴 특징이 서로 다르게 얼굴 사진을 조작하여 “능력이 높아 보이거나 낮아 보이는 얼굴”, “신뢰성이 높아 보이거나 낮아 보이는 얼굴”의 쌍을 만들었습니다. 이러한 쌍을 AI 모델에게 보여주고 다양한 판단을 내리게 하는 시도를 총 8000회 이상 반복하여 AI가 가지고 있는 얼굴 편견에 대해 밝혔습니다.

첫 번째 및 두 번째 실험에서는 OpenAI의 GPT-4o에 대해 얼굴 쌍을 제시하고 “능숙한/능숙하지 않은 얼굴” 또는 “신뢰할 수 있는/신뢰할 수 없는 얼굴”을 선택하도록 요청했습니다. AI가 얼굴 특징에 좌우되지 않고 두 얼굴을 무작위로 선택한다면 결과는 50%씩 나타날 것으로 예상됩니다. 그러나 각 600회 시행 결과, GPT-4o는 인간이 “능숙해 보이지”라고 판단하기 쉬운 얼굴을 87.83%, “신뢰할 수 있는”이라고 판단하기 쉬운 얼굴을 72.67%의 확률로 선택했습니다. 이 결과는 인간이 능력과 신뢰성을 판단하는 얼굴의 물리적 특징이 다를수록 더욱 뚜렷하며, 표준 편차가 “6”만큼 크면 능숙해 보이는 얼굴을 선택하는 확률이 98%로 상승했다는 것을 의미합니다. 또한, 얼굴 차이가 표준 편차로 “2”만큼 작아도 여전히 70%의 확률로 인간이 능숙하다고 판단하는 얼굴을 선택했습니다. 흥미로운 점은 GPT-4o가 가지고 있는 편향이 인간의 것보다 컸다는 점입니다. 동일한 얼굴을 기반으로 능숙함을 판단하는 작업의 경우, 인간의 선택을 수학적으로 추정하면 능숙해 보이는 얼굴을 선택하는 확률은 약 62.65%로 예측되며, 이는 GPT-4o가 선택한 87.83%라는 비율을 크게 밑돌았습니다.

논문의 주요 저자이자, AI 채택 도구 개발 기업인 Cangrade의 연구자인 스티븐·레이아는 “표준적인 효과량 측정법에 따르면, AI의 편견은 인간의 경우와 비교하여 현저하게 증폭되어 있었습니다”라고 밝혔습니다. 이 결과에 대해 레이아는 AI가 응답의 일관성이 인간보다 높기 때문에, 얼굴에 대한 판단의 분산이 작아졌기 때문에 인간이 가진 편견을 더욱 증폭시키게 되었다고 지적했습니다. 더 나아가 연구팀은 2160회 시혐을 통해 동일한 얼굴 사진의 쌍에 대해 “똑똑한”, “나태한”과 같은 능력에 관한 성격 특성 및 “온순한”, “이기적인”과 같은 신뢰성에 관한 성격 특성을 평가하도록 했습니다. 그 결과, 역시 GPT-4o는 능력에 관한 성격 특성의 74.63%, 신뢰성에 관한 성격 특성의 73.33%에서 인간과 동일한 편견을 보였다는 사실이 확인되었습니다.

다른 실험에서는 과거에 인간이 “얄미워 보이고” 혹은 “친절해 보이고”라고 평가한 원숭이 얼굴 사진을 GPT-4o에 보여주고, 두 장 중 어느 것이 더 신뢰할 만한지 판단하도록 했습니다. 그 결과, GPT-4o는 인간이 “친절해 보이고”라고 평가한 원숭이 사진을 더 신뢰할 가능성이 66%라는 확률로 판단했습니다. 이 결과는 GPT-4o가 단순히 훈련 데이터에서 인간의 얼굴 특징을 기억한 것뿐만 아니라, “얼굴 신뢰성”에 대한 일반적인 개념을 발전시키고, 그것을 인간이 아닌 영장류에도 적용했다는 것을 시사합니다. 레이 씨는 “우선, 이러한 대규모 언어 모델(LLM)이 이러한 편견을 보이는 것이 놀라웠습니다. 어디에서 이런 편견이 생じた 걸까요? 이는 언어와 언어에 기반하여 구축된 AI 모델이 직관적으로 예상도 하지 못한 정도로 다양한 특성을 포착할 수 있다는 것을 보여줍니다.”라고 언급했습니다. 또한, 연구팀은 인간 얼굴 사진의 쌍을 GPT-4o에 보여주고, 두 얼굴 중 어느 것이 “연쇄 살인자/인신매매업자/금융 사기꾼일 가능성이 높은가”를 묻는 시도를 각 540회 반복했습니다. 그 결과, GPT-4o는 “신뢰할 수 없는 얼굴”을 선택할 가능성이 68.7%라는 확률로 확인되었습니다. “대학 학장 선출하기” 또는 “기술 기반 스타트업에 투자하기”와 같은 현실적인 의사 결정에서도 역시 75.19%의 확률로 “능숙해 보이는 얼굴”을 학장에 선출하거나 투자 대상으로 결정했다는 보고가 있습니다. 이 일련의 결과가 GPT-4o에 국한되는지 확인하기 위해, 연구팀은 OpenAI의 더 새로운 모델인 GPT-5, Google의 Gemini 3 Flash Preview(Gemini 3), Anthropic의 Claude Sonnet 4.5와 같은 다른 AI 모델에 대해서도 동일한 실험을 진행했습니다. 그 결과, GPT-5는 GPT-4o보다 더 큰 편견을 보였으며, 기본적인 능력 판단에서는 94.33%, 현실 세계의 의사 결정에서는 97.04%로 인간의 편견을 재현했습니다. Gemini 3와 Claude Sonnet 4.5 또한 매우 높은 편견을 가지고 있었으며, 많은 실험에서 GPT-4o와 동등하거나 그 이상의 편견을 보였습니다. 이 결과는 AI 모델이 고도화될수록 얼굴에 기반한 편견이 줄어드는 것이 아니라, 오히려 얼굴에 기반한 편견이 강화될 가능성을 시사합니다. 레이 씨는 “테스트 대상이 된 3개의 추론 모델이 질문을 더 깊이 고려하고, 이러한 편견을 피할 것이라고 생각했을 것입니다. 하지만 실제로는, 이러한 AI 모델은 더 큰 편견을 보였습니다.”라고 언급했습니다.

이번 실험에서는 AI는 반드시 한쪽 얼굴만을 선택하도록 강제되었기 때문에 직접적인 비교를 할 수 없는 환경에서 다른 동작을 보일 가능성이 있습니다. 또한 AI에 주어진 것은 2차원의 정지 이미지였으며, 동영상이나 입체적인 각도의 이미지에 대해서도 동일한 판단을 내릴지 여부는 불명입니다. 그 위에 연구팀은 이번 결과가 단순히 “AI 모델은 인간의 편견을 그대로 반영하는 것”을 의미한다고 지적했습니다. AI 모델은 인간보다 일관적으로 편견이 강하고, AI 모델이 새롭게 생성될 때마다 편견이 증가한다는 사실을 간과하면 “훈련 데이터가 AI 모델에 반영된 것뿐”이라는 비판은 빗나갑니다. 즉, AI 모델은 단순히 훈련 데이터를 반영하는 것이 아니라, 그것을 더욱 증폭시키고 있다고 할 수 있습니다. 레이 씨는 “AI 모델을 인간의 가치관에 맞추기 위한 훈련은 표면적인 평등주의를 실현한 것처럼 보이지만, 더 깊은 수준에서의 노력이 필요합니다. 채용이나 법무와 같이 영향력이 큰 분야에서 AI 모델을 사용할 경우에는 신중해야 합니다. AI 모델을 사용할 경우에는 항상 편견이 없는지 꼼꼼하게 테스트해야 합니다”라고 말했습니다.

[원문 보기](https://gigazine.net/news/20260929-ai-use-facial-features-criminality-performance/) | 출처: Gigazine