여러 AI 모델을 횡단하여 이용할 수 있는 플랫폼을 제공하는 OpenRouter는 2026년 8월 21일, 여러 이미지 생성 AI의 능력을 나란히 비교할 수 있는 'Visual Image Benchmarks'를 발표했다. 공개 시점에 39개의 이미지 생성 모델을 15종류의 과제로 비교하고 있으며, 생성 결과에 더해 가격과 생성 시간도 확인할 수 있다.
## 39개의 이미지 생성 AI, 동일한 과제에 대한 출력을 목록으로 비교
'Image benchmarks'에서는 이미지 생성 AI가 어려워하기 쉬운 조건을 포함한 과제를 준비하고, 각 모델의 생성 결과를 그리드 형식으로 목록 표시한다.
예를 들어 'Full Wine Glass'에서는 "화이트 와인이 잔의 가장자리와 같은 높이까지 채워지고, 잔은 나무 테이블 위에 똑바로 서 있다"와 같은 조건을 지정한다. 각 모델이 와인을 어디까지 채웠는지, 화이트 와인으로 표현했는지를 이미지에서 직접 비교할 수 있다.
각 생성 결과에는 모델 이름 외에도 생성 비용과 생성 시간이 표시된다. 결과는 가격과 생성 시간을 기준으로 정렬할 수 있으므로, 이미지의 완성도뿐만 아니라 비용과 속도를 포함해 모델을 비교할 수 있다.
OpenRouter는 텍스트 생성 AI에는 수많은 벤치마크가 존재하는 반면, 이미지 생성 AI의 선택은 판단 기준을 정하기 어렵다고 설명한다. 공개된 예시는 좋은 결과가 선택된 경우가 있으며, AI에 의한 자동 평가는 인간이 이미지를 보면 바로 알아차리는 미세한 차이를 포착하지 못하는 경우가 있다고 한다.
## 손가락 3개, 줄무늬 없는 얼룩말, 광고 없는 타임스퀘어 등 15개 과제
벤치마크 과제는 크게 7개 카테고리로 나뉜다.
'Improbable Scenes(일어나기 어려운 장면)'에서는 가장자리까지 와인이 채워진 잔이나 닫힌 우산을, 'Count'에서는 손가락 3개나 지정된 수의 카드와 주사위를 생성시킨다.
이 밖에도 긴 문자열이나 여러 언어를 정확하게 그리는 'Text', 물체의 겹침이나 거울 반사를 다루는 'Spatial Relations', 줄무늬 없는 얼룩말이나 광고 없는 타임스퀘어를 생성하는 'Negation' 등을 준비한다.
또한 참조 이미지에서 특정 물체나 인물만 삭제하는 'Editing', 제품이나 여러 피사체의 특징을 다른 장면에서도 유지할 수 있는지 보는 'Consistency'도 포함된다. 편집이나 일관성을 시험하는 과제에서는 텍스트 지시뿐만 아니라 참조 이미지도 사용된다.
'줄무늬 없는 얼룩말'을 생성하는 과제. 모델에 따라 줄무늬가 남거나 말에 가까운 모습이 되기도 한다
OpenRouter는 각 과제에 대해 인간이 생성 결과만 보고도 지시를 충족했는지 판단하기 쉽도록 설계했다고 밝혔다.
동사는 Image Benchmarks에서 모델을 비교한 후, 자신의 프롬프트를 OpenRouter의 이미지 생성 API나 Chat에서 시험해 보는 이용 방법도 안내하고 있다. 또한 향후 이미지 모델 추가에 맞춰 벤치마크를 업데이트하고, 동영상 및 음성 모델에도 유사한 평가 도구를 확대할 방침이라고 밝혔다.
원문 보기 | 출처: Ledge.ai