방사선 진단 워크플로우에서 진단 시 악성 종양의 미확인을 발생시킬 경우 심각한 문제로 이어집니다. “RADAR”는 CT 스캔 이미지를 기반으로 약 150종류의 복부 질환을 특정할 수 있는 의료용 이미지 언어 모델이며, 알리바바 산하의 Damo Academy가 오픈 소스화하여 GitHub에서 공개되어 있습니다. [https://github.com/alibaba-damo-academy/damo-radar](https://github.com/alibaba-damo-academy/damo-radar)
전문 수준의 일반화된 AI를 위한 복부 CT 진단 | Sciencehttps://www.science.org/doi/10.1126/science.aec6129 복부에는 수많은 해부학적 구조가 존재하며, 임상적으로 중요한 소견으로 나타나 있음에도 불구하고 미확인하기 쉬운 미세한 이상으로만 나타나는 경우가 많아 복부 CT 검사에는 “매우 복잡한 진단이 필요하다”는 문제가 있습니다. 그러나 기존의 AI 솔루션은 특정 영역에 특화되어 있거나, 고가의 수동 어노테이션을 필요로 하는 지도 학습에 의존하여 확장성 및 적용성에 제한이 있었습니다.
“RADAR”는 40만 건 이상의 조영제 복부 CT 검사와 1,500만 부의 해부학적 정보가 포함된 이미지-텍스트 쌍을 사용하여 훈련된 의료용 이미지-언어 모델입니다. 임상 보고서에서 수동 어노테이션 없이 직접 학습되며, 기존 AI 개발에서 문제시되었던 “훈련 단계에서 인간의 노력이 필요하다”는 과제를 극복합니다. RADAR의 평가는 18개의 해부학적 구조와 146개의 이미지 소견을 사용하여 수행되었으며, 39,160건의 검사로 구성된 내부 코호트에서 146개의 소견 진단에 대해 ROC 곡선 하측 면적(AUC) 0.913(95% 신뢰 구간은 0.911~0.915)를 달성했습니다. 더불어 8개의 외부 센터에 걸쳐 평가한 결과에서도 AUC 0.874~0.912를 보이며 높은 일반화 성능을 입증했습니다. RADAR를 사용하여 4가지 암(간, 담낭, 위, 대장)의 병리학적 소견에 기반한 검증을 수행한 결과, AUC 0.891~0.984라는 매우 높은 성능을 보였습니다. 또한 초기 훈련에서 제외되었던 급성 복부 질환에 대해서도 AUC 0.904와 높은 성능을 유지하며, 미지의 긴급 시나리오에 대해서도 높은 일반화 성능을 갖는 것으로 입증되었습니다.
26명의 방사선과 의사가 참여한 영화 감상 시험에서 RADAR는 많은 참가자를 압도하는 성능을 보였으며, 또한 참가자와 연계함으로써 진단 성능이 약 10% 향상되었습니다. 더 나아가, RADAR는 진단과 관련된 시각적인 단서를 강조하는 “주의 지도”를 제공했습니다. 주의 지도의 제작은 임상 현장에서 매우 유용하다고 할 수 있습니다.
레이더는 대규모 시각언어 학습을 통해 “복잡하고 다양한 방사선 이미지 해석 작업에 대응하는 범용 AI 시스템”을 효율적으로 개발하기 위한 실질적인 방법론을 제시할 수 있는 가능성을 보여줍니다.
원문 보기 | 출처: Gigazine