마이크로소프트는 2026년 7월 27일(현지 시간), 사이버 보안에 특화된 AI 모델 “MAI-Cyber-1-Flash”를, 취약점 발견 및 검증, 수정 지원을 돕는 멀티 모델형 AI 시스템 “MDASH”에 통합했다고 발표했다.
MAI-Cyber-1-Flash에 대부분의 작업을 맡기고, 특히 어려운 작업만 고성능 모델 “GPT-5.4”로 전달한다. 회사에 따르면, 이 구성은 사이버 보안 벤치마크 “CyberGym”에서 95.95%의 점수를 기록했으며, 기존 MDASH 구성에 비해 비용을 50% 절감했다.
**최대 90%의 작업을 처리, 난 문제는 GPT-5.4로**
MAI-Cyber-1-Flash는 마이크로소프트가 처음 개발한 사이버 보안 특화 모델이다. 복잡한 코드 베이스에서 취약점을 발견하고, 검증, 우선순위 지정, 수정 워크플로우를 지원한다.
마이크로소프트에 따르면, MAI-Cyber-1-Flash는 MDASH에서 실행되는 작업의 최대 90%를 처리할 수 있다. 남은 약 10%의 특히 어려운 작업에는 더 규모가 크고 비용이 많이 드는 GPT-5.4를 사용한다. 모든 처리를 고성능 모델로 맡기는 대신, 작업의 난이도에 따라 모델을 분산하여 성능과 운영 비용을 동시에 달성했다.
모델 카드에 따르면, 이 모델은 코딩용 모델 “MAI-Code-1-Flash”를 사이버 보안용으로 파인 튜닝한 것이다. Mixture-of-Experts (MoE)형 아키텍처를 채택했으며, 총 파라미터 수는 1370억 개, 추론 시 활성화되는 파라미터 수는 50억 개이다. 컨텍스트 길이는 256K로 설정했다.
MDASH는 여러 AI 모델과 100개 이상의 전문 에이전트를 연계하는 시스템이다. 에이전트가 코드를 조사하고, 취약점 후보에 대해 논의하며, 실제로 악용 가능한지 검증한 후 수정까지 지원한다.
**CyberGym에서 95.95%, 기존 구성에서 비용 50% 절감**
평가에 사용된 CyberGym은 188개의 소프트웨어 프로젝트에서 수집한 1507건의 실제 취약점을 활용하여, AI 에이전트가 코드 베이스를 분석하고 취약점을 재현할 수 있는지 측정하는 벤치마크이다.
**MAI-Cyber-1-Flash와 GPT-5.4를 결합한 MDASH는 CyberGym에서 95.95%를 기록**
마이크로소프트의 모델 카드에 따르면, MDASH에서 사용하던 모델의 80%를 MAI-Cyber-1-Flash로 대체한 결과, CyberGym의 점수는 88.4%에서 95.95%로 향상되었다.
마이크로소프트가 공개한 비교에서는 “MAI-Cyber-1-Flash + GPT-5.4”로 구성한 MDASH가 Gemini, GPT, Mythos를 사용한 다른 구성들을 상회했다고 밝혔다. 다만, 95.95%는 MAI-Cyber-1-Flash 단일 모델의 성능이 아닌, 이 모델과 GPT-5.4, 여러 에이전트를 결합한 MDASH 전체 평가 결과이다.
비용은 마이크로소프트가 기존 최적 구성이었던 “GPT-5.4 + GPT-5.4 mini + GPT-5.3 Codex”와 비교하여 50% 절감했다. 대부분의 처리를 소형 특화 모델에 맡기고, 필요한 경우에 한해 GPT-5.4를 호출하는 설계가 비용 절감에 기여했다.
**방어 목적에 한정, 이용에는 추가 심사**
MAI-Cyber-1-Flash는 단독으로 널리 제공되는 일반 모델이 아니다. Azure AI Foundry의 프라이빗 프리뷰를 통해 MDASH 내에서 방어 목적에만 사용 가능하다. 고도화된 사이버 보안 기능이 공격에도 활용될 수 있다는 점을 고려하여, 이용자는 일부 고객으로 제한하고 추가적인 심사를 실시한다.
Microsoft는 이 모델을 사내 AI 레드팀의 자동 및 수동 공격 테스트에서 평가했으며, 제3자 독립 평가도 진행했다. MDASH는 역할 기반 접근 제어, 테넌트 분리, 암호화, 감사 기능, 인터넷 연결이 없는 격리된 환경 등을 채택한다.
한편, 모델 카드에서는 생성된 코드나 설명이 부정확하거나 불완전할 수 있으므로, 실제 환경에서 사용하기 전에 인간이 출력을 확인하고 테스트, 검증해야 한다고 명시한다. Microsoft는 앞으로 MAI-Cyber-1-Flash를 취약점 관리 외 다른 보안 워크플로우에도 확대할 계획이다.
원문 보기 | 출처: Ledge.ai