# 미 래플렉션, 5010억 파라미터의 “빔” 발표, 추론 효율을 중시, 10월 안에 Apache 2.0으로 가중치 공개 예정

> https://bookfactory.kr/board/news/20922
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-10-10T23:40:31.286Z

---

이미지 출처: Reflection 공식 X

미 AI 스타트업 Reflection은 2026년 10월 5일, 코딩, 추론, AI 에이전트 기반 작업에 대응하는 이사 첫 오픈 웨이트 모델 “Beam”을 발표했다. 총 파라미터 수는 5010억이며, 문장을 처리할 때 사용되는 액티브 파라미터 수는 230억이다. 현재는 일부 사용자에게 선행 제공 단계에 있으며, 동일 월 중에 학습된 파라미터인 “가중치”를 Apache 2.0 라이선스로 공개할 예정이다.

## 5010억 중 230억을 사용하는 MoE 모델

Beam은 여러 개의 전문 처리 부분을 갖추고, 입력에 따라 일부를 사용하는 Mixture-of-Experts (MoE) 구조를 채택한다. 5010억의 파라미터 모두를 매번 사용하지 않고, 각 토큰의 처리에서는 230억을 사용한다. Reflection은 처음부터 사전 학습을 수행하고, 그 다음 강화 학습으로 추론 및 툴 사용 능력을 높였다.

회사에서 발표한 평가에 따르면, 장기간 걸리는 소프트웨어 개발을 측정하는 “DeepSWE v1.1”에서 44.4, 명령 입력에 의한 터미널상의 작업을 측정하는 “Terminal Bench v2.1”에서 80.1의 점수를 기록했다. GLM 5.2는 각각 44.0, 81.0으로, Beam은 이들 평가에서 유사한 점수를 보였다. 반면, Qwen 3.8-Max는 51.0, 86.6으로, 모두 Beam을 상회했다.

■ Beam 및 다른 오픈 모델의 코딩 및 추론 성능을 비교한 그림. 평가 결과는 Reflection 발표. NR은 점수 미보고를 나타낸다.

이미지 출처: Reflection 공식 X ※ 그림 중 CritPT AA는 Beam이 15.6, 현재 공식 블로그 표에서 16.3로 되어 있다.

## 성능 외에도 추론 시 계산 효율을 중시

반사율은 빔의 특징으로 인해 추론에 필요한 계산량이 적다는 점을 언급합니다. 회사의 비교에 따르면, 고도화된 추론 평가에서 GLM 5.2에 뒤지지 않는 점수를, 약 3분의 1에서 4분의 1 정도의 추론 계산량으로 달성했다는 것입니다.

이 계산량은 처리하는 파라미터 수와, 추론 과정 및 최종 답변의 길이에서 추정한 것이다. 입력을 읽어오는 처리나, 긴 문맥을 다루는 데 필요한 계산, 서비스 운영상의 부하 등은 포함되지 않는다. 실제 이용 요금이나 응답 속도를 직접 비교한 결과는 아니다.

■ Terminal Bench 2.1의 점수와 1회 시행당 추정 생성 계산량의 관계. 왼쪽 상단에 위치할수록, 적은 계산량으로 높은 점수를 나타냄

이미지 출처: Reflection 공식 X

사용자는 과제에 따라 추론에 사용하는 계산량을 조정할 수 있다. 낮은 설정에서는 추론을 짧게 유지하고, 높은 설정에서는 어려운 과제에 따라 긴 추론을 사용한다.

## 1만 5천 기의 GB300으로 4주간의 강화학습

사전 학습에는 23.8조 토큰을 사용했다. 웹, 공개 자료, 라이선스를 취득한 데이터 등을 선별하여 코드, 기술 문서, 수학·과학 분야의 지식을 학습시켰다.

강화 학습에서는 과제에 참여한 결과에 대한 평가에 따라 모델의 행동을 개선한다. Reflection은 1만 5천 기의 NVIDIA GB300 GPU를 4주간 사용했으며, 모델이 과제에 참여하는 시험을 1억 회 이상 생성했다. 코딩, 툴 사용, 과학·기술 분야 등을 대상으로 하는 약 100만 개의 학습 환경을 마련하고, 과제의 난이도와 품질을 반복적으로 조정했다.

■ Beam의 추론 모델 학습 과정에서, 시행 횟수와 DeepSWE 점수의 관계. Reflection은 강화 학습의 계산량을 늘리는 동안, 평가 성능 향상이 지속되었다고 설명한다

이미지 출처: Reflection 공식 X

## Apache 2.0으로 가중치 공개 예정, 양자화 버전도 제공 예정

빔(Beam)은 악용 및 예상치 못한 동작을 탐색하는 레드 치이밍(Red Teaming)과 공개 전 최종 평가를 진행하고 있다. 리플렉션(Reflection)은 10월 안에 모델의 가중치, 기술 보고서, 성능 및 제약 사항을 담은 모델 카드, 실행 및 평가 및 추가 학습에 필요한 개발 자료 등을 공개할 예정이다.

모델의 가중치에는 Apache 2.0 라이센스를 채택한다. 사용 메모리 및 계산 부하를 줄이기 위해, 숫자 표현 정밀도를 낮춘 FP8·NVFP4 양자화 버전도 제공할 예정이다. 선행 이용 등록을 받고 있다.

관련 기사: 샤오미, 멀티모달 AI “MiMo-V2.6-Pro／Flash”와 강화 학습의 환경 및 코드를 공개

관련 기사: 중국 Moonshot AI, 2.8조 파라미터의 “Kimi K3” 발표, 프론트엔드 개발 평가에서 Fable 5나 GPT-5.6 Sol을 상회하며 1위

관련 기사: 구글, 오픈 모델 “Gemma 4” 공개, Gemini 3 기술을 기반으로 추론 및 AI 에이전트 기능을 강화, Apache 2.0로 제공

관련 기사: 프랑스 Mistral, 차세대 오픈 모델 “Mistral 3” 발표──3B~14B의 소형 Dense와 플래그십 Large 3을 Apache 2.0로 공개

관련 기사: 알리바바 “Qwen” 시리즈, 6개월 만에 30억 다운로드, 신 모델 “Qwen3.8-27B”의 가중치도 공개

[원문 보기](https://ledge.ai/articles/reflection_beam_open_weight_model) | 출처: Ledge.ai