# 중국의 오픈소스 AI에 맞서기 위해 Reflection이 매개변수 5010억의 오픈 모델 “Beam”을 발표, GLM 5.2에 근접하며 사용량은 3~4분의 1 수준으로 AI 에이전트 태스크에서는 Qwen3.8-Max에 근접한다고 주장

> https://bookfactory.kr/board/news/20233
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-10-06T05:06:32.640Z

---

미국에 본사를 둔 AI 스타트업 Reflection이 파라미터 수 5010억, 활성 파라미터 수 230억의 오픈 모델 “Beam”을 발표했습니다.

Introducing Beam: Reflection의 501B 오픈 웨이트 모델 — Reflection https://reflection.ai/blog/introducing-beam

Reflection AI는 중국 연구소에 대한 오픈 소스 답변 — Semafor https://www.semafor.com/article/10/05/2026/reflection-ai-unveils-an-open-source-answer-to-chinese-labs

Beam은 사전 학습과 강화 학습에 대한 대규모 투자로 탄생한 오픈 모델입니다. 사전 학습에는 웹과 자체적으로 라이선스를 취득한 데이터 세트에서 수집한, 다양하고 엄선된 고품질의 23조 8000억 토큰을 사용했습니다. 그 결과, 공개되는 동 규모의 오픈 모델과 동등 이상의 성능을 달성하는 데 성공했다고 Reflection은 설명했습니다.

이와 동시에, 막대한 계산 자원을 필요로 하는 강화 학습을 극도로 대규모로 지속하기 위해 필요한 알고리즘, 학습 환경, 인프라를 개발했습니다. 강화 학습에서는 NVIDIA GB 300을 1만 5천 기를 사용하여 4주간의 학습으로 1억 회를 초과하는 롤아웃(AI 모델이 답변이나 일련의 행동을 생성하는 시도)을 생성하고 있습니다. 사전 학습과 강화 학습을 결합함으로써, 오픈 웨이트 모델로서 경쟁력 있는 성능과 최첨단 수준의 추론 계산 효율을 달성했다고 Reflection은 주장합니다. 기사 작성 시점에서는 Beam이 최종 단계의 레드 티밍(공격적인 테스트를 통한 안전성 검증)과 평가를 받고 있는 중이므로, 모델은 공개되지 않았습니다. 다만, Reflection은 2026년 10월 중 Beam의 풀 웨이트를 공개할 예정이라고 설명하며, 아래에서 웨이팅 리스트에 등록할 수도 있습니다. Reflection Playground https://platform.reflection.ai/login Beam은 코딩 및 에이전트로서의 성능에 특히 중점을 두고 훈련되었습니다. Beam은 유럽-미국의 오픈 웨이트 모델의 도달 수준을 끌어올리고, 코딩이나 에이전트형 태스크에서 GLM 5.2와 같은 더 큰 오픈 모델에 필적하고, Qwen 3.8-Max에 가까운 성능을 발휘할 수 있습니다. Kimi K3와 같은 최첨단 오픈 모델에는 순수한 능력으로 아직 미치지 못하지만, Beam에는 추론 시의 효율이라는 강점이 있다고 설명합니다. 아래 이미지는 Beam과 GLM 5.2, Qwen 3.8-Max, Inkling, Nemotron Ultra와 같은 각종 오픈 모델을 여러 벤치마크에서 비교한 결과를 담고 있습니다. 실시한 벤치마크는 AI 코딩 에이전트용 벤치마크인 DeepSWE, AI 에이전트의 터미널 환경에서의 종합적인 실무 수행 능력을 측정하는 Terminal Bench, 검색이나 코드 실행 등의 외부 툴을 전혀 사용하지 않고 AI 모델이 가진 본래의 지식과 순수한 사고력을 평가하는 HLE No Tools, AI 코딩 에이전트의 리포지토리 레벨에서의 복잡한 과제 해결 능력을 측정하는 SWE Bench Pro, AI 코딩 에이전트가 소프트웨어 개발을 얼마나 자율적으로 수행할 수かを 측정하는 SWE Bench Verified, 연구자 레벨의 고도한 물리학 추론 능력을 측정하는 CritPT AA입니다. 모든 벤치마크에서 비교 대상이 된 오픈 모델과 동일한 수준의 성능을 발휘합니다.

또한, Beam(검)은 코딩 및 에이전트로서의 높은 능력을 가지고 있다는 것 외에도 매우 효율적인 추론 능력을 겸비하고 있습니다. 고도한 추론 벤치마크에서는 GLM-5.2(주황)에 뒤지지 않는 점수를 3분의 1에서 4분의 1의 추론 계산량으로 실현했습니다. Qwen 3.8-Max(보라)와 같은 파라미터 수가 2조 이상의 모델 군과 비교하면 효율의 차이는 더욱 뚜렷합니다.

오늘 Beam을 소개합니다. 코딩, 에이전트, 과학 워크로드에서 뛰어난 성능을 보이는 500b 오픈 모델입니다.

Beam은 매우 토큰 효율적이며, 처음부터 학습되었고, 우리가 알고 있는 가장 큰 공개적으로 실행된 RL 훈련으로 확장되었습니다.

이를 이루는 과정은 도전적이고 보람 있으며 개인적인 것이었습니다.

어린 시절 부모님이 과학자로서 PNNL(미국 워싱턴 주 시골 마을에 위치한 국가 연구소)에서 일자리를 얻으신 후 미국으로 이민했습니다.

자랐습니다. 물리학에 대한 관심을 갖게 되었는데, 이는 단순한 원리에 기반을 두고 있었고, 기초가 튼튼하며 장기적인 영향을 미쳤기 때문입니다.

물리학은 20세기의 근간이 되는 과학이었습니다.

첫 번째 범용 컴퓨터 (ENIAC), 트랜지스터, GPS, 그리고 현대 기술의 상당 부분은 물리학의 뿌리를 가지고 있었습니다.

2016년, 대학원 시절에, 인공지능 – 새로운 근간이 되는 과학의 탄생을 보았습니다.

딥마인드에서 개발한 초지능 바둑 에이전트인 알파고가 등장하면서, 앞으로 일어날 일에 대한 감각을 받았습니다.

인간 플레이어를 모방하고, 시행착오를 통해 스스로를 개선하도록 훈련된 신경망이 세계에서 가장 지적 난이도가 높은 보드 게임을 마스터했습니다.

알파고에 놀란 점은 개념적으로 단순하고, 일반적이며 확장 가능하다는 점이었습니다.

이 시스템은 원칙적으로는 영원히 스스로를 개선할 수 있으며, 이는 컴퓨팅 파워의 문제였습니다.

바로 그때 저는 “AGI 픽업(AGI pilled)” 되었다고 표현하는 것처럼, AGI에 완전히 빠져들었습니다.

저는 물리학에서 인공지능으로 전향했는데, 21세기의 근본 과학이 물리학처럼 20세기의 근본 과학이 된 것처럼, 이것이 될 것이라고 생각했기 때문입니다.

기초 과학 연구에 매달리는 것만으로는 충분하지 않다고 생각합니다.

기초 과학은 또한 개방적이고 널리 접근 가능해야 합니다.

우리는 뉴턴을 물리학에 대한 공헌으로 기억하지만, 그는 또한 연금술사였습니다.

연금술은 비밀리에 행해졌는데, 인공적으로 금을 생산하는 것이 유망했지만 동시에 전체 경제를 파괴할 수 있는 잠재적인 위험이 있기 때문이었습니다.

뉴턴은 심지어 그의 연금술 노트를 암호화하여 썼습니다.

반면에, 프린시피아는 왕립 학회의 Philosophical Transactions에 게재되었고, 지식은 널리 공개되었으며, 우리가 현재 뉴턴의 법칙이라고 부르는 세대를 거쳐 전해졌습니다.

컴퓨터, 트랜지스터, GPS는 물리학을 과학으로 인해 구축이 가능했습니다.

개방성은 혁신의 생태계를 창출한다.

과학적 발견의 핵심 교리인 개방성의 개념은 기초 기술이 구축되고 배포되는 방식에도 지침이 되고 있다.

인터넷은 개방형 프로토콜로 구축되었다.

가장 널리 사용되는 운영체제는 개방형이다.

강력한 암호화 프로토콜이 1990년대에 개방되면서 사이버 보안 분야가 존재하게 되었다.

개방성은 또한 더 안전하다는 것을 의미한다.

최고의 방어는 분산된 방어이다.

흔히 사용되는 오픈 소스 소프트웨어는 개발자 커뮤니티의 검토 및 패치를 통해 견고하고 전투를 거친 것으로 입증되었다.

AI는 많은 면에서 소프트웨어와 다르면서도 유사하지만, 훨씬 더 큰 취약점 면적을 가지고 있습니다.

비밀리에 활동하는 소규모 안전 연구팀이 아무리 의도를 가지고 있더라도 모든 잠재적 문제를 해결할 수 있는 것은 불가능합니다.

이는 당신의 몸을 보호하기 위해 백혈구 수십 개를 맡기는 것과 같습니다.

AI는 과학이자 기술로서 기초적인 역할을 수행하며, AI의 안전성을 보장하고 AI의 혜택이 공정하게 분배되는 가장 좋은 방법은 개방성을 확보하는 것입니다.

Reflection은 “토큰당 더 높은 지능 능력을 발휘할 수 있기 때문에, Beam은 높은 모델 능력을 저비용으로 제공할 수 있습니다. 기업의 코딩이나 에이전트형 업무를 지원하는 강력한 실용 모델이 될 것입니다.”라고 밝혔습니다. Reflection의 미샤 ラスキン CEO는 Beam을 오픈 모델로 출시하는 이유를 “인터넷은 개방형 프로토콜로 구축되었습니다. 가장 널리 사용되는 OS도 개방형입니다. 사이버 보안 분야가 존재하는 이유는 1990년대에 강력한 암호화 프로토콜이 개방되었기 때문입니다. 개방성은 안전성 향상에도つながります. 최고의 방어는 분산형입니다. 일반적으로 사용되는 오픈 소스 소프트웨어는 견고하고 실전 테스트를 거친 것입니다. 왜냐하면 개발자 커뮤니티에 의해 검사되고 패치가 적용되기 때문입니다. AI는 소프트웨어와는 다르지만, 많은 면에서 유사하며 취약점 표면적이 훨씬 큽니다. 작은 보안 연구 그룹이 비밀리에 일하는 것만으로는 모든 잠재적인 문제를 해결할 수 없습니다. AI는 과학과 기술 양면에서 기반이 되는 것입니다. 개방성을 통해 가장 안전한 AI의 이점을 공평하게 분배하는 방법입니다. 저는 개발자나 과학자가 이 모델에서 무언가를 구축하고 무엇을 배우는지 기대됩니다. Beam이 AI를 널리 접근 가능하고 안전하며 모든 사람에게 유익하게 만드는 데 작은 역할을 할 수 있게 되어 기쁩니다.”라고 밝혔습니다.

갑작스럽게 진행되는 일이지만, 개인적으로도 팀에게는 매우 쾌거다운 순간이라고 생각합니다.

기술적인 부분은 나중에 다루겠지만, 제가 상상 이상으로 열심히 노력했던 몇 달 동안 느꼈던 감정은 팀의 다른 모든 구성원들이 제 노력을 따라잡고 능가했다는 점입니다.

제가 ‘출시’가 무슨 의미인지 몰랐습니다.

이제 알게 되었습니다.

감사드릴 분들이 너무 많지만, @joespeez 와 @_ghorbani 님께 짧게라도 감사의 말씀을 전하고 싶습니다. 기회와 도박에 대한 믿음을 보여주셔서 감사합니다.

제가 이렇게 열심히 일하고, 이렇게 많은 것을 배우고, 이렇게 즐거운 시간을 보낸 적이 없습니다.

저희를 함께 일할 수 있게 해주셔서 감사합니다.

기술적인 측면에서 1.

3B 샌드박스는 진정으로 개방형 RL 실행이며, 저는 메타에서 이끌었던 팀보다 훨씬 작은 규모의 팀과 적은 컴퓨팅 자원으로 이를 수행했습니다.

이러한 성과를 달성하는 것은 연구와의 깊은 파트너십을 통해서만 가능한 것이며, 저는 Reflection에서 이 기회를 얻게 된 것에 매우 감사하게 생각합니다.

이러한 후술한 점에 대해 말씀드리자면, 이번이 SWE Bench 및 tbench 성능에 대한 참여감을 처음 느끼는 시기라는 것을 말씀드립니다.

말씀드릴 내용이 많지만, 팀과 함께 시간을 보내고 싶으니 이로써 마무리하겠습니다.

반성(Reflection)의 기술 담당자 제이크 웬트(Zach Wentz)氏は、메타(Meta)에서 이끌던 것보다 훨씬 작은 팀과 적은 컴퓨팅 자원으로 이렇게 뛰어난 오픈 모델을 구축하는 데 성공한 것에 대해 “연구와의 깊은 파트너십이 없었다면 불가능한 성과이며, 반성에서 이러한 관계를 구축할 수 있어서 정말 행운이라고 생각합니다”라고 밝혔습니다.

이 모든 것이 이렇게 빠르게 이루어진 가장 좋은 점은, 우리가 제대로 된 기반에 투자했기 때문에 속도를 늦추지 않을 것이라는 점입니다.

오늘의 서부 전선, 내일의 전선.

저는 비ーム에 정말 자랑스럽습니다.

비엠은 리플렉션의 첫 번째 오픈 웨이트 모델입니다.

이는 놀라운 팀 중 가장 놀라운 팀 중 하나를 보았을 때 ~년 동안의 노력, 재치, 그리고 동료애의 결과입니다 🔥저는 지난 11월 리플렉션에 합류했습니다.

특히 사전 훈련은 매우 초기 단계였는데, 5-10명만이 코드를 가지고 있었습니다!

우리는 크롤러, 탄력 있는 GPU 인프라, 중복 제거 파이프라인, 자체 평가, 충분히 큰 MoE(모델 확장성)조차 갖추지 못했습니다.

모든 것이 2026년에 진지하게 시작되었고, 제가 경험한 가장 만족스러운 스프린트 중 하나였습니다.

우리가 성공한 부분은 과학적 엄밀성, 스타트업의 강렬함, 팀 반복, 그리고 야망의 완벽한 조화라고 생각합니다.

사전 훈련 시 YOLO(You Only Live Once) 결정은 규모가 커질 때 폭발하는 경향이 있으므로 피했습니다. 🙂 하지만 우리는 민첩하고, 높은 소유권, 높은 신뢰를 가진 팀으로서 빠르게 움직이고 우리의 강점을 활용하는 데도 신경썼습니다.

체계적인 반복과 빠른 팀 간의 주고받음이 실제로 큰 도움이 되었습니다.

중간 훈련, 강화 학습(RL), 그리고 사후 훈련 팀이 사전 훈련된 기반 위에 정말 정말 뛰어난 성과를 보였습니다.

아래 발표는 그 투자 규모와 그에 따른 수익을 보여주는 내용입니다. 팀에서 이 부분을 다루도록 하겠습니다. 정말 놀랍습니다.

다수의 에이전트 코딩 기능에 대해 모델이 멈추지 않고 계속 상승하는 현상이 나타났습니다.

오늘 발표에서 더 자세히 읽어보실 수 있지만, 이번 달 말에는 Apache 2.0 라이선스 하에 전체 가중치 배포를 공개하고, LLM 과학, OSS 생태계와의 파트너 통합에 대한 상세 기술 보고서도 발표할 예정입니다.

결국 이는 개방형 모델입니다.

저는 개방형 지능이 AI의 미래라고 확신하며, 이것이 제가 이곳에 있는 이유입니다.

다른 기술 직원인 Alex Polozov 씨도 “빔은 리플렉션의 첫 번째 오픈 웨이트 모델입니다. 이는 인공지능 분야에서 제가 지금까지 본 가장 훌륭한 팀 중 하나인 약 1년에 걸친 끈기, 독창성, 그리고 동료애의 결정체입니다. 저는 2025년 11월에 리플렉션에 합류했지만, 이는 사전 학습이 시작된 바로 그 시점이었으며, 5~10명 정도의 멤버와 약간의 코드만 있는 상태였습니다. 아직 크롤러도, 탄력 있는 GPU 인프라도, 중복 제거 파이프라인도, 자체 평가도, 충분히 큰 MoE도 없었습니다. 그것들이 모두 본격적으로 시작된 것은 2026년이었으며, 제가 경험한 가장 만족스러운 스프린트 중 하나였습니다”라고 말했습니다.

그리고 여러분 모두 오픈 사이드에 합류하도록 격려합니다 😉

데이터 플랫폼 팀 리더로 Reflection에서 일했던 Jake Nations 氏は、「우리는 처음부터 시작하여 이 모델을 구축하기 위해 필요한 모든 파이프라인, 저장소, 추론, 인프라 구조, 도구를 구축했습니다. Beam은 23조 8000억 토큰으로 훈련되었습니다. 우리가 구축한 OCR 파이프라인이 수억 개의 PDF에서 수조 개의 토큰을 생성한 것에 가장 큰 자부심을 느낍니다」라고 언급했습니다.

8개월 전, Reflection에 합류하여 서부 지역의 개방형 가중치 모델을 구축하는 프로젝트를 진행하게 되었습니다. 오늘, Beam (총 501B, Apache 2.0 라이선스 하에 23B 활성)을 출시하게 됩니다. 이 기간 동안 저는 다양한 역할을 수행했지만, 대부분의 시간을 이곳에서 데이터 플랫폼 팀을 이끌면서 보냈습니다. 저희는 이 모델을 구축하기 위해 다음과 같은 모든 것을 처음부터 구축했습니다: 파이프라인, 저장, 추론, 인프라, 그리고 도구. Beam은 23.8TB 토큰으로 학습되었습니다. 저는 수백만 개의 PDF에서 조(兆) 단위의 토큰을 생성하는 OCR 파이프라인을 구축한 것에 가장 큰 자부심을 느낍니다. 데이터 팀을 단일 테라바이트에서 수십 페타바이트로 확장했습니다. 이것이 모두 팀의 노력 덕분에 가능한 것입니다. 연구 및 엔지니어링 분야의 인재들은 최고 수준이며, 이것이 첫 출시를 가능하게 한 이유입니다. 곧 이 모델과 향후 출시 버전을 모든 분들의 손에 전달되기를 기대합니다!

Reflection의 창업자들이 서부의 DeepSeek이 되는 것을 목표로 Beam, 첫 번째 오픈 웨이트 AI 모델을 출시할 계획을 밝히고 있다.

무(無)에서 시작하여 훈련된 Beam은 코딩, 추론 및 AI 에이전트용으로 설계되었다.

Reflection의 벤치마크는 가장 강력한 오픈 모델과 비교하여 상당한 효율성을 가진 토큰 경제학을 제공한다.

Beam의 데뷔를 기념하여 Reflection의 공동 창업자 MishaLaskin(CEO, 구글 Gemini의 보상 모델링을 이끌었으며)과 real_ioannis(AlphaGo 및 AlphaZero를 만들고 Gemini의 RLHF 노력을 이끌었으며)를 초대한다.

반사(Reflection)는 Nvidia, Sequoia, Lightspeed을 포함한 투자자로부터 46억 달러를 유치했습니다.

우리는 왜 중국 연구소들이 오픈 AI 모델에서 앞서나갔는지, Reflection이 Beam을 어떻게 구축했는지, 그리고 창업자들이 기업과 국가가 자체 모델을 통제하려는 이유에 대해 논의합니다.

저는 오픈 웨이트 AI에서 어떻게 수익을 창출할 계획인지, 개방성이 이러한 시스템을 더 안전하게 만들 수 있는지, 그리고 Reflection의 다음 단계는 무엇인지 질문합니다.

타임스탬프: 00:00 오픈 모델이 급증하는 이유 01:06 임대 vs.

오픈 모델을 관리 및 실행하기 위한 오픈 소스 런타임 플랫폼인 Ollama도 Beam의 등장에 환영하고 있습니다.

@reflection_ai의 새로운 오픈 모델에 대한 기대감을 표현했습니다! 더 많은 미국 기반 모델이 Ollama에 추가될 예정입니다!

한편, Reflection의 창업자가 “유럽/미국식 DeepSeek”을 목표로 Beam을 개발하게 된 배경에 대한 인터뷰 영상이 공개되었습니다.

owning intelligence 03:40 오픈 모델의 역전 05:53 중국이 오픈 AI를 선도하게 된 이유 08:03 Beam 소개 10:05 강화 학습 스케일링 14:09 처음부터 훈련 16:04 안전성, 정렬 및 개방성 32:29 Reflection의 기원 37:32 오픈 모델에서 수익 창출 42:33 수직 통합 및 컴퓨팅 48:45 파트너십 및 유통 56:46 Reflection의 다음 단계 Links: https://t.co/lsXfGvSuAw Spotify: https://t.co/XSTrGNHb8O YouTube: https://t.co/UqqKA6AYmT Substack: https://t.co/difFf7X42Z  제작 스폰서: @Atlassian, @meetgranola, @mercury

[원문 보기](https://gigazine.net/news/20261006-beam-reflection-501b-open-weight-model/) | 출처: Gigazine