# CPU만으로 동작하는 실시간 다국어 음성 인식 "하얼미", GPU, 클라우드 API, 메모리 2GB 미만으로 라이브 자막 표시부터 브라우저 표시, 화자 레이블링, 번역 자막까지 가능

> https://bookfactory.kr/board/news/20977
> 게시판: 뉴스
> 작성자: tachikoma43
> 작성일: 2026-10-11T05:49:03.644Z

---

“하야미미(하야미미)”는 GPU 또는 클라우드 API에 의존하지 않고 CPU만으로 작동하는 경량의 실시간 다중 언어 음성 인식 시스템입니다. 메모리 2GB 미만의 환경에서도 실시간 자막 표시, 화자 레이블링, 번역 자막 생성까지 대응하며, 발화 중부터 자막이 시작되어 발화가 끝나고 약 100ms에서 확정되는 고속성이 특징입니다.  단일 모델에 의존하는 기존의 CPU 기반 음성 인식과는 달리, 하야미미는 발화마다 언어를 판별하여 최적의 전용 모델에 분배하는 독자적인 접근 방식을 채택합니다. 사용되는 모델은 INT8 양자화된 ONNX 형식으로 sherpa-onnx 상에서 동작하기 때문에 PyTorch 또는 CUDA는 필요 없으며, 실제 TV 방송의 일본어 음성으로 “문자 오류율(Character Error Rate：CER) 3.8%”라는 높은 정확도를 달성하고, 6코어의 데스크톱 CPU에서 실시간 10～50배의 속도를 구현합니다.  하야미미(하야미미)는 실시간 자막 표시, 화자 레이블링, 번역 자막 생성까지 대응하며, 발화 중부터 자막이 시작되어 발화가 끝나고 약 100ms에서 확정되는 고속성이 특징입니다.  이 프로젝트는 GitHub에서 “oboroge0/hayamimi”로 제공되며,  https://github.com/oboroge0/hayamimi 에서 확인할 수 있습니다.  GPU, 클라우드 API 없이 CPU만으로 작동하는 경량의 실시간 다중 언어 음성 인식 시스템입니다.

하야미미는 다음과 같이 다각적인 기능을 제공합니다.
•	5개의 주요 언어(일본어, 중국어, 한국어, 광동어, 영어)에 더하여 유럽 24개 언어를 전용 모델로 처리하고, 나머지 약 1600개 언어는 Meta Omnilingual ASR에 폴백 드래프트 자막으로 처리합니다.
•	고속 확정: 일본어의 경우 발화 완료 후 약 100ms에서 확정 문구를 출력합니다.
•	이단 패스 보정: 2초의 무음 후 직전 발화를 재디코딩하여 “청소본” 트랜스크립트를 생성하고, 일본 CER을 15.5%에서 12.0%로 개선합니다.
•	화자 레이블링: "--speakers" 옵션으로 CAM++를 통한 실시간 화자 태깅, 청소본 경로로 pyannote/segmentation-3.0을 사용하여 본격적인 재분리(re-separation)를 수행합니다.
•	번역: "--translate" 옵션으로 지정 언어(예: en, zh, ko, es)로 실시간 번역을 수행합니다.
•	핫워드: "--hotwords"로 고유 명사 인식 강화를 실행합니다.
•	치환 사전: "--replace"로 사후 검색 치환을 실행합니다.
•	한자 숫자 → 산용 숫자 변환: 일본어, 중국어, 광동어에서 한자 숫자를 산용 숫자(算用数字)로 변환합니다.
•	실행 시 사전 API: 세션 중에 치환 사전 또는 ITN(Inverse Text Normalization) 예외/강제 지정 설정을 변경할 수 있습니다.
•	구조화 이벤트 + 실행 시 설정: EventHub에 이벤트를 발행하고 파이프라인의 각 단계를 리스닝(listen)할 수 있습니다.
•	OBS 오버레이 + 대시보드: "--serve"로 로컬 HTTP 서버를 시작하고 브라우저 소스 오버레이와 라이브 대시보드를 제공합니다.
•	네트워크 음성 입력: "--input ws"로 WebSocket을 통한 음성 입력을 수락합니다.
•	스피커 루프백 입력: "--input speaker"(Windows 전용)로 PC 내부 스피커 음성, "--input mix"로 마이크와 스피커 음성을 합성한 루프백 스트림의 텍스트 인식을 지원합니다.
•	영어 v2 티어(Opt-in): "--en-tier v2"로 Parakeet TDT v2로 전환하여 영어 WER를 10.0%에서 6.6%로 개선합니다.
•	4 클래스 일본 句読点(Opt-in): "--punct-model 4class"로 句読점을 직접 예측하는 단일 모델로 전환합니다.
•	메모리 상한 관리: LRU 모델 퇴비(eviction)를 통해 상주 모델을 상한 내(기본값은 2GB)로 제어합니다.
하야미미를 동작시키는 경우, 동작 환경에는 Python 3.10 이상과 PATH에 등록된 ffmpeg가 필요합니다. 먼저 적절한 위치에 리포지토리를 복제합니다. git clone https://github.com/oboroge0/hayamimi.git 다음으로 가상 환경 생성과 의존성 설치를 합니다. python -m venv .venv

# Windows의 경우
.venv\Scripts\pip install -r requirements.txt

# macOS / Linux의 경우
.venv/bin/pip install -r requirements.txt 마지막으로 모델을 다운로드합니다.
# Windows의 경우
.venv\Scripts\python scripts/download_models.py

# macOS / Linux의 경우
.venv/bin/python scripts/download_models.py "--minimal" 옵션을 지정하면 일본어와 영어만 있는 약 1.1GB 구성도 가능합니다. 실시간 인식 실행에는 다음 명령을 실행합니다. # 마이크 입력 (Windows)
.venv\Scripts\python scripts/realtime_transcribe.py

# 마이크 입력 (macOS/Linux)
.venv/bin/python scripts/realtime_transcribe.py

# PC 내부 스피커 입력 (Windows 전용)
.venv\Scripts\python scripts/realtime_transcribe.py --input speaker

# 마이크+스피커 합성 입력
.venv\Scripts\python scripts/realtime_transcribe.py --input mix

대시보드＋OBS 오버레이 포함

.venv\Scripts\python scripts/realtime_transcribe.py --serve 하야미에는 데모 UI가 준비되어 있습니다. "--serve" 옵션으로 로컬 서버가 실행되고 브라우저에서 다음 3 페이지에 접속할 수 있습니다.
•	http://localhost:8833/dashboard: 대시보드: 발화 중 텍스트, 확정 행, 번역, 정색본 트랜스크립트가 표시됩니다.
•	http://localhost:8833/: OBS 오버레이: OBS 브라우저 소스 URL로 설정하면 스트리밍 화면에 자막이 표시됩니다.
•	http://localhost:8833/transcript: 트랜스크립트 페이지: 정색본 트랜스크립트만 표시됩니다.
기사 작성 시점의 하야미의 제한 사항은 다음과 같습니다.
•	1 문자에 여러 언어가 혼재된 발화에는 미지원
•	효과음이나 BGM 직후의 짧은 발화에서는 언어 판정을 잘못할 수 있음
•	동시에 말하는 2명의 화자는 분리 불가능
•	번역 품질은 소형 모델에 의존하므로 중국어, 한국어 번역에서는 숫자나 금액의 차이 발생 가능성 있음
•	오プト인 4 클래스 句読点 모델은 기본적으로 감탄 부호 “!”를 출력하지 않음
하야미는 경량화 및 고속의 실시간 다중 언어 음성 인식으로, 앞으로도 눈 뗄 수 없는 존재입니다.
Google 우선 소스에 설정
복사본 내용: 기사 제목과 URL 복사
XFacebookBlueskyDiscordThreads

다음으로 가상 환경 생성 및 의존 관계 설치합니다. python -m venv .venv

# Windows의 경우
.venv\Scripts\pip install -r requirements.txt

# macOS / Linux의 경우
.venv/bin/pip install -r requirements.txt 마지막으로 모델을 다운로드합니다. # Windows의 경우
.venv\Scripts\python scripts/download_models.py

# macOS / Linux의 경우
.venv/bin/python scripts/download_models.py "--minimal" 옵션을 지정하면 일본어와 영어만 있는 약 1.1GB 구성도 가능합니다. 실시간 인식 실행에는 다음 명령을 실행합니다. # 마이크 입력 (Windows)
.venv\Scripts\python scripts/realtime_transcribe.py

# 마이크 입력 (macOS/Linux)
.venv/bin/python scripts/realtime_transcribe.py

# PC 내부 스피커 입력 (Windows 전용)
.venv\Scripts\python scripts/realtime_transcribe.py --input speaker

# 마이크 + 스피커 합성 입력
.venv\Scripts\python scripts/realtime_transcribe.py --input mix

대시보드와 OBS 오버레이 포함

.venv\Scripts\python scripts/realtime_transcribe.py --serve 하야미에는 데모 UI가 준비되어 있습니다. "--serve" 옵션으로 로컬 서버가 실행되고 브라우저에서 다음 3 페이지에 접속할 수 있습니다.
•	http://localhost:8833/dashboard: 대시보드: 발화 중 텍스트, 확정 행, 번역, 청소본 트랜스크립트가 표시됩니다.
•	http://localhost:8833/: OBS 오버레이: OBS 브라우저 소스 URL로 설정하면 스트리밍 화면에 자막이 표시됩니다.
•	http://localhost:8833/transcript: 트랜스크립트 페이지: 청소본 트랜스크립트만 표시됩니다.
기사 작성 시점의 하야미의 제한 사항은 다음과 같습니다.
•	1 문자에 여러 언어가 혼재된 발화에는 미지원
•	효과음이나 BGM 직후의 짧은 발화에서는 언어 판정을 잘못할 수 있음
•	동시에 말하는 2명의 화자는 분리 불가능
•	번역 품질은 소형 모델에 의존하므로 중국어, 한국어 번역에서는 숫자나 금액의 차이 발생 가능성 있음
•	오プト인 4 클래스 句読点 모델은 기본적으로 감탄 부호 “!”를 출력하지 않음
하야미는 경량화 및 고속의 실시간 다중 언어 음성 인식으로, 앞으로도 눈 뗄 수 없는 존재입니다.
Google 우선 소스에 설정
복사본 내용: 기사 제목 및 URL 복사
XFacebookBlueskyDiscordThreads

마지막으로 모델을 다운로드합니다. # Windows의 경우
.venv\Scripts\python scripts/download_models.py

# macOS / Linux의 경우
.venv/bin/python scripts/download_models.py “--minimal” 옵션을 지정하면 일본어와 영어만 있는 약 1.1GB 구성도 가능합니다. 실시간 인식 실행에는 다음 명령을 실행합니다. # 마이크 입력 (Windows)
.venv\Scripts\python scripts/realtime_transcribe.py

# 마이크 입력 (macOS/Linux)
.venv/bin/python scripts/realtime_transcribe.py

# PC 내부 스피커 입력 (Windows 전용)
.venv\Scripts\python scripts/realtime_transcribe.py --input speaker

# 마이크 + 스피커 합성 입력
.venv\Scripts\python scripts/realtime_transcribe.py --input mix

# 대시보드＋OBS 오버레이 포함
.venv\Scripts\python scripts/realtime_transcribe.py --serve 하야미에는 데모 UI가 준비되어 있습니다. "--serve" 옵션으로 로컬 서버가 실행되고 브라우저에서 다음 3 페이지에 접속할 수 있습니다.
•	http://localhost:8833/dashboard: 대시보드: 발화 중 텍스트, 확정 행, 번역, 정본 트랜스크립트가 표시됩니다.
•	http://localhost:8833/: OBS 오버레이: OBS 브라우저 소스 URL로 설정하면 스트리밍 화면에 자막이 표시됩니다.
•	http://localhost:8833/transcript: 트랜스크립트 페이지: 정본 트랜스크립트만 표시됩니다.
기사 작성 시점의 하야미의 제한 사항은 다음과 같습니다.
•	1 문자에 여러 언어가 혼재된 발화에는 미지원
•	효과음이나 BGM 직후의 짧은 발화에서는 언어 판정을 잘못할 수 있음
•	동시에 말하는 2명의 화자는 분리 불가능
•	번역 품질은 소형 모델에 의존하므로 중국어, 한국어 번역에서는 숫자나 금액의 차이 발생 가능성 있음
•	오プト인 4 클래스 句読点 모델은 기본적으로 감탄 부호 “!”를 출력하지 않음
하야미는 경량 및 고속한 실시간 다중 언어 음성 인식으로, 앞으로도 눈 뗄 수 없는 존재입니다.
Google 우선 소스에 설정
복사본 내용: 기사 제목 및 URL 복사
XFacebookBlueskyDiscordThreads

"--minimal" 옵션을 지정하면 일본어와 영어만으로 약 1.1GB 구성도 가능합니다. 실시간 인식 실행에는 다음 명령을 실행합니다.
# 마이크 입력 (Windows)
.venv\Scripts\python scripts/realtime_transcribe.py

# 마이크 입력 (macOS/Linux)
.venv/bin/python scripts/realtime_transcribe.py

# PC 내부 스피커 입력 (Windows 전용)
.venv\Scripts\python scripts/realtime_transcribe.py --input speaker

# 마이크 + 스피커 합성 입력
.venv\Scripts\python scripts/realtime_transcribe.py --input mix

# 대시보드＋OBS 오버레이 포함

.venv\Scripts\python scripts/realtime_transcribe.py --serve 하야미미에는 데모 UI가 준비되어 있습니다. "--serve" 옵션을 사용하여 로컬 서버가 실행되고 브라우저에서 다음 3 페이지에 액세스할 수 있습니다.
•	http://localhost:8833/dashboard: 대시보드: 발화 중 텍스트, 확정 행, 번역, 정본 트랜스크립트가 표시됩니다.
•	http://localhost:8833/: OBS 오버레이: OBS 브라우저 소스 URL로 설정하면 스트리밍 화면에 자막이 표시됩니다.
•	http://localhost:8833/transcript: 트랜스크립트 페이지: 정본 트랜스크립트만 표시됩니다.
기사 작성 시점의 하야미미의 제한 사항은 다음과 같습니다.
•	1 문자에 여러 언어가 혼재된 발화에는 미지원
•	효과음이나 BGM 직후의 짧은 발화에서는 언어 판정을 잘못할 수 있음
•	동시에 말하는 2명의 화자는 분리 불가능
•	번역 품질은 소형 모델에 의존하므로 중국어, 한국어 번역에서는 숫자나 금액의 차이 발생 가능성 있음
•	오プト인 4 클래스 句読点 모델은 기본적으로 감탄 부호 “!”를 출력하지 않음
하야미미는 경량 및 고속의 실시간 다중 언어 음성 인식으로, 앞으로도 눈길을 뗄 수 없는 존재가 될 것입니다.
Google 우선 소스에 설정
복사본 내용: 기사 제목 및 URL 복사
XFacebookBlueskyDiscordThreads

한편, 하야미에는 데모UI가 준비되어 있습니다. "--serve" 옵션을 사용하여 로컬 서버가 실행되고, 브라우저에서 다음 3 페이지에 접속할 수 있습니다.

*   http://localhost:8833/dashboard: 대시보드: 발화 중 텍스트, 확정 행, 번역, 청소본 트랜스크립트가 표시됩니다.
*   http://localhost:8833/: OBS 오버레이: OBS의 브라우저 소스 URL로 설정하면 스트리밍 화면에 자막이 표시됩니다.
*   http://localhost:8833/transcript: 트랜스크립트 페이지: 청소본 트랜스크립트만 표시됩니다.

기사 작성 시점에서의 Hayamimi의 제한 사항은 다음과 같습니다.

*   1 문장에 여러 언어가 혼재된 발화에는 미 대응
*   효과음이나 BGM 직후의 짧은 발화에서는 언어 판정을 잘못할 수 있음
*   동시에 말하는 2명의 화자는 분리 불가능
*   번역 품질은 소형 모델에 의존하므로, 중국어-한국어 번역에서는 숫자나 금액의 차이가 발생할 가능성이 있음
*   오プト인 4 클래스 句読点 모델은 기본적으로 감탄 부호 "!"를 출력하지 않는 Hayamimi는 경량화 및 고속화된 실시간 다중 언어 음성 인식으로, 앞으로도 눈 떼지 말아야 할 존재입니다.

[원문 보기](https://gigazine.net/news/20261011-hayamimi/) | 출처: Gigazine