VoiceStudio: 음성 복제와 더빙을 로컬에서 돌리는 ElevenLabs 대안
유튜브 영상에 내레이션을 넣으려고 ElevenLabs를 쓰면 글자 수만큼 크레딧이 줄어듭니다. 원고를 고칠 때마다 다시 생성하니 크레딧은 생각보다 빨리 떨어지고, 녹음한 목소리 샘플은 남의 서버에 올라갑니다.
VoiceStudio는 이 일을 전부 내 컴퓨터에서 하겠다는 오픈소스 앱입니다. 2026년 4월에 리포가 만들어졌고 9월 말 기준 GitHub 스타가 4만 8천 개를 넘었습니다. 음성 복제, 목소리 디자인, 영상 더빙, 받아쓰기, 전사, 오디오북 제작을 646개 언어로 지원한다고 소개합니다. 이 글은 README와 저장소 문서를 근거로 씁니다.
오픈소스니까 마음대로 써도 된다는 오해
무료로 받아서 오프라인으로 돌리니 결과물도 조건 없이 쓸 수 있을 것 같습니다. VoiceStudio의 README 맨 끝에는 이 생각을 바로잡는 세 문장이 있습니다. 앱은 AGPL-3.0이고, 모델에는 각자의 라이선스가 있으니 상업적으로 쓰기 전에 확인하라고, 그리고 목소리는 허락을 받은 경우에만 복제하라고 적혀 있습니다.
이 세 문장이 이 앱을 이해하는 열쇠라고 저는 봅니다. VoiceStudio는 하나의 음성 모델이 아니라 여러 오픈소스 음성 엔진을 한 화면에 모아 둔 작업대입니다. 앱의 라이선스와 내가 고른 엔진의 라이선스가 따로 논다는 뜻입니다.
엔진 열일곱 개를 한 화면에 모은 구조
기능 목록을 보면 음성 생성 엔진이 기본 엔진을 포함해 열일곱 개입니다. 기본값은 k2-fsa의 OmniVoice 기반이고, CosyVoice 3, IndexTTS 2.5, GPT-SoVITS, MOSS-TTS, KittenTTS 같은 이름이 나란히 있습니다. 전사 쪽은 WhisperX가 기본이고 Faster-Whisper, Parakeet, Moonshine, FunASR 등을 고를 수 있습니다.
사용자에게 이 구조의 이점은 엔진을 갈아 끼우는 비용이 거의 없다는 것입니다. 음성 모델은 언어마다, 목소리 성격마다 잘하는 것이 다릅니다. 한 엔진이 한국어 억양을 어색하게 읽으면 같은 원고를 다른 엔진으로 다시 돌려 보면 됩니다. 모델마다 따로 설치하고 명령줄을 익혀야 했던 일을 앱이 대신합니다.
646개 언어라는 숫자는 엔진들이 지원하는 언어를 합친 것으로 읽는 편이 안전합니다. 언어마다 품질이 같을 리 없고, 한국어가 어느 엔진에서 가장 자연스러운지는 제가 확인하지 못했습니다. 직접 짧은 문장으로 엔진 몇 개를 비교해 보는 것이 가장 빠른 확인 방법입니다.
인터넷 없이 도는 범위
README는 로컬 작업은 내 하드웨어에서 돌고, 원격 서비스는 선택이며, 사용 통계는 동의해야 수집한다고 밝힙니다. 모델은 처음 쓸 때 내려받아야 하니 첫 실행에는 네트워크가 필요하고, 그 뒤로는 오프라인으로 돕니다.
이 점이 가장 크게 의미 있는 사람은 녹음 원본을 밖으로 내보내기 어려운 경우입니다. 사내 교육 영상의 내레이션, 아직 공개하지 않은 제품 영상의 더빙, 회의 녹음의 전사가 그렇습니다. 클라우드 서비스의 약관을 읽고 데이터가 학습에 쓰이는지 따져 볼 필요가 처음부터 없어집니다.
필요한 하드웨어는 엔진마다 다르다고 README가 밝히고, GPU를 자동으로 잡아 줍니다. 가벼운 엔진은 노트북에서도 돌지만 무거운 엔진을 빠르게 돌리려면 GPU가 있는 편이 낫습니다. 구독료가 사라지는 대신 그 비용이 하드웨어와 전기로 옮겨 간다고 보면 정확합니다.
에이전트가 부를 수 있는 로컬 API와 MCP
개발자에게 눈에 띄는 부분은 앱 바깥으로 열린 입구입니다. VoiceStudio는 로컬 API와 MCP 서버를 제공합니다. Claude Code 같은 에이전트에게 "이 원고를 이 목소리로 읽어서 파일로 저장해"라고 시키면 에이전트가 MCP로 VoiceStudio를 부르는 흐름이 가능합니다.
설치도 에이전트를 염두에 두었습니다. README에는 코딩 에이전트에 붙여 넣을 설치 지시문이 있고, 연결된 가이드가 하드웨어 확인, 모델 다운로드 전 사용자 확인, 시험 생성까지 다룹니다. macOS와 Linux는 설치 스크립트 한 줄로도 됩니다.
목소리를 복제할 때 남는 책임
기술적으로는 짧은 녹음만으로 누구의 목소리든 흉내 낼 수 있는 시대입니다. 로컬에서 돈다는 것은 서비스 회사가 대신 막아 주는 장치도 없다는 뜻입니다. 클라우드 서비스라면 약관과 탐지 시스템이 있는 자리를 이제 사용자 자신이 맡습니다.
VoiceStudio는 기능 목록에 AI 워터마크를 넣어 두었습니다. 이름대로라면 생성한 음성에 AI가 만들었다는 표시를 남기는 기능입니다. 저라면 외부에 공개할 음성에는 이 기능을 켜고, 복제에 쓴 목소리의 주인에게 받은 허락을 기록으로 남겨 두겠습니다. 본인 목소리로 내레이션을 만드는 용도라면 이런 걱정 없이 가장 먼저 이득을 보는 사람은 바로 본인입니다.
함께 읽기
- Paperclip: AI 에이전트 여러 개에 예산과 작업 잠금을 거는 오픈소스 관리 앱Paperclip의 README는 "Build the 1 AI note-taking app to $1M MRR" 같은 목표를 적고, CEO, CTO, 엔지니어, 마케터 에이전트를 고용해 회사를 굴리라고 말합니다. 2026년 3월에 리포가 만들어졌고, 9월 말 기준 GitHub 스타가 9만 4천 개를 넘었고 9월 하순 G…
- Hindsight: RAG 대신 기억을 정리하는 오픈소스 에이전트 메모리에이전트에게 지난주에 "우리 팀은 배포를 금요일에 하지 않는다"고 알려 줬다고 해 보겠습니다. 오늘 새 세션에서 금요일 배포 계획을 물으면 에이전트는 그 말을 기억할까요. 대화 기록을 벡터 DB에 넣어 두었다면 운이 좋을 때만 기억합니다. 질문에 "금요일"이라는 단어가 있으면 찾아지고, "주말 전에 올려도 될까?"라고 …
- Orca: 코딩 에이전트 여러 개를 git worktree로 나눠 돌리는 오픈소스 앱Claude Code를 터미널 두 개에서 동시에 띄우고 각각 다른 일을 시켜 본 적이 있다면 금방 부딪히는 문제가 있습니다. 두 에이전트가 같은 폴더의 같은 파일을 고칩니다. 한쪽이 테스트를 돌리는 사이 다른 쪽이 코드를 바꾸고, 어느 변경이 누구 것인지 커밋할 때 가려내야 합니다.
- ChatGPT Pro $200 사용량 절반 축소: 가격은 그대로인데 단가는 두 배가 된 구조OpenAI가 9월 29일 DevDay에서 ChatGPT Pro $200 요금제를 다시 열었습니다. 9월 10일부터 신규 가입을 막아 두었던 요금제입니다. 월 요금은 그대로 200달러입니다. 그런데 10월 30일부터 이 요금제로 쓸 수 있는 양은 절반이 됩니다.
- OpenAI의 Cursor 모델 차단: AI 도구가 모델 공급사 하나에 기댈 때의 위험2026년 8월 29일, OpenAI가 Cursor에 모델 제공을 중단하겠다고 발표했습니다. 이유는 한 문장이었습니다.