안녕하세요, Hoda입니다.

AI 음성 합성 도구를 떠올리면 보통 ElevenLabs나 Speechify를 먼저 생각하기 쉽지만, Fish Audio 역시 최근 조용히 입지를 넓혀가고 블로그 등에서 존재감을 드러내고 있습니다.

개발사 측은 자사 음성이 ElevenLabs보다 더 자연스럽다고 주장하며, 맹검 테스트(blind test) 데이터를 근거로 내세우고 있어 가볍게 넘기기 어렵습니다. 특히 두 가지가 눈에 띄었는데, 바로 감정 태그 시스템과 영어 외 다른 언어에서의 뛰어난 음성 품질입니다. 제가 직접 제 모국어로 테스트해 보았으니 아래에서 자세히 다뤄보겠습니다.

이미 ElevenLabs와 Speechify 리뷰도 마친 상태라(링크는 하단에 첨부), Fish Audio 역시 그들과 나란히 비교해 볼 만한 진정한 대안으로서 이번에 제대로 파헤쳐 보았습니다.


Fish Audio란 무엇인가요?

Fish Audio 공식 사이트

Fish Audio는 **Hanabi AI Inc.**에서 개발하고 운영하는 AI 음성 플랫폼입니다. 텍스트 음성 변환(TTS), 음성 복제(Cloning), 음성 인식(STT), 음성 번역, 오디오 분리 등 음성과 관련된 다양한 기능을 지원합니다.

핵심은 자체 개발한 Fish Audio S2 모델입니다. ElevenLabs와의 공개 맞대결 벤치마크에서 약 60%의 승률을 기록했습니다. 이 수치는 사용자가 어느 도구의 샘플인지 모르는 상태에서 진행한 5,000건 이상의 맹검 테스트를 기반으로 합니다.

공식적으로 30개 이상의 언어를 지원합니다(사이트 일부에서 ‘80개 이상 언어’라고 언급하는 것은 최신 플래그십 모델인 S2.1 Pro가 83개 언어를 지원하기 때문이며, 구형 모델들은 약 30개 언어를 지원합니다). 음성 라이브러리에는 커뮤니티에서 제작한 음성이 200만 개 이상 등록되어 있습니다.

활용 예시

제 유튜브 채널에서는 Fish Audio API를 Google Sheets와 연동하여 텍스트를 MP3 오디오 파일로 일괄 변환하는 방법을 다루고 있습니다(일본어로 내레이션이 진행되지만, 언어를 몰라도 시각적으로 쉽게 따라 하실 수 있습니다).


핵심 기능

텍스트 음성 변환 (TTS)

텍스트 음성 변환 (TTS)

기본적인 기능은 입력한 텍스트를 자연스러운 음성으로 변환하는 것입니다. 이 과정에서 돋보이는 특징은 세 가지입니다.

가장 큰 차별점은 감정 태그를 통한 세밀한 감정 제어입니다. 텍스트 중간에 [excited], [whispering], [sad], [laughing] 같은 태그를 직접 삽입하면 문구별로 감정 톤이 바뀝니다. 64개 이상의 태그를 사용할 수 있어 ElevenLabs의 슬라이더 방식보다 훨씬 세밀하게 제어할 수 있습니다.

**저지연 스트리밍(Low-latency streaming)**도 장점입니다. 첫 출력이 생성되기까지의 지연 시간이 200ms 미만으로, 실시간 음성 비서나 대화형 AI에 적합한 구조를 갖추고 있습니다.

장문 콘텐츠에서의 음성 안정성도 우수합니다. 몇 분 이내의 내레이션 동안 목소리가 변질되거나 톤이 무너지지 않아 오디오북이나 유튜브 내레이션에 적합합니다.

음성 복제 (Voice Cloning)

음성 복제하기

15~30초 분량의 샘플 오디오만 있으면 목소리를 복제할 수 있습니다. 업계 표준보다 짧은 시간만 요구하므로 확실한 장점이지만, 녹음 파일에 잡음이 있거나 여러 화자의 목소리가 겹치면 복제 정확도가 크게 떨어집니다. 깨끗하고 조용한 녹음 환경은 사실상 필수입니다.

▼ 아래에서 제 목소리를 직접 복제해 보았습니다. 자화자찬일 수 있지만, 실제 목소리와 너무 똑같아서 약간 섬뜩할 정도입니다.

복제한 음성은 다른 언어에도 적용할 수 있습니다. 예를 들어 일본어 샘플을 녹음해 두면 이를 활용해 영어 TTS 출력을 생성할 수 있는 유용한 다국어 트릭입니다.

자신의 목소리 복제는 무료로 만들 수 있지만, ‘타입(Type)’ 설정에서 비공개(Private)나 링크 공유(Unlisted)로 지정하려면 유료 플랜으로 업그레이드해야 합니다. 무료 플랜에서는 생성한 모든 복제 음성이 공개(Public)로 설정되므로 시작하기 전에 참고하시기 바랍니다.

무료 플랜에서는 음성이 기본적으로 '공개(Public)'로 설정됩니다.

음성 인식(STT) 및 기타 기능

Fish Audio는 음성 전사(STT), 오디오 분리(보컬과 반주 분리), 효과음 생성, 음성 번역 기능도 함께 제공합니다. TTS와 음성 복제가 핵심이지만, 음성 관련 작업 대부분을 한곳에서 처리할 수 있어 상당히 편리합니다.

API

Fish Audio는 REST API와 함께 Python 및 JavaScript SDK를 제공하며, 개발자 문서도 잘 갖춰져 있습니다. TTS API 이용 요금은 UTF-8 바이트 백만 개당 $15로, 동일 조건의 ElevenLabs에 비해 훨씬 저렴합니다.

또한 Fish Audio는 공정 사용(fair-use) 정책에 따라 플래그십 모델인 S2.1 Pro를 개발자들에게 API를 통해 무료로 개방하고 있습니다. 적어도 현재로서는 사실상 무제한 무료 텍스트 음성 변환 API인 셈입니다. 최고 수준의 음성 품질이 대개 유료 장벽에 가막혀 있는 업계에서 보기 드문 파격적인 행보입니다.

Fish Audio S2.1 Pro


요금제

Fish Audio의 공식 요금제 기준(2026년 9월 확인, USD 기준) 플랜 구조는 다음과 같습니다.

플랜월간 결제연간 결제(월 환산)연간 총 결제액월 제공 크레딧최대 생성 시간
Free$0$0$08,000최대 7분
Plus$15$11$132/년250,000최대 200분
Pro$100$75$900/년2,000,000최대 1,620분
Max$999$749$8,988/년25,000,000최대 6,250분
Enterprise맞춤형맞춤형

상업적 이용 관련: 무료 플랜은 비상업적 용도로만 제한됩니다. 수익 창출형 유튜브 채널을 운영하거나 기업 홍보 콘텐츠에 사용하려면 Plus 이상의 플랜이 필요합니다.

생성당 글자 수 제한: Free 플랜은 500자, Plus 플랜은 15,000자, Pro 플랜은 30,000자입니다. 긴 대본을 대량으로 처리해야 한다면 Plus 이상이 실질적인 최소 기준입니다.

장점 4
  • 신용카드 등록 없이 무료 플랜 체험 가능

  • 연간 결제 시 Plus 플랜이 월 $11로 가성비 우수

  • 연간 결제 시 약 3개월 치 절감 효과 (약 27% 할인)

  • 업계 최저 수준의 API 요금 (백만 바이트당 $15)

단점 3
  • Free 플랜은 월 7분으로 제한되어 맛보기 용도로만 적합

  • 상업적 이용 시 Plus 이상 플랜 필수

  • Pro 플랜은 월 $75~$100로 일반 크리에이터에게는 다소 부담스러운 가격


음성 품질에 대한 진솔한 평가

장점: 감정 표현력과 자연스러움

제3자 리뷰 사이트(DIY AI)가 자체 데이터셋을 기준으로 평가한 결과, Fish Audio는 감정 표현력 부문에서 전체 카테고리 중 가장 높은 점수인 8.9/10점을 기록했습니다. 전체 종합 점수(8.7/10점)는 ElevenLabs를 바짝 뒤쫓았으며, 음성 자연스러움과 복제 정확도 부문에서도 우수한 평가를 받았습니다.

저는 일본인이기 때문에 일본어 출력을 직접 테스트해 보았는데, 예상보다 훨씬 훌륭했습니다. 테스트해 본 여러 구간에서 ElevenLabs의 일본어 출력보다 더 자연스럽게 느껴졌습니다. 일본어는 TTS 엔진이 제대로 구현하기 까다로운 언어 중 하나이므로, 이 정도 수준을 소화한다면 영어뿐만 아니라 다른 비영어권 언어에서도 자연스러운 결과물을 기대할 수 있음을 보여주는 신호입니다. 다만 목소리 종류에 따라 품질 편차가 존재하므로, 작업 목적에 맞는 음성을 선택하기 전에 미리 샘플을 들어보는 것이 좋습니다.

단점: 노이즈 처리 능력

잡음 처리 점수는 7.8/10점으로 다른 부문에 비해 상대적으로 낮았습니다. 음성 복제 원본 녹음에 잡음이나 울림(리버브)이 섞여 있다면 생성된 결과물에도 그대로 반영되는 경향이 있습니다. 원본 녹음을 그대로 넣기보다는 오디오 정리 도구(Adobe Podcast Enhancer, Rovoice 등)를 함께 사용하는 것을 권장합니다.

Fish Audio vs. ElevenLabs 비교

비교 항목Fish AudioElevenLabs
종합 점수 (DIY AI)8.7/108.9/10
감정 표현력8.9/10 (업계 최고 수준)8.7/10
음성 자연스러움8.8/10업계 선도 수준
음성 복제 정확도8.8/10유사함
비영어권 품질우수함 (실사용 테스트 기준)보통 — 음성에 따라 편차 있음
API 요금$15 / 백만 바이트 (최고 가성비)$165 / 백만 바이트
무료 플랜신용카드 불필요제한적임

추천 대상과 비추천 대상

Fish Audio는 풍부한 감정이 담긴 캐릭터 목소리나 내레이션이 필요한 콘텐츠 크리에이터, 음성 품질을 중시하는 비영어권 크리에이터, 그리고 막대한 API 비용 부담 없이 제품에 음성 기능을 구현하려는 엔지니어에게 특히 적합합니다.

반면, 몇 가지 상황에는 적합하지 않습니다. 컴플라이언스 교육이나 브랜드 보이스 콘텐츠처럼 깔끔한 기업형 내레이션을 대량으로 안정적으로 제작해야 한다면 ElevenLabs가 관리하기에 더 수월합니다. 또한 시끄러운 환경에서 녹음된 샘플을 기반으로 음성 복제를 하려는 경우에도 적합하지 않습니다.


이용 시 유의할 점

권리와 초상권: 허가 없이 유명인이나 성인의 목소리를 무단으로 복제하여 상업적으로 사용하는 것은 초상권 및 퍼블리시티권 침해 문제를 야기할 수 있습니다. 커뮤니티 라이브러리에 있는 모든 음성이 상업적 이용을 허가받은 것은 아니므로 사용 전에 권리 범위를 꼭 확인하시기 바랍니다.

AI 음성 사용 고지: 영상 등 콘텐츠에 생성형 오디오를 사용할 때는 AI 음성이 사용되었다는 사실을 고지하는 것이 윤리적 기준이자 업계의 바람직한 관행입니다.

계정 삭제 시 유의사항: 계정을 삭제하면 그동안 제작한 음성 모델과 미사용 크레딧이 모두 소멸됩니다. 필요한 데이터는 미리 내보내고, 유료 플랜을 이용 중이라면 계정 삭제 전에 구독을 해지해야 합니다.


자주 묻는 질문 (FAQ)

Fish Audio는 영어 외의 다른 언어도 잘 지원하나요? 네. 공식적으로 30개 이상의 언어를 지원하며, 최신 플래그십 모델은 83개 언어를 지원합니다. 저는 일본인으로서 일본어로 철저하게 테스트해 본 결과 매우 만족스러운 수준이었습니다. 일본어는 TTS 엔진에게 까다로운 언어 중 하나인데 이 정도를 소화한다면 다른 비영어권 언어에서도 품질을 기대할 수 있습니다. 다만 음성에 따라 품질 차이가 있으므로 특정 언어로 작업할 때도 사전에 샘플 음성을 미리 들어보는 것이 좋습니다.

무료 플랜에서는 실제로 어느 정도 작업을 할 수 있나요? 매월 8,000 크레딧이 제공되며, 이는 약 7분 분량의 생성량에 해당합니다. 신용카드 등록 없이 체험해 볼 수 있다는 점은 장점이지만 상업적 이용이 불가능하고, 생성당 글자 수가 500자로 제한되며, 고급 음성 복제 기능이 제한됩니다. 간단한 테스트를 넘어 본격적으로 활용하려면 Plus 이상의 플랜이 필요합니다.

ElevenLabs보다 더 나은가요? 전반적인 완성도 면에서는 ElevenLabs가 미세하게 우세하지만, Fish Audio는 API 요금, 비영어권 품질, 세밀한 감정 태그 제어 측면에서 확실한 강점이 있습니다. 어떤 도구가 더 나을지는 사용 목적에 따라 다르므로 무료 체험을 먼저 해보고 결정하는 것이 합리적입니다.

음성 복제에는 어떤 오디오 파일이 필요한가요? 최소 15~30초 분량의 샘플 오디오가 필요합니다. 더 나은 결과를 얻으려면 배경 잡음이 없는 단일 화자의 깨끗한 녹음 파일(MP3, WAV, M4A 형식)을 사용하는 것이 좋습니다.

상업적 목적으로 사용할 수 있나요? Plus 이상의 유료 플랜부터 상업적 이용이 가능합니다. 무료 플랜은 개인 용도로만 제한되므로, 수익이 발생하는 유튜브 채널이나 상업적 홍보용으로 쓰려면 유료 플랜으로 업그레이드해야 합니다.


Fish Audio는 특히 비영어권 언어로 콘텐츠를 제작하는 크리에이터라면 ElevenLabs, Speechify와 함께 반드시 고려해 보아야 할 대안입니다. 합리적인 요금제, 감정 태그 제어 기능, 뛰어난 비영어권 음성 품질의 조합은 특정 활용 사례에서 강력한 경쟁력을 발휘하며, 목적에 따라 주력 도구로 자리잡을 잠재력이 충분합니다.