일레븐랩스

글로벌 AI 오디오 기업 일레븐랩스가 차세대 텍스트 음성 변환(TTS) 모델 ‘일레븐 v4’와 저지연 특화 모델 ‘일레븐 v4 터보’를 출시했다고 밝혔다. 회사는 새 모델이 기존 세대보다 감정 표현과 문맥 이해 능력을 넓혔다고 설명했다.

일레븐랩스에 따르면 ‘일레븐 v4’는 독립 벤치마크인 아티피셜 애널리시스(Artificial Analysis)의 프로바이더 보이스 아레나 2026년 9월 평가에서 1위를 기록했다. 또 90개 이상 언어를 지원하며, 다자간 대화와 감정 표현 범위를 크게 확장한 점을 내세웠다. 마티 스타니셰프스키 공동창립자 겸 최고경영자(CEO)는 “AI는 추론 능력만큼 사람과 소통하는 방식이 중요하다”며 “일레븐 v4는 풍부하고 표현력 넘치는 커뮤니케이션 능력을 제공한다”고 말했다.

이번 공개는 음성 AI 시장이 단순 낭독형 모델에서 대화형·연기형 모델로 옮겨가고 있음을 보여준다. 특히 저지연과 표현력을 함께 내세운 점은 실시간 에이전트 경쟁이 본격화되고 있다는 신호로 읽힌다. 피오트르 다브코프스키 공동창립자 겸 최고기술책임자(CTO)는 “완전히 새로운 아키텍처를 기반으로 설계됐다”며 “대화형 에이전트 분야에도 뛰어난 표현력을 제공할 수 있게 됐다”고 밝혔다.

‘일레븐 v4’는 텍스트의 어조와 속도, 맥락을 반영해 감정이 살아 있는 음성을 구현하도록 설계됐다. 사용자는 자연어로 발화 방식을 설명할 수 있고, 문장 안에 태그를 넣어 웃음이나 억양, 음향 효과 등을 지정할 수도 있다. 이전 세대인 일레븐 v3보다 일관성이 높아졌고, 여러 화자가 오가는 대화에서도 목소리의 고유한 특징을 유지하도록 개선됐다. ‘일레븐 v4 터보’는 첫 응답 생성의 중간 추론 지연 시간이 평균 100밀리초(ms)라고 회사는 설명했다.

언어 지원 범위도 넓혔다. 일레븐랩스는 기존 v3의 70개 언어에서 90개 이상 언어로 확장됐다고 밝혔으며, 일본어와 중국어(만다린), 브라질 포르투갈어에서 성능 향상이 있었다고 전했다. 한국어로 녹음된 음성을 원어민 악센트의 영어로 바꾸면서도 원본의 피치와 음색을 유지하는 기능도 소개했다. 다만 실제 적용 범위와 품질은 언어별 환경과 활용 방식에 따라 차이가 날 수 있어 보인다.

보안과 아이덴티티 보호 장치도 함께 제시했다. 회사는 GDPR, HIPAA, SOC 2, PCI 등 글로벌 보안 규정을 준수한다고 밝혔고, 미국과 EU, 싱가포르, 인도 등에서 데이터 저장 옵션을 제공한다고 설명했다. 또 음성 복제 도구 사용 시 음성 캡차를 거치도록 하고, 정치인과 주요 공인의 음성 복제를 막는 안전장치도 운영한다고 덧붙였다.

· · · · · · · · · ·

스페셜타임스는 AI 기술의 도움을 받아 더 빠르고 다양한 뉴스를 독자에게 전달하기 위해 노력하고 있습니다.

저작권자 © 스페셜타임스 무단전재 및 재배포 금지