샤오미는 OmniVoice를 출시했습니다—모든 언어에서 텍스트를 음성으로 변환하고 목소리를 복제할 수 있는 개방형 AI 모델입니다

샤오미는 OmniVoice를 출시했습니다—모든 언어에서 텍스트를 음성으로 변환하고 목소리를 복제할 수 있는 개방형 AI 모델입니다

20 software

샤오미는 공개 AI 모듈 OmniVoice를 발표했습니다

회사는 텍스트를 음성으로 변환하는 인공지능 모델인 OmniVoice의 출시를 알렸습니다. 수백 개 언어에서 음성을 합성할 뿐만 아니라, 목소리를 복제하고 사용자 설정에 따라 발음을 생성할 수 있습니다.

OmniVoice의 새로운 기능은 무엇인가요?
지표설명언어지원 200개 이상의 언어(희귀 및 학습이 어려운 언어 포함)를 지원합니다. 데이터가 10시간 미만인 경우에도 모델은 "거의 모든 언어"에서 음성을 생성할 수 있습니다. 품질 테스트에서는 102개의 언어에서 음성 인식률이 인간 수준과 동등하거나 일부 경우에는 이를 능가했습니다. 24개 언어에서 모델은 몇몇 상업용 시스템보다 유사성과 명료성 면에서 우위를 보였습니다.
아키텍처단계별 토큰 예측 모듈 없이 단순화된 양방향 변환기 네트워크입니다. 이는 학습 시간을 하루로 단축하고 100,000시간 데이터에 대해 인퍼런스 속도를 (PyTorch에서 최대 40배) 향상시킵니다.
기술 • "음성 코드의 무작위 숨김"은 학습을 가속화합니다. • 사전 훈련 시 대형 언어 모델 연결은 발음과 명료성을 개선합니다.

실제 활용 가능성
1. 목소리 복제

- 나이, 성별, 톤, 억양, 방언 등 지정된 특성에 따라 음성을 생성합니다.
- 기준 오디오 없이 속삭임 및 기타 스타일 변형을 만들 수 있습니다.

2. 원본 녹음 처리

- 잡음을 제거하고 비완벽한 파일에서도 깨끗한 목소리 특성을 추출합니다.

3. 억양 제어

- 숨소리, 웃음 등 세부 요소를 추가해 보다 자연스러운 사운드를 만듭니다.

4. 발음 정밀 조정

- 다성 음을 가진 중국 문자나 영어 고유명사와 같은 복잡한 소리를 수동으로 조정합니다.

결과
OmniVoice는 기존 상업용 음성 합성 시스템에 대한 경쟁력 있는 대안입니다. 단순한 디자인, 빠른 학습 및 인퍼런스 속도, 광범위한 커스터마이징 기능 덕분에 모델은 소비자 애플리케이션 및 서비스에 통합될 준비가 되어 있습니다

댓글 (0)

의견을 남겨 주세요. 예의를 지키고 주제에서 벗어나지 말아 주세요.

아직 댓글이 없습니다. 댓글을 남기고 의견을 공유해 주세요!

댓글을 남기려면 로그인해 주세요.

댓글을 남기려면 로그인