샤오미는 텍스트를 음성으로 변환하고 반대로도 할 수 있는 새로운 AI 모델인 MiMo V2.5 버전을 출시했습니다

샤오미는 텍스트를 음성으로 변환하고 반대로도 할 수 있는 새로운 AI 모델인 MiMo V2.5 버전을 출시했습니다

18 software

샤오미가 새로운 음성 AI 모델을 출시합니다

샤오미는 텍스트와 오디오를 처리하는 두 가지 버전의 음성 인공지능 모델을 발표했습니다:

모델 기능 주요 특징 MiMo‑V2.5‑TTS 텍스트 → 음성 3가지 변형, MiMo Studio에서 제한 기간 동안 무료; 속도, 톤 및 감정 조절 가능; 짧은 문구로 새로운 목소리 생성(VoiceDesign) 및 소량 샘플로 목소리 복제(VoiceClone). MiMo‑V2.5‑ASR 음성 → 텍스트 구음 인식 어려운 환경에서도 중국어 방언 + 영어 지원; 이중 언어 대화와 노래 가사(배경 음악에 대한 보컬); 강한 소음에서도 동작; 억양에 따라 자동으로 문장 부호 삽입.

MiMo‑V2.5‑TTS 사용 방법
1. 기본 버전 – 사전 설정된 목소리 중 하나를 선택하고 속도, 톤 및 감정 색조를 변경할 수 있습니다.
2. VoiceDesign – 짧은 문구를 입력하면 시스템이 새로운 음색을 생성합니다.
3. VoiceClone – 선택한 목소리의 몇 개 샘플을 업로드하면 모델이 스타일과 지침을 보존하면서 재생합니다.

원하는 사운드를 얻기 위해 사용자는:
- 텍스트에 특수 태그를 추가할 수 있습니다;
- 중국어 또는 영어로 간단하고 자연스러운 언어로 목소리를 설명할 수 있습니다;
- 여러 목소리가 동시에 상호작용하는 가상 공연을 위한 시나리오를 만들 수 있습니다.

MiMo‑V2.5‑ASR 특징
- 다국어 지원 – 중국어 방언과 영어의 여러 변형을 지원합니다.
- 노래 해석 – 배경 음악이 있는 경우에도 보컬을 분리해냅니다.
- 소음 저항성 – 강한 외부 소음에서도 정확히 인식합니다.
- 억양 기반 문장 부호 – 자동으로 문장 부호를 삽입하여 수동 편집 필요성을 줄입니다.

따라서 샤오미는 합성 음성 생성과 구어 정보의 정밀 인식을 위한 유연한 도구를 제공함으로써 음성 기술 분야에서 역량을 확장하고 있습니다

댓글 (0)

의견을 남겨 주세요. 예의를 지키고 주제에서 벗어나지 말아 주세요.

아직 댓글이 없습니다. 댓글을 남기고 의견을 공유해 주세요!

댓글을 남기려면 로그인해 주세요.

댓글을 남기려면 로그인