모시(Moshi)
term_id: moshi
Category: basic_concepts
Definition
모시는 Kyutai가 만든 고급 AI 모델로, 음성 처리와 텍스트 처리를 통합된 프레임워크로 결합합니다. 전통적인 시스템이 음성을 텍스트로 변환한 후 처리하는 것과 달리, 모시는 음성 및 텍스트 표현을 함께 학습하여 자연스러운 상호작용을 가능하게 합니다.
Summary
Kyutai가 개발한 음성-언어 모델로, 원활한 다중 모달 상호작용을 위해 텍스트와 오디오 표현을 함께 학습합니다.
Key Concepts
- 다중 모달 학습
- 음성-텍스트 공동 모델링
- 운율 보존
- 실시간 상호작용
Use Cases
- 자연스러운 음성 비서 구축
- 감정 톤을 활용한 대화형 스토리텔링 강화
- 청각 장애인용 접근성 도구 개선