article detail
[기고] 음성 AI의 재고: 텍스트에서 네이티브 음성 AI 모델로
2026. 9. 30. 오전 11:27
![[기고] 음성 AI의 재고: 텍스트에서 네이티브 음성 AI 모델로](https://elec4.co.kr/media/commonfile/202609/30/073810ac9ae5d959f98a9eeef0a88183.jpg)
AI 요약
현재 음성 AI는 음성 활동 감지와 자동 음성 인식(ASR)으로 음성을 텍스트로 변환한 뒤 LLM이 응답을 생성하고 텍스트 음성 변환(TTS)으로 다시 읽어주는 파이프라인을 사용하며, 이 방식은 지연 시간과 뉘앙스 손실을 초래한다고 지적합니다. 대안으로 구글의 SoundStream·메타의 EnCodec처럼 신경망 오디오 코덱을 통해 오디오를 이산 토큰으로 압축하고 이를 직접 처리하는 네이티브 음성 AI 모델이 제안되며, 이를 통해 억양·타이밍·감정 등 음성 신호를 보존하면서 처리 단계를 줄여 지연을 낮출 수 있다고 설명합니다. 실제 사례로 OpenAI의 GPT-4o는 낮은 지연으로 오디오 응답을 생성할 수 있고, 프랑스 연구소 Kyutai의 Moshi는 2024년 9월 오픈소스로 공개되어 사용자 발화와 모델 출력을 병렬로 처리해 약 200밀리초 수준의 지연을 달성했다고 보도했습니다.