APG-MOS: 인간의 청각 인지를 반영한 혁신적인 합성 음성 평가 모델
본 기사는 청각 인지 모델을 통합하여 합성 음성의 MOS 예측 정확도를 높인 APG-MOS 모델에 대한 내용을 다룹니다. 생물학적 청각 메커니즘과 의미 왜곡 모델링, 그리고 잔차 교차 주의 아키텍처를 활용하여 기존 모델보다 우수한 성능을 보이며, AI 음성 기술 발전에 크게 기여할 것으로 기대됩니다.

인간의 귀를 닮은 AI, 합성 음성 평가의 새 지평을 열다
오늘날 인공지능(AI) 기술의 발전으로 합성 음성의 품질이 눈부시게 향상되고 있습니다. 하지만, 기계가 만든 음성이 과연 얼마나 자연스럽고 사람의 감각에 부합하는지는 여전히 중요한 과제입니다. 사람이 직접 평가하는 방법은 시간과 비용이 많이 들기 때문에, 컴퓨터가 자동으로 음성 품질을 평가하는 기술이 필요합니다.
중국과학원 자동화연구소의 Lian Zhicheng 박사, Wang Lizhi 박사, Huang Hua 박사 연구팀은 이러한 문제를 해결하기 위해 APG-MOS (Auditory Perception Guided-MOS Predictor) 라는 획기적인 모델을 개발했습니다. 이 모델은 단순히 음성의 특징만 분석하는 것이 아니라, 실제 사람의 청각 인지 메커니즘을 모방하여 합성 음성을 평가하는 데 초점을 맞추고 있습니다.
APG-MOS의 핵심 기술
APG-MOS는 크게 세 가지 핵심 기술로 구성됩니다.
- 생물학적 청각 메커니즘 기반 지각 모듈: 이 모듈은 인간의 달팽이관 기능을 모방하여 음향 신호를 생물학적으로 정렬된 전기화학적 신호로 변환합니다. 마치 인간의 귀가 소리를 처리하는 방식과 유사하게 말이죠.
- 잔차 벡터 양자화(RVQ) 기반 의미 왜곡 모델링: 단순히 음향적 차이만 고려하는 것이 아니라, 의미 수준에서의 음성 품질 저하까지 정량적으로 분석합니다. 말의 내용이 얼마나 잘 전달되었는지까지 평가하는 것이죠.
- 잔차 교차 주의 아키텍처와 점진적 학습: 전기화학적 신호와 의미 정보를 효과적으로 결합하기 위해 잔차 교차 주의 아키텍처를 사용하고, 점진적 학습 전략을 통해 모델의 성능을 최적화합니다. 다양한 정보를 종합적으로 분석하여 더욱 정확한 평가를 내리는 것이죠.
놀라운 성능과 미래 전망
연구팀은 두 가지 주요 벤치마크를 통해 APG-MOS의 우수한 성능을 검증했습니다. 공개된 코드와 체크포인트를 통해 다른 연구자들도 이 기술을 활용할 수 있도록 할 예정입니다. APG-MOS는 합성 음성 평가의 정확성을 높일 뿐만 아니라, AI 음성 기술의 발전에도 크게 기여할 것으로 기대됩니다. 더욱 자연스럽고 사람과 같은 음성을 생성하는 AI 시대를 앞당길 핵심 기술이 될 것입니다. 앞으로 APG-MOS가 어떻게 발전하고 활용될지 기대됩니다! 🎉
(출처: Lian Zhicheng, Wang Lizhi, Huang Hua. APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech)
Reference
[arxiv] APG-MOS: Auditory Perception Guided-MOS Predictor for Synthetic Speech
Published: (Updated: )
Author: Zhicheng Lian, Lizhi Wang, Hua Huang
http://arxiv.org/abs/2504.20447v1