화자 인식을 통한 등장인물 기반의 비디오 요약

이순탁,백중환,김종성,강찬미

화자 인식을 통한 등장인물 기반의 비디오 요약

2005

이순탁
백중환
김종성
강찬미

본 논문에서는 인물 기반의 비디오 요약 방법으로써 비디오 내 음성정보를 이용하여 화자 인식 기법을 통한 등장인물 중심의 요약 기법을 제안한다. 먼저, 얼굴 영역을 포함하는 장면을 중심으로 비디오로부터 배우의 대사에 해당하는 음성 정보를 분리하고, 화자 인식 기법을 수행하여 등장인물 별로 분류하였다. 화자인식 기법은 각 화자별로 MFCC(Mel Frequency Cepstrum Coefficient) 값을 추출하고 GMM(Gaussian Mixture Model)을 이용하여 분류한다. 본 논문에서는 4명의 등장인물에 대해 GMM을 학습시키고 4명 중 1명을 검출하는 실험을 통해 학습된 GMM 분류기가 실험 비디오에 대해 0.138 정도의 오분류율을 보임을 확인하였다.

Keywords:

Speech recognition
minimum distance classifier
speaker identification
Mixture model
Mel-frequency cepstrum
Mathematics

Correction
Source
Cite
Save
Machine Reading By IdeaReader

References

Citations