ETRI-Knowledge Sharing Plaform

KOREAN
논문 검색
Type SCI
Year ~ Keyword

Detail

Conference Paper 텍스트 임베딩을 활용한 소량 샘플 기반 음성 명령어 인식 성능 개선
Cited - time in scopus Share share facebook twitter linkedin kakaostory
Authors
이재원, 김범휘, 이상범, 김광용, 정성문, 정호영
Issue Date
2026-06
Citation
한국통신학회 종합 학술 발표회 (하계) 2026, pp.1-2
Publisher
한국통신학회
Language
Korean
Type
Conference Paper
Abstract
본 연구는 조용한 환경에서 녹음된 clean set 으로 학습된 음성 명령어 인식 모델을 실제 수술실 환경에서 마스크를 착용하고 녹음한 target set 에 적용할 때 발생하는 성능 저하를 완화하기 위해, 텍스트 임베딩 기반 소량 샘플 타겟 적응 방법의 적용 가능성을 검토하였다. 두 데이터셋은 동일한 명령어 체계를 공유하지만, target set 은 수술실 배경 잡음, 마스크 착용에 따른 음성 감쇠 및 녹음 환경 차이를 포함한다. 본 연구에서는 clean set 으로 사전 학습된 acoustic encoder 를 target set 에 직접 적용한 결과를 baseline 으로 설정하고, target set 에서 명령어당 1 개, 5 개의 샘플만을 사용하여 few-shot adaptation 을 수행하였다. 적응 과정에서는 condition-related layer 를 제한적으로 업데이트하고, target sample 의 acoustic prototype 을 text embedding 과 결합하여 label embedding 을 보정하였다. 이후 적응된 acoustic encoder 를 feature extractor 로 사용하고, neural network classifier 를 추가하여 softmax 기반으로 최종 명령어를 분류하였다. 실험 결과, 제안한 소량 샘플 타겟 적응 방식은 baseline 대비 target set 인식 성능을 개선하였다. 이는 실제 수술실과 같이 데이터 수집이 제한적인 음성 명령어 환경에서 소량의 target sample 만으로도 빠른 모델 적응이 가능함을 시사한다.
KSP Keywords
Acoustic encoder, Feature extractor, Label embedding, Neural Network Classifier, Target set, Text embedding