ETRI-Knowledge Sharing Plaform

KOREAN
논문 검색
Type SCI
Year ~ Keyword

Detail

Conference Paper Lustre 기반 데이터 레이크의 저장·분산 단위 및 병렬도에 따른 성능 분석 및 최적화 연구
Cited - time in scopus Share share facebook twitter linkedin kakaostory
Authors
김휘, 강조현, 이계선, 강호용
Issue Date
2026-05
Citation
한국산업정보학회 학술 대회 (춘계) 2026, pp.1-1
Publisher
한국산업정보학회
Language
Korean
Type
Conference Paper
Abstract
최근 데이터 폭증과 함께 인공지능·시뮬레이션·고성능 컴퓨팅(HPC) 기반 워크로드가 확산 되면서, 대규모 비정형 데이터를 유연하게 저장하고 고속으로 처리할 수 있는 데이터레이크 (DLK) 아키텍처의 중요성이 크게 부각되고 있다. 특히 병렬 I/O 처리와 확장성이 뛰어난 Lustre 와 같은 분산 파일 시스템은 데이터레이크 인프라의 핵심 기술로 자리 잡고 있으나, 실제 성능 은 저장 구조(HDF5 Chunk), 분산 단위(Stripe), 그리고 병렬 처리 수준 간의 상호작용에 크게 의존하며, 비최적화된 설정은 오히려 I/O 병목과 자원 낭비를 초래할 수 있다. 이러한 배경에서 본 연구는 동일 사양의 서버 2대를 활용하여 Lustre 기반 데이터레이크 성능 시험 환경을 구축 하고, 서버 1에는 MDS와 OSS를, 서버 2에는 OSS를 구성하여 클러스터 파라미터 변화에 따른 성능 영향을 체계적으로 분석하였다. 우선, HDF5의 Chunk 크기와 Lustre의 Stripe 크기 간 관 계에 따른 I/O 성능을 분석한 결과, 두 단위가 일치할 경우 데이터 분산 및 접근 효율이 극대화 되어 전반적인 성능 향상이 확인되었으며, 일부 경우에는 Chunk가 Stripe보다 소폭 작은 설정에 서 가장 높은 성능 향상이 나타나 추가적인 원인 분석의 필요성이 도출되었다. 이어서 성능이 우수한 구성을 기준으로 병렬도 변화에 따른 성능 특성을 분석한 결과, 병렬도 증가에 따라 처 리 성능이 향상되는 경향을 보였으나, CPU 코어 수를 초과하는 경우 자원 경합 및 스케줄링 오 버헤드 증가로 인해 성능 저하가 발생하는 것이 확인되었다. 이러한 결과를 통해 데이터레이크 환경에서 최적의 성능을 확보하기 위해서는 저장 단위 간 정합성과 함께 시스템 자원 한계를 고 려한 병렬도 설정이 핵심 요소임을 확인하였으며, 이는 향후 다양한 워크로드 환경에서 적용할 수 있는 실질적인 성능 최적화 기준으로 활용될 수 있다.
Keyword
데이터 레이크, Lustre, 병렬 처리, 최적화