본문으로 건너뛰기

DCASE 2026 기계 이상음 탐지, 올해 과제는 현장 소음

산업 운영 노트 특별편: 기계 이상음 탐지 연구 동향

기계 소리로 이상 징후를 찾는 연구 챌린지 DCASE Task 2가 2026년 과제의 초점을 현장 소음에 맞췄습니다. 대상 기계 가까이와 멀리에서 동시에 녹음한 2채널 소리를 제공하고, 정상음만으로 학습해 소음 속에서도 이상을 가려내게 한 것이 올해의 변화입니다.

이 글은 2026년 9월 12일 현재 공개된 DCASE 2026 과제 페이지와 공식 결과표, 과제 개요 논문(arXiv 2606.01578 v1)을 기준으로 작성했습니다.

공장 회전 설비 옆에 고정된 기계 이상음 탐지용 산업 마이크

기계 이상음 탐지 연구를 설명하기 위한 연출 이미지입니다. 실제 DCASE 데이터 녹음 현장이나 특정 제품을 보여 주지 않습니다.

올해 과제: 소음 인지형 비지도 이상음 탐지

2026년 Task 2의 공식 과제명은 Noise-aware Unsupervised Anomalous Sound Detection for Machine Condition Monitoring입니다. 과제 설명은 2월 1일, 세부 과제는 4월 1일에 공개됐습니다(DCASE 2026 과제 페이지). 비지도 설정이라 학습에는 정상 기계 소리만 주어지고, 참가 시스템은 이상음을 한 번도 듣지 않은 채 이상을 찾아야 합니다.

주최 측은 개요 논문에서 기존 설정에 환경 소음 정보가 제한적이어서 소음이 큰 환경에서는 성능이 떨어질 수 있었다고 설명합니다. 실제 현장에는 소음원이 여럿 있으므로 소음이 큰 조건에서 이상음을 찾는 일이 중요하다는 것이 올해 과제의 문제의식입니다(arXiv 2606.01578). 과제는 Hitachi, NTT, SB Intuitions, 교토대 연구자들이 주최했습니다.

가까운 마이크와 먼 마이크

올해 데이터는 대상 기계 가까운 위치(채널 1)와 먼 위치(채널 2)에서 동시에 녹음한 2채널 오디오입니다. 먼 마이크에는 환경 소음이 상대적으로 강하고 기계 직접음은 약하게 담깁니다. 두 채널을 비교하면 환경 소음과 기계 소리를 구분하는 단서를 얻을 수 있습니다.

일부 데이터는 에뮬레이션(Emu)으로 만들었습니다. 기계 위치와 스피커 위치에서 두 마이크까지의 임펄스 응답을 측정하고, 미리 녹음한 기계 소리와 환경 소음에 합성해 2채널 오디오를 만드는 방식입니다. 데이터 구성은 MIMII, ToyADMOS, MIMII DG, ToyADMOS2 등 이전 DCASE 데이터셋을 참조했습니다.

개발 세트에는 fan, gearbox(Emu), bearing(Emu), slide rail(Emu), ToyCar(Emu), ToyCar, valve(Emu) 7종이 들어 있습니다. 평가용 기계는 5월 15일에 따로 공개됐고 ToyDrone, ToothBrush, SewingMachine, Sander, BlowerDustCollector 등이 포함됐습니다. 클립 길이는 10-12초이고, 기계마다 학습용 정상음은 소스 도메인 990개와 운전 조건이 바뀐 타깃 도메인 10개입니다.

과제 페이지가 제시한 요구사항은 다섯 가지입니다.

  • 정상음만으로 학습합니다.
  • 운전 조건이 바뀌는 도메인 이동에 대응합니다.
  • 처음 보는 기계 종류에도 일반화합니다.
  • 기계 속성 정보가 있을 때와 없을 때 모두 동작합니다.
  • 2채널 녹음을 활용합니다.

2020년부터 이어진 과제의 흐름

Task 2는 현장에서 부딪히는 조건을 차례로 과제에 더해 왔습니다. 운전 조건 변화와 새 기계 종류에 이어 올해는 주변 소음이 들어왔습니다.

연도 과제의 초점
2020 비지도 이상음 탐지 도입
2021 도메인 이동(운전 조건 변화)
2022 도메인 일반화
2023-2025 first-shot: 처음 보는 기계 종류, 테스트 데이터에 기댄 튜닝 금지
2026 소음 인지: 가까운 마이크와 먼 마이크 2채널

자료: DCASE 2026 Task 2 개요 논문(arXiv 2606.01578, 2026년 6월 1일)

결과: 50여 개 팀, 170여 개 시스템

평가 데이터는 6월 1일에 공개됐고, 제출은 6월 15일에 마감됐으며, 결과는 6월 30일에 발표됐습니다. 공식 결과표에는 50여 개 팀이 낸 170여 개 시스템이 올랐습니다(공식 결과 페이지).

공식 점수는 전체 도메인의 AUC와 오경보율 0-0.1 구간의 pAUC를 모든 기계 종류에 걸쳐 조화평균한 값입니다. 베이스라인은 로그 멜 스펙트로그램을 입력으로 받는 오토인코더의 재구성 오차(MSE) 방식과 마할라노비스 거리 방식 두 가지로, 공식 점수는 각각 59.80과 54.76입니다. 최고 점수는 MERL의 시스템(Fujimura_MERL_task2_3)이 기록한 70.24입니다.

MSE 베이스라인의 시스템 순위는 68위였습니다. 베이스라인보다 낮은 점수를 받은 시스템도 많았다는 뜻이고, 올해 과제의 난도가 높았다는 점을 보여 줍니다. 이 점수는 벤치마크 데이터로 계산한 순위용 지표이며 실제 현장의 검출률이 아닙니다.

방법론 흐름: 사전학습 오디오 모델

결과 페이지의 시스템 특성표는 참가 팀이 스스로 기재한 정보입니다. 이 표에 따르면 1위 시스템은 사전학습 오디오 모델(BEATs) 임베딩과 mixup 증강을 썼습니다. 다른 참가 시스템에서도 BEATs, EAT, CED 같은 사전학습 모델 임베딩에 kNN 등 거리 기반 판정을 조합한 경우가 자주 보입니다.

자가 기재 정보라 정확한 비율을 말하기는 어렵습니다. 다만 대규모 오디오로 미리 학습한 모델을 특징 추출기로 쓰는 경향은 읽을 수 있습니다. 개요 논문 v1에는 결과가 없고, 결과와 분석은 제출 마감 후에 추가할 예정이라고 밝혀 두었습니다. 주최 측의 공식 해석은 개정판이나 워크숍 발표에서 확인해야 합니다.

소리 기반 설비 모니터링을 검토할 때 확인할 것

챌린지의 과제 설계는 현장 도입을 검토할 때 던질 질문과 겹칩니다.

  • 정상음을 어떤 운전 조건에서 모았는지 기록하고, 조건이 바뀌면 다시 확인할 계획을 세웁니다.
  • 운전 조건이 바뀐 뒤 확보할 수 있는 정상 데이터가 적을 때 어떻게 대응할지 정합니다.
  • 마이크 위치와 주변 소음원을 함께 기록합니다. 기계 가까운 위치와 떨어진 위치의 소리 차이도 확인합니다.
  • 평가 지표가 오경보가 적은 구간의 성능을 따로 보는지 확인합니다.
  • 설비 종류가 늘어날 때 같은 방식을 그대로 쓸 수 있는지, 설비별 조정이 필요한지 따져 봅니다.
  • 벤치마크 점수를 현장 검출률로 읽지 않고, 자기 설비 데이터로 다시 검증합니다.

정리

2026년 Task 2는 비지도 기계 이상음 탐지 연구가 현장 소음을 정면으로 다루기 시작했다는 신호입니다. 10월 27일 MIT에서 응용 및 산업 연구 워크숍(AIR), 10월 28-29일 Tufts University에서 본 워크숍이 미국 보스턴에서 열릴 예정이므로(DCASE 2026 워크숍), 결과 해석은 그 발표와, 개정판이 나온다면 개요 논문 개정판까지 함께 보는 편이 정확합니다. 과제 규칙과 점수는 DCASE 2026 공식 페이지에서 확인할 수 있습니다.

연구 과제가 소음을 다루듯 현장 모니터링도 주변 소음과 운전 조건 변화를 전제로 설계해야 합니다. 소리, 진동, 환경 신호로 설비 상태를 상시 모니터링하는 도구도 같은 조건에서 검토해야 하며, XyloZero도 이런 도구에 속합니다.

운영 노트 3편 설비 진단, 소리와 진동의 선택 기준에서 소리와 진동 신호의 기초를 다뤘습니다.

참고한 공식 자료

작성자 자일로랩스게시일
공유

← 블로그 목록