산업 비전 프로젝트는 종종 “모델이 충분히 정확하지 않다”에서 멈춘다. 가끔은 네트워크 용량이나 조명이 한계다. 자주 학습 라벨이 일관되지 않다: 같은 결함 유형이 다른 박스 크기로 그려지고, 경계 마크가 월요일은 결함·화요일은 합격이거나, 두 어노테이터가 동일 이미지에 다른 규칙을 적용한다.
라벨 감사 사례와 조명 드리프트 메모는 관련 비전 고장 모드를 다룬다. 이 글은 모델 선택 전에 데이터 문제로 어노테이션 잡음과 합의에 초점을 둔다.
잡음이 성능을 막는 이유
지도 검출기·분류기는 보여 준 라벨 분포를 모방한다. 라벨이 모순된 사람 판단을 담으면, 학습 손실이 도달할 수 있는 최적은 절충이다—플랜트의 문서화된 품질 기준이 아니다. 같은 잡음 과정에서 뽑은 test split의 지표는 낙관적으로 보이면서 생산 불일치는 계속될 수 있다.

잡음을 줄이는 편집 관행
예시가 있는 문서화된 클래스 정의. 경계 사례는 작업 지침에 그림이 필요하다. 한 줄 클래스 이름만으로는 부족하다.
샘플에 대한 이중 어노테이션. 벤더 라벨링 작업을 키우기 전에 합의를 측정하라(단순 일치율이나 Cohen’s kappa 식 요약이라도). 낮은 합의는 정의가 미완임을 뜻한다.
동결된 gold set. 모델이 실패할 때마다 “고치지” 않는, 판정된 작은 이미지 세트를 둔다. 새 어노테이터가 들어올 때 정의 드리프트를 잡는 데 쓴다.
어려운 사례를 분리하라. 애매한 이미지는 동전 던지기 라벨로 train/test에 밀어 넣지 말고 검토 큐에 둔다.
하지 말 것
생산 거짓 거부를, 문서 기준을 갱신하지 않고 실패 이미지만 합격 클래스로 다시 라벨링해 “고치지” 말라. 그것은 모델에 어제의 편의에 맞추라고 가르친다. 두 엔지니어가 같은 방식으로 적용하지 않을 라벨의 데이터셋에서 architecture를 비교하지 말라.
비전 모델은 박스 뒤의 사람 규칙만큼만 일관된다. 규칙과 gold set를 먼저 정리하라. 그다음에야 backbone 선택이 최적화할 기반을 갖는다.
