Training–serving skew는 학습과 라이브 파이프라인이 서로 다른 피처를 계산할 때다. 점수 교정 드리프트는 기저율이 바뀐 뒤 확률이 결과와 더 이상 맞지 않을 때다. 개념 드리프트(그리고 관련 입력 분포의 covariate shift)는 관계—또는 입력 자체—가 움직이는 동안 모델 아티팩트가 동결된 채 남을 때다.
라벨 노이즈와 prediction-interval 메모는 다른 AI 고장 모드에 속한다. 이 글은 라이브 세계가 학습 분포를 떠났음을 감지하는 것에 관한 것이다.
플랜트에서 움직이는 것
용융지수가 더 넓은 수지 로트. 새 코팅 두께. 5도 재교정된 열전대. 건조 오븐의 계절 습도 스윙. 어느 것도 악의적 행위자가 필요 없다. 피처와 품질의 결합 분포를 바꾼다. 지난 분기에 학습된 모델은 이동한 매니폴드 위에서 자신 있는 점수를 계속 낸다.

값을 하는 모니터
핵심 피처의 모집단 통계(평균·분위수·결측)를 동결된 학습 참조 창과 대조해 추적하라. 자동 수락 생산만이 아니라, 작고 정기적으로 라벨링된 hold 샘플에서 잔차·오차율을 추적하라. “스크랩이 튀어서 재학습”하기 전에 지속 발산에 경보하라. 센서 고장(한 태그 깨짐)과 진짜 공정 이동(관련 피처가 함께 움직임)을 구분하라.
하지 말 것
아무 것도 울리지 않을 때까지 임계값을 넓혀 드리프트 경보를 끄지 마라. 옛 개념을 왜 폐기하는지 적은 MoC 없이, 오염된 라벨의 지난 주로 재학습하지 마라. 하루짜리 이상치 캠페인을 새 정상 상태와 혼동하지 마라.
피처는 여전히 오고 모델은 여전히 점수를 내면, 플랜트는 자동화된 듯 보이면서 조언은 조용히 어제를 말한다. 입력과 잔차를 본 뒤 동결·재교정·재학습을 결정하라.
