데이터 분포 섹션 — 질문과 검증의 사슬
대질문: 회귀의 가정과 이 데이터는 얼마나 떨어져 있는가 — 그 거리를 어떻게 좁힐 것인가?
방법: 가정별로 거리를 측정 → 측정값이 임계값과 비교되어 전처리를 결정 (취향이 아니라 측정의 귀결)
공통 리듬
모든 소질문이 같은 4박자: 도구 → 실측 → 판정 기준 → 결정
Q1. store·item은 쓸 만한 신호인가, 얼마나 큰가? (입력 선택)
| 단계 | 내용 |
|---|
| 도구 | ANOVA F → (큰 표본 함정) → effect size η² |
| 실측 | F: 2,463 / 4,418 (p≈0, n=130K라 무정보) → η²: store 14.57% / item 62.49% |
| 판정 | Cohen ≥ 0.14 = LARGE — 둘 다 통과, item 4배 |
| 결정 | 둘 다 포함, item 주 신호 + joint η² 79.49% = 천장 (Stage 1 가설로 승격) |
Q2. 신호의 형태 — 합인가 조합인가? (표현 형태)
| 단계 | 내용 |
|---|
| 도구 | Interaction Ratio = Var(joint평균 − additive예측) / Var(joint평균) |
| 실측 | 28,450 = additive 27,582 (96.9%) + interaction 868 (3.1%) → IR 3.05% |
| 판정 | ≤ 5% = additive 충분 |
| 결정 | 곱셈항(500개) 불도입 — 이득 상한이 3% |
Q3. noise의 형태 — 등분산·정규 가정과 맞나? (변환 결정)
| 단계 | 내용 |
|---|
| 도구 | 그룹 μ vs σ의 Pearson r (+ CV 교차) |
| 실측 | r = +1.0000 (둘 다) · CV 0.47/0.29 상수 |
| 판정 | r ≈ 1 → σ∝μ → 곱셈 noise (y ≈ μ·ε) → 등분산 위반 |
| 결정 | log 변환 (곱→합) — Linear·SVR만, tree 제외(단조 불변). 사후: 잔차 skew +0.06 정규 회복 |
Q4. OneHot 표현이 수학적으로 안전한가? (인코딩 검증)
| 단계 | 내용 |
|---|
| 도구 | rank 검정 → drop='first' → VIF |
| 실측 | rank 59/60 (결손) → 58/58 (회복) → VIF max 1.96 |
| 판정 | Kutner 10의 1/5 — 잔여 공선성 무시 가능 |
| 결정 | OneHot + drop='first', 추가 조치 불필요 — 계수 해석 안정성 근거 |
산출물 (네 답의 합)
- 전처리 파이프라인: OneHot + drop='first' + log(Linear·SVR) + interaction 없음
- 천장 0.7949 — 측정이 가설이 된 지점
발표 한 줄: "가정마다 거리를 쟀고, 잰 값이 전처리를 정했고, 그 과정에서 천장이라는 가설까지 공짜로 얻었다."
예상 질문
- "순서가 왜 이렇게 되나?" → Q1(무엇을 넣나) → Q2(어떤 형태로) → Q3(target은 어떻게) → Q4(안전한가) — 입력 선택에서 검증으로 흐르는 자연 순서.
- "전부 임계값 기준 판정인데 임계값 근거는?" → Cohen(η²)·Kutner(VIF)는 문헌 표준, IR 5%는 자체 휴리스틱(명시) — 단 실측이 극단 구간(3.05%, 1.96, r=1.00)이라 임계값 민감도가 낮다.
- "σ-μ에서 r이 정확히 1.0000일 수 있나?" → 그룹 '평균 vs 표준편차' 10개·50개 점의 상관 — 판매량처럼 규모가 지배하는 데이터에서 거의 완전 비례가 나온다. 소수점 4자리 반올림 값.