ML 문제 정의 프레임워크 — 목적 → 손실함수 → 모델
## 핵심 원리
모델 선택은 모델에서 시작하는 게 아니다. 항상 이 순서로 생각해야 한다.
```
목적 (What do I want?)
↓
손실함수 (What does "wrong" cost?)
↓
모델 (What minimizes that cost?)
```
목적이 바뀌면 손실함수가 바뀌고, 손실함수가 바뀌면 모델이 바뀐다.
## 판매량 예측 케이스에서의 전환
| 목적 | 손실함수 | 모델 |
|------|---------|------|
| 평균 판매량 예측 | MAE / MSE | 일반 Regression |
| 재고 상한선 준비 | Pinball Loss (분위 손실) | Quantile Regression |
| 대량 주문 발생 여부 | Cross Entropy | Classification |
Quantile Regression으로 전환한 기준: **"틀렸을 때 어느 방향으로 틀리는 게 더 비싼가"**를 물었을 때 답이 달라졌기 때문이다.
- 과소예측(재고 부족) >> 과대예측(재고 과잉) 비용 → 상위 분위수 예측 필요 → Quantile Regression
## 핵심 질문
새 문제를 만날 때마다 물어야 하는 것:
1. 예측이 틀렸을 때 어느 방향의 오차가 더 비싼가?
2. 단일 숫자가 필요한가, 구간이 필요한가?
3. 절대적인 오차가 중요한가, 상대적인 오차가 중요한가?
이 질문들의 답이 손실함수를 결정하고, 손실함수가 모델을 결정한다.
## 주요 손실함수와 모델
| 손실함수 | 최적화 결과 | 모델 |
|---------|-----------|------|
| MSE | 조건부 평균 | Linear Regression, 대부분 Regression |
| MAE | 조건부 중앙값 | HuberRegressor, MAE 기반 모델 |
| Pinball Loss (τ=0.9) | 90th percentile | Quantile Regression |
| Cross Entropy | 클래스 확률 | Logistic Regression, 분류 모델 |
## 학습 자료
- **Hands-On Machine Learning** (Aurélien Géron): 문제 유형별 모델 선택 기준, 실습 중심. 현재 수준에 가장 적합.
- **CS229** (Andrew Ng, Stanford, 무료): 손실함수와 모델의 수학적 연결을 체계적으로 다룸. 수식이 익숙해지면 가장 근본적인 이해를 줌.
- **The Elements of Statistical Learning** (Hastie et al.): 더 깊은 이론. 나중 단계.