research

통계적 사고와 ML 모델 지형도 — 학습 로드맵

통계적 사고와 ML 모델 지형도 — 학습 로드맵


## 통계적 사고란

수식을 외우는 것이 아니다. 두 가지 질문을 습관적으로 던지는 것이다.

- **"이 숫자가 우연일 수 있는가?"** — 숫자를 그냥 받아들이지 않고 의심하는 것
- **"이 숫자가 무엇을 대표하는가?"** — 평균이 충분한지, 분포가 어떻게 생겼는지

## 학습 순서

### 1단계 — 직관 먼저 (수식 전)

- **[StatQuest with Josh Starmer](https://www.youtube.com/@statquest)** (YouTube, 무료): 확률분포, 가설검정, 회귀를 그림으로 설명. 직관이 먼저 생긴다.
- **[Seeing Theory](https://seeing-theory.brown.edu)** (무료 인터랙티브): 분포와 확률을 시각적으로 이해.

### 2단계 — 수식과 연결

직관이 잡히면 수식이 "왜 이렇게 생겼는지"가 보인다.

- **Statistics** (Freedman, Pisani, Purves): 수식보다 개념 중심. 통계적 사고 기르기에 가장 좋은 교재.
- **MML (Mathematics for Machine Learning)**: ML과 직결되는 수학. 이미 공부 중인 것과 연결.

### 3단계 — ML과 연결

- **CS229** (Andrew Ng, Stanford, 무료): 손실함수가 왜 그 통계적 의미를 갖는지 수학적으로 연결.

## ML 모델 지형도

```
예측하려는 것이 연속값인가?  → Regression
예측하려는 것이 카테고리인가? → Classification
데이터 구조를 발견하고 싶은가? → Clustering / Dimensionality Reduction
순서가 있는 데이터인가?      → Time Series
```

오늘 쓴 sklearn은 주로 Regression/Classification 영역을 다룬다.

## 현재 수준 기반 권장 순서

```
1. StatQuest로 직관 쌓기
   → 오늘 나온 R², MAE, distribution shift가 왜 그렇게 되는지 이해

2. ML 수업 + 실제 데이터 실습 병행 (지금 하고 있는 것)
   → 모델 지형도 자연스럽게 쌓임

3. MML + CS229로 수학적 기반 보완
   → 이미 공부 시작했으니 경험과 연결
```

## 핵심 원칙

통계 교재만 읽어서는 통계적 사고가 잘 안 길러진다. 실제 데이터를 보면서 숫자에 질문을 던지는 습관이 핵심이다. 오늘처럼 데이터로 직접 부딪히면서 "왜?"를 묻는 것이 가장 빠른 방법이다.