projects
평가지표 선정 — R²·SMAPE 채택, MAE·RMSE 배제
대질문: 같은 예측을 채점하는 자가 4개 있다 — 어느 자가 이 과제의 질문에 맞는가? | 지표 | 식 | 단위 | 성질 | |:---|:---|:---:|:---| | MAE | | 개수 | 오차 평균 크기,…
데이터 분포 축 — 교과서 + history 통합 노트
의 4개 질문을, 교과서 개념을 먼저 깔고 우리가 밟은 절차의 history를 얹는 식으로 확장한 노트. --- 그룹 간 평균 비교의 출발점은 t-test — 평균 차이를 표준오차로 나눈 통계량이 t분포를 따른다는…
ANOVA F-test — 그룹 평균의 차이가 우연인지 가려내는 검정
한 줄: 그룹 사이의 차이가, 그룹 안의 우연한 출렁임에 비해 충분히 큰가? — 이 비율 하나로 검정한다. store가 10개 있다. 각 store의 주간 판매 평균이 조금씩 다르다. 이게 진짜 차이(store마다…
Capacity 판별 — 모델 탓인가 문제지 탓인가 (Δ_cap + RESET)
대질문: Stage 1이 0.79에 멈췄다 — 모델의 표현력 한계인가, 입력의 정보 한계인가? 같은 성능표를 두고 처방이 정반대로 갈리는 질문. Wooldridge 가정 체계의 MLR.1 = "모델 형태가 옳다".…
데이터 분포 섹션 — 질문과 검증의 사슬
대질문: 회귀의 가정과 이 데이터는 얼마나 떨어져 있는가 — 그 거리를 어떻게 좁힐 것인가? 방법: 가정별로 거리를 측정 → 측정값이 임계값과 비교되어 전처리를 결정 (취향이 아니라 측정의 귀결) 모든 소질문이…
평가 정직성 축 — 교과서 + history 통합 노트
의 4개 질문을 교과서 개념 + 우리가 밟은 절차의 history로 확장한 노트. --- 알고 싶은 것은 train 점수가 아니라 "본 적 없는 데이터에서 몇 점일 것인가"(일반화). train 점수는 체계적으로…
주간 reframing — 분석 단위를 바꾼다는 것 (CLT와 합의 분산)
대질문: 분석 단위를 무엇으로 할 것인가 — 일별 그대로? 주간 합? 합산은 데이터에 무엇을 하는가? 주간 집계는 행 수를 1/7로 줄이는 사무 작업이 아니라 분포의 성질을 바꾸는 변환. 근거는…
Effect size와 η² — 얼마나 큰가를 재는 법
한 줄: p는 존재("0이 아닌가"), effect size는 크기("얼마나"). n을 늘리면 p는 0으로 가지만 effect size는 참값으로 수렴할 뿐이다. 효과의 크기를 표본 크기와 무관하게 재는 표준화…
오차 해부 섹션 (Stage 3) — 질문과 검증의 사슬
대질문: 남은 오차 1.4%는 왜 안 줄어드는가 — 자원의 문제인가, 정보의 문제인가? 배경: 자원(데이터·연산·튜닝)을 더 부으면 줄어드는 오차와, 입력에 정보가 없어서 못 줄이는 오차는 처방이 다르다. 진단…
평가 정직성 섹션 — 질문과 검증의 사슬
대질문: 측정된 성능이 실전에서 재현될 점수라는 걸 어떻게 보장하는가? 배경: 시계열 평가의 흔한 방법들은 미래를 미리 보거나(누수), 시험을 한 번만 본다(운). 점수는 항상 나온다 — 믿을 수 있는지가 문제.…
시간 의존성 축 — 교과서 + history 통합 노트
의 4개 질문을 교과서 개념 + 우리가 밟은 절차의 history로 확장한 노트. | 약자 | Full name | 한국어 | |:---|:---|:---| | ACF | Autocorrelation…
오차 해부 축 (Stage 3) — 교과서 + history 통합 노트
의 4개 질문을 교과서 개념 + 우리가 밟은 절차의 history로 확장한 노트. --- Bias²: 학습을 반복해 평균을 내도 남는 체계적 빗나감 — "모델이 닿지 못하는 거리" Variance: 학습 데이터가…
모델 4종 — 답을 만드는 네 가지 방식
넷은 무작위 선택이 아니라 "답을 만드는 방식"의 사분면: 전역 함수형(Linear, SVR) vs 공간 분할형(RF, HGB), 분할형 안에서 평균(RF) vs 잔차 보정(HGB). 체질이 정반대인 모델들이…
시간 의존성 섹션 — 질문과 검증의 사슬
대질문: 시간 정보를 입력으로 만들면 얼마나 좋아지는가 — 그리고 그 한계는 어디인가? 배경: 회귀 모델에게 각 행은 순서가 섞인 카드 — 시간을 스스로 못 쓰므로, 우리가 컬럼으로 만들어 줘야 한다. | 단계 |…