XGBoost를 관통하는 핵심 알고리즘 원리
1. 순차 가산 모델(Additive)
나무를 한 번에 다 만들지 않습니다. 이전 나무까지 구한 예측 오차(잔차)를 다음 나무가 전달받아, 징검다리를 놓듯 단계적으로 메꿔갑니다.
2. 맞춤형 목적 함수
합격 확률을 맞추는 이진 분류(Log-Loss)와 실제 시험 점수를 맞추는 선형 회귀(MSE)에 따라 손실 곡선의 기울기(Gradient)가 수학적으로 전환됩니다.
3. 리프 규제 가중치
특정 노드가 오차를 무리해서 전부 책임지지 않도록, 가중치 계산 분모에 L2 규제항 \(\lambda\)를 더하여 극단적인 모델 성장(과적합)을 방어합니다.
XGBoost 하이퍼파라미터 설정
학습 데이터 및 실시간 잔차(Residual) 추적 테이블
Base Score: 0.5
우측 '실제값(y)'과 '현재 모델 예측값(\(\hat{y}\))' 사이의 차이가 바로 **잔차(Residual = \(y - \hat{y}\))**입니다.
새로운 나무는 이전 단계까지 누적 예측을 완료한 후, 남은 잔차를 완벽히 메꾸는 방향으로 계산을 시작합니다.
| ID | 📚 공부 시간 (h) | 💤 수면 시간 (h) | 🎯 출석률 (%) | 실제값 (y) | 최종 모델 예측값 (\(\hat{y}\)) | 최종 잔차 (Residual) |
|---|
부스팅 학습 체인 (각 트리들의 상세 기여도)
각 나무는 독립적이지 않으며 앞선 나무들의 오류(잔차)를 차례대로 물려받아 성장합니다.
나무를 클릭하여 각 나무가 어떤 feature와 오차 가중치를 이용해 학습되었는지 내부 구조와 가중치 수식을 검사해보세요.
XGBoost 트리 #1 상세 분석
이번 트리 학습에 사용된 입력 '잔차'
앞선 나무들이 해결하지 못한 잔차(Residual)가 본 트리의 타겟값(\(g_i\))이 됩니다.
| ID | 공부 | 수면 | 출석 | 입력 잔차(오차) |
|---|
실시간 아디티브(Additive) 예측 시뮬레이터
가상의 학생 데이터를 변경하면, 각 트리가 예측한 보정치들을 순서대로 통과하며 최종 예측치를 점진적으로 보정하는 과정을 보여줍니다.
테스트할 가상 학생 프로필
부스팅 예측 누적 연산 흐름
\(\sigma(F(X)) = \frac{1}{1 + e^{-F(X)}}\) 로 변환한 최종 확률입니다.