대용량 데이터와 빠른 학습 속도를 위한
최첨단 머신러닝 알고리즘
LightGBM은 Gradient Boosting Decision Tree (GBDT) 프레임워크입니다. 전통적인 GBDT 방식은 모든 데이터와 피처를 탐색하므로 시간과 메모리 소모가 막대했습니다. LightGBM은 독창적인 기술인 Leaf-wise 성장, GOSS, EFB를 통해 정확도를 유지하면서 압도적인 속도와 효율성을 증명했습니다.
의사결정 트리 성장 방식 비교
수평적으로 자라는 전통적 알고리즘과 수직적으로 효율을 파고드는 LightGBM의 핵심적인 차이점을 시뮬레이션해 보세요.
컨트롤 타워
슬라이더를 조작하여 깊이(Depth)의 성장에 따른 노드 분할 과정을 시각적으로 비교해 보세요.
핵심 요약
**Level-wise**는 균형 잡힌 트리를 만들기 위해 동일 레벨의 모든 노드를 동시에 분할하지만 불필요한 연산이 늘어납니다. 반면 **Leaf-wise**는 최대 손실(Loss)을 줄일 수 있는 단 하나의 리프 노드만 골라 집중적으로 파고들기 때문에 자원이 대폭 절약됩니다.
균형 중심 성장 (Level-wise)
최대 깊이를 맞추기 위해 모든 형제 노드를 한 번에 평평하게 분할합니다. 불필요한 노드 생성과 학습 시간이 증가합니다.
손실 중심 성장 (Leaf-wise)
손실 값(Loss)이 가장 크게 떨어지는 노드 하나만 골라 수직으로 계속 확장합니다. 깊이가 깊어지며 오차가 급감합니다.
GOSS (Gradient-based One-Side Sampling)
그라디언트(오차) 크기를 기반으로 한 스마트 데이터 샘플링 원리
문제점: 일반 GBDT는 최적의 분할 지점을 찾기 위해 모든 데이터를 계산하여 병목이 발생합니다.
해결책 (GOSS): 오차가 큰 데이터는 모두 보존하고(더 배울 게 많으므로), 오차가 이미 작은 데이터는 무작위로 일부만 샘플링하여 연산량을 획기적으로 줄이되 정보 유실을 방지합니다.
EFB (Exclusive Feature Bundling)
상호 배타적 피처들을 묶어서 차원을 축소하는 혁신 기술
문제점: 원-핫 인코딩 등 희소(Sparse) 피처가 많아지면 무의미한 0 값이 가득 차 탐색에 비효율적입니다.
해결책 (EFB): 동시에 0이 아닌 값을 갖지 않는(상호 배타적인) 희소 피처들을 찾아 하나의 '피처 번들'로 병합하여 연산 피처 수를 압축합니다.
| 인덱스 | 피처 A (희소) | 피처 B (희소) | 병합된 번들 (EFB) |
|---|
LightGBM 하이퍼파라미터 및 결정 경계 시뮬레이터
인공적으로 설계된 2D 데이터 공간에서 하이퍼파라미터에 따라 트리 모델이 결정 경계(Decision Boundary)를 그리는 양상을 실시간 모의 학습으로 관찰합니다.
하이퍼파라미터 튜닝
학습 보폭 크기입니다. 너무 높으면 과적합, 낮으면 학습 속도가 느려집니다.
트리의 최대 세로 높이를 제한하여 과적합을 방지하는 중요 수치입니다.
LightGBM에서 깊이 조절보다 모델 복잡도를 강력히 통제하는 주 인자입니다.
리프 노드가 되기 위한 최소 데이터 크기입니다. 작으면 노이즈에 과대적합됩니다.
결정 영역 해석 팁 (Decision Boundary)
캔버스의 동그란 원형 포인트들은 저희가 설정한 가상의 이진 분류 데이터셋입니다. 배경 색상의 영역은 **LightGBM 의사결정 트리**들이 예측하는 클래스 영역을 나타냅니다.
- 파란색 점/영역 : 클래스 A 예측 영역
- 오렌지색 점/영역 : 클래스 B 예측 영역
- 배경 농도 : 예측 결과값에 따른 높은 확신 수준