← DataForge 홈
🌳

LightGBM 시뮬레이터

리프 중심 성장과 GOSS·EFB를 실시간으로 실험합니다

What is LightGBM?

대용량 데이터와 빠른 학습 속도를 위한 최첨단 머신러닝 알고리즘

LightGBM은 Gradient Boosting Decision Tree (GBDT) 프레임워크입니다. 전통적인 GBDT 방식은 모든 데이터와 피처를 탐색하므로 시간과 메모리 소모가 막대했습니다. LightGBM은 독창적인 기술인 Leaf-wise 성장, GOSS, EFB를 통해 정확도를 유지하면서 압도적인 속도와 효율성을 증명했습니다.

10x+
XGBoost 대비 빠른 학습속도
Low
극도로 낮은 메모리 사용량
Leaf-Wise
최대 손실(Loss) 감소 리프 우선 탐색
GPU
대규모 데이터 가속 지원
Key Distinction 01

의사결정 트리 성장 방식 비교

수평적으로 자라는 전통적 알고리즘과 수직적으로 효율을 파고드는 LightGBM의 핵심적인 차이점을 시뮬레이션해 보세요.

컨트롤 타워

슬라이더를 조작하여 깊이(Depth)의 성장에 따른 노드 분할 과정을 시각적으로 비교해 보세요.

초기 분할 단계 2 단계 3 단계 4 최종 트리
핵심 요약

**Level-wise**는 균형 잡힌 트리를 만들기 위해 동일 레벨의 모든 노드를 동시에 분할하지만 불필요한 연산이 늘어납니다. 반면 **Leaf-wise**는 최대 손실(Loss)을 줄일 수 있는 단 하나의 리프 노드만 골라 집중적으로 파고들기 때문에 자원이 대폭 절약됩니다.

전통적인 GBDT 방식 Level-Wise (수평)

균형 중심 성장 (Level-wise)

최대 깊이를 맞추기 위해 모든 형제 노드를 한 번에 평평하게 분할합니다. 불필요한 노드 생성과 학습 시간이 증가합니다.

LightGBM 독창적 방식 Leaf-Wise (수직)

손실 중심 성장 (Leaf-wise)

손실 값(Loss)이 가장 크게 떨어지는 노드 하나만 골라 수직으로 계속 확장합니다. 깊이가 깊어지며 오차가 급감합니다.

Tech 01

GOSS (Gradient-based One-Side Sampling)

그라디언트(오차) 크기를 기반으로 한 스마트 데이터 샘플링 원리

문제점: 일반 GBDT는 최적의 분할 지점을 찾기 위해 모든 데이터를 계산하여 병목이 발생합니다.

해결책 (GOSS): 오차가 큰 데이터는 모두 보존하고(더 배울 게 많으므로), 오차가 이미 작은 데이터는 무작위로 일부만 샘플링하여 연산량을 획기적으로 줄이되 정보 유실을 방지합니다.

전체 데이터 수: 15개
큰 오차 (학습 대상 100% 보존)
작은 오차 (가중치 보정 후 무작위 샘플링)
오차가 작은 샘플들에 가중치(Weight)를 곱하여 데이터 왜곡 없이 고성능 트리를 완성합니다.
Tech 02

EFB (Exclusive Feature Bundling)

상호 배타적 피처들을 묶어서 차원을 축소하는 혁신 기술

문제점: 원-핫 인코딩 등 희소(Sparse) 피처가 많아지면 무의미한 0 값이 가득 차 탐색에 비효율적입니다.

해결책 (EFB): 동시에 0이 아닌 값을 갖지 않는(상호 배타적인) 희소 피처들을 찾아 하나의 '피처 번들'로 병합하여 연산 피처 수를 압축합니다.

희소 피처 테이블 (피처 A, 피처 B)
인덱스 피처 A (희소) 피처 B (희소) 병합된 번들 (EFB)
각 피처마다 고유한 **오프셋(Offset)**을 부여하여 병합 시 값이 중첩되거나 소실되지 않도록 정밀 제어합니다.
Playground

LightGBM 하이퍼파라미터 및 결정 경계 시뮬레이터

인공적으로 설계된 2D 데이터 공간에서 하이퍼파라미터에 따라 트리 모델이 결정 경계(Decision Boundary)를 그리는 양상을 실시간 모의 학습으로 관찰합니다.

하이퍼파라미터 튜닝

0.10

학습 보폭 크기입니다. 너무 높으면 과적합, 낮으면 학습 속도가 느려집니다.

4

트리의 최대 세로 높이를 제한하여 과적합을 방지하는 중요 수치입니다.

15

LightGBM에서 깊이 조절보다 모델 복잡도를 강력히 통제하는 주 인자입니다.

3

리프 노드가 되기 위한 최소 데이터 크기입니다. 작으면 노이즈에 과대적합됩니다.

현재 트리 학습 횟수
0
학습 오차 (Loss)
N/A
정확도 (Accuracy)
0.0%

결정 영역 해석 팁 (Decision Boundary)

캔버스의 동그란 원형 포인트들은 저희가 설정한 가상의 이진 분류 데이터셋입니다. 배경 색상의 영역은 **LightGBM 의사결정 트리**들이 예측하는 클래스 영역을 나타냅니다.

  • 파란색 점/영역 : 클래스 A 예측 영역
  • 오렌지색 점/영역 : 클래스 B 예측 영역
  • 배경 농도 : 예측 결과값에 따른 높은 확신 수준
**실험하기**: [트레이닝] 버튼을 여러 번 연속적으로 눌러 보시면서 트리가 세부적으로 분할 영역을 정교화해 가는지 확인해 보세요!

자주 묻는 질문 (FAQ)

Q. Leaf-wise 성장은 과적합(Overfitting)에 취약한가요?

네, 맞습니다. Leaf-wise는 최대 손실이 낮아지는 쪽으로만 계속 집요하게 분할하기 때문에 깊이가 매우 깊어져 국소 데이터 그룹에 쉽게 과적합될 수 있습니다. 따라서 `max_depth`를 명시적으로 조절하거나 리프의 개수를 통제하는 `num_leaves`, `min_data_in_leaf` 파라미터 튜닝이 필수적입니다.

Q. GOSS에서 가중치를 곱하는 이유는 무엇인가요?

샘플링을 통해 많은 저오차 데이터를 탈락시키면 남은 소수의 저오차 데이터만으로는 원래 전체 데이터의 성격을 대표하지 못합니다. 따라서 오차가 작은 일부 데이터에 가중치($\frac{1-a}{b}$ 형태의 스케일러)를 부여하여 통계적으로 일관성 있는 분포 상태를 유지하도록 학습률을 보호합니다.