dataforge.ai.kr

📚 가이드·아티클

DataForge 도구 사용법과 데이터 분석·머신러닝 개념을 글로 정리했습니다.

도구 사용 가이드

/mfg · /biz · /ads · /text 🏭 실습용 데이터 생성기 사용법 제조·경영·광고·텍스트 데이터를 원하는 조건으로 즉시 만드는 법 /prep/missing 🔍 결측치·이상치 시뮬레이터 사용법 빠진 값과 튀는 값이 어떤 모양으로 나타나는지 직접 만들어보며 익히기 /prep/interpolate 🔧 CSV 보간·병합 사용법 진짜 데이터의 결측을 8가지 방법으로 채우고, 여러 파일을 합치기 /prep/edit ✂️ CSV 편집 도구 사용법 빈 행 삭제·값 필터·날짜 분리·데이터 차분을 브라우저에서 바로 /sim/ml 🤖 머신러닝 시뮬레이션 사용법 K-Means부터 XGBoost까지, 코드 없이 값을 바꿔가며 원리 관찰 /sim/deep 🧠 딥러닝 시뮬레이션 사용법 뉴런·신경망 구조·경사하강·하이퍼파라미터·과적합을 눈으로 확인 /prep/normalize ⚖️ 정규화·표준화 사용법 스케일이 다른 변수를 같은 눈금으로 — Min-Max와 Z-score 고르는 법 /prep/onehot 🔢 원-핫 인코딩 사용법 문자(범주) 데이터를 모델이 읽을 수 있는 숫자로 바꾸기 /prep/split 🪓 데이터 분할 도구 사용법 학습·테스트 세트를 올바르게 나누기 — 누수 없는 분할의 시작 /sim/timeseries 📈 시계열 분석 시뮬레이터 사용법 추세·계절성·예측을 값을 바꿔가며 눈으로 확인

개념 아티클

모델 평가 📉 정확도 98%의 함정 불량 121개 중 110개를 놓친 모델 이야기 — 혼동행렬과 불균형 데이터 데이터 분할 🕳️ AUC 0.987은 축하가 아니라 경고다 시험 문제를 미리 본 학생 — 데이터 누수가 점수를 부풀리는 구조 상관관계 🔗 상관계수가 같아도 데이터는 다르다 앤스콤 4중주와 심슨의 역설 — 요약 통계가 감추는 것들 불균형 데이터 🧪 없는 불량 17,272개를 지어냈다 SMOTE와 리샘플링의 대가 — 재현율을 올리면 무엇을 잃는가