3. 과제 제출 템플릿
### 제출자 정보
이름: 이채규
학번: 울산대학교
팀명: ?
### 과제 수행 내용
1) 과제 선택 항목: - 스케일링 유무에 따른 로지스틱 회귀 성능 비교 (StandardScaler 적용 vs 미적용)
2) 수행 과정 설명:
- 표준화 삭제 전 과 후의 결과 비교 .
3) 코드 스니펫 / 결과 화면 캡처:
- === Performance Comparison (With vs. Without Scaling) ===
Scaled Model (표준화 적용)
ROC-AUC: 0.8002
PR-AUC: 0.6973
Unscaled Model (표준화 미적용)
ROC-AUC: 0.8002
PR-AUC: 0.6973
4) 분석 결과 요약:
- 표준화 적용 미적용의 결과가 같았음
### 추가 의견 (선택 사항)
왜 표준화 적용 미적용의 결과가 같을까요
.
### 제출자 정보
이름: 이채규
학번: 울산대학교
팀명: ?
### 과제 수행 내용
1) 임계값을 0.2~0.8 범위에서 0.05 간격으로 변경하며 Precision, Recall, F1 값을
표로 작성하기
2) 수행 과정 설명:
- 임계값을 0.2~0.8 범위에서 0.05 간격으로 변경
임계값과 재현율의 관계에 있어서 최적의 임계값을 찾는 것
3) 코드 스니펫 / 결과 화면 캡처:
=== Performance Metrics at Different Thresholds ===
Threshold Precision Recall F1-Score
0
0.20
0.1498 0.8872
0.2564
1
0.25
0.1699 0.8567
0.2836
2
0.30
0.1956 0.8049
0.3147
3
0.35
0.2228 0.7805
0.3466
4
0.40
0.2460 0.7409
0.3693
5
0.45
0.2759 0.7226
0.3993
6
0.50
0.3056 0.6951
0.4246
7
0.55
0.3456 0.6860
0.4597
8
0.60
0.4026 0.6677
0.5023
9
0.65
0.4801 0.6616
0.5564
10
0.70
0.6265 0.6341
0.6303
11
0.75
0.8777 0.6128
0.7217
12
0.80
0.9784 0.4146
0.5824
4) 분석 결과 요약:
- 임계값이 0.75 일떄 F1 score 가 가장 높았음 성능이 가장 좋은 값은 0.75
1. 실습 체크리스트
•
■ 데이터 로드 및 기본 확인 (shape, head, info)
•
■ 결측치 비율 확인 및 처리 (SimpleImputer 활용)
•
■ EDA: 분포 시각화 (sensor_1, sensor_2, sensor_3, Response)
•
■ 데이터 분리 (train/test, stratify 적용)
•
■ 전처리 파이프라인 구성 (수치형/범주형 처리)
•
■ 로지스틱 회귀(class_weight='balanced') 학습 및 평가
•
■ ROC-AUC, PR-AUC, Confusion Matrix, Classification report 확인
•
■ 임계값 튜닝 (F1 최적화)
•
☐ 랜덤포레스트(class_weight='balanced') 학습 및 평가
•
☐ 특성 중요도 확인 (상위 10 개 시각화)