4.0 Learning Model
PAC learning model, SQ lower bound 등
4.0 Learning Model
4.1 Optimization
4.1 Optimization
4.1.1 Weight Initialization
모델 구조에 따라 다르지만, rotational invariant나 permutation invariant한 경우들이 있어 초기 가중치를 랜덤하게 설정하지 않으면 가중치 업데이트가 모든 노드에서 동일하게 진행됨.
학습 방식에 따라 초기 가중치가 gradient vanishing(또는 exploding)에 기여할 수 있음.
4.2 지도 학습
4.2 지도 학습
4.3 준지도 학습
4.4 비지도 학습
4.4.1 Masked Language Model(MLM)
4.4.2 Next Sentence Prediction(NSP)
4.5 Fine-Tuning