https://github.com/7hjchung-tech/deepCANCERsite
(regarding concatenation method)
deepRAD51C — Two-stage Tokenization & Fusion 설계 및 실행 계획
먼저 Stage 1 동결 상태에서 Stage 2 학습. 최종 출력과 실제 z-score 사이에 loss를 걸고(사실상 stage1이 예측한 이후 잔차로 loss), Stage 2 마지막 출력층을 0으로 initialize하면 시작점이 Stage 1 예측과 같음.
그 checkpoint에서 ESM은 동결한 채, Stage 1의 작은 tokenizer/head만 풀어 공동 미세조정. 기존 모듈에는 새 모듈보다 작은 learning rate를 주고, 같은 validation split에서 동결 모델과 비교.
구조 없이 Stage 1만 추가 학습하는 대조군도 비교. 그래야 개선이 구조 정보 때문인지, 단순히 추가 학습 때문인지 구분할 수 있음.
3-1. Module A [완료됨]