NLP
도메인 특화 BERT 기반 Intent Classification 모델 개발
Domain Adaptive Pre-training 기반 의료·보험 도메인 의도 분류
소속: 포지큐브역할: NLP 모델 개발, Domain Adaptive Pre-training, 분산 학습 환경 구축
프로젝트 개요
Azure Intent Classification API를 자체 BERT 모델로 완전 대체했습니다. Domain Adaptive Pre-training과 PyTorch DDP 분산 학습(A100 4장)으로 의료·보험 전문 용어 이해도를 높이고 오분류율을 개선해 상용 서비스에 적용했습니다.
문제 정의
범용 BERT 모델이 의료·보험 분야의 전문 용어, 코로나 관련 신조어, 상담 문체 등을 학습하지 못해 특정 Intent 간 오분류가 빈번하게 발생했습니다.
해결 접근
자체 구축한 의료·보험 도메인 Corpus를 활용하여 BERT에 Domain Adaptive Pre-training(MLM)을 수행하고, Intent Classification Task에 Fine-tuning을 적용했습니다. A100 GPU 4장을 활용한 PyTorch DDP 분산 학습 환경을 구축하여 대규모 모델 학습을 효율화했습니다.
담당 역할
- 의료·보험 도메인 Corpus 구축 및 전처리 파이프라인 설계
- BERT 기반 Domain Adaptive Pre-training (MLM) 수행
- Intent Classification Task Fine-tuning 및 Classification Head 최적화
- Error Analysis 기반 오분류 패턴 분석 및 개선 실험
- A100 GPU 4장 활용 PyTorch DDP 분산 학습 환경 구축
- Mixed Precision Training 적용 및 학습 시간 최적화
- 하이퍼파라미터 튜닝 (Learning Rate, Batch Size, Warmup Steps)
- 기존 외부 모델 대비 성능 비교 분석 및 전환 타당성 검토
성과 및 기여
- 도메인 특화 BERT 모델 개발로 의료·보험 용어 이해도 향상
- Intent 오분류율 감소 및 서비스 적용 가능 수준까지 정확도 개선
- 자사 모델 전환 검토 완료 및 기술적 타당성 검증
- 분산 학습 환경 구축으로 대규모 모델 학습 경험 확보
기술 스택
PythonPyTorchHugging Face TransformersBERTDomain Adaptive Pre-trainingFine-tuningPyTorch DDPMixed Precision TrainingCUDAMulti-GPU TrainingError AnalysisHyperparameter Optimization