📝 ReadMyLips (2024.09 ~ 2025.02)
📌 프로젝트 개요
한국어 립리딩 기반 실시간 자막 생성 시스템을 개발한 프로젝트입니다. 음성 인식이 어려운 환경에서도 화자의 입 모양만으로 문장을 예측해 자막을 생성함으로써, 청각장애인 보조와 무음 상황 자막 생성 서비스를 목표로 하였습니다.
❓ 문제 정의
기존 립리딩 모델은 영어 데이터셋(LRS2 등)에 편중되어 있으며, 실시간으로 입술 ROI를 검출하고 자막을 생성하는 파이프라인이 부족했습니다. 한국어 환경에서도 활용 가능한 립리딩 모델과 실시간 추론 파이프라인 구축이 필요했습니다.
⚙️ 개발 내용
- 데이터셋 구축 : AiHub 립리딩 데이터셋 확보, BBC LRS2 데이터셋과 통합 전처리, 세바시 유튜브 영상 크롤링 및 Whisper 자막 레이블 생성
- 모델 개발 : SyncVSR 모델을 한국어 데이터셋으로 파인튜닝
- 입술 검출 파이프라인 : YOLO + dlib 기반 실시간 입술 ROI 추출 파이프라인 구현
- 추론 및 데모 : SyncVSR + YOLO + dlib + Whisper 기반 실시간 추론 파이프라인 설계, 최종 데모 개발
👤 나의 역할
- 세바시 유튜브 영상 크롤링 및 Whisper를 활용한 자막 레이블 자동 생성
- 한국어 립리딩 모델 파인튜닝 실험 및 학습 결과 분석
- 실시간 추론 데모 개발 및 발표 자료 작성
✅ 결과 및 성과
- SyncVSR 모델 한국어 파인튜닝 (높은 성능이 아니여서 추가 학습 필요)
- 기존 SyncVSR 대비, YOLO-dlib 기반 ROI 검출을 결합해 실시간 립리딩 데모 가능
💡 어려움과 해결
- 문제: 한국어 립리딩 학습 데이터 부족
- 해결: 세바시 영상을 크롤링 후 Whisper 자막으로 학습 데이터 확장
- 문제: 입술 ROI 검출 속도 저하
- 해결: YOLO + dlib 조합으로 검출 속도 및 안정성 개선