dataman_2.png

데이터는 모았는데, 왜 여전히 사람에게 물어볼까요?

작은 문제의식에서 시작해 사내 AI 제품과 바텀업 데이터 거버넌스로 확장한 Text-to-SQL 개발기

“지난달 IT 직무 공고를 등록했고, 같은 기간 웹에서 결제를 완료한 기업을 알려주세요.”

데이터팀에겐 일상적인 질문입니다. 하지만 이 한 문장에 답하려면 생각보다 많은 것을 알아야 합니다. 공고와 결제는 어느 테이블에 있는지, ‘결제 완료’는 어떤 코드인지, 서로 다른 데이터 영역에서 같은 기업을 어떻게 찾아야 하니까요.

AWS 기반으로 클라우드 환경에 데이터 플랫폼을 구축한 뒤, 저는 사람인의 각 조직이 필요한 데이터를 더 쉽게 활용할 수 있으리라 기대했습니다.

하지만 실무자는 여전히 데이터팀에 추출 요청을 하고 있었습니다. 데이터는 누구나 접근 가능한 환경이 되었지만, 그 데이터를 어떻게 해석하고 연결하는지는 시스템을 구축한 개발 담당자만 알고 있었기 때문입니다.

여기서 하나의 질문이 떠올랐습니다.

“사람들의 데이터 질문을 해결하면서, 그 답에 필요한 지식도 함께 정리해둘 방법이 있을까”

저는 이 문제의식을 바탕으로 Text-to-SQL을 직접 발의하고 만들기 시작했습니다. 처음에는 충분히 정제된 Golden 데이터베이스 기반에서 동작하는 모델을 통해 서비스의 고도화 가능성을 확인했습니다. 이후 Slack에서 사용할 수 있는 사내 제품으로 출시하고, 1,000개 이상 테이블의 메타데이터를 가진 레거시 운영 데이터베이스 환경으로 확장해 적용했습니다.


Project Overview

항목 내용
프로젝트 메타데이터에 근거한 사내 Text-to-SQL 서비스
기간 2025.07–현재
소속 비즈플랫폼실 → Data & Analytics팀
대상 사용자 데이터 추출·분석이 필요한 사내 구성원과 이를 지원하는 데이터 담당자
나의 역할 문제 발의, 제품 범위·로드맵 수립, 메타데이터와 핵심 시스템 설계·개발, 출시·개선
협업 범위 인프라·보안 조직과 접근 범위 및 운영 조건 조율
규모·환경 Golden Database → 1,000개 이상의 운영 테이블로 확장 · Python, AWS, GCP/Gemini, Slack
제품 범위 일반 경로: 메타데이터 Q&A와 SQL 생성·검증 / 집계 및 분석으로 확장

주요 결과