1. 데이터셋 기본 정보

항목 내용
원 논문 / PRMU 출처 Meng et al. 2017 (ACL) / Boudin & Gallina 2021 (NAACL)
도메인·언어 컴퓨터공학(CS) 논문 abstract+title, 영어
총 문서 수 570,809건 (약 721MB)
Feature id, title, abstract, keyphrases(list), prmu(list)
Split 문서 수 평균 keyphrase 수 Present Reordered Mixed Unseen
Train 530,809 5.29 58.19% 10.93% 17.36% 13.52%
Test 20,000 5.28 58.40% 10.84% 17.20% 13.56%
Validation 20,000 5.27 58.20% 10.94% 17.26% 13.61%

공식 전처리 규칙: spaCy(en_core_web_sm) 토큰화, 하이픈 단어는 한 토큰 유지, 매칭 시 Porter stemmer 적용, Present keyphrase는 본문 등장 순서대로 정렬 제공.

자체 계산치(아래 2번)의 Present 비율(60.78%)이 공식 Train 수치(58.19%)와 약 2.6%p 차이 — 토큰화/스테밍 세부 구현 차이로 추정, 참고용으로 병기

2. PRMU 라벨의 의미

title / abstract 에서 key pharases 를 참고해서 뽑을때 PRMU로 분류

라벨 이름 의미
P Present 키프레이즈가 원문에 정확히 그대로(어순까지) 등장
R Reordering 키프레이즈를 구성하는 단어들은 원문에 다 있지만, 어순이 다름
M Mixed 키프레이즈 단어 중 일부만 원문에 있고 일부는 없음
U Unseen 키프레이즈 단어가 원문에 전혀 등장하지 않음 (완전히 새로 만든 표현)

여기서 잠깐!

stem의 의미로 P / U 가 갈릴 수도 있음

title에만 있어도 P가 나올 수 도있음

두 개이상의 단어가 혼합될 경우 !!

앞에 단어 존재 뒤에 단어는 title / abstract 에 없어도 M 이 나옴

virtual-reality 앞에 - 로 다른 단어로 인식하고 U로 판단함.

3. PRMU 라벨별 개수, 비율

https://huggingface.co/datasets/taln-ls2n/kp20k/viewer/raw/train?row=3