한국어 과학기술 논문 초록 문장 분류를 위한 데이터셋 및 학습 모델

The Dataset and a Pretrained Language Model for Sentence Classification in Korean Science and Technology Abstracts

초록

문서에 존재하는 각 문장을 역할 또는 기능에 따라 분류하는 것은 매우 중요하다. 특히, 과학 기술 논문의 초록에는 여러 가지 연구 관련 내용이 등장하는데, 이것을 각 의미에 따라 분별하고, 적절한 의미 태그를 부여하는 것은 콘텐츠 큐레이션 측면에서 매우 필요하지만, 작업의 복잡성과 다양성으로 인하여 쉽지 않은 일로 여겨지고 있다. 예를 들어, 생물 의학 관련 외국어 초록 데이터(PubMed)의 경우 초록을 구성하는 문장들은 대체로 일관된 의미적 순서(예, 배경-목적-방법-결과-결론)를 지키고 있지만, 한국어 논문 초록에서 문장들은 저자에 따라 매우 상이한 순서로 기술되어 있다. 본 연구에서는 한국어로 기술된 과학기술 도메인의 논문초록들을 대상으로 각 문장을 그 역할에 따라 태깅한 데이터셋(PubKorSci-1k) 을 구축을 하고, 데이터셋에 맞는 문장 분류를 위한 학습 기법을 제안한다.

키워드

초록; 자동 문장 분류; 과학기술 논문; 기계학습; 딥러닝; abstract; automatic sentence classification; science and technology paper; machine learning; deep learning
제목
한국어 과학기술 논문 초록 문장 분류를 위한 데이터셋 및 학습 모델
제목 (타언어)
The Dataset and a Pretrained Language Model for Sentence Classification in Korean Science and Technology Abstracts
저자
안홍비; 박소영; 정유철
DOI
10.5626/JOK.2023.50.6.468
발행일
2023-06
저널명
정보과학회논문지
권
50
호
6
페이지
468 ~ 475