상세 보기
초록
문서 검색에서 ‘이클립스’와 같이 하나 이상의 의미를 가지고 있는 질의어가 입력된 경우에 ‘자바 이클립스’, ‘영화 이클립스’, ‘미쯔비시 이클립스’가 분류되어 사용자에게 제시되면 검색 결과의 효용이 높아질 수 있다. 본 논문에서는 질의어에 대한 검색 결과를 제목과 요약문의 단어 정보를 이용하여 군집화하여 사용자가 찾고자 하는 검색 결과를 용이하게 찾을 수 있는 방법을 제시한다. 문서 군집에서는 제목과 요약문에 나타나는 단어의 TF와 IDF, 단어간 거리 정보를 다양하게 결합하여 단어의 가중치를 계산하며, 분류에서는 단일 군집화와 리더-팔로우 군집화 방법을 적용한다. 분류된 각 군집을 표현하기 위한 군집에서 가장 높은 가중치를 가지는 2개의 어휘를 사용자에게 제시하여 효용성을 높인다. 구축된 시스템의 평가를 위해 모호성이 높은 6개 단어에 대한 검색 결과를 네이버에서 수집하여 평가 집합을 수동으로 구성하고 검색 결과 분류에 대한 특성을 분석해 보았다. 다양한 가중치와 군집 알고리즘을 적용해 본 실험에서는 단어간 거리합에 기반한 가중치가 가장 높은 결과를 보였으며 작은 크기의 군집을 허용한 경우 최고 81.9%의 정확률을 보였다.
키워드
문서 군집; 웹 검색 결과; 요약문; 단어 거리; 리더-팔로우 군집화 알고리즘; Document Clustering; Web Search Result; Snippets; word distance; leader-follow clustering
- 제목
- 요약문을 이용한 웹 검색 결과 군집화
- 제목 (타언어)
- Web Search Result Clustering using Snippets
- 저자
- 정석팔; 임성현; 전진형; 김병만; 이현아
- 발행일
- 2012-10
- 저널명
- 정보과학회논문지 : 데이타베이스
- 권
- 39
- 호
- 5
- 페이지
- 321 ~ 331
- 언어
- KOR
- 출판사
- 한국정보과학회
- 발행국가
- 대한민국
- 분량
- 11 페이지
- ISSN
- P 1229-7739