Gom nhóm văn bản dựa trên mẫu hữu ích được đánh trọng phổ biến

Các tác giả

  • Võ Đình Bảy*
  • Trần Thanh Trâm

Từ khóa:

Cơ sở dữ liệu số lượng, gom nhóm văn bản, mẫu hữu ích được đánh trọng phổ biến, mẫu phổ biến, trọng số của từ

Tóm tắt

Gom nhóm văn bản là chủ đề quan trọng trong khai thác dữ liệu văn bản, và phương pháp hiệu quả để gom nhóm văn bản là dựa trên mẫu phổ biến. Đã có nhiều thuật toán được phát triển nhằm nâng cao độ chính xác cho bài toán gom nhóm văn bản dựa trên mẫu phổ biến, nhưng lại không quan tâm tới trọng số của từ trong văn bản. Trong bài báo này, các tác giả đề xuất một phương pháp mới để gom nhóm văn bản dựa vào mẫu hữu ích được đánh trọng phổ biến thông qua việc sử dụng TF (Term Frequency) cho mỗi từ trong văn bản. Trọng số của từ trên toàn bộ tập văn bản được tính dựa vào IDF (Inverse Document Frequency), sau đó sử dụng thuật toán MWIT-FWUI để khai thác các mẫu hữu ích phổ biến. Tiếp theo, tiến hành gom nhóm văn bản bằng thuật toán MC (Maximum Capturing). Kết quả thử nghiệm trên kho ngữ liệu gồm 1.600 văn bản (16 chủ đề) cho thấy, phương pháp mới đã cải thiện đáng kể độ chính xác của việc gom nhóm văn bản so với phương pháp dựa vào mẫu phổ biến.

 

Chỉ số phân loại

1.2

Tiểu sử tác giả

Võ Đình Bảy

Khoa Công nghệ thông tin, Trường Đại học Công nghệ TP Hồ Chí Minh

Trần Thanh Trâm

Trường Đại học Công nghệ thông tin, Đại học Quốc gia TP Hồ Chí Minh

Tải xuống

Đã xuất bản

2018-08-25

Ngày nhận bài: 26/03/2018; ngày chuyển phản biện: 30/03/2018; ngày nhận phản biện: 22/04/2018; ngày chấp nhận đăng: 27/04/2018

Cách trích dẫn

Bảy, V. Đình, & Trâm, T. T. (2018). Gom nhóm văn bản dựa trên mẫu hữu ích được đánh trọng phổ biến. Bản B của Tạp Chí Khoa học Và Công nghệ Việt Nam, 60(8). Truy vấn từ https://b.vjst.vn/index.php/ban_b/article/view/623

Số

Lĩnh vực

Khoa học Tự nhiên