MATNLI MA'LUMOTLARNI TF–IDF VA SILHOUETTE KOEFFITSIENTI ASOSIDA AVTOMATIK KLASTERLASH HAMDA KLASTERLARNI YORLIQLASH USULI
Main Article Content
Abstract
Katta hajmdagi matnli ma’lumotlarni avtomatik tahlil qilish va semantik jihatdan guruhlash tabiiy tilni qayta ishlash (NLP) tizimlarining muhim bosqichlaridan biridir. Mazkur maqolada TF–IDF vektorlashtirish usuli va K-Means klasterlash algoritmi asosida matnlarni avtomatik sinflarga ajratish hamda klasterlarni inson aralashuvisiz yorliqlash usuli taklif etiladi. Taklif etilgan metodologiyada klasterlar sonini tanlash muammosi Silhouette k’oeffitsienti asosida avtomatlashtiriladi va standart Silhouette funksiyasiga cheklov parametri qo‘shiladi. Natijalar shuni ko‘rsatadiki, taklif etilgan algoritm optimal klasterlar sonini aniqlash aniqligini oshiradi, ortiqcha segmentatsiyani kamaytiradi va yuqori o‘lchamli matn fazosida barqaror klasterlar hosil qiladi. Eksperimental natijalarda Silhouette koeffitsienti 0.84 qiymatgacha yaxshilangan, klaster yorliqlash aniqligi esa 91.8% ga yetgan.
Downloads
Article Details
Section

This work is licensed under a Creative Commons Attribution-NonCommercial-NoDerivatives 4.0 International License.
How to Cite
References
Egamberdiyev E. H. Clustering OF Small-scale Uzbek Texts Using Tf-idf AND Kmeans: an Empirical Evaluation OF Vectorization Parameters //Modern American Journal of Engineering, Technology, and Innovation. – T. 1. – №. 4. – S. 58-67.
Salton, G., & Buckley, C. (1988). Term-weighting approaches in automatic text retrieval. Information Processing & Management, 24(5), 513–523.
Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press, Cambridge, UK.
MacQueyen, J. (1967). Some Methods for Classification and Analysis of Multivariate Observations. Proceyedings of the Fifth Berkeley Symposium on Mathematical Statistics and Probability, Vol. 1, pp. 281–297.
Lloyd, S. P. (1982). Least Squares Quantization in PCM. IEYEE Transactions on Information Theory, 28(2), 129–137.
Rousseeuw, P. J. (1987). Silhouettes: A Graphical Aid to the Interpretation and Validation of Cluster Analysis. Journal of Computational and Applied Mathematics, 20, 53–65.
Aggarwal, C. C., & Zhai, C. (2012). Mining Text Data. Springer, New York.
Jurafsky, D., & Martin, J. H. (2025). Speech and Language Processing (3rd ed., draft). Pearson. (Natural Language Processing bo‘yicha zamonaviy qo‘llanma.)
Han, J., Kamber, M., & Pei, J. (2012). Data Mining: Concepts and Techniques (3rd ed.). Morgan Kaufmann.
Pedregosa, F., Varoquaux, G., Gramfort, A., et al. (2011). Scikit-learn: Machine Learning in Python. Journal of Machine Learning Research, 12, 2825–2830.