MATNLI MA'LUMOTLARNI TF–IDF VA SILHOUETTE KOEFFITSIENTI ASOSIDA AVTOMATIK KLASTERLASH HAMDA KLASTERLARNI YORLIQLASH USULI

Main Article Content

Egamberdiyev Elyor Hayitmamatovich

Abstract

Katta hajmdagi matnli ma’lumotlarni avtomatik tahlil qilish va semantik jihatdan guruhlash tabiiy tilni qayta ishlash (NLP) tizimlarining muhim bosqichlaridan biridir. Mazkur maqolada TF–IDF vektorlashtirish usuli va K-Means klasterlash algoritmi asosida matnlarni avtomatik sinflarga ajratish hamda klasterlarni inson aralashuvisiz yorliqlash usuli taklif etiladi. Taklif etilgan metodologiyada klasterlar sonini tanlash muammosi Silhouette k’oeffitsienti asosida avtomatlashtiriladi va standart Silhouette funksiyasiga cheklov parametri qo‘shiladi. Natijalar shuni ko‘rsatadiki, taklif etilgan algoritm optimal klasterlar sonini aniqlash aniqligini oshiradi, ortiqcha segmentatsiyani kamaytiradi va yuqori o‘lchamli matn fazosida barqaror klasterlar hosil qiladi. Eksperimental natijalarda Silhouette koeffitsienti 0.84 qiymatgacha yaxshilangan, klaster yorliqlash aniqligi esa 91.8% ga yetgan.

Downloads

Download data is not yet available.

Article Details

Section

Articles

How to Cite

Egamberdiyev , E. (2026). MATNLI MA’LUMOTLARNI TF–IDF VA SILHOUETTE KOEFFITSIENTI ASOSIDA AVTOMATIK KLASTERLASH HAMDA KLASTERLARNI YORLIQLASH USULI. Konferensiyalar, 1(1), 24-30. https://doi.org/10.5281/zenodo.23137257

References

Egamberdiyev E. H. Clustering OF Small-scale Uzbek Texts Using Tf-idf AND Kmeans: an Empirical Evaluation OF Vectorization Parameters //Modern American Journal of Engineering, Technology, and Innovation. – T. 1. – №. 4. – S. 58-67.

Salton, G., & Buckley, C. (1988). Term-weighting approaches in automatic text retrieval. Information Processing & Management, 24(5), 513–523.

Manning, C. D., Raghavan, P., & Schütze, H. (2008). Introduction to Information Retrieval. Cambridge University Press, Cambridge, UK.

MacQueyen, J. (1967). Some Methods for Classification and Analysis of Multivariate Observations. Proceyedings of the Fifth Berkeley Symposium on Mathematical Statistics and Probability, Vol. 1, pp. 281–297.

Lloyd, S. P. (1982). Least Squares Quantization in PCM. IEYEE Transactions on Information Theory, 28(2), 129–137.

Rousseeuw, P. J. (1987). Silhouettes: A Graphical Aid to the Interpretation and Validation of Cluster Analysis. Journal of Computational and Applied Mathematics, 20, 53–65.

Aggarwal, C. C., & Zhai, C. (2012). Mining Text Data. Springer, New York.

Jurafsky, D., & Martin, J. H. (2025). Speech and Language Processing (3rd ed., draft). Pearson. (Natural Language Processing bo‘yicha zamonaviy qo‘llanma.)

Han, J., Kamber, M., & Pei, J. (2012). Data Mining: Concepts and Techniques (3rd ed.). Morgan Kaufmann.

Pedregosa, F., Varoquaux, G., Gramfort, A., et al. (2011). Scikit-learn: Machine Learning in Python. Journal of Machine Learning Research, 12, 2825–2830.

Similar Articles

You may also start an advanced similarity search for this article.

Most read articles by the same author(s)

1 2 3 > >>