Oʻzbekcha
ELEKTRON TEZAURUS YARATISHNING LINGVISTIK ASOSLARI VA SINSET SHAKLLANTIRISH METODOLOGIYASI
Jurnal
Zamonaviy fan: innovatsion yondashuvlar va yosh tadqiqotchilarning dolzarb izlanishlari
Nashr
Zamonaviy fan: innovatsion yondashuvlar va yosh tadqiqotchilarning dolzarb izlanishlari
Annotatsiya
Ushbu maqolada elektron tezaurus yaratishning lingvistik asoslari, xususan, tezaurus birliklarini tanlash va sinsetlarni shakllantirish metodologiyasi tahlil qilinadi. Tadqiqot maqsadi elektron tezaurusning an'anaviy lug'atdan farqli tuzilish xususiyatlarini aniqlash hamda korpus statistikasi, distributiv semantika va BERT tipidagi transformer modellarni ekspert tekshiruvi bilan uyg'unlashtirgan olti bosqichli metodikani ishlab chiqishdan iborat. “O'zbek tilining ta'limiy korpusi” va ARANEUM_UZBEKICUM korpusi materiallari asosida 5 ta leksik-grammatik toifaga oid 77 ta sinset yaratildi. Natijalar elektron tezaurusni axborot-qidiruv va tabiiy tilni qayta ishlash tizimlariga integratsiya qilish uchun lingvistik zamin bo'lib xizmat qiladi
Kalit so‘zlar
BERT
deskriptor
elektron tezaurus
korpus lingvistikasi
o'zbek tili
ontologiya
semantik munosabatlar
sinonimiya
sinset
Русский
В данной статье анализируются лингвистические основы создания электронного тезауруса, в частности, методология отбора тезаурусных единиц и формирования синсетов. Цель исследования состоит в выявлении структурных особенностей электронного тезауруса, отличающих его от традиционного словаря, а также в разработке шестиэтапной методики, объединяющей корпусную статистику, дистрибутивную семантику и трансформерные модели типа BERT с экспертной верификацией. На материале «Учебного корпуса узбекского языка» и корпуса ARANEUM_UZBEKICUM создано 77 синсетов, относящихся к 5 лексико-грамматическим категориям. Результаты служат лингвистической основой для интеграции электронного тезауруса в системы информационного поиска и обработки естественного языка
BERT
дескриптор
корпусная лингвистика
онтология
семантические отношения
синонимия
синсет
узбекский язык
электронный тезаурус
English
This article analyses the linguistic foundations of electronic thesaurus construction, focusing on the methodology for selecting thesaurus units and forming synsets. The aim of the study is to identify the structural features that distinguish an electronic thesaurus from a traditional dictionary and to develop a six-stage methodology that integrates corpus statistics, distributional semantics and BERT-type transformer models with expert verification. Drawing on the “Uzbek Educational Corpus” and the ARANEUM_UZBEKICUM corpus, 77 synsets were constructed across 5 lexical-grammatical categories. The results provide a linguistic basis for integrating the electronic thesaurus into information-retrieval and natural-language-processing systems
BERT
Uzbek language
corpus linguistics
descriptor
electronic thesaurus
ontology
semantic relations
synonymy
synset
1. Апресян Ю.Д. Лексическая семантика: синонимические средства языка. – Москва: Наука, 1974. – 367 б.
2. Asadov T. Leksik-semantik guruhlarning tasnifi. – Toshkent: Fan, 2015. – 214 b.
3. Berners-Lee T., Hendler J., Lassila O. The Semantic Web // Scientific American. – 2001. – Vol. 284, No. 5. – P. 34–43.
4. Devlin J., Chang M.-W., Lee K., Toutanova K. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding // Proceedings of NAACL-HLT. – 2019. – P. 4171–4186.
5. Fellbaum C. (ed.) WordNet: An Electronic Lexical Database. – Cambridge, MA: MIT Press, 1998. – 423 p.
6. Gruber T.R. A Translation Approach to Portable Ontology Specifications // Knowledge Acquisition. – 1993. – Vol. 5, No. 2. – P. 199–220.
7. Karaulov Yu.N. Общая и русская идеография. – Москва: Наука, 1976. – 356 б.
8. Kasares J. Diccionario ideológico de la lengua española. – Barcelona: Gustavo Gili, 1942. – 887 p.
9. Mikolov T., Chen K., Corrado G., Dean J. Efficient Estimation of Word Representations in Vector Space // arXiv:1301.3781. – 2013.
10. Miller G.A. WordNet: A Lexical Database for English // Communications of the ACM. – 1995. – Vol. 38, No. 11. – P. 39–41.
11. Najmiddinov M.G'. Tezauruslar yaratishning lingvistik asoslari: Filologiya fanlari doktori (DSc) dissertatsiyasi avtoreferati. – Andijon, 2026. – 69 b.
12. “O'zbek tilining ta'limiy korpusi”. Elektron resurs. Manzil: https://uzbekcorpus.uz
13. Vaswani A. et al. Attention Is All You Need // Advances in Neural Information Processing Systems. – 2017. – Vol. 30. – P. 5998–6008.