Модель семантического связывания тюркских языков: подход с ограничением справедливости для малоресурсных условий
DOI:
https://doi.org/10.71310/pcam.4_74.2026.11Ключевые слова:
тюркские языки, кросс-язычные векторные представления, малоресурсные языки, зашумлённый контроль, ограничение справедливости, задача ПрокрустаАннотация
В работе предлагается модель кросс-язычного семантического связывания для семейства тюркских языков, большинство представителей которого относится к классу малоресурсных с точки зрения вычислительной лингвистики. Теоретической основой модели служит послойная схема обработки естественного языка Э. Д. Лидди, сжатая до четырёх уровней: графемно-морфологического, синтаксического, семантического и кросс-язычного. Вместо трактовки экспертных знаниевых ресурсов в качестве жёстких ограничений они вводятся в модель как зашумлённый сигнал контроля (noisy supervision), взвешенный по каждому языку коэффициентом надёжности ????????; эта конструкция включает классический retrofitting (???????? → 1) и чисто дистрибутивную модель (???????? → 0) как частные случаи единой схемы. Задача оптимизации дополняется ограничением справедливости, ограничивающим разрыв между наилучшим и наихудшим по языкам показателем качества и тем самым предотвращающим смещение модели в пользу ресурсно-богатых языков. Разработан двухуровневый алгоритм, объединяющий шаги Adam для обновления вложений, замкнутое ортогональное решение задачи Прокруста для кросс-язычных отображений и softmax-репараметризацию для симплекса языковых весов с проекционным субградиентным шагом по двойственной переменной; для внешнего цикла приводится стандартная оценка сходимости ????(1/√????). Программа экспериментов включает пять базовых линий, изолирующих вклад каждого компонента модели, внутренние (корреляция Спирмена на SimRelUz, Precision@1 и Precision@5 при индукции двуязычного словаря) и внешние (chrF++ при машинном переводе) метрики с 95%-ными бутстреп-доверительными интервалами и поправкой Холма — Бонферрони на множественные сравнения.
Библиографические ссылки
Agostini A. [et al.] 2021. UZWORDNET: A lexical-semantic database for the Uzbek language. Proceedings of the 11th Global WordNet Conference (GWC-2021). Global WordNet Association. 8–19.
Artetxe M., Labaka G., Agirre E. 2018. A robust self-learning method for fully unsupervised cross-lingual mappings of word embeddings. Proceedings of the 56th Annual Meeting of the Association for Computational Linguistics (ACL 2018). Vol. 1. 789–798.
Batsuren K., Bella G., Giunchiglia F. 2022. A large and evolving cognate database. Language Resources and Evaluation. 56: 165–189. doi: https://doi.org/10.1007/s10579-021-09544-6.
Bojanowski P., Grave E., Joulin A., Mikolov T. 2017. Enriching word vectors with subword information. Transactions of the Association for Computational Linguistics. 5: 135–146.
Church K., Yuan X., Guo S., Wu Z., Yang Y., Chen Z. 2021. Emerging trends: A gentle introduction to fine-tuning. Natural Language Engineering. 27(6): 763–778.
Collobert R., Weston J., Bottou L., Karlen M., Kavukcuoglu K., Kuksa P. 2011. Natural language processing (almost) from scratch. Journal of Machine Learning Research. 12: 2493–2537.
Conneau A., Khandelwal K., Goyal N., Chaudhary V., Wenzek G., Guzmán F., Grave E., Ott M., Zettlemoyer L., Stoyanov V. 2020. Unsupervised cross-lingual representation learning at scale. Proceedings of the 58th Annual Meeting of the Association for Computational Linguistics (ACL 2020). 8440–8451.
Jurafsky D., Martin J. H. 2025. Speech and language processing: An introduction to natural language processing, computational linguistics, and speech recognition with language models. 3rd ed. Online manuscript. Available at: https://web.stanford.edu/~jurafsky/slp3.
Liddy E. D. 2001. Natural language processing. Encyclopedia of Library and Information Science. 2nd ed. New York: Marcel Dekker.
Mann W. C., Thompson S. A. 1988. Rhetorical structure theory: Toward a functional theory of text organization. Text. 8(3): 243–281.
Manning C. D., Schütze H. 1999. Foundations of statistical natural language processing. Cambridge, MA: MIT Press. 680 p.
Mikolov T., Chen K., Corrado G., Dean J. 2013. Efficient estimation of word representations in vector space. Proceedings of the International Conference on Learning Representations (ICLR 2013), Workshop Track. arXiv:1301.3781.
Miller G. A. 1995. WordNet: A lexical database for English. Communications of the ACM. 38(11): 39–41.
Pennington J., Socher R., Manning C. D. 2014. GloVe: Global vectors for word representation. Proceedings of the 2014 Conference on Empirical Methods in Natural Language Processing (EMNLP). 1532–1543.
Ruder S., Vulić I., Søgaard A. 2019. A survey of cross-lingual word embedding models. Journal of Artificial Intelligence Research. 65: 569–631.
Salaev U., Kuriyozov E., Gómez-Rodríguez C. 2022. SimRelUz: Similarity and relatedness scores as a semantic evaluation dataset for the Uzbek language. Proceedings of the 1st Annual Meeting of the ELRA/ISCA Special Interest Group on Under-Resourced Languages (SIGUL 2022). 199–206.
Sennrich R., Haddow B., Birch A. 2016. Neural machine translation of rare words with subword units. Proceedings of the 54th Annual Meeting of the Association for Computational Linguistics (ACL 2016). Vol. 1. 1715–1725.
Weitzman Y., Hartmann M. 2025. Recent advancements and challenges of Turkic Central Asian language processing. Proceedings of the First Workshop on Language Models for Low-Resource Languages (LoResLM 2025). Abu Dhabi: ACL. arXiv:2407.05006.
Загрузки
Опубликован
Выпуск
Раздел
Лицензия
Copyright (c) 2026 Д.А. Ахмеджанова

Это произведение доступно по лицензии Creative Commons «Attribution» («Атрибуция») 4.0 Всемирная.