Эволюция архитектур трансформеров: от самовнимания к эффективным Sparse-моделям

dc.contributor.authorГуляев, В. О.
dc.contributor.authorЗахарова, О. И.
dc.coverage.spatialМинск
dc.date.accessioned2026-09-10T12:20:16Z
dc.date.issued2026
dc.description.abstractСтатья посвящена исследованию новых архитектур искусственных нейронных сетей, направленных на улучшение классических трансформеров путем уменьшения вычислительных затрат и увеличения эффективности. Рассматриваются основные этапы эволюции трансформеров, начиная с введения механизма самовнимания и заканчивая современными Sparse-моделями. Особое внимание уделяется методам оптимизации, таким как параметрически эффективный fine-tuning (PEFT), адаптивные слои (adapters), а также использование внешних хранилищ знаний и mem-векторов для расширения долговременной памяти моделей. Статья завершается обсуждением текущих достижений, ограничений и перспективных направлений будущих исследований в данной области.
dc.identifier.citationГуляев, В. О. Эволюция архитектур трансформеров: от самовнимания к эффективным Sparse-моделям = Evolution of transformer architectures: from self-attention to efficient sparse models / В. О. Гуляев, О. И. Захарова // Системный анализ и прикладная информатика. – 2026. – № 2. – С. 78-81.
dc.identifier.doi10.21122/2309-4923-2026-2-78-81
dc.identifier.urihttps://rep.bntu.by/handle/data/168532
dc.language.isoru
dc.publisherБНТУ
dc.titleЭволюция архитектур трансформеров: от самовнимания к эффективным Sparse-моделям
dc.title.alternativeEvolution of transformer architectures: from self-attention to efficient sparse models
dc.typeArticle
local.description.annotationThe article is devoted to the study of new architectures of artificial neural networks aimed at improving classical transformers by reducing computational costs and increasing efficiency. The main stages of the evolution of transformers are considered, starting with the introduction of the mechanism of self-attention and ending with modern sparse models. Particular attention is paid to optimization techniques such as parametrically efficient fine-tuning (PEFT), adaptive layers (adapters), as well as the use of external knowledge repositories and memory vectors to expand the long-term memory of models. The article concludes with a discussion of current achievements, limitations, and promising areas for future research in this area.

Files

Original bundle

Now showing 1 - 1 of 1
Loading...
Thumbnail Image
Name:
78-81.pdf
Size:
569.44 KB
Format:
Adobe Portable Document Format

Collections