Принципи роботи великих мовних моделей (LLM)

Автор(и)

DOI:

https://doi.org/10.17721/2706-9699.2025.1.06

Ключові слова:

великi мовнi моделi, трансформер, автогресивна генерацiя, токенiзацiя, температура, ймовiрнiсне моделювання тексту

Анотація

У статтi дослiджено принципи роботи великих мовних моделей (LLM), зокрема механiзм генерацiї наступного токена в процесi автогресивного моделювання. Описано теоретичнi основи нейронних мовних моделей, трансформерну архiтектуру з механiзмом самоуваги, а також роль токенiзацiї та ембеддингу у формуваннi вхiдного представлення тексту. Проаналiзовано основнi методи вибору наступного токена (жадiбне декодування, top-k, top-p семплiнг, температура), їхнiй вплив на стохастичнiсть результатiв i баланс мiж узгодженiстю та креативнiстю. Розглянуто обмеження довжини контексту, джерела тренувальних даних i виклики, пов’язанi з iнтерпретованiстю та ймовiрнiстю «галюцинацiй». Стаття є цiлiсним оглядом архiтектурних та алгоритмiчних рiшень, що лежать в основi генерацiї тексту LLM.

Посилання

Schuurmans D., Dai H., Zanini F. Autoregressive Large Language Models are Computationally Universal. arXiv preprint arXiv:2410.03170 [cs.CL]. 2024.

Vaswani A., Shazeer N., Parmar N., Uszkoreit J., Jones L., Gomez A. N., Kaiser L., Polosukhin I. Attention Is All You Need. arXiv preprint arXiv:1706.03762. 2017.

Grubisic D., Cummins C., Seeker V., Leather H. Priority Sampling of Large Language Models for Compilers. arXiv preprint arXiv:2402.18734. 2024.

Schmidt R. M. Recurrent Neural Networks (RNNs): A Gentle Introduction and Overview. arXiv preprint arXiv:1912.05911. 2019.

Vennerod C. B., Kjorran A., Bugge E. S. Long Short-term Memory RNN. arXiv preprint arXiv:2105.06756. 2021.

Chung J., Gulcehre C., Cho K., Bengio Y. Empirical Evaluation of Gated Recurrent Neural Networks on Sequence Modeling. arXiv preprint arXiv:1412.3555. 2014. Presented at NIPS 2014 Deep Learning and Representation Learning Workshop. https://doi.org/10.48550/arXiv.1412.3555.

Yenduri G. et al. Generative Pre-trained Transformer: A Comprehensive Review on Enabling Technologies, Potential Applications, Emerging Challenges, and Future Directions. arXiv preprint arXiv:2305.10435. 2023.

Devlin J., Chang M.-W., Lee K., Toutanova K. BERT: Pre-training of Deep Bidirectional Transformers for Language Understanding. arXiv preprint arXiv:1810.04805. 2018. https://doi.org/10.48550/arXiv.1810.04805.

Sinha K. et al. Masked Language Modeling and the Distributional Hypothesis: Order Word Matters Pre-training for Little. arXiv preprint arXiv:2104.06644. 2021. https://doi.org/10.48550/arXiv.2104.06644.

Batsuren K. et al. Evaluating Subword Tokenization: Alien Subword Composition and OOV Generalization Challenge. arXiv preprint arXiv:2404.13292. 2024.

Kozma L., Voderholzer J. Theoretical Analysis of Byte-Pair Encoding. arXiv preprint arXiv:2411.08671. 2024. https://doi.org/10.48550/arXiv.2411.08671.

Ma H., Chen J., Wang G., Zhang C. Estimating LLM Uncertainty with Logits. arXiv preprint arXiv:2502.00290. 2025. https://arxiv.org/abs/2502.00290.

PEDAL: Prompts based on Exemplar Diversity Aggregated using LLMs. arXiv preprint arXiv:2408.08869. 2024. https://doi.org/10.48550/arXiv.2408.08869.

Yao Y. et al. Determine-Then-Ensemble: Necessity of Top-k Union for Large Language Model Ensembling. arXiv preprint arXiv:2410.03777. 2024.

Ravfogel S., Goldberg Y., Goldberger J. Conformal Nucleus Sampling. arXiv preprint arXiv:2305.02633. 2023. (Findings of ACL 2023). https://doi.org/10.48550/arXiv.2305.02633.

Renze M., Guven E. The Effect of Sampling Temperature on Problem Solving in Large Language Models. Findings of the Association for Computational Linguistics: EMNLP. 2024. P. 7346–7356. https://doi.org/10.18653/v1/2024.findings-emnlp.432.

Lou C., Jia Z., Zheng Z., Tu K. Sparser is Faster and Less is More: Efficient Sparse Attention for Long-Range Transformers. arXiv preprint arXiv:2406.16747. 2024.

Beltagy I., Peters M. E., Cohan A. Longformer: The Long-Document Transformer. arXiv preprint arXiv:2004.05150. 2020.

Choromanski K. et al. Rethinking Attention with Performers. arXiv preprint arXiv:2009.14794. 2020. https://doi.org/10.48550/arXiv.2009.14794.

Bulatov A., Kuratov Y., Burtsev M. Recurrent Memory Transformer. arXiv preprint arXiv:2207.06881. 2022. Version 2. https://doi.org/10.48550/arXiv.2207. 06881.

Lewis P. et al. Retrieval-Augmented Generation for Knowledge-Intensive NLP Tasks. arXiv preprint arXiv:2005.11401. 2020.

Завантаження

Опубліковано

2025-07-17