Architektura Transformer to zaawansowany model sieci neuronowej oparty na mechanizmie uwagi (attention), który zrewolucjonizował dziedzinę przetwarzania języka naturalnego. W przeciwieństwie do starszych modeli, przetwarza ona całe sekwencje danych jednocześnie, co pozwala na znacznie szybsze trenowanie dzięki zrównolegleniu obliczeń. Głównymi komponentami tej architektury są koder i dekoder, które wspólnie analizują zależności między słowami niezależnie od ich odległości w tekście. Obecnie stanowi ona fundament dla najnowocześniejszych modeli językowych, takich jak GPT czy BERT.





