Transformer (sztuczna inteligencja)

Oto kompleksowe podsumowanie artykułu w języku polskim:

Transformer (lub transformator) to architektura uczenia głębokiego opracowana przez Google, zaproponowana w 2017 roku w artykule Attention Is All You Need („Uwaga to wszystko, czego potrzebujesz”), oparta na zrównoleglonym mechanizmie uwagi. W przeciwieństwie do sieci rekurencyjnych (np. LSTM), nie zawiera jednostek rekurencyjnych, co znacznie skraca czas uczenia i ułatwia przetwarzanie sekwencji. Architektura ta, początkowo stworzona do tłumaczenia maszynowego, obecnie jest wykorzystywana w przetwarzaniu języka naturalnego, rozpoznawaniu obrazów, dźwięku oraz w systemach multimodalnych, a także przyczyniła się do powstania modeli takich jak GPT i BERT. Podstawowa budowa opiera się na połączonych szeregowo koderach i dekoderach, które przekształcają sekwencje wejściowe (np. zdania) na wektory za pomocą warstwy osadzającej i kodowania pozycji, a następnie przetwarzają je przez moduły samouwagi i sieci jednokierunkowe. Koder składa się z samouwagi i warstwy jednokierunkowej, natomiast dekoder dodatkowo zawiera warstwę uwagi koder-dekoder, a całość uzupełniają połączenia rezydualne i normalizacja warstw. Dane przetwarzane są wsadowo, a dla sekwencji krótszych niż pojemność ścieżki stosuje się wypełnianie (padding), co pozwala na obsługę zdań lub całych akapitów.