Suche

A     B     C     D     E     F     G     H     I     J     K     L     M     N     O     P     Q     R     S     T     U     V     W     X     Y     Z


Formelsammlung
Alle Tests
 F7 F9




KI-Funktion 2


Self-Attention in einer Transformer-Schicht


Jedes Token betrachtet alle anderen Tokens gleichzeitig und bestimmt, wie wichtig sie für seine Bedeutung sind.

Was ist denn eigentlich die 'Attention'. Die Übersetzung 'Aufmerksamkeit' bringt uns auch noch nicht viel weiter. Aber der Begriff ist im Zusammenhang mit Transformer-Modellen ziemlich wichtig. Wo wird er in diesen hauptsächlich gebraucht?

Wie schon in KI-Funktion 1 erwähnt, befinden wir uns in einem Sprachmodell. Verstehen von Wörtern und Sätzen ist vielleicht nicht das, was ein computerbasiertes System gut kann. Es befasst sich eher mit der Bedeutung eines Wortes auf die anderen z.B. innerhalb eines Satzes.

Diese Zuordnung ist wichtig und die Veränderung eines Wortes oder dessen Teils kann die Bedeutung aller anderen Wörter beeinflussen. Es macht einen Unterschied, ob Sie ChatGPT nur einen Satz oder einen Abschnitt oder ein ganzes Kapitel übersetzen lassen.

Sogar die Änderung eines Absatzes im ersten Kapitel eines Buches kann die gesamte erzählte Geschichte beeinflussen, je nachdem, wie groß der aktuelle Kontext ist. Attention berechnet für jedes Token, welche anderen Tokens für seine aktuelle Bedeutung wichtig sind und wie stark sie gewichtet werden müssen.

Wie schon im vorigen Kapitel erwähnt, geht es um die Umwandlung von Text in Tokens, wobei uns diese merkwürdig fremd vorkommen. Wir werden die auch hier nicht erklären und die Ausstattung von diesen mit Dimensionen auch nicht.

Denken Sie sich einen Satz aus, darunter seine Aufspaltung in Tokens, die aus einem, mehreren Buchstaben oder einem ganzen Wort bestehen können. Und unter jedem Token eine unglaublich lange Spalte von Zahlen, deren Herkunft wir ebenfalls nicht begreifen.

Für den Benutzer erscheinen sie plötzlich, tatsächlich wurden sie zuvor durch ein sogenanntes Embedding erzeugt. Sie können offensichtlich sogar negativ und Nachkommastellen haben, sind aber nach unserem Verständnis nur Platzhalter für die richtige mathematische Berechnung zu irgendwelchen anderen Tokens.

Die Zahlen wirken völlig beliebig. Tatsächlich wurden sie während des Trainings so angepasst, dass ähnliche Bedeutungen später ähnliche Vektoren erhalten.

Sehr wichtig, mit der Umwandlung in diese Zahlenlisten (Vektoren) sind die Buchstaben verschwunden, aus denen das Token gebildet wurde. Es wird lediglich über eine riesige Tokenliste einer Zahl zugeordnet und dadurch mitgeführt.

Übrigens, je länger die Transformation läuft, desto mehr werden die einzelnen Werte innerhalb der Zahlenlisten verändert und man würde Ähnlichkeiten bei besonderer Nähe erkennen können, natürlich auch große Differenzen bei weiten Distanzen.

Schon längst sind wir über die Behandlung z.B. eines beim Prompt eingegebenen Satzes hinaus. Die früher gelesenen Bücher existieren nun nicht mehr als Texte, sondern nur noch als Wissen, das in Milliarden Gewichtungen des neuronalen Netzes gespeichert wurde.

Wichtig auch zu erwähnen, dass wir längst von der sequentiellen Bearbeitung eines ganzen Satzes zu einer parallelen übergegangen sind, die zwar viel mehr Rechenleistung, aber auch einen riesigen Gewinn an Geschwindigkeit bringt.

Während der Berechnung verändern sich die Vektoren der Tokens ständig. Die Gewichte des neuronalen Netzes bleiben dabei unverändert und dienen lediglich dazu, diese Veränderungen zu berechnen. Komplexe mathematische Operationen, die auch die Beziehungen der Tokens im Netzwerk untereinander berücksichtigen.

Früher wurden Wörter nacheinander verarbeitet. Ein Wort konnte sich deshalb nur schwer an ein anderes erinnern, das vielleicht hundert Wörter zuvor vorkam. Die Attention löst dieses Problem. Jedes Token kann unmittelbar jedes andere Token betrachten und entscheiden, wie wichtig es für seine aktuelle Bedeutung ist. Dadurch lassen sich auch sehr weit auseinanderliegende Zusammenhänge erkennen.

Jetzt haben wir die Bestimmung der Nähe von Token einigermaßen festgelegt, aber noch nicht die Reihenfolge. Deshalb enthalten die Vektoren zusätzlich Informationen über die ursprüngliche Reihenfolge der Tokens. Diese Positionsinformationen sind - im Gegensatz zu vielen anderen Zahlen im Vektor - keineswegs zufällig. Die sind dann ausdrücklich nicht willkürlich.







Sidemap - Technik Impressum E-Mail Datenschutz Sidemap - Hersteller