Transformer
Die neuronale Netzarchitektur, die praktisch allen modernen Sprachmodellen zugrunde liegt. Ihr Kernmechanismus — die Self-Attention — erlaubt es dem Modell, Beziehungen zwischen allen Wörtern eines Textes gleichzeitig zu gewichten.
Der Transformer ist die Netzarchitektur, auf der nahezu alle heutigen Large Language Models aufbauen. Vorgestellt wurde sie 2017 von Google-Forschern im Aufsatz „Attention Is All You Need". Ihr Durchbruch bestand darin, Text nicht mehr strikt Wort für Wort von links nach rechts zu verarbeiten, sondern alle Teile einer Eingabe gleichzeitig in Beziehung zu setzen. Das machte das Training auf riesigen Datenmengen effizient parallelisierbar und legte damit das Fundament für die Skalierung, die moderne KI-Modelle erst möglich gemacht hat. Das bekannte Kürzel GPT steht denn auch für Generative Pre-trained Transformer.
Der Kern: Self-Attention
Das Herzstück der Architektur ist der Attention-Mechanismus (Aufmerksamkeit). Für jeden Token einer Eingabe bewertet das Modell, wie stark jeder andere Token für dessen Bedeutung relevant ist. Im Satz „Das Konto wurde gesperrt, weil es überzogen war" erkennt die Attention, dass sich „es" auf „Konto" bezieht — obwohl mehrere Wörter dazwischenstehen. Diese Fähigkeit, Bezüge über beliebige Distanzen im Text zu erfassen, unterscheidet den Transformer von früheren Ansätzen, die den Zusammenhang über längere Passagen leicht verloren.
Der Rechenaufwand dieses Mechanismus wächst allerdings überproportional — klassisch quadratisch — mit der Textlänge, was historisch die Größe des Context Windows begrenzte. Ein großer Teil der aktuellen Forschung — etwa effizientere Attention-Varianten — zielt genau darauf ab, längere Kontexte bezahlbar zu machen.
Varianten der Architektur
Auf dem Grundprinzip bauen zahlreiche Weiterentwicklungen auf. Eine der wichtigsten ist Mixture of Experts, bei der nicht das gesamte Netz, sondern pro Token nur ausgewählte Teilnetze rechnen — das senkt den Aufwand bei gleichbleibend breitem Wissen. Andere Modelle experimentieren mit tokenizer-freien oder hybriden Ansätzen. Gemeinsam ist ihnen der Transformer-Kern; sie optimieren vor allem, wie effizient er mit Rechenzeit und Speicher umgeht.
Relevanz für KMUs
Für den Mittelstand ist der Transformer selten ein direktes Entscheidungskriterium — kaum ein Unternehmen wählt ein Modell nach seiner Architektur aus. Das Grundverständnis hilft aber, Marketingbegriffe einzuordnen: Wenn Anbieter mit „neuartiger Attention" oder „effizienter Architektur" werben, geht es fast immer um Optimierungen am Transformer-Prinzip, die vor allem Geschwindigkeit, Kontextlänge und Betriebskosten betreffen — nicht um eine völlig andere Technologie. Für die Praxis zählen am Ende Antwortqualität, Kontextfenster und die Parameter, die den Ressourcenbedarf bestimmen.