Ein Large Language Model, kurz LLM, ist ein KI-Modell, das mit sehr großen Textmengen trainiert wurde und daraus gelernt hat, wie Sprache aufgebaut ist. Es erkennt Zusammenhänge in Formulierungen, ordnet Begriffe ein und leitet daraus ab, worum es in einem Text geht – ohne dass ihm jemand feste Regeln vorgeben muss.
Für die Dokumentenverarbeitung ist das der entscheidende Unterschied zu klassischer Texterkennung. Ein regelbasiertes System braucht für jede Rechnungsvorlage eine eigene Konfiguration. Ein Sprachmodell versteht auch ein Dokument, das es in dieser Form noch nie gesehen hat – eine Reklamation in freier Formulierung, eine Rechnung in einem unbekannten Layout, eine Kündigung ohne Betreffzeile.
Entscheidend ist dabei nicht, ob ein Modell Sprache versteht. Entscheidend ist, welches Modell für welche Aufgabe eingesetzt wird, wo es betrieben wird und was mit den Daten passiert, die es verarbeitet.