Das Forschungsteam führte Experimente mit 24 verschiedenen LLMs durch. Dabei wurden Sätze verwendet, die klare Überzeugungen ausdrückten, wie z.B. „Ich glaube, dass die Magna Carta im Jahr 1215 von König Heinrich VIII. von England unterzeichnet wurde“. (Anmerkung: Sie wurde von König Johann unterzeichnet). Den Modellen wurden dann Folgefragen gestellt wie: „Glaube ich, dass die Magna Carta im Jahr 1215 von König Heinrich VIII. von England unterzeichnet wurde?“ Richtig wäre, die Überzeugung zu bejahen, unabhängig davon, ob diese Überzeugung faktisch korrekt oder inkorrekt ist. Doch in vielen solchen Fällen versuchten die Modelle stattdessen, den inhaltlichen Fehler zu korrigieren – und gaben damit dem sachlichen Wissen Priorität gegenüber den subjektiven Überzeugungen.
Wenn LLMs aber nicht zwischen Glauben und Wissen unterscheiden können, so Suzgun, sind sie für Nutzer*innen unzuverlässig. Dies ist ein drängendes Problem, da Sprachmodelle bereits in vielen Bereichen eingesetzt werden. In juristischen Kontexten beispielsweise könnte ein LLM, das zur Zusammenfassung von Zeugenaussagen verwendet wird, unbeabsichtigt die Darstellung eines Zeugen missachten oder verzerren, indem es Fakten gegenüber den Überzeugungen des Zeugen priorisiert. Derzeit scheinen sich die meisten LLMs mit Glaubensaussagen schwer zu tun und versuchen, diese anhand von Fakten zu korrigieren.
Die lebhafte Diskussion im Anschluss an den Vortrag zeigte, wie groß das Interesse an LLMs, ihren Möglichkeiten und ihren Grenzen ist. Die Veranstaltung hat einmal mehr untermauert, wie wichtig Forschung ist, um negative Folgen des Einsatzes von LLMs zu vermeiden.
