LLM-Glossar
Lokale Sprachmodelle im Benchmark
Sieben KI-Modelle, vier Testklassen, ein Apple-M4-Pro-Rechner — alle Modelle laufen komplett lokal, ohne Cloud. Wir messen, bevor wir empfehlen: Dieses Glossar zeigt mit eigenen Benchmark-Daten, wo jedes Modell steht — von deutscher Sprachkompetenz über Klausur-Assistenz bis zur agentischen Firmen-Recherche.
Kernaussagen der aktuellen Messrunde
Lokal zieht mit der Cloud gleich
Ein lokal laufendes, gezielt optimiertes 27-Milliarden-Parameter-Modell liefert in der agentischen Firmen-Recherche dasselbe Ergebnis wie die Cloud-Produktionsreferenz — korrektes Urteil und sauberes JSON, komplett auf eigener Hardware.
Sauberes JSON ist kein Qualitätsbeweis
Ein Modell lieferte formal perfekte Datensätze — und behauptete darin selbstbewusst „aktiv" für nachweislich gelöschte Firmen. Wer nur auf Schema-Treue prüft, rankt das gefährlichste Ergebnis auf Platz eins.
Klausur-Assistenz ist produktreif
Zwei Modelle erreichen in der Biologie-Klausur 10 von 10 Prüfpunkten: Fachfehler erkennen, wörtlich belegen, maschinenlesbar ausgeben — datenschutzsauber auf dem eigenen Rechner, ohne Cloud.
Was gemessen wird
Allround-Suite
108 Einzelprüfungen zu strukturierter Ausgabe, Instruktionstreue und Logik — die generelle Zuverlässigkeit als Arbeitswerkzeug.
Deutsche Sprachkompetenz
Sieben Disziplinen von Grammatik bis Übersetzung. Nur zwei trennen das Feld wirklich: Grammatik-Korrektur und Idiomatik.
Klausur-Assistenz
Kann das Modell eine Schülerarbeit vorkorrigieren? Fachfehler finden, wörtlich belegen, als gültiges JSON abliefern.
Agentische Lead-Recherche
Härtetest mit Anti-Halluzinations-Ködern: real gelöschte Firmen, die das Modell als solche erkennen muss — statt Fakten zu erfinden.
Ein Nachschlagewerk, das wächst
Dieses Glossar ist kein einmaliger Artikel, sondern eine dauerhaft gepflegte Referenz: Neue Modelle, neue Testklassen und korrigierte Messwerte fließen nach jedem Messlauf ein — der „Stand"-Stempel in Kopf und Fußzeile der Matrix zeigt immer den aktuellen Datenstand. Es lohnt sich, wiederzukommen.
Methodik
Alle Messungen laufen lokal auf einem Apple M4 Pro (48 GB) über eine Open-Source-Runtime — seriell, mit entladenem Speicher, damit kein Modell vom Cache des vorherigen profitiert. Klausur-Läufe nutzen erzwungene JSON-Grammatik (constrained decoding); die agentische Recherche läuft über einen echten Automatisierungs-Workflow mit Live-Websuche, ausgegebene Fakten werden je Lauf extern verifiziert.
Die Ergebnisse sind bewusst differenziert: Kein Modell gewinnt alles, und auch intern optimierte Kandidaten werden dort kritisiert, wo sie schwach sind. Genau das macht die Daten belastbar.
Welches Modell passt zu Ihrem Fall?
15-Minuten-Einschätzung — unverbindlich, auf Basis dieser Messdaten.