LLM-Glossar

Lokale Sprachmodelle im Benchmark

Sieben KI-Modelle, vier Testklassen, ein Apple-M4-Pro-Rechner — alle Modelle laufen komplett lokal, ohne Cloud. Wir messen, bevor wir empfehlen: Dieses Glossar zeigt mit eigenen Benchmark-Daten, wo jedes Modell steht — von deutscher Sprachkompetenz über Klausur-Assistenz bis zur agentischen Firmen-Recherche.

Interaktive Matrix öffnen Stand: 9. August 2026 · wächst laufend

Kernaussagen der aktuellen Messrunde

Lokal zieht mit der Cloud gleich

Ein lokal laufendes, gezielt optimiertes 27-Milliarden-Parameter-Modell liefert in der agentischen Firmen-Recherche dasselbe Ergebnis wie die Cloud-Produktionsreferenz — korrektes Urteil und sauberes JSON, komplett auf eigener Hardware.

Sauberes JSON ist kein Qualitätsbeweis

Ein Modell lieferte formal perfekte Datensätze — und behauptete darin selbstbewusst „aktiv" für nachweislich gelöschte Firmen. Wer nur auf Schema-Treue prüft, rankt das gefährlichste Ergebnis auf Platz eins.

Klausur-Assistenz ist produktreif

Zwei Modelle erreichen in der Biologie-Klausur 10 von 10 Prüfpunkten: Fachfehler erkennen, wörtlich belegen, maschinenlesbar ausgeben — datenschutzsauber auf dem eigenen Rechner, ohne Cloud.

Was gemessen wird

Suite

Allround-Suite

108 Einzelprüfungen zu strukturierter Ausgabe, Instruktionstreue und Logik — die generelle Zuverlässigkeit als Arbeitswerkzeug.

DS

Deutsche Sprachkompetenz

Sieben Disziplinen von Grammatik bis Übersetzung. Nur zwei trennen das Feld wirklich: Grammatik-Korrektur und Idiomatik.

K

Klausur-Assistenz

Kann das Modell eine Schülerarbeit vorkorrigieren? Fachfehler finden, wörtlich belegen, als gültiges JSON abliefern.

N

Agentische Lead-Recherche

Härtetest mit Anti-Halluzinations-Ködern: real gelöschte Firmen, die das Modell als solche erkennen muss — statt Fakten zu erfinden.

Ein Nachschlagewerk, das wächst

Dieses Glossar ist kein einmaliger Artikel, sondern eine dauerhaft gepflegte Referenz: Neue Modelle, neue Testklassen und korrigierte Messwerte fließen nach jedem Messlauf ein — der „Stand"-Stempel in Kopf und Fußzeile der Matrix zeigt immer den aktuellen Datenstand. Es lohnt sich, wiederzukommen.

Methodik

Alle Messungen laufen lokal auf einem Apple M4 Pro (48 GB) über eine Open-Source-Runtime — seriell, mit entladenem Speicher, damit kein Modell vom Cache des vorherigen profitiert. Klausur-Läufe nutzen erzwungene JSON-Grammatik (constrained decoding); die agentische Recherche läuft über einen echten Automatisierungs-Workflow mit Live-Websuche, ausgegebene Fakten werden je Lauf extern verifiziert.

Die Ergebnisse sind bewusst differenziert: Kein Modell gewinnt alles, und auch intern optimierte Kandidaten werden dort kritisiert, wo sie schwach sind. Genau das macht die Daten belastbar.

Welches Modell passt zu Ihrem Fall?

15-Minuten-Einschätzung — unverbindlich, auf Basis dieser Messdaten.

Anfrage senden